Guia · 7 min de leitura

Como a Apiway segmenta indivíduos de origens geradas por LLM

Autor: Anton Viborniy

Cortar uma pessoa + roupa de forma limpa fora de uma imagem de moda não é um problema resolvido em 2026. Modelos genéricos de segmentação fazem bem em fotografias e mal em imagens geradas por IA, cujas bordas e sombras se comportam sutilmente de forma diferente. Aqui está como a Apiway segmenta assuntos de fundos gerados pela LLM para o oleoduto branco puro.

Por que a segmentação é mais difícil em imagens de IA

As fotografias reais têm características previsíveis de borda: aberração cromática em limites de alto contraste, ruído do sensor em regiões uniformes, queda de profundidade de campo. Modelos genéricos de segmentação treinam em dados fotográficos e aprendem esses sinais como parte da pista de contorno.

As imagens geradas por IA têm sinais diferentes. As bordas são mais limpas, o ruído é uniforme, a profundidade do campo é aproximada em vez de física. Modelos genéricos de segmentação muitas vezes perdem limites em imagens de IA de maneiras sutis — um punho de jaqueta sendo cortado, um fio de cabelo ficando fragmentado, uma alça de saco desaparecendo no fundo.

A decomposição de três camadas

O passe de segmentação da Apiway produz três máscaras por imagem, não as habituais:

  • Principal: o modelo e a roupa. Máscara dura com bordas alfa.
  • Sombra de elenco: a sombra macia sob os pés e atrás do modelo. Máscara suave, baixa opacidade.
  • Contexto: tudo o resto. Descartado na fase de recombinação.

A sombra como uma camada separada é a decisão arquitetônica mais importante. (Mais: porque recompositamos em branco puro.) Sem ele, os modelos parecem flutuar no espaço.

Casos de borda para os quais o modelo foi treinado

A segmentação genérica falha nestes; o treinamento específico de moda da Apiway os pega.

  • Fios de cabelo finos contra o fundo — alfa matting em vez de duro poligon corte.
  • Tecidos de cor branca ou parcialmente transparente, onde o fundo deve ser parcialmente mostrado.
  • Longas correntes de jóias que se tornam finas na largura do pixel de fundo.
  • Correias e cintos de segurança que atravessam a silhueta corporal.
  • Vidro e acessórios refletivos (vidros de sol, cristais de relógio).
  • Tecido solto, onde o limite é genuinamente ambíguo.

Alfa acasalamento no limite

Os cortes duros parecem compostos. O gasoduto executa um passe de alfa-matting aprendido no limite de primeiro plano-fundo que permite que pixels sejam parcialmente transparentes ao invés de entrar ou sair completamente. Isto é o que permite que o cabelo para pena para o fundo branco em vez de deixar uma borda de polígono duro.

O passe alfa é calibrado com a saída original do LLM: se o original tivesse bordas macias e nebulosas (por exemplo, o LLM é um passe de alta velocidade). Um tiro retroiluminado), o acasalamento preserva mais dessa suavidade. Se o original tinha bordas nítidas (por exemplo. iluminação de estúdio), o matting permanece mais apertado.

Por que a preservação da sombra importa especificamente

Sombras são o sinal de aterramento mais importante para o sistema visual humano. Uma imagem de moda onde o modelo não tem sombra de contato sob os pés é composta instantaneamente — mais rápido do que o olho consciente pode articular o porquê. Mesmo uma pequena sombra macia a 20% de opacidade ancora o modelo no chão e faz com que a saída se sinta fotografada em vez de colada.

Para a conformidade com as políticas da Amazon especificamente, são explicitamente permitidas sombras suaves (a regra é “fundo branco puro”, não “nenhuma sombra sob o produto”). A sombra permanece dentro do envelope de políticas enquanto remove o artefato de modelo flutuante.

Forma de desempenho

A segmentação é parte do gasoduto pós-processamento. Aproximadamente 0,5–1,0 segundos por imagem em GPUs de produção. O custo é absorvido pelo preço de crédito por tomada; não há item de linha separado.

Por que nós construímos isso em vez de chamar uma API de terceiros

APIs de segmentação fora da prateleira são sintonizadas para fotografias e casos de uso do consumidor. Muitas vezes eles perdem as caixas de bordas específicas da moda (correntes de jóias, tecido puro, sombras de elenco). Eles também cobram por chamada, o que iria complicar o custo por tomada de uma forma que quebra o modelo de preço de um crédito-igualdade-um-cent.

Um modelo personalizado treinado em dados específicos da moda oferece melhor saída e custo marginal zero por chamada. O investimento em engenharia reembolsou no primeiro trimestre de produção.

Veja o resultado da segmentação você mesmo

Gera qualquer imagem do White Studio. A saída é o resultado pós-segmentação — o assunto principal e sombra de elenco em uma tela branca pura. Contas grátis enviam com 150 créditos de uma vez — suficientes para testar o vestuário e as caixas de bordas.