Guia · 7 min de leitura

Por que re-composite imagens de moda IA em puro branco #FFFFFF (tecnico profundo mergulho)

Autor: Anton Viborniy

Image LLMs não fornecem fundos RGB 255/255/255 verdadeiros, não importa o que o prompt diz. O modelo do Apiway White Studio faz — através de um oleoduto de pós-processamento de quatro estágios que funciona após o LLM ter terminado seu trabalho. Aqui está a passagem técnica, incluindo os modos de falha que corremos para construí-lo.

Por que razão a LLM não pode fazer isto sozinha

Os modelos de difusão reproduzem padrões estatísticos a partir de dados de treinamento. Os cenários reais de produtos em dados de treinamento fotográfico quase nunca são literalmente brancos puros — paredes de ciclorama refletem em ~95% albedo, papel sem costura capta gradientes, ruído sensor eleva o pixel do chão por alguns valores digitais. O modelo aprendeu que “fundo branco” significa ligeiramente texturizado esbranquiçado. (Mais: porque o seu prompt para branco puro ainda dá cinza.)

Pedir ao modelo para entregar o verdadeiro #FFFFFF é lutar contra a distribuição de treinamento. O movimento certo é deixar o modelo produzir sua melhor imagem e, em seguida, forçar a cor de fundo deterministicamente em um pós-passe.

Etapa 1: Segmentação do sujeito com preservação da sombra

Identificar o primeiro plano (modelo + vestuário) como uma máscara, a sombra lançada sob os pés como uma máscara macia separada, e o fundo como o resto. Três camadas, não duas.

A máscara de sombra é a camada que a maioria dos oleodutos falha. Sem ela, o recompósito deixa cair o contato com o chão e o modelo parece que ela está flutuando — o que é pior do que um fundo ligeiramente cinzento, porque os compradores registram o flutuando instantaneamente. Com ela, o modelo fica de castigo.

Usamos um modelo de segmentação personalizado que lida especificamente com casos de borda de moda-fotografia: cabelo contra o fundo, bordas de tecido drapey, acessórios como cintos e sacos cuja silhueta não é trivial.

Etapa 2: recomposite para o #FFFFFF literal

Gere uma nova tela na proporção de aspecto alvo (1:1, 4:5, 9:16, etc.), preenchida com RGB literal 255/255/255. Coloque a máscara de primeiro plano no topo. Coloque a máscara de sombra suave sobre a tela branca em opacidade reduzida (tipicamente 15–35% dependendo da imagem original).

Nesta fase, o pixel de canto é genuinamente #FFFFFF. A questão da conformidade da política da Amazon está resolvida.

Etapa 3: Matting alfa nas bordas

As bordas duras parecem inconfundíveis. Especialmente o cabelo — uma borda de polígono limpa através do cabelo é falsa instantaneamente. O oleoduto corre um passo de alfa-matejamento aprendido que suaviza as bordas, permite finos fios de cabelo pena para o fundo branco, e preserva textura borda tecido.

Este é o palco que levou mais tempo para acertar. Versões iniciais ou sobre-pés (lesões de cabelo no fundo) ou baixo-pés (bordas de polígono duro). A versão de produção caminha a linha, amostrando a suavidade de borda original da saída LLM e combinando-a na nova tela.

Etapa 4: correção de tom em todo o primeiro plano

Uma vez que o primeiro plano está em uma tela #FFFFFF fresco, a iluminação original gerada LLM pode olhar ligeiramente para fora em relação ao novo fundo. O modelo foi iluminado para um original esbranquiçado; a tela branca é mais brilhante, e o contraste pode ser lido duramente.

Um pequeno passo global de correção de tom reequilibra o primeiro plano para parecer que foi sempre filmado neste fundo. Sutil — geralmente um ajuste de 2–5 por cento para a luminância de primeiro plano, mais uma pequena mudança de equilíbrio branco se o original foi aceso quente.

Modos de falha que atingimos construindo-o

  • Modelos flutuantes: versões iniciais deixaram cair a máscara de sombra. Corrigido por rastrear a sombra do elenco como uma camada separada através do oleoduto.
  • Arestas de halo: um anel fino em torno do primeiro plano quando a segmentação agarrou uma borda de um pixel do fundo original. Corrigido por encolhimento da máscara de primeiro plano por 1-2 pixels e usando alfa-matting no limite.
  • Fragmentação do cabelo: fios de cabelo finos sendo cortados em uma silhueta poligonal. Fixado pelo passe alfa-materamento no estágio 3.
  • Oclusão acessórios: cintos, alças de saco, correntes de jóias sendo mal categorizadas como fundo. Fixado através da formação do modelo de segmentação em dados específicos da moda com estas classes rotuladas.

Desempenho e forma de custo

O gasoduto termina em aproximadamente 1,5-3 segundos por imagem na infraestrutura GPU de produção. O custo é absorvido pelo preço de crédito por tomada; o usuário não vê o pipeline como um item de linha separado. (Recapitulação de cálculo: um crédito é igual a um cêntimo.)

Por que esta é uma borda de produto real

A maioria das ferramentas de IA de moda ou ignora o pipeline (e envia uma saída ligeiramente cinzenta que falha na regra da Amazon) ou descarrega o trabalho de fundo branco para o usuário (passar manual Photoshop por imagem). O Apiway torna-o o padrão para o White Studio. O entregable é conforme com a política no momento em que sai do modelo.

Teste o pixel do canto você mesmo

Gerar uma imagem em White Studio. Experimente o pixel de canto em qualquer editor de imagem. Verifique se ele lê RGB 255/255/255. Contas grátis enviam com 150 créditos de uma vez — suficiente para verificar e testar o stress nos ficheiros de vestuário reais.