Guide · 7 min de lecture

Pourquoi nous recomposons les photos de mode IA sur le blanc pur #FFFFFF (technique profonde plongée)

Auteur: Anton Viborniy

Les LLM d'image ne fournissent pas de vrais arrière-plans RGB 255/255/255, peu importe ce que dit l'invite. Le modèle White Studio d'Apiway le fait — via un pipeline de post-traitement en quatre étapes qui fonctionne après que le LLM a terminé son travail. Voici la marche technique, y compris les modes de défaillance que nous avons couru à construire.

Pourquoi le LLM ne peut pas faire ça seul

Les modèles de diffusion reproduisent les schémas statistiques à partir des données de formation. Les fonds de produits réels dans les données d'entraînement photographique sont presque jamais littéralement blanc pur — les murs cyclorama réfléchissent à ~95% albedo, le papier sans soudure prend des gradients, le bruit du capteur soulève le pixel du sol par quelques valeurs numériques. Le modèle a appris que le fond blanc signifie légèrement texturé blanc cassé. (Plus : pourquoi votre invite pour le blanc pur donne encore gris.)

Demander au modèle de livrer le vrai #FFFFFF est de lutter contre la distribution de l'entraînement. Le bon mouvement est de laisser le modèle produire sa meilleure image et ensuite d'imposer la couleur de fond de façon déterministe dans un post-pass.

Étape 1: segmentation du sujet avec préservation de l'ombre

Identifiez le premier plan (modèle + vêtement) comme un masque, l'ombre moulée sous les pieds comme un masque mou séparé, et le fond comme le reste. Trois couches, pas deux.

Le masque d'ombre est la couche que la plupart des pipelines manquent. Sans elle, le recomposite baisse le contact avec le sol et le modèle semble flotter — ce qui est pire qu'un fond légèrement gris, parce que les acheteurs enregistrent instantanément le flottant. Avec elle, le modèle reste immobilisé.

Nous utilisons un modèle de segmentation sur mesure qui gère spécifiquement les cas de bords de mode-photographie : cheveux sur fond, bords de tissu drapée, accessoires comme les ceintures et les sacs dont la silhouette n'est pas triviale.

Étape 2: recomposite sur #FFFFFFL littérale

Générer une nouvelle toile au rapport d'aspect cible (1:1, 4:5, 9:16, etc.), remplie de RGB 255/255/255. Placez le masque de l'objet au premier plan sur le dessus. Placez le masque d'ombre souple sur la toile blanche à une opacité réduite (généralement 15–35% selon l'image originale).

A ce stade, le pixel du coin est vraiment #FFFFFF. La question de la conformité de la politique Amazon est résolue.

Étape 3: accouplement alpha aux bords

Les bords coupés à la dure semblent parfaitement composites. Les cheveux surtout — un bord en polygone propre à travers les cheveux se lit comme faux instantanément. Le pipeline utilise un passe alpha-matting appris qui adoucit les bords, laisse les brins de cheveux fins plume dans le fond blanc, et préserve la texture de bord de tissu.

C'est l'étape qui a pris le plus de temps pour se remettre. Les premières versions sont soit sur-félées (saignement des cheveux dans le fond) ou sous-férées (arêtes du polygone dur). La version de production marche sur la ligne en échantillonnant la douceur de bord originale de la sortie LLM et en la jumelant sur la nouvelle toile.

Étape 4: correction de tonalité à travers le premier plan

Une fois que le premier plan est sur une toile fraîche #FFFFFF, l'éclairage original généré par LLM peut sembler légèrement décalé par rapport au nouveau fond. Le modèle était illuminé pour un original blanc cassé; la toile blanche est plus brillante, et le contraste peut lire dur.

Un petit passe de correction de tons global rééquilibre le premier plan pour ressembler à ce qui a toujours été tourné sur ce fond. Subtil — généralement un ajustement de 2 à 5 % à la luminance avant plan, plus un petit changement de balance blanche si l'original était allumé chaud.

Modes de défaillance que nous avons frappé en construisant

  • Modèles flottants: les premières versions ont laissé tomber le masque d'ombre. Corrigé en suivant l'ombre de coulée comme une couche séparée à travers le pipeline.
  • Arêtes des halos: un anneau fin et décoloré autour du premier plan lorsque la segmentation a saisi une bordure d'un pixel du fond original. Correction en réduisant le masque de 1 à 2 pixels et en utilisant un apparat alpha à la limite.
  • Fraction des cheveux: brins de cheveux fins se coupant en une silhouette polygonale. Corrigé par le passe alpha-matting dans l'étape 3.
  • Occclusion accessoire: ceintures, sangles de sac, chaînes de bijoux mal classées en arrière-plan. Corrigé par formation du modèle de segmentation sur les données spécifiques à la mode avec ces classes étiquetées.

Performance et forme des coûts

Le pipeline fonctionne en 1,5 à 3 secondes par image sur l'infrastructure GPU de production. Le coût est absorbé dans le prix de crédit par coup; l'utilisateur ne voit pas le pipeline comme un article de ligne distinct. (Récapitulation des prix: un crédit égal à 1 cent.)

Pourquoi c'est un véritable bord du produit

La plupart des outils d'IA de mode sautent le pipeline (et expédient une sortie légèrement grise qui échoue à la règle d'Amazon) ou déchargent le travail de fond blanc à l'utilisateur (manual Photoshop pass par image). Apiway en fait la valeur par défaut pour White Studio. Le produit livrable est conforme aux politiques dès qu'il quitte le modèle.

Testez le pixel du coin vous-même

Générer une image dans White Studio- Oui. Échantillonnez le pixel du coin dans n'importe quel éditeur d'images. Vérifier qu'il se lit RGB 255/255/255. Compte gratuit expédié avec 150 crédits uniques — assez pour vérifier et tester les contraintes sur les vrais dossiers de vêtements.