Tagliare una persona + indumento pulito da un'immagine di moda non è un problema risolto nel 2026. I modelli di segmentazione generici fanno abbastanza bene sulle fotografie e male sulle immagini generate dall'intelligenza artificiale, i cui bordi e ombre si comportano in modo subtly diverso. Ecco come Apiway segmenta soggetti da sfondi generati LLM per il puro-bianco pipeline.
Perché la segmentazione è più difficile nell'immagine IA
Le fotografie reali hanno caratteristiche di bordo prevedibili: aberrazione cromatica a confini ad alto contrasto, rumore dei sensori a regioni uniformi, caduta di profondità di campo. Modelli di segmentazione generici si allenano su dati fotografici e imparano quei segnali come parte del segnale di confine.
Le immagini generate dall'intelligenza artificiale hanno segnali diversi. I bordi sono più puliti, il rumore è uniforme, la profondità di campo è approssimata piuttosto che fisica. Modelli di segmentazione generico spesso manca confini su immagini IA in modi sottili — un polsino giacca che viene clipped, un filo di capelli che viene frammentato, una cinghia di borsa che scompare in background.
La decomposizione a tre strati
Il pass di segmentazione di Apiway produce tre maschere per immagine, non le solite due:
- Campo di applicazione: il modello e il capo. Maschera rigida con bordi alfa.
- ombra di cast: l'ombra morbida sotto i piedi e dietro il modello. Maschera morbida, bassa opacità.
- Contesto: tutto il resto. Scontri nella fase di ricomposito.
L'ombra come strato separato è la decisione architettonica più importante. (Più: perché ricomposiamo su bianco puro.) Senza di essa, i modelli sembrano galleggianti nello spazio.
Bordo casi il modello è stato addestrato per
La segmentazione generica non riesce a queste; l'addestramento specifico della moda di Apiway li cattura.
- I fili di capelli fini su fondo — alfa matting piuttosto che duro taglio poligono.
- Tessuti trasparenti o parzialmente trasparenti, dove lo sfondo dovrebbe essere parzialmente visibile.
- catene di gioielli lunghi che sottili nella larghezza di pixel di sfondo.
- Cinghie e cinghie di borsa che attraversano la silhouette del corpo.
- Accessori per vetri e riflessivi (vetri, cristalli di orologio).
- Tessuto di drappio piccante dove il bordo è genuinamente ambiguo.
Maglietta alfa al confine
I tagli duri sembrano compositi. Il gasdotto esegue un passaggio alfa-matting imparato al confine di primo piano che consente ai pixel di essere parzialmente trasparente piuttosto che completamente in o fuori. Questo è ciò che permette ai capelli di piuma nello sfondo bianco invece di lasciare un bordo poligono duro.
Il passaggio alfa viene calibrato contro l'uscita originale LLM: se l'originale aveva bordi morbidi e ardenti (ad es. un colpo retroilluminato), il matting conserva più di quella morbidezza. Se l'originale aveva bordi croccanti (ad esempio. illuminazione dello studio), il matting rimane più stretto.
Perché la conservazione dell'ombra è specificamente importante
Le ombre sono il segnale di messa a terra più importante per il sistema visivo umano. Un'immagine di moda in cui il modello non ha ombra di contatto sotto i piedi legge come composito istantaneamente — più veloce di quello cosciente può articolare il perché. Anche una piccola ombra morbida al 20% di opacità ancora il modello al pavimento e rende l'output si sente fotografato piuttosto che collage.
Per la conformità della politica amazzonica, sono esplicitamente consentite ombre morbide (la regola è “fondo bianco puro”, non “nessuna ombra sotto il prodotto”). L'ombra rimane all'interno della busta politica mentre rimuove l'artefatto fluttuante-modello.
Forma delle prestazioni
La segmentazione fa parte del canale di post-elaborazione. Circa 0,5–1.0 secondi per immagine su GPU di produzione. Il costo viene assorbito nel prezzo di credito per-shot; nessun elemento di linea separato.
Perché abbiamo costruito questo piuttosto che chiamare un API di terze parti
Le API di segmentazione Off-the-shelf sono sintonizzate per fotografie e casi di utilizzo dei consumatori. Spesso mancano i casi di bordo specifici della moda (catene di ghiaccio, tessuto di sheer, ombre di cast). Essi caricano anche per chiamata, che avrebbe composto il costo per-shot in un modo che rompe il modello di prezzi one-credit-equals-one-cent.
Un modello personalizzato formato su dati specifici della moda offre una migliore uscita e zero costi marginali per chiamata. L'investimento di ingegneria è stato ripagato entro il primo trimestre di produzione.
Vedi il risultato della segmentazione da solo
Genera qualsiasi immagine White Studio. L'output è il risultato post-segmentazione — il soggetto primo e gettare ombra su una tela bianca pura. Conti gratuiti nave con 150 crediti una volta — sufficiente per testare su indumenti reali e casi di bordo.