指南 · 6 分钟阅读

AI时尚模型中的"一致身份"问题——和我们的方法

作者: Anton Viborniy

每一个扩散模型都会漂移到脸部 如果你再生太多次。 眼睛颜色变色 颊骨蠕动 头发在47号镜头中会触摸到一个瓦维埃 品牌最终显示100种不同的型号。 以下是时尚AI中一致识别问题的技术说明,以及生产级解决方案Apiway ships. (100)

为什么身份会变

扩散模型是具有斯图克性的. 一代人通过从随机噪音开始,走过一个以迅速和任何参考投入为指南的去诺的轨道。 即使有相同的即时,相同的种子,和相同的设置,轨迹上的微小数值差异也会产生输出面的微小差异. 在许多代人中,这些小差异会加剧。

对于时尚目录工作,当同一型号需要出现在数十或数百个镜头中时,这种漂移是品牌一致的图像和一个看起来像是用旋转的铸件拍摄的目录之间的区别.

为什么“只使用同样的提示”失败 ?

多数团队的第一直觉是锁定提示:写出模型的详细描述,保存为模板,贴在每代人身上. 这行不通,因为:

  • 自然语言的提示太低分辨率,无法指定一个面孔.“棕发、棕眼睛、椭圆形、20多岁”描述着成千上万的面孔,而不是一张。
  • 即时身份不能稳定种子。 同样的提示加不同的种子产生不同的面孔.
  • 即使有固定的种子,模型也可能因小的成分变化(不同服装,不同框架)而转变.

三种技术有效

我们用三种方法结合 堆积的不同层。

1. 国家 预设模型身份.白工作室飞船~50女和~10男预设AI时装模型. 每个预设都是建立在学习-嵌入式锚和种子稳定生成参数相结合的基础上的稳定身份. 选择预设,可以让你在每一代人中都有一个面孔,通过建筑。

2. 国家 参考图像调制.如果用户上传了参考照片(真实的模型,品牌大使),则该代在早期的去诺步骤上通过参考条件. 输出上的面孔即使服装和框架发生变化,也保持接近参考身份.

3 , 3 , 3 , 3 , 3 , 3 真实创造者主播(好莱坞图案). 对于生活方式图像,最可靠的方法是完全跳过AI面部. 创建者相片集 市场 提供了一种真正的人性面貌,顾名思义,它不会飘移——它只是一张真实的照片。 AI只处理衣服上覆。

漂移上的实际数字

因为从瞬间身份锁定的瞬间一代人, 身份漂移到100发照片中是相当重要的—— 我们经常测量 知觉的面距分数, 高于同一真实人照片的自然变化。 (5; 10)

对于White Studio的预设世代,漂移100镜头大致可以和同人照片差异相媲美. 与闲观者不可分. 能够被小心的发现

对于创作者-摄影设定锚定,漂移通过构造是零(面部是一幅在每一个上层重复使用过的文字照片).

何时使用各种技术

  • 预设模式:目录和PDP工作,其中清真AI时尚模式是可以接受的.
  • 上传参考文献:品牌-ambasador工作,创始人肖像作为一贯的面孔,定制铸造决定.
  • 创建者图片集生活方式,广告创意, 任何地方的shopper -tust信号最重要的。 (背景情况 : 好莱坞VFX方法.)

100 & plus; SKU 目录的操作模式

将模型方法锁定在目录工作的开始. 将选择(预设名称,参考照片文件,创建者设定ID)作为品牌系统资产进行记录. 机上生产商明确——该模型是品牌决定,而不是每个SKU决定.

对于季节性新鲜品,将改变模型的方法与对待改变品牌颜色调色板的方式一样:一种刻意的,沟通的品牌进化,而不是静静的漂移.

为什么这一直可以辩护

身份一致性是时尚AI中技术解决方案实际上取决于产品层面选择的少数领域之一,而不仅仅是本周最优秀的LLM. 预设训练,参考条件,和市场锚定的组合,是不会被下一个基础模型发布所淘汰的堆积物——它坐落在基础模型之上,控制其使用方式.

进行50发的漂移测试

选一个白色工作室预设 并运行50代 不同服装和框架。 把它们当作网格来放出来 面部应保持横跨网格的稳定,使迅速的只锁无法匹配. 150个一次性存款的免费账户船 足够进行完整的测试了