ガイド · 10 分で読めます

AIと人の写真:実際に実際のデータを生成するShopify A / Bテストを実行する方法

著者: Anton Viborniy

AI 生成された製品イメージが実際により良い、同じ、または従来の写真よりも悪い変換を変換するかどうかを尋ねるすべてのファッションブランドは、最終的に同じ答えに到着します。あなた自身の店でテストを実行します。 ベンダーのケーススタディは、業界レポートでは、一致することができないサンプルブランドを使用し、正直な回答は、カテゴリ、オーディエンス、および既存の画像の品質に依存します。 ショップファイのファッションストアでAI対人写真A/Bテストを実行するための実用的なガイドです。テストデザイン、その問題のメトリック、そして結論を正直に保つ規律。

AI-versus-human のテストが、使用しないデータを生成する理由

ほとんどのカジュアルなAI-versus-humanテストは、あまりにも多くの変数を組み込むので失敗します。 試験は、単一の製品で実行されます。サンプルサイズは小さく、変換が人工的なほど高い販売週末に実行され、変形画像は1つの次元以上で異なる、カルーセルの注文は、バリアント間で異なる。 これらのいずれかの1つは結果を打ち消します。 同社は、データを見据えて、約5パーセントの差をみ、AI「作品」や「作品がうまくいかない」と判断し、騒音に関する戦略を出荷します。

クリーンなA/Bテストの規準は難しくありませんが、約束が必要です。 製品の固有の分散を制御するために、少なくとも5つの製品を同時に実行します。 週1日と週末のトラフィックをスパンに少なくとも2週間フルタイムで実行します。 単一のイメージがテストされる以外すべてのカルーセルの位置と同一動かして下さい。 比較を出力するのに十分なトラフィックセグメントを大きく実行します。 クリーンなテストは、あなたの守秘的な答えを与えます。 sloppyテストは、あなたが信頼しない番号を与えます。

実際に働く3つのテスト設計

最初の設計はですメインイメージスワップ: 同じ製品、リードイメージを除く同一のPDP。 Variant Aは、ブランドの既存のメインイメージ(通常、伝統的なシュートまたはストックサプライヤーイメージ)です。 バリアントBはAIで生成されたメインイメージです。 同じトラフィックセグメントに加算して変換を測定します。 これにより、画像タイプがきれいに影響します。

2番目のデザインはカルーセルの完全性テスト:同じ製品、同じメインイメージ、しかし、バリアント A は 2 つのカルーセル画像と B のバインドを 5 つの AI 生成されたカルーセル画像で出荷します。 これは、AIが「ベター」かどうかではなく、最終的に完全なカルーセルを出荷することができるかどうか、ほとんどのブランドのためのより大きいリフトであるカタログの完全性の影響を隔離します。

3番目のデザインは、アドクレativeテスト: 同一のメタまたは TikTok の広告配置、同一のコピー、異なるクリエイティブフォーマット。 Variant Aは、クリエイターフォトセットからAIライフスタイルを創造するスタジオクリエイティブです。 CPM、CTR、ポストクリック変換を測定します。 これは、PDPではなくチャネルレベルでの影響を分離し、多くの場合、PDPとアドカティブのコンテキストとの違いを解決します。

Apiwayがテスト設計に合います

Apiway に対してテストを具体的に実行するブランドにとって、Apiway は、純粋なAI ワークフローではなく、実際のワークフローであるからです。 実際のコンテンツタイプApiway生成物であるべきあなたのテストのBの変形は–モデル上のイメージをから作り出します クリエイターマーケットプレイス ブランドの衣服を装着しました。 これは、さまざまな期待された結果と比較して、 "完全に合成人工知能が私の伝統的な撮影よりも優れている"と異なる比較です。

Apiway が歴史的に最大の A/B リフト versus ベースラインがサプライヤー在庫またはシングル ショットのカタログイメージであるというカテゴリは、フル リアル 写真撮影のクリエイティブではなく、クリエイティブです。 すでに映画の編集写真を実行しているブランドでは、リフトが小さく、AIの値は、画像変換よりもボリュームと10年以上です。 どちらが有効な商業成果であり、テストでは、特定の段階とカテゴリの最も重要な事項を明らかにします。

実際に問題のあるメトリック

ほとんどのA/Bテストダッシュボードは、ファッションコンテンツの評価のためにあまり狭い、単一の番号としてコンバージョン率を強調表示します。 重要なメトリックのフルセット: セッションの期間PDP(通常はリフトと相関する長いセッション)で、カートに入れる (上流信号)、チェックアウト完了 (下流信号)、訪問者ごとの収益 (下線信号)、およびリターン率 ポストプルチャゼ(画像が不透明にフィットするとAIイメージが悪化する長距離信号)。

アドクリエイティブテストでは、 費用ごとの設備チャネルの層およびクリエイティブな疲労率テストウィンドウに。 クリエイターが発信するAIライフスタイルイメージは、制作費1ドル当たりの視覚的な変化が高まるため、スタジオのクリエイティブよりも、疲労が遅くなります。

サンプルサイズとトラフィックの規準

ほとんどのファッションストアがこのテストをうまく動かすのは、悪くありません。 製品のPDPテストは、通常、統計的意義で10パーセントのコンバージョンリフトを検出するために、各バリアントあたり5,000セッション前後のセッションを必要とします。 ほとんどの店舗は、そのトラフィックが2週間のウィンドウ内に残っているのを打つ1つまたは2つの製品を持っています。 特にこれらの製品のテストを実行します。低トラフィックのSKUを越えて、彼らが動力を与えられたかどうかのように結果を読み込まないでください。

アドクリエイティブテストでは、サンプルがより速くなります。シングル広告セットは、最も適度に日々比較を出力することができますが、同じ懲戒は、週と週末の印象に及ぶテスト期間に適用され、創造的な疲労をコントロールします。

自分でfoolingせずに結果を読み込む

データの読み方を3つの正直なルール まず、差が5パーセント未満で、テストが不足している場合は、結果はノイズです。戦略を出荷しないでください。 第二に、変形が変換に勝つが戻り速度に負けた場合、AIイメージは相反する;スケーリング前に調査する。 3 番目, 異種が単一の製品で勝っているが、同じテストで他の人に負けた場合, 結果は、フォーマット固有のではなく、製品固有のものです; 全体的なAI写真の評論としてではなく、カテゴリレベルの証拠としてそれを扱います.

このテストを清潔に実行するブランドは、通常、迷惑な回答で終わる:AIイメージは、既存の画像が大きさで分類された、リッスリー、スイムウェア、ニッチアパレルなど、いくつかのカテゴリで明確に勝ち、他の部分でもブレイクします(既存の撮影品質が既に高いという特徴)。 どちらも便利な回答であり、カタログ作成戦略を通知します。

公開されたテストが見つかったこと

ボティカ 持っています eコマースイメージA/Bテストに便利なガイドを公開 スケールでAI対人テストに関するさらなる視点で、この1つと一緒に読む価値があります。 ヴェトンは、EILEEN FISHERや他のブランドサイト上のAI画像から変換リフトにケース学習データを公開しました。 各外部データセットは、トライアンスレーションとして便利ですが、自分のストア、自社製品、独自のオーディエンスでテストを交換することはできません。

テストを実行します

クリーンなテストを実行する最速の方法は、既存のベースラインに対してAIのバリアントで1つの製品を出荷し、実際のトラフィックの2週間が質問に答えることです。 サインアップ Apiwayアカウントの無料アカウント — 150 のワンタイムクレジット、1 つのプロダクトでフル PDP およびカルーセルのパックを出荷するのに十分。 Shopifyでバリアントを実行し、トラフィックをかなり分割し、変換データを決定させます。 ベンダーの意見はノイズです。自分の店舗のデータが重要な唯一の信号です。