本文へスキップ

トラフィックが少ないときのA/Bテスト

スタートアップ規模のトラフィックでは、ほとんどのA/Bテストは検出力が足りません。小さな効果を確実に検出できないため、誠実な選択肢は、大きな変更だけを試すか、少ないサンプルで済む手法を使うか、テスト自体を見送るかです。このガイドでは、自社がどの状況にあるかの見分け方と、代わりに何をすべきかを解説します。

更新日:8分で読めます執筆 fromHello

要点

  1. 統計的検出力とは、テストが実在する効果を検出できる確率です。トラフィックが少なければ検出力も低く、検出できるのは大きな差だけです。

  2. 最小検出効果(MDE)は、サンプルが小さくなるほど大きくなります。スタートアップの規模では、2%ではなく20%以上の差になることがよくあります。

  3. 逐次検定やベイズ的な手法は、サンプルサイズの問題を小さくします。なくすわけではありません。

  4. A/Bテストをしないのが正しい判断であることも少なくありません。ガードレール指標を見ながらリリースする、より大きく賭ける、定性調査に切り替える、といった選択肢があります。

トラフィックが少ないとA/Bテストが機能しない理由

A/Bテストは2つのバージョンを比べ、その差が本物かノイズかを問うものです。答えを出すには、シグナルと偶然を見分けられるだけの観測数が必要ですが、スタートアップにはめったにそれがありません。月に数百件のコンバージョンでは、計算上、見つけられるのは大きな差だけです。そのため、「何でもテストせよ」というよく聞く助言に従うと、最初から結論の出ないテストを回すことになります。回す価値のある少数のテストを選ぶことこそ、実験ロードマップの目的です。

統計的検出力とMDEをかみ砕いて言うと

統計的検出力とは、効果が実在するときにテストがそれを検出できる確率で、通常は80%を目標にします。最小検出効果(MDE)とは、ベースラインの率とサンプルサイズを前提に、その検出力でテストが捉えられる最小の改善幅です。2つは連動しており、訪問者が少ないほどMDEは大きくなります。スタートアップの規模では、MDEが相対で20%〜50%の差になることがよくあり、ボタンの色の変更で得られるような2%ではありません。変更の効果がMDEより小さければ、現実的などんな期間をかけてもテストはそれを捉えられません。

スタートアップのトラフィックで検出できるのは大きな効果だけです。強調した象限が、少ないトラフィックでのA/Bテストが実際に機能する領域です。小さな効果には、まだ手にしていない規模が必要です。

大きな効果しか検出できない理由

必要なサンプルサイズは、検出したい効果のおよそ2乗に反比例します。そのため、MDEを半分にすると、必要な訪問者はおよそ4倍になります。Optimizely自身の計算例がこれを数字で示しています。ベースラインが10%のとき、3%の改善を検出するには、10%の改善の場合のおよそ15倍の訪問者が必要です。したがって、小さなチームが誠実に測れる効果は粗いものに限られます。新しい料金ページ、つくり直したオンボーディングフロー、中心となるオファーの変更などで、細かな文言の調整ではありません。CROスペシャリストは、時間の大半を、どの変更がテストに値するほど大きいかの判断に使います。

逐次検定とベイズ的なテストは、少しだけ役に立つ

逐次検定では、結果が決定的になった時点で早めにテストを止められます。繰り返し結果を確認しても成り立つように計算が組まれています。Evan Millerの逐次検定の設計では、真の効果が大きい場合、観測数を25%〜50%減らせます。そもそもこの手法は、固定サンプルのテストを途中で覗かずに済むようにするためにあります。ベイズ的な手法は、p値ではなく、ある案が別の案に勝る確率を示すため、テストの途中でも判断しやすくなります。どちらもサンプルサイズの問題を小さくしますが、なくしはしません。真の効果がごく小さければ、どの手法でも手持ち以上のデータが必要です。

大きな変更を試し、途中で覗かない

少ないトラフィックでのテストを誠実に保つルールは2つです。1つ目は、大きな変更を試すことです。MDEを超えるほど大きな差を選び、トラフィックをさらに分けてしまう多変量テストではなく、きれいなA/Bテストを1つ回します。2つ目は、始める前にサンプルサイズと停止ルールを決め、有意に見えた初日に勝者を決めないことです。固定サンプルのテストを早い段階で覗くこと(ピーキング)は、ノイズを成果としてリリースしてしまう典型的な原因です。ジャーニーの中で自動のA/B分岐を回す場合も、同じ規律が当てはまります。指標と期間を事前に決めておいてください。ホールドアウトグループ(意図的に従来の体験のままにしておく一部のユーザー)は、効果が本物かを確かめる簡単な方法です。小さなチームが回せるテストは多くありません。だからこそ、回す価値のあるテストを選び、正しく回してください。

FAQ

よくある質問

  • A/Bテストにはどれくらいのトラフィックが必要ですか?

    決まった訪問者数ではなく、ベースラインのコンバージョン率と検出したい効果の大きさで決まります。大まかな参考として、VWOのガイドは、週あたり約1,000人未満の訪問者、またはコンバージョン5〜10件という目安を挙げています。それを下回る場合は、大きな変更だけをテストするか、正式なテストを見送るつもりで計画してください。

  • 逐次検定やベイズ的なテストで、トラフィック不足は解決できますか?

    役には立ちますが、解決はしません。どちらも効果が大きければテストを早く終えられますが、本当の差が小さければ、どの手法でも手持ちにないデータが必要です。サンプルサイズの問題をなくすのではなく、小さくするものです。

  • スタートアップはそもそもA/Bテストをすべきですか?

    場合によります。テストは、最小検出効果を超えるほど大きな変更に取っておいてください。それ以外は、ガードレール指標を見ながらリリースする、小さな変更をまとめる、定性調査を使う、のいずれかです。検出力の足りないテストを回すと、何週間も無駄にし、誤った確信を生みます。

  • ピーキングとは何で、なぜ問題なのですか?

    ピーキングとは、固定サンプルのテストを繰り返し確認し、有意に見えた瞬間に止めることです。偽陽性が増えます。十分な回数を見れば、ノイズが偶然しきい値を超えるからです。サンプルサイズと停止ルールを事前に決めるか、逐次的な確認を前提につくられた手法を使ってください。

fromHelloは、オープンソースのマーケティングオートメーションです。

人の行動をきっかけにメッセージを届けます。fromHello Cloudは、ウェイトリスト経由でアーリーアクセスを提供しています。

アーリーアクセス

fromHello Cloud

小さくまとまるために始めたわけではない。

fromHello Cloudのアーリーアクセスは、段階的にご案内します。 オンボーディングは伴走型です。セットアップからコンタクトの移行まで、私たちがお手伝いします。

ご利用の準備が整い次第、メールでお知らせします。スパムは送りません。

まだ登録する段階ではありませんか?GitHubで見る