トラフィックが少ないとA/Bテストが機能しない理由
A/Bテストは2つのバージョンを比べ、その差が本物かノイズかを問うものです。答えを出すには、シグナルと偶然を見分けられるだけの観測数が必要ですが、スタートアップにはめったにそれがありません。月に数百件のコンバージョンでは、計算上、見つけられるのは大きな差だけです。そのため、「何でもテストせよ」というよく聞く助言に従うと、最初から結論の出ないテストを回すことになります。回す価値のある少数のテストを選ぶことこそ、実験ロードマップの目的です。
統計的検出力とMDEをかみ砕いて言うと
統計的検出力とは、効果が実在するときにテストがそれを検出できる確率で、通常は80%を目標にします。最小検出効果(MDE)とは、ベースラインの率とサンプルサイズを前提に、その検出力でテストが捉えられる最小の改善幅です。2つは連動しており、訪問者が少ないほどMDEは大きくなります。スタートアップの規模では、MDEが相対で20%〜50%の差になることがよくあり、ボタンの色の変更で得られるような2%ではありません。変更の効果がMDEより小さければ、現実的などんな期間をかけてもテストはそれを捉えられません。
大きな効果しか検出できない理由
必要なサンプルサイズは、検出したい効果のおよそ2乗に反比例します。そのため、MDEを半分にすると、必要な訪問者はおよそ4倍になります。Optimizely自身の計算例がこれを数字で示しています。ベースラインが10%のとき、3%の改善を検出するには、10%の改善の場合のおよそ15倍の訪問者が必要です。したがって、小さなチームが誠実に測れる効果は粗いものに限られます。新しい料金ページ、つくり直したオンボーディングフロー、中心となるオファーの変更などで、細かな文言の調整ではありません。CROスペシャリストは、時間の大半を、どの変更がテストに値するほど大きいかの判断に使います。
逐次検定とベイズ的なテストは、少しだけ役に立つ
逐次検定では、結果が決定的になった時点で早めにテストを止められます。繰り返し結果を確認しても成り立つように計算が組まれています。Evan Millerの逐次検定の設計では、真の効果が大きい場合、観測数を25%〜50%減らせます。そもそもこの手法は、固定サンプルのテストを途中で覗かずに済むようにするためにあります。ベイズ的な手法は、p値ではなく、ある案が別の案に勝る確率を示すため、テストの途中でも判断しやすくなります。どちらもサンプルサイズの問題を小さくしますが、なくしはしません。真の効果がごく小さければ、どの手法でも手持ち以上のデータが必要です。
大きな変更を試し、途中で覗かない
少ないトラフィックでのテストを誠実に保つルールは2つです。1つ目は、大きな変更を試すことです。MDEを超えるほど大きな差を選び、トラフィックをさらに分けてしまう多変量テストではなく、きれいなA/Bテストを1つ回します。2つ目は、始める前にサンプルサイズと停止ルールを決め、有意に見えた初日に勝者を決めないことです。固定サンプルのテストを早い段階で覗くこと(ピーキング)は、ノイズを成果としてリリースしてしまう典型的な原因です。ジャーニーの中で自動のA/B分岐を回す場合も、同じ規律が当てはまります。指標と期間を事前に決めておいてください。ホールドアウトグループ(意図的に従来の体験のままにしておく一部のユーザー)は、効果が本物かを確かめる簡単な方法です。小さなチームが回せるテストは多くありません。だからこそ、回す価値のあるテストを選び、正しく回してください。