ABテストの有意差とは?必要サンプル数と期間の決め方
|広告運用ノウハウ公開中!
より詳しく知りたい方は資料をダウンロード!
「BのほうがCVRが高かったので、Bを採用しました」。この判断が正しいかどうかは、差の大きさではなく、集まったデータの量で決まります。
CVR 2.0%と2.4%。数字だけ見ればBの勝ちに見えますが、それぞれ500人ずつしか流入がなければ、この差は偶然でも普通に起きます。
有意差は、その「偶然でも起きる範囲かどうか」を判定するための考え方です。この記事では、判定の仕組みから必要サンプル数の早見表、テスト期間の決め方、そして有意差が出なかったときにどうするかまでをまとめます。テストの組み方そのものはABテストで最適なLPを|基本的なやり方から徹底解説にあります。
\LPの制作から検証まで、ひとつの画面で/
- ・10日間、有料プランの機能を無料でお試しいただけます
- ・LP制作からA/Bテスト、効果測定までワンストップ
目次
1. ABテストの有意差とは
有意差とは、「観測された差が、偶然では説明しにくい大きさである」という状態のことです。
ABテストでは、AとBに本当は差がなくても、たまたまBの数字が良くなることがあります。コインを10回投げて7回表が出るのと同じで、偏りは普通に起きます。
有意差の判定は、この問いに答えるものです。
「AとBに本当は差がない」と仮定したとき、今回観測された差以上の偏りが起きる確率はどれくらいか
この確率が十分小さければ、「偶然とは考えにくい=差があるとみなす」と判断します。
1-1. p値と有意水準5%の意味
その確率がp値です。そして「十分小さい」の基準が有意水準で、慣例として5%(0.05)が使われます。
| 状態 | 読み方 |
|---|---|
| p < 0.05 | 差がないと仮定すると、この偏りが起きる確率は5%未満。有意差ありと判定する |
| p ≧ 0.05 | 偶然でも起こりうる範囲。有意差なし(差がないと証明されたわけではない) |
ここを取り違えやすいので補足します。 「p ≧ 0.05」は「AとBは同じ」という意味ではありません。「差があるとは言えなかった」だけです。データが足りずに判定できていない場合も、ここに含まれます。
1-2. 使う検定はt検定ではない
「ABテスト 検定」で調べるとt検定の解説が出てきますが、CVRやクリック率の比較でt検定は使いません。
| 比べるもの | 使う検定 |
|---|---|
| CVR・クリック率・開封率(○人中○人という比率) | カイ二乗検定 / 2標本比率のZ検定 |
| 客単価・滞在時間(人ごとに値が違う平均値) | t検定 |
CVRは「コンバージョンしたか、しなかったか」の2値なので、平均値を比べるt検定の前提に合いません。比率の検定を使ってください。
1-3. 「有意差あり」は「導入すべき」ではない
有意差は差の存在を判定するだけで、差の大きさは判定しません。
サンプルが膨大なら、CVR 2.00%と2.02%のようなごくわずかな差でも有意差は出ます。しかしその0.02ptに、制作と運用のコストを払う価値があるかは別の問題です。
判定の前に「どれくらい改善したら採用するか」を決めておいてください。 これが次の章の話につながります。
2. 判定の前に3つ決める
テストを始める前に決めるものが3つあります。後から決めると、都合のいい基準を選んでしまいます。
| 決めるもの | 意味 | 通常の設定 |
|---|---|---|
| 検出したい差 | どれくらい改善したら採用するか | 相対+10%〜+50% |
| 有意水準(α) | 「偶然ではない」とみなす基準 | 5%(両側) |
| 検出力(1−β) | 本当に差があるとき、それを見つけられる確率 | 80% |
検出力が最も忘れられます。 有意水準は「差がないのに、あると誤判定する確率」を抑えるもので、検出力は「差があるのに、見逃す確率」を抑えるものです。
検出力80%とは、本当に差があっても5回に1回は見逃すという設定です。これでも実務では標準的な水準です。
この3つが決まると、必要なサンプル数が一意に決まります。
3. 必要サンプル数の早見表
先に結論を出します。
有意水準5%(両側)・検出力80%のとき、片方のパターンに必要な人数です。
| 元のCVR | +10%改善を検出 | +20%改善を検出 | +50%改善を検出 | +100%改善を検出 |
|---|---|---|---|---|
| 0.5% | 327,919 | 85,859 | 15,596 | 4,671 |
| 1.0% | 163,092 | 42,691 | 7,747 | 2,316 |
| 2.0% | 80,679 | 21,106 | 3,823 | 1,139 |
| 3.0% | 53,208 | 13,911 | 2,515 | 746 |
| 5.0% | 31,231 | 8,155 | 1,468 | 432 |
| 10.0% | 14,749 | 3,839 | 683 | 197 |
※片群あたりの人数です。A/Bの2パターンなら、表の数字の2倍の流入が必要になります。
3-1. 計算式
2標本比率の検定を使っています。
n = (Zα + Zβ)² × [ p1×(1−p1) + p2×(1−p2) ] ÷ (p2 − p1)²
>
Zα = 1.96(有意水準5%・両側)/ Zβ = 0.84(検出力80%)
p1 = 元のCVR/p2 = 改善後のCVR
n = 片群あたりに必要な人数
たとえば元のCVR 2.0%を+20%(2.4%)に改善したことを検出したい場合、片群に21,106人が必要になります。
3-2. 表の読み方
読み取ってほしいのは3点です。
- 元のCVRが低いほど、必要な人数が跳ね上がる。 CVR 0.5%で+10%を検出するには片群32万人、両群で65万人が要ります
- 小さい改善ほど、必要な人数が跳ね上がる。 CVR 2.0%の場合、+50%なら3,823人で足りますが、+10%だと80,679人。21倍の差です
- 多くのLPでは、+10%の改善は現実的に検出できない。 月間の流入が数千のLPで+10%を判定しようとすると、何年もかかります
3-3. 自社のCVRが分からない場合
計算の入口になるのは「元のCVR」です。まだ実績がない場合は、業界別のベンチマークを出発点にしてください。CVRの平均は?業界別データと改善優先度にまとめています。
4. テスト期間の決め方

「ABテスト 期間」で調べると「2週間」「1ヶ月」といった日数が出てきますが、日数で決めるのは順序が逆です。
4-1. 日数ではなくサンプル数で決める
正しい手順はこうなります。
- 必要サンプル数を先に計算する(前章の表)
- 1日あたりの流入数で割る
- 出てきた日数がテスト期間
必要サンプル数 21,106人/群 × 2群 = 42,212人
1日あたりの流入 600人
→ 71日
この計算で「半年かかる」と出たら、そのテストは実行しないほうがいいという結論になります。日数を先に決めると、この判断ができません。
4-2. それでも最低1週間は回す
サンプル数が早く集まっても、最低1週間は回してください。 曜日によってユーザーの行動が変わるためです。平日だけで判定すると、土日の傾向が結果に入りません。
2週間(2サイクル)回せればより安定します。
4-3. 途中で覗いて止めない
これが最も多い失敗です。
毎日結果を見て「有意差が出た時点で止める」という運用をすると、偶然の偏りを拾ってしまいます。 何度も判定を繰り返すほど、どこかのタイミングで偶然p<0.05になる確率が上がるためです。
対策は単純で、事前に決めたサンプル数に達するまで判定しないことです。途中経過は見てもいいですが、それで止める判断をしないでください。
5. 有意差が出ないときの3つの選択肢
ここが実務でいちばん困るところです。そして上位の記事がほとんど扱っていない部分でもあります。
5-1. 自社の実例:ABテストから「配信間の比較」に切り替えた
当社は自社のメールマガジンで、件名のABテストを4ヶ月運用しました。そのうえで2026年8月に、検証の方法を「配信間の比較」に切り替えています。
きっかけは、配信規模に対して必要サンプル数が足りているかを検算したことでした。
配信数と開封率から逆算すると、この規模で検出できる差には下限があります。記録していた勝ちパターン9件をその基準に当てはめたところ、基準を超えていたのは3件。この3件は、再現性のある学びとして件名の型に反映しました。 残りは判定を保留し、別の方法で確かめることにしています。
本文やCTAのABテストについても同じ計算をしました。1配信あたりのクリック数からは、検出に相対138%の変化が必要という結果になります。クリックが2.4倍になる変更を前提にするより、先に配信規模を増やすほうが順序として正しいと判断しました。
もう1つ、評価指標の設計も見直しました。4ヶ月の件名ABで開封率は上がりましたが、開封後のクリック率は下がっていました。 最終的な目的はコンバージョンなので、開封率という中間指標だけで良し悪しを決めない設計に改めています。
現在は、同一資料・同一リスト・同一時刻に揃え、条件を1つだけ変えて前回配信と比べる方法を使っています。 統計的な判定はできませんが、判定できる規模になるまでの間、意思決定を止めずに前へ進めるやり方として機能しています。
5-2. 選択肢1:検出したい差を大きくする
+10%の改善を狙うから人数が要るのであって、+50%を狙えば必要人数は20分の1以下になります(CVR 2.0%なら80,679人→3,823人)。
ボタンの色を変えるような小さい変更ではなく、ファーストビューの訴求を丸ごと変えるような大きい変更にする、という方向です。
5-3. 選択肢2:期間を伸ばす/流入を増やす
必要サンプル数に届くまで回す、という素直な対応です。ただし期間が長くなるほど、季節要因や市況の変化が混ざります。 3ヶ月を超えるようなら、テストの前提そのものを見直したほうが確実です。
5-4. 選択肢3:ABテスト以外の検証に切り替える
流入が構造的に足りない場面では、ABテスト以外の手法のほうが噛み合います。 当社のメルマガがこれに当てはまりました。
併用できるのは次のような方法です。
- 条件を1つだけ変えた前後比較:統計的な判定はできないが、方向性は見える
- 定性的な検証:ヒートマップや実際の行動観察で、どこで詰まっているかを見る
- より上流の指標で判断する:CVRではなく、離脱位置やスクロール到達率で比べる
なお、広告媒体の自動最適化機能を「ABテストの代わり」に使うのは避けてください。Meta公式も、ダイナミッククリエイティブについて結果が全バリエーションの集計で出るためA/Bテストの代わりには推奨しないと明記しています。詳しくはMeta広告のダイナミッククリエイティブとは?設定と限界にまとめています。
6. よくある失敗
6-1. サンプル数を決めずに始める
- 症状:テストを回しているが、いつ終わらせるか誰も決められない。結局「そろそろいいだろう」で打ち切る
- 原因:開始前に必要サンプル数を計算していない。検出したい差と検出力を決めていないため、終了条件が存在しない状態でテストが走っている。この状態だと、見る人の都合で結論が変わります
- 対策:開始前に「元のCVR」「検出したい改善幅」を決め、前章の表から必要サンプル数を出す。それを1日あたりの流入で割って終了日を確定させる
- 回避策:テストの企画書に終了条件(サンプル数と予定日)を必須項目として書く。埋まらないテストは開始しない
6-2. 有意差が出た瞬間に止める
- 症状:短期間で「勝ち」が出たので採用したが、本番に反映したら数字が戻らない
- 原因:毎日結果を覗いて、有意差が出たタイミングで止めている。判定を繰り返すほど、どこかで偶然p<0.05になる確率が上がります。1回だけ判定するなら5%の誤判定率が、10回覗けば実質的にはるかに高くなります
- 対策:事前に決めたサンプル数に達するまで判定しない。途中経過は参考として見るだけにする
- 回避策:判定日をカレンダーに入れてしまう。 「この日まで触らない」を先に固定すると、途中で止める判断が物理的に起きにくくなります
6-3. 中間指標だけを最適化する
- 症状:クリック率は改善したのに、最終的なコンバージョン数が変わらない、または減っている
- 原因:測りやすい中間指標(開封率・クリック率)をテストの評価指標にしている。中間指標は動かしやすい一方で、最終成果と連動するとは限りません。当社のメルマガでも、件名ABで開封率は上げられた一方、開封後のクリック率は同じようには動きませんでした
- 対策:テストの評価指標を最終成果に最も近いものに置く。CVが少なすぎて判定できない場合は、CVに至る手前の指標のうち、過去データでCVと連動が確認できているものを使う
- 回避策:企画時に「この指標が改善したら、CVはいくつ増える見込みか」を書き出す。書けない指標は評価指標にしない
7. 検証を回す前提なら|Squad beyondでの進め方
ここまでの話を実務に落とすと、必要なのは2つです。
- 十分なサンプル数が集まるまで、同じ条件で配信し続けられること
- 差を大きく取るために、パターンを作る手間が軽いこと
とくに2つ目が現実的なボトルネックになります。+10%ではなく+50%を狙う大きい変更をするには、ファーストビューや構成を変えたパターンを作る必要があり、1本ずつ作り直していると検証の回転が止まります。
Squad beyondは、作ったLPを複製して差分だけ差し替えたパターンを並行配信し、パターンごとの成果をレポートで比較できます。 大きく変えたパターンを用意するコストが下がるので、「小さい改善を検出できずに終わる」状態を避けやすくなります。
進め方の全体像はLPOとは?CVR改善の実践5ステップ・改善事例・ツール選び、Google広告と組み合わせる場合はGoogle 広告におけるLPのABテストの全体像を参照してください。
\LPの制作から検証まで、ひとつの画面で/
- ・10日間、有料プランの機能を無料でお試しいただけます
- ・LP制作からA/Bテスト、効果測定までワンストップ
8. ABテストの有意差についてよくある質問(FAQ)
Q. ABテストで有意差とは何ですか?
観測された差が、偶然では説明しにくい大きさである状態のことです。AとBに本当は差がなくても、たまたま片方の数字が良くなることは普通に起こります。有意差の判定は「差がないと仮定したとき、今回の偏りが起きる確率はどれくらいか」を計算し、その確率が十分小さければ「偶然とは考えにくい」と判断するものです。差の大きさを判定するものではない点に注意してください。
Q. 有意差0.05>Pとはどういう意味ですか?
p値が0.05を下回っている、つまり「AとBに差がないと仮定すると、この偏りが起きる確率は5%未満」という意味です。この場合「有意差あり」と判定します。逆にp値が0.05以上なら「有意差なし」ですが、これは「AとBは同じ」という意味ではありません。 「差があるとは言えなかった」だけで、データ不足で判定できていない場合も含まれます。
Q. ABテストにはどれくらいのサンプル数が必要ですか?
元のCVRと、検出したい改善幅で決まります。有意水準5%・検出力80%の場合、元のCVR 2.0%で+20%の改善を検出するなら片群21,106人、+50%なら3,823人です。元のCVRが低いほど、また検出したい差が小さいほど、必要人数は跳ね上がります。本記事の早見表から自社の条件に近い行を探してください。
Q. テスト期間はどれくらいが適切ですか?
日数から決めないでください。 必要サンプル数を先に計算し、1日あたりの流入数で割って出た日数が期間になります。ただし曜日変動があるので、サンプルが早く集まっても最低1週間は回してください。この計算で「半年かかる」と出たら、そのテストは実行しない判断になります。Squad beyondならパターンの複製と並行配信ができるので、同じ流入量でも検証の本数を増やせます。
Q. 有意差が出ないときはどうすればいいですか?
3つの選択肢があります。検出したい差を大きくする(小さい変更ではなく訴求を丸ごと変える)、期間を伸ばす(ただし3ヶ月を超えるなら前提を見直す)、ABテスト以外の検証に切り替えるです。流入が構造的に足りない場合は、3つ目が現実的な答えになります。当社も自社メルマガで4ヶ月ABテストを運用したのち、2026年8月に配信間の比較へ切り替えました。
Q. T検定で有意な差があるとはどういう意味ですか?
t検定は平均値の差を比べる手法で、客単価や滞在時間のように人ごとに値が異なるものに使います。CVRやクリック率のような「○人中○人」の比率には使いません。 比率の比較にはカイ二乗検定か2標本比率のZ検定を使ってください。ABテストの解説でt検定が出てくることがありますが、評価指標が比率なら前提が合っていません。
Q. 広告媒体の自動最適化をABテストの代わりに使えますか?
使えません。 たとえばMeta広告のダイナミッククリエイティブは、結果が全バリエーションの集計として表示されるため、どの組み合わせが効いたかを切り分けられません。Meta公式ヘルプも「A/Bテストの代わりに使用することはおすすめしません」と明記しています。自動最適化は「反応する方向を探す」探索、ABテストは「どれが効いたか確定させる」検証、と工程で使い分けてください。
9. まとめ
ABテストの有意差について、押さえる点をまとめます。
- 有意差は差の存在を判定するもので、差の大きさは判定しない
- 「有意差なし」は「同じ」ではなく「差があるとは言えなかった」
- CVRなどの比率にt検定は使わない。比率の検定を使う
- 必要サンプル数は元のCVRと検出したい改善幅で決まる。CVR 2.0%で+20%なら片群21,106人
- テスト期間は日数ではなくサンプル数から逆算する
- 途中で覗いて止めない
- 有意差が出ないときは、差を大きくする/期間を伸ばす/ABテスト以外の検証に切り替えるの3択
最後の選択肢を持っておくことが、実務ではいちばん効きます。いま判定できる規模かを先に確かめ、足りなければ検証方法のほうを合わせにいく。 この順番にすると、データが溜まるのを待つ間も意思決定を止めずに済みます。
---
\LPの制作から検証まで、ひとつの画面で/
- ・10日間、有料プランの機能を無料でお試しいただけます
- ・LP制作からA/Bテスト、効果測定までワンストップ
Squad beyondサービス紹介資料はこちらからダウンロード



