確率のバグ

「流れ」は存在するか:素朴に測ると見えて、正しく測ると消える

読了目安 約8分

前回の数字がまた出ると「流れが来ている」と感じ、長く出ていない数字には「そろそろ」と期待します。この直感を、超幾何分布、帰無較正、交絡の統制という三段階で検定すると、流れは一度だけ姿を見せ、そして消えました。最後に見えてきたのは、球の側ではなく、数字を選ぶ人の側の小さな傾向でした。

前回の数字がまた出るのは、出ないほうが珍しい

ロト6は1〜43から6個を選びます。ある特定の数字が本数字に入る確率は毎回6/43、約13.95%です。前回出た6個のそれぞれについてこの確率を足すと、次回に重なる個数の平均は6×6/43=0.8372個になります。1回で0.84個が出るという意味ではなく、0個・1個・2個を長く集めた平均です。

前回と1個以上重なる確率 = 1 − C(37,6)/C(43,6) ≈ 61.87%

前回の6個をすべて避けるには残り37個から6個が選ばれる必要があり、その確率は約38%しかありません。つまり独立な抽せんでも、約62%の回で前回の数字が1個以上顔を出します。「また出た」は異常ではなく、標準の風景です。重なる個数の分布は超幾何分布で、次回の6個は重複なしに取り出すので、1回の中の数字同士を独立として掛けてはいけません。

独立・等確率モデルでの重なり個数(ロト6)
前回と共通する個数確率
0個38.13%
1個42.90%
2個16.25%
3個以上2.72%

実測は2,129回の平均で0.8341個、理論0.8372個の隣にいます。ロト7は理論1.3243個に対し実測1.3396個、ミニロトは理論0.8065個に対し実測0.8327個。数字の範囲と選ぶ個数が変わると、自然な重なりやすさも変わります。

ロト6からロト7への「引き継ぎ」も同じ計算で片づきます。両方に出うる数字は1〜37の37個。独立なら平均重複は37×(6/43)×(7/37)=42/43≈0.977個で、実測は直前のロト6と比べた690回の平均で0.9768個でした。つながっていなくても、共有している37個のぶんだけ重なります。

出典・データ:宝くじ公式:ロト6のルールと当せん確率 / 宝くじ公式:ロト7のルールと当せん確率 / 宝くじ公式:ミニロトのルールと当せん確率 / SciPy公式資料:超幾何分布の定義(英語) / 集計方法とデータの範囲

素朴に回帰すると、平均回帰が「見える」

「出遅れた数字はそろそろ出る」を式にします。D_t を t 回時点での「期待出現数 − 実際の出現数」、つまり遅れとします。各回の出現が確率 p のベルヌーイ試行で独立なら、次の回で遅れがどう動くかは一行で書けます。

E[D(t+1) | D_t] = D_t + p − p = D_t

遅れの期待値は縮みません。マルチンゲールです。分散は t·p(1−p) なので、遅れの標準偏差は√t で増え続けます。取り戻すどころか、回数の差はむしろ広がります。一方で「割合」は平均へ近づきます。100回で理論14回のところ10回だった数字が、次の100回で通常どおり14回出れば合計24回。差は残ったまま、割合は10%から12%へ寄る。大数の法則は割合の話であり、帳尻の話ではありません。ついでに、10回連続で出ないこと自体は (37/43)¹⁰ ≈ 22% で、43個を眺めればどこかに「ハマった数字」が必ずいます。

ここからが本題です。ロト6の2,129回で、ある数字の遅れを説明変数、次回の出現を目的変数にして回帰すると、t = −9.40、p = 2×10⁻²¹ という強烈な負の係数が出ます。遅れているほど出やすい。教科書どおりの平均回帰が、データの中に「見える」のです。

ただし、この t 値はそのままでは額面どおりに読めません。説明変数の遅れは過去の出現から作られ、43個の数字は毎回合計6個という制約で互いに結びついています。通常の t 検定の前提が壊れているので、同じ手順を効果ゼロの一様乱数に当てても t は大きく出ます。そこで一様乱数で同じ回数を回して同じ回帰をかけ、その分布と比べる帰無較正を行うと、実データの p 値は 0.240。偶然の範囲です。

同じデータ、違う検定
分析方法統計量判定
素朴な回帰の t 検定t = −9.40、p = 2×10⁻²¹強い「証拠」に見える
帰無分布で較正した検定p = 0.240偶然の範囲
遅れた数字に賭ける模擬戦略どの戦略も理論値の周り(p > 0.13)理論値と差がない

そして陰性を書く資格として、本物の平均回帰を注入しました。10回遅れた数字が1.02倍出やすくなるだけの世界で、この検定は t = −16.57 と明確に検出します。1.02倍以上の平均回帰なら見えたはずで、実データには見えませんでした。これが「抽せん機の側に流れは見つからなかった」の正確な意味です。

出典・データ:NIST統計ハンドブック:二項分布(英語) / 集計方法とデータの範囲

有意になった「流れ」が、交絡で消えるまで

球の側に流れがないなら、人の側はどうでしょうか。ロト6では当せん口数が公開されているので、「直近に出た数字を多く含む出目は、買われ方が違うか」を回帰で問えます。時間トレンドを統制した最初の定式化では、F = 4.10、p = 0.0010、部分決定係数 1.056%。統計的には文句のない有意水準で、「ロト6に何かある」と書けそうな数字でした。

結論を書く前に、別の説明を順に確かめました。購入者は未来の当せん番号を知りえないので、「これから5回のうちに出る数字」で同じ特徴量を作れば効果はゼロのはずです。このプラセボは p = 0.0753 で出ず、未来を統制しても過去の効果は残りました(p = 0.0005)。出目の形(散らばり・連番・下一桁)を統制しても 1.056% は 1.039% にしか動きません。効果ゼロの世界で p < 0.05 になる率は 5.3% で、検定自体も適正でした。ここまでは順調でした。

それでも時系列を4期に割ると、効果は単調に減衰していました。

直近効果の部分決定係数(ロト6、4期分割)
期間回号部分決定係数p
第1期31〜548回2.255%0.0579
第2期549〜1065回1.625%0.1761
第3期1066〜1582回0.592%0.7344
第4期1583〜2099回0.355%0.8934

減衰の正体は制度でした。ロト6は2011年4月4日の第543回から週1回が週2回になり、月曜の「前回」は木曜、木曜の「前回」は月曜になります。直近特徴量は曜日と機械的に結びつき、曜日で売上規模が違う。しかも制度変更は不連続なので、なめらかな時間トレンドでは吸収できません。曜日ダミーと週2回化ダミーを加えると、部分決定係数は 0.560%、p は 0.0454。定式化を2通り試しているのでBonferroni補正すると 0.09。有意ではありません。

ロト7で再現しなかった理由も同時に説明がつきました。ロト7は2013年4月開始で、ロト6を2013年4月以降に限ると p = 0.4064、検出限界以下です。くじの違いではなく、時期の違いでした。p = 0.001 の「発見」は、曜日という第三の変数を通して現れたものでした。

出典・データ:宝くじ公式:ロト6のルールと当せん確率 / 宝くじ公式:ロト7のルールと当せん確率 / 集計方法とデータの範囲

交絡が構造的にない場所で、問い直す

交絡を統制するより、交絡が存在しない対象を探すほうが強い。ミニロトは1999年から全1,400回が火曜日、抽せん間隔は全期間7日、制度変更なし。曜日も週2回化も、統制する以前に存在しません。

ミニロト1,340回での直近効果
向きFp部分決定係数判定
過去(本検定)2.3150.04170.881%有意
未来(プラセボ)0.3410.88800.131%検出限界以下

帰無較正では効果ゼロの世界で p < 0.05 になる率が 4.7%(名目5%)で、検定は適正です。購入者が知りえない未来では出ず、過去でだけ出る。つまり交絡のない場所で、直近の数字に応じて買われ方がわずかに変わる、という人の側の効果だけが生き残りました。

ここで二つの線を引きます。第一に、この効果は口数、つまり人の行動に現れたもので、球には現れていません。ミニロトの連続回重複は理論0.8065個に対し実測0.8327個、z = +1.30。撹拌の側は静かです。第二に、生き残った効果の大きさは残差分散の1%未満で、避けているのか選んでいるのかも特定できず、実用に結びつく大きさではありません。

流れを探しに行った検定が最後に見つけたのは、球の側の癖ではなく、前回の数字を眺めて選ぶ人の側の、ささやかな傾向でした。

出典・データ:宝くじ公式:ミニロトのルールと当せん確率 / 集計方法とデータの範囲

「流れ」を感じる仕組みと、自分で確かめる手順

人間の認知は、出来事の並びにつながりを見いだすのが得意です。バスケットボールの「ホットハンド」をめぐる研究以来、連続をパターンとして受け取り、物語として覚える傾向は繰り返し確認されてきました。ロトの「流れ」もその一つで、62%の回で起きる重なりや、22%で起きる10連続不出現が、「意味のある偶然」として印象に残りやすいのだと考えられます。

この記事で行ったことは、そのまま自分の仮説に使えます。①理論値を先に計算する(62%、0.8372個、22%)。②素朴な検定の t 値を信じず、効果ゼロの乱数で同じ手順を回して較正する。③有意になったら、曜日・制度変更・売上のような第三の変数を疑い、交絡のない対象で追試する。④「差がない」と書くときは、どれだけの効果なら検出できたか(ここでは1.02倍)を添える。

確率の面で押さえておきたいのは一点だけです。前回の数字を選んでも避けても、出遅れた数字を集めても、次回の1組の確率はどれも 1/6,096,454 で同じです。そのうえで、数字によって違いが出る場所をデータで探すなら、それは同じ発想の人が何口いるかという分け前の側です。流れを眺める楽しみはそのままに、この記事の手順を自分の気になる仮説に当ててみると、過去の記録がまた違った表情を見せてくれます。

出典・データ:宝くじ公式:ロト6のルールと当せん確率