Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

サンプルサイズの決め方

区間推定のサンプルサイズの決め方

信頼区間の幅を基準にサンプルサイズを決める方法がある。

母比率ppの95%信頼区間は、標本比率p^\hat{p}を用いて

p^−1.96×p^(1−p^)n≤p≤p^+1.96×p^(1−p^)n\widehat{p}-1.96 \times \sqrt{\frac{\widehat{p}(1-\widehat{p})}{n}} \leq p \leq \widehat{p}+1.96 \times \sqrt{\frac{\widehat{p}(1-\widehat{p})}{n}}

と求めることができる

区間の幅部分が両側合計でww以下にしたい場合は

2×1.96×p^(1−p^)n≤w2 \times 1.96 \times \sqrt{\frac{\widehat{p}(1-\widehat{p})}{n}} \leq w

を解けばよいので

n≥2×1.96×p^(1−p^)×1w\sqrt{n} \geq 2 \times 1.96 \times \sqrt{\widehat{p}(1-\widehat{p})} \times \frac{1}{w}
n≥(2×1.96×p^(1−p^)×1w)2n \geq (2 \times 1.96 \times \sqrt{\widehat{p}(1-\widehat{p})} \times \frac{1}{w})^2

となる

例えば、事前調査によりp^=0.1\hat{p} = 0.1であることがわかっていて、幅w=0.01w=0.01で95%信頼区間を求めたい場合は

n=13829
[0.095, 0.105], width=0.01
[0.0937, 0.104], width=0.01

statsmodelsの関数

samplesize_confint_proportion を使うことで、想定される比率、幅、有意水準からサンプル数を推定できる

3,457

検定のサンプルサイズの決め方(決定力分析)

検定は4つの要因で構成される

そこで、次の手順で

手順1. 事前分析:サンプルサイズの設計

調査(A/Bテストなど)を行う前のサンプルサイズ設計。

  1. 効果量

  2. 有意水準

  3. 検出力

を決めてサンプルサイズを算出する。

有意水準は5%、検出力は80%などにすればいいが、効果量がちょっと難しい。

A/Bテストでいうと「この新施策で成約率が5ポイント上昇するはず」などの仮定をおいて効果量を算出することになる。

効果量

代表的な効果量にはCohenのdやhがある。

効果量用途備考
Cohen’s dd2群の平均値の差目安:0.2=小, 0.5=中, 0.8=大
Hedges’ gg2群の平均値の差Cohen’s ddの小標本でのバイアス補正版
Cohen’s hh2群の比率の差目安:0.2=小, 0.5=中, 0.8=大
d=0.103
d=0.485
d=0.213
J=0.997
g=0.212
h=0.152

手順2. 事後分析:検出力の計算

  1. 実測のサンプルサイズ

  2. 実測の効果量

  3. 有意水準

で検出力を算出する

power=0.721
power=0.954

statsmodels

statsmodels: Size Calculations

<Figure size 640x480 with 1 Axes>

statsmodelsの solve_power では、4要因のうち None にした要素を推定できる

effect_size=0.398
effect_size=0.125