E-Valueは相対リスク(リスク比)などの比率で関連性を測るとき、未観測の交絡因子の影響の強さを簡単に測る方法。
観測された処置と結果の関連性(相対リスク)がすべて交絡因子による影響だと仮定すると、どれだけ交絡因子の影響が強いのか? を示す。
E-Value = RR + RR × ( RR − 1 ) \text { E-Value }= \text{RR} +\sqrt{ \text{RR} \times( \text{RR} -1)} E-Value = RR + RR × ( RR − 1 ) ここで RR \text{RR} RR は 相対リスク(relative risk) で、例えば「キャンペーンの有無」が「商品の購入の有無」に与える効果を調べたい場合だと
RR = 処置群での購入の割合 対照群での購入の割合 \text{RR} =
\frac{ 処置群での購入の割合 }{ 対照群での購入の割合 } RR = 対照群での購入の割合 処置群での購入の割合 となる。これはRRが1より大きい場合で、もしRRが1より小さくなるなら逆数を用いる。
E-valueが大きいほど、観測された結果と処置の関係は因果関係に近い(ロバストである)と解釈される。
例えばRRが1.5(処置で1.5倍改善)だとE-valueは2.37になる。これは、 もし未観測の交絡因子でこの推定結果を説明するには、未観測の交絡因子が結果変数と処置変数の両方と2.37倍の相対リスクで関連している必要がある ことを示す。
# 例
p_treatment = 0.15 # 処置群での購入割合
p_control = 0.10 # 対照群での購入割合
RR = p_treatment / p_control
import math
E = RR + math.sqrt(RR * (RR - 1))
print(f"E-value: {E:.3g}")結果をY Y Y 、処置をA A A 、未観測の交絡因子をU U U とする。
とすると、未観測の交絡因子の影響を受けた観測された相対リスクの上限(bounding factor, R R o b s ≤ B F RR_{obs} \leq BF R R o b s ≤ BF )は
B F = R R U Y × R R A U R R U Y + R R A U − 1 BF = \frac{R R_{U Y} \times R R_{A U} }{ RR_{U Y} + RR_{A U} - 1 } BF = R R U Y + R R A U − 1 R R U Y × R R A U となる(Ding & VanderWeele, 2016 )。
(ここからは推測を含む)
ここで R R U Y = R R A U RR_{U Y} = RR_{A U} R R U Y = R R A U と仮定して E E E とおく
B F = E 2 2 E − 1 BF = \frac{E^2}{2E - 1} BF = 2 E − 1 E 2 ここで、 「観測された処置と結果の関連性R R o b s RR_{obs} R R o b s が すべて未観測の交絡因子による影響である場合(R R o b s = B F RR_{obs} = BF R R o b s = BF )に交絡の強さ E = R R U Y = R R A U E=RR_{U Y} = RR_{A U} E = R R U Y = R R A U がいくつ必要か?」 という問題を解くことにする。
R R o b s = E 2 2 E − 1 RR_{obs} = \frac{E^2}{2E - 1} R R o b s = 2 E − 1 E 2 を変形すると
E 2 − 2 E × R R o b s + R R o b s = 0 E^2 - 2 E \times RR_{obs} + RR_{obs} = 0 E 2 − 2 E × R R o b s + R R o b s = 0 という二次方程式に整理できる。
二次方程式 x 2 + b x + c = 0 x^2+b x+c=0 x 2 + b x + c = 0 の解の公式 x = − b ± b 2 − 4 c 2 x=\frac{-b \pm \sqrt{b^2-4 c}}{2} x = 2 − b ± b 2 − 4 c に対して b = − 2 R R o b s , c = R R o b s b=-2 RR_{obs}, c = RR_{obs} b = − 2 R R o b s , c = R R o b s とすると
E = 2 R R o b s ± 4 R R o b s 2 − 4 R R o b s 2 = 2 R R o b s ± 2 R R o b s 2 − R R o b s 2 = R R o b s ± R R o b s ( R R o b s − 1 ) \begin{aligned}
E &= \frac{ 2 RR_{obs} \pm \sqrt{ 4 RR_{obs}^2 - 4 RR_{obs}}}{2}\\
&= \frac{ 2 RR_{obs} \pm 2 \sqrt{ RR_{obs}^2 - RR_{obs}}}{2} \\
&= RR_{obs} \pm \sqrt{ RR_{obs} (RR_{obs} - 1)}
\end{aligned} E = 2 2 R R o b s ± 4 R R o b s 2 − 4 R R o b s = 2 2 R R o b s ± 2 R R o b s 2 − R R o b s = R R o b s ± R R o b s ( R R o b s − 1 ) R R o b s RR_{obs} R R o b s が正の場合に限定すれば
E = R R o b s + R R o b s ( R R o b s − 1 ) E = RR_{obs} + \sqrt{ RR_{obs} (RR_{obs} - 1)} E = R R o b s + R R o b s ( R R o b s − 1 ) 参考文献
Ding, P., & VanderWeele, T. J. (2016). Sensitivity analysis without assumptions. Epidemiology, 27(3), 368-377.
VanderWeele, T. J., & Ding, P. (2017). Sensitivity analysis in observational research: introducing the E-value. Annals of internal medicine, 167(4), 268-274.
VanderWeele, T. J., Ding, P., & Mathur, M. (2019). Technical considerations in the use of the E-value. Journal of Causal Inference, 7(2), 20180007.
VanderWeele, T. J., Ding, P., & Mathur, M. (2019). Technical Considerations in the Use of the E-Value. Journal of Causal Inference , 7 (2). 10.1515/jci-2018-0007