Causal TreeはCATE推定に使えるよう改良された決定木。
ただし、観察研究データに使用するためには選択バイアスを除去する必要があり、Atheyらによって傾向スコアを用いた改良手法Causal Tree-Transformed Outcome(CT-TO)が提案されている
前提 / Notation¶
Potential outcome framework
Ya=1,Ya=0∈R :潜在結果変数
Xj: p次元の pre-treatment 共変量( j=1:p )
A={0,1} :処置変数
π(x)=Pr(A=1∣X=x) :傾向スコア
Assumptions
Consistency: Y=AYa=1+(1−A)Ya=0
Unconfoundedness: A⊥Ya∣X for a=0,1
Posititvity: 0<π(x)<1
Definitions
Average Treatment Effect (ATE): θATE=E[Ya=1−Ya=0]
Heterogeneous Treatment Effect (HTE): θHTE(x)=E[Ya=1−Ya=0∣X=x]
Honest¶
Causal Treesはrecursive partitioningを用いてHeterogeneous Treatment Effectを推定する手法。
honest性という概念がcausal forestsやGeneralized Random Forestの証明において重要な役割を果たす。
またhonest性を満たすTreeはCARTと比較して過学習を起こしにくいという性質もある。
honest
「木の分割(partitioning)をするために用いるサンプル」と「TreeのLeafごとの推定量の計算に用いるサンプル」に別々のサンプルを用いることで、partition Π と 推定量μ^ が独立になったTree を honest なTreeであるという
honestな木はCARTと異なる目的関数をもつ¶
honestな木はpartition Πのもとで estimation sample Sest を用いて推定された条件付き平均μ^(Xi;Sest,Π)とテストデータSteの平均二乗誤差
MSE(Ste,Sest,Π)=#(Ste)1i∈Ste∑{(Yi−μ^(Xi;Sest,Π))2−Yi2} の期待値をとったものを最小化する。
Πhonest=argΠminESte,Sest,Str[MSE(Ste,Sest,Π(Str)] 一方で一般的なCARTでは、訓練サンプル Ste を使ってpartition Πと推定量μ^を作って誤差を最小化する
ΠCART=argΠminESte,Str[MSE(Ste,Str,Π(Str)] honestな木は過学習しにくい¶
MSEの期待値を取ったものをEMSE
EMSE(Π):=ESte,Sest [MSE(Ste,Sest ,Π)] とする。honestな木はこれを目的関数とする。
負のEMSEを展開すると
−EMSE(Π)=−E(Yi,Xj),Sest[(Yi−μ(Xi;Π)2−Yi]−EXi,Sest [(μ^(Xi;Sest ;Π)−μ(Xi;Π))2]=EXi[μ2(Xi;Π)]−ESest ,Xi[Var(μ^(Xi;Sest ;Π))] となる。
これに対して訓練サンプルStrから不偏推定量を構成すると
EMSE(Str,Π)=Ntr1i∈Str∑μ^2(Xi;Str,Π)−penaltyNtr2⋅ℓ∈Π∑SStr2(ℓ) となる。ここでSStr2(ℓ)はℓ∈Πにおけるleaf内分散を意味する。
一方で、CARTにおいてはpenalty項がなく、分割を行えば行うほど−MSEが改善するため、枝刈りが必要になる。
−MSE(Str,Str,Π)=Ntr1i∈Str∑μ^2(Xi;Str,Π) leaf内分散はleaf内のサンプル数が多いうちは小さい(=CARTとhonest treeは似た挙動になる)が、leaf内サンプルが小さくなると高くなりやすい(分割を停止する方向に動く)。
HTEの推定¶
問題:データ (Yi,Xi,Wi)∈R×Rρ×{0,1} が観測されたもとで、 θHTE(x)=E[Ya=1−Ya=0∣X=x] を推定する問題
τ(x;Π)≡E[Ya=1−Ya=0∣X∈ℓ(x;Π)] μ(a,x;Π)≡E[Ya∣X∈ℓ(x;Π)]