Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

Differential Item Functioning (DIF)

概要

Differential Item Functioning(DIF: 特異項目機能) とは、同じ能力を持つ異なる集団の受験者が、特定のテスト項目に対して異なる正答確率を示す現象である。

例えば、同じ数学的能力を持つ男女が、ある文章題に対して異なる正答率を示す場合、その項目にはDIFが存在する可能性がある。これは項目の内容が一方の集団に有利に働いていることを示唆し、テストの公平性(fairness)に関わる重要な問題である。

DIF分析では通常、比較対象となる2つの集団を 参照群(reference group) と 焦点群(focal group) と呼ぶ。参照群は基準となる集団、焦点群はDIFの有無を検討したい集団を指す。

IRTにおける定式化

2PLM(2パラメータロジスティックモデル)を考える。集団 gg に属する受験者 ii が項目 jj に正答する確率は

P(Yij=1∣θi,gi=g)=logit⁡−1(ajg(θi−bjg))P(Y_{ij}=1 \mid \theta_i, g_i=g) = \operatorname{logit}^{-1}\big(a_{jg}(\theta_i - b_{jg})\big)

と表せる。ここで

  • ajga_{jg}:集団 gg における項目 jj の識別力(discrimination)

  • bjgb_{jg}:集団 gg における項目 jj の困難度(difficulty)

DIFが存在しない項目では、これらのパラメータは集団によらず一定である(aj1=aj2=⋯=aja_{j1}=a_{j2}=\cdots=a_j、bj1=bj2=⋯=bjb_{j1}=b_{j2}=\cdots=b_j)。DIFはこの等質性のいずれか、あるいは両方が崩れる現象として定式化される。

DIFの種類

DIFは、集団間の差が能力レベルに依存するかどうかによって、Uniform DIF(均一DIF)とNon-uniform DIF(非均一DIF)の2種類に分けられる。

Uniform DIF(均一DIF)

能力レベルによらず、一方の集団が常に有利(または不利)である場合をUniform DIFという。識別力 aja_j は集団間で等しいまま、困難度 bjb_j のみが集団間で一定量シフトする。

aj1=aj2=aj,bj2=bj1+δja_{j1} = a_{j2} = a_j, \qquad b_{j2} = b_{j1} + \delta_j

δj\delta_j は焦点群(集団2)における困難度の、参照群(集団1)からのシフト量である。

ICC(Item Characteristic Curve, 項目特性曲線)上では、Uniform DIFは次のように現れる。

  • 2つの集団のICCは傾きが同じ

  • ICCは δj\delta_j の分だけ水平方向に平行移動する

  • したがって、能力水準 θ\theta によらず**一方の集団が一貫して有利(または不利)**になる

Non-uniform DIF(非均一DIF)

集団間の差が能力レベルによって変化する場合をNon-uniform DIFという。低能力層では参照群が有利だが高能力層では焦点群が有利になる、といった逆転が起こりうる。IRTでは識別力パラメータが集団間で異なることに対応する。

aj1≠aj2a_{j1} \neq a_{j2}

ICC上では傾きが集団間で異なるため、2本のICCが交差する(crossing ICC)。DIFの大きさと方向が θ\theta に依存する点がUniform DIFとの違いである。

階層ベイズによる定式化

比較する集団の数が多い場合(例えば都道府県や学校など)、集団ごとの困難度シフトを固定効果として個別に推定すると過学習しやすい。この場合、シフト量に階層事前分布を置いて部分プーリングする定式化が有用である。

bj,g=bjbase+δj,g,δj,g∼N(0,σj2)b_{j,g} = b_j^{\text{base}} + \delta_{j,g}, \qquad \delta_{j,g} \sim \mathcal{N}(0, \sigma_j^2)

bjbaseb_j^{\text{base}} は項目 jj のベースライン困難度、δj,g\delta_{j,g} は集団 gg 固有のずれである。集団ごとのサンプルサイズが小さくても安定した推定が得られやすいという利点があり、Uniform DIF(ICCの平行移動のみを許容するモデル)の階層ベイズ版とみなせる。

多値項目への拡張

ここまでは二値項目(正誤)を前提とする2PLMで説明してきたが、GPCM(Generalized Partial Credit Model)やGRM(Graded Response Model)のような多値項目向けのIRTモデルにもDIFの考え方は拡張できる。この場合、困難度パラメータ bjb_j の代わりに、各カテゴリの閾値パラメータ bjkb_{jk}(kkはカテゴリ)が集団間でシフトするかどうかを検討する。

bjk,g=bjk+δjk,gb_{jk,g} = b_{jk} + \delta_{jk,g}

全閾値が同じ量だけシフトする場合がUniform DIFに、閾値ごとにシフト量や識別力が異なる場合がNon-uniform DIFに対応する。

DIF検出手法

実際のデータからDIFを検出するための代表的な手法を紹介する。いずれも、能力を揃えたときに参照群と焦点群の間で正答率(または項目パラメータ)に差があるかどうかを検定する点で共通する。

Mantel-Haenszel法

最も広く使用されているDIF検出手法の一つ。能力の代理指標として総得点を用い、各得点層で2×2の分割表を作成し、集団間の正答オッズ比を検定する。

Mantel-Haenszel統計量:

χMH2=[∣∑k(Ak−E(Ak))∣−0.5]2∑kVar(Ak)\chi^2_{MH} = \frac{\left[ \left| \sum_k (A_k - E(A_k)) \right| - 0.5 \right]^2}{\sum_k \text{Var}(A_k)}

ここで AkA_k は得点層 kk における参照群の正答者数、E(Ak)E(A_k) はその期待値。

共通オッズ比の推定値:

α^MH=∑kAkDk/Nk∑kBkCk/Nk\hat{\alpha}_{MH} = \frac{\sum_k A_k D_k / N_k}{\sum_k B_k C_k / N_k}

ETSでは、この対数を変換したDelta尺度(MH D-DIF)がよく使われる:

MH D-DIF=−2.35ln⁡(α^MH)\text{MH D-DIF} = -2.35 \ln(\hat{\alpha}_{MH})

ロジスティック回帰法

項目への正答を目的変数、能力(総得点)と集団を説明変数とするロジスティック回帰を用いる方法。

log⁡(P(Y=1)1−P(Y=1))=β0+β1θ+β2G+β3(θ×G)\log \left( \frac{P(Y=1)}{1-P(Y=1)} \right) = \beta_0 + \beta_1 \theta + \beta_2 G + \beta_3 (\theta \times G)
  • θ\theta: 能力(または総得点)

  • GG: 集団を示すダミー変数

  • β2≠0\beta_2 \neq 0: Uniform DIFの存在

  • β3≠0\beta_3 \neq 0: Non-uniform DIFの存在

この方法の利点は、Uniform DIFとNon-uniform DIFを同時に検出できることである。

IRT法

各集団で別々にIRTモデルを推定し、DIFがないと仮定される アンカー項目(anchor item) を用いて尺度を等化したのち、項目パラメータの差を検定する方法。

Lord’s χ2\chi^2 検定:

χ2=(ξ^R−ξ^F)′Σ^−1(ξ^R−ξ^F)\chi^2 = (\hat{\boldsymbol{\xi}}_R - \hat{\boldsymbol{\xi}}_F)' \hat{\boldsymbol{\Sigma}}^{-1} (\hat{\boldsymbol{\xi}}_R - \hat{\boldsymbol{\xi}}_F)

ここで ξ^\hat{\boldsymbol{\xi}} は項目パラメータのベクトル、Σ^\hat{\boldsymbol{\Sigma}} はその共分散行列の推定値。

SIBTEST

Shealy & Stout (1993) が開発した、多次元性に基づくDIF検出法。項目をアンカー項目(DIFがないと仮定)と検討項目に分け、条件付き期待得点の差を検定する。

Pythonでの実装

difNLR パッケージ(R)

Rには difR や difNLR など、DIF分析に特化したパッケージがある。

library(difNLR)

# Mantel-Haenszel法
difMH(Data, group, focal.name = 1)

# ロジスティック回帰法
difLogistic(Data, group, focal.name = 1, type = "both")

Pythonによる実装例

PythonでのDIF分析は、statsmodels を用いたロジスティック回帰や、scipy.stats を用いたMantel-Haenszel検定で実装できる。

シミュレーションデータによる検証

DIFの解釈と対処

DIFが検出された場合、以下のステップで対処する:

  1. 統計的有意性の確認: 多重比較の補正(Bonferroni補正など)を考慮

  2. 効果量の評価: MH D-DIFの絶対値が1.0以上で「中程度」、1.5以上で「大きい」とされる(ETS基準)

  3. 項目内容の精査: 専門家による項目レビューを実施し、DIFの原因を特定

  4. 対処の決定:

    • 項目の削除

    • 項目の修正

    • 集団別の項目パラメータを使用

    • DIFの影響を考慮したスコアリング

DIFを考慮したスコアリング

DIFが検出された場合、従来の単純な総得点(素点)は集団間の公平な比較を歪める可能性がある。ここでは、DIFの影響を適切に扱うスコアリング手法を紹介する。

アプローチ1: DIF項目の除外

最も単純な方法は、DIFが検出された項目を除外して得点を算出することである。

Xpurified=∑j∉DXjX_{\text{purified}} = \sum_{j \notin \mathcal{D}} X_j

ここで D\mathcal{D} はDIF項目の集合である。この方法は直感的で実装が容易だが、項目数が減ることでテストの信頼性・測定精度が低下するという欠点がある。

アプローチ2: 集団別IRTパラメータによるスコアリング

DIF項目については集団ごとに異なるパラメータを用い、非DIF項目については共通パラメータを用いて能力値を推定する方法である。2PLMの場合、受験者 ii が集団 gg に属するとき、各項目 jj の正答確率は:

Pj(θi∣g)=11+exp⁡(−aj(θi−bjg))P_j(\theta_i \mid g) = \frac{1}{1 + \exp(-a_j(\theta_i - b_{jg}))}
  • 非DIF項目: bjR=bjF=bjb_{jR} = b_{jF} = b_j(共通パラメータ)

  • DIF項目: bjR≠bjFb_{jR} \neq b_{jF}(集団固有パラメータ)

能力値の推定には、集団に応じた適切なパラメータセットを用いてMLE(最尤推定)やEAP(期待事後推定)を行う。

θ^MLE=arg⁡max⁡θ∑j=1J[xjlog⁡Pj(θ∣g)+(1−xj)log⁡(1−Pj(θ∣g))]\hat{\theta}_{\text{MLE}} = \arg\max_\theta \sum_{j=1}^{J} \left[ x_j \log P_j(\theta \mid g) + (1-x_j) \log (1-P_j(\theta \mid g)) \right]

この方法は全項目の情報を活用でき、DIFの影響を適切にモデル化できる。

アプローチ3: 期待得点調整

Dorans & Holland (1993) に基づく方法で、DIF項目について参照群のパラメータで期待される得点に置き換えることで、焦点群に対するDIFの影響を補正する。

焦点群の受験者 ii について、DIF項目 jj の調整済みスコアは:

Xij∗=Xij−Pj(θ^i∣F)+Pj(θ^i∣R)X_{ij}^{*} = X_{ij} - P_j(\hat{\theta}_i \mid F) + P_j(\hat{\theta}_i \mid R)

すなわち、焦点群パラメータでの期待得点と参照群パラメータでの期待得点の差だけ調整を加える。テスト全体の調整済み得点は:

Xi∗=∑j∉DXij+∑j∈DXij∗X_i^{*} = \sum_{j \notin \mathcal{D}} X_{ij} + \sum_{j \in \mathcal{D}} X_{ij}^{*}

この方法は項目を除外せずにDIFの影響のみを除去でき、かつ非DIF項目からの情報を保持できる。

アプローチ4: 多母集団IRTモデル

最も理論的に洗練されたアプローチは、多母集団(multiple-group)IRTモデルを用いて全集団のデータを同時に推定することである。

このモデルでは:

  • アンカー項目(非DIF項目):全集団で共通の項目パラメータを推定

  • DIF項目:集団ごとに固有の項目パラメータを推定

  • 能力分布:参照群を θR∼N(0,1)\theta_R \sim N(0, 1) に固定し、焦点群の能力分布 θF∼N(μF,σF2)\theta_F \sim N(\mu_F, \sigma_F^2) を推定

全集団のデータを同時に用いるため推定精度が高く、等化が不要で、DIFの有無に関わらずすべての項目を活用できる。

実装例: 各スコアリング手法の比較

先のシミュレーションデータを用いて、各スコアリング手法の効果を比較する。

手法の選択指針

手法利点欠点推奨場面
DIF項目除外実装が容易情報損失、信頼性低下DIF項目が少数の場合
集団別IRTパラメータ全項目の情報を活用等化が必要、推定が複雑IRTモデルが適合する場合
期待得点調整素点スケールで調整可能能力推定の精度に依存素点での報告が必要な場合
多母集団IRT理論的に最も適切実装が複雑、大標本が必要大規模テスト

実務的には、DIFが少数の項目にのみ見られ効果量が小さい場合には素点のままでも許容される場合がある。一方、DIFが多くの項目に見られるか効果量が大きい場合には、集団別IRTパラメータや多母集団IRTモデルの利用を検討すべきである。

参考文献

Holland, P. W., & Wainer, H. (Eds.). (1993). Differential item functioning. Lawrence Erlbaum Associates.

DIFに関する包括的な教科書

Magis, D., Béland, S., Tuerlinckx, F., & De Boeck, P. (2010). A general framework and an R package for the detection of dichotomous differential item functioning. Behavior Research Methods, 42(3), 847-862.

RのdifRパッケージの論文。DIF検出手法の比較も行っている

Swaminathan, H., & Rogers, H. J. (1990). Detecting differential item functioning using logistic regression procedures. Journal of Educational Measurement, 27(4), 361-370.

ロジスティック回帰法によるDIF検出の基礎論文

References
  1. Magis, D., Béland, S., Tuerlinckx, F., & De Boeck, P. (2010). A general framework and an R package for the detection of dichotomous differential item functioning. Behavior Research Methods, 42(3), 847–862. 10.3758/brm.42.3.847