マローズのCp
From Wikipedia, the free encyclopedia
マローズのCpは、過剰適合の問題に対する方法である。一般にモデルの変数が増えれば増えるほど、残差平方和などのモデル適合度の指標は常に小さくなる。したがって、残差平方和が最小となるモデルを選択する場合、常にすべての変数を含むモデルが選択されてしまう。代わりに、データのサンプルで計算されたC p統計は、 母集団ターゲットとして平均二乗予測誤差 (MSPE)を推定する。
ただし、 は j 番目のケースのフィット値、E (Yj | Xj) は j 番目のケースの期待値であり、σ2は誤差分散(全ケース共通の定数とみなされる)である。変数が追加されても、MSPEは自動的に小さくなることはない。この基準での最適なモデルは、サンプルサイズ、さまざまな予測変数の効果量、および変数間の共線性の程度によって決まる。
P個の変数がK>PであるようなK個の変数から選択された場合、Cpは次のように定義される。
ただし、
その他の定義
次のような線形モデルがあるとする。
ただし、
- は予測変数の係数
- は誤差を表す
Cp以下のようにも定義される[4]。
ただし、
- RSSは、教師データセットの残差平方和
- dは予測変数の数
- は線形モデルの各応答に関連する分散の推定値を指す(すべての予測子を含むモデルで推定される)
この定義によるCpの値は、前掲の定義によるCpの値と等しくないが、いずれの定義においてもCpを最小にするようなモデルは同一である。