30秒で分かる今回の結果
血統に関する5候補を、同じBaseline・同じ評価条件で比較しました。
最も良かったのは PEDIGREE_COMBINED_V1 です。
ValidationのBinary Log LossはBaseline比で0.0045706608改善し、候補選択には使っていないDevelopment Testでも0.0014717395改善しました。
Development Testでの再確認はPASS、最終判定はPROMOTEです。Final Holdoutは候補選定に使用していません。
何を確認したのか
競馬では血統が重要な予想材料として扱われます。
しかし、人間にとって重要に見える情報が、そのまま既存モデルへ追加価値を持つとは限りません。
そこで今回は、血統に関する5候補を同じ条件で比較し、既存Baselineに対して予測損失を改善するかを確認しました。
結果
5候補をValidationで比較した結果、PEDIGREE_COMBINED_V1 が選定されました。
- Validation:Baseline比0.0045706608改善
- Development Test:Baseline比0.0014717395改善
- Development Test再確認:PASS
- 最終判定:PROMOTE
単独の血統候補ではなく、血統情報を組み合わせた候補が最良でした。
なぜ別のDevelopment Testでも確認するのか
特徴量探索では、候補を選んだ区間だけで良く見えることがあります。
そのため、Validationで候補を選んだ後、候補選択には使っていないDevelopment Testで改善方向を再確認しました。
今回、その再確認でも改善方向が残りました。
Final Holdoutは候補選定に使わない
Final Holdoutは今回も候補選定には使用していません。
Validationで選定し、Development Testで再確認するところまでで特徴量候補を評価しています。
Final Holdoutを探索段階から隔離することで、結果を見ながら候補を調整することを避けています。
今回の限界
今回確認したのは予測損失指標での特徴量価値です。
回収率や実運用収益の改善を直接確認したものではありません。
そのため、PROMOTEは「特徴量候補として次へ進める価値が確認できた」という判定です。
次の検証
次は、欠損そのものを表す特徴量の価値を検証します。
データが欠けているという状態自体が、予測に追加情報を持つのかを、同じBaseline・同じ評価条件で確認します。