**概要:** 競馬AIの特徴量探索を始める前に、研究のルールを先に固定しました。前日夜を基準時点とし、keiba.dbを現段階のデータ供給元に設定。過去データの深さ比較、新規レースの継続追加、特徴量の評価順序、最終Holdoutの封印までを同じ研究設計の中に組み込みました。
何を固定したのか
Phase 14では、特徴量を自由に増やす前に、どの条件で比較し、どの順番で検証し、何を採用・棄却するかを先に定義しました。
- 情報利用の基準時点を前日夜に統一
- 現段階のデータ供給元をkeiba.dbに固定
- 過去データの補完、新規レース追加、訂正、結果反映の供給ライフサイクルを固定
- 比較的新しい期間と、より古い期間まで含めた場合のデータ深度差を比較対象化
- 特徴量ファミリー、組み合わせ、アブレーション、Baseline比較、採用・棄却の評価順序を固定
- 最終Holdoutは探索中に使用しない
なぜ必要なのか
特徴量探索は自由度が高く、学習期間・特徴量・組み合わせ・評価方法を結果を見ながら変更すると、偶然良かった構成を、本当に有効な変化だと誤認する余地が増えます。
そのため今回は、強い特徴量を探す前に「どう探すか」を正式な研究OSとして固定しました。
現在の状態
研究OS、前日夜の基準時点、keiba.dbを中心とするデータ供給ライフサイクル、過去データ深度比較、特徴量評価とHoldoutの扱い、後続タスク順序までが正式に固定されています。
確認対象はすべて判定済みで、未解決事項はありません。
次の工程
次は、keiba.dbのデータ供給元と特徴量利用候補を棚卸しします。その後、データ補完、新規レースの継続追加、Point-in-Time安全性、特徴量版管理、学習期間比較、特徴量ファミリー検証、組み合わせ・アブレーション、運用再現性へ進みます。
制約
この工程では、性能・収益・精度について新たな成果は主張しません。今回確認したのは、特徴量研究を再現可能な条件で進めるための研究設計が固定されたことです。