30秒で分かる今回の進捗
競馬AIが、前処理済みの特徴量から各馬の単勝勝率を出すBaselineモデルを学習できる段階まで進みました。
モデル系列は正則化ロジスティック回帰、学習目的はBinary Log Lossです。 正則化の強さはValidationだけで選び、Final Holdoutはモデル選択に使いません。
予測値はレース単位で再正規化し、そのレースの出走馬全体で一貫した勝率として扱えるようにしました。
何を実装したか
前工程で固定したモデル方針を、実際に学習処理として使える形にしました。
主な実装内容は次の通りです。
- 正則化ロジスティック回帰による学習処理
- Binary Log Lossを学習目的として固定
- Validationだけを使ったモデル選択
- Final Holdoutをモデル選択から除外
- レース単位での予測確率の再正規化
- 同じ条件から同じモデル状態を再現する契約
なぜこの境界が必要か
学習処理と評価境界が曖昧だと、後から比較するときに「どの情報でモデルを選んだのか」が分からなくなります。
そこで今回は、モデル選択に使える範囲をValidationまでに限定し、Final Holdoutを選択から切り離しました。
また、馬単位の出力をレース単位で扱える勝率へ揃えるため、レースごとの再正規化も実装しています。
現在の状態
6項目を確認し、6項目すべてを判定、未解決は0件です。
この工程で確定したのは学習処理とその境界です。 予測結果の優劣については、この工程のEvidence範囲では主張しません。
次は、出力された予測勝率を確率校正する工程へ進みます。