開発ログ

Baseline単勝勝率モデルを学習する

30秒で分かる今回の進捗

競馬AIが、前処理済みの特徴量から各馬の単勝勝率を出すBaselineモデルを学習できる段階まで進みました。

モデル系列は正則化ロジスティック回帰、学習目的はBinary Log Lossです。 正則化の強さはValidationだけで選び、Final Holdoutはモデル選択に使いません。

予測値はレース単位で再正規化し、そのレースの出走馬全体で一貫した勝率として扱えるようにしました。

何を実装したか

前工程で固定したモデル方針を、実際に学習処理として使える形にしました。

主な実装内容は次の通りです。

  • 正則化ロジスティック回帰による学習処理
  • Binary Log Lossを学習目的として固定
  • Validationだけを使ったモデル選択
  • Final Holdoutをモデル選択から除外
  • レース単位での予測確率の再正規化
  • 同じ条件から同じモデル状態を再現する契約

なぜこの境界が必要か

学習処理と評価境界が曖昧だと、後から比較するときに「どの情報でモデルを選んだのか」が分からなくなります。

そこで今回は、モデル選択に使える範囲をValidationまでに限定し、Final Holdoutを選択から切り離しました。

また、馬単位の出力をレース単位で扱える勝率へ揃えるため、レースごとの再正規化も実装しています。

現在の状態

6項目を確認し、6項目すべてを判定、未解決は0件です。

この工程で確定したのは学習処理とその境界です。 予測結果の優劣については、この工程のEvidence範囲では主張しません。

次は、出力された予測勝率を確率校正する工程へ進みます。

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。