開発ログ

競馬AIは「情報を増やせば強くなる」のか? 4年分で7つの情報群を1つずつ外して検証した

30秒概要

7個の情報群を1つずつ外したところ、7個すべてで総合LogLossが悪化しました。過去走情報は2021〜2024年の4年すべてで悪化しています。

なぜ必要か

全部入りモデルだけでは、どの種類の情報が予測に意味を持つか切り分けられないためです。

今回の変化

情報群を丸ごと残すか捨てるかを、固定4年検証で判断できる状態になりました。

現在地

現時点ではFamily単位の検証まで完了し、次は114個の特徴量を個別に検証する段階です。

具体例

具体例として、7個の情報群のうち過去走情報は4年すべてで、外すと予測精度が悪化しました。

「競馬AIは、本当に使える情報を全部入れれば強くなるのか?」

今回はこの疑問を、2021〜2024年の固定4分割検証で確かめました。

やったことは単純です。AIに使っている情報を大きく7つのグループに分け、**1グループずつ外したときに予測精度がどう変わるか**を比較しました。

結論

今回の検証では、**7つの情報群すべてで、外したときに総合予測指標(LogLoss)が悪化**しました。

つまり少なくとも「このグループは丸ごと要らない」と判断できるものはありませんでした。

中でも今回、最も大きな差が出たのは**過去走に関する情報**です。2021〜2024年の4年すべてで、これを外すと予測精度が悪化しました。

また、**騎手・調教師などの人的情報**、**血統に関する情報**も4年すべてでプラス方向でした。

一方で、**ラップ・ペース系の情報**は少し違いました。4年のうち3年では外すと悪化しましたが、1年では外したほうがわずかに良くなりました。現時点では「効果はあるが、小さくて安定性をさらに確認したい情報」と見ています。

ここで大事なこと

この結果だけを見て、「全部の特徴量を残せばいい」とは判断しません。

情報のグループ全体には価値があっても、その中には重複している情報や、ほとんど効いていない情報が混ざっている可能性があります。

そこで次は、現在の候補114個を**1個ずつ外す検証**に進みます。

「過去走が大事」という大きな話から、次は「過去走の中でも何が本当に必要なのか」まで細かく分解していきます。

今回の検証で分かったこと

  • 7つの情報群は、今回の4年検証ではすべて予測にプラス方向
  • 特に過去走情報の寄与が大きかった
  • 騎手・調教師などの人的情報も4年一貫して寄与
  • 血統情報も4年一貫して寄与
  • ラップ・ペースは寄与が小さく、年による揺れがあった
  • まだ「最終モデル完成」ではなく、次は個別特徴量を選別する段階

まだ言えないこと

この検証は**予測精度**を見たものです。

したがって、現時点で「このAIで馬券の回収率が100%を超える」とは言えません。回収率は今後、予測モデルを固めたあとに市場オッズとのズレ、買い方、見送り条件まで含めて別に検証する必要があります。

研究を完成させてから全部まとめて公開するのではなく、今後はこうした「読者に意味がある検証結果」が出た段階で、公開できる範囲を切り出して共有していきます。

次は、**114個の特徴量を1つずつ外して、本当に必要な情報を絞る検証**です。

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。