30秒概要
7個の情報群を1つずつ外したところ、7個すべてで総合LogLossが悪化しました。過去走情報は2021〜2024年の4年すべてで悪化しています。
なぜ必要か
全部入りモデルだけでは、どの種類の情報が予測に意味を持つか切り分けられないためです。
今回の変化
情報群を丸ごと残すか捨てるかを、固定4年検証で判断できる状態になりました。
現在地
現時点ではFamily単位の検証まで完了し、次は114個の特徴量を個別に検証する段階です。
具体例
具体例として、7個の情報群のうち過去走情報は4年すべてで、外すと予測精度が悪化しました。
「競馬AIは、本当に使える情報を全部入れれば強くなるのか?」
今回はこの疑問を、2021〜2024年の固定4分割検証で確かめました。
やったことは単純です。AIに使っている情報を大きく7つのグループに分け、**1グループずつ外したときに予測精度がどう変わるか**を比較しました。
結論
今回の検証では、**7つの情報群すべてで、外したときに総合予測指標(LogLoss)が悪化**しました。
つまり少なくとも「このグループは丸ごと要らない」と判断できるものはありませんでした。
中でも今回、最も大きな差が出たのは**過去走に関する情報**です。2021〜2024年の4年すべてで、これを外すと予測精度が悪化しました。
また、**騎手・調教師などの人的情報**、**血統に関する情報**も4年すべてでプラス方向でした。
一方で、**ラップ・ペース系の情報**は少し違いました。4年のうち3年では外すと悪化しましたが、1年では外したほうがわずかに良くなりました。現時点では「効果はあるが、小さくて安定性をさらに確認したい情報」と見ています。
ここで大事なこと
この結果だけを見て、「全部の特徴量を残せばいい」とは判断しません。
情報のグループ全体には価値があっても、その中には重複している情報や、ほとんど効いていない情報が混ざっている可能性があります。
そこで次は、現在の候補114個を**1個ずつ外す検証**に進みます。
「過去走が大事」という大きな話から、次は「過去走の中でも何が本当に必要なのか」まで細かく分解していきます。
今回の検証で分かったこと
- 7つの情報群は、今回の4年検証ではすべて予測にプラス方向
- 特に過去走情報の寄与が大きかった
- 騎手・調教師などの人的情報も4年一貫して寄与
- 血統情報も4年一貫して寄与
- ラップ・ペースは寄与が小さく、年による揺れがあった
- まだ「最終モデル完成」ではなく、次は個別特徴量を選別する段階
まだ言えないこと
この検証は**予測精度**を見たものです。
したがって、現時点で「このAIで馬券の回収率が100%を超える」とは言えません。回収率は今後、予測モデルを固めたあとに市場オッズとのズレ、買い方、見送り条件まで含めて別に検証する必要があります。
研究を完成させてから全部まとめて公開するのではなく、今後はこうした「読者に意味がある検証結果」が出た段階で、公開できる範囲を切り出して共有していきます。
次は、**114個の特徴量を1つずつ外して、本当に必要な情報を絞る検証**です。