30秒で分かる結果
過去のタイム・スピード情報を4種類の特徴量として、既存の勝率予測Baselineへ個別に追加して比較しました。
最終的に選択したのは**過去走の距離補正スピード平均**です。
ValidationのBinary Log LossはBaseline比で **0.0018639069改善**し、選択には使っていないDevelopment Testでも **0.0016232923改善**しました。
一方、直近3走だけに絞った距離補正スピードはValidationではわずかに改善方向を示したものの、Development Testでは悪化しました。
「最近速かった馬」を単純に重視するより、過去走を広く使った距離補正スピードの方が、今回の条件では安定した追加価値を示しました。
詳細
今回確定したこと
比較した候補は4種類です。
- 過去走破タイム平均
- 過去の距離補正スピード平均
- 直近3走の距離補正スピード平均
- 直近3走のベスト距離補正スピード
同じBaseline、同じデータ分割、同じ評価契約で比較し、Validationで候補を選択しました。
選択候補は**過去の距離補正スピード平均**です。
検証結果
選択候補はValidationでBinary Log Lossを **0.0018639069改善**しました。
その後、候補選択には使用していないDevelopment Testでも **0.0016232923改善**し、改善方向を再確認しました。
Final Holdoutは候補選定には使用していません。
興味深かった不採用結果
直近3走の距離補正スピードは、Validationではわずかに改善方向を示しましたが、Development Testでは悪化しました。
また、直近3走の中で最も良かった距離補正スピードを使う候補も採用されませんでした。
この結果から、競馬的にもっともらしい「最近の速さを重視する」という仮説でも、別期間で再確認しなければ安定した特徴量とは判断できないことが分かります。
今回の意味
今回確認できたのは、タイム情報をただ追加することではなく、**過去走の距離差をならして比較可能なスピード情報へ変換することに増分価値があった**という点です。
一方で、最近のレースだけへ絞ればさらに良くなる、という結果にはなりませんでした。
安全境界・防止策
- 候補は共通Baseline・共通分割で比較
- Validationで候補を選択
- Development Testは選択後の再確認に使用
- Final Holdoutは候補選定に使用しない
- 不採用候補も結果として保存
- 予測対象レースより前に利用可能な過去走情報だけを特徴量化
未達・対象外
今回の結果だけでは、馬券収益の改善や本番運用での継続的な優位性までは主張できません。
また、今回の距離補正スピードは、馬場差・展開・ペース・斤量・レースレベルなどをすべて補正した完成形のスピード指数ではありません。
今回確認したのは、既存勝率予測モデルに対するタイム・スピード特徴量の増分価値です。
次工程
次はペース・脚質特徴量を検証します。
タイムが「どの程度速く走ったか」を表すのに対し、ペース・脚質は「どう走ったか」を表します。
逃げ・先行・差し・追込やレースペースの情報が、今回選択したスピード情報とは別の増分価値を持つかを確認します。
Evidence Stage
TASK_COMPLETE_VALIDATED
内部管理情報
Task: RF_DEV_122_05_TIME_SPEED_FEATURE_EXPERIMENT_V1 Selected Candidate: PRIOR_DISTANCE_NORMALIZED_SPEED_V1 Selection Partition: VALIDATION Confirmation Partition: DEVELOPMENT_TEST Final Holdout Used For Selection: false Database Access: READ_ONLY Database Write: NO Production Mutation: NO