今回の成果
今回の特徴量研究に向けて、keiba.dbを単なるデータ置き場ではなく、特徴量供給元として整理しました。
既存データから作れる特徴量候補だけでなく、不足領域、前日夜時点で利用可否が不明な情報、結果ラベルとして分離すべき項目、JOIN候補とcardinalityリスク、Canonical / Feature Store / Labelの配置方針まで分類しています。
今回の工程で強い特徴量を見つけたわけではありません。成果は、今後の特徴量研究を安全に進めるための「データ供給地図」を作ったことです。
何が変わったか
これまでは、keiba.dbに情報が存在していても、それを特徴量としてどう扱うべきかが後続工程から同じ基準で参照できる形には固定されていませんでした。
今回、スキーマ供給元の対応、特徴量候補と不足の分類、PIT安全性、結果ラベル分離、JOINリスク、配置方針を正式成果物として参照できる状態にしました。
特に重要な安全策
前日夜の基準時点で利用可能か不明な情報はFail Closedとし、曖昧なまま特徴量へ入れません。
また、レース後に確定する結果ラベルは特徴量入力と分離して扱います。
これにより、過去検証では強く見えても本番では使えない未来情報が混ざるリスクを後続工程で追えるようにしました。
足りない特徴量も逆向きに分類
今回の棚卸しは、DBに「何があるか」だけを見るものではありません。
欲しい特徴量側から逆算し、既存データで候補がある領域と、追加加工や追加供給が必要になり得る領域を分けました。
今後はこの分類を起点に、必要な特徴量をどこから作るか、何が不足しているかを判断できます。
JOINリスクも対象
複数テーブルを結合できることと、安全に結合できることは別です。
JOIN候補とcardinalityリスクを棚卸しし、重複、行数増加、履歴条件、時点条件を後続工程で検証できるようにしました。
現在の状態
正式確認対象はすべて判定済みで、未解決はありません。
次は、過去データの深さ・時代差・品質を監査します。
この工程では性能、収益、精度について新たな成果は主張しません。