開発ログ

既存特徴量と派生データを監査する

30秒でわかる概要

今回なにをした?

旧競馬AIの特徴量・派生データ54件をすべて監査しました。

結果は、再利用16件、作り直し8件、再検証20件、廃止3件、使用禁止7件。未解決は0件です。

なぜ必要?

旧AIで使っていたという理由だけで特徴量を引き継ぐと、派生ロジックの根拠不足、データ粒度の不一致、予測時点の情報境界が曖昧なまま新モデルへ持ち込む危険があります。

何が変わった?

54件すべてについて「残す・作り直す・再検証する・廃止する・禁止する」を明示し、判断理由まで追える状態にしました。

現在の状態

監査対象54件は全件判定済み、全件確認済み、未解決0件です。

詳細

Evidence Record

今回確定したこと

定義した境界・成果

  • 監査対象54件を全件確認しました。
  • REUSE 16件
  • REBUILD 8件
  • REVALIDATE 20件
  • RETIRE 3件
  • PROHIBITED 7件
  • 未解決0件

代表例として、race.distance、race.surface、horse_history.distance などは再利用候補です。

一方、distance_fit_score、market_gap_score、prev_pace_score などの旧派生スコアは作り直し・再検証対象としました。

analysis_horse_pair.* や normalization_source_lineage.recorded_at などは、今回の予測単位やモデル入力の目的に合わないため使用禁止側へ分類しています。

許可されること / できること

  • 各特徴量の元データと今後の扱いを追跡できます。
  • 後続工程は「昔使っていたから」という理由だけで旧特徴量を再利用しません。
  • 作り直し・再検証対象を明示した状態で次の予測システム設計へ進めます。

安全境界・防止策

禁止されること / 防止策

  • 根拠を確認できない旧派生値を自動的に新モデルへ持ち込まない。
  • 馬単位予測に粒度の異なるpair特徴量を混在させない。
  • データ管理用メタデータを予測Featureとして扱わない。

実装・契約根拠

  • Task Substance Evidenceに54件全件の分類結果と根拠を保存しています。

検証結果

  • 監査対象:54件
  • 判定済み:54件
  • 全件確認:PASS
  • 未解決:0件
  • Task Substance Evidence Gate:PASS

未達・対象外

  • 今回の監査だけでモデル評価・予測モデルの評価・実運用評価が改善したとは主張しません。
  • REBUILD / REVALIDATE の特徴量は後続検証で再評価します。
  • 新モデルの最終特徴量セットはまだ確定していません。

次工程

次は、特徴量やデータが「予測した瞬間に本当に利用可能だったか」を監査し、未来情報混入を防ぐ境界を確認します。

Evidence Stage

TASK_COMPLETE_VALIDATED

内部管理情報

Task ID: RF_DEV_103_LEGACY_FEATURE_AND_DERIVED_DATA_AUDIT_V1

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。