開発ログ

生データの実体・由来・利用可能性を監査する

30秒でわかる概要

今回なにをした?

競馬AIの既存データ基盤を監査し、実際に利用できる生データの範囲、由来、時刻情報、再利用条件を確認しました。

何がわかった?

データソース、取得時刻、証跡、hash、履歴保全などの契約は存在します。一方で、Real Connectorは確認できず、real-data ingestionも認証済みではありませんでした。

さらに、既存の取り込み記録は正式なRaw Evidence契約に対して不足項目が残っています。

何が変わった?

「既存資産がある」ことを、そのまま「新しい予測ライフサイクルで安全に使える」と扱わない境界を固定しました。監査結果はEvidence化され、後続工程から同じ根拠を参照できます。

現在の状態

RF_DEV_102の監査Evidenceは完了しています。ただし、実データ取得基盤そのものを完成・認証した工程ではありません。

監査で確認した主な事実

登録済みのデータソースは契約レベルで複数種類存在し、acquired_at、decision-time availability、payload hash、correction policyなどが定義されています。

既存のsource ingest実装では、payload保存とともに source_id、acquired_at、source_locator、snapshot ID、payload hashなどを記録できます。

一方、正式なRaw Evidence契約と照合すると、現在の取り込み記録だけでは次の項目が不足しています。

  • evidence_id
  • observed_at
  • payload_format
  • payload_sha256
  • source_entity
  • source_record_id
  • source_version

また、監査時点でReal Connectorは確認できず、real-data ingestionも認証済みではありませんでした。

この監査が必要な理由

予測に使う情報は、「存在する」だけでは不十分です。

レース前の意思決定に利用するには、いつ観測され、いつ取得され、どのsource/versionに由来し、その時点で本当に利用可能だったかを再現できる必要があります。

この境界が曖昧だと、将来情報の混入や再現不能なバックテストにつながります。

今回確定したこと

  • 既存のデータ契約と取り込み実装を同じ基準で照合できる
  • 観測されたRaw Factと、加工・派生値を混同しない監査境界を置ける
  • 現在の実装で不足しているRaw Evidence項目を明示できる
  • 実データ取得が未認証である状態を、完成扱いせず後続工程へ引き渡せる

安全境界

この工程では、実データ取り込み完成、予測精度改善、収益性向上を主張しません。

Evidenceに存在しない性能・収益・精度は公開内容へ追加しません。

次工程

次はRF_DEV_103で、既存特徴量と派生データを監査します。

生データの境界を基準に、どの特徴量が再現可能か、どれが古い・曖昧・不適切かを整理し、新しい予測ライフサイクルへ残す資産を選別します。

Evidence Stage: TASK_COMPLETE_VALIDATED

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。