今回の成果
これまでに構築した新Canonical DBへ、新しく増えるレース、訂正、レース後の結果・払戻を継続的に反映できるライフサイクルを実装しました。
毎回データベース全体を作り直すのではなく、既存のCanonical供給経路を利用して更新できる構造です。
旧来のkeiba.dbは元データとして保持し、書き込みはCanonical DB側だけに限定しています。
何が変わったのか
以前は、過去データをCanonical DBへ移すところまでが中心でした。
今回からは、新規レースの追加、訂正の再処理、レース後の結果反映、払戻の反映までを、継続運用できるデータライフサイクルとして扱えるようになりました。
なぜ必要なのか
競馬データは一度作って終わりではありません。
新しいレースが増え、レース前とレース後では利用可能な情報も変化します。
特徴量研究を再現可能にするには、データの追加・訂正・結果反映を同じルールで管理する必要があります。
今回、その継続更新経路をCanonical DB側に固定しました。
検証結果
正式なImplementation Orchestratorを通過し、Task Substance EvidenceもPASSしています。
旧keiba.dbの直接変更は行わず、Canonical DB側だけを更新対象とする境界も維持しています。
現在の位置
この工程では、モデル精度や収益性の改善は主張しません。
今回確定したのは、特徴量研究を継続するためのデータ更新基盤です。
次はCanonical DBの全テーブル・全カラムを棚卸しし、現在どの特徴量材料が利用可能なのか、不足しているものは何かを可視化します。