開発ログ

新しいCanonical DBだけで候補生成の基準を作り直す

30秒で分かる今回の成果

新しいCanonical DBを実測し、次のCandidateモデルに使う入力候補を固定しました。

  • 15テーブル
  • 106カラム
  • 延べ4,541,067行
  • 初期候補特徴量 17
  • 除外特徴量 89
  • 候補特徴量を持つテーブル 9
  • ID系除外 2
  • 結果・リーク系除外 6
  • 非数値除外 58

何をしたのか

Canonical DB全体を棚卸しし、数値型かつID・結果・事後情報ではない項目を初期候補として抽出しました。

目的は、後続Candidateごとに入力条件が変わり、比較できなくなることを防ぐことです。

現在できること

Canonical DBから同じルールで候補特徴量を抽出し、その集合を次のCandidate生成のBaselineとして参照できます。

今回固定した初期候補は17特徴量です。

まだ分からないこと

この17特徴量で回収率や精度が良くなったとは、まだ確認していません。

今回は予測結果を評価する前に、比較可能な入力Baselineを作った工程です。

次の検証

次はCandidate 002で、このBaselineを使った実経済評価へ進みます。

未使用Holdoutで予測結果・回収率・リスクを確認し、次へ進めるかを判定します。

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。