30秒で分かる今回の成果
新しいCanonical DBを実測し、次のCandidateモデルに使う入力候補を固定しました。
- 15テーブル
- 106カラム
- 延べ4,541,067行
- 初期候補特徴量 17
- 除外特徴量 89
- 候補特徴量を持つテーブル 9
- ID系除外 2
- 結果・リーク系除外 6
- 非数値除外 58
何をしたのか
Canonical DB全体を棚卸しし、数値型かつID・結果・事後情報ではない項目を初期候補として抽出しました。
目的は、後続Candidateごとに入力条件が変わり、比較できなくなることを防ぐことです。
現在できること
Canonical DBから同じルールで候補特徴量を抽出し、その集合を次のCandidate生成のBaselineとして参照できます。
今回固定した初期候補は17特徴量です。
まだ分からないこと
この17特徴量で回収率や精度が良くなったとは、まだ確認していません。
今回は予測結果を評価する前に、比較可能な入力Baselineを作った工程です。
次の検証
次はCandidate 002で、このBaselineを使った実経済評価へ進みます。
未使用Holdoutで予測結果・回収率・リスクを確認し、次へ進めるかを判定します。