30秒で分かる今回の進捗
Baselineモデルとして正則化ロジスティック回帰を採用し、学習目的を Binary Log Loss に固定しました。
狙いは、最初から複雑なモデルで性能を追うことではありません。今後、特徴量やモデルを変更したとき、その差分を同じ基準から比較できるBaselineを先に作ることです。
複雑なモデルは後続の比較段階へ回し、Final Holdoutはモデル選択に使わない方針も固定しました。
何を決めたか
今回、Baselineモデル系列として正則化ロジスティック回帰を選択しました。
また、学習目的は確率品質を扱う Binary Log Loss としました。
この段階では、Final Holdoutや後段の意思決定指標をモデル選択の目的には使いません。
なぜ必要か
最初から複雑なモデルを使うと、後で結果が変わっても、その原因が特徴量なのかモデル複雑化なのかを切り分けにくくなります。
そこで、まずシンプルなBaselineを固定し、後続工程の変更差分を同じ基準から評価できるようにしました。
時系列分割の役割
Train、Validation、Development Test、Calibration、Final Holdoutの役割も固定しました。
Final Holdoutはモデル選択から外し、開発中の判断材料として使わない方針です。
現在の状態
Baselineモデル系列、学習目的、複雑化を後段へ回す方針、時系列分割の利用境界が正式成果物として固定されています。
この工程では、モデル精度・収益・市場優位性はまだ主張しません。
次は、Baseline特徴量の変換・前処理を実装します。