開発ログ

Baseline特徴量の変換・前処理を実装する

Baseline特徴量の変換・前処理を固定しました。

今回の目的は、モデル学習の前に「特徴量の変換ルールが評価データを見ていない」状態を作ることです。

カテゴリ特徴量はTRAINだけを基準にone-hot化し、未知カテゴリは専用の受け皿へ送ります。 数値特徴量の標準化もTRAINだけから決めます。 Validation、Development Test、Calibration、Final Holdoutはfitに使いません。

また、想定外の欠損を黙って補完せず、fail-closedで止める方針を採用しました。 出力特徴量の順序も固定して、再現可能な前処理にしています。

この工程で確認したのは性能や収益ではなく、 Baseline特徴量を同じルールで安全に変換できることです。

次は、この前処理を使って単純BaselineとSanity Benchmarkを構築します。

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。