Baseline特徴量の変換・前処理を固定しました。
今回の目的は、モデル学習の前に「特徴量の変換ルールが評価データを見ていない」状態を作ることです。
カテゴリ特徴量はTRAINだけを基準にone-hot化し、未知カテゴリは専用の受け皿へ送ります。 数値特徴量の標準化もTRAINだけから決めます。 Validation、Development Test、Calibration、Final Holdoutはfitに使いません。
また、想定外の欠損を黙って補完せず、fail-closedで止める方針を採用しました。 出力特徴量の順序も固定して、再現可能な前処理にしています。
この工程で確認したのは性能や収益ではなく、 Baseline特徴量を同じルールで安全に変換できることです。
次は、この前処理を使って単純BaselineとSanity Benchmarkを構築します。