【要約】
学習データは多いほど良いのか。古いデータを軽くすれば改善するのか。
全履歴・直近8年・5年・3年・2年と、3種類の時間重みを組み合わせた15設定を実モデルで比較しました。
今回のDevelopment評価で最良だったのは「直近8年+一様重み」。
Development Log Lossは0.2576610079、全履歴+一様重みは0.2576614791でした。
ただし差は非常に小さく、「8年が常に最適」とは判断していません。
また、全履歴・直近8年・直近5年では時系列減衰は一様重みを上回らず、直近2年まで短縮した設定は今回の評価で悪化傾向でした。
Final Holdoutは設定選抜に使用していません。
何が分かったか
今回重要だったのは、「データは多いほど良い」「最近を重くすれば良い」という直感が、そのまま結果にはならなかったことです。
同じBaseline条件で15設定を比較した結果、全履歴より直近8年がわずかに良く、時系列減衰は今回の条件では改善につながりませんでした。
比較した条件
学習期間は以下の5種類です。
- 全履歴
- 直近8年
- 直近5年
- 直近3年
- 直近2年
各期間について、一様重みと2種類の時系列減衰を組み合わせ、合計15設定を比較しました。
最良設定
今回の最良設定は直近8年+一様重みでした。
Development Log Lossは0.2576610079。
全履歴+一様重みの0.2576614791よりわずかに良い結果です。
ただし差は小さいため、8年という期間そのものを普遍的な最適値とは扱いません。
時系列減衰の結果
全履歴・直近8年・直近5年では、古いデータを軽くする時系列減衰は一様重みを上回りませんでした。
また、直近2年まで学習期間を短くした設定は今回の評価で悪化傾向でした。
Final Holdoutの扱い
15設定の比較・選抜はDevelopment側だけで実施しました。
Final Holdoutは選抜に使用していません。
探索・選抜と最終評価を分離したまま比較しています。
データ品質と比較の公平性
単独勝者として扱えないレースや、結果との結合が成立しないレースは、実験開始前に共通ルールで除外しました。
設定ごとに除外条件を変えていないため、特定の設定だけ有利になる比較にはしていません。
検証状態
Task Evidenceでは9件を確認し、9件すべてVERIFIED、未解決0件でした。
Canonical DatabaseはREAD_ONLYで利用し、実験によるDB書き換えは行っていません。
現在の意味
今回の成果は「直近8年が勝った」ことだけではありません。
学習期間と時間重みを、感覚ではなく同じ評価条件で比較し、実際のモデル結果で選べるようになったことが重要です。
次はこの比較基盤を使い、新しい特徴量を追加したときにBaselineより本当に改善するのかを検証していきます。