開発ログ

学習期間の長さと時系列重み付けを比較検証する

【要約】

学習データは多いほど良いのか。古いデータを軽くすれば改善するのか。

全履歴・直近8年・5年・3年・2年と、3種類の時間重みを組み合わせた15設定を実モデルで比較しました。

今回のDevelopment評価で最良だったのは「直近8年+一様重み」。

Development Log Lossは0.2576610079、全履歴+一様重みは0.2576614791でした。

ただし差は非常に小さく、「8年が常に最適」とは判断していません。

また、全履歴・直近8年・直近5年では時系列減衰は一様重みを上回らず、直近2年まで短縮した設定は今回の評価で悪化傾向でした。

Final Holdoutは設定選抜に使用していません。

何が分かったか

今回重要だったのは、「データは多いほど良い」「最近を重くすれば良い」という直感が、そのまま結果にはならなかったことです。

同じBaseline条件で15設定を比較した結果、全履歴より直近8年がわずかに良く、時系列減衰は今回の条件では改善につながりませんでした。

比較した条件

学習期間は以下の5種類です。

  • 全履歴
  • 直近8年
  • 直近5年
  • 直近3年
  • 直近2年

各期間について、一様重みと2種類の時系列減衰を組み合わせ、合計15設定を比較しました。

最良設定

今回の最良設定は直近8年+一様重みでした。

Development Log Lossは0.2576610079。

全履歴+一様重みの0.2576614791よりわずかに良い結果です。

ただし差は小さいため、8年という期間そのものを普遍的な最適値とは扱いません。

時系列減衰の結果

全履歴・直近8年・直近5年では、古いデータを軽くする時系列減衰は一様重みを上回りませんでした。

また、直近2年まで学習期間を短くした設定は今回の評価で悪化傾向でした。

Final Holdoutの扱い

15設定の比較・選抜はDevelopment側だけで実施しました。

Final Holdoutは選抜に使用していません。

探索・選抜と最終評価を分離したまま比較しています。

データ品質と比較の公平性

単独勝者として扱えないレースや、結果との結合が成立しないレースは、実験開始前に共通ルールで除外しました。

設定ごとに除外条件を変えていないため、特定の設定だけ有利になる比較にはしていません。

検証状態

Task Evidenceでは9件を確認し、9件すべてVERIFIED、未解決0件でした。

Canonical DatabaseはREAD_ONLYで利用し、実験によるDB書き換えは行っていません。

現在の意味

今回の成果は「直近8年が勝った」ことだけではありません。

学習期間と時間重みを、感覚ではなく同じ評価条件で比較し、実際のモデル結果で選べるようになったことが重要です。

次はこの比較基盤を使い、新しい特徴量を追加したときにBaselineより本当に改善するのかを検証していきます。

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。