開発ログ

研究結果の公開とタスク分岐ルールを定める

今回の変更

良い研究結果が出ても、すぐ採用しないためのルールを固定しました。

研究結果は、

  • FIXED = 確定した前提
  • PLANNED = 次に検証するもの
  • CANDIDATE = 候補として残すもの
  • HOLD = 根拠不足で止めるもの

として扱います。

たとえば特徴量を追加して結果が良くなっても、それだけで正式採用にはしません。再現できるならFIXED、次の検証対象ならPLANNED、まだ候補段階ならCANDIDATE、判断根拠が足りなければHOLDです。

新しいTaskへ分岐できるのはPLANNEDとCANDIDATEです。

公開側も、TaskごとにX・note・Webを一組の投稿セットとして扱う運用を維持します。

なぜ必要なのか

研究結果が出るたびに、その場の感覚で「採用」「次に試す」と決めると、確認済みの前提と、これから試す候補が混ざります。

今回のルールでは、確定した結果と次の研究候補を分離し、どの結果から新Taskへ進めてよいかを明示します。

具体的に何が変わったのか

FIXEDには、Evidenceで確認でき、再現可能な結果を置きます。

PLANNEDとCANDIDATEは、新しい研究Taskへ分岐できる状態です。

Evidence不足、Authority不一致、既存Taskとの重複がある場合はHOLDとしてFail Closedします。

公開ルール

公開単位は、TaskごとにX・note・Webを一組として維持します。

研究中に別テーマが見つかった場合は、同じTaskから投稿を増やすのではなく、新しいTask候補として扱います。

今回の意味

この工程でできるようになったのは、単に研究結果を記録することではありません。

**「結果が良かったか」だけでなく、「その結果を次にどう扱うか」まで同じEvidence基準で判断できるようになったこと**です。

Final Holdout、多重比較、Version、Run Manifest、Rollbackと合わせて、都合の良い結果だけを拾ってAIを育てないための研究ルールが、さらに具体化しました。

現在の状態と次

研究結果の分類とTask分岐ルールは固定済みです。

次はPhase 13BでBaseline研究を棚卸しし、具体的な研究Taskへ展開します。

制約

この工程では予測性能、収益、精度の向上は主張しません。

対象は、研究結果の分類、Task分岐、公開単位のルールです。

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。