今回の変更
良い研究結果が出ても、すぐ採用しないためのルールを固定しました。
研究結果は、
- FIXED = 確定した前提
- PLANNED = 次に検証するもの
- CANDIDATE = 候補として残すもの
- HOLD = 根拠不足で止めるもの
として扱います。
たとえば特徴量を追加して結果が良くなっても、それだけで正式採用にはしません。再現できるならFIXED、次の検証対象ならPLANNED、まだ候補段階ならCANDIDATE、判断根拠が足りなければHOLDです。
新しいTaskへ分岐できるのはPLANNEDとCANDIDATEです。
公開側も、TaskごとにX・note・Webを一組の投稿セットとして扱う運用を維持します。
なぜ必要なのか
研究結果が出るたびに、その場の感覚で「採用」「次に試す」と決めると、確認済みの前提と、これから試す候補が混ざります。
今回のルールでは、確定した結果と次の研究候補を分離し、どの結果から新Taskへ進めてよいかを明示します。
具体的に何が変わったのか
FIXEDには、Evidenceで確認でき、再現可能な結果を置きます。
PLANNEDとCANDIDATEは、新しい研究Taskへ分岐できる状態です。
Evidence不足、Authority不一致、既存Taskとの重複がある場合はHOLDとしてFail Closedします。
公開ルール
公開単位は、TaskごとにX・note・Webを一組として維持します。
研究中に別テーマが見つかった場合は、同じTaskから投稿を増やすのではなく、新しいTask候補として扱います。
今回の意味
この工程でできるようになったのは、単に研究結果を記録することではありません。
**「結果が良かったか」だけでなく、「その結果を次にどう扱うか」まで同じEvidence基準で判断できるようになったこと**です。
Final Holdout、多重比較、Version、Run Manifest、Rollbackと合わせて、都合の良い結果だけを拾ってAIを育てないための研究ルールが、さらに具体化しました。
現在の状態と次
研究結果の分類とTask分岐ルールは固定済みです。
次はPhase 13BでBaseline研究を棚卸しし、具体的な研究Taskへ展開します。
制約
この工程では予測性能、収益、精度の向上は主張しません。
対象は、研究結果の分類、Task分岐、公開単位のルールです。