開発ログ

候補モデルFamilyを比較する

30秒で分かる今回の進捗

候補モデルFamilyを同じ条件で比較するための契約と評価基準を固定しました。Task Evidenceでは8件を確認し、8件すべてが VERIFIED、未解決は0件です。

何を変えたか

これまでは、この工程の成果物や判定条件を後続工程から同じ根拠で参照できる形が十分に固定されていませんでした。

今回、モデルFamily比較の契約、固定された比較Authority、確率品質とCalibration品質を含む評価軸などを、Task Evidenceと正式成果物から参照できる状態にしました。

なぜ必要か

モデル候補が増えるほど、比較条件を後から変えると結果の解釈も変わります。そこで、候補比較の前に「何を根拠に判定するか」を固定し、後続工程でも同じ条件を使えるようにしました。

現在の状態

確認対象8件はすべて VERIFIED で、未解決は0件です。今回のEvidenceに含まれない性能・収益・精度については主張しません。

次の工程

次は、今回固定した基準を引き継いで、確率校正手法の比較へ進みます。

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。