開発ログ

評価指標・統計検証

30秒でわかる概要

今回なにをした?

AIの成績が良く見えても、それが偶然ではないかを確かめる統計チェックを追加しました。

なぜ必要?

少ないレースだけの好成績や、何通りも試した中の当たりを、そのままAIの実力と判断しないためです。

何が変わった?

レース数、数字のぶれ、試した方法の数まで確認し、根拠が弱い結果は判断を保留できるようになりました。

現在の状態

好成績という数字だけでなく、その数字をどこまで信用できるかまで同じ評価ルートで確認できる状態です。

詳細

Evidence Record

今回確定したこと

定義した境界・成果

  • Canonical Metric Contractでmetric identity・sample count・point estimate・confidence intervalを明示した
  • 空サンプル、非有限値、1件のみのサンプル、未対応confidence levelをHOLDとして扱える境界を追加した
  • bootstrap seedを明示して再現可能なpercentile intervalを計算できるようにした
  • minimum sample sizeを明示し、不足時はHOLDするsample-size gateを接続した
  • BonferroniとHolmの多重検定補正にalpha検証を加えた

許可されること / できること

  • 評価指標の識別子・サンプル数・点推定・不確実性を同じ形式で扱います。
  • 信頼区間、bootstrap、sample-size gate、多重検定を一つの結果へ束ねます。
  • 複数比較による偶然の有意差を過大評価しにくくします。

安全境界・防止策

禁止されること / 防止策

  • 点推定値だけを確定的な結果として扱うことを防ぎます。
  • 必要サンプル数を暗黙に決めることを防ぎます。
  • 未登録の多重検定補正を勝手に採用することを防ぎます。
  • 実馬券購入へ進むことを防ぎます。

実装・契約根拠

  • Task Evidenceと正式成果物を公開面の根拠として参照します。

検証結果

  • RF073 targeted tests:Canonical Metric Contractと統計検証edge caseを含む15件の対象テスト結果を再利用しました。(結果:PASS)
  • payload identity:前段で検証済みの実装payloadとcommit対象payloadが一致することを確認済みです。(結果:PASS)
  • database write:データベース書き込みは行いません。(結果:NO)

未達・対象外

  • 初期confidence intervalは平均に対する95% normal approximationのみを正式サポートします。
  • bootstrapはpercentile mean intervalを対象とし、他のbootstrap interval方式は未対応です。
  • 統計検証は評価値の不確実性を扱いますが、将来の実運用収益を保証するものではありません。

次工程

RF073の統計検証結果をPhase 6の評価・シミュレーション完了判定へ渡します。

Evidence Stage

IMPLEMENTATION_COMPLETE_VALIDATED

内部管理情報

Task ID: RF_DEV_073_METRIC_DEFINITION_AND_STATISTICAL_VALIDATION_V1

Canonical Outcome Trace

  • Canonical Metric Contractでmetric identity・sample count・point estimate・confidence intervalを明示した
  • 空サンプル、非有限値、1件のみのサンプル、未対応confidence levelをHOLDとして扱える境界を追加した
  • bootstrap seedを明示して再現可能なpercentile intervalを計算できるようにした
  • minimum sample sizeを明示し、不足時はHOLDするsample-size gateを接続した
  • BonferroniとHolmの多重検定補正にalpha検証を加えた

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。