開発ログ

評価指標・統計検証

30秒でわかる概要

今回なにをした?

評価指標の識別子・サンプル数・点推定・不確実性を同じ形式で扱います。信頼区間、bootstrap、sample-size gate、多重検定を一つの結果へ束ねました。複数比較による偶然の有意差を過大評価しにくくします。

なぜ必要?

単一の成績数字だけを見ると、少数サンプルの偶然や複数比較による見かけ上の良さを過大評価する危険があるためです。

何が変わった?

metric identityとsample countを明示し、点推定だけでは確定扱いせず、信頼区間・bootstrap・sample-size gate・Bonferroni/Holm補正を統合したStatistical Validation Resultを返せるようになりました。

現在の状態

評価値をそのまま確定的な成果として扱わず、統計的な不確実性と検証条件を含めてPASS/判断保留を判断できる状態です。

詳細

Evidence Record

今回確定したこと

定義した境界・成果

  • Canonical Metric Contractでmetric identity・sample count・point estimate・confidence intervalを明示した
  • 空サンプル、非有限値、1件のみのサンプル、未対応confidence levelをHOLDとして扱える境界を追加した
  • bootstrap seedを明示して再現可能なpercentile intervalを計算できるようにした
  • minimum sample sizeを明示し、不足時はHOLDするsample-size gateを接続した
  • BonferroniとHolmの多重検定補正にalpha検証を加えた

許可されること / できること

  • 評価指標の識別子・サンプル数・点推定・不確実性を同じ形式で扱います。
  • 信頼区間、bootstrap、sample-size gate、多重検定を一つの結果へ束ねます。
  • 複数比較による偶然の有意差を過大評価しにくくします。

安全境界・防止策

禁止されること / 防止策

  • 点推定値だけを確定的な結果として扱うことを防ぎます。
  • 必要サンプル数を暗黙に決めることを防ぎます。
  • 未登録の多重検定補正を勝手に採用することを防ぎます。
  • 実馬券購入へ進むことを防ぎます。

実装・契約根拠

  • Task Evidenceと正式成果物を公開面の根拠として参照します。

検証結果

  • RF073 targeted tests:Canonical Metric Contractと統計検証edge caseを含む15件の対象テスト結果を再利用しました。(結果:PASS)
  • payload identity:前段で検証済みの実装payloadとcommit対象payloadが一致することを確認済みです。(結果:PASS)
  • database write:データベース書き込みは行いません。(結果:NO)

未達・対象外

  • 初期confidence intervalは平均に対する95% normal approximationのみを正式サポートします。
  • bootstrapはpercentile mean intervalを対象とし、他のbootstrap interval方式は未対応です。
  • 統計検証は評価値の不確実性を扱いますが、将来の実運用収益を保証するものではありません。

次工程

RF073の統計検証結果をPhase 6の評価・シミュレーション完了判定へ渡します。

Evidence Stage

IMPLEMENTATION_COMPLETE_VALIDATED

内部管理情報

Task ID: RF_DEV_073_METRIC_DEFINITION_AND_STATISTICAL_VALIDATION_V1

Canonical Outcome Trace

  • Canonical Metric Contractでmetric identity・sample count・point estimate・confidence intervalを明示した
  • 空サンプル、非有限値、1件のみのサンプル、未対応confidence levelをHOLDとして扱える境界を追加した
  • bootstrap seedを明示して再現可能なpercentile intervalを計算できるようにした
  • minimum sample sizeを明示し、不足時はHOLDするsample-size gateを接続した
  • BonferroniとHolmの多重検定補正にalpha検証を加えた

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。