30秒でわかる概要
前回の監査では、元データ23分類のうち18分類に課題が見つかりました。
今回は、その18分類を無条件に取り直すのではなく、23分類をRaw・市場Snapshot・結果/払戻・運用Metadata・派生/Cache・Legacy派生へ再分類しました。
結果、派生/LegacyとしてSource Authorityから外せるものが11分類、本当に取得・修復を検討するRaw Gap候補は8分類まで絞れました。Unknownは0です。
なぜ再分類したのか
元データベースには加工前の事実を残し、特徴量や派生値はProducer/Cache側で生成する方針にしたためです。
これにより、元データ欠損・Join問題・特徴量生成問題を分離して追跡できます。
次にやること
8分類を、既存データ修復、Join修正、新規取得、一括取得可能の観点で再整理します。
取得が必要なものも、特徴量単位ではなく、複数Feature Familyで共通利用できる元データ単位にまとめて取得します。