Evidence
残す証拠
- dataset version・case provenance・期待値
- grader type・rubric・model version
- baseline対candidateのfailure taxonomy別差分
- human calibration sampleとgrader agreement結果
ソウPM Tool Practice Playbook
AI品質を一度のデモで判断せず、versioned dataset・複数grader・人間校正・failure taxonomy・regression gateとして継続運用するrunbook。
Decision question
prompt・model・toolが変わっても、重要なfailure modeを同じdatasetと基準で再評価し、grader自身のずれも検知できるか
Preflight
Runbook
Evidence
Failure signals
Sources
評価軸・運用ルールを設計するために参照した公式ドキュメントです。特定製品の推奨を意味しません。
Saved Workflow
進捗はこのブラウザのlocalStorageだけに保存します。候補製品名・評価点・PoC結果・Evidence本文は保存しません。