Governance
導入前に決める運用ルール
- golden datasetの変更承認
- grader prompt/modelのversion管理
- 機密prompt・responseの保持期間
ソウPM Tool Evaluation Framework
製品名から探し始める前に、PM / Product Opsが自社のJob、成功条件、PoCで取る証拠、運用ルールを固定するためのカテゴリ別presetです。
PMのJob: AI機能の品質基準を実例・grader・人間レビュー・回帰テストとして継続運用する
最重要の判断: モデルやpromptが変わっても、品質劣化と新しいfailure modeを継続的に検出できるか
Primary query: PM AI Evals ツール 選定 評価基準
Scorecard preset
候補製品を見る前に重みを固定し、PoC後も同じ重みで判定します。点数は「印象」ではなく、右列の証拠を取得できたかで付けます。
| 評価軸 | 重み | 候補点 | 必要な証拠 |
|---|---|---|---|
| Dataset・Versioning | 20 | __/20 | 実ユーザー由来case、edge case、期待値、dataset versionを再現可能に管理できる |
| Grader・Human calibration | 25 | __/25 | deterministic/LLM/human graderを組み合わせ、専門家レビューでgrader driftを点検できる |
| Trace・Failure analysis | 20 | __/20 | input/output/tool call/latency/costとfailure taxonomyを同じrunで追える |
| Regression・CI | 20 | __/20 | model/prompt/tool変更時に基準datasetを自動再実行しrelease gateへ接続できる |
| Cost・Security・Operational fit | 15 | __/15 | eval実行コスト、機密データ、retention、rate limitを本番運用前提で見積もれる |
PoC preset
デモで説明を聞くだけではなく、自社に近いデータ・権限・失敗条件で証拠を取ります。
Implementation Playbook
AI品質を一度のデモで判断せず、versioned dataset・複数grader・人間校正・failure taxonomy・regression gateとして継続運用するrunbook。
Governance
Adoption
Renew / Exit
これらが継続する場合は、契約更新を自動継続せず、利用率・Outcome・運用コストを再評価します。
Saved Workflow
進捗はこのブラウザのlocalStorageだけに保存します。候補製品名・評価点・PoC結果・Evidence本文は保存しません。