Evaluation Loop
评测反馈闭环
把线上样本、人工标注、自动评分和版本比较连接成可持续改进流程。
何时使用:Prompt、模型或工具版本持续变化,需要证明质量没有退化。
Pattern anatomyLIVE TASK MODEL
ACTIVE RUN
评测反馈闭环
1
Dataset
2
Rubric
3
Run
4
Compare
适用任务
质量评测Prompt 迭代回归防护
关键构成
- 01Dataset
- 02Rubric
- 03Run
- 04Compare
反模式
只展示平均分,不保留失败样本、评判标准和版本差异。
Task flow
从触发到完成
- 01定义 rubric 与数据集
- 02运行候选版本
- 03比较切片与失败样本
- 04批准或阻止上线
State contract
必须显式呈现的状态
DraftSTATE_01
RunningSTATE_02
Needs reviewSTATE_03
PassedSTATE_04
RegressedSTATE_05
Success metrics
上线后看什么
↗Pass rate
↗回归数量
↗评审一致率
恢复策略
失败运行保留可重放配置;回归结果链接到具体样本、评分理由和修复负责人。