Case study · Eval
把 eval 和产品决策,画在同一张可以指认的地图上。
把 eval、失败样本和产品决策画在同一张地图上,让质量讨论从感觉变成可以指给别人看的东西。
已上线2025 · 5 个月评估与可观测Eval · QualityFigma · Data viz · Spec
概要
- 职责
- 质量界面与评估规格,让周会能对着失败簇做决定。
- 时间
- 2025 · 5 个月
- 背景
- 模型质量停在表格里,产品决策停在文档里。
- 问题
- 两边对不上,争论只能靠截图。
- 方法
- 把评估集当成产品规格。失败样本聚类、标注、回流到发布。
- 结果
- 周会开始对着失败簇做决定,而不是对着截图争论。
1 张图
质量和决策会面
按簇
失败不再是孤例
回流
样本进下一版发布
质量讨论如果不能指给别人看,就还是感觉。
研究侧有表格,产品侧有文档,发布会上两边各说各的。我要一张地图:评估、失败样本和产品决策占同一个空间。
问题
数字在表格里很好看,用户失败却讲不清楚。截图无法聚类,也无法回流到下一版。团队在用轶事代替规格。
方法
评估集按产品承诺来设计。失败样本聚类、命名、标严重度,再写回发布清单。地图上能点到簇,也能点到那一次失败。
系统
通过、失败簇、漂移是一等公民。每一簇连着样本、负责人和是否进入下一版。不是又一张 dashboard 装饰。
工作流
周会打开地图。先看簇的移动,再打开样本,最后写一条产品决策。截图只作附件。
结果
质量争论有了可以指的对象。发布是否推迟,取决于簇有没有被处理,而不是谁的嗓门大。
复盘
评估集就是产品规格。你把哪些失败收进来,等于你对用户承诺了什么。