一个 AI 功能离线评测明显变好,但灰度上线后用户采纳率反而下降,你会怎么排查?
考察说明
考查解释离线指标与线上结果偏差的能力。
回答思路
- 先核对指标口径和实验分流,确认采纳率下降不是埋点遗漏、版本混杂、用户构成变化或样本量不足造成的。
- 比较离线评测任务与线上真实任务的分布,检查是否遗漏了长上下文、最新信息、复杂输入或特定用户群的需求。
- 把线上漏斗拆为触发、等待、阅读、采纳、修改和最终完成,定位用户是在响应前流失,还是看完结果后不愿使用。
- 同时检查准确率以外的因素,例如延迟变长、结果过于冗长、语气不合适、交互入口变化或用户失去可控感。
- 抽取未采纳样本进行人工复盘,并结合用户修改内容判断问题来自模型质量、产品呈现还是任务本身不适合自动生成。
- 根据根因选择修复措施,例如优化交互、限制场景、切换模型或补充评测集,并通过新的受控实验验证,而不是直接用离线分数推翻线上结果。