技术转 AI / Agent 工程面试题更新 2026-08-03

团队准备用另一个大模型给回答自动打分,你会怎样校准 LLM-as-a-Judge,避免评测结果看起来精确却不可信?

考察说明

考查模型评审标准、偏差校准和人工金标准建设能力。

回答思路

  1. 先把评分拆成事实、完整、指令遵循和表达等明确维度,并为各等级提供可操作标准与边界例子。
  2. 建立由领域人员复核的代表性金标准集,比较评审模型与人工一致性和不同错误类型的偏差。
  3. 隐藏被评模型名称并随机答案顺序,控制长度、位置和措辞偏好,避免评审器偏爱特定风格。
  4. 关键事实和结构约束优先使用程序校验,评审模型只处理确实需要语义判断的部分。
  5. 模型、提示或任务分布变化后重新校准,并对低一致性与高风险样本保留人工复核而非强行自动化。