Meta:构建多轮商业Agent评估系统
📖标题:Designing Reliable LLM-as-a-Judge Measurement Systems for Multi-Turn Business Agents🌐来源:arXiv, 2609.33955v1🛎️文章简介🔸研究问题:如何为依赖特定业务事实、流程且跨多轮交互的商业Agent,建立一个可维护、可归因且可靠的自动化评估测量系统?🔸主要贡献:论文提出了一套整合评估规范、模块化LLM裁判、意图保持的用户模拟及人机协同治理的端到端测量系统方法论。📝重点思路🔸定义对话级评估规范:不再以单轮回复为单位,而是以整个对话的最终状态(如完全解决、部分解决、模型能力缺口、业务知识缺口)为分析单元,明确区分是模型没做好还是业务数据缺失,确保失败归因可执行。🔸构建模块化裁判架构:将评估拆解为多个原子维度的独立裁判(如幻觉检测、流程遵循),通过版本化的共享证据库和显式的聚合图逻辑,将原子判断组合成最终的对话级结论,避免不同裁判依据不同事实产生冲突。🔸开发意图保持的用户模拟器:使用LLM扮演用户进行多轮测试,严格约束模拟器必须覆盖原始意图且不引入新意图,在发布前需通过意图一致性、人设一致性及测量稳定性校验,确保模拟交互能真实反映Agent性能。🔸实施人机协同闭环治理:建立独立的人工审核与自动裁判并行机制,通过计算净检测率(NDR)量化测量保真度。利用分歧案例更新黄金标准数据集、修订评估指南或优化裁判提示词,实现人工与自动评估能力的共同提升。🔎分析总结🔸系统级保真度显著提升:经过多次审计迭代,测量系统的净检测率从初始的接近随机水平大幅提升,证明该闭环方法能有效校准评估系统。🔸人机协同效果最佳:实验显示,单独使用自动裁判或人工审核均存在局限,而结合两者的工作流在任务完成度等指标上具有最强的描述性性能,体现了互补性而非简单的替代关系。🔸维度特异性差异:在业务知