指标拆解
定义工具调用、引用相关性、完整度、幻觉率与可执行性等核心维度。

03 / 2025 - 2026 / AI 产品评测
围绕响应成功、工具调用、数据引用、报告完整度与用户采纳信号建立评测框架,并通过 6+ 轮迭代持续提高输出质量。
Agent 输出同时受模型、工具、知识库和编排策略影响。没有统一指标与评测集时,团队难以判断问题来源,也无法验证一次优化是否真正有效。
定义工具调用、引用相关性、完整度、幻觉率与可执行性等核心维度。
将典型任务和 Badcase 组织成可重复验证的样本,建立优化前后的对比基线。
把问题回到 Prompt、工具规则、知识片段或任务编排,逐项验证并跟踪效果。
综合评分从 68 提升到 87,并让评测成为上线后持续迭代的共同语言。