03 / 2025 - 2026 / AI 产品评测

Evaluation System让模型的不确定性,变成团队可讨论的产品问题。

围绕响应成功、工具调用、数据引用、报告完整度与用户采纳信号建立评测框架,并通过 6+ 轮迭代持续提高输出质量。

6+评测迭代轮次
3 类重点问题归因
87综合评测得分
The Problem

先找到真正阻碍用户前进的摩擦。

Agent 输出同时受模型、工具、知识库和编排策略影响。没有统一指标与评测集时,团队难以判断问题来源,也无法验证一次优化是否真正有效。

How I Worked

把模糊问题,拆成可以验证的产品动作。

01

指标拆解

定义工具调用、引用相关性、完整度、幻觉率与可执行性等核心维度。

02

评测集

将典型任务和 Badcase 组织成可重复验证的样本,建立优化前后的对比基线。

03

归因闭环

把问题回到 Prompt、工具规则、知识片段或任务编排,逐项验证并跟踪效果。

Outcome
综合评分从 68 提升到 87,并让评测成为上线后持续迭代的共同语言。