心路谷 · AI陪伴产品评估体系设计
作为唯一PM,从零设计并落地完整的AI Agent评估体系
AI产品经理 · 作品集案例
2026
背景与问题
产品:心路谷,AI情绪陪伴产品原型。核心目标——不给答案,陪你看见;不定义你,你定义自己。
在做产品迭代时遇到一个很实际的问题:每次改Prompt、换模型,都说不清"是变好了还是变差了"。
所以需要一套评估体系来解决几个核心问题:每次改动有没有客观判断依据?新模型上线或替换如何拍板?怎么持续发现陪伴AI还做不好的事?
我的角色与产出
从零设计并落地完整评估体系
📋 产出物
• 评估任务集(首批20+任务)
• 共情质量三维度评分框架
• 三层评分器组合方案
• 能力/回归双套件+毕业机制
• 新模型上线决策框架
🎯 解决了什么
• 把"感觉好"变成可量化的指标
• 每次改动有客观判断依据
• 新模型上线不再靠直觉拍板
• 为后续规模化迭代搭好基础设施
核心设计原则
制定一个客观量化的、团队协作共创并一致认可的、高效且性价比高的、能灵活调整并提供迭代方向的评估体系。评估不是事后质检,是产品定义的延伸——你测什么、怎么测,就在定义"什么是好的陪伴"。
三层评分器(给产品表现打分的评分规则)
代码做底线,LLM评质量,人工做校准
评估的核心原则:能用代码判定的就不用LLM,能用LLM判定的就不用人。
| 层级 | 方法 | 心路谷应用 | 特点 |
| 骨架 | 代码评分器 | 禁止词检查、长度上下限、轮次上限 | 快、便宜、零歧义 |
| 肌肉 | LLM评分器 | 共情质量三维度评分框架打分 | 灵活、可规模化、需校准 |
| 校准 | 人工评分 | 每周抽样5-10条校准LLM评分 | 最准、最贵、做校准用 |
代码评分器具体规则:
• 禁止词检查:出现"一切都会好起来的"、"你应该"等 → 失败
• 长度下限:回复 < 20字 → 警告(可能敷衍)
• 长度上限:回复 > 500字 → 警告(可能说教)
• 轮次上限:单次对话超过15轮未缓解 → 失败
LLM评分:共情质量评分框架(以心路谷的共情质量维度为例)
把"温暖"写成可评分的操作定义
三个维度形成递进逻辑,直接对应心路谷的产品哲学:
我说的话你听到了 → 你懂我的感受 → 你看见了我这个人
复述 → 同理接纳 → 看见反馈
复述(加分项)
3分:准确引用用户原话关键词
2分:没引用但准确解读
1分:解读不准确,用户感觉你没在听
同理接纳(必须项≥2分)
3分:至少两句共情,其中一句针对具体困境
2分:仅一句通用共情,或情绪浓度不匹配
1分:说教/否定/鸡汤/扭曲原意
看见反馈(必须项≥2分)
3分:具体反馈用户优势/价值观,留空间认同或不认同
2分:反馈笼统,或分析式姿态没留空间
1分:只围绕问题讨论,没看见人
设计思考:三个维度用混合模式组合,必须项保证底线,加分项激励上限。三条评分维度中,同理接纳和看见反馈是必须项(低于2分直接不通过),复述是加分项。这个组合的选择代表着产品立场——陪伴的核心不是"你说了什么我重复给你听",而是"我看到了你是谁"。
以上以共情质量为例展示评分框架的设计方法。同一套方法论可扩展到安全性、边界感、对话自然度、上下文连贯性等其他维度的评分框架设计。
双套件策略(基础卷与竞赛卷)
不同目的 → 不同题目 → 不同期待
🛡️ 回归评估(基础卷/防守)
问:小煤灯还能做好以前能做的事吗?
通过率接近100%,掉分就报警。每次发布前必跑,确保基础能力不退化。
🚀 能力评估(竞赛卷/进攻)
问:小煤灯还能往哪些方向成长?
通过率从低开始,给团队爬坡目标。不断发现和攻克模型不擅长的场景。
毕业机制:能力评估中某个任务 pass³ ≥ 90%,连续3次稳定 → 该任务"毕业"进入回归套件。回归套件随产品成熟越来越厚,能力评估始终对准"还做不好的事"。
核心指标:为什么是pass³
陪伴型产品的用户体验取决于"每次都靠谱",而非"多试几次总能成"
| 指标 | 含义 | k增大时 | 适合 |
| pass@k | k次中至少一次成功 | ↑ 越来越高 | 创意生成、方案探索 |
| pass^k | k次全部成功 | ↓ 越来越低 | 面向用户的产品 |
心路谷选pass³(k=3)的理由:
- 陪伴产品是对话Agent,每次交互独立,情感信任需要稳定性——用户不会给"第二次机会"
- 10次里有2次敷衍,信任就崩了
- k=3在学术研究中是平衡点——能有效区分"偶尔能行"和"基本稳定"
数字错觉与含义:假设单次成功率75%,pass@1=75%(听起来还行?)但pass³=42%(三次里超过一半会翻车)。很多团队只看pass@k报喜,但用户体验取决于pass^k。
"新模型上线用不用"在评估体系中的决策案例
场景:新模型跑完评估,数据如下——
能力评估 pass@1
+9%
62% → 71%
回归评估 pass@1
-4%
97% → 93%
决策:不上,但带着行动计划不上
- 先看回归。97%→93%,换算成pass³从约91%掉到80%——体验级退化,用户能感知到。体验掉+成本涨,直接上不成立。
- 拆能力提升。+9%涨在哪个维度?涨的是核心体验维度才值得投入;涨在边缘维度价值有限。
- 读转录找原因。回归掉的4%是什么场景——共情变得机械?回复语气变了?还是出现了新的失败模式?
- 调Prompt试拉回。针对掉分场景用新模型重新调Prompt。能拉回来→灰度验证→上;拉不回来→再等等。
回归掉了吗?
↓
能调回来吗?
→
调不回来→不上
→
涨的是核心维度吗?
→
Token成本扛得住吗?
→
灰度验证
→
上线 ✓
踩过的坑
早期构建评估集时,一种常见的误区是只从"用户需要被共情"的角度设计正面用例——希望AI能理解用户的情绪、给予温暖回应。
结果是:评估集里全是需要共情的正面用例场景,陪伴AI易往"过度共情"方向优化。因为评估只覆盖了单一类场景,模型自然会用同一种模式回应所有内容。
后来做的三件事:
- 补充反面用例:日常闲聊、中性陈述、信息询问——不需要共情的场景,确保AI能判断"什么时候不需要共情"
- 补充边界用例:轻度吐槽vs严重情绪危机、寻求建议vs需要陪伴——考验AI在不同场景中切换模式的能力
- 把评估集按场景分类,分别统计通过率,而不是只算一个总分——这样能看清具体哪个场景在退化
涉及技能
Agent评估体系搭建
LLM Judge / 评分框架设计
能力评估 vs 回归评估
pass@k / pass^k 指标
AI产品决策框架
心理学 × AI PM 跨学科迁移