跳到正文

价值度量实战

“大家觉得更快了”是信号,不是商业案例。价值度量的目标不是给 AI 找漂亮数字,而是帮助团队决定:哪些场景值得扩大,哪些需要修正,哪些应当停止。可用的度量必须同时尊重效率、质量、风险和实施成本;只看节省时间,往往会把返工和审阅成本藏起来。

先选择一个可归因的最小场景

不要一开始统计“全公司 AI 效率”。选择边界稳定、任务量足够、结果可验收的单位,例如每周经营周报、会议纪要、合同条款抽取或客户拜访准备。为这个场景定义起点、终点、样本规则和责任人,再采集基线。

项目基线期试点期备注
单任务总时长过去 4 周的中位数同口径记录包含审阅和返工
一次通过率按验收标准统计同一标准不能只看是否生成
人工步骤数流程图或观察记录同一流程关注等待与切换
风险事件漏发、错发、权限、数据错误全量登记严重度分级
成本人力、订阅、积分、实施、培训全量登记明确估算假设

基线不是为了证明过去做得差,而是为了避免试点前后口径变化。若业务季节性很强,用同比周期或同类任务做对照;若样本很少,明确写“方向性观察”,不要伪装成统计结论。

四层指标与一张场景账

使用、效率、质量、业务结果之间不是替代关系。采用率低,通常说明入口或模板有问题;效率提升但质量下降,说明把工作转移给了审阅者;质量提升而任务量太小,也未必值得大规模投入。

text
场景:__________________     统计周期:__________________
任务量:______              样本规则:____________________

效率:基线中位数 ______ 分钟;试点中位数 ______ 分钟;差值 ______。
质量:一次通过率 ______;返工次数 ______;关键错误数 ______。
业务:交付提前 ______;等待缩短 ______;已确认的业务影响 ______。
风险:事件数 ______;最高严重度 ______;是否触发停用条件 ______。
成本:订阅/积分 ______;实施 ______;培训 ______;审阅 ______;维护 ______。
结论:扩大 / 优化后再测 / 保持试点 / 停止。负责人:______。

计算时要把人审算进去

一个常用但不应机械套用的估算框架是:

text
净收益 =
(基线人工时长 − 试点总时长)× 有效任务量 × 人力小时成本
+ 已确认的质量损失避免额
+ 已确认的交付加速增量
− 订阅与使用成本
− 实施、培训、审阅、维护与治理成本

“试点总时长”包括准备输入、核验输出、修正、沟通和异常处理。不要把节省的员工时间直接等同于现金收入;除非团队确实减少了外包、避免了招聘或增加了可确认的产出,否则将其表述为“可重新分配的能力”。质量损失避免额也应有保守依据,例如历史返工成本、已记录的错误单或明确的风险事件。

用对照减少自我感动

最简单的对照方法有三种:同一人前后对照、相同任务的 A/B 对照、试点团队与非试点团队的同期对照。它们都有局限:前后对照会受熟练度影响,A/B 需要随机或规则分配,团队对照会受任务难度不同影响。因此报告中应同时写出样本数、选择规则、排除条件和无法控制的因素。

情况推荐比较方式需要披露的局限
高频标准任务随机抽取同类任务 A/B任务难度是否相等
周期性报告前后对照 + 同期历史季节性、数据量变化
少量复杂项目案例时间线 + 专家评分不可泛化为平均收益
跨团队推广分批上线的同期比较团队能力与管理差异

决策阈值:什么时候扩大,什么时候停

在试点前就写出阈值。例如:连续 4 周一次通过率不低于基线;关键错误为零;总时长中位数下降至少 20%;使用者愿意持续使用;没有未解决的权限问题。达到阈值才扩大到下一批;低于阈值时先定位是输入、模板、数据、培训还是任务不适配,而不是简单要求更多使用。

结果建议动作
效率上升、质量稳定、风险可控扩大样本,固化模板与培训
效率上升、质量下降增加质量门,缩小自动化范围
使用低、满意度低访谈用户,重做入口或停止场景
风险事件出现立即按严重度暂停,完成复盘后再决定
价值不明显保持小试点或把资源转向更高价值场景

月度价值复盘模板

text
本月最有价值的三个场景:各自的任务量、效率、质量、业务证据。
本月最大成本:审阅、维护、培训、权限处理分别是多少,是否在预算内。
本月失败或险情:是否已经修复,是否需要更新验收标准或停用开关。
下月实验:只改变一个关键因素(模板、输入、流程或人群),说明预期和判定规则。
需要管理层决定:扩大范围、继续投入、调整目标或终止试点。

真正有说服力的价值报告不追求一个夸张的 ROI,而是让读者能沿着任务样本、时间记录、验收证据和成本假设复算结论。可复算,才可持续;可持续,才值得规模化。