第 250 期

AI 客户服务:请先确认“解决 1 起”的标准

通过 Fin 的按成果付费规则与假设的成本清单,探讨如何综合计算实际解决件数与人工复核成本。

商业AI 客户服务:请先确认“解决 1 起”的标准

在“每解决 1 起 0.99 美元”中需要确认的事项

用于客户服务的 Fin AI Agent 按照成果收取费用。其中最具代表性的计费项目是“解决”,每起收取 0.99 美元。即使在同一次对话中处理了多个问题,也只收取一次费用。

我首先确认的不是价格,而是“解决”的定义。不仅是客户反馈“有帮助”的情况,在收到 Fin 的回答后未再请求进一步帮助的情况,也被计入解决。后者被称为“推断解决”。

目前 Fin 的帮助文档说明,在最后一次回答后客户超过 24 小时未参与对话,即视为推断解决。不过,如果仅仅是互相打招呼,或者 Fin 提出了确认性问题而客户没有回答,则不在计费范围内。此外,即便已被统计为解决,只要客户回到同一对话中请求进一步帮助,即使跨越了账单周期,也会扣减该笔解决计数。Fin 的解决与计费条件

即使有这类校正规则,也很难断定得到回答后离开的客户是否真正感到满意。可能是问题得到了解决,也可能是对回答感到失望而另寻他法。这就是为什么必须确认合同中可计费的成果与我们公司期望的业务结果是否一致

交付的任务不同,成果的定义也不同

Fin 的价格表中包含多种计费项目。

计费项目含义单价
解决最后一次回答后未请求进一步帮助0.99 美元
完成预设流程后转交完成客户企业设计的转接人工流程0.99 美元
判定为不合格销售线索判定不符合客户企业设定的销售目标条件0.99 美元
判定为合格销售线索判定符合销售目标条件并进行对接9.99 美元

仅仅因为无法解决而转交人工,与收集必要信息后按设定流程完成转交,两者性质完全不同。后者被视为完成了所委托的工作,因此可以计费。此外,还需要确认根据不同价格方案或所接入的客服平台所提供的功能差异。Fin 价格表

同样是 0.99 美元,公司获得的价值可能大相径庭。必须区分看待:是客户的问题彻底得到了解决,还是客服人员做好了接手工作的准备,抑或是过滤掉了非销售对象。仅凭“按成果付费”的名义,并不意味着所有的失败成本都会转移给供应商。人工跟进处理以及客户流失所产生的成本,可能依然由购买方承担。

一次成功与反复成功截然不同

我认为在评估智能体(Agent)的表现时,必须同时看清“成功率”到底意味着什么。因为必须一次性搞定的客户咨询,与生成多个方案后再择优挑选的任务,其要求完全不同。

Anthropic 用两个指标来解释这一点:pass@k 是尝试 k 次且至少成功一次的概率,而 pass^k 则是 k 次全部成功的概率。哪一个指标更合适,取决于业务属性。如果在多次尝试中能够挑出正确的结果,前者就很实用;但如果每次都必须向客户交付稳定的结果,那么反复成功的稳定性就至关重要。Anthropic 关于智能体评估的说明

举例来说,假设在同一项任务中,单次成功的概率是 90%,且每次尝试彼此独立。那么尝试十次至少成功一次的概率接近 100%,但十次全部成功的概率仅约为 35%。这并不意味着剩下的情况全都会十次彻底失败,而是说十次当中至少有一次失败的概率有那么高。

实际上已有研究测量了这种重复可靠性。在 2024 年 τ-bench 的零售咨询实验中,基于 GPT-4o 的智能体单次尝试成功率约为 61%,但同一任务连续八次全部成功的比例却不足 25%。由于这是当时模型与实验环境下的结果,不应直接解读为当下所有智能体的失败率。但这足以证明,仅凭平均成功率很难说明重复业务的稳定性。τ-bench 论文

如果妥善设计重试与验证机制,可以减小这种偏差。但是,额外调用、复核时间以及处理延迟所带来的成本,也必须一并计算在内。

将模型使用费与实际业务成本分开计算

下表并非实测数据,而是用于展示计算方法的假设。假设一个团队在一个月内处理了 500 起咨询,按照既定标准复核后,实际解决的为 350 起。

项目月度费用
模型与工具调用30 万韩元
监控、存储与集成20 万韩元
人工复核 40 小时 × 4 万韩元160 万韩元
失败恢复 10 小时 × 4 万韩元40 万韩元
合计250 万韩元

将 30 万韩元的模型与工具费用除以处理的 500 起,单件成本为 600 韩元。而将 250 万韩元的总成本除以实际解决的 350 起,单件成本则约为 7,143 韩元。

这两项计算在费用的统计范围和计件标准上完全不同。如果仅调整成功件数,30 万韩元 ÷ 350 起约为 857 韩元。若在此基础上再加上其余运营成本,就会达到 7,143 韩元。

在这个示例中,人工复核与恢复成本占到了总费用的 80%。因此,即便把模型与工具费用削减一半,总成本也仅从 250 万韩元降至 235 万韩元,降幅只有 6%。这并不意味着所有 AI 业务的人力成本都占 80%,而是表明,如果我们的业务成本结构与此类似,仅靠协商模型单价所能带来的节省空间是十分有限的。

要选择改进方案,必须综合考量两件事:能否以相同的成本高质量地完成更多工作,以及能否在保证质量的同时缩短复核与运营时间。如果减少了复核却导致二次咨询和故障恢复增加,那么这部分成本也必须重新计算进去。

转向按成果付费时容易忽视的环节

我在第 147 期中曾探讨过从按坐席付费向按成果付费转变的趋势。我认为这一判断至今依然成立。但从买方的角度来看,还有一些事项需要更深入地审视。仅仅因为按照更接近成果的单位而非账号数量付费,并不意味着该单位会自动等同于我们公司的成功标准。

成果数据也常用于阐述企业的成长性。Salesforce 于 6 月 15 日宣布达成以约 36 亿美元收购 Fin 的协议时,介绍了 Fin 端到端解决了平均 76% 咨询业务量的案例。发布当时预计交易将于 Salesforce 2027 财年第四季度完成。Salesforce 的收购协议公告

若要将这个数字用于评估技术引入,必须查明该结果出自何种客户企业与咨询类型,以及是将什么界定为“解决”。仅凭官方公告,很难断定在我们公司也能实现 76% 的解决率。同样,也没有充分证据表明仅仅是计费标准或某项解决率就决定了整个收购估值。

要是我的话,除了单价之外,还会重点审查成果的定义、统计标准的变更流程、出现二次咨询时的扣减条款,以及可查验记录的范围。尤其是对于将“转交人工”本身计为成果的业务,转交之后所耗费的时间也需要单独计算。

把运营与复核成本纳入报价评估

在对比 AI 引入成本时,我认为最好确认以下项目:

  1. 模型与产品的许可费及使用费
  2. 外部工具与 API 调用成本
  3. 存储、检索与网络成本
  4. 重试及失败调用的成本
  5. 制作评估数据集与质检的成本
  6. 人工复核与审批的时间
  7. 故障与错误恢复的时间
  8. 安全、培训及业务流程变更所需的成本

已经包含在产品定价中的费用无需重复累加。初期的构建费用与每月循环发生的运营费用也应区分开来。关键不在于凑齐多少个项目,而在于对所对比的每个产品都按照同等口径来核算成本。

业务计件的标准也必须因地制宜。如果是客服,可以设定为在规定时间内没有因同一问题再次咨询而结束的事件;如果是销售,可以是负责人接手的合格线索;如果是研发,则可以是经必要审查和测试后合入的代码变更。这并不意味着所有工作都必须由人工全量复查。可以将自动验证与抽样检查结合起来,但必须清楚可能会漏掉哪些错误。

每 Token 成本在改进技术细节时很有用;而单项实际完成业务的成本,在判断是否继续引入时则更为有用。应当同时观察这两个指标,但必须明确记录该数字具体计算了哪些内容。

我比节省金额更先关注的内容

当我查看 AI 引入评估资料时,会首先关注该团队把什么计为“成功”,以及这一判定是由谁做出的。因为即便计算准确,一旦对结果产生误解,应对策略也会南辕北辙。

举个例子,假设复核时间从 40 小时减少到了 10 小时。这可能是由于改进了自动验证从而减少了人工介入,但也可能是省略了确认流程。如果仅仅记录时间,很难区分这两者。必须一并审视的是实际错误、二次咨询、返工以及恢复所耗费的时间。

Fin 的推断解决也应当从这种视角来看待。在理解供应商提供的分类与事后扣减规则后,我们可以通过抽样来检验其与客户实际体验的契合程度。在盲目听信供应商的统计数据与由人工重读所有对话之间,其实还存在折中的选项。

本周不妨挑选一款正在使用的 AI 工具,一并核对上月的处理件数、按既定标准认定的解决件数,以及人工额外投入的时间。只要掌握这三个数字,就能探讨的不仅是使用费是否便宜,更是它是否真正减轻了工作负担。

💬 是否有某些业务在复核 AI 结果上耗费了大量时间?需要确认什么、为什么必须确认?欢迎分享您的经验。

参考资料与延伸阅读

值得一并阅读的往期内容

  • 第 147 期:从按坐席付费向按成果付费的转变
  • 第 180 期:围绕实际工时与计费工时的争议

安光涉(Oswarld)个人插画

作者 安光涉(Oswarld) 现任世宗大学兼任教授,INLEVEL9 战略顾问。职业经历、研究、著作与近期活动会持续更新在作者简介。 最新动态 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI