商业第 207 期

群聊里没出现的技术,就不算产品

ChatGPT达9亿人,智能体仅1,000万人

群聊里没出现的技术,就不算产品

开篇

读者,上周有位名叫Joshua Miller的人,在欧洲家庭旅行途中半睡半醒地发了一篇文章。

“不觉得有点奇怪吗?居然没有人真正在用AI智能体。”

他附加的判断标准挺有意思。不是看开发者或早期采用者,而是看它在大学同学群聊里成为话题的那个瞬间——就是Instagram或TikTok刚开始传播时我们感受到的那种感觉。Miller是Arc浏览器的创始人,去年把公司以6.1亿美元(约8,500亿韩元)卖给了Atlassian。他还曾是奥巴马政府白宫的首任产品总监。正因为是行业内部人士向整个行业抛出的问题,才引发了不小的震动。

先说结论。瓶颈不在模型性能,而在于验证。谁来确认AI代劳完成的事情是否正确,这才是决定采用曲线走向的关键。


9亿人与1,000万人之间

先把数字摆出来看看。

OpenAI在7月21日宣布,Codex和ChatGPT Work加起来有1,000万人在使用。这比7月初几乎翻了一倍。同一时间点,ChatGPT本身的周活跃用户超过9亿人。

按比例算是1.1%。也就是说,每100个使用聊天机器人的人中,大概只有一个人碰过智能体(Agent)产品。

这1,000万这个数字,也很难照单全收。OpenAI既没有公开按产品划分的数据,也没公开活跃用户统计的时间区间,也没有第三方审计。我们无法知道这是只启动过一次任务的人,还是每周真正完成任务的人。顺便说一句,6月发布的一项调查显示,在使用ChatGPT或Codex的组织账户用户中,17.3%使用了Codex,但在个人账户中,这一比例不到1%。

同一时期,也有说法称Anthropic的Claude Code和Cowork规模相近。不过这不是官方发布的数据,只是相关人士的传言层面,我不打算把它当作有力依据来用。

总结一下就是这样。对部分开发者和职场人来说,一个真实存在的市场已经形成。但在普通消费者层面,用Miller(音译)的说法,它从未出现在群聊里过。


为什么偏偏只有开发者在用

这里通常会出现一种常见的解释——“因为模型还不够强”。我觉得这个解释只对了一半。

我先抛出一个问题。为什么编程会成为第一个市场?

通常的回答是“因为开发者是早期采用者”。但我认为另一个原因才更重要。编程是人类工作中极为罕见的、机器能免费告诉你有没有错的领域。编译器会抓出语法错误,测试会跑起来,CI1会弹出构建失败的提示。AI一旦胡说八道,30秒之内就会亮起红灯。

现在把普通消费者的工作放到同一个标准下看看。订机票、给客户回邮件、整理购物清单、比较保险条款。这些工作里,有哪一项自带自动评分器吗?没有。全都得靠人亲自睁大眼睛去确认。

而委托带来的好处,恰恰产生于我不必再去看的时候。如果结果还要我从头到尾重新读一遍,那就不是委托,而是拿到了一份草稿。而拿草稿这件事,聊天机器人早就在做了。没必要专门再去学一个新的分类。

所以我把这件事整理成这样一句话。

智能体的普及速度,不取决于模型性能,而取决于该领域是否存在自动验证器

这里出现了一个悖论。聊天机器人的能力较低,却没给用户带来任何负担——问一句、读一句就结束了。智能体的能力要高得多,却给用户增加了两项新的功课:决定把什么事情交出去,以及确认结果是否正确。能力越强,认知负担反而同步上升。

这不是第一次发生这种事。2016年,Facebook开放Messenger聊天机器人平台的时候,整个行业都在说“应用的时代结束了”。不到一年,就有调查显示聊天机器人的请求处理失败率高达70%,Facebook当时大力推动的个人助理M也在2018年初悄然关闭。那时候失败的原因也不是模型。人必须逐一核对结果,与其核对,还不如自己动手更快。

市场调研机构Gartner在去年6月预测,到2027年底,超过40%的智能体式AI项目将被取消。给出的三个原因是成本上升、商业价值不明确、以及风险控制不足。同一份发布中还有更引人注目的一点:在市场上数千家智能体式AI供应商中,真正具备智能体能力的估计约130家。其余的则不过是把现有聊天机器人或RPA2换了个标签,这被诊断为所谓的“智能体清洗”3

当然,为了保持平衡,我也要说明一下。Gartner在同一份资料中还预测,到2028年,日常业务决策中有15%将通过智能体自主完成(2024年为0%)。这并不是否定这个方向本身,而是说现在对普及速度的期待过热了。


抹去名字的产品才活下来了

米勒更大的主张不是“还没普及”。他说的是智能体不是产品,而是技术

他这样说道:“没有人想要 AI 智能体。因为一开始就不存在这种东西。这是我们这个行业为了统称某种东西而创造出来的框架。”

依据也来自他自家的产品。据他所说,他公司打造的 AI 浏览器 Dia 中,史上最受欢迎的功能是晨间简报。打开笔记本电脑,就会出现问候语,以及从日历和邮件中提取出的今日待办事项清单,还配有一幅画之类的小东西作点缀。技术上讲,这是必须依靠智能体运转才能实现的功能。但用户不需要知道这一点。

我认为这个案例并非偶然受欢迎。晨间简报是一种即使出错也不会造成损失的工作。哪怕漏掉了一个行程安排,用户打开日历看一下就行了。验证负担几乎为零。这一设计恰好通过了前面章节提到的标准。

回顾来看,成功在消费者中落地的AI全都满足了这个条件。垃圾邮件过滤器、自动补全、地图应用的路线推荐、YouTube 推荐、照片应用的人脸整理。没有人把这些称为“AI产品”,也没有人去核对结果。错了就直接点下一个。

数字上也有旁证。Menlo Ventures 与 Morning Consult 联合调查了 5,031 名美国成年人(2025 年 4 月),结果显示,61% 的受访者表示最近 6 个月内使用过 AI。但转为付费用户的比例约为 3%。同时,71% 的人担心数据隐私,58% 的人表示不相信 AI 给出的信息

用是用了,但不付钱,也不信结果。在这种状态下,如果对方提议“现在连执行也帮您代劳吧”,会怎样呢?要求把事情委托给一个还不信任的对象,这不是便利,而是负担。


Oswarld视角

我认为这不是技术成熟度问题,而是GTM问题

在制定GTM战略的过程中,我反复遇到一种失败模式:把制造方的词汇原样塞给购买方。当我们把零部件的名字当作品牌来用,客户就得承担起理解这个零部件的责任。而在消费市场里,几乎没有人愿意主动承担这份责任。

回想一下,成功的产品走的都是相反的路。Salesforce卖的不是SaaS,而是“无需软件(No Software)”。苹果卖的不是硬盘容量,而是“口袋里的1000首歌”。现在这个行业在说“我们用的是智能体”。这句话和“我们的产品用的是数据库”属于同一个层次。

agent在这里,我最近在协助评估引入方案时,必定会加入一个问题。

“当这个智能体犯错时,谁会在什么时候察觉?”

如果对这个问题的回答是“负责人会审核结果”,那么这个项目的投资回报率通常算不出来——因为审核的人力成本会把节省下来的人力成本吃掉。反之,如果回答是“系统会自动发现”或者“出错也没有代价”,那么账才能算得通。Gartner所说的那40%里,相当一部分恐怕正是那些事后才问出这个问题的项目。

所以,如果要设计消费级智能体,路只有三条:一起把验证器也做出来(编程属于这一类);只挑选可以出错也无妨的任务(Dia的晨间简报属于这一类);或者把产出物从“需要检查的对象”变成“可供阅读的东西”。如果一个产品不属于这三者之一,却宣称“AI会帮您全部搞定”,那么它实际上是在给用户额外增加一项新的工作。

我每周都在制作一份跨越科技、经济、人文的交叉分析型新闻通讯。找出这类错位,正是这份新闻通讯要做的事。


结语

总结一下:

第一,差距是真实存在的。ChatGPT的9亿用户,对比智能体产品的1,000万用户。不过这1,000万的统计标准也没有公开。

第二,开发者之所以成为第一个市场,并不是因为他们是早期采用者,而是因为编程是机器能免费告诉你对错的罕见领域

第三,所有真正在消费者中落地的AI,都是抹去了名字的AI。而现在这个行业却在把零件的名字当作品牌来用。

米勒的最后一句话久久留在我心里:“管它看起来像不像智能体,谁会在意呢。反正没人在用智能体。”

💬 你最近是否也曾把某件事整个交给AI去做,结果到最后还是得从头重新检查一遍结果。当时是什么任务?又是在哪个环节让你觉得不能信?欢迎在评论区分享。如果案例积累够多,我们会在下一期整理成“可委托任务的条件”。


💬 如果你也有过整个委托出去、结果又重新检查的任务,欢迎在评论区分享。我们会在下一期中反映进去。 📨 如果你身边有人正在开发智能体产品,或正在考虑引入相关产品,欢迎把这篇文章转发给他们。


参考资料与延伸阅读

核心来源

  • 《Why Normal People Aren’t Using AI Agents》,WIRED,2026年8月6日。 链接 ··· 这是今天文章的出发点。米勒采访中“所有实验室都在谈论电影《她(Her)》作为愿景”这一段,最能体现整个行业想象力的单一化。
  • Josh Miller(@joshm),X帖子,2026年8月。 链接 ··· 这是争论的原文。引用回复更有意思,出现了“智能体更接近编程语言”“普通人并没有那么想节省时间”这类反驳。
  • 《OpenAI’s Agents Reach 10 Million Users After ChatGPT Work Debut》,Bloomberg,2026年7月21日。 链接 ··· 这是“1000万人”这个数字的原始出处。
  • 《OpenAI’s Work Agents Reach 10 Million Users》,Implicator.ai,2026年7月。 链接 ··· 这篇分析指出了上述数字的统计标准为何含糊不清。组织账户17.3%对个人账户不到1%这一段,是今天文章核心论据之一。
  • 《Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027》,Gartner,2025年6月25日。 链接 ··· 文中给出了在数千家供应商中,实际具备智能体能力的约仅130家的估算。这是在讨论引入方案时很好用的数字。
  • Menlo Ventures与Morning Consult,《2025: The State of Consumer AI》,2025年6月。 链接 ··· 这是对5,031名美国成年人的调查。把61%的使用率与3%的付费转化率之间的差距,以及58%的人不信任AI提供的信息这一点放在一起看,就能看出委托的边界究竟在哪里。

背景知识

  • 《Facebook Chatbots Hit 70% Failure Rate As Consumers Warm Up To The Tech》,MediaPost,2017年2月。 链接 ··· 这是记录2016年聊天机器人热潮如何熄灭的当时文章。它的句式结构与今天关于智能体的讨论惊人地相似。
  • 《Lessons From The Failed Chatbot Revolution》,CB Insights链接 ··· 这份报告对聊天机器人的失败进行了事后梳理,同时也谈到了哪些行业以及为何后来又重新复活。
  • 《Atlassian Enters Into Definitive Agreement to Acquire The Browser Company of New York》,Business Wire,2025年9月4日。 链接 ··· 这正是米勒发言分量所在。这是6.1亿美元收购公告的原文。

一起读会更好的往期文章

  • Oswarld,INLEVEL9 Letter,“关闭20瓦大脑的人们” ··· 讨论了人把判断交给AI时,实际上减少的是什么。这与今天文章中“验证负担”的说法正好站在对立面。

📝 术语说明

安光涉个人插画

作者安光涉是世宗大学经营学教授,也是 INLEVEL9首席顾问。他在大学教授经营数据管理、商业分析等统计与数据分析课程,同时在产业现场负责 GTM 与人工智能战略咨询,设计技术与商业的连接方式。他曾发表关于 AI 对话系统记忆架构(HEMA)的学术论文,并运营每日策展全球 AI 论文的 Daily Arxiv 项目。他毕业于高丽大学技术经营专业研究生院与 KMBA,著有《把思考交出去的人:Homo Brainless》。

注释

  1. CI(Continuous Integration,持续集成):每次修改代码时都自动进行构建和测试的机制。在人工确认之前先由机器捕捉错误,这正是今天文章的核心之处。

  2. RPA(Robotic Process Automation):按照既定规则自动执行人此前用鼠标和键盘完成的重复性工作的软件。它不会自行做判断,因此与智能体属于不同层次。

  3. 智能体洗白(Agent washing):指把现有的聊天机器人或自动化工具,仅换上“AI智能体”这个名字重新包装出售的做法。这个说法借用了并非真正环保却自称环保的“绿色洗白(green washing)”一词。