群聊里没出现的技术,就不算产品
ChatGPT达9亿人,智能体仅1,000万人

开篇
读者,上周有位名叫Joshua Miller的人,在欧洲家庭旅行途中半睡半醒地发了一篇文章。
“不觉得有点奇怪吗?居然没有人真正在用AI智能体。”
他附加的判断标准挺有意思。不是看开发者或早期采用者,而是看它在大学同学群聊里成为话题的那个瞬间——就是Instagram或TikTok刚开始传播时我们感受到的那种感觉。Miller是Arc浏览器的创始人,去年把公司以6.1亿美元(约8,500亿韩元)卖给了Atlassian。他还曾是奥巴马政府白宫的首任产品总监。正因为是行业内部人士向整个行业抛出的问题,才引发了不小的震动。
先说结论。瓶颈不在模型性能,而在于验证。谁来确认AI代劳完成的事情是否正确,这才是决定采用曲线走向的关键。
9亿人与1,000万人之间
先把数字摆出来看看。
OpenAI在7月21日宣布,Codex和ChatGPT Work加起来有1,000万人在使用。这比7月初几乎翻了一倍。同一时间点,ChatGPT本身的周活跃用户超过9亿人。
按比例算是1.1%。也就是说,每100个使用聊天机器人的人中,大概只有一个人碰过智能体(Agent)产品。
这1,000万这个数字,也很难照单全收。OpenAI既没有公开按产品划分的数据,也没公开活跃用户统计的时间区间,也没有第三方审计。我们无法知道这是只启动过一次任务的人,还是每周真正完成任务的人。顺便说一句,6月发布的一项调查显示,在使用ChatGPT或Codex的组织账户用户中,17.3%使用了Codex,但在个人账户中,这一比例不到1%。
同一时期,也有说法称Anthropic的Claude Code和Cowork规模相近。不过这不是官方发布的数据,只是相关人士的传言层面,我不打算把它当作有力依据来用。
总结一下就是这样。对部分开发者和职场人来说,一个真实存在的市场已经形成。但在普通消费者层面,用Miller(音译)的说法,它从未出现在群聊里过。
为什么偏偏只有开发者在用
这里通常会出现一种常见的解释——“因为模型还不够强”。我觉得这个解释只对了一半。
我先抛出一个问题。为什么编程会成为第一个市场?
通常的回答是“因为开发者是早期采用者”。但我认为另一个原因才更重要。编程是人类工作中极为罕见的、机器能免费告诉你有没有错的领域。编译器会抓出语法错误,测试会跑起来,CI1会弹出构建失败的提示。AI一旦胡说八道,30秒之内就会亮起红灯。
现在把普通消费者的工作放到同一个标准下看看。订机票、给客户回邮件、整理购物清单、比较保险条款。这些工作里,有哪一项自带自动评分器吗?没有。全都得靠人亲自睁大眼睛去确认。
而委托带来的好处,恰恰产生于我不必再去看的时候。如果结果还要我从头到尾重新读一遍,那就不是委托,而是拿到了一份草稿。而拿草稿这件事,聊天机器人早就在做了。没必要专门再去学一个新的分类。
所以我把这件事整理成这样一句话。
智能体的普及速度,不取决于模型性能,而取决于该领域是否存在自动验证器。
这里出现了一个悖论。聊天机器人的能力较低,却没给用户带来任何负担——问一句、读一句就结束了。智能体的能力要高得多,却给用户增加了两项新的功课:决定把什么事情交出去,以及确认结果是否正确。能力越强,认知负担反而同步上升。
这不是第一次发生这种事。2016年,Facebook开放Messenger聊天机器人平台的时候,整个行业都在说“应用的时代结束了”。不到一年,就有调查显示聊天机器人的请求处理失败率高达70%,Facebook当时大力推动的个人助理M也在2018年初悄然关闭。那时候失败的原因也不是模型。人必须逐一核对结果,与其核对,还不如自己动手更快。
市场调研机构Gartner在去年6月预测,到2027年底,超过40%的智能体式AI项目将被取消。给出的三个原因是成本上升、商业价值不明确、以及风险控制不足。同一份发布中还有更引人注目的一点:在市场上数千家智能体式AI供应商中,真正具备智能体能力的估计约130家。其余的则不过是把现有聊天机器人或RPA2换了个标签,这被诊断为所谓的“智能体清洗”3。
当然,为了保持平衡,我也要说明一下。Gartner在同一份资料中还预测,到2028年,日常业务决策中有15%将通过智能体自主完成(2024年为0%)。这并不是否定这个方向本身,而是说现在对普及速度的期待过热了。
抹去名字的产品才活下来了
米勒更大的主张不是“还没普及”。他说的是智能体不是产品,而是技术。
他这样说道:“没有人想要 AI 智能体。因为一开始就不存在这种东西。这是我们这个行业为了统称某种东西而创造出来的框架。”
依据也来自他自家的产品。据他所说,他公司打造的 AI 浏览器 Dia 中,史上最受欢迎的功能是晨间简报。打开笔记本电脑,就会出现问候语,以及从日历和邮件中提取出的今日待办事项清单,还配有一幅画之类的小东西作点缀。技术上讲,这是必须依靠智能体运转才能实现的功能。但用户不需要知道这一点。
我认为这个案例并非偶然受欢迎。晨间简报是一种即使出错也不会造成损失的工作。哪怕漏掉了一个行程安排,用户打开日历看一下就行了。验证负担几乎为零。这一设计恰好通过了前面章节提到的标准。
回顾来看,成功在消费者中落地的AI全都满足了这个条件。垃圾邮件过滤器、自动补全、地图应用的路线推荐、YouTube 推荐、照片应用的人脸整理。没有人把这些称为“AI产品”,也没有人去核对结果。错了就直接点下一个。
数字上也有旁证。Menlo Ventures 与 Morning Consult 联合调查了 5,031 名美国成年人(2025 年 4 月),结果显示,61% 的受访者表示最近 6 个月内使用过 AI。但转为付费用户的比例约为 3%。同时,71% 的人担心数据隐私,58% 的人表示不相信 AI 给出的信息。
用是用了,但不付钱,也不信结果。在这种状态下,如果对方提议“现在连执行也帮您代劳吧”,会怎样呢?要求把事情委托给一个还不信任的对象,这不是便利,而是负担。
Oswarld视角
我认为这不是技术成熟度问题,而是GTM问题。
在制定GTM战略的过程中,我反复遇到一种失败模式:把制造方的词汇原样塞给购买方。当我们把零部件的名字当作品牌来用,客户就得承担起理解这个零部件的责任。而在消费市场里,几乎没有人愿意主动承担这份责任。
回想一下,成功的产品走的都是相反的路。Salesforce卖的不是SaaS,而是“无需软件(No Software)”。苹果卖的不是硬盘容量,而是“口袋里的1000首歌”。现在这个行业在说“我们用的是智能体”。这句话和“我们的产品用的是数据库”属于同一个层次。
在这里,我最近在协助评估引入方案时,必定会加入一个问题。
“当这个智能体犯错时,谁会在什么时候察觉?”
如果对这个问题的回答是“负责人会审核结果”,那么这个项目的投资回报率通常算不出来——因为审核的人力成本会把节省下来的人力成本吃掉。反之,如果回答是“系统会自动发现”或者“出错也没有代价”,那么账才能算得通。Gartner所说的那40%里,相当一部分恐怕正是那些事后才问出这个问题的项目。
所以,如果要设计消费级智能体,路只有三条:一起把验证器也做出来(编程属于这一类);只挑选可以出错也无妨的任务(Dia的晨间简报属于这一类);或者把产出物从“需要检查的对象”变成“可供阅读的东西”。如果一个产品不属于这三者之一,却宣称“AI会帮您全部搞定”,那么它实际上是在给用户额外增加一项新的工作。
我每周都在制作一份跨越科技、经济、人文的交叉分析型新闻通讯。找出这类错位,正是这份新闻通讯要做的事。
结语
总结一下:
第一,差距是真实存在的。ChatGPT的9亿用户,对比智能体产品的1,000万用户。不过这1,000万的统计标准也没有公开。
第二,开发者之所以成为第一个市场,并不是因为他们是早期采用者,而是因为编程是机器能免费告诉你对错的罕见领域。
第三,所有真正在消费者中落地的AI,都是抹去了名字的AI。而现在这个行业却在把零件的名字当作品牌来用。
米勒的最后一句话久久留在我心里:“管它看起来像不像智能体,谁会在意呢。反正没人在用智能体。”
💬 你最近是否也曾把某件事整个交给AI去做,结果到最后还是得从头重新检查一遍结果。当时是什么任务?又是在哪个环节让你觉得不能信?欢迎在评论区分享。如果案例积累够多,我们会在下一期整理成“可委托任务的条件”。
💬 如果你也有过整个委托出去、结果又重新检查的任务,欢迎在评论区分享。我们会在下一期中反映进去。 📨 如果你身边有人正在开发智能体产品,或正在考虑引入相关产品,欢迎把这篇文章转发给他们。
参考资料与延伸阅读
核心来源
- 《Why Normal People Aren’t Using AI Agents》,WIRED,2026年8月6日。 链接 ··· 这是今天文章的出发点。米勒采访中“所有实验室都在谈论电影《她(Her)》作为愿景”这一段,最能体现整个行业想象力的单一化。
- Josh Miller(@joshm),X帖子,2026年8月。 链接 ··· 这是争论的原文。引用回复更有意思,出现了“智能体更接近编程语言”“普通人并没有那么想节省时间”这类反驳。
- 《OpenAI’s Agents Reach 10 Million Users After ChatGPT Work Debut》,Bloomberg,2026年7月21日。 链接 ··· 这是“1000万人”这个数字的原始出处。
- 《OpenAI’s Work Agents Reach 10 Million Users》,Implicator.ai,2026年7月。 链接 ··· 这篇分析指出了上述数字的统计标准为何含糊不清。组织账户17.3%对个人账户不到1%这一段,是今天文章核心论据之一。
- 《Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027》,Gartner,2025年6月25日。 链接 ··· 文中给出了在数千家供应商中,实际具备智能体能力的约仅130家的估算。这是在讨论引入方案时很好用的数字。
- Menlo Ventures与Morning Consult,《2025: The State of Consumer AI》,2025年6月。 链接 ··· 这是对5,031名美国成年人的调查。把61%的使用率与3%的付费转化率之间的差距,以及58%的人不信任AI提供的信息这一点放在一起看,就能看出委托的边界究竟在哪里。
背景知识
- 《Facebook Chatbots Hit 70% Failure Rate As Consumers Warm Up To The Tech》,MediaPost,2017年2月。 链接 ··· 这是记录2016年聊天机器人热潮如何熄灭的当时文章。它的句式结构与今天关于智能体的讨论惊人地相似。
- 《Lessons From The Failed Chatbot Revolution》,CB Insights。 链接 ··· 这份报告对聊天机器人的失败进行了事后梳理,同时也谈到了哪些行业以及为何后来又重新复活。
- 《Atlassian Enters Into Definitive Agreement to Acquire The Browser Company of New York》,Business Wire,2025年9月4日。 链接 ··· 这正是米勒发言分量所在。这是6.1亿美元收购公告的原文。
一起读会更好的往期文章
- Oswarld,INLEVEL9 Letter,“关闭20瓦大脑的人们” ··· 讨论了人把判断交给AI时,实际上减少的是什么。这与今天文章中“验证负担”的说法正好站在对立面。



