Gemini 的 10 亿用户无法用排名来解释
在前沿模型与基准测试中,有的项目相差 0.3 个百分点,有的项目相差 38 个百分点,它们却出现在同一张表格里
商业谷歌公布的数字,与没有公布的数字
2026 年 8 月 11 日,桑达尔·皮查伊在 X 上发文称,Gemini 应用的月活跃用户1已突破 10 亿。这是谷歌历史上增长最快的产品,也是继搜索、Gmail、安卓、地图、Chrome、Play、YouTube 之后,第 14 个突破 10 亿用户大关的谷歌产品。在同一份公告中,还有一个谷歌没有公布的数字:其中有多少人是付费用户。
围绕这条消息,国内经常出现一种反应:认为 Gemini 不如 GPT-6 Astra 或 Claude Fable 5.1 等顶尖模型2,只是用户数量多而已。因为数字和评价看起来互相矛盾。
把这两件事放在一起看,看到的并不是矛盾,而是另一个故事。**10 亿这个数字,不是模型排名的结果,而是分发渠道造就的数值;而性能差距,也不是单一的数字,而是随任务类型不同而变化的数值。**今天我们分别用原始资料来核实这两句话。
要先看清10 亿从哪里来
把轨迹排开,性格就显现出来了。2025 年 5 月的谷歌 I/O 上是 4 亿人,2025 年 10 月 Alphabet 三季度财报中是 6.5 亿人,2026 年 2 月是 7.5 亿人,2026 年 5 月 I/O 上是 9 亿人,7 月 22 日的二季度业绩中是 9.5 亿人。从 9.5 亿到 10 亿,用了大约 3 周。
这里要先厘清统计口径。这个 10 亿是仅以 Gemini 独立应用为准,接入搜索、Workspace、安卓中的 AI 用户并未计入其中。搜索的 AI 模式单独计算已突破月活 10 亿人,ChatGPT 则在 2026 年 6 月跨过了同一条线。也就是说,Gemini 晚了两个月才追上。
从使用方式来看,这批用户从何而来就更清楚了。在这 10 亿人中,超过 1 亿人是 iOS 用户,63% 的人不打字,而是用语音跟 Gemini 交流。谷歌在同一场发布中还强调了跨越安卓 40 款应用的任务自动化能力。每天生成 1.5 亿张图片这一数字也一并公布。
韩国是较早搭上这趟车的市场。2026 年 2 月,谷歌在安卓上以测试版形式开放基于 Gemini 的多步骤任务自动化时,韩国被列入首批上线国家,并与三星电子 Galaxy S26 系列联动。这与此前一直以美国为中心开放新功能的做法不同。
**比起主动挑选模型进来的用户,早已在使用的设备与应用中偶遇的用户,才是这个数字很大一部分的解释。**看着基准测试排行榜下载应用的人,在这 10 亿人里只是少数。
同一张表里,差距从 0.3%到 38.8%都有
那么性能这个话题该往哪走呢?正好出现了一份不错的资料。
2026 年 9 月 3 日,OpenAI 发布 GPT-6 Astra 时附上了一张对比表。这张表里,除了 Claude Fable 5.1、Claude Opus 5 之外,还放进了 Gemini 3.8 Flash 这一列。读这份资料时要先有个前提:这是竞争对手为了衬托自家模型而挑选的项目——正因如此,Flash 领先的那些格子反而更值得注意。
只挑出标有 Flash 分数的项目,按差距大小排列如下。
| 项目 | Gemini 3.8 Flash | GPT-6 Astra | 差距 |
|---|---|---|---|
| DeepSWE v1.1(长周期软件工程) | 73.8% | 74.1% | 0.3% |
| GPQA Diamond(研究生水平科学推理) | 95.3% | 96.0% | 0.7% |
| Artificial Analysis Intelligence Index v4.1.1 | 58.7 | 61.2 | 2.5 分 |
| Artificial Analysis Coding Agent Index v1.4 | 61.2 | 67.0 | 5.8 分 |
| FrontierCode 1.1 Main | 43.6% | 53.3% | 9.7% |
| HealthBench Professional | 52.1% | 63.4% | 11.3% |
| Terminal-Bench 4.0(长时间终端任务)3 | 19.1% | 57.9% | 38.8% |
DeepSWE v1.1 值得多看一眼。同一张表里,Claude Opus 5 是 73.7%,Claude Fable 5.1 是 67.4%。也就是说,贴着前沿价格标签的三个模型里,有两个的分数低于 Flash。谷歌自己在发布内容里也提到了这个基准,写道 3.8 Flash 领先于大多数体量更大的前沿模型,而成本只是其中一小部分。
在另一端是 Terminal-Bench 4.0。19.1% 对 57.9%,这不是靠调整就能填平的差距。在需要自主串联多个步骤、长时间运行的任务上,这两个模型是完全不同的东西。
读这份资料时要附加三个条件。第一,OpenAI 明确表示,这些分数是“在任意努力水平下的最大值”,可能和实际运营时使用的配置不同。第二,竞争对手模型的分数,是 OpenAI 在自己的环境里测出来的,或者是复现公开排行榜得出的数值,条件并不完全一致。第三,表格里有多行的 Flash 那一格是空的,意味着还有一些领域尚未被测量。
尽管如此,有一点是确定的。“是不是前沿模型”是一个只有一格的问题,但实际的差距在各个项目之间,从 0.3% 散布到 38.8%。 组织需要回答的不是等级,而是分配。
代币价格差13倍,不代表账单也会差13倍
看价目表,就能明白为什么这种分工会变成钱的问题。
Gemini 3.8 Flash 每 100 万输入代币4为 0.75 美元,每 100 万输出代币为 3.75 美元。这是推出期优惠价,将于 2026 年 12 月 31 日结束,从 2027 年 1 月 1 日起分别调整为 1.50 美元和 7.50 美元。GPT-6 Astra 每 100 万输入代币为 10 美元,每 100 万输出代币为 50 美元。将速度提升 2 倍的快速模式,价格也是 2 倍。
假设一个任务单元的输入为 100 万代币、输出为 20 万代币,计算结果如下。Flash 为 0.75 美元加上 0.75 美元,共 1.50 美元;Astra 为 10 美元加上 10 美元,共 20 美元。相差约 13.3 倍。若按 2027 年 1 月之后 Flash 的正式定价重新计算,则为 3.00 美元,差距缩小到约 6.7 倍。这是任意设定输入输出比例后得出的计算结果,读者应代入自己实际业务的比例重新计算。
但谷歌自己写明了不能止步于此的理由。3.8 Flash 被设计为在复杂任务中执行更多推理步骤、反复调用工具,努力程度越高,消耗的代币就可能越多。谷歌建议在追求效率优先的任务中降低努力程度,或者继续使用 3.7 Flash。这是一句写在自家新品发布文里的话——“我们的新模型可能会用掉更多代币”。
也存在相反方向的情况。OpenAI 表示,在 Agents’ Last Exam 测试中,Astra 使用的输出代币比 Claude Opus 5 少约 65%;在 Terminal-Bench 4.0 测试中,相比 Fable 5.1,每项任务的预估 API 成本低约 63%。
所以真正的比较单位,不是代币单价,而是完成一件工作所需的总费用。 单价便宜 13 倍的模型如果要把同一件事重试三次,这个倍数很快就会缩水。反过来,单价更贵的模型若能一次做完,账单结果也可能被逆转。第 68 期我写过代币价格会改变团队的选择,而现在需要再往前多想一步。不能只看价目表,还要一并看完成率。
苹果与三星实际验证过的标准
已经有组织解决过这道分配难题的记录了。
2026年1月12日,苹果与谷歌发布了联合声明。内容是将下一代苹果基础模型建立在谷歌的Gemini模型与云技术之上,由此打造出的模型将支撑今年推出的、包括更加个性化的Siri在内的Apple Intelligence功能。苹果写道:“经过缜密评估,我们判断谷歌的AI技术为苹果基础模型提供了最强大的基础。”
Joint statement from Google and AppleApple and Google have entered into a multi-year collaboration under which the next generation of Apple Foundation Models will be based on Google’s Gemini models and clou…如果直译这段文字,苹果给出的理由并非通用性,而是作为基础的性能。不过看合同中包含的条款,还有另一层意味——不只是模型,云也被绑定在一起了。4月,在Google Cloud Next上,Thomas Kurian登台确认,谷歌云作为苹果首选的云服务提供商,正与苹果共同开发以Gemini为基础的苹果基础模型。
Samsung SDS Strengthens Strategic Partnership with Google Cloud to Expand Presence in AI, Cloud, and Security | News | SSamsung SDS announced a strategic partnership with Google Cloud to strengthen collaboration in the areas of AI, cloud, and security, at “Google Cloud Next 2026” held in Las Vegas, U.S., on April 23 (A国内的案例也出现在同一个月。2026年7月13日,谷歌云宣布向三星电子DX部门供应Gemini Enterprise,次日在说明会上,Google Cloud Korea社长Ruth Sun表示,三星电子综合考量了性能、安全性、价值与投资回报率,并让员工亲自试用后作出评估。谷歌云将这份合同称为韩国企业引入agentic AI案例中规模最大的一次。同一场合上,谷歌强调的差异化优势之一,就是可以在包括Claude在内的200余个模型中自由选择。
也就是说,连销售平台的一方也没有主张单一模型才是赢家。
这三个案例中反复出现同一件事:**没有任何一方把跑分第一列为采购标准。**苹果买下的是承载自家模型的基础,以及运行这个基础所需的基础设施;三星则把性能、安全性、成本效益与实际使用体验放在一起综合权衡。
Oswarld视角
我在做咨询时反复说过一句话:并非所有工作都需要前沿模型。上面这张表把这句话打磨得更精确了一些。不是不需要,而是需要的工作和不需要的工作混杂在同一个组织里。在需要长时间自主执行的任务上,38.8% 会原封不动地变成成本;而在定型化的推理与代码任务上,为了 0.3% 多付 13 倍的理由就站不住脚了。
这也是我为什么会留意 Gemini 3.8 Flash 这类模型作为业务用途的原因。仅凭“快且便宜”还不够,真正改变条件的是,表格里还留有便宜模型确实能与前沿模型正面较量的那一格。不过“不算前沿级”这种说法,我现在用起来变得谨慎了。谷歌把 3.8 Flash 介绍为自家最智能的主力模型,也是迄今为止最强的推理与编程模型;OpenAI 则把这个模型放进了自家前沿发布的对比表里。与其用等级名称称呼它,不如用贴着价签所在的位置来称呼它,这样更准确。
我想把 AGI 的话题接到这里。我倾向于把 AGI 理解为人工智能被普遍地(General)使用的状态,按这个定义,离目标最近的存在也许反而是 Gemini。这不是毫无根据的重新定义。OpenAI 的章程写道,AGI 是“在大多数具有经济价值的工作中超越人类的高度自主系统”。这句话里,条件不只是能力,还附加了具有经济价值的工作这一条件。能力要触及到工作,就必须经过部署这一环节。
反方意见我也要明确写下来。在学界和业界通用的定义中,AGI 的“General”指的是能力的范围,而不是部署的范围。谷歌 DeepMind 在 2023 年提出的 AGI 等级体系,把 ChatGPT 和 Gemini 都归为“初级 AGI”,认为它们虽能在广泛领域运作,但在大多数领域都达不到熟练人类的中位水平。按这个标准,10 亿用户并不能给它升级。我的主张不是“Gemini 更接近 AGI”,而是**“AGI”这个词把能力和普及这两个不同的维度捆绑成了一个词,导致现在的争论一直对不上焦**。
关于苹果的选择,我也想把我的解读和官方说法分开来写。苹果写的理由是“最有能力的基座”。但我的读法不同:苹果买下的不是排行榜第一的模型,而是能架在 20 亿台设备之上的基座,以及运行它所需的基础设施。合约里连云服务也一并打包进去,这就是我这么读的依据。在第 124 期里我写过,苹果选择的是最大规模的部署,而不是最强的模型;当时没做的那道算术题,就是这次这张表。选择部署一方在性能上放弃了什么,如今按项目都能看清楚了。
再补一点。只要安卓和搜索这两条通路还在,我认为 Gemini 的用户还会继续增加,但这只是预测,并非已确认的事实。谷歌没有公布付费订阅用户数这一点,也要一并放在这里看待。因预装而接触到产品的用户,和决定付费的用户,是两个不同的数字。
结语
总结一下就是这样。Gemini 的 10 亿用户,不是模型排名做出来的数字,而是安卓、搜索、设备合约这条路径做出来的数字。而站在这条路径上的模型,在某些任务上与前沿模型只差 0.3%,在某些任务上却相差 38.8%。这两句话同时成立。
如果读者这个月要决定模型开支,我认为顺序应该这样定:先把我们的业务分成需要长时间自主执行的和不需要的,然后从后者开始,把挂在上面的前沿模型调用降下来,重新核算每件任务的单价。不是按 token 单价算,而是按跑完全程的总额算。
剩下的局限也要写清楚。上面这张表是 OpenAI 刊登在自家发布中的资料,基准是最大努力设置,而且 Flash 一栏有好几行是空的。Gemini 3.8 Flash 的引入价将于 2026 年 12 月 31 日结束。现在算出来的 13 倍,到明年 1 月就会变成约 6.7 倍。以价格为基础定下的分配标准,到那天必须重新审视一次。
💬 现在用前沿模型跑的任务里,有没有哪一项您觉得换成 workhorse 也会得到同样结果?欢迎在评论里告诉我是哪项任务。
📨 如果身边有同事正在写这个季度的 AI 费用申请,哪怕只是这篇文章里价格计算的部分,也请转发给他们。
参考资料与延伸阅读
核心来源
- Google,“Introducing Gemini 3.8 Flash and 3.8 Flash Cyber”,2026.9.2。⋯⋯ 价格与推出价格截止日期写在脚注里。“如果效率优先,就用 3.7 Flash”这一段是这篇文章里最有实用价值的部分。
- OpenAI,“GPT-6 Astra: A new generation of intelligence”,2026.9.3。⋯⋯ 是正文表格的原始资料。直接看页面下方比较表里 Gemini 3.8 Flash 那一列,也能确认空白栏的位置。
- Google·Apple,“Joint statement from Google and Apple”,2026.1.12。⋯⋯ 是只有四段的简短声明,要确认苹果所举理由的原文表述,得看这份文件。
- TechCrunch,“Google’s Gemini app surges to 1 billion users”,2026.8.11。⋯⋯ 这篇文章明确写出 10 亿是以单独应用为准,与搜索的 AI 模式是分开计算的。
- Newsis,“三星为何选择“Gemini”作为办公用 AI”,2026.7.14。⋯⋯ 国内规模最大的采用案例,其选定标准以厂商发言的形式整理在文中。
背景知识
- 9to5Google,“Gemini app hits 1 billion monthly users”,2026.8.11。⋯⋯ 是 iOS 用户 1 亿人、语音使用占比 63% 等使用模式数据的出处。
- OpenAI,“OpenAI Charter”,2018.4。⋯⋯ AGI 的定义句就在这里。“具有经济价值的工作”这一条件,建议直接查看原文确认。
- METR,“AGI: Definitions and Potential Impacts”。⋯⋯ 这份文件把从 1997 年的定义到 DeepMind 的五级体系并列展示,说明了争论为何总是对不上焦点。
- ZDNet Korea,“谷歌 Gemini,安卓上的 AI 自动化测试版⋯韩国・Galaxy S26 首批适用”,2026.2.26。⋯⋯ 整理了韩国被纳入首批发布国家的背景。
相关往期
- 苹果向谷歌支付 1 万亿韩元的真正原因(第 124 期)
- 一个 token 的价格改变的那些事(第 68 期)
- 是美国的两倍,韩国花在 AI 上的时间(第 206 期)
📝 术语说明
注释
-
月活跃用户(MAU):指一个月内至少实际使用过一次该服务的人数。它不同于注册人数,也不同于统计每天使用者的日活跃用户。 ↩
-
前沿模型(Frontier Model):是业界用来指代各公司在当时推出的最高水平模型的说法。这并不是一个有官方认证标准的词,各公司对“前沿”范围的界定也略有不同。 ↩
-
Terminal-Bench:是用来测试 AI 能否在终端环境中,经过多个步骤独立完成软件任务或系统设置等工作的测试平台。它看重的不是能否答得漂亮,而是能否把任务完整做完。 ↩
-
Token:是模型在处理文本时使用的最小单位。韩语通常一个字会被拆分成一个以上的 token,因此即使内容量相同,token 数往往也比英语更多。费用正是按照这个 token 数来计算的。 ↩
