Gemini 3:Google 把「满配」旗舰押在推理与 Agent 上

Google
Gemini
大模型
AI
评测
2026/10/4
·

阅读时间: 大约 11 分钟

Gemini 3:Google 把「满配」旗舰押在推理与 Agent 上

Gemini 3 官方全量基准对比表(Gemini 3 Pro vs 2.5 Pro / Claude Sonnet 4.5 / GPT-5.1)

2025 年 11 月 18 日,Google CEO Sundar Pichai 与 DeepMind 的 Demis Hassabis、Koray Kavukcuoglu 共同署名,发布了 Gemini 3——官方口径里「我们有史以来最智能的模型」。它以 Gemini 3 Pro 预览版 的形态当天进入 Gemini App、AI Studio、Vertex AI 与新发布的 Agent 开发平台 Antigravity,同时推出强化推理的 Deep Think 模式。本文不重复公关稿,而是基于其官方自评基准表,看清楚这代模型到底强在哪、哪些数字有前提、以及宣传语与表格之间的落差。

一、背景:Google 的「全栈」叙事

Pichai 在开篇给了一组大盘数字:AI Overviews 月活 20 亿、Gemini App 月活 6.5 亿、70% 的 Cloud 客户在用其 AI、1300 万开发者基于其生成式模型开发。这组数字的潜台词是——Google 卖的不是单个模型,而是「自研芯片基础设施 → 模型 → 开发者工具 → 搜索/Workspace 十亿级产品」的闭环。Gemini 3 的发布因此不只是模型升级,而是这套全栈第一次在搜索首日就随新版模型一起上线(AI Mode in Search)。

二、Pro 版基准:一张表看清强弱分布

官方公布的 Gemini 3 Pro(无工具)成绩里,最常被引用的几个:LMArena 1501 Elo(登顶)、GPQA Diamond 91.9%、Humanity’s Last Exam 37.5%、MathArena Apex 23.4%、多模态 MMMU-Pro 81%、Video-MMMU 87.6%、事实性 SimpleQA Verified 72.1%。

但把整张官方表读完,强弱分布其实很不均匀:

基准(条件)Gemini 3 ProGemini 2.5 ProClaude Sonnet 4.5GPT-5.1
HLE(无工具)37.5%21.6%13.7%26.5%
GPQA Diamond(无工具)91.9%86.4%83.4%88.1%
MathArena Apex23.4%0.5%1.6%1.0%
LiveCodeBench Pro(Elo)2,4391,7751,4182,243
Terminal-Bench 2.054.2%32.6%42.8%47.6%
SWE-Bench Verified(单次)76.2%59.6%77.2%76.3%
ScreenSpot-Pro72.7%11.4%36.2%3.5%
Vending-Bench 2(净资产均值)$5,478$574$3,839$1,473
MRCR v2(1M pointwise)26.3%16.4%不支持不支持

三、Deep Think:用更多思考换更难的题

Deep Think 是一个「想得更久」的推理模式,不在首日开放,而是先给安全测试者、之后再向 Google AI Ultra 订阅者推送。官方给出的对比是:

Gemini 3 Deep Think 与 Pro、上代及竞品在 HLE / GPQA / ARC-AGI-2 上的对比

  • HLE:Deep Think 41.0%,Pro 为 37.5%;
  • GPQA Diamond:Deep Think 93.8%,Pro 为 91.9%;
  • ARC-AGI-2:Deep Think 45.1%(带代码执行,ARC Prize Verified),Pro 为 31.1%。

注意这张图里 ARC-AGI-2 的 Deep Think 柱子是**斜纹(tools on)**填充,而 HLE、GPQA 标注的是 Tools off——三组数字并不在同一「工具使用」口径下,横向比时必须连同条件一起读。

四、Agentic 是这代的真正卖点

比起单点跑分,Google 这次更想卖的是「端到端干活」的能力。三块拼图:

  1. WebDev Arena 1487 Elo 登顶、Terminal-Bench 2.0 54.2%、τ2-bench 85.4%,主打 vibe coding 与终端工具调用;
  2. Google Antigravity:一个新的 Agent-first 开发平台,把 Agent 从 IDE 侧边栏提升到「独立面板」,可直接操作编辑器、终端、浏览器,并自己验证自己写的代码——它还同时捆绑了 Gemini 2.5 Computer Use(浏览器控制)和 Nano Banana(Gemini 2.5 Image 图像编辑);
  3. Vending-Bench 2 长程规划:模拟经营一台自动售货机整整一年,Gemini 3 Pro 净资产均值 $5,478,远超 2.5 Pro 的 $574。

Vending-Bench 2:模拟经营一整年,Gemini 3 Pro 的净资产均值显著高于其他前沿模型

四点五、发布即全量铺开:不止是模型

值得单独一说的是这次的分发节奏。Gemini 3 Pro 上线当天就同时抵达五个入口:面向普通用户的 Gemini App、面向开发者的 AI Studio 与 Vertex AI、面向企业的 Gemini Enterprise,以及新平台 Antigravity;第三方侧还接进了 Cursor、GitHub、JetBrains、Manus、Replit。更关键的是,这是 Google 第一次让新模型在搜索(AI Mode)上线首日就随版本一起发布——等于把模型能力直接灌进了它月活 20 亿的 AI Overviews。这种「模型—工具—产品—搜索」同一天打通的节奏,正是 Pichai 在开篇强调的全栈打法:benchmark 的故事最终要落到「你明天打开搜索就能用到」。

五、评测方法批判:宣传语没说出口的部分

这是本文最想强调的一节。官方说「Gemini 3 Pro 在每一个主要基准上都显著超过 2.5 Pro」——这句话成立,但它没有说「全面超越所有竞品」,而表格里至少有三处落差:

  • SWE-Bench Verified 上它并没有赢:Gemini 3 Pro 76.2%,反而略低于 Claude Sonnet 4.5 的 77.2%、也基本追平 GPT-5.1 的 76.3%。考虑到官方称其为「我们做过最好的编码 Agent 模型」,这个单项需要读者自己打个折;
  • 条件不统一:HLE/GPQA 是「无工具」,ARC-AGI-2 Deep Think 是「带代码执行」,AIME 2025 拆开「无工具 95.0% / 带代码执行 100%」。脱离这些条件谈「91.9%」「45.1%」都是不严谨的;
  • 对比模型由 Google 自己跑:表里 Claude Sonnet 4.5、GPT-5.1 等成绩是 Google 按自家方法论(deepmind.google/models/evals-methodology/gemini-3-pro)测得的,不是各厂商官方数字,存在测试集污染与路由选择的天然偏向;
  • 1M 长上下文其实仍弱:MRCR v2 的 1M pointwise 只有 26.3%(128k 平均还有 77.0%)——「100 万 token 上下文」听着唬人,但在最长刻度上的实际检索准确率仍不到三成;
  • Deep Think 尚未 GA:发稿时它只在安全测试者手里,Ultra 订阅者要「未来几周」才用上,现在评价其体感为时尚早。

六、优势与局限

优势:

  1. 无工具推理(HLE、GPQA、MathArena Apex)确实拉开身位,尤其数学竞赛类断层领先;
  2. 屏幕理解 ScreenSpot-Pro 72.7%、视频理解 Video-MMMU 87.6%,多模态与「看懂屏幕」能力是真护城河;
  3. 全栈一体化:模型即日进搜索、Antigravity 把 Agent 变成主动执行者,落地链路最短。

局限:

  1. 编码 Agent 的旗舰口碑单项(SWE-Bench)并未胜出,宣传与表格有温差;
  2. Deep Think 延迟与成本代价官方未披露,且尚未正式开放;
  3. 1M 上下文的极长检索准确率低,长文档别盲目堆 token;
  4. 全部数字为厂商自评,第三方独立复测尚未充分展开。

七、谁该关注

  • 重度使用 Google 生态、需要多模态 + 长上下文 + Agent 自动干活的开发者,Antigravity 值得第一时间试;
  • 做数学/科学推理、屏幕与视频理解产品的团队,这代是当前第一梯队;
  • 但如果你的核心场景就是写生产级代码、过 SWE-Bench 类验证,建议同时跑一遍 Claude Sonnet 4.5 再下结论——表格已经替它说了话。

参考来源