HelloAI
📄 论文精读 🏆 必读经典 · 2025 · Google DeepMind 2024-2025

Gemini 2.0 / 2.5 技术报告

Google DeepMind
📖 如果你只读一段,读这段
Google 第二代旗舰多模态:原生支持文本/图像/音频/视频 I/O,2M token 上下文(业界最长),实时 Multimodal Live API。Google 重回 AI 第一梯队的标志。
#Gemini#Google#多模态#L4#L5

为什么这篇重要

Google DeepMind 2024 末发布 Gemini 2.0 —— Google 在 AI 竞赛里的”翻身仗”

之前两年:

  • GPT-4 抢走了”最强 LLM”光环
  • Anthropic 抢走了”长上下文 + 安全”赛道
  • Google 第一代 Gemini 1.0 / 1.5 反响平平

Gemini 2.0 / 2.5 翻身的关键

  1. 原生多模态(不是后加上去的)
  2. 2M token 上下文(业界最长)
  3. Multimodal Live API(实时双向音视频)
  4. Deep Research 等新颖产品形态

三件大事

1. 原生多模态

Gemini 从设计之初就是多模态融合

输入:文本 + 图像 + 音频 + 视频 + 代码
       全部 token 化进同一序列
       
模型:统一处理(不是分别的 encoder)

输出:文本 + 图像 + 音频

跟 GPT-4o 类似 —— 但 Google 比 OpenAI 更早走这个方向。

优势

  • 跨模态对齐更紧密
  • 视频理解能力强(一帧帧序列化处理)
  • 实时音视频更顺滑

2. 2M token 上下文

业界最长。意味着:

  • 一次塞进 一整本书(约 1500 页)
  • 一次塞进 整个代码库(10 万行)
  • 一次分析 几小时的视频

实现关键:

  • 改进的 Ring Attention
  • 高效 KV cache 压缩
  • 训练时就用长序列样本

实测 2M 上下文里 “needle in haystack”(在 2M 文字中找一句话)准确率仍 > 99%。

3. Multimodal Live API

实时双向多模态

用户:开摄像头 + 麦克风
模型:流式分析视频 + 听语音
返回:实时语音回复 + 文本注解

应用场景:

  • 视障辅助(描述眼前的世界)
  • 实时翻译
  • AI 教学助手(看你的屏幕讲解)
  • 客服对话

OpenAI Realtime API 类似,但 Google 集成度更高。

模型规格

型号时间定位
Gemini 2.0 Flash2024-12旗舰高速版(默认)
Gemini 2.0 Flash Thinking2024-12带”思考”过程的推理模型
Gemini 2.0 Pro2025-02大模型版
Gemini 2.5 Pro2025-03当时最强 Google 模型
Gemini 2.5 Flash2025-04速度 + 成本优化

Gemini Nano —— 设备端 1-2B 模型,跑 Pixel 手机。

性能

Gemini 2.5 Pro 在 2025 H1 实测:

任务Gemini 2.5 ProGPT-5 (估)Claude Opus 4.6
MMLU899190
数学(MATH)919592
代码(SWE-bench)526070
多模态(MMMU)787572
长上下文(2M)业界唯一

多模态 + 长上下文上 Gemini 占优。 代码上 Claude 仍最强。 数学 / 推理 OpenAI 略微领先。

Deep Research(产品形态)

Gemini 衍生产品 Deep Research:

用户:写一份关于 X 的研究报告

Deep Research:
1. 自动规划 50+ 子问题
2. 抓 100+ 网页
3. 综合分析
4. 输出 50 页结构化报告
   带引用、带图表

耗时:5-15 分钟

类似 OpenAI 的 Deep Research、Perplexity Pro Search。

这种产品形态比”聊天”更具实用价值 —— 一份高质量报告替代几小时的人工调研。

NotebookLM(杀手锏)

Google 2024 推出的现象级产品 NotebookLM:

用户上传:
- 50 份 PDF
- 100 个网页链接
- 视频文件

NotebookLM:
- 全部理解 + 索引
- 回答任何相关问题
- 自动生成"播客版"摘要(两个 AI 主持对话讨论你的资料)

底层就是 Gemini + 长上下文。 “AI 播客主持人” 这个 UX 让 NotebookLM 2024 末爆火。

技术细节(推测)

Gemini 2.x 没有完整论文发布。已知 / 推测:

  • MoE 架构:路由若干专家
  • 多模态原生 tokenizer:图像/音频不是后加的 encoder
  • 训练数据:Google 的 YouTube + Books + Web,规模可能 30T+ tokens
  • 训练算力:自研 TPU v5p / Trillium,几万颗

Google 是唯一不依赖 NVIDIA GPU 的前沿 LLM 公司。 TPU 集群是它的核心竞争优势之一。

一个有意思的对比

维度Google GeminiOpenAI GPTAnthropic Claude
多模态原生强中(视觉好)
长上下文业界唯一 2M200k200k
代码业界最强
生态Google 全家桶最广企业 + 安全
训练硬件自研 TPUNVIDIANVIDIA + AWS Trainium
价格

Google 的差异化 = 多模态 + 长上下文 + 自研芯片 + Google 生态集成

推荐配套阅读

  • HelloAI: L5-01 多模态总览 + L4-06 In-Context Learning
  • Gemini 1.5 论文(2403.05530)—— 第一代细节
  • Gemini 2.5 博客 —— 官方说明
  • NotebookLM 自己上手体验
💡 一个反思

2023 年初 OpenAI 发 GPT-4 时, 评论:「Google 在 AI 上输了,永远追不上了。」

2024 末 Gemini 2.0 + NotebookLM 之后: 评论:「Google 回来了,可能反超。」

两年时间,AI 格局已经反转又反转

这个领域没有永远的领先者。 唯一不变的是变得太快

📬

想要更多论文精读

订阅每周精选 —— 下一篇论文笔记直接送邮箱。

💬

讨论区

· 用 GitHub 账号登录评论
⚠️ Giscus 评论未配置 —— 在 src/components/Comments.astro 顶部填入 仓库 ID 和分类 ID(见组件注释里的配置步骤)。