Gemini 2.0 / 2.5 技术报告
为什么这篇重要
Google DeepMind 2024 末发布 Gemini 2.0 —— Google 在 AI 竞赛里的”翻身仗”。
之前两年:
- GPT-4 抢走了”最强 LLM”光环
- Anthropic 抢走了”长上下文 + 安全”赛道
- Google 第一代 Gemini 1.0 / 1.5 反响平平
Gemini 2.0 / 2.5 翻身的关键:
- 原生多模态(不是后加上去的)
- 2M token 上下文(业界最长)
- Multimodal Live API(实时双向音视频)
- Deep Research 等新颖产品形态
三件大事
1. 原生多模态
Gemini 从设计之初就是多模态融合:
输入:文本 + 图像 + 音频 + 视频 + 代码
全部 token 化进同一序列
模型:统一处理(不是分别的 encoder)
输出:文本 + 图像 + 音频
跟 GPT-4o 类似 —— 但 Google 比 OpenAI 更早走这个方向。
优势:
- 跨模态对齐更紧密
- 视频理解能力强(一帧帧序列化处理)
- 实时音视频更顺滑
2. 2M token 上下文
业界最长。意味着:
- 一次塞进 一整本书(约 1500 页)
- 一次塞进 整个代码库(10 万行)
- 一次分析 几小时的视频
实现关键:
- 改进的 Ring Attention
- 高效 KV cache 压缩
- 训练时就用长序列样本
实测 2M 上下文里 “needle in haystack”(在 2M 文字中找一句话)准确率仍 > 99%。
3. Multimodal Live API
实时双向多模态:
用户:开摄像头 + 麦克风
模型:流式分析视频 + 听语音
返回:实时语音回复 + 文本注解
应用场景:
- 视障辅助(描述眼前的世界)
- 实时翻译
- AI 教学助手(看你的屏幕讲解)
- 客服对话
OpenAI Realtime API 类似,但 Google 集成度更高。
模型规格
| 型号 | 时间 | 定位 |
|---|---|---|
| Gemini 2.0 Flash | 2024-12 | 旗舰高速版(默认) |
| Gemini 2.0 Flash Thinking | 2024-12 | 带”思考”过程的推理模型 |
| Gemini 2.0 Pro | 2025-02 | 大模型版 |
| Gemini 2.5 Pro | 2025-03 | 当时最强 Google 模型 |
| Gemini 2.5 Flash | 2025-04 | 速度 + 成本优化 |
Gemini Nano —— 设备端 1-2B 模型,跑 Pixel 手机。
性能
Gemini 2.5 Pro 在 2025 H1 实测:
| 任务 | Gemini 2.5 Pro | GPT-5 (估) | Claude Opus 4.6 |
|---|---|---|---|
| MMLU | 89 | 91 | 90 |
| 数学(MATH) | 91 | 95 | 92 |
| 代码(SWE-bench) | 52 | 60 | 70 |
| 多模态(MMMU) | 78 | 75 | 72 |
| 长上下文(2M) | 业界唯一 | — | — |
多模态 + 长上下文上 Gemini 占优。 代码上 Claude 仍最强。 数学 / 推理 OpenAI 略微领先。
Deep Research(产品形态)
Gemini 衍生产品 Deep Research:
用户:写一份关于 X 的研究报告
Deep Research:
1. 自动规划 50+ 子问题
2. 抓 100+ 网页
3. 综合分析
4. 输出 50 页结构化报告
带引用、带图表
耗时:5-15 分钟
类似 OpenAI 的 Deep Research、Perplexity Pro Search。
这种产品形态比”聊天”更具实用价值 —— 一份高质量报告替代几小时的人工调研。
NotebookLM(杀手锏)
Google 2024 推出的现象级产品 NotebookLM:
用户上传:
- 50 份 PDF
- 100 个网页链接
- 视频文件
NotebookLM:
- 全部理解 + 索引
- 回答任何相关问题
- 自动生成"播客版"摘要(两个 AI 主持对话讨论你的资料)
底层就是 Gemini + 长上下文。 “AI 播客主持人” 这个 UX 让 NotebookLM 2024 末爆火。
技术细节(推测)
Gemini 2.x 没有完整论文发布。已知 / 推测:
- MoE 架构:路由若干专家
- 多模态原生 tokenizer:图像/音频不是后加的 encoder
- 训练数据:Google 的 YouTube + Books + Web,规模可能 30T+ tokens
- 训练算力:自研 TPU v5p / Trillium,几万颗
Google 是唯一不依赖 NVIDIA GPU 的前沿 LLM 公司。 TPU 集群是它的核心竞争优势之一。
一个有意思的对比
| 维度 | Google Gemini | OpenAI GPT | Anthropic Claude |
|---|---|---|---|
| 多模态 | 原生强 | 强 | 中(视觉好) |
| 长上下文 | 业界唯一 2M | 200k | 200k |
| 代码 | 中 | 强 | 业界最强 |
| 生态 | Google 全家桶 | 最广 | 企业 + 安全 |
| 训练硬件 | 自研 TPU | NVIDIA | NVIDIA + AWS Trainium |
| 价格 | 中 | 高 | 高 |
Google 的差异化 = 多模态 + 长上下文 + 自研芯片 + Google 生态集成。
推荐配套阅读
- HelloAI: L5-01 多模态总览 + L4-06 In-Context Learning
- Gemini 1.5 论文(2403.05530)—— 第一代细节
- Gemini 2.5 博客 —— 官方说明
- NotebookLM 自己上手体验
2023 年初 OpenAI 发 GPT-4 时, 评论:「Google 在 AI 上输了,永远追不上了。」
2024 末 Gemini 2.0 + NotebookLM 之后: 评论:「Google 回来了,可能反超。」
两年时间,AI 格局已经反转又反转。
这个领域没有永远的领先者。 唯一不变的是变得太快。
想要更多论文精读
订阅每周精选 —— 下一篇论文笔记直接送邮箱。
讨论区
· 用 GitHub 账号登录评论src/components/Comments.astro 顶部填入
仓库 ID 和分类 ID(见组件注释里的配置步骤)。