model · 2024/12/11 16:00:00
Google 发布 Gemini 2.0 Flash:原生多模态 + Agent 能力
Gemini 2.0 Flash 首次原生支持图像、音频流输出 + 工具使用 + 多模态实时 API。Google 第二代旗舰,性能超越 Gemini 1.5 Pro 同时速度 2 倍。
来源:Google DeepMind
查看原文 →
Google DeepMind 发布 Gemini 2.0 Flash —— Google 在 AI 竞赛中”翻身”的关键产品。
主要亮点:
1. 原生多模态 I/O
- 输入:文本 + 图像 + 音频 + 视频
- 输出:文本 + 图像 + 音频(首次原生输出多模态)
- 比 GPT-4o 早实装多模态输出能力
2. Multimodal Live API
- 实时双向音视频对话
- 用户开摄像头 + 麦克风,模型流式分析 + 实时语音回复
- 应用:视障辅助、实时翻译、AI 教学助手
3. Agent 能力
- 集成搜索 / 工具调用
- 多步规划
- “Deep Research” 产品:自动生成 50 页研究报告
4. 性能
- 多数基准上超过 Gemini 1.5 Pro
- 速度 2 倍
- 上下文 1M tokens
5. 配套产品
- NotebookLM:上传任意文档 → AI 播客主持人对话讨论
- Project Mariner:浏览器自动化 Agent
编辑批注:Gemini 2.0 是 Google 的”AI 翻身仗”。原生多模态 + Live API 比 OpenAI 的同类功能早或同时上线。 NotebookLM 在 2024 末意外爆红 —— “AI 播客”这个产品形态没人预料到。 Google 不再像 2023 年那样被 OpenAI 甩在身后。