🏷️ 标签
#多模态
共找到 8 条相关内容: 1 篇学习路径 4 篇论文 3 条资讯
📚 学习路径
📑 论文精读
2021 🏆 2025 🏆 2024 🏆 2023 🏆
Learning Transferable Visual Models From Natural Language Supervision (CLIP)
用 4 亿张"图 + 描述"对训练——让图像 encoder 和文本 encoder 在同一向量空间对齐。从此 AI 能"看图说话","看图作画"。
Gemini 2.0 / 2.5 技术报告
Google 第二代旗舰多模态:原生支持文本/图像/音频/视频 I/O,2M token 上下文(业界最长),实时 Multimodal Live API。Google 重回 AI 第一梯队的标志。
Gemini: A Family of Highly Capable Multimodal Models
Google 用 6 年时间 + 1 万张 TPU 训出的"原生多模态"大模型。1M+ 上下文窗口,是 GPT-4 的最大挑战者之一。
Visual Instruction Tuning (LLaVA)
把 CLIP + LLaMA + 指令微调 缝合起来——开源多模态指令模型的起点。让"图像+对话"AI 进入开源社区。
📰 资讯
2024/12/11 2025/4/5 2025/11/18
Google 发布 Gemini 2.0 Flash:原生多模态 + Agent 能力
Gemini 2.0 Flash 首次原生支持图像、音频流输出 + 工具使用 + 多模态实时 API。Google 第二代旗舰,性能超越 Gemini 1.5 Pro 同时速度 2 倍。
Meta 开源 Llama 4:原生多模态 MoE,Scout 上下文达 1000 万 token
Meta 发布 Llama 4 Scout 与 Maverick——首批开放权重的原生多模态 MoE 模型。Scout 上下文达 1000 万 token,万亿级的 Behemoth 仍在训练中。
Google 发布 Gemini 3 Pro:LMArena 1501 Elo 登顶
Google 推出 Gemini 3 Pro,以 1501 Elo 登顶 LMArena;GPQA Diamond 91.9%、SWE-bench Verified 76.2%,100 万 token 上下文,并首发 Deep Think 模式。