🏷️ 标签
#开源
共找到 11 条相关内容: 7 篇论文 4 条资讯
📑 论文精读
2025 🏆 2024 🏆 2023 🏆 2023 🏆 2024 🏆 2020 🏆 2022 🏆
DeepSeek-V3 / R1:开源推理模型的革命
DeepSeek 用 $5.6M 训出接近 GPT-4 的开源模型——震动了整个行业。证明"开源 + 高效工程 + 创新算法" 能挑战美国巨头。
The Llama 3 Herd of Models
Meta 公开了 Llama 3 405B 的完整训练细节——开源模型首次达到 GPT-4 级别。92 页技术报告揭秘大模型训练的工程实战。
Visual Instruction Tuning (LLaVA)
把 CLIP + LLaMA + 指令微调 缝合起来——开源多模态指令模型的起点。让"图像+对话"AI 进入开源社区。
Mistral 7B
7B 模型干翻 LLaMA-2 13B —— 法国 Mistral AI 用一系列工程优化(GQA、Sliding Window、Apache 2.0 协议)证明"小而精"的可行性。开源 LLM 生态的里程碑。
Qwen 技术报告(Qwen 2.5 / Qwen 3)
阿里通义千问开源系列 —— 0.5B 到 72B 全规格、多模态、长上下文 128k、Apache 2.0。2024 年中国开源 LLM 的代表,国际排行榜常年 Top 5。
The Pile: An 800GB Dataset of Diverse Text for Language Modeling
EleutherAI 开源的 800GB 训练数据集——第一个真正可用的"GPT-3 级别"开源训练数据。开源 LLM 革命的"砖头"。
Robust Speech Recognition via Large-Scale Weak Supervision (Whisper)
OpenAI 用 68 万小时弱监督音频训出最强 ASR。开源后统治整个开源语音识别市场。99 种语言通吃。
📰 资讯
2024/12/6 2025/1/20 2025/4/5 2026/4/24
Meta 发布 Llama 3.3 70B:70B 性能接近 405B 旗舰
Llama 3.3 70B 通过改进训练 + 后训练对齐,让 70B 模型在多数基准上接近 Llama 3.1 405B。推理 / 部署成本大幅降低,开源生态获益。
DeepSeek R1 开源发布:推理能力对标 OpenAI o1,训练成本仅 $5.6M
DeepSeek 发布 R1,在 AIME 数学竞赛、Codeforces 等推理基准上达到 o1 级水平。模型 + 权重 + 训练方法全部开源(MIT 协议),训练成本仅 $5.6M。
Meta 开源 Llama 4:原生多模态 MoE,Scout 上下文达 1000 万 token
Meta 发布 Llama 4 Scout 与 Maverick——首批开放权重的原生多模态 MoE 模型。Scout 上下文达 1000 万 token,万亿级的 Behemoth 仍在训练中。
DeepSeek 发布 V4 预览版:1M 上下文成默认,开源权重上线
DeepSeek 推出 V4 预览版,包含 V4-Pro 与 V4-Flash;100 万 token 上下文成为默认,引入稀疏注意力(DSA),开源权重上线 Hugging Face。