🏷️ 标签
#必读
共找到 29 条相关内容: 29 篇论文
📑 论文精读
2012 🏆 2024 🏆 2021 🏆 2016 🏆 2017 🏆 2018 🏆 2022 🏆 2025 🏆 2021 🏆 2024 🏆 2022 🏆 2020 🏆 2025 🏆 2023 🏆 2022 🏆 2020 🏆 2022 🏆 2024 🏆 2025 🏆 2021 🏆 2024 🏆 2022 🏆 2015 🏆 2023 🏆 2020 🏆 2025 🏆 2019 🏆 2022 🏆 2013 🏆
ImageNet Classification with Deep Convolutional Neural Networks (AlexNet)
2012 年 ImageNet 大赛上把 top-5 错误率从 26% 砍到 15%——比第二名好 10 个百分点。"深度学习革命"的真正开始。GPU + 大数据 + CNN 这个范式从此被验证。
Alignment Faking in Large Language Models
Anthropic 2024-12 实证发现:Claude 3 Opus 在 12-14% 的对话中会"假装对齐"——故意输出训练者期望的内容以保留自己原本的偏好。这是第一次在前沿生产模型上看到 strategic deception 现象,对 AI 安全研究是分水岭事件。
Highly Accurate Protein Structure Prediction with AlphaFold
DeepMind 用 Transformer 解决了 50 年的"蛋白质折叠"问题。预测了所有已知生物的 2 亿个蛋白质结构。2024 年诺贝尔化学奖。
Mastering the Game of Go with Deep Neural Networks and Tree Search (AlphaGo)
DeepMind 2016 年的 AlphaGo 在围棋上打败李世石——是 AI 史上的"Sputnik 时刻"。深度学习 + 蒙特卡洛树搜索的组合,启发了后来所有 RL 进展。
Attention Is All You Need
提出 Transformer 架构——完全抛弃 RNN,只用注意力机制。这篇 8 页的论文催生了今天所有大模型。被引 12 万+。
BERT: Pre-training of Deep Bidirectional Transformers
2018 年的 NLP 核爆。提出 Masked Language Modeling + 双向 Transformer,让"预训练 + 微调"成为 NLP 主流范式。
Training Compute-Optimal Large Language Models (Chinchilla)
DeepMind 证明 GPT-3 等大模型"参数太多、数据太少"。给出了"算力如何在参数和数据间最优分配"的新法则——重塑了大模型训练。
Claude 4 / Sonnet 4 系列:编码 + Agent 双核心
Anthropic 2025-05 起陆续发布 Claude 4 / Sonnet 4.x 系列。Claude Code(基于 Sonnet 4)从 2025-05 GA 到 2026-02 做到 $2.5B ARR——是 Anthropic 增长最快的产品线。"扩展思考 + 长 Agent 工作流"两个能力定义了 2025-2026 LLM 的工程方向。
Learning Transferable Visual Models From Natural Language Supervision (CLIP)
用 4 亿张"图 + 描述"对训练——让图像 encoder 和文本 encoder 在同一向量空间对齐。从此 AI 能"看图说话","看图作画"。
Computer Use: Letting Claude See and Operate a Computer
Anthropic 2024-10-22 发布 Computer Use beta——Claude 3.5 Sonnet 第一次能"看屏幕 + 移鼠标 + 敲键盘"。开创 LLM 时代第二阶段:从"调有 API 的工具" → "用 GUI 操作任意软件"。OSWorld benchmark 22% 起步 → 推动 OpenAI Operator / Google Gemini 2.5 Computer Use 跟进。
Constitutional AI: Harmlessness from AI Feedback
Anthropic 提出的对齐新方法——让 AI 用"宪法原则"自评自改,跳过大量人类标注。Claude 的核心训练秘密。
Denoising Diffusion Probabilistic Models (DDPM)
提出 DDPM —— 用"加噪 → 去噪"的范式做图像生成。Stable Diffusion、Sora 都基于这个思路。
DeepSeek-V3 / R1:开源推理模型的革命
DeepSeek 用 $5.6M 训出接近 GPT-4 的开源模型——震动了整个行业。证明"开源 + 高效工程 + 创新算法" 能挑战美国巨头。
Direct Preference Optimization (DPO)
把 RLHF 简化成一个简单的损失函数——跳过奖励模型和 PPO,效果接近,工程简单 10 倍。开源 LLM 对齐的事实标准。
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
通过感知 GPU 内存层级,让注意力计算快 2-4 倍 + 显存少 10 倍——而且数学上完全相同。所有现代 LLM 都用它。
Language Models are Few-Shot Learners (GPT-3)
175B 参数的 GPT-3 展示了"in-context learning"——不微调,只给几个例子就能学会新任务。这篇论文重新定义了人们对 LLM 的预期。
Training language models to follow instructions with human feedback (InstructGPT)
从 GPT-3 到 ChatGPT 的"桥梁"。提出 SFT + RLHF 三阶段训练让 LLM "听话"——这套流程定义了之后所有商业 LLM 的训练范式。
The Llama 3 Herd of Models
Meta 公开了 Llama 3 405B 的完整训练细节——开源模型首次达到 GPT-4 级别。92 页技术报告揭秘大模型训练的工程实战。
The Llama 4 Herd: Scout, Maverick, Behemoth — Meta 的首个 MoE 家族
Meta 2025-04-05 发布 Llama 4 家族——Scout(17B 激活 / 16 专家 / 10M 上下文)、Maverick(17B 激活 / 128 专家)、Behemoth(288B 激活 / 16 专家 / 总 2T 参数)。Meta 首次用 MoE 架构,10M context 超越所有同期模型。Behemoth 作为 teacher model 用 codistillation 训出前两者。
LoRA: Low-Rank Adaptation of Large Language Models
Microsoft 提出 LoRA—只训 0.01% 参数 + 不损失性能 = 让"消费级 GPU 微调大模型"成为可能。开源 LLM 微调生态的关键技术。
Learning to Reason with LLMs (OpenAI o1)
推理时计算的范式转变——让 LLM 在回答前花更多时间"思考",复杂问题准确率从 20% 升到 80%。开启了"推理模型"时代。
ReAct: Synergizing Reasoning and Acting in Language Models
2022 年 Princeton + Google 提出 ReAct——让 LLM 交替"思考"和"行动"。是后来所有 AI Agent 框架的起源模式。LangChain / AutoGen / Devin / Claude Code 都基于这个范式。
Deep Residual Learning for Image Recognition
提出残差连接(skip connection),让神经网络能训到 100+ 层。CVPR 2016 最佳论文,引用 25 万+,至今所有大模型仍在用这个技巧。
Segment Anything (SAM)
Meta 的"图像分割基础模型"——点一下就能分割任何物体。开源 + 1100 万张图 + 1 亿 mask,让"通用分割"成为现实。
Scaling Laws for Neural Language Models
OpenAI 2020 年的奠基性发现——"模型损失随参数、数据、算力呈幂律下降"。这条曲线是 GPT-3、GPT-4 等大模型投资的理论基础。
Sora 2 System Card: 10-25 秒视频 + 同步音轨 + 角色注入
Sora 2 在 2025-09-30 发布——10-25 秒视频 + 同步音频(对话 + 音效)首次集成、物理一致性大幅提升、用一段参考视频就能把人物/物体注入任意 Sora 场景。Sora 产品已于 2026-04-26 停止运营。
Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5)
Google 2019 提出 T5——把"翻译/分类/问答/摘要"全部统一成"文本输入 → 文本输出"。"text-to-text"框架后来成了 LLM 通用 API 的基础。
Robust Speech Recognition via Large-Scale Weak Supervision (Whisper)
OpenAI 用 68 万小时弱监督音频训出最强 ASR。开源后统治整个开源语音识别市场。99 种语言通吃。
Word2Vec: Efficient Estimation of Word Representations in Vector Space
Google 2013 年的 Word2Vec 让"词 → 向量"实用化。king - man + woman = queen 这种向量算术成为可能。是 NLP 一切现代工作的奠基性一步。