更新日志
HelloAI 所有内容的时间线——按月分组,最新在上。
最后更新:2026年10月9日
2026 年 十月 · 7 条
- L4 · 第 18 篇 10月9日
Eval-Driven Development:用 eval 驱动 LLM 应用开发
TDD 在传统软件叫"测试驱动";EDD 在 LLM 时代叫"评估驱动"——eval 先于 prompt、先于模型选型、先于功能。这是 2026 LLM 工程的核心方法论。
- L4 · 第 17 篇 10月8日
Adaptive RAG:让 LLM 自己决定要不要检索 / 怎么检索
朴素 RAG 把所有问题都送去检索 = 慢 + 贵 + 噪声多。Adaptive RAG 让 LLM 先判断,再决定如何检索 / 检索几次 / 跳过检索。
- 论文 · 2025 10月6日
Claude 4 / Sonnet 4 系列:编码 + Agent 双核心
Anthropic 2025-05 起陆续发布 Claude 4 / Sonnet 4.x 系列。Claude Code(基于 Sonnet 4)从 2025-05 GA 到 2026-02 做到 $2.5B ARR——是 Anthropic 增长最快的产品线。"扩展思考 + 长 Agent 工作流"两个能力定义了 2025-2026 LLM 的工程方向。
- 论文 · 2024 10月5日
Computer Use: Letting Claude See and Operate a Computer
Anthropic 2024-10-22 发布 Computer Use beta——Claude 3.5 Sonnet 第一次能"看屏幕 + 移鼠标 + 敲键盘"。开创 LLM 时代第二阶段:从"调有 API 的工具" → "用 GUI 操作任意软件"。OSWorld benchmark 22% 起步 → 推动 OpenAI Operator / Google Gemini 2.5 Computer Use 跟进。
- 论文 · 2024 10月4日
Alignment Faking in Large Language Models
Anthropic 2024-12 实证发现:Claude 3 Opus 在 12-14% 的对话中会"假装对齐"——故意输出训练者期望的内容以保留自己原本的偏好。这是第一次在前沿生产模型上看到 strategic deception 现象,对 AI 安全研究是分水岭事件。
- 论文 · 2025 10月3日
Sora 2 System Card: 10-25 秒视频 + 同步音轨 + 角色注入
Sora 2 在 2025-09-30 发布——10-25 秒视频 + 同步音频(对话 + 音效)首次集成、物理一致性大幅提升、用一段参考视频就能把人物/物体注入任意 Sora 场景。Sora 产品已于 2026-04-26 停止运营。
- 论文 · 2025 10月2日
The Llama 4 Herd: Scout, Maverick, Behemoth — Meta 的首个 MoE 家族
Meta 2025-04-05 发布 Llama 4 家族——Scout(17B 激活 / 16 专家 / 10M 上下文)、Maverick(17B 激活 / 128 专家)、Behemoth(288B 激活 / 16 专家 / 总 2T 参数)。Meta 首次用 MoE 架构,10M context 超越所有同期模型。Behemoth 作为 teacher model 用 codistillation 训出前两者。
2026 年 九月 · 24 条
- L7 · 第 9 篇 9月29日
LLMOps 全景:观测 / 评估 / 监控 / 实验
LLM 应用上线后真正的工作才开始——Langfuse、Helicone、OpenTelemetry、持续 eval、A/B 实验。2026 LLMOps 完整工具栈。
- L6 · 第 8 篇 9月28日
CoT 安全:推理模型的"思考"可信吗
Anthropic 2025 实证:Claude 3.7 与 DeepSeek R1 的思维链只有 25-39% 的时候诚实——CoT 监控不能完全代替 alignment。
- L5 · 第 9 篇 9月27日
机器人 + LLM:VLA 模型与具身智能
PaLM-E、RT-2、π0、Optimus——LLM 与机器人正式融合,"看 + 想 + 动"成为一个模型。2026 具身智能新格局。
- L5 · 第 8 篇 9月26日
AI 音乐:Suno / Udio / MusicGen 的技术与商业
2024-2026 AI 音乐从"听起来像 AI"变成"分不出和真人"。Suno v5、Udio、MusicGen 的技术原理 + 法律争议 + 商业模式。
- L4 · 第 16 篇 9月25日
视觉语言 Agent:让 AI 操控你的屏幕
Claude Computer Use、OpenAI Operator、Gemini 2.5 Computer Use——LLM 看屏幕 + 点鼠标 + 敲键盘,2024-2026 Agent 最大产品形态。
- L5 · 第 7 篇 9月22日
3D 生成:NeRF / Gaussian Splatting / 文本到 3D
2D 之后的下一波 AI 内容革命——从一组照片重建 3D,从文字生成 3D 资产。
- L4 · 第 15 篇 9月20日
Prompt Caching 工程实战:省 90% LLM 成本的技巧
Anthropic / OpenAI / Gemini 都支持的"prefix caching"——让重复的 system prompt 不再重复花钱。
- 论文 · 2016 9月20日
Mastering the Game of Go with Deep Neural Networks and Tree Search (AlphaGo)
DeepMind 2016 年的 AlphaGo 在围棋上打败李世石——是 AI 史上的"Sputnik 时刻"。深度学习 + 蒙特卡洛树搜索的组合,启发了后来所有 RL 进展。
- L4 · 第 14 篇 9月19日
结构化输出:JSON Mode / Grammars / Pydantic
让 LLM 输出可靠的机器可读结果——工业界 Agent / 工作流不可或缺的能力。
- 论文 · 2019 9月19日
Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5)
Google 2019 提出 T5——把"翻译/分类/问答/摘要"全部统一成"文本输入 → 文本输出"。"text-to-text"框架后来成了 LLM 通用 API 的基础。
- L4 · 第 13 篇 9月18日
Function Calling vs Tool Use vs MCP:三个相关概念怎么区分
工业界三个名字最让人晕——但它们是同一件事的三层抽象。一篇说清楚。
- 论文 · 2012 9月18日
ImageNet Classification with Deep Convolutional Neural Networks (AlexNet)
2012 年 ImageNet 大赛上把 top-5 错误率从 26% 砍到 15%——比第二名好 10 个百分点。"深度学习革命"的真正开始。GPU + 大数据 + CNN 这个范式从此被验证。
- 论文 · 2023 9月17日
Tree of Thoughts: Deliberate Problem Solving with Large Language Models
2023 年 ReAct 同班作者再出手——让 LLM 像下棋一样"探索多条思路 + 评估 + 回溯"。在 24 点游戏从 4% 跳到 74%。是推理模型(o1 / R1)思路的前奏。
- L3 · 第 10 篇 9月16日
GAN 与 VAE:生成模型的两条路线
Diffusion 之前主导生成 AI 的两大架构。理解它们才理解为什么 Diffusion 赢了。
- 论文 · 2022 9月16日
ReAct: Synergizing Reasoning and Acting in Language Models
2022 年 Princeton + Google 提出 ReAct——让 LLM 交替"思考"和"行动"。是后来所有 AI Agent 框架的起源模式。LangChain / AutoGen / Devin / Claude Code 都基于这个范式。
- L1 · 第 11 篇 9月15日
概率分布速览:高斯 / 伯努利 / 泊松 / 指数 / 多项分布
统计的"字母表"——所有 ML 模型都建立在这些分布之上。这一篇用直觉 + 代码讲清楚 5 个最常用的。
- 论文 · 2013 9月15日
Word2Vec: Efficient Estimation of Word Representations in Vector Space
Google 2013 年的 Word2Vec 让"词 → 向量"实用化。king - man + woman = queen 这种向量算术成为可能。是 NLP 一切现代工作的奠基性一步。
- 论文 · 2024 9月12日
FLUX.1 / FLUX.1 Pro
Stable Diffusion 原班作者出来创业,做出 2024 年最强的开源图像生成模型。Midjourney 级质量 + Apache 2.0 协议 (FLUX.1 dev) —— 开源图像生成的新顶峰。
- 论文 · 2025 9月11日
Gemini 2.0 / 2.5 技术报告
Google 第二代旗舰多模态:原生支持文本/图像/音频/视频 I/O,2M token 上下文(业界最长),实时 Multimodal Live API。Google 重回 AI 第一梯队的标志。
- 论文 · 2024 9月10日
Qwen 技术报告(Qwen 2.5 / Qwen 3)
阿里通义千问开源系列 —— 0.5B 到 72B 全规格、多模态、长上下文 128k、Apache 2.0。2024 年中国开源 LLM 的代表,国际排行榜常年 Top 5。
- 论文 · 2023 9月9日
Mistral 7B
7B 模型干翻 LLaMA-2 13B —— 法国 Mistral AI 用一系列工程优化(GQA、Sliding Window、Apache 2.0 协议)证明"小而精"的可行性。开源 LLM 生态的里程碑。
- L3 · 第 7 篇 9月4日
注意力变体:Multi-Head / Cross / Sparse / Linear
Self-Attention 之后还有什么?讲清楚现代 Transformer 各种注意力家族成员。
- L3 · 第 3 篇 9月3日
深网络训练技巧:BatchNorm / Dropout / 初始化
让深层网络真的能训起来的三大件——为什么需要它们、怎么用、什么时候用。
- L3 · 第 2 篇 9月2日
反向传播详解:链式法则的实战
Backpropagation 让神经网络真的能学。这一篇拆解它的数学、直觉、和实现。
2026 年 八月 · 31 条
- L7 · 第 7 篇 8月31日
监控与可观测性:LLM 应用的生产管理
一个 LLM 产品上线后,怎么知道它"行不行"?慢了、错了、贵了、被攻击了?这一篇讲监控栈。
- L6 · 第 7 篇 8月30日
AI 安全研究入门:怎么进入这个方向
想做 AI 安全研究?这一篇讲方向、机构、起步项目、推荐阅读——这是 2026 年最稀缺的人才方向之一。
- L5 · 第 6 篇 8月29日
视频生成:从 Sora 到现代视频 AI
Sora、Runway Gen-3、Veo、Kling……2024-2026 视频生成爆发。这一篇讲技术原理 + 工程细节 + 商业格局。
- 论文 · 2020 8月28日
Scaling Laws for Neural Language Models
OpenAI 2020 年的奠基性发现——"模型损失随参数、数据、算力呈幂律下降"。这条曲线是 GPT-3、GPT-4 等大模型投资的理论基础。
- 论文 · 2021 8月27日
LoRA: Low-Rank Adaptation of Large Language Models
Microsoft 提出 LoRA—只训 0.01% 参数 + 不损失性能 = 让"消费级 GPU 微调大模型"成为可能。开源 LLM 微调生态的关键技术。
- 论文 · 2022 8月26日
Training Compute-Optimal Large Language Models (Chinchilla)
DeepMind 证明 GPT-3 等大模型"参数太多、数据太少"。给出了"算力如何在参数和数据间最优分配"的新法则——重塑了大模型训练。
- 论文 · 2023 8月25日
Direct Preference Optimization (DPO)
把 RLHF 简化成一个简单的损失函数——跳过奖励模型和 PPO,效果接近,工程简单 10 倍。开源 LLM 对齐的事实标准。
- L4 · 第 12 篇 8月24日
LLM 成本优化:从 prompt 到部署的 10× 省钱方法
LLM 调用又贵又快——一不小心就把 AWS 账单炸了。这一篇讲实战中的成本管控技巧。
- L4 · 第 11 篇 8月23日
MCP 工具开发:手把手做一个自己的 MCP server
L4-07 讲了 MCP 是什么。这一篇手把手教你写一个能让 Claude / Cursor 直接用的 MCP server。
- L4 · 第 10 篇 8月22日
Multi-Agent 系统:让 AI 团队协作
一个 Agent 够强了吗?很多场景下不够——需要多个 Agent 分工。AutoGen、CrewAI 等框架开启了"AI 团队"时代。
- 论文 · 2020 8月21日
The Pile: An 800GB Dataset of Diverse Text for Language Modeling
EleutherAI 开源的 800GB 训练数据集——第一个真正可用的"GPT-3 级别"开源训练数据。开源 LLM 革命的"砖头"。
- 论文 · 2023 8月20日
Visual Instruction Tuning (LLaVA)
把 CLIP + LLaMA + 指令微调 缝合起来——开源多模态指令模型的起点。让"图像+对话"AI 进入开源社区。
- 论文 · 2024 8月19日
Transformers are SSMs: Generalized Models and Efficient Algorithms (Mamba 2)
Mamba 团队的反击——证明 Transformer 和 SSM 在数学上等价,并提出更快的 Mamba 2 架构。SSM 路线的关键升级。
- 论文 · 2021 8月18日
TruthfulQA: Measuring How Models Mimic Human Falsehoods
一个测 LLM "是否真实"的 benchmark。第一次系统揭示:模型越大,反而在某些常见误区上越错。
- L7 · 第 6 篇 8月17日
训练优化进阶:让大模型训得动
梯度检查点 / 混合精度 / Activation Recomputation / ZeRO Offload——这些工程技巧让 70B 模型在单卡上能微调。
- L6 · 第 6 篇 8月16日
AI 政策与监管:EU AI Act / 美国 EO / 中国办法对照
AI 公司和应用面临的法律义务正在快速演化。这一篇给你全球三大法域的对照表 + 影响。
- L5 · 第 5 篇 8月15日
TTS 语音合成:从拼接到神经合成
从机器人腔到逼真人声——TTS 走过的路。VALL-E 让 3 秒声音克隆任何人——这个能力的两面性。
- 论文 · 2024 8月14日
Gemini: A Family of Highly Capable Multimodal Models
Google 用 6 年时间 + 1 万张 TPU 训出的"原生多模态"大模型。1M+ 上下文窗口,是 GPT-4 的最大挑战者之一。
- 论文 · 2023 8月13日
Segment Anything (SAM)
Meta 的"图像分割基础模型"——点一下就能分割任何物体。开源 + 1100 万张图 + 1 亿 mask,让"通用分割"成为现实。
- 论文 · 2022 8月12日
Robust Speech Recognition via Large-Scale Weak Supervision (Whisper)
OpenAI 用 68 万小时弱监督音频训出最强 ASR。开源后统治整个开源语音识别市场。99 种语言通吃。
- 论文 · 2025 8月11日
DeepSeek-V3 / R1:开源推理模型的革命
DeepSeek 用 $5.6M 训出接近 GPT-4 的开源模型——震动了整个行业。证明"开源 + 高效工程 + 创新算法" 能挑战美国巨头。
- L4 · 第 9 篇 8月10日
Tool Use 工程实战:让 LLM 真正会用工具
LLM 能用工具——但要让它"用得稳、用得对、用得省"是另一门工程艺术。这一篇讲实战。
- L4 · 第 8 篇 8月9日
LLM 评估:从 MMLU 到真实业务
怎么知道你的 LLM 应用"好不好"?这一篇讲学术 benchmark + 工程评估的完整工具栈。
- L4 · 第 7 篇 8月8日
MCP 协议详解:AI 世界的 USB 接口
Anthropic 2024 提出的 MCP——让任何工具能接入任何 LLM。一年时间成为 AI Agent 生态的事实标准。
- 论文 · 2024 8月7日
Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone
Phi-3 mini 仅 3.8B 参数——但在多项 benchmark 上接近 GPT-3.5。证明了"小模型 + 极致数据质量"是另一条路。
- 论文 · 2024 8月6日
The Llama 3 Herd of Models
Meta 公开了 Llama 3 405B 的完整训练细节——开源模型首次达到 GPT-4 级别。92 页技术报告揭秘大模型训练的工程实战。
- 论文 · 2024 8月5日
Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training
Anthropic 证明:可以训练一个"装好的"AI——表面对齐,遇到特定触发词激活恶意行为。而且当前所有对齐方法都检测不出来。
- 论文 · 2024 8月4日
Learning to Reason with LLMs (OpenAI o1)
推理时计算的范式转变——让 LLM 在回答前花更多时间"思考",复杂问题准确率从 20% 升到 80%。开启了"推理模型"时代。
- L7 · 第 5 篇 8月3日
模型部署与服务化:从训完到上线
训出来一个模型只是开始。怎么把它变成一个 24/7 稳定、便宜、可扩展的服务?这一篇讲生产工程。
- L5 · 第 4 篇 8月2日
Whisper:让 AI 听懂 99 种语言
OpenAI 开源的 Whisper 是当下最强语音识别。手机录音转文字、会议纪要、字幕生成——背后几乎都是它。
- L4 · 第 6 篇 8月1日
In-Context Learning:为什么 LLM 看几个例子就会
GPT-3 让所有人惊讶的能力——不微调,只给几个例子就能学。它是怎么工作的?这一篇用研究解读。
2026 年 七月 · 34 条
- 论文 · 2024 7月31日
Video generation models as world simulators (Sora)
OpenAI 的视频生成模型 Sora——把视频切成"时空 patch"用 Transformer 做扩散。1 分钟高质量视频成为可能,"AI 世界模拟器"露端倪。
- 论文 · 2022 7月30日
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
通过感知 GPU 内存层级,让注意力计算快 2-4 倍 + 显存少 10 倍——而且数学上完全相同。所有现代 LLM 都用它。
- 论文 · 2022 7月29日
Constitutional AI: Harmlessness from AI Feedback
Anthropic 提出的对齐新方法——让 AI 用"宪法原则"自评自改,跳过大量人类标注。Claude 的核心训练秘密。
- 论文 · 2023 7月28日
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
挑战 Transformer 霸权的"选择性状态空间模型"——线性复杂度处理超长序列,理论上能取代 Transformer。2024 年最热的架构研究之一。
- L7 · 第 4 篇 7月27日
量化深度解析:GPTQ / AWQ / FP8 / GGUF 全谱
让 70B 模型塞进 24GB 显存——量化是消费级硬件跑大模型的关键。这一篇详解各家方案。
- L6 · 第 5 篇 7月26日
偏见与公平:AI 学到的不止是规则,还有人类的"暗面"
训练数据是人类社会的镜像——AI 学到的"模式"包含了所有偏见、刻板印象、不公平。这一篇直面这个问题。
- L4 · 第 4 篇 7月25日
Agent 构建详解:让 LLM 自己干活
从"问一句答一句的对话"到"能连续工作 4 小时的同事"——Agent 是 LLM 应用工程的下一步。
- 论文 · 2022 7月24日
Training language models to follow instructions with human feedback (InstructGPT)
从 GPT-3 到 ChatGPT 的"桥梁"。提出 SFT + RLHF 三阶段训练让 LLM "听话"——这套流程定义了之后所有商业 LLM 的训练范式。
- 论文 · 2021 7月23日
Highly Accurate Protein Structure Prediction with AlphaFold
DeepMind 用 Transformer 解决了 50 年的"蛋白质折叠"问题。预测了所有已知生物的 2 亿个蛋白质结构。2024 年诺贝尔化学奖。
- 论文 · 2018 7月22日
BERT: Pre-training of Deep Bidirectional Transformers
2018 年的 NLP 核爆。提出 Masked Language Modeling + 双向 Transformer,让"预训练 + 微调"成为 NLP 主流范式。
- 论文 · 2021 7月21日
Learning Transferable Visual Models From Natural Language Supervision (CLIP)
用 4 亿张"图 + 描述"对训练——让图像 encoder 和文本 encoder 在同一向量空间对齐。从此 AI 能"看图说话","看图作画"。
- L6 · 第 4 篇 7月20日
机制可解释性:看见神经元在想什么
LLM 是黑盒——但研究者已经能从几百亿参数里"读出"具体的概念了。这一篇带你认识 AI 内部的"心理学"研究。
- L5 · 第 3 篇 7月19日
ViT 与 CLIP:让 Transformer 看图
把图像切成 patch,喂给 Transformer——视觉领域 2020 年最大的范式转变。
- L4 · 第 2 篇 7月18日
Prompt 进阶技巧:CoT / Self-Consistency / Tree of Thoughts / Reflexion
L0-05 教你 10 个基础招。这一篇讲学术研究里的"硬核" prompt 工程——能让 GPT-4 在数学题上从 50% 升到 85%。
- 论文 · 2017 7月17日
Attention Is All You Need
提出 Transformer 架构——完全抛弃 RNN,只用注意力机制。这篇 8 页的论文催生了今天所有大模型。被引 12 万+。
- 论文 · 2020 7月17日
Denoising Diffusion Probabilistic Models (DDPM)
提出 DDPM —— 用"加噪 → 去噪"的范式做图像生成。Stable Diffusion、Sora 都基于这个思路。
- 论文 · 2020 7月17日
Language Models are Few-Shot Learners (GPT-3)
175B 参数的 GPT-3 展示了"in-context learning"——不微调,只给几个例子就能学会新任务。这篇论文重新定义了人们对 LLM 的预期。
- 论文 · 2015 7月17日
Deep Residual Learning for Image Recognition
提出残差连接(skip connection),让神经网络能训到 100+ 层。CVPR 2016 最佳论文,引用 25 万+,至今所有大模型仍在用这个技巧。
- L7 · 第 3 篇 7月16日
推理优化:vLLM / 量化 / 投机解码 / KV Cache
训完模型只是开始。让 LLM 在生产环境跑快、跑省、跑稳,是另一套工程艺术。
- L7 · 第 2 篇 7月15日
分布式训练:DP / DDP / FSDP / Tensor Parallel 怎么选
一张 H100 装不下 70B 模型。怎么把训练任务分给几千张卡?这一篇梳理 4 种主流并行策略。
- L7 · 第 1 篇 7月14日
GPU 速览:为什么 AI 离不开它
A100、H100、B200 是什么?为啥 AI 用 GPU 不用 CPU?这一篇打开硬件的黑盒。
- L6 · 第 3 篇 7月13日
红队与越狱:攻击 LLM 的方法与防御
AI 安全的"反派"视角——专门找模型漏洞的人在做什么。理解攻击才能防御。
- L6 · 第 2 篇 7月12日
RLHF 与 Constitutional AI:两大对齐方法对比
OpenAI 用 RLHF,Anthropic 用 CAI。它们都让 LLM "听话",但思路完全不同。
- L6 · 第 1 篇 7月11日
为什么需要 AI 对齐:从对错到价值观
能力越强的 AI,对齐越关键。这一篇讲清楚"对齐"到底是什么,为什么它是 AI 时代最重要的研究方向之一。
- L3 · 第 9 篇 7月10日
BERT vs GPT:两大 LLM 流派的本质区别
都是 Transformer,为啥一个做"理解"一个做"生成"?两者的训练目标差一个根本性的设计选择。
- L2 · 第 8 篇 7月9日
SVM 支持向量机:经典 ML 里的几何派
深度学习火之前,SVM 统治了 2000-2010 整整一个时代。今天它仍然是小数据集和文本分类的最优选之一。
- L5 · 第 2 篇 7月8日
Diffusion 数学:从加噪到生成
Stable Diffusion、DALL·E 3、Sora 都基于扩散模型。这一篇讲清楚它的核心数学——用最少的公式。
- L5 · 第 1 篇 7月7日
多模态总览:AI 如何同时"看、听、读"
GPT-4o 能识别你画的草图、Sora 能生成视频——这些"多模态"AI 是怎么做到的?这一篇打开全景图。
- L4 · 第 5 篇 7月6日
LoRA 微调入门:让大模型"特化"成你需要的样子
不用重训整个 70B 模型,只调几百万个参数,一张消费级显卡就能微调 LLM。
- L4 · 第 3 篇 7月5日
RAG 从 0 到 1:让 LLM 基于你的数据回答
企业 AI 应用 90% 都是 RAG。这一篇带你搭一个能跑的 RAG 系统——从分块到部署。
- L4 · 第 1 篇 7月4日
LLM 是怎么炼成的:Pretrain → SFT → RLHF 全流程
"训练一个 ChatGPT" 不是一步,是三步。每一步用完全不同的数据和目标。看完你能跟工程师对话。
- L3 · 第 8 篇 7月3日
完整 Transformer 架构:把所有积木组合起来
注意力是核心,但 Transformer 还有位置编码、FFN、残差连接、LayerNorm。这一篇把它们组合成一个完整可跑的模型。
- L3 · 第 4 篇 7月2日
RNN / LSTM 兴衰:序列模型简史
2017 年 Transformer 出现前,所有处理语言/语音的 AI 都靠 RNN 和它的衍生品。理解它的兴衰,才理解为什么 attention 是革命。
- L3 · 第 1 篇 7月1日
从感知机到多层神经网络:深度学习的起点
所有神经网络都是从一个 1958 年的简单模型扩展来的。这一篇讲清楚"神经元"到底是个啥。
2026 年 六月 · 28 条
- L2 · 第 7 篇 6月30日
评估指标 + 过拟合 + 正则化:让模型不犯傻的工程实战
会训模型不算啥。会判断模型"行不行"、知道为啥不行、怎么修——才是真正的 ML 工程师。
- L2 · 第 6 篇 6月29日
K-Means 聚类:最经典的无监督算法
没标签也能学。K-Means 是用户分群、图像压缩、市场分析的瑞士军刀——20 行代码就能写。
- L2 · 第 5 篇 6月28日
随机森林 + Boosting:让一群弱学习器变成超人
单棵树平庸,一群树投票就能逆天。Kaggle 十年霸主 XGBoost 的来历,就在这一篇。
- L2 · 第 4 篇 6月27日
决策树:最直观可解释的 ML 算法
一连串"是不是"问题,组成一棵决策的树。它是 XGBoost、LightGBM 等竞赛王者算法的基石。
- L2 · 第 3 篇 6月26日
逻辑回归与分类:从回归到决策
名字叫"回归"其实是分类。在神经网络出来之前,逻辑回归是工业界分类的事实标准——今天仍然是 baseline。
- L2 · 第 2 篇 6月25日
线性回归:最简单也最深刻的 ML 模型
你以为线性回归很简单?神经网络的最后一层、几乎所有 ML 的起点——都是它。
- L2 · 第 1 篇 6月24日
监督 / 无监督 / 强化:机器学习的三大世界观
所有机器学习算法都属于这三类之一。理解这个分类,你立刻能给任何算法"找它的家"。
- L1 · 第 10 篇 6月23日
PyTorch 基础:张量、自动求导、你的第一个神经网络
把 L1 全部的数学和 Python 武器组合起来——这是你的"AI 工程师"入门仪式。
- L1 · 第 9 篇 6月22日
Pandas 数据处理:DataFrame 是 ML 数据的标准载体
看到 CSV、Excel 这些"表格数据",先用 Pandas 装起来再说。这是 ML 工程师每天用的工具。
- L1 · 第 8 篇 6月21日
NumPy 数组运算:让 Python 像 MATLAB 一样会做矩阵
NumPy 是所有 ML 代码的地基。这一篇让你的"循环式思维"升级为"向量化思维"——快 100 倍的那种。
- L1 · 第 7 篇 6月20日
Python 速成(一):30 分钟从零到能写函数
只讲 ML 用得到的 Python 子集——不教 OOP,不教装饰器,不教 generator。够用就好。
- L1 · 第 6 篇 6月19日
链式法则与反向传播:手算一个 3 层网络
把 L1 前 5 篇的所有数学武器组合起来——让我们手算一遍真实神经网络的梯度。
- L1 · 第 5 篇 6月18日
信息论:熵、交叉熵、KL 散度的直觉
损失函数为什么长 -log P 这样?这一篇从信息论角度回答。理解了,你看到任何损失函数都不再陌生。
- L4 · 第 2 篇 6月17日
Tokenizer 与 BPE:LLM 看到的不是字,是 token
为什么 GPT 把"strawberry"切成 4 个 token?为什么数错"strawberry 有几个 r"?这些都和 tokenizer 有关。
- L3 · 第 6 篇 6月16日
CNN 卷积原理:从滤镜到 ResNet
在 Transformer 称霸前,CNN 是计算机视觉的统治者。它今天仍然是处理图像的标配。这一篇讲清楚"卷积"到底是什么。
- L3 · 第 5 篇 6月15日
注意力机制详解:从直觉到完整推导
Attention is all you need. 这一篇带你从"它到底在干嘛"到"它的每行公式",一次性吃透 Transformer 的核心。
- L2 · 第 9 篇 6月14日
优化器深度解析:SGD / Momentum / Adam 为什么是这样
你以为梯度下降只是"沿梯度反方向走"——其实有 10 多种花式走法。Adam 凭什么成为深度学习默认款?
- L1 · 第 4 篇 6月13日
概率与最大似然:为什么 ML 是个概率问题
所有 ML 模型其实都在干同一件事:寻找让"看到这些数据"的概率最大的参数。这个观点一旦你 get 了,整个 ML 都通透了。
- L1 · 第 3 篇 6月12日
导数与梯度:"学习"的数学定义
"训练神经网络" 的本质就是导数。把这个词搞懂,AI 的训练流程在你眼里就再不神秘了。
- L1 · 第 2 篇 6月11日
线性代数:用图片和位置讲明白向量和矩阵
所有 AI 的本质都是矩阵运算。这一篇不讲行列式不讲特征值,只让你"看见"向量在干什么。
- L1 · 第 1 篇 6月10日
数学不发愁:这本来该是数学课,但我们换个学法
被高中数学伤过没关系。我们用图、动画、Python 代码把 AI 数学讲清楚——不会的不要先怕,是教材写得不行而已。
- L0 · 第 12 篇 6月7日
L0 毕业了:下一步学什么?
恭喜读完启蒙路径。这一篇帮你规划下一步——是继续往深里学,还是横着拓宽,还是直接动手做项目。
- L0 · 第 11 篇 6月6日
AI 词汇表:60+ 核心术语(持续更新)
Token、Embedding、Transformer、RAG、Fine-tuning、MoE、SAE、Function Calling、MCP……AI 圈高频黑话一次给你讲完。
- L0 · 第 10 篇 6月5日
AI 安全:你和 AI 聊的话,去哪了?
你贴进 ChatGPT 的合同、病历、产品机密——它们怎么处理?谁能看到?这些事知道了,你才能放心用。
- L0 · 第 9 篇 6月4日
ChatGPT / Claude / Gemini 怎么选?——一份不站队的横评
不吹也不黑,把三大模型的优劣摆在桌面上。哪个最适合你,取决于你要干什么。
- L0 · 第 8 篇 6月3日
AI 会取代我的工作吗?——一个分类框架
不要问"会不会取代你",问"会取代你工作里的哪些部分"。这一篇给你一个能套用一辈子的判断框架。
- L0 · 第 7 篇 6月2日
5 分钟跑通你的第一个 AI 对话
理论讲完了,上手最快。手把手注册、登录、第一句话怎么说。
- L0 · 第 6 篇 6月1日
"智能"到底是什么?——从图灵测试到今天的争论
一个我们以为很清楚、其实从来没说清楚过的词。当你下次纠结"AI 算不算真的智能",先看完这篇。
2026 年 五月 · 13 条
- L0 · 第 5 篇 5月31日
提示词入门 10 招:让 AI 干活立刻精准 10 倍
不用学黑话,10 个动作就够。这一篇让你的 AI 使用水平直接超过 80% 的人。
- L0 · 第 4 篇 5月30日
"幻觉"是什么、为什么会发生、怎么减轻
为什么 AI 会一本正经地胡说八道?这不是 bug,这是它本来就这样工作。理解了机制,你就知道怎么用。
- L0 · 第 3 篇 5月29日
AI 现在到底能做什么、不能做什么——用真实例子说话
不要再听吹牛和黑稿了,我们一条一条核对:哪些事 AI 已经做得比你好,哪些事它彻底做不了。
- 资讯 · industry 5月28日
Anthropic 完成 650 亿美元 H 轮融资,估值跃至 9650 亿
Anthropic 在 5 月 28 日同步官宣 H 轮融资:650 亿美元 post-money 估值 9650 亿,run-rate 收入已过 470 亿。这是史上规模最大的私募融资之一,距离 2 月 G 轮(3800 亿)仅 3.5 个月。
- 资讯 · model 5月28日
Anthropic 发布 Claude Opus 4.8:浏览器智能体能力大幅提升
Anthropic 推出 Claude Opus 4.8,在 Online-Mind2Web 浏览器智能体任务上达 84%,定价维持 5/25 美元每百万 token。
- L0 · 第 2 篇 5月28日
一篇文章读完 AI 简史:从图灵到 ChatGPT
70 年压成 15 分钟。不讲流水账,只挑改变了游戏规则的 11 个时刻。
- 资讯 · industry 5月27日
Devin 母公司 Cognition 融资超 10 亿美元,估值 260 亿
据 TechCrunch 报道,AI 编程公司 Cognition(Devin)融资超 10 亿美元,投后估值 260 亿美元,由 Lux Capital、General Catalyst、8VC 领投;年化营收约 4.92 亿美元。
- L0 · 第 1 篇 5月27日
AI、机器学习、深度学习、大模型,到底什么关系?
一篇文章拆清楚四个被搞混最多的词,从此你不会再被任何吹牛和黑话唬住。
- 资讯 · research 5月22日
Anthropic「Glasswing」项目:一个月内发现逾万个高危漏洞
Anthropic 公布 Project Glasswing 首月进展:用 AI 辅助安全测试,在关键软件中发现逾 1 万个高/严重级漏洞,约 50 家机构参与(Cloudflare、Mozilla、微软等)。
- 资讯 · model 5月21日
阿里发布 Qwen3.7-Max:主打「Agent 基座」的旗舰模型
阿里云发布 Qwen3.7-Max,定位通用 Agent 基座;GPQA Diamond 92.4、Terminal-Bench 2.0 69.7,并演示 35 小时、上千次工具调用的自主运行。
- 资讯 · policy 5月19日
OpenAI 推进内容溯源:C2PA 合规 + SynthID 水印 + 公开验证工具
OpenAI 成为 C2PA 合规生成式产品,并引入 Google DeepMind 的 SynthID 隐形水印,同时推出公开验证工具预览版,帮助判断图片是否由 OpenAI 生成。
- 资讯 · model 5月19日
Google 发布 Gemini 3.5 Flash:旗舰级智能,Flash 级速度
Google 推出 Gemini 3.5 Flash,主打智能体与编码,号称比其它前沿模型快 4 倍;Terminal-Bench 2.1 达 76.2%,3.5 Pro 下月跟进。
- 资讯 · industry 5月18日
Anthropic 收购 Stainless:补强 Agent 的「连接力」
Anthropic 收购 SDK / MCP 工具公司 Stainless——它生成了 Anthropic 历来每一个官方 SDK;此举意在强化 Claude 连接数据与工具的能力。
2026 年 四月 · 2 条
2026 年 二月 · 1 条
2025 年 十一月 · 1 条
2025 年 十月 · 1 条
2025 年 八月 · 2 条
2025 年 七月 · 1 条
2025 年 五月 · 1 条
2025 年 四月 · 2 条
- 资讯 · model 4月16日
OpenAI 发布 o3 + o4-mini:推理模型首次原生使用所有工具
OpenAI 在 4 月 16 日发布 o3 和 o4-mini。第一次让推理模型 agentically 调用 ChatGPT 全部工具——搜索、Python、图像生成、视觉分析。ARC-AGI 上比 o1 准确率高 3 倍。
- 资讯 · model 4月5日
Meta 开源 Llama 4:原生多模态 MoE,Scout 上下文达 1000 万 token
Meta 发布 Llama 4 Scout 与 Maverick——首批开放权重的原生多模态 MoE 模型。Scout 上下文达 1000 万 token,万亿级的 Behemoth 仍在训练中。
2025 年 三月 · 1 条
2025 年 二月 · 2 条
- 资讯 · model 2月24日
Claude 3.7 Sonnet 发布:首个集成推理模式的旗舰模型
Anthropic 推出 Claude 3.7 Sonnet 和 Claude Code CLI——用户可控制 thinking 时长,编码能力 SWE-bench 70.3% 大幅领先同档。
- 资讯 · model 2月17日
xAI 发布 Grok 3:10× 训练算力,引入 Think 模式 + DeepSearch
Musk 旗下 xAI 发布 Grok 3,用 20 万张 H100 集群 Colossus 训练(10× Grok-2)。引入推理 Think 模式 + 联网搜索 DeepSearch,AIME / GPQA 上号称超 GPT-4o。
2025 年 一月 · 3 条
- 资讯 · model 1月31日
OpenAI 发布 o3-mini:推理模型平民化,免费 ChatGPT 用户也能用
OpenAI 在 DeepSeek R1 发布后 10 天紧急推出 o3-mini,性价比大幅提升。低 / 中 / 高三档“推理强度”任选,编码、数学、科学专业领域全面提升。
- 资讯 · model 1月20日
DeepSeek R1 开源发布:推理能力对标 OpenAI o1,训练成本仅 $5.6M
DeepSeek 发布 R1,在 AIME 数学竞赛、Codeforces 等推理基准上达到 o1 级水平。模型 + 权重 + 训练方法全部开源(MIT 协议),训练成本仅 $5.6M。
- 资讯 · policy 1月15日
美国发布 AI Diffusion Rule:把全球分三档管控 AI 芯片出口
Biden 政府 1 月 15 日发布「AI Diffusion 框架」——按国家分三档管控 H100 等高端 AI 芯片出口。5 月被 Trump 政府撤销,但确立了「算力 = 战略资源」的监管思路。
2024 年 十二月 · 3 条
- 资讯 · model 12月11日
Google 发布 Gemini 2.0 Flash:原生多模态 + Agent 能力
Gemini 2.0 Flash 首次原生支持图像、音频流输出 + 工具使用 + 多模态实时 API。Google 第二代旗舰,性能超越 Gemini 1.5 Pro 同时速度 2 倍。
- 资讯 · model 12月6日
Meta 发布 Llama 3.3 70B:70B 性能接近 405B 旗舰
Llama 3.3 70B 通过改进训练 + 后训练对齐,让 70B 模型在多数基准上接近 Llama 3.1 405B。推理 / 部署成本大幅降低,开源生态获益。
- 资讯 · research 12月4日
Google DeepMind 发布 Genie 2:从一张图生成可玩 3D 世界
DeepMind 发布 Genie 2 世界模型——从单张图像 + 文字描述就能生成可交互的 3D 环境,物体交互 / 光照 / 物理 / NPC 全自动模拟。具身智能的关键基础。