LLM 与生成式
前沿——Tokenizer、训练、RAG、Agent、MCP、成本优化
LLM 是怎么炼成的:Pretrain → SFT → RLHF 全流程
"训练一个 ChatGPT" 不是一步,是三步。每一步用完全不同的数据和目标。看完你能跟工程师对话。
Prompt 进阶技巧:CoT / Self-Consistency / Tree of Thoughts / Reflexion
L0-05 教你 10 个基础招。这一篇讲学术研究里的"硬核" prompt 工程——能让 GPT-4 在数学题上从 50% 升到 85%。
Tokenizer 与 BPE:LLM 看到的不是字,是 token
为什么 GPT 把"strawberry"切成 4 个 token?为什么数错"strawberry 有几个 r"?这些都和 tokenizer 有关。
RAG 从 0 到 1:让 LLM 基于你的数据回答
企业 AI 应用 90% 都是 RAG。这一篇带你搭一个能跑的 RAG 系统——从分块到部署。
Agent 构建详解:让 LLM 自己干活
从"问一句答一句的对话"到"能连续工作 4 小时的同事"——Agent 是 LLM 应用工程的下一步。
LoRA 微调入门:让大模型"特化"成你需要的样子
不用重训整个 70B 模型,只调几百万个参数,一张消费级显卡就能微调 LLM。
In-Context Learning:为什么 LLM 看几个例子就会
GPT-3 让所有人惊讶的能力——不微调,只给几个例子就能学。它是怎么工作的?这一篇用研究解读。
MCP 协议详解:AI 世界的 USB 接口
Anthropic 2024 提出的 MCP——让任何工具能接入任何 LLM。一年时间成为 AI Agent 生态的事实标准。
LLM 评估:从 MMLU 到真实业务
怎么知道你的 LLM 应用"好不好"?这一篇讲学术 benchmark + 工程评估的完整工具栈。
Tool Use 工程实战:让 LLM 真正会用工具
LLM 能用工具——但要让它"用得稳、用得对、用得省"是另一门工程艺术。这一篇讲实战。
Multi-Agent 系统:让 AI 团队协作
一个 Agent 够强了吗?很多场景下不够——需要多个 Agent 分工。AutoGen、CrewAI 等框架开启了"AI 团队"时代。
MCP 工具开发:手把手做一个自己的 MCP server
L4-07 讲了 MCP 是什么。这一篇手把手教你写一个能让 Claude / Cursor 直接用的 MCP server。
LLM 成本优化:从 prompt 到部署的 10× 省钱方法
LLM 调用又贵又快——一不小心就把 AWS 账单炸了。这一篇讲实战中的成本管控技巧。
Function Calling vs Tool Use vs MCP:三个相关概念怎么区分
工业界三个名字最让人晕——但它们是同一件事的三层抽象。一篇说清楚。
结构化输出:JSON Mode / Grammars / Pydantic
让 LLM 输出可靠的机器可读结果——工业界 Agent / 工作流不可或缺的能力。
Prompt Caching 工程实战:省 90% LLM 成本的技巧
Anthropic / OpenAI / Gemini 都支持的"prefix caching"——让重复的 system prompt 不再重复花钱。
视觉语言 Agent:让 AI 操控你的屏幕
Claude Computer Use、OpenAI Operator、Gemini 2.5 Computer Use——LLM 看屏幕 + 点鼠标 + 敲键盘,2024-2026 Agent 最大产品形态。
Adaptive RAG:让 LLM 自己决定要不要检索 / 怎么检索
朴素 RAG 把所有问题都送去检索 = 慢 + 贵 + 噪声多。Adaptive RAG 让 LLM 先判断,再决定如何检索 / 检索几次 / 跳过检索。
Eval-Driven Development:用 eval 驱动 LLM 应用开发
TDD 在传统软件叫"测试驱动";EDD 在 LLM 时代叫"评估驱动"——eval 先于 prompt、先于模型选型、先于功能。这是 2026 LLM 工程的核心方法论。