HelloAI
🦅
L4

LLM 与生成式

前沿——Tokenizer、训练、RAG、Agent、MCP、成本优化

19 篇文章 244 分钟阅读 41 个 tag
第 1 篇 🐣 11 分钟 #LLM#Pretrain#RLHF

LLM 是怎么炼成的:Pretrain → SFT → RLHF 全流程

"训练一个 ChatGPT" 不是一步,是三步。每一步用完全不同的数据和目标。看完你能跟工程师对话。

第 2 篇 🐣 11 分钟 #Prompt#CoT#L4

Prompt 进阶技巧:CoT / Self-Consistency / Tree of Thoughts / Reflexion

L0-05 教你 10 个基础招。这一篇讲学术研究里的"硬核" prompt 工程——能让 GPT-4 在数学题上从 50% 升到 85%。

第 2 篇 🐣 13 分钟 #Tokenizer#BPE#LLM

Tokenizer 与 BPE:LLM 看到的不是字,是 token

为什么 GPT 把"strawberry"切成 4 个 token?为什么数错"strawberry 有几个 r"?这些都和 tokenizer 有关。

第 3 篇 🐣 15 分钟 #RAG#检索#LLM

RAG 从 0 到 1:让 LLM 基于你的数据回答

企业 AI 应用 90% 都是 RAG。这一篇带你搭一个能跑的 RAG 系统——从分块到部署。

第 4 篇 🐥 12 分钟 #Agent#Tool Use#MCP

Agent 构建详解:让 LLM 自己干活

从"问一句答一句的对话"到"能连续工作 4 小时的同事"——Agent 是 LLM 应用工程的下一步。

第 5 篇 🐥 13 分钟 #LoRA#微调#Fine-tuning

LoRA 微调入门:让大模型"特化"成你需要的样子

不用重训整个 70B 模型,只调几百万个参数,一张消费级显卡就能微调 LLM。

第 6 篇 🐣 12 分钟 #ICL#Few-shot#L4

In-Context Learning:为什么 LLM 看几个例子就会

GPT-3 让所有人惊讶的能力——不微调,只给几个例子就能学。它是怎么工作的?这一篇用研究解读。

第 7 篇 🐣 12 分钟 #MCP#Tool Use#Agent

MCP 协议详解:AI 世界的 USB 接口

Anthropic 2024 提出的 MCP——让任何工具能接入任何 LLM。一年时间成为 AI Agent 生态的事实标准。

第 8 篇 🐣 16 分钟 #评估#Evaluation#Benchmark

LLM 评估:从 MMLU 到真实业务

怎么知道你的 LLM 应用"好不好"?这一篇讲学术 benchmark + 工程评估的完整工具栈。

第 9 篇 🐣 17 分钟 #Tool Use#Function Calling#L4

Tool Use 工程实战:让 LLM 真正会用工具

LLM 能用工具——但要让它"用得稳、用得对、用得省"是另一门工程艺术。这一篇讲实战。

第 10 篇 🐥 12 分钟 #Multi-Agent#AutoGen#L4

Multi-Agent 系统:让 AI 团队协作

一个 Agent 够强了吗?很多场景下不够——需要多个 Agent 分工。AutoGen、CrewAI 等框架开启了"AI 团队"时代。

第 11 篇 🐣 16 分钟 #MCP#工程实战#L4

MCP 工具开发:手把手做一个自己的 MCP server

L4-07 讲了 MCP 是什么。这一篇手把手教你写一个能让 Claude / Cursor 直接用的 MCP server。

第 12 篇 🐣 15 分钟 #成本优化#LLM 工程#L4

LLM 成本优化:从 prompt 到部署的 10× 省钱方法

LLM 调用又贵又快——一不小心就把 AWS 账单炸了。这一篇讲实战中的成本管控技巧。

第 13 篇 🐣 11 分钟 #Function Calling#Tool Use#MCP

Function Calling vs Tool Use vs MCP:三个相关概念怎么区分

工业界三个名字最让人晕——但它们是同一件事的三层抽象。一篇说清楚。

第 14 篇 🐣 12 分钟 #Structured Output#JSON#Pydantic

结构化输出:JSON Mode / Grammars / Pydantic

让 LLM 输出可靠的机器可读结果——工业界 Agent / 工作流不可或缺的能力。

第 15 篇 🐣 11 分钟 #Prompt Caching#Cost#L4

Prompt Caching 工程实战:省 90% LLM 成本的技巧

Anthropic / OpenAI / Gemini 都支持的"prefix caching"——让重复的 system prompt 不再重复花钱。

第 16 篇 🐥 13 分钟 #Computer Use#GUI Agent#Operator

视觉语言 Agent:让 AI 操控你的屏幕

Claude Computer Use、OpenAI Operator、Gemini 2.5 Computer Use——LLM 看屏幕 + 点鼠标 + 敲键盘,2024-2026 Agent 最大产品形态。

第 17 篇 🐥 11 分钟 #RAG#Adaptive#Routing

Adaptive RAG:让 LLM 自己决定要不要检索 / 怎么检索

朴素 RAG 把所有问题都送去检索 = 慢 + 贵 + 噪声多。Adaptive RAG 让 LLM 先判断,再决定如何检索 / 检索几次 / 跳过检索。

第 18 篇 🐥 11 分钟 #Eval#EDD#Methodology

Eval-Driven Development:用 eval 驱动 LLM 应用开发

TDD 在传统软件叫"测试驱动";EDD 在 LLM 时代叫"评估驱动"——eval 先于 prompt、先于模型选型、先于功能。这是 2026 LLM 工程的核心方法论。

📍 学完之后
L5:多模态 / L6:安全 / L7:系统