⚙️
L7
系统与工程化
GPU、分布式训练、推理优化、监控、部署
8 篇文章 109 分钟阅读 23 个 tag
第 1 篇 🐣 12 分钟 #GPU#CUDA#硬件
GPU 速览:为什么 AI 离不开它
A100、H100、B200 是什么?为啥 AI 用 GPU 不用 CPU?这一篇打开硬件的黑盒。
第 2 篇 🐥 13 分钟 #分布式训练#FSDP#DDP
分布式训练:DP / DDP / FSDP / Tensor Parallel 怎么选
一张 H100 装不下 70B 模型。怎么把训练任务分给几千张卡?这一篇梳理 4 种主流并行策略。
第 3 篇 🐥 16 分钟 #推理#vLLM#量化
推理优化:vLLM / 量化 / 投机解码 / KV Cache
训完模型只是开始。让 LLM 在生产环境跑快、跑省、跑稳,是另一套工程艺术。
第 4 篇 🐥 11 分钟 #量化#GPTQ#AWQ
量化深度解析:GPTQ / AWQ / FP8 / GGUF 全谱
让 70B 模型塞进 24GB 显存——量化是消费级硬件跑大模型的关键。这一篇详解各家方案。
第 5 篇 🐥 12 分钟 #部署#MLOps#推理服务
模型部署与服务化:从训完到上线
训出来一个模型只是开始。怎么把它变成一个 24/7 稳定、便宜、可扩展的服务?这一篇讲生产工程。
第 6 篇 🐥 14 分钟 #训练优化#Mixed Precision#L7
训练优化进阶:让大模型训得动
梯度检查点 / 混合精度 / Activation Recomputation / ZeRO Offload——这些工程技巧让 70B 模型在单卡上能微调。
第 7 篇 🐣 15 分钟 #监控#Observability#LLMOps
监控与可观测性:LLM 应用的生产管理
一个 LLM 产品上线后,怎么知道它"行不行"?慢了、错了、贵了、被攻击了?这一篇讲监控栈。
第 9 篇 🐥 16 分钟 #LLMOps#Observability#Eval
LLMOps 全景:观测 / 评估 / 监控 / 实验
LLM 应用上线后真正的工作才开始——Langfuse、Helicone、OpenTelemetry、持续 eval、A/B 实验。2026 LLMOps 完整工具栈。