HelloAI
⚙️
L7

系统与工程化

GPU、分布式训练、推理优化、监控、部署

8 篇文章 109 分钟阅读 23 个 tag
第 1 篇 🐣 12 分钟 #GPU#CUDA#硬件

GPU 速览:为什么 AI 离不开它

A100、H100、B200 是什么?为啥 AI 用 GPU 不用 CPU?这一篇打开硬件的黑盒。

第 2 篇 🐥 13 分钟 #分布式训练#FSDP#DDP

分布式训练:DP / DDP / FSDP / Tensor Parallel 怎么选

一张 H100 装不下 70B 模型。怎么把训练任务分给几千张卡?这一篇梳理 4 种主流并行策略。

第 3 篇 🐥 16 分钟 #推理#vLLM#量化

推理优化:vLLM / 量化 / 投机解码 / KV Cache

训完模型只是开始。让 LLM 在生产环境跑快、跑省、跑稳,是另一套工程艺术。

第 4 篇 🐥 11 分钟 #量化#GPTQ#AWQ

量化深度解析:GPTQ / AWQ / FP8 / GGUF 全谱

让 70B 模型塞进 24GB 显存——量化是消费级硬件跑大模型的关键。这一篇详解各家方案。

第 5 篇 🐥 12 分钟 #部署#MLOps#推理服务

模型部署与服务化:从训完到上线

训出来一个模型只是开始。怎么把它变成一个 24/7 稳定、便宜、可扩展的服务?这一篇讲生产工程。

第 6 篇 🐥 14 分钟 #训练优化#Mixed Precision#L7

训练优化进阶:让大模型训得动

梯度检查点 / 混合精度 / Activation Recomputation / ZeRO Offload——这些工程技巧让 70B 模型在单卡上能微调。

第 7 篇 🐣 15 分钟 #监控#Observability#LLMOps

监控与可观测性:LLM 应用的生产管理

一个 LLM 产品上线后,怎么知道它"行不行"?慢了、错了、贵了、被攻击了?这一篇讲监控栈。

第 9 篇 🐥 16 分钟 #LLMOps#Observability#Eval

LLMOps 全景:观测 / 评估 / 监控 / 实验

LLM 应用上线后真正的工作才开始——Langfuse、Helicone、OpenTelemetry、持续 eval、A/B 实验。2026 LLMOps 完整工具栈。

📍 学完之后
论文精读,或回去深耕某个 L4-L6 子方向