HelloAI
🎨 可视化画廊

抽象概念
做成你能玩的玩具

每一个可视化都可以拖动、点击、修改参数。
选一个让你好奇的开始。

⭐ 精选
🦅 大模型 · 入门玩具

Tokenizer Playground

同一句话,被 GPT-4、Claude、Llama 切成的 token 数量为什么差这么多? 为什么调用 API 时中文比英文贵 2 倍?亲手输入文字,立刻看清。

🕒 5 分钟玩转·🐣 入门
打开可视化 →
输入: "Hello, 世界! 🌍"
Hello , ▁世 ! ▁🌍
GPT-4
6 tok
Claude
5 tok
Llama
8 tok
Q K
🧠 深度学习

注意力实时计算

输入句子,看 4 种"注意力头"的工作方式:近邻、全局、相似、句法。

🐣 🕒 10 分钟 📚 文章
start minimum
📐 数学/优化

梯度下降登山者

点击地图任意位置,看 SGD、Momentum、Adam 三种优化器同时下山。

🐣 🕒 12 分钟 📚 文章
king queen man woman apple banana cherry dim 1 dim 2
🦅 大模型

Embedding 空间漫游

50 个词在 2D 空间的位置,玩词向量算术 (king − man + woman = ?)。

🐣 🕒 7 分钟 📚 文章
3×3 kernel 特征图
🧠 深度学习

CNN 卷积扫描

拖动卷积核扫过图像,看不同 kernel 抽出不同特征:边缘、模糊、锐化。

🥚 🕒 8 分钟 📚 文章
the · 0.42 a · 0.28 an · 0.15 this · 0.08 temperature = 0.7
🦅 大模型

LLM 采样可视化

调 temperature / top-k / top-p,看候选词概率分布变化,亲手抽下一个词。

🐣 🕒 6 分钟 📚 文章
t=1000 t=750 t=500 t=250 t=0 从噪声到图像
🎨 多模态

Diffusion 去噪

从纯噪声开始,50 步生成图像。看 Stable Diffusion / Sora 的核心思路。

🐥 🕒 10 分钟
query 向量库 LLM 检索 → 重排 → 生成
🦅 大模型

RAG 全流程

输入问题,看分块 → 向量化 → 检索 → 重排 → 生成 5 步动画。

🐣 🕒 12 分钟 📚 文章
无 Cache O(n²) 有 Cache O(n) 缓存命中省下重复计算
⚙️ 系统工程

KV Cache

同一个生成过程,有 KV Cache 比没 cache 快多少?左右对比直观看 O(n²) 变 O(n)。

🐥 🕒 8 分钟 📚 文章
GPU0GPU1 GPU2GPU3 bubble = 调度空闲 时间 →
⚙️ 系统工程

流水线并行

4 张 GPU 训大模型,怎么调度才高效?对比 Naive / GPipe / 1F1B 三种调度的 bubble 差异。

🐥 🕒 10 分钟 📚 文章
"the cat" Router E1 E2 E3 E4 E5 E6 E7 E8 每个 token 走 2 个专家
🦅 大模型

MoE 混合专家

8 个专家分工合作——每个 token 选 2 个最合适的过。点击 token 看路由模式。

🐣 🕒 8 分钟 📚 文章
小模型一次猜 5 个 tok1 tok2 tok3 tok4 tok5 大模型并行验证 3/5 接受 → 加速 3×
⚙️ 系统工程

投机解码

小模型猜 + 大模型验证 = LLM 推理加速 2-4 倍。看每轮接受率怎么影响总时间。

🐥 🕒 8 分钟 📚 文章
The cat dog sat ate ran barked k=2 保留每层最优 2 条
🦅 大模型

Beam Search

贪心 / Beam k=2 / Beam k=4 / 采样 四种解码策略对比。看 LLM 怎么选最优整句。

🐣 🕒 8 分钟 📚 文章
Teacher 软分布 Student 学到 KL 70B → 7B 温度 T = 3.0
⚙️ 系统工程

知识蒸馏

大模型怎么"教"小模型?调温度参数看"软标签 vs 硬标签"对学生模型的影响。

🐣 🕒 8 分钟 📚 文章
the of and 中国 def code 42 2024 SolidGoldMagikarp ⚠ 玄学 token 英文 60% 中文 20% 代码 10%
🦅 大模型

词表地图

GPT-4 词表里都有什么?300 token 按类别+频率聚类——英文、中文、代码、玄学 token 一图看尽。

🐣 🕒 8 分钟 📚 文章
x h₁ h₂ ŷ ∂L/∂x ← chain rule Forward →
🧠 深度学习

反向传播

一个 2 层网络的 forward + backward,5 步看链式法则怎么把 loss 的梯度传回每个参数。

🐣 🕒 8 分钟 📚 文章
真分布 生成器学习中 D: 真/假
🎨 多模态

GAN 博弈

生成器 vs 判别器实时训练,看红色点(生成样本)怎么逼近蓝色点(真分布)。换 4 种真分布玩。

🐥 🕒 10 分钟 📚 文章
回答 A r = 3.2 回答 B r = 8.7 vs 人类偏好:B 更好 L = -log σ(r_B - r_A)
🛡️ AI 安全

RLHF 奖励信号

4 个 prompt × 2 个候选回答 × 奖励模型打分。看人类偏好怎么变成训练信号。

🐣 🕒 8 分钟 📚 文章
GPT-4 Hello ·world ! 3 tok Claude Hello ·world ! 3 tok Llama-3 Hello wor ld ! 4 tok 同一句话,不同切法
🦅 大模型

Tokenizer 三模型对比

同一句话 GPT-4 / Claude / Llama-3 并排切。看中文为什么更贵 + API 费用即时计算。

🐣 🕒 6 分钟 📚 文章
H1 ⬅️ H2 H3 🎯 H4 🔁 H5 📐 H6 · H7 🌉 H8 🌈 每 head 学到不同关系
🧠 深度学习

注意力 Head 探针

8 个 head 各自学到了不同模式——近邻/句法/指代/标点。点击 head 看它在关注什么。

🐥 🕒 12 分钟 📚 文章
start min loss 地形 + 优化路径
📐 数学/优化

Loss 3D 曲面

5 种地形(碗/鞍点/峡谷/平台/多峰)× SGD/Momentum/Adam 同时跑。可拖动旋转视角。

🐥 🕒 10 分钟 📚 文章
Q K
🦅 大模型

Computer Use Agent 循环

AI 看屏幕 → 输出鼠标键盘动作 → 执行 → 再截屏。看每步 token 成本累积。

🐥 🕒 8 分钟 📚 文章
真分布 生成器学习中 D: 真/假
🎨 多模态

AI 音乐生成管线

从 prompt 到音频的 5 个阶段:文字编码 → 主模型 → 音频 token → vocoder → 波形。

🐣 🕒 6 分钟 📚 文章
回答 A r = 3.2 回答 B r = 8.7 vs 人类偏好:B 更好 L = -log σ(r_B - r_A)
⚙️ 系统工程

VLA 模型:看+想+动

机械臂从摄像头画面 + 自然语言指令到关节角度序列——具身智能完整流程。

🐥 🕒 8 分钟 📚 文章
回答 A r = 3.2 回答 B r = 8.7 vs 人类偏好:B 更好 L = -log σ(r_B - r_A)
🛡️ AI 安全

CoT 不忠实可视化

复现 Anthropic 2025 实验:Claude 用了 hint 但只有 25% 的情况会在 thinking 里提。

🐥 🕒 7 分钟 📚 文章
回答 A r = 3.2 回答 B r = 8.7 vs 人类偏好:B 更好 L = -log σ(r_B - r_A)
⚙️ 系统工程

LLMOps Trace 链路

4 种真实 trace:正常 / 命中缓存 / Agent 多步 / cost runaway。看一次请求里发生了什么。

🐣 🕒 6 分钟 📚 文章