← 可视化 /

🎵 AI 音乐生成管线

L5-08

从文字到声波的 5 个阶段

点击播放,看 Suno / Udio 怎么把"一句话"变成"完整歌曲"。

1 · Prompt
lo-fi hip-hop, jazzy piano, mellow
+ [Verse / Chorus] 标签控制结构
2 · Text encoder
CLIP/T5
[0.42, -0.18, 0.87, ...]
[1024-d embedding]
3 · 主模型
Transformer / Diffusion
tok_4f tok_a1 tok_3b tok_9d tok_2c tok_7e
4 · Vocoder
EnCodec / SoundStream
tokens → 48 kHz waveform
5 · 音频 ✓
3:30 mp3 · 12 stems
生成进度
0%
点击「生成」开始...
A. Autoregressive 路线
  • • MusicGen (Meta)、早期 Suno
  • • 音频 → 离散 token → Transformer 逐 token 生成
  • • ✅ 可控 ❌ 慢
B. Diffusion 路线
  • • Stable Audio / Riffusion
  • • latent audio space 去噪
  • • ✅ 质量高、快 ❌ 可控性差

**Suno v5 / Udio v3** 业界推测是两者混合。

→ 配套阅读:L5-08 AI 音乐