🎨
L5
多模态
Diffusion、ViT、CLIP、Sora、Whisper、TTS
9 篇文章 99 分钟阅读 27 个 tag
第 1 篇 🐣 14 分钟 #多模态#CLIP#视觉
多模态总览:AI 如何同时"看、听、读"
GPT-4o 能识别你画的草图、Sora 能生成视频——这些"多模态"AI 是怎么做到的?这一篇打开全景图。
第 2 篇 🐥 10 分钟 #Diffusion#Stable Diffusion#生成模型
Diffusion 数学:从加噪到生成
Stable Diffusion、DALL·E 3、Sora 都基于扩散模型。这一篇讲清楚它的核心数学——用最少的公式。
第 3 篇 🐣 12 分钟 #ViT#CLIP#视觉
ViT 与 CLIP:让 Transformer 看图
把图像切成 patch,喂给 Transformer——视觉领域 2020 年最大的范式转变。
第 4 篇 🐣 8 分钟 #Whisper#ASR#语音识别
Whisper:让 AI 听懂 99 种语言
OpenAI 开源的 Whisper 是当下最强语音识别。手机录音转文字、会议纪要、字幕生成——背后几乎都是它。
第 5 篇 🐣 11 分钟 #TTS#语音合成#L5
TTS 语音合成:从拼接到神经合成
从机器人腔到逼真人声——TTS 走过的路。VALL-E 让 3 秒声音克隆任何人——这个能力的两面性。
第 6 篇 🐥 13 分钟 #视频生成#Sora#Diffusion
视频生成:从 Sora 到现代视频 AI
Sora、Runway Gen-3、Veo、Kling……2024-2026 视频生成爆发。这一篇讲技术原理 + 工程细节 + 商业格局。
第 7 篇 🐥 12 分钟 #3D#NeRF#Gaussian Splatting
3D 生成:NeRF / Gaussian Splatting / 文本到 3D
2D 之后的下一波 AI 内容革命——从一组照片重建 3D,从文字生成 3D 资产。
第 8 篇 🐥 10 分钟 #AI 音乐#Suno#Udio
AI 音乐:Suno / Udio / MusicGen 的技术与商业
2024-2026 AI 音乐从"听起来像 AI"变成"分不出和真人"。Suno v5、Udio、MusicGen 的技术原理 + 法律争议 + 商业模式。
第 9 篇 🐥 9 分钟 #Robotics#VLA#Embodied AI
机器人 + LLM:VLA 模型与具身智能
PaLM-E、RT-2、π0、Optimus——LLM 与机器人正式融合,"看 + 想 + 动"成为一个模型。2026 具身智能新格局。