HelloAI
🎨
L5

多模态

Diffusion、ViT、CLIP、Sora、Whisper、TTS

9 篇文章 99 分钟阅读 27 个 tag
第 1 篇 🐣 14 分钟 #多模态#CLIP#视觉

多模态总览:AI 如何同时"看、听、读"

GPT-4o 能识别你画的草图、Sora 能生成视频——这些"多模态"AI 是怎么做到的?这一篇打开全景图。

第 2 篇 🐥 10 分钟 #Diffusion#Stable Diffusion#生成模型

Diffusion 数学:从加噪到生成

Stable Diffusion、DALL·E 3、Sora 都基于扩散模型。这一篇讲清楚它的核心数学——用最少的公式。

第 3 篇 🐣 12 分钟 #ViT#CLIP#视觉

ViT 与 CLIP:让 Transformer 看图

把图像切成 patch,喂给 Transformer——视觉领域 2020 年最大的范式转变。

第 4 篇 🐣 8 分钟 #Whisper#ASR#语音识别

Whisper:让 AI 听懂 99 种语言

OpenAI 开源的 Whisper 是当下最强语音识别。手机录音转文字、会议纪要、字幕生成——背后几乎都是它。

第 5 篇 🐣 11 分钟 #TTS#语音合成#L5

TTS 语音合成:从拼接到神经合成

从机器人腔到逼真人声——TTS 走过的路。VALL-E 让 3 秒声音克隆任何人——这个能力的两面性。

第 6 篇 🐥 13 分钟 #视频生成#Sora#Diffusion

视频生成:从 Sora 到现代视频 AI

Sora、Runway Gen-3、Veo、Kling……2024-2026 视频生成爆发。这一篇讲技术原理 + 工程细节 + 商业格局。

第 7 篇 🐥 12 分钟 #3D#NeRF#Gaussian Splatting

3D 生成:NeRF / Gaussian Splatting / 文本到 3D

2D 之后的下一波 AI 内容革命——从一组照片重建 3D,从文字生成 3D 资产。

第 8 篇 🐥 10 分钟 #AI 音乐#Suno#Udio

AI 音乐:Suno / Udio / MusicGen 的技术与商业

2024-2026 AI 音乐从"听起来像 AI"变成"分不出和真人"。Suno v5、Udio、MusicGen 的技术原理 + 法律争议 + 商业模式。

第 9 篇 🐥 9 分钟 #Robotics#VLA#Embodied AI

机器人 + LLM:VLA 模型与具身智能

PaLM-E、RT-2、π0、Optimus——LLM 与机器人正式融合,"看 + 想 + 动"成为一个模型。2026 具身智能新格局。

📍 学完之后
L6:AI 安全 / L7:系统工程