HelloAI
🏷️ 标签

#L5

共找到 11 条相关内容: 9 篇学习路径 2 篇论文

📚 学习路径

L5
多模态总览:AI 如何同时"看、听、读"
GPT-4o 能识别你画的草图、Sora 能生成视频——这些"多模态"AI 是怎么做到的?这一篇打开全景图。
L5
Diffusion 数学:从加噪到生成
Stable Diffusion、DALL·E 3、Sora 都基于扩散模型。这一篇讲清楚它的核心数学——用最少的公式。
L5
ViT 与 CLIP:让 Transformer 看图
把图像切成 patch,喂给 Transformer——视觉领域 2020 年最大的范式转变。
L5
Whisper:让 AI 听懂 99 种语言
OpenAI 开源的 Whisper 是当下最强语音识别。手机录音转文字、会议纪要、字幕生成——背后几乎都是它。
L5
TTS 语音合成:从拼接到神经合成
从机器人腔到逼真人声——TTS 走过的路。VALL-E 让 3 秒声音克隆任何人——这个能力的两面性。
L5
视频生成:从 Sora 到现代视频 AI
Sora、Runway Gen-3、Veo、Kling……2024-2026 视频生成爆发。这一篇讲技术原理 + 工程细节 + 商业格局。
L5
3D 生成:NeRF / Gaussian Splatting / 文本到 3D
2D 之后的下一波 AI 内容革命——从一组照片重建 3D,从文字生成 3D 资产。
L5
AI 音乐:Suno / Udio / MusicGen 的技术与商业
2024-2026 AI 音乐从"听起来像 AI"变成"分不出和真人"。Suno v5、Udio、MusicGen 的技术原理 + 法律争议 + 商业模式。
L5
机器人 + LLM:VLA 模型与具身智能
PaLM-E、RT-2、π0、Optimus——LLM 与机器人正式融合,"看 + 想 + 动"成为一个模型。2026 具身智能新格局。

📑 论文精读