FLUX.1 / FLUX.1 Pro
为什么这篇重要
2024 年 8 月 —— Stable Diffusion 原班作者(Robin Rombach、Andreas Blattmann 等)离开 Stability AI,成立 Black Forest Labs,发布 FLUX.1。
效果:
开源图像生成第一次达到 Midjourney 级—— 而 Midjourney 一直是商业领先标杆。
开源生态从此有了真正能打的旗舰。
三个版本
FLUX.1 同时发了 3 个版本:
| 版本 | 协议 | 用途 |
|---|---|---|
| FLUX.1 Pro | 闭源 API | Black Forest 商业版,质量最高 |
| FLUX.1 dev | 非商业开源(Apache-like) | 个人 / 研究用,质量接近 Pro |
| FLUX.1 schnell | Apache 2.0 | 商用开源,速度优先(4 步推理) |
dev 版让开发者免费玩到 Pro 接近 90% 的效果—— 这种”双轨”策略既保商业利益又保社区。
技术架构
FLUX 是 Rectified Flow + DiT + MMDiT 的组合:
1. Rectified Flow(不是标准 Diffusion)
普通扩散:在噪声 + 数据之间走 1000 步曲线。 Rectified Flow:把那条曲线”拉直”——只要少数几步就到。
普通:x(t) = √(1-α_t) ε + √(α_t) x_0 (非线性)
RF: x(t) = (1-t) ε + t x_0 (直线)
效果:
- 训练目标更简单(学一个速度场)
- 推理只要 10-50 步(不是 1000)
- 质量更稳
2. DiT(Diffusion Transformer)
不用 U-Net 做去噪,用 Transformer。 跟 Sora 一样的思路。
3. MMDiT(Multimodal DiT)
把图像 token 和文本 token 混在同一个 Transformer 里处理:
图像 patches: [img_1, img_2, ..., img_n]
文本 tokens: [txt_1, txt_2, ..., txt_m]
全部进同一 Transformer attention 互相能"看到"
跟 SD3 类似 —— 但 FLUX 模型更大(12B)+ 训练更充分。
性能对比
2024 末实测(无脑 prompt):
| 模型 | 美感 | 提示词忠实度 | 速度 | 价格 |
|---|---|---|---|---|
| Midjourney v6 | 9/10 | 7/10 | 中 | 付费 |
| FLUX.1 Pro | 9/10 | 9/10 | 中 | 付费 |
| FLUX.1 dev | 8.5/10 | 9/10 | 中 | 免费 |
| FLUX.1 schnell | 7.5/10 | 8/10 | 快 | 免费 |
| SD3 Medium | 7/10 | 7/10 | 快 | 免费 |
| DALL·E 3 | 8/10 | 9.5/10 | 慢 | 付费 |
FLUX 在提示词忠实度上超过 Midjourney——这是它的差异化优势。
几个突破
1. 文字渲染
之前所有扩散模型都不会写字(“FLUX” 会变成乱码”FLUX”)。 FLUX 训练时大量用了带文字的图像 —— 现在能正确渲染文字、logo、海报。
2. 手指
历史 AI 的尴尬 —— 6 根手指。 FLUX 通过更精确的解剖学训练大幅改善。
3. 提示词复杂度
可以接超长 prompt:
"A photograph of a 35-year-old Asian woman wearing a red silk dress
with golden embroidery, standing in a traditional Japanese garden during
cherry blossom season. Soft golden hour lighting. Shot on Hasselblad
H6D-100c with a 80mm lens. Photorealistic, high detail, magazine quality."
每个细节都被遵守。
生态
FLUX 发布几个月内:
- HuggingFace 下载量 #1
- 数千个微调版本(动漫风、写实风、艺术家风、行业风)
- ControlNet 套件(姿态控制、深度控制、Canny 边缘)
- 集成进 ComfyUI、Forge、Fooocus 等所有主流 UI
Replicate、Together、Fal.ai 等托管服务都提供 FLUX API。
应用案例
- 广告 / 营销:自动生成 banner / 海报
- 电商:商品图(不需要拍)
- 游戏 / 影视:概念图 / 场景设计
- 个人创作:插画师辅助
- AI 头像:基于 LoRA 微调
一个个人插画师 + FLUX = 以前 5 个人的工作量。
FLUX 之后
2025 后续:
- FLUX.1.1 Pro / Ultra:更高质量 + 8x 速度
- FLUX Tools:ControlNet 等控制工具官方版
- 视频版(推测):Sora 竞品在路上
Black Forest 估值 2025 初已经 10 亿美金 —— 一年从初创到独角兽。
Stable Diffusion 还重要吗
SD 是历史功臣 —— 让开源图像生成第一次可行(2022)。 但 2024 后:
- SD3 反响一般
- Stability AI 商业问题缠身
- FLUX 在多数指标上超过
SD 生态会继续维护(无数微调版本和工具链),但FLUX 是新事实标准。
推荐配套阅读
- HelloAI: L5-02 Diffusion 数学 + L5-06 视频生成
- Rectified Flow 论文(2209.03003)
- DiT 论文(2212.09748)
- Stable Diffusion 3 论文(同作者,前作)
FLUX 的故事是个好戏剧:
- 2022:Robin Rombach 等做出 Stable Diffusion,引爆 AI 图像
- 2022-2024:Stability AI 商业混乱,多次融资失败
- 2024:核心团队出走,成立 Black Forest Labs
- 2024 H2:FLUX.1 横空出世,超过老东家所有模型
AI 创业的关键不是公司,是人。 Stable Diffusion 是 Robin 等做的, FLUX 也是 Robin 等做的。 当核心团队跳船 —— 旗舰随之转移。
这给 AI 公司管理一个警告:留住核心研究员比融资重要 10×。
想要更多论文精读
订阅每周精选 —— 下一篇论文笔记直接送邮箱。
讨论区
· 用 GitHub 账号登录评论src/components/Comments.astro 顶部填入
仓库 ID 和分类 ID(见组件注释里的配置步骤)。