HelloAI
📄 论文精读 🏆 必读经典 · 2024 · Black Forest Labs 2024

FLUX.1 / FLUX.1 Pro

Black Forest Labs (Robin Rombach et al.)
📖 如果你只读一段,读这段
Stable Diffusion 原班作者出来创业,做出 2024 年最强的开源图像生成模型。Midjourney 级质量 + Apache 2.0 协议 (FLUX.1 dev) —— 开源图像生成的新顶峰。
#FLUX#Diffusion#图像生成#L5

为什么这篇重要

2024 年 8 月 —— Stable Diffusion 原班作者(Robin Rombach、Andreas Blattmann 等)离开 Stability AI,成立 Black Forest Labs,发布 FLUX.1

效果:

开源图像生成第一次达到 Midjourney 级—— 而 Midjourney 一直是商业领先标杆。

开源生态从此有了真正能打的旗舰。

三个版本

FLUX.1 同时发了 3 个版本:

版本协议用途
FLUX.1 Pro闭源 APIBlack Forest 商业版,质量最高
FLUX.1 dev非商业开源(Apache-like)个人 / 研究用,质量接近 Pro
FLUX.1 schnellApache 2.0商用开源,速度优先(4 步推理)

dev 版让开发者免费玩到 Pro 接近 90% 的效果—— 这种”双轨”策略既保商业利益又保社区。

技术架构

FLUX 是 Rectified Flow + DiT + MMDiT 的组合:

1. Rectified Flow(不是标准 Diffusion)

普通扩散:在噪声 + 数据之间走 1000 步曲线。 Rectified Flow:把那条曲线”拉直”——只要少数几步就到。

普通:x(t) = √(1-α_t) ε + √(α_t) x_0  (非线性)
RF:  x(t) = (1-t) ε + t x_0           (直线)

效果:

  • 训练目标更简单(学一个速度场)
  • 推理只要 10-50 步(不是 1000)
  • 质量更稳

2. DiT(Diffusion Transformer)

不用 U-Net 做去噪,用 Transformer。 跟 Sora 一样的思路。

3. MMDiT(Multimodal DiT)

把图像 token 和文本 token 混在同一个 Transformer 里处理

图像 patches: [img_1, img_2, ..., img_n]
文本 tokens:  [txt_1, txt_2, ..., txt_m]

全部进同一 Transformer attention 互相能"看到"

跟 SD3 类似 —— 但 FLUX 模型更大(12B)+ 训练更充分。

性能对比

2024 末实测(无脑 prompt):

模型美感提示词忠实度速度价格
Midjourney v69/107/10付费
FLUX.1 Pro9/109/10付费
FLUX.1 dev8.5/109/10免费
FLUX.1 schnell7.5/108/10免费
SD3 Medium7/107/10免费
DALL·E 38/109.5/10付费

FLUX 在提示词忠实度上超过 Midjourney——这是它的差异化优势。

几个突破

1. 文字渲染

之前所有扩散模型都不会写字(“FLUX” 会变成乱码”FLUX”)。 FLUX 训练时大量用了带文字的图像 —— 现在能正确渲染文字、logo、海报。

2. 手指

历史 AI 的尴尬 —— 6 根手指。 FLUX 通过更精确的解剖学训练大幅改善。

3. 提示词复杂度

可以接超长 prompt:

"A photograph of a 35-year-old Asian woman wearing a red silk dress
with golden embroidery, standing in a traditional Japanese garden during
cherry blossom season. Soft golden hour lighting. Shot on Hasselblad
H6D-100c with a 80mm lens. Photorealistic, high detail, magazine quality."

每个细节都被遵守。

生态

FLUX 发布几个月内:

  • HuggingFace 下载量 #1
  • 数千个微调版本(动漫风、写实风、艺术家风、行业风)
  • ControlNet 套件(姿态控制、深度控制、Canny 边缘)
  • 集成进 ComfyUI、Forge、Fooocus 等所有主流 UI

Replicate、Together、Fal.ai 等托管服务都提供 FLUX API。

应用案例

  • 广告 / 营销:自动生成 banner / 海报
  • 电商:商品图(不需要拍)
  • 游戏 / 影视:概念图 / 场景设计
  • 个人创作:插画师辅助
  • AI 头像:基于 LoRA 微调

一个个人插画师 + FLUX = 以前 5 个人的工作量。

FLUX 之后

2025 后续:

  • FLUX.1.1 Pro / Ultra:更高质量 + 8x 速度
  • FLUX Tools:ControlNet 等控制工具官方版
  • 视频版(推测):Sora 竞品在路上

Black Forest 估值 2025 初已经 10 亿美金 —— 一年从初创到独角兽。

Stable Diffusion 还重要吗

SD 是历史功臣 —— 让开源图像生成第一次可行(2022)。 但 2024 后:

  • SD3 反响一般
  • Stability AI 商业问题缠身
  • FLUX 在多数指标上超过

SD 生态会继续维护(无数微调版本和工具链),但FLUX 是新事实标准

推荐配套阅读

  • HelloAI: L5-02 Diffusion 数学 + L5-06 视频生成
  • Rectified Flow 论文(2209.03003)
  • DiT 论文(2212.09748)
  • Stable Diffusion 3 论文(同作者,前作)
💡 一个观察

FLUX 的故事是个好戏剧

  1. 2022:Robin Rombach 等做出 Stable Diffusion,引爆 AI 图像
  2. 2022-2024:Stability AI 商业混乱,多次融资失败
  3. 2024:核心团队出走,成立 Black Forest Labs
  4. 2024 H2:FLUX.1 横空出世,超过老东家所有模型

AI 创业的关键不是公司,是人。 Stable Diffusion 是 Robin 等做的, FLUX 也是 Robin 等做的。 当核心团队跳船 —— 旗舰随之转移。

这给 AI 公司管理一个警告:留住核心研究员比融资重要 10×

📬

想要更多论文精读

订阅每周精选 —— 下一篇论文笔记直接送邮箱。

💬

讨论区

· 用 GitHub 账号登录评论
⚠️ Giscus 评论未配置 —— 在 src/components/Comments.astro 顶部填入 仓库 ID 和分类 ID(见组件注释里的配置步骤)。