BFL发布FLUX 3:原生多模态架构统一四模态

BFL发布FLUX 3:原生多模态架构统一四模态

FLUX 3多模态BFLAI架构

数据源:HN + web research

2026 年 7 月 23 日,Black Forest Labs(BFL)正式发布多模态基础模型 FLUX 3。这个由前 Stability AI 核心成员 Robin Rombach 等人创立的团队,在 FLUX 1 发布仅两年后,推出了涵盖图像、视频、音频和物理动作的统一模型。同一张网络既能生成 720p 视频,又能同步合成匹配音轨,还能直接输出机器人操控序列。

FLUX 3 多模态生成示例 图:FLUX 3 展示图:多模态生成示例。来源:BFL Blog

放弃模块拼接:统一网络同时拟合视觉与声音

过去行业普遍采用模块拼接路径,用独立扩散模型管图像生成,再挂载音频与视频插帧模型。这种分层级联结构在交付复合内容时,经常出现画质与音轨在时间轴上错位的问题。多模态信息流在经过不同解码器后,上下文连贯性遭到破坏。

FLUX 3 在训练阶段将图像像素、视频帧序列和音频频谱投影至同一个隐藏空间。模型在单次前向传播中同时预测视觉衰减分布和音频波形更新,消除跨模态拼接带来的延迟与噪点。这种原生联合训练机制确保了声音事件与画面动作的微秒级同步。

物理动作(Action)的接入进一步证明了跨模态共享表示的优越性。当模型学会在统一向量空间中表征物体运动轨迹后,只需引入少量机器人操控数据进行微调,就能直接输出机械臂的运动轨迹。这表明视觉与动作在模型底层共享同一套空间演化规律。

Self-Flow架构解法:概率流与模态流的自适应映射

要让单一步骤的生成网络同时处理高维视频像素与连续音频波形,算力开销极为庞大。BFL 在 FLUX 3 中采用了全新的 Self-Flow 机制,替代了此前基于 Flow Matching(流匹配)的标准概率匹配算法。该方法通过在模态间建立自适应流导向,降低多模态联合采样时的计算复杂度。

Self-Flow 架构对比 图:Self-Flow vs Flow Matching 架构对比图。来源:BFL Blog

Self-Flow 架构的核心在于动态分配不同模态在时间步中的特征权重。在生成高动态视频片段时,模型会显著增加视频帧与音频帧之间的交叉注意力算力,而在生成静态高分辨率图像时则自动收缩模态间的通信开销。这种自适应特征流动机制使 FLUX 3 在保持生成质量的同时大幅降低了推理成本。

复杂 Prompt(提示词)理解和多语言文本渲染也因此受益。传统图像模型在遇到长句逻辑时容易出现语义遗漏,而 FLUX 3 凭借跨模态上下文记忆,可以精准解析包含多个物理实体与空间关系的复杂指令。

FLUX 3 图像生成示例 图:FLUX 3 图像生成示例。来源:BFL Blog

盲测数据压制同类:从视频质感到声画同步

在实际生成性能测验中,BFL 开放了视频生成的 Early Access(早期访问),并公布了针对主流生成模型的盲测用户偏好率。FLUX 3 可直接生成最长 20 秒、分辨率 720p 且带有原生音频同步的视频内容。

在对比实验中,FLUX 3 面对 Grok Imagine Video 获得了 69% 的用户偏好率,超越 Kling v3 Pro(60%)和 Happy Horse v1(59%)。在面对 Runway Gen-4.5 时偏好率达到 77%,面对 Luma Ray 3.2 时更是取得了 93% 的压制性优势。盲测数据的显著领先表明,原生声画联合生成的效果已经超越了传统分级渲染方案。

目前 BFL 已开放视频功能的早期测试,图像早访问权限预计在数周内对外开放。这一节奏反映出团队在处理高维连续模态时的技术自信,也印证了统一表示在多模态理解中的落地速度。

物理动作序列生成:多模态进化的最终终点

如果说图像与视频生成解决的是虚拟内容的表达问题,那么物理动作(Action)的生成则直接打通了虚拟与现实的边界。BFL 团队通过对 FLUX 3 进行特定领域的微调,成功使其输出了可用于机器人操控的物理动作序列。

动作序列承载着质量、重力和摩擦力等物理约束。FLUX 3 之所以具备这种能力,是因为在训练视频和音频的过程中,隐藏层已经隐式构建了物理世界的时空演变模型。物理动作生成的成功验证,确立了原生多模态架构作为世界模型的演进路线。

这一成果打破了生成式模型仅用于内容创作的固有印象。当统一架构学会预测物理世界的变化规律时,原本用于视频合成的参数即可无缝迁移到具身智能的决策控制中。

从单模态工具到世界模型

2024 年 8 月 FLUX 1 的发布奠定了 BFL 在开源图像生成领域的地位。仅仅两年时间,FLUX 架构完成了从纯图像生成器到原生四模态基础模型的跃化。这一演进轨迹展示了多模态 AI 从独立工具向统一世界表示演进的趋势。

架构的统一消除了以往多模型级联带来的系统复杂性与信息损耗。图像、视频、音频和动作在底层参数中的相互借力,让模型在单项任务上的表现同样突破了以往专有模型的上限。

FLUX 3 的突破体现在生成质量上,重塑了基础设施的架构逻辑。当多模态 AI 彻底摆脱分治拼接的模式,共享世界表示将成为下一代基础模型的核心形态。

参考链接:

  • Black Forest Labs FLUX 3 发布报告
  • BFL 官方博客 FLUX 3 多模态架构技术详解