FLUX 3 即将发布

1 条回复
37 次浏览

1. 核心理念:统一的多模态学习

FLUX 3 不再孤立地处理单一模态,而是在一个统一的架构中同时学习图像、视频和音频。它的目标是让模型真正理解“世界”的运作方式(例如物体如何组合、事物如何运动、事件听起来是怎样的)。不同模态相互补充和约束(例如声音必须匹配撞击动作,运动必须符合物理质量),从而让模型构建出对底层现实更完整的认知。

2. 关键技术

该模型基于 BFL 的 Self-Flow 技术,该技术能高效地对齐多模态的生成与理解。在此基础上,BFL 大幅增加了计算和数据资源,实现了对视频、图像和音频的同步联合训练。

3. 主要能力

  • 视频生成:单次生成可输出长达 20 秒自带原生音频的高质量视频。支持文本生视频、图生视频、视频生视频、关键帧控制过渡、多语言对话生成,甚至能通过智能体(Agentic)方式将多个片段链接成更长的多镜头序列。
  • 图像生成与编辑:支持多种风格、比例和分辨率。在中期训练评估中,FLUX 3 在处理复杂提示词和图像内文字生成方面,相比早期的 FLUX 模型有了显著提升。
  • 动作预测 (Action):模型对世界的理解延伸到了物理动作预测。BFL 正在将原生动作预测直接集成到 FLUX 3 中,并利用其视频骨干网络作为基础,供专门的机器人动作模型进行微调(例如与 mimic robotics 合作)。

4. 未来发布计划

经过早期访问、反馈收集和安全测试后,BFL 将在未来几周至几个月内逐步推出以下功能:

  • FLUX 3 Video:通过 API 和私有权重提供视频与音频的生成和编辑。
  • FLUX 3 Image:通过 API 和私有权重提供图像合成与编辑。
  • FLUX-mimic / FLUX 3 Action:通过特定的研究和商业合作伙伴提供动作预测能力。
  • FLUX 3 Dev:提供多模态骨干网络的开放权重,供开发者和研究人员用于内容创作和动作预测研究。

FLUX 3 是 FLUX 系列的重大升级,从单纯的图像生成模型进化为了一个能同时理解和生成“图、文、音、视频”甚至“物理动作”的综合性世界模型,且未来会提供开源版本。

发表一个评论

R保持