熟悉 FLUX 的朋友应该都知道,前几代产品主要还是围绕图像生成和编辑。
但刚公布的 FLUX 3,方向明显变了。
它被定位为一个统一的多模态模型,同时覆盖:
- Image:图像生成与精细编辑
- Video:带可选原生音频的视频生成
- Audio:让声音与画面事件同步
- Action:理解动作结果,进一步面向机器人和物理世界任务
换句话说,FLUX 3 想做的已经不只是“生成一张更好看的图片”,而是让模型理解一个场景如何运动、变化和产生反馈。
目前,FLUX 3 Video & FLUX 3 Image 已进入早期体验阶段,FLUX 3 Image 预计后续推出。
至于大家最关心的 Dev 版本、开放权重、API 价格和本地部署要求,目前还需要等待官方进一步公布。
我也做了一个独立的 FLUX 3 信息与体验页面,方便持续跟进更新。需要说明的是,该页面并非 Black Forest Labs 官方网站: