作者error405 (流河=L)
看板AI_Art
标题[闲聊] Flux3影音多模态模型开放早期存取
时间Fri Jul 24 08:43:45 2026
https://x.com/bfl_ai/status/2080308988961554582
FLUX 3 介绍:Black Forest Labs 的多模态视觉智能前沿模型
Black Forest Labs(黑森林实验室,简称 BFL)於 2026 年 7 月 23 日正式推出 FLUX
3,这是其 FLUX 系列的最新多模态前沿模型。它不再是单纯的文字生成图像工具,而是
统一架构下联合训练影像、影片、音频,甚至动作预测的综合模型,目标是打造真正的「
视觉智能」——让 AI 不仅能创作,还能理解、预测并作用於现实世界。
核心特点:单一统一架构的多模态能力
影像(Image)**:支援多种风格、比例与高解析度生成与编辑。早期样本显示出极高的
真实感与细节控制。
影片(Video)**:已开放早期存取(Early Access),支援原生音频生成。演示影片展
现多镜头连续性、逼真物理模拟(如机甲战斗、拉力赛车追逐),画质达 1080p、24fps
,具备相机控制与多镜头一致性。
音频(Audio)**:与影片同步生成语音、音乐与音效(48kHz 立体声)。
动作预测(Action-Prediction):可扩展至机器人控制。与 mimic robotics 合作开发
的 **FLUX-mimic 已应用於 Audi 工厂,实现灵巧操作,单一 GPU 即可运行,且所需训
练示范大幅减少。
FLUX 3 的关键在於「联合训练」:影像、影片、音频共享同一个世界表徵,让输出更连
贯、更贴近真实生活,而非各自独立的模组拼凑。
推出时间表(逐步开放)
现已开放**:FLUX 3 Video(含原生音频)与 Action(透过合作夥伴)。
即将推出**:FLUX 3 Image 生成与编辑、快速变体(成本优化)、多参考控制等。
未来规划**:开放权重的多模态主干模型,供内容创作与机器人应用。
Black Forest Labs 强调,这是朝向「实世界视觉智能」的重要一步:模型不仅用於数位
创作,还能感知、预测并作用於物理环境。
背景与意义
Black Forest Labs 由前 Stability AI 成员创立,以 FLUX.1 系列(尤其是开源版本)
闻名,擅长提示词遵循度、文字渲染与高品质输出。FLUX 3 延续开放创新精神,同时大
幅扩展到多模态与物理 AI 领域,已有 Canva、Picsart、Magnific 等平台测试中。
相较先前版本,FLUX 3 强调「世界理解」(world understanding),在控制力、真实感
与跨模态一致性上达到新高度,被视为连接数位创作与实体机器人的桥梁。
如何体验
申请 FLUX 3 Video 早期存取:
https://bfl.ai/models/flux-3
官方网站:
https://bfl.ai/
详细技术文章:
https://bfl.ai/blog/flux-3
FLUX 3 不仅是生成工具的升级,更是 Black Forest Labs 向「通用视觉智能」迈进的里
程碑。无论是创作者、开发者还是机器人工程师,都值得密切关注其後续发展。随着影像
、影片、音频与动作能力的逐步开放,它有望重塑内容创作与物理世界的互动方式。
(资讯汇整自 Black Forest Labs 官方 X 贴文与网站,截至 2026 年 7 月 24 日)
--
Grok整理
重点是开源预定我就高兴了
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 114.36.212.31 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/AI_Art/M.1784853828.A.DF1.html
1F:推 v86861062: 可以色色ㄇ 07/24 08:49
2F:→ error405: 开源总有办法吧 07/24 08:55
3F:推 fay001: 不能色色的ai迟早泡沫化(价值观偏差 07/24 12:07
5F:推 coox: 本地端AI的优势真的就是色色啊 07/24 16:55
6F:→ ganei: 之前用本地端flux很吃VRAM速度也不快,要Try提示词的话有点 07/24 19:07
7F:→ ganei: 痛苦 07/24 19:07
8F:推 Supasizeit: 所以後来都Klein 啊 07/24 19:21