作者error405 (流河=L)
看板AI_Art
標題[閒聊] Flux3影音多模態模型開放早期存取
時間Fri Jul 24 08:43:45 2026
https://x.com/bfl_ai/status/2080308988961554582
FLUX 3 介紹:Black Forest Labs 的多模態視覺智能前沿模型
Black Forest Labs(黑森林實驗室,簡稱 BFL)於 2026 年 7 月 23 日正式推出 FLUX
3,這是其 FLUX 系列的最新多模態前沿模型。它不再是單純的文字生成圖像工具,而是
統一架構下聯合訓練影像、影片、音頻,甚至動作預測的綜合模型,目標是打造真正的「
視覺智能」——讓 AI 不僅能創作,還能理解、預測並作用於現實世界。
核心特點:單一統一架構的多模態能力
影像(Image)**:支援多種風格、比例與高解析度生成與編輯。早期樣本顯示出極高的
真實感與細節控制。
影片(Video)**:已開放早期存取(Early Access),支援原生音頻生成。演示影片展
現多鏡頭連續性、逼真物理模擬(如機甲戰鬥、拉力賽車追逐),畫質達 1080p、24fps
,具備相機控制與多鏡頭一致性。
音頻(Audio)**:與影片同步生成語音、音樂與音效(48kHz 立體聲)。
動作預測(Action-Prediction):可擴展至機器人控制。與 mimic robotics 合作開發
的 **FLUX-mimic 已應用於 Audi 工廠,實現靈巧操作,單一 GPU 即可運行,且所需訓
練示範大幅減少。
FLUX 3 的關鍵在於「聯合訓練」:影像、影片、音頻共享同一個世界表徵,讓輸出更連
貫、更貼近真實生活,而非各自獨立的模組拼湊。
推出時間表(逐步開放)
現已開放**:FLUX 3 Video(含原生音頻)與 Action(透過合作夥伴)。
即將推出**:FLUX 3 Image 生成與編輯、快速變體(成本優化)、多參考控制等。
未來規劃**:開放權重的多模態主幹模型,供內容創作與機器人應用。
Black Forest Labs 強調,這是朝向「實世界視覺智能」的重要一步:模型不僅用於數位
創作,還能感知、預測並作用於物理環境。
背景與意義
Black Forest Labs 由前 Stability AI 成員創立,以 FLUX.1 系列(尤其是開源版本)
聞名,擅長提示詞遵循度、文字渲染與高品質輸出。FLUX 3 延續開放創新精神,同時大
幅擴展到多模態與物理 AI 領域,已有 Canva、Picsart、Magnific 等平台測試中。
相較先前版本,FLUX 3 強調「世界理解」(world understanding),在控制力、真實感
與跨模態一致性上達到新高度,被視為連接數位創作與實體機器人的橋樑。
如何體驗
申請 FLUX 3 Video 早期存取:
https://bfl.ai/models/flux-3
官方網站:
https://bfl.ai/
詳細技術文章:
https://bfl.ai/blog/flux-3
FLUX 3 不僅是生成工具的升級,更是 Black Forest Labs 向「通用視覺智能」邁進的里
程碑。無論是創作者、開發者還是機器人工程師,都值得密切關注其後續發展。隨著影像
、影片、音頻與動作能力的逐步開放,它有望重塑內容創作與物理世界的互動方式。
(資訊彙整自 Black Forest Labs 官方 X 貼文與網站,截至 2026 年 7 月 24 日)
--
Grok整理
重點是開源預定我就高興了
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 114.36.212.31 (臺灣)
※ 文章網址: https://webptt.com/m.aspx?n=bbs/AI_Art/M.1784853828.A.DF1.html
1F:推 v86861062: 可以色色ㄇ 07/24 08:49
2F:→ error405: 開源總有辦法吧 07/24 08:55
3F:推 fay001: 不能色色的ai遲早泡沫化(價值觀偏差 07/24 12:07
5F:推 coox: 本地端AI的優勢真的就是色色啊 07/24 16:55
6F:→ ganei: 之前用本地端flux很吃VRAM速度也不快,要Try提示詞的話有點 07/24 19:07
7F:→ ganei: 痛苦 07/24 19:07
8F:推 Supasizeit: 所以後來都Klein 啊 07/24 19:21