作者error405 (流河=L)
看板AI_Art
標題[閒聊] 等身老婆 Fable回歸 讀心AI..本週AI新聞
時間Sun Jul 5 12:52:35 2026
https://www.youtube.com/watch?v=qtzzN8w2TvU
AI news intro
本週 AI 界消息非常震撼,包括各類開源模型、網頁即時影片編輯、由思考轉化為文字的
技術,以及大幅提升圖像模型生成速度的新方法等。 [00:00]
MusViT
這是一款專門用來「閱讀」五線譜的視覺 AI 模型。傳統視覺模型無法有效理解樂譜中的
符號、拍子、音高與結構。MusViT 使用 970 萬頁樂譜數據訓練,透過遮罩重建技術掌握
了音樂結構。模型體積小於 500MB,非常適合在消費級設備上離線運行。 [00:51]
LongCat 2.0
由中國外賣平台美團推出的 1.6 兆參數開源混合專家(MoE)模型。令人驚豔的是,它完
全沒有使用 Nvidia 的 GPU 進行訓練,而是基於國產的 ASIC 晶片(傳聞為華為晶片)
,且訓練過程非常穩定、無任何中斷。在程式碼編寫與邏輯推理等多項基準測試中,表現
逼近 GPT-5.5 與 Claude Opus。 [02:33]
LiveEdit
這是一個可實現「即時視訊編輯」的 AI 系統。使用者只需提供一段影片及自然語言指令
,模型就能以每秒近 13 幀的速度,即時更換影片中人物的衣服、改變天氣、移除物件或
調整構圖。其主要是將一般影片模型轉化為分塊流式處理結構。 [06:20]
VidiHand
這款工具能從一般影片中高精確度地重建人手部的 3D 運動與形狀。手部動作通常快速且
容易互相遮擋,導致傳統 AI 難以精確追蹤。VidiHand 在各項檢測指標上皆超越同類產
品,此技術將大幅有助於訓練人形機器人,並可用於 AR/VR 領域。 [07:37]
Agents A1
這是一個僅有 35 億參數的開源中型混合專家模型。雖然體積不大(FP8 版本的模型大小
僅約 37.7 GB),但專為多步驟的自主代理(Agentic)工作流程而設計。在多項科學與
推理基準測試中,它擊敗了引領潮流的 Qwen-35B 與部分破兆參數的模型。 [09:03]
OmniContact
此框架旨在教導人形機器人執行長時間、跨多步驟的複合型真實任務(例如搬箱、推車)
。它引入了「接觸流(contact flow)」架構,讓機器人的各種日常動作技能得以流暢地
銜接、並且能從失誤中自行恢復。 [10:46]
Hi3D
本片贊助商,這是一個全方位的 3D 模型生成與列印平台。使用者輸入簡單指令生成圖片
後,系統能自動將其轉為可列印的 3D 模型,並內建智慧分割、添加連接孔與優化列印床
排版等完整工作流。 [12:37]
Claude Fable is back
Anthropic 之前因被美國政府顧忌危險性而遭短暫禁用的最強模型 Claude Fable 5 再次
回歸。在配合政府實施新的安全分類器後得以重新上線。不過新版的使用限制極多:目前
至 7 月 7 日前僅限訂閱用戶使用、且僅佔每週限額的 50%,最嚴重的是因安全機制過於
嚴格,導致寫程式與除錯等常規任務極易觸發錯誤拒絕,並降級回 Opus 模型,性能出現
明顯退化。 [15:00]
Claude Sonnet 5
Anthropic 本週也推出了 Sonnet 5 輕量版模型。然而在基準測試中,它的性能甚至落後
於舊世代的 Opus 4.8,在智商與速度上也落後於其他開源模型。更糟糕的是它的定價極
高,定價甚至超過 GPT-5.5 的兩倍,在性價比上完全缺乏競爭力。 [19:06]
PhysiFormer
此 AI 能夠預測 3D 物體在現實世界中受到外力時的運動與變形方式(例如球掉落、果凍
被擠壓)。它不僅生成 3D 形狀,更理解物理規則與材料特性(如金屬或橡膠),讓 3D
動畫在互動時顯得更加真實。 [20:51]
Aspire
Nvidia 推出的一套專為機器人設計的自我改進系統。當機器人執行任務失敗時,系統會
自動編寫程式碼控制、觀測錯誤原因並修復程式碼,將失敗經驗轉化為技能儲存在程式庫
中,避免重蹈覆轍,從而建立起一個可持續自我學習與優化的閉環系統。 [22:33]
New Google models
Google 本週將研發重點放在效率上,推出了兩款輕量級模型:
Nano Banana 2 Light:Google 最快且最便宜的圖像生成模型,速度大幅提升(生成
一張圖約 4 秒)。
Gemini Omni Flash:高靈活性的影片生成與編輯模型,使用者能以自然語言對影片
內容進行物件替換、添加特效等。目前兩款模型均可在 Google Flow 平台免費體驗。
[24:06]
UBTech U1
優必選(UBTech)發表了全新一代超逼真的人形伴侶機器人 U1 系列(包含頭部軀幹版與
全身版)。外觀具有極致細節(如皮膚毛孔、血管與指紋),觸感真實,並配備情緒 AI
,能以 90% 的準確度識別 20 多種人類情感,主打情感支持與陪伴,目前已獲得超過
13,000 張預訂單。 [26:42]
Comfy MCP
ComfyUI 是本地運行生成式開源模型最受歡迎的平台,但其節點與接線界面相當複雜。
Comfy MCP 則是連接 AI 代理與 ComfyUI 的橋樑。用戶現在可以直接用自然語言命令
AI 代理在後台自動搜尋模型、建立節點並運行複雜的工作流。 [28:43]
Brain2qwerty
Meta 發表的創新研究項目(第二版)。它可在「無需手術」侵入大腦的情況下,單純透
過腦磁圖(MEG)記錄的大腦活動信號,直接將使用者的思維轉化為文字(字詞預測準確
度達 78%)。相較於第一版,本次訓練數據量提升了 10 倍以上。 [30:15]
RDM
全稱為 Representation Distribution Matching(表徵分布匹配)。一般的擴散圖像模
型需要 30 到 50 個步驟(Turbo 模型也需要 4 到 10 步)才能除去噪點生成圖像。
RDM 技術透過教導 AI 匹配高階視覺特徵的整體分布,能夠「僅用 1 個步驟」就生成品
質不俗的圖像,大幅提高生成速度。 [31:38]
MrFlow
另一種瘋狂加速圖像生成的方法。其核心邏輯是先生成低解析度圖像,再將其放大並加入
微量噪點,最後讓原始模型僅執行「一個高解析度步驟」來修飾細節。該方法完全無需重
新訓練模型,可將部分圖像模型的生成速度提升 9 到 21 倍,生成一張圖僅需約一秒。
[33:08]
SimFoundry
這款 AI 能將單張照片或影片直接轉化為具有物理精確度的「3D 模擬場景」。這對機器
人訓練至關重要,因為在現實廚房或工廠中讓機器人失敗幾千次代價昂貴且具危險性,但
透過該系統,機器人可以在數位的 3D 模擬環境中利用強化學習進行成千上萬次的數位訓
練。 [34:47]
CHORD
一個全新的機器人學習框架。它透過 forces(力量)與 torques(轉矩)來記錄和轉化
人類的操作示範影片,藉此教導機器人掌握靈巧的手部技能。由於它專注於物理受力而非
單純複製動作,因此即便人類與機器人(或不同型號機器人)的手部結構不同,機器人也
能順利學會如何操作各類物件。 [36:06]
Luna
由 Meta 提出的 3D 人類角色動畫新方法。傳統方法需要依賴人體 3D 模型與骨架,容易
導致衣物變形異常或動作僵硬。Luna 改為將所有輸入轉換為「高斯變形(Gaussian
deformations)」,用戶僅需提供少許目標角色的照片,以及任何驅動訊號(例如其他人
的動作影片、骨架動畫甚至是線條草圖),就能靈活且逼真地讓 3D 角色動起來。
[37:20]
--
Gemini整理
生圖加速器終於進入只要1step的領域
Meta的腦波讀取器好大台 希望以後能小型化到EVA裡那種髮夾
至於中國仿真機器人..我們離暴民屠殺秀又近了一步
https://youtu.be/V8EnJIJ4nEo
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 114.36.253.145 (臺灣)
※ 文章網址: https://webptt.com/m.aspx?n=bbs/AI_Art/M.1783227157.A.DF9.html
2F:推 a159371153: Grok到底有沒有要再進步啊…? 07/05 15:40
3F:→ error405: grok好像更新了雜七雜八的東西 除了本體沒動靜 07/05 16:38
4F:推 gino0717: grok是給馬斯克體驗AI的 現在他有更大的計劃了 07/05 17:29
5F:推 ct13579: 老馬不是說在來到年底要每月推一個模型? 07/05 22:47
6F:推 Supasizeit: 你馬要出手機 還要搞電信業 才能救股價 07/05 23:12
7F:→ Supasizeit: AI模型市場滿了 電信還有一塊 07/05 23:13
8F:→ s78513221: 這週最夯要頒發給K12 GPT EDU吧 07/05 23:51
9F:→ s78513221: 一口氣生了5個GPT K12來串Codex 07/05 23:52
10F:→ ksjr: 老馬我記得早就出過手機拉? grok不就是被拿來圈錢的嗎 07/06 03:06
11F:推 ganei: Grok最近改成每週renew 一次使用額度了,而且是文、圖、動 07/06 07:50
12F:→ ganei: 畫共用額度,現在帳號的設定頁面會秀給你看用了多少,下面 07/06 07:50
13F:→ ganei: 還很貼心的設好管道讓你投錢接關,馬投顧揪甘心 (棒讀) 07/06 07:50
14F:→ ganei: 順帶一提720P動畫10秒大概一次約2%,15秒大概約3%,但是15 07/06 07:54
15F:→ ganei: 秒很明顯灌水灌更大,10秒被大家練這麼久至少也接近原本6秒 07/06 07:54
16F:→ ganei: 的水準了 07/06 07:54
17F:→ Orcish: Grok雙帳到期不續…吃相太難看!什麼都不玩,只生720p10s 07/06 13:09
18F:→ Orcish: 每週50支(一定不到,因為審核變嚴,還會背地砍檔),吃史! 07/06 13:10
19F:推 Orcish: 上次大砍後,約每18小時重置:18支720p+25支480p+72張圖 07/06 13:14
20F:→ Orcish: 現在是168小時只有50支720p…多噁爛 07/06 13:15
21F:→ shin2190: Grok免費帳號好像沒法看額度? 07/06 13:57
22F:→ ganei: 鄉民講到重點了,最近Grok 常常不定時"回溯",眼前你對產生 07/06 15:52
23F:→ ganei: 的圖片影片很滿意,沒多久可能Grok就失智記不得,建議隨時 07/06 15:52
24F:→ ganei: 抓到電腦上做好本地端備份才安全,檔案被吃掉去抗議官方 07/06 15:52
25F:→ ganei: 基本上是不理你的... 07/06 15:52
27F:→ error405: 明後天grok4.5 也許gpt5.6也是 07/08 14:52