作者tacovirus (大怒神のスイッチ)
看板PC_Shopping
標題Re: [閒聊] VRAM大就是正義?Intel B70 minimax h3
時間Wed Sep 2 14:42:52 2026
※ 引述《kimisawa (楊回血了。)》之銘言:
: YT Lon.TV 測了B70用ComfyUI跑 minimax
: https://www.youtube.com/watch?v=HfevkEZ8w5Q
: 看起來VRAM大的優勢在這邊體現出來,無速度法跟NVIDA比,
: 不過NVIDIA要32G的價格就很不舒服了
: B70生480p 5秒大概 2分半
: 生圖 1024x1024 大概 34秒
: 他還測了許多其他用途與模型,影片搭聲音,coding,等等
: 另外大vram的好處是跑LLM
: https://www.youtube.com/watch?v=bLac7-toF68&t=363s
: Lon.TV 跑Qwen3.8可以全部放在vram 大概 25 token/s
: 亞馬遜的價錢
: https://i.imgur.com/lErsamq.png
: 退一步B60 24G VRAM可以放絕大部分的模型只有B70一半的價錢
: 不過I卡的問題是待機功耗,待機要吃到50W有點高啊
: 單跑AI或許'目前'i卡是一種選擇?N卡的性價比實在太差了
在下做了 Qwen3.8 27B 的測試, 簡單的結論如下
1. 推薦模型: unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL
2. 編譯 llama.cpp 建議用 F16 with oneDNN 那組編譯選項
3. 啟動 llama.cpp 建議不要改 -ctk -ctv, 預設 f16 的 kv cache 速度較快
測試報告可以參考 llama.cpp 討論區, 我寫了幾篇 B70 的測試結果
https://github.com/ggml-org/llama.cpp/discussions/23313#discussioncomment-182299
目前搭配 ZooCode, axe, AnythingLLM 等 Agent 使用
邏輯複雜的任務, 需要搭配 MCP 使用, 邏輯簡單手續複雜的任務可以直接做
以目前測試結果, 應該已經接近榨乾 B70 SYCL 性能
接下來會再研究 OVMS 與 OpenVINO IR 量化, 看能不能進一步提升效能
--
世界越快 心則慢
網路越慢 心則快
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 122.117.175.196 (臺灣)
※ 文章網址: https://webptt.com/m.aspx?n=bbs/PC_Shopping/M.1788331380.A.1E5.html
1F:推 World5566: 潮101.10.167.166 09/02 14:50
2F:推 yymeow: 推個60.250.130.216 09/02 15:24
3F:推 d0178411: 看嘸 還是推223.143.240.105 09/02 15:57
4F:推 dog41125: 想請問你的電源方面有調整嗎?還是上下103.5.140.191 09/02 16:00
5F:→ dog41125: 文的設計,我也是用B70跑Qwen一定當機,103.5.140.191 09/02 16:00
6F:→ dog41125: 現在用gemma27B穩定跑103.5.140.191 09/02 16:00
建議安裝 PPA 驅動, Ubuntu 內建驅動對 B70 應該沒有完整相容
https://dgpu-docs.intel.com/installation-guides/installing-packages-from-the-int
※ 編輯: tacovirus (61.219.120.33 臺灣), 09/02/2026 16:42:34
7F:推 d030b: 感謝分享36.226.237.148 09/02 18:17
8F:→ necrophagist: Gemma是26Ba4b moe 和qwen 27b den111.80.145.255 09/02 19:14
9F:→ necrophagist: se模型要能順跑的難度差很多111.80.145.255 09/02 19:14
10F:推 px172: 謝謝分享114.24.94.13 09/02 19:25
11F:推 saito2190: 建議用Q4,Q3Q5不能被2整除 有時候反114.137.92.172 09/02 20:41
12F:→ saito2190: 而會跑更慢114.137.92.172 09/02 20:41
這張卡在 llama.cpp 跑 Q4 會損失 66% pp512 性能喔,測試報告有寫
13F:推 sdbb: 謝謝175.182.177.165 09/02 22:55
14F:推 YCL13: 很多人調KV的目的是要加大上下文容量1.161.155.111 09/02 23:19
※ 編輯: tacovirus (122.117.175.196 臺灣), 09/02/2026 23:53:53
這張卡不建議調 kv 型態,是因為計算過程會統一轉成 f16 計算導致降速,由於這張卡的
VRAM 夠大但是頻寬偏小,所以用 f16 體驗比較好
※ 編輯: tacovirus (122.117.175.196 臺灣), 09/02/2026 23:56:25
※ 編輯: tacovirus (122.117.175.196 臺灣), 09/02/2026 23:57:05
15F:推 jhjhs33504: 調整KV型態要海量數學配套不然不夠準1.162.78.66 09/03 00:50
16F:推 saito2190: B70居然跟Q4不合嗎...感謝情報,讓我114.24.170.184 09/03 05:39
17F:→ saito2190: 也想買一張B70回來研究研究114.24.170.184 09/03 05:39
應該是說 llama.cpp 的工作原理對 Intel 架構的 Q4 不合,不然理論上 Intel 的 INT4
效能非常高,所以正打算開始實驗 OVMS 推論引擎,如果模型量化得當,我認為推論速度可
能是 llama.cpp 的兩倍
※ 編輯: tacovirus (61.219.120.33 臺灣), 09/03/2026 10:43:01