作者tacovirus (大怒神のスイッチ)
看板PC_Shopping
标题Re: [闲聊] VRAM大就是正义?Intel B70 minimax h3
时间Wed Sep 2 14:42:52 2026
※ 引述《kimisawa (杨回血了。)》之铭言:
: YT Lon.TV 测了B70用ComfyUI跑 minimax
: https://www.youtube.com/watch?v=HfevkEZ8w5Q
: 看起来VRAM大的优势在这边体现出来,无速度法跟NVIDA比,
: 不过NVIDIA要32G的价格就很不舒服了
: B70生480p 5秒大概 2分半
: 生图 1024x1024 大概 34秒
: 他还测了许多其他用途与模型,影片搭声音,coding,等等
: 另外大vram的好处是跑LLM
: https://www.youtube.com/watch?v=bLac7-toF68&t=363s
: Lon.TV 跑Qwen3.8可以全部放在vram 大概 25 token/s
: 亚马逊的价钱
: https://i.imgur.com/lErsamq.png
: 退一步B60 24G VRAM可以放绝大部分的模型只有B70一半的价钱
: 不过I卡的问题是待机功耗,待机要吃到50W有点高啊
: 单跑AI或许'目前'i卡是一种选择?N卡的性价比实在太差了
在下做了 Qwen3.8 27B 的测试, 简单的结论如下
1. 推荐模型: unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL
2. 编译 llama.cpp 建议用 F16 with oneDNN 那组编译选项
3. 启动 llama.cpp 建议不要改 -ctk -ctv, 预设 f16 的 kv cache 速度较快
测试报告可以参考 llama.cpp 讨论区, 我写了几篇 B70 的测试结果
https://github.com/ggml-org/llama.cpp/discussions/23313#discussioncomment-182299
目前搭配 ZooCode, axe, AnythingLLM 等 Agent 使用
逻辑复杂的任务, 需要搭配 MCP 使用, 逻辑简单手续复杂的任务可以直接做
以目前测试结果, 应该已经接近榨乾 B70 SYCL 性能
接下来会再研究 OVMS 与 OpenVINO IR 量化, 看能不能进一步提升效能
--
世界越快 心则慢
网路越慢 心则快
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 122.117.175.196 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/PC_Shopping/M.1788331380.A.1E5.html
1F:推 World5566: 潮101.10.167.166 09/02 14:50
2F:推 yymeow: 推个60.250.130.216 09/02 15:24
3F:推 d0178411: 看呒 还是推223.143.240.105 09/02 15:57
4F:推 dog41125: 想请问你的电源方面有调整吗?还是上下103.5.140.191 09/02 16:00
5F:→ dog41125: 文的设计,我也是用B70跑Qwen一定当机,103.5.140.191 09/02 16:00
6F:→ dog41125: 现在用gemma27B稳定跑103.5.140.191 09/02 16:00
建议安装 PPA 驱动, Ubuntu 内建驱动对 B70 应该没有完整相容
https://dgpu-docs.intel.com/installation-guides/installing-packages-from-the-int
※ 编辑: tacovirus (61.219.120.33 台湾), 09/02/2026 16:42:34
7F:推 d030b: 感谢分享36.226.237.148 09/02 18:17
8F:→ necrophagist: Gemma是26Ba4b moe 和qwen 27b den111.80.145.255 09/02 19:14
9F:→ necrophagist: se模型要能顺跑的难度差很多111.80.145.255 09/02 19:14
10F:推 px172: 谢谢分享114.24.94.13 09/02 19:25
11F:推 saito2190: 建议用Q4,Q3Q5不能被2整除 有时候反114.137.92.172 09/02 20:41
12F:→ saito2190: 而会跑更慢114.137.92.172 09/02 20:41
这张卡在 llama.cpp 跑 Q4 会损失 66% pp512 性能喔,测试报告有写
13F:推 sdbb: 谢谢175.182.177.165 09/02 22:55
14F:推 YCL13: 很多人调KV的目的是要加大上下文容量1.161.155.111 09/02 23:19
※ 编辑: tacovirus (122.117.175.196 台湾), 09/02/2026 23:53:53
这张卡不建议调 kv 型态,是因为计算过程会统一转成 f16 计算导致降速,由於这张卡的
VRAM 够大但是频宽偏小,所以用 f16 体验比较好
※ 编辑: tacovirus (122.117.175.196 台湾), 09/02/2026 23:56:25
※ 编辑: tacovirus (122.117.175.196 台湾), 09/02/2026 23:57:05
15F:推 jhjhs33504: 调整KV型态要海量数学配套不然不够准1.162.78.66 09/03 00:50
16F:推 saito2190: B70居然跟Q4不合吗...感谢情报,让我114.24.170.184 09/03 05:39
17F:→ saito2190: 也想买一张B70回来研究研究114.24.170.184 09/03 05:39
应该是说 llama.cpp 的工作原理对 Intel 架构的 Q4 不合,不然理论上 Intel 的 INT4
效能非常高,所以正打算开始实验 OVMS 推论引擎,如果模型量化得当,我认为推论速度可
能是 llama.cpp 的两倍
※ 编辑: tacovirus (61.219.120.33 台湾), 09/03/2026 10:43:01