作者CardLin (卡林)
看板PC_Shopping
标题[心得] Dell Pro Max with GB10 2TB
时间Tue Aug 11 21:04:52 2026
我入手 Dell Pro Max with GB10 2TB 价格比 ASUS GX10 1TB 便宜
但整体仍然因涨价潮影响,还是会让荷包大失血,分享我对它的看法给大家参考
Dell官网连结:
https://tinyurl.com/4bmuzx49
0. 介绍
简单介绍 NVIDIA GB10 UMA 128GB 的架构
基本上就是一个小电脑搭载 20 核心的联发科 ARM 处理器
加上最新的 NVIDIA GB20B (Blackwell 2.0) GPU
并搭配 128GB LPDDR5X 256bit 273.2 GB/s 的统一记忆体 (CPU & GPU 共用)
只能用 Ubuntu 24.04 作业系统,如果之後要重灌原厂官网有还原包
详细规格:
https://www.techpowerup.com/gpu-specs/gb10.c4342
1.储存空间
由於 GB10 的储存空间太小了,而且这台是 2TB QLC
在调研模型的时候动辄 10GB 的模型很快吃满容量
串接我的 NAS: i7-9700K + 128GB DDR4 + SSD 1TB x2 (RAID1) + HDD 18TB x8 (RAID6)
我在 RAID6 NAS 这台安装 TP-Link TX401 10 Gigabit PCI Express 网路卡在 x4 插槽
并用 CAT6A 直连两个 10Gbps Port,然後设定 NAS 这台两张网卡组成 Bridge
好处是不用买很贵的 10Gbps Hub,缺点是 NAS 这台要开机我的 GB10 才能连网
实测挂载 NFS 速率如下: (NAS OS 是 Debian, RAID6 是 Software RAID mdadm)
写:
$ dd if=/dev/zero of=./testfile bs=100M count=10 conv=fdatasync
1048576000 bytes (1.0 GB, 1000 MiB) copied, 3.50447 s, 299 MB/s
读:
$ dd if=./testfile of=/dev/null bs=100M count=10
1048576000 bytes (1.0 GB, 1000 MiB) copied, 0.918901 s, 1.1 GB/s
写入速度受限於硬碟的速度,而 RAID6 多硬碟可以大幅加快读取速度
至於 100G 的光纤网路方案,网上有某家 NAS 的文章感觉是业配,且 100G 卡很贵作罢
每个 GB10 有 100Gbps x 2 Port 可以串接第二台 GB10 进行共同运算
虽然我接 10G 写入跑不满,但至少读取模型才是最主要的操作,已可达到 1.1 GB/s
建议有要用 10Gbps NAS 的用户要用 NVMe RAID1 当快取速度才能满速运转
另外我初期 GB10 只用 1Gbps 网路实在是太慢,不建议这样配置
2.CPU速度
CPU 虽然是 ARM 架构但编译软体非常流畅
编译 OpenCV with CUDA support 只花十分钟不到 (20核心ARM)
同样的编译参数拿到 Windows + x86 大概要花三十分钟以上 (8核心5700X3D)
3.GPU 与 VRAM 速度
它的定位是一个 RTX5070 等级的 GPU 运算性能 + 128GB 慢速 RAM (因需相容CPU)
相比於 RTX5070 12GB 的 672.0 GB/s 存取速度,273.2 GB/s 只有一半不到
4.CUDA效能
如果你要写 CUDA 程式在上面跑跑看的话,可以直接沿用 x86 的程式不用改
宣告在 UMA 的 cudaMallocManaged() 的记忆体在 CPU + GPU 可以同时存取
但实际测试 cudaMalloc() 宣告只能在 GPU 使用的记忆体存取速度快 10% 以上
测试版本是 Driver Version: 580.173.02 CUDA Version: 13.0
5.AI LLM
大型语言模型基本上 100B 左右都有机会可以放进 Q4 (量化成4bit) 的模型
我有用过最大的模型是 Qwen3.5-122B-A10B
https://github.com/albond/DGX_Spark_Qwen3.5-122B-A10B-AR-INT4
大概会占用 100GB 的 VRAM,速度被这位大神优化到还蛮快的 52 tok/s
GB10在大语言模型的优点是记忆体大,可以放下足够长的上下文跟用较聪明的模型
缺点是记忆体慢,所以 pre-fill 很慢,导致整体体验会觉得比线上 API 慢很多
pre-fill 就是输入的 token 读取速度,由於 Hermes Agent (或龙虾 OpenClaw)
这类 Agent 程式都要管理记忆,所以会累积到 100K tokens 十万字左右的篇幅
而 GB10 的 pre-fill 速度在一些如 35B-A3B 的模型可达最高 1000 toks/s 左右
等於是你首次问一个问题要花 100 秒才会得到回应,当然第二次有 cache 会变快
而 122B 大模型可能掉到 200 toks/s 所以拿来跑龙虾的话,500 秒才会回应...
35B-A3B 的速度之数量级 (印象中的速度) 记忆体占用 24GB 左右
文字输入速度: GB10=1000tok/s RTX5090=4000tok/s
文字输出速度: GB10=100tok/s RTX5090=200tok/s
相比於线上 API 的白菜价,用 GB10 跑 LLM 基本上不划算,
OpenAI 的线上 API 文字输入速度都是 10000tok/s 以上
只要 ChatGPT 订阅帐号可以串接 Hermes Agent 或 OpenClaw
使用 gpt-5.6-luna 就很好用,所以我打算不拿 GB10 跑 LLM
除非你有隐私需求,但考量速度会建议你买 RTX5090
6. AI Vision 文生图、图生图、文生影片、图生影片 / AI Audio 语音合成等
我觉得 GB10 的优点是有大记忆体,所以反而很适合跑一些影片生成类的生产力工具
原因是线上的生成影片 API 实在是非常贵,如生成1秒要价1台币,还不确定达到成果
也就是 Comfy UI 的工作流了, Comfy UI 是个可将 AI 模型产出串接另一 AI 的工具
例如我今天输入想说出的文字及老王的语音范本跟老王照片,要产出老王说出特定的文字
就可以将这个语音生成的结果串接到下一个节点接入嘴型生成的AI模型
搭配老王的照片就可以产出老王讲出特定内容的影片,也就是YT上各种AI生成的主播
线上 API 生成 10 分钟就要 600 台币了,跑在 GB10 可能要花半天运算,但省钱
而且很弹性,做坏了就再花几小时重新运算,并且可以将 Comfy UI 设定好的参数存档
网路上也有很多 GitHub 会放 Comfy UI 的插件,可以随时加入最前沿的模型以供使用
而生一个 720p 影片会用超过 32GB 的 VRAM 所以 GB10 相对比 RTX5090 还要更适合
而且开始生成时可以关闭浏览器,Comfy UI 是透过网页,等跑完再连入取得结果即可
7. AI Agent
如果目标是 LLM 的代理人可能要再想想,它的速度堪用但不够快,为了隐私的话可接受
基本上我在这台跑 Hermes + OpenAI gpt-5.6-luna 协助我布署,下载模型只要贴网址
如果你要跑本地 LLM 用於 AI Agent
我建议用这个GitHub: (Qwen3.5-35B-A3B vLLM 最佳化)
https://github.com/yunusshin/DGX_Spark_Qwen3.5-35B-A3B-Optimized
可以一开始就下这个命令要他记住: (请自行修改)
"请记住您是一个执行在 NVIDIA DGX Spark (GB10) 128GB UMA + ARMv9.2 + 2TB QLC
SSD 的 BOT ,并且拥有 sudo 权限,而你只能使用内建的 cuda-13.0 + cudnn 9.23.2
+ tensorrt v110100 ,而你的网路是透过 10Gbps 内网连结 18TBx8 RAID6 (108TB) 的
NAS ,这个磁碟挂载在 /storage 是专门给你用的
。所以请使用上述内建的 CUDA Lib 版本,并且尽量使用 /storage 这个空间,而
避免使用 /home 或 /tmp 等空间因为它是 QLC 比较不耐写,我希望你的寿命长久。"
以避免 AI 使用不相容版本的 CUDA 或是自行幻想自己是 x86 平台
虽然我觉得拿 GB10 跑 LLM 好像比较不划算,比几乎同价格的 RTX5090 慢
8. 萤幕接口
GB10 可输出萤幕的接口有 HDMI x1 + TypeC x3 (已扣除电源的TypeC接口)
算是可以接 4 个萤幕,与一般显卡的数量相同,作业系统是 Ubuntu 需考虑软体相容性
结论:
GB10 整体来说可以让你有一台独立可跑 AI 的小电脑,让人可以用低成本导入 AI
但它的缺点是效能较低,特别是记忆体频宽不够大,所以购买前请务必先评估效能
优点是很省电且可以载入市面上大多数的模型,泛用性比 RTX5090 还要好
非常适合用於 AI 专案的前期模型布署相关调查研究,固定成本可让你不断试错
也可以让你用这个平台尝试目前最前沿的模型,基本上每个月都有新模型可以试
等到效果达标,有需要加速的时候再购买更高规格硬体,或是使用云端虚拟主机
至於储存的部分则建议串联 10G 内网连接 NAS 才有充足的空间让你尝试最新模型
这也难怪 4TB 版本会卖那麽贵,插 TypeC 的 SSD 也可以考虑,它的 TypeC 是 20Gbps
希望人人都能找到适合自己的 AI 平台,买了 GB10 之後觉得购买前可先试试云端 API
因为最前沿的模型通常是要拿来赚钱,尚未开源,开源模型通常要等一阵子
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 36.227.154.12 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/PC_Shopping/M.1786453501.A.9D2.html
1F:→ CardLin: 补充: 建议买来先更新韧体, 有稳定性更新 36.227.154.12 08/11 21:06
2F:推 roseritter: 推 122.117.187.82 08/11 22:04
3F:推 seemoon2000: 现在最佳解是买两台装deepseek 0731 220.137.6.192 08/11 22:09
4F:→ seemoon2000: 还有跑生图影音需要这台 如果是要省 220.137.6.192 08/11 22:09
5F:→ seemoon2000: 钱跑本地模型 不需要这台 不会省钱 220.137.6.192 08/11 22:09
6F:→ CardLin: 请问两台200G光纤串起来VRAM会双倍吗?? 36.227.154.12 08/11 22:28
7F:推 sdbb: 谢谢 112.104.65.143 08/11 22:35
8F:推 seemoon2000: 不是vram翻倍 是让两台接力运送 透 89.117.42.14 08/11 22:40
9F:→ seemoon2000: 过那条ConnectX-7传输资料 89.117.42.14 08/11 22:40
解释一下ComfyUI执行任务时是将任务放到排队伫列,跑完一个会接续跑下一个
刚刚查了一下两台GB10跑ComfyUI不是加速单一执行,而是同时可跑两个任务 (额外设定)
10F:推 sadspat: 好奇请教为何不是选ai max+ 395 ?123.192.239.198 08/11 23:11
NVIDIA架构包含CUDA是最广泛使用的AI平台不用踩坑,而且新模型通常能直上不用等
11F:推 fautumn: 谢谢分享 1.169.120.153 08/11 23:37
12F:→ crimsonmoon9: 很容易过热重开 丢24Hr冷气机房还是 42.77.121.248 08/12 01:38
13F:→ crimsonmoon9: 要加个小电扇 42.77.121.248 08/12 01:38
14F:→ xeyrekr: ai max 395 生态系支援太差 不支援fp4 220.133.20.17 08/12 03:47
15F:→ xeyrekr: 地端的价值是 资料不外流+comfyUI容错率 220.133.20.17 08/12 03:55
16F:→ iceyang: 适合拿来放着慢慢跑模型训练 61.224.186.178 08/12 04:55
17F:推 skywgu: 硬碟IO性能主要影响「模型载入时间」;通 49.218.143.96 08/12 09:57
18F:→ skywgu: 常不太影响模型载入完成後的推理速度吧 49.218.143.96 08/12 09:57
19F:→ skywgu: 用机械硬碟载入100G也就拉个屎10分钟左右 49.218.143.96 08/12 09:57
20F:→ skywgu: 就结束了XD 49.218.143.96 08/12 09:57
ComfyUI每跑一个节点就会重新载入模型,用完就卸载以释放记忆体,会频繁I/O
如果是跑一些 10GB 的文字转语音模型,转换花30秒,载入要花超过30秒就不划算了
若载 10GB 模型跑10分钟可能还可接受,模型生命周期短的话还是有 10Gbps 网路较好
另外 NAS 如果有足够的 RAM 的话也会被当成硬碟快取
如果是大档案的话 RAID6 多碟(我的是8碟)本身就可达 1GB/s 算很够用
100Gbps就等以後看有没有100Gbps洋垃圾网卡但就要使用x8或x16的插槽
※ 编辑: CardLin (36.227.129.159 台湾), 08/12/2026 10:27:09
21F:推 stlinman: 感觉跑影片比较划算,跑LLM首字要等500150.116.129.113 08/12 10:46
22F:→ stlinman: 秒? 太慢了跑Agent感觉卡,而且现在线上150.116.129.113 08/12 10:46
23F:→ stlinman: API几乎都能吃到补贴让利。 不介意数据150.116.129.113 08/12 10:47
24F:→ stlinman: 隐私安全的LLM走云端比较有效益!150.116.129.113 08/12 10:48
LLM 我用的 Qwen3.5-122B-A10B 的 Content Window = 262144 tokens
Content Window 的意思是最长可接受的上下文,如问题 25 万字,剩下 1 万字可输出
也就是上下文的 KV Cache 记忆体用量的上限
而速度的问题要看 pre-fill rate 如 10万字 / (pre-fill-rate=200字/秒) = 500秒
如果是 Qwen3.5-35B-A3B 就拥有 pre-fill rate=1000字/秒 就会缩短到 100 秒
会输入10万字通常是在查询网页时将整个网页爬虫之类的情况,或是 AI Agent 查看 Log
如果只是一般对话,例如线上 AI 客服之类的短 content 应用,其实反应蛮快的
简单算一下输入只有 1000 字的话 1 秒後就开始输出文字回答
整体 AI Agent 速度的体感是比 OpenAI API 慢而且初期投入成本相对算是非常高
隐私需求的话仍然可以考虑买一台来 Try Run,毕竟企业一个文档可能就以超过硬体价值
※ 编辑: CardLin (36.227.129.159 台湾), 08/12/2026 11:07:34
25F:推 Nilife: 试试Qwen3.8-27B q8_0 101.8.81.50 08/20 18:09
26F:→ labiron: 没有windows会很不方便吗?用27B模型模 36.228.238.20 08/24 21:54
27F:→ labiron: 型 还需要用到量化版 36.228.238.20 08/24 21:54
28F:→ CardLin: Linux 看个人熟悉程度, 3.8-27B 效果不错 36.227.147.233 08/27 13:46
29F:→ CardLin: 我是参考 hasso5703/dgx-spark-qwen38 36.227.147.233 08/27 13:46