作者ck203l5 (ck203l5)
看板PC_Shopping
标题[测试] 地端双卡AI使用SFF-8654通道拆分简易测试
时间Thu Aug 6 23:12:59 2026
前阵子有朋友在评估只有一条PCIE-X16主机板想玩双卡AI
故这次这边买了一组PCIE转SFF-8654通道拆分卡来实测
https://i.meee.com.tw/xZShP8H.jpg
测试设备:
CPU: R9-5900X
MB: ASROCK B550M-ITX/AC (PCI-E 4.0)
VGA: 2张 ZOTAC 5060TI 16G
想说反正5060TI本来也就只有物理PCIE X8
一张卡占用一条X16实在太浪费,乾脆拿来测试这套设备
1.先做一般显示输出测试,确认其稳定度与可用性
(1)显卡直插主机板 3DMark-TimeSpy 测试
https://i.meee.com.tw/KPjD3t1.jpg
https://i.meee.com.tw/mydevDH.png
(2)透过拆分板&SFF-8654连接 3DMark-TimeSpy 测试
https://i.meee.com.tw/vyGVAiV.jpg
https://i.meee.com.tw/dRFW6Ug.jpg
https://i.meee.com.tw/DmohbnF.png
可以看到透过拆分装置连接的5060TI
(PCIE Link-Speed 16GT/s 代表走 PCI-E 4.0)
在PCIE Error Counter中
Recoverey Count 的数量明显增加 (但直插时也有这个Count只是较少)
NAKs Received Count 也出现几笔 (直插没这个Count)
但没有出现被列为Error等级的Count
表示讯号传输确实会受到拆分装置影响,但不至於出现"错误"等级的问题
从3DMark分数来看也在误差范围内,证明这套拆分装置的可用性。
2.双卡AI测试
https://i.meee.com.tw/7ze7zSz.jpg
https://i.meee.com.tw/F5DdSko.png
用Ollama跑Qwen3.6-27B-Q4_K_M KV量化Q8 Pipeline Parallel 情况下
得到结果为23tk/s
(当然换个引擎会更快但主要是验证通道拆分装置,就不另外多测了)
这边可以看到 Recoverey及NAKs Received Count 都集中在有插萤幕的这张卡上
没萤幕只负责计算的卡 Recoverey Count 就很少
可推断通道拆分装置对Pipeline Parallel模式下的AI多卡运算影响不大
3.PCI-E降速测试
网路上一直有查到一套论述是 "对於Pipeline Parallel模式,PCI-E 3.0 & 4.0 在X8下
差异不大"
正好就拿这套设备来自己验证
https://i.meee.com.tw/HGuSq2o.png
可以看到跑出来速度还是23tk/s左右
(PCIE Link-Speed 8GT/s 代表走 PCI-E 3.0)
4.测试小结
(1) "品质好的"通道拆分装置,对於2张5060TI等级的卡,要跑PP并行模式的AI,其稳定
性是足够的。
(2) PCI-E X8 3.0 & 4.0 对於2张5060TI等级的卡,在PP并行模式下,AI运算速度影响不
大。
分享给有考虑SFF-8654 PCI-E通道拆分装置的板友参考~
****本篇内容仅为个人测试心得,若论点或观点有误还请各位多帮忙指正或分享资讯****
****以上系对Pipeline Parallel进行验证,想跑Tensor Parallel的要另外验证影响程度
****
感谢您的收看~
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 172.56.164.96 (美国)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/PC_Shopping/M.1786029182.A.931.html
1F:推 pphyy5844548: 换个引擎是指换llm.cpp吗 123.252.75.84 08/06 23:16
2F:→ ck203l5: 绝大多数情况下llama.cpp一定比Ollama快 12.170.106.26 08/06 23:21
3F:→ ck203l5: Ollama就是主打懒人用的但效能不是最好 12.170.106.26 08/06 23:22
4F:→ crimsonmoon9: 个人实测过就算只有PCIe的频宽在vLL 42.77.121.248 08/07 00:26
5F:→ crimsonmoon9: M上TP还是比PP有效率 42.77.121.248 08/07 00:26
6F:→ crimsonmoon9: 有点想不通它的逻辑 之前手算应该要 42.77.121.248 08/07 00:26
7F:→ crimsonmoon9: NVLink等级才会追过才对 42.77.121.248 08/07 00:26
8F:推 fu1vu03: 用50不考虑跑个NVFP4吗 211.76.56.41 08/07 00:39
9F:推 marklai: 请问如果主版是5×16, 这样拆分後是5×8 125.231.12.162 08/07 02:10
10F:→ marklai: 或4×8呢?它的转接版跟线可以支援到pcie 125.231.12.162 08/07 02:10
11F:→ marklai: 5吗? 125.231.12.162 08/07 02:10
12F:推 TameFoxx: TP其实没那麽吃频宽 182.233.84.193 08/07 02:16
13F:→ TameFoxx: 他权重拆layer,kv好像也会拆,两边 182.233.84.193 08/07 02:17
14F:→ TameFoxx: 传递最新生出来那个就好,应该类似这样 182.233.84.193 08/07 02:17
15F:→ crimsonmoon9: 你那个是PP吧 TP是同一层拆到两张上 42.77.121.248 08/07 02:29
16F:→ crimsonmoon9: 算完再all-gather同步後再接着算拆 42.77.121.248 08/07 02:29
17F:→ crimsonmoon9: 开的下一层 42.77.121.248 08/07 02:29
18F:→ ck203l5: SFF-8654只有PCI-E 4.0,但它有另一个 12.170.106.26 08/07 03:11
19F:→ ck203l5: 外观很像的规格叫 MCIO(SFF-TA-1016) 12.170.106.26 08/07 03:11
20F:→ ck203l5: 是跑PCI-E 5.0的,虾皮美亚搜一下就有。 12.170.106.26 08/07 03:11
21F:→ ck203l5: 但有个先决条件就是主机板BIOS要有支援 12.170.106.26 08/07 03:11
22F:→ ck203l5: PCIe通道拆分(PCIe Bifurcation),才能 12.170.106.26 08/07 03:11
23F:→ ck203l5: 将原本X16插槽自己先拆成X8+X8两段讯号, 12.170.106.26 08/07 03:12
24F:→ ck203l5: 再透过MCIO转接卡将前後两段分别拉出来 12.170.106.26 08/07 03:12
25F:→ ck203l5: 成2个独立的PCI-E插槽。 12.170.106.26 08/07 03:12
26F:→ ck203l5: 若主机板原生5.0X16且支援PCIe通道拆分 12.170.106.26 08/07 03:12
27F:→ ck203l5: 就能用MCIO线材拆成2个独立的5.0X8插槽 12.170.106.26 08/07 03:13
28F:→ ck203l5: 并独立安装两张显示卡(2张都跑5.0X8)。 12.170.106.26 08/07 03:13
30F:→ ck203l5: 像这种就是MCIO规格走PCI-E 5.0的 供参 12.170.106.26 08/07 03:22
31F:推 fautumn: 感谢测试111.240.133.159 08/07 10:32
32F:推 TameFoxx: Crim 大看到了 好像是batch没很大时 42.79.182.17 08/07 12:48
33F:→ TameFoxx: 感受不到差异,所以单人使用没啥差 42.79.182.17 08/07 12:49