作者ck203l5 (ck203l5)
看板PC_Shopping
標題[測試] 地端雙卡AI使用SFF-8654通道拆分簡易測試
時間Thu Aug 6 23:12:59 2026
前陣子有朋友在評估只有一條PCIE-X16主機板想玩雙卡AI
故這次這邊買了一組PCIE轉SFF-8654通道拆分卡來實測
https://i.meee.com.tw/xZShP8H.jpg
測試設備:
CPU: R9-5900X
MB: ASROCK B550M-ITX/AC (PCI-E 4.0)
VGA: 2張 ZOTAC 5060TI 16G
想說反正5060TI本來也就只有物理PCIE X8
一張卡佔用一條X16實在太浪費,乾脆拿來測試這套設備
1.先做一般顯示輸出測試,確認其穩定度與可用性
(1)顯卡直插主機板 3DMark-TimeSpy 測試
https://i.meee.com.tw/KPjD3t1.jpg
https://i.meee.com.tw/mydevDH.png
(2)透過拆分板&SFF-8654連接 3DMark-TimeSpy 測試
https://i.meee.com.tw/vyGVAiV.jpg
https://i.meee.com.tw/dRFW6Ug.jpg
https://i.meee.com.tw/DmohbnF.png
可以看到透過拆分裝置連接的5060TI
(PCIE Link-Speed 16GT/s 代表走 PCI-E 4.0)
在PCIE Error Counter中
Recoverey Count 的數量明顯增加 (但直插時也有這個Count只是較少)
NAKs Received Count 也出現幾筆 (直插沒這個Count)
但沒有出現被列為Error等級的Count
表示訊號傳輸確實會受到拆分裝置影響,但不至於出現"錯誤"等級的問題
從3DMark分數來看也在誤差範圍內,證明這套拆分裝置的可用性。
2.雙卡AI測試
https://i.meee.com.tw/7ze7zSz.jpg
https://i.meee.com.tw/F5DdSko.png
用Ollama跑Qwen3.6-27B-Q4_K_M KV量化Q8 Pipeline Parallel 情況下
得到結果為23tk/s
(當然換個引擎會更快但主要是驗證通道拆分裝置,就不另外多測了)
這邊可以看到 Recoverey及NAKs Received Count 都集中在有插螢幕的這張卡上
沒螢幕只負責計算的卡 Recoverey Count 就很少
可推斷通道拆分裝置對Pipeline Parallel模式下的AI多卡運算影響不大
3.PCI-E降速測試
網路上一直有查到一套論述是 "對於Pipeline Parallel模式,PCI-E 3.0 & 4.0 在X8下
差異不大"
正好就拿這套設備來自己驗證
https://i.meee.com.tw/HGuSq2o.png
可以看到跑出來速度還是23tk/s左右
(PCIE Link-Speed 8GT/s 代表走 PCI-E 3.0)
4.測試小結
(1) "品質好的"通道拆分裝置,對於2張5060TI等級的卡,要跑PP並行模式的AI,其穩定
性是足夠的。
(2) PCI-E X8 3.0 & 4.0 對於2張5060TI等級的卡,在PP並行模式下,AI運算速度影響不
大。
分享給有考慮SFF-8654 PCI-E通道拆分裝置的板友參考~
****本篇內容僅為個人測試心得,若論點或觀點有誤還請各位多幫忙指正或分享資訊****
****以上係對Pipeline Parallel進行驗證,想跑Tensor Parallel的要另外驗證影響程度
****
感謝您的收看~
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 172.56.164.96 (美國)
※ 文章網址: https://webptt.com/m.aspx?n=bbs/PC_Shopping/M.1786029182.A.931.html
1F:推 pphyy5844548: 換個引擎是指換llm.cpp嗎 123.252.75.84 08/06 23:16
2F:→ ck203l5: 絕大多數情況下llama.cpp一定比Ollama快 12.170.106.26 08/06 23:21
3F:→ ck203l5: Ollama就是主打懶人用的但效能不是最好 12.170.106.26 08/06 23:22
4F:→ crimsonmoon9: 個人實測過就算只有PCIe的頻寬在vLL 42.77.121.248 08/07 00:26
5F:→ crimsonmoon9: M上TP還是比PP有效率 42.77.121.248 08/07 00:26
6F:→ crimsonmoon9: 有點想不通它的邏輯 之前手算應該要 42.77.121.248 08/07 00:26
7F:→ crimsonmoon9: NVLink等級才會追過才對 42.77.121.248 08/07 00:26
8F:推 fu1vu03: 用50不考慮跑個NVFP4嗎 211.76.56.41 08/07 00:39
9F:推 marklai: 請問如果主版是5×16, 這樣拆分後是5×8 125.231.12.162 08/07 02:10
10F:→ marklai: 或4×8呢?它的轉接版跟線可以支援到pcie 125.231.12.162 08/07 02:10
11F:→ marklai: 5嗎? 125.231.12.162 08/07 02:10
12F:推 TameFoxx: TP其實沒那麼吃頻寬 182.233.84.193 08/07 02:16
13F:→ TameFoxx: 他權重拆layer,kv好像也會拆,兩邊 182.233.84.193 08/07 02:17
14F:→ TameFoxx: 傳遞最新生出來那個就好,應該類似這樣 182.233.84.193 08/07 02:17
15F:→ crimsonmoon9: 你那個是PP吧 TP是同一層拆到兩張上 42.77.121.248 08/07 02:29
16F:→ crimsonmoon9: 算完再all-gather同步後再接著算拆 42.77.121.248 08/07 02:29
17F:→ crimsonmoon9: 開的下一層 42.77.121.248 08/07 02:29
18F:→ ck203l5: SFF-8654只有PCI-E 4.0,但它有另一個 12.170.106.26 08/07 03:11
19F:→ ck203l5: 外觀很像的規格叫 MCIO(SFF-TA-1016) 12.170.106.26 08/07 03:11
20F:→ ck203l5: 是跑PCI-E 5.0的,蝦皮美亞搜一下就有。 12.170.106.26 08/07 03:11
21F:→ ck203l5: 但有個先決條件就是主機板BIOS要有支援 12.170.106.26 08/07 03:11
22F:→ ck203l5: PCIe通道拆分(PCIe Bifurcation),才能 12.170.106.26 08/07 03:11
23F:→ ck203l5: 將原本X16插槽自己先拆成X8+X8兩段訊號, 12.170.106.26 08/07 03:12
24F:→ ck203l5: 再透過MCIO轉接卡將前後兩段分別拉出來 12.170.106.26 08/07 03:12
25F:→ ck203l5: 成2個獨立的PCI-E插槽。 12.170.106.26 08/07 03:12
26F:→ ck203l5: 若主機板原生5.0X16且支援PCIe通道拆分 12.170.106.26 08/07 03:12
27F:→ ck203l5: 就能用MCIO線材拆成2個獨立的5.0X8插槽 12.170.106.26 08/07 03:13
28F:→ ck203l5: 並獨立安裝兩張顯示卡(2張都跑5.0X8)。 12.170.106.26 08/07 03:13
30F:→ ck203l5: 像這種就是MCIO規格走PCI-E 5.0的 供參 12.170.106.26 08/07 03:22
31F:推 fautumn: 感謝測試111.240.133.159 08/07 10:32