PC_Shopping 板


LINE

最初本来只是在主力机只有一张4080在玩ComfyUI,後来看到一张便宜的3080 12G後 就收下来用想说其中一张卡跑一个较小的LLM,但入手後随着想想玩的东西越来越多 东西也越买越多,最後就乾脆独立一台。 而这台最终的组合是 X99 平台配五张 RTX 3060,合计 60 GB VRAM。以下大致照组 装的顺序记录选料、踩到的坑与实际数据。 ▲ 完成後的样子,开放式矿机架 https://i.urusai.cc/8OpY3.jpeg
【主机板与 CPU】 主机板、CPU 与散热器是二手整组买的,2500 元。CPU 是 i7-5960X,主机板是 ASUS X99 Deluxe。 选这组的理由是 PCIe 通道配置。这张板子的 所有PCIe x16 插槽由 CPU 直出,不 需要额外的拆分卡就可以有5组 PCIe 3.0 x8插五张 GPU 。网路卡则插在 PCH 提供 的 PCIe 2.0 x4 上。 https://i.urusai.cc/nupyq.jpeg
【记忆体】 记忆体用 2 条 REG ECC 16 GB DDR4-2666。主机板与 CPU 的规格表只写原生支援到 2133,但实际插上去会自动跑到 2666。 後来跟朋友借了 4 条 8 GB DDR4-3200 来试,四通道 DDR4-3200 也上得去,不过效 能似乎卡在 CPU IMC 本身的限制,跟双通道 DDR4-2666 差距不大,所以最後就维持 原本那两条 ECC。反正模型权重全部在 VRAM,主机记忆体只在载入时走一次。 【系统碟与模型储存】 只配了一颗 256 GB 的 Kingston SKC600 SATA SSD 当系统开机碟。模型权重档全部 放在 NAS 上,透过 SMB Direct 存取,本机不留副本。 【电源供应器】 电供是技嘉 P1000GM 1000W,RMA 回来未开封的,2000 元收到。它本身就有 6 个 PCIe 8pin 可以直接用,另外再自己做了几条 SATA 转 PCIe 6pin 的线,供电给 PCIe 转接板。 【网路卡】 网路卡用 HPE 544FLR-QSFP+ 40G,很久以前买的,加转接板一张几百元。 因为 NAS 端目前是 25G/10G 的网路卡,所以必须加转接头降速成 10G 来用。不过 NAS 实际读取上限大约 2 GB/s,网路卡只有10Gbps还算可以接受。 ▲ HPE 544FLR-QSFP+ 加转接板 https://i.urusai.cc/Pv0nV.jpeg
【PCIe 延长方案】 延长走的是纯被动方案:PCIe x8 转 SFF-8654 x1,再用 SFF-8654 x1 转回 PCIe x16。找闲鱼上的委托代购,一组含线大约 500 元台币。 ▲ 转接板与 SFF-8654 线材 https://i.urusai.cc/JdYT3.jpeg
市面上容易找到的 PCIe x8 转 SFF-8654 转接板有两种,线路看起来比较简单的那 一种,要把板子上 R5 的电阻位置短路,否则插在主机板第一条 PCIe x16 以外的插 槽会侦测不到卡。 原因是这个电阻位置的两端分别是 PRSNT1# 与 PCIe x8 的 PRSNT2#,主机板就是靠 这两个接点有没有导通,去判断插槽上到底有没有插介面卡。第一条插槽会过是因为 它本来就预期有卡,其他插槽就得靠这组讯号自己表态。 ▲ R5 位置补一点锡短路就正常了 https://i.urusai.cc/6mEaM.jpeg
【电力配置】 这台跟主力机共用一组 220V 的电源回路。两台闲置时合计约 200~250W,LLM 跑起 来大概再加 650W;如果主力机的双卡(4080 + 3080)同时在生图或跑影片,总功耗 会冲到 1600W 以上。 ▲ 只有 LLM 在跑的时候 https://i.urusai.cc/9egUG.jpeg
▲ LLM 加上主力机生图,220V 那一路来到 1651W https://i.urusai.cc/uMpSq.jpg
先前两台加 NAS 都挂在同一组 110V/15A 回路上,不小心让 LLM 跟生图一起跑就会 直接跳电,後来乾脆自己拉了一路 220V/15A 专门给主力机和 LLM 用。NAS 因为接 110V 的 UPS,就继续留在 110V。 【显示卡】 五张 3060 是前两个月陆续收的,单张 5500~6000 元。厂牌没有统一,ASUS 的 ROG Strix、TUF、Dual 各一张,再加两张 MSI──二手市场有什麽就收什麽,反正 VRAM 一样大、跑起来也差不多。以目前新品的售价来看,现在大概很难再用这个价格收到了。 ▲ 五张 3060,厂牌与散热器都不一样 https://i.urusai.cc/tm2Hc.jpeg
【软体与效能】 OS 是 Ubuntu 26,跑 llama.cpp。原本载入跟切换模型都靠 script 档,後来觉得 太麻烦,就叫 Opus 写了一个网页控制介面。 ▲ llama.cpp 控制台,起停模型跟改参数都在这里 https://i.urusai.cc/N85Ls.png
目前主要跑 Qwen3.6 27B Q8,开多模态与 MTP,模型与 KV 全部放在 VRAM, context 可以开到 256K。在 32K context 长度下,TTFT 48 秒、prefill 677 t/s、 decode 42 t/s。 补一下 Q4 与 Q8 在没有 MTP 情况下的测试结果: ▲ llama-bench,Q4_K_M 对 Q8_0 https://i.urusai.cc/LFyNp.png
【花费总结】 RAM、SSD、网路卡、矿机架都是本来就有的,这次额外买的只有主机板加 CPU 加散 热器、电源供应器,以及 PCIe 延长板。 ‧ 主机板 + CPU + 散热器(二手整组):2,500 ‧ 电源供应器 P1000GM 1000W(二手未拆):2,000 ‧ PCIe 延长板:一组含线约 500,五组约 2,500 ‧ RTX 3060 x5:单张 5,500~6,000,合计约 2.8~3 万 显示卡以外的部分加起来大约 7,000 元。以 60 GB VRAM、能把 27B Q8 连同 256K context 整个放进 VRAM 来说还算划算吧 弄下来的一点感想是要搞多 GPU 门槛我觉得并不高。 AM5 平台大多支援把 PCIe x16 拆成 x8+x8、x8+x4+x4 或 x4+x4+x4+x4,再加上 CPU 直出的两个 x4 M.2,配上 PCIe x16 转 4x OcuLink 以及 M.2 转 OcuLink 的 转接板,就可以生出 6 组 PCIe 4.0 x4 给 6 张 GPU 用。AM4 也可以有 5 组。 我之前就是在 AM5 主力机上跑 PCIe 4.0 x8+x8+x4+x4。用 HWiNFO 看会发现 GPU 的 PCIe Error 计数器有一些数字,但实际运作没遇到什麽问题;而如果降到 PCIe 3.0,这些错误计数就不会出现了。如果改用那种板上有 PCIe Redriver/Retimer 的 延长方案,应该就可以在 PCIe 4.0 下完全没有错误,只是价格贵很多。 至於PCIe频宽够不够,目前 3060 跑 --sm tensor 模式,在 PCIe 3.0 x8(跟 4.0 x4 差不多)下还是有明显增益的。 接下来说一些建置过程中的测试调整,也有近期看到有人在讨论的PCIe频宽与TP议题 软体设定修改与测试方面主要是由Codex与Claude Code处理的 下面的内容也是叫Codex/Claude Code捞出来整理的 要先补充的是另一台机器:主力工作站是 Ryzen 7 9800X3D 配约 64 GB DDR5-6000, 平常跑 ComfyUI 生图,目前挂 RTX 4080 加 RTX 3080 两张卡。多卡实验最早就 是在它身上做的,後来卡片才陆续搬到专用伺服器。 卡片在这两台之间流动过好几次,这是下文所有测试的背景。顺序大致是:主力工作 站先从两张卡扩到四张,成为多卡实验的第一个场地;接着才另外组了专用伺服器, 起初只有两张 3060,中途曾把其中一张换成 3080 用来测异质组合,之後才逐步补 到四张、再到五张同型号的 3060。所以下文提到「这台」时,指的是当时正在测的 那一台,两者的卡数与拓朴都不同。 最一开始是搞清楚单张 4080 跑得动什麽、能开多大 context。用的是官方 QAT 量 化的 Gemma 4 12B(gemma-4-12b-it-qat-q4_0.gguf,6.50 GiB,另加约 0.16 GiB 的 mmproj),RTX 3080 完全保留不用,正式 profile 设 262,144 context 配 Q8 K/V cache 与 Flash Attention。 ▲ 单卡 Gemma 12B:context 上限 32K vs 256K https://i.urusai.cc/gTBZK.png
这组数字给出了一个贯穿後续所有 context 决策的结论:把可用 context 上限从 32K 拉到 256K,短序列的解码速度几乎没有变化(73.60 对 73.51)。换句话说, 增加 context 上限本身不必然拖慢生成,真正的成本在 KV cache 占掉的容量,以 及长 prompt 的 prefill 时间。这条结论後来让几乎每个 profile 都敢把 context 开大,只在 VRAM 真的不够时才往回收。 再往後上线的是 Gemma 4 26B A4B Uncensored HauhauCS Balanced Q4_K_M(15.64 GiB,约 26B 总参数配约 4B active),跑在 4080 加 CPU/RAM 上、排除 3080,同 样是 131,072 context 与 Q8 KV。长时间日志完成过一次 65,536-token 的连续生 成,平均 43.99 tok/s,另有约 49-50 tok/s 的一般生成纪录──这证明它不只能 载入,还能长时间稳定输出。 值得先记一笔的是:这颗 MoE 在「部分权重留在 RAM」的配置下仍有 44 tok/s。同 尺寸的 dense 模型在同样情况下会慢得多,因为 MoE 每个 token 只启用少数专家, 实际需要读取的权重量少了一个量级。 再来是Gemma4-31B Opus Distill 的两个量化──它们跑在同一组三张卡(3080 加 两张 3060)上,唯一的关键差异是 KV cache 放在 GPU 还是 CPU: ▲ Gemma4-31B Opus Distill:KV 放 CPU vs 放 GPU https://i.urusai.cc/JdUKL.png
Q5 这边还有更细的量测:载入後三张卡的剩余量分别是约 2.3 GB、3080 只剩约 436 MB、约 1.05 GB;跑完一次 21K token 的 prefill 之後 3080 仍有约 418 MB, 确认了「idle 时的余裕约等於稳态余裕」──因为 KV 是在载入时就整块预先配 置好的,不会随着实际用量慢慢长大。生成速度约 11 到 12 tok/s,而且随深度几 乎平坦(0 深度 10.9、21K 深度 12.2),代表它是被层链中最慢的那张卡绑住,而 不是被 KV 绑住;prefill 在 21K prompt 时约 757 tok/s,首字约 28 秒。 两相对照,把 KV 留在 CPU 的代价极高──Q6_K 的长生成只剩 4.16 tok/s,是 Q5 (KV 在 GPU)的四成不到,因为每个 token 的跨 PCIe 与 RAM 路径成了热点。但 Q6_K 换到的是 128K context(Q5 只有 96K),所以这是一笔刻意的交易而不是设 定失误:需要长 context 就付速度,需要速度就收 context。 另外 Q5 的 3080 只剩不到 0.5 GB,这个量化已经不能再往上加 context。这也是 整段历程反覆出现的一个规律:真正卡住的永远是「最满的那一张卡」,不是几张卡 加起来的总量。三张 12 GB 看起来有 36 GB,但只要有一张先满,整个配置就到顶 了。 主力工作站常常要跑ComfyUI,觉得要切换使用很麻烦,於是要搞了套X99,接下来的 多卡测试换到了另一台X99机器上。这台起初只有两张 3060──两张卡都是 Gen3 x16 直连 CPU root port下面几组测试都是在这台上做的。 换到这台机器最大的一笔效能提升来自切换张量切分方式,而原本的预测完全相反: 这台没有 P2P、卡间只有 5.57 GB/s 而且要绕主机记忆体,照直觉推断 tensor parallel 应该不划算。 实测推翻了这个预测(Qwen3.6-27B Q4_K_M @ ctx32K,同一个 prompt、temp 0): ▲ Qwen3.6-27B:-sm layer vs -sm tensor(MTP 开/关) https://i.urusai.cc/J4w9f.png
TP 与 MTP 是乘法叠加的:18.3 经 TP 变成 30.9(1.7 倍),再经 MTP 变成 46 (又 1.5 倍),总共 2.5 倍。 原因在於 batch=1 的生成是记忆体频宽瓶颈而不是通讯瓶颈:每一层的 all-reduce 只有大约 10 KB,几微秒就传完;而 -sm layer 的问题是同一时间只有一张卡在动, -sm tensor 则让两张卡同时计算每一层,等效频宽因此翻倍。GPU 使用率的观察 印证了这点──layer 模式下有一张卡闲着,tensor 模式下两张都在 89% 与 92%。 得到的教训是:不要用「PCIe 慢、没有 NVLink、没有 P2P」来推论 TP 不划算,那 个直觉只适用於大 batch 的 prefill。附带好处是 tensor 模式的 VRAM 分配很平 均(10361/10353),不像 layer 模式那样偏斜(9747/10949)。生成越长还越快: 114 token 是 34.6,300 token 45.4,800 token 45.8,8.6K prompt 则到 48.5 tok/s。 【把 PCIe 频宽砍半来测 TP 的敏感度】 既然 TP 的收益这麽大,下一个问题就是它对频宽有多敏感──如果换到频宽更窄的 插槽还划算吗?做法是用 setpci 把 root port 的 LNKCTL2 target speed 从 Gen3 降到 Gen2 再 retrain(这个改动不持久,重开机自动回复)。Gen2 x16 的 8.0 GB/s 约等於 PCIe 3.0 x8 的 7.88 GB/s,是很好的代理,因为软体改不了 lane 数 只能改速度。 ▲ PCIe 由 Gen3 x16 降到 Gen2 对 TP 的影响 https://i.urusai.cc/Qbtgs.png
频宽砍半只让 prefill 掉 9%、decode 掉 5%,所以即使只有 x8 也该用 tensor (44.4 对 29.6,还是 1.5 倍)。对照组只掉 1% 与 0.4%,这证明量到的确实是 PCIe 的影响而不是杂讯。 更重要的是从这里导出的洞察:痛不痛不是看频宽,而是看「通讯占计算时间的比例」。 主力工作站的 3080 挂在 PCH 後面的 PCIe 4.0 x4(7.88 GB/s,跟这里的 Gen2 差不多),但那边的 tensor prefill 却直接腰斩(2123 掉到 1011)。差别 有两个:一是 4080 与 3080 的算力约为 3060 的三倍,计算时间短,同样的通讯量 占比就大增;二是 PCH 多了一跳而且有 DMI 争用,延迟远高於直连 root complex。 所以单纯从 x16 降到 x8 不痛,PCH 加上快卡才痛。 【P2P 解锁:技术上成功,实用上几乎没有意义】 TP 既然靠卡间通讯,那把被锁住的通道打开应该还能再快一点──这是很自然的下 一步。消费卡的 P2P DMA 被 NVIDIA 锁住,但社群有开源分支可以解开,原本估计 「通讯约 5ms 一个 token,P2P 省一半就有 +10%」。 实际做法是把 BIOS 改成 OS Type=Other OS(Secure Boot 关闭)并开启 Above 4G Decoding,驱动换成 .run 安装的 610.43.03 userspace 加上 aikitoria/open-gpu-kernel-modules 的 610.43.03-p2p 自编未签名模组(taint 12288),并补上 nouveau 黑名单与 update-initramfs -u、把三个 kernel 套件 apt-mark hold 住、开 NVreg_EnableResizableBar=1 加 grub 的 pci=realloc,以 及把 NCCL 的 P2P 层级设成 SYS。 ▲ P2P 解锁前後:卡间频宽 vs llama.cpp 实际效能 https://i.urusai.cc/bcS8a.png
原本估的 +10% 是错的。CUDA 层确实开通了,但 llama.cpp 几乎没有受益──因为 llama.cpp 早就把通讯与计算重叠了,通讯根本不在关键路径上,加速它省不到时间。 频宽分析只在大 batch 的 prefill 才成立,而那正好就是唯一有改善的地方。这 也和前一节的结论互相呼应:既然频宽砍半只掉 5%,把频宽加倍自然也换不回多少。 另外三点值得记:NCCL_P2P_LEVEL=SYS 不设就等於整套白装(NCCL 看到 PHB 拓扑 会预设走绕主机的路径);ReBAR 生效的关键是 pci=realloc 而不是驱动版本 (GPU0 是 boot_vga,BAR 卡在 4G 以下,没有 realloc 搬不上去),BAR1 因此从 256 MB 变成 16 GB;而把 patch 移植到旧驱动是死路──上游 fork 最新只到 570, 套到 595 有六个 hunk 失败、全都在建立 peer PTE 的那段程式码,手工补会静 默地写错实体位址,比不能用还糟。 【-ts 有效,但 3080 的 12 GB 是个死结】 这台专用机中途曾把一张 3060 换成 3080,於是有了一组乾净的异质卡环境可以验 证 -ts(手动指定各卡分配比例)到底有没有用──两张卡都是 Gen3 x16 直连、没 有 PCH 污染。单卡的 tg128 是 3080 89.5、3060 42.1,所以理论最佳比例是 0.68/0.32。 ▲ 异质卡 -ts 比例扫描(3080 + 3060) https://i.urusai.cc/7v4B7.png
从均分调到正确比例是 +38%,而且是单调上升直到理论最佳点才 OOM──如果不设 -ts,快卡会完全被慢卡拖住。 但把整个组合背对背比较之後,结论却很扫兴: ▲ 3080+3060 与 2x3060 的 decode 背对背比较 https://i.urusai.cc/JJk8a.png
-ts 调校与 MTP 只能二选一,而 MTP 比较划算。要让 3080 真正出力就得给它 68% 的层数,也就是 10.8 GB,再加上 MTP 的 context(458 MB)与 compute buffer 就爆掉 12 GB──ctx 试到 32k、16k、8k 全部 OOM,连 8192 都不行。核心问题是 3080 快 2.13 倍但 VRAM 跟 3060 一样是 12 GB,速度配不上容量,要换 24 GB 的 卡才解得开。 换句话说,换上一张更快的卡并没有换到更快的推论。这台机器最後的选择是回头走 同型号路线──与其凑一张快卡加一张慢卡,不如多放几张一样的卡,让分配变简单、 也让每张卡的负担平均。 【四卡一次到位】 四张 3060 到位之後,尝试一次拿到「Q8 精度加 128K context 加多模态加 MTP」 全开。脚本用四卡 -sm tensor(同型号同速所以不需要 -ts,正好省掉上一节那个 两难)、ctx 131072、Q8 KV、Flash Attention 打开、MTP 开启,并为视觉任务加 上 --image-min-tokens 1024。 结果是一次就成功、零 OOM:VRAM 用掉 39,900 / 49,152 MiB(81%),每张卡还剩 1.5 到 2.6 GB,载入 56 秒。短文字生成 39.3 tok/s;8.6K prompt 的 prefill 是 836 tok/s、生成 48.2 tok/s;图片 prefill 436 tok/s。最有说服力的是深层 验证:52,551 token 的 prompt 以 760 tok/s 处理完,而埋在最开头的密语被一字 不差地复述出来──这证明它不只是「能载入」,而是真的记得住。 那麽加卡到底买到了什麽? ▲ 2x3060 vs 4x3060:加卡的边际效益 https://i.urusai.cc/Xwtle.png
扩展是次线性的,效率大约 0.33,因为 4-way all-reduce 的通讯成本吃掉了大半 算力红利。但加卡的真正价值不是速度而是容量──四卡跑 Q8(836 / 48.2)全面 胜过双卡跑 Q4(664 / 45.7),等於精度翻倍、context 翻倍、图片快十倍,而速 度不减。 其中「图片快十倍」值得单独说明:四卡最大的好处是 mmproj 可以放上 GPU。双卡 时 VRAM 不够,必须让视觉编码器跑在 CPU 上,图片 prefill 只有 46 tok/s;四 卡放上 GPU 之後(GPU0 多吃 1.1 GB)跳到 436 tok/s。 补充有人提问的Qwen3.6 35B A3B Q4的测试 https://i.urusai.cc/9r7pc.png
--



※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 218.161.18.24 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/PC_Shopping/M.1786274152.A.A50.html
1F:推 d030b: 感谢分享 36.226.229.109 08/09 19:26
2F:推 saito2190: 先推,拉220V的都是狠人 XD 114.24.163.152 08/09 19:29
3F:推 YCL13: 推经验分享,一般而言这些实测多不会分享 1.161.149.226 08/09 19:39
4F:推 ms0317929: 推经验分享 122.118.26.176 08/09 20:02
5F:推 EYESOFDARKKE: 推经验分享,这些细节很难看到。 114.27.87.184 08/09 20:06
6F:推 weiber82: 可以写论文了XD 118.231.193.86 08/09 20:07
7F:推 DSI: 推! 124.218.173.68 08/09 20:19
8F:推 xzero0911: 超猛 玩LLM我最後还是觉得订阅线上便宜 114.34.51.252 08/09 20:27
9F:→ xzero0911: 的用就好… 114.34.51.252 08/09 20:27
10F:推 CGary: 推一下细节分享 我最近也动脑筋到 223.137.159.84 08/09 20:47
11F:→ CGary: 这种事 学习了 223.137.159.84 08/09 20:47
12F:推 yenchieh1102: 超猛,相比看不下去的好像分享了什 1.161.64.81 08/09 21:00
13F:→ yenchieh1102: 麽又好像什麽都没分享 1.161.64.81 08/09 21:00
14F:推 powergreen: 推118.168.217.117 08/09 21:01
15F:推 nanobiofilm: 推 1.162.165.22 08/09 21:13
16F:推 zorro1111: 推 114.25.205.204 08/09 21:41
17F:推 kawa0710: 超猛,根本小论文 123.241.243.11 08/09 21:43
18F:推 kcwu1234: 好奇问这种可以做影片吗?MJ VS Dio之类 125.229.194.59 08/09 22:07
跑影片模型的话不会多快,影片模型偏重计算而3060单卡算力太弱了 影片的话我是另一台4080+3080 12G去跑的
19F:推 Transposon: PTT电虾所口试论文 61.227.11.134 08/09 22:37
20F:→ narukaza: 如果RAM是ECC的,可以考虑升级EPYC,7 114.34.174.204 08/09 22:37
21F:→ narukaza: 卡不是梦(? 114.34.174.204 08/09 22:37
22F:→ narukaza: 而且基本功耗可以少个100瓦以上... 114.34.174.204 08/09 22:37
是有考虑过EPYC,但主机板二手价都不便宜。 理想上PCIe 4.0x8 x8卡+128GB 8通道DDR4,做部分CPU Offload可以跑更大的模型 不过记忆体目前也还在涨....
23F:推 ms0608432: 最近也在研究,感谢分享 114.24.33.6 08/09 22:56
24F:推 saiboos: 推 电虾论文 118.231.177.8 08/09 22:58
25F:推 GenShoku: 我现在很认真在考虑要不要搞个两张4090D 123.192.94.227 08/09 23:21
26F:→ GenShoku: 48G来塞我的全精度qwen3.8 27b... 123.192.94.227 08/09 23:21
也有想过玩魔改卡但有点担忧耐用度,反覆加热及没原厂焊接品管,且单卡也不便宜
27F:→ felixr0123: 好猛喔 可以跑什麽模型 是不是影片什 42.73.211.72 08/09 23:32
28F:→ felixr0123: 麽都一下就算出来了 42.73.211.72 08/09 23:32
29F:推 seemoon2000: 其实我也是玩了一堆方案 我自己心得 45.144.227.89 08/09 23:40
30F:→ seemoon2000: 就是 直接买DGX就好.... 45.144.227.89 08/09 23:41
31F:推 sdbb: 谢谢原po和seemoon2000 112.104.65.143 08/09 23:53
32F:推 shinjikawuru: 结论 能一张大卡 就一张大卡 省事XD 1.172.79.206 08/10 00:05
会搞这个的其中一个原因就是买不起大卡&DGX&大容量Strix Halo...
33F:推 d0178411: PTT到底还是学术论坛 223.143.242.96 08/10 00:26
34F:推 wellzx: 推分享 1.160.129.61 08/10 00:31
35F:推 v86861062: 推推 220.134.60.79 08/10 00:47
36F:推 Link1218: 推经验分享118.231.192.130 08/10 00:52
37F:推 ian31722: 推分享 114.24.198.159 08/10 01:01
38F:→ Obama19: 搞一堆 结果还是叫Opus写程式 笑死 114.37.209.17 08/10 01:18
39F:推 felaray: 推个 够细节 118.168.212.28 08/10 02:11
40F:推 Supasizeit: 推一下 可是这麽搞刚跟MacBook Pro203.204.195.174 08/10 04:22
41F:→ Supasizeit: 跑起来效能差不多@@203.204.195.174 08/10 04:22
42F:推 bhmagic: 你是那里找到这麽多3060 16GB的 XDD 99.118.209.229 08/10 04:53
43F:→ bhmagic: 眼花 看错了 没事没事 99.118.209.229 08/10 04:54
44F:推 samsonfu: 推 111.81.33.102 08/10 05:30
45F:推 aries5420: 推一个 122.117.59.50 08/10 06:33
46F:推 cannedtuna: 可以推出水冷+热水器的机壳了 1.168.221.188 08/10 06:42
47F:→ cannedtuna: 24小时运转的1000w家用伺服器 1.168.221.188 08/10 06:42
48F:→ cannedtuna: 拿来烧热水刚好 1.168.221.188 08/10 06:42
49F:推 cannedtuna: 伺服器过热就自动提醒去洗澡消耗热水 1.168.221.188 08/10 06:49
50F:推 lordmi: x99配30系显卡效能跟价格刚好,但是要用 36.229.110.69 08/10 07:29
51F:→ lordmi: 更现代的卡,天花板就会被卡住了 36.229.110.69 08/10 07:29
也是觉得3060这等级卡的卡最适合
52F:推 kf0916: 推心得分享 223.143.240.28 08/10 07:35
53F:推 baby850811: 专业推 42.75.69.163 08/10 07:58
※ 编辑: laeva75 (218.161.18.24 台湾), 08/10/2026 08:20:31
54F:推 avans: 实用(?)推223.137.118.240 08/10 08:15
※ 编辑: laeva75 (218.161.18.24 台湾), 08/10/2026 08:29:58
55F:推 paul5566: 推喇 61.227.33.112 08/10 08:47
56F:推 marklai: 推 3060真是长青卡,我也有一张还在用 125.231.21.65 08/10 09:01
57F:→ vsbrm: 没有一定硬体跟软体知识还真的搞不起来,还 223.138.26.101 08/10 09:09
58F:→ vsbrm: 好是出现在电虾版,如果出现在硬体版就.... 223.138.26.101 08/10 09:09
59F:推 chuckysky: ptt果然是学术论坛 223.140.36.36 08/10 09:23
60F:→ gbcg9725: 涨价前395不贵 五万多 110.28.121.96 08/10 09:26
61F:→ gbcg9725: 多卡生图生影片没什麽帮助 110.28.121.96 08/10 09:27
62F:推 d82465213: 推 39.10.61.168 08/10 09:29
63F:推 foolishness: 感谢分享 118.231.148.13 08/10 09:46
64F:推 stinkyshit77: 优文推 42.72.145.181 08/10 10:14
65F:推 fredking1: 专业推 223.140.86.149 08/10 10:41
66F:推 lolicat: 好猛 纯推 49.215.241.49 08/10 10:46
67F:推 marklai: 多卡跑comfyUI,我觉得还是蛮可以的,我 125.231.21.65 08/10 11:05
68F:→ marklai: 有一台三张N卡一起跑,有的跑语言模型, 125.231.21.65 08/10 11:05
69F:→ marklai: 有的跑图有的跑影片,常常很忙,记忆体 125.231.21.65 08/10 11:05
70F:→ marklai: 大一点的像3090 ,有时候又要跑llm 又要 125.231.21.65 08/10 11:05
71F:→ marklai: 跑图,忙得不亦乐乎 125.231.21.65 08/10 11:05
72F:→ marklai: 另外一台5070ti+intel b70,现在正在分 125.231.21.65 08/10 11:11
73F:→ marklai: 别跑comfyui,b70要分别跑llm,zit还有影 125.231.21.65 08/10 11:11
74F:→ marklai: 片minimax,常常在loading 又unloading 125.231.21.65 08/10 11:11
75F:→ marklai: 很忙 125.231.21.65 08/10 11:11
76F:推 fay001: 根本神 49.215.57.104 08/10 11:17
77F:→ e2167471: 以前矿机是会被嘘爆的,现在AI机倒是大 60.250.144.174 08/10 11:19
78F:→ e2167471: 大方方,有人分析过两者的差异吗?在我 60.250.144.174 08/10 11:20
79F:→ e2167471: 看来其实意思差不多 60.250.144.174 08/10 11:20
80F:推 kitkat1051: 一个有实际产出 相关研究可以推进技 116.59.165.91 08/10 11:32
81F:→ kitkat1051: 术迭代 一个没有 116.59.165.91 08/10 11:32
82F:推 inte629l: 推实验 超酷 118.167.71.136 08/10 11:48
83F:→ ganei: 拿矿机比是来乱的吧?XX比鸡腿 42.79.188.105 08/10 11:52
84F:→ gbcg9725: 共通点应该只有显卡大幅涨价 110.28.121.96 08/10 11:59
85F:推 seemoon2000: 矿潮还有其他周边矿渣可以捡 LLM这 89.117.42.38 08/10 12:06
86F:→ seemoon2000: 波是买家变成渣 89.117.42.38 08/10 12:06
87F:推 years7944: 超用心整理的 感谢分享223.140.134.197 08/10 12:09
88F:推 xiaotee: 推223.139.106.251 08/10 12:17
89F:推 liknacamgal: 推 36.238.251.104 08/10 12:33
90F:推 BisWang: 推经验分享,本地AI要嘛烧钱要嘛就要有创 223.137.87.253 08/10 12:36
91F:→ BisWang: 意 223.137.87.253 08/10 12:36
92F:推 BisWang: 喔对了,建议把SATA转pcie供电换掉,那个 223.137.87.253 08/10 12:40
93F:→ BisWang: 东西超容易烧,大4pin转pcie还好一点 223.137.87.253 08/10 12:40
94F:推 Supasizeit: 他自己做的线没差吧 转接头都一样有203.204.195.174 08/10 13:09
95F:→ Supasizeit: 风险203.204.195.174 08/10 13:09
96F:推 PolarClover: 如果跑llm+长期运作,弄个两张r9700 111.71.78.153 08/10 13:19
97F:→ PolarClover: 32gb应该比较省事,至少有两条x8 sl 111.71.78.153 08/10 13:19
98F:→ PolarClover: ot的主机板就能用,目前相容性再差也 111.71.78.153 08/10 13:19
99F:→ PolarClover: 比Imtel B70要好的多 111.71.78.153 08/10 13:19
100F:推 widec: COOL 1.165.2.132 08/10 13:21
101F:推 mookio: 不要瞧不起intel b70 32g, 目前想 27.247.89.208 08/10 13:21
102F:→ mookio: 买还买不到,成熟的速度很快 27.247.89.208 08/10 13:21
103F:推 mookio: https://i.ibb.co/ZRjHgkPw/1.jpg 27.247.89.208 08/10 13:24
104F:→ mookio: 五卡ai推理机 + 5卡comfyui 任意出 27.247.89.208 08/10 13:24
105F:→ mookio: 图 27.247.89.208 08/10 13:24
106F:推 twisukuku: 推专业 猛 49.216.130.154 08/10 13:26
107F:→ e2167471: 矿机是赚个人钱,本地AI机说穿了也是啊 60.250.144.174 08/10 13:39
108F:→ e2167471: 有哪一台AI机是为了公共利益?但抢卡抢 60.250.144.174 08/10 13:39
109F:→ e2167471: 零组件毫无疑问是共通的,乡民的态度却 60.250.144.174 08/10 13:40
110F:→ e2167471: 大不相同,说真的矿潮也一堆乡民在偷挖 60.250.144.174 08/10 13:40
111F:→ e2167471: 只是不敢拿到板上讲而已 60.250.144.174 08/10 13:40
112F:推 wei115: 太贵惹,我现在找GPU租赁,5090一小时3块 111.82.148.124 08/10 13:53
113F:→ wei115: 人民币,但搞NSFW要规划加密,LLM则是lla 111.82.148.124 08/10 13:53
114F:→ wei115: ma cpp都在记忆体中处理,线路也是ssh隧 111.82.148.124 08/10 13:53
115F:→ wei115: 道,搞什麽审查工都很大,不划算,所以就 111.82.148.124 08/10 13:53
116F:→ wei115: 没管 111.82.148.124 08/10 13:53
117F:推 GenShoku: 矿机是纯粹赚投机钱,本地AI机是偏向个 114.137.64.54 08/10 13:56
118F:→ GenShoku: 人使用优化工作流,甚至有些人认为这就 114.137.64.54 08/10 13:56
119F:→ GenShoku: 是在「玩」,那这样跟买显卡玩游戏不就 114.137.64.54 08/10 13:56
120F:→ GenShoku: 是同样道理? 本地AI那个算力速度是要怎 114.137.64.54 08/10 13:56
121F:→ GenShoku: 麽多并发当伺服器赚钱啦,根本完全不同 114.137.64.54 08/10 13:56
122F:→ GenShoku: 的事情好吗 114.137.64.54 08/10 13:56
123F:→ gbcg9725: 这波涨价主因又不是个人导致 110.28.121.96 08/10 13:58
124F:→ RaiGend0519: 推心得 111.82.182.93 08/10 14:11
125F:推 RaiGend0519: 本地AI着重处理个人本地资料 111.82.182.93 08/10 14:13
126F:→ RaiGend0519: 跟云端AI的用途不同 111.82.182.93 08/10 14:13
127F:推 yymeow: 推这篇,超专业的 60.250.130.216 08/10 14:20
128F:推 catboost: 太猛了 114.136.143.54 08/10 14:23
129F:推 shiauber: 这local端 超赞的 真的优秀 114.137.61.193 08/10 15:03
130F:推 hangtenboy: 只能跪了… 101.10.158.181 08/10 15:07
131F:推 kuroshizu21: 这文一定要推的, 感谢分享啊!! 61.227.28.176 08/10 15:14
132F:→ ganei: 你的工作是当矿工吗?拿AI的生产力跟挖矿比 42.79.188.105 08/10 15:17
133F:→ ganei: ,叫那些挖矿软体写几段程式来看看 42.79.188.105 08/10 15:17
134F:推 necrophagist: Local ai需要展现更大的需求 厂商 111.81.62.27 08/10 16:06
135F:→ necrophagist: 才会 care 出更多产品 111.81.62.27 08/10 16:06
136F:推 BisWang: 回94楼,sata就是容易烧在接头,针脚太密 223.137.87.253 08/10 16:17
137F:→ BisWang: 自己做用好线也没啥用,有点像现在灾难的 223.137.87.253 08/10 16:18
138F:→ BisWang: 12VHPWR 223.137.87.253 08/10 16:18
139F:→ Nafusica: 有转接都会烧 不过问题在12V倒灌 220.141.208.55 08/10 16:35
140F:→ Nafusica: 其实跟线材关系不大 PCB Trace都会烧了 220.141.208.55 08/10 16:35
141F:→ Nafusica: 但目前没有电源厂有意识到12V倒灌的问题 220.141.208.55 08/10 16:36
142F:→ Nafusica: solution也是没防 土炮多卡只能多烧香 220.141.208.55 08/10 16:36
143F:推 kcwu1234: 组一台做影片的,投稿红果XD 223.137.92.245 08/10 16:44
144F:推 lordmi: 在正经用ComfyUI的话这配备是很可以但不是 36.229.110.69 08/10 17:45
145F:→ lordmi: 很推,流水线用5090两张能最快交件。再上 36.229.110.69 08/10 17:46
146F:→ lordmi: 去没那麽划算,说到底就是X99之後就没类似 36.229.110.69 08/10 17:48
147F:→ lordmi: 切性能切太大块的方案了... 36.229.110.69 08/10 17:48
148F:推 kunyi: 强 推一个 59.124.80.190 08/10 19:30
149F:推 proton63: 推 111.255.11.88 08/10 20:13
150F:推 maxim755: 现在好像都没有x99 x299这种平台出来了 118.168.128.97 08/10 20:15
151F:→ maxim755: 吗 118.168.128.97 08/10 20:15
152F:推 w1222067: 猛,但我不是客群xd 61.224.25.82 08/10 20:23
153F:推 Xray2002: 推,强者 220.141.234.18 08/10 21:08
154F:推 ck203l5: 感谢分享那麽多宝贵的设定细节,X99万岁 12.170.106.26 08/10 23:12
155F:推 ck203l5: 最宝贵的是多卡TP在不同PCIE下速度比较 12.170.106.26 08/10 23:16
156F:→ ck203l5: 看来最大重点就是卡不能挂在PCH的PCIE上 12.170.106.26 08/10 23:16
157F:推 tyr2004: 推223.139.227.227 08/10 23:18
158F:推 Ruhaha: 虽然看不懂 不过给个推 180.218.86.85 08/11 00:33
159F:推 Litfal: 跪的脚好麻 1.34.131.99 08/11 01:40
160F:推 p41413: 优质文 推推 152.117.171.93 08/11 07:47
161F:推 z1357961: 推优质论文(? 165.91.13.58 08/12 02:19
※ 编辑: laeva75 (218.161.18.24 台湾), 08/12/2026 07:06:19
162F:推 winiel559: 高手 114.24.155.251 08/12 09:13
163F:推 demintree: p2p要在同一个PCIe Switch 之後才能发 73.252.153.154 08/13 16:01
164F:→ demintree: 挥最大效率,GPU 之间的DMA不需要经过r 73.252.153.154 08/13 16:01
165F:→ demintree: oot complex 73.252.153.154 08/13 16:01
166F:→ demintree: PCIe有error,大部分就是重送一次封包, 73.252.153.154 08/13 16:06
167F:→ demintree: 所以error多会明显影响速度 73.252.153.154 08/13 16:06
168F:推 likeyousmile: 推 223.143.246.29 08/21 11:09







like.gif 您可能会有兴趣的文章
icon.png[问题/行为] 猫晚上进房间会不会有憋尿问题
icon.pngRe: [闲聊] 选了错误的女孩成为魔法少女 XDDDDDDDDDD
icon.png[正妹] 瑞典 一张
icon.png[心得] EMS高领长版毛衣.墨小楼MC1002
icon.png[分享] 丹龙隔热纸GE55+33+22
icon.png[问题] 清洗洗衣机
icon.png[寻物] 窗台下的空间
icon.png[闲聊] 双极の女神1 木魔爵
icon.png[售车] 新竹 1997 march 1297cc 白色 四门
icon.png[讨论] 能从照片感受到摄影者心情吗
icon.png[狂贺] 贺贺贺贺 贺!岛村卯月!总选举NO.1
icon.png[难过] 羡慕白皮肤的女生
icon.png阅读文章
icon.png[黑特]
icon.png[问题] SBK S1安装於安全帽位置
icon.png[分享] 旧woo100绝版开箱!!
icon.pngRe: [无言] 关於小包卫生纸
icon.png[开箱] E5-2683V3 RX480Strix 快睿C1 简单测试
icon.png[心得] 苍の海贼龙 地狱 执行者16PT
icon.png[售车] 1999年Virage iO 1.8EXi
icon.png[心得] 挑战33 LV10 狮子座pt solo
icon.png[闲聊] 手把手教你不被桶之新手主购教学
icon.png[分享] Civic Type R 量产版官方照无预警流出
icon.png[售车] Golf 4 2.0 银色 自排
icon.png[出售] Graco提篮汽座(有底座)2000元诚可议
icon.png[问题] 请问补牙材质掉了还能再补吗?(台中半年内
icon.png[问题] 44th 单曲 生写竟然都给重复的啊啊!
icon.png[心得] 华南红卡/icash 核卡
icon.png[问题] 拔牙矫正这样正常吗
icon.png[赠送] 老莫高业 初业 102年版
icon.png[情报] 三大行动支付 本季掀战火
icon.png[宝宝] 博客来Amos水蜡笔5/1特价五折
icon.pngRe: [心得] 新鲜人一些面试分享
icon.png[心得] 苍の海贼龙 地狱 麒麟25PT
icon.pngRe: [闲聊] (君の名は。雷慎入) 君名二创漫画翻译
icon.pngRe: [闲聊] OGN中场影片:失踪人口局 (英文字幕)
icon.png[问题] 台湾大哥大4G讯号差
icon.png[出售] [全国]全新千寻侘草LED灯, 水草

请输入看板名称,例如:Boy-Girl站内搜寻

TOP