作者kimisawa (杨回血了。)
看板C_Chat
标题Re: [闲聊] RTX3060 12G复产两个月 涨比5050更贵且慢
时间Wed Aug 26 11:27:40 2026
: 推 kimisawa: AI那段不对,12G可以放比5050大的模型 08/26 10:16
: 这句话只对30%
: 当你模型大到8G塞不下,12G以下可以塞的情况是成立
: 但是超过12G的时候又反过来,
: 另外8G塞的下的轻模型也是5050快得多
: 而且3060不支援FP8 E4M3/E4M2还有INT 4,遇到这种量化模型会被5050按在地上擦..
: 推 GenShoku: 这张是买来多卡AI的,你用游戏性能来看肯定不值 08/26 10:23
: 推 sleep30hours: 有什麽模型是刚好8GB塞不下而12GB塞得下的吗? 08/26 10:44
: → sleep30hours: 这年头不就三个等级:8~9B以下,30B左右,数百B以上 08/26 10:44
: → sleep30hours: 以前还有不少12B~14B的量化後8GB很紧绷,但现在也只 08/26 10:45
: 推 laeva75: Gemma 12B 08/26 10:46
: → sleep30hours: 剩一个量化的Gemma4 12B仅此一家了。 08/26 10:46
: → laeva75: 单纯跑minimax h3扩容买DRAM比买3060划算简单.... 08/26 10:48
: → laeva75: VRAM大一点同一模型可以用更高精度的量化减少能力损失 08/26 10:50
: → gbcg9725: 9060xt 跑llm没压力,minimax所需时间大概是n卡6倍 08/26 10:55
: → gbcg9725: 所以我也看不懂在3060在贵什麽 08/26 10:56
: → gbcg9725: 实测llama-cpp用rocm版跟4070速度差不多 08/26 10:57
: → gbcg9725: 我是指9060xt 16g 08/26 10:58
: → tsunamimk2: 光12G vram就无敌了 08/26 11:14
: → tsunamimk2: 问题不只是权重本身 context长度差非常多 08/26 11:15
: → kimisawa: 3060贵因为被拿来AI多卡啊 08/26 11:15
: → tsunamimk2: 很多benchmark只看模型是不准的 08/26 11:15
: → tsunamimk2: 3060贵什麽喔 cuda啊 08/26 11:16
: → kimisawa: 你手上有一张24G N卡,插一张3060变成36G不香吗? 08/26 11:16
: → tsunamimk2: 还有可以装很多张 08/26 11:16
: → kimisawa: 或是一张16G的 再插一张3060变成30G 08/26 11:17
: → kimisawa: 50XX+3060虽然说频宽损失一些但便宜就可以增加大VRAM 08/26 11:18
https://www.youtube.com/watch?v=hqrBC4EgqbY
这边就有实测了 5060TI 16G 加插一张 3060 12G
https://i.imgur.com/ZoXzgvJ.png
用Gemma3 27B
5060TI 16G x 2 = 22 tok/s
5060TI 16G单卡 + CPU offload = 5 tok/s
5060TI+3060 可以跑到 17 tok/s,价格却低很多
国外很多都把3060拿来插多卡,所以这波才涨上去
用一张50系当主输出处理FP8 E4M3/E4M2/INT 4这些,然後offload到 3060去
你可以3060插四张弄个48G,也才1500镁
所以3060在国外才会被炒,因为太万用了
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 68.228.69.69 (美国)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/C_Chat/M.1787714863.A.6CA.html
1F:推 Yoimiya: 文艺复兴 08/26 11:30
2F:推 davidex: GDDR7可以和GDDR6混用呀 08/26 11:31
3F:推 jazon: 好神奇 因为AI伺服器太贵就把脑筋动到高VRAM旧显卡上 08/26 11:32
4F:推 ninnyshadow: 不是啊 源头问题不就是因为50系买不到只好回头去抢 08/26 11:38
5F:→ ninnyshadow: 3060 如果50系没缺谁没事想回头用30系啊 08/26 11:38
不知道怎麽回答你的问题,本来就是看当下不是吗?
你"现在"想玩大VRAM的N卡,你就是花大钱买5090 24G $5000镁
或是插多张的3060,那个比较划算?
电虾
#1gU65efG (PC_Shopping),都有人插五张了 60GVRAM 哪来的50系?
6F:推 laeva75: 影片中的是跑layer split,只是把模型切分到2个gpu接力 08/26 11:47
7F:→ laeva75: 运算。没有甚麽主卡计算副卡vram offload喔... 08/26 11:47
影片只是单纯示意可以这样插,我说的主卡副卡不是影片的内容,你有点误会了
8F:推 laeva75: 真要用另一张gpu做offload的话还不如直接用主记忆体就好 08/26 11:50
9F:→ laeva75: ,反正瓶颈同样是被pcie卡住,还可以少走一段路 08/26 11:50
看你在意的点是什麽,就像影片的内容,他觉得牺牲pcie但token提升还是很有感
10F:推 ninnyshadow: 就老黄实在是太邪恶了 我开始考虑改买新的MAC M5MAX 08/26 11:54
※ 编辑: kimisawa (68.228.69.69 美国), 08/26/2026 11:55:30
11F:推 laeva75: 牺牲的不是PCIe,而是5060Ti上面的那些较新的加速功能 08/26 11:58
12F:推 kausan: 不如直上70ti 08/26 12:09
13F:推 laeva75: 若模型大到16GB VRAM放不下的话,5070ti会比这种5060ti+ 08/26 12:15
14F:→ laeva75: 3060的组合慢非常多喔 08/26 12:15
15F:→ laeva75: 反之若模型与KV都在16GB内的话,单5070Ti碾压这种双卡组 08/26 12:16
16F:→ laeva75: 合 08/26 12:16
17F:→ tsunamimk2: 问题是主机板与电力..XD 08/26 16:01
18F:→ tsunamimk2: 还有分配管理记忆体需要driver 08/26 16:01
19F:→ tsunamimk2: 另外其实那个边际效益不高 看你要做什麽 08/26 16:02
20F:→ tsunamimk2: 自己架设的推论机还是训练机 训练机其实永远不够 08/26 16:03
21F:→ tsunamimk2: 推论机的话 这投资又不一定划算 包括算图算影片 08/26 16:03
22F:→ tsunamimk2: 目前实际的感觉是个人的显卡大概16GB~24GB VRAM 08/26 16:03
23F:→ tsunamimk2: 然後用来当本地的script/agent第一层/RAG平台 08/26 16:04
24F:→ tsunamimk2: context 能撑到32K还有一定速度就好了 08/26 16:04
25F:→ tsunamimk2: kv cache/context/权重的比例其实是很微妙的 08/26 16:05
26F:推 tsunamimk2: 再往上加其实可以考虑排队买mac mini/mac studio了 08/26 16:08
27F:→ tsunamimk2: 事实上我预期一开始卖就会排到明年 08/26 16:08
28F:→ tsunamimk2: 那个电力/算力/系统稳定度比真的很高 08/26 16:08
29F:推 tsunamimk2: 另外认真做事大概无法避免每个月三千去买max pro 08/26 16:11
30F:→ tsunamimk2: 那是必要的 因为大型的效果实在差很多 08/26 16:12
31F:推 DonnyDon: 30系真的是最操劳的一代,挖完矿出来又被叫去跑AI 08/26 17:49