作者a34021501 (CARD)
看板VideoCard
标题Re: [闲聊]rx480性能功耗比
时间Wed Mar 22 18:24:17 2017
各位好,我的经验上的看法提供给大家分享一下
就是我在 AMD 的驱动里面找到 ATI 的安装程式
所以我可以在 AMD 的 Chipset 16.12.2 的 Bin
64资料夹里面找到了 ATISetup.exe 执行了之後
会很快速地跳出一连串的讯息让我来不及看内容
不过那不重要,重要的是我的画面已经出现了CF
的花纹,但是是我只有装了一张卡 AMD R9 280X
样的情况下我觉得我的 NB 里面有其他显卡作用
或是说更厉害的是 AMD R9 280X 里面有被切割
这样的话就像以前烧掉的显卡 HD5830 如同5870
我的意思是那时候新闻说 HD5870 雷射切成5830
不管 5830 还是 5870 它的尺寸在数据上一样大
这样我们就可以用这些数据来评估RX470与RX480
我把它连在一起根本就是说他们数据好像一样大
这边的大小是指DIE SIZE与PROCESS SIZE即制程
那我们来算算看好了,评估里面有多少个处理器
假设每个处理器所需要的外观尺寸差不多是个LL
LL即L*L的长度,但越新的制程会让长度变短#nm
先拿280X的效能来当参考好了,毕竟7970是卡王
我的意思是我有7970也有280X但是不同DIE SIZE
好像不太一样但是拆开来看之後其实差不多大喔
总之也有可能是GPUZ或其他网站写错了我不清楚
先来算算以28nm制程的7970系列有多少个LL单位
(352mm^2=352*1000*1000nm^2)/(28nm*28nm)=448979.591837 (这是Google计算机的数据)
好了,在来算算看R9280X的数据为多少给大家看
我发现GPUZ更新到正确的大小,不过可能是驱动
所以我还是以448979为这两张卡的判断标准好了
再来算算以14nm制程的RX48系列有多少个LL单位
(232mm^2=232*1000*1000nm^2)/(14nm*14nm)=1183673.46939 (这是Google计算机的数据)
好了那我们来看一下RX47系列的核心数目2048个
好了那我们来看一下280X系列的核心树目2048个
因此可以看出相同核心数目但RX47新制程面积大 (Google计算机相除约2.63636363636倍)
如果是我来设计显示卡,我一定会选用旧指令集
毕竟280X的整体运算效能已达4096Gflops运算量
如此同频新显卡4096Gflops*2.63~=10798Gflops
这样大家可以看出1120Mhz的RX480比1Ghz的280X
还可以再多出10798*1.12=12094Gflops的效能吧
不过这是还未考虑到GDDR通道数的情况的评估值
不知道各位大大觉得我这样算有没有评估错误呢
在CPU有一种技术叫做C state可以关闭核心节能
不知道要如何关闭这些节能来提取提供全部效能
如此一来我才有办法计算3D领域的相关研究成果
http://i.imgur.com/9ZhvA53.png 共用记忆体
以前共用记忆体的技术只有在 Intel内建显示卡
※ 引述《dreamjade (瑜儿)》之铭言:
: 标题: [闲聊]rx480性能功耗比
: 时间: Mon Mar 20 23:11:50 2017
:
: 在rx480未上市前,就有各种传闻说amd临时提升频率,於是鲁妹就试着降频使用
: 显卡型号: rx480 nitro+ 4GB
: 功耗以蓝宝程式读值作为参考依据(也许不太精确,但看趋势应该没有太大疑虑)
: 预设频率:1306 ->1105
: 预设电压:1.14 -> 1.00
: 满载功耗(从平均~160W掉到~80W)
: 降50%(跑3d mark 11)
: 效能大约只小降5%
: 真的差的有点多呢~
:
:
: --
:
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 140.112.246.36
: ※ 文章网址: https://webptt.com/cn.aspx?n=bbs/VideoCard/M.1490022712.A.5C7.html
: 推 a34021501: 我觉得还要算一下ASIC的面积甚至体积(如果有堆叠)评估! 03/20 23:25
: 推 novarossi: 原po跟一楼可以组个团体 03/21 00:17
: → nimaj: 电虾也有人用470试过了 甚至可以压到75W以下 03/21 01:10
: 推 a34021501: http://i.imgur.com/qkxfz56.jpg 我先说,GPU有很多部 03/21 01:57
: → a34021501: 份,我们需要更多人手! 03/21 01:57
: 推 super7407412: 原Po跟楼上一起组团吧 03/21 11:12
: 推 davidbright: 为何这样就要组团?@@ 03/21 11:53
: → GORDON2037: 1105会不会降太低? 03/21 18:34
: 推 ltyintw: 压在140w以内(留10w给peak用) 03/21 19:08
: → ltyintw: 就差不多了 03/21 19:08
: → waterblue85: 降功耗跟降压比较有关系,降频是多余的 03/21 19:26
: → a34021501: 怎麽可以留给peak用,这样peak pixel/texture rate 03/21 19:27
: → a34021501: 就会被保留起来让以後新版的驱动程式可以提高peak?? 03/21 19:28
: → a34021501: 毕竟pixel rate与texture rate好像是搬资料的速度! 03/21 19:30
: → a34021501: 所以我们先从搬资料开始讨论好了,我正在网路上查! 03/21 19:35
: → a34021501: 欢应资深的潜水乡民提供关於GDDR效率的经验及佐证! 03/21 19:36
: 推 s30zx2000: 我比较好奇萤幕上跑的是做什麽用的??? 03/22 00:21
: → FeRin: 我比较好奇a34121501的思想到底是怎样 03/22 15:48
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 1.164.252.34
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/VideoCard/M.1490178260.A.041.html
更正Bin为Bin64
※ 编辑: a34021501 (1.164.252.34), 03/22/2017 18:25:13
1F:嘘 a123453906: 这排版头痛 03/22 18:26
3F:→ lovinlover: 这中文我看不太懂 03/22 18:44
4F:嘘 disword: 拉基排版 03/22 18:46
5F:→ disword: 直接END 03/22 18:46
6F:嘘 Cubelia: 看到这ID先嘘就对了 03/22 18:55
7F:嘘 slsamg7112: 共三小 03/22 19:02
8F:嘘 powyo: 朝圣 先卡位 说不定你会成为一代显卡大师 03/22 19:20
9F:→ powyo: 天才总是孤独的 爱迪生小时候也被当成智障 03/22 19:20
10F:嘘 novarossi: 你的电脑被追杀你的外星人入侵了 快拿去丢 03/22 19:35
11F:→ wind0083: 连看两次都忍不住END 03/22 19:45
12F:嘘 henrry2220: ... 03/22 19:47
14F:嘘 weihung0520: 别吸毒了 03/22 20:14
15F:嘘 Rivendil: 厂厂 03/22 20:34
16F:→ a34021501: 我直说好了,其实我也不懂,只是看到很多东西没装好! 03/22 20:40
17F:→ a34021501: 例如AMD SPB SMBUS Controller的x64里面有档案很可疑! 03/22 20:41
18F:→ a34021501: 大家可以多看看里面的ReadMe,不然AMD真的很辛酸血尿! 03/22 20:51
19F:→ a34021501: 我觉得驱动根本早已写好了,只是某些.sys因规范不能放! 03/22 20:57
20F:嘘 novarossi: 你看不懂还能PO一篇 03/22 21:03
21F:嘘 ken841520: 不管他嗑了什麽,都给我来一点(゚∀゚) 03/22 21:11
23F:→ a34021501: 别再嘘我了喔,这方法就是可以把不存在的装置装进去! 03/22 21:21
24F:→ a34021501: 大家可以试着装进其他装置,只要没错误应该就是存在! 03/22 21:21
25F:→ a34021501: 可参考 amdpsp.inf 的内容,明确描述 ExcludeID 的用法 03/22 21:23
26F:嘘 ww578912tw: 你到底嗑了什麽一天到晚讲疯话 03/22 21:25
27F:嘘 novarossi: 偏要嘘 03/22 21:29
29F:嘘 novarossi: 早就看穿你的鬼扯少在那边 03/22 21:38
30F:嘘 Bob9154: ID正确 03/22 21:40
请大家帮我思考一下系统参数PATH要怎麽设置才能让驱动抓取正确的DLL档 > echo %PATH%
以下是依档案时间排序的PATH清单,请大家帮忙测试如何调整最洽当或有其他资料夹可加!
C:\Program Files\AMD\CIM\Bin64;C:\Program Files
(x86)\AMD\CNext\CCCSlim;C:\Program Files\AMD\CNext\CNext;C:\Program Files
(x86)\AMD APP SDK\3.0\bin\x86_64;C:\Program Files (x86)\AMD APP
SDK\3.0\bin\x86;%SystemRoot%\system32;%SystemRoot%;%SystemRoot%\System32\Wbem;%SYSTEMROOT%\System32\WindowsPowerShell\v1.0\;
谢谢大家,剩下的就交给你们了!
※ 编辑: a34021501 (1.164.252.34), 03/22/2017 21:55:57
31F:嘘 Cubelia: 能被退文这麽多次我也是醉惹 03/22 21:59
32F:嘘 GORDON2037: 这是在讲三小 03/22 22:00
33F:嘘 alexgame01: 你到底怎麽办到的 03/22 22:00
34F:嘘 novarossi: 跟A片放一起不会喔 03/22 22:07
35F:嘘 yuetsu: 不嘘对不起自己 03/22 22:17
36F:嘘 charlie20083: 乱版成这样都没事 这版规真的没问题吗? 03/22 22:20
37F:嘘 ddrdod: 《登入次数》3421 次《有效文章》318 篇 (退:5) 03/22 22:22
38F:嘘 damnedfish: 挖这啥啊 03/22 22:36
39F:嘘 yichenglee: 去看医生 03/22 23:03
40F:嘘 FeRin: 你到底是在洗文章洗P币还是洗退文? 03/22 23:09
41F:嘘 FeRin: 不过说实在的,我不太希望他被水桶欸,毕竟电虾都死了…能 03/22 23:24
42F:→ FeRin: 炮的只剩a34了 03/22 23:24
43F:嘘 novarossi: 我也不希望 玩PTT这麽久就他最厉害 03/22 23:58
45F:→ a34021501: 可以在 检视 > 装置(依连线) 切到这个 View!! 03/23 00:51
46F:嘘 a5150219: 我竟然看完了… 03/23 01:00
为确保AMD显示卡驱动程式的DLL档会优先读取,我的PATH最前面加了这行路径!
C:\AMD\WHQL-Win10-64Bit-Radeon-Software-Crimson-ReLive-17.2.1-Feb28\Packages\Drivers\Display\WT6A_INF\B311170;
因为有时候系统.DLL会被改(更新或後门),如此AMD驱动的DLL档最为优先读取!
当然在驱动中Bin64里面执行ATISetup.exe -Install -output screen 安装後!
会将AMD CIM装入 C:\Program Files\AMD\CIM\Bin64 我觉得适合放在更前面~!
因为在17.2.1版本中,CIM的编译时间是2/28,DisplayDriver与CCCSlim编译时间是2/10
还有就是 Bin64\translations 里面放的档案的编译时间是3/1 或许值得放在更前面!
至於测试效能,就和我之前用280X与16.12.2测试GTA5的4K@60一样可以顺畅跑高画质!
※ 编辑: a34021501 (1.164.252.34), 03/23/2017 01:52:35
48F:→ a34021501: 我忘了加 -txaa 参数画质很差,在此向各位的眼睛致歉! 03/23 02:02
来谈谈记忆体好了,关於记忆体Benchmark的软体我觉得都已经不够看了,毕竟都莫名的慢
C:\Users\Card\AMD APP SDK\3.0\samples\opencl\bin\x86_64>ConstantBandwidth.exe
--device cpu
Platform 0 : Advanced Micro Devices, Inc.
Platform found : Advanced Micro Devices, Inc.
Selected Platform Vendor : Advanced Micro Devices, Inc.
Device 0 : AMD FX-8320E Eight-Core Processor Device ID is
00000040305C1EF0
Build Options are : -D DATATYPE=float4 -D DATATYPE2=float4 -D SIZE=5120 -D
IDXTYPE=ulong
AccessType : single(static index)
VectorElements : 4
Bandwidth : 98.2572 GB/s
AccessType : single(dynamic index)
VectorElements : 4
Bandwidth : 99.157 GB/s
AccessType : linear
VectorElements : 4
Bandwidth : 118.709 GB/s
AccessType : random
VectorElements : 4
Bandwidth : 14.2031 GB/s
C:\Users\Card\AMD APP SDK\3.0\samples\opencl\bin\x86_64>ConstantBandwidth.exe
--device gpu
Platform 0 : Advanced Micro Devices, Inc.
Platform found : Advanced Micro Devices, Inc.
Selected Platform Vendor : Advanced Micro Devices, Inc.
Device 0 : Tahiti Device ID is 0000006DBDFA91A0
Build Options are : -D DATATYPE=float4 -D DATATYPE2=float4 -D SIZE=5120 -D
IDXTYPE=ulong
AccessType : single(static index)
VectorElements : 4
Bandwidth : 8212.22 GB/s
AccessType : single(dynamic index)
VectorElements : 4
Bandwidth : 8641.56 GB/s
AccessType : linear
VectorElements : 4
Bandwidth : 2213.72 GB/s
AccessType : random
VectorElements : 4
Bandwidth : 1075.47 GB/s
以上是 CPU 读取 DDR3 与 GPU 读取 GDDR5 的数据,透过 OpenCL 可以了解普通程式很慢
所以不管怎样这些装置彼此沟通的 PCI-E 通道的频宽就会影响电脑的效能所以不能被降速
※ 编辑: a34021501 (1.164.252.34), 03/23/2017 06:32:56
49F:嘘 moonlca: 不懂电脑可以去上点课吗 你当电资只有google? 03/23 07:23
50F:嘘 jslee: 《有效文章》318 篇 (退:5) 03/23 12:14
51F:嘘 sk10037643: 你到底再写三小 03/23 14:03
52F:嘘 pcfox: 板主好像都自动无视这个ID的文章 03/23 15:43
53F:嘘 FeRin: OC版倒是只剩下一次机会了QQ 03/23 15:50
54F:嘘 humbug0453: 这个我还是看不懂 03/23 16:33
55F:嘘 FeRin: 他的文就当娱乐用吧,至少可以嘘到爽 03/23 17:16
56F:嘘 leehome12345: 这个版是不桶人的吗? 03/23 17:39
57F:嘘 powyo: 应该没违反版规吧 03/23 18:01
58F:嘘 novarossi: 路过再嘘 03/23 19:04
59F:推 duece0927: 你需要医生吗 03/24 01:38
60F:嘘 pcfox: 原来可以无限唬烂不用被桶,隔壁版的业代还真可怜 03/24 02:09
我没有无限唬烂,我的PCI-E仍然被限制在PCI-Express Gen2即8GB/s左右只是有超过一点
C:\Users\Card\AMD APP SDK\3.0\samples\opencl\bin\x86_64>ImageBandwidth.exe
Platform found : Advanced Micro Devices, Inc.
Device 0: Tahiti
Build: _WINxx release
Pixel format: CL_RGBA / CL_UNSIGNED_INT32
Image width: 1024
Image height: 1024
Image origin: 0 0
Image region: 1024 1024
Image size in bytes: 16777216
Region size in bytes: 16777216
Global work items X: 1024
Global work items Y: 8
Total work items: 8192
Pixels per thread: 128
Local work items X: 16
Local work items Y: 8
Number of groups: 64
Timing loops: 10
Repeats: 1
Kernel loops: 100
Kernel launches: 1
inputImage: CL_MEM_READ_ONLY
outputImage: CL_MEM_WRITE_ONLY
Host baseline (single thread, naive):
Timer resolution 793 ns
Page fault 1018 ns
Barrier speed 127 ns
CPU read 4.40 GB/s
memcpy() 5.89 GB/s
memset(,1,) 9.77 GB/s
memset(,0,) 9.39 GB/s
AVERAGES (over loops 2 - 9, use -l for complete log)
--------
1. Host mapped write to inputImage
clEnqueueMapImage(WRITE): 0.002644 s [ 6.34 GB/s ]
memset(): 0.002569 s 6.53 GB/s
clEnqueueUnmapMemObject(): 0.002999 s [ 5.60 GB/s ]
2. GPU kernel read of inputImage
clEnqueueNDRangeKernel(): 0.008412 s 199.43 GB/s
verification ok
3. GPU kernel write to outputImage
clEnqueueNDRangeKernel(): 0.010325 s 162.49 GB/s
4. Host mapped read of outputImage
clEnqueueMapImage(READ): 0.002647 s [ 6.34 GB/s ]
CPU read: 0.001958 s 8.57 GB/s
verification ok
clEnqueueUnmapMemObject(): 0.000020 s [ 821.96 GB/s ]
Passed!
8.57GB/s就是我的CPU从我的GPU的DDR5读取记忆体的资讯的速度大概就是比PCI-E Gen3慢
由此可知推论我已经超过PCI-E Gen2的标准并且仍然只有Gen2多一丁点的传输速率而已喔
毕竟以往的理论速度几乎不会超过,我想知道这个传输速率要怎麽DDL才能发挥系统效能!
※ 编辑: a34021501 (1.164.252.34), 03/24/2017 15:49:30
61F:嘘 FeRin: 那你乾脆把GPU拿来做日常浮点运算,VRAM当系统记忆体,把C 03/24 16:59
62F:→ FeRin: PU拔掉算了 03/24 16:59
64F:嘘 FeRin: 然後呢?重点呢? 03/25 08:19