架构特点
AMD RX6600 XT基于AMD最新的RDNA2架构,使用的RDNA2架构中的第三款核心Navi23的完整版。
计算机图形中的光栅化是把一系列3D空间图元转换为2D图像的技术。对于多边形的光栅化,2D图像中的每个像素点中心会有一个采样点,如果有图元覆盖了该采样点,像素便会被设置为该图元的颜色。

AMD FSR是FidelityFX系列游戏特效中的最新成员,是一种面向游戏的超分辨率技术。提到超分辨率技术就不得不提一下Nvidia在两年前推出的DLSS技术,一种基于AI的超分辨率技术,可以将低分辨率游戏图像提升到高分辨率,从而节约显卡性能。DLSS一代推出之后因为苛刻的实现条件以及并不算出色的画质,并没有得到广大玩家的好评。之后Nvidia又推出了第二代,改善了一代中的诸多毛病,比如需要预训练,画面模糊,需要限定的游戏分辨率等等,在玩家中得到了较好的评价,但Nvidia的技术通常都是封闭的技术,所以AMD无法使用。当然作为开源急先锋的AMD肯定不会坐视不管,于是就有了FSR。
测试平台
| CPU | Intel Core i7 11700K | AMD Ryzen 7 5800X |
| 主板 | MSI MAG Z590 TOMAHAWK WIFI | ASUS PRO WS X570 ACE |
| 内存 | 皇家戟 3200 C16 OC 3866 | 皇家戟 3200 C16 OC 3800 |
| 显卡 | 迪兰 RX6700 XT 12G X 战神 | 迪兰 RX6700 XT 12G X 战神 |
| 声卡 | 创新 AE9 | 创新 AE9 |
| 散热器 | NZXT Z63 | FS140 |
测试统一使用CapFrameX作为测试软件,有自带Benchmark的游戏录制Benchmark过程,没有的游戏则录制一段游戏固定路线的游戏过程。分辨率统一使用2560*1440,有画质Preset的游戏使用可能的最高Preset,没有的手动设置小项为可能的最高设置。
注意:由于之前的测试失误,地平线4的分辨率被设为了1080P,所以特此声明一下,这次的地平线4测试也使用1080P进行。另外由于LOL的回放经历版本更新之后已经失效,所以使用的录像并非同一局,但为了公正起见,5800X使用的场景复杂度其实比11700K的要高得多。
去年底,我们测试了AMD的翻身之作6800XT,时隔一个季度(符合AMD之前公布的一个季度一块卡的节奏)我又等来了AMD的主流性能级显卡 6700XT。
6700XT采用Navi22核心,是使用RDNA2架构的新一代核心(RDNA2架构的解析可以参见之前6800XT的文章),支持DX12U的所有功能,包括VRS(可变倍率渲染),Mesh Shader(网格着色器),Ray Tracing(光线追踪),Sampler Feedback(纹理采样器反馈),对于新游戏和未来几年将要出的游戏,都提供了良好的特性支持。
另外,距离6800XT发布已经过了几个月,AMD这次也随着6700XT的发布,更新了Radeon Boost和Radeon Antilag,这两个功能现在都开始支持DX12的游戏。并且Radeon Boost再DX12的实现上采取了和之前不一样的做法,DX12下因为有VRS的加入,所以不用像DX11一样去降低全部屏幕的渲染倍率,只需要使用VRS减低人眼不易察觉部分的渲染倍率,所以整体画质得到了明显的提升。



接下来介绍一下本次测试的四张卡的规格:
| RX 6700 XT | RX 5700 XT 50周年 | RTX 2080 | RX 6800 XT | |
| 计算单元 | 40 | 40 | 46 | 80 |
| 纹理单元 | 160 | 160 | 184 | 320 |
| 几何流水线 | 2 | 4 | 6 | 4 |
| 色彩ROP | 64 | 64 | 64 | 128 |
| 深度/模板ROP | 128 | 256 | 256 | 256 |
| 显存位宽 | 192 | 256 | 256 | 256 |
| 显存容量 | 12 GiB | 8 GiB | 8 GiB | 16 GiB |
| 无限缓存 | 96 MiB | 无 | 无 | 128 MiB |
| 核心频率 | 2321/2581 Mhz | 1680/1980 Mhz | 1515/1710 Mhz | 1825/2250 Mhz |
| 显存频率 | 16 Ghz | 14 Ghz | 14 Ghz | 16 Ghz |
| 理论浮点计算性能 | 13214 Gflops | 10137 Gflops | 10068 Gflops | 23040 Gflops |
| 理论纹理填充率 | 413 GT/s | 317 GT/s | 314 GT/s | 720 GT/s |
| 理论多边形生成率 | 5.162 GTri/s | 7.92 GTri/s | 10.26 GTri/s | 9 GTri/s |
| 理论色彩像素填充率 | 165 GP/s | 127 GP/s | 109 GP/s | 288 GP/s |
| 理论深度像素填充率 | 330 GP/s | 507 GP/s | 438 GP/s | 576 GP/s |
| 理论显存带宽 | 384 GiB/s | 448 GiB/s | 448 GiB/s | 512 GiB/s |
| 理论无限缓存带宽 | 1490 GiB/s | 无 | 无 | 1986 GiB/s |
Zen4依然使用IOD和CCD的MCM设计。
Zen4的IOD会封装一颗小GPU。
Zen4的CCD使用5nm,IOD使用7nm/6nm。
这方面可以从Zen3的微架构看出一些端倪。
Zen3的重大改进在于重新平衡了调度器,并新加入了大量的执行单元,同时还扩展了访存能力。但是在乱序窗口这点上显得非常的吝啬,仅仅给出了256槽的重排序缓冲区,物理寄存器也保持在了192/192。所以我认为Zen4首先要做的第一个改进,就是大幅加大重排序缓冲区,物理寄存器也会提升到与之匹配的程度。
Zen3的向量和浮点部分增加了两个发射端,并且将大量传统的,不需要向量化的指令移到了新的发射端,比如X87之类的,而剩下的四个发射端就变的非常的对称。这样的变化,可能意味着AMD在为AVX512做准备,所以可以大胆的猜测一下Zen4,AMD将引入AVX512指令的支持,极大的可能性是使用2*256bit的拼接模式支持。
CCD部分互联方面应该改动不会很多,Ringbus目前来看满足8C的互联需求问题不大,即便Zen4有扩张到10C甚至12C每CCD的需求,都是没有大问题的。不过L3大小应该会有所变化,我打算留到后面说。
IOD这块比较可靠的消息认为会引入一个小GPU。但这个应该不是关键,AMD在RDNA2中引入了Infinite Cache,取得了不错的效果,Infinite Cache作为一个内存侧缓存,可以在不影响现有缓存的一致性协议和结构的情况下,为整个系统的访存操作带来极大的改善,无论是延迟还是带宽上。
如果在IOD中提供一块64M的IC,那么CPU方面就不再需要巨大的L3了,对于5nm的CCD部分是个很好的成本节约措施。另一方面,64M的IC可以由两个CCD共享,被缓存数据的容量也极大的得到了提升。最后IOD中提供的显卡,也不再会因为带宽问题所困扰。如果AMD想的话,也可以实现APU和CPU轻松的切换,只需要提供不同的IOD。
不过IC放在IOD中有一个问题,就是IOD与CCD之间的互联带宽和延迟。延迟方面的问题主要来自IF,带宽问题则是互联方式。如果AMD继续改进下IF,互联上使用台积电的linpincon,这两个问题应该会轻松解决。推而且其次的话,只改进下IF也是可以的,因为CPU带宽需求其实并没有想象的大。
| SE | SH,SA | Rasterizer | Pixel/Rasterizer | Render Backend | Pixel/Render Backend | ROP | CU | WaveFront/CU | |
| Navi10 | 2 | 4 | 4 | 16 | 16 | 4 | 64 | 40 | 40 |
| Navi12 | 2 | 4 | 4 | 16 | 16 | 4 | 64 | 40 | 40 |
| Navi14 | 1 | 2 | 2 | 16 | 8 | 4 | 32 | 24 | 40 |
| Navi21Lite | 2 | 4 | 4 | 16 | 8 | 8 | 64 | 56 | 40 |
| Navi21 | 4 | 8 | 4 | 32 | 16 | 8 | 128 | 80 | 32 |
| Navi22 | 2 | 4 | 2 | 32 | 8 | 8 | 64 | 40 | 32 |
| Navi23 | 2 | 4 | 2 | 32 | 8 | 8 | 64 | 32 | 32 |
| Navi31 | 4 | 8 | 4 | 32 | 16 | 8 | 128 | 80 | 32 |
| Van Gogh | 1 | 1 | 1 | 16 | 2 | 8 | 16 | 8 | 32 |
| Rembrandt | 1 | 2 | 1 | 32 | 4 | 8 | 32 | 12 | 32 |