Advancing AI 2026 стало самым большим на данный момент мероприятием AMD, где компания представила сразу несколько релизов: новый ускоритель Instinct MI455X, шкаф Helios на 72 GPU и шестое поколение серверных процессоров EPYC Venice вместе с хост-процессором Verano, который заслуживает отдельной статьи. Так или иначе, в рамках одной статьи охватить все эти новинки крайне сложно, поэтому сегодня мы расскажем, главным образом, о серии Venice, которая предлагает до 256 ядер/ 512 потоков на сокет, пропускную способность памяти 1.6 ТБ/с, поддержку PCIe Gen 6 – впервые в сегменте серверных процессоров – и 18-кратное увеличение производительности по сравнению с первым поколением EPYC 2017 года выпуска.

Venice – это не один чип и не один сокет. Это целое портфолио, что AMD подчеркивает каждый раз: одна модель CPU на одном сокете не вмещает все области применения. Архитектура поколения Zen 6 развертывается в чипах для серверов высокой плотности и для корпоративных систем, в чипах с объемным кэшем для высокопроизводительных вычислений (HPC) и в процессорах для хост-нод с малопотребляющей памятью LPDDR. Поэтому, прежде чем переходить к характеристикам, давайте посмотрим на саму линейку.
AMD делит современные серверы на три класса, и в портфолио представлены процессоры для каждого из них. Серверы с процессорами общего назначения содержат веб-шлюзы, кэши, уровни приложений, базы данных и любое другое программное обеспечение, которое на них размещают. Графические серверы имеют центральный хост-процессор, который управляет нагрузкой ускорителей, и здесь однопоточная производительность и пропускная способность I/O важнее, чем количество ядер CPU. Третий класс – серверы высокой плотности для оркестровки и выполнения кода, которым обросли ИИ-сервисы; этот код нагружен ветвлениями и склонен к зависаниям, поэтому для него нужно максимальное количество потоков.

Линейка представлена четырьмя продуктами, и для этих платформ запланированы следующие окна выпуска: Venice SP7 – в 4-м квартале 2026 года, Venice SP8 – в 1-й половине 2027 года, Venice-X и Verano – во 2-й половине того же года. AMD модифицировала исходный базовый кристалл по шести направлениям, которые в итоге были распределены по вышеупомянутым трем классам серверных процессоров. Класс общего назначения представляют чипы Venice SP7, SP8 и Venice-X. Класс хост-процессоров – высокочастотная бин-выборка Venice (HF) и чип Verano с поддержкой памяти LPDDR. Для плотного компьютинга предназначен чип Venice с пометкой 256c, который отличается большим числом ядер и сравнительно низким энергопотреблением, что позволяет запихнуть в стойку столько потоков, сколько позволяет бюджет мощности. Verano работает на два фонта: по словам AMD, некоторые заказчики будут развертывать его в качестве процессора общего назначения в системах, имеющих ограничения по мощности.

Мы получили общее представление обо всех моделях процессоров благодаря примечаниям-сноскам на слайдах. Возглавляет линейку 256-ядерный чип EPYC 9996, чип 9956 предлагает столько же ядер в рамках 400 Вт, а 96-ядерный 9686F представляет собой высокочастотный хост-процессор. Платформа Helios использует собственную версию этого чипа, EPYC 9G76, в каждой вычислительной секции.
Прежде чем переходить к спецификациям, скажем пару слов о том, где будет использоваться самый большой сокет. Серия Venice SP7 зарезервирована для самых высококлассных систем AMD, которые будут развертываться в дата-центрах, гиперскейлерах и кластерах HPC, где производительность стойки является решающим фактором, без оглядки на экономичность. Производители серверов уже вносят соответствующие изменения в номенклатуру своих линеек. Dell выделила пространство для этого класса в рамках своего бренда PowerEdge, где данный класс производительности будет представлять новая серия 9000, которую возглавят флагманские 3-юнитовые серверы PowerEdge R9825 и Rack Scale M9825, оснащенные двумя чипами Venice.
Все семейство базируется на одной платформе, почти все ключевые аспекты которой обновлены относительно Turin.

Начнем с ядер. Ядра Zen 6 выпускаются в двух модификациях: компактные Zen 6c, обеспечивающие конфигурацию 256 ядер/ 512 потоков на сокете мощностью до 600 Вт, и стандартные, которых максимум 96, но с частотой 5 ГГц. AMD заявляет на 20% более высокую производительность на ядро, чем у конкурирующих аналогов с соответствующим числом ядер, и эта плотность достигается без урезания кэша: даже в 256-ядерном чипе на одно ядро приходится около 4 МБ кэша L3, который во флагманском процессоре составляет целый гигабайт. Пакет инструкций AVX-512 отвечает за токенизацию на моделях с числом параметров от 3 до 8 млрд, которые все чаще запускаются на CPU.

Для загрузки этих ядер требуется намного более развитая подсистема памяти: 16 каналов памяти DDR5 8000 MT/с или MRDIMM 12800 MT/с дают пропускную способность 1.6 ТБ/с на сокет, тогда как Turin с 12 каналами обеспечивает только 614 ГБ/с. Аналогичный прогресс имеет место и в части I/O. Venice – первый серверный процессор с PCIe Gen 6, который предлагает 128 линий интерфейса и пропускную способность 64 ГТ/с, с удвоенной пропускной способностью линии для любых подключенных ускорителей, и создает базис для высокопроизводительного хоста, о чем мы поговорим позднее. Поддержка CXL 3.1 позволяет использовать эти линии для расширения памяти, а на отдельных двухсокетных хост-платформах для ИИ использование интерконнекта xGMI для подключений I/O позволяет довести число доступных линий до 160. Еще два менее громких обновления ускоряют перемещение данных без перегрузки ядер: SDXI снимает нагрузку копирования памяти и шифрования данных в эквиваленте загрузки 30-50 ядер CPU, а Smart Data Cache Injection отправляет сетевые пакеты прямо в кэш, минуя DRAM.

В части управления мощностью мы получаем три заметных нововведения, которые имеют значение, поскольку все дальнейшие сопоставления AMD делаются в рамках бюджета мощности стойки. UPP объединяет бюджеты мощности SoC и DIMM в один, так что в сценариях с интенсивной нагрузкой на память большую его часть потребляет память, а в сценариях с интенсивными вычислениями – SoC. Это позволяет повысить производительность каждого из компонентов в рамках фиксированного бюджета мощности или подключить дополнительные ноды. UBPS ограничивает мощность при низкой загрузке системы, жертвуя обычной прибавкой к производительности в сценариях с легкой нагрузкой в пользу предсказуемого нагрузочного профиля; пользователи, предпочитающие указанную прибавку к скорости, могут отключить эту функцию. FAST функционально разделяет SoC на два процессора: приоритетные ядра продолжают работать с высокой частотой, в то время как фоновые ядра работают медленнее, что позволяет одновременно запускать на одном сокете и критическую нагрузку, и ряд второстепенных.
В части защиты данных Venice расширяет функционал конфиденциальной виртуализации на платформе EPYC, который исторически включает в себя SEV (начиная с EPYC 7002), затем Encrypted State, Secure Nested Paging и, наконец, технологию Trusted I/O, введенную в поколении Turin. Новшества этого поколения: усиленный корень доверия с RSA-4K, постквантовые алгоритмы, нейтрализация физических атак и атак по сторонним каналам, сертификация FIPS 140-3 Level 1 и Device Provenance – подтверждение происхождения продукта, которое AMD вводит для Venice в числе первых своих продуктов.
Четыре компонента отличаются друг от друга больше, чем можно было бы предположить исходя из общего наименования.
| Спецификация | 9006 SP7 | 9006 SP8 | 9006X SP7 | 9006 LP “Verano” |
| Число ядер | До 256 (512 потоков) | От 8 до 128 | До 96 | До 72 |
| Максимальная частота | 5.0 ГГц на 96 ядрах (HF) | Доступны опции HF | ~ 5.15 ГГц | До 5.0 ГГц |
| Память | 16 каналов, до 1.6 ТБ/с | 8 каналов в конфигурации 2 DIMM на канал (2DPC) | 16 каналов MRDIMM 12800 MT/с | 24 канала LPDDR5X, SOCAMM2 |
| Кэш L3 | До 1024 МБ | Зависит от числа ядер | 1152 МБ (3D V-Cache) | Зависит от числа ядер |
| I/O | PCIe Gen 6, 128 линий 1P | 128 линий PCIe, 1P и 2P | PCIe Gen 6 | Усиленный xGMI 112 ГТ/с |
| Область применения | Гиперскейлеры высокой плотности, хосты ИИ | Корпоративные, граничные, NEBS-серверы | HPC, предпроцессинг ИИ | Стоечные хосты ИИ |
SP7 – это флагманский сокет, который уже запущен в производство; партнерские платформы выходят в 4-м квартале этого года. Высокочастотные компоненты, идущие на смену чипам HF Turin, по словам AMD, относятся к быстрейшим моделям со «взрывной» скоростью, и их самая главная область применения – серверы Helios, где хост-процессор каждой вычислительной секции присоединяет когерентный домен памяти стойки – 1 ТБ DDR5 – через Infinity Fabric. Поскольку сокет стандартный, все процессоры SP7 предлагают до 256 ядер.

Серия SP8 меняет огромный сокет на экономичность системы. Она предлагает от 8 до 128 ядер, поддерживает восемь каналов памяти в конфигурации 2DPC, 128 линий PCIe и включает в себя высокочастотные и NEBS-опции процессоров для телекоммуникационных и граничных серверов, как односокетных (1P), так и двухсокетных (2P). Коммерческий аргумент этой серии AMD – подбор оптимальной производительности для предприятий, где главным показателем эффективности является не чистая производительность на стойку, а производительность на доллар стоимости системы.

Серия Venice-X предлагает 3D V-Cache на 96-ядерной высокочастотной конфигурации и доводит объем кэша L3 до 1152 МБ, увеличивая долю кэша на ядро примерно втрое по сравнению со стандартными чипами SP7. Тактовые частоты достигают примерно 5.15 ГГц, плюс полная 16-канальная конфигурация памяти 12800 MT/с. Области применения – моделирование, крупномасштабная аналитика, базы данных in-memory и предпроцессинг ИИ, формирующий потоки для пайплайнов обучения – одним словом, нагрузки, использующие в большей мере преимущества большого кэша, чем дополнительных ядер.

Verano – самый специализированный компонент семейства: он предназначен, прежде всего, для хост-нод ИИ, предлагает до 72 ядер на частоте 5 ГГц, 24 канала памяти LPDDR5X и усиленный интерконнект xGMI 112 ГТ/с для обеспечения трафика между CPU и GPU. Память LPDDR размещается в модулях SOCAMM2, которые в ходе эксплуатации могут быть заменены; это важный момент, поскольку выход из строя памяти, распаянной на плате, приводит к замене всей платы. Кроме того, Verano – непосредственный ответ AMD платформе NVIDIA Vera, и к этому полю конкуренции мы еще вернемся.

AMD выстроила свой кейс в две линии: Turin – в подтверждение своего текущего лидерства, и Venice – чтобы показать, как далеко они продвинулись в перспективе.
В большинстве примеров AMD сопоставляет свои платформы с NVIDIA Vera (центральный процессор Arm на платформе Vera Rubin) и показывает достижения уже существующего поколения Turin. Согласно результатам моделирования AMD на уровне стоек, стойка Turin обеспечивает в 2.4 раза большую производительность по сравнению с Vera в общих задачах и вдвое большую производительность агентов на ватт потребляемой мощности. Модель включает в себя обе стойки с бюджетом мощности 100 кВт: двухпроцессорная платформа EPYC 9965 (384 ядра) против также двухпроцессорной платформы Vera (176 ядер); сравниваются осредненные показатели, полученные по результатам запуска шести тестовых нагрузок: SPECrate 2017, скрипты Java на стороне сервера, NGINX, Redis, Memcached и производные бенчмарки TPC-C.

Здесь нужно сделать пару замечаний, которые касаются и остальной части статьи. Платформы Vera еще не отгружались, так что все оценки AMD сделаны на основе опубликованных материалов NVIDIA, где описан пример 88-ядерного 450-ваттного компонента. И, поскольку стандартных бенчмарков для агентных нагрузок сегодня не существует, при подсчете агентов на ватт AMD учитывала аппаратные потоки в качестве прокси-шаблонов для агентов.
Сравнение с Intel имеет под собой более ощутимую основу, поскольку обе стороны отгружают свои чипы, которые AMD может взять для непосредственного сопоставительного тестирования. Хост-процессоры Turin достигают 5.0 ГГц, тогда как их ближайшие аналоги Xeon выдают максимум 3.9 ГГц, и это 28%-ное преимущество в тактовой частоте играет роль в сценариях однопоточного обеспечения загрузки GPU. В прямом сравнении двух сокетов (Turin против 128-ядерного Xeon 6980P) AMD заявляет 1.4-кратное превосходство Turin в SPEC CPU и корпоративных сценариях Java, 1.8-кратное – в HPC и 1.7-кратное – в приложениях ИИ на CPU.

Venice укрепляет лидерство AMD по всем этим показателям. В рамках той же самой 100-киловаттной стоечной модели уже 512 ядер Venice против 176 ядер Vera обеспечивают, согласно заявлениям AMD, 3.3-кратное превосходство в части общей производительности. По сравнению со 136-ядерным процессором Arm AGI Venice обеспечивает в 2.8 раз больше агентов на ватт и в 1.8 раз больше токенов в секунду на frontier-моделях, когда Venice выполняет роль хоста для графических ускорителей. Этот 1.8-кратный показатель относится к более узкоспециализированному сценарию, и мы к этому еще вернемся в разделе, посвященном хост-нодам.

В SPECrate 2026 AMD оценивает результат двухпроцессорной платформы 2P Venice 9996 в 2070 выполненных задач против 925 у Vera, что соответствует 2.2-кратному преимуществу в пропускной способности и обеспечивает 96-ядерному высокочастотному процессору примерно 1.2-кратное превосходство над Vera в части производительности на ядро. Результаты обеих платформ получены с одним и тем же компилятором GCC 15.2, с которым также были получены результаты Vera, опубликованные NVIDIA.

Показатель производительности на ядро фактически вырос за неделю. Рави Куппусвами (Ravi Kuppuswamy), менеджер проекта процессора AMD, сообщил журналистам, что для этого показателя AMD изначально заявляла 10%-ное преимущество. После того как NVIDIA в начале недели опубликовала свои результаты для Vera, команда AMD провела повторное тестирование с тем же компилятором и настройками, что и NVIDIA, и получила 20%-ное преимущество, причем оптимизация еще не закончена. 2.2-кратное преимущество в пропускной способности, по его словам, получалось по всем проектным расчетам AMD. В отдельном контрольном тесте в SPECrate 2017 с собственным компилятором AMD AOCC был получен результат, показывающий 1.7-кратное превосходство Venice в части производительности на ядро, так что относительно этого результата 20%-ное преимущество выглядит более консервативно.
AMD также представила расширенные данные SPECrate 2017. Платформа Venice 9996 (256 ядер, 600 Вт) лидирует с результатом 4900, следом идет Turin 9965 с результатом 3240, затем Intel Xeon 6980P (128 ядер, 500 Вт) с результатом 2510, Arm AGI (136 ядер, 300 Вт) с результатом 1944 и Vera с результатом 1459. Показатели Venice 9996, AGI и Vera – это оценки AMD; результаты Turin и Intel уже публиковались официально. По сравнению с Intel новая платформа AMD предлагает примерно вдвое большую пропускную способность при сопоставимой стоимости, т.е. вдвое большую производительность на доллар. В части производительности на ядро 128-ядерная 500-ваттная конфигурация Venice превосходит 6980P в 1.3 раза, в то время как ядро Arm AGI предлагает только 70% производительности Xeon. В отличие от предыдущего сравнения с Vera, здесь результаты каждой платформы получены с использованием собственных компиляторов производителей: AOCC для AMD, OneAPI для Intel и GCC 13 для Arm.

В этом сегменте AMD также оценивает каждый результат относительно результата Intel 6980P, принятого за 1.0. В части облачных нагрузок 256-ядерная конфигурация Venice 9996 показывает 3.5-кратное превосходство в MongoDB, 2.9-кратное – в Redis, 3.7-кратное – в NGINX, и 2.6-кратное – в MySQL. Преимущество Turin относительно Intel в этих тестах составляет от 1.6 до 2.4 раз, преимущество Graviton5 – от 1.2 до 1.5 раз.

В приложениях HPC платформа Venice демонстрирует 3.1-кратное превосходство в GROMACS и NAMD, 2.9-кратное – в WRF, и 1.8-кратное – в Quantum Espresso. На эти результаты существенно влияет конфигурация памяти. Со стандартными модулями RDIMM 8000 MT/с Venice в GROMACS превосходит Xeon в 2.81 раза; модули MRDIMM 12800 MT/с увеличивают это преимущество до 3.13 раз, аналогично в WRF – с 2.25 до 2.90 раз. В зависимости от конкретной нагрузки и памяти общее преимущество AMD в HPC составляет от 1.8 до 3.5 раз. Базисный результат Intel получен с памятью MRDIMM 8800 MT/с, так что отрыв AMD нельзя списать на апгрейд памяти относительно более медленной конфигурации Intel.

Вернемся к заявлению об увеличении числа токенов в секунду в 1.8 раза. Стоящий за этим аппаратный апгрейд легко просматривается: хост-процессор с частотой 5 ГГц теперь имеет 96 ядер вместо 64, пропускная способность памяти хоста выросла с 614 ГБ/с до 1.6 ТБ/с, и PCIe Gen 6 удваивает пропускную способность линка CPU-GPU.

Первое, на что нужно обратить внимание – базисный уровень, взятый за 1.0. В этот раз AMD нормировала все результаты относительно Turin, а не Intel, и платформа 6-го поколения Xeon 6960P финишировала с показателем 0.9, относительно которого Venice демонстрирует все то же двукратное превосходство. Расчетное увеличение производительности почти целиком основывается на пропускной способности I/O. В тесте AMD с разгрузкой CPU веса модели Qwen3-30B BF16 передавались из памяти хоста на GPU, при этом, по данным измерений, приемный канал PCIe Gen 5 x16 работал с пропускной способностью от 89% до 95% от своего теоретического потолка, в то время как DRAM-память хоста задействовала менее 10% своей теоретической максимальной пропускной способности. Скорость декодирования лимитировалась каналом передачи, поэтому удвоение его пропускной способности благодаря переходу на PCIe Gen 6 в этом тесте обеспечило повышение производительности в 1.8-1.9 раза. Сегодня Venice – единственный серверный процессор, который предлагает ускорителям PCIe Gen 6, так что это преимущество не только реальное, но на данный момент еще и эксклюзивное. Однако область его реализации довольно узкая: повышение производительности в 1.8 раз относится к сценарию разгрузки процессора, где лимитирующим фактором является пропускная способность PCIe, поэтому не следует трактовать этот результат как обещание того, что графические ускорители на хостах Venice будут обслуживать каждую модель в 1.8 раз быстрее. Что касается фактически отгружаемого сегодня «железа», хост Turin по времени первого токена опережает Xeon 6960P в среднем на 13% (геометрическое среднее по результатам запуска ряда vLLM и нагрузок NIM на одной и той же системе 8x B200), при этом в лучшем случае преимущество составило 36%.
Наконец, последнее заявление касается плотности: 49152 ядер Venice в одной стойке, против 36864 для Turin и 22528 для Vera, при этом каждый компонент предлагает удвоенное (относительно числа ядер) число потоков. Это заявление имеет наибольший вес, с учетом всех примечаний и сносок.

В заголовке слайда – 2.2-кратное превосходство по ядрам по сравнению с Vera, но при этом стойка Venice потребляет 269 кВт, в то время как Vera – 185 кВт, так что по энергопотреблению эти конфигурации несопоставимы. В сносках AMD приводит нормированные показатели. При одинаковом бюджете мощности 100 кВт стойка 9996 предлагает в 2.08 раза больше ядер, чем Vera, в 1.86 раза больше, чем Turin, и в 1.24 раза больше, чем Intel 6980P. Ставя на место флагмана 400-ваттный EPYC 9956, AMD получает 1.91-кратное превосходство по ядрам над Vera при на 26% меньшем энергопотреблении, или 2.57-кратное преимущество по ядрам на каждый ватт, потребляемый стойкой. В зависимости от бюджета мощности абсолютное превосходство по ядрам варьируется в диапазоне от 1.9- до 2.2-кратного, и, как и в случае всех показателей Vera, приводимых в этой статье, данные стойки NVIDIA получены по результатам моделирования на основании опубликованных спецификаций, а не физических измерений. При нормировании преимущество в плотности сохраняется; оно просто становится меньше 2.2-кратного, заявленного в заголовке слайда.
Оставляя в стороне отдельные заявления, отметим в общем: в топовом сегменте рынка серверных процессоров у AMD сегодня нет прямых конкурентов. Лучшие предложения Intel уступают поколению Turin, которому AMD уже практически подготовила смену. Альтернативы от Arm также уступают платформе Turin во всех бенчмарках, представленных AMD. Процессоры Vera еще не отгружаются, но по оценкам AMD они обеспечивают более чем вдвое меньшую пропускную способность, чем Turin 9965, процессор, который присутствует на рынке уже полтора года, а Venice снова примерно удваивает пропускную способность относительно Turin. По данным Mercury Research, это положение уже принесло AMD около 46% дохода рынка серверных процессоров. Текущая ситуация на рынке это только подтверждает. Спрос на топовые компоненты EPYC сегодня превышает предложение, в результате сроки заказов растягиваются.
Мы можем добавить к этому наши собственные данные. Наш мировой рекорд вычисления числа «пи» с точностью 314 триллионов значащих цифр был поставлен на системе Dell PowerEdge R7725 с двумя 192-ядерными процессорами EPYC 9965 и 1.5 ТБ памяти DDR5, то есть на той же самой 384-ядерной двухпроцессорной конфигурации, на которой AMD моделирует свои стойки Turin. В ходе вычислений все ядра были загружены в течение 110 дней, и задача была завершена без секунды простоя; одна ошибка памяти или аварийное закрытие приложения – и попытка была бы не засчитана. Средняя потребляемая мощность составила около 1600 Вт, а суммарная энергия, затраченная на выполнение задачи – 4305 кВт-ч, или 13.7 кВт-ч на один триллион значащих цифр. Для сравнения – предыдущий рекорд с точностью 300 триллионов значащих цифр потребовал около 33600 кВт-ч и 225 дней.

Venice представляет собой сильнейший выпуск за всю историю серверных процессоров AMD, и его идеологическая основа – широта применения. Одно поколение Zen 6 охватывает области от корпоративных серверов с плотностью 256 ядер на сокет и чипов для HPC с трехмерным 1152-мегабайтным кэшем до хост-нод с памятью LPDDR, так что заказчики могут строить все уровни дата-центра на базе одной и той же архитектуры и программного обеспечения. Приводимые показатели говорят сами за себя: вдвое большая пропускная способность, чем у Intel, при сопоставимой стоимости системы; 20%-ное преимущество перед Vera в части производительности на ядро при использовании одного и того же компилятора; и 1.9-2.2-кратное (в зависимости от бюджета мощности) превосходство над хост-процессором NVIDIA в части плотности стойки.
Коммерческая сторона вопроса тоже довольно предсказуема. Процессоры SP7 запущены в производство, партнерские платформы ожидаются в 4-м квартале текущего года; серия SP8 запланирована на первую половину 2027 года, следом идут Venice-X и Verano. За компанией уже числятся 46% совокупного дохода от продаж серверных процессоров, спрос на их текущие продукты намного опережает предложение, и заказчики терпеливо стоят в очереди за процессорами EPYC. Не пройдет и года, как выйдут процессоры семейства Venice, и данные бенчмарков, приведенные в этой статье, указывают на их бесспорное лидерство, так как чипы Turin уже превосходят все аналоги, и отгружаемые, и готовящиеся к выпуску. Сегодня AMD настолько впереди всех, что в настоящий момент ближайшие конкуренты их серверных процессоров – их же новейшее поколение.