Информация актуальна на сентябрь 2026 года.
Введение. Зачем гонять нейросети на ноутбуке в 2026 году
Три года назад сама мысль о том, чтобы запустить языковую модель на ноутбуке без дискретной видеокарты, вызывала снисходительную улыбку. Максимум, на что хватало мобильного процессора, — это генерация двух-трёх токенов в секунду из крошечной модели на полмиллиарда параметров, причём текст получался бессвязным. Сегодня ситуация изменилась до неузнаваемости. Я сижу за ноутбуком с Ryzen 7 AI 350, кручу квантованную семёрку на 14 токенов в секунду и одновременно держу в фоне NPU-задачу по суммаризации документов. Никакой облачной подписки, никакой отправки данных на чужие серверы, никакой задержки сети.
Причин, по которым локальный инференс перестал быть экзотикой, несколько. Во-первых, модели стали компактнее и умнее: Llama 3.2 на три миллиарда параметров генерирует текст, который в 2023 году выдавали только семидесяти миллиардные гиганты. Во-вторых, квантование шагнуло далеко вперёд: Q4_K_M на семь миллиардов весит чуть больше четырёх гигабайт и умещается в оперативную память любого современного ноутбука. В-третьих, сами процессоры обзавелись специализированными блоками — NPU, которые разгружают центральные ядра от рутинных операций матричного умножения. И в-четвёртых, экосистема софта созрела: llama.cpp, Ollama, LM Studio работают из коробки и не требуют диплома по машинному обучению для настройки.
В этой статье я подробно разберу, на что способен AMD Ryzen 7 AI 350 и его соседи по линейке Strix Point в задачах локального AI. Покажу реальные цифры генерации для конкретных моделей, объясню, где узкое горлышко и как его обойти. Рассказу, что AMD готовит на ближайший год, и как Intel планирует перехватить инициативу. Если вы выбираете ноутбук для работы с нейросетями без облака или уже владеете машиной на Ryzen AI 300 и хотите выжать из неё максимум — этот текст для вас.
Семейство AMD Ryzen AI 300 (Strix Point): полный расклад по полкам
Позиционирование и иерархия SKU
Линейка Ryzen AI 300, известная под кодовым именем Strix Point, вышла на рынок в середине 2024 года и к сентябрю 2026-го стала основной мобильной платформой AMD для ноутбуков среднего и верхнего сегментов. Название «AI» в индексе — не маркетинговая наклейка: каждый чип семейства несёт на кристалле нейронный процессор XDNA второго поколения с пиковой производительностью 50 триллионов операций в секунду. Именно этот блок формально обеспечивает соответствие требованиям программы Copilot+ PC от Microsoft, где порог составляет 40 TOPS.
Иерархия внутри семейства выстроена привычно:
- Ryzen AI 9 HX 370 — флагман. Двенадцать ядер, графика Radeon 890M с 16 вычислительными блоками, максимальные частоты. Для тех, кому нужен максимум и в задачах продуктивности, и в инференсе.
- Ryzen AI 9 365 — десять ядер, Radeon 880M. Чуть урезанный флагман, который часто встречается в ультрабуках верхнего сегмента.
- Ryzen AI 7 PRO 360 — бизнес-версия с расширенными функциями управления и безопасности. Восемь ядер, тот же NPU.
- Ryzen AI 7 350 — герой этой статьи. Восемь ядер, Radeon 860M. Золотая середина по соотношению цена, энергопотребление и вычислительная мощь.
- Ryzen AI 5 340 — шесть ядер, Radeon 840M. Бюджетный вход в мир Ryzen AI.
- Ryzen AI 5 330 — шесть ядер, сниженные частоты. Самый доступный вариант.
Важно понимать: во всех перечисленных SKU стоит один и тот же NPU XDNA 2 на 50 TOPS. Разница между ними — в количестве ядер CPU, объёме кэша, частотах и конфигурации встроенной графики. Для LLM-инференса это означает, что переход с Ryzen AI 5 330 на Ryzen AI 7 350 даёт ощутимый прирост скорости генерации, а вот переход с Ryzen AI 7 350 на Ryzen AI 9 HX 370 — уже менее драматичный, потому что упор чаще всего упирается не в ядра, а в пропускную способность памяти.
Единая архитектура: Zen 5, RDNA 3.5, XDNA 2
Strix Point — первый потребительский чип AMD, где на одном кристалле соседствуют три принципиально разных вычислительных домена:
- CPU-ядра Zen 5 и Zen 5c. Zen 5 — полноразмерные высокопроизводительные ядра с широким конвейером, большим окном переименования и агрессивным предсказанием ветвлений. Zen 5c — их компактные собратья: та же микроархитектура и набор инструкций, но уменьшенный кэш L2 и более плотная компоновка. Это не «малые ядра» в духе ARM-кластеров: они выполняют тот же ISA и способны работать на высоких частотах, просто занимают меньше площади кремния.
- GPU на архитектуре RDNA 3.5. Встроенная графика с вычислительными блоками от 8 до 16 в зависимости от SKU. Поддерживает аппаратное ускорение матричных операций через WMMA-инструкции и может использоваться для инференса моделей через Vulkan или ROCm-подобные стеки.
- NPU XDNA 2. Массив из 32 AI-ядер, каждое из которых содержит векторные блоки и локальную SRAM-память. Пиковая производительность — 50 TOPS при INT8, около 25 TOPS при INT16. NPU работает независимо от CPU и GPU, потребляет доли ватта и предназначен для непрерывных фоновых задач: шумоподавление, распознавание речи, обработка изображения с камеры. Для LLM-инференса он пока играет вспомогательную роль, но об этом подробнее дальше.
Все три домена объединены общей шиной Infinity Fabric и обращаются к единому пулу памяти LPDDR5x-7500 или DDR5-5600 в зависимости от реализации ноутбука. Именно пропускная способность этой памяти — главный ограничитель скорости генерации, и я вернусь к этому не раз.
Ryzen 7 AI 350 под микроскопом
Ядра, кэш, частоты
Итак, что конкретно находится под крышкой у Ryzen 7 AI 350:
- Восемь ядер: четыре Zen 5 и четыре Zen 5c. Шестнадцать потоков благодаря SMT.
- Базовая частота около 2,0 ГГц, максимальная в бусте — до 5,0 ГГц на ядрах Zen 5. Ядра Zen 5c бустятся чуть ниже, примерно до 4,6 ГГц.
- Кэш L2: по 1 МБ на каждое ядро, итого 8 МБ.
- Кэш L3: 16 МБ общий для всех ядер.
- TDP: конфигурируемый, от 15 до 54 Вт в зависимости от системы охлаждения ноутбука. В большинстве ультрабуков реальный длительный лимит держится в районе 28–35 Вт.
Для LLM-инференса критичны три параметра: количество потоков (определяет параллелизм при перемножении матриц), объём кэша L3 (влияет на попадание весов модели в быструю память) и частота (определяет скорость скалярных операций и адресации). Четыре ядра Zen 5 с их широким конвейером отлично справляются с AVX-512 и VNNI-инструкциями, которые использует llama.cpp для квантованного инференса. Четыре ядра Zen 5c добавляют ещё четыре потока, но их меньший кэш L2 и чуть более низкая частота делают их вклад неравноценным.
Я проверил на практике: при запуске llama.cpp с параметром —threads 8 модель использует все шестнадцать потоков, но реальная загрузка ядер Zen 5c на 10–15 процентов ниже. Если выставить —threads 8 и привязать процесс к ядрам Zen 5 через numactl или Task Manager, скорость генерации падает незначительно, а вот энергопотребление снижается заметно. Для ноутбука с батарейным питанием это полезный трюк.
Встроенная графика Radeon 860M
Radeon 860M в составе Ryzen 7 AI 350 содержит восемь вычислительных блоков RDNA 3.5, что даёт 512 потоковых процессоров. Частота графики — до 2,6 ГГц. Это не дискретная видеокарта, и ожидать от неё чудес в инференсе больших моделей не стоит. Однако для моделей до трёх миллиардов параметров в формате FP16 или INT8 она способна обеспечить ускорение через Vulkan-бэкенд в llama.cpp или через ROCm-совместимые библиотеки.
На практике я получил следующий результат: Llama 3.2 3B в Q8_0 на CPU генерирует около 22 токенов в секунду, а при переносе части весов на iGPU через Vulkan — около 26 токенов. Прирост есть, но он не радикальный. Для моделей 7B и выше iGPU уже не хватает: не ни вычислительной мощности, ни пропускной способности. Тем не менее для фоновых задач вроде эмбеддинга или работы с небольшими классификаторами Radeon 860M вполне годится.
NPU XDNA 2: 50 TOPS — что за цифрой
50 TOPS при INT8 звучит внушительно, но для LLM-инференса эта цифра обманчива. Вот почему.
Языковые модели при генерации текста работают в режиме авто-регрессии: каждый новый токен требует прогона всего прямого прохода по модели. Это означает тысячи последовательных операций, каждая из которых зависит от результата предыдущей. NPU XDNA 2 оптимизирован для конвейерной обработки фиксированных батчей данных — например, для обработки видеопотока или аудиобуфера. Когда речь идёт об инференсе одного токена за раз, загрузка 32 AI-ядер NPU падает до единичных процентов, и реальная производительность оказывается далеко от пиковых 50 TOPS.
К сентябрю 2026 года ситуация с софтом для NPU такова:
- Ryzen AI Software (бывший Ryzen AI Developer Platform) позволяет запускать ONNX-модели на NPU через ONNX Runtime. Поддерживаются модели до нескольких сотен миллионов параметров: классификаторы, детекторы, небольшие трансформеры для суммаризации. Полноценные LLM на 3B+ через этот путь пока не идут — не хватает ни поддержки динамического KV-кэша, ни оптимизаций для авто-регрессионной генерации.
- Прямой доступ к NPU через драйвер реализован в Windows через Windows ML и в Linux через экспериментальный модуль ядра. Но экосистема вокруг этого сырая, документации мало, и для LLM-задач это пока тупик.
Вывод: на сентябрь 2026 года NPU в Ryzen 7 AI 350 полезен для фоновых задач (шумоподавление в Zoom, размытие фона, распознавание жестов), но не для генерации текста. Основная нагрузка ложится на CPU-ядра и, частично, на iGPU. AMD это понимает и в следующих поколениях обещает изменить баланс, но об этом в соответствующем разделе.
Какие LLM-модели реально работают на Ryzen 7 AI 350
Модели до 3B параметров: комфортная зона
Это та категория, где Ryzen 7 AI 350 чувствует себя уверенно. Модели до трёх миллиардов параметров в квантовании Q4_K_M или Q5_K_M занимают от 1,5 до 2,5 гигабайт оперативной памяти и генерируют текст со скоростью 18–28 токенов в секунду в зависимости от конкретной архитектуры и настроек.
Что сюда входит и что я рекомендую:
- Llama 3.2 1B и 3B. Тройка в Q5_K_M выдаёт около 24 токенов в секунду на Ryzen 7 AI 350 при 28 Вт. Качество текста для базовых задач — суммаризация, перефразирование, простые вопросы-ответы — вполне рабочее. Единица быстрее, около 35 токенов в секунду, и подходит для интерактивных сценариев, где важна мгновенная реакция.
- Phi-4 Mini (3,8B). Модель Microsoft, которая при компактном размере демонстрирует неожиданно сильное рассуждение. В Q4_K_M занимает около 2,3 ГБ, скорость — порядка 20 токенов в секунду. Хорошо справляется с логическими задачами и математикой начального уровня.
- Gemma 2 2B. Модель Google, оптимизированная для мультиязычности. На русском языке работает заметно лучше, чем Llama 3.2 того же размера. Скорость — около 22 токенов в секунду.
- Qwen 2.5 1.5B и 3B. Китайская серия, которая в 2026 году стала одним из лучших вариантов для работы с русским языком в компактном формате. Тройка в Q5_K_M генерирует на скорости около 21 токен в секунду и при этом выдаёт связный, грамматически корректный русский текст.
- Mistral 3B (Mistral Nemo 3B). Компактная версия от Mistral AI. Хороша для кода и технических текстов.
Для всех перечисленных моделей ноутбук на Ryzen 7 AI 350 работает в полностью автономном режиме: без нагрева выше 65 градусов, без троттлинга, с приемлемым временем отклика (у меня msi Pulse A16 AI+). Это уровень, на котором уже можно строить реальные рабочие процессы: локальный ассистент для написания писем, суммаризатор документов, помощник при программировании.
Модели 7–8B: рабочий компромисс
Семёрки и восьмёрки — самый популярный размер для локального использования. Они дают ощутимый скачок в качестве по сравнению с тройками, но требуют больше памяти и вычислительных ресурсов. На Ryzen 7 AI 350 они работают, но скорость генерации снижается до 8–15 токенов в секунду.
Конкретные варианты:
- Llama 3.1 8B. В Q4_K_M занимает 4,9 ГБ. Скорость на Ryzen 7 AI 350 — около 12 токенов в секунду при 35 Вт. В Q5_K_M — около 11 токенов. Качество генерации на русском языке приемлемое, но не идеальное: периодически проскакивают англицизмы и кальки.
- Mistral 7B v0.3. Классика локального инференса. В Q4_K_M — около 13 токенов в секунду. Модель хорошо справляется с английским, на русском чуть слабее, но для технических текстов и кода подходит отлично.
- Qwen 2.5 7B. На мой взгляд, лучшая семёрка для русского языка в 2026 году. В Q4_K_M генерирует со скоростью около 12 токенов в секунду. Понимает контекст, держит стиль, редко галлюцинирует на фактах.
- Gemma 2 9B. Чуть крупнее семёрок, в Q4_K_M занимает около 5,5 ГБ. Скорость падает до 9–10 токенов в секунду, но качество рассуждения выше, чем у конкурентов того же размера.
- Phi-4 (14B в квантовании Q3). Формально это уже следующий класс, но в агрессивном квантовании Q3_K_M модель ужимается до 6,5 ГБ и работает на скорости около 6–7 токенов в секунду. Использовать можно, но интерактивность уже страдает.
Практическое наблюдение: при работе с семёрками я настоятельно рекомендую выставлять количество потоков не на максимум, а на 8 (по числу физических ядер). Гиперпоточность в задачах инференса даёт минимальный прирост, зато увеличивает конкуренцию за кэш и память. Разница между 8 и 16 потоками на Ryzen 7 AI 350 составляет один-два токена в секунду, а вот температура и шум вентилятора заметно ниже при восьми.
Модели 13B и выше: чего ждать
Здесь начинается территория компромиссов, и я буду честен: для комфортной работы модели от тринадцати миллиардов параметров на Ryzen 7 AI 350 не предназначены. Это не значит, что их нельзя запустить, но опыт будет болезненным.
- Llama 3.1 13B в Q4_K_M занимает около 8 ГБ. Скорость генерации — 4–6 токенов в секунду. Это означает, что на абзац в сто слов уйдёт около сорока секунд. Для разового запроса терпимо, для регулярной работы — нет.
- Mixtral 8x7B (модель со смесью экспертов) в Q3_K_M весит около 13 ГБ. На ноутбуке с 16 ГБ оперативной памяти она просто не поместится целиком. С 32 ГБ — запустится, но скорость будет 2–3 токена в секунду.
- Command R (35B) и аналогичные крупные модели — исключительно для тех, у кого 64 ГБ памяти и бесконечное терпение. Скорость ниже одного токена в секунду.
Единственный сценарий, где крупные модели на Ryzen 7 AI 350 имеют смысл, — это оффлайн-обработка больших документов, где скорость не критична. Запустить суммаризацию стостраничного отчёта и уйти на обед — работает. Вести живой диалог — нет.
Мультимодальные модели и специализированные задачи
Отдельно стоит сказать о мультимодальных моделях, которые принимают на вход не только текст, но и изображения. На Ryzen 7 AI 350 их запуск возможен, но с оговорками:
- LLaVA 7B и Qwen 2.5 VL 7B в Q4_K_M работают на скорости около 8–10 токенов в секунду для текстовой части. Обработка изображения добавляет 2–5 секунд на начальном этапе. Для анализа скриншотов, графиков, фотографий документов — вполне рабочий вариант.
- Moondream 2 (1,8B) — крошечная мультимодальная модель, которая на Ryzen 7 AI 350 генерирует 20+ токенов в секунду и при этом способна описывать изображения. Качество описаний базовое, но для автоматической разметки или быстрого анализа подходит.
Для специализированных задач — генерация кода, перевод, извлечение структурированных данных — я рекомендую использовать не универсальные модели, а заточенные под задачу варианты. Например, CodeLlama 7B или StarCoder2 7B для программирования, BART-based модели для суммаризации. Они часто работают быстрее и точнее универсальных аналогов на конкретной задаче.
Скорость генерации: бенчмарки и реальные цифры
Тесты в llama.cpp и Ollama
Я провёл серию замеров на ноутбуке с Ryzen 7 AI 350, 32 ГБ LPDDR5x-7500, в режиме максимальной производительности. Операционная система — Windows 11 24H2, версия llama.cpp — актуальная на сентябрь 2026. Все замеры в токенах в секунду (tok/s) для генерации после обработки промпта.
| Модель | Квантование | Размер файла | Скорость (tok/s) | Потребление (Вт) |
|---|---|---|---|---|
| Llama 3.2 1B | Q5_K_M | 0,9 ГБ | 35 | 18 |
| Llama 3.2 3B | Q5_K_M | 2,1 ГБ | 24 | 24 |
| Qwen 2.5 3B | Q5_K_M | 2,0 ГБ | 22 | 24 |
| Gemma 2 2B | Q5_K_M | 1,6 ГБ | 26 | 22 |
| Phi-4 Mini 3,8B | Q4_K_M | 2,3 ГБ | 20 | 26 |
| Llama 3.1 8B | Q4_K_M | 4,9 ГБ | 12 | 33 |
| Qwen 2.5 7B | Q4_K_M | 4,7 ГБ | 12 | 33 |
| Mistral 7B v0.3 | Q4_K_M | 4,4 ГБ | 13 | 32 |
| Gemma 2 9B | Q4_K_M | 5,5 ГБ | 9 | 35 |
| Llama 3.1 13B | Q4_K_M | 8,1 ГБ | 5 | 38 |
В Ollama результаты аналогичны с поправкой на один-два токена в секунду вниз, что объясняется накладными расходами их рантайма. В LM Studio цифры близки к llama.cpp, поскольку под капотом используется тот же движок.
Важная оговорка: все эти цифры получены при длине контекста 2048 токенов. При увеличении контекста до 8192 скорость генерации падает на 15–25 процентов из-за роста объёма KV-кэша, который тоже нужно держать в памяти и пересчитывать.
Влияние квантования на скорость и качество
Квантование — главный рычаг, которым вы управляете при работе с локальными моделями. Суть проста: веса модели хранятся не в 16-битном формате с плавающей точкой, а в целочисленном с меньшей разрядностью. Модель становится меньше и быстрее, но теряет часть точности.
На Ryzen 7 AI 350 я рекомендую следующую логику выбора:
- Q4_K_M — основной рабочий формат для моделей 7–13B. Потеря качества минимальна, выигрыш в скорости и памяти максимален.
- Q5_K_M — для моделей до 3B, где каждый бит качества на счету, а размер файла и так небольшой.
- Q6_K — если память позволяет и хочется чуть лучшее качество без перехода на Q8. Разница в скорости с Q5 составляет 5–8 процентов.
- Q8_0 — практически без потерь, но файл в два раза больше Q4. Имеет смысл для моделей до 3B или когда качество критично.
- Q3_K_M и ниже — только для очень крупных моделей, которые иначе не помещаются в память. Потеря качества уже заметна: появляются повторы, теряется логика рассуждения.
Практическое правило: если модель в Q4_K_M помещается в оперативную память с запасом хотя бы 2–3 гигабайта под систему и контекст — берите Q4. Если памяти впритык — опускайтесь до Q3, но будьте готовы к деградации текста.
Узкое горлышко — пропускная способность памяти
Вот ключевой момент, который многие упускают. Скорость генерации авто-регрессионной модели на CPU ограничена не количеством ядер и не их частотой, а тем, как быстро процессор может считать веса модели из оперативной памяти.
При генерации одного токена модели необходимо прочитать все свои веса из памяти. Для модели 7B в Q4_K_M это около 4,5 гигабайт данных на каждый токен. Если пропускная способность памяти составляет, скажем, 60 ГБ/с (типично для двухканального LPDDR5x-7500 в ноутбуке), то теоретический максимум скорости — 60 / 4,5 = 13 токенов в секунду. И это именно то, что мы видим в бенчмарках.
Отсюда практический вывод: объём оперативной памяти важен для вместимости модели, а её пропускная способность — для скорости генерации. Ноутбук с 32 ГБ LPDDR5x-7500 будет быстрее генерировать текст, чем ноутбук с 32 ГБ DDR5-4800, даже при одинаковом процессоре. Разница может достигать 20–30 процентов.
Это же объясняет, почему добавление ядер сверх определённого предела не помогает. Четыре ядра уже насыщают канал памяти. Восемь ядер дают прирост, но не двукратный. Шестнадцать потоков — почти ничего сверх восьми ядер.
Соседи по линейке: от Ryzen AI 5 330 до Ryzen AI 9 HX 370
Таблица сравнения ключевых параметров
| Параметр | AI 5 330 | AI 5 340 | AI 7 350 | AI 7 PRO 360 | AI 9 365 | AI 9 HX 370 |
|---|---|---|---|---|---|---|
| Ядра / потоки | 6/12 | 6/12 | 8/16 | 8/16 | 10/20 | 12/24 |
| Zen 5 / Zen 5c | 2/4 | 3/3 | 4/4 | 4/4 | 4/6 | 4/8 |
| Макс. частота | 4,9 ГГц | 4,9 ГГц | 5,0 ГГц | 5,0 ГГц | 5,0 ГГц | 5,1 ГГц |
| Кэш L3 | 16 МБ | 16 МБ | 16 МБ | 16 МБ | 24 МБ | 24 МБ |
| GPU | 840M (4 CU) | 840M (4 CU) | 860M (8 CU) | 860M (8 CU) | 880M (12 CU) | 890M (16 CU) |
| NPU TOPS | 50 | 50 | 50 | 50 | 50 | 50 |
| TDP (тип.) | 15–28 Вт | 15–28 Вт | 15–54 Вт | 15–54 Вт | 15–54 Вт | 15–54 Вт |
Что даёт прирост ядер и кэша для инференса
Глядя на таблицу, легко заметить: для LLM-инференса наиболее значимый скачок происходит при переходе от шести ядер к восьми. Это добавляет два полноценных потока для матричных операций и увеличивает параллелизм при обработке слоёв модели.
Переход с восьми ядер на десять или двенадцать даёт прирост в 5–12 процентов для моделей 7B и почти незаметен для моделей 3B и меньше. Причина та же: упор в память. Дополнительные ядра просто простаивают в ожидании данных.
Увеличение кэша L3 с 16 до 24 МБ у Ryzen AI 9 365 и HX 370 помогает для моделей до 3B, которые частично помещаются в кэш. Для семёрок и выше эффект минимален: 24 МБ кэша против 4,5 ГБ весов — капля в море.
Встроенная графика с большим число CU (12 и 16 у старших моделей) даёт чуть больше возможностей для GPU-оффлоадинга мелких моделей, но для серьёзного инференса по-прежнему не заменяет дискретную видеокарту.
Мой практический вывод: если бюджет ограничен и вы выбираете между Ryzen AI 5 340 и Ryzen AI 7 350, доплата за семёрку оправдана — вы получите 25–30 процентов прироста скорости на моделях 7B. А вот переплата за Ryzen AI 9 HX 370 ради LLM-задач смысла не имеет: эти деньги лучше вложить в 32 ГБ быстрой памяти.
Ryzen AI Max (Strix Halo): когда ноутбук превращается в рабочую станцию
Архитектурные отличия и 128 ГБ объединённой памяти
Если Strix Point — это массовый мобильный сегмент, то Strix Halo, вышедший под маркой Ryzen AI Max, — совсем другая лига. Я выделяю этот чип в отдельный раздел, потому что он кардинально меняет правила игры для локального AI.
Ryzen AI Max 395 (верхний SKU линейки) содержит:
- 16 ядер Zen 5, все полноразмерные, без компактных вариантов. 32 потока.
- Встроенная графика Radeon 8060S на 40 вычислительных блоков RDNA 3.5. Это уже уровень дискретных видеокарт начального-среднего сегмента.
- NPU XDNA 2 на те же 50 TOPS.
- Поддержка до 128 ГБ объединённой памяти LPDDR5x-8000.
Ключевое слово здесь — «объединённая». В отличие от обычных ноутбуков, где память делится между CPU и iGPU через контроллер, в Strix Halo реализована архитектура с единым адресным пространством. Процессор, графика и NPU обращаются к одному пулу памяти без копирования данных между буферами. Пропускная способность при этом достигает 256 ГБ/с.
LLM на Strix Halo: новый порядок цифр
Что это означает на практике? Модель, которая на Ryzen 7 AI 350 генерирует 12 токенов в секунду, на Ryzen AI Max 395 выдаёт 30–40 токенов в секунду. Но главное даже не скорость, а вместимость.
128 ГБ объединённой памяти позволяют загрузить:
- Llama 3.1 70B в Q4_K_M (около 40 ГБ) — со скоростью 6–8 токенов в секунду. Это уже уровень, на котором можно вести осмысленный диалог.
- Qwen 2.5 72B в Q4_K_M — аналогичные цифры.
- Mixtral 8x22B в Q3_K_M — около 5 токенов в секунду.
- Две-три модели 7–13B одновременно для разных задач.
Я тестировал Ryzen AI Max 395 в мобильной рабочей станции, и впечатление было сильным. Впервые на ноутбуке без дискретной видеокарты можно запустить семидесяти миллиардную модель и получить связный, быстрый ответ. Да, это не уровень RTX 4090 с её 80+ токенами в секунду на тех же моделях, но для мобильной платформы без внешнего GPU — прорыв.
Структура памяти также позволяет эффективно использовать iGPU для оффлоадинга части весов. В llama.cpp с Vulkan-бэкендом я распределял слои модели между CPU и iGPU и получал прирост 15–20 процентов по сравнению с чисто CPU-инференсом.
Стоимость устройств на Strix Halo высока: ноутбуки и мини-ПК на этой платформе в 2026 году стоят от двух с половиной до четырёх тысяч долларов. Это нишевый продукт для разработчиков, исследователей и тех, кому принципиально важен локальный AI без привязки к облаку. Но для этой аудитории он закрывает потребность, которую раньше удовлетворяла только настольная система с мощной видеокартой.
Программная экосистема для локального AI
llama.cpp и Ollama на AMD
llama.cpp остаётся золотым стандартом локального инференса на CPU. Проект активно развивается, поддерживает AVX-512, VNNI, AMX-инструкции (для Intel) и оптимизирован под ARM. На AMD Ryzen AI 300 работают все основные оптимизации для x86: AVX2, AVX-512 F/CD/BW/DQ/VL, AVX-512 VNNI для INT8-операций.
Для запуска на Ryzen 7 AI 350 я использую следующую команду в терминале:
llama-server -m model-q4_k_m.gguf --threads 8 --ctx-size 4096 --port 8080
Параметр —threads 8 привязывает вычисления к физическим ядрам. —ctx-size 4096 задаёт длину контекста; больше — медленнее из-за KV-кэша, но позволяет работать с длинными документами.
Ollama — надстройка над llama.cpp, которая упрощает управление моделями до одной команды. Ставится за минуту, подтягивает модели из реестра, запускает их в фоне. Для тех, кто не хочет возиться с настройками, это лучший вариант. На Ryzen AI 300 Ollama работает стабильно, единственное замечание: по умолчанию она использует все доступные потоки, что на ноутбуке приводит к лишнему шуму. В файле конфигурации Modelfile можно выставить параметр num_thread на 8.
ONNX Runtime и Ryzen AI Software
Ryzen AI Software — это пакет AMD для разработчиков, который предоставляет доступ к NPU через ONNX Runtime. В 2026 году он поддерживает:
- Запуск ONNX-моделей на NPU для задач классификации, детекции, сегментации.
- Гибридный режим: часть модели на CPU, часть на NPU.
- Интеграцию с Python через пакет onnxruntime-ryzen-ai.
Для LLM-инференса этот путь пока не готов. Причина в том, что NPU XDNA 2 не поддерживает динамическое управление памятью, необходимое для KV-кэша авто-регрессионных моделей. Вы можете запустить энкодер небольшой модели на NPU, но полноценную генерацию текста на 7B через NPU выполнить не получится.
Тем не менее для вспомогательных задач — эмбеддинг, классификация намерений, извлечение именованных сущностей — ONNX Runtime на NPU работает отлично и потребляет 1–2 Вт вместо 15–20 Вт на CPU. Если ваш рабочий процесс включает такие подзадачи, имеет смысл вынести их на NPU, а основную LLM крутить на ядрах.
LM Studio, GPT4All и другие оболочки
Для тех, кто предпочитает графический интерфейс:
- LM Studio — удобный комбайн с каталогом моделей, встроенным бенчмарком и чат-интерфейсом. Под капотом тот же llama.cpp. На Ryzen 7 AI 350 работает стабильно, позволяет визуально подбирать параметры квантования и контекста.
- GPT4All — ещё одна оболочка с акцентом на приватность. Каталог моделей меньше, чем у LM Studio, но интерфейс проще. Подходит для тех, кому нужен «просто чат без настроек».
- Jan — открытый аналог с поддержкой различных бэкендов. Менее зрелый, но быстро развивается.
Все перечисленные инструменты на Ryzen AI 300 дают примерно одинаковую скорость генерации, поскольку используют общий движок. Разница — в удобстве и дополнительных функциях.
Linux-поддержка: что работает, что нет
На Linux ситуация к сентябрю 2026 года следующая:
- llama.cpp работает безупречно. Собирается из исходников за две минуты, поддерживает все оптимизации AVX-512. В Ubuntu 24.04 и Fedora 41 все зависимости ставятся из репозиториев.
- Ollama имеет нативный Linux-клиент. Работает как сервис в фоне, управляется через CLI. На Ryzen 7 AI 350 — без проблем.
- NPU XDNA 2 поддерживается через экспериментальный драйвер amdxdna в ядре Linux начиная с версии 6.10. К сентябрю 2026 года он стабилизирован в основных дистрибутивах, но экосистема вокруг него бедная. Запустить простую ONNX-модель можно, но документации мало, а отладка требует терпения.
- ROCm для iGPU на мобильных чипах AMD по-прежнему не поддерживается полноценно. Vulkan-бэкенд в llama.cpp — единственный путь использовать iGPU для инференса на Linux.
Если вы планируете серьёзно работать с локальными моделями на Linux, я рекомендую связку: Ubuntu 24.04 LTS + llama.cpp, собранный с флагами -march=native. Это даёт максимальную производительность и минимум проблем.
Оптимизация инференса на Ryzen AI 300
Квантование: выбор формата под задачу
Я уже касался темы квантования в разделе бенчмарков, но здесь дам более детальную практическую схему.
Для Ryzen 7 AI 350 с 32 ГБ оперативной памяти:
| Задача | Модель | Квантование | Обоснование |
|---|---|---|---|
| Быстрый чат-ассистент | Llama 3.2 3B | Q5_K_M | Скорость важнее, модель и так небольшая |
| Работа с русским текстом | Qwen 2.5 7B | Q4_K_M | Баланс качества и скорости |
| Генерация кода | CodeLlama 7B / StarCoder2 7B | Q4_K_M | Точность синтаксиса критична, но модель 7B в Q4 даёт достаточно |
| Суммаризация документов | Mistral 7B | Q4_K_M | Контекст 8K, скорость важнее нюансов |
| Перевод | Qwen 2.5 7B | Q5_K_M | Чуть лучшее качество за счёт меньшего сжатия |
| Мультимодальный анализ | LLaVA 7B | Q4_K_M | Стандартный выбор |
| Максимальное качество | Qwen 2.5 14B | Q3_K_M | Терпимо по скорости, заметно по качеству |
Если у вас 16 ГБ памяти, вычитайте 4 ГБ на систему и получите 12 ГБ рабочего пространства. Этого хватает для моделей до 8B в Q4_K_M. Тринадцатимиллиардные модели уже не влезут без агрессивного Q3, а качество при этом страдает.
Настройка потоков и привязка к ядрам
На Ryzen 7 AI 350 оптимальная конфигурация потоков для инференса:
- 8 потоков для моделей 7B и выше. Привязка к четырём ядрам Zen 5 через numactl (Linux) или через утилиту процессора в диспетчере задач (Windows). Ядра Zen 5c при этом остаются свободными для фоновых задач.
- 6 потоков для моделей до 3B. Достаточно для насыщения, а меньшая нагрузка означает меньший нагрев.
- 4 потока для моделей 1–1,5B. Больше не нужно, упор в последовательную зависимость операций.
В Windows привязку можно выставить через командную строку: start /AFFINITY 0xF llama-server.exe ..., где маска 0xF соответствует первым четырём физическим ядрам. В Linux: numactl --cpunodebind=0 --physcpubind=0-3 llama-server ....
Я экспериментировал с разными конфигурациями и обнаружил неочевидный эффект: при работе от батареи ограничение до четырёх потоков снижает энергопотребление на 30–40 процентов при потере скорости всего на 15–20 процентов. Для мобильного сценария «дописать текст в поезде» это разумный компромисс.
Работа с контекстным окном
Контекстное окно определяет, сколько текста модель «помнит» в рамках одного диалога. На Ryzen 7 AI 350 я рекомендую следующие настройки:
- 2048 токенов для быстрого чата и коротких запросов. Минимальный расход памяти на KV-кэш.
- 4096 токенов для работы с документами среднего размера. Баланс скорости и функциональности.
- 8192 токенов для анализа длинных текстов. Скорость падает на 20–25 процентов, но для разовых задач терпимо.
- Более 8192 — не рекомендую. На 7B-модели KV-кэш для 16K контекста занимает около 1,5 ГБ дополнительной памяти, а скорость генерации снижается на 35–40 процентов.
Практический совет: если вам нужно обработать документ длиннее контекстного окна, используйте технику скользящего окна или иерархической суммаризации. Разбейте документ на фрагменты по 3000 токенов, суммаризируйте каждый, затем суммаризируйте набор промежуточных итогов. На Ryzen 7 AI 350 это работает и даёт приемлемый результат.
Роль NPU и iGPU в конвейере
Подведу итог по распределению нагрузки на Ryzen 7 AI 350:
- CPU (Zen 5 / Zen 5c): основная генерация текста. 90–95 процентов работы по инференсу.
- iGPU (Radeon 860M): опциональный оффлоад части весов для моделей до 3B. Прирост 10–20 процентов. Для моделей 7B и выше нецелесообразен.
- NPU (XDNA 2): фоновые задачи, не связанные с генерацией. Шумоподавление, распознавание речи, обработка видео. Для LLM в 2026 году не используется.
В идеальном рабочем процессе на одном ноутбуке эти три блока работают параллельно: CPU генерирует текст, NPU обрабатывает аудио с микрофона для голосового ввода, iGPU рендерит интерфейс. Ни один блок не простаивает, и ни один не становится бутылочным горлышком для другого.
Следующий шаг AMD: дорожная карта на 2026–2027
XDNA 3 и рост TOPS
AMD не скрывает, что текущее поколение NPU — промежуточное. Архитектура XDNA 2 проектировалась в первую очередь для задач компьютерного зрения и обработки сигналов, а не для генеративного AI. В следующей итерации, XDNA 3, компания обещает:
- Увеличение пиковой производительности до 100+ TOPS при INT8.
- Поддержку динамического управления памятью, что теоретически откроет путь к запуску LLM на NPU.
- Аппаратное ускорение операций внимания (attention), которые являются вычислительным ядром трансформеров.
- Расширение локальной SRAM на кристалле для хранения KV-кэша.
По имеющимся данным, XDNA 3 войдёт в состав процессоров следующего поколения, которые ожидаются в конце 2026 или начале 2027 года. Это означает, что реальные устройства с обновлённым NPU появятся на полках не раньше весны-лета 2027 года.
Важно понимать: даже при 100 TOPS и аппаратном ускорении внимания, запуск полноценных 7B-моделей на NPU маловероятен в ближайшие два поколения. Объём весов модели в 4 ГБ просто не помещается в локальную память NPU, а гонять их через общую шину каждый такт — значит убить всю идею энергоэффективности. Скорее всего, NPU будет использоваться для малых моделей (до 1–2B) и для вспомогательных операций внутри конвейера генерации.
Ryzen AI 400 и переход на Zen 6
Следующее поколение мобильных процессоров AMD, ожидаемое в 2027 году, должно принести:
- Ядра Zen 6 с улучшенным предсказанием ветвлений и расширенной поддержкой AI-инструкций. Ожидается добавление новых векторных расширений, оптимизированных для INT4 и INT2 квантования.
- Графику RDNA 4 во встроенном исполнении. Для инференса это означает более производительный Vulkan-бэкенд и, возможно, аппаратную поддержку матричных операций в стиле Tensor Core.
- Память LPDDR6 с пропускной способностью до 300 ГБ/с. Это ключевое улучшение для LLM: при той же модели 7B в Q4 теоретический максимум скорости вырастет с 13 до 20+ токенов в секунду только за счёт памяти.
- Обновлённый контроллер памяти с поддержкой большего числа каналов.
Кодовое имя платформы пока не подтверждено официально, но в отраслевых обсуждениях фигурирует обозначение «Strix Point 2» или «Medusa Point». В любом случае, переход на новый техпроцесс (ожидается 3 нм или улучшенный 4 нм) позволит увеличить число ядер при сохранении теплового пакета.
Стратегия AMD в локальном AI
Если смотреть на стратегию AMD в целом, прослеживается чёткий вектор: компания хочет сделать локальный AI такой же стандартной функцией ноутбука, как Wi-Fi или Bluetooth. Для этого:
- NPU в каждом SKU, начиная с бюджетного сегмента. Уже в линейке 2025 года нет процессоров Ryzen AI без NPU.
- Открытая программная экосистема. AMD активно поддерживает llama.cpp, ONNX Runtime, PyTorch. В отличие от некоторых конкурентов, нет привязки к проприетарному стеку.
- Партнёрство с Microsoft. Требования Copilot+ PC стимулируют производителей ноутбуков ставить чипы с мощным NPU, и AMD здесь в выигрышной позиции.
- Ryzen AI Max как витрина. Дорогой, но впечатляющий продукт, который показывает, на что способна платформа без дискретного GPU.
Мой прогноз: к концу 2027 года типичный ноутбук на Ryzen AI будет запускать 7B-модель на 25–30 токенов в секунду, а 14B-модель — на 12–15. Это сделает локальный AI полноценной альтернативой облачным сервисам для большинства повседневных задач.
Ответ Intel: Lunar Lake, Arrow Lake, Panther Lake
Core Ultra 200V (Lunar Lake): NPU на 48 TOPS
Intel Lunar Lake, вышедший осенью 2024 года и активно продающийся в 2025–2026, — прямой конкурент Ryzen AI 300 в сегменте тонких ультрабуков.
Ключевые характеристики для AI:
- NPU четвёртого поколения с пиковой производительностью 48 TOPS. Чуть меньше, чем у AMD (50 TOPS), но разница несущественна.
- Ядра Lion Cove (P-cores) и Skymont (E-cores). До четырёх производительных и четырёх энергоэффективных ядер. Для LLM-инференса это слабее, чем восемь полноценных Zen 5 у Ryzen 7 AI 350.
- Графика Arc 140V на архитектуре Xe2. Восемь Xe-ядер. Для инференса через Vulkan или oneAPI может дать ускорение на малых моделях.
- Память на кристалле (MCM-дизайн): до 32 ГБ LPDDR5x-8533, распаянных прямо на подложке процессора. Пропускная способность — около 136 ГБ/с.
На практике в задачах LLM-инференса Lunar Lake уступает Ryzen 7 AI 350. Причина проста: четыре производительных ядра против восьми у AMD. При запуске Llama 3.1 8B в Q4_K_M я фиксировал на Core Ultra 7 258V скорость около 8–9 токенов в секунду против 12 на Ryzen 7 AI 350. Для моделей 3B разрыв меньше: 18 против 24 токенов в секунду.
Зато у Lunar Lake есть преимущество в энергоэффективности: при той же нагрузке он потребляет на 20–30 процентов меньше. Для ультрабука с маленькой батареей это критично. Но если задача — максимальная скорость генерации, AMD выигрывает.
Core Ultra 200H/S (Arrow Lake): десктопный и мобильный AI
Arrow Lake — более производительная линейка, ориентированная на ноутбуки с полноценным охлаждением и на десктопы. В мобильном варианте (серия H) и десктопном (серия S) она предлагает:
- До 16 ядер (6 P-cores + 8 E-cores + 2 LP E-cores) в мобильном варианте и до 24 ядер (8 P + 16 E) в десктопном.
- Графика Arc Xe2 с 4–8 Xe-ядрами.
- NPU четвёртого поколения на 13–38 TOPS в зависимости от SKU. Десктопные версии имеют меньший NPU или не имеют его вовсе.
- Поддержка DDR5-6400 в десктопном варианте и LPDDR5x-7467 в мобильном.
Для LLM-инференса десктопный Arrow Lake интересен большим числом ядер и высокой пропускной способностью памяти. Но отсутствие мощного NPU и менее эффективная архитектура E-ядер (которые для матричных операций почти бесполезны) делают его уступающим Ryzen AI в мобильном сегменте.
В десктопе картина иная: 24 ядра и 128 ГБ DDR5 дают достаточно ресурсов для запуска крупных моделей. Но тут конкуренция идёт уже не с ноутбуками, а с дискретными GPU, и без видеокарты уровня RTX 4070 и выше процессорный инференс проигрывает по всем статьям.
Panther Lake и NPU пятого поколения
На 2026–2027 годы Intel готовит Panther Lake — следующее поколение мобильных процессоров, которое должно стать прямым ответом на Ryzen AI 400. Известные и ожидаемые характеристики:
- Техпроцесс 18A (1,8 нм по классификации Intel). Первый продукт на новом техпроцессе компании.
- Ядра нового поколения (предположительно, развитие архитектуры после Lion Cove).
- NPU пятого поколения с целевой производительностью 75–100 TOPS.
- Интеграция памяти по схеме, аналогичной Lunar Lake, но с переходом на LPDDR6.
- Расширенные инструкции AMX (Advanced Matrix Extensions) для ускорения INT8 и FP16 операций на CPU.
Главный вопрос вокруг Panther Lake — сможет ли Intel реализовать техпроцесс 18A в срок и с приемлемым выходом годных кристаллов. На сентябрь 2026 года первые инженерные образцы уже тестируются, но массовые продукты ожидаются не раньше второго квартала 2027 года.
Открытая экосистема OpenVINO
Intel делает ставку на программную экосистему как конкурентное преимущество. Набор инструментов OpenVINO включает:
- Компилятор моделей, который оптимизирует граф вычислений под конкретное железо (CPU, GPU, NPU).
- Runtime с поддержкой динамических форм и авто-регрессионной генерации.
- Интеграцию с llama.cpp через бэкенд: часть операций можно выполнять через OpenVINO, часть — через нативный код llama.cpp.
- Поддержку квантования на лету (динамическое квантование весов при загрузке модели).
На практике я пробовал запускать модели через OpenVINO на Core Ultra 258V и получил прирост 10–15 процентов по сравнению с чистым llama.cpp для моделей до 3B. Для 7B и выше разница нивелируется, потому что упор снова уходит в память.
Тем не менее, для тех, кто уже работает в экосистеме Intel и использует OpenVINO для других задач (компьютерное зрение, обработка речи), интеграция с локальным LLM-инференсом через тот же стек удобна. Это снижает порог входа и упрощает поддержку.
Сравнение платформ для локального LLM-инференса в 2026 году
Сводная таблица
| Критерий | Ryzen 7 AI 350 | Ryzen AI 9 HX 370 | Ryzen AI Max 395 | Core Ultra 258V | Core Ultra 9 285H |
|---|---|---|---|---|---|
| Ядра CPU | 8 (4+4) | 12 (4+8) | 16 Zen 5 | 8 (4P+4E) | 16 (6P+8E+2LP) |
| NPU TOPS | 50 | 50 | 50 | 48 | 38 |
| Память (тип.) | 32 ГБ LPDDR5x | 32 ГБ LPDDR5x | 128 ГБ LPDDR5x | 32 ГБ на кристалле | 64 ГБ DDR5/LPDDR5x |
| Пропуск. способность | ~60 ГБ/с | ~60 ГБ/с | ~256 ГБ/с | ~136 ГБ/с | ~90–120 ГБ/с |
| Llama 3.2 3B Q5 (tok/s) | 24 | 28 | 55 | 18 | 20 |
| Llama 3.1 8B Q4 (tok/s) | 12 | 14 | 35 | 9 | 11 |
| Llama 3.1 70B Q4 | Нет | Нет | 7 | Нет | Нет |
| Энергопотребление при инференсе | 25–35 Вт | 30–40 Вт | 45–65 Вт | 15–25 Вт | 35–55 Вт |
Где каждая платформа сильнее
Ryzen 7 AI 350 — оптимум для мобильного локального AI в ценовом сегменте до 1200 долларов. Восемь ядер, 50 TOPS NPU, быстрая память. Если вам нужна рабочая лошадка для 3–8B моделей в дороге и дома, это лучший выбор по соотношению цена/качество.
Ryzen AI 9 HX 370 — для тех, кто параллельно с инференсом занимается компиляцией кода, рендерингом или другими многопоточными задачами. Дополнительный запас ядер не даёт радикального прироста для LLM, но в смешанных нагрузках оправдан.
Ryzen AI Max 395 — нишевый, но уникальный продукт. Единственный мобильный процессор, на котором реально крутить 70B-модель без дискретной видеокарты. Для исследователей и разработчиков, которым нужен максимум локального AI в портативном формате.
Core Ultra 258V (Lunar Lake) — чемпион энергоэффективности. Если приоритет — работа от батареи, а инференс нужен эпизодически и для небольших моделей, это разумный выбор. Но по чистой скорости генерации уступает


Добавить комментарий