NVIDIA ускорила локальный AI на RTX и DGX: Muse Glimmer выдает 200+ токенов/с на RTX 5090

NVIDIA расширила возможности локального AI на системах RTX и DGX. Компания добавила поддержку новых открытых моделей, оптимизировала генерацию видео в LTX-2.5 и представила инструменты для объединения нескольких DGX Spark в кластер. Один из самых заметных результатов — более 200 токенов в секунду при запуске Meta Muse Glimmer на одной GeForce RTX 5090.
Meta Muse Glimmer — модель с открытыми весами на 30 млрд параметров, рассчитанная в том числе на программирование и работу AI-агентов. По данным NVIDIA, на RTX 5090 она способна выдавать более 200 токенов в секунду. При этом модель можно использовать локально: она умеет работать с файлами, документами, почтой и сообщениями, выполнять цепочки действий и обращаться к инструментам без необходимости отправлять чувствительные данные в облако.
Для Muse Glimmer заявлены и более сложные сценарии: создание специализированных агентов под конкретные задачи, работа с API-ключами и токенами авторизации на устройстве, выполнение многошаговых операций и продолжительных задач с возможностью восстановить прерванную сессию.
Не менее заметное обновление получила LTX-2.5 — открытая модель для генерации видео. В ней появился дополнительный диффузионный декодер видео, который работает вместе с декодером на основе вариационного автоэнкодера (VAE) и должен улучшать качество финального результата.
LTX-2.5 оптимизирована для NVIDIA RTX, DGX Spark и DGX Station. В первичном анонсе NVIDIA приводит конкретные показатели для RTX PRO 6000 с 96 ГБ памяти: до 20% выше производительность при генерации видео и до 40% меньше потребление памяти. Для локальной работы также доступны оптимизации NVFP4 и FastVideo и готовый workflow для ComfyUI с поддержкой генерации из текста и изображений, а также преобразования видео.
Одновременно NVIDIA выделила ряд новых открытых моделей и моделей с открытыми весами, которые можно запускать или использовать с оптимизациями для ее платформ. Ранее компания также развивала это направление через Nemotron 3 Ultra. В новый список вошли:
- Cosmos 3 Edge — 4 млрд параметров;
- MiniMax-H3 — 33 млрд параметров;
- Poolside Laguna S 2.1 — 118 млрд параметров;
- DeepSeek V4-Flash — 284 млрд параметров;
- Wan-Animate-2 — 14 млрд параметров;
- Thinking Machines Lab Inkling-Small — 276 млрд параметров.
Отдельные цифры NVIDIA приводит для Wan-Animate-2 — модели, которая переносит движения и мимику из исходного видео на статичное изображение персонажа. В этом конкретном сценарии RTX 5090 заявлена до 26 раз быстрее Apple M3 Ultra, а RTX PRO 5000 Blackwell — до 16 раз быстрее. Эти показатели относятся именно к Wan-Animate-2, а не к общей производительности видеокарт и компьютеров.
Еще одно направление — Unsloth Desktop. Это приложение с открытым исходным кодом объединяет локальный запуск моделей, генерацию изображений и видео, дообучение моделей, интеграцию AI-агентов, поиск информации в интернете и выполнение кода. По сообщению NVIDIA от 11 августа, запуск Unsloth Desktop запланирован на понедельник, 17 августа.
Изменения затронули и DGX Spark. Cluster Assistant в NVIDIA Sync позволяет объединять два и более компьютера DGX Spark в высокоскоростной кластер, увеличивая доступную память, производительность инференса и пропускную способность при обучении крупных моделей. Сервис автоматически настраивает сеть между системами, распределяет нагрузки по узлам и контролирует состояние кластера.
Еще два обновления для DGX Spark NVIDIA планирует выпустить позже в августе. Google Chrome получит нативную ARM64-версию для Linux с установкой через DGX Dashboard, а NVIDIA Sync Resource Monitor позволит отслеживать текущую и историческую загрузку CPU и GPU как отдельного DGX Spark, так и всего кластера.
В итоге NVIDIA продолжает двигать RTX и DGX в сторону полностью локальной работы с AI. Речь уже не только о запуске языковой модели: на одном компьютере можно строить AI-агентов, обрабатывать приватные документы, генерировать видео и дообучать модели, а при нехватке ресурсов — объединять несколько DGX Spark. Параллельно компания развивает отдельную платформу RTX Spark для Arm-ПК и компактных рабочих станций.
Заявленные показатели вроде 200+ токенов в секунду на RTX 5090, 26-кратного преимущества над Apple M3 Ultra или 20-процентного ускорения LTX-2.5 стоит воспринимать как результаты NVIDIA для конкретных сценариев и оборудования, а не как универсальное сравнение производительности систем.
Источники: NVIDIA, Meta AI.