Skip to content
Alibaba выпустила открытую модель Qwen3.8-2.4T-A95B с 2,4 трлн параметров
15 августа 22:40 2 Просмотров Новости

Alibaba выпустила открытую модель Qwen3.8-2.4T-A95B с 2,4 трлн параметров

Команда Qwen из Alibaba Cloud официально выпустила в открытый доступ флагманскую модель Qwen3.8-2.4T-A95B (также именуемую Qwen3.8-Max) — впервые в истории компании веса модели класса Max стали доступны для скачивания и самостоятельного запуска. Анонс состоялся 13 августа 2026 года, а сама модель представлена 3 августа. На данный момент среди открытых LLM больше параметров имеет только Kimi K3 с 2,8 трлн. логотип модели Qwen3.8-2.4T-A95B

Архитектура: 512 экспертов и гибридное внимание

Модель построена по архитектуре Mixture-of-Experts (MoE): общий объём составляет 2,4 триллиона параметров, распределённых между 512 специализированными блоками («экспертами»). При обработке каждого токена активируется около 95 млрд параметров — десять маршрутизируемых экспертов и один общий. Это делает инференс вычислительно дешевле, чем у плотной модели сравнимого размера, но не снимает требование разместить всю модель в видеопамяти целиком, так как маршрутизатор может обратиться к любому эксперту.

Основа — архитектура Qwen3.5 с механизмами DeltaNet и Gated Attention. Они экономят вычисления при работе с длинным контекстом за счёт гибридной схемы внимания, сочетающей линейное и полное внимание. Нативное контекстное окно — 262 144 токена, с расширением до 1 010 000 токенов (в облачной версии Qwen3.8-Max заявлено до 1 млн). Отдельная настройка позволяет менять интенсивность рассуждений в зависимости от задачи. архитектура Mixture-of-Experts модели Qwen3.8

Назначение и результаты тестов

Qwen3.8-2.4T-A95B ориентирована на программирование, исследовательские задачи и сложные агентные сценарии, требующие длительной автономной работы. В одном из внутренних тестов модель работала десять дней подряд и написала CLI-инструмент для автономного ИИ-агента вроде Claude Code.

По опубликованным командой бенчмаркам модель заметно обогнала Qwen3.7-Max в PaperBench, ERQA, PerceptionBench и OSWorld-Verified. В пользовательском рейтинге AI Arena по веб-разработке Qwen 3.8-Max заняла третье место после Claude Opus 5 и Kimi K3. В некоторых тестах на кодирование она приблизилась к Opus 4.8 от Anthropic. Для сравнения с закрытыми фронтир-моделями компания приводит результаты против Claude Opus 4.8 и GPT-5.6 Sol. По данным Artificial Analysis, в общем рейтинге открытых моделей Qwen3.8-Max занимает шестое место после Kimi K3.

Железные реалии: от кластеров до квантования

Полные веса в формате BF16 занимают около 4,8 Тбайт. Ни один сервер с восемью ускорителями, даже на новейших NVIDIA B200 с 192 Гбайт памяти на карту, такое не вместит — нужно порядка 25 ускорителей только на веса без запаса под контекст и промежуточные вычисления. На практике это кластер из 4–5 узлов по 8 ускорителей класса B200/H200, объединённых быстрой сетью для распределённого инференса.

  • BF16 (без потерь) — ~4,8 Тбайт, кластер 4–5 узлов по 8×B200/H200;
  • 4-битное квантование — ~1,2 Тбайт, укладывается в один узел с 8 картами по 192 Гбайт, но впритык, без запаса под контекст;
  • 8 ускорителей на 80 Гбайт (H100) для 4-битной версии уже не хватает — нужны карты нового поколения с памятью от 141 Гбайт.

По расчётам проекта Vram Calculator, для запуска квантованной версии Q4_K_M потребуется 1674,8 ГБ VRAM при контексте 8 токенов, 1703 ГБ — для 256 тысяч токенов, и 1788 ГБ — для 1 млн токенов. Официальных рекомендаций по железу Alibaba не публикует, но выпустила рецепты для фреймворков vLLM и SGLang с поддержкой распределённого инференса — явно ориентируясь на облачных провайдеров и крупные ИИ-команды, а не на энтузиастов с одной видеокартой. серверный кластер для запуска Qwen3.8-2.4T-A95B

Доступность, лицензия и планы

Веса Qwen3.8-2.4T-A95B уже доступны на Hugging Face и ModelScope. Лицензия имеет коммерческие ограничения для крупных провайдеров облачных услуг и сервисов MaaS (Model-as-a-Service), что отличает её от пермиссивных лицензий вроде Apache 2.0. Параллельно Alibaba предлагает облачную Qwen3.8-Max — она умеет работать с изображениями, поддерживает контекст до 1 млн токенов и встроенные инструменты. Модель добавлена в бесплатный ИИ-инструмент Qwen Studio и облачную платформу Qwen Cloud для агентного программирования: там бесплатно доступно использование максимум 1 млн токенов, затем нужен API-ключ.

Компания обещает в будущем выложить веса сжатой версии Qwen 3.8-27B на 27 млрд параметров, адаптированной под локальный запуск на потребительском оборудовании. По мнению экспертов DigitalRazor, флагманская модель — демонстрация возможностей, а не инструмент для типового корпоративного внедрения: для большинства российских интеграторов и бизнес-кейсов практичнее присмотреться к более компактным версиям линейки Qwen. интерфейс Qwen Studio с моделью Qwen3.8-Max

Поделиться

Похожие публикации