Qwen 3.8 Max вышел: что нового, API и характеристики

Qwen 3.8 Max
Qwen3.8-Max
Qwen 3.8 API
Qwen 3.8 характеристики
Qwen 3.8 локально

Обновлено 4 августа 2026 года.

Alibaba выпустила Qwen3.8-Max — новую флагманскую модель Qwen с нативным пониманием текста и изображений, MoE-архитектурой на 2,4 трлн параметров и контекстом до 1 млн токенов. Production-модель с ID qwen3.8-max появилась 3 августа, спустя две недели после preview. Она доступна через Alibaba Cloud Model Studio в Пекине, Сингапуре, Токио, Франкфурте и Вирджинии.

Коротко: Qwen 3.8 Max — облачная мультимодальная модель для сложных рассуждений, программирования и AI-агентов. Она поддерживает function calling, встроенные инструменты и OpenAI-совместимый API. Но публичной цены pay-as-you-go и скачиваемых весов в официальных материалах на 4 августа мы не нашли, поэтому миграцию лучше начинать с измеряемого пилота.

Эта статья для разработчиков и руководителей AI-проектов. Мы разбираем официальный облачный релиз Max, а не старую модель Qwen3-8B и не отдельные будущие модели семейства 3.8.

Содержание

Что именно выпустила Alibaba

История релиза состоит из двух этапов. 19 июля 2026 года Alibaba открыла qwen3.8-max-preview внутри Token Plan. Preview могла обновляться без фиксации поведения и после завершения теста должна была исчезнуть или смениться production-версией.

3 августа 2026 года в официальном журнале QwenCloud появился qwen3.8-max. Документация называет его самой сильной флагманской моделью Qwen на момент релиза и подтверждает четыре базовые характеристики: нативную vision-language архитектуру, MoE, 2,4 трлн общих параметров и контекст 1 млн токенов.

Важно не смешивать два ID:

  • qwen3.8-max-preview — июльская тестовая версия с меняющимся поведением;
  • qwen3.8-max — production-модель, опубликованная 3 августа.

Параметры и доступность меняются быстро. Для production-интеграции следует фиксировать модель в конфигурации и прогонять регрессионный набор после каждого обновления плавающего ID.

Характеристики Qwen 3.8 Max

Характеристика Qwen3.8-Max
Разработчик Alibaba, команда Qwen
Дата production-релиза 3 августа 2026 года
Архитектура Mixture-of-Experts, 2,4 трлн общих параметров
Вход текст и изображения
Контекст до 1 млн токенов
Режим мышления гибридный, включён по умолчанию
Function calling поддерживается
Встроенные инструменты web search, code interpreter, web extractor и поиск изображений
Структурированный вывод поддерживается
API OpenAI-compatible, Anthropic-compatible и DashScope
Регионы Пекин, Сингапур, Токио, Франкфурт, Вирджиния
Открытые веса не найдены в официальных репозиториях на 4 августа

Контекст в 1 млн токенов — это верхний технический лимит, а не рекомендация отправлять весь репозиторий в каждом запросе. Длинный вход повышает задержку и стоимость, а лишние файлы могут ухудшить фокус модели. Для большинства задач разумнее сначала отобрать нужные модули поиском или RAG, а затем передать компактный контекст.

Число 2,4 трлн тоже нельзя напрямую переводить в качество. MoE активирует для каждого токена часть экспертов, а Alibaba пока не указала число активных параметров в кратком журнале релиза. Сравнивать модель стоит по завершённым задачам, затратам и частоте ошибок, а не по размеру сети.

Что изменилось по сравнению с Qwen 3.7

Возможность Qwen3.7-Max Qwen3.8-Max
Позиционирование флагман для reasoning и автономного выполнения новый самый сильный флагман Qwen
Мультимодальный вход поздние версии получили visual understanding native vision-language модель
Контекст 1 млн токенов 1 млн токенов
Thinking budget до 256 тыс. токенов в документации 3.7 до 262 144 через уровень xhigh
Инструменты function calling и встроенные tools те же классы tools плюс акцент на сложные агентные задачи
Официальная оценка базовая точка сравнения Alibaba заявляет заметный рост относительно 3.7

Последняя строка — оценка поставщика, а не независимый результат AI рассвет. В руководстве Model Studio Alibaba рекомендует 3.8 Max для самых сложных рассуждений, а более дешёвый 3.7 Plus — как сбалансированный вариант для массовых задач. Это полезная продуктовая граница: Max нужен не каждому запросу.

Практичная маршрутизация выглядит так: классификация, извлечение и короткие ответы уходят в Flash или Plus; архитектурные решения, длинные агентные циклы и сложная отладка — в Max. Такой каскад обычно важнее, чем выбор одной модели для всего продукта.

Для каких задач подходит модель

Qwen 3.8 Max стоит тестировать там, где ошибка дорогая, а задача требует нескольких шагов:

  • анализ большого репозитория и изменение нескольких связанных модулей;
  • поиск причин сбоя по коду, логам, скриншотам и документации;
  • подготовка отчёта по таблицам, диаграммам и текстовым источникам;
  • агентные сценарии с поиском в интернете, исполнением кода и вызовом внутренних функций;
  • генерация интерфейса по скриншоту или макету;
  • длинные рабочие сессии, где важен контекст прошлых решений.

Модель не заменяет обвязку агента. Права на инструменты, подтверждение опасных операций, защита секретов и журнал действий остаются задачей приложения. Мы подробно разбирали этот слой в материале о защите AI-чата и ИИ-агентов.

Для простого FAQ-бота, массовой классификации или краткого пересказа Qwen 3.8 Max может оказаться избыточным. В таких задачах нужно сравнить её с Qwen3.7-Plus и Flash по цене одного правильного ответа.

Как подключить Qwen 3.8 Max по API

В официальном списке моделей указаны OpenAI-compatible, Anthropic-compatible и DashScope-интерфейсы. Для OpenAI SDK нужны три изменения: API-ключ Alibaba Cloud, региональный base_url и имя модели qwen3.8-max.

Минимальная последовательность:

  1. Создайте workspace и API-ключ в Model Studio.
  2. Выберите ближайший регион и скопируйте его OpenAI-compatible Base URL.
  3. Передайте model="qwen3.8-max" в Chat Completions или Responses API.
  4. Ограничьте reasoning для первой серии тестов.
  5. Записывайте входные, выходные и reasoning-токены отдельно.

Для Сингапура Base URL имеет вид https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1. Код, уже использующий OpenAI SDK, можно оставить прежним: меняются api_key, base_url и model.

В production не храните ключ в исходниках. Положите его в менеджер секретов, задайте лимиты на запрос, таймаут и максимальный ответ, а вызовы инструментов проверяйте на стороне приложения.

Что важно знать о reasoning

В документации OpenAI-совместимого API для Qwen 3.8 указаны три уровня reasoning_effort:

Уровень Эквивалентный thinking budget Когда использовать
low 4 096 токенов простые правки и короткий анализ
medium 16 384 токена обычные инженерные задачи
xhigh до 262 144 токенов сложное планирование и длинная отладка

Если параметр не задан, документация указывает default thinking budget 131 072 токена и уровень xhigh. Это может неожиданно увеличить задержку и расход квоты. Для пилота лучше начать с medium, а xhigh включать только на задачах, где он даёт измеримый прирост.

Вторая особенность — preserve_thinking, включённый для 3.8 по умолчанию. В многоходовом диалоге приложение должно возвращать исторический reasoning_content в одноимённом поле, а не склеивать его с обычным content. Эти токены снова входят во входной объём и тарифицируются. Если ваша библиотека отбрасывает reasoning history, проверьте поведение длинных агентных сессий отдельно.

Сколько стоит Qwen 3.8 Max

На момент проверки 4 августа 2026 года production-модель уже присутствовала в официальном каталоге, но отдельной строки qwen3.8-max в публичной таблице pay-as-you-go цен не было. Поэтому точную цену за 1 млн токенов мы не приводим.

Preview доступна через Token Plan. Международный Token Plan для разработчиков начинается с $6 в месяц по временной цене; квота списывается в Credits и зависит от модели, числа токенов, reasoning и инструментов. Это не то же самое, что фиксированная цена production API за миллион токенов.

Перед запуском проверьте карточку модели в своём регионе. В смету включайте:

  • входные и выходные токены;
  • reasoning-токены;
  • повторно передаваемую историю;
  • вызовы встроенных инструментов;
  • неудачные попытки агента;
  • проверку результата человеком.

Сравнить структуру расходов и альтернативных провайдеров можно в нашем обзоре дешёвых API LLM.

Можно ли запустить Qwen 3.8 локально

На 4 августа в официальных источниках, которые мы проверили, не было ссылки на скачиваемые веса Qwen3.8-Max, model card или лицензию. Значит, production-релиз следует считать облачной моделью, пока команда Qwen не опубликует репозиторий и условия использования.

Даже после возможного открытия весов Max не станет моделью для обычного ноутбука. 2,4 трлн общих параметров требуют крупной серверной инфраструктуры, а точные требования зависят от активных параметров, формата весов, квантизации и длины контекста. Для локального контура разумнее ждать меньшие варианты семейства 3.8 или выбирать уже доступную open-weight модель подходящего размера.

Это отличается от обычного Qwen3-8B: запись 3-8B означает версию 3 с 8 млрд параметров, а 3.8 — номер нового поколения. Путаница в поиске уже заметна, поэтому при скачивании всегда проверяйте точный ID.

Как проверить модель перед внедрением

Не переносите весь production-трафик после одного красивого демо. Соберите 50–100 реальных задач и сравните 3.8 Max с текущей моделью в одинаковой обвязке.

Минимальный протокол пилота

  1. Разделите задачи на код, документы, изображения, инструменты и длинные диалоги.
  2. Зафиксируйте ожидаемый результат и критерии успеха до запуска.
  3. Прогоните каждый пример на medium; сложные провалы повторите на xhigh.
  4. Измерьте долю выполненных задач, медианную задержку, токены и число повторов.
  5. Проверьте ошибки function calling, JSON и восстановление после сбоя инструмента.
  6. Отдельно протестируйте русский язык, внутреннюю терминологию и длинную историю.
  7. Оставьте человеку подтверждение платежей, удаления данных и production-деплоя.

Главная метрика — не балл общего benchmark, а стоимость успешно завершённой бизнес-задачи. Модель с более дорогим запросом может быть выгоднее, если реже ошибается и требует меньше повторов. И наоборот, Max проиграет более простой модели там, где обе дают одинаковый результат.

Если вы только проектируете подобную систему, начните с материала о том, как работают GPT и LLM в бизнесе, а затем определите, где ИИ-агенты дают измеримый эффект.

FAQ

Что такое Qwen 3.8 Max?

Qwen3.8-Max — флагманская облачная vision-language модель Alibaba с MoE-архитектурой на 2,4 трлн общих параметров и контекстом до 1 млн токенов. Production-версия с ID qwen3.8-max вышла 3 августа 2026 года.

Чем Qwen 3.8 Max отличается от Qwen 3.7 Max?

Новая модель изначально позиционируется как vision-language флагман и получила обновлённую MoE-архитектуру. Контекст остался на уровне 1 млн токенов, а максимальный управляемый thinking budget достигает 262 144 токенов. Заявление о приросте качества пока исходит от Alibaba и требует проверки на собственных задачах.

Какой контекст у Qwen 3.8 Max?

Официальная документация указывает окно в 1 млн токенов. Использовать весь лимит в каждом запросе невыгодно: растут задержка, расход и риск потери фокуса на нужных данных.

Есть ли API Qwen 3.8 Max?

Да. Модель qwen3.8-max доступна в Alibaba Cloud Model Studio через OpenAI-compatible, Anthropic-compatible и DashScope API. Поддерживаются function calling, встроенные инструменты и структурированный вывод.

Сколько стоит Qwen 3.8 Max?

На 4 августа 2026 года отдельная pay-as-you-go цена production-модели не была опубликована в официальной таблице Model Studio. Preview входит в Token Plan с оплатой через Credits, но эти условия нельзя автоматически переносить на production API.

Можно ли скачать Qwen 3.8 Max и запустить локально?

На дату публикации официальных весов, model card и лицензии Qwen3.8-Max в проверенных источниках не было. Текущий подтверждённый способ использования — облачный API Alibaba. Из-за масштаба 2,4 трлн параметров полный Max в любом случае потребует серверной инфраструктуры.

Итог

Qwen 3.8 Max — заметное обновление флагманской линии Alibaba: нативная мультимодальность, 1 млн токенов контекста, 2,4 трлн параметров MoE и полный набор агентных API. Самое полезное изменение для разработчика — не размер модели, а возможность подключить сильное reasoning, изображения и инструменты через уже знакомые протоколы.

Но релиз ещё слишком свежий, чтобы верить общим заявлениям без проверки. Цена production API и открытые веса на момент публикации не были зафиксированы в официальных материалах. Следующий разумный шаг — прогнать 50–100 своих задач на medium, измерить качество и полную стоимость, а затем решить, какие запросы действительно заслуживают Max.

← Все статьи

Комментарии (0)

Пока нет комментариев. Будьте первым!

Оставить комментарий
Регистрация не требуется