Qwen3.8-Max: 2,4 трлн параметров за $2, но в собственной таблице Alibaba проигрывает Mythos 5 на 12,6 пункта
Alibaba выпустила Qwen3.8-Max и говорит про уровень фронтира. Самое честное описание модели лежит в её же презентационной таблице: на SWE-bench Pro у Qwen3.8-Max 67,7%, а рядом в той же таблице стоит Claude Mythos 5 с 80,3%. Разрыв 12,6 пункта на главном кодинг-бенчмарке — и его опубликовал сам вендор.
При этом модель стоит $2/$6 за миллион токенов против $10/$50 у Opus 5. Так что разговор не про «кто лучше», а про то, за какую цену тебе хватит.
TL;DR: Qwen3.8-Max вышла 3 августа: sparse MoE на 2,4 трлн параметров (95 млрд активных), контекст 1M, вход текст/картинки/видео, $2/$6 за Mtok при кеш-ридах $0,25/M. Открытые веса обещаны «на следующей неделе» и на 5 августа не вышли. В независимом композите BenchLM у неё 60,9 против 71,8 у предшественницы Qwen3.7 Max — и это не деградация, а артефакт нехватки данных. Разбираем, как не попасться на оба этих числа.
Что за модель и сколько стоит
Sparse Mixture-of-Experts на 2,4 трлн параметров с примерно 95 млрд активных на токен, окно 1M, нативная мультимодальность на вход (текст, изображения, видео) и текст на выход. API-идентификатор — qwen3.8-max.
По ценам QwenCloud это $2 за миллион входных токенов и $6 за миллион выходных. Отдельно стоит запомнить кеш-риды: $0,25 за миллион. В агентном цикле, где почти весь вход — это повторно читаемый контекст, эффективная входная ставка опускается примерно до $0,78 за миллион. Против $10/$50 у Opus 5 разница получается в разы, и именно в этом вся суть релиза, а не в бенчмарках.
Уточнения по лимитам, чтобы не проектировать на неверных числах: максимальный вход около 991,8K токенов, в режиме размышления 983,61K, максимальный выход 131 072 токена. В некоторых примерах интеграции maxTokens выставлен в 65 536 — это конфиг клиента из примера, а не потолок платформы.
Режимы усилия — low, medium и xhigh. Из архитектурных заявок интересен гибридный attention (Gated DeltaNet) и AgentWorld: «языковая модель мира», которая позволяет агенту прогонять последствия действия до его выполнения. Идея «мысленной репетиции» вместо повторных проб в реальном окружении — реальный исследовательский вклад, независимо от того, где модель встанет в рейтингах.
А вот чего Alibaba не раскрыла: количество слоёв, число экспертов, top-k роутинга, размерности и объём обучающих токенов. Правильный ответ на любой вопрос об этом — «не раскрыто на 3 августа», а не экстраполяция от Qwen3.5.
Почему в независимом рейтинге у неё 60,9 против 71,8 у предшественницы
Потому что композитный балл в первую неделю после релиза измеряет не качество модели, а полноту собранных о ней данных. И это ловушка, в которую на выходных попались несколько обзоров.
Смотрим на факты. У BenchLM Qwen3.8-Max получила 60,9 из 100 и место №46 из 215, тогда как Qwen3.7 Max в той же линейке стоит с 71,8. Выглядит как регресс поколения. Но рядом сайт прямым текстом пишет: профиль не имеет достаточного покрытия для верифицированной позиции, заполнено 52 строки бенчмарков из 381 отслеживаемого слота, статус оценки — Estimated, а не Supported.
Композит считается по тому, что есть. Новая модель за два дня успела попасть в несколько бенчмарков, старая за три месяца — в десятки. Пока слоты пустые, средняя проседает, и по мере набора данных балл поедет вверх. Никакой информации о том, что 3.8 хуже 3.7, в этих числах нет.
Практический вывод шире, чем один Qwen: композитные рейтинги в неделю релиза читать бессмысленно, а сравнивать по ним новую модель со старой — прямая ошибка. Смотреть надо на отдельные строки с указанием источника, а не на агрегат. И держать в голове, что «ранг №46 из 215» в этот момент означает «данных мало», а не «сорок пять моделей сильнее».
Что говорят цифры, которые Alibaba опубликовала сама
Они говорят, что модель сильна в агентных сценариях и работе с интерфейсами, а в тяжёлом кодинге отстаёт от лидера — и это видно в вендорской таблице без всякой сторонней проверки.
Из презентационных данных Qwen:
- Terminal-Bench 2.1 — 86,6%. Лучший подтверждённый результат в этой строке. Для агентной работы в терминале это сильно.
- OSWorld-Verified — 86,1%. Тоже лучший подтверждённый. Управление компьютером — явно то, куда Alibaba вкладывалась.
- IFBench — 82,8%. Следование инструкциям, отстаёт лишь от MAI-Thinking-1 с 85%. В той же таблице GPT-5.6 Sol стоит с 72,7%, Claude Fable 5 — около 63,5%, Opus 4.8 — около 62,2%.
- SWE-bench Pro — 67,7% против 80,3% у Claude Mythos 5. Разрыв 12,6 пункта.
- MMMU-Pro — 82,3% против 94% у GPT-5.4 Pro. Разрыв 11,7 пункта.
- OmniDocBench 1.5 — 92,1% и Parametric CAD Bench — 91,5%. Результаты конкурентов по этим тестам Alibaba не приводит, так что сравнивать не с чем.
Ключевая оговорка ко всему списку: оценки конкурентов здесь тоже вендорские. Цифру 63,5% для Claude Fable 5 на IFBench опубликовала Alibaba, а не Anthropic, и условия прогона (харнесс, настройки инструментов, число попыток) задавала тоже Alibaba. Независимых замеров Qwen3.8-Max на 5 августа фактически нет — на BenchLM 52 строки из 381, у Artificial Analysis профиля с прогоном ещё нет.
Подводные камни
- Открытых весов до сих пор нет. Alibaba обещала выложить их «на следующей неделе» после релиза, на Hugging Face и ModelScope, вместе с Qwen3.8-27B. Это был бы первый Max-класс в открытых весах у Alibaba, то есть событие. Но на 5 августа нет ни чекпоинта, ни лицензии, и корректное описание статуса — «обещаны». Мы уже видели, как обещания сроков у вендоров скользят; планировать миграцию под ещё не выложенные веса не стоит.
qwen3.8-max-preview— это неqwen3.8-max. Превью появилось 19 июля через Token Plan, продакшен — 3 августа. Все анекдоты и замеры июльского превью к текущей модели отношения не имеют, пока не переподтверждены. Путаницу усиливает то, что Qwen Code добавил превью в список 23 июля, и часть обзоров тестировала именно его.- И это не Qwen3-8B. Qwen3-8B — старая модель на 8 млрд параметров. Совпадение цифр в названии стоило нескольким обзорам достоверности.
- Локально ты это не запустишь, даже когда веса выйдут. 2,4 трлн параметров требуют лицензии, рецепта сервинга, поддерживаемого движка, достаточной суммарной памяти акселераторов и быстрого интерконнекта. Для обычного разработчика вариант Qwen3.8-27B в итоге окажется важнее, чем Max.
- Данные и регуляторика. Условия хранения данных у Token Plan и у Model Studio различаются, а «второе место после Fable 5» из июльских заявлений так и не подкреплено полной таблицей с методикой. Для регулируемых отраслей этого пока недостаточно.
Альтернативы
- DeepSeek V4 Pro — MIT-лицензия, веса лежат сегодня, репутация набрана. Если тебе нужны именно открытые веса и предсказуемость, это дефолт, а не Qwen3.8-Max с обещанием.
- Claude Opus 5 — дороже в разы ($10/$50), но по SWE-bench Pro в вендорской таблице Alibaba обходит Qwen3.8-Max на 12,6 пункта силами Mythos 5. Берётся туда, где стоимость ошибки в коде выше стоимости токенов.
- Kimi K3 — прямой конкурент по позиционированию «фронтир в открытых весах»; веса выложены. Разница в том, что у K3 цена входа в самостоятельный хостинг измеряется в реальных секундах до первого токена, а не в теоретической доступности.
- Qwen3.8-27B, когда выйдет — единственный вариант из этого анонса, который реально запускается на одной топовой GPU. Для большинства читателей это и есть главная новость релиза, просто она пока не наступила.
Вердикт
Стоит пробовать сегодня, если у тебя агентная нагрузка с терминалом или управлением интерфейсами и чувствительность к цене: Terminal-Bench 2.1 на 86,6%, OSWorld-Verified на 86,1% и эффективная входная ставка около $0,78/M в цикле с кешем — это сочетание, которого у западных флагманов нет. Не стоит тащить в тяжёлый кодинг вместо Opus 5: минус 12,6 пункта на SWE-bench Pro признаёт сам вендор, и экономия на токенах тут съедается стоимостью разбирательств.
Подождать имеет смысл двум группам. Тем, кому нужны открытые веса: до появления чекпоинта и лицензии обсуждать нечего. И тем, кто выбирает по независимым замерам: сейчас их нет, а композит 60,9 против 71,8 у предшественницы — это дырки в данных, а не деградация модели, и через пару недель он будет выглядеть иначе.
Как попробовать
- Возьми доступ через Alibaba Cloud Model Studio или QwenCloud и убедись, что в запросе стоит именно
qwen3.8-max, а неqwen3.8-max-preview— иначе ты тестируешь июльскую модель. - Прогони её на своих задачах в двух режимах усилия, low и xhigh, и посчитай не токены, а деньги: с учётом кеш-ридов по $0,25/M арифметика агентного цикла сильно отличается от прайса $2/$6.
- Если работаешь с длинным контекстом, проверяйся на реальных лимитах (~991,8K вход, 131 072 выход), а не на значении
maxTokensиз примера в документации. - Для сравнения с фронтиром возьми свой набор задач и прогони параллельно Opus 5 и DeepSeek V4 Pro — вендорские таблицы сравнивают в удобных для вендора условиях, твой набор такого недостатка не имеет.
- Следи за появлением весов на Hugging Face и за независимыми прогонами на BenchLM и Artificial Analysis — до этого любое обсуждение «Qwen3.8-Max против всех» опирается только на данные Alibaba.