> · · 8 мин

Qwen3.8-Max: 2,4 трлн параметров за $2, но в собственной таблице Alibaba проигрывает Mythos 5 на 12,6 пункта

Alibaba выпустила Qwen3.8-Max и говорит про уровень фронтира. Самое честное описание модели лежит в её же презентационной таблице: на SWE-bench Pro у Qwen3.8-Max 67,7%, а рядом в той же таблице стоит Claude Mythos 5 с 80,3%. Разрыв 12,6 пункта на главном кодинг-бенчмарке — и его опубликовал сам вендор.

При этом модель стоит $2/$6 за миллион токенов против $10/$50 у Opus 5. Так что разговор не про «кто лучше», а про то, за какую цену тебе хватит.

TL;DR: Qwen3.8-Max вышла 3 августа: sparse MoE на 2,4 трлн параметров (95 млрд активных), контекст 1M, вход текст/картинки/видео, $2/$6 за Mtok при кеш-ридах $0,25/M. Открытые веса обещаны «на следующей неделе» и на 5 августа не вышли. В независимом композите BenchLM у неё 60,9 против 71,8 у предшественницы Qwen3.7 Max — и это не деградация, а артефакт нехватки данных. Разбираем, как не попасться на оба этих числа.

Что за модель и сколько стоит

Sparse Mixture-of-Experts на 2,4 трлн параметров с примерно 95 млрд активных на токен, окно 1M, нативная мультимодальность на вход (текст, изображения, видео) и текст на выход. API-идентификатор — qwen3.8-max.

По ценам QwenCloud это $2 за миллион входных токенов и $6 за миллион выходных. Отдельно стоит запомнить кеш-риды: $0,25 за миллион. В агентном цикле, где почти весь вход — это повторно читаемый контекст, эффективная входная ставка опускается примерно до $0,78 за миллион. Против $10/$50 у Opus 5 разница получается в разы, и именно в этом вся суть релиза, а не в бенчмарках.

Уточнения по лимитам, чтобы не проектировать на неверных числах: максимальный вход около 991,8K токенов, в режиме размышления 983,61K, максимальный выход 131 072 токена. В некоторых примерах интеграции maxTokens выставлен в 65 536 — это конфиг клиента из примера, а не потолок платформы.

Режимы усилия — low, medium и xhigh. Из архитектурных заявок интересен гибридный attention (Gated DeltaNet) и AgentWorld: «языковая модель мира», которая позволяет агенту прогонять последствия действия до его выполнения. Идея «мысленной репетиции» вместо повторных проб в реальном окружении — реальный исследовательский вклад, независимо от того, где модель встанет в рейтингах.

А вот чего Alibaba не раскрыла: количество слоёв, число экспертов, top-k роутинга, размерности и объём обучающих токенов. Правильный ответ на любой вопрос об этом — «не раскрыто на 3 августа», а не экстраполяция от Qwen3.5.

Почему в независимом рейтинге у неё 60,9 против 71,8 у предшественницы

Потому что композитный балл в первую неделю после релиза измеряет не качество модели, а полноту собранных о ней данных. И это ловушка, в которую на выходных попались несколько обзоров.

Смотрим на факты. У BenchLM Qwen3.8-Max получила 60,9 из 100 и место №46 из 215, тогда как Qwen3.7 Max в той же линейке стоит с 71,8. Выглядит как регресс поколения. Но рядом сайт прямым текстом пишет: профиль не имеет достаточного покрытия для верифицированной позиции, заполнено 52 строки бенчмарков из 381 отслеживаемого слота, статус оценки — Estimated, а не Supported.

Композит считается по тому, что есть. Новая модель за два дня успела попасть в несколько бенчмарков, старая за три месяца — в десятки. Пока слоты пустые, средняя проседает, и по мере набора данных балл поедет вверх. Никакой информации о том, что 3.8 хуже 3.7, в этих числах нет.

Практический вывод шире, чем один Qwen: композитные рейтинги в неделю релиза читать бессмысленно, а сравнивать по ним новую модель со старой — прямая ошибка. Смотреть надо на отдельные строки с указанием источника, а не на агрегат. И держать в голове, что «ранг №46 из 215» в этот момент означает «данных мало», а не «сорок пять моделей сильнее».

Что говорят цифры, которые Alibaba опубликовала сама

Они говорят, что модель сильна в агентных сценариях и работе с интерфейсами, а в тяжёлом кодинге отстаёт от лидера — и это видно в вендорской таблице без всякой сторонней проверки.

Из презентационных данных Qwen:

  • Terminal-Bench 2.1 — 86,6%. Лучший подтверждённый результат в этой строке. Для агентной работы в терминале это сильно.
  • OSWorld-Verified — 86,1%. Тоже лучший подтверждённый. Управление компьютером — явно то, куда Alibaba вкладывалась.
  • IFBench — 82,8%. Следование инструкциям, отстаёт лишь от MAI-Thinking-1 с 85%. В той же таблице GPT-5.6 Sol стоит с 72,7%, Claude Fable 5 — около 63,5%, Opus 4.8 — около 62,2%.
  • SWE-bench Pro — 67,7% против 80,3% у Claude Mythos 5. Разрыв 12,6 пункта.
  • MMMU-Pro — 82,3% против 94% у GPT-5.4 Pro. Разрыв 11,7 пункта.
  • OmniDocBench 1.5 — 92,1% и Parametric CAD Bench — 91,5%. Результаты конкурентов по этим тестам Alibaba не приводит, так что сравнивать не с чем.

Ключевая оговорка ко всему списку: оценки конкурентов здесь тоже вендорские. Цифру 63,5% для Claude Fable 5 на IFBench опубликовала Alibaba, а не Anthropic, и условия прогона (харнесс, настройки инструментов, число попыток) задавала тоже Alibaba. Независимых замеров Qwen3.8-Max на 5 августа фактически нет — на BenchLM 52 строки из 381, у Artificial Analysis профиля с прогоном ещё нет.

Подводные камни

  • Открытых весов до сих пор нет. Alibaba обещала выложить их «на следующей неделе» после релиза, на Hugging Face и ModelScope, вместе с Qwen3.8-27B. Это был бы первый Max-класс в открытых весах у Alibaba, то есть событие. Но на 5 августа нет ни чекпоинта, ни лицензии, и корректное описание статуса — «обещаны». Мы уже видели, как обещания сроков у вендоров скользят; планировать миграцию под ещё не выложенные веса не стоит.
  • qwen3.8-max-preview — это не qwen3.8-max. Превью появилось 19 июля через Token Plan, продакшен — 3 августа. Все анекдоты и замеры июльского превью к текущей модели отношения не имеют, пока не переподтверждены. Путаницу усиливает то, что Qwen Code добавил превью в список 23 июля, и часть обзоров тестировала именно его.
  • И это не Qwen3-8B. Qwen3-8B — старая модель на 8 млрд параметров. Совпадение цифр в названии стоило нескольким обзорам достоверности.
  • Локально ты это не запустишь, даже когда веса выйдут. 2,4 трлн параметров требуют лицензии, рецепта сервинга, поддерживаемого движка, достаточной суммарной памяти акселераторов и быстрого интерконнекта. Для обычного разработчика вариант Qwen3.8-27B в итоге окажется важнее, чем Max.
  • Данные и регуляторика. Условия хранения данных у Token Plan и у Model Studio различаются, а «второе место после Fable 5» из июльских заявлений так и не подкреплено полной таблицей с методикой. Для регулируемых отраслей этого пока недостаточно.

Альтернативы

  • DeepSeek V4 Pro — MIT-лицензия, веса лежат сегодня, репутация набрана. Если тебе нужны именно открытые веса и предсказуемость, это дефолт, а не Qwen3.8-Max с обещанием.
  • Claude Opus 5 — дороже в разы ($10/$50), но по SWE-bench Pro в вендорской таблице Alibaba обходит Qwen3.8-Max на 12,6 пункта силами Mythos 5. Берётся туда, где стоимость ошибки в коде выше стоимости токенов.
  • Kimi K3 — прямой конкурент по позиционированию «фронтир в открытых весах»; веса выложены. Разница в том, что у K3 цена входа в самостоятельный хостинг измеряется в реальных секундах до первого токена, а не в теоретической доступности.
  • Qwen3.8-27B, когда выйдет — единственный вариант из этого анонса, который реально запускается на одной топовой GPU. Для большинства читателей это и есть главная новость релиза, просто она пока не наступила.

Вердикт

Стоит пробовать сегодня, если у тебя агентная нагрузка с терминалом или управлением интерфейсами и чувствительность к цене: Terminal-Bench 2.1 на 86,6%, OSWorld-Verified на 86,1% и эффективная входная ставка около $0,78/M в цикле с кешем — это сочетание, которого у западных флагманов нет. Не стоит тащить в тяжёлый кодинг вместо Opus 5: минус 12,6 пункта на SWE-bench Pro признаёт сам вендор, и экономия на токенах тут съедается стоимостью разбирательств.

Подождать имеет смысл двум группам. Тем, кому нужны открытые веса: до появления чекпоинта и лицензии обсуждать нечего. И тем, кто выбирает по независимым замерам: сейчас их нет, а композит 60,9 против 71,8 у предшественницы — это дырки в данных, а не деградация модели, и через пару недель он будет выглядеть иначе.

Как попробовать

  1. Возьми доступ через Alibaba Cloud Model Studio или QwenCloud и убедись, что в запросе стоит именно qwen3.8-max, а не qwen3.8-max-preview — иначе ты тестируешь июльскую модель.
  2. Прогони её на своих задачах в двух режимах усилия, low и xhigh, и посчитай не токены, а деньги: с учётом кеш-ридов по $0,25/M арифметика агентного цикла сильно отличается от прайса $2/$6.
  3. Если работаешь с длинным контекстом, проверяйся на реальных лимитах (~991,8K вход, 131 072 выход), а не на значении maxTokens из примера в документации.
  4. Для сравнения с фронтиром возьми свой набор задач и прогони параллельно Opus 5 и DeepSeek V4 Pro — вендорские таблицы сравнивают в удобных для вендора условиях, твой набор такого недостатка не имеет.
  5. Следи за появлением весов на Hugging Face и за независимыми прогонами на BenchLM и Artificial Analysis — до этого любое обсуждение «Qwen3.8-Max против всех» опирается только на данные Alibaba.
$ ls ./related/

Похожие статьи

turbofieldfare-gemma-2gb.md
26B-модель в 2 ГБ памяти: Gemma 4 на восьмигиговом MacBook Air, потому что память подорожала
> · 6 мин

26B-модель в 2 ГБ памяти: Gemma 4 на восьмигиговом MacBook Air, потому что память подорожала

TurboFieldfare держит в памяти только общее ядро модели на 1,35 ГБ, а экспертов под каждый токен стримит с SSD. Gemma 4 26B укладывается примерно в 2 ГБ вместо 14,3 ГБ и выдаёт 5–6 токенов в секунду на 8-гиговом M2 MacBook Air.

ai llm open-source macos
copilot-word-ai-worm.md
AI-червь в Word: Copilot вклеивает чужие инструкции в твой документ, и он заражает следующий
> · 6 мин

AI-червь в Word: Copilot вклеивает чужие инструкции в твой документ, и он заражает следующий

Скрытые инструкции в документе заставляют Copilot for Word изменить создаваемый файл и скопировать в него сам вредоносный промпт белым текстом. Заражённый документ становится новым вектором. На 28 июля атака воспроизводится со всеми митигациями Microsoft.

ai security copilot microsoft
kimi-k3-weights-vs-opus-5.md
Веса Kimi K3 выложили: 2,8T параметров бесплатно и 164 секунды до первого токена
> · 8 мин

Веса Kimi K3 выложили: 2,8T параметров бесплатно и 164 секунды до первого токена

Moonshot выложила веса Kimi K3 27 июля вместе с техническим отчётом. Независимые замеры: Opus 5 впереди по общему баллу, K3 берёт мультимодальность и стоит на 40% дешевле — ценой 164,6 секунды до первого токена против 21,7 у Opus.

ai llm open-source benchmark
subscribe.sh

$ cat /dev/blog/updates

> Свежие заметки о программировании,

> DevOps и AI — прямо в мессенджер

./subscribe