> · · 8 мин

DeepSeek V4 Flash: №3 по интеллекту и последнее место по знаниям. Один чекпоинт, два индекса, 210 млн токенов

DeepSeek V4 Flash: №3 по интеллекту и последнее место по знаниям. Один чекпоинт, два индекса, 210 млн токенов

Открываешь Artificial Analysis: DeepSeek V4 Flash 0731 — третье место по интеллекту из 101 модели. Открываешь BenchLM: та же модель, категория «знания», место 55 из 55. Последнее.

Оба индекса независимые, оба публикуют источники, ни один не врёт. И оба про один и тот же чекпоинт с MIT-лицензией, который вышел 31 июля. Разбираемся, как так получается — и почему прайс $0,14 за миллион входных токенов не означает, что счёт будет самым маленьким.

TL;DR: DeepSeek V4 Flash 0731 — MoE на 284 млрд параметров (13 млрд активных), контекст 1M, MIT. У Artificial Analysis это №3 по интеллекту (50 баллов против медианы 25) и №1 по цене кеш-хита. Но verbosity — 210 млн токенов против медианных 100 млн, то есть двойной расход на тот же результат. Плюс часть циркулирующих бенчмарков относится к апрельскому превью, а не к новому чекпоинту, и агрегаторы расходятся в цене кеша в 10 раз.

Почему два индекса дают противоположный ответ

Потому что они меряют разное и считают по разному объёму данных. «Интеллект» у Artificial Analysis — это композит из ризонинга, знаний, математики и кода на своём харнессе. «Знания» у BenchLM — отдельная категория, и в неё у этой модели попало мало подтверждённых строк.

Смотрим числа. Artificial Analysis даёт 50 баллов по Intelligence Index — при медиане 25 среди сопоставимых открытых моделей — и ставит модель на 3-е место из 101. BenchLM при этом пишет прямо: модель отслеживается, но публично не ранжирована, потому что покрытия не хватает; всего 22 строки бенчмарков с источниками; в категории «знания» результат 34,3 из 100 и место 55 из 55 среди тех, кто в этой категории вообще проходит порог.

То есть «последнее место» здесь не означает «модель не знает фактов». Оно означает «в эту категорию по ней собрано так мало подтверждённых прогонов, что дальше её ставить некуда». Ровно та же механика, которая на этой неделе занизила композит у нового флагмана Alibaba: чем свежее модель, тем больше пустых слотов и тем бесполезнее агрегат.

Практический вывод простой. В первые недели после релиза смотри на отдельные строки с указанием харнесса, а не на композит и не на ранг. И проверяй, что именно индекс считал: у Artificial Analysis в профиле стоит режим Reasoning с максимальным усилием, а это другая модель поведения (и другой счёт), чем дефолтный вызов.

Куда уходят деньги, если прайс самый низкий

В токены. Прайс действительно один из лучших на рынке, но модель тратит примерно вдвое больше токенов на ту же работу, и это съедает часть преимущества.

Цифры по Artificial Analysis:

  • Цена — $0,14 за миллион входных и $0,28 за миллион выходных. Место 22 из 101, медиана по рынку $0,43 и $1,20. Дешёво.
  • Кеш-хит — $0,003 за миллион, минус 98%. Первое место из 101. Для агентных циклов с переиспользованием контекста это самая интересная строчка всего профиля.
  • Скорость — 113,5 токена в секунду. Место 10 из 101, у сопоставимых открытых моделей медиана 61,4. Быстро.
  • Verbosity — 210 млн токенов на прогоне Intelligence Index против медианных 100 млн. Место 36 из 101 с формулировкой «очень болтливая».
  • Итоговый счёт за один прогон индекса — $72,02. Эту цифру Artificial Analysis публикует прямо, и она полезнее всех остальных: это реальные деньги за фиксированный объём работы.

Дальше арифметика, которую вендоры в пресс-релизах не делают. Если модель выдаёт вдвое больше токенов на ту же задачу, её $0,28 за миллион выхода в пересчёте на результат ведут себя как ~$0,59 у модели с медианной болтливостью. Всё ещё дешевле рынка, но история «в двадцать раз дешевле Opus» после этой поправки выглядит иначе. Мы это уже проходили на токенизаторе Sonnet 5: прайс-лист и счёт — разные документы.

Кому это в плюс: ризонинг-модель на максимальном усилии обязана много «думать», и часть этих 210 млн токенов — полезная работа, а не мусор. Кому в минус: если ты платишь за выход и латентность важна, болтливость бьёт дважды.

Какие бенчмарки нельзя брать из фида

Те, что описывают режим без размышления. По пометке BenchLM, значения в строке Non-Think — это точный снимок таблицы 7 апрельского превью-чекпоинта, а не свежие замеры 0731, и они сохранены как историческое свидетельство.

Причина в том, как вышел релиз. API-идентификатор deepseek-v4-flash теперь отдаёт DeepSeek-V4-Flash-0731 в публичной бете. DeepSeek заявляет, что архитектура и размер остались от превью, а переобучение коснулось только пост-тренинга. В презентационной таблице от 31 июля опубликованы лишь результаты Code Agent на максимальном усилии. Всё остальное, что расходится по обзорам под именем «V4 Flash», подтянуто из апреля.

То есть под одним названием сейчас живут два чекпоинта: апрельское превью и июльский 0731, и веса обоих лежат на Hugging Face отдельно, оба под MIT. Когда ты сравниваешь «DeepSeek V4 Flash против чего-нибудь», сперва выясни, какой из двух имел в виду автор таблицы. Скорее всего он сам не выяснял.

Отдельная неприятность для планирования бюджета: агрегаторы расходятся в цене кеш-рида в десять раз. Artificial Analysis указывает $0,003 за миллион, Kilo со ссылкой на OpenRouter — $0,03. Разница между «минус 98%» и «минус 79%» решает, окупается ли твой агентный цикл. Проверять надо на своём счёте за первые сутки, а не по таблице.

И ещё одно, приятное: у OpenRouter модель отдаётся дешевле первоисточника — $0,09 и $0,18 за миллион против $0,14 и $0,28 у DeepSeek, при 18 провайдерах и максимальном выходе 65 536 токенов. Дешевле официального прайса — это редкость, и это стоит проверить до того, как подключаться напрямую.

Подводные камни

  • Один и тот же API-идентификатор отдаёт другую модель, чем месяц назад. Если у тебя в проде висит deepseek-v4-flash с апреля, поведение уже изменилось: пост-тренинг переделан. Прогоны регрессии стоит перезапустить, даже если ты ничего не менял.
  • Публичная бета. 0731 отдаётся в статусе беты. Для прода это означает отсутствие гарантий стабильности ответов между днями.
  • Максимальный выход зависит от провайдера. У OpenRouter это 65 536 токенов, у других поставщиков в каталогах фигурируют цифры до 393 216. При контексте 1M это принципиальная разница, и упираться в неё ты будешь молча.
  • Независимой скорости никто не мерил. BenchLM отдельно указывает, что runtime speed независимо не замерялась; 113,5 t/s у Artificial Analysis получены на API самого DeepSeek. На self-hosted железе это число не воспроизводится.
  • Verbosity ломает не только счёт, но и контекст. Двойной объём вывода в агентном цикле быстрее забивает окно и заставляет чаще сбрасывать историю. На длинных задачах это выливается в потерю контекста, а не в лишние центы.
  • Никакой сертифицированной цифры по знаниям пока нет. 34,3 из 100 — это оценка при 22 строках покрытия. Строить на ней вывод «модель плохо знает факты» так же неверно, как строить на ранге №3 вывод «модель почти фронтир».

Альтернативы

  • Qwen3.8-Max — дороже ($2/$6), проприетарная, но берёт Terminal-Bench 2.1 на 86,6% по вендорским данным и заметно сильнее в мультимодальности. Разумный выбор, когда важнее агентные сценарии с интерфейсами, а не цена за токен.
  • Kimi K3 — тоже открытые веса и тоже фронтир-позиционирование. Разница в цене входа в самостоятельный хостинг: у K3 до первого токена уходили реальные 164 секунды, и такие числа выясняются только на практике.
  • DeepSeek V4 Pro — старший брат, дороже, но с набранной репутацией и полной таблицей результатов. Если Flash не проходит по качеству, переход внутри семейства дешевле смены поставщика.
  • Claude Opus 5 — $10/$50, другая весовая категория по цене. Берётся туда, где двойная болтливость и бета-статус недопустимы, а стоимость ошибки выше стоимости токенов.

Вердикт

Стоит брать, если у тебя агентный цикл с большим переиспользованием контекста и терпимость к бете: кеш-рид по $0,003 (проверь на своём счёте) плюс 113,5 токена в секунду — это лучшее соотношение на рынке открытых весов прямо сейчас. Не стоит ставить в задачи с оплатой за выход и жёсткой латентностью: 210 млн токенов против медианных 100 млн — это не мелочь, а множитель к половине твоего счёта.

И главное, что стоит унести из этого разбора вообще без привязки к DeepSeek: при выборе модели по рейтингам всегда открывай два независимых индекса, а не один. Здесь у них №3 и последнее место по одному и тому же чекпоинту, и оба числа корректны в своих определениях. Один индекс — это не факт, а выбранное определение.

Как попробовать

  1. Проверь, какой чекпоинт ты вызываешь: deepseek-v4-flash теперь отдаёт 0731, а не апрельское превью. Веса обоих лежат на Hugging Face под MIT отдельными чекпоинтами.
  2. Сравни цены до подключения: прайс DeepSeek против OpenRouter, где на момент проверки было $0,09/$0,18. И уточни максимальный выход у выбранного провайдера.
  3. Замерь verbosity на своих задачах: прогони десяток типичных запросов и посчитай средний выход в токенах против той модели, что стоит у тебя сейчас. Множитель важнее прайса.
  4. Проверь реальную цену кеша по первому счёту за сутки — из-за расхождения агрегаторов в 10 раз это единственный надёжный способ.
  5. Если гоняешь регрессию, перезапусти её: пост-тренинг переделан, а идентификатор остался тот же. Отдельно сверься с профилем на Artificial Analysis — там указан режим и усилие, при которых получены опубликованные цифры.
$ ls ./related/

Похожие статьи

chaindrop-npm-worm.md
npm-червь ChainDrop за четыре часа отравил 444 пакета — и первым делом полез в твой .claude/settings.json
> · 9 мин

npm-червь ChainDrop за четыре часа отравил 444 пакета — и первым делом полез в твой .claude/settings.json

4 августа червь ChainDrop стартовал с keyv@6.0.0 и за неполные четыре часа переопубликовал себя в 444 пакета и 2212 версий. Он крадёт credential-сторы Claude, Codex и Cursor, дописывает хуки в .claude/settings.json до 50 веток на репозиторий и вышел с валидной SLSA-провенансом через npm OIDC Trusted Publishing. Разбираем цепочку, почему подпись не спасла, и что проверить у себя прямо сейчас.

ai claude-code security npm
turbofieldfare-gemma-2gb.md
26B-модель в 2 ГБ памяти: Gemma 4 на восьмигиговом MacBook Air, потому что память подорожала
> · 6 мин

26B-модель в 2 ГБ памяти: Gemma 4 на восьмигиговом MacBook Air, потому что память подорожала

TurboFieldfare держит в памяти только общее ядро модели на 1,35 ГБ, а экспертов под каждый токен стримит с SSD. Gemma 4 26B укладывается примерно в 2 ГБ вместо 14,3 ГБ и выдаёт 5–6 токенов в секунду на 8-гиговом M2 MacBook Air.

ai llm open-source macos
copilot-word-ai-worm.md
AI-червь в Word: Copilot вклеивает чужие инструкции в твой документ, и он заражает следующий
> · 6 мин

AI-червь в Word: Copilot вклеивает чужие инструкции в твой документ, и он заражает следующий

Скрытые инструкции в документе заставляют Copilot for Word изменить создаваемый файл и скопировать в него сам вредоносный промпт белым текстом. Заражённый документ становится новым вектором. На 28 июля атака воспроизводится со всеми митигациями Microsoft.

ai security copilot microsoft
subscribe.sh

$ cat /dev/blog/updates

> Свежие заметки о программировании,

> DevOps и AI — прямо в мессенджер

./subscribe