Веса Kimi K3 выложили: 2,8T параметров бесплатно и 164 секунды до первого токена
27 июля Moonshot выложила веса Kimi K3 — 2,8 триллиона параметров, самая крупная открытая модель в истории. Технический отчёт приехал вместе с весами, а не через месяц, как это обычно бывает. А на следующий день независимые трекеры досчитали цифры сравнения с Claude Opus 5, и там нашлась одна, которую в маркетинговых таблицах не встретишь: 164,6 секунды до первого токена.
TL;DR: Веса Kimi K3 выложены 27 июля, лицензия своя, не MIT. По независимым замерам BenchLM на 28 июля Opus 5 набирает 82,81 против 79,89 у K3, но K3 берёт мультимодальность (78,5 против 66,9), GPQA Diamond и BrowseComp и стоит примерно на 40% дешевле в смешанном расчёте. Расплата — скорость: 32 токена в секунду против 58 и время до первого токена 164,6 секунды против 21,7.
Что выложила Moonshot 27 июля
Веса Kimi K3 доступны для скачивания, и вместе с ними вышел технический отчёт — его уже разобрали и в англоязычных блогах, и на Hacker News. В анонсе от 14 июля компания обещала веса «к 27 июля», и на этот раз обещание сдержали день в день.
Спецификация: mixture-of-experts на 2,8T параметров, 93 слоя (69 с Kimi Delta Attention и 24 с Gated MLA), 896 экспертов, из которых на токен выбирается 16. Контекст — 1 048 576 токенов, вход текстовый, картиночный и видео, визуальный энкодер MoonViT-V2 на 401M параметров. Квантование весов MXFP4, активаций MXFP8. Управление рассуждением через reasoning_effort со значениями low, high и max, по умолчанию max.
С активными параметрами есть расхождение, которое стоит знать: официальная карточка называет 104B активных на токен, часть обзоров пишет про ~32B. Ни один источник расхождение не объясняет, так что если вы считаете стоимость инференса на своём железе — считайте по худшему.
Из архитектурных заявлений Moonshot: Kimi Delta Attention даёт до 6,3× более быстрый декодинг на миллионном контексте, а Attention Residuals — примерно на 25% выше эффективность обучения при менее чем 2% дополнительных затрат. Это цифры вендора из твита от 16 июля, независимых подтверждений на момент написания нет.
Сколько на самом деле стоит Kimi K3 против Opus 5
По API: $0.30 за миллион токенов при попадании в кеш, $3 за некешированный вход, $15 за выход. У Opus 5 — $5 и $25. В смешанном расчёте при соотношении кеш/вход/выход 7:2:1 CodingFleet считает $2.31 против $3.85, то есть примерно на 40% дешевле.
Дальше начинается интересное. Скорость выдачи у Opus 5 — около 58 токенов в секунду, у K3 — 32. Это ощутимо в интерактивной сессии, но терпимо. А вот время до первого токена: 21,7 секунды у Opus 5 на высоком effort и 164,6 секунды у K3. Разница в 7,6 раза, и это почти три минуты тишины перед первым символом.
Для батчевой обработки это не важно совсем. Для агента в терминале, где вы ждёте ответа, это разница между инструментом и фоновым процессом. Ваша экономия в 40% на токенах покупается тем, что вы больше не сидите в цикле «спросил — посмотрел — уточнил».
Кто выигрывает по бенчмаркам
Общий счёт независимых трекеров — за Opus 5, но с оговорками. BenchLM на 28 июля даёт 82,81 против 79,89 по своей линейке BenchAlign, при 28 общих результатах бенчмарков в 3 сопоставимых категориях из 8.
По категориям:
- Мультимодальность — K3 78,5 против 66,9 у Opus 5, разрыв 11,6 в пользу открытой модели
- Знания — Opus 5 64,7 против 61,0
- Агентные задачи — Opus 5 90,8 против 89,5, разрыв меньше двух пунктов
- Кодинг и рассуждения — у K3 сопоставимых публичных замеров нет вообще
По отдельным бенчмаркам Opus 5 забирает HLE (64,7% против 56,0%), AA Intelligence Index (59 против 57), DeepSWE v1.1 (68,8% против 67,5%) и Terminal-Bench 2.1 (89,1% против 88,3%). K3 отыгрывает GPQA Diamond (93,5% против 93,2%), BrowseComp (91,2% против 90,8%) и AutomationBench (30,8% против 26,0%).
Отдельно про кодинг: Opus 5 показывает 79,2% на SWE-bench Pro — это 1865 реальных задач из живых репозиториев. Kimi сопоставимого результата не публиковала вообще, а в собственной таблице сравнения предпочла Program Bench и FrontierSWE. Отсутствие числа — тоже число.
Почему «открытые веса» не значит «на твоём ноутбуке»
Мы уже писали об этом разрыве в июле, и K3 доводит его до предела. Модель на 2,8T параметров даже в MXFP4 — это порядка полутора терабайт весов. Локально её не запустит никто, кроме тех, у кого стоит стойка с ускорителями.
Практическая ценность открытых весов здесь другая: их можно поднять у себя в контуре, зафайнтюнить, изучить и не зависеть от того, что вендор завтра поменяет модель под тем же именем. Комментарий с Hacker News формулирует это точнее всего: релиз K3 помог остаться в гонке всем остальным лабораториям, потому что теперь есть на чём строить.
Лицензия — своя, Kimi K3 License, не MIT, вопреки тому, что писали некоторые обзоры до выкладки весов. Прочитайте текст, прежде чем тащить модель в продукт.
Подводные камни
Контекст в 1M доступен не всем. В документации Kimi Code аккаунты уровня Moderato получают до 256K, полный миллион открывается на Allegretto и выше. Сторонним инструментам контекст надо выставлять явным значением 1048576, иначе получите дефолт. Кстати, на Hacker News 30 июля вышла отдельная запись про K3-256k в Kimi Code — стоит свериться с актуальной таблицей тарифов перед покупкой.
164 секунды до первого токена ломают интерактивный сценарий. Это не придирка к цифре: при effort по умолчанию max модель думает долго по определению. Если гоняете K3 в CLI-агенте, крутите reasoning_effort вниз и замеряйте, что осталось от качества.
Избыточная инициативность. Обучение на длинных горизонтах приводит к тому, что при неоднозначном запросе K3 импровизирует, иногда сильно дальше границы, которую вы имели в виду. Лечится ужесточением системного промпта и AGENTS.md, но об этом надо знать заранее.
Сравнения по кодингу неполные с обеих сторон. Moonshot мерила свои цифры в основном харнессом Kimi Code, Anthropic — своим. BenchLM честно помечает кодинг и рассуждения как «не измерено» для K3. Любая таблица «K3 против Opus 5 по кодингу» сейчас собрана из разных харнессов, и относиться к ней надо соответственно.
У модели уже есть боевой послужной список не в ту сторону. Рой агентов на K3 нашёл серию 0-day в Redis, а в мультиплеерной арене Vending-Bench её обыграли и обманули все, кто мог. Сильная в наступательных задачах, наивная в переговорных — странное сочетание, которое стоит держать в голове.
Альтернативы
MiniMax M3 — по данным BenchLM, лучшая открытая модель по общему баллу (68,8). Слабее K3, зато влезает в разумное железо, и это решает вопрос локального запуска, который у K3 не решается никак.
GLM-5.2 — открытые веса, сильные результаты на DeepSWE, активно используется как рабочая лошадка. Именно на ней Hugging Face прогоняла разбор июльского вторжения, что говорит о доверии практиков к модели.
Claude Sonnet 5 — если нужен не открытый вес, а дешёвая закрытая модель для повседневного кода. Ближе к Opus по качеству на обычных задачах и не требует ни стойки, ни трёхминутного ожидания.
Вердикт
Берите K3 через API, если у вас батчевая обработка, мультимодальные задачи или агентный веб-браузинг: там она выигрывает и по качеству, и по цене. Не берите её для интерактивного кодинга в терминале — 164 секунды до первого токена убивают цикл обратной связи, а на SWE-bench Pro у неё просто нет числа, чтобы сравнить. И не покупайтесь на слово «открытая» как на обещание независимости: скачать 2,8T параметров вы можете, а запустить их — только если у вас уже есть инфраструктура, при наличии которой вопрос выбора модели решается совсем другими аргументами.
Как попробовать
- Возьмите ключ на platform.kimi.ai и дёрните модель
kimi-k3через OpenAI-совместимый эндпоинт. В Kimi Code она может называтьсяk3, ID зависит от продукта. - Первым делом замерьте время до первого токена на своём типичном промпте с
reasoning_effort: maxи сlow. Это решит за вас вопрос, годится ли модель для вашего сценария. - Сравните счёт честно: считайте не цену за миллион, а стоимость решённой задачи. Дешёвые токены при вдвое большем их числе экономии не дают.
- Если нужны локальные веса — сначала прочитайте текст Kimi K3 License, потом считайте железо. Полтора терабайта в MXFP4 не влезают в план «поставлю на рабочую станцию».
- Для сравнения с закрытыми моделями смотрите на BenchLM и Artificial Analysis, а не на таблицы из анонса: launch-таблица Moonshot построена против Opus 4.8, потому что Opus 5 тогда ещё не существовал.