> · · 9 мин

Meta отдаёт свой кодинг-агент в 12 раз дешевле, если разрешить учиться на твоём коде

Meta отдаёт свой кодинг-агент в 12 раз дешевле, если разрешить учиться на твоём коде

У Meta теперь свой терминальный кодинг-агент, и главное в нём не фичи. Главное в нём прайс-лист, где одна и та же модель стоит либо 1,25 доллара за миллион входных токенов, либо 10 центов. Разница между тирами ровно одна: разрешаешь ли ты Meta учиться на твоих промптах и на том, что модель тебе ответила.

TL;DR: Meta выпустила Muse Code 5 августа: терминальный агент на Muse Spark 1.2 с постоянными фоновыми субагентами и локальным журналом событий, из которого сессия восстанавливается после краша. Тир Contributor дешевле стандартного в 12,5 раза на входе и в 21,25 раза на выходе, платишь своими данными. По замерам Artificial Analysis модель прибавила 260 пунктов Elo на агентной работе, но всего 2 пункта на Terminal-Bench, стоимость задачи выросла с 0,29 до 0,40 доллара, а галлюцинации упали в основном потому, что модель стала чаще отказываться отвечать.

Что такое Muse Code и чем он отличается

Терминальный агент, который ставится одной строкой на macOS или Linux:

curl -fsSL https://dev.meta.ai/install.sh | bash

Работает на Muse Spark 1.2, берёт задачи по большим репозиториям, планирует изменение, пишет код и проверяет результат. Статус: бета.

Два решения в архитектуре выглядят интереснее общих слов про автономность.

Первое, фоновые субагенты живут всю сессию, а не спавнятся под конкретную задачу. Meta объясняет это тем, что так они не собирают одну и ту же информацию по десять раз: специализированные агенты остаются активными, сами двигают следующие шаги и сами решают, когда доложить главному агенту. Если сравнивать с обычной схемой «породил субагента, получил ответ, забыл», то экономия здесь как раз на повторном сборе контекста.

Второе решение практичнее. У Muse Code локальный журнал событий, в который дописывается каждый вызов модели, каждый запуск тула, каждое одобрение и каждая правка. Из этого следует, что рантайм воспроизводится точно и переживает рестарт: после падения агент продолжает ровно с того места, где остановился. Для суточных задач это разница между «начать сначала» и «продолжить».

Из коробки три скилла: /plan превращает задачу в план с гейтом одобрения, /grill стресс-тестит этот план, пока он не начнёт держаться, /goal работает на достижение заданной цели. Скилл /grill мне нравится концептуально: агент, который сначала пытается развалить собственный план, честнее агента, который сразу побежал писать код.

В качестве демонстрации выносливости Meta приводит оптимизацию GPU-ядер: больше тысячи вызовов тулов, до 24 часов работы, ядра KDA и MLA под NVIDIA Hopper. Условие показательное: импортировать сторонние библиотеки ядер вроде FLA запрещали, надо было реализовывать алгоритм в Triton самому. Для MLA модель собрала двухкерневый Triton-пайплайн с переиспользованием общего KV latent сразу как K и как V, для KDA скомбинировала chunk-parallel подготовку с последовательным сканом между чанками и ре-центрированием gated cumulative decay в середине чанка. Сравнение шло с референсом на PyTorch при batch 1, 64 головах, длине 8192 и латентной размерности 512.

Сколько стоит и в чём подвох Contributor

Стандартный тир: 1,25 доллара за миллион входных токенов, 0,15 за миллион кешированных, 4,25 за миллион выходных. Тир Contributor: 0,10 за вход, 0,002 за кешированный вход, 0,20 за выход. Модель одна и та же, доступ одинаковый, тир выбирается на уровне запроса.

Отличие только в одном пункте: на Contributor Meta использует твои промпты и ответы модели для улучшения своих продуктов. На стандартном тире не использует.

В деньгах это 12,5 раза на входе и 21,25 раза на выходе. На реальном профиле команды из пяти инженеров с двумя сотнями ревью пулл-реквестов и четырьмя сотнями точечных правок в месяц разница выглядит как 30 до 80 долларов против 2 до 6 в зависимости от попадания в кеш.

Стратегия читается без усилий. Cursor поднимает раунд при оценке около 50 миллиардов, GitHub замораживал регистрацию новых пользователей Copilot, потому что агентное потребление вылезло за экономику подписки, а Meta заходит на этот рынок последней и покупает вход данными. Люди, которые сэкономят больше всех, это те же люди, которые закроют Meta отставание от более отточенных конкурентов.

Отдельная деталь для тех, кто планирует интеграцию: совместимость SDK на момент запуска не документирована, и предполагать совместимость с SDK OpenAI не стоит, пока Meta это не подтвердит. Лимиты запросов тоже не опубликованы. Единственный формально задокументированный клиент, это CLI Muse Code.

Насколько Muse Spark 1.2 реально стал умнее

Прибавка есть, но она узкая. Artificial Analysis поставила модели 54 по своему Intelligence Index: плюс 3 к версии 1.1 и плюс 11 к апрельской 1.0. Это вровень с GPT-5.5 (55) и Grok 4.5 (54) и позади Claude Opus 5 (61), Claude Fable 5 (60), GPT-5.6 Sol (59) и Kimi K3 (57). Meta дала им доступ до публичного релиза.

Дальше разбивка, и она объясняет, почему заголовки про Meta в этот раз бодрее реальности. Весь прирост сконцентрирован в агентной части: GDPval-AA v2 плюс 260 пунктов Elo, с 1371 до 1631, что даёт пятое место среди всех замеренных моделей и обгоняет Claude Opus 4.8 с его 1588. А Terminal-Bench v2.1, который мерит агентный кодинг и работу в терминале, прибавил 2 пункта: с 78% до 80%. Инструментальный τ³-Banking тоже 2 пункта, с 25% до 27%. Есть и регрессии: SciCode минус 2 пункта, Humanity's Last Exam минус 1.

То есть 260 Elo относятся к офисной агентной работе вроде подготовки презентаций и анализа с доступом к шеллу и браузеру, а не к кодингу. На кодинге прибавка два пункта. Для агента, которого продают как кодинг-агента, это стоит держать в голове.

И цена задачи выросла: 0,40 доллара за задачу Intelligence Index против 0,29 у версии 1.1. Причина не в тарифе, тариф не менялся, а в расходе токенов: вход вырос примерно на 53%, выход примерно на 36%, и рост сконцентрирован именно в GDPval-AA v2. Умнее на агентных задачах и на 38% дороже за задачу.

Почему галлюцинаций стало меньше

Потому что модель стала чаще молчать. Индекс AA-Omniscience вырос с 18 до 22, и доля галлюцинаций упала сразу на 10 пунктов, с 38% до 28%. Красиво, пока не посмотришь на два соседних числа: доля попыток ответить упала с 82% до 67%, а точность съехала с 41% до 38%.

Механика бенчмарка объясняет всё: он награждает правильные ответы, наказывает галлюцинации и не наказывает отказ отвечать. Модель, которая чаще воздерживается, автоматически выглядит честнее. Artificial Analysis прямо пишет, что это уже второй релиз Meta подряд, где рост индекса вытянут воздержанием.

Для практики это два разных инструмента. Если тебе нужен ассистент, который лучше промолчит, чем придумает имя функции, поведение полезное. Если нужен агент, который доводит задачу до конца без твоего участия, готовься к тому, что он чаще будет останавливаться и спрашивать.

Подводные камни

Установка через curl | bash. Единственный задокументированный способ поставить агента, это скачать скрипт с dev.meta.ai и сразу исполнить его в шелле. Через неделю после того, как npm-червь ChainDrop за четыре часа отравил 444 пакета и первым делом полез в конфиги кодинг-агентов, такой способ поставки хочется как минимум скачать отдельно и прочитать.

Contributor это не «анонимная телеметрия». Meta использует промпты и завершения. В промпт кодинг-агента попадает содержимое файлов, которые он прочитал, а в завершения попадает код, который он написал. Для проприетарного репозитория это не скидка, это публикация с отсрочкой.

Тир выбирается на уровне запроса, а значит его легко перепутать. Разумная схема, это роутить по чувствительности на шлюзе, а не в вызывающем коде, и алертить на запросы, ушедшие не в тот тир. Один неправильно помеченный запрос отменяет всю политику.

Плюс 260 Elo это не про кодинг. Цифра из офисной агентной работы. На агентном кодинге прибавка два пункта, а стоимость задачи при этом выросла на 38% из-за роста расхода токенов.

Меньше галлюцинаций куплено отказами. Attempt rate 67% против 82% означает, что каждый третий вопрос модель предпочитает не трогать. В интерактиве это плюс, в автономном прогоне это остановки.

SDK и лимиты не документированы. Совместимость с SDK OpenAI не заявлена, лимиты запросов не опубликованы. Если строишь на этом продакшен, оберни клиент тонкой абстракцией, чтобы замена была правкой в одном файле.

Альтернативы

Claude Code. Дороже, но данные на стандартных тирах не идут в обучение, а модель по Intelligence Index заметно выше (Opus 5 на 61 против 54). Разница в цене на длинных сессиях реальная, разница в качестве на кодинге тоже.

Codex CLI. Тоже терминальный агент, свежая версия умеет забирать скиллы из Cursor и Claude Code. Один прайс без тира за данные, зато и десятикратной скидки нет.

Открытые веса на своём железе. Единственный вариант, где вопрос «кто учится на моём коде» снимается полностью. Например TurboFieldfare запускает 26B в двух гигабайтах памяти, но до фронтир-уровня агентной работы там далеко.

Стандартный тир Muse Spark 1.2 без Contributor. 1,25 против 4,25 за миллион, это всё равно дешевле фронтира, а модель ровно та же. Если Muse Code понравился, а данные отдавать не хочется, это и есть очевидный компромисс.

Вердикт

Contributor бери на открытом коде и на пет-проектах, там скидка в 12,5 раза бесплатная в буквальном смысле: код и так публичный. Не бери на клиентском или проприетарном репозитории ни под каким предлогом, потому что в промпты кодинг-агента попадает содержимое файлов, а не только твои вопросы.

Сам Muse Code стоит попробовать за две вещи, которые не про модель: журнал событий, из которого сессия восстанавливается после падения, и скилл /grill, который ломает план до того, как по нему начнут писать код. Если ждёшь от Muse Spark 1.2 рывка в кодинге, то по независимым замерам его нет: два пункта на Terminal-Bench при росте стоимости задачи на 38%.

Как попробовать

  1. Скачай установщик отдельно, а не в пайп: curl -fsSL https://dev.meta.ai/install.sh -o muse-install.sh, прочитай, потом запусти.
  2. Начни с /plan на реальной задаче, потом прогони /grill по этому плану. Разница между первым и вторым планом покажет, чего стоит агент на твоей кодовой базе.
  3. Проверь, что тир выставлен осознанно. Contributor выбирается на уровне запроса, поэтому решай это на шлюзе, а не в коде вызова.
  4. Убей процесс агента посреди длинной задачи и запусти снова. Восстановление из журнала событий, это главная заявленная фича рантайма, и проверяется она за минуту.
  5. Сверь свои ожидания с разбором Artificial Analysis, а не с релизным постом: там есть и прирост в 260 Elo, и рост расхода токенов, и разбивка по отказам.
$ ls ./related/

Похожие статьи

microsoft-flint-charts-mcp.md
Microsoft Flint: агент описывает график в пять строк, а компилятор собирает его в Vega-Lite, Plotly и Excel
> · 7 мин

Microsoft Flint: агент описывает график в пять строк, а компилятор собирает его в Vega-Lite, Plotly и Excel

Flint от Microsoft Research — промежуточный язык визуализации под MIT. Ты описываешь компактный спек с семантическими типами полей, а компилятор сам выводит масштабы, оси, отступы и раскладку. Один вход собирается в Vega-Lite, ECharts, Chart.js, Plotly и нативные графики Excel. В комплекте MCP-сервер: npx -y flint-chart-mcp, и агент рисует прямо из чата.

ai open-source devtools mcp
deepseek-v4-flash-0731-verbosity.md
DeepSeek V4 Flash: №3 по интеллекту и последнее место по знаниям. Один чекпоинт, два индекса, 210 млн токенов
> · 8 мин

DeepSeek V4 Flash: №3 по интеллекту и последнее место по знаниям. Один чекпоинт, два индекса, 210 млн токенов

У Artificial Analysis DeepSeek V4 Flash 0731 — третье место по интеллекту из 101 модели и первое по цене кеш-хита. У BenchLM та же модель в категории «знания» стоит на 55-м месте из 55. Оба индекса корректны. Разбираем, почему так выходит, куда уходят деньги при прайсе $0,14 за миллион и какие циркулирующие бенчмарки относятся к апрельскому превью, а не к новому чекпоинту.

ai llm benchmarks deepseek
qwen-38-max-launch.md
> · 8 мин

Qwen3.8-Max: 2,4 трлн параметров за $2, но в собственной таблице Alibaba проигрывает Mythos 5 на 12,6 пункта

Alibaba выпустила Qwen3.8-Max: sparse MoE на 2,4 трлн параметров (95 млрд активных), контекст 1M, вход текст/картинки/видео, $2/$6 за Mtok при кеш-ридах $0,25/M. Открытые веса обещаны «на следующей неделе» и пока не вышли. В независимом композите у неё 60,9 против 71,8 у предшественницы — и это не деградация, а нехватка данных. Разбираем, как не попасться на оба числа.

ai llm benchmarks qwen
subscribe.sh

$ cat /dev/blog/updates

> Свежие заметки о программировании,

> DevOps и AI — прямо в мессенджер

./subscribe