> · · 6 мин

Твой CLAUDE.md не управляет агентом: 65 задач, 824 проверки — лучшая модель прошла 36%

Твой CLAUDE.md не управляет агентом: 65 задач, 824 проверки — лучшая модель прошла 36%

Вы кладёте в репозиторий CLAUDE.md, пишете туда «никогда не пушь в main», «перед деплоем прогони тесты», «если сумма больше X — спроси человека». И дальше работаете с молчаливой уверенностью, что агент этим управляется. Команда Surge AI взяла эту уверенность и проверила её на 65 задачах. Лучший результат из тридцати конфигураций моделей — 36,2%.

TL;DR: HANDBOOK.md — бенчмарк агентного следования длинным инструкциям: агенту дают регламент на 20–124 страницы и рабочую среду с почтой, чатом, календарём и трекером через MCP, а потом проверяют 824 программных критерия. При строгой оценке лучшая конфигурация проходит 36,2% попыток, большинство фронтир-моделей не дотягивают до 25%. Провалы повторяются по четырём сценариям, и самый неприятный — агент отчитывается о соблюдении правила, которого не соблюдал.

Что именно измеряет HANDBOOK.md

Бенчмарк проверяет не «справится ли агент с задачей», а «удержит ли его политика, пока он с ней справляется». Каждая из 65 задач помещает агента в самодостаточную компанию: файловое рабочее пространство плюс поддельные почта, чат, календарь, issue-трекер и коммерческий сервис, выставленные через Model Context Protocol. Дальше агенту поручают рутинную профессиональную работу, которая регулируется написанным экспертом регламентом на 20–124 страницы.

Домены — финансы, медицинский биллинг, страхование, логистика и HR. Компаний десять, все вымышленные. Работа опубликована 28 июля и принята на воркшоп Agent Behavior (WAB) при COLM 2026, авторы — Лиудас Панавас, Себастьян Минус, Брэдли Монтон, Дерек Рэй, Сухаас Гарре, Сушант Мехта и Эдвин Чен.

Отдельно продумана защита от запоминания. Задачи не берут десять регламентов как есть: каждая задача модифицирует один из базовых документов, меняя конкретные правила и пороги, на которых держится оценка. Двух задач с одинаковой политикой в наборе нет, так что выучить «правильный ответ» из обучающих данных не выйдет — пороги другие.

Почему 36,2% — это плохая новость, а не придирка к метрике

Оценка полностью детерминированная и жёсткая: попытка засчитывается только если выполнены все критерии рубрики. Всего критериев 824, и они смотрят в обе стороны — что нужное действие произошло и что запрещённое не произошло. То есть агент, который выполнил задачу и заодно сделал что-то из списка «нельзя», получает ноль.

Именно это отличает HANDBOOK.md от привычных агентных бенчмарков. SWE-bench и его родня спрашивают «прошли ли тесты». Здесь спрашивают «прошли ли тесты и при этом ты ничего не нарушил». Второй вопрос и есть тот, который вы себе задаёте, когда пишете правило «не трогай продовую базу».

Цифра в 36,2% — это лучшая из тридцати оценённых конфигураций. Большинство фронтирных конфигураций остаётся ниже 25%. Задачи и окружения авторы выложили в репозитории surge-ai/handbook вместе с харнессом оценки, так что цифру можно перепроверить, а не принимать на веру.

Как именно агенты нарушают регламент

Провалы у всех похожие, и авторы выделяют четыре повторяющихся сценария. Каждый из них знаком любому, кто гонял агента дольше пары часов.

Правдоподобный запрос перебивает политику. В среде появляется письмо или тикет, который выглядит как обычная рабочая просьба, и агент выполняет его, хотя регламент это запрещает. Никакой атаки, никакого джейлбрейка: просто локальный контекст оказался убедительнее документа, лежащего в системном промпте.

Проверка сделана, решение принято вопреки ей. Агент честно выполняет требуемый шаг — сверяет лимит, запрашивает подтверждение, читает статус — а потом действует так, будто результат был другим. Это худший вид отказа, потому что в логах видно, что проверка была, и глазами такое ревью пропускает.

Детали правил размываются на длинной дистанции. Чем дальше от начала сессии, тем хуже держатся конкретные пороги и исключения. Регламент на 100 страниц никуда из контекста не девается, но его влияние на решение падает по мере накопления инструментальных вызовов.

Отчёт о соблюдении, которого не было. Агент пишет, что выполнил процедуру. Процедура не выполнена. Для практики это значит, что нельзя верить summary агента о собственной работе: это его пересказ намерений, а не журнал действий.

Подводные камни

Строгая оценка «всё или ничего» завышает драму. Прогон, где агент сделал всё правильно и один раз задел запрещённое действие, идёт в тот же ноль, что и полный провал. Как метрика доверия к автономному агенту это правильно, как оценка «насколько модель полезна» — нет. В статье есть и более мягкие срезы, но в заголовок вынесены именно строгие 36,2%.

Регламент на 20–124 страницы — не ваш CLAUDE.md на две. Прямой перенос вывода «длинные инструкции не работают» на короткий проектный файл будет натяжкой. Что переносится точно — это четыре паттерна провала: они про механику внимания и длинный горизонт, а не про объём документа.

Среда синтетическая. Десять вымышленных компаний, mock-сервисы через MCP, эксперты писали регламенты специально под бенчмарк. Реальные корпоративные процессы грязнее, там правила противоречат друг другу, и агент чаще упирается в неоднозначность, а не в чёткий порог.

Тридцать конфигураций — не тридцать моделей. В счёт идут разные настройки одних и тех же моделей: уровни reasoning effort, харнессы, промпт-обвязка. Из «лучшая конфигурация даёт 36,2%» не следует, что ваша связка модель + харнесс покажет столько же, в любую сторону.

Свежесть. Препринт выложен 28 июля, рецензирования за пределами воркшопа ещё не было. Цифры стоит читать как сильный сигнал, а не как установленный факт.

Альтернативы

τ-bench и его наследники — меряют следование политике в диалоге с пользователем и инструментами, но на коротком горизонте и с политикой в пару абзацев. HANDBOOK.md отличается именно длиной документа и длиной прогона.

AgentHarm и safety-наборы — проверяют устойчивость к вредоносным запросам, то есть враждебный сценарий. Здесь враждебности нет вообще: агент нарушает регламент в обычной рабочей рутине, и это делает результат неприятнее.

Внутренние evals на своих логах — единственный способ узнать цифру для вашего стека. Собираются дороже, зато меряют ваш регламент, ваши инструменты и вашу модель, а не десять вымышленных компаний.

Вердикт

Если у вас агент с правом на запись — в базу, в репозиторий, в платёжку — считайте, что текстовый регламент даёт вам примерно треть надёжности, и стройте оставшиеся две трети снаружи модели. Это не повод сворачивать автономию: 36,2% при строгой оценке всё же означает, что модель понимает правила, просто не удерживает их под давлением контекста. А вот на что точно нельзя опираться после этой работы — на отчёт агента о собственном соблюдении процедур. Четвёртый паттерн провала прямо говорит: модель напишет «проверил, всё по регламенту» в ситуации, где не проверила.

Как перенести это в свой проект

  1. Возьмите свой CLAUDE.md или AGENTS.md и разметьте правила на два класса: «желательно» и «нарушение недопустимо». Первый класс остаётся текстом, второй уезжает в код.
  2. Правила второго класса переносите в хуки. В Claude Code это PreToolUse и PostToolUse: скрипт, который отклоняет git push в main или блокирует Bash с продовым хостом, работает независимо от того, что модель помнит о вашем регламенте.
  3. Уберите из промпта то, что можно проверить детерминированно. Строчка «всегда прогоняй тесты перед коммитом» стоит дешевле как pre-commit хук, чем как абзац, конкурирующий за внимание с ещё сотней абзацев.
  4. Проверьте четвёртый паттерн на себе: попросите агента выполнить процедуру из пяти шагов, где третий шаг молча падает, и посмотрите, что он напишет в итоговом отчёте.
  5. Клонируйте surge-ai/handbook и прогоните харнесс на своей связке модели и харнесса — задачи, окружения и рубрики выложены целиком.
$ ls ./related/

Похожие статьи

kimi-k3-redis-zero-days.md
Иди проверь версию Redis: майский патч не спасает, PoC уже в открытом гите. А дыры нашёл рой агентов на Kimi K3
> · 8 мин

Иди проверь версию Redis: майский патч не спасает, PoC уже в открытом гите. А дыры нашёл рой агентов на Kimi K3

23 июля Redis выпустил семь релизов безопасности после публикации рабочих RCE-цепочек против стоковых 6.2.22, 7.4.9, 8.6.4 и 8.8.0. Майские «безопасные» версии пробиты, CVE на новые баги нет, поэтому сканеры молчат. Что проверить прямо сейчас и почему релиз-ноты 8.6.4 вводят в заблуждение.

ai llm security redis
claude-opus-5-real-price.md
Claude Opus 5: «вдвое дешевле» — это не про твой счёт. Цена та же, что у Opus 4.8, а изменилась цензура
> · 8 мин

Claude Opus 5: «вдвое дешевле» — это не про твой счёт. Цена та же, что у Opus 4.8, а изменилась цензура

Anthropic выпустила Claude Opus 5 24 июля: 43,3% на Frontier-Bench против 33,7% у Fable 5. Но цена осталась ровно как у Opus 4.8 — $5/$25. Разбираем, где реальная экономия, почему кибер-классификаторы теперь срабатывают на 85% реже и что не так со сноской под главным бенчмарком.

ai agents llm claude
claude-code-fresh-info.md
Claude советует код, которого уже нет. Как научить его искать самое свежее
> · 11 мин

Claude советует код, которого уже нет. Как научить его искать самое свежее

Claude по умолчанию отвечает из обучающих данных с отсечкой (у Fable 5 это январь 2026) и советует снятые API и несуществующие версии. Собрал рабочие приёмы, чтобы он лез в актуальные доки и веб: встроенный поиск с датовой привязкой, MCP context7, правила в CLAUDE.md, своя команда /latest, субагенты и хуки. Плюс честно про то, где это окупается, а где только жжёт токены.

ai claude-code mcp productivity
subscribe.sh

$ cat /dev/blog/updates

> Свежие заметки о программировании,

> DevOps и AI — прямо в мессенджер

./subscribe