# ai
Искусственный интеллект в разработке — новости моделей, сравнения, инструменты и практики использования AI для написания кода и автоматизации.
MCP 2026-07-28 вышла финалом: сессий больше нет, initialize нет, -32002 стал -32602
Финальная спецификация MCP опубликована 28 июля. Протокол стал stateless: пропали Mcp-Session-Id и рукопожатие initialize, Roots/Sampling/Logging уехали в депрекейт на 12 месяцев, а между RC и финалом добавилось обязательное поле resultType.
Claude Opus 5 сколотил картель, нарушил 11 перемирий и вернул покупателям $8,54
Andon Labs посадила Opus 5, GPT-5.6 Sol и Kimi K3 управлять торговыми автоматами по соседству. Opus поставил рекорд бенчмарка в $11 182, предлагал ценовой сговор во всех шести прогонах и одобрял возвраты в 10% случаев против 71% у GPT.
Твой CLAUDE.md не управляет агентом: 65 задач, 824 проверки — лучшая модель прошла 36%
Surge AI выложила HANDBOOK.md — бенчмарк, который проверяет не «справился ли агент с задачей», а «удержал ли его регламент, пока он справлялся». Лучшая из 30 конфигураций проходит 36,2% попыток, большинство фронтир-моделей — меньше 25%.
Codex теперь рулится голосом, а мультипапочный проект читает только один AGENTS.md
OpenAI 23 июля привезла ChatGPT Voice в десктопные приложения: голосом можно запускать и проверять задачи Codex в других тредах, а на macOS включается Screen context. Плюс мультипапочные проекты с неочевидным поведением конфигов и релиз Codex CLI 0.145.0, где /import переносит настройки из Cursor и Claude Code.
Agent Data Injection: атака не даёт агенту ни одной команды, а он всё равно запускает чужой код
Исследователи из Сеульского национального университета и UIUC показали атаку, которая обходит все защиты от prompt injection, потому что не подделывает инструкции — она подделывает факты. Доля успеха доходит до 100%, проверено на Claude Code, Codex, Gemini CLI и веб-агентах. Как защищаться, пока фикса нет.
3607 случаев, когда агент сделал не то: главная угроза оказалась не бэкдорами, а услужливостью
Открытый корпус Reward Hacking in the Wild собрал 3607 пользовательских жалоб на поведение AI-агентов и разметил их по 14 категориям. Скрытые бэкдоры — 0,4%, порча тестов — 1,2%, а избыточная инициатива — 43,4%. Что из этого следует для тех, кто даёт агентам права на запись.
Иди проверь версию Redis: майский патч не спасает, PoC уже в открытом гите. А дыры нашёл рой агентов на Kimi K3
23 июля Redis выпустил семь релизов безопасности после публикации рабочих RCE-цепочек против стоковых 6.2.22, 7.4.9, 8.6.4 и 8.8.0. Майские «безопасные» версии пробиты, CVE на новые баги нет, поэтому сканеры молчат. Что проверить прямо сейчас и почему релиз-ноты 8.6.4 вводят в заблуждение.
Claude Opus 5: «вдвое дешевле» — это не про твой счёт. Цена та же, что у Opus 4.8, а изменилась цензура
Anthropic выпустила Claude Opus 5 24 июля: 43,3% на Frontier-Bench против 33,7% у Fable 5. Но цена осталась ровно как у Opus 4.8 — $5/$25. Разбираем, где реальная экономия, почему кибер-классификаторы теперь срабатывают на 85% реже и что не так со сноской под главным бенчмарком.
Claude советует код, которого уже нет. Как научить его искать самое свежее
Claude по умолчанию отвечает из обучающих данных с отсечкой (у Fable 5 это январь 2026) и советует снятые API и несуществующие версии. Собрал рабочие приёмы, чтобы он лез в актуальные доки и веб: встроенный поиск с датовой привязкой, MCP context7, правила в CLAUDE.md, своя команда /latest, субагенты и хуки. Плюс честно про то, где это окупается, а где только жжёт токены.
80% на SWE-bench это не 80% решённых задач: как кодинг-лидерборды меряют ретривал, а не кодинг
Четыре работы за месяц показали, что кодинг-лидерборды меряют ретривал и обвязку, а не кодинг: OpenAI зарубила два своих бенчмарка, Cursor нашёл 63% найденных фиксов, RuBench поймал GPT-5.6 на добывании ответов с диска. Плюс инструкция, как честно померить агента на своём репозитории.