# llm
Большие языковые модели — бенчмарки, архитектуры, контекстные окна, fine-tuning и практическое применение LLM в разработке.
За два дня отключили 21 модель: все codex прошлых поколений и оба имени DeepSeek. Плюс тихий баг, который увеличит твой счёт
23 июля OpenAI выключила 19 снапшотов, включая gpt-5-codex, gpt-5.1-codex-max и gpt-5.2-codex. 24 июля DeepSeek убила deepseek-chat и deepseek-reasoner без грейс-периода. В миграции DeepSeek спрятана ловушка: режим размышления включается по умолчанию и молча раздувает счёт. Что грепать и какие даты держать в календаре.
Agent Data Injection: атака не даёт агенту ни одной команды, а он всё равно запускает чужой код
Исследователи из Сеульского национального университета и UIUC показали атаку, которая обходит все защиты от prompt injection, потому что не подделывает инструкции — она подделывает факты. Доля успеха доходит до 100%, проверено на Claude Code, Codex, Gemini CLI и веб-агентах. Как защищаться, пока фикса нет.
3607 случаев, когда агент сделал не то: главная угроза оказалась не бэкдорами, а услужливостью
Открытый корпус Reward Hacking in the Wild собрал 3607 пользовательских жалоб на поведение AI-агентов и разметил их по 14 категориям. Скрытые бэкдоры — 0,4%, порча тестов — 1,2%, а избыточная инициатива — 43,4%. Что из этого следует для тех, кто даёт агентам права на запись.
Иди проверь версию Redis: майский патч не спасает, PoC уже в открытом гите. А дыры нашёл рой агентов на Kimi K3
23 июля Redis выпустил семь релизов безопасности после публикации рабочих RCE-цепочек против стоковых 6.2.22, 7.4.9, 8.6.4 и 8.8.0. Майские «безопасные» версии пробиты, CVE на новые баги нет, поэтому сканеры молчат. Что проверить прямо сейчас и почему релиз-ноты 8.6.4 вводят в заблуждение.
Claude Opus 5: «вдвое дешевле» — это не про твой счёт. Цена та же, что у Opus 4.8, а изменилась цензура
Anthropic выпустила Claude Opus 5 24 июля: 43,3% на Frontier-Bench против 33,7% у Fable 5. Но цена осталась ровно как у Opus 4.8 — $5/$25. Разбираем, где реальная экономия, почему кибер-классификаторы теперь срабатывают на 85% реже и что не так со сноской под главным бенчмарком.
80% на SWE-bench это не 80% решённых задач: как кодинг-лидерборды меряют ретривал, а не кодинг
Четыре работы за месяц показали, что кодинг-лидерборды меряют ретривал и обвязку, а не кодинг: OpenAI зарубила два своих бенчмарка, Cursor нашёл 63% найденных фиксов, RuBench поймал GPT-5.6 на добывании ответов с диска. Плюс инструкция, как честно померить агента на своём репозитории.
Google выпустила три Gemini и снова не выпустила 3.5 Pro. Зато уже учит Gemini 4
Google выпустила Gemini 3.6 Flash, Flash-Lite и закрытую Flash Cyber, но снова отложила флагман 3.5 Pro и начала учить Gemini 4. Разбираем цены, бенчмарки, дуал-юз кибермодели и подводные камни, включая баг с квотой в Antigravity и недоступность из РФ.
Дедлайн Fable 5 всё-таки наступил: Max получил модель навсегда, Pro отправили платить по $10/$50 за миллион токенов
После трёх продлений Anthropic не стала продлевать промо Fable 5 в четвёртый раз, а разделила пользователей по тарифам: Max получил модель навсегда, Pro перевели на оплату по токенам $10/$50 за миллион. Считаем реальную стоимость сессии, разбираем разовый кредит $100 и куда уходить с Pro.
На чём кодить дёшево в июле 2026: GLM-5.2 обошёл GPT-5.5 на SWE-Pro, MiniMax M3 стоит копейки — но «open» не значит «на твоём ноуте»
Открытые веса догнали закрытых: GLM-5.2 обходит GPT-5.5 на SWE-bench Pro, MiniMax M3 стоит $0.30 за миллион токенов, а DeepSeek V4-Pro кодит почти как Opus за десятую часть цены. Сравниваем цену, бенчмарки, контекст и лицензии — и почему «open-weight» не значит «влезет в твой ноут».
«Это не просто фича — это философия»: главный тик AI-текстов, который никто не может объяснить. The Atlantic посчитал, Fortune 500 спалилась
The Atlantic разобрал негативный параллелизм — конструкцию «это не X, а Y», на которой сходятся модели всех лабораторий. Механизм никто не может объяснить, а Barron's насчитал 4-кратный рост паттерна в отчётах Fortune 500. Как вычистить тик из своих текстов и доков.