# coding
Программирование с AI — паттерны совместной работы с LLM, code review, рефакторинг и подходы к написанию кода нового поколения.
80% на SWE-bench это не 80% решённых задач: как кодинг-лидерборды меряют ретривал, а не кодинг
Четыре работы за месяц показали, что кодинг-лидерборды меряют ретривал и обвязку, а не кодинг: OpenAI зарубила два своих бенчмарка, Cursor нашёл 63% найденных фиксов, RuBench поймал GPT-5.6 на добывании ответов с диска. Плюс инструкция, как честно померить агента на своём репозитории.
На чём кодить дёшево в июле 2026: GLM-5.2 обошёл GPT-5.5 на SWE-Pro, MiniMax M3 стоит копейки — но «open» не значит «на твоём ноуте»
Открытые веса догнали закрытых: GLM-5.2 обходит GPT-5.5 на SWE-bench Pro, MiniMax M3 стоит $0.30 за миллион токенов, а DeepSeek V4-Pro кодит почти как Opus за десятую часть цены. Сравниваем цену, бенчмарки, контекст и лицензии — и почему «open-weight» не значит «влезет в твой ноут».
На чём кодить в июле 2026: расклад моделей по цене и задаче, когда флагманы дорожают каждую неделю
Sonnet 5 стал дефолтом с хитрым токенизатором, Fable 5 ушёл в кредиты по $10/$50, GPT-5.6 в превью, а локальные модели дышат в спину облачным. Практический расклад: какую модель выбрать под задачу и бюджет, без маркетинга.
Laguna XS 2.1 — агентный кодер на 33B, который влезает в MacBook и не отправляет твой код никуда
Poolside выложила Laguna XS 2.1 — open-weight MoE на 33B (3B активных), которая крутится на Mac с 36 ГБ RAM. 70.9% на SWE-bench Verified, контекст 256K, установка одной командой в Ollama. Полностью локальный агентный кодер за спиной которого западная лаба.
GLM-5.2 — Китай выложил open-weight модель, которая бьёт GPT-5.5 и дышит в спину Claude Opus 4.8
Z.ai выложила GLM-5.2 — open-weight модель на 753B параметров под MIT, которая бьёт GPT-5.5 на кодинг-бенчмарках и отстаёт от Claude Opus 4.8 всего на 1% на длинных задачах. За первые дни она забрала 75% трафика Z.ai на OpenRouter. Разбираем цифры, цену, как подключить и почему дешёвый токен не значит дешёвый результат.
Qwen 3.7 Max — модель, которая 35 часов сама оптимизировала GPU-кернел на неизвестном железе. И стоит в 4 раза дешевле Opus
Alibaba тихо выкатила Qwen 3.7 Max — первый Max-вариант, который не вышел в open-source. 35 часов автономной работы, 1158 tool calls, 10× ускорение кернела на железе, которого не было в обучающих данных. И drop-in замена в Claude Code по нативному Anthropic-протоколу.
Gemini 3.5 Flash — Flash, который впервые бьёт собственный Pro. И стоит в 3 раза дороже прошлой Flash
Google выкатил Gemini 3.5 Flash на I/O 2026. Впервые в истории Flash-модель обходит свой собственный Pro на кодинге и MCP-агентах — 76.2% Terminal-Bench, 4× быстрее frontier-моделей, 1M контекст. Но цена выросла в 3 раза от прошлого Flash, а критики уже зовут её "benchmaxxed fraud". Разбираем бенчмарки, цены, Managed Agents с AGENTS.md/SKILL.md и сравнение с Claude Opus 4.7 и GPT-5.5.
Qwen3.6-27B — 27 миллиардов параметров обыграли 397 миллиардов на кодинге. И всё это влезает в одну GPU
27B dense-модель Alibaba под Apache 2.0 берёт 77.2% на SWE-bench Verified (уровень Claude Opus 4.5) и обходит собственного 397B MoE-предшественника. Влезает в RTX 4090 в Q4, мультимодальная, 262K контекста нативно (до 1M через YaRN). На OpenRouter $0.32 / $3.20 за миллион токенов.
GLM-5.1 — open-source модель из Китая обошла Claude Opus и GPT-5.4 на SWE-Bench Pro, кодит 8 часов без остановки и стоит в 5 раз дешевле
Z.ai выпустила GLM-5.1 под MIT-лицензией: 58.4% на SWE-Bench Pro (выше Claude Opus 4.6 и GPT-5.4), 600+ итераций оптимизации без плато. API в 5-8 раз дешевле конкурентов, подключается к Claude Code за 5 минут.
5 бесплатных AI-агентов для кодинга, которые заменяют подписку за $20 в месяц
OpenCode, Qwen Code, Gemini CLI, Cline и Aider — пять open-source AI-агентов для кодинга, которые стоят $0. Сравнение, установка, грабли и честный вердикт.