# llm
Большие языковые модели — бенчмарки, архитектуры, контекстные окна, fine-tuning и практическое применение LLM в разработке.
Caveman Claude — Claude Code skill, который говорит как неандерталец и экономит 75% output-токенов
Мем с Reddit про «научил Claude говорить как пещерный человек» за неделю стал Claude Code skill с 13 тысячами звёзд. Считаем, сколько реально экономит (спойлер: не 75%), как ставить и кому не подходит.
GLM-5.1 — open-source модель из Китая обошла Claude Opus и GPT-5.4 на SWE-Bench Pro, кодит 8 часов без остановки и стоит в 5 раз дешевле
Z.ai выпустила GLM-5.1 под MIT-лицензией: 58.4% на SWE-Bench Pro (выше Claude Opus 4.6 и GPT-5.4), 600+ итераций оптимизации без плато. API в 5-8 раз дешевле конкурентов, подключается к Claude Code за 5 минут.
Gemma 4 — Apache 2.0, function calling из коробки и 89% AIME. Google выложил open-weight модель, которая делает cloud API необязательным
Google DeepMind выпустил Gemma 4 — четыре open-weight модели от 2B до 31B под Apache 2.0 с native function calling и мультимодальностью. Flagship 31B занял #3 на Arena AI, обходит Qwen 3.5 по математике и кодингу, а E2B работает на телефоне.
Qwen3.5-Omni — 113 языков, голосовые клоны и аудио-видео в одном контуре. Alibaba наступает на пятки Gemini
Alibaba выкатила Qwen3.5-Omni — мультимодальную модель с текстом, картинками, аудио и видео в одном контуре. Три версии (Plus/Flash/Light), 256K контекста, 113 языков распознавания речи и voice cloning. Разбираем, что это даёт разработчику.
Claude Mythos — утечка раскрыла модель Anthropic, которая настолько сильна в кибербезе, что её боятся выпускать
Anthropic случайно раскрыла Claude Mythos — новый тир модели выше Opus с прорывными возможностями в кодинге и кибербезопасности. Акции CrowdStrike и Palo Alto рухнули на 7%.
Claude 5 — 90%+ SWE-bench, 500K контекст и дата «28 апреля», которую Amodei не отрицает. Разбираем всё, что известно
Dario Amodei подтвердил Claude 5 в Q2 2026, слил дату 28 апреля и обещал 90%+ SWE-bench. Разбираем, чего ждать разработчикам — и почему скептики не верят.
Cursor Composer 2 — собственная модель, которая бьёт Claude Opus 4.6 за десятую часть цены. Но пользователи уже просят вернуть старую версию
Cursor выпустил Composer 2 — первую in-house модель для кодинга, обученную исключительно на коде. Бьёт Claude Opus 4.6 на двух бенчмарках из трёх и стоит в 10-30 раз дешевле. Но архитектуру не раскрывают, а часть разработчиков откатывается на 1.5.
GPT-5.4 mini и nano — mini кодит почти как флагман, nano описывает 76 000 фотографий за $52, а цены выросли втрое
OpenAI выпустила GPT-5.4 mini и nano — маленькие модели, которые на бенчмарках догоняют флагман. Mini набирает 54.4% на SWE-Bench Pro, nano стоит $0.20 за миллион токенов. Но цены выросли в 3-4 раза по сравнению с предшественниками.
1 миллион токенов — и что дальше? Гонка контекстных окон уже не про размер, а про то, что с ним делать
Claude Opus 4.6 получил 1M контекст без наценки, Meta заявляет 10M, Magic.dev — 100M. Но реальная битва уже не за размер окна, а за context engineering — умение набить контекст правильными токенами вместо мусора.
Hindsight — open-source память для AI-агентов, которая учится как человеческий мозг, а не как тупой поиск по векторам
Hindsight — open-source система памяти для AI-агентов от Vectorize.io. Три операции (Retain, Recall, Reflect), четыре стратегии поиска, SOTA на LongMemEval — и всё это через Docker за 60 секунд.