$ grep -r "llm" ./posts/

# llm

Большие языковые модели — бенчмарки, архитектуры, контекстные окна, fine-tuning и практическое применение LLM в разработке.

Все ai claude-code llm agents open-source anthropic productivity tips developer-tools claude mcp coding openai api tools cursor gemini google
security codex cli automation ai-agents workflow testing pricing voice models ide qwen comparison coding-tools ai-tools skills devtools tokens multimodal openrouter ai-models plugins gpt ai-coding xai grok cybersecurity leak alibaba benchmarks tdd research coding-agent playwright orchestration codex-cli multi-agent context-window coding-agents memory python chatgpt stealth-models deepseek google-io-2026 gpt-5-6 moe benchmark git openclaw ralph-loop autonomous-coding github ios swift xcode computer-use gpt-5.4 code-review browser-automation unity game-development context-engineering vibe-coding web-scraping browser gemma china tts glm hunter-alpha video-generation owl-alpha protocol nvidia vision ollama gpt-5.6 local fable prompt-engineering safety coding-assistant deep-research terminal qa php laravel assistant worktrees docker parallel-development oauth websocket context-management mobile copilot perplexity multi-model image-generation remotion video shorts instagram tiktok permissions future code-intelligence knowledge-graph future-of-programming opinion hooks xctest commands local-ai liquid-ai privacy fast-mode copilot-cli macos linux windows machine-learning cron scheduled-tasks effort settings godot unreal-engine search-api tavily exa agent-teams opus-4.6 expo cowork remote-control plugin google-colab responsive-design frontend telegram discord channels astral superapp kimi licensing documentation prompts figma design web-development demo gamedev gemini-cli speech scraping self-improvement ultraplan debugging function-calling free-tools elevenlabs infrastructure configuration skill microsoft dotnet cost-optimization nous-research gpt-6 llama healer-alpha elephant-alpha gpt-5-5 tmux stealth-launch fal elixir linear rust tencent voice-cloning reasoning nemotron mythos policy dense-model game-dev open-beta sonnet gpt-55 spacex managed-agents realtime subq subquadratic long-context transformers finance edge-ai rag vector-search notion typescript workers malware chrome leaks veo lmarena fingerprinting api-pricing onboarding opus-4-8 robotics world-models physical-ai minimax free-models ocr baidu document-ai release-tracker gemini-35-pro ml amazon data-labeling amd hardware local-llm llama-cpp code-quality interpretability ai-safety meta apple lawsuit curl writing pentesting career wordpress vulnerability evaluation context7 redis devops rce prompt-injection migration
cursor-composer-2-own-coding-model.md
Cursor Composer 2 — собственная модель, которая бьёт Claude Opus 4.6 за десятую часть цены. Но пользователи уже просят вернуть старую версию
> · 8 мин

Cursor Composer 2 — собственная модель, которая бьёт Claude Opus 4.6 за десятую часть цены. Но пользователи уже просят вернуть старую версию

Cursor выпустил Composer 2 — первую in-house модель для кодинга, обученную исключительно на коде. Бьёт Claude Opus 4.6 на двух бенчмарках из трёх и стоит в 10-30 раз дешевле. Но архитектуру не раскрывают, а часть разработчиков откатывается на 1.5.

ai cursor ide agents
gpt-54-mini-nano-release.md
GPT-5.4 mini и nano — mini кодит почти как флагман, nano описывает 76 000 фотографий за $52, а цены выросли втрое
> · 7 мин

GPT-5.4 mini и nano — mini кодит почти как флагман, nano описывает 76 000 фотографий за $52, а цены выросли втрое

OpenAI выпустила GPT-5.4 mini и nano — маленькие модели, которые на бенчмарках догоняют флагман. Mini набирает 54.4% на SWE-Bench Pro, nano стоит $0.20 за миллион токенов. Но цены выросли в 3-4 раза по сравнению с предшественниками.

ai llm coding api
context-window-race-beyond-1m.md
1 миллион токенов — и что дальше? Гонка контекстных окон уже не про размер, а про то, что с ним делать
> · 9 мин

1 миллион токенов — и что дальше? Гонка контекстных окон уже не про размер, а про то, что с ним делать

Claude Opus 4.6 получил 1M контекст без наценки, Meta заявляет 10M, Magic.dev — 100M. Но реальная битва уже не за размер окна, а за context engineering — умение набить контекст правильными токенами вместо мусора.

ai agents llm claude-code
hindsight-agent-memory-system.md
Hindsight — open-source память для AI-агентов, которая учится как человеческий мозг, а не как тупой поиск по векторам
> · 8 мин

Hindsight — open-source память для AI-агентов, которая учится как человеческий мозг, а не как тупой поиск по векторам

Hindsight — open-source система памяти для AI-агентов от Vectorize.io. Три операции (Retain, Recall, Reflect), четыре стратегии поиска, SOTA на LongMemEval — и всё это через Docker за 60 секунд.

ai agents llm open-source
claude-code-opus-1m-context-default.md
Claude Code v2.1.75 — Opus 4.6 получил 1M контекст по умолчанию, и за это не берут ни цента сверху
> · 7 мин

Claude Code v2.1.75 — Opus 4.6 получил 1M контекст по умолчанию, и за это не берут ни цента сверху

Opus 4.6 и Sonnet 4.6 получили 1M контекст как стандарт — без beta-заголовков, без доплат, без конфигурации. Разбираем, что изменилось в Claude Code v2.1.75 и кому это реально пригодится.

ai llm anthropic claude-code
autoresearch-karpathy-overnight-ml.md
Autoresearch — Karpathy выложил фреймворк, где AI-агент ночью гоняет 100 ML-экспериментов на одной GPU
> · 7 мин

Autoresearch — Karpathy выложил фреймворк, где AI-агент ночью гоняет 100 ML-экспериментов на одной GPU

Andrej Karpathy упаковал autoresearch — фреймворк, где AI-агент сам модифицирует код обучения LLM, запускает 5-минутные тренировки и за ночь прогоняет ~100 экспериментов. 4.2K звёзд за два дня.

ai agents llm open-source
gpt-54-computer-use-agent.md
GPT-5.4 — миллион токенов, computer use быстрее человека и плагины для Excel, которые превращают ChatGPT в офисного работника
> · 8 мин

GPT-5.4 — миллион токенов, computer use быстрее человека и плагины для Excel, которые превращают ChatGPT в офисного работника

GPT-5.4 — первая mainline-модель OpenAI с нативным computer use и контекстом на 1M токенов. На OSWorld обогнала людей, на задачах инвестбанковского аналитика в Excel набирает 87.3%. Разбираем, что это значит для разработчиков.

ai agents llm openai
gemini-31-flash-lite.md
Gemini 3.1 Flash-Lite — $0.25 за миллион токенов, качество взрослого Flash и 363 токена в секунду
> · 7 мин

Gemini 3.1 Flash-Lite — $0.25 за миллион токенов, качество взрослого Flash и 363 токена в секунду

Google выпустила Gemini 3.1 Flash-Lite — самую быструю и дешёвую модель серии Gemini 3. $0.25 за миллион входных токенов, 363 tok/s, quality на уровне 2.5 Flash, thinking levels и мультимодальность. Разбираем, кому стоит мигрировать.

ai llm gemini google
openai-websocket-responses-api.md
OpenAI WebSocket mode — Responses API переезжает на постоянное соединение, и агенты ускоряются на 40%
> · 5 мин

OpenAI WebSocket mode — Responses API переезжает на постоянное соединение, и агенты ускоряются на 40%

OpenAI добавил WebSocket mode в Responses API — постоянное соединение, инкрементальные запросы и до 40% ускорения для агентских цепочек с десятками tool-вызовов.

agents llm api openai
ai-web-research-comparison.md
Кто лучше гуглит: Claude Opus 4.6, GPT-5.3 Codex или Gemini 3.1 Pro
> · 5 мин

Кто лучше гуглит: Claude Opus 4.6, GPT-5.3 Codex или Gemini 3.1 Pro

Три топовые модели февраля 2026 — и вопрос, который мучает всех: кто из них лучше ищет информацию в интернете? Разбираем бенчмарки, продукты Deep Research и реальные сценарии.

ai llm gemini claude