$ grep -r "llm" ./posts/

# llm

Большие языковые модели — бенчмарки, архитектуры, контекстные окна, fine-tuning и практическое применение LLM в разработке.

Все ai claude-code llm agents open-source anthropic productivity tips developer-tools claude mcp coding openai api tools cursor gemini google
security codex cli automation ai-agents workflow testing pricing voice models ide qwen comparison coding-tools ai-tools skills devtools tokens multimodal openrouter ai-models plugins gpt ai-coding xai grok cybersecurity leak alibaba benchmarks tdd research coding-agent playwright orchestration codex-cli multi-agent context-window coding-agents memory python chatgpt stealth-models deepseek google-io-2026 gpt-5-6 moe benchmark git openclaw ralph-loop autonomous-coding github ios swift xcode computer-use gpt-5.4 code-review browser-automation unity game-development context-engineering vibe-coding web-scraping browser gemma china tts glm hunter-alpha video-generation owl-alpha protocol nvidia vision ollama gpt-5.6 local fable prompt-engineering safety coding-assistant deep-research terminal qa php laravel assistant worktrees docker parallel-development oauth websocket context-management mobile copilot perplexity multi-model image-generation remotion video shorts instagram tiktok permissions future code-intelligence knowledge-graph future-of-programming opinion hooks xctest commands local-ai liquid-ai privacy fast-mode copilot-cli macos linux windows machine-learning cron scheduled-tasks effort settings godot unreal-engine search-api tavily exa agent-teams opus-4.6 expo cowork remote-control plugin google-colab responsive-design frontend telegram discord channels astral superapp kimi licensing documentation prompts figma design web-development demo gamedev gemini-cli speech scraping self-improvement ultraplan debugging function-calling free-tools elevenlabs infrastructure configuration skill microsoft dotnet cost-optimization nous-research gpt-6 llama healer-alpha elephant-alpha gpt-5-5 tmux stealth-launch fal elixir linear rust tencent voice-cloning reasoning nemotron mythos policy dense-model game-dev open-beta sonnet gpt-55 spacex managed-agents realtime subq subquadratic long-context transformers finance edge-ai rag vector-search notion typescript workers malware chrome leaks veo lmarena fingerprinting api-pricing onboarding opus-4-8 robotics world-models physical-ai minimax free-models ocr baidu document-ai release-tracker gemini-35-pro ml amazon data-labeling amd hardware local-llm llama-cpp code-quality interpretability ai-safety meta apple lawsuit curl writing pentesting career wordpress vulnerability evaluation context7 redis devops rce prompt-injection migration
skillsbench-agent-skills.md
SkillsBench — первый бенчмарк, где тестируют не модели, а скиллы для AI-агентов
> · 5 мин

SkillsBench — первый бенчмарк, где тестируют не модели, а скиллы для AI-агентов

SkillsBench — бенчмарк из 84 задач в 11 доменах. Skills поднимают pass rate на 16.2%, но самогенерация не работает. Haiku со скиллами бьёт Opus без них.

ai agents llm benchmark
opus-codex-gemini-coding-workflow.md
Opus vs Codex vs Gemini — три AI-модели, один workflow, ноль хаоса
> · 6 мин

Opus vs Codex vs Gemini — три AI-модели, один workflow, ноль хаоса

Claude Opus 4.6 и GPT-5.3 Codex вышли в один день и оказались не конкурентами, а напарниками. Разбираю, как строить workflow из трёх моделей — с Gemini 3.1 Pro в комплекте.

ai agents llm gemini
gemini-31-pro-benchmarks.md
Gemini 3.1 Pro — Google выходит в лидеры по 13 из 16 бенчмарков
> · 4 мин

Gemini 3.1 Pro — Google выходит в лидеры по 13 из 16 бенчмарков

Google выпустил Gemini 3.1 Pro — модель, которая обошла Claude Opus 4.6 и GPT-5.2 по большинству бенчмарков. ARC-AGI-2 вдвое выше предшественника, LiveCodeBench на уровне топ-программистов мира.

ai llm gemini google
cursor-25-marketplace-composer-agents.md
Cursor 2.5 — маркетплейс плагинов, собственный LLM и агенты, которые кодят двое суток без перерыва
> · 6 мин

Cursor 2.5 — маркетплейс плагинов, собственный LLM и агенты, которые кодят двое суток без перерыва

Cursor выпустил версию 2.5 с маркетплейсом плагинов (Figma, Stripe, AWS), собственной моделью Composer 1.5 с RL×20 и long-running агентами, которые автономно работают до 52 часов.

ai cursor ide coding-assistant
qwen-35-visual-agents-moe.md
Qwen 3.5 — 397 миллиардов параметров, 17 активных, и визуальный агент, который сам кликает кнопки
> · 5 мин

Qwen 3.5 — 397 миллиардов параметров, 17 активных, и визуальный агент, который сам кликает кнопки

Qwen 3.5: 397B параметров, 17B активных, визуальные агенты, 201 язык, Apache 2.0. В 12 раз дешевле Claude Opus. Обзор, бенчмарки, как запустить.

ai agents llm open-source
gpt-53-codex-spark.md
GPT-5.3-Codex — первый кодинг-агент, которым можно рулить на лету
> · 6 мин

GPT-5.3-Codex — первый кодинг-агент, которым можно рулить на лету

OpenAI объединили мощь GPT-5.2-Codex и reasoning GPT-5.2 в одном агенте: steering в реальном времени, 77.3% Terminal-Bench, а Codex-Spark на Cerebras выдаёт 1000 tok/s. API пока нет — но CLI и IDE уже работают.

ai agents llm coding
claude-sonnet-46.md
Claude Sonnet 4.6 — мозги Opus за пятую часть цены
> · 6 мин

Claude Sonnet 4.6 — мозги Opus за пятую часть цены

Anthropic выпустили Sonnet 4.6: 79.6% SWE-bench, Adaptive Thinking, 1M контекст, computer use 72.5% — и всё это за $3/$15 на миллион токенов. Разбираем, зачем платить за Opus.

ai agents llm coding