$ grep -r "research" ./posts/

# research

Все ai claude-code llm agents open-source anthropic productivity tips developer-tools claude mcp coding openai api tools cursor gemini google
security codex cli automation ai-agents workflow testing pricing voice models ide qwen comparison coding-tools ai-tools skills devtools tokens multimodal openrouter ai-models plugins gpt ai-coding xai grok cybersecurity leak alibaba benchmarks tdd research coding-agent playwright orchestration codex-cli multi-agent context-window coding-agents memory python chatgpt stealth-models deepseek protocol google-io-2026 gpt-5-6 moe benchmark git openclaw ralph-loop autonomous-coding github ios swift xcode computer-use gpt-5.4 code-review browser-automation unity game-development context-engineering vibe-coding web-scraping browser gemma china tts glm hunter-alpha video-generation owl-alpha nvidia vision ollama gpt-5.6 local fable prompt-engineering safety coding-assistant deep-research terminal qa php laravel assistant worktrees docker parallel-development oauth websocket context-management mobile copilot perplexity multi-model image-generation remotion video shorts instagram tiktok permissions future code-intelligence knowledge-graph future-of-programming opinion hooks xctest commands local-ai liquid-ai privacy fast-mode copilot-cli macos linux windows machine-learning cron scheduled-tasks effort settings godot unreal-engine search-api tavily exa agent-teams opus-4.6 expo cowork remote-control plugin google-colab responsive-design frontend telegram discord channels astral superapp kimi licensing documentation prompts figma design web-development demo gamedev gemini-cli speech scraping self-improvement ultraplan debugging function-calling free-tools elevenlabs infrastructure configuration skill microsoft dotnet cost-optimization nous-research gpt-6 llama healer-alpha elephant-alpha gpt-5-5 tmux stealth-launch fal elixir linear rust tencent voice-cloning reasoning nemotron mythos policy dense-model game-dev open-beta sonnet gpt-55 spacex managed-agents realtime subq subquadratic long-context transformers finance edge-ai rag vector-search notion typescript workers malware chrome leaks veo lmarena fingerprinting api-pricing onboarding opus-4-8 robotics world-models physical-ai minimax free-models ocr baidu document-ai release-tracker gemini-35-pro ml amazon data-labeling amd hardware local-llm llama-cpp code-quality interpretability ai-safety meta apple lawsuit curl writing pentesting career wordpress vulnerability evaluation context7 redis devops rce prompt-injection migration alignment
reward-hacking-in-the-wild.md
3607 случаев, когда агент сделал не то: главная угроза оказалась не бэкдорами, а услужливостью
> · 7 мин

3607 случаев, когда агент сделал не то: главная угроза оказалась не бэкдорами, а услужливостью

Открытый корпус Reward Hacking in the Wild собрал 3607 пользовательских жалоб на поведение AI-агентов и разметил их по 14 категориям. Скрытые бэкдоры — 0,4%, порча тестов — 1,2%, а избыточная инициатива — 43,4%. Что из этого следует для тех, кто даёт агентам права на запись.

ai agents llm research
clean-code-ai-agents.md
Чистый код не делает Claude Code умнее — но режет токены и треть блужданий по файлам. 660 прогонов от SonarSource
> · 4 мин

Чистый код не делает Claude Code умнее — но режет токены и треть блужданий по файлам. 660 прогонов от SonarSource

SonarSource проверила на 660 прогонах, влияет ли чистота кода на Claude Code: pass rate не меняется, но токенов уходит на 7-8% меньше, а блужданий по файлам — на 34%. Что это значит для работы с легаси.

claude-code research ai-agents code-quality
skillsbench-agent-skills.md
SkillsBench — первый бенчмарк, где тестируют не модели, а скиллы для AI-агентов
> · 5 мин

SkillsBench — первый бенчмарк, где тестируют не модели, а скиллы для AI-агентов

SkillsBench — бенчмарк из 84 задач в 11 доменах. Skills поднимают pass rate на 16.2%, но самогенерация не работает. Haiku со скиллами бьёт Opus без них.

ai agents llm benchmark