📰 IT Дайджест

← К выпуску 13.09.2026

Вышел Real-SWE: бенчмарк для ИИ на реальных корпоративных кодовых базах

withspecific.com · #ai #benchmark #enterprise #llm #swe

Бенчмарк содержит задачи из приватных продакшн-репозиториев c реальными бизнес-правилами (расчёт налогов, миграции). Лучший результат у Claude Fable 5.1 + Claude Code — 38.8% resolution rate. GPT-6 Astra с Codex CLI набрал 33.8%, Gemini 3.8 Flash — 31.2%. Ни одна модель не превышает 40%.

Открыть оригинал →