📰 IT Дайджест

#swe

2 материала

12. Вышел Real-SWE: бенчмарк для ИИ на реальных корпоративных кодовых базах

Бенчмарк содержит задачи из приватных продакшн-репозиториев c реальными бизнес-правилами (расчёт налогов, миграции). Лучший результат у Claude Fable 5.1 + Claude Code — 38.8% resolution rate. GPT-6 Astra с Codex CLI набрал 33.8%, Gemini 3.8 Flash — 31.2%. Ни одна модель не превышает 40%.

withspecific.com · #ai #benchmark #enterprise #llm #swe

5. Cognition выпустила SWE-2 — кодовую модель за копейки

Модель SWE-2 набрала 50% на FrontierCode 1.1 Main, отстав от Fable 5.1 на один пункт, но будучи на 64% дешевле. Она построена поверх Kimi K33 (2.8 трлн параметров) и использует RL с линейным штрафом за стоимость. SWE-2 medium тратит на 58% меньше шагов и стоит на 81% дешевле SWE-1.7 при равном или лучшем результате.

cognition.com · #ai #cognition #llm #swe