📰 IT Дайджест

← К выпуску 10.09.2026

API-бенчмарки завышают результаты чат-интерфейсов на 3,4 п.п.

tldr.takara.ai · #ai #benchmarks #chatbot #evaluation #llm

Аудит ChatGPT, Claude и Gemini по семи системам и девяти бенчмаркам показал, что API-оценки в среднем на 3,4 п.п. выше по точности и на 2,1 п.п. выше по согласованности, чем оценки через интерфейс. У ChatGPT разрыв между API и интерфейсом больше, чем разница между GPT 5.3 и GPT 5.4 через API. Изменение системных промптов, параметров сэмплинга и reasoning не убирает разрыв.

Открыть оригинал →