📰 IT Дайджест

#chatbot

2 материала

9. API-бенчмарки завышают результаты чат-интерфейсов на 3,4 п.п.

Аудит ChatGPT, Claude и Gemini по семи системам и девяти бенчмаркам показал, что API-оценки в среднем на 3,4 п.п. выше по точности и на 2,1 п.п. выше по согласованности, чем оценки через интерфейс. У ChatGPT разрыв между API и интерфейсом больше, чем разница между GPT 5.3 и GPT 5.4 через API. Изменение системных промптов, параметров сэмплинга и reasoning не убирает разрыв.

tldr.takara.ai · #ai #benchmarks #chatbot #evaluation #llm

9. xAI показала Grok Bot, который работает как «тиммейт»

Grok Bot умеет брать задачи на себя, работать параллельно в нескольких ботах и лезть в ваши приложения и сайты после одного логина. xAI обещает, что бот может учиться на ваших рутинах, запускаться по расписанию и даже жить в связке с Cursor Ultra за $200 в месяц или Cursor Premium Teams за $120 за seat.

x.ai · #ai #chatbot #grok #llm #xai