📰 IT Дайджест

#evaluation

6 материалов

9. API-бенчмарки завышают результаты чат-интерфейсов на 3,4 п.п.

Аудит ChatGPT, Claude и Gemini по семи системам и девяти бенчмаркам показал, что API-оценки в среднем на 3,4 п.п. выше по точности и на 2,1 п.п. выше по согласованности, чем оценки через интерфейс. У ChatGPT разрыв между API и интерфейсом больше, чем разница между GPT 5.3 и GPT 5.4 через API. Изменение системных промптов, параметров сэмплинга и reasoning не убирает разрыв.

tldr.takara.ai · #ai #benchmarks #chatbot #evaluation #llm

10. Чёрные ящики LLM-судей ненадёжны: 52 988 запросов показали разброс корреляции до 0.40

Исследователи аудировали предположение, что одна и та же LLM-модель возвращает одинаковые результаты. На 52 988 запросах Spearman согласие повторов в одном окне составило 0.40 (требовалось 0.90). Причины: смещение mapping-меток, шум на 7 порядков ниже сигнала и бит-идентичные входы с разными рангами. Смена провайдера не помогла.

tldr.takara.ai · #ai #ai #evaluation #llm #reliability

11. BenchMIRT выясняет, что на самом деле измеряют LLM-бенчмарки

Новый метод аудита на основе многомерной IRT проанализировал 34 тыс. вопросов из 16 бенчмарков на 100 LLM. Выяснилось, что BBQ (тест на социальные стереотипы) сильнее коррелирует с общим reasoning, чем с безопасностью, а WMDP (опасные знания) тоже больше зависит от reasoning, причём сильные модели чаще отказываются отвечать.

huggingface.co · #ai #benchmarking #evaluation #llm

12. Meta показала Muse Spark 1.1

На HN обсуждают Muse Spark 1.1 из блога Meta, а в описании уже торчат ссылки на evaluation PDF и developer resources. Плюс есть Bloomberg-ссылка про отдельный анонс Meta — то есть это не совсем «смотрите, какой у нас блогпост», но и не особенно понятная для внешнего наблюдателя история без чтения первоисточников.

ai.meta.com · #ai #ai-meta #evaluation #muse-spark #pdf

12. Habr: почему детектор GPTZero решил, что человеческий текст написал ИИ

Автор тестирует GPTZero на собственном тексте и получает 78% вероятности того, что это сгенерировал ИИ — хотя текст написан руками, без подсказок. Рядом он сравнивает материал, собранный через Webwize с парой своих правок, и получается неприятная для детекторов картина: они уверенно ошибаются именно там, где им вроде бы и положено быть умными. Отличный повод еще раз вспомнить, что «детектор ИИ» — это не судья, а очень самоуверенный вероятностный комментатор.

habr.com · #ai #ai-text #evaluation #gptzero #misclassification