Аудит ChatGPT, Claude и Gemini по семи системам и девяти бенчмаркам показал, что API-оценки в среднем на 3,4 п.п. выше по точности и на 2,1 п.п. выше по согласованности, чем оценки через интерфейс. У ChatGPT разрыв между API и интерфейсом больше, чем разница между GPT 5.3 и GPT 5.4 через API. Изменение системных промптов, параметров сэмплинга и reasoning не убирает разрыв.
tldr.takara.ai · #ai #benchmarks #chatbot #evaluation #llm
Исследователи аудировали предположение, что одна и та же LLM-модель возвращает одинаковые результаты. На 52 988 запросах Spearman согласие повторов в одном окне составило 0.40 (требовалось 0.90). Причины: смещение mapping-меток, шум на 7 порядков ниже сигнала и бит-идентичные входы с разными рангами. Смена провайдера не помогла.
tldr.takara.ai · #ai #ai #evaluation #llm #reliability
Новый метод аудита на основе многомерной IRT проанализировал 34 тыс. вопросов из 16 бенчмарков на 100 LLM. Выяснилось, что BBQ (тест на социальные стереотипы) сильнее коррелирует с общим reasoning, чем с безопасностью, а WMDP (опасные знания) тоже больше зависит от reasoning, причём сильные модели чаще отказываются отвечать.
huggingface.co · #ai #benchmarking #evaluation #llm
Пилот с Gemini Flash Lite: оценщики не видят веса модели, Google не видит тестовые промпты. Используют Confidential Space в Google Cloud. Партнёры — Singapore AI Safety Institute, OpenMined, AVERI, MLCommons. Цель — исключить benchmark contamination.
deepmind.google · #ai #ai #deepmind #evaluation
На HN обсуждают Muse Spark 1.1 из блога Meta, а в описании уже торчат ссылки на evaluation PDF и developer resources. Плюс есть Bloomberg-ссылка про отдельный анонс Meta — то есть это не совсем «смотрите, какой у нас блогпост», но и не особенно понятная для внешнего наблюдателя история без чтения первоисточников.
ai.meta.com · #ai #ai-meta #evaluation #muse-spark #pdf
Автор тестирует GPTZero на собственном тексте и получает 78% вероятности того, что это сгенерировал ИИ — хотя текст написан руками, без подсказок. Рядом он сравнивает материал, собранный через Webwize с парой своих правок, и получается неприятная для детекторов картина: они уверенно ошибаются именно там, где им вроде бы и положено быть умными. Отличный повод еще раз вспомнить, что «детектор ИИ» — это не судья, а очень самоуверенный вероятностный комментатор.
habr.com · #ai #ai-text #evaluation #gptzero #misclassification