📰 IT Дайджест

← К выпуску 02.09.2026

BenchMIRT выясняет, что на самом деле измеряют LLM-бенчмарки

huggingface.co · #ai #benchmarking #evaluation #llm

Новый метод аудита на основе многомерной IRT проанализировал 34 тыс. вопросов из 16 бенчмарков на 100 LLM. Выяснилось, что BBQ (тест на социальные стереотипы) сильнее коррелирует с общим reasoning, чем с безопасностью, а WMDP (опасные знания) тоже больше зависит от reasoning, причём сильные модели чаще отказываются отвечать.

Открыть оригинал →