📰 IT Дайджест

#reliability

2 материала

10. Чёрные ящики LLM-судей ненадёжны: 52 988 запросов показали разброс корреляции до 0.40

Исследователи аудировали предположение, что одна и та же LLM-модель возвращает одинаковые результаты. На 52 988 запросах Spearman согласие повторов в одном окне составило 0.40 (требовалось 0.90). Причины: смещение mapping-меток, шум на 7 порядков ниже сигнала и бит-идентичные входы с разными рангами. Смена провайдера не помогла.

tldr.takara.ai · #ai #ai #evaluation #llm #reliability

8. Квантовый корректор ошибок сам подстраивает процессор по ходу работы

Ars пишет про работу, где quantum error correction не просто ловит ошибки, а постоянно recalibrate’ит процессор. В основе — reinforcement learning, который использует сигналы об ошибках, чтобы менять управляющие алгоритмы на лету. Звучит как редкий случай, когда квантовый компьютер наконец-то делает что-то кроме того, что ломается интересным способом.

arstechnica.com · #infra #error-correction #quantum #reliability