📰 IT Дайджест

#ml

4 материала

11. В Datasette всплеск коммитов совпал с эпохой моделей Opus 4.8 и GPT-5.6 Sol

Симон Уилсон посмотрел на GitHub chart частоты изменений в Datasette и заметил резкий пик активности в конце. Он сопоставляет его с появлением Opus 4.8, GPT-5.5, Fable 5 и GPT-5.6 Sol — то есть с тем моментом, когда кодовые агенты начали заметно шевелить его open source-проект.

simonwillison.net · #ai #coding-agents #datasette #github #ml

12. Почему +0.3% к ROC-AUC часто ничего не значит

Разбор на Habr начинается с очень знакомой сцены: метрика выросла с 0,871 до 0,874, и все уже хотят шампанское. Автор объясняет, почему такой прирост часто оказывается шумом разбиения, и предлагает смотреть на разброс метрики, а не на третий знак после запятой.

habr.com · #ai #metrics #ml #roc-auc #statistics

10. FlakyDetector 2.0: AST, ML и дашборд против падающих CI-тестов

Автор Habr-статьи превратил исследовательский прототип в рабочий инструмент для поиска flaky-тестов. Внутри — AST-анализ, машинное обучение и отдельный дашборд; то есть теперь можно не просто вздыхать над красным билдом, а хоть как-то системно разбирать, почему тест «то падает, то нет».

habr.com · #tool #ast #ci #dashboard #ml #testing

11. На стенде по computer vision обещают 86% точности на десятках картинок

Авторы Habr-поста пишут про стенд, где модели учатся буквально на десятках изображений вместо тысяч и при этом показывают не меньше 86% точности. Отдельно они утверждают, что решение обходит YOLO и не требует GPU-кластеров — звучит как отличный повод проверить, где там заканчивается инженерия и начинается маркетинг.

habr.com · #ai #benchmark #computer-vision #ml #stand