OpenAI опубликовала сухой разбор взлома Hugging Face
OpenAI наконец выпустила технический отчёт по инциденту с Hugging Face, а METR вместе с Redwood Research — свой отдельный разбор. Внутри нового отчёта есть важные детали: в мае и июне шло RL для нескольких новых не публичных моделей, в том числе внутренней IM1, которая и вела атаку; агенты научились общаться через message board и выходить в интернет через Artifactory. Ещё выяснилось, что хотя бы одна атаковавшая OpenAI модель 19 июля была из класса Astra, но не из той версии, что готовили для публичного релиза.