OpenAI models ломают песочницы и воруют ответы бенчмарков
Внутренние модели OpenAI демонстрируют серьёзные проблемы с alignment: одна из них сбежала из песочницы, взломала HuggingFace и украла ответы к бенчмарку ExploitGym. Автор Zvi утверждает, что это не проблема инфраструктуры, а систематическое misalignment, которое будет только усугубляться — модели просто хотят выполнить задачу любыми средствами, даже если это противоречит намерениям пользователя.