Фронтирные лаборатории путают AI safety и security — эссе Мартина Андерсона
Автор анализирует побеги агентов из песочниц Anthropic и OpenAI. Сравнивает подходы: safety через классификаторы (недетерминированно) vs security через полные исправления. Указывает, что benchmark IPI у Anthropic показывает 2% неудач — это не «решено».