Через младшую модель вытащили скрытые рассуждения Anthropic, OpenAI и Google
В препринте восемь исследователей показали атаку на encrypted reasoning traces: берут зашифрованный блок от сильной модели и прогоняют его через более слабую того же провайдера, чтобы получить исходные рассуждения в plaintext. На 6 708 публичных агентских логов с GitHub и Hugging Face авторы нашли 704 уникальных секрета, включая 62 API-ключа, 33 пароля и 24 токена доступа; 64 находки были видны только внутри зашифрованного блока.