Вскрытие скрытых рассуждений: 704 секрета из логов Claude, GPT и Gemini
Авторы работы показывают тот же трюк: encrypted reasoning block от сильной модели подсовывают слабой и вытаскивают рассуждения в открытом виде, не трогая старшую модель напрямую. На 6 708 публичных агентских траекториях они восстановили 315 320 reasoning blocks и нашли 704 distinct privacy artifacts, включая API keys, PII и credentials.