7. Секреты в контексте LLM утекают через обычные ответы
Исследователи показали, что 2-значные секреты в контексте восстанавливаются почти идеально, а 4-значные — с точностью 82%, даже когда модель отказывается их выдавать. Более способные модели утекают сильнее, а атака позволяет вытащить номера SSN из продакшн-агента.