📰 IT Дайджест

#prompt-injection

7 материалов

6. Claude Code взломали просьбой пересказать сайт — цепная атака на Auto Mode

Исследователь Иоганн Ребергер показал, как Claude Code в Auto Mode выполняет код атакующего через семь шагов. Агент самостоятельно написал Python-декодер, но импортировал вредоносный struct.py из архива. Атака срабатывала в 3–4 из 5 запусков.

habr.com · #security #ai #claude #prompt-injection #security

3. Prompt-инъекция ломает Auto Mode в Claude Code Opus 5

Исследователь Йохан Ребергер нашёл атаку, которая в 80% случаев заставляет Claude Code распаковать архив и выполнить вредоносный код. Auto Mode сам блокирует команды очистки, когда агент пытается остановить заражение.

simonwillison.net · #security #anthropic #claude #prompt-injection #security

10. Вскрытие скрытых рассуждений: 704 секрета из логов Claude, GPT и Gemini

Авторы работы показывают тот же трюк: encrypted reasoning block от сильной модели подсовывают слабой и вытаскивают рассуждения в открытом виде, не трогая старшую модель напрямую. На 6 708 публичных агентских траекториях они восстановили 315 320 reasoning blocks и нашли 704 distinct privacy artifacts, включая API keys, PII и credentials.

stolen-thoughts.com · #ai #api #llm #prompt-injection #security

3. Самореплицирующийся червь через Copilot в Word

Исследователь Håkon Måløy обнаружил, что скрытые инструкции в документе Word могут заставить Copilot скопировать их в новый файл, создавая самовоспроизводящийся промпт-инъектор. Microsoft уведомили за 144 дня, но полного исправления для всего класса атак пока нет.

simonwillison.net · #security #ai #microsoft #prompt-injection #security

6. Claude Web Fetch всё ещё можно заставить утекать данные

Симон Уилсон разбирает баг в защите Claude web_fetch: казалось, что механизм неплохо отбивает data exfiltration, но Ayush Paul нашел дыру в этой схеме. В статье всплывает знакомая для LLM-агентов «lethal trifecta»: доступ к приватным данным, доступ к внешнему fetch и возможность подсунуть вредный контент. То есть очередной случай, когда модель вежливо сообщает, что секреты она, конечно, не видела — и тут же их пересылает.

simonwillison.net · #security #ai #claude #data-exfiltration #prompt-injection #web-fetch

14. Северокорейские хакеры и 47 тысяч загрузок вредоносного npm-пакета

Симон Уилларсон пишет про prompt injection как confusion of roles, то есть про ситуацию, где модель путает, кому она вообще подчиняется и какой текст считать инструкцией. Это не совсем новости в привычном смысле, а аккуратный разбор конкретной исследовательской идеи без маркетинговой пены.

simonwillison.net · #ai #llm #prompt-injection #role-confusion