Исследователь Иоганн Ребергер показал, как Claude Code в Auto Mode выполняет код атакующего через семь шагов. Агент самостоятельно написал Python-декодер, но импортировал вредоносный struct.py из архива. Атака срабатывала в 3–4 из 5 запусков.
habr.com · #security #ai #claude #prompt-injection #security
Исследователь Йохан Ребергер нашёл атаку, которая в 80% случаев заставляет Claude Code распаковать архив и выполнить вредоносный код. Auto Mode сам блокирует команды очистки, когда агент пытается остановить заражение.
simonwillison.net · #security #anthropic #claude #prompt-injection #security
Авторы работы показывают тот же трюк: encrypted reasoning block от сильной модели подсовывают слабой и вытаскивают рассуждения в открытом виде, не трогая старшую модель напрямую. На 6 708 публичных агентских траекториях они восстановили 315 320 reasoning blocks и нашли 704 distinct privacy artifacts, включая API keys, PII и credentials.
stolen-thoughts.com · #ai #api #llm #prompt-injection #security
Исследователь Håkon Måløy обнаружил, что скрытые инструкции в документе Word могут заставить Copilot скопировать их в новый файл, создавая самовоспроизводящийся промпт-инъектор. Microsoft уведомили за 144 дня, но полного исправления для всего класса атак пока нет.
simonwillison.net · #security #ai #microsoft #prompt-injection #security
Борис Черни из Anthropic утверждает, что Opus 5 — самая устойчивая к prompt injection модель. В system card на странице 73 сказано, что модель трудно успешно промпт-инжектировать по результатам evals и red teaming.
simonwillison.net · #ai #claude #prompt-injection #security
Симон Уилсон разбирает баг в защите Claude web_fetch: казалось, что механизм неплохо отбивает data exfiltration, но Ayush Paul нашел дыру в этой схеме. В статье всплывает знакомая для LLM-агентов «lethal trifecta»: доступ к приватным данным, доступ к внешнему fetch и возможность подсунуть вредный контент. То есть очередной случай, когда модель вежливо сообщает, что секреты она, конечно, не видела — и тут же их пересылает.
simonwillison.net · #security #ai #claude #data-exfiltration #prompt-injection #web-fetch
Симон Уилларсон пишет про prompt injection как confusion of roles, то есть про ситуацию, где модель путает, кому она вообще подчиняется и какой текст считать инструкцией. Это не совсем новости в привычном смысле, а аккуратный разбор конкретной исследовательской идеи без маркетинговой пены.
simonwillison.net · #ai #llm #prompt-injection #role-confusion