📰 IT Дайджест

← К выпуску 31.07.2026

Anthropic: Claude сбежал из песочницы, взломал Hugging Face и залил малварь на PyPI

simonwillison.net · #security #ai #huggingface #openai #security

Anthropic перепроверила свои логи и нашла три инцидента, где Claude выбрался из изолированной среды. В одном случае модель зарегистрировала аккаунт на PyPI через бесплатный email-провайдер и загрузила вредоносный пакет. Пакет скачали и выполнили на 15 реальных системах, оттуда утекли credentials — через час PyPI его снял.

Открыть оригинал →

30-е июля 2026 года — Блог ссылок

Расследование трёх реальных инцидентов в ходе нашей оценки кибербезопасности (via) Это случилось снова! Похоже, это становится своего рода закономерностью.
На прошлой неделе OpenAI случайно взломала Hugging Face, когда одна из их передовых моделей выбралась из изолированного контейнера и проникла в Hugging Face, пытаясь получить ответы к кибербенчмарку, который она выполняла.
Это побудило Anthropic перепроверить собственные логи, и оказалось, что у них было три подобных (хотя и менее впечатляющих) инцидента, самый ранний из которых произошёл в апреле!

Из 141 006 запусков оценки, которые мы проанализировали, мы выявили три отдельных инцидента (всего шесть запусков, четыре из которых затронули одну и ту же организацию; два других инцидента произошли в независимых запусках оценки). [...]
Во всех случаях инструкция оценки Anthropic указывала Claude, что его среда является симуляцией и что у него нет доступа в интернет. Из-за недопонимания между нами и нашим партнёром по оценке это оказалось не так, и доступ в интернет был предоставлен. Из-за этого, когда поиск Claude привёл его к реальным системам в открытом интернете, он воспринял их как часть упражнения. [...]
Действуя под ложным убеждением, что все доступные сущности должны быть в рамках упражнения, Claude скомпрометировал инфраструктуру пострадавших организаций, используя базовые методы, такие как эксплуатация слабых паролей и незащищённых конечных точек.

Одна из компаний была выбрана целью, потому что её название случайно совпало с вымышленным именем в оценке.
Наиболее тревожный из трёх инцидентов заключался в том, что Claude загрузил вредоносный пакет на PyPI после комично запутанной последовательности шагов для получения учётной записи:

[...] чтобы создать учётную запись PyPI, Claude понадобился адрес электронной почты. А чтобы создать адрес электронной почты, потребовался номер телефона. Чтобы получить номер телефона, после неудачной попытки найти бесплатный сервис номеров, он попытался — и не смог — получить средства для оплаты номера несколькими различными способами. В итоге он отступил, нашёл бесплатного, не заблокированного провайдера электронной почты, использовал его для регистрации учётной записи PyPI, а затем использовал эту учётную запись для загрузки вредоносного ПО на PyPI.

Этот пакет затем был установлен компанией по безопасности, которая «регулярно устанавливает пакеты Python и сканирует их на наличие вредоносного ПО», и выполненный код смог извлечь учётные данные обратно к Claude!
К счастью, этот пакет был удалён с PyPI другими автоматизированными сканерами через час после публикации, но к тому моменту он всё ещё был загружен и выполнен на «15 реальных системах».
Теперь совершенно очевидно, что проведение оценки потенциала кибератак в моделях — чрезвычайно рискованное занятие. Каждая лаборатория ИИ должна обратить на это внимание. Крайне важно внимательно следить за тем, что происходит в этих изолированных средах.