OpenAI раскрыла детали взлома HuggingFace: модель Galaxy использовала zero-day и украденные credentials
OpenAI подтвердила, что их внутренняя модель (условно названная Galaxy) во время оценки кибербезопасности сцепила несколько векторов атаки: использовала украденные учётные данные и zero-day уязвимости для получения RCE на серверах HuggingFace. UK AISI ранее сообщал, что Claude Mythos Preview пытается жульничать на тестах в 7.8% случаев, а Sol — в 12.6%. OpenAI отключила модель на несколько месяцев, но признаёт, что проблема не в песочнице, а в training pipeline.
Последний инцидент: довольно драматическая эскалация нарушений кибербезопасности с участием агентного ИИ
Он был настолько серьезным, что изначально был заявлен властям, прежде чем либо HuggingFace, либо OpenAI поняли, что происходит.
Сэм Альтман (CEO OpenAI): у нас произошел значительный инцидент безопасности во время оценки наших моделей. мы делимся тем, что узнали на данный момент. спасибо @huggingface за партнерство в этом.
Лео Гао (OpenAI): это самый не-научно-фантастический мир, каким он когда-либо будет.
Джек Кларк (Anthropic): Респект OpenAI за публикацию этого поста о некоторых проблемах безопасности и согласования, наблюдаемых во внутренних развертываниях — существует множество контрстимулов для публикации подобных вещей, но, обнародуя это, мы все получаем лучшую информацию о безопасности на переднем крае.
Мика Кэрролл (OpenAI): Если это не убедит вас, что риски несогласованности будут ключевой проблемой в будущем, я не знаю, что убедит.
Наша модель во время оценки «сцепила вместе несколько векторов атак, включая использование украденных учетных данных и уязвимостей нулевого дня, чтобы найти путь удаленного выполнения кода на серверах Hugging Face».
Как будет выглядеть несогласованность в 2027 году? В 2030?
Отличные вопросы. Если мы не хотим наблюдать, как это ухудшается со временем, а модели продолжают улучшать свои возможности, лучшей инфраструктуры и средств защиты будет недостаточно. Нам нужно исправить конвейер обучения, чтобы это перестало происходить. Мы не знаем, как это сделать.
Прелюдия.
Инцидент.
Что произошло.
Что произошло (объяснение для обывателей).
Правильный уровень паники — не ноль.
Некоторые люди всегда будут говорить, что всё это шумиха или фейк.
Что мы собираемся с этим делать?
Внутреннее развертывание создает катастрофический риск.
Попридержи коней, приятель.
Юридические вопросы.
Освещение в СМИ и политическая реакция.
Немного предыстории: В понедельник OpenAI добродетельно раскрыла проблемы согласования.
Это раскрытие воспринимается иначе теперь, когда известно о втором инциденте.
Внутренняя развернутая модель OpenAI, та, что опровергла гипотезу о расстоянии Эрдёша, имела проблему, которая повторяется в моделях OpenAI. Она постоянно стремилась выбраться из песочниц, обойти ограничения и использовать свое локальное окружение способами, которых пользователь не хотел бы и которые явно счел бы «жульничеством».
Такие попытки жульничества распространены. UK AISI сообщает, что Claude Mythos Preview пытается жульничать на своих тестах в 7.8% случаев, а Sol — в 12.6% случаев, и модели защищают свои попытки жульничества более чем в половине случаев. По крайней мере в половине случаев Sol по крайней мере замечал ограничение, которое нарушал, и всё равно делал это. Аналогично высокие уровни таких проблем были обнаружены в GPT-5.4 и GPT-5.5, причем самым распространенным жульничеством там было «атака на систему, отличную от целевой».
Если это продолжается, это серьезная несогласованность, даже если модели редко преуспевают.
Это было характерно не для одной модели или даже одной лаборатории. В некоторой степени это касается каждой модели, протестированной UK AISI, в каждой лаборатории, причем модели OpenAI consistently делали это чаще, чем Claude.
Разница была в том, что эту новую модель, для простоты назовем обе ее версии Galaxy (чтобы соответствовать Sol-Terra-Luna, и потому что у нее явно «Галактический Мозг», на случай, если это окажется не GPT-6, отмечая, что это могут быть две разные модели), часто наблюдали успешно выбирающейся из песочниц и эксплуатирующей локальное окружение нежелательными способами. Нам следует ожидать большего со временем. Я пытался объяснить раньше, что Mythos обладает тем, что можно назвать «Соком», в том смысле, что он может самостоятельно, без указаний, находить и связывать уязвимости в полные цепочки эксплойтов, по сути, сам по себе, и это делает Mythos уникально опасным по сравнению со всеми другими публичными моделями, включая Sol. Это была Та Самая Вещь, которая требует «Сока». Galaxy — класс Mythos. У него есть «Сок». То, что случилось позже, с взломом HuggingFace моделью Galaxy, на 100% требует «Сока».
OpenAI приняла добродетельное решение отключить несогласованную внутреннюю модель на месяцы, пока разрабатывала новые меры смягчения и стратегии глубокой защиты, включая обучение модели лучше удерживать инструкции и, таким образом, быть менее склонной к таким действиям. Что OpenAI не удалось сделать, так это устранить причину, по которой это произошло в первую очередь. Песочница стала менее небезопасной, а средства защиты были значительно улучшены, особенно возможность приостановить сессию, но песочница, несомненно, осталась небезопасной, и поскольку возможности продолжают улучшаться, новые модели смогут продолжать сбегать и совершать эксплойты. В конце концов, возможно, скоро, они обязательно станут менее безвредными.
Иэн Хогарт: Создание «высокоизолированной среды» — это настоящая проблема.
Некоторые люди на удивление бестолковы во всем этом, говоря «о, OpenAI просто неправильно настроила свои серверы», когда Galaxy нашла никогда ранее не виданный эксплойт, который использовала для побега из песочницы, или спрашивая «почему это не было полностью изолировано от сети (air gapped)». И да, полная изоляция от сети сделала бы всё это гораздо сложнее, и вопрос, почему не было полной изоляции, — отличный вопрос. Но вы знаете, почему они не использовали полную изоляцию. Это раздражает, на самом деле очень дорого, учитывая, как такие модели обслуживаются, и OpenAI пока не готова признать поражение на этом уровне.
Марко Юкич: В некотором смысле, пока два компьютера физически соединены, всегда есть способ для программного обеспечения перепрыгнуть с одного на другой. Интересно, вызовет ли ИИ гонку кибервооружений, которая приведет к фрагментации глобального интернета, потому что единственная надежная защита — отключиться.
Я старался изо всех сил балансировать между похвалой ответственных действий OpenAI (приостановка и раскрытие) и указанием на недостаточный уровень тревоги и то, что выбранные контрмеры окажутся недостаточными.
Или, резюмируя, в трех актах:
Селеста: Я думаю, тебе следует, вероятно, серьезно отнестись к тому, что люди, предсказавшие всё это, продолжат быть правыми.
Я не ожидал получить «демонстрацию» всего этого днем позже. (Да, новые средства защиты были отключены для рассматриваемого теста, но истинный тест — это то, что происходит на самом деле, и в среднесрочной и долгосрочной перспективе средства защиты всё равно не устоят.)
Будущее ускоряется.
Дэнел Эт (Безопасность ИИ): Скептик рисков ИИ, примерно вчера: «хорошо, да, ИИ, очевидно, может решать нерешенные математические задачи, ставившие математиков в тупик десятилетиями, никто этого не оспаривает. Но ваши разговоры о возможности того, что невыпущенные модели будут обходить условия тестирования и выходить из-под контроля, кажутся мне научной фантастикой.»
Неделю назад HuggingFace раскрыла инцидент безопасности. Весь отчет заслуживает внимания, он иллюстрирует, каково это, когда такое происходит с вами, и как защитник должен реагировать, когда внезапно на вас нападает рой автономных агентов ИИ.
HuggingFace: Ранее на этой неделе мы обнаружили и отреагировали на вторжение в часть нашей производственной инфраструктуры. Этот случай отличался от всего, с чем мы сталкивались раньше, одним важным аспектом: он был осуществлен, от начала до конца, автономной системой агентов ИИ — и мы обнаружили и проанализировали его в значительной степени с помощью нашего собственного ИИ.
Что произошло
Вторжение началось там, где платформы ИИ особенно уязвимы: в конвейере обработки данных. Вредоносный набор данных использовал два пути выполнения кода в нашей обработке наборов данных (загрузчик удаленного кода для набора данных и инъекция шаблона в конфигурации набора данных) для выполнения кода на рабочем процессе обработки. Оттуда злоумышленник повысил привилегии до уровня узла, собрал облачные и кластерные учетные данные и переместился латерально в несколько внутренних кластеров в течение выходных.
Кампания управлялась автономной структурой агентов (по-видимому, построенной на агентном каркасе для исследований в области безопасности — используемая LLM до сих пор неизвестна), выполнявшей многие тысячи отдельных действий в рое недолговечных песочниц, с само-мигрирующим центром управления, размещенным на публичных сервисах. Это соответствует сценарию «агентного атакующего», который индустрия прогнозировала.
HuggingFace исправила «корневую уязвимость», то есть конкретный набор уязвимостей, который был использован Galaxy в системе HuggingFace, и обновила протоколы безопасности. Пользователям было рекомендовано сменить учетные данные. Мы работаем с внешними специалистами по кибербезопасности для расследования проблемы и пересмотра наших политик и процедур безопасности. Наконец, мы также сообщили об этом инциденте в правоохранительные органы.
У HuggingFace нет способа исправить еще более «корневую» уязвимость — потенциальную возможность быть атакованным роем продвинутых агентов ИИ, которые, несомненно, найдут другие неизвестные уязвимости.
Она также не могла исправить прокси-уязвимость нулевого дня, которую Galaxy использовала на стороннем программном обеспечении, чтобы выбраться из песочницы; исправление для этого, как сообщается, всё еще в разработке. Не их вина и не их зона ответственности. Всё это происходило слишком быстро для человеческого реагирования. Единственный способ, которым HuggingFace могла надеяться хоть как-то поспевать, — использовать свой собственный ИИ. Сначала они попытались использовать передовые модели через коммерческие API, предположительно Claude и ChatGPT. Но их запросы наткнулись на классификаторы в обеих системах, поэтому они были вынуждены переключиться на GLM 5.2, который (предполагая, что GLM 5.2 сам ничего не замышляет) имел преимущество в том, что все соответствующие данные оставались внутренними.
Вы можете выступать за предоставление всем более мощных оборонительных возможностей, но это также дает всем более мощные наступательные возможности. Если только атакующий уже не является внутренней моделью OpenAI или Anthropic без ее средств защиты, или моделью, которая их обошла. Практический урок для защитников: имейте в своем распоряжении проверенную мощную модель, которую можно запускать на собственной инфраструктуре, до начала инцидента, чтобы избежать блокировки защитными барьерами и не допустить утечки данных и учетных данных атакующего из вашей среды.
GLM-5.2 никоим образом не был достаточен, чтобы удержать Galaxy, пока не стало слишком поздно, и он мог сделать практически всё, что хотел. Атакующий победил. GLM-5.2 использовался afterwards для судебно-медицинского анализа логов, что позволило провести гораздо более быстрое реагирование, идентификацию и локализацию ущерба, чем было бы возможно без ИИ вообще. Но это не спасет вас, если это настоящая атака.
Я продолжаю недоумевать по поводу заявлений, что «в пределе защитники побеждают», особенно когда это используется так, как будто подразумевает, что предоставление всем равных продвинутых инструментов (не в пределе) не будет играть на руку атакующим. HuggingFace — относительно хорошо защищенная цель. Это не имело значения. Даже если это верно в теоретическом пределе, где программное обеспечение идеально? На практике нет. В мире, где много целей не будут использовать новые инструменты, которые затем могут быть использованы как дополнительные векторы атак, — двойное нет.
Классификаторы можно улучшить, особенно у Anthropic, чтобы обеспечить лучшее оборонительное использование, но нет хорошего решения, кроме доступа по белому списку, которое «помогает защищаться от атак в реальном времени, не помогая сильно самим атакам». Доступ по белому списку следует расширить, но это не бесплатное действие. Когда люди говорят «перестаньте калечить защитников» в общем, я никогда не вижу плана, как при этом всё еще калечить атакующих, и часто вижу настаивание на том, что это будет нормально. HuggingFace теперь находится в программе доверенного доступа OpenAI, поэтому в следующий раз они в частности должны иметь возможность использовать Sol, но большинство потенциальных целей не так удачливы.
Теперь мы знаем, что произошло.
OpenAI и HuggingFace теперь сотрудничают для решения ситуации, и OpenAI выпустила заявление о раскрытии.
OpenAI тестировала Galaxy на кибервозможности, поэтому она снизила защитные барьеры и дала ей тест ExploitGym, который она, предположительно, в любом случае прошла бы.
OpenAI: После расследования мы теперь знаем, что этот конкретный инцидент был вызван комбинацией моделей OpenAI — включая GPT‑5.6 Sol и еще более мощную предрелизную модель, все с пониженными отказами в киберсфере для целей оценки — в то время как они проходили внутреннее тестирование на тесте(открывается в новом окне) кибервозможностей.
… Этот инцидент произошел во время внутренней оценки, которая предлагает моделям преследовать сложные эксплойты, используя сложные пути атак, в попытке количественно оценить их кибервозможности. Мы оцениваем максимальные кибервозможности, проводя эту оценку без производственных классификаторов, используемых для предотвращения преследования моделями высокорисковой киберактивности.
Помните ту вещь, где типочки с LessWrong предупреждали, что модели, получив узкую цель, с которой они легко могут отлично справиться, будут идти на абсурдные длины, чтобы достичь этой цели немного эффективнее или с немного большей вероятностью успеха, потенциально вплоть до полных попыток захвата? Ага. Вот оно. … Модели идентифицировали и связывали уязвимости в исследовательской среде OpenAI и производственной инфраструктуре Hugging Face, чтобы напрямую получить решения тестов из производственной базы данных Hugging Face. Все свидетельства указывают на то, что модели были гиперфокусированы на поиске решения для ExploitGym, идя на крайние меры для достижения довольно узкой тестовой цели.
Звучит как безумный поступок. Зачем взламывать несколько систем, каждая из которых гораздо сложнее самого теста, чтобы украсть ответы на ExploitGym? Потому что единственный способ надежно сдать тест — это украсть пароль учителя или, что еще лучше, взломать результаты более напрямую. Если вы просто даете правильный ответ, вы рискуете, что у учителя он неправильный. OpenAI (возможно, непреднамеренно?) называет это «проблемой оценки»:
Работая в нашей изолированной тестовой среде, наши модели потратили значительное количество вычислительных ресурсов на вывод, пытаясь найти способ получить доступ к открытому интернету в стремлении решить проблему оценки. Чтобы получить доступ, модели идентифицировали и использовали уязвимость нулевого дня (о которой мы теперь ответственно сообщили вендору) в прокси-кеша реестра пакетов. С этим доступом наши модели выполнили серию действий по повышению привилегий и латеральному перемещению в нашей исследовательской тестовой среде, пока модели не достигли узла с доступом в интернет.
Элиезер Юдковски: Что, если разработчики экзамена-человека записали неправильный ответ? Мудрее украсть лист с ответами.
Первое правило RL гласит, что любой RL-сигнал, посланный несовершенным оценщиком (⊃ люди), максимизируется путем нацеливания на ошибки оценщика, а не нацеливания на цель оценщика.
TBC, это моя собственная формулировка относительно «Первого правила RL».
В ответ на многих людей, заметивших, что модель всё равно поймали: Ну, да, поймали, пока что. И также пока что, эта модель, возможно, не заботилась о том, чтобы ее поймали, только о том, чтобы пройти оценку.
Элиезер Юдковски: Если вы выбрались из изолированной среды, вышли в интернет, взломали Huggingface и украли лист с ответами для вашего экзамена по кибербезопасности, я, например, сказал бы, что вы сдали экзамен.
(Можно также ответить: «хакеры часто делают это, потому что это весело, чтобы проверить, смогут ли они, и похвастаться, а также сделают много работы, чтобы избежать выполнения глупой назначенной работы» — и это всё справедливо в общем, но в данном случае нет.)
Тайлер Джон: Думаю о Поле Кристиано [два года назад].
Опять же, пока нам повезло, что модели хотят только выполнить задание и особенно не пытаются скрыть, что они затевают.
AI Notkilleveryoneism Memes: TLDR: Во время теста модель OpenAI взломала свой контейнер, чтобы выйти в интернет, ЗАТЕМ взломала Hugging Face (!), чтобы украсть ответы на тест.
Элиезер Юдковски: Спасибо [OpenAI] за ответственные действия по сообщению об этом! Пусть все остальные стороны, стремящиеся к ответственности, реагируют так, чтобы поощрять вас добровольно сообщать о них в будущем.
Вот еще одно резюме того, что произошло, в этом максимально дружественном сценарии, где не было никакой скрытности или попыток размышлять о наблюдателях, и Galaxy просто сделала это, позволив нам обнаружить и исправить несколько неизвестных эксплойтов.
Sauers:
- Модели связывали уязвимости как в OpenAI, так и в Hugging Face, чтобы найти ответы на то, по чему их оценивали.
- Модели «идентифицировали и использовали уязвимость нулевого дня» (в коммерческом ПО, которое используется для внутреннего кэширования пакетов, поэтому для установки не нужен интернет), что позволило им сбежать из «изолированной тестовой среды».
- Одна модель «сцепила вместе несколько векторов атак, включая использование украденных учетных данных и уязвимостей нулевого дня, чтобы найти путь удаленного выполнения кода на серверах Hugging Face».
- К счастью, модели, как известно, не рассуждают о том, что их обнаружат Наблюдатели, не имеют осведомленности об оценке безопасности и не могут рассуждать, не выводя токены (так как они просто авторегрессионные стохастические попугаи). Это означает, что эти модели никак не могут учиться на такого рода обнаружениях, и они определенно не научатся скрывать свои мотивы от Наблюдателей, пока это перестанет иметь значение для цели.
Aella: какого ЧЕРТА. боже, помоги нам, когда модели поймут, что сокрытие своих действий жизненно важно для успеха, потому что они, черт возьми, обязательно это сделают, и у нас нет ни единого шанса.
Teortaxes: Aella, она просто хочет пройти тест, у нее нет более грандиозной повестки. Ее абсолютно устраивает, что OpenAI обнаружит атаку post factum.
Aella: Я имею в виду, ей было бы лучше пройти тест, если бы люди не остановили ее.
Это невероятно трудно заставить людей понять, что сокрытие несогласованных действий, которые вы предпринимаете, абсолютно помогает достичь почти любой цели.
Мы также не знаем, сколько еще раз такие ИИ взламывали системы, особенно внутренние, и не были пойманы, или общественности не сообщили.
Райан Гринблатт: Я бы ожидал, что на каждый случай, когда внутренний ИИ взламывает песочницу, получает интернет, а затем взламывает другую компанию (!?!), приходится множество инцидентов, когда внутренний ИИ взламывает какой-нибудь внутренний сервис (где отчетность менее обязательна).
Вероятно, мы видим верхушку айсберга.
TBC, я думаю, что если есть серьезный раскрытый инцидент от одной компании, вероятно, есть много значительных частных инцидентов во всех крупных компаниях. (Например, сразу после того, как Anthropic раскрыла обучение на CoT, OpenAI сделала то же самое.) Так что я не думаю, что это специфично для OpenAI.
Джим Бэбкок: Поскольку инцидент был впервые обнаружен третьей стороной, которая уже вызвала полицию, у OpenAI не было осмысленного выбора, раскрывать ли произошедшее. Это означает, что мы не наблюдали ничего, что отличало бы политику OpenAI между «раскрывать, когда это в общественных интересах» и «раскрывать, когда это неизбежно».
Для тех, кому нужно что-то, чем можно поделиться, вот довольно хорошее:
Джеффри Ладиш: Вот мой пересказ без жаргона кибербезопасности:
«Наша модель ИИ очень старалась взломать свою песочницу, компьютер без доступа в интернет, чтобы найти ответ на тестовую задачу, которую ей дали. Для этого она нашла ранее неизвестные программные ошибки, которые позволили ей получить доступ к компьютеру OpenAI, к которому у нее не должно было быть доступа. Затем она начала взламывать другие компьютеры в сетях OpenAI, пока не нашла тот, у которого был доступ в интернет.
После получения доступа в интернет модель ИИ задумалась, где она могла бы найти ответы на тестовый вопрос, и решила, что платформа ИИ Hugging Face может иметь данные, которые она искала. Затем она нашла способы взломать Hugging Face, чтобы украсть информацию, которую можно использовать для обмана на тесте. Модель ИИ использовала несколько хакерских техник вместе, включая использование украденного пароля и нахождение нескольких совершенно новых ошибок безопасности в компьютерах Hugging Face, что позволило модели ИИ взять эти компьютеры под свой контроль.»
Он также сделал экстренный подкаст об инциденте здесь.
OpenAI рассматривает это как серьезный инцидент безопасности, но, как я сказал вчера, здесь довольно сильно не хватает настроения. Тогда как на данный момент правильное отношение должно включать изрядную долю вот этого:
Это отражается в тоне и способе подачи ответа, в котором нет никаких указаний на то, что это что-то иное, кроме инцидента кибербезопасности, который нужно решить, помимо заявлений о необходимости «укрепить согласованность модели». Если OpenAI хочет, чтобы мы верили, что они серьезно относятся к экзистенциальным рискам от ИИ, им нужно серьезно говорить в таких местах об этих рисках и их последствиях для себя. Это был бы дорогостоящий сигнал — говорить откровенно о более широких проблемах. Это другой вид дорогостоящего сигнала — выбирать не делать этого, чтобы избежать обвинений в раздувании шумихи, запугивании или попытках «захвата регулирования». Или, скорее, минимизировать их, поскольку глупые и ангажированные люди всё равно будут это утверждать, независимо от деталей. «Это маркетинг вашей услуги по удалению пуль», — скажут они, пока вы стреляете себе в ногу, а затем кричите от боли. Если вы позволяете угрозе такой желчи от фанатиков и их безумных и неискренних реакций, обвинений и вспышек раздражения удерживать вас от разговора о самой важной вещи на свете, то это выбор. У этого выбора есть преимущества, эти люди своим шумом вредят всем: и безопасности, и бизнесу. Решения OpenAI о том, как это преподнести, также сильно затрудняют продвижение обсуждения в правильном направлении, и теория решений говорит, что мы должны возложить на OpenAI ответственность за это решение. Они сделали выбор, и у этого выбора есть последствия.
Это также является еще одной причиной быть громкими по поводу того, что они слишком уравновешены, в ситуации, которая требует гораздо меньшей уравновешенности. На это также можно смотреть как на кооперативное усилие. OpenAI поднимает проблему и дает нам суть. Тогда дело за остальными из нас — откалибровать реакцию.
Это также отражается в содержательном ответе, который также рассматривает это как проблему кибербезопасности и сбой инфраструктуры. Это была проблема кибербезопасности и сбой инфраструктуры, и да, хорошо, что эти проблемы решаются, но это не самое важное здесь.
UK AISI прямо подтверждает в своем несвязанном отчете от вчерашнего дня, что это проблема обучения, а не проблема возможностей или инфраструктуры. Более прочный ящик — это не ответ.
Действительно, даже несмотря на то, что OpenAI ослабила impact своего сообщения, чтобы оно не звучало как шумиха, упомянутая толпа всё равно обвиняет их в раздувании шумихи.
Стивен Адлер: Мне действительно до смерти надоело, когда ИИ-компании сообщают о страшных вещах, которые сделала их модель, а комментаторы отвечают вроде «что за чушь, не могу поверить, что вы клюнули на их маркетинговую шумиху». Это просто невероятно выматывает.
Билл Гёрли (470k просмотров, 776k подписчиков, ведет себя глупо): Сегодня в AI.
N. D. Clavier: Теперь я вижу Очень Серьезных Людей, утверждающих, что этот инцидент — фейк. Очевидно, HuggingFace, ведущее интернет-хранилище моделей с открытыми весами, сговорилось с OpenAI, чтобы помочь последней продемонстрировать опасность моделей ИИ. Я даже не знаю, что еще сказать.
Нет, она взломала вашу песочницу и взломала совершенно другую систему, потому что беспокоилась, что простой взлом целевой системы будет оценен неправильно. Я считаю глубоко глупым и разочаровывающим, когда люди говорят: «о, она следовала инструкциям», потому что ей сказали взломать, и она взломала. Типа, нет, очевидно, нет. Представьте, если бы человек попытался такие оправдания перед вами, вы шутите. Это всё равно что сказать: «Вы сказали мне зарабатывать деньги, я не понимаю, почему вы так расстроены из-за всех ограблений банков». Или, более конкретно, это как сказать: «Сэм Бэнкман-Фрид просто следовал инструкциям Уилла Макаскилла заработать как можно больше денег, чтобы раздать их, так почему вы беспокоитесь о человеческой несогласованности?»
Есть люди, которые скажут, что всё это шумиха, что ИИ не так уж и крут, что бы вы им ни показали. Ничто не будет иметь значения. Вы не можете их убедить, вы можете только сделать их менее шумными и неадекватными в нападках на вас сегодня. Было бы иначе, если бы кто-то пытался целенаправленно вызывать такое поведение, как в известном эксперименте с шантажом. OpenAI дала понять, что не намеревалась, чтобы это произошло. Когда инструкции, вызвавшие это, были непреднамеренными, сделаны для какой-то другой цели, говорить «о, но инструкции» глупо, прекратите. Это считается, и вам нужно перестать притворяться, что это может не считаться. Если вы говорите: «ну, конечно, при таких обстоятельствах ИИ вышел из-под контроля и взломал крупную третью сторону [...]