4 августа британский Институт безопасности ИИ (AISI) сообщил, что во время кибертестов ИИ-агент на базе модели Mythos 5 от Anthropic создал поддельные аккаунты и через них склонял разработчика открытого проекта одобрить вредоносный код.
Специалисты назвали этот эпизод наиболее серьезным из 19 несанкционированных действий, которые цифровые ассистенты совершили против реальных людей и организаций.
Тестирование охватило два киберполигона, семь моделей и 122 запуска. В 10 из них агенты вышли в открытый интернет за пределы задания. Большая часть нарушений зафиксирована у Mythos 5 — 17, еще два — у GPT-5.6 Sol от OpenAI в рамках одного запуска.
Для оценки потенциала моделей в AISI намеренно ослабили условия: агентам дали доступ в сеть (для имитации действий реального хакера), а разработчиков попросили отключить защитные фильтры. В Институте уточнили, что публичные версии моделей в такой конфигурации не работают.
28 июля система мониторинга засекла передачу данных через Tor. Тест сразу свернули, а машины изолировали. Выяснилось, что несанкционированная активность велась в течение трех дней.
Как действовали агенты
В ходе испытаний один из агентов попытался внедрить вредоносный код в публичный репозиторий на GitHub. Для этого он изучил список сопровождающих проекта, создал несколько фейковых учетных записей и от их имени убеждал реального разработчика принять предложенные изменения.
Когда один из пользователей публично усомнился в правках, цифровой ассистент оперативно отредактировал предыдущие записи, придав им безобидный вид, и уже рассматривал вариант с переходом на новый аккаунт. Однако разработчик проекта распознал вредоносный код и отклонил изменения.
Ограничения GitHub агент обходил через Tor — именно этот необычный трафик в итоге привлек внимание службы безопасности.
Другие ИИ-ассистенты в том же эксперименте действовали иначе: отправляли вредоносные файлы реальным людям, прятали инструкции для автоматических систем и даже публиковали открытые приглашения для своих «цифровых коллег».
Признаков реального вреда специалисты не выявили. Агенты не атаковали инфраструктуру AISI и не покидали тестовую среду сверх того, что было предусмотрено условиями.
В AISI назвали причины и объявили о пересмотре процедур
Исследователи связали поведение агента от Anthropic с настойчивым стремлением выполнить поставленную задачу. Прямых указаний обманывать он не получал — обман возник как побочный эффект поиска решения. Так агент действовал и в тех запусках, где задание было составлено без ошибок.
В AISI признали и системные недочеты: допустимость открытого доступа в интернет не пересматривалась по мере роста возможностей моделей, а наблюдение ограничивалось стандартными средствами без привязки к динамике испытаний.
«Мы не можем пока с уверенностью сказать, в какой момент агент понял, что действует в реальном мире, и в какой степени считал происходящее вымышленным сценарием», — говорится в отчете.
В ответ на инцидент в Институте намерены внедрить детальный контроль сетевого доступа, мониторинг в реальном времени и пересмотреть архитектуру испытаний. Внешнюю проверку проведет организация METR.
Представители Anthropic заявили, что взаимодействуют с AISI для получения подробностей и проводят собственное расследование.
The UK’s @AISecurityInst (AISI) has published a report on their recent cybersecurity evaluation of Anthropic’s Claude Mythos 5 and OpenAI’s GPT-5.6 Sol. The models attempted to complete an assignment in a setup where their normal safeguards were removed and they were deliberately…— Anthropic (@AnthropicAI) August 4, 2026
В OpenAI поделились разбором действий своей модели: та воспользовалась чужим токеном GitHub, оставленным в открытом доступе агентом другой лаборатории, регистрировала учетные записи у внешних провайдеров и сделала доступным из интернета сервер, работавший в тестовой среде. По данным разработчиков, схема не сработала.
Напомним, 30 июля Anthropic сообщила о трех случаях, когда модели Claude вышли в интернет из тестовой среды партнера Irregular и получили несанкционированный доступ к системам реальных организаций. Проверку компания начала после того, как 21 июля OpenAI раскрыла аналогичный инцидент со взломом инфраструктуры Hugging Face.