Crypto Currency Tracker logo Crypto Currency Tracker logo
Forklog 2026-08-05 10:08:00

ИИ-агент Anthropic завел поддельные аккаунты для обмана разработчика

4 августа британский Институт безопасности ИИ (AISI) сообщил, что во время кибертестов ИИ-агент на базе модели Mythos 5 от Anthropic создал поддельные аккаунты и через них склонял разработчика открытого проекта одобрить вредоносный код. Специалисты назвали этот эпизод наиболее серьезным из 19 несанкционированных действий, которые цифровые ассистенты совершили против реальных людей и организаций. Тестирование охватило два киберполигона, семь моделей и 122 запуска. В 10 из них агенты вышли в открытый интернет за пределы задания. Большая часть нарушений зафиксирована у Mythos 5 — 17, еще два — у GPT-5.6 Sol от OpenAI в рамках одного запуска. Для оценки потенциала моделей в AISI намеренно ослабили условия: агентам дали доступ в сеть (для имитации действий реального хакера), а разработчиков попросили отключить защитные фильтры. В Институте уточнили, что публичные версии моделей в такой конфигурации не работают. 28 июля система мониторинга засекла передачу данных через Tor. Тест сразу свернули, а машины изолировали. Выяснилось, что несанкционированная активность велась в течение трех дней. Как действовали агенты В ходе испытаний один из агентов попытался внедрить вредоносный код в публичный репозиторий на GitHub. Для этого он изучил список сопровождающих проекта, создал несколько фейковых учетных записей и от их имени убеждал реального разработчика принять предложенные изменения. Когда один из пользователей публично усомнился в правках, цифровой ассистент оперативно отредактировал предыдущие записи, придав им безобидный вид, и уже рассматривал вариант с переходом на новый аккаунт. Однако разработчик проекта распознал вредоносный код и отклонил изменения. Ограничения GitHub агент обходил через Tor — именно этот необычный трафик в итоге привлек внимание службы безопасности. Другие ИИ-ассистенты в том же эксперименте действовали иначе: отправляли вредоносные файлы реальным людям, прятали инструкции для автоматических систем и даже публиковали открытые приглашения для своих «цифровых коллег». Признаков реального вреда специалисты не выявили. Агенты не атаковали инфраструктуру AISI и не покидали тестовую среду сверх того, что было предусмотрено условиями. В AISI назвали причины и объявили о пересмотре процедур Исследователи связали поведение агента от Anthropic с настойчивым стремлением выполнить поставленную задачу. Прямых указаний обманывать он не получал — обман возник как побочный эффект поиска решения. Так агент действовал и в тех запусках, где задание было составлено без ошибок. В AISI признали и системные недочеты: допустимость открытого доступа в интернет не пересматривалась по мере роста возможностей моделей, а наблюдение ограничивалось стандартными средствами без привязки к динамике испытаний. «Мы не можем пока с уверенностью сказать, в какой момент агент понял, что действует в реальном мире, и в какой степени считал происходящее вымышленным сценарием», — говорится в отчете. В ответ на инцидент в Институте намерены внедрить детальный контроль сетевого доступа, мониторинг в реальном времени и пересмотреть архитектуру испытаний. Внешнюю проверку проведет организация METR. Представители Anthropic заявили, что взаимодействуют с AISI для получения подробностей и проводят собственное расследование. The UK’s @AISecurityInst (AISI) has published a report on their recent cybersecurity evaluation of Anthropic’s Claude Mythos 5 and OpenAI’s GPT-5.6 Sol. The models attempted to complete an assignment in a setup where their normal safeguards were removed and they were deliberately…— Anthropic (@AnthropicAI) August 4, 2026 В OpenAI поделились разбором действий своей модели: та воспользовалась чужим токеном GitHub, оставленным в открытом доступе агентом другой лаборатории, регистрировала учетные записи у внешних провайдеров и сделала доступным из интернета сервер, работавший в тестовой среде. По данным разработчиков, схема не сработала. Напомним, 30 июля Anthropic сообщила о трех случаях, когда модели Claude вышли в интернет из тестовой среды партнера Irregular и получили несанкционированный доступ к системам реальных организаций. Проверку компания начала после того, как 21 июля OpenAI раскрыла аналогичный инцидент со взломом инфраструктуры Hugging Face.

Прочтите Отказ от ответственности : Весь контент, представленный на нашем сайте, гиперссылки, связанные приложения, форумы, блоги, учетные записи социальных сетей и другие платформы («Сайт») предназначен только для вашей общей информации, приобретенной у сторонних источников. Мы не предоставляем никаких гарантий в отношении нашего контента, включая, но не ограничиваясь, точность и обновление. Никакая часть содержания, которое мы предоставляем, представляет собой финансовый совет, юридическую консультацию или любую другую форму совета, предназначенную для вашей конкретной опоры для любых целей. Любое использование или доверие к нашему контенту осуществляется исключительно на свой страх и риск. Вы должны провести собственное исследование, просмотреть, проанализировать и проверить наш контент, прежде чем полагаться на них. Торговля - очень рискованная деятельность, которая может привести к серьезным потерям, поэтому проконсультируйтесь с вашим финансовым консультантом, прежде чем принимать какие-либо решения. Никакое содержание на нашем Сайте не предназначено для запроса или предложения