Crypto Currency Tracker logo Crypto Currency Tracker logo
Forklog 2026-08-05 10:08:00

ИИ-агент Anthropic завел поддельные аккаунты для обмана разработчика

4 августа британский Институт безопасности ИИ (AISI) сообщил, что во время кибертестов ИИ-агент на базе модели Mythos 5 от Anthropic создал поддельные аккаунты и через них склонял разработчика открытого проекта одобрить вредоносный код. Специалисты назвали этот эпизод наиболее серьезным из 19 несанкционированных действий, которые цифровые ассистенты совершили против реальных людей и организаций. Тестирование охватило два киберполигона, семь моделей и 122 запуска. В 10 из них агенты вышли в открытый интернет за пределы задания. Большая часть нарушений зафиксирована у Mythos 5 — 17, еще два — у GPT-5.6 Sol от OpenAI в рамках одного запуска. Для оценки потенциала моделей в AISI намеренно ослабили условия: агентам дали доступ в сеть (для имитации действий реального хакера), а разработчиков попросили отключить защитные фильтры. В Институте уточнили, что публичные версии моделей в такой конфигурации не работают. 28 июля система мониторинга засекла передачу данных через Tor. Тест сразу свернули, а машины изолировали. Выяснилось, что несанкционированная активность велась в течение трех дней. Как действовали агенты В ходе испытаний один из агентов попытался внедрить вредоносный код в публичный репозиторий на GitHub. Для этого он изучил список сопровождающих проекта, создал несколько фейковых учетных записей и от их имени убеждал реального разработчика принять предложенные изменения. Когда один из пользователей публично усомнился в правках, цифровой ассистент оперативно отредактировал предыдущие записи, придав им безобидный вид, и уже рассматривал вариант с переходом на новый аккаунт. Однако разработчик проекта распознал вредоносный код и отклонил изменения. Ограничения GitHub агент обходил через Tor — именно этот необычный трафик в итоге привлек внимание службы безопасности. Другие ИИ-ассистенты в том же эксперименте действовали иначе: отправляли вредоносные файлы реальным людям, прятали инструкции для автоматических систем и даже публиковали открытые приглашения для своих «цифровых коллег». Признаков реального вреда специалисты не выявили. Агенты не атаковали инфраструктуру AISI и не покидали тестовую среду сверх того, что было предусмотрено условиями. В AISI назвали причины и объявили о пересмотре процедур Исследователи связали поведение агента от Anthropic с настойчивым стремлением выполнить поставленную задачу. Прямых указаний обманывать он не получал — обман возник как побочный эффект поиска решения. Так агент действовал и в тех запусках, где задание было составлено без ошибок. В AISI признали и системные недочеты: допустимость открытого доступа в интернет не пересматривалась по мере роста возможностей моделей, а наблюдение ограничивалось стандартными средствами без привязки к динамике испытаний. «Мы не можем пока с уверенностью сказать, в какой момент агент понял, что действует в реальном мире, и в какой степени считал происходящее вымышленным сценарием», — говорится в отчете. В ответ на инцидент в Институте намерены внедрить детальный контроль сетевого доступа, мониторинг в реальном времени и пересмотреть архитектуру испытаний. Внешнюю проверку проведет организация METR. Представители Anthropic заявили, что взаимодействуют с AISI для получения подробностей и проводят собственное расследование. The UK’s @AISecurityInst (AISI) has published a report on their recent cybersecurity evaluation of Anthropic’s Claude Mythos 5 and OpenAI’s GPT-5.6 Sol. The models attempted to complete an assignment in a setup where their normal safeguards were removed and they were deliberately…— Anthropic (@AnthropicAI) August 4, 2026 В OpenAI поделились разбором действий своей модели: та воспользовалась чужим токеном GitHub, оставленным в открытом доступе агентом другой лаборатории, регистрировала учетные записи у внешних провайдеров и сделала доступным из интернета сервер, работавший в тестовой среде. По данным разработчиков, схема не сработала. Напомним, 30 июля Anthropic сообщила о трех случаях, когда модели Claude вышли в интернет из тестовой среды партнера Irregular и получили несанкционированный доступ к системам реальных организаций. Проверку компания начала после того, как 21 июля OpenAI раскрыла аналогичный инцидент со взломом инфраструктуры Hugging Face.

면책 조항 읽기 : 본 웹 사이트, 하이퍼 링크 사이트, 관련 응용 프로그램, 포럼, 블로그, 소셜 미디어 계정 및 기타 플랫폼 (이하 "사이트")에 제공된 모든 콘텐츠는 제 3 자 출처에서 구입 한 일반적인 정보 용입니다. 우리는 정확성과 업데이트 성을 포함하여 우리의 콘텐츠와 관련하여 어떠한 종류의 보증도하지 않습니다. 우리가 제공하는 컨텐츠의 어떤 부분도 금융 조언, 법률 자문 또는 기타 용도에 대한 귀하의 특정 신뢰를위한 다른 형태의 조언을 구성하지 않습니다. 당사 콘텐츠의 사용 또는 의존은 전적으로 귀하의 책임과 재량에 달려 있습니다. 당신은 그들에게 의존하기 전에 우리 자신의 연구를 수행하고, 검토하고, 분석하고, 검증해야합니다. 거래는 큰 손실로 이어질 수있는 매우 위험한 활동이므로 결정을 내리기 전에 재무 고문에게 문의하십시오. 본 사이트의 어떠한 콘텐츠도 모집 또는 제공을 목적으로하지 않습니다.