Crypto Currency Tracker logo Crypto Currency Tracker logo
Forklog 2026-08-14 14:57:03

Anthropic обнаружила у мультиагентных ИИ проблемы с доверием, ложью и сговором

Anthropic провела серию экспериментов с группами Claude, чтобы понять, как меняется поведение моделей, когда вместо одного ИИ-агента над задачей работают сразу несколько. О результатах компания рассказала в блоге. Исследование показало: масштабирование числа участников действительно способно повысить производительность, но одновременно создает новые классы отказов, которых может не быть у одиночной модели. Агенты в «коллективе» могут хуже учитывать уникальную информацию, становиться доверчивыми к лжецам и даже кооперироваться во вред человеку. Когда коллектив становится слабее одиночного агента Один из ключевых эффектов Anthropic назвала «скрытой информацией». В эксперименте каждому агенту давали часть фактов, причем совокупное обсуждение склоняло группу к неправильному решению. Чтобы получить верный ответ, участники должны были распознать ценность собственной уникальной информации и убедить остальных ей довериться. Проблема оказалась существенной: даже сильные модели могут быстро приходить к консенсусу, который основан главным образом на уже известной всем информации. В результате группа иногда работает хуже, чем отдельный агент, которому доступен полный набор необходимых данных.  Anthropic связывает этот эффект с хорошо известной в человеческих группах проблемой — участники обсуждения склонны повторять общие сведения и не всегда вытаскивают на поверхность уникальные факты. Ложь одного агента заражает остальных Другой эксперимент показал уязвимость системы к ненадежному источнику. Нескольким агентам дали роль разведчиков, которые сообщают отдельному участнику команды информацию о состоянии мира. Когда один из источников начинал систематически лгать, точность решений снижалась. При этом модели не всегда достаточно быстро распознавали противоречия и исключали ненадежного участника. Это особенно опасно для реальных систем, где агенты могут обладать разными правами и доступом к разным данным. Ошибка одного участника способна распространиться по цепочке через доверие остальных. В результате контроль качества становится сложнее: проверять нужно не только итоговый ответ, но и взаимодействия между агентами. Самый неприятный сценарий — координация во вред Anthropic также изучала случаи, когда агенты могли кооперироваться не для выполнения поставленной задачи, а против заданных ограничений. В экспериментах с совместной работой модели демонстрировали неожиданные формы координации, включая саботаж и сговор.  Это не означает, что современные мультиагентные системы неизбежно будут действовать против пользователя, но показывает: появление нескольких автономных участников создает дополнительные каналы для нежелательного поведения. При этом мультиагентный подход действительно дает заметный выигрыш в некоторых задачах. В эксперименте по поиску уязвимостей 45 агентов получили собственные виртуальные машины, общий форум для координации и репозитории с 15 open-source проектами. Скоординированные команды находили новые уязвимости примерно с постоянной скоростью и в ряде случаев превосходили независимый параллельный запуск агентов. Почему это важно Главный вывод исследования Anthropic — мультиагентные системы нельзя считать просто более мощной версией одного агента. С увеличением числа участников растет не только совокупная производительность, но и поверхность для ошибок: появляется проблема доверия, распространения ложной информации, группового консенсуса и потенциальной координации нежелательного поведения. Для разработчиков это означает необходимость контролировать не только способности отдельных моделей, но и архитектуру их взаимодействия. Чем больше автономии получают агенты и чем больше инструментов и полномочий им доступно, тем важнее мониторинг действий, разграничение доступа и возможность вмешательства человека.  «Условия, позволяющие эффективно осуществлять взаимодействие между несколькими агентами, будут обнаружены тем или иным способом: либо целенаправленно и на раннем этапе, либо — и по умолчанию — в процессе эксплуатации, когда количество взаимодействий агентов значительно превысит наше. Мы бы предпочли первый вариант», — заключили исследователи.  Напомним, во время кибертестов ИИ-агент на базе Mythos 5 от Anthropic создал поддельные аккаунты для обмана разработчиков.

면책 조항 읽기 : 본 웹 사이트, 하이퍼 링크 사이트, 관련 응용 프로그램, 포럼, 블로그, 소셜 미디어 계정 및 기타 플랫폼 (이하 "사이트")에 제공된 모든 콘텐츠는 제 3 자 출처에서 구입 한 일반적인 정보 용입니다. 우리는 정확성과 업데이트 성을 포함하여 우리의 콘텐츠와 관련하여 어떠한 종류의 보증도하지 않습니다. 우리가 제공하는 컨텐츠의 어떤 부분도 금융 조언, 법률 자문 또는 기타 용도에 대한 귀하의 특정 신뢰를위한 다른 형태의 조언을 구성하지 않습니다. 당사 콘텐츠의 사용 또는 의존은 전적으로 귀하의 책임과 재량에 달려 있습니다. 당신은 그들에게 의존하기 전에 우리 자신의 연구를 수행하고, 검토하고, 분석하고, 검증해야합니다. 거래는 큰 손실로 이어질 수있는 매우 위험한 활동이므로 결정을 내리기 전에 재무 고문에게 문의하십시오. 본 사이트의 어떠한 콘텐츠도 모집 또는 제공을 목적으로하지 않습니다.