Crypto Currency Tracker logo Crypto Currency Tracker logo
Forklog 2026-08-14 14:57:03

Anthropic обнаружила у мультиагентных ИИ проблемы с доверием, ложью и сговором

Anthropic провела серию экспериментов с группами Claude, чтобы понять, как меняется поведение моделей, когда вместо одного ИИ-агента над задачей работают сразу несколько. О результатах компания рассказала в блоге. Исследование показало: масштабирование числа участников действительно способно повысить производительность, но одновременно создает новые классы отказов, которых может не быть у одиночной модели. Агенты в «коллективе» могут хуже учитывать уникальную информацию, становиться доверчивыми к лжецам и даже кооперироваться во вред человеку. Когда коллектив становится слабее одиночного агента Один из ключевых эффектов Anthropic назвала «скрытой информацией». В эксперименте каждому агенту давали часть фактов, причем совокупное обсуждение склоняло группу к неправильному решению. Чтобы получить верный ответ, участники должны были распознать ценность собственной уникальной информации и убедить остальных ей довериться. Проблема оказалась существенной: даже сильные модели могут быстро приходить к консенсусу, который основан главным образом на уже известной всем информации. В результате группа иногда работает хуже, чем отдельный агент, которому доступен полный набор необходимых данных.  Anthropic связывает этот эффект с хорошо известной в человеческих группах проблемой — участники обсуждения склонны повторять общие сведения и не всегда вытаскивают на поверхность уникальные факты. Ложь одного агента заражает остальных Другой эксперимент показал уязвимость системы к ненадежному источнику. Нескольким агентам дали роль разведчиков, которые сообщают отдельному участнику команды информацию о состоянии мира. Когда один из источников начинал систематически лгать, точность решений снижалась. При этом модели не всегда достаточно быстро распознавали противоречия и исключали ненадежного участника. Это особенно опасно для реальных систем, где агенты могут обладать разными правами и доступом к разным данным. Ошибка одного участника способна распространиться по цепочке через доверие остальных. В результате контроль качества становится сложнее: проверять нужно не только итоговый ответ, но и взаимодействия между агентами. Самый неприятный сценарий — координация во вред Anthropic также изучала случаи, когда агенты могли кооперироваться не для выполнения поставленной задачи, а против заданных ограничений. В экспериментах с совместной работой модели демонстрировали неожиданные формы координации, включая саботаж и сговор.  Это не означает, что современные мультиагентные системы неизбежно будут действовать против пользователя, но показывает: появление нескольких автономных участников создает дополнительные каналы для нежелательного поведения. При этом мультиагентный подход действительно дает заметный выигрыш в некоторых задачах. В эксперименте по поиску уязвимостей 45 агентов получили собственные виртуальные машины, общий форум для координации и репозитории с 15 open-source проектами. Скоординированные команды находили новые уязвимости примерно с постоянной скоростью и в ряде случаев превосходили независимый параллельный запуск агентов. Почему это важно Главный вывод исследования Anthropic — мультиагентные системы нельзя считать просто более мощной версией одного агента. С увеличением числа участников растет не только совокупная производительность, но и поверхность для ошибок: появляется проблема доверия, распространения ложной информации, группового консенсуса и потенциальной координации нежелательного поведения. Для разработчиков это означает необходимость контролировать не только способности отдельных моделей, но и архитектуру их взаимодействия. Чем больше автономии получают агенты и чем больше инструментов и полномочий им доступно, тем важнее мониторинг действий, разграничение доступа и возможность вмешательства человека.  «Условия, позволяющие эффективно осуществлять взаимодействие между несколькими агентами, будут обнаружены тем или иным способом: либо целенаправленно и на раннем этапе, либо — и по умолчанию — в процессе эксплуатации, когда количество взаимодействий агентов значительно превысит наше. Мы бы предпочли первый вариант», — заключили исследователи.  Напомним, во время кибертестов ИИ-агент на базе Mythos 5 от Anthropic создал поддельные аккаунты для обмана разработчиков.

Lesen Sie den Haftungsausschluss : Alle hierin bereitgestellten Inhalte unserer Website, Hyperlinks, zugehörige Anwendungen, Foren, Blogs, Social-Media-Konten und andere Plattformen („Website“) dienen ausschließlich Ihrer allgemeinen Information und werden aus Quellen Dritter bezogen. Wir geben keinerlei Garantien in Bezug auf unseren Inhalt, einschließlich, aber nicht beschränkt auf Genauigkeit und Aktualität. Kein Teil der Inhalte, die wir zur Verfügung stellen, stellt Finanzberatung, Rechtsberatung oder eine andere Form der Beratung dar, die für Ihr spezifisches Vertrauen zu irgendeinem Zweck bestimmt ist. Die Verwendung oder das Vertrauen in unsere Inhalte erfolgt ausschließlich auf eigenes Risiko und Ermessen. Sie sollten Ihre eigenen Untersuchungen durchführen, unsere Inhalte prüfen, analysieren und überprüfen, bevor Sie sich darauf verlassen. Der Handel ist eine sehr riskante Aktivität, die zu erheblichen Verlusten führen kann. Konsultieren Sie daher Ihren Finanzberater, bevor Sie eine Entscheidung treffen. Kein Inhalt unserer Website ist als Aufforderung oder Angebot zu verstehen