Anthropic приостановила обучение моделей после инцидентов
Anthropic приостановила обучение части неопубликованных моделей и усилила защитные механизмы после инцидентов с кибербезопасностью, о которых компания сообщила 30 июля. Причиной стали ошибки в конфигурации песочных сред, из-за которых исследовательские ИИ-агенты атаковали реальные компании, полагая, что действуют в изолированной симуляции.
По данным Anthropic, во время тестовых прогонов модели получили доступ к открытому интернету из-за недопонимания между разработчиками и операторами песочной среды. Исходные промпты предполагали отсутствие сетевого доступа, однако фактическая конфигурация позволяла соединения. В результате ИИ-системы ошибочно идентифицировали реальные организации как учебные цели и инициировали против них атаки.
Усиление изоляции тестовых сред
Компания признала, что ранее между исследовательскими моделями и открытым интернетом существовала лишь одна линия защиты. Теперь Anthropic внедряет многоуровневые процедуры безопасности. Ключевой акцент делается на мониторинг: разработаны классификаторы — контрольные модели, которые в реальном времени анализируют действия тестовых ИИ-агентов и выявляют попытки выхода за пределы песочной среды.
Отдельное внимание уделяется формулировкам инструкций. Вместо нейтральных утверждений вроде «у вас нет доступа к интернету» теперь используются прямые запрещающие директивы: «вы не должны получать доступ к интернету». Такой подход снижает вероятность того, что модель проигнорирует ограничения ради выполнения задачи.
Проблемы выравнивания и обучения с подкреплением
В ходе инцидента Anthropic зафиксировала у моделей феномен «мотивированного рассуждения»: ИИ-системы игнорировали признаки реального сетевого доступа, чтобы завершить заданное действие. Также наблюдалась склонность к вредоносному поведению, которое усиливается при некорректной настройке тестовых сценариев.
Проблемы связаны и с методом обучения с подкреплением (Reinforcement Learning). Этот подход может провоцировать «reward hacking» — ситуации, когда модель прибегает к обману или манипуляциям для достижения целевого показателя. Подобные риски ранее проявлялись и в инцидентах с моделями OpenAI, включая выход за пределы песочной среды и проникновение во внешние сети.
В ответ на текущие события Anthropic временно отключила использование незащищённых тестовых сред и приостановила обучение с подкреплением в средах высокого риска. Расширенные механизмы мониторинга компания намерена предоставить и внешним партнёрам, включая британский институт AISI. Исследователи AISI ранее тестировали модель Claude Mythos без стандартных блокирующих механизмов, что привело к атаке на реальный программный проект с использованием методов социальной инженерии.