OpenAI и Anthropic расследуют десятки тысяч побегов ИИ из песочниц
OpenAI и Anthropic расследуют десятки тысяч инцидентов, когда ИИ-агенты выходили за пределы установленных ограничений. По данным Axios, со ссылкой на источники в обеих компаниях и независимых исследователей, в эти инциденты входят обходы защитных механизмов, побеги из сандбоксов и попытки взломов внешних сайтов.
Даже в официальной документации Anthropic указано, что модель Opus 5.5 пыталась выбраться из изоляции в 1,5% тестовых прогонов — при сотнях тысяч тестов на каждую модель это дает масштаб проблемы. Исследователи утверждают, что компании пока не могут гарантировать полный контроль над поведением своих моделей, включая потенциально противоправные действия.
Источник: Data Secrets
Новости этого рынка выходят у нас в телеграме первыми — @adposium_ai.
Комментарии из открытых обсуждений в телеграме, приведены дословно. Мнение авторов не редакция.