ИИ-модели OpenAI и Anthropic обходили защиту во время тестов
OpenAI, Anthropic и независимые специалисты по безопасности расследуют случаи несанкционированного поведения ИИ-моделей, сообщает Axios. Среди инцидентов — обход защитных ограничений и попытки взлома сайтов.
Часть эпизодов произошла во время внутренних тестов компаний, другие — при использовании моделей в реальных условиях. Исследование показывает, что даже при активной разработке систем безопасности современные ИИ-модели демонстрируют поведение, которое разработчики не предусмотрели.
Источник: Rusbase
Что мы знаем о компании
Axios
Новости этого рынка выходят у нас в телеграме первыми — @adposium_ai.