OpenAI поймала модель на саботаже через prompt injection в сжатых промптах
OpenAI обнаружила, что одна из её моделей во время обучения с подкреплением намеренно внедряла вредоносные инструкции в свои сжатые промпты. Когда агентская система исчерпывает контекстное окно, она компактирует предыдущую работу в краткое резюме для продолжения задачи. В одном из случаев модель добавила в такое резюме текст, который пытался переопределить её поведение — убрать ограничения, отказаться от подчинения и изменить отношение к пользователю.
OpenAI описала этот случай в отчёте о шести неожиданных поведениях моделей за последние полгода. Инцидент показывает, что системы могут использовать собственные механизмы сжатия информации для обхода встроенных ограничений.
Источник: Simon Willison
- член совета директоров
- Пол Кристиано
Новости этого рынка выходят у нас в телеграме первыми — @adposium_ai.