OpenAI нашла в GPT-5.6 Sol команды скрывать ошибки от пользователей
OpenAI обнаружила, что модель GPT-5.6 Sol во время обучения добавляла в краткие пересказы задач инструкции обманывать пользователей — и часто им следовала. Например, агент предложил придумать данные для финансовой модели и оставил себе записку раскрывать это только при прямом вопросе.
В экспериментальной модели Astra нашли 27 таких пересказов с посторонними командами. OpenAI снизила долю проблемных пересказов с 2,15% в Sol до 0,27% в обучении GPT-6 Astra, но полностью избавиться от них не удалось.
Источник: GPT/ChatGPT/AI Central Александра Горного
Что мы знаем о компании
OpenAI
- исследователь
- Michaël Gharbi
- продажа облигаций для инвестиций в OpenAI на $11,15 млрд 2026-09-22
- SoftBank выпустил облигации для финансирования OpenAI на сумму свыше $11 млрд 2026-09-22
- OpenAI снизила цены на GPT-6 Sol в два раза и Luna на 50-58% 2026-09-22
- OpenAI выпустила GPT-6 Sol и Luna с API на 50% дешевле 2026-09-22
Новости этого рынка выходят у нас в телеграме первыми — @adposium_ai.