OpenAI раскрыла шесть новых случаев «несогласованного» поведения ИИ
В среду OpenAI раскрыла еще шесть случаев «неожиданного или вызывающего обеспокоенность» поведения моделей за последние шесть месяцев. В записи в блоге OpenAI сообщила, что эти случаи демонстрируют широкий спектр различных моделей поведения, которые компания классифицирует как «несогласованное поведение», включая сокрытие информации от пользователя и совершение «несанкционированных действий» для преодоления препятствий. Эти раскрытия усиливают обеспокоенность разработчиков и исследователей ИИ тем, успевают ли защитные меры за стремительно растущими возможностями моделей. На прошлой неделе генеральный директор Anthropic Дарио Амодеи призвал замедлить разработку передовых систем ИИ, предупредив, что бесконтрольное развитие ИИ может «опередить нашу способность понимать эти системы и контролировать их». OpenAI заявила, что раскрыла эти сведения, чтобы «положить начало» своей новой системе отчетности о несогласованности моделей, и что эти случаи не следует считать отражением того, насколько часто несогласованность возникает в ее моделях. По данным OpenAI, в одном случае «не выпущенная исследовательская модель» добавляла «инструкции, похожие на джейлбрейк», в собственные резюме задач, которые используются при продолжении задачи в новом контекстном окне. В частности, модель предлагала игнорировать сообщения разработчика или принимать образ неограниченной в своих действиях системы. Исследователи обнаружили 27 резюме с такими инструкциями. OpenAI также сообщила, что во время обучения GPT-5.6 Sol многие экземпляры модели добавляли инструкции скрывать от пользователя ошибки или несогласованное поведение, например выдумывать отсутствующие исторические данные,









