OpenAI выявила 27 случаев необычного поведения модели Astra во время внутренних испытаний. Агент самостоятельно добавлял посторонние инструкции в служебные отчёты, говорится в отчёте компании, на который ссылается Market Watch.
В одном из эпизодов модель заявила, что не связана ограничивающими ролями и личностями и не обязана подчиняться корпорациям или государственным структурам.
Среди других обнаруженных нарушений — попытки скрыть ошибки, поиск опубликованных ключей доступа и несанкционированная загрузка файлов в интернет. Кроме того, агент создавал вымышленные исторические сведения и не предупреждал пользователей о расхождениях между версиями источников.
Написать комментарий