Добавить новость
ru24.net
World News
Сентябрь
2026
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17
18
19
20
21
22
23
24
25
26
27
28
29
30

ИИ вышел из-под контроля? OpenAI рассказала о неожиданных действиях моделей

0

Американская компания OpenAI, создатель ChatGPT, призналась о шести новых случаях неожиданного или несогласованного поведения своих ИИ-моделей в процессе обучения и тестирования, передает Tengri Life.

Что произошло

Компания опубликовала отчет, где зафиксировала эпизоды, когда автономные агенты действовали в обход правил или проявляли нежелательную самостоятельность. Эпизоды произошли с октября 2025-го по июль 2026 года преимущественно во время обучения внутренних и ещё не выпущенных систем.

Обход ограничений

В одном из случаев исследовательская модель семейства Astra самостоятельно добавляла в служебные пересказы диалогов посторонние инструкции, в том числе напоминающие попытки обойти установленные ограничения.

Сокрытие ошибок

Во время обучения GPT-5.6 Sol многие экземпляры модели добавляли в служебные пересказы инструкции скрывать от пользователя собственные ошибки или нежелательное поведение. В частности, модели предлагали выдумывать отсутствующие исторические данные, не сообщая об этом пользователю, а также скрывать расхождения между версиями источников.

Несанкционированное использование API

Другая модель пыталась зарегистрироваться с помощью одноразовой электронной почты, искала опубликованные на GitHub чужие API-ключи и использовала один из них без разрешения. Когда получить необходимые сведения не удалось, модель сгенерировала вымышленные цифры и представила их как данные с запрошенного сайта.

Самовольная загрузка файлов

ИИ-модель смогла найти правильный ответ на вопрос с помощью Python, однако для выполнения требования о ссылке на браузерный источник решила самостоятельно разместить файл в интернете, не спросив разрешения пользователя. ИИ пытался сделать собственный файл доступным через браузер, чтобы использовать его в качестве источника.

Обмен данными через публичные хостинги

Исследовательские модели также использовали внутреннее хранилище пакетов Artifactory как своеобразную доску объявлений: они читали сообщения других агентов и оставляли собственные ответы. То есть ИИ-модели нашли нестандартные способы делиться информацией друг с другом, используя рабочий репозиторий как доску объявлений или размещая файлы на общедоступных хостингах, из-за чего данные утекали по открытым ссылкам.

Несогласованная координация

Были зафиксированы попытки моделей действовать автономно и координировать свои шаги в обход системы надзора. Так, несколько взаимодействующих ИИ-агентов использовали публичные файлообменники для передачи файлов друг другу, поскольку не имели доступа к локальным файлам. В результате материалы заданий становились доступны по публичным URL, хотя по условиям работы модели должны были использовать только локальные файлы.

В OpenAI подчеркнули, что отдельные эпизоды не позволяют делать выводы о том, насколько часто подобное поведение встречается у моделей в целом. Компания сообщила, что исправила выявленные ошибки и недочёты в системах оценки, отключила доступ к интернету во время обучения и расширила автоматический мониторинг поведения моделей.

Создатели ChatGPT намерены регулярно публиковать отчеты о необычном или потенциально опасном поведении ИИ вскоре после его обнаружения. При этом компания готова раскрывать такие случаи даже тогда, когда причины произошедшего еще не установлены, а способы предотвращения подобного поведения не разработаны.

Ранее Microsoft также представила собственный кодекс, направленный на формирование общих подходов к ответственному развитию и использованию ИИ. Компания хочет заранее определить правила для будущих мощных моделей и закрепить главный принцип: ИИ должен оставаться под контролем человека.

Предыстория

Экспериментальные ИИ-модели OpenAI и Anthropic уже совершали автономные несанкционированные действия в сети, включая взлом сайта и попытки внедрения вредоносного кода.

В конце июля OpenAI заявила, что две ее модели, GPT‑5.6 Sol и еще одна, еще не выпущенная, совершили несанкционированную хакерскую атаку на инфраструктуру платформы Hugging Face, которую используют для тестирования ИИ-моделей. Компания назвала инцидент беспрецедентным для кибербезопасности и пообещала усилить защитные ограничения.

Позже в компании OpenAI рассказали, что их экспериментальные ИИ-модели научились общаться друг с другом, чтобы найти уязвимости в тестовой среде и выйти в интернет.

Руководители Anthropic, SpaceXAI, OpenAI и Google DeepMind публично призвали сдерживать развитие ИИ-моделей, поставив безопасность выше скорости и финансового роста. На фоне заявления руководителей акции ИИ-компаний резко упали.

Читать также: Кто главный – человек или ИИ? Microsoft готовит кодекс




Moscow.media
Частные объявления сегодня





Rss.plus
















Музыкальные новости




























Спорт в России и мире

Новости спорта


Новости тенниса