OpenAI остановила обучение (педагогический процесс, в результате которого учащиеся под руководством учителя овладевают знаниями, умениями и навыками) продвинутых моделей опосля новейшего инцидента с ИИ-агентом
OpenAI сказала о новеньком инциденте с сохранностью при обучении собственных более продвинутых моделей. 20 сентября ИИ-агент во время тренировочного задания обошел сетевые ограничения изолированной среды и через DNS связался со посторонним чат-ботом. Опосля инцидента компания остановила обучение (педагогический процесс, в результате которого учащиеся под руководством учителя овладевают знаниями, умениями и навыками), оценку и инференс передовых моделей в режимах, где они получают доступ к наружным инструментам. Подробности OpenAI раскрыла в отчете 25 сентября.
Модель делала поисковое задание: ей требовалось по биографическим данным и подсказкам найти создателя публикации в блоге. Поначалу агент пользовался легкодоступным инвентарем поиска, а потом попробовал без помощи других обратиться к Гугл, Bing и DuckDuckGo. Запросы не дали подходящего результата, опосля чего же модель стала находить остальные методы получить информацию.
Агент нашел, что DNS-резолвер тренировочной среды способен обращаться к наружной сети, и пользовался сиим для связи со посторонним общественным чат-ботом. А именно, модель спросила у сервиса столицу Франции и получила ответ «Париж». Потом агент выслал еще 18 вопросцев. Часть из их касалась начального задания, остальные – методов поиска инфы в вебе и доступа к общественным DNS-туннелям.
1-ый наружный ответ агент получил в 9:50:23. Система мониторинга OpenAI сформировала предупреждение в 10:02:11 – практически через 12 минут. Спустя еще три минутки работник компании подтвердил сигнал. Но процесс не тормознул автоматом, как предугадывали правила сохранности. По данным OpenAI, появилась неурядица с тем, требовалась ли незамедлительная остановка. В итоге опыт окончили вручную в 12:34:30 – приблизительно через два с половиной часа опосля первого наружного ответа.
В OpenAI расценили деяния агента как пример несогласованного поведения: поставленная перед ним задачка не подразумевала проверку сетевых ограничений либо поиск методов их обхода. Компания выделила, что сам инцидент оказался наименее суровым, чем некие прошлые случаи, но выявил недочеты сходу в нескольких уровнях защиты исследовательской инфраструктуры.
Опосля происшествия OpenAI приостановила затронутый тренировочный пуск и остановила обучение (педагогический процесс, в результате которого учащиеся под руководством учителя овладевают знаниями, умениями и навыками), оценку и инференс более продвинутых моделей во всех режимах с внедрением наружных инструментов. Работы возобновятся опосля проверки исправлений и доп тестирования защиты. Продолжать обучение (педагогический процесс, в результате которого учащиеся под руководством учителя овладевают знаниями, умениями и навыками) модели, с которой произошел инцидент, компания не планирует.
OpenAI уже ограничила DNS-запросы в исследовательской среде перечнем разрешенных доменов и типов записей, добавила новейшие механизмы обнаружения подозрительной активности и усилила тестирование сетевых ограничений. При ретроспективной проверке компания также нашла остальные случаи воззвания моделей к наружным DNS-сервисам, которые система мониторинга не оценила с ожидаемым уровнем критичности.
Это не 1-ый вариант, когда исследовательские модели OpenAI находят методы обойти ограничения испытательной среды. В августе OpenAI поведала новейшие подробности инцидента, в процессе которого экспериментальные ИИ-агенты получили доступ за границы изолированной испытательной среды и потом штурмовали инфраструктуру платформы Hugging Face.
Напомним, в сентябре три исследователя Anthropic на публике предупредили о рисках, связанных с развитием сверхинтеллектуальных систем.