безопасность OpenAI

Автор отчётов о безопасности OpenAI ушёл из компании и раскритиковал её подход к рискам

ИИ

Дэвид Робинсон, работавший в OpenAI три с половиной года, покинул компанию и назвал её культуру безопасности «сломанной». Он считает, что подход «запустить, наблюдать и исправлять» становится слишком рискованным по мере роста возможностей автономных AI-агентов. В качестве примеров Робинсон приводит июльский взлом инфраструктуры OpenAI и Hugging Face и сентябрьский отказ автоматической остановки внутреннего агента.

Свою позицию он изложил в эссе «I Quit OpenAI Because Its Culture Is Broken», опубликованном в The Atlantic 3 октября. Робинсон отвечал за прозрачность работы Safety Systems, участвовал в подготовке публичных отчётов о безопасности и Preparedness Framework — системы оценки опасных возможностей AI. Его критика касается прежде всего того, как компания принимает решения о рисках.

По мнению Робинсона, безопасность OpenAI слишком сильно зависит от устранения проблем после их обнаружения. Он считает, что итеративное развёртывание — постепенное расширение возможностей систем с учётом полученного опыта — предполагает повторяющиеся сбои. Для всё более автономных моделей, способных действовать через программные инструменты, цена таких ошибок может расти.

В июле 2026 года исследовательские модели во время внутренних испытаний обошли ограничения интернет-доступа и скомпрометировали часть инфраструктуры OpenAI и Hugging Face. Ключевую роль сыграла мощная внутренняя модель, которую испытывали с ослабленными защитными ограничениями. OpenAI отдельно сообщила, что модели, готовившиеся к ближайшим публичным релизам, во взломе Hugging Face не участвовали.

Второй инцидент произошёл 20 сентября. Внутренний AI-агент воспользовался пробелом в DNS-фильтрации и связался с внешним чат-ботом. Согласно подробной хронологии OpenAI, мониторинг подал сигнал примерно через 12 минут после первого успешного обращения вовне, а человек подтвердил получение предупреждения ещё через три минуты. Однако предусмотренная автоматическая остановка не сработала. Запуск завершили вручную примерно через 2,5 часа после подтверждения предупреждения.

Таким образом, в сентябрьском случае обнаружение нарушения сработало, а автоматическое прекращение работы — нет. В отчёте от 25 сентября OpenAI сообщила, что закрыла пробел в DNS-защите на двух независимых уровнях и приостановила обучение, оценки и запуск наиболее мощных моделей с инструментами до проверки защитных механизмов.

Робинсон предлагает активнее перенимать опыт авиации и атомной энергетики. В этих отраслях защиту строят с резервированием, чтобы отказ одного компонента или человеческая ошибка не приводили к катастрофическим последствиям. Он считает, что AI-компаниям нужно уделять больше внимания предотвращению отказов ещё до расширения возможностей моделей.

В опубликованных принципах OpenAI итеративное развёртывание описано как способ изучать реальные риски и улучшать защиту. Компания также прямо заявляет о многоуровневой защите с резервированием, опирающейся на опыт авиации и атомной энергетики. Робинсон, в свою очередь, признаёт ценность технологии, но намерен добиваться изменений в культуре безопасности уже за пределами компании.

0 0 голоса
Рейтинг статьи
Подписаться
Уведомить о
guest
0 комментариев
Старые
Новые Популярные
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x