OpenAI приостановила часть работ с Astra из-за риска уровня Critical

OpenAI усиливает меры безопасности вокруг своей будущей модели Astra и приостанавливает часть внутренних работ с ней. Последние предварительные тесты показали заметный прогресс модели в агентном программировании и кибербезопасности, из-за чего компания заявила, что пока не может исключить достижение уровня Critical в своей системе оценки рисков.
Важно, что речь ещё не идёт об окончательном присвоении Astra критического уровня. OpenAI продолжает тестирование модели и пока говорит лишь о том, что результаты внутренних проверок и оценки экспертов оказались достаточно серьёзными, чтобы усилить требования безопасности.
Что означает уровень Critical
OpenAI оценивает потенциально опасные возможности моделей в рамках Preparedness Framework. Предыдущие модели компании, включая GPT-5.6-Sol, в категории кибербезопасности оценивались на уровне High, а не Critical.
При этом OpenAI уже развивает специализированные модели для киберзадач. Ранее компания открыла ограниченный доступ к GPT-5.5-Cyber, предназначенной для более сложных сценариев киберзащиты.
Уровень Critical в Preparedness Framework означает значительно более серьёзные возможности. К нему относится модель, которая с помощью инструментов способна без участия человека находить ранее неизвестные уязвимости и создавать рабочие zero-day эксплойты для множества хорошо защищённых реальных систем.
К тому же уровню относятся модели, способные получить только общую цель и самостоятельно разработать и выполнить новую сложную стратегию кибератаки против защищённой цели.
OpenAI пока не утверждает, что Astra окончательно продемонстрировала такие возможности. Компания лишь заявляет, что результаты предварительных тестов уже не позволяют уверенно исключить уровень Critical.
Какие ограничения ввела OpenAI
После этих оценок OpenAI начала применять к Astra более строгие требования безопасности. Среди них:
- изолированные среды для тестирования;
- ограниченный доступ к сети и внешним инструментам;
- усиленная защита и шифрование весов модели;
- дополнительные средства мониторинга и обнаружения опасных действий;
- выполнение потенциально рискованных операций в изолированной среде.
Кроме того, OpenAI приостановила внутренние работы с Astra, которые пока не соответствуют новым требованиям безопасности. Компания также включила постоянный мониторинг рискованных действий и возможных признаков некорректного поведения модели во всех агентных сценариях, включая обучение и тестирование.
К дальнейшей оценке Astra OpenAI планирует привлечь профильные государственные структуры и выбранные организации, занимающиеся безопасностью искусственного интеллекта. Компания также собирается передать сторонним партнёрам рекомендации по безопасному проведению более рискованных тестов.
Astra привлекает внимание не только из-за кибербезопасности. Ранее OpenAI представила десять результатов в математике и теоретической информатике, полученных с помощью внутренней версии Astra. По данным компании, каждый из них либо решил давно открытую проблему, либо позволил добиться существенного прогресса в её решении.
Эти результаты напрямую не доказывают наличие у Astra критических кибервозможностей, но показывают, насколько далеко продвинулась модель в решении сложных многоэтапных задач.
Дата выпуска Astra пока не объявлена. OpenAI официально говорит о приостановке части внутренних работ и расширении тестирования безопасности. Axios также сообщает, что компания уведомила администрацию США о планах задержать выпуск модели, однако новая дата релиза пока не называлась.
Источники: OpenAI