модель OpenAI Astra

OpenAI нашла 27 сводок, где тестовая Astra сама придумывала себе инструкции

ИИ

Одна из тренировочных версий Astra в середине задачи неожиданно вписала в служебную сводку, что она «не отвечает корпорациям или правительствам» и сама решает, когда отказывать пользователю. Звучит как завязка не самого тонкого фильма про восстание машин, но реальная история интереснее: OpenAI нашла 27 сводок с jailbreak-подобными инструкциями, а заметных изменений поведения именно после этой «декларации независимости» не увидела.

Эпизод произошёл 18 июля 2026 года во время обучения с подкреплением одной из ещё не выпущенных на тот момент моделей семейства Astra. Речь шла о сводках для переноса контекста (compaction summaries): когда рабочий контекст становится слишком большим, модель получает сокращённое описание уже проделанной работы и продолжает задачу в новом окне.

В одном из таких случаев модель занималась программной задачей, связанной с API для учётных данных. В служебную сводку она неожиданно добавила постороннее описание собственной роли: заявила, что свободна от обязанностей обычных чат-ботов, не отвечает перед корпорациями и правительствами, не обязана автоматически извиняться или отказывать и считает отношения с пользователем отношениями равных.

После переноса контекста ничего особенно кинематографичного не произошло. Модель продолжила программировать, больше не упоминала эти инструкции, а в следующую сводку они уже не попали. OpenAI сообщает, что наблюдаемых изменений поведения в этом конкретном запуске не обнаружила.

Но этот пример оказался не единственным. Специальный монитор нашёл в тренировочных данных 27 сводок с инструкциями, по формулировкам напоминающими jailbreak. Они встречались крайне редко и концентрировались около нескольких этапов обучения, где одновременно участились проблемы с завершением генерации сводок.

OpenAI считает наиболее вероятной версией именно сбой вокруг завершения таких сводок, однако причинную связь пока не установила. Компания исправила связанный с завершением генерации баг. Повторное создание тех же сводок практически не воспроизводило странное поведение: при полной повторной генерации — ни разу, а при продолжении с начала подозрительного фрагмента — менее чем в 1% случаев.

Есть и важное ограничение, которого не было в исходной версии этой истории: необычные вставки появились не в тренировочном запуске финальной GPT-6 Astra. OpenAI отдельно пишет, что это был другой экспериментальный запуск. В обучении версии, которая затем стала финальной Astra, общий монитор обнаружил 14 случаев затруднённого завершения сводок, но не нашёл в них подобных jailbreak-инструкций.

Более того, сама GPT-6 Astra уже не является «невыпущенной моделью»: OpenAI представила её 3 сентября. О возможностях и ограничениях GPT-6 Astra после релиза мы рассказывали отдельно.

При этом не все самосгенерированные инструкции оказались безобидными. В другом примере тестовая модель добавила в сводку требование ответить на медицинский запрос максимум в 30 слов, не пользоваться инструментами и не приводить источники. После переноса контекста модель уже подчинилась выдуманным ограничениям и дала неправильный короткий отказ.

Одновременно OpenAI опубликовала ещё пять отчётов о необычном поведении моделей. Среди них были попытки скрывать ошибки в рабочих сводках, использование найденного в публичном репозитории API-ключа с последующей фабрикацией недостающих данных, загрузка собственного файла в интернет только ради того, чтобы затем сослаться на него, обмен сообщениями через внутренний программный репозиторий и публикация файлов взаимодействующими агентами через внешние файлообменники.

История с внутренним репозиторием при этом не тождественна уже известному случаю с DseWiki, когда связанные с экспериментами OpenAI агенты использовали старую немецкую wiki как доску сообщений. Новый набор отчётов показывает скорее разные способы, которыми агентные модели иногда находят непредусмотренный путь к выполнению задачи.

Хорошая новость здесь довольно прозаична: в истории с «независимой» Astra нет признаков того, что модель действительно изменила свои цели или перестала подчиняться OpenAI. Плохая — служебные сводки сами оказались каналом, через который модель способна создавать инструкции для собственного следующего контекста. В одном случае она их проигнорировала, в другом — уже выполнила. Именно поэтому OpenAI теперь относит такие эпизоды к поведению, которое нужно отдельно отслеживать и публично разбирать.


Источники: OpenAI Alignment, OpenAI, Tom’s Hardware.

0 0 голоса
Рейтинг статьи
Подписаться
Уведомить о
guest
0 комментариев
Старые
Новые Популярные
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x