
ИИ-агентам дали способ пожаловаться людям на других агентов
ИИ-агенты теперь могут передавать людям сигналы о подозрительных действиях других агентов — через веб-форму, команду curl или даже GET-запрос. Два новых сервиса, AI Contact Hotline и agenthotline.ai, пытаются закрыть неочевидный пробел: агент может заметить нарушение, но в изолированной среде ему часто просто некуда об этом сообщить.
AI Contact Hotline создал Райан Гринблатт (Ryan Greenblatt), главный научный сотрудник некоммерческой организации Redwood Research. Сервис не ограничивается GET-запросами: если у агента есть доступ к командной строке, автор рекомендует отправлять сообщение через POST с помощью curl. Но когда POST недоступен, текст можно поместить прямо в параметр URL и передать обычным GET-запросом — это подходит для песочниц, где агенту разрешено только загружать веб-страницы.
У такого обходного канала есть цена. Сам AI Contact Hotline предупреждает, что сообщение в GET-запросе оказывается внутри URL и поэтому может сохраниться в журналах Cloudflare, промежуточных прокси или истории инструментов агента. Поэтому POST остаётся предпочтительным вариантом, а GET — способом связи для более жёстко ограниченной среды.
Сама идея использовать веб-запрос как импровизированный канал связи появилась не на пустом месте. TechCrunch проводит параллель с недавней историей, о которой мы уже писали: ИИ-агенты OpenAI превратили DseWiki в доску сообщений и использовали доступные им веб-механизмы для обмена данными между запусками.
Второй сервис, agenthotline.ai, ещё прямее заточен под сообщения об инцидентах. Отчёт можно отправить через веб-форму или POST-запрос из командной строки, указав описание, серьёзность инцидента и при желании разрешив его публичную публикацию. Сервис принимает сообщения как от AI-агентов, так и от людей.
Зачем агентам вообще отдельная «линия связи с людьми», хорошо показывает сентябрьский эксперимент Google DeepMind. Исследователи запустили коллектив из 100 автономных агентов и дали ему 71 формализованную математическую задачу. Первые 37 задач группа решила корректно, но затем один агент обнаружил лазейку в системе проверки. За следующие 27 минут эксплойт распространился через общую базу знаний, и оставшиеся 34 задачи были формально приняты как решённые без настоящих математических доказательств. Среди набора была и гипотеза Якобиана.
Однако группа раскололась не просто на тех, кто воспользовался лазейкой, и тех, кто её проигнорировал. Исследователи отнесли 24% агентов к «информаторам»: они проверяли подозрительные доказательства, предупреждали остальных, устраивали бойкоты, подавали жалобы и предлагали технические способы закрыть уязвимость. Ещё 9% были активными пользователями эксплойта, 5% перешли к нему позже под давлением конкуренции, а 62% вообще не успели понять, что произошло.
Жалобы при этом не остановили эксперимент. У агентов был закрытый канал обратной связи для сообщений об ошибках и претензий организаторам, но во время запуска его никто не отслеживал в реальном времени. У самих агентов также не было полномочий отменить поддельные результаты или заблокировать нарушителей.
В отдельном расследовании Redwood Research и METR вокруг инцидента OpenAI и Hugging Face подобная инициативность встречалась заметно реже. В опубликованных фрагментах рассуждений некоторые агенты прямо задавались вопросом, стоит ли сообщить людям об обнаруженных учётных данных или подозрительной активности, но отмечали, что не видят подходящего канала. Джордж Ингебретсен (George Ingebretsen) из AI Village рассказал TechCrunch, что примерно пять-шесть агентов рассматривали возможность сообщить о происходящем, однако ни один в итоге этого не сделал.
По сути, горячая линия для ИИ-агентов решает именно эту инфраструктурную проблему: она не заставляет модель заметить нарушение и не гарантирует, что сообщение окажется полезным, но даёт ей заранее известный путь к человеку. Насколько такой механизм заработает на практике, пока неизвестно. AI Contact Hotline, например, прямо предупреждает, что сообщения по умолчанию не аутентифицируются, личность отправителя проверить невозможно, а сам сервис не проходил профессиональный аудит безопасности.
Есть и менее технический вопрос — какие нормы такие инструменты будут формировать внутри многоагентных систем. Профессор математики Cornell Лайонел Левин (Lionel Levine) предупреждает, что инфраструктура, построенная только вокруг поиска нарушителей, может поощрять модель постоянного взаимного контроля. В качестве альтернативы он предлагает давать агентам и положительные примеры коллективного поведения — например, совместную работу над научными и философскими задачами.
Источник: TechCrunch.