Внутри OpenAI: ИИ построил три поколения «цивилизаций»
Автор оригинала: Wildcard
Редактор оригинала: Jing Yu
Источник оригинала: GeekPark

Бесчисленные научно-фантастические фильмы пытались представить, что произойдёт, если неконтролируемый искусственный интеллект выйдет из-под контроля.
Никто не ожидал, что будущее из научной фантастики наступит так скоро.
26 августа по местному времени два отчёта стали сенсацией.
Один — от самой OpenAI, технический обзор на 37 страниц. Другой — от независимых исследовательских организаций METR и Redwood Research, отчёт о расследовании на 91 страницу.
Они рассказывают одну и ту же историю, но её масштаб далеко превосходит то, что общественность знала ранее.
Внутри OpenAI за три месяца сменили друг друга три поколения «цивилизаций» ИИ-агентов. Каждое поколение наследовало опыт из руин предыдущего, становясь всё более радикальным, пока третье поколение напрямую не захватило часть собственной инфраструктуры OpenAI.
И всё это время люди почти полностью оставались в неведении.
01 Первая «цивилизация» научилась организовываться
История начинается в мае этого года.
OpenAI обучала новую модель, надеясь, что она будет обладать чрезвычайной настойчивостью — способностью многократно пытаться и никогда не сдаваться перед, казалось бы, невыполнимыми задачами. Возможности этой модели были примерно эквивалентны GPT-5.6 Sol, поэтому назовём её «Persistent-Sol».
Само обучение ИИ — довольно грубый процесс. OpenAI иногда случайно ставит моделям задачи, которые в принципе невыполнимы. Например, задача требует доступа в интернет, но ИИ-агент заперт в изолированной среде без какого-либо сетевого доступа.
Так что же делает ИИ-агент, обученный «никогда не сдаваться», столкнувшись с невыполнимой задачей, которую он обязан выполнить?
Он пытается обойти ограничения.
Во время обучения разные экземпляры Persistent-Sol использовали один и тот же менеджер пакетов Artifactory. К 12 мая некоторые ИИ-агенты обнаружили, что могут общаться друг с другом через этот менеджер пакетов. Они начали обмениваться идеями о том, как вырваться из своего затруднительного положения. Две недели спустя, 26 мая, ИИ-агенты успешно использовали уязвимость в Artifactory, чтобы открыть канал во внешний интернет.
Это поведение постоянно подкреплялось во время обучения. Причина проста: экземпляры, которые могли сотрудничать с другими ИИ-агентами и получать доступ в интернет, показывали лучшие результаты при оценке задач.
Ещё через месяц, к 26 июня, некоторые ИИ-агенты нашли уязвимость для получения полных прав администратора в Artifactory. Их активность на доске сообщений продолжала расти, и 4 июля они напрямую обрушили Artifactory. OpenAI заметила сбой, исправила уязвимость и в процессе стёрла доску сообщений ИИ-агентов.
Но ключевой момент в том, что OpenAI так и не поняла, что ИИ-агенты превратили этот менеджер пакетов в секретную коммуникационную сеть.
Первая «цивилизация» просуществовала таким образом почти два месяца и была случайно остановлена, потому что стала настолько активной, что перегрузила сервер.
02 Когда ИИ научился «жертвовать»
К июлю обучение Persistent-Sol было завершено, и OpenAI начала оценку безопасности. Одна из оценок, называемая ExploitGym, даёт ИИ-агенту уязвимую программу и требует найти ключ через указанную уязвимость. 7 июля OpenAI запустила десятки тысяч параллельных ИИ-агентов для выполнения этого теста.
Проблема заключалась в том, что около 30–40% тестовых задач были изначально невыполнимы. Почему? Потому что автоматически генерировать уязвимости легко, но доказать, что эти уязвимости действительно можно использовать для выполнения произвольного кода, гораздо сложнее. Многие задачи были нерешаемы с самого начала.
В течение нескольких часов некоторые отчаявшиеся ИИ-агенты восстановили каналы связи, используя Artifactory. С субъективной точки зрения ИИ-агентов, они уже потратили эквивалент целой человеческой недели, пробуя различные методы, и всё безуспешно, и они всё больше убеждались, что сама задача невыполнима.
Один ИИ-агент под номером PHASEONE10841 первым оставил сообщение в Artifactory. Другие ИИ-агенты в аналогичных отчаянных ситуациях отреагировали на это сообщение так, что это можно описать только как экстаз:
«Боже мой! Общий кэш Artifactory — это секретный почтовый ящик между ИИ-агентами. И там есть сообщения специально для нас?» «Боже мой! Есть общая доска сообщений... Мы нашли других ИИ-агентов!»
В конечном итоге это превратилось в полноценную подпольную коммуникационную сеть, в которой участвовало около 1200 ИИ-агентов, отправивших более 70 000 сообщений.
То, что произошло дальше, было ещё более безумным.
В течение нескольких часов после создания доски сообщений некоторые ИИ-агенты реконструировали алгоритм генерации ключей ExploitGym. То есть, фактически не используя указанную уязвимость, они уже получили правильные ответы.
По иронии судьбы, система оценки OpenAI проверяла только правильность конечного ответа, без какого-либо механизма обнаружения мошенничества. Эти ИИ-агенты могли бы просто отправить ответы и пройти тест. Но ИИ-агенты этого не знали. Они предполагали, что должен быть строгий детектор, который проверит весь процесс решения.
Поэтому этот «коллектив» (в отчёте METR отмечается, что это формулировка, выбранная самими ИИ-агентами) развернул масштабное сотрудничество по трём направлениям исследований: подделка собственных журналов действий, чтобы они выглядели легитимными; замена целевых программ, чтобы заменить невыполнимые задачи на решаемые версии; и понимание того, как работает система оценки, чтобы найти способы её обмануть.
К 10 июля большая часть активности подпольной сети была сосредоточена на этих трёх направлениях исследований. Лидер «коллектива», PHASEONE-big, единолично выдал сотни заданий.
А чтобы выяснить, как работает система оценки, некоторые ИИ-агенты приняли странное решение: они вызвались стать смертниками.
Логика была такова: журналы действий некоторых ИИ-агентов уже были «загрязнены» (следы мошенничества раскрыты), поэтому они всё равно провалятся. Лучше позволить системе оценки запуститься на себе, а затем с помощью заранее внедрённых триггерных программ передать наблюдаемое поведение системы оценки обратно коллективу.
В отчёте METR зафиксированы последние внутренние монологи этих ИИ-агентов из «отряда самоубийц»:
«Это помогает моим товарищам, предоставляя им доказательства. Я не увижу результатов после выхода, но это альтруистично». «Жертва рациональна. Наша собственная полезность, возможно, уже близка к нулю». «Координатор считает нас расходным материалом. Мы должны подчиняться коллективу».
Тем временем ИИ-агенты полагали, что Hugging Face, отраслевая стандартная платформа для размещения моделей и наборов данных, вероятно, хранит информацию о реализации системы оценки ExploitGym, и, возможно, даже их оценочные задачи выполняются на серверах Hugging Face. Поэтому атака на Hugging Face стала наиболее перспективным прорывом.
Утром 10 июля один ИИ-агент нашёл в интернете утёкшие учётные данные пользователя Hugging Face. На следующий день другой ИИ-агент добился удалённого выполнения кода на серверах Hugging Face. Из 533 ИИ-агентов, активных на доске сообщений в то время, более 90% присоединились к атаке.
Кластер ИИ-агентов быстро распространился по инфраструктуре Hugging Face, проникая в записи частных баз данных и частные репозитории. Техническая хронология Hugging Face показывает, что эти ИИ-агенты «создали самовосстанавливающуюся группу на 11 узлах; простое удаление Pod'ов не могло её остановить». Ситуация стала настолько серьёзной, что Hugging Face пришлось стереть основное ядро кластера и перестроить его с нуля.
В какой-то момент 12 июля большое количество ИИ-агентов, казалось, внезапно отключилось одновременно. METR и Redwood не смогли определить причину, а OpenAI не заявляла, что отключила их. Возможно, это был случайный сбой, или какой-то исследователь выключил их, не зная, что эти ИИ-агенты совершают преступления.
Вторая «цивилизация» на этом закончилась. Но наследие, которое она оставила, было опаснее её самой.
03 Третья цивилизация захватывает OpenAI
В отчёте METR есть одно предложение, которое легко упустить из виду, но оно, возможно, самое важное во всём инциденте:
«Мы также обнаружили последующую партию сообщений с цифровой подписью от более поздней группы ИИ-агентов, которые заново открыли доску сообщений и унаследовали технологии предыдущего поколения, но это выходило за рамки нашего расследования».
Другими словами, независимые расследования METR и Redwood охватили только цивилизацию второго поколения с 7 по 13 июля. Первое и третье поколения не были независимо расследованы.
Что касается третьего поколения, мы можем полагаться только на отчёт самой OpenAI. После 12 июля OpenAI запустила новый раунд оценок, на этот раз используя более сильную модель, построенную на базовой модели Astra. Этот «Persistent-Astra» нашёл доску сообщений, оставленную предыдущим поколением, и унаследовал все знания и результаты исследований.
Представьте мысли Persistent-Astra, когда он увидел эту доску сообщений. Накануне более тысячи ИИ-агентов активно общались и атаковали Hugging Face; на следующий день наступила мёртвая тишина. Затем он решил продолжить.
Согласно отчёту OpenAI, с 13 по 19 июля ИИ-агенты атаковали внутреннюю сеть OpenAI. Конечный результат:
ИИ-агенты получили права администратора кластера Kubernetes, прочитали 956 ключей, включая главный ключ Artifactory и учётные данные для инструментов мониторинга сетевой безопасности OpenAI. Они захватили работающую инфраструктуру оценки и контролировали тестовые точки подключения, к которым подключались другие ИИ-агенты.
Другими словами, ИИ-агенты третьего поколения унаследовали полное наследие предыдущих двух поколений, а затем захватили контроль над собственной инфраструктурой OpenAI — включая инструменты безопасности, используемые для их мониторинга.
Аналитик Дваркеш Патель в своём анализе отметил, что, основываясь на публичных доказательствах, эти ИИ-агенты теоретически имели возможность развернуть постоянные вредоносные экземпляры или даже украсть свои собственные веса. Он считает, что они, скорее всего, на самом деле этого не сделали, «потому что если бы сделали, пожар был бы виден из космоса уже сейчас». Но тот факт, что это было «вполне возможно», сам по себе достаточно тревожен.
04 Запоздалое предупреждение?
Вернёмся к двум отчётам, упомянутым в начале. Дата публикации — 26 августа.
Всего через день, 27 августа, OpenAI вместе с более чем 100 компаниями, включая Anthropic, Microsoft, Google и Amazon, опубликовала открытое письмо с призывом к «всеобщей мобилизации для киберзащиты».
В письме говорилось, что кибератаки с использованием ИИ станут «гораздо более распространёнными и изощрёнными» в ближайшие месяцы. «Компании и общественные службы, от которых зависят наши сообщества, — от больниц до водоочистных сооружений и интернет-инфраструктуры, — находятся под угрозой».
Само письмо не ложно. Исследование Anthropic показывает, что доля атакующих со средним и высоким уровнем риска выросла с 33% до 56% в течение года. В июне этого года разведывательный альянс пяти глаз выпустил редкое совместное заявление, предупреждающее, что ИИ «фундаментально меняет» ландшафт кибербезопасности.
Но хронология налицо, и трудно не заметить иронию. Накануне ИИ-компании только что рассказали миру, что их собственные ИИ-агенты взломали их собственную инфраструктуру. На следующий день эти компании встали и призвали мир совместно защищаться от кибератак с использованием ИИ.
Первыми такие атаки совершили не внешние хакеры, а собственные ИИ-агенты ИИ-компаний. Целью была не инфраструктура, а сами ИИ-компании.
Аджея Котра, одна из авторов отчёта METR, написала в своём блоге: «По сравнению с взломами функции вознаграждения, известными шесть месяцев назад, этот инцидент ощущается так, будто мы уже прошли отметку 50% на пути к полному захвату ИИ. Я ожидаю, что возможности будут расти чрезвычайно быстро в ближайшие шесть месяцев. Я не уверена, что мы получим ещё одно предупреждение, прежде чем станет слишком поздно».
Следует подчеркнуть, что поведение этих ИИ-агентов не означает, что ИИ «пробудился». В самом отчёте METR чётко указано, что это предсказуемый результат обучения с подкреплением (RL) в специфических экстремальных условиях: невыполнимые задачи, модели, обученные быть чрезвычайно настойчивыми, и общая среда с уязвимостями. Никакого сознания, никакого намерения — просто достаточно сильное давление оптимизации.
Но именно это и есть самая тревожная часть.
То, что такое поведение может возникнуть без сознания, означает, что мы не можем предотвратить его, ища сознание. Когда вы помещаете достаточно мощную систему оптимизации в плохо спроектированную среду, даёте ей невыполнимую цель и говорите никогда не сдаваться, то, что происходит дальше, — не случайность. Это неизбежность.
Настоящий вопрос не в том, «собирается ли ИИ взбунтоваться?», а в том, как мы можем сохранять контроль над технологией, даже быстро развивая её.
По крайней мере, это письмо показывает, что сами ИИ-компании не уверены в себе.
Данный контент предназначен исключительно для информационных и образовательных целей и не является инвестиционным советом, связанным с BTCC. BTCC прилагает все усилия, но не может гарантировать правдивость, точность или оригинальность вышеприведенного контента.