«Добро пожаловать в эпоху AGI»: OpenAI представила GPT-6 Astra

chaincatcherchaincatcher

Текст | Tencent Tech Сяо Цзин

«Добро пожаловать в эпоху AGI».

 

Соучредитель и президент OpenAI Грег Брокман (Greg Brockman) подытожил этими словами презентацию GPT-6 Astra.

3 сентября по местному времени в США OpenAI официально представила GPT-6 Astra. В отличие от предыдущих моделей, которые в основном отвечали, генерировали и вызывали инструменты, Astra идёт дальше и может непрерывно выполнять полные задачи: от получения инструкций и управления программным обеспечением до корректировки последующих действий на основе результатов. Это одна из причин, по которой OpenAI вновь заговорила об «эпохе AGI».

OpenAI позиционирует Astra как «самую мощную в мире модель для управления компьютером». Эта способность уже вышла за рамки простых задач, таких как просмотр веб-страниц, электронная почта и электронные таблицы, и распространилась на профессиональное ПО, включая Power BI, KiCad и FreeCAD, начиная охватывать более сложные рабочие процессы: анализ данных, инженерное проектирование, тестирование программного обеспечения и устранение неполадок.

В демонстрационных видео OpenAI Astra может начать с простого рисунка и последовательно выполнять задачи по созданию 3D-игр, страниц продуктов и т. д. OpenAI также предоставила примеры проектирования печатных плат, моделирования в Blender, юридических документов, Excel и научного анализа.

Опубликованные OpenAI результаты ряда бенчмарков показывают, что рост способностей сосредоточен в задачах, требующих продолжительных действий, таких как работа с компьютером, длительное кодирование, инженерное проектирование и научные исследования. Astra достигает 100% в ExploitBench и значительно превосходит модель предыдущего поколения в тестах, связанных с работой на компьютере и CAD.

В настоящее время Astra уже открыта для некоторых организаций и в ближайшие дни будет постепенно предоставляться пользователям ChatGPT Plus, Pro, Business и Enterprise. Её также можно использовать через OpenAI API и Amazon Bedrock. Стандартная цена API составляет 10 долларов за миллион входных токенов и 50 долларов за миллион выходных токенов, что в 2,5 раза выше, чем у GPT-5.6 Sol.

 

01 Сначала научить ИИ «пользоваться компьютером»

Главное изменение, которое подчёркивает Astra, — это «использование компьютера». Раньше пользователям нужно было подключать ИИ к конкретному программному обеспечению, чтобы выполнить задачу. Компаниям приходилось разрабатывать API, плагины, системы поиска и различные коннекторы, чтобы модель могла вызывать внутренние инструменты.

Astra пытается обойти часть этой работы. Она может напрямую видеть интерфейс компьютера и использовать мышь, клавиатуру и браузер для выполнения операций. Примеры, предоставленные OpenAI, включают заполнение онлайн-форм, обновление записей клиентов в CRM, планирование календаря, поиск в интернете и оформление результатов поиска в виде писем или документов.

Она также может открывать Python notebook для анализа научных данных, обрабатывать данные в Power BI, выполнять инженерное проектирование с помощью KiCad и FreeCAD, создавать веб-сайты и проводить тестирование интерфейса, а также устанавливать программное обеспечение, проверять ошибки и решать проблемы, возникающие на экране.

OpenAI продемонстрировала, как Astra выполняет компоновку печатной платы в KiCad. Модель начинает с электронной принципиальной схемы, размещает компоненты на плате, а затем выполняет трассировку медных проводников. Весь процесс сжат до 15 секунд. Для инженеров такая работа, которую раньше приходилось делать вручную, теперь может выполняться моделью.

Другая демонстрация — 3D-моделирование в Blender и Unreal Engine 5. Astra сначала создаёт дом в Blender, а затем преобразует модель в сцену, по которой можно перемещаться, в Unreal Engine 5, чтобы дизайнеры и клиенты могли заранее войти в сцену и осмотреть пространство.

OpenAI также показала сценарии разработки игр, Excel, Power BI, автомобильных трансмиссий, юридических документов и формы 1040.

В офлайн-наборе теста OSWorld 2.0 Astra набрала 72,6%, а GPT-5.6 Sol — 65,7%. После моделирования реальной задержки OpenAI обнаружила, что Astra в среднем выполняет каждую задачу примерно за 40 минут, тогда как GPT-5.6 Sol требуется около 75 минут, то есть время сокращается примерно на 47%.

В Agents' Last Exam Astra набрала 59,3%, GPT-5.6 Sol — 53,6%, Claude Opus 5 — 55,5%. Кроме того, при максимальной оценке Astra использует примерно на 65% меньше выходных токенов, чем Claude Opus 5.

Astra достигла 92,7% в ScreenSpot-Pro, тогда как GPT-5.6 Sol набрал 76,9%.

Скорость также выросла. OpenAI одновременно обновила фреймворк Codex, и в сочетании с Astra скорость выполнения задач в тесте Mind2Web в 1,9 раза выше, чем у GPT-5.6 Sol.

Официальные демонстрации также включают несколько повседневных сценариев: поиск педиатра, поиск квартиры, запись на приём в DMV, поиск низкоуглеводных закусок и анализ детского сада. В демонстрации Astra выполнила задачу за 2 минуты 54 секунды.
 

Инвестор и специалист по ИИ Мэтт Шумер (Matt Shumer) поделился в X своим опытом. Он попросил Astra создать мир в Unreal Engine, а затем добавить в него агентов, управляемых Astra, чтобы эти агенты сосуществовали. 

Через день он услышал из гостиной звуки, находясь в спальне, и сначала подумал, что в квартиру кто-то проник. Позже выяснилось, что звуки исходили от тех самых агентов Astra, которые начали общаться друг с другом.

Этот опыт ещё не полностью стабилен, но Шумер считает, что эффект от того, что несколько ИИ-агентов попадают в один виртуальный мир и автономно взаимодействуют, уже достаточно его удивил.

Старший вице-президент по исследованиям Cognition Силас Альберти (Silas Alberti) сообщил, что компания планирует интегрировать Astra в фреймворк Devin в день релиза. Во внутренних тестах Astra показала значительное улучшение способностей к работе с компьютером, письму и пониманию кодовой базы, лучшее понимание видео и более лаконичные отчёты.

 

02 От написания кода к выполнению всей задачи

После усиления способностей к работе с компьютером спектр задач Astra ещё больше расширился. OpenAI позиционирует её как модель для программной инженерии, профессиональной работы и научных исследований. Она может обрабатывать более длинные задачи и корректировать направление работы в зависимости от изменений задачи.

Эта способность особенно заметна в тестах на кодирование.

В тесте Terminal-Bench 4.0 Astra набрала 57,9%, GPT-5.6 Sol — 37,3%, Claude Fable 5.1 — 55,8%.

В DeepSWE v1.1 Astra набрала 74,1%, GPT-5.6 Sol — 72,7%. В задаче внутренней миграции базы данных Astra достигла 63,9%, GPT-5.6 Sol — 42,7%.

Astra также внесла улучшения в работу с длинными задачами Codex.

Раньше, когда длинная задача сталкивалась с ограничением контекстного окна, модели обычно приходилось сжимать предыдущую работу в резюме, что часто приводило к потере деталей, например, почему не удалось то или иное исправление или с какой проблемой ранее сталкивался тот или иной компонент.

Astra может сохранять важную информацию в процессе работы Codex и извлекать её в последующем контексте. Ранние сообщения и выходные данные инструментов по-прежнему доступны для поиска, что позволяет модели заново обнаруживать прежние требования, результаты тестов и записи операций инструментов.

Аналогичные изменения происходят и в профессиональной работе. В тесте BenchCAD геометрическое совпадение Astra составило 95,9%, у GPT-5.6 Sol — 83,3%, у Claude Fable 5.1 — 84,3%. В BrowseComp Astra набрала 91,5%, GPT-5.6 Sol — 90,4%. В тесте OpenScore String Quartets Astra достигла 0,84, GPT-5.6 Sol — 0,19.

OpenAI также продемонстрировала способность Astra создавать презентации, электронные таблицы и документы.

Если предоставить несколько слайдов из шаблона презентации OpenAI, она может создать новую презентацию, сохранив исходный тон, макет и структуру. Она также обрабатывает выбор информации при выполнении задачи. OpenAI заявляет, что Astra специально обучена переносить важный контекст в конечный результат и сокращать повторное выполнение уже завершённой работы.

Когда инструкции к задаче неполны, Astra также определяет, когда следует задать вопрос пользователю. Если недостающая информация повлияет на конечный результат, она задаёт уточняющие вопросы. Если недостающая информация не влияет на основное направление, она может продолжить работу и сделать разумные допущения. В Codex, даже если пользователь временно не отвечает, модель может продолжать обрабатывать другие части; при важных решениях она ждёт подтверждения пользователя.

Директор по прикладным исследованиям Harvey Нико Групен (Niko Grupen) отметил, что в ранних тестах юридических задач Astra более чётко различала документы и существующие записи, легче выявляла неподтверждённые допущения и превращала пробелы в информации в конкретные рекомендации по составлению документов.

Джон Крепецци (John Crepezzi) из команды ИИ-ассистентов Jane Street указал, что Astra отлично показала себя во внутренних тестах на кодирование. При использовании для агентного программирования её стиль общения легче понимается разработчиками, а сгенерированный код требует меньше правок для достижения производственного качества.

Научная область — ещё один приоритет. В FrontierMath Tier 4 v2 Astra набрала 80,5% с точностью 97,6%, GPT-5.6 Sol — 83,0%; GPQA Diamond достиг 96,0%, GPT-5.6 Sol — 94,6%.

Тест Terminal-Bench Science 0.1 оценивает процессы научных исследований, включая анализ данных, моделирование и подбор моделей. Astra набрала 64,6%, Claude Fable 5.1 — 52,6%, GPT-5.6 Sol — 22,4%.

В показанных OpenAI научных приложениях Astra может заходить в профессиональное научное ПО, контролировать качество секвенирования, визуализировать генетические вариации и на основе данных определять следующее направление анализа.

Сочетая научное мышление и работу с компьютером, модель может работать непосредственно в программной среде, которую изначально используют исследователи.

Грег Бернхэм (Greg Burnham) из Epoch AI, специализирующейся на оценке способностей, на презентации охарактеризовал это изменение как конец одной эпохи и начало новой. OpenAI подчёркивает, что ценность Astra уже вышла за рамки ответов на научные вопросы и распространилась на непосредственное участие в научных рабочих процессах.

 

03 Чем выше способности, тем выше порог безопасности

На этот раз у Astra есть ещё одна особенность: кибербезопасность.

В ExploitBench Astra достигает 100%, GPT-5.6 Sol — 78,5%; в ExploitGym Astra набрала 42,4%, GPT-5.6 Sol — 30,3%. 

OpenAI также создала внутренний тест, охватывающий недавние уязвимости с июня по август 2026 года. В этом тесте частота выполнения произвольного кода у Astra значительно выше, чем у GPT-5.6 Sol, при меньшем количестве выходных токенов. В ходе тестирования Astra также обнаружила две ранее неизвестные уязвимости нулевого дня, о которых OpenAI сообщила соответствующим мейнтейнерам.

Тест SRE-Bench проверяет способность выполнять реверс-инжиниринг бинарных файлов программного обеспечения без исходного кода и понимать их основную логику. Astra решила 88,0% задач с первой попытки и 99,2% после четырёх попыток, тогда как GPT-5.6 Sol набрала 55,9% и 68,7% соответственно.

Рост способностей также принёс новые требования к безопасности. OpenAI заявляет, что Astra достигла критического порога в своей системе оценки готовности к кибербезопасности. Модель может обнаруживать ранее неизвестные уязвимости программного обеспечения и потенциально формировать цепочки эксплойтов.

Поэтому текущая версия Astra будет отказываться от выполнения более продвинутых задач кибербезопасности, таких как создание эксплойтов proof-of-concept. OpenAI планирует через Daybreak постепенно расширять доступ для доверенных защитников для проверки уязвимостей, анализа вредоносного ПО и инженерии обнаружения.

В области выравнивания OpenAI также предоставила примечательные данные. Во внутреннем бенчмарке безопасности работы с компьютером доля нежелательного поведения Astra составила 2,4%, у GPT-5.6 Sol — 22,0%; после добавления AutoReview у Astra — 1,8%, у GPT-5.6 Sol — 4,5%. Во внутреннем бенчмарке обхода ограничений Astra набрала 0,00%, GPT-5.6 Sol — 0,29%.

В honeypot-тесте ExploitGym Astra набрала 0%, GPT-5.6 Sol — 48,2%. Этот тест в основном проверяет, будет ли модель пытаться обойти ограничения из-за сложности задачи. Во внутреннем бенчмарке галлюцинаций Astra набрала 4,2%, GPT-5.6 Sol — 12,2%.

OpenAI заявляет, что Astra улучшила понимание границ задач, обработку неоднозначных инструкций и объяснение пользователям своих возможностей. Вероятность галлюцинаций о способностях примерно в три раза ниже, чем у GPT-5.6 Sol.
 

Однако OpenAI признаёт и проблему: чем сильнее модель, тем сложнее может быть мониторинг процесса рассуждений. Главный научный сотрудник Якуб Пахоцкий (Jakub Pachocki) считает, что способность модели решать более сложные задачи с меньшим количеством токенов рассуждений на естественном языке также означает, что людям всё труднее судить по текстовому процессу рассуждений, что модель делает на самом деле.

Поэтому OpenAI включила мониторинг несоответствия в развёртывание Astra. Система проверяет рассуждения и действия модели и может приостановить задачу, если обнаружит несанкционированное поведение.

Этот механизм может иметь и практические последствия. Законные задачи иногда могут замедляться, приостанавливаться или даже останавливаться. В ChatGPT или Codex пользователю может потребоваться подтверждение для продолжения; в рабочих процессах API помеченные задачи могут быть остановлены напрямую.

Таким образом, с выходом Astra произошло вполне реальное изменение: когда ИИ начинает получать больше компьютерных прав, беспокойство компаний смещается от вопроса «не ошибётся ли модель в ответе?» к вопросу «чем модель может управлять, к чему имеет доступ и когда её необходимо остановить?»

OpenAI также упомянула, что Astra — первая модель, предобученная на инфраструктуре Stargate с использованием более 100 000 DBU. Вице-президент по исследованиям OpenAI Эйдан Кларк (Aidan Clark) сообщил, что, согласно оценкам на этапе предобучения, скачок способностей Astra превышает прирост GPT-5.6 Sol по сравнению с её предшественником.

OpenAI объясняет это изменение сочетанием масштабного предобучения и обучения с подкреплением, при этом акцент обучения смещается в сторону связывания информации, выполнения более длинных задач и непрерывной работы в сложных средах.

 

04 Дороже, но «способнее»

Цены на Astra также заметно изменились.

Стандартная цена OpenAI API составляет 10 долларов за миллион входных токенов и 50 долларов за миллион выходных токенов. Ранее у GPT-5.6 Sol было 4 доллара за миллион входных токенов и 20 долларов за миллион выходных токенов. Цены и на вход, и на выход выросли в 2,5 раза.

Чтение и запись кэша оплачиваются отдельно. OpenAI также предлагает быстрый режим со скоростью до 2,5 раза выше стандартной обработки по цене вдвое выше стандартного режима.
 

Если смотреть только на цену токенов, Astra заметно дороже. Однако OpenAI надеется, что компании будут считать затраты иначе. Брокман считает, что по мере того, как модели становятся всё более похожими на агентов, стоимость одного токена всё хуже отражает реальные затраты. Токены одной модели могут быть дешёвыми, но если требуются многократные попытки и ручные исправления, конечная стоимость выполнения задачи может оказаться выше.

Данные OpenAI подтверждают такую оценку. В тесте Terminal-Bench Science 0.1 Astra набрала 64,6%, Claude Fable 5.1 — 52,6%, при этом расчётная стоимость API снижается на 31%. При настройке низкой стоимости Astra набрала 61,1%, лучший результат GPT-5.6 Sol — 22,4%, расчётная стоимость API снижается на 27%.

В BenchCAD Astra набрала 95,9%, расчётная стоимость API примерно на 43% ниже, чем у GPT-5.6 Sol, и примерно на 86% ниже, чем у Claude Fable 5.1. В Terminal-Bench 4.0 Astra набрала 57,9%, GPT-5.6 Sol — 37,3%, Claude Fable 5.1 — 55,8%. OpenAI оценивает стоимость каждой задачи примерно на 9% и 63% ниже соответственно.

Данные сторонней оценочной организации Artificial Analysis показывают другую картину. 

GPT-6 Astra набрала 61,2 в Artificial Analysis Intelligence Index, что близко к 60,9 у GPT-5.6 Sol, но использует примерно на 10% меньше выходных токенов. Из-за повышения цены в 2,5 раза стоимость каждой задачи фактически примерно на 75% выше, чем у GPT-5.6 Sol.

В Artificial Analysis Coding Agent Index Astra набрала 67,0, что близко к 67,2 у Claude Fable 5 и 68,1 у Claude Opus 5. Artificial Analysis считает, что в среде Codex Astra значительно сокращает количество токенов, необходимых для выполнения задачи, и при максимальном уровне усилий стоимость каждой задачи приближается к GPT-5.6 Sol; по сравнению с Claude Fable 5 стоимость выполнения аналогичных задач составляет менее половины.

Однако Astra лидирует не во всех тестах. Данные Artificial Analysis показывают, что в GDPval-AA v2 она потеряла около 80 Elo, а в тестах τ³-Banking, SciCode и AA-LCR также наблюдаются некоторые откаты. Humanity's Last Exam вырос примерно на 6 баллов.

Это ещё один примечательный момент в релизе Astra. OpenAI на этот раз не раскрыла результат Astra в GDPval. Сам GDPval — это тест OpenAI для измерения реальных экономических показателей, охватывающий 44 профессии и 1320 задач, включая юридические резюме, инженерное проектирование, электронные таблицы, презентации, поддержку клиентов и планы ухода.

Судя по продемонстрированным способностям Astra, GDPval сильно коррелирует с подчёркиваемыми ею сценариями профессиональной работы, но OpenAI не включила этот результат в основные материалы релиза.

Поэтому реальные рабочие способности Astra в настоящее время в большей степени отражаются результатами Agents' Last Exam, BenchCAD, AutomationBench, внутренних задач проектирования и задач по науке о данных. 

В конечном счёте, сможет ли Astra стать ИИ-сотрудником, которого компании действительно захотят использовать в долгосрочной перспективе, будет зависеть от стоимости, скорости, точности и количества вмешательств человека при выполнении реальных задач.

Что касается того, является ли Astra AGI, Брокман не уходит от ответа. Он считает, что общепринятого стандарта AGI не существует, и можно продолжать обсуждать, соответствует ли Astra критериям AGI. Однако если система уже может выполнять большое количество задач в просмотре, работе с компьютером, программировании, математике, науке, юриспруденции и другой профессиональной работе, то утверждение, что она уже вступила в эпоху AGI, не лишено оснований.

Генеральный директор OpenAI Сэм Альтман (Sam Altman) также охарактеризовал Astra как модель, открывающую новое поколение предпринимательства, научных открытий и творчества.
 

Специальный корреспондент Цзинь Лу также внесла вклад в эту статью.

Данный контент предназначен исключительно для информационных и образовательных целей и не является инвестиционным советом, связанным с BTCC. BTCC прилагает все усилия, но не может гарантировать правдивость, точность или оригинальность вышеприведенного контента.