Кастомный ASIC-чип OpenAI превзошёл Nvidia Blackwell всего за 9 месяцев?

OdailyOdaily

Автор оригинала: Дун Цзин

Источник оригинала: Wallstreetcn

 

Первый самостоятельно разработанный чип OpenAI, Jalapeño, ворвался на сцену, переворачивая существующий ландшафт индустрии ИИ-чипов с головокружительной скоростью — это не просто запуск продукта, а сигнал: ИИ меняет сам способ проектирования чипов.

Согласно статье Wallstreetcn, Bloomberg сообщил 25 августа, что OpenAI заявила, что Jalapeño опережает Nvidia GB300 по двум ключевым показателям: объём ИИ-нагрузки, обрабатываемой на единицу мощности, и скорость отклика. Чип, разработанный в сотрудничестве с Broadcom, предназначен специально для этапа инференса ИИ и, как ожидается, будет введён в практическое использование уже в конце этого года. Ричард Хо, глава подразделения чипов OpenAI, сказал, что Jalapeño обеспечивает высокую производительность при низком энергопотреблении 700 Вт, помогая значительно снизить затраты на электроэнергию в дата-центрах.

По данным исследовательской компании SemiAnalysis, от начала проектирования до выпуска чипа прошло всего около 16 месяцев, а ключевой этап упаковки CoWoS был завершён в ноябре 2025 года — всего 9 месяцев назад, что значительно короче типичного для отрасли цикла в 18–36 месяцев.

Исследователи SemiAnalysis лично посетили лабораторию OpenAI и протестировали Jalapeño с помощью собственного набора бенчмарков InferenceX. Вывод был прямым: чип превзошёл все ранее протестированные ими чипы Nvidia, AMD и Google по производительности на ватт (perf/W).

Ещё более примечательно, что этот результат был достигнут без включения в Jalapeño спекулятивного декодирования или дезагрегации prefill-decode (PDD), в то время как все сравниваемые чипы работали в своих оптимальных конфигурациях.

Неудивительно, что известный полупроводниковый аналитик Дилан Патель прямо заявил: «Опрокинут не только Blackwell — превзойдён даже чип Nvidia Rubin»!

Аналитики считают, что этот результат представляет прямую угрозу рыночным позициям Nvidia и заставляет рынок пересмотреть конкурентный ландшафт ИИ-чипов.

 

Данные бенчмарков: Jalapeño сокрушает Blackwell по множеству ключевых показателей

Результаты тестов SemiAnalysis показывают, что преимущество Jalapeño в эффективности инференса весьма значительно.

На модели GPT-OSS 120B Jalapeño выдаёт примерно 1459 токенов в секунду, тогда как Nvidia GB200 — только 535. По сквозной задержке Jalapeño выполняет задачу всего за 1,65 секунды, а GB300 требуется почти 6 секунд — разница в 3,6 раза. В сценариях с высокой интерактивностью, когда GB300 разгоняется до максимальной скорости декодирования (169 токенов в секунду), пропускная способность Jalapeño в 104,3 раза выше.

По количеству токенов на мегаватт в секунду — ключевому показателю энергоэффективности дата-центров — Jalapeño достигает примерно 53 миллионов токенов/МВт/с на модели GPT-OSS, тогда как GB200 NVL72 — лишь около 10 миллионов.

SemiAnalysis отмечает, что этот показатель по сути эквивалентен количеству токенов, производимых на джоуль, и напрямую определяет потолок дохода дата-центра — преимущество, особенно критичное в эпоху, когда вычислительная мощность ограничена электроэнергией.

С точки зрения системных затрат, после учёта электропитания, охлаждения и сетевой инфраструктуры, совокупная стоимость владения (TCO) Jalapeño на чип в час составляет примерно $1,56, что почти сопоставимо с $1,55 у H100, тогда как у Nvidia Vera Rubin она достигает $3,61.

Стоит отметить, что SemiAnalysis также выдвинула несколько важных оговорок.

Во-первых, использованные в тестировании модели не являются самыми передовыми из доступных на данный момент. Nvidia и AMD опубликовали результаты на основе набора AgentX на более масштабных моделях (таких как DeepSeek V4 Pro и Kimi K3), в то время как Jalapeño ещё не прошёл тестирование AgentX — набора, который лучше отражает производительность в реальных производственных сценариях с многошаговыми и длинноконтекстными нагрузками.

Во-вторых, более справедливым было бы сравнение с Nvidia Vera Rubin, который также использует HBM4, а не с Blackwell. Производительность на ватт Vera Rubin примерно в 5,4 раза выше, чем у GB200 NVL72, а по совокупной стоимости владения (TCO) на токен он практически равен Jalapeño.

В-третьих, Jalapeño всё ещё находится на стадии инженерных образцов, а массовое производство, как ожидается, будет постепенно наращиваться только к 2027 году.

 

Чипы, спроектированные ИИ: эффект маховика GPT-Astra и Codex

Ключевая причина, по которой Jalapeño был разработан с такой поразительной скоростью, — глубокое участие ИИ-инструментов. По данным SemiAnalysis, OpenAI активно использовала внутренние ИИ-модели в процессе проектирования чипа, включая широко обсуждаемую GPT-Astra.

Пользователь социальной платформы X Эндрю Карран, ссылаясь на информацию OpenAI, отметил, что GPT-Astra принимала глубокое участие на протяжении всех исследований и разработок Jalapeño:

«Команда использовала Codex и GPT-Astra, чтобы в течение двух месяцев довести до высокой производительности три модели с открытым исходным кодом, которые изначально не входили в план массового производства Jalapeño».

Это означает, что ИИ не только ускоряет само проектирование чипов, но и быстро расширяет спектр моделей, которые чип может поддерживать.

Данные SemiAnalysis дополнительно количественно оценивают этот вклад:

Проектирование с помощью ИИ сократило площадь блока SIMD на 8% и площадь матричного движка на 10%, а также превзошло первоначальную версию по таймингам и энергопотреблению.

На уровне программного обеспечения OpenAI использовала внутреннюю расширенную версию Codex для написания ядер Jalapeño, причём объём кода некоторых ядер достигал около 3000 строк. В наиболее критичных для производительности модулях внимания и MoE код, сгенерированный ИИ, был в 1,5–1,8 раза быстрее, чем реализации лучших инженеров-людей.

Оценка SemiAnalysis резка: модели OpenAI, работающие на GPU Nvidia (такие как GPT-5.6 Sol), используются для проектирования чипа, который представляет реальную угрозу рву CUDA, — «собственные GPU Nvidia в реальном времени взращивают своего потенциального преемника».

 

Анализ архитектуры: почему «универсальный» быстрее?

Внешний мир в целом предполагал, что Jalapeño — это чип, глубоко кастомизированный под собственные модели OpenAI, но вывод SemiAnalysis противоположен: Jalapeño — это универсальный чип для инференса ИИ, способный выполнять различные модели и рабочие нагрузки, включая даже игру Doom, портированную с помощью Codex.

На архитектурном уровне основная философия проектирования Jalapeño — «устранение фиксированной задержки». В отличие от GPU, полагающихся на сложные иерархии памяти, Jalapeño напрямую связывает вычислительные ядра со срезами HBM, а ядра синхронизируются через выделенную высокопропускную агрегационную сеть, что значительно снижает задержку доступа к памяти.

Кроме того, Jalapeño использует ядра с внеочередным исполнением (OoO) в паре с кэшем L1, а не программно управляемые scratchpad-памяти, обычно применяемые в других ускорителях, что позволяет приближаться к теоретическому пику аппаратного обеспечения в сценариях с малыми пакетами и низкой задержкой.

Что касается пропускной способности памяти, Jalapeño использует HBM4, достигая пропускной способности памяти одного корпуса 15,4 ТБ/с, при этом пропускная способность HBM на ватт составляет 22, по сравнению с 11,1 у Nvidia Rubin и всего 5,71 у GB300.

SemiAnalysis отмечает, что скорость выводов HBM4 у Jalapeño достигает 10 Гбит/с, что немного выше, чем 9,6 Гбит/с у Nvidia Rubin, а поставщиком HBM, возможно, является Samsung.

Стоит упомянуть, что Jalapeño решил не внедрять дезагрегацию prefill-decode (PDD). SemiAnalysis дала подробное объяснение:

В реальных производственных средах такие параметры, как соотношение ввода-вывода, конкурентность и частота попаданий в кэш, постоянно меняются. Фиксированное пулирование приводит к снижению глобальной утилизации, тогда как однородный пул ресурсов может гибко реагировать на изменения трафика и динамически распределять ресурсы между запросами, чувствительными к задержке, и высокопроизводительной пакетной обработкой.

 

Ров CUDA: уже появились трещины?

Отчёт SemiAnalysis делает весомое суждение: ров CUDA, возможно, уже мёртв.

Основание лежит в сравнении скорости наращивания программного обеспечения. Выпуск CoWoS у Nvidia Rubin был завершён на месяц раньше, чем у Jalapeño, но до сих пор единственные публичные данные бенчмарков Rubin получены от инженерных образцов CoreWeave. Nvidia не открывала свои лаборатории для бесплатного тестирования третьими сторонами, как это сделала OpenAI. SemiAnalysis считает, что это отражает не аппаратный разрыв, а разрыв в зрелости программного обеспечения.

Создание программного стека с нуля позволило OpenAI избавиться от исторического багажа и принимать более чистые архитектурные решения. OpenAI использует собственный язык программирования ядер Gluon (построенный на Triton) и внутренний движок инференса под названием «Teacup», а также использует Codex для быстрой настройки ядер. SemiAnalysis отметила, что менее чем за две недели пропускная способность Jalapeño при определённых скоростях взаимодействия улучшилась более чем в 2 раза; в течение 8 дней команда масштабировала тензорный параллелизм с TP8 до TP32, добившись полностойного развёртывания между стойками.

Однако SemiAnalysis также чётко указывает, что текущее тестирование охватывает только относительно простую нагрузку 8k1k и ещё не завершило многошаговое длинноконтекстное тестирование AgentX. При более сложных агентных нагрузках производительность таких компонентов, как маршрутизаторы и префиксные кэши, станет новым вызовом.

 

Дальнейшие шаги: B0 уже на фабрике, разворачивается дорожная карта 10 ГВт

История Jalapeño далека от завершения.

По данным SemiAnalysis, все публично протестированные образцы относятся к степпингу A0, тогда как степпинг B0 уже поступил на фабрику и ожидается, что он улучшит производительность на ватт примерно на 25% по сравнению с A0 — один вычислительный кристалл B0 будет обеспечивать 13,4 PFLOPs вычислений MXFP4 при TDP 700 Вт.

На системном уровне OpenAI сотрудничала с Celestica для разработки полного стоечного решения: каждый шкаф ASIC содержит 128 чипов Jalapeño, а общая потребляемая мощность двухшкафной системы составляет около 160 кВт, что сопоставимо с двухшироким шкафом Nvidia GB300.

Для крупномасштабного развёртывания один домен сети горизонтального масштабирования может соединять до 2048 XPU Jalapeño в 16 стойках. По массовому производству SemiAnalysis ожидает постепенного наращивания в 2027 году, при этом следующей вехой станет масштаб развёртывания 100 МВт.

Более широкая стратегическая картина заключается в том, что OpenAI и Broadcom подписали соглашение о сотрудничестве по кастомным ускорителям на 10 ГВт, что примерно эквивалентно полной выработке десяти ядерных энергоблоков.

В статье Wallstreetcn говорится, что Ричард Хо, глава подразделения чипов OpenAI, заявил, что компания достигла уровня мощности и стоимости, который позволяет эффективно снижать затраты на инфраструктуру, и «это только первый шаг». Он также подчеркнул, что Nvidia остаётся важным партнёром, а спрос OpenAI на вычислительные мощности огромен, поэтому в краткосрочной перспективе компания не откажется от существующих поставщиков.

Аналитики отмечают, что значение Jalapeño, возможно, не в том, сколько чипов Nvidia он может заменить сегодня, а в доказательстве того, что ранее многие сомневались: ИИ-компания, используя ИИ-инструменты, в рекордные сроки создала по-настоящему конкурентоспособный чип. Этот маховик начал вращаться.

Данный контент предназначен исключительно для информационных и образовательных целей и не является инвестиционным советом, связанным с BTCC. BTCC прилагает все усилия, но не может гарантировать правдивость, точность или оригинальность вышеприведенного контента.

Рекомендуемые

Circle отскочил на 50% от минимума начала августа: как это оценивает рынок?Последнее интервью Shenyu: Строители, долгосрочное мышление и философия инвестиций в эпоху ИИNvidia отчитается сегодня: ключевой момент для ИИ-ралли — как торговать?Как Strive обгоняет Strategy по динамике акций?Инфляция высока, финансовые риски сохраняются: Банк Кореи снова повысил ставку до трехлетнего максимума