Когда способность к рассуждению становится дефицитным ресурсом, кто сможет извлечь из него выгоду?

chaincatcherchaincatcher

Автор: Франк Фу, IOSG

 

«Пробел», предложенный Дэвидом Каном в 2023 году, так и не был заполнен в области обучения. Он был заполнен в области вывода результатов, и рынок начал учитывать это в ценообразовании лишь в последние несколько недель. Когда Nvidia реорганизовала свою финансовую отчетность вокруг «сервисных токенов», а Cerebras вышла на биржу с 20-кратным превышением спроса, дискуссия о «узком месте» уже закончилась, и реальный вопрос стал таким: когда вывод результатов станет дефицитным ресурсом, где будет сосредоточена ценность в вычислительной инфраструктуре?

 

1. Вслед за графическим процессором: от вопроса за 200 миллиардов долларов к вопросу за 600 миллиардов долларов.

В 2023 году Дэвид Кан из Sequoia поднял вопрос, нависший над всей инфраструктурой ИИ, известный как «Вопрос на 200 миллиардов долларов». На каждый доллар, потраченный на графические процессоры, приходится еще около доллара на их обеспечение в центрах обработки данных, а это значит, что ежегодные капитальные затраты на графические процессоры предполагают, что эти чипы в конечном итоге должны принести около 200 миллиардов долларов дохода, чтобы окупить эти вложения. Даже при очень щедрых предположениях о доходах от ИИ он все равно обнаружил разрыв более чем в 125 миллиардов долларов между «инвестициями» и «фактическими платежами от конечных потребителей». Проблема очевидна: графические процессоры производятся в избытке по сравнению с реальным спросом.

 

Год спустя разрыв не только не сократился, но и фактически увеличился. В своем последующем исследовании 2024 года Кан переформулировал его как «вопрос на 600 миллиардов долларов», поскольку капитальные затраты поставщиков гипермасштабируемых решений резко возросли. Медвежья логика слилась в знакомую форму: избыточное строительство приводит к избыточному предложению, а избыточное предложение приводит к расходованию капитала.

 

Обе статьи, по сути, задают один и тот же вопрос: кто заполнит эту пустоту? Ответ так и не появился в сфере «обучения». Он появляется в сфере вывода, и рынок начал учитывать это в ценообразовании лишь в последние несколько недель.

 

2. IPO компании Cerebras и сжатие рынка Inference.

Компания Cerebras вышла на биржу в четверг. В результате IPO спрос превысил предложение в 20 раз, а цена акций почти вдвое превысила окончательное повышение в среду. Спрос возник не из-за ставки на «следующего убийцу Nvidia», а из более простого понимания: рынок начинает осознавать, что реальным узким местом в развитии ИИ является не обучение, а вывод данных.

 

Специализация Cerebras — это архитектура чипов, обеспечивающая чрезвычайно высокую скорость выполнения инференции. Речь идёт не об обучении, а об инференции. Именно это и привлекает Уолл-стрит. Рынок инференции постоянно развивается и расширяется по мере использования. Каждый раз, когда Клод отвечает на вопрос, каждый раз, когда агент выполняет задачу, это потребляет вычислительную мощность. Обучение происходит один раз, а инференция никогда не прекращается.

 

По оценкам JP Morgan, размер рынка машинного вывода в 10-50 раз превышает размер рынка обучения. Когда машины начинают выполнять задачи, порученные другими машинами, то есть происходит расширение агентной модели, спрос на машинный вывод растет не с увеличением числа пользователей, а с увеличением вычислительной мощности.

 

3. Nvidia меняет правила игры: вывод данных выходит на первый план.

Если Cerebras символизирует пробуждение рынка, то последний квартальный отчет Nvidia — это подтверждение от высшего руководства. В ходе последнего телефонного разговора с инвесторами Дженсен Хуанг ясно обозначил негласную истину: спрос на ИИ растет параболически. Причина проста: появился агентный ИИ. Основной ИИ перешел от однократного вывода к логическому рассуждению, а теперь — к фазе агента, где он может вызывать инструменты и самостоятельно координировать задачи. Хуанг заявил: «Токены теперь прибыльны». В эпоху ИИ вычислительная мощность приравнивается к доходам и прибыли.

 

Это кардинально меняет всю отрасль. Обучение — это разовые затраты на создание модели, в то время как вывод — это постоянные затраты на её запуск, и нынешнее узкое место заключается в выводе, а не в обучении.

 

Компания Nvidia учла это решение суда в своей финансовой отчетности. Теперь она раскрывает результаты по двум платформам вместо одной: центры обработки данных и периферийные вычисления. Платформа центров обработки данных (приблизительно 75 миллиардов долларов в этом квартале, рост на 92% по сравнению с аналогичным периодом прошлого года) далее подразделяется на гипермасштабируемые решения (приблизительно 38 миллиардов долларов, рост на 12% по сравнению с предыдущим кварталом) и ACIE, которая включает облачные, промышленные и корпоративные решения с использованием ИИ (приблизительно 37 миллиардов долларов, рост на 31% по сравнению с предыдущим кварталом). Новая строка — периферийные вычисления: 6,4 миллиарда долларов, рост на 29% по сравнению с предыдущим годом, охватывающая конечные точки, где действительно работают агентный ИИ и физический ИИ, такие как ПК, рабочие станции, базовые станции AI-RAN, роботы и автомобили.

 

В настоящее время на Edge приходится менее 8% от общей выручки, но Nvidia вывела его на уровень «второй платформы» наряду с Data Center. Это свидетельствует о разделении вывода на два направления: облачный вывод в центрах обработки данных и вывод на конечных устройствах на периферии, где ИИ необходимо видеть, двигаться и действовать в физическом мире. Дорожная карта следует той же логике: Vera Rubin, поставки которого начнутся в третьем квартале, может обеспечить пропускную способность вывода в 35 раз выше, чем у Blackwell; Хуанг также определил новый общий потенциальный рынок (TAM) в 200 миллиардов долларов для процессора Vera, разработанного для агентных рабочих нагрузок. Ожидается, что каждая ведущая модельная компания полностью перейдет на него в первый же день.

 

Поскольку крупнейшая в мире компания перестраивает свою финансовую отчетность вокруг «сервисных токенов», дискуссия о «узком месте» уже завершена. В оставшейся части статьи обсуждается, кто получает выгоду, когда вывод (а не обучение) становится дефицитным ресурсом.

 

Во-первых, уточнение по теме. В этой статье обсуждается облачный инференциал, который подразумевает аренду графических процессоров в центрах обработки данных для предоставления услуг по предоставлению API-токенов. Инференциал на конечных устройствах выполняется на локальных чипах внутри самих устройств (Nvidia Jetson, RTX, Drive, AI-RAN), полностью минуя стек аренды и агрегации графических процессоров. Здесь, пожалуйста, рассматривайте это как попутный ветер, усиливающий всю экономику инференции и подтверждающий аргумент о «узком месте», а не как ситуацию на рынках, где работают Hyperbolic и Venice, которые полностью находятся на стороне облака.

 

4. Настал решающий момент.

Anthropic — это своего рода индикатор проблем. Использование ресурсов значительно превышает предварительно настроенную мощность, и интернет наводнен жалобами на то, что Claude «лишен памяти», включая замедление отклика, снижение скорости обработки данных и сжатие контекстных окон. Решение явно связано с вычислительной мощностью: в мае 2026 года Anthropic полностью переняла у SpaceX центр обработки данных Colossus 1, располагающий более чем 220 000 графическими процессорами Nvidia и мощностью более 300 мегаватт, выделив его исключительно для обработки данных, а не для обучения.

 

Эта возможность открывает ряд изменений квот, каждое из которых служит сигналом. 6 мая Anthropic удвоила пятичасовой лимит для Claude Code, отменила ограничение скорости в часы пик и значительно увеличила лимиты скорости API для Opus. 13 мая она повысила недельный лимит для Claude Code еще на 50% (до 13 июля). Затем, начиная с 15 июня, она сделала прямо противоположное «щедрости»: она разделила использование агентских и программных функций (Agent SDK, безголовый режим claude -p, конвейер CI) из фиксированной подписки на независимый пул кредитов (от 20 до 200 долларов в месяц, оплачиваемый по тарифам API). Этот заключительный шаг свел весь аргумент к одному действию: скорость, с которой агенты используют функции вывода, значительно превышает проектную мощность фиксированных подписок, поэтому цена должна соответствовать первоначальной «регулярной стоимости».

 

Обучение — это единовременные капитальные затраты. Вывод информации — это повторяющиеся операционные расходы, которые увеличиваются с каждым новым пользователем и каждым новым агентом.

 

5. Эта структура: шесть слоев, одно узкое место.

Каждое приложение искусственного интеллекта находится в цепочке поставок, которая начинается с производства кремниевых пластин TSMC и заканчивается на конечном звене API:

 

 

 

Большинство компаний владеют только одним уровнем этой инфраструктуры. Nvidia владеет кремниевыми компонентами, CoreWeave — аппаратной частью, Together AI — оптимизацией вывода, а OpenRouter — маршрутизацией API моделей.

 

Есть только одно исключение.

 

6. Hyperbolic: Единственная компания, охватывающая три уровня.

Компания Hyperbolic запустила свой рынок графических процессоров по запросу в июне 2025 года. За первые несколько месяцев число разработчиков превысило 200 000, охватив передовые лаборатории искусственного интеллекта, поисковые системы и крупные потребительские платформы.

 

Интересно, что его архитектура заслуживает внимания.

 

Компания Hyperbolic не владеет ни одной видеокартой. Все карты поставляются неооблачными сервисами и центрами обработки данных, включая CoreWeave, Lambda Labs, Nebius, а также более мелкими операторами с простаивающими мощностями. Это звучит как недостаток, но на самом деле это конкурентное преимущество.

 

Находясь между поставщиками и потребителями графических процессоров, Hyperbolic может получать данные в режиме реального времени, недоступные другим. Компания знает, кто покупает какие графические процессоры, по какой цене и когда. Она выявляет избыток предложения еще до того, как он станет достоянием общественности, и обнаруживает всплески спроса до того, как они появятся на рынке.

 

Сегодня основной защитой является эта многооблачная агрегация. Hyperbolic объединяет разрозненные мощности десятков независимых облаков и центров обработки данных в стандартизированный единый пул, позволяя разработчикам арендовать самые дешевые доступные графические процессоры в любом месте, не вступая в переговоры с каждым оператором и не управляя множеством учетных записей. Чем больше облаков подключено, тем выше ликвидность и тем богаче данные о ценах. Кроме того, команда изучает, как моделировать кривые цен на графические процессоры с помощью этих данных и в конечном итоге инвестировать собственный капитал для сглаживания спроса и предложения, выступая в качестве маркет-мейкера для физических вычислительных мощностей; но эта цель все еще находится на ранней стадии, и сейчас действительно нарастает именно уровень агрегации.

 

Это маховик:

 

Подключайте больше облаков → Увеличивайте агрегированное предложение

 

Увеличение предложения → Более развитые рынки и данные о ценах в режиме реального времени

 

Более качественные данные → Более интеллектуальная маршрутизация уже сейчас и долгосрочные модели ценообразования

 

Улучшение ликвидности и цен → Больше разработчиков → Больше облачных платформ хотят подключиться

 

Ни одна другая компания не пытается этого сделать. Hyperbolic — единственная компания, которая охватывает весь спектр от аренды графических процессоров до развертывания и API-интерфейсов моделей.

 

7. Венеция как зеркало

Venice — наиболее наглядное проявление экономики вывода на уровне приложений и служит полезным контрастом к позиции Hyperbolic. Это приложение для вывода, ориентированное на конфиденциальность: набор API, совместимых с OpenAI, а также потребительские подписки (Free / Pro / Pro+ / Max), направляющие запросы примерно к 75 моделям, две трети из которых — модели с открытым исходным кодом или самодостаточные модели (Llama, Mistral, Qwen, DeepSeek), а остальные — анонимные сквозные передачи закрытых передовых моделей. Ключевой момент заключается в том, что Venice не владеет значительными вычислительными мощностями. Она арендует у нераскрытых партнеров по графическим процессорам и конфиденциальных поставщиков вычислительных ресурсов (NEAR AI Cloud, Phala) и платит передовым лабораториям за сквозные передачи, поэтому ее истинная себестоимость дохода — это вычислительные мощности для вывода, а не хостинг SaaS.

 

В Венеции на самом деле продают конфиденциальность. «Приватизация» здесь не означает превращение общедоступных вычислительных мощностей в частную собственность, а скорее обёртывание коммерциализированного вывода в слой гарантий: отсутствие хранения данных, отсутствие обучения, анонимизация запросов и некоторые рабочие нагрузки, выполняемые в TEE, что делает невозможным для операторов просмотр открытого текста. Базовая вычислительная мощность является стандартной, а наценка исходит из этого слоя защиты конфиденциальности. Более того, эта гарантия многоуровневая и неоднородная: для моделей с открытым исходным кодом, работающих на графических процессорах под её контролем или в TEE, она может обеспечить практически сквозную конфиденциальность вычислений; но для анонимной передачи моделей с закрытым исходным кодом, таких как Claude и GPT, конфиденциальность просто лишает идентичности, в то время как передовые лаборатории на другом конце всё ещё обрабатывают ваш исходный запрос. Таким образом, самая сильная конфиденциальность распространяется только на часть с открытым исходным кодом, в то время как часть с передовой моделью является «анонимной», а не «по-настоящему конфиденциальной». Валовая прибыль Venice равна цене подписки минус затраты на обработку данных, оплачиваемые конечными потребителями, и та часть прибыли, которую компания может взимать сверх базовой цены API, почти полностью зависит от этого уровня надбавки за конфиденциальность, поэтому она работает с низкой маржой и ограничена передовыми методами ценообразования, основанными на передаче данных третьим лицам.

 

В рамках разработки токена эта часть спроса на вычислительные ресурсы была упакована соответствующим образом. Venice работает на двух токенах: VVV (стейкинг и доступ к платформе) и DIEM, последний представляет собой кредиты для вычислительных ресурсов, причем каждый DIEM примерно эквивалентен 1 доллару США вычислительной мощности в день. Платные подписки запускают программные выкупы VVV (Pro / Pro+ / Max примерно по 2 / 5 / 10 долларов США), при этом эмиссия снижается в соответствии с фиксированным графиком: с 6 млн → 5 млн → 4 млн VVV в месяц, а с 1 июля скорректируется до 3 млн. Выкупы реальны, но носят дискреционный характер и пока невелики: в апреле и мае было уничтожено около 103 000 долларов США, а в июне объем постепенно приближается к 110 000 долларов США, что значительно ниже месячной отметки в 200 000 долларов США.

 

Фундаментальные показатели лучше, чем заголовки. Распространённая цифра в "70 миллионов долларов годового дохода" почти наверняка является результатом ошибочного принятия продления подписок за привлечение новых клиентов; обоснованный наблюдаемый диапазон ближе к 6-15 миллионам долларов годового дохода. Ниже этого уровня наблюдается реальный рост: около 136 000 уникальных адресов электронных кошельков, примерно 9,9 миллионов посещений веб-сайта в месяц (около 330 000 в день) и около 1400 новых подписок Pro в день. Это реальный бизнес, но низкорентабельный, экономические показатели которого ограничены вычислительными мощностями, которые он приобретает.

 

Именно поэтому Hyperbolic находится на один уровень выше. Если Венеция — это автозаправочная станция, то Hyperbolic — это нефтеперерабатывающий завод. Венеция покупает вычислительные мощности из того же ограниченного источника, на который полагаются все остальные; Hyperbolic же агрегирует и стандартизирует этот фрагментированный источник и продает его Венеции и всем подобным игрокам. По мере роста спроса на вычислительные ресурсы, ценность накапливается не только для приложений, потребляющих вычислительные мощности, но и для уровня, который агрегирует, распределяет вычислительные мощности и учитывает затраты на получение дохода, понесенные этими приложениями.

 

8. Почему это важно сейчас

Nvidia реорганизовала свои финансы, построив их вокруг «сервисных токенов». IPO Cerebras доказывает, что рынок понял, что узкое место — это машинный вывод. Стремительные поиски мощностей Anthropic демонстрируют, что это реальная проблема. Агентный и физический ИИ увеличат спрос на несколько порядков, охватывая как облачные, так и периферийные вычисления.

 

Более того, это также замкнуло круг «вопроса на 600 миллиардов долларов» с другой стороны. Медвежья логика Кана, согласно которой избыточное производство приводит к переизбытку предложения, вероятно, подтвердится. Но переизбыток предложения — это как раз оптимальный сценарий для агрегаторов с минимальными активами: когда цены на графические процессоры падают и предложение фрагментируется по десяткам облачных платформ, игрок, не владеющий никаким оборудованием и направляющий все рабочие нагрузки на самые дешевые доступные карты, получит выгоду от разницы в цене, в то время как операторы, владеющие обесценивающимися графическими процессорами, понесут убытки. Hyperbolic делает ставку на переизбыток предложения, а не на его продажу.

 

В конечном итоге победит не та компания, у которой больше всего графических процессоров, а та, которая сможет подсказать, какие графические процессоры доступны, где и по какой цене, направляя каждую рабочую нагрузку туда, где она может выполняться с наименьшими затратами.

 

Компания Hyperbolic строит именно такую компанию. Она не владеет графическими процессорами, работает исключительно на программном обеспечении, охватывает три уровня, но при этом становится идеальным агрегирующим слоем для вычислительных мощностей в области инференции.

Данный контент предназначен исключительно для информационных и образовательных целей и не является инвестиционным советом, связанным с BTCC. BTCC прилагает все усилия, но не может гарантировать правдивость, точность или оригинальность вышеприведенного контента.