От повышения рейтинга до платежей: иллюзия спроса в Model Fusion

chaincatcherchaincatcher

I. Что такое слияние моделей?

В июне 2026 года на рынке ИИ менее чем за три недели появились два продукта под названием "Fusion".

12 июня компания OpenRouter выпустила маршрутизатор Fusion Router под заголовком « Превосходя производительность Frontier с Fusion ». В ходе углубленной оценки DRACO группа моделей, состоящая из Fable 5 и GPT-5.5, набрала 69,0 баллов, превзойдя 65,3 балла, полученные единственной моделью Fable 5. Принцип работы OpenRouter прост: если одной модели недостаточно, несколько моделей отвечают на тот же вопрос, а затем модели сравниваются и обобщаются экспертом.

От повышения эффективности до платных услуг: иллюзия спроса при использовании алгоритмов слияния моделей.

29 июня компания Cognition выпустила Devin Fusion под названием « Передовая производительность при снижении стоимости на 35% ». Вместо того чтобы несколько моделей многократно выполняли всю задачу, система позволяет фронтенд-модели заниматься планированием и принятием решений, оставляя тестирование, механические модификации и другие задачи более дешевому помощнику, а также динамически переключая модели во время выполнения.

От повышения эффективности до платных услуг: иллюзия спроса при использовании алгоритмов слияния моделей.

Один и тот же термин указывает на две противоположные экономические логики. OpenRouter использует больше вычислительных ресурсов для покупки более высоких мощностей; Cognition стремится сократить дорогостоящие вычисления, сохраняя при этом исходное качество. Этот контраст более показателен, чем любой рейтинг моделей. Техническое утверждение о слиянии моделей действительно верно: несколько попыток имеют шанс превзойти одну попытку. Но рынок действительно вознаграждает не «большее количество вызовов модели», а того, кто может потратить меньше и быстрее выполнить задачу после достижения пороговых значений качества.

От повышения эффективности до платных услуг: иллюзия спроса при использовании алгоритмов слияния моделей. ▲ Рисунок 1: Два типа Fusion в одном месяце. В этой статье Model Fusion определяется как более узкая архитектура: несколько моделей параллельно выполняют одну и ту же задачу, модели проверяются, их результаты сравниваются, и, наконец, одна модель выдает ответ. Devin Fusion не подпадает под это определение; он ближе к динамической маршрутизации и делегированию задач. Он помещен в начало, потому что на рынке используется термин «Fusion» как общее обозначение для всех многомодельных оркестровок, в то время как действительно эффективные продукты часто отходят от узкого определения Model Fusion.

Наша оценка пессимистична: Model Fusion — это дорогостоящая страховка качества. Она может улучшить абсолютную производительность определенных задач, но редко действительно расширяет границу эффективности по соотношению затрат, качества и задержки. Очень немногие задачи действительно стоят того, чтобы покупать для них такую страховку. Она останется, но, скорее всего, будет функцией, срабатывающей с низкой частотой, а не архитектурой по умолчанию, и вряд ли станет самостоятельной категорией.

 

II. Какие варианты моделей доступны в настоящее время?

Обсуждения Fusion легко переходят к рейтингам точности, но компании не покупают места в рейтингах. Они покупают приемлемые результаты для решения задачи, учитывая при этом цену, задержку, конфиденциальность и стабильность. Пока существует недорогая модель...

Как только будет преодолен порог принятия бизнесом новых решений, дальнейшая оплата «более интеллектуальных» функций может перестать быть экономически целесообразной. Истинной движущей силой на рынке моделей является экономическая эффективность.

От повышения эффективности до платных услуг: иллюзия спроса при использовании алгоритмов слияния моделей. ▲ Рисунок 2: Интеллектуальность модели и стоимость выполнения одной задачи. Наиболее примечательными точками на логарифмической шкале являются не самые высокие значения в правом верхнем углу, а точки, отклоняющиеся от тренда «цена-возможности»: они предлагают достаточные возможности по более низкой цене и являются аномально эффективными для конкретных рабочих нагрузок. Хотя составной индекс не может напрямую ответить на вопрос, какая модель лучше всего подходит для анализа кода, китайских исследований или регулируемого развертывания, он выявляет тенденцию: предложение моделей становится товаром массового потребления, и «самая сильная модель» отделяется от «оптимального выбора».

В настоящее время на рынке существует четыре основные стратегии закупок, направленные на решение одной и той же проблемы нехватки качества.

Первый подход заключается в непосредственном переходе на более мощную единую модель. Это самый простой и легкий для аудита вариант; как правило, он остается предпочтительным, если незначительное увеличение стоимости высокопроизводительной модели меньше, чем стоимость ошибок или доработок. Второй подход заключается в увеличении вычислительных затрат на тестирование той же модели, например, за счет расширения вывода, самосогласованности или множественной выборки. Третий подход — маршрутизация, каскадирование и делегирование задач: сначала используется более дешевая модель для обработки проверяемых или механических частей, и обновление происходит только при возникновении трудностей. Четвертый подход, в более узком смысле, — это слияние моделей: несколько моделей многократно отвечают на один и тот же вопрос, а затем окончательный ответ формируется путем анализа и синтеза моделей.

Все четыре метода позволяют «обменять больше вычислительных ресурсов на качество», но разница заключается в том, куда эти ресурсы направляются. Расширения на основе одной модели обеспечивают более глубокий вывод, маршрутизация — более точное распределение ресурсов, в то время как Fusion приобретает больше вариантов ответов. Первые три метода концентрируют свои бюджеты на этапах, которые с наибольшей вероятностью могут изменить результат; Fusion же сначала оплачивает дублирующие мнения, а затем делает ставку на то, что модель проверки сможет выявить обоснованные различия. Модели-кандидаты должны предоставлять достаточно независимой информации, и рецензенты должны уметь распознавать эту информацию.

Fusion — единственный вариант, который может превзойти остальные три.

Маршрутизация доказала, что различия в возможностях между моделями в первую очередь связаны с оптимизацией планирования. RouteLLM позволила снизить затраты более чем в два раза в некоторых тестах без ущерба для качества; Switchcraft добилась снижения затрат на 84% при точности 82,9%, что, согласно статье, означает экономию более 3600 долларов на миллион запросов. Результаты еще предстоит воспроизвести на собственном трафике предприятия, но экономическая логика проста: вместо того, чтобы использовать несколько моделей в конференции, просто назначайте каждую задачу самой дешевой и подходящей модели.

Это означает, что рынок сначала устранит пробел в качестве за счет обновлений, маршрутизации и проверки; только когда эти методы все еще окажутся недостаточными, появится причина для приобретения дополнительных вариантов ответов для Fusion.

 

III. Почему улучшение результатов не равнозначно их ценности?

Поскольку Fusion должен одновременно преодолеть три препятствия: повышение качества должно покрывать дополнительные затраты и задержку, модели-кандидаты должны предоставлять независимую информацию, а рецензенты должны постоянно выявлять лучшие ответы. Если хотя бы одно из этих препятствий не выполняется, улучшение оценки не может быть преобразовано в ценность для производства. Вычислительные затраты: какой дополнительный бюджет и задержка требуются? Улучшение оценки Fusion в первую очередь является определенными вычислительными затратами. OpenRouter вызывает несколько панельных моделей параллельно, а затем рецензенты и интегрированная модель генерируют ответ. Все три контрольные группы в DRACO показали улучшение оценок: Fable 5 + GPT-5.5 увеличилась с 65,3 до 69,0; Opus 4.8 самослияние увеличилось с 58,8 до 65,5; а группа с тремя недорогими моделями увеличилась с 60,3 до 64,7.

Однако улучшение самослияния в Opus более значительно, что предполагает, что выигрыш может быть обусловлен дополнительным поиском и выборкой, а не взаимодополняемостью знаний между моделями . Справедливое сравнение следует проводить между самосогласованностью, более длительным выводом и сильными моделями с одним агентом при одинаковом бюджете токенов. Существующие исследования также показывают, что многоагентные модели могут улучшить производительность до 7,1 процентных пунктов при примерно в 20 раз больших вычислительных затратах; при том же бюджете модели debate и Mixture-of-Agents лишь на 1,3 и 2,7 процентных пункта выше, чем самосогласованность, соответственно, в то время как другое исследование с равным количеством токенов для рассуждений показало, что модели с одним агентом не уступают или превосходят их. Многие «преимущества в сотрудничестве» исчезают после выравнивания вычислительного реестра.

От повышения эффективности до платных услуг: иллюзия спроса при использовании алгоритмов слияния моделей. ▲ Рисунок 3: Улучшение результатов бенчмарка OpenRouter и стоимость продукта. Панель OpenRouter по умолчанию с 3 моделями стоит примерно в 4-5 раз дороже, чем стандартная сгенерированная панель, и работает в 2-3 раза медленнее . Однако в ней не раскрываются полные данные о токенах, стоимости и задержке для каждой конфигурации DRACO, что делает невозможным определить, стоит ли улучшение на 3,7 пункта того. Оценка включала только 100 заданий с текстом на простом английском языке, при этом было выполнено только 93 задания, связанные с Fable. Изменение модели обзора может изменить абсолютный балл на 10-25 процентных пунктов. Это доказывает, что Fusion может улучшить результаты, но не доказывает, что Fusion повышает рентабельность инвестиций в производство.

Выборочное срабатывание может только снизить затраты. Согласно оценкам, опубликованным OpenRouter, общая стоимость увеличивается примерно в 1,03-1,04 раза при частоте срабатывания 1%; в 1,30-1,40 раза при 10%; и в 1,75-2,00 раза при 25%.

От повышения эффективности до платных услуг: иллюзия спроса при использовании алгоритмов слияния моделей. ▲ Рисунок 4: Общая экономика выборочного вызова Fusion. Наиболее сложные запросы с наибольшей вероятностью вызовут Fusion, но система должна дождаться завершения проверки и генерации наиболее медленных членов панели, прежде чем последовательно завершить анализ. Таким образом, задержка в конце цепочки запросов концентрируется на наиболее важных задачах. Вызов нескольких поставщиков также расширяет поверхность сбоев, усложняет аудит и увеличивает риск нарушения конфиденциальности. Стоимость Fusion — это не только цена API, но и время ожидания, а также дополнительные системные риски. Информационная взаимодополняемость: действительно ли несколько моделей предоставляют различную информацию? Ценность Fusion зависит от того, предоставляют ли модели-кандидаты независимую информацию, но разные модели часто используют общие обучающие корпуса, источники веб-страниц и ошибочные предпосылки. В исследовательских задачах это приводит к «отмыванию цитирований» : несколько моделей ссылаются на один и тот же источник, но упаковываются как несколько независимых доказательств. Если система не сохраняет происхождение на уровне утверждений и пути поиска, стоимость API увеличивается почти линейно с количеством моделей, но разнообразие доказательств не обязательно увеличивается.

В своей статье 2026 года «Когда объединение языковых моделей помогает?» Йозеф Чен, соучредитель и генеральный директор KAIKAKU.AI, изучил 67 моделей от 21 поставщика услуг. В задачах с открытым ответом по математике прогнозируемая вероятность одновременного неправильного ответа всех моделей составляла 2,3%, но фактическая вероятность достигла 5,2% — примерно в 2,3 раза больше прогнозируемого значения . Показатель одновременного неправильного ответа увеличился до 7,9% и 12,7% в задаче с оценочным кодом и в версии GPQA-Diamond со свободным ответом, соответственно. При наличии 100 вопросов GPQA-Diamond примерно 13 вопросов приведут к тому, что все модели-кандидаты ответят неправильно, не оставив ни одного правильного ответа для голосования, проверки или синтеза. Расхождение между моделями в простых вопросах усиливает объединенную ценность, в то время как в наиболее важных вопросах, находящихся в конце списка, все они могут дать неправильный ответ. Оценка надежности: Может ли система выявлять и синтезировать более качественные ответы? Даже при наличии взаимодополняющих вариантов ответов ценность по-прежнему зависит от проверки. Когда варианты согласуются, проверяющие могут ошибочно интерпретировать связанные ошибки как высокую степень уверенности; когда варианты расходятся, для выбора правильного ответа требуется достаточная экспертиза. Составная модель также может стирать ключевые мнения меньшинства или преобразовывать реальные разногласия в окончательные выводы.

В задачах программирования компиляторы, тесты и статический анализ часто оказываются более надежными, чем мнение другой модели; в творческих задачах проверка и синтез могут легко свести различия к среднему ответу. Даже самая сильная готовая модель проверки в LitBench имеет лишь 73% совпадения с предпочтениями людей в области творческого письма. Когда существуют недорогие внешние валидаторы для задачи или когда само понятие «хорошо» зависит от субъективной оценки, улучшения показателей Fusion трудно конвертировать в платную ценность.

 

IV. Кто оплатит Fusion?

Спрос на Fusion зависит от двух факторов: может ли задача выиграть от использования нескольких моделей и достаточно ли этой выгоды для получения стабильного дохода. Первый фактор — технический, а второй — рыночный. От технической применимости до экономической целесообразности Fusion требует, чтобы вероятность исправления ошибки, умноженная на предотвратимые потери от одной ошибки, перевешивала затраты, задержку, сложность эксплуатации и риски конфиденциальности, связанные с добавлением новых API.

Оценки по эталонным показателям не могут ответить на вопрос о прибыли и убытках. Интеграция технологий жизнеспособна только тогда, когда стоимость ошибки высока, модели-кандидаты обеспечивают взаимодополняющие пути поиска, отсутствуют более дешевые внешние валидаторы, и бизнес готов смириться с дополнительной задержкой и риском, связанным с поставщиками; окончательный результат все равно должен быть подтвержден экспертами или внешними источниками.

От повышения эффективности до платных услуг: иллюзия спроса при использовании алгоритмов слияния моделей. ▲ Рисунок 5: От технологической применимости к устойчивым потребностям. К числу таких потребностей относятся, прежде всего , высокоэффективные исследования и комплексная проверка, обзоры архитектуры и безопасности, а также «вторые мнения» перед принятием необратимых решений. Они имеют общие черты: неполные ограничения, высокие издержки упущений и неотъемлемая ценность независимого подхода. Напротив, обычный код, приложения с немедленным использованием, высокопроизводительные рабочие процессы с низкой рентабельностью и задачи, непосредственно проверяемые с помощью тестирования или правил, как правило, не требуют интеграции. Регулирующие органы также могут отклонять многовендорные панели из-за ограничений данных и требований аудита. От готовности платить к устойчивым потребностям. Технологическая полезность может порождать высокую готовность платить, но это не означает масштабируемый спрос. Для того чтобы устойчивый спрос материализовался, потери от ошибок должны быть количественно измеримыми, задачи должны быть повторяющимися, должны быть четко определенные бюджетные обязанности внутри организации, а интеграция должна постоянно превосходить экспертов, модели с сильными едиными объектами и внешнюю проверку. Однако бюджеты на комплексную проверку часто направляются аналитикам и надежным источникам, бюджеты на обеспечение безопасности — профессиональным аудиторам, а необратимые решения принимаются слишком редко.

Поэтому мы не питаем оптимизма по отношению к компаниям, которые предоставляют только многомодельные оболочки, запускают панели по умолчанию или рассматривают статические алгоритмы выбора моделей как непреодолимое препятствие. Подключение API легко воспроизвести, а фиксированные стратегии быстро становятся неэффективными по мере изменения возможностей моделей и цен; без знания частоты ошибок и того, сколько раз Fusion фактически исправил ошибки, невозможно оценить эту страховку. Те, кто контролирует реальные результаты, с большей вероятностью получат выгоду: платформы шлюзов и агентов, вертикальные приложения, владельцы рабочих процессов, а также продукты для оценки и мониторинга. Они знают стоимость ошибок, могут наблюдать за результатами и оптимизировать стратегии запуска. Что действительно сложно воспроизвести, так это не список панелей, а определение того, когда не следует запускать Fusion. Проверка рынка: публичных рынков недостаточно для определения масштаба спроса на Fusion, но они уже показывают, как он используется. Perplexity Model Council доступен только пользователям Max и Enterprise Max, которые платят 200 долларов в месяц. Пользователи вручную выбирают три модели в интернете для инвестиционных исследований, принятия сложных решений и проверки информации; Примеры использования в публичных проектах включают интеграцию Model Council в рабочие процессы анализа акций посредством автоматизации браузера. Hermes Mixture of Agents представляет Fusion как выбираемую виртуальную модель внутри агента: пользователи могут перейти к решению одной сложной задачи через /moa или постоянно включать его в сложных сессиях, при этом анализ предоставляется несколькими эталонными моделями, а агрегатор вызывает инструменты для выполнения задачи. Позже Hermes снизил частоту разветвления по умолчанию и повторно использовал обратную связь от предыдущих моделей для контроля затрат. Эти примеры показывают, что реальный спрос на Fusion сосредоточен в задачах с низкой частотой выполнения, таких как исследования, отладка, проверка и принятие важных решений. Типичное использование — это упреждающие обновления после того, как одна модель сталкивается с узким местом, а не высокочастотный автоматизированный процесс, включенный по умолчанию. Имеющиеся данные подтверждают наличие этого спроса, но общедоступной информации пока недостаточно, чтобы определить, сможет ли он сформировать независимый, крупномасштабный платный рынок.

 

V. Будущее термоядерного синтеза

Хотя снижение затрат на вывод данных, по-видимому, выгодно Fusion, оно также одновременно снижает затраты на мощные отдельные модели, маршрутизацию и внешнюю проверку. Fusion конкурирует не за счет устаревших методов вызова моделей, а за счет постоянного совершенствования моделей следующего поколения и базовых показателей оркестрации.

Проект Devin Fusion от Cognition демонстрирует направление этого соревнования: дорогостоящие модели следует оставить на этапе принятия решений, а проверяемые, механические задачи делегировать более дешевым моделям. В ходе самотестирования поставщиков общий балл Fusion + Fable 5 немного вырос с 57,0 до 57,6, при этом средняя стоимость снизилась с 5,12 до 3,00 долларов; однако в пяти опубликованных тематических исследованиях, хотя стоимость снизилась на 25–62%, оценки задач колебались от +12 до -27. Хорошо определенные и тщательно протестированные рефакторинги ES6 выросли с 98 до 100 баллов; функции React/Redux, основанные на понимании взаимодействия и неявных требованиях, при неправильном делегировании, упали с 54 до 27 баллов.

От повышения эффективности до платных услуг: иллюзия спроса при использовании алгоритмов слияния моделей. ▲ Рисунок 6: Оценки и стоимость задач Devin Fusion. Это примеры, выбранные поставщиками, и они не отражают общее распределение, но они ясно указывают на следующее: основная возможность будущих многомодельных систем заключается не в вызове большего количества моделей, а в определении правильных границ деградации. Проверяемые механические задачи могут быть назначены более дешевым моделям, в то время как задачи, требующие принятия решений, должны быть оставлены для передовых моделей. OpenRouter продает «больше интеллекта», а Cognition — «эквивалентный интеллект по более низкой цене»; второе предложение ближе к долгосрочному направлению. Чем ближе система к производственной экономике, тем меньше она похожа на Model Fusion в узком смысле и тем больше — на маршрутизацию, делегирование и верификацию.

В конце июля в СМИ появились сообщения о том, что Stripe ведёт переговоры о приобретении OpenRouter примерно за 10 миллиардов долларов, хотя сделка ещё не подтверждена. Этот сигнал не следует интерпретировать как подтверждение рыночной востребованности Fusion: основная ценность OpenRouter заключается не в какой-либо конкретной панели, а в нейтральном уровне обработки вызовов, соединяющем более 5 миллионов разработчиков с более чем 400 моделями. Stripe уже предоставляет OpenRouter услуги по выставлению счетов, налогообложению и контролю рисков, а также позволяет разработчикам создавать учетные записи, получать ключи API и напрямую подключаться к платежам через Stripe Projects. Скорее всего, Stripe приобретает шлюз транзакций для вывода ИИ: OpenRouter контролирует выбор модели, использование токенов и затраты, а Stripe занимается ценообразованием, выставлением счетов и платежами. Это даёт рыночный сигнал для упомянутой ранее оценки ценности: в эпоху мультимоделей ценность, скорее всего, останется в уровне оркестровки, который может отслеживать задачи, распределять вызовы и завершать расчёты; Fusion — это всего лишь дорогостоящая стратегия модернизации поверх этого.

В будущих многомодельных системах не будет автоматически вызывать панели; вместо этого они будут сначала оценивать сложность задачи, затраты на валидацию и штрафы за ошибки. Поиск расхождений в многомодельных системах будет продолжаться только тогда, когда более сильные отдельные модели, расширенный вывод и внешние инструменты окажутся недостаточными. Единственными значимыми показателями продукта являются частота срабатывания, коэффициент прироста успешности и подтвержденная стоимость единицы результата. Слияние останется низкочастотной функцией, а не станет архитектурой по умолчанию или самостоятельной категорией.

 

VI. Источники

OpenRouter: Превосходство над производительностью Frontier благодаря Fusion

Документация OpenRouter Fusion Router

Cognition: Devin Fusion — передовые технологии при снижении стоимости на 35%.

Microsoft Research: Switchcraft — Маршрутизатор моделей ИИ для вызова инструментов агентного управления.

В каких случаях объединение языковых моделей приносит пользу?

Многоагентный анализ повышает эффективность вычислений.

Системы с одним агентом превосходят многоагентные системы по результатам многошагового рассуждения при равном бюджете мыслительных токенов.

Использование смешанных агентов расширяет возможности больших языковых моделей.

RouteLLM: Обучение маршрутизации LLM с использованием данных о предпочтениях

LitBench: Система оценки художественной литературы

Сравнение моделей искусственного анализа

Цена прогресса: соотношение цены и качества и будущее искусственного интеллекта.

Затруднение: Что такое Модельный совет?

Пример использования Perplexity: Модельный совет по финансовым исследованиям.

Агент Hermes: документация по смешанным агентам

Stripe обеспечивает доступ к глобальной модели искусственного интеллекта OpenRouter.

Axios: Что стоит за сообщениями о переходе Stripe на OpenRouter?

Данный контент предназначен исключительно для информационных и образовательных целей и не является инвестиционным советом, связанным с BTCC. BTCC прилагает все усилия, но не может гарантировать правдивость, точность или оригинальность вышеприведенного контента.