Перекресток ИИ: почему Уолл-стрит говорит «нет» ChatGPT и Клоду?
chaincatcherАвтор: Джефф @IOSG
Почему необходим частный ИИ
1 июля генеральный директор Palantir Алекс Карп дал 20-минутное интервью на CNBC, которое некоторые СМИ назвали «нервным срывом». По словам Карпа, компании платят символическую премию передовым лабораториям, наблюдая при этом, как их собственная интеллектуальная собственность переходит к поставщикам моделей. Он назвал эту утечку передачей альфа-частиц, которая происходит на архитектурном уровне: каждый запрос, отправленный к модели с закрытым исходным кодом, поступает на сервер поставщика услуг в открытом виде. За несколько дней до выхода программы в эфир Palantir объявила о партнерстве с NVIDIA для запуска открытых моделей Nemotron в средах, контролируемых клиентами, сопроводив это заявлением о суверенитете ИИ из девяти пунктов. После выхода программы на CNBC акции PLTR подскочили на 8%.
В течение последних двадцати лет компании внедряли облачное программное обеспечение, основанное на доверии на уровне протокола, и это работало. Каждый поставщик SaaS-услуг видит лишь часть корпоративных данных, и у большинства нет особых стимулов передавать данные о клиентах обратно в свои основные продукты. Salesforce видит каналы продаж, Workday — отдел кадров, Jira — итерации разработки, а AWS предоставляет основу для хранения и вычислений. Однако современные рабочие процессы ИИ предполагают однократную загрузку всех ресурсов вместе со структурированным контекстом, связывающим различные отделы, в стремлении к максимальной производительности. Отбросив добрую волю, поставщики услуг теперь могут использовать эти данные для разработки новых функций, вместо того чтобы позволять им пылиться на серверах.
Никто не сбавляет обороты; годовой доход Anthropic в мае достиг 47 миллиардов долларов, что является значительным скачком по сравнению с 9 миллиардами долларов в конце 2025 года, а OpenAI в феврале превысила отметку в 900 миллионов еженедельно активных пользователей. Обе компании завершили новые раунды финансирования этой весной, их оценка приближается к 1 триллиону долларов, и ожидается, что они проведут IPO при еще более высоких оценках. Многолетние обвинения в нарушении конфиденциальности и защите интеллектуальной собственности не привели к снижению темпов роста ни одной из компаний.
Некоторые компании уже предприняли шаги в этом направлении. В феврале 2023 года, менее чем через три месяца после запуска ChatGPT, крупные банки Уолл-стрит ограничили его использование. В мае 2023 года, после того как инженер Samsung допустил утечку исходного кода чипа в ChatGPT, компания запретила генеративный ИИ в своей сети. В ответ OpenAI запустила ChatGPT Enterprise в августе того же года, пообещав не использовать коммерческие данные для обучения, а также протокол нулевого хранения данных (ZDR), который впоследствии стал стандартным требованием для корпоративных закупок.
Однако контракты блокируют только корпоративные учетные записи. Компания IBM обнаружила, что к 2025 году теневой ИИ (сотрудники, передающие корпоративные данные в несанкционированные инструменты ИИ через личные учетные записи) будет задействован в пятой части случаев утечки данных, а интенсивное использование теневого ИИ в среднем увеличит затраты на устранение последствий утечки на 670 000 долларов. В опросе, проведенном в 2025 году компанией Anagram, занимающейся обучением в области безопасности, четыре сотрудника указали, что готовы нарушать правила использования ИИ, чтобы быстрее выполнять задачи.
Компании, по крайней мере, могут потратить деньги, чтобы выкупить свои позиции, используя контракты ZDR и тарифные планы без обучения, а если вы являетесь государственным клиентом или клиентом Palantir, существуют варианты развертывания на суверенной основе. Однако для обычных пользователей, таких как вы и я, важность ИИ для обеспечения конфиденциальности остается предметом споров до тех пор, пока не придет судебная повестка.
В мае 2025 года суд обязал OpenAI сохранять даже удаленные пользователями журналы чатов, а в ноябре судья распорядился передать 20 миллионов таких журналов юристам The New York Times в качестве доказательств. Затем последовали уголовные дела: записи ChatGPT от обвиняемого по делу о поджоге в Палисадесе стали доказательством, а в показаниях под присягой по делу о двойном убийстве во Флориде упоминались вопросы подозреваемого о том, как избавиться от тела. Сэм Альтман также признал в интервью в июле 2025 года, что разговоры в ChatGPT не защищены юридической привилегией, и в ходе судебного разбирательства OpenAI «может быть обязана передать» журналы чатов пользователей.
Суть в том, что частные разговоры нужны не только преступникам. Архивирование и возможность запроса повесткой в суд переписки между людьми и ИИ представляют собой аспект слежки, о котором большинство пользователей не подозревают. Опрос, проведенный юридической фирмой «Колмогоров» в октябре 2025 года среди 1000 американских пользователей ИИ, показал, что 50% не знали о возможности запроса повесткой в суд этих разговоров, а две трети считали, что эти чаты должны получать такую же защиту, как консультации с юристами или врачами.
Самостоятельно размещаемые или открытые модели, работающие в проверяемых средах, быстро набирают популярность, но самые сильные из них по общим возможностям всё ещё отстают от передовых закрытых моделей примерно на четыре месяца. Это ставит предприятия и частных лиц, занимающихся токенизацией, перед выбором: либо пожертвовать несколькими месяцами качества модели ради конфиденциальности, либо продолжать загружать конфиденциальные материалы на серверы Anthropic, поскольку конкуренты таким образом получают преимущества в производительности.
В настоящее время на рынке нет идеальных решений. В отчете описываются попытки различных сторон сократить этот разрыв и анализируется, насколько далеко находится внедрение передовых технологий обработки информации с гарантированной конфиденциальностью в корпоративную среду и для обычных пользователей.
Как в настоящее время обеспечивается конфиденциальность
Privacy AI — это не единый проект, но каждый существующий на рынке механизм в настоящее время обрабатывает одно и то же событие: запрос покидает ваше устройство, проходит через сеть, попадает на машину, на которой работает модель, и затем возвращает ответ. Разница между механизмами заключается в том, где на этом пути находится открытый текст, кто может его прочитать и что используется для проверки конфиденциальности ответа.
Конфиденциальность на уровне протокола
На этом уровне, помимо вас, ваш текстовый запрос могут прочитать и другие, и дальнейшие действия полностью зависят от данного обещания.
Решение Contractual Zero Retention — это корпоративное решение. Поставщик услуг знает, кто вы, обрабатывает ваше уведомление и обязуется не сохранять его, что обеспечивается договорами и репутацией.
Анонимные прокси-серверы стирают вашу личность, но не шифруют сказанное вами; поставщики услуг по-прежнему обрабатывают открытый текст в соответствии со своими собственными правилами. Условия различаются в зависимости от поставщика; например, Duck.ai (чат-бот DuckDuckGo) может заключать соглашения об удалении данных с поставщиками моделей, в то время как Venice предполагает, что пользователи будут считать, что поставщик услуг сохранит все данные, но ни одна из сторон не может это проверить.
Каждый сегмент маршрута между машинами работает по протоколу TLS, который шифрует только сам канал связи; принимающая сторона может прочитать всю информацию. Ретрансляторы обычно используют протокол Oblivious HTTP (RFC 9458) для разделения этого права на информацию, функционируя подобно другу, передающему записку. Друг знает, кто передал записку, но не может прочитать ее содержимое; получатель может прочитать содержимое, но не знает, кто ее написал. OHTTP стал стандартом IETF в январе 2024 года, и многие компании теперь используют OHTTP-ретрансляторы, арендованные у Cloudflare и Fastly, для обработки производственного трафика.
Это также предел конфиденциальности, достижимый при доступе к моделям с закрытым исходным кодом, из-за математической проблемы. Текущая стоимость обучения на флагманском уровне исчисляется миллиардами долларов, а почти триллионная оценка этих лабораторий основана на эксклюзивности весов модели. Длительность разрыва в возможностях модели определяет длительность существования премии; таким образом, лаборатории хранят файлы с весами как государственную тайну.
Meta пассивно провела этот эксперимент. Модель LLaMA, выпущенная в феврале 2023 года, изначально была доступна только исследователям, но в течение недели её веса просочились на 4chan в виде исходных файлов. Неделю спустя файл llama.cpp позволил запустить самую маленькую 7-битную модель локально на MacBook, а три дня спустя Стэнфордский университет доработал чат-помощника Alpaca на той же модели менее чем за 600 долларов. Эта утечка снизила эксплуатационные расходы Llama до уровня электроэнергии, позволив любому, у кого есть файл, запустить её дома. В июле 2023 года Meta официально открыла исходный код Llama 2 с коммерческой лицензией, которая исключала пункт о 700 миллионах ежемесячно активных пользователей. Веса запустились, и последовала премиальная цена.
Теоретически, передовые лаборатории могли бы предоставлять аттестацию (удалённое доказательство) для вывода результатов в моделях с закрытым исходным кодом, но аттестация может доказать только то, какой сегмент кода прочитал запрос; она не может доказать, что этот код с ним сделал. Чтобы определить, сохранил ли сервер данные, нам необходимо провести аудит кода, обслуживающего сервер, и восстановить его до хеша, сообщаемого оборудованием. Однако, как только код, обслуживающий сервер, передаётся, лаборатория также отказывается от методов пакетной обработки и кэширования, которые обеспечивают прибыль, и эти методы будут переходить в каждое последующее поколение моделей. Apple и Meta могут предоставлять удалённое доказательство для стеков сервисов, лежащих в основе iPhone и WhatsApp, потому что их прибыль поступает от устройств и рекламы, а публичное раскрытие кода сервиса практически ничего не стоит.
Именно поэтому весовые коэффициенты и сервисный код флагманских моделей не попадают к внешним операторам. Без внешних операторов отсутствует сторонняя аттестация; без аттестации проверяемая конфиденциальность существует только в моделях с открытым исходным кодом.
Конфиденциальность на структурном уровне
Каждый механизм в этой категории заменяет обещания доверия аппаратными, криптографическими или физическими доказательствами, но каждый из них влечет за собой разные затраты на повышение уровня конфиденциальности, главным образом потому, что они могут работать только с моделями с открытым исходным кодом.
Технология TEE (Trusted Execution Environment) Confidential Computing выполняет вычисления внутри аппаратного анклава (герметичной камеры на чипе, которую не может открыть даже оператор машины); чип подписывает аттестацию, в которой подробно указывается, какая модель и сегмент кода были выполнены.
Запрос скрывается только на конечной точке. На пути, проходимом через прокси-сервер, остается роль, позволяющая читать открытый текст, и только протокол предотвращает запись или утечку содержимого ретранслятора через прокси-сервер.
Сквозное шифрование (E2EE) блокирует доступ к читаемым каналам связи. Устройство пользователя шифрует приглашение с помощью ключа анклава, и каждый промежуточный узел передает запечатанный конверт, который может открыть только сам анклав.
Доверие лежит на стороне клиента. Код, отвечающий за шифрование запроса и проверку аттестации, также имеет возможность отозвать эту гарантию. Следовательно, для проверяемого сквозного шифрования (E2EE) необходимы как проверенный анклав, так и открытый, воспроизводимый клиентский код.
По сравнению с простотой TEE, стоимостью E2EE является инженерная нагрузка, которая также замедляет функциональную интеграцию. E2EE превращает прокси в слепого посредника, поэтому все функции, зависящие от чтения открытого текста, должны быть перестроены вокруг клиентского ключа или реконструированы только внутри анклава.
Полное гомоморфное шифрование (FHE) и его варианты MPC полностью исключают доверенную сторону. Сервер выполняет вычисления над зашифрованным текстом в закрытом ящике, который он никогда не сможет открыть; ключ находится только в ваших руках, в то время как MPC (многосторонние вычисления) разделяет запрос на секретные части, распределяемые между несколькими сторонами, достигая того же эффекта, если только все участники не вступят в сговор.
Цена заключается в скорости. В FHE изначально выполняются только сложение и умножение, поэтому нелинейные шаги, необходимые для работы преобразователя, должны быть восстановлены с большими затратами. Стоимость вывода для зашифрованного текста в 10 000–100 000 раз выше, чем для открытого текста, при этом на небольших моделях вывод каждого токена занимает от секунд до минут, тогда как в незашифрованных условиях — всего миллисекунды.
Ожидается, что чипы, специально разработанные для вычислений с шифрованием, сократят этот разрыв, но первый прототип завершит свою демонстрацию только в начале 2026 года, а на разработку коммерческих версий потребуется еще несколько лет.
Локальный вывод напрямую исключает этот путь. Модель работает на вашем собственном оборудовании, без ретранслятора, сервера, поставщика услуг и требований к проверке.
Очевидные издержки — это затраты и возможности модели. gpt-oss-120b показывает примерно вдвое меньший результат, чем GLM-5.2, по индексу искусственного интеллекта, но его размер составляет 65 ГБ, что превышает суммарный объем видеопамяти двух флагманских игровых видеокарт на рынке. Полноточная версия GLM-5.2 может работать только на узле центра обработки данных с 8 видеокартами, стоимость которых только за графические процессоры превышает 300 000 долларов.
Однако, помимо этих структурных ограничений, стоимость размещения вычислений в анклавах снижается. В однопроцессорных системах, согласно тестам поставщика облачных услуг Phala, потери пропускной способности в режиме анклава H100 в среднем составляют менее 7%, а на больших моделях практически равны нулю, поскольку основные затраты связаны с перемещением данных в чип, а не с вычислениями внутри него. В многопроцессорных системах графические процессоры NVIDIA следующего поколения Blackwell теперь поддерживают прямое шифрование межчипового трафика, в то время как более старый H100 может достичь того же эффекта только путем маршрутизации через центральный процессор с пропускной способностью в семь раз меньшей. Собственные тесты NVIDIA на Blackwell показывают, что потери пропускной способности для модели 397B в режиме анклава составляют менее 8%. Благодаря этим достижениям, потери производительности при вычислении конфиденциальной информации больше не являются решающим фактором.
Фактически, сам анклав практически не увеличивает эксплуатационные расходы оператора. Все H100 после 2023 года поставляются в режиме анклава, и дополнительные затраты связаны с потерей пропускной способности из-за шифрования, а не с дополнительными чипами. В настоящее время арендная плата за конфиденциальные SKU H100 на Azure по-прежнему составляет 8,90 долларов в час, в то время как без анклава она составляет 6,98 долларов, что представляет собой наценку в 27% по сравнению с традиционными облачными ресурсами. С другой стороны, такие операторы, как Phala, специализирующиеся на анклавах, арендуют H100 в конфиденциальном режиме по цене от 3,80 долларов в час, что ниже ценового диапазона от 3,99 до 4,29 долларов за стандартные карты SXM Lambda. В решениях для размещенных API NEAR AI предлагает конечные точки с аттестацией по цене 0,15 долларов за миллион токенов на входе и 0,55 долларов на выходе для gpt-oss-120b, что сопоставимо с маршрутами в открытом виде на Amazon Bedrock, Together и Groq. Даже для моделей, требующих многочипового параллелизма, цены NEAR AI на GLM 5.2 идентичны ценам Fireworks, а на более крупной Kimi K2.6 входные данные на 15% дешевле, а выходные — на 4%.
Хотя эти новые поставщики услуг по определению уровня конфиденциальности могут тратить прибыль на захват доли рынка (это относится к любой компании на рынке, стремящейся к росту), структурная тенденция заключается в том, что стоимость обеспечения конфиденциальности снижается как для потребителей, так и для операторов.
Как модели с открытым исходным кодом побеждают
Несмотря на снижение накладных расходов на производительность, между передовыми моделями и современными моделями с открытым исходным кодом сохраняется заметный разрыв. Организация, стремящаяся к максимальной производительности, по-прежнему должна доверять передовым лабораториям и быть уверенной, что они не украдут её интеллектуальную собственность.
Разрыв по-прежнему существует, но 30 июня AIA Labs под управлением Bridgewater и Thinking Machines представили пример: открытая модель, доработанная с помощью экспертных аннотаций, одновременно превзошла передовую модель как по точности, так и по стоимости.
В ходе исследования команда доработала модель Qwen3-235B на платформе Tinker (сервис API для тонкой настройки, размещенный компанией Thinking Machines). Сначала они получили аннотации от поставщика, обучили модель на первом этапе с использованием этого набора данных, а затем отправили отличающиеся образцы обратно инвестиционному персоналу компании для повторной аннотации. В процессе обучения использовалось обучение с подкреплением (GRPO) с тремя модификациями: пакетная обработка по кругу (каждая задача по очереди создает пакет), функция потерь CISPO (ограничивающая влияние одного ответа на модель) и дистилляция на основе политики (привязка к текущей оптимальной контрольной точке, чтобы гарантировать, что модель не будет обучаться на более слабых копиях).
Все задачи были взяты из повседневных рабочих процессов инвестиционного персонала: важна ли новостная статья для руководителей высшего звена, предполагает ли документ центрального банка будущие изменения процентных ставок, и с чего начать использование шаблонных фраз в документе или электронном письме. Оценка проводилась на независимом тестовом наборе данных, при этом передовые модели в среднем набирали около 50% на простых запросах и достигали только 78,2% на запросах экспертов, что ниже порога в 80%, установленного инвестиционным персоналом. Усовершенствованная модель Qwen достигла 84,7%, что, согласно оригинальному тексту, означает, что она допустила на 29,8% меньше ошибок, чем передовая оптимальная модель, при этом затраты на вывод были в 13,8 раза ниже.
https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/
Этот случай демонстрирует, что модели с открытым исходным кодом могут выигрывать как по точности, так и по стоимости, но процесс обучения всё ещё не является конфиденциальным. Экспертные аннотации, используемые в процессе, представляют собой конфиденциальные данные от Bridgewater, проходящие через сторонний сервис Tinker, что обеспечивает тот же уровень доверия, что и у протокола ZDR. Фонд также арендовал вычислительные мощности, и всё обучение проходило на машинах, которые он никогда не контролировал. У покупателей, желающих получить такую формулу без предположения о доверии, сегодня очень мало вариантов. Аренда кластеров с чистыми графическими процессорами делает процесс обучения понятным для операторов облачных сервисов. Покупка кластера решает проблему размещения данных, но затраты резко возрастают.
Наметился путь с аттестацией. В марте Workshop Labs и Tinfoil выпустили Silo, стек для постобучения, работающий в анклавах Tinfoil на одном узле с 8 картами, ключи которого контролируются исключительно заказчиком. В статье говорится, что стоимость анклава добавляет 11 минут к двухчасовой сессии обучения, и этот стек может вместить модель с триллионом параметров (Kimi K2 Thinking), заморозив базовые веса и обучая на них только небольшие адаптеры. Сложность заключается в том, что обучение с подкреплением требует перемещения данных между компонентами, и именно перемещение данных является причиной возникновения затрат на анклав.
Менее чем через месяц после выхода Silo компания Workshop Labs была приобретена Thinking Machines, и теперь все компоненты, необходимые для запуска следующего цикла обучения с подкреплением в стиле Bridgewater в этом анклаве, находятся в ведении той же компании.
Конфиденциальность на уровне жгута проводов
Существует еще одна проблема, выходящая за рамки всех механизмов вывода. Каждый из этих механизмов управляет путем от запроса к модели, в то время как каждый вызов внешнего инструмента, инициированный агентом, открывает маршрут, к которому слой вывода принципиально не имеет доступа. Современная тенденция к разработке вспомогательных средств усугубляет проблему; каждый инструмент, хранилище памяти и источник данных, окружающие модель, являются еще одним пунктом назначения, который считывает свою часть рабочего процесса в открытом виде. Серверы календарей считывают расписания, серверы баз данных — запросы. Полностью локальный агент все равно должен отправлять поисковые запросы в открытом виде в поисковую систему, если ему нужно что-то за пределами обучающего набора данных, поскольку сервер не может читать открытый текст и, следовательно, не может отвечать на вопросы.
В большинстве решений по умолчанию используется протокольный уровень. Такие компании, как Runlayer и MintMCP, используют центральный шлюз для управления всем трафиком инструментов, скрывая персональные данные (PII) до отправки запросов. Шлюз также определяет, какие серверы могут принимать трафик, блокируя непроверенные, и регистрирует пункт назначения и содержимое каждого вызова для дальнейшего использования. Даже если эти средства контроля проходят независимые аудиты (SOC 2), серверам инструментов все равно необходимо читать запросы в открытом текстовом виде для ответа, и сохранение ими копий зависит от их собственных политик хранения, умноженных на количество инструментов в системе. Более того, сам шлюз является дополнительной стороной, читающей данные, и его работа зависит от доверия на всем пути следования запроса, а не от проверки.
Решения на структурном уровне нацелены на этот средний слой. Например, Phala напрямую размещает сервер MCP внутри TEE, охватывая кошельки, выполнение кода и источники данных, позволяя пользователям проверять заявления о конфиденциальности с помощью аттестации, а не доверять оператору. Однако инструменты, размещенные в TEE, по-прежнему должны отправлять запросы в открытом виде поставщикам услуг; анклав защищает только отправителя, а не получателя.
Лишь немногие сервисы научились отвечать без чтения, но только на структурированные запросы. Apple предоставляет функцию извлечения конфиденциальной информации для iPhone, позволяя сопоставлять номера звонящих с базами данных спам-звонков, не раскрывая номер, а Microsoft использует ту же схему для паролей в браузере Edge. Функция Queryable Encryption в MongoDB позволяет клиентам шифровать поля перед отправкой, что дает серверу возможность выполнять сопоставление по равенству и диапазону, основываясь исключительно на зашифрованном тексте.
Однако для открытых поисковых запросов лучшие ответы сегодня по-прежнему зависят от доверия; проверяемый зашифрованный поиск еще не появился в лабораторных условиях. Brave обещает нулевое хранение данных в собственном индексе, содержащем 40 миллиардов страниц (а не в индексе Google), но он все еще находится на уровне протокола. Exa создала нейронный индекс, который семантически встраивает ключевые слова пользователя, сопоставляя результаты на основе семантики, но этот этап встраивания все еще начинается с открытого текста на серверах Exa. В статье Tiptoe, опубликованной в MIT в 2023 году, удалось добиться ранжирования 360 миллионов веб-страниц без раскрытия запросов, но каждый поиск потребляет значительное количество вычислительной мощности сервера, и качество ранжирования отличается от незашифрованных поисков. В статье Wally, опубликованной Apple в 2024 году, затраты на связь снижаются до 31 раза за счет сокрытия реальных запросов среди подставных, но эта математика становится дешевой только при миллионах одновременных запросов, масштабе, которым в настоящее время не обладает ни одна частная поисковая система.
Поиск с использованием шифрования вполне осуществим; просто он еще не достиг коммерчески жизнеспособного уровня с точки зрения производительности и цены.
Outlook
Спрос на приватный ИИ растёт. Компания Venice AI недавно превысила отметку в 3,5 миллиона зарегистрированных пользователей и ежемесячный объём обработки в 1,3 триллиона токенов, после чего завершила новый раунд финансирования серии А на сумму 1 миллиард долларов. Её прямым конкурентом является Proton, чей чат-продукт Lumo за год после запуска превысил 10 миллионов пользователей. Что касается инфраструктуры, Phala в настоящее время ежедневно обрабатывает от 2 до 3 миллиардов токенов на OpenRouter. Duck.ai направляет gpt-oss-120b и Gemma в анклав Tinfoil, обеспечивая проверяемую конфиденциальность, выходящую за рамки пользовательских прокси. Это даже не учитывает самохостинг, который, вероятно, является крупнейшим каналом для приватного вывода, поскольку модели работают на собственном оборудовании пользователя, не оставляя следов использования.
Однако в более широкой волне развития ИИ для массового потребителя конфиденциальность в ИИ занимает лишь крошечную долю, и этот разрыв сократится только тогда, когда передовые лаборатории целенаправленно удовлетворят этот спрос. В мае Google обработал 320 триллионов токенов во всех своих продуктах, что означает, что ежемесячная пропускная способность Venice примерно эквивалентна 18 минутам работы Google. В ноябре прошлого года Google запустил Private AI Compute (PAC), в рамках которого некоторые функции на базе Gemini работают в закрытых анклавах TPU, изолированных от самой компании, а разработка была независимо проверена NCC Group. Однако проблема в том, что PAC охватывает лишь некоторые функции Pixel, такие как персонализированные рекомендации и аудиорезюме, а не приложения Gemini, используемые сотнями миллионов пользователей. Google готов передавать проекты аудиторам, потому что эти функции монетизируются за счет устройств и рекламы, а не за счет продажи токенов.
Существующие решения на основе хостинга также несовершенны. Пользователям, стремящимся к максимальной конфиденциальности за счет сквозного шифрования (E2EE), приходится ждать, пока новые функции будут переработаны в тех местах, которые недоступны для чтения поставщикам услуг. Частные системы по-прежнему полагаются на протоколы на уровне сервисов. Доступная по цене постобработка по-прежнему требует доверия к сторонним поставщикам для достижения наилучших результатов тонкой настройки. Самостоятельный хостинг полностью исключает всех поставщиков услуг, но запуск самых надежных моделей с открытым исходным кодом локально может стоить дороже, чем здание, в котором они размещены.
Несмотря на недостатки, частный ИИ стал реальным и доступным вариантом, а оставшиеся пробелы сокращаются. Для обычных потребителей открытые модели частных чатов на Lumo и Venice с гарантией отсутствия логов ничего не стоят, в то время как подписки от Venice или Tinfoil за 18-20 долларов инкапсулируют те же чаты в анклавы, что не дороже подписки на ChatGPT. Для корпоративных рабочих процессов конечные точки с аттестацией теперь даже дешевле, чем маршруты с открытым текстом. Такие конечные точки, как API E2EE от NEAR, теперь могут передавать зашифрованный контекст в анклавы, при этом память, загрузка файлов и пользовательские инструкции работают поверх E2EE уже сегодня. Что касается постобучения с аттестацией, грядущая видеокарта NVIDIA Vera Rubin NVL72 расширит возможности конфиденциальных вычислений с 8-карточных узлов Blackwell до 72-карточных стоек, что сделает передовые циклы обучения с подкреплением более осуществимыми без раскрытия IP-адресов.
Однако ключевая ценность заключается в том, что она выходит за рамки этих уровней ценового сжатия. Конфиденциальность практически бесплатна там, где она уже существует, но она не охватывает основные рабочие процессы агентов. Операторы, ориентированные на аренду и продажу анклавов, удерживают переключатель на стандартных чипах, а не создают защитный барьер, в то время как шлюзы протокольного уровня конкурируют наряду с традиционным промежуточным программным обеспечением. Защитная территория — это та половина отчета, которая остается нерешенной: циклы обучения, заблокированные в анклавах, сквозные закрытые вызовы инструментов и невидимые индексы поиска по терминам. Тот, кто первым добьется чего-то одного из этого, будет продавать то, что невозможно будет превратить в товар в ценовой войне. Капитал, стремящийся к созданию ИИ, ориентированного на конфиденциальность, должен покупать пробелы, а не этот переключатель.
Итак, доверять или проверять? Для задач, требующих интенсивного выполнения и работы с агентами, выбирайте доверие, поскольку каждый вызов инструмента по своей сути передает открытый текст в места назначения, которые не могут быть защищены анклавами, и передовые модели заслуживают своей цены в таких циклах. Что касается высокоуровневого мышления, отличающего компанию от конкурентов, выбирайте проверку. Стратегия, планирование и суждения, выработанные за годы профессионального опыта, — это именно та самая спорная альфа-версия. Путь вперед заключается в тонкой настройке моделей с открытым исходным кодом с использованием этих собственных знаний в рамках контроля компании. В областях, где находится альфа-версия компании, экспертно настроенные открытые модели уже одновременно превзошли передовые модели по точности и стоимости, а инфраструктура для их построения в условиях конфиденциальности появляется узел за узлом.
Данный контент предназначен исключительно для информационных и образовательных целей и не является инвестиционным советом, связанным с BTCC. BTCC прилагает все усилия, но не может гарантировать правдивость, точность или оригинальность вышеприведенного контента.