La encrucijada de la IA: ¿Por qué Wall Street le dice "no" a ChatGPT y a Claude?

chaincatcherchaincatcher

Autor: Jeff @IOSG

 

¿Por qué se necesita la IA privada?

El 1 de julio, Alex Karp, CEO de Palantir, concedió una entrevista de 20 minutos a CNBC, que algunos medios calificaron de "colapso mental". Según Karp, las empresas pagan una prima simbólica a laboratorios de vanguardia mientras ven cómo su propiedad intelectual se filtra a los proveedores de modelos. Se refirió a esta fuga como la transferencia de alfa, que se produce a nivel arquitectónico: cada solicitud enviada a un modelo de código cerrado llega al servidor del proveedor de servicios en texto plano. Días antes de la emisión del programa, Palantir había anunciado una alianza con NVIDIA para ejecutar modelos abiertos de Nemotron en entornos controlados por el cliente, acompañada de una declaración de soberanía de IA de nueve puntos. Tras la emisión del programa de CNBC, PLTR experimentó un alza del 8%.

 

Durante los últimos veinte años, las empresas han adoptado software en la nube basado en la confianza a nivel de protocolo, y ha funcionado. Cada proveedor de SaaS solo ve una parte de los datos empresariales, y la mayoría tiene pocos incentivos para integrar los datos de los clientes en sus productos principales. Salesforce ve los canales de venta, Workday ve los recursos humanos, Jira ve las iteraciones de desarrollo y AWS proporciona la base para el almacenamiento y la computación. Sin embargo, los flujos de trabajo de IA actuales abogan por la carga única de todos los activos, junto con el contexto estructurado que conecta los distintos departamentos, en busca de maximizar la productividad. Dejando de lado la buena voluntad, los proveedores de servicios ascendentes ahora pueden usar estos datos para desarrollar nuevas funcionalidades en lugar de dejarlos almacenados en servidores sin uso.

 

Nadie baja el ritmo; los ingresos anuales de Anthropic alcanzaron los 47.000 millones de dólares en mayo, un salto significativo respecto a los 9.000 millones previstos para finales de 2025, mientras que OpenAI superó los 900 millones de usuarios activos semanales en febrero. Ambas compañías completaron nuevas rondas de financiación esta primavera, con valoraciones cercanas al billón de dólares, y se espera que salgan a bolsa con valoraciones aún mayores. Años de acusaciones sobre privacidad y propiedad intelectual no han hecho que ninguna de las dos empresas pierda impulso.

 

Algunas empresas ya han tomado medidas. En febrero de 2023, menos de tres meses después del lanzamiento de ChatGPT, los principales bancos de Wall Street restringieron su uso. En mayo de 2023, tras la filtración del código fuente de un chip por parte de un ingeniero de Samsung en ChatGPT, la empresa prohibió la IA generativa en toda su red. En respuesta, OpenAI lanzó ChatGPT Enterprise en agosto de ese mismo año, comprometiéndose a no utilizar datos comerciales para el entrenamiento, junto con un protocolo de retención cero de datos (ZDR), que posteriormente se convirtió en un requisito estándar para las adquisiciones empresariales.

 

Sin embargo, los contratos solo protegen las cuentas de la empresa. IBM descubrió que, para 2025, la IA en la sombra (empleados que alimentaban herramientas de IA no autorizadas con datos de la empresa a través de cuentas personales) estaba involucrada en una quinta parte de los incidentes de filtración de datos, y el uso intensivo de IA en la sombra añadía un promedio de 670 000 dólares a los costes de las filtraciones. En una encuesta realizada en 2025 por la empresa de formación en seguridad Anagram, cuatro empleados indicaron que estarían dispuestos a infringir las políticas de uso de la IA para completar tareas más rápidamente.

 

Las empresas pueden, al menos, invertir dinero para evitar problemas mediante contratos ZDR y niveles de servicio sin capacitación. Si eres un gobierno o cliente de Palantir, existen opciones de implementación soberana. Sin embargo, para usuarios comunes como tú y yo, la importancia de la IA en materia de privacidad sigue siendo un tema de debate hasta que llega una citación judicial.

 

En mayo de 2025, una orden judicial obligó a OpenAI a conservar incluso los registros de chat de los usuarios que estos habían borrado. En noviembre, un juez ordenó la transferencia de 20 millones de esos registros a los abogados de The New York Times como prueba. Posteriormente, surgieron casos penales: los registros de ChatGPT del acusado en el caso del incendio provocado en Palisades se presentaron como prueba, y una declaración jurada en un caso de doble homicidio en Florida citó las preguntas del sospechoso sobre cómo deshacerse de un cadáver. Sam Altman también admitió en una entrevista en julio de 2025 que las conversaciones de ChatGPT no están protegidas por el secreto profesional y que, en un litigio, OpenAI "podría verse obligada a entregar" los registros de chat de los usuarios.

 

La cuestión es que no solo los delincuentes necesitan conversaciones privadas. El archivo de conversaciones entre personas e inteligencia artificial, que pueden ser objeto de citación judicial, representa un aspecto de vigilancia del que la mayoría de los usuarios no son conscientes. Una encuesta realizada por Kolmogorov Law en octubre de 2025 a 1000 usuarios estadounidenses de IA reveló que el 50 % desconocía que estas conversaciones pudieran ser objeto de citación judicial, mientras que dos tercios creían que estos chats deberían recibir la misma protección que las consultas con abogados o médicos.

 

Los modelos autoalojados o de código abierto que se ejecutan en entornos verificables están avanzando rápidamente, pero los más potentes aún se encuentran a unos cuatro meses por detrás de los modelos de código cerrado de última generación en cuanto a capacidades generales. Esto coloca a las empresas y a los particulares que se dedican a maximizar la seguridad de sus tokens en una encrucijada: o bien sacrifican unos meses de calidad del modelo a cambio de privacidad, o bien siguen subiendo material sensible a los servidores de Anthropic, ya que sus competidores obtienen ventajas de productividad de esta manera.

 

Actualmente, no existen soluciones perfectas en el mercado. Un informe describe los intentos de diversas partes por reducir esta brecha y analiza cuán lejos está la inteligencia de vanguardia, con privacidad verificable, de llegar a las empresas y a los usuarios comunes.

 

Cómo se logra actualmente la privacidad

La IA de privacidad no es un proyecto único, pero todos los mecanismos disponibles en el mercado abordan el mismo evento: una solicitud sale de tu dispositivo, recorre la red, llega a una máquina que ejecuta el modelo y, finalmente, devuelve una respuesta. La diferencia entre los mecanismos radica en dónde se encuentra el texto sin cifrar a lo largo de este proceso, quién puede leerlo y qué se utiliza para verificar la privacidad de la respuesta.

 

Privacidad a nivel de protocolo

En este nivel, además de ti, otros pueden leer tu mensaje en texto plano, y lo que suceda a continuación depende completamente de una promesa.

 

La retención cero contractual es la solución empresarial. El proveedor de servicios sabe quién es usted, procesa su solicitud y se compromete a no retenerla, lo cual se garantiza mediante contratos y su reputación.

 

Los proxies anónimos borran tu identidad, pero no cifran lo que dices; los proveedores de servicios posteriores siguen manejando el texto sin cifrar según sus propias políticas. Los términos varían según el proveedor; por ejemplo, Duck.ai (el chatbot de DuckDuckGo) puede negociar acuerdos de eliminación con los proveedores de modelos, mientras que Venice asume que los usuarios darán por sentado que el proveedor de servicios conservará toda la información, pero ninguna de las partes puede verificarlo.

 

Cada segmento de la ruta entre máquinas se ejecuta mediante TLS, que solo cifra el flujo de datos; el receptor puede leer toda la información. Los repetidores suelen usar HTTP Oblivious (RFC 9458) para separar este derecho a saber, funcionando como un amigo que pasa una nota. El amigo sabe quién la pasó, pero no puede leer el contenido; el destinatario puede leer el contenido, pero no sabe quién la escribió. OHTTP se convirtió en un estándar de la IETF en enero de 2024, y muchas empresas ahora gestionan el tráfico de producción en repetidores OHTTP alquilados a Cloudflare y Fastly.

 

Este es también el límite de privacidad que se puede alcanzar al acceder a modelos de código cerrado, debido a un problema matemático. El costo actual de la capacitación de alto nivel asciende a miles de millones, y la valoración de estos laboratorios, cercana al billón de dólares, se basa en la exclusividad de los pesos de los modelos. La duración de la brecha en la capacidad del modelo determina la duración de la prima; por lo tanto, los laboratorios protegen los archivos de pesos como secretos de Estado.

 

Meta llevó a cabo este experimento de forma pasiva. El modelo LLaMA, lanzado en febrero de 2023, inicialmente solo estaba disponible para investigadores, pero en una semana, los pesos se filtraron a 4chan en forma de semilla. Una semana después, llama.cpp permitió que el modelo más pequeño de 7B se ejecutara localmente en una MacBook, y tres días después, Stanford ajustó un asistente de chat, Alpaca, con el mismo modelo por menos de 600 dólares. Esta filtración redujo los costos operativos de Llama a la electricidad, lo que permitió que cualquiera con el archivo lo ejecutara en casa. En julio de 2023, Meta lanzó oficialmente Llama 2 como código abierto con una licencia comercial que excluía una cláusula para 700 millones de usuarios activos mensuales. Los pesos se ejecutaron y, posteriormente, llegó la versión premium.

 

En teoría, los laboratorios de vanguardia podrían proporcionar una prueba remota para la inferencia en modelos de código cerrado, pero esta prueba solo demuestra qué segmento de código leyó la solicitud; no puede demostrar qué hizo ese código con ella. Para determinar si el servidor conservó datos, necesitamos auditar el código del servidor y reconstruirlo a partir del hash reportado por el hardware. Sin embargo, una vez que se entrega el código del servidor, el laboratorio también renuncia a las técnicas de procesamiento por lotes y almacenamiento en caché que sustentan los márgenes de ganancia, y estas técnicas migrarán a cada futura generación de modelos. Apple y Meta pueden proporcionar una prueba remota para las pilas de servicios detrás del iPhone y WhatsApp porque sus ganancias provienen de los dispositivos y la publicidad, y la divulgación pública del código del servicio prácticamente no genera costos.

 

Por eso, los pesos y el código de servicio de los modelos insignia no llegan a los operadores externos. Sin operadores externos, no hay certificación de terceros; sin certificación, la privacidad verificable solo existe en los modelos de código abierto.
 

Privacidad a nivel estructural

Cada mecanismo de esta categoría sustituye las promesas de confianza por pruebas de hardware, criptográficas o físicas, pero cada uno conlleva costes diferentes para las mejoras de privacidad, principalmente porque solo pueden ejecutar modelos de código abierto.

 

TEE (Trusted Execution Environment) Confidential Computing ejecuta la inferencia dentro de un enclave de hardware (una cámara sellada en el chip que ni siquiera el operador de la máquina puede abrir); el chip firmará una certificación que detalla qué modelo y segmento de código se ejecutó.

 

La solicitud solo se sella en el punto final. Persiste un rol a lo largo de la ruta mediada por el proxy que puede leer texto plano, y solo el protocolo impide que el proxy registre o filtre el contenido del relé.

 

El cifrado de extremo a extremo (E2EE) protege los relés legibles. El dispositivo del usuario cifra el mensaje con la clave del enclave, y cada salto intermedio contiene un paquete sellado que solo el enclave puede abrir.

 

La confianza recae en el cliente. El código responsable de cifrar la solicitud y verificar la certificación también tiene la capacidad de revocar esta garantía. Por lo tanto, el cifrado de extremo a extremo verificable requiere tanto un enclave probado como un código cliente abierto y reproducible.

 

En comparación con la simplicidad de TEE, el costo de E2EE radica en la complejidad de la ingeniería, lo que también ralentiza la integración funcional. E2EE convierte al proxy en un mensajero ciego, por lo que todas las funciones que dependen de la lectura de texto plano deben reconstruirse en torno a la clave del cliente o reconstruirse únicamente internamente dentro del enclave.

 

El cifrado homomórfico completo (FHE, por sus siglas en inglés) y sus variantes MPC eliminan por completo a la parte de confianza. El servidor realiza cálculos sobre el texto cifrado en una caja fuerte que nunca podrá abrir; la clave solo está en tus manos. Por otro lado, el MPC (computación multipartita) divide la solicitud en partes secretas distribuidas entre varias partes, logrando el mismo efecto a menos que todos los participantes conspiren.

 

El precio a pagar es la velocidad. FHE solo realiza sumas y multiplicaciones de forma nativa, por lo que los pasos no lineales necesarios para la operación del transformador deben reconstruirse a un alto costo. El costo de inferencia en el texto cifrado es de 10 000 a 100 000 veces mayor que en el texto plano, y cada token en modelos pequeños tarda de segundos a minutos, mientras que en condiciones sin cifrar, solo tarda milisegundos.

 

Se espera que los chips personalizados para la computación cifrada reduzcan la brecha, pero el primer prototipo no completará su demostración hasta principios de 2026, y las versiones comerciales tardarán algunos años más.

 

La inferencia local elimina directamente esta posibilidad. El modelo se ejecuta en su propio hardware, sin intermediarios, servidores, proveedores de servicios ni requisitos de verificación.

 

Los costos evidentes son el precio y la capacidad del modelo. gpt-oss-120b obtiene aproximadamente la mitad que GLM-5.2 en el índice de Análisis Artificial, pero su tamaño es de 65 GB, superando la VRAM combinada de dos tarjetas gráficas de gama alta para juegos disponibles en el mercado. El GLM-5.2 de precisión completa solo puede ejecutarse en un nodo de centro de datos de 8 tarjetas, con un costo superior a los 300 000 dólares solo para las GPU.

 

Sin embargo, más allá de estas limitaciones estructurales, el costo de implementar la inferencia en enclaves está disminuyendo. En la inferencia de una sola tarjeta, las pruebas de rendimiento del proveedor de servicios en la nube Phala muestran que la pérdida de rendimiento para el modo enclave H100 es, en promedio, inferior al 7%, y prácticamente nula en modelos grandes, ya que el costo principal reside en transferir datos al chip, no en el procesamiento dentro del mismo. En la inferencia de múltiples tarjetas, la GPU Blackwell de próxima generación de NVIDIA ahora admite el cifrado directo del tráfico entre chips, mientras que la H100 anterior solo puede lograr el mismo efecto enrutando a través de la CPU host a una séptima parte del ancho de banda. Las propias pruebas de rendimiento de NVIDIA en Blackwell muestran que la pérdida de rendimiento para un modelo 397B en modo enclave es inferior al 8%. Con estos avances, la pérdida de rendimiento de la inferencia de privacidad ya no es una limitación decisiva.

 

De hecho, el enclave en sí mismo casi no añade costes operativos adicionales para el operador. Todos los H100 posteriores a 2023 vienen con el modo enclave, y el coste adicional es la pérdida de rendimiento causada por el cifrado, no chips adicionales. Actualmente, el precio de alquiler para las SKU de H100 confidenciales en Azure sigue siendo de 8,90 $ por hora, mientras que sin enclave es de 6,98 $, lo que representa un margen de beneficio del 27 % con respecto a las instalaciones de nube tradicionales. Por otro lado, operadores como Phala que se especializan en enclaves están alquilando H100 en modo confidencial a partir de 3,80 $ por hora, más bajo que el rango de precios de 3,99 $ a 4,29 $ para las tarjetas SXM estándar de Lambda. En soluciones de API alojadas, NEAR AI ofrece endpoints con atestación a 0,15 $ por millón de tokens de entrada y 0,55 $ de salida para gpt-oss-120b, comparable a las rutas de texto plano en Amazon Bedrock, Together y Groq. Incluso para los modelos que requieren paralelismo multichip, el precio de NEAR AI en GLM 5.2 es idéntico al de Fireworks, y en el modelo más grande, Kimi K2.6, las entradas son un 15 % más baratas y las salidas un 4 % más baratas.

 

Si bien estos nuevos proveedores de inferencia de privacidad pueden estar sacrificando beneficios para captar cuota de mercado (esto se aplica a cualquier empresa del mercado que busque crecer), la tendencia estructural es que el coste de la privacidad está disminuyendo tanto para los consumidores como para los operadores.

 

Cómo triunfan los modelos de código abierto

A pesar de que la sobrecarga de rendimiento se ha reducido, sigue existiendo una brecha visible entre los modelos de vanguardia y los modelos de código abierto de última generación. Una entidad que busca la máxima productividad aún necesita confiar en que los laboratorios de vanguardia no roben su propiedad intelectual.

 

La brecha aún existe, pero AIA Labs, bajo la dirección de Bridgewater, y Thinking Machines presentaron un ejemplo el 30 de junio: un modelo abierto, ajustado con anotaciones de expertos, superó simultáneamente a un modelo de vanguardia tanto en precisión como en coste.

 

En el estudio, el equipo ajustó el modelo Qwen3-235B en Tinker (el servicio API de ajuste fino alojado por Thinking Machines). Primero, obtuvieron las anotaciones del proveedor, entrenaron la primera ronda con este lote de datos y luego enviaron las muestras divergentes al personal de inversión de la empresa para su reanotación. El entrenamiento utilizó aprendizaje por refuerzo (GRPO) junto con tres modificaciones: procesamiento por lotes round-robin (cada tarea produce un lote por turnos), pérdida CISPO (que limita hasta dónde puede llegar una sola respuesta con el modelo) y destilación en política (que se ancla al punto de control óptimo actual para garantizar que el modelo no aprenda de copias más débiles).

 

Todas las tareas se basaron en los flujos de trabajo diarios del personal de inversión: si un artículo de noticias es importante para los directivos de inversión, si un documento del banco central sugiere futuros cambios en los tipos de interés y por dónde empezar con las frases predefinidas en un documento o correo electrónico. La puntuación provino de un conjunto de pruebas independiente, donde los modelos de vanguardia obtuvieron un promedio de aproximadamente el 50 % en indicaciones sencillas y solo alcanzaron el 78,2 % con indicaciones de expertos, por debajo del umbral del 80 % establecido por el personal de inversión. El modelo Qwen optimizado logró un 84,7 %, lo que, según el texto original, significa que cometió un 29,8 % menos de errores que el modelo óptimo de vanguardia, con costes de inferencia 13,8 veces menores.

 

https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/

Este caso demuestra que los modelos de código abierto pueden ser superiores en precisión y coste, pero el proceso de entrenamiento sigue sin ser privado. Las anotaciones de expertos utilizadas son datos propietarios de Bridgewater, que pasan por el servicio de terceros de Tinker y alcanzan el mismo nivel de confianza que el protocolo ZDR. El fondo también alquiló capacidad de procesamiento, y todo el entrenamiento se ejecutó en máquinas que nunca controló. Los compradores que buscan esta fórmula sin la suposición de confianza tienen muy pocas opciones hoy en día. Alquilar clústeres de GPU sin infraestructura física permite que los operadores de la nube comprendan el proceso de entrenamiento. Comprar un clúster resuelve el problema del alojamiento de datos, pero los costes se disparan.

 

La ruta con certificación acaba de llegar. En marzo, Workshop Labs y Tinfoil lanzaron Silo, una pila de post-entrenamiento que se ejecuta en enclaves de Tinfoil en un único nodo de 8 tarjetas, con claves controladas exclusivamente por el cliente. El artículo indica que el coste del enclave añade 11 minutos a una sesión de entrenamiento de dos horas, y esta pila puede albergar un modelo de un billón de parámetros (Kimi K2 Thinking) congelando los pesos base y entrenando únicamente adaptadores pequeños sobre ellos. El desafío reside en que el aprendizaje por refuerzo requiere transferir datos entre componentes, y es precisamente en esta transferencia de datos donde surgen los costes del enclave.

 

Menos de un mes después del lanzamiento de Silo, Workshop Labs fue adquirida por Thinking Machines, y todos los componentes necesarios para ejecutar el siguiente ciclo de aprendizaje por refuerzo al estilo Bridgewater en el enclave ahora están bajo la misma compañía.

 

Privacidad en la capa del arnés

Existe otro problema que escapa al control de todos los mecanismos de inferencia privados. Estos mecanismos gestionan la ruta desde la solicitud hasta el modelo, mientras que cada llamada a una herramienta externa iniciada por un agente abre una ruta que la capa de inferencia, en esencia, no puede modificar. La reciente tendencia de la ingeniería de arneses agrava el problema: cada herramienta, almacenamiento de memoria y fuente de datos que rodea al modelo constituye un destino más que lee su parte del flujo de trabajo en texto plano. Los servidores de calendario leen los horarios, los servidores de bases de datos leen las consultas. Un agente completamente local aún necesita enviar términos de búsqueda en texto plano a un motor de búsqueda si desea obtener información fuera del conjunto de entrenamiento, ya que el servidor no puede leer texto plano y, por lo tanto, no puede responder a las preguntas.

 

Las soluciones convencionales siguen recurriendo a la capa de protocolo. Empresas como Runlayer y MintMCP utilizan una puerta de enlace central para controlar todo el tráfico de las herramientas, enmascarando la información personal identificable (PII) antes de que las solicitudes salgan. La puerta de enlace también decide qué servidores pueden recibir tráfico, bloqueando los que no han sido verificados, y registra el destino y el contenido de cada llamada para futuras consultas. Aunque estos controles cuenten con auditorías independientes (SOC 2), los servidores de las herramientas aún necesitan leer las consultas en texto plano para responder, y la retención de copias depende de sus propias políticas de retención, multiplicadas por cada herramienta en el entorno. Además, la propia puerta de enlace es una entidad de lectura adicional que depende de la confianza a lo largo de la ruta, en lugar de la verificación.

 

Las soluciones a nivel estructural se centran en esa capa intermedia. Por ejemplo, Phala aloja directamente el servidor MCP dentro de un TEE, abarcando carteras, ejecución de código y fuentes de datos, lo que permite a los usuarios verificar las declaraciones de privacidad mediante una certificación en lugar de confiar en el operador. Sin embargo, las herramientas alojadas en TEE aún necesitan enviar consultas en texto plano a los proveedores de servicios; el enclave solo protege al remitente, no al destinatario.

 

Solo unos pocos destinos han aprendido a responder sin leer, pero únicamente para consultas estructuradas. Apple ofrece recuperación de información privada para el iPhone, lo que permite cotejar los números de las personas que llaman con bases de datos de llamadas no deseadas sin exponer el número, y Microsoft utiliza el mismo esquema para las contraseñas en el navegador Edge. El cifrado consultable de MongoDB permite a los clientes cifrar los campos antes de enviarlos, lo que posibilita que el servidor realice comparaciones de igualdad y de rango basándose únicamente en el texto cifrado.

 

Sin embargo, para búsquedas abiertas, las mejores respuestas hoy en día aún se basan en la confianza; la búsqueda cifrada verificable aún no ha salido del laboratorio. Brave promete cero retención de datos en su propio índice de 40 mil millones de páginas (en lugar del de Google), pero aún se encuentra bajo la capa de protocolo. Exa construyó un índice neuronal que incrusta palabras clave del usuario semánticamente, haciendo coincidir resultados basados en la semántica, pero este paso de incrustación aún comienza desde texto plano en los servidores de Exa. El artículo Tiptoe del MIT de 2023 logró la clasificación en 360 millones de páginas web sin exponer las consultas, pero cada búsqueda consume una cantidad significativa de potencia de cálculo del servidor, y la calidad de la clasificación difiere de las búsquedas no cifradas. El artículo Wally de Apple de 2024 reduce los costos de comunicación hasta 31 veces al ocultar consultas reales entre señuelos, pero este cálculo solo resulta económico con millones de consultas concurrentes, una escala que ningún sistema de búsqueda privada posee actualmente.

 

La búsqueda cifrada es factible; simplemente aún no ha alcanzado un nivel comercialmente viable en términos de rendimiento y precio.

 

Perspectiva

La demanda de IA privada está creciendo. Venice AI superó recientemente los 3,5 millones de usuarios registrados y un rendimiento mensual de 1,3 billones de tokens, completando posteriormente una nueva ronda de financiación de capital Serie A valorada en 1.000 millones de dólares. Proton es su competidor directo, con su producto de chat Lumo superando los 10 millones de usuarios en el primer año de su lanzamiento. En términos de infraestructura, Phala actualmente gestiona entre 2.000 y 3.000 millones de tokens diarios en OpenRouter. Duck.ai enruta gpt-oss-120b y Gemma al enclave de Tinfoil, proporcionando privacidad verificable más allá de los proxies de usuario. Esto sin siquiera considerar el autoalojamiento, que probablemente sea el canal más importante para la inferencia privada, ya que los modelos se ejecutan en el propio hardware, sin dejar rastro de uso.

 

Sin embargo, en la ola más amplia de IA convencional, la IA de privacidad ocupa solo una pequeña parte, y esta brecha solo se cerrará cuando los laboratorios de vanguardia satisfagan intencionalmente esta demanda. En mayo, Google procesó 320 billones de tokens en todos sus productos, lo que significa que el rendimiento mensual de Venice es aproximadamente equivalente a los 18 minutos de Google. En noviembre pasado, Google lanzó Private AI Compute (PAC), ejecutando algunas funciones basadas en Gemini en enclaves TPU sellados y aislados de la propia empresa, con un diseño auditado de forma independiente por NCC Group. Sin embargo, el problema es que PAC solo cubre algunas funciones de Pixel, como recomendaciones personalizadas y resúmenes de audio, no las aplicaciones de Gemini utilizadas por cientos de millones de personas. Google está dispuesto a entregar los diseños a los auditores porque estas funciones se monetizan a través de dispositivos y publicidad, no mediante la venta de tokens.

 

Las soluciones de alojamiento actuales también son imperfectas. Los usuarios que buscan la máxima privacidad mediante cifrado de extremo a extremo deben esperar a que se desarrollen nuevas funcionalidades en áreas a las que los proveedores de servicios no tienen acceso. Los sistemas de seguridad privados aún dependen de protocolos en la capa de servicio. Para lograr una optimización óptima, es necesario confiar en proveedores externos. El autoalojamiento elimina por completo a todos los proveedores de servicios, pero ejecutar localmente los modelos de código abierto más robustos puede resultar más caro que el propio edificio que los alberga.

 

Dejando a un lado sus defectos, la IA privada se ha convertido en una opción real y asequible, y las brechas restantes se están reduciendo. Para los consumidores comunes, los chats privados de modelo abierto en Lumo y Venice, con promesas de no guardar registros, son gratuitos, mientras que las suscripciones de Venice o Tinfoil, con precios entre 18 y 20 dólares, encapsulan los mismos chats en enclaves, sin ser más caras que una suscripción a ChatGPT. Para los flujos de trabajo empresariales, los puntos finales con atestación son ahora incluso más baratos que las rutas de texto plano. Puntos finales como la API E2EE de NEAR ahora pueden incorporar contexto cifrado a los enclaves, con memoria, carga de archivos e instrucciones personalizadas que operan sobre E2EE actualmente. En cuanto al post-entrenamiento con atestación, la próxima Vera Rubin NVL72 de NVIDIA extenderá la computación confidencial de los nodos de 8 tarjetas de Blackwell a racks de 72 tarjetas, lo que hará que los bucles de aprendizaje por refuerzo de vanguardia sean más factibles sin exponer la propiedad intelectual.

 

Sin embargo, la clave para capturar valor reside más allá de estos niveles de compresión de precios. La privacidad es prácticamente gratuita donde ya existe, pero no se ha extendido a los flujos de trabajo de agentes convencionales. Los operadores centrados en alquilar y vender enclaves controlan un interruptor en chips estándar, no una barrera de entrada, mientras que las pasarelas de capa de protocolo compiten con el middleware tradicional. El terreno defendible es la mitad de este informe que aún no se ha resuelto: bucles de entrenamiento bloqueados en enclaves, llamadas a herramientas selladas de extremo a extremo e índices de búsqueda de términos invisibles. Quien logre primero una de estas soluciones venderá algo que no podrá convertirse en mercancía mediante ninguna guerra de precios. El capital que busca IA de privacidad debería comprar las brechas, no ese interruptor.

 

Entonces, ¿confiar o verificar? Para tareas que requieren mucha ejecución y mucha intervención de agentes, elija la confianza, porque cada llamada a una herramienta entrega inherentemente texto plano a destinos que los enclaves no pueden sellar, y los modelos de vanguardia merecen su precio en tales bucles. En cuanto al pensamiento estratégico que distingue a una empresa de sus competidores, elija la verificación. La estrategia, la planificación y los juicios destilados de años de experiencia profesional son precisamente ese alfa disputado. El camino a seguir es ajustar los modelos de código abierto con estos conocimientos propios dentro de los límites del control de la empresa. En los dominios donde reside el alfa de una empresa, los modelos abiertos ajustados por expertos ya han superado simultáneamente a los de vanguardia en precisión y costo, y la infraestructura para construirlos en entornos de privacidad está llegando nodo por nodo.

Este contenido se proporciona únicamente con fines informativos y educativos y no constituye asesoramiento de inversión relacionado con BTCC. BTCC realiza todos los esfuerzos posibles, pero no puede garantizar la veracidad, exactitud u originalidad del contenido anterior.