Fireworks, que se originó a partir de Meta, analiza el código abierto frente al código cerrado: ¿quién ganará?
BlockbeatsAutor: Silicon Valley VectorCreador del vídeo: Silicon Valley Vector
Editado por: Peggy, BlockBeats
Nota del editor: Con los modelos de código abierto acercándose rápidamente a la vanguardia de los modelos de código cerrado y los precios de inferencia en constante descenso, los debates del sector están pasando de "¿quién tiene el modelo más potente?" a "¿quién puede implementar el modelo en producción a un menor coste?". Sin embargo, a medida que las capacidades de los modelos convergen y el aumento del consumo de tokens se convierte en un consenso, surge una pregunta más fundamental: ¿Qué están realmente dispuestas a pagar las empresas: llamadas a modelos más baratas o inteligencia dedicada capaz de completar tareas específicas de forma fiable?
Recientemente, Cao Qingyun, presentadora de "Silicon Valley Coordinates", conversó con Chen Yufei, cofundadora de Fireworks AI. Fireworks, que se sitúa entre los modelos y las aplicaciones empresariales, ofrece principalmente a sus clientes servicios de inferencia de modelos de código abierto, optimización del rendimiento y personalización. En lugar de limitarse a debatir si el código abierto puede alcanzar al código cerrado, las observaciones de Chen Yufei se centran en las cargas de trabajo reales: ¿a dónde van los tokens?, ¿por qué las empresas pagan? y ¿qué falta aún para que los modelos pasen de la prueba de concepto a la producción?

En este diálogo, Chen Yufei desglosó la cuestión del "código abierto frente al código cerrado" en una serie de preguntas estructurales más fundamentales: ¿Puede el crecimiento de tokens convertirse en ingresos? ¿Pueden las capacidades generales reemplazar la acumulación vertical? ¿Pueden los modelos de bajo precio superar la evaluación empresarial? ¿Y cómo pueden las plataformas de inferencia generar valor entre los proveedores de la nube y las empresas de aplicaciones?
En primer lugar, la escala de uso y el valor comercial de los modelos de código abierto están divergiendo. Anteriormente, la mejora de las capacidades y los precios de las llamadas eran los principales indicadores de la competitividad del código abierto; hoy en día, la plataforma Fireworks procesa aproximadamente entre 400 y 500 gigabits de tokens al día, y el uso real de los modelos de código abierto se ha expandido rápidamente. Sin embargo, el tráfico gratuito, las subvenciones promocionales y las diferencias de precio entre modelos pueden provocar que las estadísticas de tokens sobreestimen cierta demanda. Los clientes pueden utilizar intensivamente los modelos de bajo coste, pero aun así destinar sus mayores presupuestos a los modelos de código cerrado más eficaces. Esto significa que la siguiente etapa para el código abierto ya no se trata solo de aumentar el tráfico, sino de demostrar su capacidad para alcanzar o incluso superar a los modelos de vanguardia en tareas de alto valor y de traducir las ventajas de costes en disposición a pagar.
En segundo lugar, los modelos de propósito general y los modelos verticales están comenzando a evolucionar en direcciones diferentes. En el pasado, cada actualización de un modelo de vanguardia podía dejar obsoleto directamente un conjunto de modelos optimizados; ahora, las aplicaciones verticales, como las de derecho, sanidad y programación, acumulan evaluaciones, datos y flujos de trabajo más detallados, y sus objetivos de optimización se alejan gradualmente de los de los laboratorios de vanguardia. Los modelos de propósito general necesitan aumentar su capacidad, mientras que los modelos verticales deben ofrecer resultados estables en escenarios limitados. Los primeros pueden resolver una gama más amplia de problemas, mientras que los segundos comprenden mejor cómo definen los usuarios la "corrección". Esto significa que la barrera de entrada para las empresas verticales no reside únicamente en tener un modelo personalizado, sino en la capacidad de traducir continuamente las necesidades del sector en sistemas de evaluación y migrarlos repetidamente a medida que se actualiza el modelo básico.
En tercer lugar, el cuello de botella para la implementación de IA empresarial está cambiando: de la oferta de modelos a las capacidades de evaluación. Antes, las pruebas de concepto empresariales solían basarse en experiencias de prueba y juicios subjetivos; ahora, a medida que la IA se integra en procesos de producción como centros de llamadas, investigación jurídica y asistencia médica, basarse simplemente en que "tiene buena pinta" ya no es suficiente para respaldar las decisiones de adquisición. Las empresas deben saber en qué tareas es eficaz un modelo, cuándo falla y cuánto cambiarán el coste y la calidad al pasar de software de código cerrado a software de código abierto. Por lo tanto, la evaluación ya no es una herramienta auxiliar, sino la infraestructura que conecta la adquisición, la formación y la implementación en producción. Quien pueda definir las tareas, establecer distribuciones de prueba y actualizar continuamente los estándares, controlará realmente la selección del modelo.
En cuarto lugar, el valor de las plataformas de inferencia está pasando de "vender potencia de cálculo barata" a organizar modelos, hardware y flujos de trabajo. Antes, la optimización de la inferencia se entendía principalmente como la reducción del coste de un solo token; ahora, el almacenamiento en caché, la división de tareas, el enrutamiento de modelos y la gestión del contexto pueden modificar directamente las tasas de finalización de las tareas. Los diferentes modelos ya no necesitan competir por la misma posición, sino que pueden actuar como ejecutores y asesores, respectivamente. La lógica empresarial de Fireworks se mantiene así: en lugar de construir su propio hardware costoso, vincula los ingresos al uso real de los modelos de los clientes mediante el entrenamiento, la personalización y la inferencia continua. Sin embargo, los principales competidores en este camino no son empresas de nube nuevas e independientes, sino grandes proveedores de nube que pueden controlar simultáneamente la potencia de cálculo, el software y los puntos de acceso de los clientes.
En quinto lugar, el auge de los modelos de código abierto no necesariamente debilita la demanda de infraestructura; al contrario, podría reducir el costo de la capa de modelos e impulsar aún más el valor hacia la inferencia y la capacidad de procesamiento. El continuo aumento del gasto de capital de los gigantes tecnológicos no se trata solo de calcular los rendimientos a corto plazo, sino también de sopesar los riesgos a largo plazo de perderse el ciclo de la IA. Sin embargo, para las nuevas empresas de la nube que dependen de financiamiento externo, los costos de la deuda, los retrasos en los proyectos y los períodos de recuperación de la inversión seguirán representando limitaciones más directas. Que los modelos sean más baratos no significa que la construcción y el funcionamiento de los sistemas de IA se vuelvan proporcionalmente más sencillos.
Si tuviéramos que resumir esta conversación en una sola conclusión, sería esta: ponerse al día con los modelos de código abierto es solo el principio; la siguiente etapa de la comercialización de la IA girará en torno a la evaluación, la personalización, la eficiencia de la inferencia y los flujos de trabajo del cliente.
A continuación se presenta el texto original (editado para facilitar su lectura y comprensión):
TL;DR
Los modelos de código abierto están alcanzando rápidamente a los modelos de código cerrado, pero el crecimiento de los tokens no se traduce en un aumento de los ingresos, y los presupuestos corporativos siguen priorizando los modelos con mejor rendimiento.
La destilación solo puede ayudar a los modelos de código abierto a reducir la brecha a corto plazo; la competitividad a largo plazo sigue dependiendo de la formación independiente, los datos de evaluación, el talento y la capacidad de procesamiento.
• La actualización de los modelos generales ya no implica necesariamente la eliminación de los modelos verticales. En ámbitos como el derecho y la sanidad, las barreras se están desplazando de las capacidades de los modelos a la evaluación, los datos y el flujo de trabajo.
La clave para llevar la IA empresarial de la prueba de concepto (PoC) a la producción no reside en aumentar el número de opciones de modelos, sino en establecer un sistema de evaluación que pueda medir la calidad, el coste y los límites de fallos.
La optimización de la inferencia se ha expandido desde la reducción del costo de un solo token hasta el almacenamiento en caché, la división de tareas y el enrutamiento de modelos. El diseño del sistema permite que múltiples combinaciones de modelos superen el rendimiento de un único modelo de vanguardia.
Los modelos personalizados son más adecuados para plataformas SaaS verticales que abarcan un gran número de clientes similares, ya que las empresas individuales generalmente carecen de una distribución de datos suficientemente amplia y de capacidades de evaluación continua.
La ventaja competitiva de Fireworks no reside en poseer GPU, sino en conectar el entrenamiento, la personalización y la inferencia continua. Sin embargo, sus verdaderos rivales a largo plazo siguen siendo los gigantes de la nube, capaces de abarcar todo el conjunto de tecnologías.
La adopción generalizada de modelos de código abierto no necesariamente reduce la demanda de hardware; es más probable que comprima los sobreprecios de las capas de modelos y redistribuya el valor de la industria hacia la capacidad de computación, la infraestructura de inferencia y los flujos de trabajo empresariales.
Puntos clave de la entrevista
El software de código abierto seguirá avanzando, pero la simplificación no es una solución a largo plazo.
El equipo de Fireworks proviene en gran medida del ecosistema PyTorch de Meta. Basándose en su experiencia previa en el desarrollo de sistemas operativos, bases de datos y otros programas, el equipo siempre ha creído que el software valioso acabará teniendo soluciones de código abierto competitivas. Es posible que el modelo a gran escala siga una trayectoria similar, solo que esta fase de adaptación se está produciendo más rápido de lo que Chen Yufei había previsto inicialmente.
Por un lado, los ingresos recurrentes anuales de empresas de modelos de código cerrado como OpenAI y Anthropic siguen creciendo rápidamente; por otro lado, los modelos de código abierto en China y Estados Unidos también están reduciendo rápidamente la brecha de capacidades y llevando los precios de la inferencia a niveles muy bajos. El código abierto y el código cerrado no constituyen una relación de suma cero en la que una parte crece y la otra inevitablemente decae.
En cuanto a la optimización de algunos modelos de código abierto mediante la salida de modelos de código cerrado, Chen Yufei considera que, si bien este enfoque puede ayudar a los modelos a alcanzar un alto nivel a corto plazo, es improbable que sea una solución fiable a largo plazo. Los proveedores de software de código cerrado pueden ir modificando gradualmente las API y los mecanismos de seguridad para reducir la posibilidad de que se extraigan los procesos de inferencia y los datos relacionados.
Sin embargo, el progreso de los modelos de código abierto no depende exclusivamente de la destilación. Mientras el sistema de evaluación siga mejorando, los costes de los datos continúen disminuyendo y exista suficiente talento, GPU y capacidad de ingeniería, los equipos de código abierto podrán entrenar de forma independiente modelos competitivos. Empresas como Meta, con su potencia informática y reservas de talento, no tienen motivos para mantener una brecha tan grande con los modelos de vanguardia de código cerrado a largo plazo.
Esto no significa que los modelos de código cerrado vayan a perder cuota de mercado. Chen Yufei compara ambos sistemas con Apple y Android: los ecosistemas abiertos pueden dar cabida a una mayor escala de uso, mientras que los productos de código cerrado, líderes en el mercado, pueden retener a clientes de alto valor con menor sensibilidad al precio gracias a una experiencia estable, el reconocimiento de la marca y la confianza corporativa.
Las compras empresariales suelen ser conservadoras. El dicho «Nadie pierde su trabajo por comprar IBM» describe a la perfección esta mentalidad a la hora de tomar decisiones. Mientras los clientes sigan creyendo que adquirir modelos líderes de código cerrado es la opción más segura, empresas como OpenAI y Anthropic pueden mantener cierta ventaja. En comparación con las brechas tecnológicas a corto plazo, cambiar la percepción de los usuarios y la capacidad de entrada al mercado puede resultar más difícil.
Chen Yufei predice que los ingresos recurrentes anuales (ARR) de las empresas con modelos de código cerrado seguirán creciendo, pero esta cifra podría no reflejar completamente sus beneficios económicos finales. Por ejemplo, es posible que parte de los ingresos deban compartirse con proveedores de servicios en la nube, y un aumento en los ARR no se traduce necesariamente en un aumento proporcional de los ingresos y beneficios contables. Solo se podrá determinar si el poder de negociación de los modelos de código cerrado ha disminuido una vez que las empresas pertinentes divulguen información financiera más completa.
A largo plazo, el software de código abierto podría alcanzar una mayor escala de uso, mientras que el software de código cerrado seguirá controlando la demanda para obtener mayores beneficios. Los límites comerciales de ambos no solo dependen de las capacidades del modelo, sino también de la marca, los canales de distribución, la confianza del cliente y los métodos de distribución de ingresos.
Los tokens están evolucionando hacia el código abierto, pero los ingresos siguen dependiendo del rendimiento.
Según Chen Yufei, la plataforma Fireworks procesa actualmente entre 40 y 50 billones de tokens al día. Basándose en la información pública que citó, esta cifra supera el tráfico de API empresariales divulgado por Gemini y OpenAI.
Las principales necesidades de la plataforma provienen de la programación, la atención médica, el trabajo colaborativo y la investigación exhaustiva. Entre estas, un número creciente de tareas que originalmente no se consideraban programación se están redefiniendo como "problemas de programación".
El software de oficina, como PowerPoint y Excel, es un ejemplo típico. Cuando un modelo puede operar estos programas mediante código o herramientas estructuradas, los métodos existentes de generación de código, invocación de herramientas y aprendizaje por refuerzo pueden transferirse a entornos de oficina. Muchas empresas SaaS especializadas también están integrando herramientas del sector en entornos a los que los modelos pueden acceder, y luego utilizan el aprendizaje por refuerzo para familiarizar a los modelos con flujos de trabajo específicos.
Chen Yufei clasifica las necesidades actuales en dos tipos principales: programación e investigación exhaustiva. Las distintas aplicaciones verticales combinarán ambos tipos para crear agentes especializados para escenarios como el derecho, la sanidad y el trabajo de oficina.
Se muestra especialmente optimista respecto a los productos de oficina colaborativos dirigidos a usuarios no técnicos. Anteriormente, la mayor parte de los recursos del sector se invertían en necesidades de ciencia, tecnología, ingeniería y matemáticas (STEM), como matemáticas y programación, pero es probable que las necesidades de un amplio abanico de trabajadores del conocimiento, como la creación de diapositivas, el procesamiento de documentos y la creación de vídeos, crezcan aún más rápidamente.
El desarrollo de agentes controlados por computadora ha sido más lento de lo previsto. Hace poco más de un año, se creía que estos productos evitarían las API complejas, permitiendo a los usuarios interactuar directamente con las computadoras como si fueran humanos. Sin embargo, en la práctica, las empresas, en un esfuerzo por reducir costos, han migrado más flujos de trabajo a texto plano. Los modelos de texto son más económicos y fáciles de integrar en los procesos existentes. Si bien los agentes controlados por computadora podrían ganar mayor popularidad a medida que disminuyan los costos de las máquinas virtuales y mejoren los entornos operativos, aún se están explorando las vías de optimización específicas.
Sin embargo, el crecimiento de los tokens no representa directamente su valor comercial. Las clasificaciones de enrutamiento de modelos públicos suelen verse influenciadas por las cuotas gratuitas y las actividades promocionales, y la misma cantidad de tokens puede corresponder a precios completamente diferentes. El tráfico generado por modelos de bajo precio y el generado por modelos de vanguardia costosos tienen significados distintos en términos de ingresos.
Chen Yufei cree que los ingresos son un mejor indicador de la verdadera preferencia del cliente que la cantidad de tokens. Cuando las empresas no son sensibles al precio, sus presupuestos se destinan a los modelos con mejor rendimiento. Por lo tanto, cuando Fireworks ayuda a sus clientes a personalizar modelos, su objetivo principal no suele ser lograr una buena relación costo-beneficio, sino igualar o incluso superar a los principales modelos de código cerrado en tareas específicas.
El mercado de la programación también muestra una divergencia entre el uso y los ingresos. Es probable que el consumo de tokens siga creciendo, pero si los modelos de uso común continúan bajando de precio, los precios más bajos estimularán un mayor número de solicitudes, pero no necesariamente incrementarán los ingresos del mercado en consecuencia. Del mismo modo que el acceso generalizado a la electricidad no implica que todas las ganancias vayan a parar a las empresas generadoras de energía, el crecimiento en el uso de la IA no puede explicar directamente dónde reside, en última instancia, el valor de la industria.
En un futuro próximo, es probable que el uso de modelos de código abierto siga aumentando, pero que el gasto asociado se expanda en paralelo dependerá de la disposición de las empresas a invertir recursos en la personalización. Si cada vez más empresas logran que los modelos de código abierto personalizados compitan con los de código cerrado en tareas específicas, el tráfico y los ingresos seguirán migrando hacia el código abierto; si los costos de personalización, las tasas de fallos y las capacidades organizativas siguen siendo obstáculos, los modelos de código cerrado continuarán cubriendo la mayoría de las necesidades de alto valor.
Los modelos de propósito general elevan el límite superior de las capacidades, mientras que los modelos verticales acumulan barreras de tareas.
Cada vez que se lanza un nuevo modelo de vanguardia, el mercado plantea una nueva pregunta: ¿Perderá rápidamente su valor el modelo en el que las empresas invierten datos y fondos para perfeccionarlo?
Chen Yufei afirmó que, si bien muchos modelos personalizados fueron reemplazados por modelos básicos de nueva generación en 2025, esta situación disminuyó significativamente para 2026. En su opinión, esto es una señal positiva de que el valor comercial de los modelos verticales se está estabilizando gradualmente.
La razón es que los modelos de propósito general y las aplicaciones verticales se optimizan en direcciones diferentes. Los laboratorios de vanguardia necesitan demostrar que los modelos pueden resolver problemas matemáticos, científicos y de desarrollo de fármacos más complejos; mientras que las empresas especializadas en campos como el derecho y la atención médica se centran en las necesidades específicas de los usuarios, las tasas de finalización de tareas, la precisión de las citas y la fiabilidad de los flujos de trabajo.
"Desarrollar un buen agente para un mercado vertical específico y resolver la hipótesis de Riemann son dos tareas completamente diferentes."
Tomemos como ejemplo a Harvey, una empresa de IA legal. Su ventaja radica no solo en el modelo base que utiliza, sino también en la segmentación de las tareas legales, el sistema de evaluación, el procesamiento de datos y los procesos de producción. Lo mismo ocurre en el ámbito médico; los diferentes productos deben establecer estándares específicos basados en los métodos de trabajo de los médicos, las fuentes de datos y los requisitos de precisión.
Estas evaluaciones y datos no se invalidan automáticamente con el lanzamiento de nuevos modelos. Tras la actualización del modelo base, las empresas verticales pueden migrar sus entornos de formación existentes al nuevo modelo sin necesidad de replantearse todo el sector. A medida que las evaluaciones se vuelven más detalladas y los procesos de limpieza de datos más maduros, los modelos verticales desarrollan una capacidad que se va ampliando continuamente en torno a tareas específicas.
En teoría, las empresas de modelado de vanguardia podrían concentrar sus recursos en ingresar a los mercados legal o médico y superar a los productos existentes en un solo sector. Sin embargo, este enfoque podría no estar alineado con sus objetivos comerciales. Las empresas de modelado de propósito general necesitan atender a una amplia base de clientes, y una fuerte inversión en un solo sector vertical podría no ser suficiente para alcanzar el tamaño de mercado y la valoración deseados.
Chen Yufei comparó el modelo general con una cadena de restaurantes que necesita satisfacer una amplia gama de gustos, mientras que el modelo vertical se asemeja más a un restaurante especializado en pocos platos. Este último no necesita resolver todos los problemas; con que sea significativamente mejor que la solución general en la tarea en cuestión, puede potencialmente establecer un espacio independiente de pago.
Esta capacidad desequilibrada pero altamente especializada es lo que él denomina «Inteligencia Dentada». Un modelo jurídico puede no ser capaz de resolver la Hipótesis de Riemann, pero puede superar a modelos más amplios y de propósito general en ciertos tipos de tareas legales. Para los clientes corporativos, la capacidad de completar la tarea de forma fiable suele ser más importante que las capacidades generales del modelo.
Los modelos personalizados no son adecuados para todas las empresas. Chen Yufei cree que los clientes más idóneos son las empresas SaaS verticales que prestan servicios a un gran número de instituciones similares, en lugar de hospitales individuales, bufetes de abogados o empresas usuarias finales.
Las plataformas SaaS verticales permiten llegar a un gran número de clientes, comprender las necesidades comunes de diferentes organizaciones y establecer sistemas de evaluación que abarquen diversas situaciones. Las empresas individuales suelen carecer de una distribución de datos suficientemente amplia y de capacidades de evaluación continua. En lugar de entrenar modelos de forma independiente, es preferible consolidar los procesos internos en habilidades, herramientas o agentes, y luego recurrir a modelos básicos externos para completar las tareas.
En los proyectos de aprendizaje por refuerzo personalizados, las GPU son el principal factor de costo, pero los datos y el entorno de entrenamiento son igualmente importantes. Los equipos deben verificar si existen manipulaciones de recompensas (es decir, explotar vulnerabilidades de evaluación para obtener puntuaciones altas sin completar realmente la tarea) y, al mismo tiempo, garantizar un entorno de entrenamiento estable que permita escalar el entrenamiento.
El entorno de entrenamiento inicial no necesita necesariamente alcanzar cientos de miles de trayectorias. Chen Yufei afirmó que mil entornos de entrenamiento son suficientes para iniciar el aprendizaje por refuerzo, ya que el modelo explora y genera repetidamente una gran cantidad de trayectorias durante el entrenamiento. Suponiendo que cada paso de entrenamiento se ejecute 128 veces en un entorno, mil puntos de datos iniciales podrían generar aproximadamente 128 000 trayectorias de entrenamiento.
Los modelos personalizados aún requieren ajustes tras su implementación. Cuando se publica un nuevo modelo base de código abierto, la plataforma puede migrar el sistema original de capacitación y evaluación al nuevo modelo. Siempre que los criterios de evaluación y el entorno de tareas sean fijos, la migración en sí no necesariamente consume mucho tiempo; lo que realmente genera una carga de trabajo continua es cuando los clientes añaden nuevos escenarios, flujos de trabajo y tareas más complejas.
Por lo tanto, los activos principales de una empresa vertical no son los pesos de una determinada generación de modelos, sino los datos, las evaluaciones y los flujos de trabajo que se pueden migrar repetidamente a medida que se actualiza el modelo básico.
La IA empresarial está estancada en la fase de prueba de concepto (PoC, por sus siglas en inglés) no porque carezca de un modelo, sino porque carece de evaluación.
Cuando las empresas eligen entre modelos de código abierto y de código cerrado, su principal consideración no es solo el rendimiento y el precio, sino también la confianza.
Dado que los contratos empresariales suelen durar entre uno y dos años, los compradores deben evaluar si el proveedor de servicios y su ecosistema pueden satisfacer las necesidades del negocio a largo plazo. Si bien los modelos de código abierto pueden ser más económicos y flexibles, los proveedores de código cerrado aún conservan una ventaja en cuanto a comunicación de marca, casos de éxito y reconocimiento de mercado.
Chen Yufei considera que la principal debilidad de los modelos de código abierto y sus proveedores de servicios no reside en la tecnología, sino en su capacidad de entrada al mercado. Las empresas que utilizan modelos de código cerrado pueden mejorar continuamente el conocimiento de sus productos y servicios mediante demostraciones de nuevas funcionalidades y resultados de investigación, mientras que el ecosistema de código abierto carece de un sistema unificado de marketing y comunicación con el cliente.
Los métodos de implementación también están cambiando. Inicialmente, las empresas se centraban más en las implementaciones locales, pero ahora cada vez más cargas de trabajo se trasladan a la nube. Siempre que los proveedores de servicios puedan generar confianza en áreas como la seguridad y las nubes privadas virtuales, los servicios de nube multiusuario suelen ser más rentables que las GPU dedicadas para las empresas.
Una sola empresa podría no ser capaz de mantener altas tasas de utilización para un conjunto de GPU, pero una plataforma puede agrupar las necesidades de diferentes clientes y mejorar la eficiencia en la utilización del hardware. A medida que los costos de inferencia aumentan como porcentaje de los gastos operativos de la empresa, las ventajas de costos de la infraestructura compartida se vuelven más evidentes.
Uno de los mayores obstáculos para las empresas que pasan de la prueba de concepto a la producción es la falta de una evaluación rigurosa. Incluso cuando las empresas ya han aplicado la IA a áreas importantes como los centros de llamadas, siguen evaluando la eficacia de sus modelos mediante ensayo y error en lugar de establecer estándares de prueba que puedan ejecutarse repetidamente.
Sin una evaluación, las empresas no pueden comparar de forma fiable los modelos de código abierto y de código cerrado, ni determinar si las actualizaciones de los modelos realmente mejoran su negocio. Por lo tanto, Chen Yufei cree que el talento capaz de diseñar sistemas de evaluación de IA sigue siendo escaso. Un sistema de evaluación fiable podría ayudar a las empresas a reemplazar sus modelos y ahorrar a largo plazo gastos que superan con creces sus costes iniciales de construcción.
Esto no difiere fundamentalmente de las pruebas unitarias en las empresas de software tradicionales. Antes, las empresas de SaaS necesitaban ejecutar un conjunto de pruebas antes de la entrega del software; ahora, las empresas de IA vertical necesitan establecer un conjunto de evaluaciones para confirmar que el agente cumple con los estándares correspondientes antes de su puesta en producción. El enfoque del trabajo en la industria está cambiando, pasando de la simple "escritura de pruebas" a la "escritura de evaluaciones", pero la esencia sigue siendo transformar la calidad del producto en capacidades organizativas medibles y acumulativas.
El desarrollo de empresas de datos de terceros también puede servir como indicador para observar la implementación de la IA en las empresas. Si sus clientes siguen concentrados en unos pocos laboratorios de vanguardia, indica que el margen para que las empresas comunes desarrollen capacidades de IA independientes aún es limitado; si las fuentes de ingresos se diversifican gradualmente, puede significar que más empresas están empezando a comprar datos, crear sistemas de evaluación y entrenar sus propios modelos.
Lo que realmente les falta a las empresas no son más modelos, sino un conjunto de estándares que puedan definir qué es correcto, identificar qué es incorrecto y respaldar las decisiones de compra.
La optimización de la inferencia pasa de reducir los costes de los tokens a la planificación del sistema.
La actividad principal de Fireworks es la optimización de inferencias. Chen Yufei cree que aún hay mucho margen de mejora en este ámbito, ya que el rendimiento de un modelo en su lanzamiento inicial suele ser muy diferente de su rendimiento tras una optimización a largo plazo.
La plataforma busca acortar este ciclo de optimización, asegurando que los nuevos modelos alcancen su estado óptimo al momento de su implementación. Además del tiempo de ejecución del modelo, el almacenamiento en caché, la planificación y la infraestructura de soporte influyen en el costo final. Muchas optimizaciones implican una gran cantidad de trabajo de ingeniería fragmentado, lo que convierte la optimización de la inferencia en una tarea laboriosa.
En comparación con las API de origen proporcionadas por los desarrolladores de modelos, Fireworks ofrece una gran cantidad de modelos base y personalizados simultáneamente, lo que permite observar patrones de tráfico y cargas de trabajo más diversos. Los proveedores de modelos deben garantizar que sus modelos se ofrezcan de forma estable a una amplia gama de usuarios, mientras que las plataformas de terceros pueden realizar optimizaciones más detalladas para las características específicas de las solicitudes de cada cliente.
El enrutamiento basado en modelos no se limita a la reducción de costes. En un experimento conjunto entre Fireworks y Harvey, el sistema utilizó un modelo como ejecutor de tareas y otro como asesor, dividiendo las tareas de contexto extenso en varias subtareas más cortas. Dado que el rendimiento del modelo principal puede disminuir a medida que el contexto se alarga, con una división adecuada del trabajo, el rendimiento general del sistema puede incluso superar el de utilizar únicamente el modelo más potente.
Chen Yufei comparó este proceso con la optimización del rendimiento de la CPU. Los desarrolladores deben comprender las características del procesador y luego dividir el programa en cargas de trabajo adecuadas para dicho procesador. De manera similar, en los sistemas de IA, el modelo base puede considerarse como un procesador de texto: el equipo primero debe comprender los límites de capacidad de los diferentes modelos, luego diseñar el marco de tareas y, finalmente, ubicar el modelo apropiado en la posición adecuada.
La optimización del hardware no puede abordarse analizando métricas individuales como la GPU, la memoria HBM, la CPU y la red. Los modelos suelen diseñarse teniendo en cuenta la relación entre la capacidad de cómputo y la memoria del hardware existente durante el entrenamiento inicial. Por lo tanto, migrar un modelo de una GPU NVIDIA a una GPU AMD de capacidad similar es relativamente sencillo, mientras que migrarlo a un ASIC con una arquitectura diferente puede requerir un trabajo considerable.
El éxito de un nuevo dispositivo no solo depende de si sus especificaciones son similares a las de Nvidia, sino también de la escala de la oferta, el ecosistema de software y si los incentivos económicos motivan a los desarrolladores a optimizar sus modelos para dicho dispositivo. Incluso si la configuración del hardware es similar a la de Nvidia, será difícil crear un ecosistema si los desarrolladores no obtienen suficientes beneficios al usarlo.
En definitiva, la optimización de una plataforma de inferencia no se trata solo de la velocidad a la que se ejecuta el modelo, sino de la compatibilidad entre el modelo, la tarea y el hardware.
Fireworks no es propietaria del hardware, pero conecta el entrenamiento con la inferencia.
Ante la expansión de los proveedores de IA en la nube hacia el ámbito del software, Fireworks no tiene previsto fabricar su propio hardware ni invertir fuertemente en GPU. Chen Yufei describe el modelo de la empresa como similar al de un "arrendador": adquiere capacidad de cómputo de proveedores de infraestructura y se centra en el software de computación, los servicios de inferencia y la personalización de modelos.
La diferencia entre Fireworks y las plataformas de IA en la nube convencionales radica en que la mayor parte del tráfico en la plataforma no proviene de modelos base sin modificar, sino de modelos personalizados. Chen Yufei cree que la competencia en la inferencia de modelos base será cada vez más feroz, y es más probable que los beneficios provengan de modelos propietarios que puedan ofrecer mejores resultados a los clientes.
Fireworks integra el entrenamiento y la inferencia en un único modelo de negocio. La empresa ayuda a sus clientes a entrenar modelos y busca un crecimiento sostenido en el tráfico de inferencia una vez que los modelos se ponen en marcha. En comparación con los proveedores de servicios que solo cobran por el entrenamiento o la consultoría, esta estructura de ingresos alinea de forma más eficaz los beneficios a largo plazo tanto para la plataforma como para sus clientes: a medida que los clientes generan más valor a través de sus modelos, Fireworks puede obtener mayores ingresos gracias a la inferencia continua.
Algunos proveedores de servicios de aprendizaje por refuerzo solo ofrecen capacitación o consultoría, y sus ingresos pueden no estar directamente relacionados con la efectividad del modelo una vez implementado. La lógica de negocio de Fireworks consiste en mejorar el rendimiento del modelo mediante la capacitación y luego obtener beneficios del tráfico de inferencia posterior. No vende proyectos de capacitación puntuales, sino la capacidad de permitir que los modelos de sus clientes generen un uso continuo.
Los verdaderos competidores capaces de abarcar toda la cadena no son empresas emergentes de servicios en la nube, sino grandes proveedores como AWS, Microsoft Azure y Google Cloud. Estos últimos poseen tanto capacidad de procesamiento como la habilidad para desarrollar servicios de aprendizaje por refuerzo, plataformas de inferencia y herramientas de desarrollo.
Fireworks compite con los proveedores de servicios en la nube, a la vez que depende de su infraestructura y colabora con ella. Actualmente, la empresa mantiene una estrecha colaboración con Azure, lo que permite a los clientes adquirir servicios de Fireworks utilizando créditos de Azure. También colabora con AWS y Google Cloud.
Chen Yufei considera que las capacidades actuales de optimización de inferencia de Fireworks siguen siendo superiores a las de servicios similares de proveedores de la nube, pero el rendimiento en un solo punto no es el obstáculo más importante. Lo más relevante es que abarca todo el ciclo operativo de aprendizaje automático, desde el entrenamiento y la implementación hasta la evaluación y la inferencia, brindando a los desarrolladores una experiencia fluida. En comparación con las nuevas empresas de la nube, Fireworks cubre una cadena más larga; y en comparación con los gigantes de la nube, necesita mantener sus ventajas en especialización y velocidad de ejecución.
Aunque la IA logre automatizar el desarrollo, la inferencia y la optimización posterior al entrenamiento de los kernels en el futuro, comprender las necesidades del cliente probablemente seguirá siendo una tarea difícil de reemplazar por completo. Un sistema puede resolver problemas matemáticos complejos, pero es posible que no pueda comprender los procesos, las limitaciones y los criterios de evaluación de una empresa de la nada. El valor a largo plazo de Fireworks depende, en última instancia, de su capacidad para traducir las necesidades del cliente en modelos, evaluaciones y productos funcionales.
La ventaja de los modelos de compresión de código abierto sigue dependiendo de la potencia de cálculo como principal limitación.
Durante los próximos uno o dos años, el mayor desafío para Fireworks seguirá siendo la capacidad de procesamiento. La dificultad de la empresa para adquirir recursos informáticos suficientes a un precio razonable limitará directamente el crecimiento de sus ingresos. Chen Yufei resume la situación actual de Fireworks como una limitación en la capacidad de procesamiento y predice que es probable que el mercado en general mantenga esta situación durante al menos el próximo año.
Esto también influyó en su visión sobre las inversiones en IA de los gigantes tecnológicos. El mercado suele juzgar si empresas como Google y Meta están invirtiendo en exceso basándose en el retorno de la inversión; pero para estas empresas, otro riesgo puede ser mayor: si la IA finalmente genera rendimientos extremadamente altos y se quedan fuera de esta ronda de competencia por haber reducido su inversión, podrían perder definitivamente su lugar en el mercado.
Por lo tanto, incluso con una sobreinversión a corto plazo, el costo podría limitarse a la presión sobre los estados financieros y la necesidad de absorber la depreciación en los próximos años. Para los gigantes tecnológicos con flujo de caja y capacidad de financiación a largo plazo, esto generalmente no representa un riesgo para su supervivencia; sin embargo, perderse ciclos tecnológicos clave sí podría serlo.
La situación es diferente para las nuevas empresas de computación en la nube. Necesitan calcular con mayor rigor la rentabilidad de los proyectos, los costos de financiación y los plazos de recuperación de la inversión. Chen Yufei sugiere prestar atención a las calificaciones crediticias, las extensiones de proyectos y la capacidad de refinanciación de las empresas relevantes. Si algún participante no puede seguir obteniendo préstamos debido a problemas de crédito y necesita reestructurar sus deudas en los próximos 3 a 6 meses, la disponibilidad de fondos en el mercado será un indicador clave de la capacidad de financiación de la infraestructura de IA.
Chen Yufei se muestra escéptico ante la idea generalizada en el mercado de que "la equiparación entre modelos de código abierto y de código cerrado reducirá la demanda de hardware". En su opinión, la mejora en las capacidades de los modelos de código abierto debilita principalmente el poder de fijación de precios de la capa de modelado. Si el gasto total en IA se mantiene sin cambios, el valor podría, de hecho, trasladarse a las empresas que proporcionan capacidad de procesamiento e infraestructura.
Sin embargo, aún queda por ver si las inversiones en IA generarán suficientes beneficios. Los proyectos de potencia informática suelen tardar varios años en recuperar la inversión, y la dinámica de la oferta y la demanda dentro de un año es difícil de predecir. Un indicio relativamente claro en la actualidad es que tanto Fireworks como muchos de sus clientes siguen buscando mayor potencia informática.
La competencia entre modelos de código abierto y de código cerrado no se determinará únicamente por la clasificación de los modelos. A medida que la brecha de capacidades se reduzca, el valor para la industria dependerá más de quién pueda definir las tareas, verificar la efectividad e implementar los modelos en producción a un costo sostenible.
Este contenido se proporciona únicamente con fines informativos y educativos y no constituye asesoramiento de inversión relacionado con BTCC. BTCC realiza todos los esfuerzos posibles, pero no puede garantizar la veracidad, exactitud u originalidad del contenido anterior.