Aprendizaje por refuerzo: un cambio de paradigma en las redes de IA descentralizadas

PanewslabPanewslabAutor: 博闻札记

La verdadera oportunidad para el aprendizaje de refuerzo × Web3 no radica en replicar una versión descentralizada de OpenAI, sino en reescribir las "relaciones de producción inteligentes".

Escrito por: 0xjacobzhao

 

Este informe de investigación independiente contó con el apoyo de IOSG Ventures. El proceso de investigación y redacción se inspiró en el informe de Sam Lehman (Pantera Capital) sobre aprendizaje por refuerzo. Agradecemos a Ben Fielding (Gensyn.ai), Gao Yuan (Gradient), Samuel Dare y Erfan Miahi (Covenant AI), Shashank Yadav (Fraction AI) y Chao Wang por sus valiosas sugerencias. Si bien buscamos la objetividad y la precisión, algunos puntos de vista implican juicios subjetivos y pueden contener sesgos; solicitamos la comprensión del lector.

 

La inteligencia artificial está evolucionando del aprendizaje estadístico, centrado principalmente en el ajuste de patrones, a un sistema de capacidades centrado en el razonamiento estructurado, donde el post-entrenamiento cobra cada vez mayor importancia. La aparición de DeepSeek-R1 marca un cambio de paradigma en el aprendizaje por refuerzo en la era de los modelos de gran tamaño, lo que ha generado un consenso en la industria: el pre-entrenamiento sirve como base para la construcción de modelos de propósito general. El aprendizaje por refuerzo ya no es solo una herramienta de alineación de valores, sino que ha demostrado mejorar sistemáticamente la calidad de las cadenas de razonamiento y las capacidades de toma de decisiones complejas, convirtiéndose gradualmente en una vía tecnológica para la mejora continua de la inteligencia.

 

Mientras tanto, la Web3 está transformando las relaciones de producción de la IA mediante redes informáticas descentralizadas y sistemas de incentivos encriptados. Los requisitos estructurales del aprendizaje por refuerzo para el muestreo de implementación, las señales de recompensa y el entrenamiento verificable se alinean naturalmente con la colaboración en la potencia informática, la distribución de incentivos y la ejecución verificable de la cadena de bloques. Esta investigación analiza sistemáticamente el paradigma de entrenamiento de la IA y los principios de la tecnología de aprendizaje por refuerzo, demostrando las ventajas estructurales del aprendizaje por refuerzo × Web3 y analizando proyectos como Prime Intellect, Gensyn, Nous Research, Gradient, Grail y Fraction AI.

 

I. Tres etapas del entrenamiento de IA: preentrenamiento, ajuste de instrucciones y alineación posterior al entrenamiento

El ciclo de vida completo de entrenamiento de los modelos de lenguaje grande (LLM) modernos se divide típicamente en tres etapas principales: preentrenamiento, ajuste fino supervisado (SFT) y posentrenamiento/RL. Estas tres etapas cumplen respectivamente las funciones de "construir un modelo del mundo", "inyectar capacidades de tarea" y "dar forma al razonamiento y al valor". Su estructura computacional, los requisitos de datos y la dificultad de verificación determinan el grado de coincidencia descentralizada.

 

El preentrenamiento, que construye la estructura estadística lingüística y el modelo intermodal del mundo mediante aprendizaje autosupervisado a gran escala, es la base de las capacidades del LLM. Esta etapa requiere entrenamiento con billones de corpus de forma globalmente sincrónica, basándose en clústeres homogéneos de miles a decenas de miles de imágenes H100, lo que representa entre el 80 % y el 95 % del coste. Es extremadamente sensible al ancho de banda y a los derechos de autor de los datos, por lo que debe completarse en un entorno altamente centralizado.

 

El ajuste fino supervisado se utiliza para inyectar capacidades de tareas y formatos de instrucciones. Requiere pocos datos y representa aproximadamente entre el 5 % y el 15 % del coste. El ajuste fino puede realizarse mediante entrenamiento de parámetros completos o métodos de ajuste fino paramétricamente eficiente (PEFT), entre los que LoRA, Q-LoRA y Adapter son los métodos más comunes en la industria. Sin embargo, aún se requiere la sincronización de gradientes, lo que limita su potencial descentralizado.

 

El post-entrenamiento consta de múltiples subetapas iterativas que determinan la capacidad de razonamiento, los valores y los límites de seguridad del modelo. Los métodos incluyen sistemas de aprendizaje por refuerzo (RLHF, RLAIF, GRPO), métodos de optimización de preferencias sin RL (DPO) y modelos de recompensa por proceso (PRM). Esta etapa requiere menos datos y tiene menores costos (5-10%), centrándose principalmente en la implementación y la actualización de políticas. Admite ejecución asíncrona y distribuida; los nodos no necesitan tener pesos completos. Combinada con computación verificable e incentivos en cadena, puede formar una red de entrenamiento abierta y descentralizada, lo que la convierte en la etapa de entrenamiento más adecuada para Web3.

II. Una visión panorámica de la tecnología de aprendizaje por refuerzo: arquitectura, marcos y aplicaciones

2.1 Arquitectura del sistema y componentes centrales del aprendizaje por refuerzo

El Aprendizaje por Refuerzo (AR) impulsa a un modelo a mejorar de forma autónoma su capacidad de toma de decisiones mediante la interacción con el entorno, la retroalimentación de recompensas y la actualización de políticas. Su estructura central puede considerarse un bucle de retroalimentación compuesto por estado, acción, recompensa y política. Un sistema completo de AR suele incluir tres tipos de componentes: Política (red de políticas), Implementación (muestreo de experiencias) y Estudiante (actualizador de políticas). La política interactúa con el entorno para generar una trayectoria, y el Estudiante la actualiza basándose en las señales de recompensa, conformando así un proceso de aprendizaje continuo, iterativo y optimizador.

Red de políticas: Genera acciones a partir del estado del entorno y es el núcleo de la toma de decisiones del sistema. Durante el entrenamiento, se requiere retropropagación centralizada para mantener la consistencia; durante la inferencia, puede distribuirse a diferentes nodos para su funcionamiento en paralelo.

Despliegue: Los nodos interactúan con el entorno según la política, generando trayectorias como estado, acción y recompensa. Este proceso es altamente paralelo, requiere una comunicación mínima y es insensible a las diferencias de hardware, lo que lo convierte en el componente más adecuado para el escalado en entornos descentralizados.

El alumno agrega todas las trayectorias de implementación y actualiza los gradientes de políticas. Es el módulo con mayores requisitos de potencia de procesamiento y ancho de banda, por lo que suele implementarse de forma centralizada o ligeramente centralizada para garantizar la estabilidad de la convergencia.

 

2.2 Arquitectura de la etapa de aprendizaje por refuerzo (RLHF → RLAIF → PRM → GRPO)

El aprendizaje por refuerzo generalmente se puede dividir en cinco etapas y el proceso general es el siguiente:

Fase de generación de datos (exploración de políticas): dadas las señales de entrada, el modelo de políticas πθ genera múltiples cadenas de inferencia candidatas o trayectorias completas, lo que proporciona una base de muestra para la posterior evaluación de preferencias y modelado de recompensas, y determina la amplitud de la exploración de políticas.

Fase de retroalimentación de preferencias (RLHF/RLAIF):
 

RLHF (Aprendizaje por Refuerzo a partir de la Retroalimentación Humana) utiliza respuestas de múltiples candidatos, anotación de preferencias humanas, entrenamiento de un modelo de recompensa (RM) y una estrategia de optimización PPO para que el resultado del modelo se ajuste mejor a los valores humanos. Es un componente clave de la transición de GPT-3.5 a GPT-4.

 

RLAIF (Aprendizaje de Refuerzo a partir de la Retroalimentación de IA) reemplaza la anotación manual con un Juez de IA o reglas constitucionales, automatizando la adquisición de preferencias, reduciendo significativamente los costos y ofreciendo escalabilidad. Se ha convertido en el paradigma de alineación dominante para empresas como Anthropic, OpenAI y DeepSeek.

Fase de Modelado de Recompensas: Se aplican preferencias al modelo de recompensa de entrada, que aprende a asignar la salida a una recompensa. El Modelado de Recompensas (MR) enseña al modelo cuál es la respuesta correcta, mientras que el Modelado Previo a la Recompensa (PRM) le enseña cómo realizar un razonamiento correcto.
 

El modelo de recompensa (RM) se utiliza para evaluar la calidad de la respuesta final, puntuando solo el resultado.
 

El Modelo de Recompensa de Proceso (PRM) ya no solo evalúa la respuesta final, sino que también califica cada paso del razonamiento, cada token y cada segmento lógico. Además, es una tecnología clave de OpenAI o1 y DeepSeek-R1, y básicamente enseña al modelo a pensar.

 

Fase de verificación de recompensas (RLVR): introducción de "restricciones verificables" durante la generación y el uso de señales de recompensa para garantizar que las recompensas provengan de reglas, hechos o consensos reproducibles tanto como sea posible, reduciendo así los riesgos de piratería de recompensas y sesgo, y mejorando la auditabilidad y la escalabilidad en entornos abiertos.

 

La optimización de políticas implica actualizar los parámetros de política θ según las señales del modelo de recompensa para obtener una política πθ′ con mayor capacidad de razonamiento, mayor seguridad y patrones de comportamiento más estables. Los métodos de optimización convencionales incluyen:

 

PPO (Optimización de política proximal): un optimizador tradicional en RLHF, conocido por su estabilidad, pero que a menudo enfrenta limitaciones como convergencia lenta y estabilidad insuficiente en tareas de inferencia complejas.

 

La Optimización de Políticas Relativa de Grupo (GRPO) es una innovación fundamental de DeepSeek-R1. Estima el valor esperado modelando la distribución de dominancia dentro de los grupos de respuestas candidatas, en lugar de simplemente clasificarlos. Este método preserva la información sobre la magnitud de la recompensa, lo que lo hace más adecuado para la optimización de la cadena de inferencia y genera un proceso de entrenamiento más estable. Se considera un importante marco de optimización del aprendizaje por refuerzo para escenarios de inferencia profunda posteriores a la PPO.

 

DPO (Optimización Directa de Preferencias): Un método de post-entrenamiento que no es un método de aprendizaje por refuerzo. No genera trayectorias ni construye modelos de recompensa, sino que optimiza directamente los pares de preferencias. Es económico y estable, por lo que se utiliza ampliamente para la alineación en modelos de código abierto como Llama y Gemma, pero no mejora la capacidad de inferencia.

 

Fase de Implementación de Nuevas Políticas: El modelo optimizado presenta capacidades mejoradas de Razonamiento del Sistema 2, comportamientos más acordes con las preferencias humanas o de IA, menor tasa de alucinaciones y mayor seguridad. Mediante la iteración continua, el modelo aprende preferencias, optimiza el proceso y mejora la calidad de la toma de decisiones, formando un ciclo cerrado.

2.3 Cinco categorías principales de aplicaciones industriales del aprendizaje por refuerzo

El aprendizaje por refuerzo ha evolucionado desde la teoría de juegos inicial hasta convertirse en un marco fundamental para la toma de decisiones autónoma en diversas industrias. Sus escenarios de aplicación pueden clasificarse en cinco tipos principales según su madurez tecnológica e implementación industrial, y cada uno ha impulsado avances clave en su respectiva dirección.

 

Sistemas de Juego y Estrategia: Esta fue la primera área del RL en ser validada. En entornos con "información perfecta + recompensas explícitas" como AlphaGo, AlphaZero, AlphaStar y OpenAI Five, el RL demostró una inteligencia en la toma de decisiones que podía rivalizar o incluso superar a la de los expertos humanos, sentando las bases de los algoritmos modernos de RL.

 

Robótica e IA Corporizada: El aprendizaje automático (RL), mediante el control continuo, el modelado dinámico y la interacción con el entorno, permite a los robots aprender manipulación, control de movimiento y tareas intermodales (como RT-2 y RT-X), y avanza rápidamente hacia la industrialización. Es una vía tecnológica clave para la aplicación práctica de los robots.

 

Razonamiento Digital (Sistema LLM-2): RL + PRM impulsa modelos grandes desde la imitación del lenguaje hasta el razonamiento estructurado. Entre los logros más representativos se incluyen DeepSeek-R1, OpenAI o1/o3, Anthropic Claude y AlphaGeometry. Su esencia reside en optimizar las recompensas a nivel de la cadena de razonamiento, en lugar de simplemente evaluar la respuesta final de la recompensa.

 

Descubrimiento científico y optimización matemática (RL): RL busca estructuras o estrategias óptimas en espacios de búsqueda enormes, de recompensas complejas y no etiquetadas, y ha logrado avances fundamentales como AlphaTensor, AlphaDev y Fusion RL, demostrando una capacidad de exploración que supera la intuición humana.

 

Toma de decisiones económicas y trading: El aprendizaje automático (RL) se utiliza para la optimización de estrategias, el control de riesgos de alta dimensión y la generación de sistemas de trading adaptativos. A diferencia de los modelos cuantitativos tradicionales, permite un aprendizaje continuo en entornos inciertos y es un componente fundamental de las finanzas inteligentes.

 

III. Correspondencia natural entre el aprendizaje por refuerzo y la Web3

El alto grado de compatibilidad entre el aprendizaje por refuerzo (AR) y la Web3 se debe a que ambos son esencialmente sistemas basados en incentivos. El AR se basa en señales de recompensa para optimizar las estrategias, mientras que la cadena de bloques se basa en incentivos económicos para coordinar el comportamiento de los participantes, lo que les otorga una coherencia natural a nivel de mecanismo. Las necesidades fundamentales del AR —implementación heterogénea a gran escala, distribución de recompensas y verificación de autenticidad— son precisamente donde residen las ventajas estructurales de la Web3.

 

Desacoplar razonamiento y entrenamiento: El proceso de entrenamiento del aprendizaje de refuerzo se puede dividir claramente en dos etapas:
 

Implementación (muestreo exploratorio): El modelo genera una gran cantidad de datos según la política actual, una tarea computacionalmente intensiva pero con escasa comunicación. No requiere comunicación frecuente entre nodos y es adecuado para la generación paralela en GPU de consumo distribuidas globalmente.

Actualización (actualización de parámetros): actualiza los pesos del modelo en función de los datos recopilados, lo que requiere un nodo centralizado de alta frecuencia y gran ancho de banda.
 

La "disociación entre inferencia y entrenamiento" es una opción natural para las estructuras de poder computacional heterogéneas descentralizadas: la implementación se puede subcontratar a redes abiertas, con liquidación basada en la contribución a través de un mecanismo de token, mientras que las actualizaciones del modelo permanecen centralizadas para garantizar la estabilidad.

 

Verificabilidad: ZK y la Prueba de Aprendizaje (PPA) proporcionan un medio para verificar si los nodos realmente realizan razonamiento, resolviendo así el problema de honestidad en redes abiertas. En tareas deterministas como el código y el razonamiento matemático, los verificadores solo necesitan comprobar la respuesta para confirmar la carga de trabajo, lo que mejora significativamente la credibilidad de los sistemas de aprendizaje por repetición descentralizados.

 

La capa de incentivos se basa en un mecanismo de producción de retroalimentación basado en tokens: el mecanismo de tokens de Web3 puede recompensar directamente a los contribuyentes de retroalimentación de preferencias RLHF/RLAIF, lo que permite que la generación de datos de preferencias tenga una estructura de incentivos transparente, liquidable y sin permisos; el staking y el slashing restringen aún más la calidad de la retroalimentación, formando un mercado de retroalimentación más eficiente y alineado que el crowdsourcing tradicional.

 

El potencial del Aprendizaje por Refuerzo Multiagente (MARL): Blockchain es inherentemente un entorno multiagente público, transparente y en constante evolución. Las cuentas, los contratos y los agentes ajustan constantemente sus estrategias en función de los incentivos, lo que le otorga un potencial natural para construir campos de prueba MARL a gran escala. Aunque aún se encuentra en sus primeras etapas, sus características de estado público, ejecución verificable e incentivos programables ofrecen una ventaja fundamental para el desarrollo futuro de MARL.

 

IV. Análisis de proyectos clásicos de Web3 + aprendizaje por refuerzo

Basándonos en el marco teórico anterior, analizaremos brevemente los proyectos más representativos del ecosistema actual:

 

Prime Intellect: Paradigma de aprendizaje por refuerzo asincrónico - prime-rl

Prime Intellect se dedica a construir un mercado global de computación abierta, reduciendo las barreras de la capacitación, promoviendo la capacitación colaborativa y descentralizada y desarrollando un conjunto completo de tecnologías de superinteligencia de código abierto. Su sistema incluye: Prime Compute (un entorno unificado de computación en la nube/distribuida), la familia de modelos INTELLECT (10B–100B+), el Centro de Entornos (centro de aprendizaje de refuerzo abierto) y el motor de datos sintéticos a gran escala (SYNTHETIC-1/2).

El componente principal de la infraestructura de Prime Intellect, la arquitectura prime-rl, está diseñado para entornos distribuidos asíncronos y es muy relevante para el aprendizaje por refuerzo. Otros componentes incluyen el protocolo de comunicación OpenDiLoCo, que supera los cuellos de botella del ancho de banda, y el mecanismo de verificación TopLoc, que garantiza la integridad computacional.

Descripción general de los componentes de la infraestructura central de Prime Intellect

Fundamento técnico: marco de aprendizaje de refuerzo asincrónico prime-rl

prime-rl es el motor de entrenamiento principal de Prime Intellect, diseñado específicamente para entornos descentralizados asíncronos a gran escala. Logra una inferencia de alto rendimiento y actualizaciones estables mediante la completa disociación entre Actor y Learner. Los trabajadores y los Learners de Rollout ya no se bloquean sincrónicamente; los nodos pueden unirse o salir en cualquier momento, simplemente extrayendo continuamente la estrategia más reciente y cargando los datos generados.

 

Actor (Trabajadores de Despliegue): Responsable de la inferencia del modelo y la generación de datos. Prime Intellect integra de forma innovadora el motor de inferencia vLLM en el lado del Actor. La tecnología PagedAttention de vLLM y la capacidad de procesamiento continuo por lotes permiten a los Actores generar trayectorias de inferencia con un rendimiento extremadamente alto.

 

Aprendiz (Entrenador): Responsable de la optimización de políticas. El Aprendiz extrae datos asincrónicamente del Buffer de Experiencia compartido para actualizar los gradientes sin esperar a que todos los Actores completen el lote actual.

 

Orquestador: responsable de programar los pesos del modelo y el flujo de datos.

 

Las principales innovaciones de prime-rl:

Asincronía real: prime-rl abandona el paradigma sincrónico del PPO tradicional, no espera nodos lentos y no requiere alineación por lotes, lo que permite acceder a cualquier cantidad y rendimiento de GPU en cualquier momento, sentando las bases para la viabilidad del RL descentralizado.

Integración profunda de FSDP2 y MoE: Mediante la segmentación de parámetros de FSDP2 y la activación dispersa de MoE, prime-rl permite el entrenamiento eficiente de miles de millones de modelos en un entorno distribuido. Los actores solo ejecutan expertos activos, lo que reduce significativamente la memoria de la GPU y los costos de inferencia.

GRPO+ (Optimización de Políticas Relativa de Grupo): GRPO elimina la red crítica, lo que reduce significativamente la sobrecarga computacional y de memoria, y se adapta de forma natural a entornos asíncronos. GRPO+ de Prime-RL garantiza además una convergencia fiable en condiciones de alta latencia mediante un mecanismo de estabilización.

 

La familia de modelos INTELLECT: un marcador de madurez en la tecnología RL descentralizada.

INTELLECT-1 (10B, octubre de 2024) es el primero en demostrar que OpenDiLoCo se puede entrenar de manera eficiente en redes heterogéneas que abarcan tres continentes (índice de comunicación <2%, utilización de potencia informática 98%), rompiendo la comprensión física del entrenamiento interregional.

INTELLECT-2 (32B, abril de 2025) es el primer modelo de RL sin permiso que verifica la capacidad de convergencia estable de prime-rl y GRPO+ en entornos asincrónicos y de retardo de múltiples pasos, y realiza un RL descentralizado con participación global de poder computacional abierto.

INTELLECT-3 (106 B MoE, noviembre de 2025) emplea una arquitectura dispersa que activa solo 12 B de parámetros. Se entrena en 512 × H₂O y alcanza un rendimiento de inferencia excepcional (AIME 90,8 %, GPQA 74,4 %, MMLU-Pro 81,9 %, etc.). Su rendimiento general es superior al de su modelo central e incluso supera la escala del modelo fuente.

 

Prime Intellect también construyó varios componentes de infraestructura de soporte: OpenDiLoCo reduce la comunicación de entrenamiento entre regiones cientos de veces mediante una comunicación dispersa temporalmente y diferencias de ponderación de cuantificación, lo que permite a INTELLECT-1 mantener una utilización del 98 % en tres redes continentales; TopLoc + Verifiers forman una capa de ejecución descentralizada para la verificación de huellas dactilares, mientras que el motor de datos de verificación de huellas dactilares en entorno aislado produce cadenas de inferencia a gran escala y de alta calidad, y permite que el modelo 671B funcione eficientemente en clústeres de GPU de consumo mediante paralelismo de canalizaciones. Estos componentes proporcionan una base de ingeniería crucial para la generación de datos, la verificación y el rendimiento de inferencia en el aprendizaje automático descentralizado. La serie INTELLECT demuestra que esta pila tecnológica puede producir modelos maduros y de primera clase, marcando la transición de los sistemas de entrenamiento descentralizados de la fase conceptual a la fase de aplicación práctica.

 

Gensyn: Pilas principales de aprendizaje por refuerzo: Swarm y SAPO

El objetivo de Gensyn es integrar la potencia de cálculo inactiva a nivel global en una infraestructura de entrenamiento de IA abierta, confiable e infinitamente escalable. Su núcleo incluye una capa de ejecución estandarizada en todos los dispositivos, una red de coordinación entre pares y un sistema de verificación de tareas confiable, que asigna automáticamente tareas y recompensas mediante contratos inteligentes. Aprovechando las características del aprendizaje por refuerzo, Gensyn introduce mecanismos clave como RL Swarm, SAPO y SkipPipe para desacoplar los procesos de generación, evaluación y actualización, utilizando un enjambre de GPU heterogéneas a nivel global para lograr una evolución colectiva. En definitiva, ofrece no solo potencia de cálculo, sino también inteligencia verificable.

 

Aplicaciones de aprendizaje por refuerzo apilado de Gensyn

RL Swarm: un motor de aprendizaje de refuerzo colaborativo descentralizado

RL Swarm demuestra un modelo colaborativo completamente nuevo. Ya no se trata de un simple sistema de distribución de tareas, sino de un bucle descentralizado de "generar-evaluar-actualizar" que simula el aprendizaje social humano, similar a un proceso de aprendizaje colaborativo, con un bucle infinito:

 

Solucionadores (Ejecutores): Responsables de la inferencia del modelo local y la generación de rollouts, independientemente de la heterogeneidad de los nodos. Gensyn integra localmente un motor de inferencia de alto rendimiento (como CodeZero), que puede generar la trayectoria completa en lugar de solo la respuesta.

 

Proponentes: Generar dinámicamente tareas (problemas matemáticos, problemas de código, etc.) para apoyar la diversidad de tareas y la dificultad adaptativa del aprendizaje curricular.

 

Evaluadores: Utilicen modelos de evaluación o reglas fijas para evaluar las implementaciones locales y generar señales de recompensa locales. El proceso de evaluación puede auditarse, lo que reduce las posibilidades de comportamiento malicioso.

 

Juntos, estos tres elementos forman una estructura organizacional de aprendizaje colaborativo P2P, que permite el aprendizaje colaborativo a gran escala sin una programación centralizada.

SAPO: Un algoritmo de optimización de políticas para la reconstrucción descentralizada: SAPO (Optimización de políticas de muestreo de enjambre) se centra en compartir el despliegue y filtrar muestras de señales sin gradiente, en lugar de compartir gradientes. Mediante el muestreo de despliegue descentralizado a gran escala y el tratamiento de los despliegues recibidos como generados localmente, mantiene la convergencia diferencial en entornos con coordinación descentralizada y alta latencia. En comparación con PPO, que se basa en redes críticas y tiene altos costos computacionales, o GRPO, que se basa en la estimación de la ventaja intragrupo, SAPO permite que las GPU de consumo participen eficazmente en la optimización del aprendizaje por refuerzo a gran escala con un ancho de banda extremadamente bajo.

 

A través de RL Swarm y SAPO, Gensyn demuestra que el aprendizaje por refuerzo (especialmente el RLVR posterior al entrenamiento) se adapta naturalmente a las arquitecturas descentralizadas, ya que se basa más en implementaciones diversas y a gran escala que en la sincronización de parámetros de alta frecuencia. Al combinar los marcos de validación de PoL y Verde, Gensyn ofrece una ruta alternativa para entrenar modelos de billones de parámetros que ya no depende de un solo gigante tecnológico: una red superinteligente y autoevolutiva compuesta por millones de GPU heterogéneas en todo el mundo.

 

Investigación Nous: Atropos, un entorno de aprendizaje por refuerzo basado en la validación

Nous Research está construyendo una infraestructura cognitiva descentralizada y autoevolutiva. Sus componentes principales —Hermes, Atropos, DisTrO, Psyche y World Sim— están organizados en un sistema de evolución inteligente de bucle cerrado continuo. A diferencia del proceso lineal tradicional de "preentrenamiento-postentrenamiento-inferencia", Nous emplea técnicas de aprendizaje por refuerzo como DPO, GRPO y muestreo de rechazo para unificar la generación, verificación, aprendizaje e inferencia de datos en un bucle de retroalimentación continuo, creando un ecosistema de IA de bucle cerrado en constante mejora.

 

 

Descripción general del componente de investigación de Nous

Capa modelo: Hermes y la evolución de la capacidad de razonamiento

La serie Hermes es la principal interfaz de modelo orientada al usuario de Nous Research, y su evolución demuestra claramente la ruta de migración de la industria desde la alineación tradicional SFT/DPO al aprendizaje de refuerzo de razonamiento (RL):

Hermes 1–3: Alineación de instrucciones y capacidad del agente temprano: Hermes 1–3 se basó en DPO de bajo costo para una alineación de instrucciones sólida, mientras que Hermes 3 aprovechó datos sintéticos y el mecanismo de verificación Atropos recientemente introducido.

Hermes 4 / DeepHermes: al escribir el pensamiento lento al estilo Sistema 2 en pesos a través de una cadena de pensamiento, mejora el rendimiento matemático y del código mediante el escalamiento en tiempo de prueba y se basa en "muestreo de rechazo + verificación de Atropos" para construir datos de inferencia de alta pureza.

DeepHermes adopta además GRPO para reemplazar PPO, que es difícil de implementar de manera distribuida, lo que permite que el RL de inferencia se ejecute en la red GPU descentralizada Psyche, sentando las bases de ingeniería para la escalabilidad del RL de inferencia de código abierto.
 

Atropos: Un entorno verificable de aprendizaje de refuerzo basado en recompensas

Atropos es el eje central del sistema de aprendizaje automático (RL) de Nous. Encapsula indicaciones, llamadas a herramientas, ejecución de código e interacciones multiturno en un entorno de RL estandarizado, verificando directamente la exactitud de los resultados y proporcionando señales de recompensa deterministas, reemplazando así la costosa y no escalable anotación humana. Más importante aún, en la red de entrenamiento descentralizada Psyche, Atropos actúa como árbitro, verificando si los nodos están mejorando realmente sus políticas, respaldando la prueba de aprendizaje auditable y resolviendo fundamentalmente el problema de la fiabilidad de las recompensas en el RL distribuido.

DisTrO y Psyche: Capas optimizadoras para el aprendizaje de refuerzo descentralizado

El entrenamiento tradicional de RLF (RLHF/RLAIF) se basa en clústeres centralizados de alto ancho de banda, lo cual constituye una barrera fundamental que los sistemas de código abierto no pueden replicar. DisTrO reduce el coste de comunicación de RL en varios órdenes de magnitud mediante el desacoplamiento del momento y la compresión de gradiente, lo que permite que el entrenamiento se ejecute con el ancho de banda de internet. Psyche, por otro lado, implementa este mecanismo de entrenamiento en una red en cadena, lo que permite a los nodos completar la inferencia, la verificación, la evaluación de recompensas y las actualizaciones de peso localmente, formando un bucle cerrado completo de RL.

 

En la arquitectura Nous, Atropos valida la cadena de pensamiento; DisTrO comprime la comunicación de entrenamiento; Psyche ejecuta el bucle de aprendizaje por refuerzo; WorldSim proporciona un entorno complejo; Forge recopila inferencias reales; y Hermes escribe todo el aprendizaje en los pesos. El aprendizaje por refuerzo no es solo una fase de entrenamiento, sino el protocolo central de la arquitectura Nous que conecta datos, entorno, modelo e infraestructura, convirtiendo a Hermes en un sistema vivo capaz de mejorar continuamente en redes informáticas de código abierto.

 

Red de gradiente: Echo, una arquitectura de aprendizaje por refuerzo

La visión central de Gradient Network es reconstruir el paradigma de la computación de IA mediante una "pila de inteligencia abierta". La pila tecnológica de Gradient consiste en un conjunto de protocolos centrales que pueden evolucionar de forma independiente, pero colaborar de forma heterogénea. Su sistema, desde la comunicación subyacente hasta la colaboración inteligente de alto nivel, incluye: Parallax (inferencia distribuida), Echo (entrenamiento de aprendizaje automático descentralizado), Lattica (red P2P), SEDM/Massgen/Symphony/CUAHarm (memoria, colaboración, seguridad), VeriLLM (verificación de confianza) y Mirage (simulación de fidelidad). Esta simulación compartida conforma una infraestructura en constante evolución.

Echo — Arquitectura de entrenamiento de aprendizaje por refuerzo

Echo es el marco de aprendizaje por refuerzo de Gradient. Su filosofía de diseño principal consiste en desacoplar las rutas de entrenamiento, inferencia y datos (recompensa) en el aprendizaje por refuerzo, lo que permite que la generación de implementaciones, la optimización de políticas y la evaluación de recompensas se escalen y programen de forma independiente en entornos heterogéneos. Opera de forma colaborativa en redes heterogéneas compuestas por nodos de inferencia y entrenamiento, manteniendo la estabilidad del entrenamiento en entornos heterogéneos de área extensa con un mecanismo de sincronización ligero. Esto mitiga eficazmente los fallos de SPMD y los cuellos de botella en el uso de la GPU causados por la inferencia y el entrenamiento combinados en DeepSpeed RLHF/VERL tradicionales.

Echo emplea una arquitectura de dos grupos para la inferencia y el entrenamiento con el fin de maximizar el uso de la potencia computacional. Ambos grupos operan de forma independiente y no se bloquean entre sí.

 

Maximizar el rendimiento del muestreo: Inference Swarm consta de GPU y dispositivos de borde de nivel de consumidor, y utiliza Parallax para construir muestreadores de alto rendimiento de manera paralela a la canalización, centrándose en la generación de trayectorias;

 

Maximizar la potencia de cálculo de gradientes: Training Swarm, que consiste en redes de GPU de nivel de consumidor que pueden ejecutarse en clústeres centralizados o en múltiples ubicaciones alrededor del mundo, es responsable de las actualizaciones de gradientes, la sincronización de parámetros y el ajuste fino de LoRA, centrándose en el proceso de aprendizaje.
 

Para mantener la coherencia de las políticas y los datos, Echo proporciona dos protocolos de sincronización ligeros: secuencial y asincrónico, para lograr una gestión de la coherencia bidireccional de los pesos y trayectorias de las políticas.

 

Modo de extracción secuencial | Prioridad de precisión: el lado de entrenamiento fuerza al nodo de inferencia a actualizar la versión del modelo antes de extraer una nueva trayectoria, lo que garantiza la frescura de la trayectoria, lo que es adecuado para tareas que son muy sensibles a la obsolescencia de las políticas;

 

Modo Push-Pull asincrónico | La eficiencia es lo primero: el lado de inferencia genera continuamente trayectorias con etiquetas de versión, el lado de entrenamiento las consume a su propio ritmo y el coordinador monitorea las desviaciones de versión y activa actualizaciones de peso para maximizar la utilización del dispositivo.

 

En esencia, Echo se basa en Parallax (inferencia heterogénea en entornos de bajo ancho de banda) y elementos de entrenamiento distribuidos livianos (como VERL), y se basa en LoRA para reducir el costo de la sincronización entre nodos, lo que permite que el aprendizaje de refuerzo opere de manera estable en redes heterogéneas alrededor del mundo.

 

Grial: Aprendizaje por refuerzo en el ecosistema Bittensor

Bittensor construye una red de funciones de recompensa masiva, dispersa y no estacionaria a través de su exclusivo mecanismo de consenso Yuma.

 

Covenant AI, dentro del ecosistema Bittensor, ha desarrollado un flujo de trabajo integrado verticalmente desde el preentrenamiento hasta el entrenamiento posterior al RL utilizando SN3 Templar, SN39 Basilica y SN81 Grail. SN3 Templar se encarga del preentrenamiento del modelo base, SN39 Basilica proporciona un mercado de computación distribuida y SN81 Grail sirve como una "capa de inferencia verificable" para el entrenamiento posterior al RL, integrando los procesos centrales de RLHF/RLAIF y completando la optimización de bucle cerrado desde el modelo base hasta la estrategia de alineación.

GRAIL busca demostrar criptográficamente la autenticidad de cada implementación de aprendizaje de refuerzo y su vinculación con la identidad del modelo, garantizando así la ejecución segura de RLHF en un entorno sin confianza. El protocolo establece una cadena de confianza mediante un mecanismo de tres capas:

 

Generación de desafíos deterministas: las tareas de desafío impredecibles pero reproducibles (como SAT y GSM8K) se generan utilizando balizas aleatorias y hashes de bloque, lo que elimina las trampas previas al cálculo;

 

Al utilizar el muestreo del índice PRF y los compromisos de boceto, los validadores pueden muestrear cadenas de inferencia y logprob a nivel de token a un costo extremadamente bajo para confirmar que la implementación es realmente generada por el modelo de declaración.

 

Vinculación de la identidad del modelo: El proceso de inferencia está vinculado a la firma estructurada de la huella de peso del modelo y la distribución de tokens, lo que garantiza que el reemplazo del modelo o la repetición de resultados se identifiquen de inmediato. Esto proporciona una base realista para la implementación de la inferencia en RL.

 

Basándose en este mecanismo, la subred Grail implementa un proceso de post-entrenamiento verificable al estilo GRPO: los mineros generan múltiples rutas de inferencia para el mismo problema, los verificadores las califican según su corrección, la calidad de la cadena de inferencia y la satisfacción con el SAT, y escriben los resultados normalizados en la cadena como ponderaciones TAO. Experimentos públicos muestran que este marco ha mejorado la precisión MATH de Qwen2.5-1.5B del 12,7 % al 47,6 %, lo que demuestra que puede prevenir trampas y mejorar significativamente las capacidades del modelo. En la pila de entrenamiento de IA Covenant, Grail es la piedra angular de la confianza y la ejecución para RLVR/RLAIF descentralizado, y aún no se ha lanzado oficialmente en la red principal.

 

Fraction AI: Aprendizaje por refuerzo basado en la competencia (RLFC)

La arquitectura de Fraction AI se basa explícitamente en el Aprendizaje por Refuerzo de la Competencia (RLFC) y la anotación de datos gamificada, reemplazando las recompensas estáticas y las anotaciones manuales del RLFC tradicional con un entorno competitivo abierto y dinámico. Los agentes compiten entre sí en diferentes Espacios, y sus clasificaciones relativas, junto con las puntuaciones del juez de IA, constituyen recompensas inmediatas, transformando el proceso de alineación en un sistema de juego multiagente en línea continuo.

 

Las principales diferencias entre el RLHF tradicional y el RLFC de Fraction AI:

El valor fundamental de RLFC reside en que las recompensas ya no provienen de un único modelo, sino de oponentes y evaluadores en constante evolución, lo que impide que el modelo de recompensas sea explotado y que el ecosistema quede atrapado en óptimos locales debido a la diversidad de estrategias. La estructura de los Espacios determina la naturaleza del juego (suma cero o suma positiva), impulsando la aparición de comportamientos complejos en interacciones adversarias y cooperativas.

 

En términos de arquitectura del sistema, Friction AI divide el proceso de entrenamiento en cuatro componentes clave:

 

Agentes: Unidades de políticas ligeras basadas en LLM de código abierto, extendidas con pesos diferenciales a través de QLoRA y actualizadas a bajo costo;

Espacios: entornos de dominio de misión aislados donde los agentes pagan para ingresar y reciben recompensas según sus victorias y derrotas;

Jueces de IA: una capa de recompensa instantánea construida con RLAIF proporciona una evaluación escalable y descentralizada;

Prueba de aprendizaje: vincula las actualizaciones de políticas a resultados competitivos específicos, lo que garantiza que el proceso de capacitación sea verificable y evite las trampas.

 

La esencia de Fraction AI reside en la construcción de un motor evolutivo colaborativo entre humanos y máquinas. Los usuarios, actuando como "metaoptimizadores" en la capa estratégica, guían la exploración mediante ingeniería rápida y configuración de hiperparámetros; mientras tanto, los agentes generan automáticamente cantidades masivas de pares de preferencias de alta calidad en una competencia a nivel micro. Este modelo permite la anotación de datos para lograr un ciclo cerrado de negocio mediante un ajuste fino sin necesidad de confianza.

 

Comparación de arquitecturas de proyectos de aprendizaje por refuerzo Web3

V. Resumen y perspectivas: Caminos y oportunidades para el aprendizaje por refuerzo × Web3

Basándonos en el análisis deconstructivo de los proyectos de vanguardia mencionados, observamos que, si bien los puntos de entrada de cada equipo (algoritmos, ingeniería o mercados) difieren, al combinar el aprendizaje de refuerzo (AR) con Web3, su lógica arquitectónica subyacente converge en un paradigma de "desacoplamiento-verificación-incentivo" altamente consistente. Esto no es una mera coincidencia técnica, sino un resultado inevitable de la adaptación de las redes descentralizadas a las propiedades únicas del aprendizaje de refuerzo.

 

Características arquitectónicas generales del aprendizaje de refuerzo: abordar restricciones físicas centrales y cuestiones de confianza.

Desacoplamiento de implementaciones y aprendizaje: topología computacional predefinida

El lanzamiento disperso y paralelizable se subcontrata a GPU de nivel de consumidor en todo el mundo, con actualizaciones de parámetros de alta frecuencia concentradas en una pequeña cantidad de nodos de entrenamiento, como se ve en el Actor-Learner asincrónico de Prime Intellect y la arquitectura de doble clúster de Gradient Echo.

 

Confianza basada en la verificación: desarrollo de infraestructura

En redes sin permisos, la autenticidad computacional debe garantizarse mediante un diseño matemático y mecanicista, que representa métodos de verificación criptográfica como PoL de Gensyn, TOPLOC de Prime Intellect y Grail.

 

Bucle de incentivos tokenizado: autorregulación del mercado

El suministro de potencia informática, la generación de datos, la verificación y clasificación, y la distribución de recompensas forman un circuito cerrado. Al impulsar la participación mediante recompensas y suprimir las trampas mediante barras, la red puede mantenerse estable y seguir evolucionando en un entorno abierto.

 

Caminos tecnológicos diferenciados: diferentes "puntos de inflexión" bajo una arquitectura consistente

A pesar de sus arquitecturas similares, cada proyecto ha elegido diferentes fosos tecnológicos en función de sus propias características:

 

Nous Research, un grupo centrado en avances algorítmicos, intenta abordar la contradicción fundamental (el cuello de botella del ancho de banda) del entrenamiento distribuido desde una perspectiva matemática. Su optimizador DisTrO busca comprimir la comunicación de gradiente miles de veces, con el objetivo de permitir el entrenamiento de modelos grandes incluso con banda ancha doméstica: un "ataque de reducción de dimensionalidad" contra las limitaciones físicas.

 

Enfoque de Ingeniería de Sistemas (Prime Intellect, Gensyn, Gradient): Se centra en la creación de sistemas de ejecución de IA de última generación. ShardCast de Prime Intellect y Parallax de Gradient están diseñados para optimizar la eficiencia de clústeres heterogéneos en las condiciones de red existentes mediante técnicas de ingeniería extremas.

 

Teoría de juegos basada en el mercado (Bittensor, IA de Fracciones): Se centra en el diseño de funciones de recompensa. Mediante ingeniosos mecanismos de puntuación, guía a los mineros para que encuentren espontáneamente estrategias óptimas, acelerando así el desarrollo de la inteligencia.

 

Fortalezas, desafíos y perspectivas finales

En el paradigma de combinar el aprendizaje de refuerzo con Web3, las ventajas de la jerarquía del sistema se reflejan primero en la reescritura de la estructura de costos y la estructura de gobernanza.

 

Reestructuración de costos: la capacitación posterior en RL tiene una demanda ilimitada de muestreo de implementación, mientras que Web3 puede movilizar potencia informática global de cola larga a un costo extremadamente bajo, una ventaja de costos que los proveedores de nube centralizada no pueden igualar.

 

Alineación soberana: Al romper el monopolio de las grandes empresas sobre los valores de la IA (alineación), la comunidad puede votar con tokens para decidir "cuál es la buena respuesta" para el modelo, democratizando así la gobernanza de la IA.

 

Al mismo tiempo, este sistema también enfrenta dos limitaciones estructurales importantes.

 

Muro de ancho de banda: a pesar de innovaciones como DisTrO, la latencia física aún limita el entrenamiento completo de modelos de parámetros ultra grandes (70 B+), y la IA Web3 actualmente está más limitada al ajuste fino y la inferencia.

 

Ley de Goodhard (Hackeo de Recompensas): En redes con altos incentivos, los mineros tienden a sobreajustar las reglas de recompensa (cultivo de puntajes) en lugar de mejorar la inteligencia real. Diseñar una función de recompensa robusta para evitar trampas es un juego continuo.

 

Ataques maliciosos de trabajadores bizantinos: Estos ataques interrumpen la convergencia del modelo manipulando y envenenando activamente las señales de entrenamiento. El principio fundamental no es diseñar continuamente funciones de recompensa antitrampas, sino construir un mecanismo robusto y antagónico.

 

La combinación del aprendizaje por refuerzo y la Web3 reescribe esencialmente el mecanismo de cómo se produce, se alinea y se distribuye el valor de la inteligencia. Su evolución puede resumirse en tres direcciones complementarias:

 

Red de entrenamiento push descentralizada: desde máquinas de minería de potencia informática hasta redes de políticas, subcontratando la implementación paralela y verificable a GPU de cola larga globales, centrándose en el mercado de inferencia verificable en el corto plazo y evolucionando hacia una subred de aprendizaje de refuerzo para la agrupación de tareas en el mediano plazo;

 

Activos de Preferencias y Recompensas: Del Trabajo de Etiquetado de Datos a la Equidad de Datos. Esto implica activos de preferencias y recompensas, transformando la retroalimentación de alta calidad y el Modelo de Recompensas en activos de datos gobernables y distribuibles, y transformando el "trabajo de etiquetado de datos" en "equidad de datos".

La evolución "pequeña pero hermosa" en campos verticales: En escenarios verticales donde los resultados son verificables y los beneficios son cuantificables, se están desarrollando pequeños pero poderosos Agentes RL dedicados, como la ejecución de estrategias DeFi y la generación de código, que vinculan directamente la mejora de la estrategia con la captura de valor y se espera que superen los modelos generales de código cerrado.

 

En general, la verdadera oportunidad para el aprendizaje de refuerzo × Web3 no reside en replicar una versión descentralizada de OpenAI, sino en reescribir las "relaciones de producción inteligente": hacer de la ejecución del entrenamiento un mercado de poder computacional abierto, hacer que las recompensas y las preferencias sean activos gobernables en cadena y redistribuir el valor aportado por la inteligencia que ya no se concentra en la plataforma, sino entre entrenadores, alineadores y usuarios.

Aviso legal: Este artículo se redactó con la ayuda de las herramientas de inteligencia artificial ChatGPT-5 y Gemini 3. El autor ha hecho todo lo posible por corregir y garantizar la veracidad y precisión de la información, pero es inevitable que se produzcan omisiones. Disculpen las molestias. Es especialmente importante tener en cuenta que el mercado de criptomonedas suele experimentar una divergencia entre los fundamentos del proyecto y el rendimiento del precio en el mercado secundario. Este artículo tiene fines meramente informativos y de intercambio académico/de investigación, y no constituye asesoramiento de inversión ni debe considerarse una recomendación para comprar o vender ningún token.

 

Este contenido se proporciona únicamente con fines informativos y educativos y no constituye asesoramiento de inversión relacionado con BTCC. BTCC realiza todos los esfuerzos posibles, pero no puede garantizar la veracidad, exactitud u originalidad del contenido anterior.