Обучение с подкреплением: смена парадигмы в децентрализованных сетях искусственного интеллекта.
PanewslabАвтор: 博闻札记Реальные возможности для интеграции обучения с подкреплением и Web3 заключаются не в воспроизведении децентрализованной версии OpenAI, а в переосмыслении «интеллектуальных производственных отношений».
Автор: 0xjacobzhao
Данный независимый исследовательский отчет был подготовлен при поддержке IOSG Ventures. Исследование и написание отчета были вдохновлены работой Сэма Лемана (Pantera Capital) по теме обучения с подкреплением. Мы благодарим Бена Филдинга (Gensyn.ai), Гао Юаня (Gradient), Сэмюэля Даре и Эрфана Миахи (Covenant AI), Шашанка Ядава (Fraction AI) и Чао Вана за их ценные предложения. Стремясь к объективности и точности, мы допускаем, что некоторые точки зрения могут быть субъективными и содержать предвзятые суждения; просим читателя отнестись к этому с пониманием.
Искусственный интеллект переходит от статистического обучения, в основном ориентированного на «подгонку шаблонов», к системе, основанной на «структурированном рассуждении», при этом постобучение приобретает все большее значение. Появление DeepSeek-R1 знаменует собой сдвиг парадигмы в обучении с подкреплением в эпоху больших моделей, что привело к консенсусу в отрасли: предварительное обучение служит основой для построения моделей общего назначения. Обучение с подкреплением перестало быть просто инструментом выравнивания значений и доказало свою способность систематически улучшать качество цепочек рассуждений и сложных возможностей принятия решений, постепенно превращаясь в технологический путь для непрерывного повышения интеллекта.
Тем временем Web3 меняет производственные отношения в сфере ИИ посредством децентрализованных вычислительных сетей и зашифрованных систем поощрения. Структурные требования обучения с подкреплением для выборочного развертывания, сигналов вознаграждения и проверяемого обучения естественным образом согласуются с сотрудничеством в области вычислительной мощности, распределением поощрений и проверяемым выполнением в блокчейне. В данном исследовании систематически анализируется парадигма обучения ИИ и принципы технологии обучения с подкреплением, демонстрируются структурные преимущества взаимодействия обучения с подкреплением и Web3, а также анализируются такие проекты, как Prime Intellect, Gensyn, Nous Research, Gradient, Grail и Fraction AI.
I. Три этапа обучения ИИ: предварительное обучение, тонкая настройка инструкций и согласование результатов после обучения.
Весь цикл обучения современных больших языковых моделей (LLM) обычно делится на три основных этапа: предварительное обучение, контролируемая тонкая настройка (SFT) и постобучение/обучение с подкреплением (RL). Эти три этапа соответственно выполняют функции «построения модели мира», «внедрения возможностей задачи» и «формирования рассуждений и ценностей». Их вычислительная структура, требования к данным и сложность проверки определяют степень децентрализованного сопоставления.
Предварительное обучение, в ходе которого формируется лингвистическая статистическая структура и кросс-модальная модель мира модели посредством крупномасштабного самообучения с учителем, является основой возможностей LLM. Этот этап требует обучения на триллионах корпусов в глобально синхронном режиме, опираясь на однородные кластеры из тысяч или десятков тысяч изображений H100, что составляет 80-95% от общей стоимости. Он чрезвычайно чувствителен к пропускной способности и авторским правам на данные, поэтому должен выполняться в высокоцентрализованной среде.
Контролируемая тонкая настройка используется для внедрения возможностей задачи и форматов инструкций. Она требует небольшого объема данных и составляет приблизительно 5-15% от общей стоимости. Тонкая настройка может выполняться с использованием обучения с полными параметрами или параметрически эффективных методов тонкой настройки (PEFT), среди которых LoRA, Q-LoRA и Adapter являются основными методами в отрасли. Однако по-прежнему требуется синхронизация градиентов, что ограничивает ее децентрализованный потенциал.
Пост-обучение состоит из нескольких итеративных подэтапов, определяющих способность модели к рассуждению, значения и границы безопасности. К используемым методам относятся системы обучения с подкреплением (RLHF, RLAIF, GRPO), методы оптимизации предпочтений без обучения с подкреплением (DPO) и модели вознаграждения за процесс (PRM). Этот этап имеет меньшие требования к данным и затратам (5–10%), в основном фокусируясь на развертывании и обновлении политики. Он естественным образом поддерживает асинхронное и распределенное выполнение; узлам не нужно хранить полные веса. В сочетании с проверяемыми вычислениями и внутрисетевыми стимулами он может сформировать открытую децентрализованную обучающую сеть, что делает его наиболее подходящим этапом обучения для Web3.

II. Панорамный обзор технологии обучения с подкреплением: архитектура, фреймворки и приложения
2.1 Системная архитектура и основные компоненты обучения с подкреплением
Обучение с подкреплением (Reinforcement Learning, RL) позволяет модели автономно улучшать свои навыки принятия решений посредством «взаимодействия с окружающей средой — обратной связи по вознаграждению — обновления политики». Его основная структура может рассматриваться как петля обратной связи, состоящая из состояния, действия, вознаграждения и политики. Полная система RL обычно включает три типа компонентов: Политика (сеть политики), Выполнение (выбор опыта) и Обучающийся (обновитель политики). Политика взаимодействует с окружающей средой для генерации траектории, а Обучающийся обновляет политику на основе сигналов вознаграждения, таким образом формируя непрерывный итеративный и оптимизирующий процесс обучения.

Сеть политик: генерирует действия на основе состояния окружающей среды и является ядром процесса принятия решений в системе. Во время обучения для поддержания согласованности требуется централизованное обратное распространение ошибки; во время вывода она может быть распределена между различными узлами для параллельной работы.
Внедрение: Узлы взаимодействуют с окружающей средой в соответствии с политикой, генерируя траектории, такие как состояние, действие и вознаграждение. Этот процесс является высокопараллельным, требует минимального обмена данными и нечувствителен к различиям в оборудовании, что делает его наиболее подходящим компонентом для масштабирования в децентрализованных средах.
Модуль обучения объединяет все траектории развертывания и выполняет обновления градиента политики. Это модуль с самыми высокими требованиями к вычислительной мощности и пропускной способности, поэтому его обычно развертывают централизованно или с частичной централизацией для обеспечения стабильности сходимости.
2.2 Архитектура этапа обучения с подкреплением (RLHF → RLAIF → PRM → GRPO)
Обучение с подкреплением, как правило, можно разделить на пять этапов, и общий процесс выглядит следующим образом:


Этап генерации данных (исследование политики): На основе входных данных модель политики πθ генерирует множество возможных цепочек выводов или полных траекторий, предоставляя основу для последующей оценки предпочтений и моделирования вознаграждений, а также определяя масштабы исследования политики.
Фаза обратной связи по предпочтениям (RLHF / RLAIF):
RLHF (обучение с подкреплением на основе обратной связи от человека) использует множество вариантов ответов, аннотации предпочтений человека, обучение модели вознаграждения (RM) и стратегию оптимизации PPO, чтобы сделать выходные данные модели более соответствующими ценностям человека. Это ключевой элемент перехода от GPT-3.5 к GPT-4.
RLAIF (обучение с подкреплением на основе обратной связи от ИИ) заменяет ручную аннотацию правилами, установленными ИИ, автоматизируя процесс формирования предпочтений, значительно снижая затраты и обеспечивая масштабируемость. Эта парадигма стала основной для таких компаний, как Anthropic, OpenAI и DeepSeek.
Этап моделирования вознаграждения: предпочтения применяются к входной модели вознаграждения, которая учится сопоставлять выходные данные с вознаграждением. Моделирование вознаграждения (RM) учит модель «какой правильный ответ», в то время как моделирование предварительного вознаграждения (PRM) учит модель «как делать правильные рассуждения».
Модель вознаграждения (Reward Model, RM) используется для оценки качества конечного ответа, при этом учитывается только результат.
Модель вознаграждения за процесс (Process Reward Model, PRM) теперь оценивает не только конечный ответ, но и каждый шаг рассуждения, каждый токен и каждый логический сегмент. Это также ключевая технология OpenAI o1 и DeepSeek-R1, которая, по сути, учит модель мыслить.
Этап проверки вознаграждения (RLVR): Введение «проверяемых ограничений» в процессе генерации и использования сигналов вознаграждения для обеспечения того, чтобы вознаграждения в максимально возможной степени основывались на воспроизводимых правилах, фактах или консенсусе, тем самым снижая риски взлома системы вознаграждения и предвзятости, а также улучшая возможность аудита и масштабируемость в открытых средах.
Оптимизация политики включает в себя обновление параметров политики θ под руководством сигналов от модели вознаграждения для получения политики πθ′ с более выраженной способностью к рассуждению, большей безопасностью и более стабильными моделями поведения. К основным методам оптимизации относятся:
PPO (Proximal Policy Optimization): Традиционный оптимизатор в RLHF, известный своей стабильностью, но часто сталкивающийся с ограничениями, такими как медленная сходимость и недостаточная стабильность в сложных задачах вывода.
Групповая относительная оптимизация политики (GRPO) — ключевое нововведение DeepSeek-R1. Она оценивает ожидаемое значение, моделируя распределение доминирования внутри групп кандидатов в ответы, а не просто ранжируя их. Этот метод сохраняет информацию о величине вознаграждения, что делает его более подходящим для оптимизации цепочки вывода и приводит к более стабильному процессу обучения. После PPO он считается важной оптимизационной структурой для обучения с подкреплением в сценариях глубокого вывода.
DPO (Direct Preference Optimization): метод, применяемый после обучения, не являющийся методом обучения с подкреплением. Он не генерирует траектории и не строит модели вознаграждения, а напрямую оптимизирует пары предпочтений. Он недорог и стабилен, поэтому широко используется для выравнивания в моделях с открытым исходным кодом, таких как Llama и Gemma, но не улучшает возможности вывода.
Этап внедрения новой политики: оптимизированная модель демонстрирует улучшенные возможности логического мышления системы 2, поведение, более соответствующее предпочтениям человека или ИИ, меньшую частоту галлюцинаций и более высокий уровень безопасности. Благодаря непрерывной итерации модель изучает предпочтения, оптимизирует процесс и повышает качество принятия решений, образуя замкнутый цикл.

2.3 Пять основных категорий промышленного применения обучения с подкреплением
Обучение с подкреплением эволюционировало от ранней теории игр до ключевой концепции автономного принятия решений в различных отраслях. Сценарии его применения можно разделить на пять основных типов в зависимости от технологической зрелости и промышленного внедрения, и каждый из них привел к ключевым прорывам в своем направлении.
Игровые и стратегические системы: это была самая ранняя область обучения с подкреплением, получившая подтверждение эффективности. В средах с «полной информацией + явными вознаграждениями», таких как AlphaGo, AlphaZero, AlphaStar и OpenAI Five, обучение с подкреплением продемонстрировало интеллектуальные способности к принятию решений, которые могли соперничать или даже превосходить человеческие знания, заложив основу для современных алгоритмов обучения с подкреплением.
Робототехника и воплощенный ИИ: обучение с подкреплением (RL) посредством непрерывного управления, динамического моделирования и взаимодействия с окружающей средой позволяет роботам обучаться манипулированию, управлению движением и кросс-модальным задачам (таким как RT-2 и RT-X) и быстро движется к индустриализации. Это ключевое технологическое направление для практического применения роботов в реальном мире.
Цифровое рассуждение (LLM System-2): RL + PRM переводит большие модели от «имитации языка» к «структурированному рассуждению». К числу показательных достижений относятся DeepSeek-R1, OpenAI o1/o3, Anthropic Claude и AlphaGeometry. Суть метода заключается в оптимизации вознаграждений на уровне цепочки рассуждений, а не просто в оценке конечного результата.
Научные открытия и математическая оптимизация (RL): RL ищет оптимальные структуры или стратегии в немаркированных, сложных пространствах вознаграждений и огромных пространствах поиска, и достигла фундаментальных прорывов, таких как AlphaTensor, AlphaDev и Fusion RL, демонстрируя возможности исследования, превосходящие человеческую интуицию.
Принятие экономических решений и торговля: обучение с подкреплением используется для оптимизации стратегий, управления рисками в многомерной среде и создания адаптивных торговых систем. По сравнению с традиционными количественными моделями, оно способно непрерывно обучаться в условиях неопределенности и является важной частью интеллектуальных финансов.
III. Естественное соответствие между обучением с подкреплением и Web3
Высокая степень совместимости между обучением с подкреплением (RL) и Web3 обусловлена тем, что обе системы, по сути, являются «системами, основанными на стимулах». RL использует сигналы вознаграждения для оптимизации стратегий, в то время как блокчейн использует экономические стимулы для координации поведения участников, что делает их естественным образом согласованными на уровне механизмов. Основные потребности RL — крупномасштабное гетерогенное развертывание, распределение вознаграждений и проверка подлинности — именно в этом и заключаются структурные преимущества Web3.
Разделение рассуждений и обучения: Процесс обучения с подкреплением можно четко разделить на два этапа:
Внедрение (исследовательская выборка): Модель генерирует большой объем данных на основе текущей политики, что является вычислительно сложной, но экономичной с точки зрения обмена данными задачей. Она не требует частого обмена данными между узлами и подходит для параллельной генерации на глобально распределенных графических процессорах потребительского класса.
Обновление (обновление параметров): Обновляет веса модели на основе собранных данных, что требует наличия высокочастотного централизованного узла с высокой пропускной способностью.
«Разделение процессов вывода и обучения» идеально подходит для децентрализованных гетерогенных вычислительных структур: развертывание может быть передано на аутсорсинг в открытые сети, а расчеты будут производиться на основе взносов через механизм токенов, в то время как обновления модели останутся централизованными для обеспечения стабильности.
Проверяемость: ZK и Proof-of-Learning предоставляют средства для проверки того, действительно ли узлы выполняют рассуждения, решая проблему честности в открытых сетях. В детерминированных задачах, таких как программирование и математические рассуждения, верификаторам достаточно проверить ответ, чтобы подтвердить выполнение работы, что значительно повышает достоверность децентрализованных систем обучения с подкреплением.
Система поощрений основана на механизме формирования обратной связи с использованием токенов: механизм токенов Web3 может напрямую вознаграждать участников, предоставляющих обратную связь по предпочтениям в рамках RLHF/RLAIF, что позволяет создавать прозрачную, расчетную и не требующую разрешений структуру поощрений для генерации данных о предпочтениях; стейкинг и штрафные санкции дополнительно ограничивают качество обратной связи, формируя более эффективный и согласованный рынок обратной связи, чем традиционный краудсорсинг.
Потенциал многоагентного обучения с подкреплением (MARL): блокчейн по своей природе представляет собой публичную, прозрачную и постоянно развивающуюся многоагентную среду. Учетные записи, контракты и агенты постоянно корректируют свои стратегии в условиях, обусловленных стимулами, что создает естественный потенциал для создания крупномасштабных полигонов для тестирования MARL. Хотя блокчейн все еще находится на ранней стадии развития, его характеристики публичного состояния, проверяемого исполнения и программируемых стимулов обеспечивают фундаментальное преимущество для будущего развития MARL.
IV. Анализ классических проектов Web3 + обучение с подкреплением
На основе вышеизложенной теоретической модели мы кратко проанализируем наиболее представительные проекты в современной экосистеме:
Prime Intellect: Асинхронная парадигма обучения с подкреплением - prime-rl
Компания Prime Intellect致力于 созданию глобального открытого рынка вычислительных систем, снижению барьеров для обучения, продвижению совместного децентрализованного обучения и разработке полного набора технологий суперинтеллекта с открытым исходным кодом. Ее система включает в себя: Prime Compute (единая облачная/распределенная вычислительная среда), семейство моделей INTELLECT (10B–100B+), Environments Hub (центр открытой среды обучения с подкреплением) и крупномасштабный механизм синтетической обработки данных (SYNTHETIC-1/2).
Основной инфраструктурный компонент Prime Intellect, архитектура prime-rl, разработана для асинхронных распределенных сред и имеет большое значение для обучения с подкреплением. Другие компоненты включают протокол связи OpenDiLoCo, который преодолевает узкие места пропускной способности, и механизм проверки TopLoc, обеспечивающий вычислительную целостность.
Обзор основных компонентов инфраструктуры Prime Intellect

Техническая основа: асинхронная структура обучения с подкреплением prime-rl
prime-rl — это основной механизм обучения Prime Intellect, разработанный специально для крупномасштабных асинхронных децентрализованных сред. Он обеспечивает высокую пропускную способность вывода и стабильные обновления за счет полного разделения между Actor и Learner. Рабочие узлы и узлы обучения больше не блокируются синхронно; узлы могут присоединяться или покидать систему в любое время, просто непрерывно получая последнюю стратегию и загружая сгенерированные данные.
Актор (работники развертывания): отвечает за вывод модели и генерацию данных. Prime Intellect инновационно интегрирует механизм вывода vLLM на стороне актора. Технология PagedAttention и возможность непрерывной пакетной обработки vLLM позволяют акторам генерировать траектории вывода с чрезвычайно высокой пропускной способностью.
Обучающийся (Тренер): отвечает за оптимизацию политики. Обучающийся асинхронно извлекает данные из общего буфера опыта для обновления градиентов, не дожидаясь завершения обработки текущей партии данных всеми Акторами.
Оркестратор: отвечает за планирование весовых коэффициентов модели и потока данных.
Ключевые нововведения prime-rl:
Истинная асинхронность: prime-rl отказывается от синхронной парадигмы традиционного PPO, не ожидает медленных узлов и не требует пакетной обработки, что позволяет любому количеству и производительности графических процессоров получать доступ в любое время, закладывая основу для возможности децентрализованного обучения с подкреплением.
Глубокая интеграция FSDP2 и MoE: благодаря параметрическому разделению FSDP2 и разреженной активации MoE, prime-rl обеспечивает эффективное обучение миллиардов моделей в распределенной среде. Акторы запускают только активных экспертов, что значительно снижает потребление памяти GPU и затраты на вывод.
GRPO+ (Group Relative Policy Optimization): GRPO исключает сеть Critic, значительно снижая вычислительные и запоминающие затраты, и естественным образом адаптирована к асинхронным средам. GRPO+ в Prime-RL дополнительно обеспечивает надежную сходимость в условиях высокой задержки благодаря механизму стабилизации.
Семейство моделей INTELLECT: показатель зрелости децентрализованных технологий обучения с подкреплением.
INTELLECT-1 (10B, октябрь 2024 г.) — первый проект, продемонстрировавший возможность эффективного обучения OpenDiLoCo в гетерогенных сетях, охватывающих три континента (коэффициент связи <2%, использование вычислительной мощности 98%), что выходит за рамки физического понимания межрегионального обучения.
INTELLECT-2 (32B, апрель 2025 г.) — первая модель обучения с подкреплением без разрешений, которая подтверждает возможность стабильной сходимости prime-rl и GRPO+ в условиях многошаговой задержки и асинхронности, а также реализует децентрализованное обучение с подкреплением с участием глобальных открытых вычислительных мощностей.
INTELLECT-3 (106 млрд. MoE, ноябрь 2025 г.) использует разреженную архитектуру, активирующую всего 12 млрд параметров. Он обучен на наборе данных 512×H200 и достигает флагманских показателей производительности вывода (AIME 90,8%, GPQA 74,4%, MMLU-Pro 81,9% и др.). Его общая производительность превосходит показатели его собственной центральной модели и даже масштаб исходной модели.
Компания Prime Intellect также разработала несколько вспомогательных инфраструктурных компонентов: OpenDiLoCo сокращает обмен данными между регионами в процессе обучения в сотни раз за счет временной разреженности обмена данными и различий в весовых коэффициентах квантования, что позволяет INTELLECT-1 поддерживать 98% загрузки в трех континентальных сетях; TopLoc + Verifiers формируют децентрализованный уровень выполнения для проверки отпечатков пальцев, а механизм обработки данных для проверки отпечатков пальцев в изолированной среде создает крупномасштабные высококачественные цепочки вывода и позволяет модели 671B эффективно работать на кластерах GPU потребительского класса за счет параллельной обработки данных. Эти компоненты обеспечивают важнейшую инженерную основу для генерации данных, проверки и пропускной способности вывода в децентрализованном обучении с подкреплением. Серия INTELLECT демонстрирует, что этот технологический стек может создавать зрелые модели мирового класса, знаменуя переход децентрализованных систем обучения от концептуальной стадии к стадии практического применения.
Gensyn: Основные стеки технологий обучения с подкреплением: Swarm и SAPO
Цель Gensyn — объединить простаивающие вычислительные мощности по всему миру в открытую, не требующую доверия и бесконечно масштабируемую инфраструктуру для обучения ИИ. В её основу входит стандартизированный уровень выполнения на разных устройствах, одноранговая координационная сеть и система проверки задач, не требующая доверия, которая автоматически распределяет задачи и вознаграждения с помощью смарт-контрактов. Используя характеристики обучения с подкреплением, Gensyn внедряет такие основные механизмы, как RL Swarm, SAPO и SkipPipe, чтобы разделить процессы генерации, оценки и обновления, используя «рой» гетерогенных графических процессоров по всему миру для достижения коллективной эволюции. В конечном итоге, она обеспечивает не только вычислительные мощности, но и проверяемый интеллект.
Приложения Gensyn для обучения с подкреплением методом стекового обучения

RL Swarm: децентрализованная система совместного обучения с подкреплением.
RL Swarm демонстрирует совершенно новую модель сотрудничества. Это уже не простая система распределения задач, а децентрализованный цикл «генерация-оценка-обновление», имитирующий социальное обучение человека, аналогичный процессу совместного обучения, с бесконечным циклом:
Решатели (исполнители): отвечают за локальный вывод модели и генерацию развертывания, независимо от гетерогенности узлов. Gensyn интегрирует локально высокопроизводительный механизм вывода (например, CodeZero), который может выводить полную траекторию, а не только ответ.
Авторы предложения: Динамически генерировать задания (математические задачи, задачи на программирование и т. д.) для обеспечения разнообразия заданий и адаптивной сложности учебного процесса.
Оценщики: Используйте замороженные «модели оценки» или правила для оценки локальных внедрений и генерации локальных сигналов вознаграждения. Процесс оценки может быть проверен, что снижает возможности для злонамеренных действий.
Вместе эти три элемента образуют организационную структуру P2P RL, позволяющую осуществлять крупномасштабное совместное обучение без централизованного планирования.

SAPO: Алгоритм оптимизации политики для децентрализованной реконструкции: SAPO (Swarm Sampling Policy Optimization) фокусируется на «совместном использовании Rollout и фильтрации сигнальных выборок без градиентов, а не на совместном использовании градиентов». Благодаря крупномасштабной децентрализованной выборке Rollout и обработке полученных Rollout как локально сгенерированных, он поддерживает дифференциальную сходимость в средах с децентрализованной координацией и высокой задержкой. По сравнению с PPO, который основан на сетях Critic и имеет высокие вычислительные затраты, или GRPO, который основан на оценке внутригруппового преимущества, SAPO позволяет потребительским графическим процессорам эффективно участвовать в крупномасштабной оптимизации обучения с подкреплением с чрезвычайно низкой пропускной способностью.
С помощью RL Swarm и SAPO компания Gensyn демонстрирует, что обучение с подкреплением (особенно постобучающее RLVR) естественным образом подходит для децентрализованных архитектур, поскольку оно в большей степени опирается на крупномасштабные и разнообразные развертывания, чем на высокочастотную синхронизацию параметров. Объединяя фреймворки валидации PoL и Verde, Gensyn предлагает альтернативный путь для обучения моделей с триллионом параметров, который больше не зависит от одного технологического гиганта: саморазвивающаяся сверхинтеллектуальная сеть, состоящая из миллионов гетерогенных графических процессоров по всему миру.
Nous Research: Atropos, среда обучения с подкреплением на основе валидации.
Компания Nous Research создает децентрализованную, саморазвивающуюся когнитивную инфраструктуру. Ее основные компоненты — Hermes, Atropos, DisTrO, Psyche и World Sim — организованы в систему непрерывной замкнутой интеллектуальной эволюции. В отличие от традиционного линейного процесса «предварительное обучение — последующее обучение — вывод», Nous использует методы обучения с подкреплением, такие как DPO, GRPO и выборочное отклонение, чтобы объединить генерацию данных, проверку, обучение и вывод в непрерывный цикл обратной связи, создавая постоянно самосовершенствующуюся замкнутую экосистему ИИ.

Обзор исследовательского компонента Nous
Модельный слой: Гермес и эволюция способности к рассуждению.
Серия Hermes — это основной пользовательский интерфейс для моделей, разработанный компанией Nous Research, и её эволюция наглядно демонстрирует переход отрасли от традиционного согласования SFT/DPO к обучению с подкреплением на основе рассуждений (Reasoning Reinforcement Learning, RL):
Hermes 1–3: Выравнивание инструкций и возможности раннего агента: Hermes 1–3 полагались на недорогие DPO для надежного выравнивания инструкций, в то время как Hermes 3 использовал синтетические данные и недавно представленный механизм проверки Atropos.
Hermes 4 / DeepHermes: За счет запоминания медленного мышления в стиле System-2, реализуемого посредством цепочки мыслей, повышается математическая и программная производительность за счет масштабирования во время тестирования, а также используется метод «отбракованной выборки + проверки Атропосом» для построения высокочистых данных для вывода.
DeepHermes также использует GRPO вместо PPO, который сложно развернуть в распределенной среде, что позволяет запускать алгоритмы обучения с подкреплением на децентрализованной сети GPU Psyche, закладывая инженерную основу для масштабируемости алгоритмов обучения с подкреплением с открытым исходным кодом.
Atropos: Проверяемая среда обучения с подкреплением, основанная на вознаграждении.
Atropos — это истинный ключевой элемент системы Nous RL. Он инкапсулирует подсказки, вызовы инструментов, выполнение кода и многошаговые взаимодействия в стандартизированную среду RL, напрямую проверяя правильность выходных данных и предоставляя детерминированные сигналы вознаграждения, заменяя дорогостоящую и не масштабируемую ручную аннотацию. Что еще важнее, в децентрализованной обучающей сети Psyche Atropos выступает в роли «арбитра», проверяя, действительно ли узлы улучшают свои стратегии, поддерживая проверяемое доказательство обучения и принципиально решая проблему надежности вознаграждения в распределенном RL.

DisTrO и Psyche: оптимизирующие слои для децентрализованного обучения с подкреплением
Традиционное обучение с подкреплением (RLHF/RLAIF) основано на централизованных кластерах с высокой пропускной способностью, что является ключевым препятствием, которое системы с открытым исходным кодом не могут воспроизвести. DisTrO снижает затраты на связь в обучении с подкреплением на несколько порядков за счет разделения импульса и сжатия градиента, что позволяет проводить обучение в условиях высокой пропускной способности интернета. Psyche, с другой стороны, развертывает этот механизм обучения в сети блокчейн, позволяя узлам выполнять вывод, проверку, оценку вознаграждения и обновление весов локально, образуя полный замкнутый цикл обучения с подкреплением.
В архитектуре Nous Atropos проверяет цепочку мыслей; DisTrO сжимает обмен данными в процессе обучения; Psyche запускает цикл обучения с подкреплением; WorldSim предоставляет сложную среду; Forge собирает реальные выводы; а Hermes записывает все полученные знания в веса. Обучение с подкреплением — это не просто этап обучения, а основной протокол в архитектуре Nous, который связывает данные, среду, модель и инфраструктуру, делая Hermes живой системой, способной постоянно совершенствоваться в вычислительных сетях с открытым исходным кодом.
Градиентная сеть: Эхо, архитектура обучения с подкреплением
Основная цель Gradient Network — перестроить парадигму вычислений в области искусственного интеллекта с помощью «открытого интеллектуального стека». Технологический стек Gradient состоит из набора основных протоколов, которые могут развиваться независимо, но при этом гетерогенно взаимодействовать. Его система, от базовой связи до интеллектуального взаимодействия верхнего уровня, включает в себя: Parallax (распределенный вывод), Echo (децентрализованное обучение с подкреплением), Lattica (P2P-сеть), SEDM / Massgen / Symphony / CUAHarm (память, взаимодействие, безопасность), VeriLLM (доверенная верификация) и Mirage (моделирование точности). Это общее моделирование формирует быстро развивающуюся инфраструктуру.

Эхо — Архитектура обучения с подкреплением
Echo — это фреймворк для обучения с подкреплением от Gradient. Его основная философия проектирования заключается в разделении путей обучения, вывода и данных (вознаграждения) в обучении с подкреплением, что позволяет масштабировать и планировать генерацию развертывания, оптимизацию политики и оценку вознаграждения независимо друг от друга в гетерогенных средах. Он работает совместно в гетерогенных сетях, состоящих из узлов вывода и обучения, поддерживая стабильность обучения в гетерогенных средах с большой площадью охвата благодаря легковесному механизму синхронизации. Это эффективно снижает сбои SPMD и проблемы с использованием графических процессоров, вызванные смешанным выводом и обучением в традиционных DeepSpeed RLHF/VERL.

Echo использует двухгрупповую архитектуру для вывода и обучения, чтобы максимизировать использование вычислительной мощности. Две группы работают независимо и не блокируют друг друга.
Максимизация пропускной способности выборки: Inference Swarm состоит из графических процессоров потребительского класса и периферийных устройств и использует Parallax для создания высокопроизводительных алгоритмов выборки в параллельном режиме, фокусируясь на генерации траекторий;
Максимизация вычислительной мощности градиентного спуска: «Обучающий рой», состоящий из сетей графических процессоров потребительского класса, которые могут работать на централизованных кластерах или в нескольких местах по всему миру, отвечает за обновление градиентов, синхронизацию параметров и тонкую настройку LoRA, фокусируясь на процессе обучения.
Для обеспечения согласованности политик и данных Echo предоставляет два облегченных протокола синхронизации: последовательный и асинхронный, для достижения двунаправленного управления согласованностью весов и траекторий политик.
Режим последовательного получения данных | Приоритет точности: на стороне обучения узел вывода принудительно обновляет версию модели перед получением новой траектории, обеспечивая тем самым актуальность траектории, что подходит для задач, очень чувствительных к устареванию политики;
Асинхронный режим "тяни-толкай" | Приоритет эффективности: сторона, отвечающая за вывод, непрерывно генерирует траектории с метками версий, сторона, отвечающая за обучение, обрабатывает их в своем собственном темпе, а координатор отслеживает отклонения версий и запускает обновление весов для максимального использования ресурсов устройства.
В основе Echo лежит технология Parallax (гетерогенный вывод в условиях низкой пропускной способности) и легковесные распределенные элементы обучения (такие как VERL), использующие LoRA для снижения затрат на синхронизацию между узлами, что позволяет обеспечить стабильную работу обучения с подкреплением в гетерогенных сетях по всему миру.
Grail: Обучение с подкреплением в экосистеме Bittensor
Bittensor строит массивную, разреженную, нестационарную сеть функций вознаграждения с помощью своего уникального механизма консенсуса Юмы.
В рамках экосистемы Bittensor компания Covenant AI создала вертикально интегрированный конвейер от предварительного обучения до обучения с подкреплением, используя SN3 Templar, SN39 Basilica и SN81 Grail. SN3 Templar отвечает за предварительное обучение базовой модели, SN39 Basilica предоставляет распределенную вычислительную площадку, а SN81 Grail служит «проверяемым слоем вывода» для обучения с подкреплением, выполняя основные процессы RLHF/RLAIF и завершая оптимизацию замкнутого цикла от базовой модели до стратегии выравнивания.

GRAIL стремится криптографически доказать подлинность каждого развертывания алгоритма обучения с подкреплением и его связь с идентификатором модели, обеспечивая безопасное выполнение RLHF в среде, не требующей доверия. Протокол устанавливает цепочку доверия посредством трехуровневого механизма:
Детерминированная генерация задач: Непредсказуемые, но воспроизводимые задачи-задания (такие как SAT и GSM8K) генерируются с использованием случайных маяков и хешей блоков, что исключает мошенничество на этапе предварительных вычислений;
Используя выборку индексов PRF и эскизные обязательства, валидаторы могут с чрезвычайно низкими затратами проводить выборку логпрогностических и инференционных цепочек на уровне токенов, чтобы подтвердить, что развертывание действительно сгенерировано моделью объявления.
Привязка идентификатора модели: Процесс вывода привязан к структурированной сигнатуре отпечатка весов модели и распределению токенов, что гарантирует немедленное выявление необходимости замены модели или воспроизведения результатов. Это обеспечивает реалистичную основу для внедрения вывода в RL.
На основе этого механизма подсеть Grail реализует проверяемый процесс постобучения в стиле GRPO: майнеры генерируют несколько путей вывода для одной и той же задачи, верификаторы оценивают их на основе правильности, качества цепочки вывода и соответствия SAT, а затем записывают нормализованные результаты в блокчейн в виде весов TAO. Публичные эксперименты показывают, что эта структура повысила точность MATH в Qwen2.5-1.5B с 12,7% до 47,6%, доказывая, что она может как предотвратить мошенничество, так и значительно расширить возможности модели. В стеке обучения Covenant AI Grail является краеугольным камнем доверия и выполнения для децентрализованных RLVR/RLAIF, и он еще официально не запущен в основной сети.
Fraction AI: Обучение с подкреплением на основе конкуренции (RLFC)
Архитектура Fraction AI построена на основе обучения с подкреплением на основе соревнований (RLFC) и геймифицированной аннотации данных, заменяя статические награды и ручную аннотацию традиционного RLFC открытой, динамичной соревновательной средой. Агенты соревнуются друг с другом в разных пространствах, а их относительные рейтинги, вместе с оценками судьи-ИИ, представляют собой немедленные награды, превращая процесс сопоставления в непрерывно работающую многоагентную игровую систему.
Основные отличия традиционного RLHF от RLFC от Fraction AI:

Основная ценность RLFC заключается в том, что вознаграждение поступает не от одной модели, а от постоянно развивающихся противников и оценщиков, что предотвращает злоупотребление моделью вознаграждения и не позволяет экосистеме застревать в локальных оптимумах за счет разнообразия стратегий. Структура пространств определяет характер игры (с нулевой или положительной суммой), способствуя возникновению сложных моделей поведения в конфликтных и кооперативных взаимодействиях.
С точки зрения системной архитектуры, Friction AI разделяет процесс обучения на четыре ключевых компонента:
Агенты: Легковесные модули политики, основанные на открытом исходном коде LLM, расширенные за счет дифференцированных весов с помощью QLoRA и обновляемые с низкими затратами;
Пространства: изолированные среды, предназначенные для выполнения миссий, где агенты платят за вход и получают вознаграждения в зависимости от побед и поражений;
Судьи на основе ИИ: система мгновенного вознаграждения, созданная с использованием RLAIF, обеспечивает масштабируемую децентрализованную оценку;
Подтверждение усвоения знаний: Привязывает обновления политики к конкретным результатам соревнований, обеспечивая проверяемость процесса обучения и предотвращая мошенничество.
Суть Fraction AI заключается в построении эволюционного механизма, основанного на сотрудничестве человека и машины. Пользователи, выступая в роли «мета-оптимизаторов» на стратегическом уровне, направляют процесс исследования посредством оперативного проектирования и настройки гиперпараметров; в то время как агенты автоматически генерируют огромное количество высококачественных пар предпочтений в условиях микроуровневой конкуренции. Эта модель позволяет осуществлять аннотирование данных для достижения замкнутого цикла бизнес-процессов посредством «тонкой настройки без необходимости доверия».
Сравнение архитектур проектов Web3 с подкреплением

V. Резюме и перспективы: пути и возможности обучения с подкреплением × Web3
На основе деконструктивного анализа вышеупомянутых передовых проектов мы обнаружили, что, хотя точки входа каждой команды (алгоритмы, разработка или рынки) различаются, при сочетании обучения с подкреплением (RL) с Web3 их базовая архитектурная логика сходится в высокосогласованную парадигму «разъединение-верификация-стимулирование». Это не просто техническое совпадение, а неизбежный результат адаптации децентрализованных сетей к уникальным свойствам обучения с подкреплением.
Общие архитектурные особенности обучения с подкреплением: решение основных физических ограничений и вопросов доверия.
Разделение процессов внедрения и обучения – Заранее определенная вычислительная топология
Разреженное, распараллеливаемое развертывание (Sparse, parallelizem Rollout) выполняется на потребительских графических процессорах по всему миру, при этом высокочастотные обновления параметров сосредоточены на небольшом количестве обучающих узлов, как это видно в асинхронном алгоритме обучения акторов (Actor-Learner) от Prime Intellect и двухкластерной архитектуре Gradient Echo.
Доверие, основанное на проверке – развитие инфраструктуры
В сетях без разрешений вычислительная аутентичность должна обеспечиваться посредством математического и механистического проектирования, включающего методы криптографической проверки, такие как PoL от Gensyn, TOPLOC от Prime Intellect и Grail.
Токенизированная система поощрений – саморегулирование рынка
Предоставление вычислительных мощностей, генерация данных, проверка и ранжирование, а также распределение вознаграждений образуют замкнутый цикл. Благодаря стимулированию участия посредством вознаграждений и подавлению мошенничества с помощью штрафных санкций, сеть может оставаться стабильной и продолжать развиваться в открытой среде.
Дифференцированные технологические пути: различные «точки прорыва» в рамках единой архитектуры.
Несмотря на схожую архитектуру, каждый проект выбрал свои собственные технологические преимущества, основанные на своих особенностях:
Группа Nous Research, занимающаяся разработкой алгоритмических прорывов, пытается решить фундаментальное противоречие (узкое место в пропускной способности) распределенного обучения с математической точки зрения. Их оптимизатор DisTrO направлен на сжатие передачи градиентов в тысячи раз, с целью обеспечения возможности обучения больших моделей даже при использовании домашнего широкополосного доступа — это «атака на снижение размерности» для преодоления физических ограничений.
Системный инженерный подход (Prime Intellect, Gensyn, Gradient): фокусируется на создании систем выполнения ИИ следующего поколения. ShardCast от Prime Intellect и Parallax от Gradient разработаны для достижения максимальной эффективности гетерогенных кластеров в существующих сетевых условиях с помощью экстремальных инженерных методов.
Теория игр, основанная на рыночных принципах (Bittensor, Fraction AI): фокусируется на разработке функций вознаграждения. Благодаря искусно разработанным механизмам оценки, она направляет майнеров к спонтанному поиску оптимальных стратегий, тем самым ускоряя появление интеллекта.
Сильные стороны, вызовы и перспективы на заключительный этап
В парадигме объединения обучения с подкреплением и Web3 преимущества иерархической системы в первую очередь проявляются в пересмотре структуры затрат и структуры управления.
Изменение структуры затрат: в постобучении в RL существует неограниченная потребность в выборке данных для развертывания, в то время как Web3 может мобилизовать глобальные вычислительные мощности с большим объемом данных по чрезвычайно низкой цене, что является ценовым преимуществом, недоступным для централизованных облачных провайдеров.
Суверенное согласование: Разрушая монополию крупных компаний на ценности ИИ (согласование), сообщество может голосовать токенами, чтобы решить, «какой ответ является правильным» для модели, тем самым демократизируя управление ИИ.
В то же время, эта система сталкивается с двумя основными структурными ограничениями.
Ограничение пропускной способности: несмотря на такие инновации, как DisTrO, физическая задержка по-прежнему ограничивает полноценную подготовку моделей со сверхбольшим количеством параметров (70 млрд+), и в настоящее время Web3 AI в большей степени ограничен тонкой настройкой и выводом результатов.
Закон Гудхарда (взлом системы вознаграждений): в сетях с высокой степенью мотивации майнеры склонны к «переобучению» правил вознаграждения (фарминг очков), а не к повышению реального интеллекта. Разработка надежной функции вознаграждения для предотвращения мошенничества — это бесконечная игра.
Злонамеренные атаки типа «византийский рабочий процесс»: эти атаки нарушают сходимость модели путем активного манипулирования и отравления обучающих сигналов. Основной принцип заключается не в постоянном проектировании функций вознаграждения, препятствующих мошенничеству, а в создании надежного и противодействующего механизма.
Сочетание обучения с подкреплением и Web3 по сути переписывает механизм «того, как создается, согласовывается и распределяется интеллектуальная ценность». Его эволюцию можно суммировать в три взаимодополняющих направления:
Децентрализованная сеть обучения с использованием механизма push-ускорения: от вычислительной мощности майнинговых машин до сетей политик, аутсорсинга параллельного и проверяемого развертывания на глобальные графические процессоры с длинным хвостом, фокусирования на рынке проверяемого вывода в краткосрочной перспективе и развития в подсеть обучения с подкреплением для кластеризации задач в среднесрочной перспективе;
Преобразование предпочтений и вознаграждений в активы: от труда по разметке данных к равенству данных. Это включает в себя преобразование предпочтений и вознаграждений в активы, трансформацию высококачественной обратной связи и модели вознаграждения в управляемые и распределяемые информационные активы, а также повышение статуса «труда по разметке данных» до «равенства данных».
«Небольшая, но прекрасная» эволюция в вертикальных областях: в вертикальных сценариях, где результаты поддаются проверке, а выгоды количественно измеримы, разрабатываются небольшие, но мощные специализированные агенты обучения с подкреплением, такие как агенты для выполнения стратегий DeFi и генерации кода, которые напрямую связывают улучшение стратегии с получением выгоды и, как ожидается, превзойдут общие модели с закрытым исходным кодом.
В целом, реальная возможность для интеграции обучения с подкреплением и Web3 заключается не в воспроизведении децентрализованной версии OpenAI, а в переписывании «интеллектуальных производственных отношений»: превращении выполнения обучения в открытый рынок вычислительной мощности, обеспечении управляемых вознаграждений и предпочтений в активы блокчейна и перераспределении ценности, создаваемой интеллектом, не только на платформе, но и между обучающими программами, программистами и пользователями.

Отказ от ответственности: Данная статья написана с помощью инструментов искусственного интеллекта ChatGPT-5 и Gemini 3. Автор приложил все усилия для проверки и обеспечения достоверности и точности информации, однако неизбежны упущения. Приносим извинения за доставленные неудобства. Особенно важно отметить, что на криптовалютном рынке часто наблюдается расхождение между фундаментальными показателями проекта и динамикой цен на вторичном рынке. Данная статья предназначена исключительно для информационных и академических/исследовательских целей и не является инвестиционной рекомендацией, а также не должна рассматриваться как рекомендация к покупке или продаже какого-либо токена.
Данный контент предназначен исключительно для информационных и образовательных целей и не является инвестиционным советом, связанным с BTCC. BTCC прилагает все усилия, но не может гарантировать правдивость, точность или оригинальность вышеприведенного контента.