Исследование: улучшение эффективности предварительного обучения с 2019 по 2025 год в основном обусловлено данными

chaincatcherchaincatcher
Dwarkesh Patel и Jerry Han опубликовали исследование 8 сентября 2026 года, в котором разложили вклад улучшений данных и моделей в прогресс предварительного обучения с 2019 по 2025 год. Исследование проводилось в меньшем масштабе, сосредоточившись на предварительном обучении, соответствующем публично выпущенным рецептам моделей и публично доступным корпусам данных для каждого года, и обучалось при вычислительном масштабе до 1e19 FLOPs. Результаты показывают, что при бюджете вычислений 1e19 FLOPs выигрыш в вычислительной эффективности от улучшений данных составляет 12,0 раз, в то время как улучшения моделей дают 3,7 раза, при этом выигрыш со стороны данных примерно в 3,24 раза больше, чем со стороны модели. Выигрыши от улучшений данных и моделей в значительной степени независимы и очень мало взаимодействуют, при этом аддитивный эффект обоих объясняет 88% дисперсии в показателях OLMES в рамках линейной модели. Со стороны модели эволюция от GPT-2 до OLMo-2 охватывает оптимизаторы, позиционное кодирование, нормализацию, функции активации и инициализацию, среди прочего. Со стороны данных корпус эволюционировал от примерно 9 миллиардов токенов OpenWebText в 2019 году до более крупных и более тщательно отфильтрованных корпусов, таких как UltraFineWeb, к 2025 году.

Данный контент предназначен исключительно для информационных и образовательных целей и не является инвестиционным советом, связанным с BTCC. BTCC прилагает все усилия, но не может гарантировать правдивость, точность или оригинальность вышеприведенного контента.