Google заявляет, что стоимость памяти для ИИ-серверов превысила 75%, продвигая двухтрековую стратегию для программного и аппаратного обеспечения
chaincatcherСаммит по памяти SEMICON Taiwan 2026 состоялся 1-го числа, где Нихил Чериан, старший директор по инфраструктуре цепочки поставок в Google Cloud под управлением Alphabet, отметил, что с ростом популярности мультимодальных и смешанных экспертных архитектур, ИИ-вычисления сместились от ограничений по мощности к ограничениям по памяти, при этом высокопроизводительная память составляет более 75% стоимости спецификации аппаратного обеспечения ИИ-серверов. Столкнувшись с узкими местами в емкости, пропускной способности и энергопотреблении, Google преодолевает узкое место памяти для ИИ с помощью двухтрековой стратегии: аппаратная разгрузка для вывода и обучения, а также алгоритмы без потерь для квантования. Google применяет стратегию разгрузки в аппаратной архитектуре, выпуская TPU 8i для низколатентного вывода и TPU 8t, специализированный для крупномасштабного обучения. TPU 8i оснащен 288 ГБ высокоскоростной памяти, объем SRAM на чипе увеличен втрое до 384 МиБ, что позволяет размещать динамические состояния диалога и кэши ключей и значений непосредственно на чипе, обеспечивая нулевую задержку при обращении к памяти вне чипа. TPU 8t образует сверхбольшой вычислительный кластер из 9600 чипов, достигая общего пула HBM масштаба 2 ПБ, устраняя узкие места передачи данных вне чипа, а также используя технологию TPU Direct Storage. Google разработал алгоритм квантования без потерь TurboQuant, не требующий обучения, сжимая кэш ключей и значений больших моделей с 32 бит до 3 бит, снижая использование памяти в шесть раз без потери точности, что приводит к восьмикратному ускорению вычислений внимания, а также интегрирует технологию DRAM старшего поколения для продления срока службы компонентов.
Данный контент предназначен исключительно для информационных и образовательных целей и не является инвестиционным советом, связанным с BTCC. BTCC прилагает все усилия, но не может гарантировать правдивость, точность или оригинальность вышеприведенного контента.