Google เผยต้นทุนหน่วยความจำเซิร์ฟเวอร์ AI ทะลุ 75% เดินหน้ากลยุทธ์คู่ขนานทั้งซอฟต์แวร์และฮาร์ดแวร์

chaincatcherchaincatcher
การประชุมสุดยอดหน่วยความจำ SEMICON Taiwan 2026 จัดขึ้นในวันที่ 1 โดย Nikhil Cherian ผู้อำนวยการอาวุโสฝ่ายโครงสร้างพื้นฐานซัพพลายเชนของ Google Cloud ภายใต้ Alphabet ระบุว่า ด้วยความนิยมของสถาปัตยกรรม multimodal และ mixture of experts การประมวลผล AI ได้เปลี่ยนจากข้อจำกัดด้านพลังงานมาเป็นข้อจำกัดด้านหน่วยความจำ โดยหน่วยความจำประสิทธิภาพสูงคิดเป็นสัดส่วนมากกว่า 75% ของต้นทุนวัสดุฮาร์ดแวร์เซิร์ฟเวอร์ AI เมื่อเผชิญกับปัญหาคอขวดด้านความจุ แบนด์วิดท์ และการใช้พลังงาน Google กำลังฝ่าวิกฤตคอขวดด้านหน่วยความจำ AI ผ่านกลยุทธ์คู่ขนานทั้งการโหลดงานออกจากฮาร์ดแวร์สำหรับการอนุมานและการฝึกฝน และอัลกอริทึมซอฟต์แวร์การหาปริมาณแบบไม่สูญเสียข้อมูล Google ใช้กลยุทธ์การโหลดงานออกในสถาปัตยกรรมฮาร์ดแวร์ โดยเปิดตัว TPU 8i สำหรับการอนุมานที่หน่วงเวลาต่ำ และ TPU 8t ที่เชี่ยวชาญด้านการฝึกฝนขนาดใหญ่ TPU 8i มาพร้อมหน่วยความจำแบนด์วิดท์สูง 288 GB โดยเพิ่มความจุ SRAM บนชิปสามเท่าเป็น 384 MiB เพื่อวางสถานะการสนทนาแบบไดนามิกและแคชคีย์-ค่าบนชิปเอง ทำให้เกิดความหน่วงเป็นศูนย์เมื่อต้องเข้าถึงข้อมูลนอกชิป TPU 8t สร้างคลัสเตอร์การคำนวณขนาดใหญ่พิเศษด้วยชิป 9600 ตัว ทำให้เกิดพูล HBM ที่ใช้ร่วมกันในระดับ 2 PB ขจัดปัญหาคอขวดการถ่ายโอนข้อมูลนอกชิป พร้อมกับเทคโนโลยี TPU Direct Storage Google พัฒนาอัลกอริทึมการหาปริมาณแบบไม่สูญเสียข้อมูล TurboQuant ที่ไม่ต้องฝึกฝน โดยบีบอัดแคชคีย์-ค่าของโมเดลขนาดใหญ่จาก 32 บิตเป็น 3 บิต ลดการใช้หน่วยความจำลงหกเท่าโดยไม่สูญเสียความแม่นยำ ส่งผลให้การคำนวณ attention เร็วขึ้นแปดเท่า และผสานเทคโนโลยี DRAM รุ่นเก่าเพื่อยืดอายุการใช้งานของส่วนประกอบ

เนื้อหานี้จัดทำขึ้นโดยมีวัตถุประสงค์เพื่อแจ้งข้อมูลและให้ความรู้เท่านั้น และไม่ถือว่าเป็นคำแนะนำด้านการลงทุนที่เกี่ยวข้องกับ BTCC แต่อย่างใด BTCC ใช้ความพยายามอย่างเต็มที่ แต่ไม่สามารถรับประกันความจริงแท้ ความถูกต้อง หรือความเป็นต้นฉบับของเนื้อหาข้างต้นได้