NVIDIA Mellanox 920-9B210-00FN-0D0 ในทางปฏิบัติ: การสร้างเครือข่าย NDR ที่มีความหน่วงต่ำสำหรับโมเดล MoE ที่มีพารามิเตอร์นับล้านล้าน
August 27, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 ในการปฏิบัติ: การสร้าง NDR Low-Latency Fabric สําหรับแบบ MoE ปารามิเตอร์ทริล้าน
เบื้องหลัง และ ความ ท้าทาย เมื่อ การ ให้ ทุก คน ได้ รับ ทุก อย่าง เป็น ปัญหา ใน การ ฝึกอบรม
องค์กรการวิจัย AI ที่ชั้นนํา ล่าสุดได้ปรับขนาดกลุ่มฝึกอบรมแบบภาษาขนาดใหญ่จาก 1,024 เป็น 4,096 NVIDIA H100 GPU โดยมีเป้าหมายที่ทะเยอทะยานในการลดเวลาฝึกอบรมสําหรับ 1.โมเดล MoE (Mixture of Experts) ที่มีปารามิตร 8 พันล้านตัวละเอียดจากเดือนถึงไม่ถึงสองสัปดาห์อย่างไรก็ตาม ระหว่างการตรวจสอบครั้งแรก the team discovered that their existing 200Gb/s HDR network was experiencing severe congestion during the all-to-all communication phase—a characteristic pattern of MoE architectures—causing GPU utilization to plummet from an expected 85% to just 52%ต่ํากว่าขั้นต่ําที่จําเป็นในการดําเนินการ
การวิเคราะห์เครือข่ายแสดงให้เห็นว่าการสื่อสารร่วมกันทั้งหมดเป็นส่วนมากกว่า 40% ของร่องรอยการสื่อสารของรุ่น MOE และเมื่อจํานวนผู้เชี่ยวชาญเพิ่มขึ้นการจราจรเป็นรูปแบบที่แตกแยกและแตกแยกมากขึ้น. เครือข่าย HDR ที่มีอยู่ หลังจากเปิดระบบควบคุมความจุกจุก มีการเพิ่มระยะเวลาในการใช้งานอย่างมาก ทําให้ส่วนใหญ่ของ GPU อยู่ในช่วงรอคอยองค์กรต้องการอย่างเร่งด่วน สายเครือข่ายที่สามารถส่งผลการกําหนดความช้าต่ํากว่าไมโครเซกอนด์, การขนส่งไร้ความสูญเสีย, และการปรับปรุงขนาดใหญ่ที่ไม่กั้นNVIDIA Mellanox 920-9B210-00FN-0D0ถูกสร้างมาเพื่อความท้าทายนี้
การแก้ไขและการจัดจําหน่าย: อาร์คิเทคชัน Leaf-Spine NDR ที่ได้รับการปรับปรุงโดย MoE
องค์กรได้นําผ้าใบกระดูกสันหลังสองชั้น920-9B210-00FN-0D0 InfiniBand สวิตช์ OPNในทุกคอมพิวเตอร์ราค920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRสวิทช์ถูกนําไปใช้ในชั้นใบ, ให้ความเชื่อมต่อ 400Gb / s กับ 64 เซอร์เวอร์ H100 ที่มีประตูสองทางผ่านสายไฟฟ้าออฟติกที่ทํางาน OSFP-to-OSFP16 สวิตช์เพิ่มเติม 920-9B210-00FN-0D0 เชื่อมต่อกัน สวิตช์ใบทั้งหมด, สร้างเนื้อเยื่อไม้ไขมันที่ไม่กักขัดอย่างสมบูรณ์แบบที่มีความกว้างของแบนด์เบนด์ของ 51.2 Tb / s
ส่วนกลางของคําตอบนี้คือเทคโนโลยี SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) ของสวิตช์การสื่อสารจากทุกคนไปยังทุกคนถูกส่งตรงไปยังผ้าสวิทช์, โดยสวิทช์ทําการลดข้อมูลในเครือข่ายและการกระจายใหม่ลดค่าใช้จ่ายในการสื่อสารอย่างมาก ซึ่งเป็นปัญหาในการใช้งาน HDR ก่อนหน้านี้.ใบข้อมูล 920-9B210-00FN-0D0ชี้ให้เห็นถึงความช้าในการตัดที่ต่ํากว่า 100 ns ซึ่งถูกรับรองในช่วงช่วงการพิสูจน์แนวคิด และพิสูจน์ว่ามีความสําคัญต่อความต้องการความช้าที่เข้มงวดของภาระงาน MoE
รายการรายละเอียด 920-9B210-00FN-0D0✓รวมถึงปั๊มพลังงานสองแบบที่เหลือใช้และแฟนที่เปลี่ยนได้ร้อน920-9B210-00FN-0D0 รองรับระบบนิเวศรวมออฟติกและเคเบิล OSFP ทั้งหมดที่พวกเขาได้รับคุณสมบัติแล้ว การกําจัดการช้าในการจัดซื้อและการปรับปรุงระยะเวลาการใช้งาน
ผลลัพธ์และผลกําไรที่สามารถวัดได้: จากอุปสรรคไปยังผู้ช่วย
หลังจากที่ระบบ NDR ได้ถูกนําไปใช้อย่างเต็มที่ และงานฝึกอบรมของกระทรวงอุตสาหกรรมได้เริ่มใหม่ องค์กรได้วัดการปรับปรุงการเปลี่ยนแปลงผ่านหลายมิติ:
- การฟื้นฟูการใช้งาน GPU:การใช้งาน GPU โดยเฉลี่ยเพิ่มขึ้นจาก 52% เป็น 89% โดยการใช้งานสูงสุดถึง 94% ในช่วงที่ใช้งานคอมพิวเตอร์มาก
- การลดความช้าทั้งหมด:เวลาที่จําเป็นสําหรับการแลกเปลี่ยนครบวงจรทั้งหมดผ่าน 4,096 GPU ลดลงจาก 180ms เป็นต่ํากว่า 45ms, การปรับปรุง 75% ที่แปลโดยตรงไปยังการฝึกซ้อมที่รวดเร็วขึ้น
- ระยะเวลาในการเสร็จสิ้นงานระยะเวลาการฝึกอบรมที่คาดไว้สําหรับโมเดล 1.8T MoE ถูกลดจาก 14 วันเป็นเพียง 9 วัน ผันเร็ว 36% ซึ่งลดค่าใช้จ่ายทั้งเวลาในการตลาดและคอมพิวเตอร์ในเมฆอย่างสําคัญ
- ประสิทธิภาพการดําเนินงานด้วย 64 ท่าทางต่อสวิทช์ จํานวนสวิทช์กระดูกสันหลังที่จําเป็นถูกลดลง 37% เมื่อเทียบกับการออกแบบ HDR 40 ท่าทาง โดยทําให้การเชื่อมสายงานง่ายขึ้นและลดการบริโภคพลังงานต่อเรคลง 28%
จากมุมมองของค่าบริการรวม920-9B210-00FN-0D0 ราคาราคาต่อเน็ตต่อ GPU จริงๆ ลดลง เนื่องจากรากีซ์ที่สูงขึ้นและจํานวนชั้นสวิตช์ที่ลดลง ข้อดีทางเศรษฐกิจนี้รวมไปถึงผลงานที่ดีขึ้นอย่างมากทําให้การปรับปรุง NDR เป็นการชนะธุรกิจที่ชัดเจน920-9B210-00FN-0D0 โซลูชั่น OPN สวิตช์ InfiniBandยังได้บูรณาการอย่างต่อเนื่องกับการใช้งาน NVIDIA UFM ที่มีอยู่ในปัจจุบัน ด้วยการให้ความเห็นกลางและเตือนแบบอัตโนมัติ ซึ่งลดค่าใช้จ่ายในการดําเนินงานลงถึง 40%
สรุปและมุมมอง: มูลนิธิ NDR สําหรับภาระงาน MOE รุ่นใหม่
รายการNVIDIA Mellanox 920-9B210-00FN-0D0พิสูจน์ว่าเป็นทางออกที่เปลี่ยนแปลง ที่องค์กรวิจัย AI นี้ต้องการ เพื่อปลดปล่อยศักยภาพเต็มของคลาสเตอร์ H100 4,096-GPU ของมัน โดยการให้ความกว้างแบนด์ NDR 400Gb/s ความหนาแน่น 64-portและ SHARPv3 ในเครือข่ายคอมพิวเตอร์, การเปลี่ยนทําให้พวกเขาสามารถปรับขนาดจาก 1,024 เป็น 4,096 GPU โดยไม่เสียผลงานหรือความสามารถในการจัดการ
มองไปข้างหน้า องค์กรวางแผนที่จะขยายไปถึง 8,192 GPU ภายใน 18 เดือนข้างหน้า920-9B210-00FN-0D0 สําหรับขายผ่านพันธมิตรช่องทางของ NVIDIA เพื่อสร้างเนื้อเยื่อปิดพับสามชั้นที่ใหญ่กว่าเครื่อง 920-9B210-00FN-0D0 ให้ความสามารถที่พิสูจน์ได้, โซลูชั่นพร้อมการผลิตที่นําเสนอสัญญาในการปรับปรุง RDMA อินเตอร์คอนเนคต์ความช้าต่ําใน exascale

