NVIDIA Mellanox 920-9B210-00FN-0D0 ในการปฏิบัติ: การสร้าง NDR Low-Latency Fabric สําหรับคลาสเตอร์ AI ปารามิเตอร์พันล้าน

August 26, 2026

ข่าว บริษัท ล่าสุดเกี่ยวกับ NVIDIA Mellanox 920-9B210-00FN-0D0 ในการปฏิบัติ: การสร้าง NDR Low-Latency Fabric สําหรับคลาสเตอร์ AI ปารามิเตอร์พันล้าน

NVIDIA Mellanox 920-9B210-00FN-0D0 ในทางปฏิบัติ: การสร้างเครือข่าย NDR ที่มีความหน่วงต่ำสำหรับคลัสเตอร์ AI ระดับล้านล้านพารามิเตอร์

เบื้องหลังและความท้าทาย: เมื่อ HDR พบกับโมเดลระดับล้านล้านพารามิเตอร์

องค์กรวิจัย AI ชั้นนำแห่งหนึ่งได้ขยายคลัสเตอร์การฝึกอบรมโมเดลภาษาขนาดใหญ่จาก 1,024 เป็น 4,096 GPU ของ NVIDIA H100 โดยมีเป้าหมายเพื่อลดระยะเวลาการฝึกอบรมสำหรับโมเดล MoE (Mixture of Experts) แบบเบาบางขนาด 1.8 ล้านล้านพารามิเตอร์ จากหลายเดือนเหลือไม่ถึงสองสัปดาห์ อย่างไรก็ตาม ในระหว่างการตรวจสอบเบื้องต้น ทีมงานสังเกตเห็นการติดขัดอย่างรุนแรงในระยะการสื่อสารแบบ all-to-all บนเครือข่าย HDR 200Gb/s ที่มีอยู่ ทำให้การใช้งาน GPU ลดลงจากที่คาดการณ์ไว้ 85% เหลือเพียง 52% ซึ่งต่ำกว่าเกณฑ์ที่จำเป็นในการบรรลุเป้าหมายการฝึกอบรมที่ทะเยอทะยาน

การวิเคราะห์เครือข่ายเผยให้เห็นว่าการดำเนินการแบบ all-to-all collective ซึ่งเป็นส่วนสำคัญของสถาปัตยกรรม MoE กำลังทำให้ลิงก์ HDR อิ่มตัวและกระตุ้นกลไกการควบคุมการติดขัด ซึ่งยิ่งเพิ่มความหน่วง องค์กรต้องการเครือข่ายที่สามารถส่งมอบความหน่วงที่แน่นอน น้อยกว่าไมโครวินาที ในหลายพันจุดปลายทาง พร้อมทั้งให้แบนด์วิดท์ที่เพียงพอเพื่อรองรับการรับส่งข้อมูลที่เพิ่มขึ้นโดยไม่ทำให้ประสิทธิภาพลดลง นี่คือความท้าทายที่ NVIDIA Mellanox 920-9B210-00FN-0D0 ถูกออกแบบมาเพื่อแก้ไข

โซลูชันและการติดตั้ง: เครือข่าย NDR 400Gb/s สำหรับ AI ระดับ Exascale

องค์กรได้ติดตั้ง 920-9B210-00FN-0D0 InfiniBand switch OPN (Ordering Part Number) เป็นรากฐานของเครือข่าย leaf-spine แบบสองชั้นใหม่ ที่ชั้น leaf สวิตช์แต่ละแร็คได้รับสวิตช์ 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR สองตัว ให้การเชื่อมต่อ 128 พอร์ต 400Gb/s กับเซิร์ฟเวอร์ H100 แบบ dual-port 64 เครื่องต่อแร็ค ผ่านสายเคเบิลออปติคัลแบบแอคทีฟ OSFP-to-OSFP ที่ชั้น spine สวิตช์ 920-9B210-00FN-0D0 เพิ่มเติมอีก 16 ตัวเชื่อมต่อสวิตช์ leaf ทั้งหมด สร้างเครือข่าย fat-tree แบบ non-blocking ที่มีแบนด์วิดท์ bisection เต็มรูปแบบ 51.2 Tb/s ต่อชั้น spine

สิ่งที่ทำให้โซลูชันนี้น่าสนใจเป็นพิเศษคือเทคโนโลยี SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) ในตัวของสวิตช์ สำหรับเวิร์กโหลด MoE การสื่อสารแบบ all-to-all ถูกถ่ายโอนโดยตรงไปยังเครือข่ายสวิตช์ โดยสวิตช์จะทำการลดข้อมูลและกระจายข้อมูลใหม่ภายในเครือข่าย สิ่งนี้ช่วยลดความจำเป็นในการส่งข้อมูลหลายครั้งที่ฝั่งโฮสต์ ซึ่งช่วยลดภาระการสื่อสารที่เคยเป็นปัญหาในการติดตั้ง HDR ก่อนหน้านี้ได้อย่างมาก

ตาม 920-9B210-00FN-0D0 datasheet สวิตช์นี้ให้ความหน่วงแบบ cut-through น้อยกว่า 100ns ซึ่งได้รับการยืนยันในระหว่างขั้นตอนการพิสูจน์แนวคิด ทีมวิศวกรรมยังยืนยันว่าระบบนิเวศที่ 920-9B210-00FN-0D0 compatible ประกอบด้วยออปติกและสายเคเบิล OSFP ทั้งหมดที่พวกเขาได้ทำการรับรองแล้ว ซึ่งช่วยลดความล่าช้าในการจัดซื้อ 920-9B210-00FN-0D0 specifications ซึ่งรวมถึงแหล่งจ่ายไฟแบบ dual-redundant และพัดลมแบบ hot-swappable ทำให้ทีมงานมั่นใจในการบรรลุเป้าหมายความพร้อมใช้งาน 99.999% สำหรับคลัสเตอร์การผลิต

ผลลัพธ์และผลประโยชน์ที่วัดได้: จากคอขวดสู่ตัวขับเคลื่อน

หลังจากติดตั้งเครือข่าย NDR เต็มรูปแบบและเริ่มงานฝึกอบรม MoE ใหม่ องค์กรได้วัดผลการปรับปรุงที่เปลี่ยนแปลงไปในหลายมิติ:

  • การฟื้นตัวของการใช้งาน GPU: การใช้งาน GPU เฉลี่ยพุ่งสูงขึ้นจาก 52% เป็น 89% โดยมีการใช้งานสูงสุดถึง 94% ในช่วงที่การประมวลผลเข้มข้น ซึ่งเป็นผลโดยตรงจากการขจัดปัญหาคอขวดที่เกิดจากเครือข่าย
  • การลดความหน่วงแบบ all-to-all: เวลาที่ต้องใช้ในการแลกเปลี่ยนข้อมูลแบบ all-to-all เต็มรูปแบบระหว่าง GPU 4,096 ตัว ลดลงจาก 180ms เหลือต่ำกว่า 45ms ซึ่งเป็นการปรับปรุง 75% ที่ส่งผลโดยตรงต่อการทำซ้ำการฝึกอบรมที่เร็วขึ้น
  • เวลาในการทำงานให้เสร็จ: ระยะเวลาการฝึกอบรมที่คาดการณ์ไว้สำหรับโมเดล MoE ขนาด 1.8T ลดลงจาก 14 วัน เหลือเพียง 9 วัน ซึ่งเป็นการเร่งความเร็ว 36% ที่ช่วยลดทั้งเวลาในการออกสู่ตลาดและค่าใช้จ่ายในการประมวลผลบนคลาวด์
  • ประสิทธิภาพการดำเนินงาน: ด้วย 64 พอร์ตต่อสวิตช์ จำนวนสวิตช์ spine ที่ต้องการลดลง 37% เมื่อเทียบกับการออกแบบ HDR 40 พอร์ต ทำให้การเดินสายง่ายขึ้นและลดการใช้พลังงานต่อแร็คลง 28%

จากมุมมองของต้นทุนรวมในการเป็นเจ้าของ ทีมการเงินขององค์กรตั้งข้อสังเกตว่าแม้ว่า 920-9B210-00FN-0D0 price ต่อหน่วยจะสูงกว่าทางเลือก HDR แต่ต้นทุนเครือข่ายต่อ GPU จริงๆ แล้วลดลงเนื่องจาก radix ที่สูงขึ้นและจำนวนชั้นสวิตช์ที่ลดลง ข้อได้เปรียบทางเศรษฐกิจนี้ ร่วมกับผลการดำเนินงานที่เพิ่มขึ้นอย่างมาก ทำให้การอัปเกรด NDR เป็นชัยชนะทางธุรกิจที่ชัดเจน 920-9B210-00FN-0D0 InfiniBand switch OPN solution ยังทำงานร่วมกับระบบ NVIDIA UFM ที่มีอยู่ได้อย่างราบรื่น ให้การมองเห็นแบบรวมศูนย์และการแจ้งเตือนอัตโนมัติที่ลดภาระการดำเนินงานลง 40%

สรุปและแนวโน้ม: รากฐาน NDR สำหรับ AI ยุคถัดไป

NVIDIA Mellanox 920-9B210-00FN-0D0 ได้พิสูจน์แล้วว่าเป็นโซลูชันที่เปลี่ยนแปลงไปซึ่งองค์กรวิจัย AI แห่งนี้ต้องการเพื่อปลดล็อกศักยภาพสูงสุดของคลัสเตอร์ H100 ที่มี GPU 4,096 ตัว ด้วยการส่งมอบแบนด์วิดท์ NDR 400Gb/s ความหนาแน่น 64 พอร์ต และการประมวลผลในเครือข่าย SHARPv3 สวิตช์นี้ทำให้พวกเขาสามารถขยายขนาดจาก 1,024 เป็น 4,096 GPU ได้โดยไม่กระทบต่อประสิทธิภาพหรือความสามารถในการจัดการ ซึ่งเป็นความสำเร็จที่จะเป็นไปไม่ได้ด้วยโครงสร้างพื้นฐาน HDR เดิมของพวกเขา

มองไปข้างหน้า องค์กรวางแผนที่จะขยายไปยัง GPU 8,192 ตัวภายใน 18 เดือนข้างหน้า โดยใช้ประโยชน์จาก 920-9B210-00FN-0D0 for sale ผ่านพันธมิตรช่องทางของ NVIDIA เพื่อสร้างเครือข่าย folded-Clos แบบสามชั้นที่ใหญ่ขึ้น สำหรับองค์กรที่กำลังประเมินการลงทุนเครือข่าย AI และ HPC รุ่นต่อไป 920-9B210-00FN-0D0 นำเสนอโซลูชันที่ได้รับการพิสูจน์แล้ว พร้อมใช้งานจริง ที่ตอบสนองต่อคำมั่นสัญญาของการเพิ่มประสิทธิภาพการเชื่อมต่อ RDMA ที่มีความหน่วงต่ำในระดับ exascale