NVIDIA Mellanox MQM8790-HS2F สวิตช์ InfiniBand ในการทำงาน: การเพิ่มประสิทธิภาพการเชื่อมต่อความหน่วงต่ำสำหรับคลัสเตอร์ RDMA/HPC/AI

August 21, 2026

ข่าว บริษัท ล่าสุดเกี่ยวกับ NVIDIA Mellanox MQM8790-HS2F สวิตช์ InfiniBand ในการทำงาน: การเพิ่มประสิทธิภาพการเชื่อมต่อความหน่วงต่ำสำหรับคลัสเตอร์ RDMA/HPC/AI

NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch in Action: การปรับปรุงการเชื่อมต่อระยะยาวต่ําสําหรับ RDMA / HPC / AI Clusters

ในแวดล้อมของการฝึกแบบ AI ในขนาดใหญ่และการคิดเลขความสามารถสูง (HPC) ความช้าของเครือข่ายมักกลายเป็นอุปสรรคสําคัญที่จํากัดความสามารถในการปรับขนาดและประสิทธิภาพของคลาสเตอร์ศูนย์คอมพิวเตอร์ยอดเยี่ยมระดับประเทศ จบการปรับปรุงโครงสร้างพื้นฐานอย่างใหญ่หลวงเมื่อเร็วๆ นี้, การเปลี่ยนแปลงจาก 100Gb / s EDR InfiniBand fabric ไปยัง 200Gb / sNVIDIA Mellanox MQM8790-HS2Fสวิตช์ InfiniBand การศึกษากรณีนี้วิเคราะห์ความท้าทายที่พวกเขาต้องเผชิญ, กลยุทธ์การจัดจําหน่าย, และการเพิ่มประสิทธิภาพที่สามารถวัดได้สําเร็จผ่านการเชื่อมต่อรุ่นต่อไปนี้

สถานการณ์และความท้าทาย: เมื่อความช้าช้ากลายเป็นเพลตเพลตการทํางาน

ศูนย์คอมพิวเตอร์ยอดเยี่ยมใช้งานคลัสเตอร์ที่ไม่เหมือนกัน ซึ่งประกอบด้วย 2,000 หน่วย GPU ที่รองรับการผสมผสานภาระงานที่หลากหลาย ซึ่งรวมถึงการจําลองสภาพอากาศ การวิจัยพันธุกรรมและการฝึกแบบภาษาขนาดใหญ่กับเครือข่าย EDR 100Gb/s ก่อนหน้านี้ทีมปฏิบัติการสังเกตว่าการดําเนินงานสื่อสารรวม เช่น All-Reduce และ All-Gather ใช้ส่วนส่วนที่เพิ่มขึ้นของเวลาทํางานทั้งหมดเมื่อจํานวน Node เพิ่มขึ้นในงานฝึกหัดกระจายบางงาน, ค่าใช้จ่ายที่เกี่ยวข้องกับเครือข่ายมีส่วนร่วมเกือบ 40% ของเวลาการดําเนินงานปลายไปปลาย, จํากัดการใช้งาน GPU อย่างหนักและขยายวงจรการรวมตัวแบบ.

ความท้าทายเพิ่มเติมประกอบด้วย

  • สถานที่ร้อนของการจราจร:รูปแบบการจราจรในการฝึก AI มักจะกระจายและไม่สามารถคาดเดาได้ ซึ่งนําไปสู่การกั้นหัวของสาย และการเพิ่มความช้าของหาง ที่ทําให้การกําหนดการทํางานถูกขัดขวาง
  • การเร่งในเครือข่ายที่ไม่เพียงพอองค์ประกอบเก่าขาดการสนับสนุนความสามารถในการลดอัตราการโหลดรวมที่ก้าวหน้า ทําให้การดําเนินการลดทั้งหมดต้องผ่านระบบระดับความจําและ CPU ของเจ้าภาพ
  • ความซับซ้อนของการจัดการการแก้ไขปัญหาด้านการทํางานจําเป็นต้องมีการวิเคราะห์ด้วยมือของเครื่องมือการติดตามหลายอย่าง ทําให้ยากที่จะระบุสาเหตุเบื้องต้นในการใช้งานขนาดใหญ่

หลังจากการประเมินตัวเลือกการเชื่อมต่อหลายตัว ศูนย์ได้เลือกMQM8790-HS2Fเป็นพื้นฐานสําหรับผ้าใหม่ของมันใบข้อมูล MQM8790-HS2F, สวิตช์นี้ให้บริการ 40 ท่าทางของ 200Gb / s HDR ไม่ปิดการผ่าน ความช้าตัด-ผ่าน sub-130ns และการสนับสนุน SHARP v30 ความสามารถในการลดภาระร่วมกันที่ตอบสนองตรงกับจุดเจ็บปวดหลักของพวกเขา.

การแก้ไขและการนําไปใช้งาน: สร้างเนื้อเยื่อความช้าต่ําสําหรับ AI / HPC

การจัดจําหน่ายได้นํามาใช้โปโลยีต้นไขมันสองชั้นMQM8790-HS2F 200Gb/s HDR 40 ท่า QSFP56สวิตช์ที่ใช้ในฐานะก้อนผงและ 8 หน่วยเป็นสวิตช์กระดูกสันหลัง1 การสมัครสมาชิกเกินจํานวนในกลุ่มทั้งหมด เพียงพอสําหรับภาระงานปัจจุบันของพวกเขา.

ชั้นการใช้งาน จํานวนสวิตช์ ท่าเรือที่ใช้ การเชื่อมต่อ
ใบ (ต่อเร็ก) 24 32 ท่าเรือแต่ละลํา เซอร์เวอร์ ToR + สปินอัพลิงค์
กระดูกสันหลัง 8 ละ 36 ท่าเรือ หน้าตาเต็มทุกสวิทช์ใบ

สวิตช์ใบแต่ละใบเชื่อมต่อกับหน่วยคอมพิวเตอร์ ผ่าน NVIDIA ConnectX-6 HDR โฮสต์แคแนนอลสอดคล้องกับ MQM8790-HS2Fออฟติกส์และระบบนิเวศการเชื่อมเคเบิล ทําให้ทีมงานสามารถนําเคเบิล QSFP56 ที่มีอยู่มาใช้ใหม่ โดยเร่งการจัดจําหน่ายและลดต้นทุนการจัดซื้อด้วยเครื่องควบคุมที่ใช้ NVIDIA's Unified Fabric Manager (UFM) สําหรับการค้นหาและจัดหาทอปโลยีแบบอัตโนมัติ.

การสนับสนุนของสวิตช์สําหรับการตั้งเส้นทางปรับปรุงและการควบคุมความจุกจุกได้พิสูจน์ว่ามีความสําคัญในการจัดการกับลักษณะของการจราจรที่แตกของภาระงาน AIโดยการกระจายกระแสใหม่อย่างไดนามิค ระหว่างเส้นทางที่มีอยู่, การMQM8790-HS2F สวิตช์ InfiniBandลดการสร้างจุดร้อนให้น้อยที่สุด และรักษาผลงานอย่างต่อเนื่อง แม้กระทั่งในช่วงเวลาที่ทํางานสูงสุด

ผลลัพธ์และผลกําไร: การปรับปรุงที่สามารถวัดได้ในงานและการใช้ GPU

หลังการดําเนินการผลิต 3 เดือน ศูนย์คอมพิวเตอร์ยอดเยี่ยมรายงานผลการดําเนินงานเพิ่มขึ้นอย่างสําคัญ

  • การลดความช้า:อัตราเฉลี่ยของ MPI ping-pong latency ลดลงจาก 680 ns บนผ้า EDR ก่อนหน้านี้เป็นต่ํากว่า 130 ns กับNVIDIA Mellanox MQM8790-HS2Fซึ่งแสดงให้เห็นถึงการปรับปรุงประสิทธิภาพในการแลกเปลี่ยนข้อความถึง 5 เท่า
  • การเร่งขันการดําเนินงานร่วมกันการลดความช้าทั้งหมดสําหรับงาน 1024 หน่วยลดลง 62% ขอบคุณ SHARP v3.0 offload ที่ทําการลดโดยตรงภายในผนังสลับ
  • การใช้งาน GPU:ผลรวมของความช้าที่ต่ํากว่าและความกว้างแบนด์วิทที่สูงกว่าผลักดันการใช้งาน GPU โดยเฉลี่ยจาก 72% เป็น 91%, แปลว่าการลดเวลาในการแก้ไข 26% สําหรับการทํางานการฝึกแบบภาษาขนาดใหญ่.
  • ประสิทธิภาพการกําหนดการทํางานการลดความแปรปรวนความช้าของหางทําให้โปรแกรมการกําหนดเวลาของ SLURM สามารถบรรจุงานได้มากขึ้นในชุดหน่วยเดียวกันโดยไม่ต้องขัดแย้งการทํางาน เพิ่มความสามารถในการทํางานของคลัสเตอร์โดยรวมโดยประมาณ 18%

เมื่อทีมงานในภายหลังเทียบราคา MQM8790-HS2Fกับสวิทช์ทางเลือกจากผู้ขายอื่น they found that the total cost per Gb/s delivered was highly competitive—especially when factoring in the reduced management overhead and the switch's ability to support both HDR and HDR100 link speedsการปกป้องการลงทุนในสภาพแวดล้อมความเร็วผสม

จากมุมมองการดําเนินงาน แพลตฟอร์ม UFM ที่บูรณาการให้บริการกระจกเดียวสําหรับการติดตามสุขภาพผ้า รูปแบบการจราจร และความผิดพลาดระดับลิงค์การมองเห็นนี้ทําให้ทีมงานสามารถระบุสายไฟที่เสื่อมเสื่อมได้อย่างเป็นระเบียบ และเปลี่ยนมันระหว่างการบํารุงรักษาตามกําหนดการหลีกเลี่ยงการหยุดทํางานที่ไม่ได้วางแผน

สรุปและมุมมอง: แผนผังสําหรับผ้ารุ่นใหม่ที่มีความช้าต่ํา

การศึกษากรณีนี้แสดงว่าMQM8790-HS2F โซลูชั่นสวิตช์ InfiniBandเป็นมากกว่าการปรับปรุงความเร็วที่ง่ายๆ มันคือองค์ประกอบที่เปลี่ยนแปลงสําหรับองค์กรที่ต้องการที่จะปลดล็อคศักยภาพการทํางานเต็มของพื้นฐาน AI และ HPC ของพวกเขาโดยรวมความหนาแน่นของท่าเรือสูง, ความยืดหยุ่นที่ต่ํามาก และความสามารถในการคิดเลขในเครือข่าย สวิตช์จะแก้ไขข้อจํากัดทางการสื่อสารที่มีความจํากัดในการปรับขนาดคลัสเตอร์

มองไปข้างหน้า ศูนย์คอมพิวเตอร์ยอดเยี่ยมวางแผนที่จะขยายพื้นที่การทํางานไปถึง 2,400 ค้อน ในปีงบประมาณหน้าMQM8790-HS2Fอาร์คิทคัตราที่มีสวิตช์กระดูกสันหลังเพิ่มเติม ทีมงานยังกําลังศึกษาการสนับสนุนของสวิตช์สําหรับอัลการิทึมการลดที่พัฒนาของ SHARP v3.0ซึ่งสัญญาว่าจะเร่งกระบวนการทํางานที่กําลังเกิดขึ้น เช่น เครือข่ายเซลล์ประสาทกราฟ และการเรียนรู้เสริม.

สําหรับผู้บริหารไอที, สถาปนิกเครือข่าย และวิศวกรที่ประเมินตัวเลือกการเชื่อมต่อสําหรับการสร้างคลาสเตอร์ของตัวเองNVIDIA Mellanox MQM8790-HS2Fเปิดทางที่ผ่านการพิสูจน์และผ่านการตรวจสอบในสนามเพื่อบรรลุความช้าต่ํากว่าไมโครเซกอนด์, การใช้งาน GPU ให้มากที่สุด, และการจัดการผ้าที่เรียบง่ายรายละเอียด MQM8790-HS2Fและการออกแบบอ้างอิงมีให้บริการจาก NVIDIA's ทางเข้าเอกสารทางเทคนิค และสวิตช์ตอนนี้มีให้บริการทั่วไปMQM8790-HS2F สําหรับขายเพื่อหาพันธมิตรภูมิภาค