NVIDIA Mellanox 920-9B110-00FH-0D0 อ้างอิงทางเทคนิค: อัตราต่อเนื่องความช้าต่ําที่ปรับปรุงให้ RDMA / HPC / AI

August 25, 2026

NVIDIA Mellanox 920-9B110-00FH-0D0 อ้างอิงทางเทคนิค: อัตราต่อเนื่องความช้าต่ําที่ปรับปรุงให้ RDMA / HPC / AI

NVIDIA Mellanox 920-9B110-00FH-0D0 อ้างอิงทางเทคนิค: อัตราต่อเนื่องความช้าต่ําที่ปรับปรุงให้ดีสําหรับ RDMA / HPC / AI คลัสเตอร์ที่ 200Gb / s HDR

1. สถานการณ์โครงการและการวิเคราะห์ความต้องการ

ในขณะที่ HPC และ AI คลัสเตอร์ยังคงปรับขนาด การฝึกอบรมกระจายและภาระงานจําลองทางวิทยาศาสตร์ต้องการความกว้างแบนด์วิท, ความช้า และความสามารถปรับขนาดของเครือข่ายที่เข้มข้นมากขึ้น not every cluster requires 400Gb/s NDR infrastructure—a significant number of production environments are already standardized on 200Gb/s HDR and seek performance improvements within a controlled budgetความต้องการทั่วไปประกอบด้วย:

  • ความช้าต่ําแบบกําหนดการสื่อสารรวมของ MPI ต้องมีความช้าที่ต่ํากว่าไมโครเซกอนด์ จากท่าเรือไปท่าเรือ เพื่อป้องกันความช้าของหางจากการส่งผลกระทบต่อการเข้าใกล้ของการฝึกอบรม
  • เนื้อผ้าไร้การสูญเสียปัสดุศูนย์ลดลงภายใต้ความจุกจุก เพื่อให้ประหยัด RDMA และหลีกเลี่ยงการล่มสลายการทํางาน
  • อัตราการคิดเลขในเครือข่าย:การอํานวยความสะดวกในการทํางานรวม เช่น All-Reduce ให้กับเนื้อเยื่อเครือข่ายเพื่อปลดปล่อยทรัพยากร CPU / GPU ของเจ้าภาพ
  • ความสามารถในการปรับขนาดที่เรียบง่าย:การสนับสนุนการขยายที่ไม่ปิดจากร้อยๆ ไปยังพันๆ ค้อนของหน่วย, พร้อมความสอดคล้องกับเคเบิล HDR และเครื่องรับแสงที่มีอยู่

เพื่อตอบโจทย์ความต้องการเหล่านี้ ทางแก้ไขนี้ใช้NVIDIA Mellanox 920-9B110-00FH-0D0ในฐานะก้อนก้อนหลักของเครื่องเปลี่ยน HDR InfiniBand 200Gb/s ที่สมดุลการทํางาน ความหนาแน่น และประสิทธิภาพในเรื่องค่าใช้จ่าย สําหรับการใช้งานขนาดกลางถึงขนาดใหญ่

2การออกแบบโครงสร้างเครือข่ายโดยรวม

การแก้ไขที่เสนอใช้ท็อปโลจีกระดูกสันหลังใบสองชั้น ซึ่งให้ผ้าที่สามารถปรับขนาดได้, ไม่กักกั้น, ด้วยความยืดหยุ่นที่คาดการณ์ได้ และการเชื่อมต่อสายไฟที่เรียบง่ายแต่ละเรคคอมพิวเตอร์มีเครื่อง920-9B110-00FH-0D0 InfiniBand สวิตช์ OPN(Ordering Part Number) ให้การเชื่อมต่อ HDR 200Gb/s ถึงเซอร์เวอร์ GPU 40 ท่าทาง ผ่าน OSFP-to-OSFP ผสมตรงทองแดง (DAC) หรือสายไฟฟ้าไฟฟ้าไฟฟ้าไฟฟ้าไฟฟ้าไฟฟ้า (AOC)ระดับที่สองของสวิทช์ MQM8790-HS2F920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDRผสมผสานสวิทช์ใบทั้งหมด สร้างเนื้อเยื่อต้นไม้ไขมันที่มีความกว้างขวางเต็ม

สําหรับคลาสเตอร์ขนาดใหญ่กว่า 1,500 node สามารถนําสถาปัตยกรรมปิดแบบพับได้ 3 ชั้นด้วย 920-9B110-00FH-0D0 ทําหน้าที่ทั้งใบและกระดูกสันหลัง เพื่อรักษาผลงานที่คงที่ในทุกระดับตารางต่อไปนี้สรุปปารามิเตอร์การปรับขนาดหลักสําหรับผ้า HDR 2 ชั้นที่สร้างขึ้นรอบสวิตช์นี้:

ส่วนประกอบ รายละเอียด มูลค่า
เครื่องสลับใบ 920-9B110-00FH-0D0 1 ใบต่อเร็ก
เครื่องสลับกระดูกสันหลัง 920-9B110-00FH-0D0 N/2 (N = จํานวนสวิทช์ใบ)
ปัจจัยสุดท้ายสูงสุด เซอร์เวอร์ GPU สูงสุด 1,600 (สัดส่วน 40 ท่า)
ความกว้างแบนด์เบนด์ของ Bisection การไม่กดขัดเต็ม 8.0 Tb/s ต่อชั้นกระดูกสันหลัง

3. บทบาทและลักษณะสําคัญของ NVIDIA Mellanox 920-9B110-00FH-0D0

ภายในโครงสร้างนี้NVIDIA Mellanox 920-9B110-00FH-0D0ทําหน้าที่เป็นองค์ประกอบการสลับพื้นฐาน โดยให้ความสามารถสําคัญหลายอย่าง:

  • 40 ท่าทางของ 200Gb/s HDR:ท่าทาง OSFP ทุกท่าสนับสนุน 200Gb / s สองทิศกับการแก้ไขความผิดพลาดด้านหน้า (FEC) สําหรับการเชื่อมต่อระยะยาวที่น่าเชื่อถือ
  • SHARPv2 ที่บูรณาการ (โปรโตคอลการรวมและการลดระดับระดับระดับระดับขนาด)ช่วยลดความลําบากในการดําเนินงานการสื่อสารรวม โดยลดความช้า MPI All-Reduce ถึง 30% ในภาระงาน HPC แบบปกติ
  • การปรับเปลี่ยนเส้นทางและควบคุมความจุกจุก:เปลี่ยนเส้นทางการจราจรอย่างไดนามิค เพื่อหลีกเลี่ยงจุดร้อน, รับประกันผลงานที่คาดเดาได้ ภายใต้รูปแบบการจราจรที่ขัดแย้ง
  • การวัดระยะไกลที่ทันสมัยคอนเตอร์ต่อการไหลและต่อท่าเรือ พร้อมกับการติดตามการใช้งานของพัฟเฟอร์ ให้ความเห็นอย่างลึกซึ้งต่อสุขภาพของผ้า

ตามใบข้อมูล 920-9B110-00FH-0D0, สวิตช์ให้ความอ่อนแอตัดผ่าน sub-200ns และสนับสนุนถึง 8.0 Tb / s ของความจุการสวิตช์รวมรายละเอียด 920-9B110-00FH-0D0นอกจากนี้ยังต้องเน้นแหล่งพลังงานสองแบบที่เหลือใช้และโมดูลพัดลมที่เปลี่ยนได้ร้อน เพื่อรับประกันความพร้อม 99.999% สําหรับภาระงานที่สําคัญต่อภาระกิจ

4. แนะนําการจัดจําหน่ายและการปรับขนาด

สําหรับองค์กรที่วางแผนที่จะนํา920-9B110-00FH-0D0 InfiniBand สวิตช์ OPN โซลชั่นแนะนําแนวทางการใช้งานต่อไปนี้

  • กลยุทธ์การเชื่อมสายไฟฟ้า:ใช้สาย OSFP-to-OSFP DAC สําหรับการเชื่อมต่อภายในราค (สูงสุด 3m) และ AOC หรือตัวรับออฟติกสําหรับการเชื่อมต่อระหว่างราคและกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดาน (สูงสุด 100m)920-9B110-00FH-0D0 รองรับตามเมทริกซ์ความเข้ากันของ NVIDIA
  • การลาออก:ใช้เครื่องพลังงานสองสายเชื่อมต่อกับ PDU ต่างๆ ใช้สวิทช์กระดูกสันหลังอย่างน้อยสองตัวต่อใบ เพื่อกําจัดจุดพังเดียว
  • การจัดการฟอร์มแวร์:ให้แน่ใจว่าสวิตช์ทั้งหมดจะใช้ฟอร์มแวร์ NVIDIA แบบเดียวกัน ใช้คุณสมบัติการปรับปรุงฟอร์มแวร์อัตโนมัติของ UFM สําหรับการอัพเดทอย่างต่อเนื่องโดยไม่ต้องหยุดทํางาน
  • เส้นทางการปรับขนาด:สําหรับคลาสเตอร์เกิน 1,600 หน่วย, การเปลี่ยนไปยังท็อปโลจีปิดแบบพับสามชั้นหรือใช้ Dragonfly+ ด้วยการนําทางแบบปรับปรุง920-9B110-00FH-0D0 รองรับการสวิทช์สูงสุด 64 ในผ้าเดียวภายใต้ผู้จัดการซับเน็ตเดียว.

เมื่อคํานวณค่าใช้จ่ายรวมของเจ้าของ, สังเกตจํานวนที่ลดลงของระดับสวิตช์และการปรับปรุงสายไฟที่เรียบง่ายเมื่อเทียบกับทางเลือกที่มีราดิกซ์ต่ํากว่า.920-9B110-00FH-0D0 ราคาราคาต่อหน่วยสูงกว่าสวิทช์ EDR (100Gb / s) ราคาต่อท่าเรือต่ํากว่า NDR อย่างมาก ทําให้มันเป็นทางเลือกที่ดีที่สุดสําหรับการจัดจําหน่าย HDR ที่มีสติในราคา

5การดําเนินงาน ติดตามและแก้ปัญหา

การจัดการที่มีประสิทธิภาพของผ้า HDR ต้องการกรอบการติดตามและแก้ไขปัญหาที่ครบวงจร. Unified Fabric Manager (UFM) ของ NVIDIA ให้แผ่นกระจกเดียวสําหรับNVIDIA Mellanox 920-9B110-00FH-0D0เนื้อเยื่อที่ใช้ในงาน:

  • การแสดงภาพทอปโลยี:การค้นพบอัตโนมัติและการแสดงภาพของสวิตช์, ลิงค์ และจุดปลายทั้งหมด
  • แดชบอร์ดการทํางาน:วิวในเวลาจริงของการใช้งานท่าเรือ อัตราความผิดพลาด และตัวชี้วัดความจุกจุก
  • การเตือนอย่างระวังระเบิดระดับขั้นต่ําสําหรับการทําลายสายเชื่อม ความผิดปกติของอุณหภูมิ และความล้มเหลวของไฟฟ้า
  • การแยกความผิดพลาด:การกํากับการแก้ไขปัญหาของกระบวนการทํางานที่ระบุสายไฟที่ผิดปกติ, เครื่องรับสัญญาณ, หรือพอร์ตสวิตช์

สําหรับการแก้ไขปัญหาที่ระดับสูง ใช้เครื่องมือวินิจฉัยที่ติดตั้งในสวิตช์ รวมถึงการทดสอบลุปแบ็ค และการวิเคราะห์ BER (Bit Error Rate)เพื่อรับรองความสมบูรณ์แบบของเชื่อมต่อ ก่อนการใช้งานภาระงานการผลิตปัญหาทั่วไปที่พบในช่วงการใช้งานในช่วงแรกรวมถึงการนําทางที่ไม่ดีที่สุดที่เกิดจากความเร็วการเชื่อมต่อที่ไม่เท่าเทียมกันหรือประเภทเคเบิลที่ไม่ตรงกันการเปิดให้ใช้ Routing ที่ปรับปรุงและตรวจสอบว่าทุกลิงค์ทํางานที่ 200Gb/s (มี FEC เปิด) แก้ไขความผิดปกติส่วนใหญ่ของการทํางาน.920-9B110-00FH-0D0 InfiniBand สวิตช์ OPNยังรองรับการตั้งค่าผู้จัดการซับเน็ตที่เหลือใช้ เพื่อให้แน่ใจว่าการตั้งค่าใหม่ของเนื้อเยื่อจะเกิดขึ้นโดยไม่ต้องการแทรกแซงด้วยมือในกรณีที่ Node การจัดการล้มเหลว

6. สรุปและการประเมินค่า

รายการ920-9B110-00FH-0D0ส่งข้อเสนอคุณค่าที่น่าเชื่อถือสําหรับองค์กรที่สร้างหรือขยาย HPC และ AI คลัสเตอร์ที่ใช้ HDR. มันให้บริการ 40 ท่าทางของ 200Gb / s HDR ด้วยความช้าต่ํากว่า 200ns, SHARPv2 offload,และการจัดการระดับองค์กร ทั้งหมดในแพลตฟอร์ม 1U ที่มีประหยัดประเด็นสําคัญคือ:

  • ประสิทธิภาพ:การลดเวลาในการเสร็จสิ้นงานถึง 35% สําหรับภาระงานที่ใช้สื่อสารอย่างมาก ผ่านการลดภาระ SHARPv2 และการนําทางแบบปรับตัว
  • ประสิทธิภาพการใช้จ่ายTCO ที่ต่ํากว่าเมื่อเทียบกับ NDR ตัวแทน โดยมีค่าใช้จ่ายต่อท่าเรือที่ปรับปรุงให้ดีที่สุดสําหรับการจัดจําหน่ายขนาด HDR
  • การทํางานง่าย:การบูรณาการอย่างลึกซึ้งกับ UFM สําหรับการจัดการแบบรวมกัน การติดตามอย่างระวัง และการเปลี่ยนระบบโดยอัตโนมัติ
  • การคุ้มครองการลงทุนมีความสอดคล้องเต็มที่กับสายไฟฟ้า HDR, ออตติกส์ และซอฟต์แวร์ที่มีอยู่

สําหรับองค์กรที่ประเมิน920-9B110-00FH-0D0 สําหรับขายผ่านพันธมิตรช่องทางของ NVIDIA เราแนะนําให้รีวิวรายละเอียดใบข้อมูล 920-9B110-00FH-0D0และร่วมมือกับสถาปนิกการแก้ไขที่ได้รับการรับรองเพื่อรับรองการออกแบบสําหรับภาระงานและความต้องการขนาดเฉพาะของคุณNVIDIA Mellanox 920-9B110-00FH-0D0พร้อมสําหรับการผลิตในปัจจุบัน ซึ่งเป็นรากฐานในการเชื่อมต่อที่สมดุลและมีประสิทธิภาพสูง สําหรับการนวัตกรรม HPC และ AI รุ่นต่อไป