NVIDIA Mellanox 920-9B110-00FH-0D0 อ้างอิงทางเทคนิค: อัตราต่อเนื่องความช้าต่ําที่ปรับปรุงให้ RDMA / HPC / AI
August 25, 2026
NVIDIA Mellanox 920-9B110-00FH-0D0 อ้างอิงทางเทคนิค: อัตราต่อเนื่องความช้าต่ําที่ปรับปรุงให้ดีสําหรับ RDMA / HPC / AI คลัสเตอร์ที่ 200Gb / s HDR
1. สถานการณ์โครงการและการวิเคราะห์ความต้องการ
ในขณะที่ HPC และ AI คลัสเตอร์ยังคงปรับขนาด การฝึกอบรมกระจายและภาระงานจําลองทางวิทยาศาสตร์ต้องการความกว้างแบนด์วิท, ความช้า และความสามารถปรับขนาดของเครือข่ายที่เข้มข้นมากขึ้น not every cluster requires 400Gb/s NDR infrastructure—a significant number of production environments are already standardized on 200Gb/s HDR and seek performance improvements within a controlled budgetความต้องการทั่วไปประกอบด้วย:
- ความช้าต่ําแบบกําหนดการสื่อสารรวมของ MPI ต้องมีความช้าที่ต่ํากว่าไมโครเซกอนด์ จากท่าเรือไปท่าเรือ เพื่อป้องกันความช้าของหางจากการส่งผลกระทบต่อการเข้าใกล้ของการฝึกอบรม
- เนื้อผ้าไร้การสูญเสียปัสดุศูนย์ลดลงภายใต้ความจุกจุก เพื่อให้ประหยัด RDMA และหลีกเลี่ยงการล่มสลายการทํางาน
- อัตราการคิดเลขในเครือข่าย:การอํานวยความสะดวกในการทํางานรวม เช่น All-Reduce ให้กับเนื้อเยื่อเครือข่ายเพื่อปลดปล่อยทรัพยากร CPU / GPU ของเจ้าภาพ
- ความสามารถในการปรับขนาดที่เรียบง่าย:การสนับสนุนการขยายที่ไม่ปิดจากร้อยๆ ไปยังพันๆ ค้อนของหน่วย, พร้อมความสอดคล้องกับเคเบิล HDR และเครื่องรับแสงที่มีอยู่
เพื่อตอบโจทย์ความต้องการเหล่านี้ ทางแก้ไขนี้ใช้NVIDIA Mellanox 920-9B110-00FH-0D0ในฐานะก้อนก้อนหลักของเครื่องเปลี่ยน HDR InfiniBand 200Gb/s ที่สมดุลการทํางาน ความหนาแน่น และประสิทธิภาพในเรื่องค่าใช้จ่าย สําหรับการใช้งานขนาดกลางถึงขนาดใหญ่
2การออกแบบโครงสร้างเครือข่ายโดยรวม
การแก้ไขที่เสนอใช้ท็อปโลจีกระดูกสันหลังใบสองชั้น ซึ่งให้ผ้าที่สามารถปรับขนาดได้, ไม่กักกั้น, ด้วยความยืดหยุ่นที่คาดการณ์ได้ และการเชื่อมต่อสายไฟที่เรียบง่ายแต่ละเรคคอมพิวเตอร์มีเครื่อง920-9B110-00FH-0D0 InfiniBand สวิตช์ OPN(Ordering Part Number) ให้การเชื่อมต่อ HDR 200Gb/s ถึงเซอร์เวอร์ GPU 40 ท่าทาง ผ่าน OSFP-to-OSFP ผสมตรงทองแดง (DAC) หรือสายไฟฟ้าไฟฟ้าไฟฟ้าไฟฟ้าไฟฟ้าไฟฟ้า (AOC)ระดับที่สองของสวิทช์ MQM8790-HS2F920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDRผสมผสานสวิทช์ใบทั้งหมด สร้างเนื้อเยื่อต้นไม้ไขมันที่มีความกว้างขวางเต็ม
สําหรับคลาสเตอร์ขนาดใหญ่กว่า 1,500 node สามารถนําสถาปัตยกรรมปิดแบบพับได้ 3 ชั้นด้วย 920-9B110-00FH-0D0 ทําหน้าที่ทั้งใบและกระดูกสันหลัง เพื่อรักษาผลงานที่คงที่ในทุกระดับตารางต่อไปนี้สรุปปารามิเตอร์การปรับขนาดหลักสําหรับผ้า HDR 2 ชั้นที่สร้างขึ้นรอบสวิตช์นี้:
| ส่วนประกอบ | รายละเอียด | มูลค่า |
|---|---|---|
| เครื่องสลับใบ | 920-9B110-00FH-0D0 | 1 ใบต่อเร็ก |
| เครื่องสลับกระดูกสันหลัง | 920-9B110-00FH-0D0 | N/2 (N = จํานวนสวิทช์ใบ) |
| ปัจจัยสุดท้ายสูงสุด | เซอร์เวอร์ GPU | สูงสุด 1,600 (สัดส่วน 40 ท่า) |
| ความกว้างแบนด์เบนด์ของ Bisection | การไม่กดขัดเต็ม | 8.0 Tb/s ต่อชั้นกระดูกสันหลัง |
3. บทบาทและลักษณะสําคัญของ NVIDIA Mellanox 920-9B110-00FH-0D0
ภายในโครงสร้างนี้NVIDIA Mellanox 920-9B110-00FH-0D0ทําหน้าที่เป็นองค์ประกอบการสลับพื้นฐาน โดยให้ความสามารถสําคัญหลายอย่าง:
- 40 ท่าทางของ 200Gb/s HDR:ท่าทาง OSFP ทุกท่าสนับสนุน 200Gb / s สองทิศกับการแก้ไขความผิดพลาดด้านหน้า (FEC) สําหรับการเชื่อมต่อระยะยาวที่น่าเชื่อถือ
- SHARPv2 ที่บูรณาการ (โปรโตคอลการรวมและการลดระดับระดับระดับระดับขนาด)ช่วยลดความลําบากในการดําเนินงานการสื่อสารรวม โดยลดความช้า MPI All-Reduce ถึง 30% ในภาระงาน HPC แบบปกติ
- การปรับเปลี่ยนเส้นทางและควบคุมความจุกจุก:เปลี่ยนเส้นทางการจราจรอย่างไดนามิค เพื่อหลีกเลี่ยงจุดร้อน, รับประกันผลงานที่คาดเดาได้ ภายใต้รูปแบบการจราจรที่ขัดแย้ง
- การวัดระยะไกลที่ทันสมัยคอนเตอร์ต่อการไหลและต่อท่าเรือ พร้อมกับการติดตามการใช้งานของพัฟเฟอร์ ให้ความเห็นอย่างลึกซึ้งต่อสุขภาพของผ้า
ตามใบข้อมูล 920-9B110-00FH-0D0, สวิตช์ให้ความอ่อนแอตัดผ่าน sub-200ns และสนับสนุนถึง 8.0 Tb / s ของความจุการสวิตช์รวมรายละเอียด 920-9B110-00FH-0D0นอกจากนี้ยังต้องเน้นแหล่งพลังงานสองแบบที่เหลือใช้และโมดูลพัดลมที่เปลี่ยนได้ร้อน เพื่อรับประกันความพร้อม 99.999% สําหรับภาระงานที่สําคัญต่อภาระกิจ
4. แนะนําการจัดจําหน่ายและการปรับขนาด
สําหรับองค์กรที่วางแผนที่จะนํา920-9B110-00FH-0D0 InfiniBand สวิตช์ OPN โซลชั่นแนะนําแนวทางการใช้งานต่อไปนี้
- กลยุทธ์การเชื่อมสายไฟฟ้า:ใช้สาย OSFP-to-OSFP DAC สําหรับการเชื่อมต่อภายในราค (สูงสุด 3m) และ AOC หรือตัวรับออฟติกสําหรับการเชื่อมต่อระหว่างราคและกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดาน (สูงสุด 100m)920-9B110-00FH-0D0 รองรับตามเมทริกซ์ความเข้ากันของ NVIDIA
- การลาออก:ใช้เครื่องพลังงานสองสายเชื่อมต่อกับ PDU ต่างๆ ใช้สวิทช์กระดูกสันหลังอย่างน้อยสองตัวต่อใบ เพื่อกําจัดจุดพังเดียว
- การจัดการฟอร์มแวร์:ให้แน่ใจว่าสวิตช์ทั้งหมดจะใช้ฟอร์มแวร์ NVIDIA แบบเดียวกัน ใช้คุณสมบัติการปรับปรุงฟอร์มแวร์อัตโนมัติของ UFM สําหรับการอัพเดทอย่างต่อเนื่องโดยไม่ต้องหยุดทํางาน
- เส้นทางการปรับขนาด:สําหรับคลาสเตอร์เกิน 1,600 หน่วย, การเปลี่ยนไปยังท็อปโลจีปิดแบบพับสามชั้นหรือใช้ Dragonfly+ ด้วยการนําทางแบบปรับปรุง920-9B110-00FH-0D0 รองรับการสวิทช์สูงสุด 64 ในผ้าเดียวภายใต้ผู้จัดการซับเน็ตเดียว.
เมื่อคํานวณค่าใช้จ่ายรวมของเจ้าของ, สังเกตจํานวนที่ลดลงของระดับสวิตช์และการปรับปรุงสายไฟที่เรียบง่ายเมื่อเทียบกับทางเลือกที่มีราดิกซ์ต่ํากว่า.920-9B110-00FH-0D0 ราคาราคาต่อหน่วยสูงกว่าสวิทช์ EDR (100Gb / s) ราคาต่อท่าเรือต่ํากว่า NDR อย่างมาก ทําให้มันเป็นทางเลือกที่ดีที่สุดสําหรับการจัดจําหน่าย HDR ที่มีสติในราคา
5การดําเนินงาน ติดตามและแก้ปัญหา
การจัดการที่มีประสิทธิภาพของผ้า HDR ต้องการกรอบการติดตามและแก้ไขปัญหาที่ครบวงจร. Unified Fabric Manager (UFM) ของ NVIDIA ให้แผ่นกระจกเดียวสําหรับNVIDIA Mellanox 920-9B110-00FH-0D0เนื้อเยื่อที่ใช้ในงาน:
- การแสดงภาพทอปโลยี:การค้นพบอัตโนมัติและการแสดงภาพของสวิตช์, ลิงค์ และจุดปลายทั้งหมด
- แดชบอร์ดการทํางาน:วิวในเวลาจริงของการใช้งานท่าเรือ อัตราความผิดพลาด และตัวชี้วัดความจุกจุก
- การเตือนอย่างระวังระเบิดระดับขั้นต่ําสําหรับการทําลายสายเชื่อม ความผิดปกติของอุณหภูมิ และความล้มเหลวของไฟฟ้า
- การแยกความผิดพลาด:การกํากับการแก้ไขปัญหาของกระบวนการทํางานที่ระบุสายไฟที่ผิดปกติ, เครื่องรับสัญญาณ, หรือพอร์ตสวิตช์
สําหรับการแก้ไขปัญหาที่ระดับสูง ใช้เครื่องมือวินิจฉัยที่ติดตั้งในสวิตช์ รวมถึงการทดสอบลุปแบ็ค และการวิเคราะห์ BER (Bit Error Rate)เพื่อรับรองความสมบูรณ์แบบของเชื่อมต่อ ก่อนการใช้งานภาระงานการผลิตปัญหาทั่วไปที่พบในช่วงการใช้งานในช่วงแรกรวมถึงการนําทางที่ไม่ดีที่สุดที่เกิดจากความเร็วการเชื่อมต่อที่ไม่เท่าเทียมกันหรือประเภทเคเบิลที่ไม่ตรงกันการเปิดให้ใช้ Routing ที่ปรับปรุงและตรวจสอบว่าทุกลิงค์ทํางานที่ 200Gb/s (มี FEC เปิด) แก้ไขความผิดปกติส่วนใหญ่ของการทํางาน.920-9B110-00FH-0D0 InfiniBand สวิตช์ OPNยังรองรับการตั้งค่าผู้จัดการซับเน็ตที่เหลือใช้ เพื่อให้แน่ใจว่าการตั้งค่าใหม่ของเนื้อเยื่อจะเกิดขึ้นโดยไม่ต้องการแทรกแซงด้วยมือในกรณีที่ Node การจัดการล้มเหลว
6. สรุปและการประเมินค่า
รายการ920-9B110-00FH-0D0ส่งข้อเสนอคุณค่าที่น่าเชื่อถือสําหรับองค์กรที่สร้างหรือขยาย HPC และ AI คลัสเตอร์ที่ใช้ HDR. มันให้บริการ 40 ท่าทางของ 200Gb / s HDR ด้วยความช้าต่ํากว่า 200ns, SHARPv2 offload,และการจัดการระดับองค์กร ทั้งหมดในแพลตฟอร์ม 1U ที่มีประหยัดประเด็นสําคัญคือ:
- ประสิทธิภาพ:การลดเวลาในการเสร็จสิ้นงานถึง 35% สําหรับภาระงานที่ใช้สื่อสารอย่างมาก ผ่านการลดภาระ SHARPv2 และการนําทางแบบปรับตัว
- ประสิทธิภาพการใช้จ่ายTCO ที่ต่ํากว่าเมื่อเทียบกับ NDR ตัวแทน โดยมีค่าใช้จ่ายต่อท่าเรือที่ปรับปรุงให้ดีที่สุดสําหรับการจัดจําหน่ายขนาด HDR
- การทํางานง่าย:การบูรณาการอย่างลึกซึ้งกับ UFM สําหรับการจัดการแบบรวมกัน การติดตามอย่างระวัง และการเปลี่ยนระบบโดยอัตโนมัติ
- การคุ้มครองการลงทุนมีความสอดคล้องเต็มที่กับสายไฟฟ้า HDR, ออตติกส์ และซอฟต์แวร์ที่มีอยู่
สําหรับองค์กรที่ประเมิน920-9B110-00FH-0D0 สําหรับขายผ่านพันธมิตรช่องทางของ NVIDIA เราแนะนําให้รีวิวรายละเอียดใบข้อมูล 920-9B110-00FH-0D0และร่วมมือกับสถาปนิกการแก้ไขที่ได้รับการรับรองเพื่อรับรองการออกแบบสําหรับภาระงานและความต้องการขนาดเฉพาะของคุณNVIDIA Mellanox 920-9B110-00FH-0D0พร้อมสําหรับการผลิตในปัจจุบัน ซึ่งเป็นรากฐานในการเชื่อมต่อที่สมดุลและมีประสิทธิภาพสูง สําหรับการนวัตกรรม HPC และ AI รุ่นต่อไป

