NVIDIA Mellanox 920-9B110-00FH-0D0 ในปฏิบัติการ: การปรับปรุงผ้า RDMA ความช้าต่ําสําหรับ HPC และ AI คลัสเตอร์

August 25, 2026

ข่าว บริษัท ล่าสุดเกี่ยวกับ NVIDIA Mellanox 920-9B110-00FH-0D0 ในปฏิบัติการ: การปรับปรุงผ้า RDMA ความช้าต่ําสําหรับ HPC และ AI คลัสเตอร์

NVIDIA Mellanox 920-9B110-00FH-0D0 ในทางปฏิบัติ: การปรับปรุงประสิทธิภาพเครือข่าย RDMA ที่มีความหน่วงต่ำสำหรับคลัสเตอร์ HPC และ AI

เบื้องหลังและความท้าทาย: เมื่อประสิทธิภาพ HDR พบกับความเป็นจริงด้านงบประมาณ

ห้องปฏิบัติการวิจัย AI ขนาดกลางแห่งหนึ่งเพิ่งเผชิญกับความท้าทายที่คุ้นเคย: เครือข่าย InfiniBand EDR 100Gb/s ที่มีอยู่ของพวกเขากลายเป็นคอขวดสำหรับคลัสเตอร์ GPU ที่กำลังขยายตัว ซึ่งเติบโตจาก 128 เป็น 512 โหนด NVIDIA A100 เวลาในการฝึกโมเดล Transformer ขนาดใหญ่เพิ่มขึ้นกว่า 40% เนื่องจากการจราจรติดขัดของเครือข่ายระหว่างการดำเนินการ all-reduce และทีมงานต้องการการอัปเกรดที่สามารถให้ประสิทธิภาพที่เพิ่มขึ้นอย่างมากโดยไม่ต้องใช้เงินลงทุนจำนวนมากที่จำเป็นสำหรับการใช้งาน NDR 400Gb/s เต็มรูปแบบ

ห้องปฏิบัติการได้ประเมินตัวเลือกหลายอย่างและระบุ 200Gb/s HDR ว่าเป็นสมดุลที่เหมาะสมระหว่างประสิทธิภาพและต้นทุน อย่างไรก็ตาม พวกเขาต้องการสวิตช์ที่สามารถให้ความหนาแน่นของพอร์ตสูง การควบคุมการจราจรติดขัดขั้นสูง และการผสานรวมอย่างราบรื่นกับสายเคเบิลและตัวรับส่งสัญญาณที่เข้ากันได้กับ HDR ที่มีอยู่ นี่คือจุดที่ NVIDIA Mellanox 920-9B110-00FH-0D0 เข้ามามีบทบาท — สวิตช์ที่สร้างขึ้นมาโดยเฉพาะสำหรับสภาพแวดล้อมที่ HDR ให้แบนด์วิดท์เพียงพอโดยไม่ต้องมีการจัดสรรเกิน

โซลูชันและการติดตั้ง: เครือข่าย HDR ที่ปรับให้เหมาะสมกับต้นทุน

ห้องปฏิบัติการได้ติดตั้ง 920-9B110-00FH-0D0 InfiniBand switch OPN (หมายเลขชิ้นส่วนการสั่งซื้อ) เป็นแกนหลักของสถาปัตยกรรม leaf-spine ใหม่ แต่ละแร็คคอมพิวเตอร์ได้รับสวิตช์หนึ่งเครื่องที่ใช้ MQM8790-HS2F — แพลตฟอร์มซิลิคอนที่อยู่เบื้องหลัง 920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDR — ให้การเชื่อมต่อ 40 พอร์ต 200Gb/s กับเซิร์ฟเวอร์ GPU ผ่านสายเคเบิล OSFP-to-OSFP แบบเชื่อมต่อโดยตรง ที่ชั้น spine สวิตช์ 920-9B110-00FH-0D0 เพิ่มเติมอีกสี่เครื่องเชื่อมต่อสวิตช์ leaf ทั้งหมดเข้าด้วยกัน สร้างเครือข่าย fat-tree ที่ไม่ปิดกั้นพร้อมแบนด์วิดท์ bisection เต็มรูปแบบ

สิ่งที่ทำให้การติดตั้งนี้มีประสิทธิภาพเป็นพิเศษคือเทคโนโลยี SHARPv2 (Scalable Hierarchical Aggregation and Reduction Protocol) ในตัวของสวิตช์ ซึ่งช่วยลดภาระการดำเนินการสื่อสารแบบรวมโดยตรงบนเครือข่ายสวิตช์ ในทางปฏิบัติ หมายความว่าการดำเนินการ all-reduce ซึ่งก่อนหน้านี้ใช้รอบ CPU โฮสต์และแบนด์วิดท์เครือข่ายจำนวนมาก ตอนนี้เสร็จสมบูรณ์ในครั้งเดียวผ่านเครือข่าย — ลดเวลาในการทำงานให้เสร็จสิ้นอย่างมาก

ตาม 920-9B110-00FH-0D0 datasheet สวิตช์ให้ความหน่วงแบบ cut-through น้อยกว่า 200ns ซึ่งสอดคล้องกับข้อกำหนดด้านประสิทธิภาพของห้องปฏิบัติการ ทีมวิศวกรรมยังยืนยันว่าระบบนิเวศที่ 920-9B110-00FH-0D0 compatible ประกอบด้วยประเภทสายเคเบิลและออปติกทั้งหมดที่พวกเขาได้กำหนดมาตรฐานไว้แล้ว ซึ่งช่วยขจัดความจำเป็นในการเดินสายใหม่ที่มีค่าใช้จ่ายสูง

ผลลัพธ์และผลประโยชน์ที่วัดได้: จากคอขวดสู่ตัวเปิดใช้งาน

หลังจากการติดตั้ง ห้องปฏิบัติการได้วัดผลการปรับปรุงในหลายมิติที่สำคัญ:

  • การลดเวลาในการทำงานให้เสร็จสิ้น: การทำซ้ำการฝึกสำหรับโมเดลพารามิเตอร์ 13B ลดลง 35% โดยความหน่วง all-reduce ลดลงจาก 12μs เป็นต่ำกว่า 5μs สำหรับขนาดการรวมทั่วไป
  • การใช้เครือข่าย: การใช้เครือข่ายโดยเฉลี่ยเพิ่มขึ้นจาก 58% เป็น 83% โดยไม่ก่อให้เกิดการจราจรติดขัด ต้องขอบคุณกลไกการกำหนดเส้นทางแบบปรับได้และการควบคุมการจราจรติดขัดของสวิตช์
  • ประสิทธิภาพการใช้พลังงานและการระบายความร้อน: เมื่อเทียบกับเครือข่าย EDR ก่อนหน้านี้ โครงสร้างพื้นฐาน HDR ใหม่ช่วยลดการใช้พลังงานต่อพอร์ตลง 30% ทำให้ห้องปฏิบัติการสามารถเพิ่มโหนดคอมพิวเตอร์ได้มากขึ้นโดยไม่เกินงบประมาณพลังงานของศูนย์ข้อมูล

จากมุมมองของต้นทุนรวมในการเป็นเจ้าของ 920-9B110-00FH-0D0 price ต่อพอร์ตต่ำกว่าทางเลือก NDR อย่างมาก ทำให้ห้องปฏิบัติการสามารถอัปเกรดเครือข่ายทั้งหมดภายในงบประมาณที่มีอยู่ได้ 920-9B110-00FH-0D0 specifications ยังเน้นย้ำถึงแหล่งจ่ายไฟแบบคู่สำรองและโมดูลพัดลมที่สามารถเปลี่ยนได้ขณะทำงานของสวิตช์ ซึ่งมีส่วนช่วยให้ห้องปฏิบัติการบรรลุเป้าหมายความพร้อมใช้งาน 99.999% สำหรับงานฝึกการผลิต

วิศวกรเครือข่ายตั้งข้อสังเกตว่า 920-9B110-00FH-0D0 InfiniBand switch OPN solution ผสานรวมอย่างราบรื่นกับ NVIDIA Unified Fabric Manager (UFM) ให้การมองเห็นแบบรวมศูนย์เกี่ยวกับสุขภาพของเครือข่ายและการแจ้งเตือนอัตโนมัติ สิ่งนี้ช่วยลดเวลาที่ใช้ในการแก้ไขปัญหาและการบำรุงรักษาเชิงรุกได้อย่างมาก ทำให้ทีมมีอิสระในการมุ่งเน้นไปที่การปรับปรุงไปป์ไลน์การฝึกอบรมของตนเอง แทนที่จะจัดการเครือข่าย

สรุปและแนวโน้ม: รากฐาน HDR ที่มีขนาดเหมาะสม

NVIDIA Mellanox 920-9B110-00FH-0D0 พิสูจน์แล้วว่าเป็นตัวเลือกที่เหมาะสมสำหรับห้องปฏิบัติการวิจัยแห่งนี้ โดยให้ประสิทธิภาพ 200Gb/s HDR ในโครงสร้างต้นทุนที่สมเหตุสมผลทางธุรกิจ ด้วยการใช้ประโยชน์จากความหนาแน่น 40 พอร์ตของสวิตช์ ความสามารถในการประมวลผลในเครือข่าย และคุณสมบัติการจัดการที่แข็งแกร่ง ห้องปฏิบัติการได้เปลี่ยนเครือข่ายของตนจากคอขวดด้านประสิทธิภาพให้เป็นรากฐานที่ปรับขนาดได้สำหรับการเติบโตในอนาคต

เมื่อมองไปข้างหน้า ห้องปฏิบัติการวางแผนที่จะขยายคลัสเตอร์เป็น 1,024 โหนดในช่วง 18 เดือนข้างหน้า ด้วยการสนับสนุน 920-9B110-00FH-0D0 สำหรับโทโพโลยีที่ใหญ่ขึ้นผ่านชั้น spine หลายชั้น พวกเขามั่นใจว่าเครือข่ายของตนสามารถเติบโตไปพร้อมกับความสามารถในการประมวลผลของตนได้ สำหรับองค์กรที่กำลังประเมินตัวเลือกโครงสร้างพื้นฐาน HDR ของตน 920-9B110-00FH-0D0 for sale ผ่านพันธมิตรช่องทางของ NVIDIA นำเสนอโซลูชันที่น่าสนใจและได้รับการตรวจสอบการผลิตที่สมดุลระหว่างประสิทธิภาพ ความหนาแน่น และต้นทุน