NVIDIA Mellanox MCX631432AN-ADAB Server Adapter ในการทํางาน: RDMA / RoCE การขนส่งความช้าต่ําและการเพิ่มผลิตของเซอร์เวอร์
April 28, 2026
ในสภาพแวดล้อมศูนย์ข้อมูลที่ทันสมัย การจัดจําหน่ายข้อมูล การฝึกอบรม AI และแพลตฟอร์มธุรกิจความถี่สูงความช้าของเครือข่ายและค่าใช้จ่ายส่วนกลางของ CPU ที่เกิดจาก TCP/IPสําหรับผู้ให้บริการเมฆขนาดกลางที่ดิ้นรนกับการทํางานที่ไม่สอดคล้องกับการเก็บข้อมูลและการเชื่อมต่อการเข้าถึง 25GbE ที่จุกจับ การค้นหาทางแก้ไขที่แท้จริงที่ใช้ฮาร์ดแวร์ได้นําพวกเขาไปสู่NVIDIA Mellanox MCX631432AN-ADABการศึกษากรณีการใช้งานนี้พิจารณาวิธีการการ์ด MCX631432AN-ADAB Ethernetเปลี่ยนแปลงโครงสร้างพื้นฐานของพวกเขา จากความไม่คาดเดาที่ผูกพันกับ CPU เป็นการทํางานที่มีความเร็วและความช้าน้อย
สถานการณ์และความท้าทาย: ค่าใช้จ่ายของเครือข่ายแบบปกติ
สิ่งแวดล้อมเก่าของผู้ให้บริการพึ่งพาการใช้ NICs 25GbE มาตรฐานที่มี iSCSI และ NFS ที่ใช้โปรแกรมเช่นเดียวกับการใช้งาน CPU บน node การจองที่มักเกิน 60% เพียงสําหรับการประมวลผลเครือข่าย. ความขั้นต่ําสูงในช่วงหน้าต่างสํารองและการย้ายตัวจริงทําให้การใช้งานหมดเวลา.สถาปนิกต้องการคําตอบ 25GbE ที่สามารถลดภาระการขนส่ง, ป้องกันความปลอดภัยของฮาร์ดแวร์และสนับสนุน RDMA โดยไม่ต้องเขียนใหม่แอปพลิเคชั่นหลังจากพิจารณาใบข้อมูล MCX631432AN-ADABและการตอบสนองของชุมชนในช่วงต้นMCX631432AN-ADAB ConnectX-6 Lx ท่าสอง 25GbE SFP28การออกแบบเป็นพื้นฐานสําหรับการปรับปรุงระบบ
การแก้ไขและการจัดจําหน่าย: ทําให้ RoCE สามารถเก็บและคํานวณได้
การจัดจําหน่ายแทน NICs ที่มีอยู่ใน 120 คอมพิวเตอร์โน้ดและ 15 เซอร์เวอร์ที่เก็บของMCX631432AN-ADABแอดป์เตอร์ แต่ละตัวอัดแปลงถูกตั้งค่าให้ RoCE (RDMA over Converged Ethernet) โดยใช้ ECN และ PFC บนสวิทช์กระดูกสันหลังที่มีอยู่
- ทําให้การเริ่มต้นที่เชื่อถือด้วยฮาร์ดแวร์และการอํานวยความสะดวก IPsec ในสายบนตัวปรับทั้งหมดเพื่อตอบสนองความต้องการความเป็นมา
- การอพยพการจอดข้อมูลจาก iSCSI ไปยัง NVMe over Fabrics (NVMe-oF) ด้วย RoCE transportMCX631432AN-ADAB การแก้ไขการ์ดปรับเปลี่ยน Ethernetเก็บไว้
- การจัดจําหน่ายเทเลเมตรี Cumulus Linux ของ NVIDIA เพื่อเฝ้าระวังผลงาน RoECE และแจ้งความอึดอัดในแต่ละพอร์ต
ตามเจ้าหน้าที่รายละเอียด MCX631432AN-ADAB, แอดป์เตอร์ให้ความช้าของฮาร์ดแวร์ต่ํากว่า 800 ns และรองรับการผ่านแบบสองทิศสูงถึง 200Gb / s เมื่อคู่กับ PCIe 4.0 hosts ในปฏิบัติงานทีมวิศวกรวัดความสม่ําเสมอ 1.ความช้าระดับการใช้งาน 5μs สําหรับ NVMe-oF อ่านว่าดีขึ้น 14 เท่าเมื่อเทียบกับเส้นทาง iSCSI ของโปรแกรมก่อนหน้านี้การใช้ CPU บนเซอร์เวอร์ที่เก็บข้อมูลลดลงจาก 58% เป็นเพียง 11% ในช่วงการทดสอบ IOPS ที่สูงสุด
ผลลัพธ์ที่สามารถวัดได้ และประโยชน์ทางธุรกิจ
หลังการผลิต 4 สัปดาห์ ผู้ให้บริการรายงานว่ามีผลดีขึ้น 3 อย่าง
- การยกอัตราการออกกําลัง:ปัจจุบันแต่ละโน้ดการเก็บข้อมูลจะทําให้ท่าทาง 25GbE ทั้งคู่ (49.5Gbit/s รวม) เติมเต็มได้ โดยยังคงมีการกระตุ้นในระยะต่ํากว่าไมโครเซกอนด์ เมื่อเทียบกับอัตราการผ่านของ 18Gbit/s ก่อนหน้านี้
- ความสม่ําเสมอของความช้า:ความช้าในการเขียนของ 99th percentile สําหรับฐานข้อมูลที่กระจายได้ลดลงจาก 780μs เป็น 94μs โดยกําจัดการหยุดเวลาระหว่างการปรับสมดุลคลัสเตอร์
- การทํางานง่าย:ชุดหนึ่งของไดรเวอร์บริหารทั้งการคํานวณและอุปกรณ์ปรับจองMCX631432AN-ADAB รองรับระบบนิเวศรวมถึงการจําหน่าย Linux ทั้งหมดที่สําคัญ ทําให้การอัพเดทเนอร์เนลไม่มีการหยุดทํางาน
นอกจากนี้ ทีมงานยังประเมินMCX631432AN-ADAB ราคาในส่วนของค่าบริการรวม และพบว่าเครื่องปรับของฮาร์ดแวร์ Root-of-Trust และ RoCE Offload ได้กําจัดความจําเป็นของการใช้อุปกรณ์การเข้ารหัสแยกและ RNICs เฉพาะส่งผลให้ TCO สามปีลดลง 33%สําหรับองค์กรที่พิจารณาขยายMCX631432AN-ADAB สําหรับขายผ่านผู้จําหน่ายใหญ่ ตอนนี้เปิดให้บริการราคาปริมาณ ทําให้การปรับปรุงขนาดใหญ่เป็นไปได้ทางการเงิน
สรุปและมุมมอง
รายการNVIDIA Mellanox MCX631432AN-ADABผ่านการย้ายการประมวลผลการขนส่งจาก CPU ไปยังซิลิคอนผู้ให้บริการได้ปลดปล่อยศักยภาพเต็มของ NVMe storage และลดการบริโภคพลังงานต่อเซอร์เวอร์โดยเฉลี่ย 18Wในขณะที่ศูนย์ข้อมูลยังคงยึดถือการเก็บข้อมูลที่แยกแยก และการสรุป AI ในเวลาจริงMCX631432AN-ADAB ConnectX-6 Lx ท่าสอง 25GbE SFP28adapter ให้ทางที่วัสดุสมบูรณ์แบบ และถูกบันทึกไว้อย่างดี และถูกใช้อย่างกว้างขวางเพื่อความสําเร็จ RDMA/RoCEนักสถาปัตยกรรมไอทีที่มองหาการเพิ่มผลประกอบการที่ซ้ําได้ สามารถอ้างอิงกรณีนี้ได้อย่างมั่นใจเมื่อวางแผนการเริ่มต้นการปรับปรุง 25GbE ของตนเอง.

