RDMA / RoCE การขนส่งความช้าต่ําและการปรับปรุงความเร็วของเซอร์เวอร์

April 28, 2026

RDMA / RoCE การขนส่งความช้าต่ําและการปรับปรุงความเร็วของเซอร์เวอร์

เอกสารทางเทคนิคฉบับนี้จัดทำขึ้นสำหรับสถาปนิก วิศวกรฝ่ายขายล่วงหน้า และหัวหน้าฝ่ายปฏิบัติการ เพื่อเป็นข้อมูลอ้างอิงที่ครอบคลุมเกี่ยวกับการออกแบบอ้างอิงที่เน้นที่ NVIDIA Mellanox MCX631432AN-ADAB โซลูชันนี้จัดการกับความท้าทายของศูนย์ข้อมูลสมัยใหม่ เช่น ภาระงานของ CPU จากสแต็กเครือข่ายแบบเดิม ความหน่วงของพื้นที่จัดเก็บที่ไม่สอดคล้องกัน และแบนด์วิดท์ 25GbE ที่ใช้งานไม่เต็มประสิทธิภาพ โดยการใช้ การ์ดอะแดปเตอร์ Ethernet MCX631432AN-ADAB เป็นแกนหลักของเครือข่าย RDMA/RoCE ประสิทธิภาพสูงแบบรวมศูนย์

1. ความเป็นมาของโครงการและการวิเคราะห์ข้อกำหนด

เครือข่ายศูนย์ข้อมูลแบบดั้งเดิมอาศัย TCP/IP สำหรับทั้งทราฟฟิกการประมวลผลและพื้นที่จัดเก็บ ทำให้ CPU ต้องประมวลผลทุกแพ็กเก็ต ในสภาพแวดล้อมที่รันฐานข้อมูลแบบกระจาย NVMe-over-Fabrics (NVMe-oF) หรือเวิร์กโหลดการฝึก AI แนวทางที่ใช้ซอฟต์แวร์นี้สร้างปัญหาพื้นฐานสามประการ: ความหน่วงสูงและแปรปรวน (มักเกิน 50 ไมโครวินาทีสำหรับการดำเนินการจัดเก็บข้อมูล) ภาระงาน CPU ที่มีนัยสำคัญ (30-60% สำหรับการประมวลผลเครือข่าย) และการใช้แบนด์วิดท์ทางกายภาพอย่างไม่มีประสิทธิภาพเนื่องจากโอเวอร์เฮดของโปรโตคอล เมื่อ 25GbE กลายเป็นความเร็วมาตรฐานของชั้นการเข้าถึง ความไม่มีประสิทธิภาพเหล่านี้จึงไม่เป็นที่ยอมรับอีกต่อไป ข้อกำหนดเป้าหมายสำหรับโซลูชันนี้คือ: ความหน่วงของพื้นที่จัดเก็บแบบ end-to-end ต่ำกว่า 5 ไมโครวินาที การใช้งาน CPU น้อยกว่า 10% สำหรับ I/O เครือข่าย และการใช้งานพอร์ต 25GbE สองพอร์ตต่อเซิร์ฟเวอร์เต็มอัตราสาย

2. การออกแบบสถาปัตยกรรมเครือข่าย/ระบบโดยรวม

สถาปัตยกรรมที่นำเสนอใช้โทโพโลยีแบบ spine-leaf สองชั้นพร้อม Ethernet แบบไม่สูญเสียที่เลเยอร์ 2 โหนดประมวลผลและพื้นที่จัดเก็บจะกระจายอย่างสม่ำเสมอทั่วสวิตช์ leaf ซึ่งแต่ละตัวกำหนดค่าด้วย PFC (Priority Flow Control) และ ECN (Explicit Congestion Notification) เพื่อเปิดใช้งาน RoCEv2 การตัดสินใจเชิงสถาปัตยกรรมที่สำคัญคือการใช้ อะแดปเตอร์ MCX631432AN-ADAB ConnectX-6 Lx แบบพอร์ตคู่ 25GbE SFP28 บนเซิร์ฟเวอร์ทุกเครื่อง ซึ่งให้ทั้งการเชื่อมต่อเครือข่ายและการยกเลิกภาระงานฮาร์ดแวร์สำหรับ RDMA คิวลำดับความสำคัญที่กำหนดโดย DSCP โดยเฉพาะจะถูกจัดสรรสำหรับทราฟฟิก RoCE แยกต่างหากจากทราฟฟิก IP แบบ best-effort การจัดการแบบรวมศูนย์ใช้ NVIDIA Cumulus Linux หรือ SONiC สำหรับการกำหนดค่าสวิตช์ ในขณะที่การจัดการฝั่งโฮสต์ใช้สแต็ก NVIDIA OFED

3. บทบาทและคุณสมบัติหลักของ NVIDIA Mellanox MCX631432AN-ADAB

ภายในโซลูชันนี้ MCX631432AN-ADAB ทำหน้าที่เป็นตัวเปิดใช้งานที่สำคัญ ซึ่งเปลี่ยนเซิร์ฟเวอร์ทั่วไปให้เป็นโหนดที่มีความหน่วงต่ำและมีปริมาณงานสูง จาก เอกสารข้อมูล MCX631432AN-ADAB อะแดปเตอร์นี้มีคุณสมบัติขั้นสูงหลายประการ:

  • การยกเลิกภาระงาน RDMA ด้วยฮาร์ดแวร์: สถานะ RoCEv2 เต็มรูปแบบในซิลิคอน ขจัดกระบวนการขนส่งที่ใช้ซอฟต์แวร์
  • พอร์ตคู่ 25GbE SFP28: รองรับทั้งสายเคเบิลแบบออปติคัลและ DAC พร้อมการประมวลผล PPS แบบอิสระต่อพอร์ต
  • อินเทอร์เฟซโฮสต์ PCIe 4.0 x16: ให้แบนด์วิดท์แบบสองทิศทางสูงสุด 200Gbps ไม่ทิ้งคอขวดระหว่างอะแดปเตอร์และหน่วยความจำโฮสต์
  • การยกเลิกการเข้ารหัสแบบ Inline: การประมวลผล IPsec และ TLS ที่อัตราสาย ซึ่งสำคัญสำหรับเครือข่ายพื้นที่จัดเก็บแบบ zero-trust
  • การเร่งความเร็ว NVMe-oF: การจัดคิวคำสั่งและการจัดวางข้อมูลบนฮาร์ดแวร์ที่ปรับให้เหมาะสมโดยเฉพาะสำหรับ NVMe/TCP และ NVMe/RoCE

ตาม ข้อมูลจำเพาะ MCX631432AN-ADAB อย่างเป็นทางการ อะแดปเตอร์ให้ความหน่วงฮาร์ดแวร์ต่ำกว่า 800ns และรองรับข้อความสูงสุด 200 ล้านข้อความต่อวินาที เมื่อรวมกับไลบรารี RDMACM แบบโอเพนซอร์ส แอปพลิเคชันสามารถเปลี่ยนจากซ็อกเก็ต TCP ไปยัง RDMA verbs ได้ด้วยการเปลี่ยนแปลงโค้ดเพียงเล็กน้อย สำหรับองค์กรที่ประเมินโซลูชันนี้ สิ่งสำคัญคือต้องทราบว่ารายการเซิร์ฟเวอร์ ที่เข้ากันได้กับ MCX631432AN-ADAB รวมถึงแพลตฟอร์ม OEM หลักทั้งหมด (Dell PowerEdge, HPE ProLiant, Lenovo ThinkSystem และ Supermicro) พร้อมไดรเวอร์ที่ได้รับการรับรองสำหรับ RHEL, Ubuntu, Rocky Linux และ Windows Server

4. คำแนะนำในการติดตั้งและปรับขนาด

การติดตั้งระดับแร็คทั่วไปเป็นไปตามรูปแบบนี้: โหนดประมวลผลหรือพื้นที่จัดเก็บแต่ละโหนดจะได้รับ โซลูชันการ์ดอะแดปเตอร์ Ethernet MCX631432AN-ADAB หนึ่งชุด โดยพอร์ตคู่จะถูกกำหนดค่าในการรวม LACP แบบ active-active เพื่อความซ้ำซ้อน หรือเป็นเส้นทางเครือข่ายแยกต่างหาก (หนึ่งไปยัง leaf-A หนึ่งไปยัง leaf-B) โทโพโลยีทางกายภาพนั้นง่าย:

  • เซิร์ฟเวอร์แต่ละเครื่อง → ลิงก์ 25GbE สองลิงก์ → สวิตช์ leaf สองตัว (รองรับการสลับโดยไม่หยุดชะงัก)
  • สวิตช์ Leaf → อัปลิงก์ 100GbE → สวิตช์ spine สองตัวสำหรับการเชื่อมต่อแบบ full-mesh แบบไม่ปิดกั้น
  • การทำเครื่องหมาย DSCP เฉพาะ (เช่น 46) สำหรับทราฟฟิก RoCE ในทุกสวิตช์พร้อมเปิดใช้งาน PFC ในคลาสนั้น

สำหรับการปรับขนาดเกิน 200 เซิร์ฟเวอร์ เราขอแนะนำให้ใช้คลัสเตอร์ RoCE แยกต่างหากสำหรับพื้นที่จัดเก็บและคอมพิวต์ตามลำดับ หรือใช้ นโยบาย QoS เพื่อให้แน่ใจว่าทราฟฟิก RoCE ของพื้นที่จัดเก็บจะได้รับความสำคัญ การปรับบัฟเฟอร์ที่สวิตช์ leaf ก็มีความสำคัญเช่นกัน: ขนาดบัฟเฟอร์ที่ใช้ร่วมกันต่อพอร์ตควรเพิ่มขึ้นเป็น 12MB สำหรับพอร์ต 25GbE เพื่อรองรับ micro-bursts โดยไม่สูญเสียแพ็กเก็ต องค์กรสามารถอ้างอิงแคตตาล็อกผู้จำหน่าย MCX631432AN-ADAB สำหรับขาย สำหรับราคาขายส่ง และ ราคา MCX631432AN-ADAB ต่อโหนดมักจะคิดค่าเสื่อมราคาภายในหกเดือนเนื่องจากการประหยัด CPU และการเพิ่มประสิทธิภาพพื้นที่จัดเก็บ

5. การปฏิบัติงาน การตรวจสอบ และการปรับประสิทธิภาพ

หลังการติดตั้ง เครื่องมือและแนวปฏิบัติต่อไปนี้จะช่วยให้มั่นใจได้ถึงความหน่วงต่ำอย่างต่อเนื่อง:

  • การตรวจสอบฝั่งโฮสต์: ใช้ mlx_perf และ ethtool -S เพื่อติดตามตัวนับ RDMA ต่อคิว การส่งซ้ำ PCIe และเครื่องหมายการแออัดของ RoCE
  • เทเลเมทรีสวิตช์: เปิดใช้งาน PFC watchdog และฮิสโตแกรมการทำเครื่องหมาย ECN เพื่อตรวจจับ head-of-line blocking ก่อนที่จะส่งผลกระทบต่อการผลิต
  • คำแนะนำในการปรับแต่ง: ตั้งค่า irqbalance เพื่อแยกคอร์ CPU สำหรับคิวการเสร็จสิ้น RDMA เพิ่มขนาดคำขออ่าน PCIe สูงสุดเป็น 4096 ไบต์ ปิดใช้งาน ECN บนคิว best-effort เพื่อหลีกเลี่ยงสัญญาณการแออัดที่ผิดพลาด
  • วงจรเฟิร์มแวร์และไดรเวอร์: สมัครรับข้อมูลบันทึกการออกรุ่น NVIDIA OFED; การ์ดอะแดปเตอร์ Ethernet MCX631432AN-ADAB รองรับการอัปเกรดเฟิร์มแวร์ในตำแหน่งโดยไม่ต้องรีบูตโฮสต์เนื่องจากมีอิมเมจสำรองสองชุด

สำหรับการแก้ไขปัญหา ตัวนับข้อผิดพลาดในตัวของอะแดปเตอร์ (เช่น ข้อผิดพลาดของสัญลักษณ์ ความล้มเหลวของความสมบูรณ์ของลิงก์ภายใน) ให้การวินิจฉัยที่รวดเร็ว เมื่อรวมกับรุ่นสวิตช์ใหม่ ให้ตรวจสอบเมทริกซ์การทำงานร่วมกัน ที่เข้ากันได้กับ MCX631432AN-ADAB ที่ดูแลโดย NVIDIA

6. สรุปและการประเมินมูลค่า

โซลูชันที่ใช้ NVIDIA Mellanox MCX631432AN-ADAB มอบมูลค่าที่วัดผลได้ในสามมิติ: ประสิทธิภาพ TCO และความเรียบง่ายในการดำเนินงาน ด้วยการย้ายการประมวลผลโปรโตคอลการขนส่ง การเข้ารหัส และพื้นที่จัดเก็บจาก CPU ไปยังอะแดปเตอร์ องค์กรจะได้รับความหน่วง NVMe-oF ต่ำกว่า 5 ไมโครวินาที ในขณะที่เพิ่มรอบ CPU มากกว่า 40% สำหรับตรรกะแอปพลิเคชัน การออกแบบพอร์ตคู่ 25GbE ช่วยให้การเชื่อมต่อเซิร์ฟเวอร์พร้อมสำหรับอนาคต และสแต็กซอฟต์แวร์ NVIDIA OFED ที่สมบูรณ์ช่วยลดความเสี่ยงในการรวมระบบ สำหรับสถาปนิกที่วางแผนการติดตั้ง 25GbE แบบ greenfield หรือการปรับปรุงโครงสร้างพื้นฐานที่ผูกติดกับ TCP ที่มีอยู่ โซลูชันทางเทคนิคนี้ ซึ่งเน้นที่ อะแดปเตอร์ MCX631432AN-ADAB ConnectX-6 Lx แบบพอร์ตคู่ 25GbE SFP28 เป็นเส้นทางที่ได้รับการพิสูจน์แล้ว ปรับขนาดได้ และได้รับการปกป้องการลงทุนสู่ความสำเร็จของ RDMA/RoCE