โซลูชันทางเทคนิคของอะแดปเตอร์เซิร์ฟเวอร์ NVIDIA Mellanox MCX4121A-ACAT
June 8, 2026
โซลูชันทางเทคนิคนี้ออกแบบมาสำหรับสถาปนิกเครือข่าย วิศวกรก่อนการขาย และหัวหน้าฝ่ายปฏิบัติการ โดยมีรายละเอียดวิธีการNVIDIA Mellanox MCX4121A-ACATอะแดปเตอร์เซิร์ฟเวอร์ช่วยให้สามารถส่งข้อมูลเวลาแฝงต่ำตาม RDMA/RoCE และปรับปรุงปริมาณงานของเซิร์ฟเวอร์ได้อย่างมากในสภาพแวดล้อมศูนย์ข้อมูลสมัยใหม่
1. การวิเคราะห์ความเป็นมาและความต้องการของโครงการ
เครือข่าย TCP/IP แบบดั้งเดิมกำหนดข้อจำกัดพื้นฐานเกี่ยวกับเวิร์กโหลดที่ไวต่อประสิทธิภาพ เช่น ฐานข้อมูลแบบกระจาย พื้นที่จัดเก็บ NVMe-oF และการวิเคราะห์แบบเรียลไทม์ ปัญหาสำคัญ ได้แก่ โอเวอร์เฮดของ CPU สูงจากการประมวลผลสแต็กเครือข่าย เวลาแฝงที่คาดเดาไม่ได้เนื่องจากการส่งข้อมูลแพ็กเก็ตใหม่ และการคัดลอกหน่วยความจำที่ไม่มีประสิทธิภาพระหว่างเคอร์เนลและพื้นที่แอปพลิเคชัน
เพื่อจัดการกับความท้าทายเหล่านี้ ศูนย์ข้อมูลสมัยใหม่จำเป็นต้องมีโซลูชันเครือข่ายที่มอบ:
- เวลาแฝงตั้งแต่ต้นทางถึงปลายทางต่ำกว่า 10 ไมโครวินาทีสำหรับการจัดเก็บและการรับส่งข้อมูล HPC
- บายพาสเคอร์เนลและการเข้าถึงหน่วยความจำโดยตรงเพื่อลดภาระของ CPU
- โครงสร้างอีเธอร์เน็ตแบบ Lossless รองรับ 25GbE ต่อพอร์ต
- การบูรณาการอย่างราบรื่นกับโครงสร้างพื้นฐานอีเธอร์เน็ตที่มีอยู่
ที่MCX4121A-ACATโซลูชันที่ใช้ RoCE ตอบสนองความต้องการเหล่านี้โดยตรง ขณะเดียวกันก็รักษาความเข้ากันได้กับระบบนิเวศสวิตชิ่งมาตรฐาน
2. การออกแบบสถาปัตยกรรมเครือข่ายและระบบโดยรวม
สถาปัตยกรรมที่นำเสนอใช้โทโพโลยีแบบ leaf-spine พร้อมอีเทอร์เน็ตแบบ lossless ที่ชั้นการเข้าถึง 25GbE เซิร์ฟเวอร์ประมวลผลหรือจัดเก็บข้อมูลแต่ละรายการมีหนึ่งหรือสองเซิร์ฟเวอร์การ์ดอะแดปเตอร์อีเทอร์เน็ต MCX4121A-ACATโดยเชื่อมต่อกับสวิตช์ลีฟผ่านสายเคเบิล SFP28 DAC หรือตัวรับส่งสัญญาณแบบออปติคัล สวิตช์ลีฟรองรับโปรโตคอล Data Center Bridging (DCB) รวมถึง Priority Flow Control (PFC) และ Enhanced Transmission Selection (ETS) ซึ่งจำเป็นสำหรับการรับส่งข้อมูล RoCE
สำหรับการออกแบบที่มีความพร้อมใช้งานสูง อะแดปเตอร์แบบพอร์ตคู่ช่วยให้สามารถเชื่อมต่อแบบ active-active หรือการกำหนดค่าเฟลโอเวอร์ได้ เลเยอร์สไปน์จะรวมสวิตช์ลีฟโดยใช้อัปลิงก์ 100GbE ทำให้มั่นใจได้ว่าแบนด์วิธไม่ปิดกั้นสำหรับรูปแบบการรับส่งข้อมูลตะวันออก-ตะวันตก กุญแจสำคัญของการออกแบบนี้คือการแยกการรับส่งข้อมูลการจัดเก็บข้อมูล RoCE ออกจากการรับส่งข้อมูลการจัดการ TCP/IP ปกติโดยใช้ VLAN และคลาส QoS
3. บทบาทของ NVIDIA Mellanox MCX4121A-ACAT และคุณสมบัติหลัก
ที่NVIDIA Mellanox MCX4121A-ACATทำหน้าที่เป็นส่วนประกอบปลายทางที่สำคัญที่เปิดใช้งาน RDMA ผ่าน Converged Ethernet อะแดปเตอร์ 25GbE SFP28 สองพอร์ตที่สร้างขึ้นบน ConnectX-4 Lx ASIC มีความสามารถในการเร่งความเร็วด้วยฮาร์ดแวร์ดังต่อไปนี้:
- ออฟโหลดฮาร์ดแวร์ RoCE:ประมวลผลการขนส่ง RDMA อย่างสมบูรณ์ด้วยซิลิคอน ช่วยลดค่าใช้จ่ายด้านซอฟต์แวร์
- การจับคู่แท็กและการกู้คืนกริ่งประตู:การจัดการการเชื่อมต่อที่เชื่อถือได้โดยใช้ฮาร์ดแวร์ช่วย
- การจำลองเสมือน SR-IOV:ฟังก์ชันเสมือนสูงสุด 256 รายการต่อพอร์ตสำหรับคอนเทนเนอร์และความหนาแน่นของ VM
- GPUDirect RDMA:การเข้าถึงหน่วยความจำ GPU โดยตรงสำหรับคลัสเตอร์การฝึกฝน AI/ML
- ออฟโหลดเครือข่ายโอเวอร์เลย์:การห่อหุ้ม/การแยกแคปซูลฮาร์ดแวร์สำหรับ VXLAN, NVGRE และ Geneve
ที่MCX4121A-ACAT ConnectX-4 Lx สองพอร์ต 25GbE SFP28อะแดปเตอร์ยังรองรับคุณสมบัติขั้นสูง เช่น การกำหนดเส้นทางแบบปรับได้ การควบคุมความแออัด และการออฟโหลดบัฟเฟอร์แบบต่อเนื่อง สำหรับการวางแผนบูรณาการนั้นเอกสารข้อมูลสินค้า MCX4121A-ACATให้ข้อมูลจำเพาะทางไฟฟ้า ความร้อน และเครื่องกลที่ครอบคลุม
4. คำแนะนำในการปรับใช้และการปรับขนาด (ตัวอย่างโทโพโลยี)
โทโพโลยีทั่วไป – 25GbE RoCE Fabric สำหรับ 100+ โหนด:
- เข้าถึงเลเยอร์:สวิตช์ลีฟ 25GbE จำนวน 48 พอร์ต พร้อมรองรับ DCB
- ชั้นกระดูกสันหลัง:สวิตช์สไปน์ 32 พอร์ต 100GbE
- อะแดปเตอร์เซิร์ฟเวอร์: MCX4121A-ACAT(พอร์ตคู่) ในช่อง PCIe 3.0 x8
- การเดินสาย:DAC แบบพาสซีฟ SFP28 สำหรับอินทราแร็ค (≤5ม.) ออปติคัลแบบแอคทีฟสำหรับครอสแร็ค
ขั้นตอนการปรับใช้:
- ตรวจสอบการตั้งค่า BIOS ของเซิร์ฟเวอร์ (การแยก PCIe, เปิดใช้งาน SR-IOV, สูงกว่าการถอดรหัส 4G)
- ติดตั้งNVIDIA Mellanox MCX4121A-ACATเฟิร์มแวร์ผ่านเครื่องมือ mlxup หรือ MST
- กำหนดค่าพอร์ตสวิตช์: ลำดับความสำคัญ PFC 3-5, การจัดสรรแบนด์วิดท์ ETS, เชื่อถือ DSCP
- เปิดใช้งาน RoCE บนโฮสต์: ตั้งค่าโหมด RoCE เป็น v2 (เป็นมิตรกับการกำหนดเส้นทาง) กำหนดค่าคำนำหน้า GID
- ตรวจสอบพฤติกรรมที่ไม่มีการสูญเสียโดยใช้การตรวจสอบ ibdiagnet และ cqounter
สำหรับการปรับขนาดเป็น 500+ โหนด ให้พิจารณาปรับใช้แฟบริคการจัดเก็บข้อมูล RoCE แยกต่างหากเพื่อแยกการรับส่งข้อมูลการจัดเก็บข้อมูลจากการสื่อสารการผลิตตะวันออก-ตะวันตก ที่รองรับ MCX4121A-ACATระบบนิเวศรวมถึงเซิร์ฟเวอร์ OEM รายใหญ่ทั้งหมดและผู้จำหน่ายสวิตช์ เพื่อให้มั่นใจว่าการปรับขนาดจะราบรื่น
5. การดำเนินการ การตรวจสอบ การแก้ไขปัญหาและการเพิ่มประสิทธิภาพ
ตัวชี้วัดการตรวจสอบที่สำคัญ:
- แพ็กเก็ต RoCE ลดลง (บ่งบอกถึงปัญหาการกำหนดค่า PFC)
- RDMA ส่ง/รับความลึกของคิวที่เสร็จสมบูรณ์
- ข้อผิดพลาดของพอร์ต, CRC และการฝึกลิงก์ใหม่
- การใช้งาน CPU ต่อคอร์ (วัดประสิทธิภาพการบายพาสเคอร์เนล)
เครื่องมือสำคัญ:
- mellanox_perf – การวัดแบนด์วิธ/เวลาแฝงระดับอะแดปเตอร์
- ibdiagnet – การตรวจสอบความถูกต้องของโครงสร้าง RoCE และการวินิจฉัยสายเคเบิล
- ethtool -S – สถิติต่อคิวและตัวนับออฟโหลด
- syslog/dmesg – การติดตามเหตุการณ์ไดรเวอร์และเฟิร์มแวร์
แนวทางการเพิ่มประสิทธิภาพ:
- ตั้งค่า NRPE (เปิดใช้งานการรับจังหวะของเครือข่าย) เพื่อความเป็นธรรมแบบหลายสตรีม
- ปรับการขัดจังหวะการรวมตัว (การกลั่นกรอง) ตามประเภทภาระงาน
- สำหรับปริมาณงานพื้นที่จัดเก็บข้อมูล ให้ผูกความสำเร็จของ RDMA กับคอร์ CPU เฉพาะ
- ใช้ข้อมูลจำเพาะ MCX4121A-ACATเพื่อตรวจสอบขีดจำกัดความร้อนภายใต้โหลดอัตราบรรทัดแบบยั่งยืน
เมื่อต้องพิจารณางบประมาณและการจัดหา ให้ตรวจสอบMCX4121A-ACAT ราคาแนวโน้มและขาย MCX4121A-ACATมีจำหน่ายผ่านตัวแทนจำหน่ายที่ได้รับอนุญาต โดยทั่วไปการจัดซื้อจำนวนมากจะช่วยลดต้นทุนต่อหน่วยในขณะที่รับประกันการรองรับเฟิร์มแวร์ของแท้
6. สรุปและการประเมินมูลค่า
ที่โซลูชันการ์ดอะแดปเตอร์อีเทอร์เน็ต MCX4121A-ACATมอบผลประโยชน์เชิงปริมาณในหลายมิติ:
| เมตริก | TCP/IP พื้นฐาน (25GbE) | ด้วย MCX4121A-ACAT + RoCE | การปรับปรุง |
|---|---|---|---|
| เวลาแฝงในการเขียน 4KB (µs) | 48–55 | 8–11 | ต่ำกว่า 5.2 เท่า |
| การใช้งาน CPU (ต่อ 25Gb/s) | 28-34% | 5-7% | ลด 5 เท่า |
| อัตราข้อความ (Mpps) | 2.1 | 15.3 | สูงขึ้น 7.3 เท่า |
นอกเหนือจากประสิทธิภาพดิบแล้ว โซลูชันนี้ยังช่วยลด TCO ด้วยการรวมพื้นที่จัดเก็บข้อมูลและเครือข่ายข้อมูลไว้ในอีเทอร์เน็ตแฟบริคเดียวที่ไม่มีการสูญเสีย ที่MCX4121A-ACATช่วยให้องค์กรต่างๆ สามารถรักษาการลงทุนในสวิตช์ที่มีอยู่ ในขณะเดียวกันก็ปลดล็อกความสามารถ RDMA ที่สงวนไว้ก่อนหน้านี้สำหรับ InfiniBand สำหรับทีมที่วางแผนสถาปัตยกรรมศูนย์ข้อมูลเจเนอเรชั่นถัดไป อะแดปเตอร์นี้มอบเส้นทางที่ได้รับการพิสูจน์แล้วและปรับขนาดได้ไปสู่เครือข่ายเซิร์ฟเวอร์ที่มีเวลาแฝงต่ำและมีปริมาณงานสูง

