โซลูชันทางเทคนิคสำหรับอะแดปเตอร์เซิร์ฟเวอร์ Mellanox (NVIDIA Mellanox) MCX653105A-HDAT
April 29, 2026
ศูนย์ข้อมูลที่ทันสมัยกําลังปรับเปลี่ยนจากสถาปัตยกรรมที่เน้นการคอมพิวเตอร์ เป็นสถาปัตยกรรมที่เน้นการข้อมูลและสภาพแวดล้อมการเทรดความถี่สูง ปฏิบัติตามความต้องการที่เข้มงวดต่อความช้าของเครือข่ายและการผ่านของเซอร์เวอร์. TCP / IP แสตั๊กประเพณี สร้างการสับสน CPU ที่สําคัญและสวิทช์เนื้อหาภายใต้ความกว้างแบนด์วิทสูง, ทานพลังงานคํานวณมากกว่า 30% เพียงสําหรับค่าใช้จ่ายทั่วไปของเครือข่ายโปรต็อกอลการเก็บข้อมูลที่กําลังเกิดใหม่ๆ เช่น NVMe-oF ต้องการระยะเวลาขั้นต่ําในระดับไมโครวินาที เพื่อปลดปล่อยศักยภาพการทํางานเพื่อแก้ไขปัญหาเหล่านี้ องค์กรต้องการ NIC เซอร์เวอร์ที่ลดการประมวลผลของเครือข่ายและทําให้การเข้าถึงความจําโดยตรงMellanox (NVIDIA Mellanox) MCX653105A-HDATส่งส่ง
ความต้องการหลักที่ระบุในกรณีการใช้งานทั่วไปประกอบด้วย: ความช้าระดับการใช้งานต่ํากว่า 2μs, ความเร็ว 100GbE ต่อพอร์ตการลดความหน่วงของฮาร์ดแวร์สําหรับ RoCE (RDMA over Converged Ethernet), การบูรณาการที่เรียบร้อยกับเซอร์เวอร์ PCIe 4.0 ที่มีอยู่MCX653105A-HDATตอบโจทย์แต่ละตัวนี้ด้วยสถาปัตยกรรม ConnectX-6
การแก้ไขที่เสนอใช้เยื่อกระดูกสันหลัง 2 ชั้นที่มีการสนับสนุน RoCE การกําจัดข้อตกลง TCP/IP โดยยังคงประหยัด Ethernetเครื่องสวิทช์บนเรค (NVIDIA SN4000 series หรือสวิทช์ที่รองรับ PFC เท่านั้น) เชื่อมต่อระหว่างหน่วยคอมพิวเตอร์และหน่วยเก็บข้อมูล. ทุกหน่วยคอมพิวเตอร์รวมการ์ด MCX653105A-HDAT Ethernet, ให้ความเชื่อมต่อ 100GbE ที่มีสองท่าทาง คอยจอดข้อมูลใช้ตัวปรับเดียวกันเพื่อให้บริการเป้าหมาย NVMe-oF โดยตรงผ่าน RDMA
ในทางสถาปัตยกรรมNVIDIA Mellanox MCX653105A-HDATตําแหน่งเป็นตัวเร่งระดับข้อมูลที่สําคัญ จัดการ I/O ของเครือข่ายทั้งหมดจากเครื่องออนไลน์ คอนเทนเนอร์ และภาระงานโลหะเปล่าระบบควบคุมยังคงอยู่บน CPU เจ้าภาพ แต่ได้รับการปลดปล่อยจากภารกิจการเคลื่อนไหวข้อมูล. สําหรับการจัดจําหน่ายขนาดใหญ่ (100+ node) โดเมนการควบคุมความจุกจุก RoCE ได้รับการตั้งค่าโดยใช้ DCQCN (Data Center Quantized Congestion Notification)ที่มีปูนพัฟเฟอร์แยกสําหรับการคิดเลขและการจอดข้อมูล.
รายการMCX653105A-HDAT ConnectX แอดป์เตอร์ บัตรเครือข่าย PCIeทําหน้าที่สําคัญ 4 อย่างในโครงสร้างนี้
- RoCE ที่ใช้กับเครื่องมือ:ใช้ RDMA โดยไม่ต้องใช้สวิตช์หรือผ้าพิเศษ ข้อมูลเคลื่อนไหวตรงระหว่างอุปกรณ์พัฟเฟอร์และความจําทางไกล โดยเลี่ยงเนอร์เนลโดยสิ้นเชิง
- PCIe 4.0 x16 อินเตอร์เฟส:ส่งถึง 200Gb / s ความกว้างแดนสองทิศ การกําจัด host bus bottlenecks และการใช้ Port 100GbE สองแบบอย่างเต็มที่
- การสวิตชิ่งและการประมวลผลแพ็คเก็ตที่เร่งรัด (ASAP2)รองรับการปรับเปลี่ยนท่อที่ยืดหยุ่นสําหรับ VXLAN / NVGRE offload, การเร่ง VirtIO และเทเลเมตรีที่สามารถวางโปรแกรมได้
- ความเร่งในการเก็บของ:การลดความอ้วนของฮาร์ดแวร์สําหรับ NVMe-oF (TCP และ RoCE) การสร้าง/รับรองลายเซ็นต์ T10-DIF และการเร่งรัดการรหัสลบ
ตามใบข้อมูล MCX653105A-HDAT, ตัวปรับยังรองรับการบูทที่ปลอดภัย, แฮร์ดแวร์รูทของความไว้วางใจ, และการเข้ารหัส IPsec / TLS ในสายสูงถึง 100GbE.รายละเอียด MCX653105A-HDAT, วิศวกรจะสังเกตความกว้างของสล็อตสองช่อง, การทําความเย็นโดยเฉพาะ, และช่วงอุณหภูมิการทํางานที่กว้าง (0 °C ถึง 55 °C), ทําให้มันเหมาะสําหรับสภาพแวดล้อมเซอร์เวอร์หนาแน่น.
Topology แบบ (ตัวอย่าง cluster 1024 node)
- ลายใบ: 16x สวิตช์ใบ แต่ละตัวมีพอร์ตลิงค์ลง 48x 100GbE + 8x 400GbE uplinks
- ชั้นกระดูกสันหลัง: สวิทช์กระดูกสันหลัง 4x เนื้อผ้า 400GbE ที่ไม่ปิด
- คอมพิวเตอร์โน๊ด:MCX653105A-HDATต่อหน่วย (ไม่จํากัด Active-Active หรือ Active-Standby)
- พื้นที่เก็บข้อมูล: 1xMCX653105A-HDATต่อหน่วย, ให้บริการ NVMe namespaces ผ่าน RDMA
ขั้นตอนการใช้งาน:ยืนยันMCX653105A-HDAT รองรับเซอร์เวอร์ที่ใช้เมทริกซ์ความสอดคล้องอย่างเป็นทางการ ติดตั้ง MLNX_OFED หรือ DOCA Framework (สัญลักษณ์ขั้นต่ํา 5.8) เอนกประสงค์ RoCE บนพอร์ตสวิตช์ (ปารามิเตอร์ PFC, ECN, DCQCN ปรับให้กับภาระงาน)ปรับปรุงการเชื่อมต่อหรือหลายเส้นทางสําหรับการรีดันซ์สองพอร์ต. ในที่สุด, ยืนยันการใช้ perftest suite (ib_write_bw, ib_read_lat)
ความคิดในการปรับขนาด:สําหรับ 2000+ ค้อนโน้ต, นําไปใช้ Routing ปรับปรุงและการควบคุมความจืดหยุ่นในระดับผ้า.MCX653105A-HDAT Ethernet adapter การ์ดแก้ไขขยายขนาดแบบเส้นตรง เพราะแต่ละตัวปรับใช้ทํางานอย่างอิสระ โดยไม่มีจุดขัดขวางกลางMCX653105A-HDAT ราคาเมื่อเทียบกับ TCO ช่วงเวลาการชําระเงินปกติคือ 6-12 เดือนเนื่องจากการปรับปรุงเซอร์เวอร์และลดความต้องการจํานวนคอร์ CPUMCX653105A-HDAT สําหรับขายควรติดต่อผู้จําหน่ายภูมิภาคสําหรับราคาปริมาณและตัวเลือกการปรับปรุงฟอร์มแวร์
| ขนาดการใช้งาน | โทปโลยีที่แนะนํา | คาดการณ์ความช้า (P99) | อัตราการลดอัตรา CPU |
|---|---|---|---|
| สูงสุด 256 คัน | ใบเดียวหรือใบสอง + หลังสอง | ≤1.8 μs | 85-90% |
| 257-1024 หน่วย | 4-16 ใบ + 4 กระดาน | ≤ 2.2 μs | 88-92% |
| 1024+ หน่วย | มีหลายระดับที่มีการปรับเปลี่ยนเส้นทาง | ≤2.8 μs | 90-95% |
การติดตามและเทเลเมตร:รายการNVIDIA Mellanox MCX653105A-HDATส่งออกตัวนับในเวลาจริงผ่าน PCM (Performance Counter Monitor) และ DOCA Telemetry เมตรสําคัญในการติดตาม: อัตราการระบุความจุกจุก RoCE, จํานวนการลดพัฟเฟอร์, ความผิดพลาดการเชื่อมโยง PCIe และกรอบหยุดท่าเรือการบูรณาการกับ Prometheus+Grafana ได้รับการสนับสนุนผ่าน NVIDIA Management Library (NVML).
แนวทางการปรับปรุง:กําหนดพารามิเตอร์ DCQCN (cnp_802p_prio=3, rpg_time_reset=300, ฯลฯ) โดยใช้ภาระงานที่มีความรุนแรงสําหรับการเก็บของ, ปลอดภัยสําหรับการคํานวณระบบการส่งและส่ง, RoCE สําหรับกระแสที่มีความรู้สึกต่อความช้า และ ASAP2 สําหรับ NFV. ใช้เครื่องมือ mlxconfig ที่รวมไว้เพื่อปรับขนาดน้ําหนักประโยชน์สูงสุดของ PCIe (256B เป็นตัวอํานวยความสะดวกสําหรับเซอร์เวอร์ส่วนใหญ่)
การแก้ปัญหาทั่วไป:การพับท่าพานมักจะแสดงให้เห็นว่า SFP / สายไฟฟ้าไม่ตรงกันMCX653105A-HDAT รองรับความสามารถในการใช้งาน RDMA ที่ต่ํามักชี้ให้เห็นถึงการตั้งค่า ECN ที่ไม่เพียงพอบนสวิตช์ใช้ ibdiagnet สําหรับการรับรองผ้าและ dump_emad เพื่อตรวจสอบทะเบียนตัวปรับภายในสําหรับประเด็นที่คงอยู่ใบข้อมูล MCX653105A-HDATจําหน่ายระบบวินิจฉัย ระดับทะเบียน และตารางรหัสความผิดพลาด
รายการMCX653105A-HDATเป็นก้อนของส่วนที่พร้อมสําหรับการผลิต สําหรับเครือข่ายศูนย์ข้อมูลที่มีความอ่อนแอต่ําและความเร็วสูง โดยการย้ายการประมวลผลเครือข่ายจาก CPU ไปยังเครื่องยนต์ที่ใช้ฮาร์ดแวร์มันทําให้ RDMA/RoCE สามารถใช้งานได้บนพื้นฐาน Ethernet มาตรฐาน. ผลลัพธ์ค่าหลักรวมถึง: การลด CPU 50-70% สําหรับงานเครือข่าย, ความช้าต่ําต่ํา 2μs, การบูรณาการ NVMe-oF ที่เรียบร้อย, และความสามารถปรับขนาดเชิงเส้นเป็นพันหน่วยMCX653105A-HDAT Ethernet adapter การ์ดแก้ไขให้ช่องทางที่มั่นคงในอนาคตไปยังผ้า 200GbE โดยยังรักษาความเข้ากันได้กับเครื่องมือการจัดการที่มีอยู่รายละเอียด MCX653105A-HDATสําหรับการพิสูจน์แนวคิด หรือการวางแผนการวางจําหน่ายในขนาด rack ตัวปรับตัวนี้นํามาซึ่งการปรับปรุงที่สามารถปรับปริมาณได้ ทั้งในด้านการทํางานและค่าบริการรวม

