Mellanox (NVIDIA Mellanox) MCX623106AN-CDAT Server Adapter กระดาษเทคนิค
April 24, 2026
เอกสารทางเทคนิคฉบับนี้จัดทำขึ้นสำหรับสถาปนิกเครือข่าย วิศวกรฝ่ายขายล่วงหน้า และผู้จัดการฝ่ายปฏิบัติการ โดยมุ่งเน้นไปที่ Mellanox (NVIDIA Mellanox) MCX623106AN-CDAT อะแดปเตอร์เซิร์ฟเวอร์ และสาธิตวิธีการสร้างเครือข่ายศูนย์ข้อมูลที่มีความหน่วงต่ำและมีปริมาณงานสูงโดยใช้เทคโนโลยี RDMA/RoCE เอกสารครอบคลุมการออกแบบสถาปัตยกรรม คุณสมบัติทางเทคนิคที่สำคัญ กลยุทธ์การปรับใช้และการขยายขนาด รวมถึงการดำเนินงานและการตรวจสอบ—ให้คำแนะนำที่นำไปปฏิบัติได้จริงสำหรับการนำไปใช้ในโลกแห่งความเป็นจริง
ศูนย์ข้อมูลสมัยใหม่เผชิญกับความท้าทายหลักสามประการ: CPU กลายเป็นคอขวดของเครือข่าย ความหน่วงในการเข้าถึงที่เก็บข้อมูลที่มากเกินไป และค่าใช้จ่ายในการสื่อสารที่ควบคุมไม่ได้สำหรับแอปพลิเคชันแบบกระจาย โปรโตคอลสแต็ก TCP/IP แบบดั้งเดิมใช้ทรัพยากร CPU มากกว่า 30% ในการประมวลผลโปรโตคอลและการคัดลอกข้อมูลระหว่างการสื่อสารแบบขนานขนาดใหญ่ ซึ่งช่วยลดปริมาณงานของเซิร์ฟเวอร์ที่มีประสิทธิภาพลงอย่างมาก ในขณะเดียวกัน แอปพลิเคชัน เช่น NVMe over Fabrics, เฟรมเวิร์กการเรียนรู้ของเครื่องแบบกระจาย (เช่น NCCL) และฐานข้อมูลในหน่วยความจำ ต้องการความหน่วงแบบ end-to-end ที่ต่ำกว่า 20 ไมโครวินาที สิ่งที่จำเป็นเร่งด่วนคือโซลูชันที่ข้ามเคอร์เนลและให้การยกเลิกการขนส่งระดับฮาร์ดแวร์—ซึ่งเป็นปัญหาที่ MCX623106AN-CDAT ร่วมกับเทคโนโลยี RoCE แก้ไขได้
โซลูชันนี้ใช้โทโพโลยีแบบ Spine-Leaf สองชั้น โหนดคอมพิวต์และที่เก็บข้อมูลทั้งหมดติดตั้งอะแดปเตอร์ Ethernet NVIDIA Mellanox MCX623106AN-CDAT สวิตช์ Leaf ถูกกำหนดค่าสำหรับการทำงาน RoCE แบบไม่สูญเสียข้อมูล โดยเปิดใช้งาน PFC (Priority Flow Control) และ ECN (Explicit Congestion Notification) พร้อมคิวลำดับความสำคัญเฉพาะสำหรับทราฟฟิก RoCE หลักการออกแบบที่สำคัญ ได้แก่:
- การแยกส่วนควบคุมและส่วนข้อมูล: การไหลของข้อมูล RoCE ถูกประมวลผลโดยฮาร์ดแวร์บนอะแดปเตอร์ทั้งหมด ในขณะที่โปรโตคอลควบคุม (เช่น ARP, DHCP) ยังคงเป็นไปตามเส้นทางแบบดั้งเดิม
- เครือข่ายแบบรวม: Ethernet รองรับทั้งทราฟฟิก TCP/IP มาตรฐานและ RoCE โดยมีการแยก QoS ผ่านการทำเครื่องหมาย DSCP
- การจัดการความแออัดแบบ end-to-end: อิงตามอัลกอริทึม DCQCN สร้างกลไกการป้อนกลับแบบวงปิดระหว่างอะแดปเตอร์ต้นทางและสวิตช์
การ์ดอะแดปเตอร์ Ethernet MCX623106AN-CDAT มีบทบาทสำคัญในแต่ละโหนดเซิร์ฟเวอร์ การออกแบบพอร์ตคู่ 100GbE สามารถเชื่อมต่อกับสวิตช์ Leaf ที่แตกต่างกันเพื่อความซ้ำซ้อน หรือให้การแยกทางกายภาพระหว่างทราฟฟิกที่เก็บข้อมูลและคอมพิวต์
ในฐานะส่วนประกอบหลักของส่วนข้อมูลของโซลูชันนี้ การ์ดเครือข่าย PCIe อะแดปเตอร์ MCX623106AN-CDAT ConnectX มอบความสามารถที่สำคัญดังต่อไปนี้:
- เอนจิ้นการยกเลิก RoCE ระดับฮาร์ดแวร์: จัดการการประมวลผลเลเยอร์การขนส่ง (การแบ่งส่วน การประกอบใหม่ การยืนยัน การส่งซ้ำ) โดยไม่ต้องใช้ CPU โฮสต์
- การยกเลิก ConnectX แบบไดนามิก: กระจายทราฟฟิกแบบหลายคิวโดยอัตโนมัติ ปรับปรุงปริมาณงานบนเซิร์ฟเวอร์แบบหลายคอร์
- อินเทอร์เฟซโฮสต์ PCIe 4.0 x16: แบนด์วิดท์ตามทฤษฎี 256Gb/s รับประกันว่าไม่มีคอขวดสำหรับการส่งต่อแบบ line-rate
- การยกเลิกที่เก็บข้อมูลขั้นสูง: รองรับการเร่งความเร็วฮาร์ดแวร์สำหรับ NVMe over Fabrics รวมถึงการค้นหา namespace และการตรวจสอบความสมบูรณ์ของข้อมูล
ตาม เอกสารข้อมูล MCX623106AN-CDAT และ ข้อมูลจำเพาะ MCX623106AN-CDAT ที่เผยแพร่ต่อสาธารณะ อะแดปเตอร์นี้มีความหน่วงจากพอร์ตถึงพอร์ตต่ำกว่า 600 นาโนวินาที และรองรับอัตราการประมวลผลแพ็กเก็ตสูงสุด 200 ล้านแพ็กเก็ตต่อวินาที สำหรับทีมที่ประเมินต้นทุน ราคา MCX623106AN-CDAT มีการแข่งขันสูงในกลุ่มอะแดปเตอร์ 100GbE RoCE ที่เทียบเคียงกัน และ MCX623106AN-CDAT สำหรับขาย มีจำหน่ายผ่านช่องทางการจัดจำหน่ายมาตรฐาน ก่อนทำการเลือก ควรยืนยันว่ารุ่นเซิร์ฟเวอร์ปรากฏในรายการ MCX623106AN-CDAT ที่เข้ากันได้—แพลตฟอร์ม OEM หลักทั้งหมดได้รับการตรวจสอบแล้ว
คำอธิบายโทโพโลยีทั่วไป:
สถาปัตยกรรม Clos ประกอบด้วยสวิตช์ Spine 2 ตัวและสวิตช์ Leaf 4 ตัว โหนดเซิร์ฟเวอร์แต่ละโหนดติดตั้ง MCX623106AN-CDAT หนึ่งตัว โดยมีพอร์ต 100GbE ทั้งสองเชื่อมต่อกับสวิตช์ Leaf ที่แตกต่างกันสองตัว พอร์ตอัปลิงก์ของ Leaf เชื่อมต่อกับ Spines ด้วยอัตราส่วนการโอเวอร์ซับสคริปชัน 4:1 ใช้ VLAN เฉพาะสำหรับทราฟฟิก RoCE
ขั้นตอนการปรับใช้:
- ขั้นตอนที่ 1: ติดตั้ง MCX623106AN-CDAT ในสล็อต PCIe 4.0 x16 จากนั้นติดตั้งเฟิร์มแวร์ล่าสุดและไดรเวอร์ NVIDIA MLNX_OFED
- ขั้นตอนที่ 2: บนสวิตช์ กำหนดค่า PFC (แนะนำลำดับความสำคัญ 3) และ ECN (ตั้งค่า Kmin/Kmax) สำหรับทราฟฟิก RoCE
- ขั้นตอนที่ 3: บนระบบปฏิบัติการ เปิดใช้งานโหมด RoCEv2 และกำหนดค่าพารามิเตอร์ DCQCN (ค่าเริ่มต้น: α=1, β=1, ระยะเวลาตัวจับเวลา 100μs)
- ขั้นตอนที่ 4: ใช้เครื่องมือ ib_write_bw และ ib_write_lat เพื่อตรวจสอบประสิทธิภาพพื้นฐาน
คำแนะนำในการขยายขนาด: เมื่อคลัสเตอร์ขยายเกิน 500 โหนด ให้พิจารณาเปิดใช้งานการควบคุมการไหลของอะแดปเตอร์ (PPC) และตารางการจับคู่ QoS และพิจารณาใช้ลำดับความสำคัญ RoCE หลายรายการเพื่อหลีกเลี่ยงปัญหา head-of-line blocking
ทีมปฏิบัติการสามารถใช้เครื่องมือต่อไปนี้เพื่อตรวจสอบสุขภาพของ โซลูชันการ์ดอะแดปเตอร์ Ethernet MCX623106AN-CDAT:
- mlxconfig / mlxfwmanager: กำหนดค่าพารามิเตอร์เฟิร์มแวร์และจัดการการอัปเกรดเฟิร์มแวร์
- ethtool -S: ดูตัวนับการส่ง/รับ RoCE และจำนวนเฟรมหยุด PFC
- ibdiagnet: ดำเนินการวินิจฉัยเครือข่าย RoCE ที่ครอบคลุมเพื่อตรวจจับพายุ PFC ที่ไม่จำเป็น
- Telemetry และ HIST: ใช้ตารางการกระจายความหน่วงแบบประวัติที่มีอยู่ในอะแดปเตอร์เพื่อระบุความผิดปกติของความหน่วงหาง
การแก้ไขปัญหาทั่วไป:
- ปริมาณงานต่ำกว่าที่คาดไว้: ตรวจสอบสถานะการเจรจา PCIe (ควรเป็น Gen4 x16) และตรวจสอบให้แน่ใจว่า MTU ถูกตั้งค่าเป็นเฟรมจัมโบ้ 9000 อย่างสม่ำเสมอ
- ความล้มเหลวในการเชื่อมต่อ RoCE: ตรวจสอบการจับคู่ DSCP และการกำหนดค่า VLAN ตรวจสอบให้แน่ใจว่าสวิตช์ไม่ได้ทิ้งแพ็กเก็ตที่ทำเครื่องหมาย RoCE
- การใช้งาน CPU สูง: นี่อาจบ่งชี้ว่าการยกเลิกฮาร์ดแวร์ไม่ได้เปิดใช้งาน ตรวจสอบการตั้งค่าการยกเลิก ethtool
คำแนะนำในการปรับปรุงประสิทธิภาพ: สำหรับแอปพลิเคชันที่ไวต่อความหน่วงเป็นพิเศษ (เช่น การซื้อขายความถี่สูง การจำลองบันทึก RDMA) ให้พิจารณาเปลี่ยนประเภทบริการ RoCE จาก "connected" เป็น "datagram" และปิดใช้งานการควบคุมความแออัด
โซลูชัน RDMA/RoCE ที่ใช้ MCX623106AN-CDAT ช่วยลดความหน่วงแบบ end-to-end สำหรับแอปพลิเคชันแบบกระจายลงหนึ่งอันดับ (จากหลายร้อยไมโครวินาทีเป็นหลายสิบไมโครวินาที) โดยไม่ต้องเปลี่ยนโครงสร้างพื้นฐาน Ethernet ที่มีอยู่ ในขณะเดียวกันก็ช่วยเพิ่มทรัพยากรคอมพิวต์ CPU ได้ 20-30% สำหรับสถานการณ์ต่างๆ เช่น การฝึก AI ที่เก็บข้อมูลแบบ hyperconverged และการวิเคราะห์แบบเรียลไทม์ สิ่งนี้แปลโดยตรงเป็นเวลาในการทำงานที่สั้นลงและความหนาแน่นของเซิร์ฟเวอร์ที่สูงขึ้น ในฐานะ โซลูชันการ์ดอะแดปเตอร์ Ethernet MCX623106AN-CDAT ที่สมบูรณ์ แสดงให้เห็นว่า "lossless Ethernet + smart NIC" เป็นเส้นทางที่ใช้งานได้จริงเพื่อให้ได้ทั้งปริมาณงานสูงและความหน่วงต่ำ สำหรับรายละเอียดทางเทคนิคเพิ่มเติมหรือเพื่อรับ เอกสารข้อมูล MCX623106AN-CDAT โปรดดูเอกสารอย่างเป็นทางการของ NVIDIA หรือติดต่อทีมสถาปัตยกรรมโซลูชัน

