เอกสารทางเทคนิค NVIDIA Mellanox MCX653106A-HDAT Server Adapter
April 30, 2026
เอกสารไวท์เปเปอร์ทางเทคนิคฉบับนี้มีไว้สำหรับสถาปนิกเครือข่าย วิศวกรฝ่ายขายล่วงหน้า และผู้จัดการฝ่ายปฏิบัติการ โดยให้ข้อมูลอ้างอิงที่ครอบคลุมสำหรับการออกแบบและปรับใช้เครือข่ายศูนย์ข้อมูลประสิทธิภาพสูงที่มีความหน่วงต่ำ โดยใช้ NVIDIA Mellanox MCX653106A-HDAT เซิร์ฟเวอร์ NIC โดยเน้นที่การขนส่ง RDMA/RoCE และการเพิ่มปริมาณงานของเซิร์ฟเวอร์ที่วัดผลได้
ปริมาณงานศูนย์ข้อมูลสมัยใหม่ — รวมถึงเครือข่ายจัดเก็บข้อมูล NVMe-oF การฝึกอบรม AI แบบกระจาย การซื้อขายความถี่สูง และการวิเคราะห์แบบเรียลไทม์ — ทำให้โครงสร้างพื้นฐานเครือข่ายมีความต้องการสูง การประมวลผลสแต็ก TCP/IP แบบดั้งเดิมทำให้เกิดคอขวดพื้นฐานสามประการ: ภาระงาน CPU สูง (มักเกิน 50% ของรอบการทำงานหลัก) ความหน่วงที่แปรผันเนื่องจากข้อจำกัดในการข้ามเคอร์เนล และปริมาณงานที่มีประสิทธิภาพลดลงจากภาระงานการประมวลผลโปรโตคอล องค์กรต่างๆ ต้องการโซลูชันที่ให้แบนด์วิดท์ระดับสายด้วยความหน่วงต่ำกว่าไมโครวินาที ในขณะที่ยังคงทรัพยากร CPU ไว้สำหรับการประมวลผลแอปพลิเคชัน ข้อกำหนดที่สำคัญ ได้แก่ RDMA ที่ประมวลผลด้วยฮาร์ดแวร์ การขนส่ง RoCE แบบไม่สูญเสีย การผสานรวมอย่างราบรื่นกับเครือข่าย Ethernet ที่มีอยู่ และเครื่องมือการดำเนินงานที่ครอบคลุมสำหรับการตรวจสอบและการแก้ไขปัญหา
สถาปัตยกรรมที่นำเสนอใช้โทโพโลยี Clos แบบสองชั้น (spine-leaf) ที่ปรับให้เหมาะสมสำหรับการขนส่ง RoCE สวิตช์ Leaf ให้การเชื่อมต่อเซิร์ฟเวอร์ด้วย DCB (Priority Flow Control, Enhanced Transmission Selection) ที่กำหนดค่าเพื่อรับประกันพฤติกรรมแบบไม่สูญเสียสำหรับทราฟฟิก RDMA สวิตช์ Spine ช่วยให้การสื่อสารแบบไม่บล็อกระหว่างกันภายในเครือข่าย แต่ละโหนดประมวลผลและจัดเก็บข้อมูลมี การ์ดอะแดปเตอร์ Ethernet MCX653106A-HDAT ซึ่งเชื่อมต่อกับสวิตช์ Leaf ผ่านพอร์ต 100GbE สองพอร์ตที่กำหนดค่าแบบ active-active bonding สถาปัตยกรรมแยกทราฟฟิก RDMA (คิวลำดับความสำคัญเฉพาะพร้อมเปิดใช้งาน PFC) ออกจากทราฟฟิก TCP/IP ปกติ (คิวแบบ best-effort) เพื่อให้มั่นใจถึงความหน่วงต่ำที่แน่นอนสำหรับโฟลว์ที่สำคัญ การแบ่งส่วน VLAN แยกโดเมน RDMA ในขณะที่การกำหนดเส้นทางจะจัดการการสื่อสารข้ามซับเน็ตตามที่จำเป็น
การ์ดเครือข่าย PCIe อะแดปเตอร์ MCX653106A-HDAT ConnectX ทำหน้าที่เป็นรากฐานของโซลูชันนี้ สร้างขึ้นบนสถาปัตยกรรม ConnectX-6 พร้อมอินเทอร์เฟซโฮสต์ PCIe 4.0 x16 ให้ปริมาณงาน 100GbE แบบสองพอร์ต (หรือ 200GbE แบบพอร์ตเดียว) ด้วยความหน่วงต่ำกว่า 600ns ภายใต้ปริมาณงาน RDMA คุณสมบัติหลักที่ใช้ในการออกแบบนี้ ได้แก่:
- การประมวลผล RDMA และ RoCE ด้วยฮาร์ดแวร์: การประมวลผลคำสั่ง RDMA verbs แบบเต็ม ช่วยลดการมีส่วนร่วมของ CPU โฮสต์สำหรับการเคลื่อนย้ายข้อมูล รองรับทั้ง RoCE v1 และ v2
- ตัวเร่ง NVMe-oF: ตรรกะฮาร์ดแวร์ที่เร่งคำสั่ง NVMe ลดความหน่วงในการเข้าถึงที่เก็บข้อมูลได้มากกว่า 80% เมื่อเทียบกับเป้าหมายซอฟต์แวร์
- เส้นทางการประมวลผลข้อมูลที่ตั้งโปรแกรมได้ (ASAP²): เปิดใช้งานการประมวลผลแพ็กเก็ตที่ยืดหยุ่นและการประมวลผลเครือข่ายโอเวอร์เลย์ (VXLAN, GENEVE)
- Multi-Host และ GPU Direct RDMA: การสื่อสารแบบ peer-to-peer โดยตรงระหว่าง GPU ข้ามโหนดโดยไม่ต้องมีการแทรกแซงของ CPU — สำคัญสำหรับคลัสเตอร์ AI
- การวัดปริมาณและ การควบคุมความแออัด: การตรวจสอบโฟลว์ด้วยฮาร์ดแวร์ การทำเครื่องหมาย ECN และการจำกัดอัตราแบบไดนามิก
วิศวกรที่ตรวจสอบ เอกสารข้อมูล MCX653106A-HDAT จะสังเกตเห็นการรองรับทั้งฟอร์มแฟกเตอร์มาตรฐานและ OCP 3.0 การครอบคลุมระบบปฏิบัติการที่ครอบคลุม (การแจกจ่าย Linux ด้วย MLNX_OFED, Windows, ESXi) และความเข้ากันได้ของเซิร์ฟเวอร์ที่กว้างขวาง ข้อมูลจำเพาะ MCX653106A-HDAT ยังยืนยันการใช้พลังงานสูงสุด 75W และอุณหภูมิการทำงานตั้งแต่ 0°C ถึง 55°C ซึ่งเหมาะสำหรับการใช้งานที่มีความหนาแน่นสูง
การปรับใช้เป็นไปตามแนวทางทีละขั้นตอน โทโพโลยีการทดลองสองแร็คทั่วไปแสดงไว้ด้านล่าง:
| ส่วนประกอบ | การกำหนดค่า | ปริมาณ |
|---|---|---|
| โหนดประมวลผล/จัดเก็บข้อมูล | Dual Socket Intel/AMD, RAM 256GB+, ไดรฟ์ NVMe | 16 |
| NIC ต่อโหนด | MCX653106A-HDAT(100GbE แบบสองพอร์ต) | 16 |
| สวิตช์ Leaf | Mellanox SN3700 (32x 100GbE, เปิดใช้งาน DCB) | 2 |
| สวิตช์ Spine | Mellanox SN3700 (อัปลิงก์ 100GbE) | 1 (ปรับขนาดเป็น 2 เพื่อความซ้ำซ้อน) |
ขั้นตอนการปรับใช้:
- ขั้นตอนที่ 1 – การตรวจสอบความถูกต้อง:ยืนยันว่าเซิร์ฟเวอร์ เข้ากันได้กับ MCX653106A-HDAT เฟิร์มแวร์สวิตช์ และเวอร์ชันเคอร์เนล OS ใช้เมทริกซ์ความเข้ากันได้จาก เอกสารข้อมูล MCX653106A-HDAT.
- ขั้นตอนที่ 2 – การติดตั้งไดรเวอร์:ปรับใช้แพ็กเกจไดรเวอร์ MLNX_OFED (เวอร์ชันขั้นต่ำ 5.8) ทั่วทั้งโหนดทั้งหมด เปิดใช้งานโมดูลเคอร์เนล RDMA และ RoCE
- ขั้นตอนที่ 3 – การกำหนดค่าเครือข่าย:เปิดใช้งาน PFC (ลำดับความสำคัญ 3 สำหรับ RDMA) และ ETS บนสวิตช์ Leaf กำหนดค่า MTU 9000 สำหรับการรองรับเฟรมจัมโบ้
- ขั้นตอนที่ 4 – การตั้งค่า RoCE:กำหนดค่า การ์ดอะแดปเตอร์ Ethernet MCX653106A-HDAT แต่ละใบด้วย RoCE v2 (กำหนดเส้นทางได้) หรือ v1 (กำหนดเส้นทางไม่ได้) ตั้งค่าโหมด GID เป็น RoCE v2 ด้วยที่อยู่ IPv4
- ขั้นตอนที่ 5 – การตรวจสอบ:เรียกใช้การทดสอบ ib_write_bw และ ib_send_lat ระหว่างโหนดเพื่อตรวจสอบแบนด์วิดท์และความหน่วง ตรวจสอบด้วย
perfqueryปัจจุบัน และระยะเวลารอคอยmlnx_perf.
สำหรับการปรับขนาดเกิน 16 โหนด ให้เปลี่ยนไปใช้โทโพโลยี spine-leaf ด้วยสวิตช์ spine ที่ซ้ำซ้อนซึ่งรองรับได้ถึง 128 โหนด โซลูชันการ์ดอะแดปเตอร์ Ethernet MCX653106A-HDAT ปรับขนาดเป็นเชิงเส้นโดยไม่ต้องกำหนดค่าเครือข่ายใหม่ เนื่องจาก RoCE ใช้ ECMP สำหรับการกระจายโหลดผ่านหลายเส้นทาง
การดำเนินงานสภาพแวดล้อม RDMA/RoCE ที่มีประสิทธิภาพต้องใช้เครื่องมือพิเศษ ขอแนะนำแนวทางปฏิบัติดังต่อไปนี้:
- การตรวจจับความแออัด:ตรวจสอบเฟรม PFC pause ต่อพอร์ตโดยใช้การวัดปริมาณสวิตช์ (เช่น Mellanox SHARP) อัตรา pause ที่สูงขึ้นบ่งชี้ถึง incast หรือ micro-bursts ที่ต้องการการปรับการควบคุมโฟลว์
- เกณฑ์มาตรฐานประสิทธิภาพ:ใช้
mlx5cmdปัจจุบัน และระยะเวลารอคอยethtool -Sเพื่อรวบรวมตัวนับ RDMA ต่อคิว ติดตามการเสร็จสิ้นนอกลำดับและการส่งซ้ำ - การปรับแต่ง ECN และ DCQCN:เปิดใช้งาน Explicit Congestion Notification (ECN) บนสวิตช์ และกำหนดค่าพารามิเตอร์ Dynamic Congestion Control (DCQCN) บนไดรเวอร์ MCX653106A-HDAT(เช่น
dcqcn_r_ai=40,dcqcn_r_hai=10). - การวิเคราะห์บันทึก:ตรวจสอบ
/var/log/messagesสำหรับความล้มเหลวในการเชื่อมต่อ RDMA (เช่น “mlx5_core: failed to create QP”) ตรวจสอบว่าดัชนี GID ตรงกันระหว่างจุดปลาย - การอัปเดตเฟิร์มแวร์:อัปเดตเฟิร์มแวร์ NIC เป็นประจำผ่าน
mlxfwmanagerข้อมูลจำเพาะ MCX653106A-HDAT แนะนำให้ใช้เฟิร์มแวร์พื้นฐาน xx.36.1010 หรือใหม่กว่าสำหรับประสิทธิภาพ RoCE ที่ดีที่สุด - การวางแผนความจุ:สำหรับองค์กรที่ประมาณการ ราคา MCX653106A-HDAT ปัจจุบัน และระยะเวลารอคอย MCX653106A-HDAT สำหรับขาย ให้วางแผนอัตราการเติบโตของการรับส่งข้อมูล RDMA และวางแผนอัตราส่วนการโอเวอร์ซับสคริปต์ของสวิตช์ Leaf (โดยทั่วไปคือ 3:1 สำหรับเครือข่ายจัดเก็บข้อมูล)
สถานการณ์การแก้ไขปัญหาทั่วไป: ความหน่วงสูงแบบทิศทางเดียวโดยไม่มีการสูญเสียแพ็กเก็ต มักบ่งชี้ถึงการตั้งค่า ECN ที่กำหนดค่าผิดพลาด หรือการตั้งค่า PFC ที่ไม่สมมาตร ใช้ mlnx_qos เพื่อตรวจสอบโหมด trust และการจับคู่ DSCP กับลำดับความสำคัญทั่วทั้งองค์ประกอบเครือข่ายทั้งหมด
NVIDIA Mellanox MCX653106A-HDAT เซิร์ฟเวอร์ NIC เป็นรากฐานที่พร้อมสำหรับการผลิตสำหรับการปรับใช้เครือข่าย RDMA/RoCE ประสิทธิภาพสูง โซลูชันทางเทคนิคนี้มอบมูลค่าที่วัดผลได้ในหลายมิติ:
- ประสิทธิภาพ: ปริมาณงานสูงสุด 200Gb/s ต่ออะแดปเตอร์ด้วยความหน่วงต่ำกว่าไมโครวินาที ช่วยให้เครือข่ายจัดเก็บข้อมูลแบบ scale-out และปริมาณงานการประมวลผลแบบกระจายที่เคยถูกจำกัดโดยภาระงาน TCP
- ประสิทธิภาพ: การประมวลผลด้วยฮาร์ดแวร์ช่วยลดการใช้ CPU ที่เกี่ยวข้องกับเครือข่ายจาก >50% เหลือต่ำกว่า 15% ทำให้มีคอร์เหลือสำหรับการประมวลผลแอปพลิเคชัน
- TCO: โซลูชันการ์ดอะแดปเตอร์ Ethernet MCX653106A-HDAT ลดจำนวนโหนดที่ต้องการสำหรับเป้าหมายปริมาณงานที่กำหนด ลดค่าใช้จ่ายด้านทุนและการดำเนินงาน เมื่อประเมิน ราคา MCX653106A-HDAT ให้พิจารณาช่วงเวลาคืนทุน 9–12 เดือนจากผลประโยชน์ด้านประสิทธิภาพเพียงอย่างเดียว
- ความพร้อมสำหรับอนาคต: การรองรับ PCIe 5.0 (เข้ากันได้แบบย้อนหลัง) และความสามารถในการตั้งโปรแกรมผ่าน DOCA ช่วยให้มั่นใจในการปกป้องการลงทุน เนื่องจากความเร็วของศูนย์ข้อมูลจะย้ายไปที่ 200/400GbE
สำหรับสถาปนิกที่มองหารูปแบบการออกแบบที่ผ่านการทดสอบการผลิต โซลูชันนี้จะผสานรวมเข้ากับการดำเนินงาน Ethernet ที่มีอยู่ได้อย่างราบรื่น ในขณะเดียวกันก็ปลดล็อกศักยภาพสูงสุดของ RDMA โปรดปรึกษา เอกสารข้อมูล MCX653106A-HDAT สำหรับแบบร่างเชิงกล แผนภาพเวลา และคำอธิบายคุณสมบัติขั้นสูง สำหรับคำแนะนำในการจัดซื้อ รวมถึง ราคา MCX653106A-HDAT ปัจจุบัน และระยะเวลารอคอย MCX653106A-HDAT สำหรับขาย โปรดติดต่อพันธมิตรผู้จัดจำหน่าย NVIDIA Mellanox ที่ได้รับอนุญาต

