Mellanox (NVIDIA Mellanox) โซลูชันทางเทคนิคของเซิร์ฟเวอร์ MCX556A-ECAT
June 9, 2026
เอกสารไวท์เปเปอร์นี้ช่วยให้สถาปนิกเครือข่าย วิศวกรก่อนการขาย และผู้นำฝ่ายปฏิบัติการได้รับกรอบทางเทคนิคที่ครอบคลุมสำหรับการปรับใช้เมลลาน็อกซ์ (NVIDIA เมลลาน็อกซ์) MCX556A-ECATอะแดปเตอร์เครือข่ายเซิร์ฟเวอร์ โซลูชันนี้มุ่งเน้นไปที่การขจัดปัญหาคอขวดของ TCP/IP ผ่าน RDMA/RoCE ซึ่งมอบการสื่อสารที่มีความหน่วงต่ำตามที่กำหนดได้ ในขณะเดียวกันก็เพิ่มปริมาณงานของเซิร์ฟเวอร์ให้สูงสุดสำหรับเวิร์กโหลดที่มีข้อมูลจำนวนมาก
1. การวิเคราะห์ความเป็นมาและความต้องการของโครงการ
สภาพแวดล้อมศูนย์ข้อมูลสมัยใหม่ รวมถึงคลัสเตอร์การฝึกอบรม AI ฐานข้อมูลแบบกระจาย โครงสร้างพื้นฐานแบบไฮเปอร์คอนเวิร์จ และแพลตฟอร์มการซื้อขายความถี่สูง มีข้อจำกัดร่วมกัน นั่นคือ สแต็กเครือข่ายแบบเดิมใช้รอบ CPU 30–50% ในสำเนาหน่วยความจำ สวิตช์บริบท และการประมวลผลโปรโตคอล เมื่อความเร็วลิงก์เพิ่มขึ้นเป็น 100Gbps และมากกว่านั้น เครือข่ายที่ใช้ซอฟต์แวร์จึงไม่ยั่งยืน ข้อกำหนดหลักสำหรับการเชื่อมต่อเซิร์ฟเวอร์ยุคถัดไป ได้แก่ เวลาแฝงระหว่างโหนดต่ำกว่า 5 ไมโครวินาที โอเวอร์เฮดของ CPU ต่ำกว่า 10% ต่อลิงก์ 100Gbps การขนส่งแบบไม่สูญเสียข้อมูลสำหรับโปรโตคอลการจัดเก็บข้อมูล (NVMe-oF) และการบูรณาการอย่างราบรื่นกับโครงสร้างพื้นฐานอีเทอร์เน็ตที่มีอยู่ ที่โซลูชันการ์ดอะแดปเตอร์อีเทอร์เน็ต MCX556A-ECATตอบสนองความต้องการเหล่านี้โดยตรง
2. การออกแบบสถาปัตยกรรมเครือข่าย/ระบบโดยรวม
สถาปัตยกรรมที่แนะนำปรับใช้NVIDIA Mellanox MCX556A-ECATเป็นอะแดปเตอร์ 100GbE สองพอร์ตในแต่ละโหนดประมวลผลหรือหน่วยเก็บข้อมูล โซลูชันนี้ใช้โทโพโลยี leaf-spine สองชั้นพร้อมการรองรับ RoCE (RDMA บน Converged Ethernet) การตัดสินใจทางสถาปัตยกรรมที่สำคัญ ได้แก่ :
- รากฐานอีเทอร์เน็ตแบบ Lossless: เปิดใช้งาน Priority Flow Control (PFC) บนพอร์ตที่มีการรับส่งข้อมูล RoCE และกำหนดค่าเกณฑ์ ECN (การแจ้งเตือนความแออัดอย่างชัดเจน) บนลีฟสวิตช์
- แยกชั้นการจราจร: กำหนดการรับส่งข้อมูล RoCE ให้กับคิวลำดับความสำคัญเฉพาะ (โดยทั่วไปคือ 3 หรือ 5) โดยมีการกำหนดเวลาลำดับความสำคัญที่เข้มงวด
- การจัดการบัฟเฟอร์: จัดสรรพูลบัฟเฟอร์ที่ใช้ร่วมกันบนสวิตช์ตามข้อมูลจำเพาะ MCX556A-ECAT(แนะนำ 4MB ต่อพอร์ตสำหรับการดำเนินการแบบไม่สูญเสีย)
แต่ละMCX556A-ECAT อะแดปเตอร์ ConnectX การ์ดเครือข่าย PCIeเชื่อมต่อกับสวิตช์ลีฟผ่านออปติก QSFP28 (SR4, LR4 หรือ AOC/DAC ขึ้นอยู่กับระยะทาง) เพื่อความพร้อมใช้งานสูง การกำหนดค่าแบบ dual-homing จะเชื่อมโยงทั้งสองพอร์ตเข้าด้วยกัน ได้แก่ active-active สำหรับปริมาณงาน หรือ active-standby สำหรับการเปลี่ยนระบบเมื่อเกิดข้อผิดพลาด ส่วนควบคุมใช้อีเทอร์เน็ตและ IP มาตรฐาน ในขณะที่ส่วนข้อมูลใช้ประโยชน์จาก RDMA สำหรับการถ่ายโอนแบบไม่มีสำเนา
3. บทบาทและคุณสมบัติหลักของ Mellanox (NVIDIA Mellanox) MCX556A-ECAT ในโซลูชัน
ที่MCX556A-ECATทำหน้าที่เป็นกลไกการถ่ายข้อมูลที่สำคัญระหว่างหน่วยความจำเซิร์ฟเวอร์และแฟบริคเครือข่าย การขนส่งโดยใช้ฮาร์ดแวร์ช่วยลดความเกี่ยวข้องของเคอร์เนลในการเคลื่อนย้ายข้อมูล ความสามารถหลักที่ดึงมาจากเอกสารข้อมูลสินค้า MCX556A-ECATรวม:
| คุณสมบัติ | คำอธิบาย | ผลประโยชน์ |
|---|---|---|
| RDMA และ RoCE เวอร์ชัน 2 | การเข้าถึงหน่วยความจำโดยตรงระยะไกลโดยใช้ฮาร์ดแวร์ผ่านอีเธอร์เน็ตแบบรวม | การมีส่วนร่วมของ CPU เป็นศูนย์; เวลาแฝงของฮาร์ดแวร์ต่ำกว่า1µs |
| ออฟโหลด NVMe-oF | ออฟโหลดเต็มรูปแบบของการประมวลผลคำสั่ง NVMe/TCP และ NVMe/RDMA | เปิดใช้งานพื้นที่เก็บข้อมูลแบบแยกส่วนที่ใช้ร่วมกันที่ประสิทธิภาพในเครื่อง |
| GPUDirect | การสื่อสารแบบเพียร์ทูเพียร์ระหว่าง GPU และหน่วยความจำ NIC | กำจัดหน่วยความจำระบบระดับกลางสำหรับการฝึก AI |
ที่การ์ดอะแดปเตอร์อีเทอร์เน็ต MCX556A-ECATยังรวมถึงการบังคับทิศทางขั้นสูง (การจำแนกโฟลว์เป็น 128 คิวเสมือน), SR-IOV พร้อมฟังก์ชันเสมือนสูงสุด 512 ฟังก์ชัน และออฟโหลดตัวจับเวลาฮาร์ดแวร์สำหรับโปรโตคอลเวลาที่แม่นยำ (PTP) คุณสมบัติเหล่านี้ทำให้เป็นกลไกเร่งความเร็วเส้นทางข้อมูลที่สมบูรณ์ ไม่ใช่แค่อินเทอร์เฟซความเร็วสูงเท่านั้น
4. คำแนะนำในการปรับใช้และการปรับขนาด (โทโพโลยีทั่วไป)
สำหรับคลัสเตอร์ขนาดกลาง (64–256 โหนด) แนะนำให้ใช้โทโพโลยีต่อไปนี้:
- ชั้นใบ: สวิตช์ RoCE 100GbE 48 พอร์ตสองหรือสี่ตัว (เช่น NVIDIA SN3700) แต่ละลีฟเชื่อมต่อกับเซิร์ฟเวอร์ 24–48 เครื่องด้วยรองรับ MCX556A-ECATพอร์ต QSFP28
- ชั้นกระดูกสันหลัง: สวิตช์ 400GbE 32 พอร์ต 4 ตัวที่ให้อัปลิงก์ 100GbE แบบไม่บล็อก 128 ตัวจากใบไม้
- การกำหนดค่าเซิร์ฟเวอร์: หนึ่งMCX556A-ECATต่อเซิร์ฟเวอร์ พอร์ต A ถึงลีฟสวิตช์ A, พอร์ต B ถึงลีฟสวิตช์ B ซึ่งให้แบนด์วิธรวม 200Gbps และความซ้ำซ้อนของเส้นทาง
การปรับขนาดแฟบริคเกินกว่า 256 โหนดจำเป็นต้องเพิ่มคู่ลีฟ-สไปน์ หรือการย้ายไปยังสถาปัตยกรรม Clos แบบ 3 ขั้นตอน เมื่อทำการประเมินราคา MCX556A-ECATเมื่อเทียบกับความจุในอนาคต จะต้องคำนึงถึงอะแดปเตอร์ด้วยรองรับ MCX556A-ECATด้วยมาเธอร์บอร์ด PCIe 4.0 (รันที่ 3.0 x16 ในตอนแรก) ให้เส้นทางการอัพเกรดที่ตรงไปตรงมา
5. การดำเนินการ การตรวจสอบ การแก้ไขปัญหาและการเพิ่มประสิทธิภาพ
ความเป็นเลิศในการดำเนินงานสำหรับการใช้งาน RoCE จำเป็นต้องมีการตรวจสอบและปรับแต่งเฉพาะ แนวทางปฏิบัติหลัก ได้แก่ :
- เคาน์เตอร์ติดตาม: ใช้
ethtool -S ethX | grep -E "roce|pfc|ecn"เพื่อติดตามเฟรมการหยุดชั่วคราวที่มีลำดับความสำคัญและ CNP (แพ็คเก็ตการแจ้งเตือนความแออัด) ที่ข้อมูลจำเพาะ MCX556A-ECATเอกสารค่าพื้นฐานที่คาดหวัง - การปรับบัฟเฟอร์: กำหนดค่าบัฟเฟอร์ทางออกของสวิตช์เป็น 4–6MB สำหรับคิว RoCE บัฟเฟอร์ไม่เพียงพอทำให้เกิดพายุ PFC และปริมาณงานล่มสลาย
- การจัดการเฟิร์มแวร์: รักษาเฟิร์มแวร์ล่าสุด (หาได้จากพอร์ทัลสนับสนุนองค์กรของ NVIDIA) เพื่อแก้ไขข้อผิดพลาดและรับการปรับปรุงประสิทธิภาพที่บันทึกไว้ในเอกสารเอกสารข้อมูลสินค้า MCX556A-ECAT.
- พื้นฐานประสิทธิภาพ: วิ่ง
ib_write_bwและib_read_latจากชุดเครื่องมือ OFED ผลลัพธ์ที่คาดหวัง: แบบสองทิศทาง 98–99 Gbps พร้อมเวลาแฝง 0.8–1.2 µs สำหรับข้อความ 8 ไบต์
สถานการณ์การแก้ไขปัญหาทั่วไป: การชะงักงันของ PFC (ตรวจสอบการแมปคิวที่กำหนดค่าไม่ถูกต้อง) การสะบัดลิงก์ (ตรวจสอบระดับพลังงานและสายเคเบิล) และการหมดเวลาการเชื่อมต่อ RDMA (ตรวจสอบความสอดคล้องของ MTU ที่ 4200 ไบต์สำหรับเฟรมจัมโบ้) สำหรับทีมที่ค้นหาขาย MCX556A-ECATเพื่อขยายคลัสเตอร์ การจัดตำแหน่งเฟิร์มแวร์ล่วงหน้าระหว่างแบตช์จะหลีกเลี่ยงปัญหาความเข้ากันได้ที่น่าประหลาดใจ
6. สรุปและการประเมินมูลค่า
ที่MCX556A-ECATมอบคุณค่าที่ชัดเจนสำหรับศูนย์ข้อมูลสมัยใหม่ โดยการเปิดใช้งาน RDMA/RoCE จะทำให้NVIDIA Mellanox MCX556A-ECATลดเวลาแฝงของแอปพลิเคชันลง 10 เท่าเมื่อเทียบกับ TCP ลดค่าใช้จ่ายด้านเครือข่าย CPU ลง 85% และปลดล็อกการแยกส่วนพื้นที่เก็บข้อมูลผ่าน NVMe-oF สำหรับสถาปนิก ความจุ 100GbE สองพอร์ตของการ์ดช่วยเพิ่มพื้นที่ว่างในอนาคต สำหรับทีมปฏิบัติการ ชุดไดรเวอร์ที่สมบูรณ์ (อัพสตรีม Linux, Windows และ VMware) ช่วยลดความยุ่งยากในการจัดการ เมื่อทำการประเมินราคา MCX556A-ECATเมื่อเทียบกับต้นทุนรวมในการเป็นเจ้าของ รวมถึงสิทธิ์การใช้งานซอฟต์แวร์ พลังงาน และการระบายความร้อน โดยทั่วไปแล้วอะแดปเตอร์จะจ่ายเองภายใน 6-12 เดือนผ่านการรวมเซิร์ฟเวอร์ ไม่ว่าจะอ้างอิงเป็นการ์ดอะแดปเตอร์อีเทอร์เน็ต MCX556A-ECATหรือMCX556A-ECAT อะแดปเตอร์ ConnectX การ์ดเครือข่าย PCIeโซลูชันนี้ยังคงเป็นการออกแบบอ้างอิงสำหรับเครือข่ายอีเทอร์เน็ตความเร็วสูงแบบไม่สูญเสียข้อมูล

