NVIDIA Mellanox MCX556A-ECAT Server Adapter หนังสือขาวเทคนิค

July 23, 2026

NVIDIA Mellanox MCX556A-ECAT Server Adapter หนังสือขาวเทคนิค

NVIDIA Mellanox MCX556A-ECAT Server Adapter Technical White Paper | RDMA/RoCE Low-Latency Transport & Server Throughput Optimization

1. ความเป็นมาของโครงการและการวิเคราะห์ข้อกำหนด

ศูนย์ข้อมูลสมัยใหม่กำลังอยู่ระหว่างการเปลี่ยนแปลงพื้นฐานที่ขับเคลื่อนด้วยปัญญาประดิษฐ์ การประมวลผลประสิทธิภาพสูง (HPC) และการวิเคราะห์แบบเรียลไทม์ เวิร์กโหลดเหล่านี้ต้องการประสิทธิภาพเครือข่ายที่ไม่เคยมีมาก่อน ไม่ใช่แค่แบนด์วิดท์ดิบ แต่ยังรวมถึงความหน่วงแฝงต่ำที่คาดการณ์ได้ การเคลื่อนย้ายข้อมูลที่มีประสิทธิภาพต่อ CPU และความสามารถในการปรับขนาดที่ราบรื่น อะแดปเตอร์ Ethernet แบบดั้งเดิมที่อาศัยสแต็ก TCP/IP ที่ใช้ซอฟต์แวร์ได้กลายเป็นคอขวดที่สำคัญ โดยใช้แกน CPU 20-30% และสร้างความผันผวนของความหน่วงแฝงที่ไม่สามารถคาดเดาได้ซึ่งทำให้ประสิทธิภาพของแอปพลิเคชันลดลง สำหรับองค์กรที่ดำเนินงานในระดับใหญ่ ประสิทธิภาพที่ไม่มีประสิทธิภาพนี้จะแปลเป็นต้นทุนโครงสร้างพื้นฐานที่สูงขึ้นและเวลาในการรับข้อมูลเชิงลึกที่ช้าลงโดยตรง

เอกสารฉบับนี้จะนำเสนอโซลูชันทางเทคนิคที่ครอบคลุมซึ่งมีศูนย์กลางอยู่ที่ NVIDIA Mellanox MCX556A-ECAT เซิร์ฟเวอร์อะแดปเตอร์ ออกแบบมาสำหรับองค์กรที่ต้องการเพิ่มผลตอบแทนจากการลงทุน 100GbE ของตน MCX556A-ECAT Ethernet adapter card ให้บริการ RDMA over Converged Ethernet (RoCE) ที่เร่งด้วยฮาร์ดแวร์ ทำให้การขนส่งแบบไม่สูญเสียและมีความหน่วงแฝงต่ำ ซึ่งเปลี่ยน I/O เครือข่ายจากภาระให้เป็นสินทรัพย์เชิงกลยุทธ์ โซลูชันนี้ได้รับการออกแบบมาโดยเฉพาะเพื่อบรรลุวัตถุประสงค์หลักสามประการ: (1) การบรรลุความหน่วงแฝงของแอปพลิเคชันแบบ end-to-end ต่ำกว่า 10 ไมโครวินาที (2) การลดภาระการประมวลผลเครือข่ายของ CPU ให้ต่ำกว่า 5% และ (3) การจัดหาพื้นฐานที่ปรับขนาดได้และพร้อมสำหรับอนาคตสำหรับ 100GbE และสูงกว่า

2. การออกแบบสถาปัตยกรรมเครือข่ายและระบบโดยรวม

สถาปัตยกรรมที่แนะนำใช้โทโพโลยี leaf-spine ประสิทธิภาพสูง โดยมี 100GbE เป็นชั้นการเข้าถึงเซิร์ฟเวอร์ และอัปลิงก์ 400GbE ไปยัง spine หัวใจหลักของการออกแบบนี้คือ MCX556A-ECAT ConnectX adapter PCIe network card ซึ่งติดตั้งอยู่ในโหนดคอมพิวต์และสตอเรจทุกโหนดทั่วทั้งเฟรม สถาปัตยกรรมนี้สร้างขึ้นจากหลักการสำคัญห้าประการ:

  • Lossless Ethernet Fabric: ใช้ประโยชน์จาก RoCE v2 ร่วมกับ PFC (Priority Flow Control) และ ECN (Explicit Congestion Notification) ทั่วทั้งสวิตช์ทั้งหมดเพื่อขจัดแพ็กเก็ตที่สูญหายและรับประกันความหน่วงแฝงที่คาดการณ์ได้สำหรับการรับส่งข้อมูล RDMA
  • Hardware Offload Everywhere: การยกเลิกการประมวลผลเลเยอร์การขนส่ง รวมถึงการยกเลิกเช็คซัมม์ การแบ่งส่วน (LSO/LRO) การติดแท็ก VLAN และ RDMA ไปยังอะแดปเตอร์ เพื่อปลดปล่อยรอบ CPU สำหรับตรรกะของแอปพลิเคชัน
  • Active-Active Redundancy: ใช้พอร์ต QSFP28 ทั้งสองพอร์ตในโหมด link aggregation (LACP) สำหรับแบนด์วิดท์รวม 200Gb/s และการทำงานสำรองอัตโนมัติพร้อมการกู้คืนภายในหนึ่งวินาที
  • Traffic Segmentation: คลาสการรับส่งข้อมูลเฉพาะสำหรับสตอเรจ (NVMe-oF) คอมพิวต์ (MPI/RDMA) และการรับส่งข้อมูลการจัดการ เพื่อรับประกัน QoS ที่คาดการณ์ได้สำหรับเวิร์กโหลดทั้งหมด
  • Scalable Control Plane: การจัดการแบบรวมศูนย์ผ่านสวิตช์ NVIDIA Spectrum พร้อมเทเลเมทรีในตัวและระบบอัตโนมัติผ่าน REST API และ Ansible playbooks

โซลูชันนี้เข้ากันได้กับ MCX556A-ECAT compatible กับแพลตฟอร์มเซิร์ฟเวอร์ชั้นนำ (Dell PowerEdge, HPE ProLiant, Supermicro, Lenovo) และทำงานร่วมกับระบบปฏิบัติการหลัก (Linux, Windows Server, VMware ESXi) ได้อย่างราบรื่น สำหรับสตอเรจ สถาปัตยกรรมรองรับ NVMe-oF over RoCE ทำให้สตอเรจแบบแบ่งส่วนที่ใช้ร่วมกันได้มีความหน่วงแฝงใกล้เคียงกับไดรฟ์ NVMe ในเครื่อง

3. บทบาทและคุณสมบัติหลักของ NVIDIA Mellanox MCX556A-ECAT

ในฐานะส่วนประกอบพื้นฐานของโซลูชันนี้ NVIDIA Mellanox MCX556A-ECAT มีบทบาทสำคัญสามประการภายในสถาปัตยกรรม:

Function Implementation Detail Business Benefit
RDMA/RoCE Engine RoCE v2 ที่ใช้ฮาร์ดแวร์พร้อมรองรับ ECN/PFC, ความหน่วงแฝงต่ำกว่า 0.8 ไมโครวินาที การมีส่วนร่วมของ CPU น้อยมากสำหรับการเคลื่อนย้ายข้อมูล ประสิทธิภาพที่คาดการณ์ได้
Dual-Port 100GbE พอร์ต QSFP28 สองพอร์ตอิสระ, ทรูพุตโดยรวม 200Gb/s การรวมลิงก์แบบ Active-active เพื่อแบนด์วิดท์; Active-standby เพื่อความซ้ำซ้อน
Virtualization & Overlay Offload SR-IOV พร้อม VFs สูงสุด 128 รายการต่อพอร์ต; การยกเลิกฮาร์ดแวร์ VXLAN/NVGRE การแบ่งหลายผู้เช่าที่มีความหนาแน่นสูงพร้อมประสิทธิภาพระดับสายและการแยก

ข้อมูลจำเพาะทางเทคนิคที่ดึงมาจาก MCX556A-ECAT datasheet รวมถึงอินเทอร์เฟซโฮสต์ PCIe 3.0/4.0 x16, ความสามารถในการยกเลิกที่ครอบคลุม (เช็คซัมม์, LSO/LRO, การลบ/แทรก VLAN, RSS) และเทเลเมทรีขั้นสูงต่อพอร์ต ประสิทธิภาพการใช้พลังงานของอะแดปเตอร์ (โดยทั่วไปต่ำกว่า 15W) และการรองรับระบบปฏิบัติการที่หลากหลายทำให้เป็นส่วนประกอบที่หลากหลายสำหรับสภาพแวดล้อมที่แตกต่างกัน MCX556A-ECAT specifications ยังเน้นการรองรับความเข้ากันได้กับ 25GbE และ 40GbE ซึ่งมอบความยืดหยุ่นในการใช้งานสำหรับสภาพแวดล้อมที่มีความเร็วผสมผสานกัน

4. คำแนะนำในการติดตั้งและปรับขนาด

สำหรับการติดตั้งใหม่ เราขอแนะนำโทโพโลยี leaf-spine แบบสองชั้น โดยมีการเข้าถึง 100GbE และอัปลิงก์ spine 400GbE เซิร์ฟเวอร์แต่ละเครื่องมี MCX556A-ECAT Ethernet adapter card หนึ่งเครื่อง โดยมีพอร์ต QSFP28 ทั้งสองเชื่อมต่อกับสวิตช์ leaf แยกกันเพื่อความซ้ำซ้อน เครือข่าย RoCE ต้องการการกำหนดค่า QoS ที่สอดคล้องกันทั่วทั้งสวิตช์ทั้งหมด โดยเฉพาะ PFC บนลำดับความสำคัญ 3 (สำหรับการรับส่งข้อมูล RDMA) และลำดับความสำคัญ 4 (สำหรับสตอเรจ) พร้อมการทำเครื่องหมาย ECN บนคลาสการรับส่งข้อมูลเดียวกัน เราขอแนะนำให้จัดสรร VLAN เฉพาะสำหรับการรับส่งข้อมูล RoCE การจัดการ และสตอเรจ เพื่อให้การตรวจสอบและแก้ไขปัญหาง่ายขึ้น

สำหรับสภาพแวดล้อมที่มีอยู่เดิมซึ่งมีโครงสร้างพื้นฐาน 40GbE อยู่แล้ว MCX556A-ECAT Ethernet adapter card solution นำเสนอเส้นทางการย้ายที่ราบรื่น เนื่องจากอะแดปเตอร์เข้ากันได้แบบย้อนหลังกับออปติก 40GbE QSFP+ สายเคเบิลที่มีอยู่สามารถนำกลับมาใช้ใหม่ได้ในระหว่างการอัปเกรดเป็น 100GbE เป็นระยะๆ อะแดปเตอร์ยังรองรับการสลับ Ethernet มาตรฐานโดยไม่จำเป็นต้องเปิดใช้งาน RoCE ทำให้ทีมสามารถติดตั้งฮาร์ดแวร์ก่อนและเปิดใช้งานความสามารถ RDMA เป็นระยะๆ เมื่อเครือข่ายมีความสมบูรณ์และเวิร์กโหลดมีความจำเป็นต้องเปลี่ยนผ่าน

การปรับขนาดโซลูชันให้เกิน 50 โหนดจะนำมาซึ่งข้อควรพิจารณาเพิ่มเติม เราขอแนะนำให้ใช้กลยุทธ์การจัดการความแออัดของ RoCE โดยเฉพาะ โดยใช้สวิตช์ NVIDIA Spectrum ที่มีเทเลเมทรีในตัวและการปรับค่า ECN แบบไดนามิก สำหรับคลัสเตอร์ที่มีมากกว่า 200 โหนด ให้พิจารณาใช้ตัวควบคุมการจัดการเครือข่ายแบบรวมศูนย์ (เช่น NVIDIA Cumulus NetQ) เพื่อรักษาการมองเห็นแบบ end-to-end และความสอดคล้องของการกำหนดค่าอัตโนมัติ MCX556A-ECAT for sale ผ่านพันธมิตรช่องทางทั่วโลกของ NVIDIA รวมถึงการรับประกันที่ครอบคลุมและการสนับสนุนการอัปเดตเฟิร์มแวร์ เพื่อให้มั่นใจถึงความน่าเชื่อถือในระยะยาวในระดับใหญ่

5. การดำเนินงาน การตรวจสอบ การแก้ไขปัญหา และการปรับปรุงประสิทธิภาพ

การดำเนินงานเครือข่าย RoCE ที่มีประสิทธิภาพต้องใช้กลยุทธ์การตรวจสอบและแก้ไขปัญหาแบบหลายชั้น:

  • Adapter-Level Telemetry: MCX556A-ECAT specifications รวมถึงตัวนับต่อพอร์ตสำหรับเฟรม PFC แพ็กเก็ตที่ทำเครื่องหมาย ECN เฟรมที่สูญหาย และข้อผิดพลาดของลิงก์ ใช้ mlx5cmd, ethtool หรือเครื่องมือเฟิร์มแวร์ของ NVIDIA เพื่อส่งออกเมตริกเหล่านี้ไปยังแดชบอร์ด Prometheus/Grafana
  • Switch-Level Monitoring: ตรวจสอบการใช้บัฟเฟอร์ จำนวนเฟรมหยุดชั่วคราว ความลึกของคิว และอัตราการทำเครื่องหมาย ECN บนสวิตช์ spine และ leaf การเพิ่มขึ้นอย่างกะทันหันของเฟรมหยุดชั่วคราวบ่งชี้ถึงความแออัดระดับไมโครที่อาจต้องมีการปรับค่า ECN
  • Application-Level Metrics: สำหรับแอปพลิเคชัน RDMA ให้ติดตามความหน่วงแฝงในการเสร็จสิ้น WR (Work Request) เหตุการณ์ CQ (Completion Queue) ล้น และจำนวนข้อผิดพลาด QP (Queue Pair) โดยใช้ไลบรารี NVIDIA libibverbs และ rdma-core

สถานการณ์การแก้ไขปัญหาทั่วไปและการดำเนินการที่แนะนำ:

  • ประสิทธิภาพ RoCE ลดลง: ตรวจสอบว่า PFC เปิดใช้งานบนพอร์ตสวิตช์ทั้งหมด และการทำเครื่องหมาย DSCP ตรงกับการกำหนดค่าสวิตช์ ใช้ MCX556A-ECAT datasheet เพื่อตรวจสอบการตั้งค่าการจัดสรรบัฟเฟอร์เทียบกับค่าที่แนะนำสำหรับโปรไฟล์เวิร์กโหลดของคุณ
  • ลิงก์สั่นหรือข้อผิดพลาด CRC: ตรวจสอบคุณภาพสายเคเบิล QSFP28 และตรวจสอบให้แน่ใจว่าเฟิร์มแวร์อะแดปเตอร์ได้รับการอัปเดตเป็นเวอร์ชันล่าสุด ตรวจสอบว่าสายเคเบิลเป็นไปตามข้อกำหนด IEEE 802.3bj สำหรับ 100GBASE-SR4 หรือ LR4
  • CPU ยังคงสูงแม้จะมีการยกเลิกการทำงาน: ยืนยันว่ามีการใช้ RDMA จริง (ไม่กลับไปใช้ TCP) โดยการตรวจสอบตัวนับไดรเวอร์ บันทึกแอปพลิเคชัน และสถานะการเชื่อมต่อ
  • PFC deadlock หรือ pause storm: ตรวจสอบลำดับความสำคัญที่กำหนดค่าผิดพลาด และตรวจสอบให้แน่ใจว่า PFC เปิดใช้งานเฉพาะบนคลาสการรับส่งข้อมูล RoCE (ไม่ใช่บนการรับส่งข้อมูลการจัดการหรือสตอเรจ)

สำหรับการปรับปรุงประสิทธิภาพ เราขอแนะนำพารามิเตอร์การปรับแต่งต่อไปนี้ตามการตรวจสอบในห้องปฏิบัติการอย่างละเอียด:

  • Interrupt coalescing (moderation): ตั้งค่าเป็น 4-8 ไมโครวินาทีสำหรับเวิร์กโหลดผสม (การซื้อขาย + สตอเรจ) เพื่อสร้างสมดุลระหว่างความหน่วงแฝงและประสิทธิภาพของ CPU
  • RDMA MTU: เพิ่มเป็น 4096 ไบต์สำหรับเวิร์กโหลดสตอเรจเพื่อลดโอเวอร์เฮดของโปรโตคอลและปรับปรุงทรูพุต
  • RSS (Receive Side Scaling): กำหนดค่าข้ามแกน CPU หลายแกนสำหรับการรับส่งข้อมูลที่ไม่ใช่ RDMA เพื่อกระจายการประมวลผลและหลีกเลี่ยงการอิ่มตัวของแกนเดียว
  • ECN thresholds: ตั้งค่า min-threshold ที่ 50% ของบัฟเฟอร์ และ max-threshold ที่ 80% สำหรับการรับส่งข้อมูลลำดับความสำคัญ 3 โดยปรับตามรูปแบบความแออัดที่สังเกตได้

6. สรุปและการประเมินมูลค่า

โซลูชัน NVIDIA Mellanox MCX556A-ECAT มอบมูลค่าที่เปลี่ยนแปลงสำหรับศูนย์ข้อมูลสมัยใหม่ ด้วยการแทนที่ TCP/IP ที่ใช้ซอฟต์แวร์ด้วย RDMA/RoCE ที่เร่งด้วยฮาร์ดแวร์ องค์กรต่างๆ สามารถลดความหน่วงแฝงระดับแอปพลิเคชันลงได้ 5-10 เท่า ลดโอเวอร์เฮดเครือข่ายของ CPU ลงกว่า 80% และเพิ่มความหนาแน่นของคอนเทนเนอร์เซิร์ฟเวอร์ได้ 30-50% MCX556A-ECAT Ethernet adapter card นำเสนอเส้นทางที่คุ้มค่าในการนำ 100GbE มาใช้ พร้อมการปกป้องการลงทุนผ่านความเข้ากันได้แบบย้อนหลังกับ 40GbE และความสามารถในการยกเลิกการทำงานที่พร้อมสำหรับอนาคตสำหรับเวิร์กโหลดที่เกิดขึ้นใหม่

เมื่อประเมินต้นทุนรวมในการเป็นเจ้าของ MCX556A-ECAT price จะถูกหักล้างด้วยการประหยัดในการดำเนินงานที่สำคัญ: จำนวนเซิร์ฟเวอร์ที่ลดลง (เนื่องจากการใช้งานที่สูงขึ้น) ต้นทุนการระบายความร้อนที่ต่ำลง (เนื่องจาก<15W power draw), and elimination of separate InfiniBand or proprietary RDMA fabrics. The solution is fully MCX556A-ECAT compatible กับระบบนิเวศโอเพนซอร์สและระดับองค์กรหลัก รวมถึง Kubernetes, Apache Spark, TensorFlow และ VMware vSphere เพื่อให้มั่นใจถึงความสามารถในการใช้งานที่กว้างขวางในองค์กร HPC และการใช้งานแบบคลาวด์เนทีฟ

สำหรับสคริปต์การติดตั้งโดยละเอียด เทมเพลตการกำหนดค่า และรายงานการวัดประสิทธิภาพ โปรดดู MCX556A-ECAT datasheet อย่างเป็นทางการ และพอร์ทัลเอกสารเครือข่ายที่ครอบคลุมของ NVIDIA เอกสารฉบับนี้ทำหน้าที่เป็นพื้นฐาน สถาปัตยกรรมได้รับการตรวจสอบแล้ว ส่วนประกอบพร้อมสำหรับการผลิต และประโยชน์ที่ได้รับสามารถวัดผลได้ MCX556A-ECAT ConnectX adapter PCIe network card ไม่ใช่แค่อะแดปเตอร์เท่านั้น แต่เป็นตัวเปิดใช้งานเชิงกลยุทธ์สำหรับศูนย์ข้อมูลแห่งอนาคตที่พร้อมสำหรับ RDMA และปรับปรุงทรูพุต