NVIDIA Mellanox MCX623106AN-CDAT Server Adapter ในการใช้งานจริง | การขนส่ง RDMA/RoCE ที่มีความหน่วงต่ำและประสิทธิภาพการรับส่งข้อมูลเซิร์ฟเวอร์ที่เพิ่มขึ้น
July 22, 2026
NVIDIA Mellanox MCX623106AN-CDAT Server Adapter ในการทำงาน | RDMA/RoCE การขนส่งที่มีความหน่วงต่ำ & การเพิ่มประสิทธิภาพเซิร์ฟเวอร์
ภูมิหลังและความท้าทาย: เมื่อ 200GbE พบกับกำแพงการปรับขนาด AI
องค์กรวิจัย AI ที่เติบโตอย่างรวดเร็ว — ให้เราเรียกพวกเขาว่า "DeepCore Labs" — กำลังเผชิญกับปัญหาคอขวดที่สำคัญในการปรับขนาด คลัสเตอร์การฝึกโมเดลภาษาขนาดใหญ่ที่เป็นเรือธงของพวกเขา ซึ่งประกอบด้วย NVIDIA H100 GPU จำนวน 512 ตัว กระจายอยู่ทั่ว 128 โหนด กำลังประสบปัญหาประสิทธิภาพที่ลดลงอย่างรุนแรงเมื่อพวกเขาปรับขนาดเกิน 64 โหนด ปัญหาไม่ใช่การประมวลผลหรือหน่วยความจำ แต่เป็นเครือข่าย การซิงโครไนซ์ All-reduce ของเกรเดียนต์ใช้เวลามากกว่า 15 วินาทีต่อรอบ และการใช้งาน GPU ลดลงเหลือเพียง 62% เนื่องจากการหยุดชะงักของเครือข่าย โครงสร้างพื้นฐาน 100GbE ที่มีอยู่ของพวกเขา ซึ่งอาศัย TCP/IP ที่ทำงานบนซอฟต์แวร์ ไม่สามารถรองรับรูปแบบการสื่อสารที่กระจัดกระจายและไวต่อความหน่วงของการฝึกแบบกระจายได้ ทีมงานต้องการโซลูชันที่สามารถส่งมอบปริมาณงาน 200GbE ที่ความเร็วสายสัญญาณพร้อมความหน่วงที่กำหนดได้ในระดับไมโครวินาที
การประเมินของพวกเขาทำให้พวกเขาพบกับ NVIDIA Mellanox MCX623106AN-CDAT — อะแดปเตอร์เซิร์ฟเวอร์ 200GbE ที่ออกแบบมาสำหรับเวิร์กโหลด AI และ HPC ที่ต้องการมากที่สุด ทีมวิจัยตระหนักดีว่า การ์ดเครือข่าย PCIe อะแดปเตอร์ MCX623106AN-CDAT ConnectX นำเสนอการยกภาระขั้นสูงและความสามารถของ GPUDirect ที่จำเป็นในการกำจัดคอขวดของเครือข่ายและเพิ่มการใช้งาน GPU ให้สูงสุด
โซลูชัน: การติดตั้งอะแดปเตอร์ Ethernet MCX623106AN-CDAT
DeepCore Labs ได้ติดตั้ง การ์ดอะแดปเตอร์ Ethernet MCX623106AN-CDAT ทั่วทั้ง 128 โหนดการฝึกอบรม โดยแต่ละเซิร์ฟเวอร์ติดตั้งอะแดปเตอร์ QSFP112 แบบพอร์ตคู่หนึ่งตัวที่เชื่อมต่อกับโครงสร้างแบบ leaf-spine ที่สร้างขึ้นบนสวิตช์ NVIDIA Spectrum-4 การติดตั้งใช้ประโยชน์จากการรองรับ RoCE v2 ดั้งเดิมของอะแดปเตอร์เพื่อเปิดใช้งานการขนส่ง Ethernet แบบไม่สูญเสีย ซึ่งช่วยลดความจำเป็นในการใช้โครงสร้าง InfiniBand แยกต่างหาก สิ่งสำคัญของโซลูชันคือความสามารถ GPUDirect RDMA ของอะแดปเตอร์ ซึ่งช่วยให้การเคลื่อนย้ายข้อมูลโดยตรงระหว่าง GPU ทั่วทั้งเครือข่ายโดยไม่ต้องมีการแทรกแซงของ CPU — คุณสมบัติที่สำคัญสำหรับการลดภาระการซิงโครไนซ์
ทีมงานได้กำหนดค่า PFC (Priority Flow Control) และ ECN (Explicit Congestion Notification) ที่ระดับสวิตช์ โดยจัดลำดับความสำคัญ 3 สำหรับการรับส่งข้อมูลการสื่อสารแบบรวม และลำดับความสำคัญ 4 สำหรับ I/O การจัดเก็บข้อมูล พวกเขายังได้นำเทคโนโลยีการกำหนดเส้นทางแบบปรับได้ของ NVIDIA มาใช้เพื่อกระจายการรับส่งข้อมูลแบบไดนามิกผ่านหลายเส้นทาง ลดจุดร้อน ภายในสี่สัปดาห์ โครงสร้างการฝึกอบรมทั้งหมดทำงานบน RDMA โดย GPU ทั้งหมด 512 ตัวสื่อสารกันได้อย่างราบรื่นผ่าน RoCE ระบบนิเวศที่ เข้ากันได้กับ MCX623106AN-CDAT พิสูจน์แล้วว่ามีความแข็งแกร่ง — การ์ดทำงานร่วมกับเซิร์ฟเวอร์ที่ใช้ H100 และ NCCL (NVIDIA Collective Communications Library) ของ NVIDIA ได้อย่างสมบูรณ์แบบโดยไม่ต้องมีการปรับเปลี่ยนใดๆ
ทีมงานได้อ้างอิงถึง เอกสารข้อมูล MCX623106AN-CDAT เพื่อปรับการจัดสรรบัฟเฟอร์และพารามิเตอร์การควบคุมความแออัดให้เหมาะสม บรรลุประสิทธิภาพสูงสุดสำหรับสภาพแวดล้อมเวิร์กโหลดแบบผสมผสานของพวกเขา — ซึ่งรวมถึงทั้งการฝึกอบรมแบบซิงโครนัส (เน้น all-reduce) และการตรวจสอบสถานะแบบอะซิงโครนัส
ผลลัพธ์ที่วัดได้: ประสิทธิภาพการปรับขนาด ปริมาณงาน และการใช้งาน GPU
การเพิ่มประสิทธิภาพนั้นเปลี่ยนแปลงไปอย่างมาก ด้วย RDMA ผ่าน RoCE ที่เปิดใช้งานผ่าน NVIDIA Mellanox MCX623106AN-CDAT ความหน่วงในการซิงโครไนซ์ all-reduce ลดลงจากค่าเฉลี่ย 15.2 วินาที เหลือเพียง 1.8 วินาทีต่อรอบ — เพิ่มขึ้น 8.4 เท่า สิ่งนี้แปลโดยตรงเป็นการบรรจบกันของโมเดลที่เร็วขึ้น: เวลาฝึกอบรมทั้งหมดสำหรับโมเดลพารามิเตอร์ 70B ของพวกเขา ลดลงจาก 42 วัน เหลือ 19 วัน เร่งวงจรการวิจัยของพวกเขามากกว่า 50%
การใช้งาน GPU ซึ่งเคยอยู่ที่ 62% เนื่องจากการหยุดชะงักของเครือข่าย พุ่งสูงขึ้นเป็น 94% หลังจากการอัปเกรด — เพิ่มขึ้น 52% ในความสามารถในการประมวลผลที่มีประสิทธิภาพ การจัดวางข้อมูลนอกลำดับขั้นสูงของอะแดปเตอร์และการจัดจังหวะแพ็กเก็ตช่วยขจัด micro-bursts ที่เคยทำให้เกิดความหน่วงหางที่สูงขึ้น ทำให้มั่นใจได้ถึงประสิทธิภาพที่สม่ำเสมอทั่วทั้งโหนดทั้งหมด
นอกเหนือจากประสิทธิภาพการฝึกอบรมแล้ว การเพิ่มปริมาณงานของเซิร์ฟเวอร์ก็มีความน่าสนใจไม่แพ้กัน เครื่องมือยกภาระฮาร์ดแวร์ — รวมถึงการยกภาระเช็คซัม, LSO/LRO, และการเร่งความเร็ว RoCE — ลดการใช้งาน CPU สำหรับการประมวลผลเครือข่ายจาก 38% เหลือต่ำกว่า 4% ทั่วทั้งโหนด สิ่งนี้ได้ปลดปล่อยความสามารถของ CPU จำนวนมากสำหรับการประมวลผลข้อมูลล่วงหน้า การบีบอัดการตรวจสอบสถานะ และงานเสริมอื่นๆ ที่เคยถูกจำกัด
| ตัวชี้วัด | ก่อน (NIC 100GbE เดิม) | หลัง (MCX623106AN-CDAT) | การปรับปรุง |
|---|---|---|---|
| ความหน่วง All-Reduce (ต่อรอบ) | 15.2 วินาที | 1.8 วินาที | เร็วขึ้น 8.4 เท่า |
| การใช้งาน GPU | 62% | 94% | สูงขึ้น 52% |
| เวลาฝึกอบรมโมเดล (70B พารามิเตอร์) | 42 วัน | 19 วัน | เร็วขึ้น 55% |
| ภาระงานเครือข่าย CPU | 38% | ต่ำกว่า 4% | ลดลง 89% |
| ความหน่วงในการอ่าน NVMe-oF (ที่เก็บข้อมูล) | 185 ไมโครวินาที | 12 ไมโครวินาที | เร็วขึ้น 15 เท่า |
ประโยชน์ในการดำเนินงาน: TCO และประสิทธิภาพโครงสร้างพื้นฐาน
แม้ว่าประสิทธิภาพจะเพิ่มขึ้นอย่างมาก แต่ประโยชน์ในการดำเนินงานและการเงินก็มีความสำคัญไม่แพ้กัน โซลูชันการ์ดอะแดปเตอร์ Ethernet MCX623106AN-CDAT ลดต้นทุนรวมในการเป็นเจ้าของโดยการกำจัดความจำเป็นในการใช้โครงสร้าง InfiniBand แยกต่างหาก — ประหยัดค่าใช้จ่ายโครงสร้างสวิตช์มากกว่า 500,000 ดอลลาร์ การออกแบบที่ประหยัดพลังงานของอะแดปเตอร์ (ต่ำกว่า 20W ต่อการ์ด) มีส่วนช่วยในการประหยัดพลังงานที่วัดได้ทั่วทั้งคลัสเตอร์ 128 โหนด ลดค่าใช้จ่ายในการทำความเย็นต่อปีโดยประมาณ 18%
สำหรับผู้จัดการฝ่าย IT ที่ประเมิน ราคา MCX623106AN-CDAT เทียบกับโซลูชันทางเลือก ผู้อำนวยการฝ่ายโครงสร้างพื้นฐานของ DeepCore กล่าวว่าระยะเวลาคืนทุนน้อยกว่าหกเดือน — ขับเคลื่อนหลักโดยการลดเวลาฝึกอบรม ซึ่งเร่งวงจรการพัฒนาผลิตภัณฑ์ของพวกเขาโดยตรง ทีมงานยังให้ความสำคัญกับการเตรียมพร้อมสำหรับอนาคตของอะแดปเตอร์: MCX623106AN-CDAT สำหรับขาย ในปัจจุบันรองรับ 200GbE แต่ยังเข้ากันได้กับออปติก 100GbE และ 50GbE ให้ความยืดหยุ่นสำหรับสภาพแวดล้อมความเร็วผสมและอัปเกรดแบบค่อยเป็นค่อยไป
ตาม ข้อมูลจำเพาะ MCX623106AN-CDAT อะแดปเตอร์ประกอบด้วยคุณสมบัติการวัดปริมาณที่ครอบคลุม รวมถึงการวัดปริมาณเครือข่ายในแถบ (INT) และการติดตามความหน่วงต่อโฟลว์ DeepCore ได้รวมเมตริกเหล่านี้เข้ากับสแต็ก Prometheus/Grafana ของพวกเขา ทำให้สามารถตรวจจับ micro-congestion ได้เชิงรุกก่อนที่จะส่งผลกระทบต่อประสิทธิภาพการฝึกอบรม ทีมงานยังได้ใช้ประโยชน์จากอัลกอริทึมการควบคุมความแออัดของอะแดปเตอร์เพื่อปรับเกณฑ์ ECN แบบไดนามิก รักษาพฤติกรรมแบบไม่สูญเสียแม้ในระหว่างการดำเนินการตรวจสอบสถานะที่สร้างภาระเครือข่ายเพิ่มเติม
สรุปและแนวโน้ม: แผนผังสำหรับเครือข่ายระดับ AI
การเดินทางของ DeepCore Labs กับ NVIDIA Mellanox MCX623106AN-CDAT แสดงให้เห็นถึงแผนผังที่ชัดเจนสำหรับองค์กรที่สร้างหรือปรับขนาดโครงสร้างพื้นฐาน AI ด้วยการรวมปริมาณงาน 200GbE แบบพอร์ตคู่, อินเทอร์เฟซโฮสต์ PCIe 5.0, และ RDMA ที่เปิดใช้งาน GPUDirect, การ์ดอะแดปเตอร์ Ethernet MCX623106AN-CDAT เปลี่ยนเครือข่ายจากคอขวดในการปรับขนาดให้เป็นตัวคูณประสิทธิภาพ ผลลัพธ์ — all-reduce เร็วขึ้น 8.4 เท่า, การใช้งาน GPU 94%, และวงจรการฝึกอบรมเร็วขึ้น 55% — แสดงให้เห็นถึงความสามารถของอะแดปเตอร์ในการส่งมอบผลลัพธ์ทางธุรกิจที่จับต้องได้ในสภาพแวดล้อมการประมวลผลที่ต้องการมากที่สุด
เมื่อมองไปข้างหน้า ในขณะที่ขนาดโมเดลยังคงเพิ่มขึ้นเป็นสองเท่าทุกๆ สองสามเดือน และคลัสเตอร์การฝึกอบรมแบบกระจายขยายไปถึง GPU หลายพันตัว, การ์ดเครือข่าย PCIe อะแดปเตอร์ MCX623106AN-CDAT ConnectX เป็นรากฐานที่มั่นคงสำหรับโครงสร้างแบบไม่สูญเสียและมีความหน่วงต่ำเป็นพิเศษ สำหรับสถาปนิกและผู้นำฝ่าย IT ที่วางแผนการลงทุนโครงสร้างพื้นฐาน AI ครั้งต่อไป อะแดปเตอร์นี้ไม่เพียงแต่เป็นส่วนประกอบ แต่ยังเป็นตัวขับเคลื่อนเชิงกลยุทธ์สำหรับการสร้างความแตกต่างในการแข่งขัน พารามิเตอร์การปรับแต่งโดยละเอียด, สคริปต์การติดตั้ง, และรายงานการวัดประสิทธิภาพมีอยู่ใน เอกสารข้อมูล MCX623106AN-CDAT อย่างเป็นทางการ — เป็นแหล่งอ้างอิงที่จำเป็นสำหรับการปรับใช้ AI ขนาดใหญ่ใดๆ

