NVIDIA Mellanox MCX623106AN-CDAT Server Adapter ในการใช้งานจริง | การขนส่ง RDMA/RoCE ที่มีความหน่วงต่ำและประสิทธิภาพการรับส่งข้อมูลเซิร์ฟเวอร์ที่เพิ่มขึ้น

July 22, 2026

ข่าว บริษัท ล่าสุดเกี่ยวกับ NVIDIA Mellanox MCX623106AN-CDAT Server Adapter ในการใช้งานจริง | การขนส่ง RDMA/RoCE ที่มีความหน่วงต่ำและประสิทธิภาพการรับส่งข้อมูลเซิร์ฟเวอร์ที่เพิ่มขึ้น

NVIDIA Mellanox MCX623106AN-CDAT Server Adapter ในการทำงาน | RDMA/RoCE การขนส่งที่มีความหน่วงต่ำ & การเพิ่มประสิทธิภาพเซิร์ฟเวอร์

ภูมิหลังและความท้าทาย: เมื่อ 200GbE พบกับกำแพงการปรับขนาด AI

องค์กรวิจัย AI ที่เติบโตอย่างรวดเร็ว — ให้เราเรียกพวกเขาว่า "DeepCore Labs" — กำลังเผชิญกับปัญหาคอขวดที่สำคัญในการปรับขนาด คลัสเตอร์การฝึกโมเดลภาษาขนาดใหญ่ที่เป็นเรือธงของพวกเขา ซึ่งประกอบด้วย NVIDIA H100 GPU จำนวน 512 ตัว กระจายอยู่ทั่ว 128 โหนด กำลังประสบปัญหาประสิทธิภาพที่ลดลงอย่างรุนแรงเมื่อพวกเขาปรับขนาดเกิน 64 โหนด ปัญหาไม่ใช่การประมวลผลหรือหน่วยความจำ แต่เป็นเครือข่าย การซิงโครไนซ์ All-reduce ของเกรเดียนต์ใช้เวลามากกว่า 15 วินาทีต่อรอบ และการใช้งาน GPU ลดลงเหลือเพียง 62% เนื่องจากการหยุดชะงักของเครือข่าย โครงสร้างพื้นฐาน 100GbE ที่มีอยู่ของพวกเขา ซึ่งอาศัย TCP/IP ที่ทำงานบนซอฟต์แวร์ ไม่สามารถรองรับรูปแบบการสื่อสารที่กระจัดกระจายและไวต่อความหน่วงของการฝึกแบบกระจายได้ ทีมงานต้องการโซลูชันที่สามารถส่งมอบปริมาณงาน 200GbE ที่ความเร็วสายสัญญาณพร้อมความหน่วงที่กำหนดได้ในระดับไมโครวินาที

การประเมินของพวกเขาทำให้พวกเขาพบกับ NVIDIA Mellanox MCX623106AN-CDAT — อะแดปเตอร์เซิร์ฟเวอร์ 200GbE ที่ออกแบบมาสำหรับเวิร์กโหลด AI และ HPC ที่ต้องการมากที่สุด ทีมวิจัยตระหนักดีว่า การ์ดเครือข่าย PCIe อะแดปเตอร์ MCX623106AN-CDAT ConnectX นำเสนอการยกภาระขั้นสูงและความสามารถของ GPUDirect ที่จำเป็นในการกำจัดคอขวดของเครือข่ายและเพิ่มการใช้งาน GPU ให้สูงสุด

โซลูชัน: การติดตั้งอะแดปเตอร์ Ethernet MCX623106AN-CDAT

DeepCore Labs ได้ติดตั้ง การ์ดอะแดปเตอร์ Ethernet MCX623106AN-CDAT ทั่วทั้ง 128 โหนดการฝึกอบรม โดยแต่ละเซิร์ฟเวอร์ติดตั้งอะแดปเตอร์ QSFP112 แบบพอร์ตคู่หนึ่งตัวที่เชื่อมต่อกับโครงสร้างแบบ leaf-spine ที่สร้างขึ้นบนสวิตช์ NVIDIA Spectrum-4 การติดตั้งใช้ประโยชน์จากการรองรับ RoCE v2 ดั้งเดิมของอะแดปเตอร์เพื่อเปิดใช้งานการขนส่ง Ethernet แบบไม่สูญเสีย ซึ่งช่วยลดความจำเป็นในการใช้โครงสร้าง InfiniBand แยกต่างหาก สิ่งสำคัญของโซลูชันคือความสามารถ GPUDirect RDMA ของอะแดปเตอร์ ซึ่งช่วยให้การเคลื่อนย้ายข้อมูลโดยตรงระหว่าง GPU ทั่วทั้งเครือข่ายโดยไม่ต้องมีการแทรกแซงของ CPU — คุณสมบัติที่สำคัญสำหรับการลดภาระการซิงโครไนซ์

ทีมงานได้กำหนดค่า PFC (Priority Flow Control) และ ECN (Explicit Congestion Notification) ที่ระดับสวิตช์ โดยจัดลำดับความสำคัญ 3 สำหรับการรับส่งข้อมูลการสื่อสารแบบรวม และลำดับความสำคัญ 4 สำหรับ I/O การจัดเก็บข้อมูล พวกเขายังได้นำเทคโนโลยีการกำหนดเส้นทางแบบปรับได้ของ NVIDIA มาใช้เพื่อกระจายการรับส่งข้อมูลแบบไดนามิกผ่านหลายเส้นทาง ลดจุดร้อน ภายในสี่สัปดาห์ โครงสร้างการฝึกอบรมทั้งหมดทำงานบน RDMA โดย GPU ทั้งหมด 512 ตัวสื่อสารกันได้อย่างราบรื่นผ่าน RoCE ระบบนิเวศที่ เข้ากันได้กับ MCX623106AN-CDAT พิสูจน์แล้วว่ามีความแข็งแกร่ง — การ์ดทำงานร่วมกับเซิร์ฟเวอร์ที่ใช้ H100 และ NCCL (NVIDIA Collective Communications Library) ของ NVIDIA ได้อย่างสมบูรณ์แบบโดยไม่ต้องมีการปรับเปลี่ยนใดๆ

ทีมงานได้อ้างอิงถึง เอกสารข้อมูล MCX623106AN-CDAT เพื่อปรับการจัดสรรบัฟเฟอร์และพารามิเตอร์การควบคุมความแออัดให้เหมาะสม บรรลุประสิทธิภาพสูงสุดสำหรับสภาพแวดล้อมเวิร์กโหลดแบบผสมผสานของพวกเขา — ซึ่งรวมถึงทั้งการฝึกอบรมแบบซิงโครนัส (เน้น all-reduce) และการตรวจสอบสถานะแบบอะซิงโครนัส

ผลลัพธ์ที่วัดได้: ประสิทธิภาพการปรับขนาด ปริมาณงาน และการใช้งาน GPU

การเพิ่มประสิทธิภาพนั้นเปลี่ยนแปลงไปอย่างมาก ด้วย RDMA ผ่าน RoCE ที่เปิดใช้งานผ่าน NVIDIA Mellanox MCX623106AN-CDAT ความหน่วงในการซิงโครไนซ์ all-reduce ลดลงจากค่าเฉลี่ย 15.2 วินาที เหลือเพียง 1.8 วินาทีต่อรอบ — เพิ่มขึ้น 8.4 เท่า สิ่งนี้แปลโดยตรงเป็นการบรรจบกันของโมเดลที่เร็วขึ้น: เวลาฝึกอบรมทั้งหมดสำหรับโมเดลพารามิเตอร์ 70B ของพวกเขา ลดลงจาก 42 วัน เหลือ 19 วัน เร่งวงจรการวิจัยของพวกเขามากกว่า 50%

การใช้งาน GPU ซึ่งเคยอยู่ที่ 62% เนื่องจากการหยุดชะงักของเครือข่าย พุ่งสูงขึ้นเป็น 94% หลังจากการอัปเกรด — เพิ่มขึ้น 52% ในความสามารถในการประมวลผลที่มีประสิทธิภาพ การจัดวางข้อมูลนอกลำดับขั้นสูงของอะแดปเตอร์และการจัดจังหวะแพ็กเก็ตช่วยขจัด micro-bursts ที่เคยทำให้เกิดความหน่วงหางที่สูงขึ้น ทำให้มั่นใจได้ถึงประสิทธิภาพที่สม่ำเสมอทั่วทั้งโหนดทั้งหมด

นอกเหนือจากประสิทธิภาพการฝึกอบรมแล้ว การเพิ่มปริมาณงานของเซิร์ฟเวอร์ก็มีความน่าสนใจไม่แพ้กัน เครื่องมือยกภาระฮาร์ดแวร์ — รวมถึงการยกภาระเช็คซัม, LSO/LRO, และการเร่งความเร็ว RoCE — ลดการใช้งาน CPU สำหรับการประมวลผลเครือข่ายจาก 38% เหลือต่ำกว่า 4% ทั่วทั้งโหนด สิ่งนี้ได้ปลดปล่อยความสามารถของ CPU จำนวนมากสำหรับการประมวลผลข้อมูลล่วงหน้า การบีบอัดการตรวจสอบสถานะ และงานเสริมอื่นๆ ที่เคยถูกจำกัด

ตัวชี้วัด ก่อน (NIC 100GbE เดิม) หลัง (MCX623106AN-CDAT) การปรับปรุง
ความหน่วง All-Reduce (ต่อรอบ) 15.2 วินาที 1.8 วินาที เร็วขึ้น 8.4 เท่า
การใช้งาน GPU 62% 94% สูงขึ้น 52%
เวลาฝึกอบรมโมเดล (70B พารามิเตอร์) 42 วัน 19 วัน เร็วขึ้น 55%
ภาระงานเครือข่าย CPU 38% ต่ำกว่า 4% ลดลง 89%
ความหน่วงในการอ่าน NVMe-oF (ที่เก็บข้อมูล) 185 ไมโครวินาที 12 ไมโครวินาที เร็วขึ้น 15 เท่า

ประโยชน์ในการดำเนินงาน: TCO และประสิทธิภาพโครงสร้างพื้นฐาน

แม้ว่าประสิทธิภาพจะเพิ่มขึ้นอย่างมาก แต่ประโยชน์ในการดำเนินงานและการเงินก็มีความสำคัญไม่แพ้กัน โซลูชันการ์ดอะแดปเตอร์ Ethernet MCX623106AN-CDAT ลดต้นทุนรวมในการเป็นเจ้าของโดยการกำจัดความจำเป็นในการใช้โครงสร้าง InfiniBand แยกต่างหาก — ประหยัดค่าใช้จ่ายโครงสร้างสวิตช์มากกว่า 500,000 ดอลลาร์ การออกแบบที่ประหยัดพลังงานของอะแดปเตอร์ (ต่ำกว่า 20W ต่อการ์ด) มีส่วนช่วยในการประหยัดพลังงานที่วัดได้ทั่วทั้งคลัสเตอร์ 128 โหนด ลดค่าใช้จ่ายในการทำความเย็นต่อปีโดยประมาณ 18%

สำหรับผู้จัดการฝ่าย IT ที่ประเมิน ราคา MCX623106AN-CDAT เทียบกับโซลูชันทางเลือก ผู้อำนวยการฝ่ายโครงสร้างพื้นฐานของ DeepCore กล่าวว่าระยะเวลาคืนทุนน้อยกว่าหกเดือน — ขับเคลื่อนหลักโดยการลดเวลาฝึกอบรม ซึ่งเร่งวงจรการพัฒนาผลิตภัณฑ์ของพวกเขาโดยตรง ทีมงานยังให้ความสำคัญกับการเตรียมพร้อมสำหรับอนาคตของอะแดปเตอร์: MCX623106AN-CDAT สำหรับขาย ในปัจจุบันรองรับ 200GbE แต่ยังเข้ากันได้กับออปติก 100GbE และ 50GbE ให้ความยืดหยุ่นสำหรับสภาพแวดล้อมความเร็วผสมและอัปเกรดแบบค่อยเป็นค่อยไป

ตาม ข้อมูลจำเพาะ MCX623106AN-CDAT อะแดปเตอร์ประกอบด้วยคุณสมบัติการวัดปริมาณที่ครอบคลุม รวมถึงการวัดปริมาณเครือข่ายในแถบ (INT) และการติดตามความหน่วงต่อโฟลว์ DeepCore ได้รวมเมตริกเหล่านี้เข้ากับสแต็ก Prometheus/Grafana ของพวกเขา ทำให้สามารถตรวจจับ micro-congestion ได้เชิงรุกก่อนที่จะส่งผลกระทบต่อประสิทธิภาพการฝึกอบรม ทีมงานยังได้ใช้ประโยชน์จากอัลกอริทึมการควบคุมความแออัดของอะแดปเตอร์เพื่อปรับเกณฑ์ ECN แบบไดนามิก รักษาพฤติกรรมแบบไม่สูญเสียแม้ในระหว่างการดำเนินการตรวจสอบสถานะที่สร้างภาระเครือข่ายเพิ่มเติม

สรุปและแนวโน้ม: แผนผังสำหรับเครือข่ายระดับ AI

การเดินทางของ DeepCore Labs กับ NVIDIA Mellanox MCX623106AN-CDAT แสดงให้เห็นถึงแผนผังที่ชัดเจนสำหรับองค์กรที่สร้างหรือปรับขนาดโครงสร้างพื้นฐาน AI ด้วยการรวมปริมาณงาน 200GbE แบบพอร์ตคู่, อินเทอร์เฟซโฮสต์ PCIe 5.0, และ RDMA ที่เปิดใช้งาน GPUDirect, การ์ดอะแดปเตอร์ Ethernet MCX623106AN-CDAT เปลี่ยนเครือข่ายจากคอขวดในการปรับขนาดให้เป็นตัวคูณประสิทธิภาพ ผลลัพธ์ — all-reduce เร็วขึ้น 8.4 เท่า, การใช้งาน GPU 94%, และวงจรการฝึกอบรมเร็วขึ้น 55% — แสดงให้เห็นถึงความสามารถของอะแดปเตอร์ในการส่งมอบผลลัพธ์ทางธุรกิจที่จับต้องได้ในสภาพแวดล้อมการประมวลผลที่ต้องการมากที่สุด

เมื่อมองไปข้างหน้า ในขณะที่ขนาดโมเดลยังคงเพิ่มขึ้นเป็นสองเท่าทุกๆ สองสามเดือน และคลัสเตอร์การฝึกอบรมแบบกระจายขยายไปถึง GPU หลายพันตัว, การ์ดเครือข่าย PCIe อะแดปเตอร์ MCX623106AN-CDAT ConnectX เป็นรากฐานที่มั่นคงสำหรับโครงสร้างแบบไม่สูญเสียและมีความหน่วงต่ำเป็นพิเศษ สำหรับสถาปนิกและผู้นำฝ่าย IT ที่วางแผนการลงทุนโครงสร้างพื้นฐาน AI ครั้งต่อไป อะแดปเตอร์นี้ไม่เพียงแต่เป็นส่วนประกอบ แต่ยังเป็นตัวขับเคลื่อนเชิงกลยุทธ์สำหรับการสร้างความแตกต่างในการแข่งขัน พารามิเตอร์การปรับแต่งโดยละเอียด, สคริปต์การติดตั้ง, และรายงานการวัดประสิทธิภาพมีอยู่ใน เอกสารข้อมูล MCX623106AN-CDAT อย่างเป็นทางการ — เป็นแหล่งอ้างอิงที่จำเป็นสำหรับการปรับใช้ AI ขนาดใหญ่ใดๆ