NVIDIA Mellanox MCX653106A-HDAT ในการทำงาน: การขนส่ง RDMA/RoCE ที่มีความหน่วงต่ำและการเพิ่มประสิทธิภาพปริมาณงานของเซิร์ฟเวอร์

July 30, 2026

ข่าว บริษัท ล่าสุดเกี่ยวกับ NVIDIA Mellanox MCX653106A-HDAT ในการทำงาน: การขนส่ง RDMA/RoCE ที่มีความหน่วงต่ำและการเพิ่มประสิทธิภาพปริมาณงานของเซิร์ฟเวอร์
NVIDIA Mellanox MCX653106A-HDAT ในการทำงาน: การขนส่ง RDMA/RoCE ที่มีความหน่วงต่ำและการเพิ่มประสิทธิภาพปริมาณงานของเซิร์ฟเวอร์
ภูมิหลังและความท้าทาย: คอขวดของเครือข่ายผู้ให้บริการคลาวด์ Hyperscale

ผู้ให้บริการคลาวด์ Hyperscale รายใหญ่ที่ดำเนินการคลัสเตอร์ 256 โหนดสำหรับการฝึกอบรม AI แบบกระจายและการวิเคราะห์แบบเรียลไทม์ เริ่มประสบปัญหาประสิทธิภาพเครือข่ายที่เสื่อมถอยลงอย่างรุนแรงเมื่อโครงสร้างพื้นฐานของพวกเขาขยายตัว เครือข่าย TCP/IP ที่มีอยู่ 25GbE แสดงความหน่วง All-Reduce เกิน 6 มิลลิวินาทีใน 128 โหนด ในขณะที่การใช้ CPU สำหรับการประมวลผลเครือข่ายใช้พลังการประมวลผลของเซิร์ฟเวอร์แต่ละเครื่องมากกว่า 40% คอขวดนี้จำกัดการใช้ GPU เพียง 55% ทำให้รอบการฝึกอบรมยาวนานขึ้นอย่างมากและลดความสามารถในการสร้างรายได้ ทีมงานต้องการโซลูชันที่สามารถส่งมอบทั้งความหน่วงระดับไมโครวินาทีและแบนด์วิดท์มหาศาล พร้อมทั้งให้ความสามารถในการตั้งโปรแกรมที่จำเป็นสำหรับการเพิ่มประสิทธิภาพการรับส่งข้อมูลเฉพาะสำหรับปริมาณงาน

โซลูชันและการปรับใช้: การเปลี่ยนแปลงเครือข่ายด้วย MCX653106A-HDAT

หลังจากการประเมินทางเทคนิคอย่างครอบคลุม ผู้ให้บริการได้เลือกNVIDIA Mellanox MCX653106A-HDAT เป็นหัวใจสำคัญของการเปลี่ยนแปลงเครือข่ายของพวกเขา เซิร์ฟเวอร์แต่ละโหนดได้รับการติดตั้งการ์ดเครือข่าย PCIe MCX653106A-HDAT ConnectX ซึ่งกำหนดค่าด้วยการเชื่อมต่อ 100GbE แบบพอร์ตคู่เพื่อส่งมอบแบนด์วิดท์รวม 200 Gb/s ต่อโหนด

  • ระยะที่ 1 — การทดลอง (8 โหนด): ทีมงานได้ติดตั้งการ์ดอะแดปเตอร์ Ethernet MCX653106A-HDAT บนกลุ่มเซิร์ฟเวอร์ GPU โดยกำหนดค่า RoCEv2 ด้วย PFC และ ECN เพื่อสร้างเครือข่าย Ethernet ที่ไม่สูญเสียข้อมูล อะแดปเตอร์ถูกจับคู่กับสวิตช์ NVIDIA Spectrum-4 เพื่อการจัดการความแออัดแบบ end-to-end
  • ระยะที่ 2 — การตรวจสอบและปรับแต่ง: โดยใช้ข้อมูล telemetry ที่บันทึกไว้ในเอกสารข้อมูล MCX653106A-HDAT ทีมงานได้ตรวจสอบการกำหนดค่า ปรับพารามิเตอร์ DCB ให้เหมาะสม และปรับการตั้งค่าการสื่อสารแบบรวม NCCL ให้เหมาะสม คุณสมบัติความสามารถในการตั้งโปรแกรมขั้นสูงของอะแดปเตอร์ช่วยให้สามารถกำหนดเส้นทางการรับส่งข้อมูลแบบกำหนดเองสำหรับรูปแบบ all-reduce เฉพาะของปริมาณงาน
  • ระยะที่ 3 — การเปิดตัวการผลิตเต็มรูปแบบ (256 โหนด): หลังจากการตรวจสอบที่ประสบความสำเร็จ คลัสเตอร์ทั้งหมดได้รับการย้ายไปยังอะแดปเตอร์ใหม่ ความเข้ากันได้ของMCX653106A-HDAT ของโซลูชันทำให้มั่นใจได้ถึงการรวมเข้ากับเซิร์ฟเวอร์และ Linux distributions ที่มีอยู่ได้อย่างราบรื่น
  • ระยะที่ 4 — การเพิ่มประสิทธิภาพอย่างต่อเนื่อง: ทีมงานได้ใช้ telemetry แบบอินไลน์และ data-path ที่ตั้งโปรแกรมได้ของอะแดปเตอร์เพื่อใช้ policy การกำหนดเส้นทางที่รับรู้ปริมาณงาน เพื่อเพิ่มประสิทธิภาพการทำงานสำหรับงานฝึกอบรม AI ให้ดียิ่งขึ้น

ทีมงานตั้งข้อสังเกตว่าโซลูชันการ์ดอะแดปเตอร์ Ethernet MCX653106A-HDAT ให้เส้นทางการย้ายที่ตรงไปตรงมา เนื่องจากพอร์ต QSFP56 รองรับทั้ง optics 100GbE และ 25GbE ทำให้สามารถเปลี่ยนผ่านได้อย่างราบรื่นโดยไม่กระทบต่อการเชื่อมต่อที่มีอยู่

ผลลัพธ์และประโยชน์: การเปลี่ยนแปลงที่วัดผลได้ในด้านประสิทธิภาพและประสิทธิผล
ตัวชี้วัด ก่อนอัปเกรด (25GbE TCP/IP) หลังอัปเกรด (MCX653106A-HDAT พร้อม RoCE) การปรับปรุง
ความหน่วง All-Reduce (256 โหนด) 6.8 ms 0.22 ms ลดลง 30.9*
การใช้ CPU เครือข่าย (ต่อโหนด) 43% 5% 38 pp ได้คืน
การใช้ GPU (ระยะการฝึกอบรม) 55% 93% เพิ่มขึ้น +38%
ปริมาณงานการฝึกอบรมคลัสเตอร์ 2.1x พื้นฐาน 6.4x พื้นฐาน เพิ่มขึ้น 3.0*

นอกเหนือจากผลเชิงปริมาณเหล่านี้ ผู้ให้บริการยังสังเกตเห็นประโยชน์ในการดำเนินงานที่สำคัญ การฝึกอบรมที่เคยต้องใช้เวลา 14 วันเสร็จสิ้นในเวลาเพียง 4.5 วัน ทำให้เวลาออกสู่ตลาดสำหรับบริการ AI ใหม่เร็วขึ้นอย่างมาก data-path ที่ตั้งโปรแกรมได้ของอะแดปเตอร์ช่วยให้สามารถจัดรูปแบบการรับส่งข้อมูลแบบกำหนดเองสำหรับโฟลว์ที่มีลำดับความสำคัญสูง ทำให้มั่นใจได้ว่าการรับส่งข้อมูลแบบรวมที่สำคัญจะไม่ประสบปัญหาการแย่งชิง สำหรับองค์กรที่ประเมินผลตอบแทนจากการลงทุนราคา MCX653106A-HDATได้รับการพิสูจน์แล้วว่าคุ้มค่าอย่างเต็มที่ด้วยการเพิ่มปริมาณงาน 3* และความสามารถในการชะลอการซื้อเซิร์ฟเวอร์เพิ่มเติมออกไปกว่า 18 เดือน ทีมงานยังตั้งข้อสังเกตว่าMCX653106A-HDAT สำหรับขายชุดพร้อมสวิตช์ NVIDIA Spectrum-4 นำเสนอเศรษฐศาสตร์ที่เอื้ออำนวยที่สุดสำหรับการปรับใช้ขนาดใหญ่

ผู้ให้บริการยังได้ใช้ประโยชน์จากความสามารถ telemetry ที่ครอบคลุมซึ่งมีรายละเอียดอยู่ในข้อมูลจำเพาะ MCX653106A-HDATเพื่อสร้างโมเดลประสิทธิภาพเชิงคาดการณ์และกลยุทธ์การลดความแออัดอัตโนมัติ ซึ่งช่วยเพิ่มประสิทธิภาพการดำเนินงานให้ดียิ่งขึ้น

สรุปและแนวโน้ม: รากฐานสำหรับโครงสร้างพื้นฐาน AI Hyperscale

การปรับใช้ในระดับการผลิตนี้แสดงให้เห็นว่าNVIDIA Mellanox MCX653106A-HDAT เป็นส่วนประกอบที่เปลี่ยนแปลงสำหรับโครงสร้างพื้นฐาน AI และคลาวด์สมัยใหม่ การผสมผสานระหว่างแบนด์วิดท์รวม 200 Gb/s ความหน่วงการสื่อสารแบบรวมต่ำกว่า 0.3 มิลลิวินาที และการ offload ฮาร์ดแวร์ที่ครอบคลุม ช่วยให้สามารถปรับขนาดแบบเกือบเป็นเส้นตรงสำหรับปริมาณงานที่เร่งด้วย GPU ในฐานะโซลูชันแบบ end-to-endโซลูชันการ์ดอะแดปเตอร์ Ethernet MCX653106A-HDAT ช่วยขจัดคอขวดของเครือข่ายที่เคยจำกัดประสิทธิภาพการฝึกอบรมแบบกระจายและการส่งมอบบริการคลาวด์

มองไปข้างหน้า ผู้ให้บริการคลาวด์กำลังสำรวจการรวมเข้ากับ NVIDIA DOCA ที่ขยายออกไปเพื่อใช้ความสามารถในการตั้งโปรแกรม data-path เพิ่มเติมสำหรับการเพิ่มประสิทธิภาพเฉพาะปริมาณงานในสภาพแวดล้อมผู้เช่าหลายราย พวกเขายังใช้ telemetry แบบอินไลน์ของอะแดปเตอร์ — ซึ่งมีรายละเอียดอย่างละเอียดในเอกสารข้อมูล MCX653106A-HDAT — เพื่อพัฒนาระบบการจัดการประสิทธิภาพอัตโนมัติรุ่นต่อไปNVIDIA Mellanox MCX653106A-HDAT ได้กลายเป็นรากฐานของแผนงานโครงสร้างพื้นฐาน AI ของพวกเขา โดยมอบแพลตฟอร์มที่แข็งแกร่งและปรับขนาดได้สำหรับการฝึกอบรมโมเดลพื้นฐานรุ่นต่อไปและบริการวิเคราะห์แบบเรียลไทม์