NVIDIA Mellanox MCX653105A-HDAT ในกิจกรรม: RDMA / RoCE การขนส่งความช้าต่ําและการปรับปรุงการทํางานของเซอร์เวอร์

July 29, 2026

ข่าว บริษัท ล่าสุดเกี่ยวกับ NVIDIA Mellanox MCX653105A-HDAT ในกิจกรรม: RDMA / RoCE การขนส่งความช้าต่ําและการปรับปรุงการทํางานของเซอร์เวอร์

NVIDIA Mellanox MCX653105A-HDAT ในกิจกรรม: RDMA / RoCE การขนส่งความช้าต่ําและการปรับปรุงการทํางานของเซอร์เวอร์

สถานการณ์และความท้าทาย: ช่องว่างในเครือข่ายใน AI / HPC Cluster

บริษัทเทคโนโลยีขนาดใหญ่หนึ่ง ล่าสุดได้ใช้คลาสเตอร์ที่เร่งด้วย GPU 128 node สําหรับการฝึกแบบภาษาขนาดใหญ่ (LLM)โดยทุกหน่วยมี GPU NVIDIA H100 จํานวนแปดหน่วย และการเก็บข้อมูล NVMe ที่มีประสิทธิภาพสูงอย่างไรก็ตาม เมื่อปรับขนาดเกิน 32 ค้อน คลัสเตอร์ประสบความเสื่อมของผลงานอย่างมาก All-Reduce ความช้าในการสื่อสารรวมเพิ่มขึ้นถึง 8-10 มิลลิสกอนด์ขณะที่ TCP / IP networking stack ใช้มากกว่า 45% ของทรัพยากร CPU ต่อ nodeเครือข่ายที่สร้างขึ้นบนหลาย 25GbE ลิงค์ กลายเป็นข้อขัดขวางหลัก, จํากัดการใช้งาน GPU และขยายวงจรการฝึกอบรมไกลเกินระยะเวลาที่ยอมรับได้ทีมงานต้องการอย่างเร่งด่วน การแก้ไขที่สามารถนําเสนอทั้งความช้าต่ําสุดและความกว้างของแบนด์วิดขนาดใหญ่.

การแก้ไขและการใช้งาน: การแปลงผ้าด้วย MCX653105A-HDAT

หลังจากการประเมินทางเทคนิคอย่างครบถ้วน ทีมงานได้เลือกNVIDIA Mellanox MCX653105A-HDATเป็นพื้นฐานสําหรับการแปลงเครือข่ายของพวกเขา. ทุก GPU node มีอุปกรณ์MCX653105A-HDAT ConnectX แอดป์เตอร์ บัตรเครือข่าย PCIe, ปรับแต่งด้วยการเชื่อมต่อ 100GbE ที่มีสองพอร์ต เพื่อให้ความกว้างแบนด์วิทรวม 200 Gb/s ต่อเซอร์เวอร์

การใช้งานถูกดําเนินการในสี่ระยะที่จัดทํา

  • ขั้นตอนที่ 1 การติดตั้งฮาร์ดแวร์ (128 node)แต่ละเซอร์เวอร์ได้รับการ์ด MCX653105A-HDAT Ethernet, โดยมีทั้งสองพอร์ต QSFP28 เชื่อมต่อกับสวิทช์ใบ NVIDIA Spectrum-4 ที่เหลือใช้สองตัว. ตัวปรับเปลี่ยนถูกติดตั้งด้วยฟอร์มแวร์ล่าสุดและ NVIDIA OFED ไดรเวอร์สเต็ก.
  • ระยะที่ 2 ราคา RoCEv2ทีมงานได้เปิด RoCEv2 ทั่วผนังทั้งหมด โดยการปรับปรุงปริมาตรการควบคุมการไหลของความสําคัญ (PFC) และการแจ้งความจุกจุกอย่างชัดเจน (ECN) ให้ดี เพื่อสร้างสภาพแวดล้อม Ethernet ที่ไม่มีการเสียลักษณะการจัดการความจุกจุกที่พัฒนาใบข้อมูล MCX653105A-HDATมีส่วนสําคัญในการบรรลุการจัดสรรพัสดุสะดวกที่สุด
  • ขั้นตอนที่ 3 การปรับปรุง NCCL:ห้องสมุดการสื่อสารรวมของ NVIDIA (NCCL) ได้มีการปรับปรุงใหม่ เพื่อนํามาใช้ความสามารถ RDMA ของตัวปรับด้วยกฎการควบคุมการจราจรที่กําหนดเองที่เขียนโปรแกรมในเครื่องยนต์การประมวลผลที่ฝังในตัวปรับ เพื่อปรับปรุงให้เหมาะสมกับรูปแบบการลดทั้งหมดและรวมทั้งหมดของภาระงาน LLM.
  • ขั้นตอนที่ 4 การรับรองและการปรับปรุงการใช้ข้อมูลเทเลเมตรี่ที่เปิดเผยผ่านรายละเอียด MCX653105A-HDAT, ทีมงานได้ตรวจสอบการตั้งค่า, ปรับการตั้งค่าการปรับปรุงการหยุด, และกําหนดมาตรฐานการทํางานฐานสําหรับการติดตามต่อเนื่อง

โดยเฉพาะอย่างยิ่ง, ตัวปรับเปลี่ยนพิสูจน์ว่าMCX653105A-HDAT รองรับด้วยโครงสร้างการเชื่อมเคเบิลที่มีอยู่ เนื่องจากพอร์ต QSFP28 รองรับทั้ง 100GbE และ 25GbE optics ทําให้มีการย้ายที่เรียบร้อยโดยไม่ต้องเปลี่ยนเคเบิลที่รบกวนทีมงานยังนํามาใช้ความสามารถหลายโฮสต์ของตัวปรับ เพื่อรองรับทั้งฟังก์ชันการคํานวณและการเก็บข้อมูลบนพอร์ตทางกายภาพเดียวกัน.

ผล & ประโยชน์: ผลประโยชน์ในการฝึกอบรมที่วัดได้

การปรับปรุงผลประกอบการNVIDIA Mellanox MCX653105A-HDATกว่าการคาดการณ์เริ่มต้นทั้งหมด เมตรการประกอบการหลักก่อนและหลังการปรับปรุง

เมทริก การปรับปรุงก่อน (25GbE TCP/IP) หลังการปรับปรุง (MCX653105A-HDAT กับ RoCE) การปรับปรุง
All-Reduce Latency (128 node) การใช้งานของเครื่องหมาย 9.2 ms 0.28 ms 32.8× การลด
การใช้งาน CPU ของเครือข่าย (ต่อหน่วย) 47% 6% 41 pp กลับคืนมา
การใช้ GPU (ช่วงการฝึก) 58% 94% +36% เพิ่มขึ้น
ผลการฝึกกลุ่ม 1.9x เบอร์เบลย์ 5.7x ราคาเบื้องต้น เพิ่มขึ้น 3x

นอกเหนือจากผลประกอบการปริมาณเหล่านี้ ทีมงานได้สังเกตผลประโยชน์ทางการดําเนินงานที่สําคัญ การฝึกอบรมที่ใช้เวลา 12 วันก่อนหน้านี้การเร่งกระตุ้นวงจรการทบทวนแบบอย่างรวดเร็วเส้นทางข้อมูลที่สามารถเขียนโปรแกรมได้ของตัวปรับอัดได้ ทําให้การออกแบบการจราจรตามความต้องการสําหรับกระแสความสําคัญสําหรับองค์กรที่ประเมินผลตอบแทนจากการลงทุน, การMCX653105A-HDAT ราคาพิสูจน์ให้เห็นได้ชัดว่าการเพิ่มอัตราการทํางาน 3 เท่า และความสามารถในการเลื่อนการซื้อเซอร์เวอร์ GPU เพิ่มเติมอย่างน้อย 12 เดือนMCX653105A-HDAT สําหรับขายพันธ์ที่มีสวิตช์ NVIDIA Spectrum-4 ให้เศรษฐกิจที่ดีที่สุดสําหรับการจัดจําหน่ายคลัสเตอร์เต็ม

สรุปและมุมมอง: รากฐานสําหรับพื้นฐาน AI รุ่นต่อไป

การใช้งานขนาดการผลิตนี้ยืนยันว่าNVIDIA Mellanox MCX653105A-HDATเป็นองค์ประกอบการแปลงสําหรับ AI และ HPC คลัสเตอร์ที่ทันสมัยและการลดภาระฮาร์ดแวร์ที่ครบถ้วน ทําให้องค์กรสามารถปรับขนาดเกือบเส้นตรงสําหรับภาระงานที่เร่ง GPUในฐานะที่ปลายไปปลายMCX653105A-HDAT Ethernet adapter การ์ดแก้ไข, มันกําจัดข้อจํากัดของเครือข่าย ที่มีประวัติศาสตร์จํากัดประสิทธิภาพการฝึกกระจาย

มองไปข้างหน้า บริษัทกําลังศึกษาเรื่องการบูรณาการกับ NVIDIA DOCA เพื่อนํามาใช้โปรแกรมเส้นทางข้อมูลเพิ่มเติมเพื่อปรับปรุงภาระงานเฉพาะพวกเขายังกําลังนําผลประโยชน์จากเทเลเมตรีที่ก้าวหน้าของตัวปรับใบข้อมูล MCX653105A-HDAT✅ การสร้างแบบจําลองการแสดงผลลัพธ์แบบคาดการณ์ และยุทธศาสตร์การลดความจุกจุกโดยอัตโนมัติNVIDIA Mellanox MCX653105A-HDATได้กลายเป็นหินมุมของตารางทางด้านพื้นฐาน AI ของพวกเขา โดยให้พื้นฐานที่แข็งแกร่งและสามารถปรับขนาดได้ สําหรับการพัฒนาและการจัดจําหน่ายรุ่นใหม่ของโมเดลพื้นฐาน