NVIDIA Mellanox MCX631432AN-ADAB ในกิจกรรม: RDMA / RoCE การขนส่งความช้าต่ําและการปรับปรุงการทํางานของเซอร์เวอร์
July 28, 2026
NVIDIA Mellanox MCX631432AN-ADAB ในกิจกรรม: RDMA / RoCE การขนส่งความช้าต่ําและการปรับปรุงการทํางานของเซอร์เวอร์
สถานการณ์และความท้าทาย: สะดวกในเครือข่ายในกลุ่มฝึกอบรม AI
บริษัทฟินเทคชั้นนําแห่งหนึ่ง ล่าสุดได้ใช้คลาสเตอร์ AI ที่ใช้ GPU 64 หน่วย เพื่อฝึกทหารยุทธศาสตร์การเทรดความถี่สูง โดยมีเซอร์เวอร์แต่ละหน่วยพร้อมกับระบบเก็บข้อมูล NVMe ที่มีความสามารถสูง,เมื่อเริ่มใช้งานแล้ว ความสามารถในการฝึกอบรมที่แท้จริงก็ลดลงอย่างสําคัญ ต่ํากว่าคาดการณ์การวิเคราะห์หลังการจัดจําหน่ายแสดงให้เห็นว่า 10GbE TCP/IP-based inter-node communication fabric ได้กลายเป็นข้อขัดขวางหลักการดําเนินการสื่อสารรวม All-Reduce มีความยาวนานสูงถึง 4-5 มิลลิวินาทีขณะที่ CPU overhead สําหรับการประมวลผลโปรต็อกอลเครือข่ายเกิน 40%ทีมงานต้องการอย่างเร่งด่วน การแก้ไขเครือข่ายที่สามารถทั้งการลดความช้าในการสื่อสารและการฟื้นฟูความจุของ CPU
การแก้ไขและการจัดจําหน่าย: การสร้างเครือข่าย RoCE ที่ขาดทุนด้วย MCX631432AN-ADAB
หลังจากการประเมินทางเทคนิคอย่างครบถ้วน ทีมงานได้เลือกNVIDIA Mellanox MCX631432AN-ADABเป็นพื้นฐานสําหรับการปรับปรุงเครือข่ายของพวกเขาMCX631432AN-ADAB ConnectX-6 Lx ท่าสอง 25GbE SFP28แอดป์เตอร์, โดยมีทั้งสองพอร์ต SFP28 เชื่อมต่อกับสวิทช์ NVIDIA Spectrum-3 ที่เหลือใช้เพื่อกําหนดสถาปัตยกรรมที่มีอยู่สูง
การใช้งานถูกดําเนินการใน 3 ขั้นตอนที่แตกต่างกัน
- ขั้นตอนที่ 1 ภาพทดลอง (8 หน่วยงาน)ทีมงานติดตั้งการ์ด MCX631432AN-ADAB Ethernetบนกลุ่มย่อยของเซอร์เวอร์ GPU, การตั้งค่า RoCEv2 ด้วยการควบคุมการไหลของความสําคัญ (PFC) และการแจ้งความอึดอัดอย่างชัดเจน (ECN) เพื่อสร้างเนื้อเยื่อ Ethernet ที่ขาดทุนNCCL (NVIDIA Collective Communications Library) ได้ถูกประกอบใหม่ด้วยการสนับสนุน RDMA.
- ขั้นตอนที่ 2 การปรับ & การรับรองการใช้ข้อมูลเทเลเมตรี่ที่อธิบายในใบข้อมูล MCX631432AN-ADAB, ทีมงานปรับปรุงปริมาตร DCB และขั้นต่ําพัฟเฟอร์เพื่อกําจัด PFC พายุหยุดขณะที่รักษาการสูญเสียแพ็คเก็ตเกือบศูนย์.รายละเอียด MCX631432AN-ADABนําทางในการปรับปรุงความเข้มข้นของการหยุดและความลึกของคิวสําหรับโปรไฟล์ภาระงานเฉพาะ
- ขั้นตอนที่ 3 ลงตัวการผลิตเต็ม (64 หน่วยงาน)หลังจากการรับรองที่ประสบความสําเร็จ ค้อนของหน่วยที่เหลือถูกย้ายไปยังตัวปรับใหม่MCX631432AN-ADAB รองรับไดรเวอร์ที่บูรณาการได้อย่างต่อเนื่องกับสภาพแวดล้อมที่ใช้ Ubuntu และเมลลาน็อกซ์ OFED
ทีมงานระบุว่าMCX631432AN-ADAB การแก้ไขการ์ดปรับเปลี่ยน Ethernetจําหน่ายเส้นทางการย้ายที่ตรงไปตรงมา เนื่องจากตัวปรับปรุงสามารถเข้ากันได้อย่างสมบูรณ์แบบกับระบบประกอบเคเบิลและสวิตช์ SFP28 ที่มีอยู่
ผล & ประโยชน์: การแปลงที่สามารถวัดได้ในความช้าและการผ่าน
การเพิ่มผลประกอบการNVIDIA Mellanox MCX631432AN-ADABการนําเสนอในตารางต่อไปนี้ สรุปเมทริกหลักก่อนและหลังการปรับปรุง:
| เมทริก | การปรับปรุงก่อน (10GbE TCP/IP) | การปรับปรุงหลัง (MCX631432AN-ADAB กับ RoCE) | การปรับปรุง |
|---|---|---|---|
| All-Reduce Latency (เฉลี่ย) | 4.7 ms | 0.32 ms | 14.7× การลด |
| การใช้งาน CPU ของเครือข่าย (ต่อหน่วย) | 42% | 9% | 33 pp ปล่อย |
| การใช้งาน GPU (ระยะการบรรจุข้อมูล) | 61% | 89% | +28% |
| ผลการฝึกกลุ่ม | 1.8x เบอร์เบลย์ | 4.3x เบอร์ลีน | 2.4× เพิ่มขึ้น |
นอกเหนือจากการเพิ่มปริมาณเหล่านี้ ทีมงานได้สังเกตเห็นการปรับปรุงการดําเนินงาน ที่ส่งผลกระทบต่อผลิตภาพของผู้พัฒนาโดยตรงแบบฝึกอบรมที่ก่อนหน้านี้ต้องใช้เวลา 36 ชั่วโมง จบเพียง 15 ชั่วโมง, ทําให้รอบการทบทวนบ่อยขึ้น. การลด NVMe-oF โดยใช้ฮาร์ดแวร์ยังลดความช้าในการเข้าถึงสตอเรชั่นลงถึง 35% เพิ่มเติมเร่งการดําเนินงานจุดตรวจสอบที่ใช้ข้อมูลมากขึ้นสําหรับองค์กรที่ประเมินกรณีธุรกิจ, การMCX631432AN-ADAB ราคาพิสูจน์ว่ามีความสามารถในการแข่งขันสูงเมื่อวัดเมื่อเทียบกับการเพิ่มความสามารถในการทํางาน 2.4x และความสามารถในการเลื่อนการซื้อเซอร์เวอร์ GPU เพิ่มเติมMCX631432AN-ADAB สําหรับขายพันธ์ที่มีสวิตช์ NVIDIA Spectrum ให้ทางที่คุ้มค่าที่สุดสําหรับการปรับขนาดในอนาคต
สรุปและมุมมอง: รากฐานสําหรับการนวัตกรรมภาระงานในอนาคต
การเปิดตัวการผลิตนี้แสดงว่าNVIDIA Mellanox MCX631432AN-ADABมากกว่าการปรับปรุงเครือข่ายแบบประจําๆ มันคือองค์ประกอบพื้นฐานที่เปลี่ยนแปลง ที่ปลดปล่อยศักยภาพเต็มของคอมพิวเตอร์ที่ใช้ GPU เร่งรัดทันสมัยการผสมผสานของความกว้างแบนด์วิทรวม 50 Gb/s, ความช้าในการสื่อสารรวมที่ต่ํากว่า 0.4ms และความสามารถในการลดความจมของ CPU ที่น่าทึ่ง ทําให้ตัวปรับตัวนี้เป็นตัวเลือกที่เหมาะสมสําหรับองค์กรที่ใช้งาน AI แบ่งปันและความจุในการวิเคราะห์เวลาจริง.
มองไปข้างหน้า ทีมงานฟินเทคกําลังศึกษาเรื่องการบูรณาการกับ NVIDIA DOCA เพื่อเร่งเพิ่มความสามารถในการเขียนโปรแกรมเส้นทางข้อมูลและนําการจัดหาแบบไม่มีการสัมผัสเข้าสู่การขยายคลัสเตอร์ในอนาคตพวกเขายังกําลังประเมินศักยภาพทางโทรเมตรของตัวปรับใบข้อมูล MCX631432AN-ADABณ การพัฒนาแบบจําลองการจัดการความจุกจุกMCX631432AN-ADAB การแก้ไขการ์ดปรับเปลี่ยน Ethernetยังคงพิสูจน์คุณค่าของมัน บริษัทวางแผนที่จะมาตรฐานบนแพลตฟอร์มนี้ สําหรับการลงทุนในพื้นฐานในอนาคตทั้งหมดมั่นใจว่ามันจะให้พื้นฐานที่แข็งแกร่งและสามารถปรับขนาดได้ สําหรับรุ่นต่อไปของแอปพลิเคชั่นทางการเงินที่ขับเคลื่อนโดย AI.

