NVIDIA Mellanox MCX623106AN-CDAT Server Adapter หนังสือขาวทางเทคนิค
July 24, 2026
NVIDIA Mellanox MCX623106AN-CDAT Server Adapter หนังสือขาวเทคนิค
1. สถานการณ์โครงการและการวิเคราะห์ความต้องการ
ศูนย์ข้อมูลที่ทันสมัยกําลังปรับเปลี่ยนแบบอย่าง โดยการเติบโตอย่างรวดเร็วของปัญญาประดิษฐ์ การเรียนรู้เครื่องจักรขนาดใหญ่ และการวิเคราะห์ในเวลาจริงค่าทํางานเหล่านี้ต้องการผลงานเครือข่ายที่ไม่เคยมีมาก่อน ไม่เพียงแค่ความกว้างของแบนด์วิธ, แต่ความช้าต่ํากว่า 5μs ที่กําหนดได้, การเคลื่อนไหวข้อมูลที่ประสิทธิภาพของ CPU, และการปรับขนาดได้อย่างต่อเนื่องถึงพัน ๆ ค้อน.ได้กลายเป็นอุปสรรคที่สําคัญ, ใช้ CPU ถึง 40% ในความเร็ว 200GbE และนําไปสู่การเปลี่ยนแปลงความช้าที่ไม่คาดเดาได้ ซึ่งทําให้การทํางานของแอปพลิเคชั่นลดลงสําหรับองค์กรที่สร้างคลัสเตอร์ AIขนาดใหญ่ (500+ GPU) หรือโครงสร้างพื้นฐานเมฆขนาดใหญ่, ความไม่ประสิทธิภาพนี้แปลโดยตรงไปสู่เวลาการฝึกอบรมที่ยาวนาน, ค่าบริการในพื้นฐานที่สูงขึ้น, และเวลาในการตลาดที่ช้าลง.
หนังสือขาวนี้นําเสนอวิธีการแก้ไขทางเทคนิคที่ครบวงจรNVIDIA Mellanox MCX623106AN-CDATแอดป์เตอร์เซอร์เวอร์. ออกแบบสําหรับบริษัทที่ต้องการให้การลงทุน 200GbE ของพวกเขาสูงสุดการ์ด MCX623106AN-CDAT Ethernetส่ง RDMA ที่เร่งเร็วด้วยฮาร์ดแวร์ผ่าน Converged Ethernet (RoCE) ทําให้การขนส่งที่ไม่มีการสูญเสียและความช้าต่ําสุดสามารถเปลี่ยน I/O ของเครือข่ายจากอุปสรรคในการปรับขนาดเป็นข้อดีในการแข่งขันการแก้ไขถูกออกแบบโดยเฉพาะเพื่อตอบสนองเป้าหมายหลักสามอย่าง: (1) การบรรลุความช้าในการใช้งานปลายสู่ปลายของ sub-5μs สําหรับการสื่อสารรวม AI, (2) การลดค่าใช้จ่ายในการประมวลผลเครือข่าย CPU เป็นต่ํากว่า 5% และ (3) การให้บริการที่สามารถปรับขนาดได้ฐานที่มั่นคงในอนาคตสําหรับ 200GbE และมากกว่า.
2. การออกแบบระบบระบบและเครือข่ายโดยรวม
สถาปัตยกรรมที่แนะนําใช้ทอปโลยีกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานMCX623106AN-CDAT แอดป์เตอร์ ConnectX การ์ดเครือข่าย PCIe, ใช้ในทุกคอมพิวเตอร์และสตอเรชั่นโน๊ดทั่วเนื้อเยื่อ
- ผ้าอีเทอร์เน็ตไร้การสูญเสีย:การใช้ RoCE v2 กับ PFC (Priority Flow Control) และ ECN (Explicit Congestion Notification) ผ่านสวิตช์ทั้งหมดเพื่อกําจัดการตกของแพ็คเก็ตและรับประกันความช้าช้าที่กําหนดสําหรับการจราจร RDMA
- GPUDirect RDMA:ทําให้การสื่อสารตรงจาก GPU ไปยัง GPU ผ่านเครือข่ายโดยไม่ต้องมีส่วนร่วมของ CPU, ลดความช้าและปลดปล่อยทรัพยากร CPU สําหรับงานคอมพิวเตอร์
- อัดฮาร์ดแวร์ทุกที่การลดโหลดโครงการขนส่ง, ความปลอดภัย (IPsec / MACsec) และโปรโตคอลการเก็บข้อมูลไปยังตัวปรับ, ปลดปล่อยวงจร CPU สําหรับโลจิกการใช้งาน
- อัตราการรีดันต์ที่ทํางานการใช้ Port QSFP112 ทั้งสองในรูปแบบการรวมลิงค์ (LACP) สําหรับความกว้างแบนด์วิทรวม 400Gb/s และ failover อัตโนมัติพร้อมการฟื้นฟู sub-second
- วิศวกรรมการจราจรที่ฉลาดการนําทางที่ปรับปรุงและการจัดส่งแพคเก็ตที่ผิดระเบียบ เพื่อหลีกเลี่ยงจุดร้อนของความจุกจูงและยกระดับการใช้งานผ้าให้มากที่สุด
- เทเลเมทรีที่ครบวงจรเทเลเมทรีในเครือข่ายในวงจร (INT) และการติดตามต่อการไหลเพื่อการตรวจจับความหนาแน่นและการวางแผนความจุ
คําตอบคืออย่างเต็มที่สอดคล้องกับ MCX623106AN-CDATด้วยแพลตฟอร์ม NVIDIA GPU (HGX, DGX) และเซอร์เวอร์ CPU นําจาก Dell, HPE, Supermicro และ Lenovo สําหรับการเก็บข้อมูล อาร์คิทคชันรองรับ NVMe-oF ผ่าน RoCE ด้วยความช้าต่ํากว่า 15μsทําให้การเก็บข้อมูลแบบแบ่งปันได้ สําหรับกลุ่มการฝึกอบรมขนาดใหญ่.
3. บทบาทและคุณสมบัติสําคัญของ NVIDIA Mellanox MCX623106AN-CDAT
ในฐานะองค์ประกอบพื้นฐานของคําตอบนี้NVIDIA Mellanox MCX623106AN-CDATมีหน้าที่สําคัญ 4 อย่างในโครงสร้าง:
| หน้าที่ | รายละเอียดการดําเนินการ | ประโยชน์ทางธุรกิจ |
|---|---|---|
| เครื่อง RDMA/RoCE | RoCE v2 ที่ใช้ฮาร์ดแวร์กับ ECN/PFC ความช้าต่ํากว่า 0.6μs การสนับสนุน GPUDirect | การมีส่วนร่วมของ CPU เกือบศูนย์; รวดเร็ว 8 เท่า |
| โพร์ตสองสาย 200GbE | สายพาน QSFP112 ที่เป็นอิสระสองสาย, ความเร็วรวม 400Gb / s | การเชื่อมต่อแบบแอคทีฟ-แอคทีฟ สําหรับความกว้างแบนด์บิด; การรอคอยแบบแอคทีฟ สําหรับความอุดหน่ํา |
| อินเตอร์เฟซ PCIe 5.0 | PCIe 5.0 x16 (สูงสุด 32 GT/s) ด้วยเครื่องยนต์ DMA ที่ทันสมัย | กําจัดความคับแคบของอินเตอร์เฟซโฮสต์สําหรับการจราจร 200GbE |
| การเวอร์ชูเอล & การอัพโหลดออฟเลย์ | SR-IOV ด้วยความเร็วสูงสุด 512 VF ต่อพอร์ต; VXLAN/NVGRE/IPsec/MACsec | โครงการเช่าหลายรายการความหนาแน่นสูง พร้อมความมั่นคงและการทํางานของอัตราการเช่า |
ข้อจําแนกทางเทคนิคหลัก ๆใบข้อมูล MCX623106AN-CDATรวมถึงความสามารถในการลดภาระที่ครบถ้วน (เช็คซัม, LSO/LRO, VLAN stripping/insertion, RSS ด้วยคิวสูงสุด 128 คิว) อัลการิทึมควบคุมความจุกจุกที่พัฒนาและการสนับสนุนอย่างเต็มที่สําหรับห้องสมุดสื่อสารรวมของ NVIDIA (NCCL).รายละเอียด MCX623106AN-CDATยังเน้นการสนับสนุนความสอดคล้อง 100GbE และ 50GbE ให้ความยืดหยุ่นในการใช้งานสําหรับสภาพแวดล้อมความเร็วผสมผสาน
4. แนะนําการใช้งานและการปรับขนาด
สําหรับกลัสเตอร์ AI สนามสีเขียว เราแนะนําให้ใช้ทอปโลจีกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดานกระดการ์ด MCX623106AN-CDAT Ethernetโดยมีทั้งสองพอร์ต QSFP112 เชื่อมต่อกับสวิทช์ใบแยกเพื่อการขยายตัว ผ้า RoCE ต้องการการตั้งค่า QoS ที่ตรงกันข้ามกับสวิทช์ทั้งหมดPFC เรื่องความสําคัญ 3 (สําหรับการจราจรรวม RDMA) และความสําคัญ 4 (สําหรับการเก็บ)เราแนะนําให้อุทิศ VLAN แยกแยกสําหรับ RDMA, การบริหาร, การเก็บข้อมูล, และการจ้างจ้างเพื่อปรับปรุงการติดตามและแก้ปัญหา
สําหรับสภาพแวดล้อมที่ใช้งานไม่ดีที่มีพื้นฐาน 100GbEMCX623106AN-CDAT Ethernet การแก้ไขการ์ดปรับเปลี่ยนโปรโมชั่นนี้มีเส้นทางการย้ายที่เรียบร้อย เนื่องจากตัวปรับอัตราเป็นที่สอดคล้องกับออฟติก 100GbE QSFP56, การเชื่อมต่อสายไฟที่มีอยู่สามารถนําไปใช้ใหม่ได้ในระหว่างการปรับปรุงเป็น 200GbE.ตัวปรับสัญญาณยังรองรับการสวิตช์ Ethernet มาตรฐานโดยไม่ต้องเปิด RoCE, ทําให้ทีมงานสามารถใช้ฮาร์ดแวร์ได้ก่อน และเปิดใช้ความสามารถ RDMA ในระยะเวลาที่เนื้อผ้าเติบโตและภาระงานอ้างอิงการเปลี่ยนแปลง
การปรับขนาดของคําตอบไปเกิน 500 คูปโปง ต้องมีการพิจารณาเพิ่มเติมเราแนะนําให้นํามาใช้กลยุทธ์การจัดการความหนาแน่น RoCE โดยใช้สวิตช์ NVIDIA Spectrum-4 พร้อมเทเลเมตรีและการปรับขั้นต่ํา ECNสําหรับคลาสเตอร์ที่เกิน 1,000 ค้อน, พิจารณาการจัดจําหน่ายตัวควบคุมการจัดการผ้ากลาง (เช่น NVIDIA NetQ) เพื่อรักษาความเห็นจากปลายไปปลายและความสม่ําเสมอการตั้งค่าอัตโนมัติMCX623106AN-CDAT สําหรับขายผ่านพันธมิตรช่องทางโลกของ NVIDIA รวมถึงการรับประกันครบวงจรและการสนับสนุนการอัพเดทฟอร์มแวร์
5การดําเนินงาน ติดตาม ตรวจสอบปัญหา และปรับปรุง
การทํางานอย่างมีประสิทธิภาพของ RoCE fabric ต้องการกลยุทธ์การติดตามและแก้ปัญหาหลายชั้น:
- เทเลเมทรีระดับตัวปรับรายการรายละเอียด MCX623106AN-CDATรวมถึงตัวนับต่อท่าเรือสําหรับเฟรม PFC, แพ็คเก็ตที่มีเครื่องหมาย ECN, เฟรมที่ตก, ความผิดพลาดของลิงค์ และช่วงเวลาหน่วง
mlx5cmd,อีธทูล, หรือ NVIDIA เครื่องมือฟอร์มแวร์ เพื่อส่งออกเมทริกเหล่านี้ไปยัง Prometheus / Grafana แดชบอร์ดพร้อมกับการเตือนที่เหมาะสม - เครือข่าย In-Band Telemetry (INT)ใช้การสนับสนุน INT ของตัวปรับเพื่อติดตามความช้าต่อการไหลและความลึกของคิวทั่วผ้า, ทําให้สามารถระบุแหล่งอับอัดขนาดเล็กได้อย่างแม่นยํา
- การติดตามระดับสวิทช์:ติดตามการครอบครองพัฟเฟอร์, จํานวนเฟรมหยุด, ความลึกของคิว, และอัตราการตรา ECN บนสวิตช์กระดูกสันหลังและใบ.การเพิ่มระยะเวลาในช่วงพักช้าอย่างฉับพลันแสดงให้เห็นถึงความจุกจุกเล็กๆ ที่อาจต้องปรับขั้นต่ํา ECN.
- เมทริกระดับการใช้งาน:สําหรับแอปพลิเคชั่น RDMA ติดตาม WR (Work Request) ความช้าในการเสร็จสิ้น, CQ (Completion Queue) เหตุการณ์ overflow, และ QP (Queue Pair) การนับความผิดพลาดโดยใช้ NVIDIA libibverbs และ rdma-core ไบรารี.
สถานการณ์การแก้ไขปัญหาทั่วไป และการกระทําที่แนะนํา
- ความเสื่อมของ RoCEยืนยันว่า PFC ได้เปิดในพอร์ตสวิตช์ทั้งหมด และการระบุ DSCP ตรงกับการตั้งค่าสวิตช์ใบข้อมูล MCX623106AN-CDATเพื่อรับรองการตั้งค่าการจัดสรรพัสดุพัสดุพัสดุพัสดุ (buffer allocation) กับค่าที่แนะนําสําหรับโปรไฟล์ภาระงานของคุณ
- ความผิดพลาดการลดลิงค์หรือ CRC:ตรวจสอบคุณภาพเคเบิล QSFP112 (ให้แน่ใจว่ามีความสอดคล้องกับรายละเอียด 200G AOC หรือ DAC) และตรวจสอบว่าฟอร์มแวร์ของตัวปรับอัพเดทถูกอัพเดทเป็นรีลิสล่าสุด
- ปัญหาการทํางานของ GPU Direct:ยืนยันว่า GPUDirect ถูกเริ่มต้นอย่างถูกต้อง และว่า โทโปโลยี PCIe รองรับ DMA peer-to-peer โดยไม่ต้องเปลี่ยนระหว่าง
- PFC deadlock หรือหยุดพายุ:ตรวจสอบความสําคัญที่ไม่ถูกตั้งค่า และให้แน่ใจว่า PFC ได้เปิดให้ใช้ได้เฉพาะใน RoCE traffic class (ไม่เปิดให้ใช้ในการจัดการหรือการเก็บข้อมูล)
สําหรับการปรับปรุง, เราแนะนํา ปริมาตรการปรับปรุงต่อไปนี้
- การสอดคล้องตัด (การปรับปรุง)กําหนดเป็น 2 ‰ 4 μs สําหรับภาระงานการฝึกอบรม AI เพื่อลดความช้าให้น้อยที่สุดในขณะที่รักษาประสิทธิภาพของ CPU
- RDMA MTU:เพิ่มเป็น 4096 ไบท์ สําหรับการสื่อสารทั้งหมด เพื่อลดค่าใช้จ่ายโปรโตคอล และปรับปรุงความเร็ว
- RSS (รับด้านการปรับขนาด):การตั้งค่าในหลาย CPU core สําหรับการจราจรที่ไม่ใช่ RDMA เพื่อกระจายการประมวลผลและหลีกเลี่ยงการอิ่มตัวของ CPU หน่วยเดียว
- ขั้นต่ํา ECN:กําหนดขีดขวางขั้นต่ําที่ 40% ของพัฟเฟอร์และขีดขั้นสูงสุดที่ 75% สําหรับการจราจรความสําคัญที่ 3 โดยปรับตามรูปแบบการจราจรที่สังเกตและลักษณะของภาระงาน
6. สรุปและการประเมินค่า
รายการNVIDIA Mellanox MCX623106AN-CDATการแก้ไขนําเสนอคุณค่าการเปลี่ยนแปลงสําหรับศูนย์ข้อมูลขนาด AI ที่ทันสมัย โดยการแทนที่ TCP/IP ที่ใช้โปรแกรมด้วย RDMA/RoCE และ GPUDirect ที่ใช้ฮาร์ดแวร์เร่งองค์กรสามารถบรรลุการลดความช้าระดับแอปพลิเคชั่นได้ 8~10x, ลดค่าใช้จ่ายส่วนกลางของเครือข่าย CPU ไปกว่า 85% และเพิ่มการใช้งาน GPU จากต่ํากว่า 70% เป็นมากกว่า 95%การ์ด MCX623106AN-CDAT Ethernetให้ทางที่คุ้มค่าในการใช้งาน 200GbE พร้อมการคุ้มครองการลงทุนผ่านความเข้ากันแบบถอยหลังกับ 100GbE และความสามารถในการลดภาระในอนาคตสําหรับภาระงานที่กําลังเกิด
เมื่อประเมินค่าบริหารสินค้าทั้งหมดMCX623106AN-CDAT ราคาได้รับการชดเชยจากการประหยัดการดําเนินงานที่สําคัญ: การลดเวลาการฝึกอบรม (เร่งเวลาในการตลาด) จํานวนเซอร์เวอร์ที่ต่ํากว่า (เนื่องจากการใช้งาน GPU ที่สูงขึ้น)ค่าเย็นลดลง (เนื่องจากการใช้พลังงาน < 20W), และกําจัดผ้า InfiniBand ที่แยกแยกสอดคล้องกับ MCX623106AN-CDATด้วยซอฟต์แวร์ AI และ HPC ที่สําคัญรวมถึงห้องสมุด NVIDIA NCCL, PyTorch, TensorFlow และ MPI, รับประกันความสามารถในการใช้งานที่กว้างขวางในธุรกิจ, เมฆและการจัดจําหน่ายการวิจัย
สําหรับสคริปต์การใช้งานรายละเอียด แมปเล็ตการตั้งค่า และรายงานการเปรียบเทียบผลงาน กรุณาดูรายงานการใช้งานทางการใบข้อมูล MCX623106AN-CDATและโปตัลเอกสารเครือข่ายที่ครบถ้วนของ NVIDIA หนังสือขาวนี้เป็นพื้นฐาน ✅สถาปัตยกรรมได้รับการรับรองและผลประโยชน์ก็สามารถวัดได้.MCX623106AN-CDAT แอดป์เตอร์ ConnectX การ์ดเครือข่าย PCIeมันไม่ใช่แค่ตัวปรับ แต่เป็นตัวช่วยทางกลยุทธ์ สําหรับศูนย์ข้อมูล AI พร้อม และความช้าต่ําสุดในอนาคต

