อะแดปเตอร์เซิร์ฟเวอร์ NVIDIA Mellanox MCX653105A-HDAT ในการใช้งานจริง: การขนส่งและเซิร์ฟเวอร์ RDMA/RoCE Low-Latency

June 15, 2026

ข่าว บริษัท ล่าสุดเกี่ยวกับ อะแดปเตอร์เซิร์ฟเวอร์ NVIDIA Mellanox MCX653105A-HDAT ในการใช้งานจริง: การขนส่งและเซิร์ฟเวอร์ RDMA/RoCE Low-Latency

ในศูนย์ข้อมูลสมัยใหม่ พื้นที่จัดเก็บข้อมูลแบบกระจาย การประมวลผลประสิทธิภาพสูง (HPC) และคลัสเตอร์การฝึกอบรม AI เผชิญกับปัญหาคอขวดทั่วไป นั่นก็คือ เครือข่าย สแต็ก TCP/IP แบบดั้งเดิมนำเสนอเวลาแฝงที่สำคัญและโอเวอร์เฮดของ CPU ซึ่งทำให้ประสิทธิภาพของแอปพลิเคชันลดลงในวงกว้าง กรณีศึกษานี้ตรวจสอบว่าผู้ให้บริการระบบคลาวด์ขนาดกลางจัดการกับความท้าทายเหล่านี้ได้อย่างไรโดยการปรับใช้NVIDIA Mellanox MCX653105A-HDATอะแดปเตอร์เซิร์ฟเวอร์เพื่อเปิดใช้งานการขนส่งที่มีความหน่วงต่ำตาม RDMA/RoCE และเพิ่มปริมาณงานเซิร์ฟเวอร์ได้อย่างมาก

ความเป็นมาและความท้าทาย: เมื่อทุกเสี้ยววินาทีมีค่า

โครงสร้างพื้นฐาน 25GbE ที่มีอยู่ของผู้ให้บริการ ซึ่งใช้งาน TCP/IP มาตรฐาน กำลังประสบปัญหาในการรองรับแบ็กเอนด์พื้นที่จัดเก็บข้อมูล NVMe-over-Fabrics ใหม่ การใช้งาน CPU บนโหนดการจัดเก็บข้อมูลมักจะเกิน 70% เพียงจากการประมวลผลเครือข่าย และความหน่วงระหว่างโหนดอยู่ที่ประมาณ 50µs ซึ่งเป็นที่ยอมรับไม่ได้สำหรับปริมาณงานฐานข้อมูลที่ไวต่อความหน่วง นอกจากนี้ เมื่อขยายขนาดเป็นหลายร้อยโหนด ความแออัดของเครือข่ายทำให้เกิดความล่าช้าด้านท้ายที่เพิ่มขึ้นอย่างรวดเร็วซึ่งส่งผลต่อ SLA ของแอปพลิเคชัน พวกเขาต้องการโซลูชันที่ช่วยลดภาระค่าใช้จ่ายด้านเครือข่าย ให้เวลาแฝงต่ำกว่าไมโครวินาที และรักษาประสิทธิภาพที่สม่ำเสมอภายใต้โหลด

โซลูชันและการปรับใช้: ขอแนะนำการ์ดเครือข่าย PCIe MCX653105A-HDAT ConnectX Adapter

หลังจากพิจารณาหลายตัวเลือกแล้ว ทีมงานก็เลือกการ์ดอะแดปเตอร์อีเทอร์เน็ต MCX653105A-HDATสำหรับความสามารถ 100GbE สองพอร์ตและการรองรับ RoCE (RDMA ผ่าน Converged Ethernet) ที่NVIDIA Mellanox MCX653105A-HDATถูกปรับใช้บนพื้นที่จัดเก็บข้อมูลและโหนดประมวลผล 120 รายการ โดยมีการกำหนดค่าต่อไปนี้:

  • เปิดใช้งาน RoCE แล้วด้วย ECN (การแจ้งเตือนความแออัดอย่างชัดเจน) และ DCQCN สำหรับการควบคุมความแออัด
  • ออฟโหลดเป้าหมาย NVMe-oFไปยังฮาร์ดแวร์ โดยข้าม CPU โฮสต์สำหรับ I/O ที่เก็บข้อมูล
  • การแบ่งพาร์ติชันไปสู่โฟลว์ที่มีลำดับความสำคัญแบบไม่สูญเสียสำหรับการรับส่งข้อมูลการจัดเก็บข้อมูล
  • การตรวจสอบการวัดและส่งข้อมูลทางไกลโดยใช้ตัวนับประสิทธิภาพในตัวของอะแดปเตอร์

ตามที่เอกสารข้อมูลสินค้า MCX653105A-HDATการ์ดดังกล่าวรองรับทั้งโปรโตคอล InfiniBand และอีเธอร์เน็ต แต่ทีมงานเลือก RoCEv2 เพื่อบูรณาการเข้ากับสวิตช์อีเธอร์เน็ตที่มีอยู่ได้อย่างราบรื่น ความเข้ากันได้นั้นตรงไปตรงมา: เซิร์ฟเวอร์หลักทุกรุ่นคือรองรับ MCX653105A-HDATโดยต้องการเฉพาะสล็อต PCIe มาตรฐานและเฟิร์มแวร์ที่อัพเดตแล้ว การปรับใช้เสร็จสมบูรณ์ในช่วงสองสุดสัปดาห์โดยไม่มีการหยุดทำงานเป็นศูนย์ โดยใช้คุณสมบัติการย้ายข้อมูลแบบเรียลไทม์ของอแด็ปเตอร์

ผลลัพธ์และคุณประโยชน์: ประสิทธิภาพที่เพิ่มขึ้นที่วัดได้

ผลกระทบเกิดขึ้นทันทีและเป็นรูปธรรม ตารางต่อไปนี้สรุปตัวชี้วัดหลักก่อนและหลังการปรับใช้งานโซลูชันการ์ดอะแดปเตอร์อีเทอร์เน็ต MCX653105A-HDAT: :

เมตริก ก่อน (TCP/IP) หลัง (RoCE + MCX653105A-HDAT) การปรับปรุง
เวลาแฝงเฉลี่ย (โหนดต่อโหนด) 52 ไมโครวินาที 1.8 ไมโครวินาที ลดลง 96.5%
การใช้งาน CPU (โหนดที่เก็บข้อมูล, สแต็กเครือข่าย) 72% 8% ลดลง 89%
ปริมาณงานที่มีประสิทธิภาพต่อโหนด (NVMe-oF) 18 กิกะบิตต่อวินาที 96 กิกะบิตต่อวินาที เพิ่มขึ้น 5.3 เท่า
เวลาแฝงส่วนท้าย (เปอร์เซ็นไทล์ที่ 99.9) 380 ไมโครวินาที 12 ไมโครวินาที ลดลง 96.8%

นอกเหนือจากตัวเลขเหล่านี้ ทีมงานยังสังเกตเห็นประโยชน์ในการดำเนินงานเพิ่มเติมอีกด้วย ที่ข้อมูลจำเพาะ MCX653105A-HDATรวมถึงการติดตามการเชื่อมต่อที่ใช้ฮาร์ดแวร์และการถ่ายโอนข้อมูล ASAP2 ซึ่งช่วยลดความกระวนกระวายใจของการรับส่งข้อมูลตะวันออก - ตะวันตกและเปิดใช้งานการปรับขนาดที่ราบรื่นยิ่งขึ้น เมื่อประเมินต้นทุนการเป็นเจ้าของทั้งหมดMCX653105A-HDAT ราคาได้รับการพิสูจน์ภายในหกเดือนโดยการลดต้นทุนลิขสิทธิ์ CPU core และความหนาแน่นของพื้นที่จัดเก็บข้อมูลต่อโหนดที่สูงขึ้น ตอนนี้อะแดปเตอร์แพร่หลายแล้วขาย MCX653105A-HDATผ่านช่องทางมาตรฐานทำให้ประสิทธิภาพนี้เข้าถึงได้สำหรับองค์กรทุกขนาด

สรุปและแนวโน้ม: รากฐานสำหรับโครงสร้างพื้นฐาน Next-Gen

กรณีนี้แสดงให้เห็นว่าMCX653105A-HDAT อะแดปเตอร์ ConnectX การ์ดเครือข่าย PCIeไม่ใช่แค่ NIC ที่เร็วขึ้นเท่านั้น แต่ยังเป็นแพลตฟอร์มสำหรับการประมวลผลที่เน้นข้อมูลเป็นศูนย์กลางอย่างแท้จริง ด้วยการเปิดใช้งาน RDMA และ RoCE ด้วยการออฟโหลดฮาร์ดแวร์NVIDIA Mellanox MCX653105A-HDATเปลี่ยนแปลงวิธีที่เซิร์ฟเวอร์สื่อสาร ขจัดค่าใช้จ่ายของโปรโตคอลแบบเดิม และปลดล็อกศักยภาพสูงสุดของพื้นที่จัดเก็บ NVMe และแฟบริคหน่วยความจำแบบกระจาย

เมื่อมองไปข้างหน้า ผู้ให้บริการวางแผนที่จะขยายการใช้งานให้รวม GPUDirect RDMA สำหรับเวิร์กโหลดการฝึกฝน AI ตลอดจนสำรวจฟีเจอร์ความสามารถในการตั้งโปรแกรมของอะแดปเตอร์สำหรับการประมวลผลแพ็กเก็ตแบบกำหนดเอง สำหรับสถาปนิกไอทีและวิศวกรเครือข่ายที่เผชิญกับความท้าทายในการปรับขนาดที่คล้ายคลึงกันการ์ดอะแดปเตอร์อีเทอร์เน็ต MCX653105A-HDATนำเสนอเส้นทางที่ได้รับการพิสูจน์แล้วและพร้อมสำหรับอนาคตสู่เครือข่ายศูนย์ข้อมูลที่มีความหน่วงต่ำและมีปริมาณงานสูง