NVIDIA Mellanox MCX631102AN-ADAT ในกิจกรรม: RDMA / RoCE การขนส่งความช้าต่ําและการปรับปรุงการทํางานของเซอร์เวอร์
July 27, 2026
NVIDIA Mellanox MCX631102AN-ADAT ในการใช้งานจริง: การขนส่ง RDMA/RoCE ที่มีความหน่วงต่ำและการเพิ่มประสิทธิภาพปริมาณงานของเซิร์ฟเวอร์
ภูมิหลังและความท้าทาย: คอขวดด้านความหน่วงและปริมาณงานในการจัดเก็บแบบกระจาย
ผู้ให้บริการคลาวด์ขนาดกลางที่ใช้คลัสเตอร์จัดเก็บข้อมูล Ceph แบบกระจายบนเซิร์ฟเวอร์ x86 จำนวน 120 เครื่อง เริ่มประสบปัญหาด้านประสิทธิภาพที่เพิ่มขึ้น โครงสร้างพื้นฐานเครือข่าย 10GbE ที่มีอยู่ ซึ่งอาศัย TCP/IP สำหรับการสื่อสารระหว่างโหนด กำลังประสบปัญหาในการรองรับปริมาณพื้นที่จัดเก็บข้อมูลที่ใช้ NVMe ที่เพิ่มขึ้น อาการสำคัญ ได้แก่ การใช้งาน CPU สูงเกิน 45% บนโหนดจัดเก็บข้อมูลเนื่องจากการประมวลผลโปรโตคอลเครือข่าย ความหน่วงในการอ่าน/เขียนเฉลี่ยที่พุ่งสูงกว่า 3 มิลลิวินาทีในช่วงเวลาที่มีการใช้งานสูงสุด และช่องว่างที่สำคัญระหว่างปริมาณงานของดิสก์ตามทฤษฎีกับประสิทธิภาพที่ส่งมอบผ่านเครือข่ายจริง ทีมวิศวกรรมตระหนักดีว่าการบรรลุความหน่วงระดับต่ำกว่ามิลลิวินาทีและการปลดปล่อยประสิทธิภาพ NVMe อย่างเต็มที่นั้นต้องการการเปลี่ยนแปลงพื้นฐานในแนวทางการสร้างเครือข่าย โดยเฉพาะอย่างยิ่งการนำ RDMA over Converged Ethernet (RoCE) มาใช้
โซลูชันและการติดตั้ง: ขอแนะนำโซลูชันการ์ดอะแดปเตอร์ Ethernet MCX631102AN-ADAT
หลังจากประเมินตัวเลือกผู้จำหน่ายหลายราย ทีมงานได้เลือกNVIDIA Mellanox MCX631102AN-ADAT เป็นตัวขับเคลื่อนหลักสำหรับการอัปเกรดเครือข่ายของพวกเขา MCX631102AN-ADAT ConnectX-6 Lx dual-port 25GbE SFP28 อะแดปเตอร์ถูกเลือกเนื่องจากการรองรับ RoCEv2 แบบเนทีฟ การควบคุมความแออัดที่ทำงานบนฮาร์ดแวร์ และการผสานรวมกับโครงสร้างพื้นฐานสายเคเบิล SFP28 ที่มีอยู่ได้อย่างราบรื่น
กลยุทธ์การติดตั้งถูกแบ่งออกเป็นสามคลัสเตอร์:
- ระยะที่ 1 (นำร่อง): โหนดจัดเก็บข้อมูล 16 โหนดได้รับการติดตั้ง การ์ดอะแดปเตอร์ Ethernet MCX631102AN-ADAT แทนที่ NIC 10GbE รุ่นเก่า อะแดปเตอร์ถูกกำหนดค่าในโหมด dual-port active-active โดยแต่ละพอร์ตเชื่อมต่อกับสวิตช์ NVIDIA Spectrum คู่เพื่อความซ้ำซ้อน
- ระยะที่ 2 (การเพิ่มประสิทธิภาพ): เปิดใช้งาน RoCEv2 ด้วย Priority Flow Control (PFC) และ Explicit Congestion Notification (ECN) ที่ปรับแต่งเพื่อป้องกันการสูญหายของเครือข่าย ทีมงานใช้ประโยชน์จากเอนจิ้นการยกเลิกภาระงานของฮาร์ดแวร์ของอะแดปเตอร์สำหรับการคำนวณ NVMe-oF และ erasure coding
- ระยะที่ 3 (การเปิดตัวเต็มรูปแบบ): โหนดทั้งหมด 120 โหนดถูกย้ายไปยัง NVIDIA Mellanox MCX631102AN-ADAT โดยมีการกำหนดค่าสแต็กเครือข่าย Ceph OSD (Object Storage Daemon) ใหม่เพื่อใช้การขนส่ง RDMA
ตาม เอกสารข้อมูล MCX631102AN-ADAT อินเทอร์เฟซ PCIe 4.0 x8 ของอะแดปเตอร์ให้แบนด์วิดท์เพียงพอสำหรับการจัดการปริมาณงานรวม 50 Gb/s ทีมงานยืนยันว่า ข้อมูลจำเพาะ MCX631102AN-ADAT — รวมถึงความหน่วงต่ำกว่า 0.6 ไมโครวินาทีและการกำหนดเส้นทางการรับส่งข้อมูลที่ทำงานบนฮาร์ดแวร์ — สอดคล้องกับข้อกำหนดด้านประสิทธิภาพที่เข้มงวดของพวกเขาอย่างสมบูรณ์แบบ อะแดปเตอร์ยังพิสูจน์แล้วว่า MCX631102AN-ADAT เข้ากันได้ กับการแจกจ่าย Linux ที่มีอยู่ (RHEL 9.2) และไดรเวอร์ Mellanox OFED ซึ่งช่วยลดความซับซ้อนของกระบวนการติดตั้งได้อย่างมาก
ผลลัพธ์และประโยชน์: การเพิ่มขึ้นที่วัดได้ในด้านความหน่วงและปริมาณงาน
ผลกระทบของการย้ายระบบปรากฏชัดเจนทันทีในตัวชี้วัดการผลิต การปรับปรุงที่สำคัญที่สังเกตได้หลังการติดตั้ง ได้แก่:
| ตัวชี้วัด | ก่อนการอัปเกรด (10GbE TCP/IP) | หลังการอัปเกรด (MCX631102AN-ADAT พร้อม RoCE) | การปรับปรุง |
|---|---|---|---|
| ความหน่วงในการอ่านเฉลี่ย | 2.8 ms | 0.4 ms | ลดลง 7 เท่า |
| ความหน่วงในการเขียนเฉลี่ย | 3.2 ms | 0.5 ms | ลดลง 6.4 เท่า |
| การใช้งาน CPU ของโหนด (สแต็กเครือข่าย) | 42% | 11% | เพิ่มขึ้น 31 pp |
| ปริมาณงานรวมของคลัสเตอร์ | 18 Gb/s | 42 Gb/s | เพิ่มขึ้น 2.3 เท่า |
นอกเหนือจากตัวเลขแล้ว ทีมงานยังสังเกตเห็นการปรับปรุงการดำเนินงานที่สำคัญ MCX631102AN-ADAT ช่วยให้การย้าย VM ที่ใช้งานแอปพลิเคชันที่ไวต่อความหน่วงเป็นไปอย่างราบรื่น เนื่องจากความผันผวนของเครือข่ายลดลงจนอยู่ในระดับที่น้อยมาก การยกเลิกภาระงาน NVMe-oF ที่ทำงานบนฮาร์ดแวร์ช่วยลดความหน่วงในการเข้าถึงที่จัดเก็บข้อมูลลงอีก 30% ทำให้คลัสเตอร์สามารถจัดการกับปริมาณงานการอ่าน/เขียนแบบผสมผสานด้วยเวลาตอบสนองที่สม่ำเสมอต่ำกว่ามิลลิวินาที สำหรับองค์กรที่คำนวณผลตอบแทนจากการลงทุน ราคา MCX631102AN-ADAT พิสูจน์แล้วว่าคุ้มค่าด้วยปริมาณงานที่เพิ่มขึ้น 2.3 เท่าและความสามารถในการเลื่อนการซื้อเซิร์ฟเวอร์เพิ่มเติมออกไปอย่างน้อย 18 เดือน ผู้ให้บริการยังตั้งข้อสังเกตว่า MCX631102AN-ADAT สำหรับขาย ผ่านพันธมิตรช่องทางมีส่วนลดปริมาณที่ยืดหยุ่นสำหรับการติดตั้งขนาดใหญ่
นอกจากนี้ ความสามารถในการวัดปริมาณและจัดการนอกแบนด์ในตัวของอะแดปเตอร์ — ซึ่งมีรายละเอียดใน เอกสารข้อมูล MCX631102AN-ADAT — ให้การมองเห็นเชิงลึกเกี่ยวกับสุขภาพของเครือข่าย ทำให้สามารถจัดการความแออัดเชิงรุกและวิเคราะห์สาเหตุรากเหง้าได้เร็วขึ้นระหว่างการแก้ไขเหตุการณ์
สรุปและแนวโน้ม: รากฐานเชิงกลยุทธ์สำหรับปริมาณงานในอนาคต
การติดตั้งจริงนี้แสดงให้เห็นว่า NVIDIA Mellanox MCX631102AN-ADAT เป็นมากกว่าการอัปเกรดแบนด์วิดท์ธรรมดา ในฐานะ โซลูชันการ์ดอะแดปเตอร์ Ethernet MCX631102AN-ADAT ที่สร้างขึ้นเพื่อสภาพแวดล้อมที่เปิดใช้งาน RoCE โดยเฉพาะ สามารถขจัดเครือข่ายเป็นคอขวดด้านประสิทธิภาพได้อย่างมีประสิทธิภาพ ปลดปล่อยศักยภาพสูงสุดของที่จัดเก็บข้อมูล NVMe สมัยใหม่และสถาปัตยกรรม CPU การผสมผสานระหว่างปริมาณงาน dual-port 25GbE การยกเลิกภาระงาน RDMA ที่ครอบคลุม และความเข้ากันได้กับระบบนิเวศที่กว้างขวาง ทำให้เป็นอะแดปเตอร์นี้เป็นการลงทุนเชิงกลยุทธ์สำหรับองค์กรใดๆ ที่วางแผนจะขยายไปป์ไลน์ AI/ML ฐานข้อมูลแบบกระจาย หรือโครงสร้างพื้นฐานแบบไฮเปอร์คอนเวอร์จ
เมื่อมองไปข้างหน้า ทีมงานกำลังสำรวจกรณีการใช้งานเพิ่มเติม รวมถึงการผสานรวม NVIDIA DOCA สำหรับเส้นทางข้อมูลที่ตั้งโปรแกรมได้และการจัดเตรียมแบบ zero-touch ด้วยความสามารถที่ได้รับการพิสูจน์แล้วในการลดความหน่วง เพิ่มปริมาณงาน และเรียกคืนทรัพยากร CPU MCX631102AN-ADAT กำหนดเกณฑ์มาตรฐานใหม่สำหรับอะแดปเตอร์เซิร์ฟเวอร์ 25GbE ในสภาพแวดล้อมองค์กรและคลาวด์

