Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch ในการปฏิบัติ

July 15, 2026

ข่าว บริษัท ล่าสุดเกี่ยวกับ Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch ในการปฏิบัติ

Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 สวิตช์ InfiniBand ในทางปฏิบัติ | การเพิ่มประสิทธิภาพการเชื่อมต่อระหว่างกันที่มีความหน่วงต่ำสำหรับคลัสเตอร์ RDMA/HPC/AI

ความเป็นมาและความท้าทาย: เมื่อขนาดคลัสเตอร์พบกับปัญหาคอขวดของการเชื่อมต่อระหว่างกัน

แผนกวิจัย AI ของบริษัทอินเทอร์เน็ตชั้นนำพบว่าตัวเองอยู่บนทางแยกที่คุ้นเคย กลุ่มเซิร์ฟเวอร์ GPU ที่กำลังเติบโต ซึ่งครอบคลุมหลายแร็คและมีการใช้มากขึ้นสำหรับการฝึกอบรมโมเดลภาษาขนาดใหญ่ กำลังประสบปัญหาเวลาทำงานเสร็จอย่างคาดเดาไม่ได้ โครงสร้างที่ใช้อีเทอร์เน็ตที่มีอยู่ แม้ว่าจะเพียงพอสำหรับปริมาณงานตามวัตถุประสงค์ทั่วไป แต่ก็ไม่สามารถจัดการรูปแบบการรับส่งข้อมูลที่ซิงโครไนซ์และต่อเนื่องของการฝึกอบรมแบบกระจายได้ การดำเนินการลดทั้งหมดจะหยุดลงเป็นประจำเนื่องจากการลดลงของแพ็กเก็ตและความแออัด ทำให้วงจรการฝึกอบรมจากวันเป็นสัปดาห์ ทีมโครงสร้างพื้นฐานจำเป็นต้องเปลี่ยนแปลงพื้นฐานวิธีที่เครือข่ายแบ็กเอนด์จัดการการรับส่งข้อมูล RDMA และพวกเขาต้องการโดยไม่ต้องยกเครื่องสถาปัตยกรรมศูนย์ข้อมูลทั้งหมด

การออกแบบโซลูชัน: การปรับใช้สวิตช์ OPN 920-9B210-00FN-0D0 InfiniBand

หลังจากประเมินตัวเลือกการเชื่อมต่อระหว่างกันหลายตัวเลือกแล้ว ทีมงานก็เลือกเมลลาน็อกซ์ (NVIDIA เมลลาน็อกซ์) 920-9B210-00FN-0D0เป็นรากฐานสำคัญของโครงสร้างแบ็กเอนด์ใหม่ การปรับใช้มีศูนย์กลางอยู่ที่โทโพโลยี leaf-spine สองชั้น โดยแต่ละ leaf switch จะเชื่อมต่อโหนด GPU ได้สูงสุด 40 โหนดผ่านลิงก์ 400Gb/s ที่920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRตัวแปรได้รับเลือกมาโดยเฉพาะสำหรับสถาปัตยกรรมที่ไม่ปิดกั้นและความสามารถในการประมวลผลในเครือข่าย SHARPv3 ที่ผสานรวม สิ่งนี้ทำให้ทีมงานลดภาระการดำเนินการสื่อสารโดยรวมลงบนสวิตช์แฟบริคโดยตรง ซึ่งช่วยลดโอเวอร์เฮดของ CPU และเพิ่มรอบการทำงานของ GPU สำหรับการคำนวณจริง

ในแง่ของการใช้งานทางกายภาพ สวิตช์ได้รับการติดตั้งด้วยการไหลเวียนของอากาศจากด้านหน้าไปด้านหลังเพื่อให้ตรงกับการกำหนดค่าทางเดินร้อน/ทางเดินเย็นที่มีอยู่ ทีมงานได้ใช้ประโยชน์จากเอกสารข้อมูลสินค้า 920-9B210-00FN-0D0เพื่อตรวจสอบข้อกำหนดด้านพลังงานและการทำความเย็น เพื่อให้มั่นใจว่าสามารถบูรณาการเข้ากับหน่วยจ่ายพลังงานที่มีอยู่ได้อย่างราบรื่น การเดินสายเคเบิลได้รับการดูแลให้สอดคล้องกันโดยใช้ตัวรับส่งสัญญาณ QSFP-DD พร้อมด้วยเข้ากันได้ 920-9B210-00FN-0D0ออพติคได้รับการตรวจสอบทั่วทั้งงบประมาณการเชื่อมต่อ รวมถึงการเชื่อมต่อแบบกระดูกสันหลังถึงใบไม้ที่ทอดยาวถึง 100 เมตร

แนวทางการปรับใช้: การบูรณาการทีละขั้นตอน

  • ระยะที่ 1 – การตรวจสอบห้องปฏิบัติการ:ทดสอบขนาดเล็กที่มีโหนด GPU 8 ตัวและสวิตช์สองตัวเพื่อวัดประสิทธิภาพเวลาแฝงและปริมาณงาน ที่NVIDIA เมลลาน็อกซ์ 920-9B210-00FN-0D0แสดงให้เห็นถึงเวลาแฝงของสวิตช์ sub-600ns ซึ่งเพิ่มขึ้น 60% เมื่อเทียบกับรุ่น HDR รุ่นก่อนหน้า
  • ระยะที่ 2 – การเปิดตัวแบบทีละขั้น:ทีมย้ายพ็อดการฝึกอบรมทีละรายการ โดยใช้ Unified Fabric Manager ของ NVIDIA เพื่อตรวจสอบความสมบูรณ์ของลิงก์และความแออัดในแบบเรียลไทม์ ซึ่งช่วยลดการหยุดชะงักของปริมาณงานการผลิตที่กำลังดำเนินอยู่ให้เหลือน้อยที่สุด
  • ระยะที่ 3 – การบูรณาการเต็มรูปแบบ:สวิตช์ทั้ง 18 ตัวถูกใช้งานบนชั้นวาง 3 ชั้น ทำให้เกิดกระดูกสันหลังที่ไม่มีการปิดกั้นโดยสมบูรณ์พร้อมอัปลิงก์ 400Gb/s เปิดใช้งานการกำหนดเส้นทางแบบปรับได้เพื่อสร้างสมดุลการรับส่งข้อมูลแบบไดนามิก และหลีกเลี่ยงการสมัครสมาชิกมากเกินไปในระหว่างการส่งงานที่มีปริมาณสูงสุด

ตลอดการใช้งาน ทีมวิศวกร กล่าวถึงอย่างครอบคลุมข้อมูลจำเพาะ 920-9B210-00FN-0D0เพื่อปรับแต่งการตั้งค่าบัฟเฟอร์และพารามิเตอร์ควบคุมความแออัด การวัดและส่งข้อมูลทางไกลขั้นสูงของสวิตช์ช่วยให้มองเห็นจำนวนข้อผิดพลาดต่อพอร์ตและการใช้งานลิงก์ได้อย่างละเอียด ช่วยให้สามารถบำรุงรักษาเชิงรุกและวางแผนความจุได้

ผลลัพธ์ที่วัดได้และผลประโยชน์ในการดำเนินงาน

ภายในสองสัปดาห์ของการใช้งานเต็มรูปแบบ การปรับปรุงก็เป็นรูปธรรม ลดเวลาเสร็จสิ้นทั้งหมดสำหรับงานฝึกอบรม 1,024-GPU มาตรฐานลดลงจาก 12.3 วินาทีเหลือ 7.8 วินาที ซึ่งคิดเป็นค่าใช้จ่ายในการสื่อสารที่ลดลง 37% เวลาทำงานให้เสร็จสิ้นสำหรับโมเดลสไตล์ GPT ทั่วไปดีขึ้นเกือบ 30% ช่วยให้ทีมวิจัยทำซ้ำได้เร็วขึ้นและทำการทดลองได้มากขึ้นต่อสัปดาห์ เอ็นจิ้น SHARPv3 ในตัวช่วยลดภาระการดำเนินงานโดยรวมโดยเฉลี่ย 18% แปลโดยตรงไปยังการใช้งาน GPU ที่สูงขึ้น และการใช้พลังงานที่ลดลงต่อการฝึกซ้อม

ในการปฏิบัติงาน ทีมไอทีรายงานความล้มเหลวของงานที่เกี่ยวข้องกับเครือข่ายน้อยลง และใช้เวลาน้อยลงอย่างมากในการวินิจฉัยปัญหาระดับลิงก์ ที่โซลูชัน OPN สวิตช์ InfiniBand 920-9B210-00FN-0D0ได้รับการพิสูจน์แล้วว่ามีเสถียรภาพอย่างน่าทึ่ง โดยไม่มีการหยุดทำงานโดยไม่ได้วางแผนไว้เป็นศูนย์ในช่วงระยะเวลาสังเกตการณ์สามเดือน อินเทอร์เฟซการจัดการแบบรวมช่วยลดช่วงการเรียนรู้สำหรับทีมปฏิบัติการเครือข่าย ซึ่งขณะนี้สามารถจัดการแฟบริคทั้งหมดผ่านบานหน้าต่างเดียว

ข้อพิจารณาด้านต้นทุนและการจัดซื้อจัดจ้าง

ในขณะที่เบื้องต้นราคา 920-9B210-00FN-0D0วางตำแหน่งสวิตช์ไว้ที่ระดับพรีเมี่ยมของตลาด การวิเคราะห์ต้นทุนการเป็นเจ้าของโดยรวมบอกเล่าเรื่องราวที่แตกต่างออกไป ด้วยการลดเวลาทำงานให้เสร็จสิ้นและปรับปรุงการใช้งาน GPU องค์กรจึงสามารถลดต้นทุนอินสแตนซ์ระบบคลาวด์ลงได้ 22% สำหรับความสามารถในการประมวลผลที่เทียบเท่ากัน นอกจากนี้ขาย 920-9B210-00FN-0D0ผ่านพันธมิตรช่องทางหลายรายทำให้เกิดการเสนอราคาที่แข่งขันได้ และความมุ่งมั่นในการสนับสนุนระยะยาวจาก NVIDIA Mellanox ให้ความมั่นใจในการลงทุน

สรุปและแนวโน้ม: พิมพ์เขียวสำหรับโครงสร้างพื้นฐาน AI รุ่นต่อไป

การติดตั้งใช้งานของเมลลาน็อกซ์ (NVIDIA เมลลาน็อกซ์) 920-9B210-00FN-0D0ที่ศูนย์วิจัย AI ขนาดใหญ่แห่งนี้ ทำหน้าที่เป็นสถาปัตยกรรมอ้างอิงที่น่าสนใจสำหรับองค์กรที่เผชิญกับความท้าทายในการเชื่อมต่อที่คล้ายคลึงกัน การรวมกันของความเร็ว NDR 400Gb/s เวลาแฝงต่ำกว่าไมโครวินาที และความสามารถในการประมวลผลในเครือข่าย ช่วยแก้ไขจุดบกพร่องหลักของคลัสเตอร์ HPC และ AI ที่ใช้ RDMA สถาปนิกเครือข่ายจะประทับใจกับความยืดหยุ่นของ920-9B210-00FN-0D0 สวิตช์ InfiniBand OPNในโทโพโลยีต่างๆ ในขณะที่ผู้จัดการฝ่ายไอทีสามารถพึ่งพาเครื่องมือการจัดการที่แข็งแกร่งและครอบคลุมได้เอกสารข้อมูลสินค้า 920-9B210-00FN-0D0สำหรับการวางแผนกำลังการผลิต

เมื่อมองไปข้างหน้า องค์กรกำลังวางแผนที่จะขยายแฟบริคเพื่อรองรับคลัสเตอร์ GPU ที่ใหญ่ขึ้น รวมถึงการบูรณาการ BlueField-3 DPUs สำหรับออฟโหลดพื้นที่จัดเก็บเพิ่มเติมและการแยกความปลอดภัย ที่เข้ากันได้ 920-9B210-00FN-0D0ระบบนิเวศทำให้มั่นใจได้ว่าการอัพเกรดในอนาคต ไม่ว่าจะเป็น NIC หรือเทคโนโลยีออปติคัลที่ใหม่กว่า จะได้รับการสนับสนุนอย่างราบรื่น สำหรับองค์กรใดๆ ที่ใช้ปริมาณงาน AI หรือ HPC ขนาดใหญ่ สวิตช์นี้ไม่เพียงแสดงถึงการอัปเกรดส่วนเพิ่มเท่านั้น แต่ยังเป็นตัวช่วยพื้นฐานสำหรับประสิทธิภาพในวงกว้างอีกด้วย