NVIDIA Mellanox 980-9I510-00NS00 หนังสือขาวทางเทคนิค
June 5, 2026
เอกสารไวท์เปเปอร์ทางเทคนิคนี้มุ่งเน้นไปที่NVIDIA เมลลาน็อกซ์ 980-9I510-00NS00เป็นองค์ประกอบหลักสำหรับศูนย์ข้อมูลสมัยใหม่และแฟบริคเครือข่ายองค์กร โดยตอบสนองความต้องการที่เพิ่มขึ้นสำหรับเวลาแฝงที่ต่ำตามที่กำหนด ความพร้อมใช้งานสูงแบบแอคทีฟ-แอคทีฟ และการวัดและส่งข้อมูลทางไกลในการดำเนินงานที่มีประสิทธิภาพ โดยไม่ต้องมีความซับซ้อนของการออกแบบที่ใช้แชสซีแบบดั้งเดิมหรือแบบโอเวอร์เลย์
1. การวิเคราะห์ความเป็นมาและความต้องการของโครงการ
ผู้ปฏิบัติงานศูนย์ข้อมูลในปัจจุบันเผชิญกับความท้าทายสามประการที่มาบรรจบกัน ประการแรก การรับส่งข้อมูลตะวันออก-ตะวันตก (เซิร์ฟเวอร์ต่อเซิร์ฟเวอร์และพื้นที่เก็บข้อมูล) ครอบงำอยู่ในขณะนี้ โดยต้องการการส่งต่อที่ไม่สูญเสียและกระวนกระวายใจต่ำ ประการที่สอง ระยะเวลาการบำรุงรักษาลดลงในขณะที่โดเมนที่ล้มเหลวขยาย ลิงก์หรือเหตุการณ์สวิตช์ใดๆ จะต้องมีหน่วยเป็นมิลลิวินาที ประการที่สาม ทีมปฏิบัติงานมีข้อมูลมากมายล้นหลามโดยความสัมพันธ์ระหว่างบันทึก การโพล SNMP และเอาต์พุต CLI ที่แตกต่างกัน เมื่อเร็วๆ นี้ ผู้ให้บริการคลาวด์รายใหญ่ระบุปริมาณว่า 68% ของตั๋วปัญหาที่เกี่ยวข้องกับเครือข่ายเกิดจากการแยกข้อผิดพลาดที่ล่าช้า มากกว่าความล้มเหลวของฮาร์ดแวร์เอง แรงกดดันเหล่านี้ผลักดันให้เกิดความต้องการอุปกรณ์เครือข่ายเฉพาะที่รวมเอาความสามารถของฟิสิคัลเลเยอร์ความเร็วสูงเข้ากับการมองเห็นในตัวและอินเทอร์เฟซที่เป็นมิตรต่อระบบอัตโนมัติ
ข้อกำหนดหลักที่ระบุโดยสถาปนิก ได้แก่ การเฟลโอเวอร์ที่ต่ำกว่า 50 มิลลิวินาที, การวัดและส่งข้อมูลทางไกลที่เร่งด้วยฮาร์ดแวร์, การจัดเตรียมแบบ Zero-Touch (ZTP) และความเข้ากันได้เต็มรูปแบบกับโรงงานออปติกและเคเบิลที่มีอยู่ ที่ผลิตภัณฑ์เครือข่าย 980-9I510-00NS00ได้รับเลือกสำหรับการประเมินเนื่องจากคุณลักษณะของมันตั้งค่าโดยตรงกับความจำเป็นในการปฏิบัติงานเหล่านี้
2. การออกแบบสถาปัตยกรรมเครือข่าย / ระบบโดยรวม
สถาปัตยกรรมที่นำเสนอใช้โทโพโลยีแบบ leaf-spine ที่ปรับให้เหมาะสมสำหรับทั้งการเชื่อมต่อที่มีความน่าเชื่อถือสูงและประสิทธิภาพการดำเนินงาน บล็อกใบไม้แต่ละอันประกอบด้วยสองบล็อกNVIDIA เมลลาน็อกซ์ 980-9I510-00NS00อุปกรณ์ที่กำหนดค่าเป็นคู่ MLAG ซึ่งให้บริการเซิร์ฟเวอร์/โหนดจัดเก็บข้อมูลได้สูงสุด 48 เครื่องผ่านการเชื่อมต่อแบบแยก 100G หรือ 200G เลเยอร์สไปน์ใช้ยูนิต 980-9I510-00NS00 สี่ยูนิตอิสระในการออกแบบ ECMP แบบเต็มเมช โดยให้การสมัครใช้งานเกินขนาด 4:1 สำหรับเวิร์กโหลดวัตถุประสงค์ทั่วไป และ 1:1 สำหรับการจัดเก็บข้อมูล/คลัสเตอร์ AI โปรโตคอลควบคุมทั้งหมด (BGP, EVPN, PFC, ECN) ทำงานโดยตรงบนระนาบข้อมูลฮาร์ดแวร์ ขจัดปัญหาคอขวดของซอฟต์แวร์ที่ช้า
สถาปัตยกรรมเน้นความโปร่งใสแบบ "ชนกันในสาย": การกำหนดที่อยู่เครือข่ายที่มีอยู่ นโยบายความปลอดภัย และเอเจนต์การตรวจสอบยังคงไม่เปลี่ยนแปลง ที่เครือข่ายความเร็วสูงของศูนย์ข้อมูล 980-9I510-00NS00ความสามารถช่วยให้มั่นใจได้ว่าแม้ที่อัตราสาย 200G เวลาแฝงจะยังคงอยู่ต่ำกว่า 600 นาโนวินาทีสำหรับการส่งต่อแบบตัดผ่าน สำหรับการปรับใช้หลายไซต์ สามารถวางอุปกรณ์เดียวกันที่จุดขอบ DCI ได้ ซึ่งรองรับการเข้ารหัส MACsec และการวัดและส่งข้อมูลทางไกลในแถบความถี่ผ่านลิงก์รถไฟใต้ดิน
3. บทบาทและคุณสมบัติหลักของ NVIDIA Mellanox 980-9I510-00NS00
980-9I510-00NS00 ทำหน้าที่เป็นทั้งสวิตช์ระดับบนสุดและองค์ประกอบเชื่อมต่อระหว่างกัน โดยเป็นการรวมเลเยอร์ทางกายภาพและเลเยอร์ลิงก์ข้อมูลเข้าด้วยกัน ความแตกต่างทางเทคนิคที่สำคัญ ได้แก่:
- ความล้มเหลวที่ได้รับความช่วยเหลือจากฮาร์ดแวร์:การเฟลโอเวอร์ของกลุ่มลิงก์ (LAG) ที่ต่ำกว่า 15 มิลลิวินาที โดยไม่ต้องอาศัย STP ที่ช้าหรือตัวจับเวลาแบบโอเวอร์เลย์
- การวางท่อบัฟเฟอร์ลึก:บัฟเฟอร์ที่ใช้ร่วมกันที่กำหนดค่าได้สูงสุดถึง 32MB ต่อกลุ่มพอร์ต ดูดซับการกระจายระดับไมโครทั่วไปใน NVMe/TCP และปริมาณงานการฝึกอบรมแบบกระจาย
- สตรีมมิ่ง Telemetry (gNMI/IPFIX):ความลึกของคิวแบบเรียลไทม์ ตัวนับการดร็อป และจำนวนเฟรม PFC ถูกส่งไปยังตัวรวบรวมที่รายละเอียด 1 วินาที
- การวินิจฉัยสายเคเบิลอัตโนมัติ:อุปกรณ์จะตรวจสอบความสมบูรณ์ของสัญญาณอย่างต่อเนื่อง (สุขภาพของ VCSEL, BER, อุณหภูมิ) และแจ้งว่าออปติกเสื่อมสภาพก่อนที่จะทำให้เกิดปัญหาการเชื่อมต่อ
- ระบบนิเวศอัตโนมัติแบบเปิด:รองรับ SONiC, Cumulus Linux และ Onyx/FAST ของ NVIDIA อย่างเต็มที่ ทำให้สามารถใช้งานไปป์ไลน์โครงสร้างพื้นฐานตามโค้ดได้
ตามที่เอกสารข้อมูลสินค้า 980-9I510-00NS00แพลตฟอร์มดังกล่าวยังรวมถึงการประทับเวลาด้วยฮาร์ดแวร์ (PTP/SyncE) และการติดตามโฟลว์แบบอินไลน์ ซึ่งเป็นคุณสมบัติที่ปกติแล้วจะสงวนไว้สำหรับระบบแชสซีที่มีราคาสูงกว่ามาก
4. คำแนะนำในการปรับใช้และการปรับขนาด (พร้อมโทโพโลยีทั่วไป)
การใช้งานระดับแร็คทั่วไปเป็นไปตามกระบวนการสองขั้นตอนง่ายๆ ขั้นแรก มีการติดตั้งยูนิต 980-9I510-00NS00 สองยูนิตในชั้นวางเดียว เชื่อมต่อกันผ่านลิงก์แบ็คฮอล 200G และเพียร์ลิงก์ MLAG สองลิงก์ เซิร์ฟเวอร์เป็นแบบ dual-homed โดยมีการเชื่อมต่อเดียวไปยังแต่ละ leaf โดยใช้ LACP active-active ประการที่สอง แต่ละคู่ลีฟจะเชื่อมต่อกับสวิตช์สไปน์ทั้งสี่ตัวโดยใช้ลิงก์ 100G หรือ 200G ทำให้เกิดเป็นแฟบริค CLOS ที่ไม่ปิดกั้น สำหรับการปรับขนาดเกินกว่าพอร์ตเซิร์ฟเวอร์ 96 พอร์ต จะมีการเพิ่มคู่ลีฟเพิ่มเติมโดยไม่ต้องกำหนดค่าสไปน์ใหม่ โดยพอร์ตสไปน์จะได้รับการจัดเตรียมไว้ล่วงหน้าเป็นอินเทอร์เฟซ ECMP ที่กำหนดเส้นทาง
ที่ข้อมูลจำเพาะ 980-9I510-00NS00รองรับโหมดการแยกย่อยที่ยืดหยุ่น: 4x50G, 2x100G หรือ 1x200G ต่อฟิสิคัลพอร์ต อนุญาตสภาพแวดล้อมที่มีความเร็วผสม (เช่น ที่เก็บข้อมูล 25G รุ่นเก่าควบคู่ไปกับการประมวลผล 100G ใหม่) สำหรับการปรับใช้บราวน์ฟิลด์ อุปกรณ์นี้มีความสมบูรณ์เข้ากันได้ 980-9I510-00NS00ด้วยออปติก SFP56/SFP112 มาตรฐานอุตสาหกรรม, สายเคเบิล DAC และ AOC ซึ่งช่วยลดความเสี่ยงในการย้ายข้อมูล ในการออกแบบอ้างอิงที่ได้รับการตรวจสอบแล้ว การแลกเปลี่ยนทางการเงินปรับขนาดจาก 4 เป็น 24 leaf pair (พอร์ตเซิร์ฟเวอร์มากกว่า 1,152 พอร์ต) โดยไม่ต้องเปลี่ยนบรรทัดการกำหนดค่าสไปน์เดียว
5. การดำเนินการ การตรวจสอบ การแก้ไขปัญหาและการเพิ่มประสิทธิภาพ
กรอบการทำงานถูกสร้างขึ้นโดยมีเสาหลัก 3 ประการ ได้แก่ การมองเห็นเชิงรุก การตรวจสอบอัตโนมัติ และการแก้ไขที่แนะนำ การวัดและส่งข้อมูลทางไกลแบบสตรีมมิ่งของอุปกรณ์จะป้อนฐานข้อมูลอนุกรมเวลา (สแต็ก Prometheus/TICK) ที่ทริกเกอร์การแจ้งเตือนเมื่อเฟรมหยุดชั่วคราว PFC เกินเกณฑ์ที่กำหนดได้ หรือเมื่อข้อผิดพลาด CRC ของลิงก์มีแนวโน้มสูงขึ้น ข้อมูลการวัดและส่งข้อมูลทางไกลในอดีตยังใช้สำหรับการวางแผนกำลังการผลิตด้วย:โซลูชันผลิตภัณฑ์เครือข่าย 980-9I510-00NS00รวมแดชบอร์ด Grafana ที่สร้างไว้ล่วงหน้าซึ่งแสดงการใช้งานต่อพอร์ต เปอร์เซ็นไทล์การเข้าใช้บัฟเฟอร์ และความสมดุลของโฟลว์แฮช
สำหรับการแก้ไขปัญหา ให้ใช้คำสั่ง CLI เดียว (แสดงการติดตามภายในของฮาร์ดแวร์) จับแพ็กเก็ต 1,000 รายการล่าสุดที่ประสบปัญหาความแออัดหรือข้อผิดพลาด พร้อมด้วยการประทับเวลาที่ความละเอียดระดับนาโนวินาที ซึ่งจะช่วยลดเวลาเฉลี่ยในการวินิจฉัย (MTTD) ได้อย่างมาก คำแนะนำในการเพิ่มประสิทธิภาพ ได้แก่ การเปิดใช้งาน ECN บนพอร์ตที่เชื่อมต่อกับ Fabric ทั้งหมด การตั้งค่าเกณฑ์ PFC เป็น 3/4 ของความลึกบัฟเฟอร์ และการใช้ Dynamic Load Balancing (DLB) ของฮาร์ดแวร์สำหรับการรับส่งข้อมูลแบบซ้อนทับ ทีมปฏิบัติการยังสามารถกำหนดเวลาสคริปต์ "การรับรองความสมบูรณ์" เป็นประจำเพื่อตรวจสอบการกำหนดค่าที่เบี่ยงเบน ความสอดคล้องของเฟิร์มแวร์ และ BER ของสายเคเบิลในอุปกรณ์ทั้งหมด
6. สรุปและการประเมินมูลค่า
กำลังปรับใช้NVIDIA เมลลาน็อกซ์ 980-9I510-00NS00เนื่องจากองค์ประกอบใบ-สันที่รวมเป็นหนึ่งเดียวทำให้เกิดการปรับปรุงที่วัดผลได้ในมิติค่าทั้งสี่:
- ความน่าเชื่อถือ:การเฟลโอเวอร์ที่ต่ำกว่า 15 มิลลิวินาทีที่กำหนดและพฤติกรรม RoCE/ECN แบบไม่สูญเสียช่วยขจัดสิ่งรบกวนที่มองเห็นได้ของแอปพลิเคชันส่วนใหญ่
- ประสิทธิภาพการดำเนินงาน:การวัดและส่งข้อมูลทางไกลแบบสตรีมมิ่งและการวินิจฉัยสายเคเบิลอัตโนมัติช่วยลดความสัมพันธ์ของข้อผิดพลาดด้วยตนเองได้มากกว่า 60%
- ต้นทุนรวมในการเป็นเจ้าของ (TCO):การกำหนดราคารูปแบบคงที่ (ไฟล์ราคา 980-9I510-00NS00โดยทั่วไปจะต่ำกว่าแชสซีแบบโมดูลาร์ 40-50% ต่อพอร์ต 100G) เมื่อรวมกับการจัดเตรียมแบบ Zero-Touch ช่วยลดทั้งต้นทุนและค่าใช้จ่ายในการดำเนินงาน
- การคุ้มครองการลงทุน:อุปกรณ์ถูกทำเครื่องหมายไว้แล้วขาย 980-9I510-00NS00ผ่านช่องทางการจัดจำหน่ายหลักๆ และความเข้ากันได้แบบย้อนหลังทำให้มั่นใจได้ว่าจะให้บริการควบคู่ไปกับเลนส์ 100G ในปัจจุบันและการอัพเกรด 200G/400G ในอนาคต
ที่โซลูชันผลิตภัณฑ์เครือข่าย 980-9I510-00NS00จึงนำเสนอเส้นทางที่ใช้งานได้จริงและปรับใช้ได้ทันทีไปสู่แฟบริคศูนย์ข้อมูลที่มีความน่าเชื่อถือสูงและใช้งานง่าย สถาปนิกเครือข่ายและผู้จัดการฝ่ายไอทีที่ต้องการลดงานในการปฏิบัติงานพร้อมทั้งรับประกันประสิทธิภาพความเร็วของสายควรประเมินแพลตฟอร์มนี้เป็นองค์ประกอบสำคัญของแผนงานโครงสร้างพื้นฐานรุ่นต่อไป

