โครงการ Data Superhighway for AI
Proxmox VE + GPU

Project overview

เรื่องราวและที่มาของโครงการ (The Story)

มหาวิทยาลัยมีความต้องการยกระดับโครงสร้างพื้นฐานด้านไอทีเพื่อรองรับการประมวลผลประสิทธิภาพสูง (High-Performance Computing – HPC) โดยเฉพาะในด้าน AI, Data Science และการวิจัยขั้นสูง ที่ต้องใช้พลังจาก GPU จำนวนมาก โครงการนี้จึงเป็นการออกแบบระบบ Virtualization (Proxmox VE) ที่มีความเสถียรสูงและมีช่องสัญญาณการรับส่งข้อมูลที่รวดเร็ว (High Throughput) เพื่อตอบโจทย์การใช้งานของนักศึกษาและนักวิจัย

Challenges & constraints

ความท้าทายที่โครงการต้องจัดการดังนี้:

Projects solution

เราใช้เทคโนโลยีระดับ Enterprise เพื่อแก้ปัญหาข้างต้น ดังนี้:

1. ขุมพลังประมวลผล (Compute Stack)

  • ใช้เซิร์ฟเวอร์ SuperMicro SYS-421GE ซึ่งเป็น GPU Server ระดับสูง

  • ใช้เทคนิค PCI-Passthrough เพื่อให้ Virtual Machines (VM) สามารถเข้าถึง GPU โดยตรงเสมือนใช้งานบน Hardware จริง ลดการสูญเสียประสิทธิภาพ

2. ระบบเครือข่ายความเร็วสูง (High-Speed Network)

  • ใช้ Aruba CX8100 จำนวน 2 ชุด ทำงานร่วมกันเพื่อสร้าง Redundancy

  • เชื่อมต่อระหว่าง Switch (Stacking)ด้วยความเร็ว 100G และเชื่อมต่อ Storage ด้วยสาย 2x 100G (Multi-Path)เพื่อให้มั่นใจว่าไม่มีคอขวดในการเขียน/อ่านข้อมูล

  • เชื่อมต่อเข้ากับ Core Network ของมหาวิทยาลัยผ่าน LACP (2x 10G) เพื่อความเสถียรและการขยายแบนด์วิดท์

3. ระบบจัดเก็บข้อมูลประสิทธิภาพสูง (Storage Solution)

  • เลือกใช้ QSAN Storage ที่เชื่อมต่อแบบ Redundant ผ่านสาย 4x 10G ไปยัง Switch ทั้งสองตัว เพื่อรองรับการเข้าถึงข้อมูลพร้อมกันจากหลาย VM โดยไม่มีอาการหน่วง


 

ผลลัพธ์ที่ได้รับ (The Results)

  • Performance: มหาวิทยาลัยได้ระบบประมวลผลที่ทรงพลัง VM แต่ละตัวสามารถดึงศักยภาพของ GPU มาใช้งานได้อย่างเต็มที่ผ่าน PCI-Passthrough

  • Reliability: ระบบไม่มีจุดอ่อนที่เป็น Single Point of Failure ด้วยการออกแบบ Dual-Switch และการเชื่อมต่อแบบ Redundant ในทุกจุด

  • Scalability: โครงสร้างนี้รองรับการขยายตัวในอนาคตได้ง่าย ทั้งการเพิ่มเซิร์ฟเวอร์ SuperMicro หรือการขยายความจุ Storage

  • Management: มีการแยก Network ออกเป็นสัดส่วนชัดเจน (User, VM, Storage, Management VLAN) ทำให้การดูแลรักษาระบบทำได้ง่ายและปลอดภัย

บทสรุป

โครงการนี้คือการสร้าง “ทางด่วนข้อมูล” ให้กับ “ซูเปอร์คอมพิวเตอร์” ของมหาวิทยาลัย เพื่อขับเคลื่อนงานวิจัยสู่ระดับสากลครับ

0 %

Success Rate

Lets address your questions

เนื่องจากการประมวลผล AI และ Big Data ผ่าน GPU Server (SuperMicro) มีการรับส่งข้อมูลจำนวนมหาศาลระหว่างตัวเครื่องเซิร์ฟเวอร์และระบบจัดเก็บข้อมูล (Storage) การใช้ความเร็ว 100G ช่วยป้องกันการเกิด "คอขวด" (Bottleneck) เพื่อให้ GPU สามารถดึงข้อมูลไปประมวลผลได้ต่อเนื่องโดยไม่ต้องรอการส่งผ่านข้อมูลครับ

ปกติการใช้งานบนระบบเสมือน (VM) จะมีการแบ่งทรัพยากรที่ทำให้ประสิทธิภาพลดลง แต่ PCI-Passthrough ช่วยให้ VM สามารถเข้าถึงและสั่งการ GPU โดยตรงจาก Hardware เสมือนเป็นการเสียบการ์ดจอเข้ากับเครื่องนั้นจริงๆ ผลลัพธ์คือผู้ใช้งานจะได้ประสิทธิภาพความแรงของ GPU เกือบ 100% เหมาะสำหรับงานคำนวณที่ซับซ้อนครับ

ทำงานได้ปกติครับ เพราะมีการออกแบบระบบเครือข่ายแบบ Redundancy โดยใช้ Aruba CX8100 จำนวน 2 ตัว ทำงานคู่ขนานกัน และมีการเชื่อมต่อสายสัญญาณแบบ Stacking ระหว่างกัน หากอุปกรณ์ตัวใดตัวหนึ่งขัดข้อง ระบบจะสลับเส้นทางไปใช้อีกตัวหนึ่งโดยอัตโนมัติ ทำให้ระบบไม่ล่ม (High Availability)

เราใช้ Proxmox VE ทำหน้าที่เป็น Hypervisor โดยออกแบบให้ทำงานเป็น Cluster โดยมี ใช้ฟีเจอร์ที่สำคัญดังนี้

  • ด้าน Performance ใช้ PCI-Passthrough สู่ GPU โดยตรง 
  • ด้านเครือข่าย ใช้ LACP เพื่อขยาย Bandwidth, VLAN เพื่อจัดคุณภาพของสัญญาณและความปลอดภัย
  • ด้าน  I/O ใช้ Multi-Path เพื่อเพิ่ม Throughput และเสถียรภาพ

Project Name

โครงการ Data Superhighway for AI - Proxmox VE + GPU

Category

AI, System

Clients

Walailak University

Date

2 May, 2025

Duration

1 Month

Share:

You have different questions?

Our team will answer all your questions. we ensure a quick response.