GPU(หน่วยประมวลผลกราฟิก)

GPU (Graphics Processing Unit) คือชิปเซมิคอนดักเตอร์ที่ประมวลผลการคำนวณแบบขนานจำนวนมากได้อย่างรวดเร็ว เดิมทีได้รับการออกแบบมาเพื่อการเรนเดอร์ภาพกราฟิก แต่ความสามารถในการคำนวณแบบขนานนั้นเหมาะอย่างยิ่งสำหรับการเรียนรู้และการอนุมานของ AI จึงกลายเป็นฮาร์ดแวร์ที่ขาดไม่ได้สำหรับการฝึกและการ fine-tuning ของ LLM ในปัจจุบัน
ทำไมต้องใช้ GPU ไม่ใช่ CPU
CPU ได้รับการปรับแต่งให้เหมาะกับการประมวลผลแบบลำดับที่ซับซ้อน โดยมีจำนวนคอร์เพียงไม่กี่สิบคอร์ ในทางตรงกันข้าม GPU สามารถประมวลผลการคำนวณที่เรียบง่ายได้พร้อมกันด้วยคอร์หลายพันถึงหลายหมื่นคอร์ การเทรน Neural Network นั้นโดยพื้นฐานแล้วคือการทำ Matrix Operation ซ้ำๆ ซึ่งรูปแบบการประมวลผลนี้สอดคล้องกับสถาปัตยกรรมแบบ Parallel ของ GPU
ตัวอย่างเช่น เมื่อเทรน Dense Model ขนาด 70B Parameter จำเป็นต้องคำนวณ Gradient ของแต่ละ Parameter แบบขนานกัน การประมวลผลแบบลำดับด้วย CPU อาจใช้เวลาหลายเดือน แต่ด้วย GPU Cluster สามารถเสร็จสิ้นได้ภายในไม่กี่วันถึงไม่กี่สัปดาห์
ข้อจำกัดของ VRAM
เมื่อพูดถึง GPU ในบริบทของ AI สิ่งที่สำคัญพอๆ กับประสิทธิภาพการคำนวณคือ VRAM (Video RAM) เนื่องจาก Weight และ Activation ทั้งหมดของโมเดลจำเป็นต้องถูกโหลดลงใน VRAM ความจุของ VRAM จึงเป็นตัวกำหนดขีดจำกัดที่แท้จริงของขนาดโมเดล
NVIDIA A100 (80GB) หนึ่งการ์ดสามารถรองรับโมเดลได้ประมาณ 40B Parameter (ในกรณีของ FP16) สำหรับการรัน Dense Model ขนาด 70B ต้องใช้อย่างน้อย 2 การ์ด และหากต้องการเทรนด้วยต้องใช้ 8 การ์ดขึ้นไป สาเหตุที่ LoRA และ QLoRA ได้รับความสนใจก็เพราะสามารถลดการใช้ VRAM ได้อย่างมาก
Cloud vs On-Premises
GPU มีราคาสูง โดย NVIDIA H100 หนึ่งการ์ดมีราคาหลายล้านเยน ดังนั้นหลายบริษัทจึงเลือกใช้ Cloud GPU (AWS, GCP, Azure) แบบ On-Demand แทน อย่างไรก็ตาม ในกรณีที่ต้องทำ Inference ปริมาณมากอย่างต่อเนื่อง การใช้ On-Premises อาจมีความคุ้มค่าด้านต้นทุนมากกว่า และการตัดสินใจในเรื่องนี้มีความสำคัญอย่างยิ่งในการดำเนินงาน Local LLM
บทความที่กล่าวถึงคำศัพท์นี้
- การเปรียบเทียบการติดตั้ง LLM / SLM แบบโลคอล — การใช้ AI โดยไม่พึ่งพา Cloud APIเปรียบเทียบ Open-weight Model เช่น GPT OSS, Phi-4, Llama 4 Scout กับ Cloud API ใน 3 มิติ: GPU, ความแม่นยำ และ TCO พร้อมคู่มือ Local AI เพื่อ Data Sovereignty และลดต้นทุน
- SLM Distillation คืออะไร? วิธีสร้างโมเดลขนาดเล็กเฉพาะทางจาก LLM ขนาดใหญ่เรียนรู้วิธีสร้าง SLM Distillation เพื่อพัฒนาโมเดลขนาดเล็กเฉพาะทางด้วยต้นทุนต่ำ โดยใช้ LLM ขนาดใหญ่เป็นครู พร้อมอธิบายกลไกและขั้นตอนการใช้งานจริง
- PEFT (Parameter-Efficient Fine-Tuning) คืออะไร? เทคนิคลดต้นทุนการปรับแต่ง AI Model ได้ถึง 90%อธิบาย PEFT (Parameter-Efficient Fine-Tuning) และวิธีหลัก (LoRA, QLoRA, Adapter) สำหรับผู้บริหาร พร้อมกรณีศึกษา GPU และแนวทางตัดสินใจลงทุน
- Model Merge คืออะไร? เทคนิคเพิ่มประสิทธิภาพ LLM โดยรวมโมเดลเข้าด้วยกันโดยไม่ต้องเทรนใหม่อธิบายกลไกและวิธีใช้งาน Model Merging เพื่อรวมโมเดลที่ Fine-tuning แล้วเข้าด้วยกัน ช่วยผสานทักษะหลากหลายโดยลดต้นทุนการคำนวณได้อย่างมีประสิทธิภาพ
คำศัพท์ที่เกี่ยวข้อง

NDVI
NDVI (Normalized Difference Vegetation Index · ดัชนีพืชพรรณแบบนอร์มอลไลซ์) คือดัชนีที่ได้จากการนอร์ม

Sentinel-2
Sentinel-2 คือดาวเทียมสำรวจโลกในโครงการ Copernicus ที่นำโดย ESA (องค์การอวกาศยุโรป) ทำการบันทึกภาพ m

ประทัด
Firecracker คือ Virtual Machine Monitor (VMM) โอเพนซอร์สที่พัฒนาโดย AWS ซึ่งสามารถเริ่มต้น microVM ท

การสำรวจระยะไกล
การสำรวจระยะไกล (Remote Sensing) คือ เทคโนโลยีที่ใช้ดาวเทียม อากาศยาน หรือโดรนที่ติดตั้งเซนเซอร์ เพื



