Petaflop ของเรานั้นไม่เท่ากัน

ช่วงนี้เห็นมี Ads เยอะ แบบขายเครื่อง XXX สามารถ Run AI ได้ 1 Petaflop เหมือนมีเครื่อง Super Computer อยู่ที่บ้านคุณเอง แต่ทว่าพอเอา Model เดียวกัน แต่ความละเอียดต่างกัน ความเร็วในการตอบสนองต่างกันมากโขเลย

FLOPS คือ อะไร

FLOPS (Floating-Point Operations Per Second) มองว่าเป็นการวัดว่าใน 1 วินาที ตัวหน่วยประมวลผลของเราไม่ว่าจะเป็น GPU / NPU / CPU ว่าจะคำนวณจุดทศนิยมได้เยอะแค่ไหน นั้นเอง

Floating Point คือ อะไร

Floating Point ระบบการจัดเก็บข้อมูลตัวเลขในคอมพิวเตอร์สำหรับค่าที่มีจุดทศนิยมหรือตัวเลขที่มีค่ามาก/น้อยมากๆ เท่าที่จะเก็บตรงๆ แบบพวก Scientific Notation อันนี้ผมย้อนกลับไป ปี1 เครื่อง LC-3 เค้าจะมีอ้างอิงมาตรฐานนึง IEEE 754 แบ่งพื้นทีการเก็บพวก Floating Point ออกเป็น 3 ส่วน

  • sign เครื่องหมาย บวก/ลบ
  • exponent -เลขยกกำลังบอกว่าช่วงค่าใหญ่่ เล็กแค่ไหน
  • mantissa - ความละเอียด ว่าระบุได้กี่หลัก

อีกแบบนอกจาก Floating Point ก็ INT เก็บจำนวนเต็มล้วนๆ ประหยัดพื้นที่สำหรับพวกทิศนิยมลง

ความต่างทั้งหมดมาจากการแบ่งนี้แหละ — ถ้า Bit ยิงน้อย มันจะใช้หน่วยความจำน้อยและคำนวณเร็ว แต่ก็เสียทั้งช่วงค่าและความละเอียดไป

เวลาไปฟังเค้าขาย XXX 1 Petaflop มาจากไหน ?

อันนี้ต้องย้ายไปดูที่ตัว Model กันก่อน พอดีผมไปฟัง Talk หลาย Session เช่น If you need Local what you should know to fit your budget (AgentCamp Bangkok 2026) เป็นต้น เลยได้มาจดๆไว้ ตัว AI Model มันจะมาตรวัดความละเอียดในการคำนวณ ยิ่งทศนิยมเยอะมาก มันจะยิ่งเก่งใช้ Processor / Memory / Disk เยอะตาม ไล่ตามเยอะสุด

📌 FP64 (Double Precision) - ความละเอียดที่ของ Model ที่พวก Supercomputer แบบ HPC ใช้กัน ที่ต้องใช้ละเอียดขนาดนั้น เพราะ

  • Floating-Point Error (ความคลาดเคลื่อนจากการปัดเศษ) มันแทนด้วยเลขฐาน 2 แล้วถ้าคำนวณทดไปเรื่อย ค่า Floating-Point Error มันจะสะสมทดไปที่ละเล็กน้อย
  • งานที่ใช้มันพลาดไม่ได้ เช่น การหาตัวยา คำนวณสภาพอากาศ หรือ ออกแบบเครื่องบิน, จรวด วิถีการยิง เป็นต้น

📌 FP32 (Single Precision) - สำหรับกราฟิก 3D และการเทรน AI ยุคแรกๆ

2 แบบข้างต้นมันใช้ Resource เยอะมากทั้ง CPU GPU RAM Disk ตัองแรงมากๆ แล้วมีเยอะด้วย มาใช้แบบที่ Optimal ที่สุดในตอนนี้

📌 FP16 (Half Precision - 16 bits): ลดจำนวน Bit ลงครึ่งหนึ่ง ทำให้กิน VRAM ลดลง 50% และคำนวณได้เร็วขึ้นมาก แต่ข้อเสียคือมีระยะ (Range) ของตัวเลขที่แคบลง บางครั้งทำให้เกิดปัญหา Underflow/Overflow (ตัวเลขน้อยหรือมากเกินกว่าที่ระบบจะเก็บได้) เวลาเทรนโมเดล

📌 BF16 (Brain Floating Point - 16 bits): ถูกพัฒนาโดย Google เพื่อแก้จุดอ่อนของ FP16 โดยมันจะใช้ ฺBit ในการเก็บ Exponent (ช่วงของตัวเลข) เท่ากับ FP32 แต่ลดความละเอียดของทศนิยม (Mantissa) ลงแทน ซึ่งวิธีนี้เป็นที่นิยมสำหรับการ Train LLM Model เพราะรักษาเสถียรภาพได้ดี

แต่ FP16 / BF16 มันยังใช้ Spec แรงอยู่ดี เลนมี Idea การทำ Quantization เพื่อลดจำนวน Param และความละเอียดลง โดยที่คุณภาพยังรับได้สำหรับ Local Model มี Idea ตามนี้

📌 INT8 (8-bit Integer): แปลงตัวเลขทศนิยม (Floating Point) ให้กลายเป็นจำนวนเต็ม (Integer) ขนาด 8 บิต ลดการใช้ VRAM ลงได้อีกครึ่งหนึ่งจาก FP16

📌 INT4 (4-bit Integer): บีบอัดขั้นสุด ใช้ร่วมกับฟอร์แมตอย่าง GGUF หรือ AWQ ทำให้สามารถรันโมเดลขนาด 7B บนการ์ดจอที่มี VRAM แค่ 6-8GB ได้ แต่อาจจะมีอาการหลอน (Hallucination) หรือตอบคำถามซับซ้อนได้แย่ลง เมื่อเทียบ

📌 FP8 / FP4 (8-bit / 4-bit Floating Point): GPU ยุคใหม่ (เช่น NVIDIA Hopper หรือ Blackwell) รองรับการใช้ทศนิยมคำนวณทศนิยมได้ระดับนึง ทำให้ Model มีความแม่นยำดีกว่าแบบ INT (Integer) ในจำนวนบิตที่เท่ากัน และทีความเร็วการ Inference ได้ไว้ด้วย

ถึงตรงนี้จะเห็นแล้วว่า 1 Petaflop สำหรับ Model FP64 (Super Computer 1 Cluster) / INT4 (PC + GPU สักใบพอ) มันใช้ทรัพยากรต่างกันแค่ไหน

อีกหน่วยวัดที่เจอกัน TOPS vs. TFLOPS

  • TFLOPS (ทศนิยม): วัดจากการคำนวณตัวเลขทศนิยม (Floating-Point) ของ LLM กลุ่ม FP / BP
  • TOPS (จำนวนเต็ม): ย่อมาจาก Tera Operations Per Secondก วัดจากการคำนวณจำนวนของ LLM จะทดสอบบน INT8 (เลขจำนวนเต็ม 8 บิต) หรือ INT4

มันไม่ต้องคิดเยอะ เลยคำนวณได้ไวมา ที่นี้เลยมีคนตีความว่า 1000 TOPS = 1 Petaflop เป็นช่องการขายที่อาจจะอธิบายแค่ความจริงบางส่วนจนเราคิดไปเองว่า ฉันซื่อ Super Computer มาไว้ที่บ้านได้ จริงๆเห็น Review อันนึงที่ขายเครื่องที่มี NPU แล้วคันมือ ซื้อมาก็พลาดเลยนะ

นอกจาก TFLOPS ที่ต้องสนใจแล้ว ยังต้องสนใจ Memory

ถ้าเรา Run บน GPU ต้องเลือกที่ Model ที่เหมาะกับ GPU ของเราด้วย ตอนนี้มันมากสุด 32 GB ถ้าใช้พวก DGX มากสุด 128 GB แต่อย่าลืมว่าเราต้องแบ่ง Memory ทั้งในส่วนของ

  • Model ว่าใช้ไปเท่าไหร่
  • KV Cache พื้นที่ที Model ใช้ทด ถ้าได้ RAM ใกล้กัน จะดีมาก ถ้าข้ามจาก GPU > Mem ปกติ จะเกิดอาการคอขวดได้
  • ต้องเหลือให้ตัว OS หลักมันทำงานได้ด้วยนะ

แม้ว่าตัว AI Runtime หลายๆตัว Ollama / LMStudio จะกำหนดตัว Memory ให้ Model ได้ ว่าใส่ลง GPU เท่าไหร่ Mem อื่นเท่าไหร่

ตอนนี้ราคาของ Hardware พวกนี้น่าจะแพงขึ้นไปเยอะ เพราะ Draft Blog ไว้ตั่งแต่ก่อนสงกรานต์

สรุป 1 Petaflop ไม่ได้เท่ากันเสมอไป เพราะขึ้นอยู่กับ Precision (ความละเอียด) ที่ใช้ ยิ่ง Precision ต่ำ (เช่น FP8/INT4) ตัวเลข TFLOPS/TOPS จะยิ่งพุ่งสูง แต่ความแม่นยำของ Model จะลดลง ดังนั้นเวลาเลือกซื้อเครื่อง อย่าดูแค่เลข Petaflop บนกล่อง HW นั้นพวก DGX / GPU นั้นรองรับ Precision แบบไหน และ VRAM เพียงพอต่อขนาด Model ที่เราจะใช้งานหรือไม่


Discover more from naiwaen@DebuggingSoft

Subscribe to get the latest posts sent to your email.