จดๆจาก Cloud Native Bangkok: Cloud Native AI (AUG-2026)

Building Inference Workloads with vLLM on Kubernetes (EKS) Speaker: Patis Piriyahaphan, Dasapich Thongnopnua, Mongkol Thongkraikaew, Fukiat Julnual 📌AI Project หลายๆอันที่เปิดตัวกันมาเยอะ และ ไปเงียบหายไป สาเหตุหลักๆมาจาก 2 ส่วน 📌รูปแบบของ AI Project มันเปลี่ยนไปด้วย 📌ทำไมต้อง K8S + Self Host 📌ถ้าเราจะ Self Host และติดต้องถึงอะไรบ้าง 📌Reference Arch ถ้าไม่รู้จะเริ่มยังไงดู Reference Arch ได้ 📌แล้ว ถ้าต้อง Scale Cluster ? มันช่วยได้จริงไหม ต้องเข้าใจก่อนการ Scale ช่วยได้ แต่ผู้ใช้เดิมต้องอยู่ที่ Node เดิม ส่วนคนใหม่ให้ไปที่ Node อื่น เพราะเคสของ AI มันที่เป็น Multi Turn มันต้องกับไปคุยต่อที่ Node เดิม ไม่งั้นมันจะหา KV Cache เดิมไม่เจอ แล้วเอ่อ ต้องมีของมาช่วยจัดการ นอกจากนี้ต้องเข้าใจกระบวนการทำการของ Model ด้วย จากปัญหาข้างต้นเอา KServe มาช่วยได้ รองรับ Inference ได้หลายตัวอย่าง vLLM / llm-d.ai เป็นต้น ซึ่งมาช่วย Auto Scale / Prefix Cache / Distribute Prefill Decode / Multi Node…








