วันนี้ลองแวะมาฟังช่วงนี้กัดฟันถอย 5070 มาลอง Local LLM และสนใจ Model Qwen ด้วย เลยอยากมาลอง
Alibaba Cloud - Token Plan

- รวม Model ค่ายจีนมั้งหมด api เดี่ยวได้หมด
- kimi deepseek glm qwen
- พวก image gen qwen / wan Vdo HappyHorse / Qwen Audio Tools Calling qwen 3.6 เป็น multi model ทำ ocr ได้นะ - Pricing Option - Personal $6-68 usd / Corporate(20-200) แบบ per seat
- Easy Integration กับ tool ClaudeCode / Open Code / QCoder เป็นต้น และ
- Enterpise Security (Model Studio)
AGICAFET - Qwen Use Case in Enterprises / University
Speaker Natdhanai Praneenatthavee
สำหรับหัวข้อนี้คุณ Job เล่าการใช้ Qwen ใน 3 มุม
📌 Enterprises
- การปรับให้ Tools อย่าง Claude Code มาใช้ Model ของค่ายอื่นๆ แทน ในที่นี้ตัว Alibaba Cloud - Token Plan มันช่วยลดค่าใช้จ่ายลงได้ถึง 3 เท่า เมื่อเทียบกับเจ้าอื่น ตัวอย่างเช่น จากเดิมที่เคยจ่ายประมาณ 600 ดอลลาร์ต่อเดือน ลดลงเหลือเพียงประมาณ 200
- Flow ทำ Agentic App ตามรูปเลย
- Model Qwen ทำงานได้ดี อย่าง Qwen
- Context Window สูงถึง 1 ล้าน
- Multimodal Capabilities Qwen 3.6 ++ ทำ OCR ได้ในตัว
- Thinking Level ปรับให้เหมาะสมกับงาน เพื่อลดเวลา และ cost ด้วย
- เหมาะสำหรับ Long-running Agent - นอกจากมี token per sec แล้ว matrix ของภาษาด้วย อย่าง Thai Per Second

📌 University
- มีการทำ MOU กับมหาวิทยาลัยธรรมศาสตร์ และใช้ Credit AI จาก Token Plan ไปให้น้องลองได้ Idea จะได้ อาทิ Fraud Detection / Scoring Systems / Chatbot & Discord Integration เป็นต้น โดยมีการแนะนำเทคนิค Routing Model (การสลับใช้โมเดลตามความเหมาะสมของงาน
📌 Physical AI


- สำหรับอันนี้เป็นการแชร์อีก Idea นึงในการนำ AI มาใช้ โดยจะ robot เล็ก Spec ตามรูป
- โดยมี Input (Mic) / Output (Speaker)
- ซึ่งไม่ได้ใช้ Model เดียวนะ แต่ประกอบไปด้วยหลาย Model มาจากส่วน Token Plan / Model Builder (Free Tier)
| ROLE | MODEL |
| หู - Speech-text | qwen3-asr-flash (Model Builder) |
| สมอง - Brain | qwen3.8-max-preview (Token Plan) |
| ปาก - Text-speech | qwen3-tts-flash (Model Builder) |
| ตา - Vision | qwen3.8 multimodal (Token Plan) |
| เส้นทาง - Routing | text-embedding-v3 (Model Builder) |
- แล้วที่นี้การเอา Model หลายอันมาใช้ร่วมกัน ส่วนของการตอบสนอง ในที่นี้ WaitTime = Routing+ASR+Brain+TTS ซึ่งการลดเวลาส่วน Routing
- เดิม ใช้ LLM มันมี Latency เยอะ
- ใหม่ ใช้ vLLM Semantic Router ที่ใช้เทคนิคหาความเหมือนของคำ อย่างพวก Cosine Similarity
Agentic Payments
Speaker Dome Charoenyost
📌 Vibe Code Story

- Qwen Code (Qwen Code Extension + VS Code) เข้ามาช่วยอะไรบ้าง อย่างอันนี้พี่โดมเล่า Use Case การใช้ MarketMarker ใน Hyperliquid มันมีค่าใช้จ่ายรายเดือนที่สุง 2500 usd แต่ได้ใช้ตัว qwen code (0.3 usd per day) + telegram bot vm-Hetzner Cloud (5usd)
- จากนั้นย้ายมาใช้ zcode - terminal เดียวแบบ iterm เดียวมันจัดการต่อเอง
- นอกจาก Claude Design มี kimi / zcode ทำ slide ได้
📌 Agentic Payments
Trend 3 อันที่มาแน่ local model / agent / agentic paymemt (mpp)
จากนั้นเป็น Demo
- เริ่มจาก Skill (https://mpp.thaichain.org/SKILL.md) + thaiCraw + 12B Model
- Step wallet tcs cash
- เติมเงินเข้าไป ตรงมีประเด็นอยู่ Agent ถือ Private / privy (wallet as bank)
- ที่นี้ ถ้ามี api เราเก็บเงินได้เลย เราให้ API ตอบกลับไปเลย โดยที่ทั้งหมด On Chain นะ
ย้อนมาเล่า Slide โดยพื้นฐานของ Agentic Payments มาจาก HTTP 402 (Payment Required) ตั้งแต่ปี 1999 แล้ว แต่ยังไม่มีการนำมาใช้จริงจัง
- จนมาถึงยุคของ Cryptocurrency - Coinbase สร้าง Base ซึ่งเป็น Layer 2 บน Ethereum และ Protocal X402 เพื่อให้ Web 2.0 (เช่น Agoda) สามารถรับชำระเงินผ่าน Blockchain โดยไม่ต้องจัดการ Chain เอง Coinbase เสนอตัวเป็น "Facilitator"ถ้า API Return 402 ระบบแสดงช่องทางการโอนให้ Crypto แต่มีปัญหา
- ออกแบบมาเพื่อคนใช้ ยังไม่ใช่ยุคของ Agent
- ความช้าของ Ethereum ออกของช้า / Sequential Nonce ของ Gas Fee ถ้ารายการมาลำดับไม่ต่อเนื่องกันรายการจะ Pending และช้า - Stripe เสนอตัว MPP เป็น Protocal กลางที่มาและนำเสนอ Tempo ซึ่งเป็น Blockchain ยุคใหม่ขึ้นมาช่วยแก้ปัญหาความช้าของ Ethereum
- มุม AI Agent มี Skill เติมไว้ให้ และตัว MPP เปิดช่องให้ทำงานได้ Automate มากขึ้น และแก้เรื่อง Sequential Nonce มีกำหนด timeout เพิ่มมาใน Tempo ืทำให้ TPS สูงขึ้น
- รองรับการชำระเงินด้วย USDC
- Payment Models - one-time / pay-as-you-go / streamed
- MPX Server เป็น NPM Package ที่ช่วยให้สามารถเขียนโค้ดเพื่อรับชำระเงินผ่าน API ได้ง่าย
- นอกจากนี้ ถ้าอยากรู้ว่าใครประกาศชำระเงิน mpp ดูจาก mppscan.com / mppscan.thaichain.org
สำหรับในไทย การทำระบบแบบนี้ อาจจะต้องมาดูเรื่อง Regulation ก่อนว่าออกเหรียญ เพื่อทำอะไร
- กลต - ดูแล Investment Token (เช่น JFin) / Utility Token (Loyalty Point อย่าง J Point)
- ธนาคารแห่งประเทศไทย - BOT ดูแลเหรียญที่เป็น Stablecoin แต่มีข้อยกเว้น ถ้าใช้วงจำกัด แต่ใน Game เอาไปโลกจริงไม่ได้ทำได้
เลยมี Idea ถ้าเราอยากย้ายระบบ J Point มาบน Chain + AI Agent ต้องมีการวางการรองรับนอกจากย้ายมา Tempo ที่เป็น mpp แล้ว ต้องมาคุยมุมของ Best Practice ควรให้ AI Agent เข้าถุึง Private Key หรือ ทำได้แบบมีเงื่อนไข centralize wallet platform
นอกจากนี้มีตัว https://th.vote/ ที่เอา Idea MPP มาทำเหมือนกัน โดย Thaichain เป็นมูลนิธี เข้ามาทำในส่วนี้ ซึ่งส่วน ความปลอดภัยและ KYC ผู้ที่ต้องการตั้งโหวตต้องเสียค่าธรรมเนียม (เช่น 300 TCS) และต้องผ่านการยืนยันตัวตน (KYC) เพื่อป้องกันการตั้งโหวตที่ผิดกฎหมายหรือไร้สาระ
Ref: Demo https://www.facebook.com/share/v/1D28hRaDZF/
DataKarate - Qwen for Large Enterprise SDLC View
Speaker คุณเปรม โชติพานิช
Project ใหญ่ ไม่จนใน Prompt เดียว เลยเป็นที่มาของ CLI อย่าง Claude Code และ หลายเจ้า อย่าง Qwen Code มาช่วย การจัดการแต่ละ Feature / Dependency & Reletion
สำหรับการพัฒนา Software มี Flow มาตรฐานมาช่วยอย่าง SDLC โดยรายละเอียด สำหรับยุต Agentic ดังนี้
📌 Requirememt
- สมัยก่อน dev มาแยกกันไปคนยุค ยุคนี้เอา Agent มา Run เชื่อม Workflow
- มี Skill ดังนี้ grill-me / grill-with-doc
จุดอ่อน เราคุยกับ AI แต่การทำงานจริง คุยกับหลายฝ่าย และประชุมกันอีก


เลยมีท่ามาช่วยเสริม
- to-questionare กระจายคำถาม ให้ Stacker Holder (Customer) มาช่วยยืนยัน มันจะได้พวก meeting agenda ด้วย
- Agent Debates Patterns หาจุดสมดุลระหว่าง Biz / Tech แปะรูป paper ตาราง มาหาจุดลงตัว เช่น เร็ว เท่าไหร่ ท่าอะไร และ cost
- Finite State Machine บอกภาพส่า แต่บะ Tx มี State การไหลของข้อมูลอย่างไร และแต่ละจุด User มี Interaction อย่าวไร เอา agent ทำ html ออกมาได้ มุม se fsm เปผ้นะนฐานนะ
- เคส Change Req / Hotfix / bug fix ต้องเข้า loop นี้มา link relation ปรับ แล้ว มีอะไร แจกด้วยไหใป
📌Design Req -Plan To Executable Task
- to-spec - บอกว่า ทำอะไร ย่อยๆบ้าง ว่า feature อะไร tech ไหน Descision Note อะไร
- to-tickets เป็น skill ที่ช่วยเอา Task (Epic》User Story 》sub task) ลงใน managememt tools อย่าง jira / github issue
- หรือ ใช้พวก spec-kit ก็ได้ แต่อันก่อนหน้า เบาสุด
📌Develop
- บอกให้ดึง jira ทำ ต้องกำหนด skill บอกให้ทำ ลดการเอา markdown ใน repo มาอยู่ใน jira centralize มากกว่าProgressive Disclosire (Epic 》 Story 》Sub Task)
- แบ่ง Sub Agent ยังไง
- WorkTree copy ให้ Agent แต่ Disk จะโตมาก
- มีอีกท่า ให้ Git Sub Module (ท่า Control Plane) Idea มาจากการออกแบบระบบใหญ่ มีหลาย Service และมี msg queue มา syncเรื่อง Design ไม่มบ้ Control pane และ spot จุดเดว - Testing
- (Unit / e2e) Unit Test - Test Gen / Coverage Control
- e2e -regression / automate browser (slelnium / playwrite) แต่ consume token เยอะ Perfromamce
- Maintain - Load Test / Smoke Test / Security Test / Code Review แยก context agent code + code review เพื่อกันมันแอบโกง เทคนิค new session ใน code ทำ docstring มาอธิบาย
- ถ้ามี ai agent ต้อง ทำ test eval ด้วย
📌Deploy
- ใช้ cli เพื่อความเสถีนร อย่าง alibaba
aliyun --helpทำ iac gen iac เห็นภาพรวม SAC Docker deploy ServerlessPolarDBAI Model builderหรือ scale ACK (Kune) + ApsaraDB + AI gateway (Higress)
📌Maintain
- Qwen Code มาตาม Monitor ก็ได้
- ควรเล็กๆ อย่าง OpenCraw / HiCraw แยก Log ตาม Level


จากนั้นเป็น Demo ERP App ที่ทำมาจาก Qwen 3.7 max model
AI Medical - Qwen in Healthcare
Speaker Arnon Tawong
📌Pain Point
- ปกติโรงพยาบาลหลายแห มีคนมารักษาก่อน แล้วโรงพยาบาลสำรองจ่ายไปก่อน ตามสิทธิตาม แล้วค่อยมาเบิกจากส่วนกลางตามหลัง
- แพทย์ รายงานสรุปการรักษา เพื่อนำไปเบิกจ่ายงบประมาณจากส่วนกลาง แต่รายงานเขียนไม่ละเอียดหรือไม่สมเหตุสมผล โรงพยาบาลจะถูกปฏิเสธการเบิกจ่าย ทำให้สูญเสียรายได้
เลยเป็นที่มา จะเอา Local LLM มาใข้อย่างไร ข้อมูลเข้าข่าย PDPA และ โรงพยาบาล Internet ช้ามากก
Local LLM เป็นไปได้สำหรับ Inference Model แบบ FP-4 สเปคตามรูปเลย

สำหรับเคสนี้ เนื่องจากเป็นงานด่วน และประหยัดที่สุดเลยเลือก NVIDIA DGX Spark
📌Solution ทำระบบชื่อยุสุ (แมวส้ม) ซึ่งประกอบไปด้วย
- Local LLM
- NVIDIA DGX Spark ใช้ Model Qwen3.6 35B A3B NVFP4 โดยเป็นตัวที่มาจาก RedhatAI ปรับแล้วภาษาไทยดีกว่า และเป็น Multi Model ทำพวก OCR ได้ด้วย
- ทดสอบแบบ Concurrent สามารถทำความเร็ว (Tokens per second) ได้ดีมาก แม้จะมีผู้ใช้งานพร้อมกันถึง 20-64 คน และปรับ KV-Cache เผื่อ
- และมี Resource เหลือให้ Tools อื่นๆ อย่าง Claude Code

- Chat Web
- พวกข้อมูลกฏต่างๆ ที่เอามาทำ Grouding ใช้ตัว wiki.js + ocr pdf ภาษาไทย จากตัว Model Typhoon
- ทำ GuardRail บอกว่า Role ไหน เข้าข้อมูลส่วนไหนได้บ้าง แพทย์ เภสัช มาจาก Rule ของโรงพยาบาล
- Agent แยกเรื่องนี้ และคุยส่วนตัว อย่างแม่หมอ ถามหวย ดูดวง gamification ช่วยส่งเสริมการเรียนรู้ ai
- พวกหน้าจอ Report ต่างๆ มีเอา AI มาช่วยอย่างตัว รายงานสรุปการรักษา มี AI แนะนำให้ แต่ Human In The Loop อ่านและตรวจสอบขั้นตอนสุดท้าย
- ตัว Agent เข้าไปอ่าน DB HOSxP ได้
- นอกจากกมี cron job การช้อมูลการวินิจฉัย มาเป็น flow update knowledge ใน AI (Confident > 90%) - Challenge
- Clean Data ใน HOSxP ดูก่อนว่าอะไรประหลาดไหม และปรับ
- ต่อไป upskill คนแต่ละสายเข้าใจ ai มากขึ้น เอาตัว แม่หมอ gamification
- ภาษาไทย บางททีพวกสระ วรรณยุกต์ตกไปอย่าง Model ของ PrismaQuant แรงกว่าจริง แต่ภาษาไทยตกเลยต้องเอาของ RedhatAI แทน
นอกจากนี้มีคนเสนอให้ลอง Pathumma LLM ให้มาลอง รวมถึงการไปเชื่อมกับข้อมูลอื่นๆ Motion ของผู้ป่วย และมี Idea อยากมาช่วยภาครัฐ เป็นมูลนิธฺิ แบบฝั่งพี่โดม หรือ คนจากฝั่งการศึกษา
Local Qwen Low Latency
Speaker poonpipat changkawain
สำหรับการ Run Model แบบ Local มีเทคนิคที่ช่วยให้ Model สามารถทำงานได้ดีบนข้อจำกัดของ HW พวก GPU RAM 4 อัน ได้แก่
1. Quantization
- การแปลงค่า Weight (น้ำหนัก) ของ AI ในแต่ละ Layer จากเดิมที่เป็นเลขทศนิยมละเอียดๆ ซึ่งคำนวณยากและช้า ให้กลายเป็นตัวเลขที่ง่ายขึ้น เช่น จากทศนิยม 16 ตำแหน่งเหลือ 4 หรือ ตัดทิ้งเลย
- คำนวณในแต่ละ Layer เร็วขึ้นมาก ช่วยลด Latency ลงได้ประมาณ 2 เท่า (แล้วแต่ Model + HW)
- ข้อแลกเปลี่ยน: ความแม่นยำ (Accuracy) อาจลดลงบ้าง แต่สามารถแก้ไขได้ด้วยการทำ Warm up หรือการทดสอบซ้ำเพื่อให้ AI ชินกับงานเฉพาะด้านของเรา
2. Low-rank Factorization
- แบ่ง Weight ขนาดใหญ่ออกเป็น 2 ก้อนย่อย (เช่น A และ B) เมื่อนำมาคุณกลับผลลัพธ์ใหล้เคียงเดิม พอลดขนาด Weight ที่ใหญ่่ ลงเป็น 2 ชุดเล็กทำให้ VRAM ลงได้ถึง 2 เท่า
- การค่าที่ตัด ค่ายิงน้อยจะยิ่งดี โดยใช้ Self-learning มาช่วยสกัดตัวแปร
3. Knowledge Distillation
- เอา Model ใหญ่มาติวเข็มกับ Model เล็กๆ ทำให้ผลลัพธ์ที่ได้ดีขึ้น
- แต่วิธีการนี้ความยากการเตรียมข้อมูล และ HW สำหรับ Train Model - knwledge มันจะเฉพาะทาว มากขึ้น
4. Pruning
- เบื่องหลังมันเป็น Neural Network ของใน Transformer ลองดูว่าหลังลองทดสอบแล้ว มี Param ไหน หรือ Layer ไหนไม่มีการเรียกใช้เลย ตัดออกได้ โดยหลัก ตัดเวทที่เข้าใกล้ 0 / ตัดทั้งเลเยอร์หรือก้อนเวท
- ช่วยให้โมเดลประมวลผลได้เร็วขึ้น แต่เป็นวิธีที่ซับซ้อนและวุ่นวายที่สุด
การเลือกใช้เทคนิคเหล่านี้เป็นการ Trade-off ระหว่างความเร็ว ความแม่นยำ และความยากในการทำ โดยเป้าหมายไม่ใช่การมีโมเดลที่ใหญ่ที่สุด แต่คือโมเดลที่ คุ้มค่าและตอบโจทย์ธุรกิจ ขององค์กรมากที่สุด
Discover more from naiwaen@DebuggingSoft
Subscribe to get the latest posts sent to your email.



