แวะมาฟัง QWEN3.8 USE CASE SHOW CASE

วันนี้ลองแวะมาฟังช่วงนี้กัดฟันถอย 5070 มาลอง Local LLM และสนใจ Model Qwen ด้วย เลยอยากมาลองฟัง โดยที่จดมาหัวข้อตามนี้ครับ

Alibaba Cloud - Token Plan

  1. รวม Model ค่ายจีนมั้งหมด api เดี่ยวได้หมด
    - kimi deepseek glm qwen
    - พวก image gen qwen / wan Vdo HappyHorse / Qwen Audio Tools Calling qwen 3.6 เป็น multi model ทำ ocr ได้นะ
  2. Pricing Option - Personal $6-68 usd / Corporate(20-200) แบบ per seat
  3. Easy Integration กับ tool ClaudeCode / Open Code / QCoder เป็นต้น และ
  4. Enterpise Security (Model Studio)

AGICAFET - Qwen Use Case in Enterprises / University

Speaker Natdhanai Praneenatthavee

สำหรับหัวข้อนี้คุณ Job เล่าการใช้ Qwen ใน 3 มุม

📌 Enterprises

  • การปรับให้ Tools อย่าง Claude Code มาใช้ Model ของค่ายอื่นๆ แทน ในที่นี้ตัว Alibaba Cloud - Token Plan มันช่วยลดค่าใช้จ่ายลงได้ถึง 3 เท่า เมื่อเทียบกับเจ้าอื่น ตัวอย่างเช่น จากเดิมที่เคยจ่ายประมาณ 600 ดอลลาร์ต่อเดือน ลดลงเหลือเพียงประมาณ 200
  • Flow ทำ Agentic App ตามรูปเลย
  • Model Qwen ทำงานได้ดี อย่าง Qwen
    - Context Window สูงถึง 1 ล้าน
    - Multimodal Capabilities Qwen 3.6 ++ ทำ OCR ได้ในตัว
    - Thinking Level ปรับให้เหมาะสมกับงาน เพื่อลดเวลา และ cost ด้วย
    - เหมาะสำหรับ Long-running Agent
  • นอกจากมี token per sec แล้ว matrix ของภาษาด้วย อย่าง Thai Per Second

📌 University

  • มีการทำ MOU กับมหาวิทยาลัยธรรมศาสตร์ และใช้ Credit AI จาก Token Plan ไปให้น้องลองได้ Idea จะได้ อาทิ Fraud Detection / Scoring Systems / Chatbot & Discord Integration เป็นต้น โดยมีการแนะนำเทคนิค Routing Model การสลับใช้โมเดลตามความเหมาะสมของงาน

📌 Physical AI

  • สำหรับอันนี้เป็นการแชร์อีก Idea นึงในการนำ AI มาใช้ โดยจะ robot เล็ก Spec ตามรูป
  • โดยมี Input (Mic) / Output (Speaker)
  • ซึ่งไม่ได้ใช้ Model เดียวนะ แต่ประกอบไปด้วยหลาย Model มาจากส่วน Token Plan / Model Builder (Free Tier)
ROLEMODEL
หู - Speech-textqwen3-asr-flash (Model Builder)
สมอง - Brainqwen3.8-max-preview (Token Plan)
ปาก - Text-speechqwen3-tts-flash (Model Builder)
ตา - Visionqwen3.8 multimodal (Token Plan)
เส้นทาง - Routingtext-embedding-v3 (Model Builder)
  • แล้วที่นี้การเอา Model หลายอันมาใช้ร่วมกัน ส่วนของการตอบสนอง ในที่นี้ WaitTime = Routing+ASR+Brain+TTS ซึ่งการลดเวลาส่วน Routing
    - เดิม ใช้ LLM มันมี Latency เยอะ
    - ใหม่ ใช้ vLLM Semantic Router ที่ใช้เทคนิคหาความเหมือนของคำ อย่างพวก Cosine Similarity

Agentic Payments

Speaker Dome Charoenyost

📌 Vibe Code Story

  • Qwen Code (Qwen Code Extension + VS Code) เข้ามาช่วยอะไรบ้าง อย่างอันนี้พี่โดมเล่า Use Case การใช้ MarketMarker ใน Hyperliquid มันมีค่าใช้จ่ายรายเดือนที่สุง 2500 usd แต่ได้ใช้ตัว qwen code (0.3 usd per day) + telegram bot vm-Hetzner Cloud (5usd)
  • จากนั้นย้ายมาใช้ zcode - terminal เดียวแบบ iterm เดียวมันจัดการต่อเอง
  • นอกจาก Claude Design มี kimi / zcode ทำ slide ได้

📌 Agentic Payments

Trend 3 อันที่มาแน่ local model / agent / agentic payment (mpp)

จากนั้นเป็น Demo

  • เริ่มจาก Skill (https://mpp.thaichain.org/SKILL.md) + thaiCraw + 12B Model
  • Setup wallet เหรียญ TCS cash
  • เติมเงินเข้าไป ตรงมีประเด็นอยู่ Agent ถือ Private / privy (wallet as bank)
  • ที่นี้ ถ้ามี api เราเก็บเงินได้เลย เราให้ API ตอบกลับไปเลย โดยที่ทั้งหมด On Chain นะ

ย้อนมาเล่า Slide โดยพื้นฐานของ Agentic Payments มาจาก HTTP 402 (Payment Required) ตั้งแต่ปี 1999 แล้ว แต่ยังไม่มีการนำมาใช้จริงจัง

  • จนมาถึงยุคของ Cryptocurrency - Coinbase สร้าง Base ซึ่งเป็น Layer 2 บน Ethereum และ Protocol X402 เพื่อให้ Web 2.0 (เช่น Agoda) สามารถรับชำระเงินผ่าน Blockchain โดยไม่ต้องจัดการ Chain เอง Coinbase เสนอตัวเป็น "Facilitator"ถ้า API Return 402 ระบบแสดงช่องทางการโอนให้ Crypto แต่มีปัญหา
    - ออกแบบมาเพื่อคนใช้ ยังไม่ใช่ยุคของ Agent
    - ความช้าของ Ethereum ออกของช้า / Sequential Nonce ของ Gas Fee ถ้ารายการมาลำดับไม่ต่อเนื่องกันรายการจะ Pending และช้า
  • Stripe เสนอตัว MPP เป็น Protocol กลางที่มาและนำเสนอ Tempo ซึ่งเป็น Blockchain ยุคใหม่ขึ้นมาช่วยแก้ปัญหาความช้าของ Ethereum โดยมีรายละเอียดดังนี้
    - มุม AI Agent มี Skill เติมไว้ให้ และตัว MPP เปิดช่องให้ทำงานได้ Automate มากขึ้น และแก้เรื่อง Sequential Nonce มีกำหนด timeout เพิ่มมาใน Tempo ทำให้ TPS สูงขึ้น
    - รองรับการชำระเงินด้วย USDC และมีมาตรฐาน TIP-20 (extends ERC-20) มาคู่กันด้วย
    - Payment Models - one-time / pay-as-you-go / streamed 
    - MPX Server เป็น NPM Package ที่ช่วยให้สามารถเขียนโค้ดเพื่อรับชำระเงินผ่าน API ได้ง่าย
    - นอกจากนี้ ถ้าอยากรู้ว่าใครประกาศชำระเงิน mpp ดูจาก mppscan.com / mppscan.thaichain.org

สำหรับในไทย การทำระบบแบบนี้ อาจจะต้องมาดูเรื่อง Regulation ก่อนว่าออกเหรียญ เพื่อทำอะไร

  • กลต - ดูแล Investment Token (เช่น JFin) / Utility Token (Loyalty Point อย่าง J Point)
  • ธนาคารแห่งประเทศไทย - BOT ดูแลเหรียญที่เป็น Stablecoin แต่มีข้อยกเว้น ถ้าใช้วงจำกัด แต่ใน Game เอาไปโลกจริงไม่ได้ทำได้

เลยมี Idea ถ้าเราอยากย้ายระบบ J Point มาบน Chain + AI Agent ต้องมีการวางการรองรับนอกจากย้ายมา Tempo ที่เป็น mpp แล้ว ต้องมาคุยมุมของ Best Practice ควรให้ AI Agent เข้าถุึง Private Key หรือ ทำได้แบบมีเงื่อนไข centralize wallet platform

นอกจากนี้มีตัว https://th.vote/ ที่เอา Idea MPP มาทำเหมือนกัน โดย ThaiChain เป็นมูลนิธี เข้ามาทำในส่วนี้ ซึ่งส่วน ความปลอดภัยและ KYC ผู้ที่ต้องการตั้งโหวตต้องเสียค่าธรรมเนียม (เช่น 300 TCS) และต้องผ่านการยืนยันตัวตน (KYC) เพื่อป้องกันการตั้งโหวตที่ผิดกฎหมายหรือไร้สาระ คน Vote ได้เงินด้วยนะ TCS

Ref: Demo https://www.facebook.com/share/v/1D28hRaDZF/

DataKarate - Qwen for Large Enterprise SDLC View

Speaker คุณเปรม โชติพานิช

Project ใหญ่ ไม่จนใน Prompt เดียว เลยเป็นที่มาของ CLI อย่าง Claude Code และ หลายเจ้า อย่าง Qwen Code มาช่วย การจัดการแต่ละ Feature / Dependency & Reletion

สำหรับการพัฒนา Software มี Flow มาตรฐานมาช่วยอย่าง SDLC โดยรายละเอียด สำหรับยุต Agentic ดังนี้

📌 Requirememt

  • สมัยก่อน dev มาแยกกันไปคนยุค ยุคนี้เอา Agent มา Run เชื่อม Workflow
  • มี Skill ดังนี้ grill-me / grill-with-doc
    จุดอ่อน เราคุยกับ AI แต่การทำงานจริง คุยกับหลายฝ่าย และประชุมกันอีก

เลยมีท่ามาช่วยเสริม

  • to-questionare กระจายคำถาม ให้ Stacker Holder (Customer) มาช่วยยืนยัน มันจะได้พวก meeting agenda ด้วย
  • Agent Debates Patterns หาจุดสมดุลระหว่าง Biz / Tech แปะรูป paper ตาราง มาหาจุดลงตัว เช่น เร็ว เท่าไหร่ ท่าอะไร และ cost
  • Finite State Machine บอกภาพส่า แต่บะ Tx มี State การไหลของข้อมูลอย่างไร และแต่ละจุด User มี Interaction อย่าวไร เอา agent ทำ html ออกมาได้
    เสริม มุม Software Engineering ตัว Finite State Machine เรียกว่าเป็นพื้นฐานที่ควรทำเลยนะ
  • เคส Change Req / Hotfix / bug fix ต้องเข้า loop นี้มา link relation ปรับ แล้ว มีอะไร แจกด้วยไหใป

📌Design Req -Plan To Executable Task

  • to-spec - บอกว่า ทำอะไร ย่อยๆบ้าง ว่า feature อะไร tech ไหน Descision Note อะไร
  • to-tickets เป็น skill ที่ช่วยเอา Task (Epic》User Story 》sub task) ลงใน managememt tools อย่าง jira / github issue
  • หรือ ใช้พวก spec-kit ก็ได้ แต่ควรเอาอันที่เบาสุด

📌Develop

  • บอกให้ดึง jira ทำ ต้องกำหนด skill บอกให้ทำ ลดการเอา markdown ใน repo มาอยู่ใน jira centralize มากกว่าProgressive Disclosire (Epic 》 Story 》Sub Task)
  • แบ่ง Sub Agent ยังไง
    - WorkTree copy ให้ Agent แต่ Disk จะโตมาก
    - มีอีกท่า ให้ Git Sub Module (ท่า Control Plane) Idea มาจากการออกแบบระบบใหญ่ มีหลาย Service และมี msg queue มา syncเรื่อง Design ไม่มบ้ Control pane และ spot จุดเดว
  • Testing
    - (Unit / e2e) Unit Test - Test Gen / Coverage Control
    - e2e -regression / automate browser (slelnium / playwrite) แต่ consume token เยอะ Perfromamce
    - Maintain - Load Test / Smoke Test / Security Test / Code Review แยก context agent code + code review เพื่อกันมันแอบโกง เทคนิค new session ใน code ทำ docstring มาอธิบาย
    - ถ้ามี ai agent ต้อง ทำ test eval ด้วย

📌Deploy

  • ใช้ cli เพื่อความเสถีนร อย่าง Alibaba (aliyun cli) aliyun --help ทำ iac / gen iac เห็นภาพรวม
    - ระบบเล็ก Serverless App Engine (SAE) เอา container มา deploy frontend / backend ส่วน DB Serverless PolarDB + ถ้ามี AI เอา Endpoint มาจาก Model Studio
    - หรือ scale ขึ้นมา ACK (Kube) + ApsaraDB (RDS)+ Higress (AI gateway)

📌Maintain

  • Qwen Code มาตาม Monitor ก็ได้
  • ควรเล็กๆ อย่าง OpenCraw / HiCraw แยก Log ตาม Level

จากนั้นเป็น Demo ERP App ที่ทำมาจาก Qwen 3.7 max model ตัวอย่างระบบลองไปดูจาก Post นี้ https://www.facebook.com/share/p/18QchE8Har/

AI Medical - Qwen in Healthcare

Speaker Arnon Tawong

📌Pain Point

  • ปกติโรงพยาบาลหลายแห มีคนมารักษาก่อน แล้วโรงพยาบาลสำรองจ่ายไปก่อน ตามสิทธิตาม แล้วค่อยมาเบิกจากส่วนกลางตามหลัง
  • แพทย์เขียนรายงานสรุปการรักษา เพื่อนำไปเบิกจ่ายงบประมาณจากส่วนกลาง แต่รายงานเขียนไม่ละเอียดหรือไม่สมเหตุสมผล โรงพยาบาลจะถูกปฏิเสธการเบิกจ่าย ทำให้สูญเสียรายได้

เลยเป็นที่มา จะเอา Local LLM มาใข้อย่างไร เพราะ ข้อมูลเข้าข่าย PDPA และ โรงพยาบาล Internet ช้ามากก ซึ่ง Local LLM เป็นไปได้สำหรับ Inference Model แบบ FP-4 สเปคตามรูปเลย (ทายราคาในสถานการณ์ต่างๆกันเองนะ)

สำหรับเคสนี้ เนื่องจากเป็นงานด่วน และประหยัดที่สุดเลยเลือก NVIDIA DGX Spark

📌Solution ทำระบบชื่อยุสุ (แมวส้ม) ซึ่งประกอบไปด้วย

Local LLM

  • NVIDIA DGX Spark / 4 TB ใช้ Model
    - Qwen3.6 35B A3B NVFP4 (RedHat AI) ภาษาไทยดีกว่า ตัวอื่นๆ และเป็น Multi Model ทำพวก OCR ได้ด้วย
    - Typhoon OCR (BF16) ใช้ตอนทำ Data Ingestion
    - bge-m3 ใช้ตอนทำ Data Ingestion
  • Qwen3.6 35B A3B + vLLM ทดสอบแบบ Concurrent สามารถทำความเร็ว (Tokens per second) ได้ดีมาก แม้จะมีผู้ใช้งานพร้อมกันถึง 20-64 คน และปรับ KV-Cache เผื่อ และมี Resource เหลือให้ Tools อื่นๆ อย่าง Claude Code
ภาพมันไมชัด ผมเลยให้ Gemini ลองปรับให้ชัดขึ้น

Web Service

  • WikiJS + Postgres:
    - พวกข้อมูลกฏต่างๆ ที่เอามาทำ Grounding
    - OCR pdf ภาษาไทย จากตัว Model Typhoon
    - ทำ Guardrail บอกว่า Role ไหน เข้าข้อมูลส่วนไหนได้บ้าง แพทย์ เภสัช มาจาก Rule ของโรงพยาบาล
  • WebApp Chat
    - แยก Chat / Agent แยกเรื่องงาน ตามสิทธิที่ได้ และคุยส่วนตัว อย่างแม่หมอ ถามหวย ดูดวง gamification ช่วยส่งเสริมการเรียนรู้
    - พวกหน้าจอ Report ต่างๆ มีเอา AI มาช่วยอย่างตัว รายงานสรุปการรักษา ตาม ICD-10 (รหัสเรียกโรค) มี AI แนะนำให้ แต่ Human In The Loop อ่านและตรวจสอบขั้นตอนสุดท้าย
    - ตัว Agent เข้าไปอ่าน DB HOSxP ได้ - ถ้าดูจาก Diagram มี Read Only DB แยกไว้
  • Data Ingestion
    - มี cron job การช้อมูลการวินิจฉัย มาเป็น flow update knowledge ใน AI
    - การทดสอบเน้นConfident > 90% เพราะงานด้านการแพทย์

Challenge

  • Clean Data ใน HOSxP ดูก่อนว่าอะไรประหลาดไหม และปรับแก้ก่อนทำ Data Ingestion
  • ต่อไป upskill คนแต่ละสายเข้าใจ ai มากขึ้น เอาตัว แม่หมอ gamification
  • ภาษาไทย บางททีพวกสระ วรรณยุกต์ตกไปอย่าง Model ของ Qwen3.6-35B-A3B (PrismaQuant) อันนี้เดานะ แรงกว่าจริง แต่ภาษาไทยตกเลยต้องเอาของ Qwen3.6 35B A3B NVFP4 (RedHat AI) แทน จริงมีลองหลายตัวนะ อย่าง GPT-OSS มีเอามาลองด้วย

นอกจากนี้มีคนเสนอให้ลอง Pathumma LLM ให้มาลอง รวมถึงการไปเชื่อมกับข้อมูลอื่นๆ Motion ของผู้ป่วย และมี Idea อยากมาช่วยภาครัฐ เป็นมูลนิธฺิ แบบฝั่งพี่โดม หรือ คนจากฝั่งการศึกษา

Local Qwen Low Latency

Speaker poonpipat changkawain

สำหรับการ Run Model แบบ Local มีเทคนิคที่ช่วยให้ Model สามารถทำงานได้ดีบนข้อจำกัดของ HW พวก GPU / VRAM / RAM 4 อัน ได้แก่

1. Quantization

  • การแปลงค่า Weight (น้ำหนัก) ของ AI ในแต่ละ Layer จากเดิมที่เป็นเลขทศนิยมละเอียดๆ ซึ่งคำนวณยากและช้า ให้กลายเป็นตัวเลขที่ง่ายขึ้น เช่น จากทศนิยม 16 ตำแหน่งเหลือ 4 หรือ ตัดทิ้งเลย
  • คำนวณในแต่ละ Layer เร็วขึ้นมาก ช่วยลด Latency ลงได้ประมาณ 2 เท่า (แล้วแต่ Model + HW)
  • ข้อแลกเปลี่ยน: ความแม่นยำ (Accuracy) อาจลดลงบ้าง แต่สามารถแก้ไขได้ด้วยการทำ Warm up หรือการทดสอบซ้ำเพื่อให้ AI ชินกับงานเฉพาะด้านของเรา

2. Low-rank Factorization

  • แบ่ง Weight ขนาดใหญ่ออกเป็น 2 ก้อนย่อย (เช่น A และ B) เมื่อนำมาคุณกลับผลลัพธ์ใหล้เคียงเดิม พอลดขนาด Weight ที่ใหญ่่ ลงเป็น 2 ชุดเล็กทำให้ VRAM ลงได้ถึง 2 เท่า
  • การค่าที่ตัด ค่ายิงน้อยจะยิ่งดี โดยใช้ Self-learning มาช่วยสกัดตัวแปร

3. Knowledge Distillation

  • เอา Model ใหญ่มาติวเข็มกับ Model เล็กๆ ทำให้ผลลัพธ์ที่ได้ดีขึ้น
  • แต่วิธีการนี้ความยากการเตรียมข้อมูล และ HW สำหรับ Train Model - knwledge มันจะเฉพาะทาว มากขึ้น

4. Pruning

  • เบื่องหลังมันเป็น Neural Network ของใน Transformer ลองดูว่าหลังลองทดสอบแล้ว มี Param ไหน หรือ Layer ไหนไม่มีการเรียกใช้เลย ตัดออกได้ โดย 2 แบบ
    - Unstructured Pruning ตัด Weight ที่เข้าใกล้ 0
    - Structured Pruning ตัดทั้งเลเยอร์หรือ ก้อน Weight ตรงนีต้องมาหาเอง และต้องดูว่า Data มันไหลไปไหม
  • ช่วยให้โมเดลประมวลผลได้เร็วขึ้น แต่เป็นวิธีที่ซับซ้อนและวุ่นวายที่สุด

การเลือกใช้เทคนิคเหล่านี้เป็นการ Trade-off ระหว่างความเร็ว ความแม่นยำ และความยากในการทำ โดยเป้าหมายไม่ใช่การมีโมเดลที่ใหญ่ที่สุด แต่คือโมเดลที่ คุ้มค่าและตอบโจทย์ธุรกิจ ขององค์กรมากที่สุด

Reference


Discover more from naiwaen@DebuggingSoft

Subscribe to get the latest posts sent to your email.