DeepSeek-V4.1-Flash: โมเดลโอเพนรุ่นใหม่ที่เปลี่ยนสมการต้นทุนของ AI Agent

ข่าวต่างประเทศโดย KhunTony · อัปเดต กันยายน 2026

DeepSeek-V4.1-Flash — โมเดลโอเพนรุ่นใหม่

กลางเดือนกันยายน 2026 DeepSeek ปล่อย DeepSeek-V4.1-Flash ลง Hugging Face ภายใต้ลิขสิทธิ์ MIT
พร้อมโค้ดอ้างอิงสำหรับการอนุมานและรายละเอียดการออกแบบสถาปัตยกรรม ทำให้โมเดลตัวนี้ไม่ได้เป็นแค่ checkpoint อัปเดตธรรมดา
แต่เป็นการออกแบบใหม่ทั้งชุด: แกน backbone 552,000 ล้านพารามิเตอร์ (activate 8,000 ล้านตัวต่อโทเคนช่วง prefill
และ 16,000 ล้านช่วง decode) รองรับภาพและข้อความแบบ native และมี context window ขนาด 1 ล้านโทเคน

ตัวเลขที่ทุกคนจับตาดู: KV cache 890 ไบต์ต่อโทเคน

สิ่งที่ทำให้วงการเงียบหายไปพักหนึ่งไม่ใช่สกอร์ benchmark แต่คือขนาดแคชที่หดเหลือเพียง 890 ไบต์ต่อโทเคน
ไล่จาก DeepSeek-V1 (พฤศจิกายน 2023) ที่ใช้ 389,120 ไบต์ → V3.2 (ธันวาคม 2025) เหลือ 48,068 → V4-Flash (เมษายน 2026) เหลือ 3,514
จนมาถึงตัวนี้ที่ 890 — ลดลงราว 437 เท่าภายในสามปี ตัวเลขนี้มาจากการบีบอัดแคชด้วย FP4 และการนำแคชกลับมาใช้ข้ามเลเยอร์
ด้วยกลไก attention ที่ออกแบบใหม่ (CSA2 / Compressed Sparse Attention 2)

ทำไมตัวเลขนี้ถึงสำคัญ? เพราะ workload ของ AI agent เป็นงานที่ “เน้น input” มากกว่างานเขียนเอาต์พุต ทุก ๆ เทิร์นของ agent
ต้องส่ง prefix ใหญ่ซ้ำกันทุกครั้ง ไม่ว่าเป็นโค้ดเบส repository เดียวกัน คำสั่งระบบชุดเดิม หรือประวัติการสนทนาที่ยาว
คอขวดของงานไม่ได้อยู่ที่โมเดลเขียนเร็วแค่ไหน แต่อยู่ที่ค่าใช้จ่ายในการ “อ่านซ้ำ” ทุกอย่างที่เคยเห็นมาเท่าไร
ด้วยแคช 890 ไบต์/โทเคน คอนเท็กซ์ยาว 1 ล้านโทเคนใช้พื้นที่แคชราว 0.93 GB (เลย์เอาต์แบบพื้น ๆ ต้องใช้ราว 2.15 GB)
และการอ่านคอนเท็กซ์ที่แคชไว้เต็ม ๆ ทั้งหมด ราคาต่ำกว่า 1 เซนต์ต่อรอบ

สกอร์ที่ทำให้โมเดลราคาถูกชนะเรือธง

เมื่อตั้งระดับการใช้เหตุผลที่สูงสุด (reasoning dial ควบคุมได้ต่อเนื่อง 1–100) DeepSeek-V4.1-Flash ทำสกอร์:
Terminal-Bench 2.1 ได้ 90.6 (Opus 5.0 ได้ 89.1, GPT-5.6 Sol ได้ 88.8),
DeepSWE v1.1 ได้ 74.2 (Opus 5.0 ได้ 74.0, GLM-5.3 ได้ 66.9),
CyberGym 88.1, AutomationBench 54.8 และ Agent’s Last Exam 31.8
ซึ่งชนะ GPT-5.6 Sol ใน benchmark agentic ทั้งห้าตัว และชนะ Claude Opus 5.0 ในสี่ในห้า
นอกนั้น Codeforces rating ได้ 3,471 (สูงขึ้นจาก 3,348 ของ V4 Pro) และเทียบชั้น Kimi K3 ที่ 65.6 ใน MathArena Apex

ราคาที่เปลี่ยนความหมายของ “ถูก”

ตัวเลขต่อ 1 ล้านโทเคน (USD): input แบบ cache miss 0.15 ดอลลาร์ช่วง off-peak (0.30 ช่วง peak),
input แบบ cache hit 0.003 ดอลลาร์ off-peak (0.006 peak) และ output 0.60 off-peak (1.20 peak)
ราคา off-peak สำหรับ input cache miss อยู่ที่ 0.15/0.75 รวมต่อ 1M — แพงเป็นลำดับรองจากโมเดลราคาจัดโปรของ Meta
ในขณะที่ OpenAI ตั้ง GPT-5.6 Sol อยู่ที่ 4 ดอลลาร์ input 0.40 แบบ cache และ 20 ดอลลาร์ output
Anthropic เก็บ 5 ดอลลาร์ input 0.50 cache hit และ 25 ดอลลาร์ output
ลำพังเลข 0.003 นี้ก็เปลี่ยนการตัดสินใจเรื่อง “รัน agent ระยะยาว” ไปแล้ว

ทำไมเหล่า agent จึงเป็นเป้าหมายหลัก

จุดเด่นของแคชเล็กคือ agent ที่ทำงานกับคอนเท็กซ์เดิมซ้ำ ๆ ได้ถูกมาก ตัวอย่างที่เห็นชัดจากรายงานทางเทคนิค:
นักพัฒนาที่ใช้ Hermes หรือเครื่องมือ agent อื่นที่บีบอัดประวัติเซสชัน เมื่อแคชหมดอายุทุกครั้งที่บีบอัด
แต่ละเทิร์นจะถูกเรียกเก็บในราคา cache miss เต็ม ๆ — สถานการณ์ที่ V4.1-Flash ตั้งใจโจมตีตรง ๆ
เพราะพรอมต์แคชที่เสถียรจะทำให้ agent loop ยาว ๆ มีต้นทุนต่อรอบต่ำจนการตัดสินใจเปลี่ยนจาก “ควรแคชไหม”
เป็น “แคชไปเลยสิ”

MIT License คือประเด็นใหญ่ที่ซ่อนอยู่

การปล่อยภายใต้ MIT พร้อมโค้ดอ้างอิงและรายละเอียดการ implement หมายความว่าเทคนิคเหล่านี้กระจายได้ไกลเกินตัว DeepSeek
ผู้ให้บริการ API รายอื่นหรือทีมที่ self-host โมเดลเปิดสามารถนำแนวคิดการบีบอัดแคชไปใช้ต่อได้
ในขณะที่ DeepSeek เองก็ยุบโครงสร้างระดับโมเดลเป็นสามระดับการให้เหตุผล (low, high, max) ใน endpoint เดียว
และเตรียมยุติ V4 Pro ภายในกลางเดือนกันยายน — ทีมที่คำนวณต้นทุนหรือเขียนการประเมินโดยยึดราคาเดิมของ V4 Pro
มีเวลาเตรียมตัวก่อน endpoint เดิมเปลี่ยนโมเดลใต้ชื่อ

บทสรุป

DeepSeek-V4.1-Flash ไม่ใช่แค่โมเดลถูกที่สกอร์สูง แต่เป็นชิ้นส่วนสถาปัตยกรรมที่โจมตีจุดที่ระบบ agent ทั้งหลายเจ็บที่สุด
คือค่าใช้จ่ายในการอ่านบริบทซ้ำ การรวมกันของ MIT License, แคชที่เล็กลง 437 เท่า, หน้าต่าง 1 ล้านโทเคน
และราคา cache hit ระดับหนึ่งในพันดอลลาร์ ทำให้โมเดลตัวนี้เป็น “โมเดลเริ่มต้น” ที่น่าสนใจ
สำหรับผู้ที่สร้าง coding agent, ไปป์ไลน์เอกสาร หรือระบบใดก็ตามที่เผาผลาญคอนเท็กซ์ในปริมาณมาก

ข้อความประกาศ (Disclaimer)

บทความนี้เป็นเนื้อหาข่าวที่จัดทำโดยบริษัท ไอดินนายด์ จำกัด เพื่อเป็นข้อมูลประกอบการศึกษาเท่านั้น
ตัวเลข ข้อมูลจำเพาะ และราคาอ้างอิงจากเอกสารเผยแพร่ของผู้พัฒนา (DeepSeek) และสื่ออ้างอิง ณ วันที่เขียน
อาจมีการเปลี่ยนแปลงได้โดยไม่ต้องแจ้งล่วงหน้า บริษัทฯ ไม่มีส่วนเกี่ยวข้องกับการพัฒนาโมเดลดังกล่าว
และไม่รับผิดชอบต่อการนำข้อมูลไปใช้ประกอบการตัดสินใจ

แหล่งที่มา / บทความต้นฉบับ:
Why DeepSeek-V4.1-Flash Is Such an Exciting Open Model Release — KDnuggets