DeepSeek V4-Flash tiếp tục gây sức ép với hiệu năng cao và chi phí vận hành thấp

DeepSeek V4-Flash-0731 nâng mạnh năng lực agent và coding trong khi giữ giá API chỉ 0,14 USD/triệu token đầu vào và 0,28 USD/triệu token đầu ra. Mô hình cho thấy cuộc cạnh tranh AI đang chuyển nhanh từ điểm benchmark sang hiệu năng trên mỗi đô la.

DeepSeek V4-Flash tiếp tục gây sức ép với hiệu năng cao và chi phí vận hành thấp

DeepSeek một lần nữa đưa bài toán chi phí trở lại trung tâm của cuộc cạnh tranh AI. Bản cập nhật DeepSeek V4-Flash-0731, được đưa lên API ngày 31/7/2026, nâng đáng kể hiệu năng trên các benchmark agent và coding nhưng vẫn giữ mức giá rất thấp so với phần lớn mô hình frontier hiện nay.

Điểm đáng chú ý là DeepSeek cho biết bản 0731 không thay đổi kiến trúc hay kích thước so với V4-Flash Preview. Mức cải thiện chủ yếu đến từ quá trình post-training. Điều này khiến V4-Flash trở thành một ví dụ đáng chú ý cho xu hướng mới của ngành AI: lợi thế cạnh tranh không chỉ đến từ việc xây mô hình lớn hơn, mà còn từ khả năng khai thác tốt hơn cùng một lượng tham số và cùng một hạ tầng inference.

Theo Artificial Analysis được Reuters dẫn lại, V4-Flash đạt 50 điểm trên Intelligence Index sau bản cập nhật mới, ngang Gemini 3.6 Flash và chỉ thấp hơn một điểm so với Meta Muse Spark 1.1 và GLM-5.2. Quan trọng hơn, chi phí trung bình để hoàn thành một bài test trong bộ đánh giá này chỉ khoảng 0,03 USD, thấp hơn rất nhiều so với nhiều mô hình nổi tiếng khác.

DeepSeek V4-Flash-0731 thay đổi điều gì?

DeepSeek lần đầu giới thiệu dòng V4 vào tháng 4/2026 với hai phiên bản V4-Pro và V4-Flash. Flash được định vị là biến thể nhẹ hơn, nhanh hơn và tiết kiệm hơn, trong khi vẫn giữ khả năng reasoning và agentic ở mức cao.

Ngày 31/7, DeepSeek cập nhật V4-Flash API lên bản 0731 và cho biết năng lực agent đã được cải thiện đáng kể. Theo changelog chính thức, mô hình đạt các kết quả:

  • Terminal Bench 2.1: 82,7.
  • NL2Repo: 54,2.
  • Cybergym: 76,7.
  • DeepSWE: 54,4.
  • Toolathlon Verified: 70,3.
  • Agent Last Exam: 25,2.
  • Automation Bench Public: 25,1.

DeepSeek cũng công bố hai benchmark nội bộ DSBench-FullStack và DSBench-Hard với điểm lần lượt 68,7 và 59,6. Vì đây là bộ test nội bộ, các con số này nên được xem như chỉ báo do nhà phát triển cung cấp, không phải phép đo độc lập.

Đáng chú ý hơn, DeepSeek nói V4-Flash-0731 vẫn sử dụng đúng kiến trúc và kích thước của bản Preview, chỉ được re-post-trained. Điều này cho thấy một phần lớn hiệu năng mới đến từ dữ liệu, reinforcement learning, cách huấn luyện agent và quy trình hậu huấn luyện thay vì tăng số tham số.

284 tỷ tham số nhưng chỉ kích hoạt khoảng 13 tỷ mỗi token

V4-Flash sử dụng kiến trúc Mixture-of-Experts (MoE). Theo tài liệu DeepSeek công bố khi ra mắt V4 Preview, mô hình có khoảng 284 tỷ tham số tổng cộng, nhưng chỉ khoảng 13 tỷ tham số được kích hoạt cho mỗi token.

Đây là một trong những yếu tố giúp Flash đạt tỷ lệ hiệu năng trên chi phí cao. Thay vì đưa toàn bộ tham số vào mỗi bước tính toán như mô hình dense, MoE định tuyến từng token tới một nhóm expert phù hợp. Về lý thuyết, cách này cho phép tăng dung lượng kiến thức và khả năng của mô hình mà không làm lượng compute trên mỗi token tăng tương ứng với tổng số tham số.

Tuy nhiên, cần phân biệt compute active với yêu cầu bộ nhớ khi tự triển khai. Việc chỉ kích hoạt 13 tỷ tham số không có nghĩa V4-Flash có footprint tương đương một mô hình dense 13B. Hệ thống vẫn phải lưu và phục vụ một phần rất lớn của bộ trọng số 284B, nên self-hosting ở tốc độ cao vẫn đòi hỏi hạ tầng đáng kể.

Giá API 0,14 USD đầu vào và 0,28 USD đầu ra

DeepSeek hiện niêm yết V4-Flash ở mức 0,14 USD cho một triệu token đầu vào khi cache miss0,28 USD cho một triệu token đầu ra. Với phần input đã nằm trong context cache, mức giá giảm xuống khoảng 0,0028 USD cho một triệu token.

Context caching có ý nghĩa đặc biệt với AI agent. Một agent coding hoặc trợ lý doanh nghiệp thường lặp lại lượng lớn system prompt, tool schema, repository context, hướng dẫn dự án và lịch sử hội thoại qua nhiều lượt. Nếu các phần này được cache, chi phí hiệu dụng có thể giảm mạnh so với cách chỉ nhìn vào bảng giá input thông thường.

DeepSeek cũng cho phép mức đồng thời cao hơn cho V4-Flash so với V4-Pro trên API chính thức. Theo tài liệu hiện tại, V4-Flash có giới hạn concurrency mặc định 2.500 kết nối trên mỗi tài khoản, trong khi V4-Pro ở mức 500. Điều này phù hợp với vị trí của Flash như một model dành cho workload khối lượng lớn.

Artificial Analysis: khoảng 3 cent cho một bài benchmark

Giá theo token chỉ phản ánh một phần economics của mô hình. Một model rẻ nhưng phải sinh quá nhiều token hoặc lặp nhiều bước để giải bài có thể vẫn tốn hơn model có giá token cao nhưng hoàn thành nhiệm vụ nhanh.

Artificial Analysis vì vậy sử dụng chỉ số cost per task, tính lượng token thực tế mà model tiêu thụ trên các benchmark. Theo Reuters ngày 3/8/2026, V4-Flash có chi phí trung bình khoảng 0,03 USD mỗi bài test.

Cùng phép đo đó, Reuters dẫn số liệu khoảng 0,86 USD cho Kimi K3, 1,86 USD cho GPT-5.6 Sol và 3,15 USD cho Claude Fable 5. Nếu chỉ xét bộ benchmark và cấu hình mà Artificial Analysis sử dụng, V4-Flash tạo ra khoảng cách chi phí rất lớn.

Dù vậy, không nên chuyển trực tiếp kết quả này thành kết luận rằng V4-Flash rẻ hơn cùng tỷ lệ trong mọi workload production. Chi phí thực tế phụ thuộc độ dài context, tỷ lệ cache hit, reasoning effort, số lượt tool call, retry, latency và chất lượng đầu ra cần thiết.

Điểm Intelligence Index 50 đưa Flash vào nhóm cạnh tranh đáng chú ý

Theo Artificial Analysis được Reuters dẫn lại, bản V4-Flash mới đạt 50/100 trên Intelligence Index, một chỉ số tổng hợp chín benchmark về coding, reasoning và tác vụ công việc.

Mức 50 ngang với Gemini 3.6 Flash và thấp hơn một điểm so với Muse Spark 1.1 của Meta cùng GLM-5.2 của Z.AI. Kimi K3 đạt 57, còn các model cao cấp như Claude Opus 5, Claude Fable 5 và GPT-5.6 nằm cao hơn V4-Flash ít nhất chín điểm.

Bức tranh này rất quan trọng: V4-Flash chưa phải mô hình mạnh nhất tuyệt đối. Lợi thế của nó nằm ở việc tiến đủ gần nhóm model cao cấp trong khi chi phí thấp hơn mạnh. Đối với doanh nghiệp chạy hàng triệu hoặc hàng tỷ token mỗi ngày, khoảng cách vài điểm benchmark có thể ít quan trọng hơn chênh lệch tổng chi phí sở hữu.

Agentic coding là nơi V4-Flash gây sức ép mạnh nhất

Bản 0731 được DeepSeek tối ưu rõ rệt cho agent. Công ty cho biết model hỗ trợ native Responses API và được điều chỉnh để hoạt động với workflow kiểu Codex. V4 cũng được thiết kế để tích hợp với các framework coding agent phổ biến.

Terminal Bench 2.1 ở mức 82,7 là tín hiệu đáng chú ý vì benchmark này không chỉ kiểm tra khả năng sinh một đoạn code độc lập. Model phải làm việc trong terminal, thực hiện nhiều bước, đọc trạng thái môi trường và sửa lỗi trong quá trình hoàn thành nhiệm vụ.

Toolathlon Verified ở mức 70,3 cũng cho thấy DeepSeek đang tập trung mạnh vào tool use. Đây là năng lực quan trọng đối với thế hệ AI agent mới, nơi model không chỉ trả lời bằng văn bản mà phải chọn đúng công cụ, tạo tham số hợp lệ và duy trì trạng thái qua nhiều lượt.

Tuy nhiên, benchmark agent rất nhạy với harness, reasoning budget và cấu hình test. DeepSeek cho biết các bài Code Agent công khai được chạy với DeepSeek Harness ở chế độ minimal, max effort, top-p 0,95 và temperature 1,0. Vì vậy, việc so trực tiếp một con số duy nhất giữa các nhà cung cấp cần được thực hiện thận trọng.

1 triệu token context trở thành tiêu chuẩn mặc định của V4

Cả V4-Flash và V4-Pro đều hỗ trợ cửa sổ ngữ cảnh 1 triệu token trên API chính thức. Mức context này đặc biệt hữu ích với coding agent, phân tích repository lớn, xử lý tài liệu dài và workflow cần giữ nhiều tool output trong cùng phiên.

DeepSeek cho biết kiến trúc V4 sử dụng các kỹ thuật attention và compression nhằm giảm chi phí bộ nhớ trong bối cảnh dài. Đây là một phần quan trọng của economics: mở rộng context không chỉ cần model hiểu chuỗi dài mà còn cần serving stack có thể xử lý KV cache với chi phí chấp nhận được.

Trong production, context 1 triệu token không có nghĩa nên đưa toàn bộ dữ liệu vào mỗi request. RAG, caching, memory hierarchy và context pruning vẫn quan trọng để giảm latency và chi phí. Nhưng việc model hỗ trợ context dài giúp kiến trúc ứng dụng có thêm dư địa khi gặp trường hợp khó tránh việc giữ lượng thông tin lớn.

Context caching khiến bài toán chi phí thay đổi mạnh

Mức cache-hit chỉ 0,0028 USD mỗi triệu input token là một trong những chi tiết dễ bị bỏ qua trong bảng giá DeepSeek. Với agent, đây có thể là yếu tố quan trọng hơn cả headline price.

Giả sử một coding agent phải mang theo system instruction, hàng chục tool definition và một phần repository giống nhau trong hàng trăm lượt. Nếu toàn bộ phần context tĩnh bị tính lại theo giá cache miss ở mỗi lần gọi, tổng chi phí tăng nhanh. Khi phần lặp được cache, chi phí biên của những lượt sau có thể giảm đáng kể.

Đây cũng là một lý do thị trường AI đang chuyển từ việc chỉ so USD trên một triệu token sang các chỉ số gần workload thực hơn như USD trên task, USD trên resolved issue hoặc USD trên một giờ agent hoạt động.

Giá thấp gây sức ép trực tiếp lên mô hình kinh doanh AI

DeepSeek nổi lên từ đầu năm 2025 với câu hỏi gây khó chịu cho ngành: liệu một mô hình AI cạnh tranh có thực sự phải có giá vận hành cao như thị trường từng giả định?

V4-Flash tiếp tục đẩy câu hỏi này xa hơn. Khi một model có năng lực coding và reasoning đủ dùng trong nhiều workload chỉ có giá vài phần nhỏ của một đô la trên hàng triệu token, việc dùng model cao cấp nhất cho mọi request trở nên khó biện minh về kinh tế.

Doanh nghiệp có thể chuyển sang kiến trúc model routing: dùng Flash cho phần lớn tác vụ phân loại, extraction, code maintenance, background agent và tool execution; chỉ đẩy các trường hợp khó hoặc rủi ro cao sang model premium.

Nếu cách này phổ biến, thị trường LLM có thể giống cloud compute hơn: nhiều tầng model với giá, latency và năng lực khác nhau thay vì một model duy nhất xử lý toàn bộ workload.

“Flash” không còn đồng nghĩa với mô hình chỉ làm việc đơn giản

Trong giai đoạn đầu, các phiên bản Flash, Mini hoặc Haiku thường được hiểu là lựa chọn nhanh và rẻ cho tóm tắt, classification hoặc chatbot cơ bản. V4-Flash cho thấy ranh giới này đang mờ đi.

Một model tiết kiệm giờ đây có thể chạy terminal agent, reasoning nhiều bước, tool call và coding workflow phức tạp. Điều này khiến khoảng giá premium phải được giải thích bằng các khác biệt rõ ràng hơn như độ chính xác cao nhất, multimodal, reliability, safety, enterprise compliance hoặc chất lượng trên tác vụ rất khó.

Nói cách khác, phân khúc giá rẻ đang đi lên về năng lực nhanh hơn tốc độ mà phân khúc cao cấp có thể duy trì khoảng cách.

Post-training trở thành vũ khí cạnh tranh ngang với pretraining

Chi tiết quan trọng nhất về V4-Flash-0731 có thể không phải benchmark mà là việc DeepSeek nói model giữ nguyên kiến trúc và kích thước.

Nếu cùng một backbone có thể tăng mạnh năng lực agent chỉ thông qua post-training, điều đó cho thấy ngành vẫn còn rất nhiều dư địa tối ưu ngoài việc scale pretraining compute.

Reinforcement learning, synthetic trajectories, tool-use data, failure recovery, long-horizon training và harness-aware post-training có thể tạo ra bước nhảy lớn về hiệu quả thực tế. Với doanh nghiệp AI, đây là tin tích cực vì cải thiện sản phẩm không nhất thiết luôn yêu cầu một training run mới ở quy mô lớn hơn.

Nó cũng có tác động tới vòng đời model. Thay vì phát hành một kiến trúc hoàn toàn mới mỗi vài tháng, nhà phát triển có thể cập nhật cùng một backbone nhiều lần với khả năng agent, coding hoặc domain specialization tốt hơn.

Open weights tiếp tục là một lợi thế chiến lược của DeepSeek

Checkpoint DeepSeek-V4-Flash-0731 hiện đã xuất hiện trên tài khoản chính thức của DeepSeek trên Hugging Face. Điều này cho phép cộng đồng nghiên cứu và nhà cung cấp inference triển khai model ngoài API chính thức.

Open weights tạo áp lực theo hai hướng. Thứ nhất, các nhà cung cấp inference cạnh tranh với nhau về giá và tốc độ trên cùng một model. Thứ hai, doanh nghiệp có thể fine-tune, quantize hoặc triển khai trong môi trường riêng nếu yêu cầu dữ liệu và kiểm soát hạ tầng phù hợp.

Tuy nhiên, open weights không đồng nghĩa triển khai rẻ cho mọi tổ chức. Model 284B vẫn đòi hỏi lượng bộ nhớ đáng kể. Self-hosting chỉ kinh tế khi workload đủ lớn để bù chi phí GPU/NPU, vận hành cluster, engineering và observability.

Chi phí API thấp không đồng nghĩa total cost of ownership luôn thấp

Đây là điểm cần phân biệt khi nói V4-Flash có “chi phí vận hành thấp”. Giá API chính thức thực sự rất thấp, nhưng total cost of ownership phụ thuộc cách triển khai.

Nếu dùng API DeepSeek, doanh nghiệp trả theo token và không phải sở hữu GPU. Nếu self-host, họ phải tính thêm:

  • GPU hoặc NPU và chi phí khấu hao.
  • HBM/VRAM cần để giữ weights và KV cache.
  • Điện và cooling.
  • Networking giữa nhiều accelerator.
  • Inference engine, quantization và kernel optimization.
  • Đội ngũ vận hành, monitoring và capacity planning.

Vì vậy, lợi thế rõ nhất của V4-Flash hiện nằm ở price-performance của API và khả năng phục vụ workload khối lượng lớn. Với self-hosting, bài toán cần được tính riêng theo mức sử dụng và hạ tầng có sẵn.

Hiệu năng cao nhưng vẫn có những giới hạn cần lưu ý

Không nên biến kết quả mới thành kết luận V4-Flash thay thế mọi model premium. Artificial Analysis cho thấy model vẫn thấp hơn nhóm dẫn đầu về Intelligence Index. Một số tác vụ cần độ chính xác cực cao, multimodal sâu hoặc reliability dài hạn có thể vẫn phù hợp hơn với model đắt tiền.

Benchmark cũng không phản ánh hoàn toàn production. Agent trong hệ thống thật phải xử lý credential, timeout, API thay đổi, dữ liệu nhiễu, tool failure và hàng loạt tình huống không xuất hiện trong bộ test chuẩn.

Doanh nghiệp còn phải đánh giá các yếu tố như data governance, vị trí xử lý dữ liệu, SLA, hỗ trợ kỹ thuật, compliance và khả năng kiểm soát output. Giá token chỉ là một biến trong quyết định lựa chọn model.

DeepSeek đang ép thị trường chuyển từ “best model” sang “best economics”

Trong năm 2024-2025, cuộc đua AI phần lớn được kể bằng model nào đứng đầu benchmark. Sang năm 2026, một câu hỏi khác ngày càng quan trọng: chi phí để tạo ra một đơn vị công việc hữu ích là bao nhiêu?

Đây là nơi V4-Flash tạo sức ép mạnh. Một model không cần đứng số một tuyệt đối nếu nó đạt 80-90% giá trị cần thiết với một phần nhỏ chi phí. Với workload hàng tỷ token, khoảng cách kinh tế có thể lớn hơn giá trị của vài điểm benchmark.

Xu hướng này có thể khiến doanh nghiệp bắt đầu đo AI giống cloud infrastructure: cost per resolved ticket, cost per merged pull request, cost per sales lead, cost per research task hoặc cost per automated workflow.

Cuộc chiến giá AI có thể tiếp tục sâu hơn

Reuters nhận định V4-Flash xuất hiện trong bối cảnh cạnh tranh AI tại Trung Quốc ngày càng gay gắt giữa DeepSeek, Moonshot, MiniMax, Z.AI, ByteDance và Alibaba, đồng thời các hãng Mỹ vẫn tiếp tục nâng năng lực model cao cấp.

Khi các nhà cung cấp cùng tăng hiệu suất inference, cache, quantization và post-training, giá token có khả năng tiếp tục giảm. Một nghiên cứu học thuật công bố năm 2026 về thị trường inference cũng ghi nhận mức giảm giá rất nhanh trong vài năm qua, với cải thiện phần mềm và kiến trúc đóng vai trò quan trọng bên cạnh phần cứng.

Điều này có thể tạo hiệu ứng Jevons cho AI: model rẻ hơn không làm tổng chi tiêu giảm, mà kích thích doanh nghiệp chạy nhiều agent và nhiều token hơn. Một workload từng quá đắt để tự động hóa có thể trở nên khả thi khi giá giảm 10 hoặc 100 lần.

V4-Flash phù hợp nhất với những workload nào?

Dựa trên cách DeepSeek định vị model và các benchmark hiện tại, V4-Flash đặc biệt đáng chú ý cho:

  • Coding agent: sửa code, chạy terminal, xử lý repository và automation.
  • Background agent: các tác vụ chạy thường xuyên nhưng mỗi tác vụ có giá trị thấp.
  • Tool-heavy workflow: chuỗi API call, search, extraction và transformation.
  • Long-context processing: tài liệu lớn, codebase, log và lịch sử dài.
  • High-volume API: hệ thống có lượng request lớn, nơi giá token ảnh hưởng trực tiếp đến unit economics.
  • Model routing: làm tầng mặc định trước khi escalates sang model premium.

Đối với tác vụ có hậu quả cao, doanh nghiệp vẫn nên benchmark riêng trên dữ liệu nội bộ và thiết kế cơ chế review thay vì dựa vào điểm công khai.

Ý nghĩa lớn hơn: trí tuệ đang trở thành hàng hóa rẻ hơn rất nhanh

V4-Flash-0731 cho thấy một thay đổi quan trọng của thị trường AI: mức năng lực từng chỉ có ở model đắt tiền đang nhanh chóng xuất hiện trong phân khúc chi phí thấp.

Điều này gây áp lực lên mọi nhà cung cấp. Các model premium phải tiếp tục mở rộng khoảng cách về chất lượng, reliability và tính năng doanh nghiệp. Các model giá rẻ phải tối ưu sâu hơn để duy trì biên lợi nhuận khi giá token ngày càng gần chi phí hạ tầng.

Với người dùng và doanh nghiệp, đây là diễn biến tích cực. Khả năng thử nghiệm agent, coding automation và workflow AI ở quy mô lớn trở nên dễ tiếp cận hơn nhiều.

DeepSeek V4-Flash chưa phải mô hình mạnh nhất trên mọi tiêu chí. Nhưng việc một model 284B MoE, chỉ kích hoạt khoảng 13B tham số mỗi token, đạt điểm agent cao trong khi API chỉ có giá vài chục cent cho mỗi triệu token cho thấy cuộc đua đã thay đổi.

Thước đo quan trọng của thế hệ AI tiếp theo có thể không còn là ai xây được model lớn nhất, mà là ai cung cấp được nhiều năng lực hữu ích nhất trên mỗi đô la, mỗi watt và mỗi giây inference. Ở mặt trận đó, V4-Flash đang buộc phần còn lại của thị trường phải phản ứng.

Nguồn tham khảo

Chia sẻ