DeepSeek-V4-Flash chính thức ra mắt, tăng tốc cuộc đua tác tử AI với OpenAI
DeepSeek vừa chính thức mở thử nghiệm công khai (public beta) API của mô hình DeepSeek-V4-Flash, đồng thời xác nhận phiên bản DeepSeek-V4-Pro hoàn chỉnh sẽ ra mắt vào đầu tháng 8.
Không chỉ tiếp tục duy trì lợi thế về chi phí thấp, DeepSeek còn tập trung nâng cấp mạnh khả năng tác tử AI, lĩnh vực đang được xem là "mặt trận" cạnh tranh quyết liệt nhất giữa các mô hình ngôn ngữ lớn. Động thái này diễn ra trong bối cảnh OpenAI vừa hạ giá mạnh nhiều dòng mô hình, cho thấy cuộc đua AI đang chuyển từ cạnh tranh về giá sang cạnh tranh về năng lực thực thi.

DeepSeek-V4-Flash nâng cấp mạnh khả năng tác tử AI, hỗ trợ ngữ cảnh 1 triệu token
Sau ba tháng kể từ khi giới thiệu phiên bản xem trước, DeepSeek đã chính thức phát hành API của DeepSeek-V4-Flash và mở cho các nhà phát triển thử nghiệm.
Phiên bản mới vẫn sử dụng kiến trúc Mixture of Experts (MoE) với tổng cộng 284 tỉ tham số nhưng chỉ kích hoạt khoảng 13 tỉ tham số trong mỗi lần suy luận, giúp cân bằng giữa hiệu năng và chi phí tính toán.
Một trong những điểm nổi bật nhất là khả năng xử lí ngữ cảnh lên tới 1 triệu token, cho phép mô hình làm việc với lượng dữ liệu cực lớn trong một phiên tương tác. Người dùng cũng có thể linh hoạt chuyển đổi giữa chế độ suy luận thông thường và chế độ "tư duy" (thinking mode) tùy theo từng tác vụ.
Theo DeepSeek, mặc dù cấu trúc mô hình và quy mô tham số không thay đổi so với bản xem trước, phiên bản chính thức đã được huấn luyện bổ sung (post-training) nhằm cải thiện đáng kể chất lượng phản hồi và khả năng thực hiện tác vụ.
Đáng chú ý, DeepSeek-V4-Flash đã được tối ưu để hoạt động với nhiều nền tảng tác tử AI phổ biến như Claude Code, OpenClaw, OpenCode hay CodeBuddy.
Ngoài ra, mô hình còn hỗ trợ trực tiếp chuẩn Responses API của OpenAI và được tối ưu cho Codex. Điều này đồng nghĩa các lập trình viên gần như không cần thay đổi cấu hình hay Base URL khi chuyển từ OpenAI sang DeepSeek, giúp giảm đáng kể chi phí chuyển đổi nền tảng.
Trong các bài kiểm tra đánh giá tác tử AI, DeepSeek-V4-Flash đạt nhiều kết quả đáng chú ý.
Ở bài kiểm tra Terminal Bench 2.1, mô hình đạt 82,7 điểm; Cybergym đạt 76,7 điểm; Toolathlon Verified đạt 70,3 điểm; trong khi các bài đánh giá về lập trình như DSBench-FullStack và DSBench-Hard lần lượt đạt 68,7 và 59,6 điểm.
Những kết quả này cho thấy khả năng sử dụng công cụ, tự động hóa quy trình và thực hiện các tác vụ lập trình của DeepSeek đã được cải thiện đáng kể so với thế hệ trước.
Trước đó, vào tháng 4, DeepSeek từng công bố hai phiên bản thử nghiệm gồm V4-Pro và V4-Flash.
Trong đó, V4-Pro hướng tới hiệu năng tối đa nhằm cạnh tranh trực tiếp với các mô hình thương mại hàng đầu như GPT hay Claude, còn V4-Flash được thiết kế với quy mô nhỏ hơn để giảm độ trễ và chi phí vận hành.
Theo đánh giá nội bộ của DeepSeek, phiên bản V4-Pro Preview đã nằm trong nhóm dẫn đầu các mô hình nguồn mở ở nhiều bài kiểm tra về tác tử AI và lập trình. Hiệu quả làm việc của mô hình được cho là đã tiệm cận Claude Opus 4.6 ở chế độ thông thường và đạt trình độ gần ngang các mô hình thương mại hàng đầu trong các bài toán toán học, STEM và lập trình phức tạp.
Cuộc đua AI chuyển từ chiến tranh giá sang cạnh tranh năng lực
Không chỉ nâng cấp hiệu năng, DeepSeek tiếp tục duy trì lợi thế lớn về chi phí. Theo bảng giá API mới, DeepSeek-V4-Pro có giá chỉ 1 nhân dân tệ cho mỗi triệu token đầu vào nếu dữ liệu đã được lưu trong bộ nhớ đệm (cache). Với dữ liệu chưa có cache, mức giá là 12 nhân dân tệ cho mỗi triệu token đầu vào và 24 nhân dân tệ cho mỗi triệu token đầu ra.
Trong khi đó, DeepSeek-V4-Flash có mức giá thấp hơn nhiều, chỉ 0,2 nhân dân tệ cho mỗi triệu token đầu vào có cache, 1 nhân dân tệ nếu không có cache và 2 nhân dân tệ cho mỗi triệu token đầu ra.
Bên cạnh chi phí thấp, DeepSeek còn công bố nhiều cải tiến đáng kể về hiệu quả xử lí ngữ cảnh dài. Ở bài toán xử lí tới một triệu token, lượng tính toán cho mỗi token chỉ còn khoảng 27% so với phiên bản V3.2. Đồng thời, dung lượng bộ nhớ đệm KV Cache giảm xuống còn khoảng 10%, giúp tiết kiệm đáng kể tài nguyên GPU và bộ nhớ khi triển khai các ứng dụng AI quy mô lớn.
Những cải tiến này được xem là đặc biệt quan trọng trong bối cảnh tác tử AI ngày càng phải xử lí những quy trình nhiều bước, đọc lượng lớn tài liệu và thực hiện các chuỗi tác vụ kéo dài. Việc DeepSeek tung ra phiên bản mới diễn ra gần như đồng thời với động thái giảm giá mạnh từ OpenAI.
Cùng ngày, OpenAI thông báo giảm tới 80% giá API của dòng GPT-5.6 Luna và giảm 20% đối với GPT-5.6 Terra. Nhiều chuyên gia trong ngành cho rằng đây là phản ứng trước sức ép cạnh tranh từ các mô hình AI Trung Quốc vốn nổi tiếng với chiến lược giá thấp.
Tuy nhiên, giới phát triển AI nhận định cuộc chiến hiện nay không còn đơn thuần xoay quanh chi phí sử dụng API.
Trong giai đoạn đầu của thị trường AI tạo sinh, giá thành thấp giúp các doanh nghiệp nhanh chóng thu hút nhà phát triển. Nhưng khi mức giá giữa các mô hình ngày càng tiệm cận nhau, yếu tố quyết định sẽ là khả năng hoàn thành công việc thực tế.
Điều mà các doanh nghiệp hiện cần không chỉ là chatbot trả lời câu hỏi, mà là các tác tử AI có thể tự lập kế hoạch, sử dụng công cụ, viết mã, xử lí quy trình nhiều bước và hoàn thành nhiệm vụ với mức độ tự động hóa ngày càng cao.
Chính vì vậy, DeepSeek cho rằng cuộc chiến giá chỉ quyết định "tấm vé vào cửa", còn năng lực tác tử AI mới là yếu tố phân định thắng bại trong giai đoạn tiếp theo của ngành AI.
Việc DeepSeek-V4-Flash không chỉ rẻ hơn mà còn có nhiều bài kiểm tra tác tử AI vượt cả phiên bản V4-Pro Preview cho thấy chiến lược của các doanh nghiệp AI Trung Quốc đang thay đổi. Thay vì cạnh tranh bằng giá thấp đơn thuần, họ đang hướng tới mục tiêu chứng minh rằng các mô hình chi phí thấp vẫn có thể cung cấp năng lực xử lí ngang ngửa, thậm chí cạnh tranh trực tiếp với những hệ thống AI thương mại hàng đầu thế giới.