AI

DeepSeek V4-Flash có chi phí vận hành thấp hơn 105 lần so với Claude Fable 5

Sơn Vân 03/08/2026 16:04

DeepSeek V4-Flash có chi phí vận hành thấp nhất trong số các mô hình nổi tiếng trên thế giới khi được đánh giá qua các bài kiểm tra chuẩn, rẻ hơn 105 lần so với Claude Fable 5 của Anthropic.

DeepSeek, startup AI hàng đầu Trung Quốc đang chuẩn bị cho khả năng IPO (chào bán cổ phiếu lần đầu ra công chúng), chính thức phát hành mô hình V4-Flash vào ngày 31/7 vừa qua.

Đây là nỗ lực mới nhất của DeepSeek nhằm lấy lại đà phát triển bằng cách tập trung vào thế mạnh quen thuộc: Cung cấp các giải pháp AI có chi phí cực thấp.

Mô hình suy luận R1 của DeepSeek từng gây sốt trên toàn cầu vào đầu năm 2025 vì có hiệu năng ngang ngửa các sản phẩm Mỹ như của OpenAI, Google và Anthropic nhưng chi phí huấn luyện thấp hơn nhiều lần. R1 từng khiến cổ phiếu công nghệ trên thế giới bị bán tháo và làm dấy lên những câu hỏi về khoản tiền khổng lồ mà các công ty Mỹ đang chi cho AI.

Theo hãng nghiên cứu Artificial Analysis (có trụ sở tại thành phố San Francisco, Mỹ), V4-Flash có giá 0,14 USD cho mỗi triệu token đầu vào và 0,28 USD cho mỗi triệu token đầu ra.

Token là đơn vị dữ liệu mà mô hình AI xử lí hoặc tạo ra dưới dạng văn bản hoặc hình ảnh, có thể là một từ, một phần của từ, hoặc thậm chí là dấu câu. Nhiều công ty sử dụng token như một đơn vị kinh tế để đo lường khối lượng tính toán mà AI thực hiện. Văn bản càng dài thì càng cần nhiều token để xử lý, vì vậy chi phí thường được tính theo số token (trên mỗi nghìn hoặc mỗi triệu token).

Artificial Analysis ước tính chi phí trung bình để V4-Flash hoàn thành một bài kiểm tra là 3 cent, thấp hơn nhiều so với 86 cent của Kimi K3 từ Moonshot AI, 1,86 USD của GPT-5.6 Sol từ OpenAI và 3,15 USD của Claude Fable 5.

Cách so sánh này phản ánh sát hơn giá trị thực tế của mỗi mô hình AI thay vì chỉ dựa vào mức giá niêm yết, bởi tính cả lượng dữ liệu mà mô hình phải xử lí và tạo ra để hoàn thành nhiệm vụ. Một mô hình AI có giá niêm yết thấp chưa chắc đã rẻ nếu phải thực hiện nhiều bước hơn đáng kể để đưa ra câu trả lời.

DeepSeek V4-Flash có chi phí vận hành thấp hơn 105 lần so với Claude Fable 5
Ảnh: SV

DeepSeek từng chiếm phần lớn sự chú ý trong lĩnh vực phát triển mô hình AI của Trung Quốc, nhưng nhanh chóng phải đối mặt với hàng loạt đối thủ nội địa. Trong số này có Moonshot AI, MiniMax, Z.ai, ByteDance và Alibaba.

Các công ty Trung Quốc này đang cạnh tranh với những tập đoàn công nghệ Mỹ để đưa AI đến người dùng trên toàn cầu, đặc biệt nhắm đến doanh nghiệp đang tìm kiếm những cách rẻ hơn để triển khai AI trên quy mô lớn.

DeepSeek V4-Flash có hiệu năng ngang Google Gemini 3.6 Flash

Theo Artificial Analysis, mô hình V4-Flash đạt 50/100 điểm trên Intelligence Index, chỉ số tổng hợp kết quả từ 9 bài kiểm tra đánh giá các khả năng như lập trình, suy luận và thực hiện những nhiệm vụ mô phỏng công việc thực tế. Điểm số này ngang với Google Gemini 3.6 Flash nhưng thấp hơn 1 điểm so với Muse Spark 1.1 của Meta và GLM-5.2 của Z.ai.

Trong khi đó, Kimi K3 của Moonshot AI đạt 57 điểm. Các mô hình Claude Opus 5, Fable 5 và GPT-5.6 của OpenAI đều đạt điểm cao hơn V4-Flash ít nhất 9 điểm.

DeepSeek đang chuẩn bị phát hành V4-Pro, phiên bản mạnh hơn V4-Flash.

Trong một diễn biến khác vào ngày 3/8, Alibaba đã công bố Qwen3.8-Max, mô hình AI có năng lực cao nhất của hãng tính đến nay.

Qwen3.8-Max có 2.400 tỉ tham số, tiếp nhận 1 triệu token trong một lần xử lí

Qwen3.8-Max là mô hình AI đa phương thức có khả năng xử lí văn bản, hình ảnh và video. Mô hình AI mới của Alibaba có thể tiếp nhận tới 1 triệu token trong một lần xử lí, tương đương khả năng làm việc với lượng thông tin rất lớn như hồ sơ pháp lí dài, mã nguồn của dự án phần mềm hoặc hàng trăm trang tài liệu.

Qwen3.8-Max có 2.400 tỉ tham số, tiến khá gần Kimi K3 với 2.800 tỉ tham số. Tham số có thể hiểu đơn giản là những giá trị mà mô hình học được từ dữ liệu để nhận diện quy luật, tạo câu trả lời và thực hiện các nhiệm vụ. Tuy nhiên, số lượng tham số lớn hơn không đồng nghĩa chắc chắn với một mô hình tốt hơn.

Alibaba cho biết Qwen3.8-Max được giới thiệu trên Arena.AI, nền tảng đánh giá mô hình AI dựa trên kết quả sử dụng thực tế của cộng đồng.

Theo hãng tin Reuters, Qwen3.8-Max nhanh chóng trở thành mô hình AI Trung Quốc có thứ hạng cao nhất trong bảng xếp hạng dành cho các mô hình xử lý văn bản trên Arena.AI. Tuy nhiên, mô hình này vẫn đứng sau Claude Fable 5 và ba biến thể Opus của Anthropic.

Không những thế, Qwen3.8-Max đứng thứ hai thế giới trong bảng xếp hạng các mô hình xử lý hình ảnh và nội dung trực quan, chỉ sau Claude Fable 5.

Qwen3.8-Max sử dụng kiến trúc Mixture-of-Experts (MoE), có thể hiểu là chia mô hình thành nhiều “chuyên gia” xử lí những loại nhiệm vụ khác nhau. Khi nhận một yêu cầu, Qwen3.8-Max chỉ kích hoạt những phần cần thiết thay vì vận hành toàn bộ mô hình AI.

Dù Qwen3.8-Max có tổng cộng 2.400 tỉ tham số, chỉ khoảng 95 tỉ tham số được kích hoạt tại một thời điểm. Theo Alibaba, cách thiết kế này giúp giảm lượng tính toán cần thiết, từ đó giảm chi phí và thời gian phản hồi so với việc phải kích hoạt toàn bộ mô hình AI.

Đây là yếu tố quan trọng trong cuộc đua AI hiện nay. Một mô hình càng lớn thường càng đòi hỏi nhiều tài nguyên để vận hành, nên các công ty không chỉ cạnh tranh về khả năng xử lí mà còn phải tìm cách khiến mô hình hoạt động hiệu quả hơn.

qwen3.8-max.webp
Qwen3.8-Max là mô hình AI có năng lực cao nhất của Alibaba tính đến nay. Ảnh: Alibaba

Ngoài ra, Alibaba còn nhấn mạnh khả năng thực hiện các nhiệm vụ kéo dài nhiều ngày của Qwen3.8-Max.

Theo gã khổng lồ thương mại điện tử Trung Quốc, ở một thử nghiệm nội bộ, Qwen3.8-Max đã tự thực hiện một dự án kỹ thuật phần mềm trong 16 ngày. Dự án yêu cầu Qwen3.8-Max xây dựng một hệ thống tác tử AI có khả năng tự cải tiến từ đầu.

Trong quá trình này, Qwen3.8-Max liên tục tạo mã, kiểm thử, xem kết quả, phân tích nhật kí và tiếp tục chỉnh sửa. Alibaba cho biết kết quả là một khung tác tử AI có tên oh-my-cli, được công bố mã nguồn trên GitHub.

Khả năng này cho thấy hướng phát triển của các mô hình AI đang thay đổi. Thay vì chỉ trả lời câu hỏi, các mô hình AI mới ngày càng được thiết kế để lập kế hoạch, thực hiện nhiều bước và tự điều chỉnh trong thời gian dài.

Alibaba cho biết Qwen3.8-Max còn được thiết kế cho nhiều công việc thực tế khác như thiết kế ứng dụng, xem xét tài liệu pháp lí, phân tích thể thao, nghiên cứu tài chính và xây dựng mô hình kiến trúc 3D.

Qwen3.8-Max cũng được Alibaba định vị là một mô hình AI có khả năng xử lí thông tin trực quan ở quy mô lớn. Theo công ty, Qwen3.8-Max có thể tiếp nhận những tài liệu dài hàng trăm trang, cả loạt chương trình truyền hình hoặc tới 100 giờ phát trực tiếp, sau đó biến lượng thông tin này thành cơ sở dữ liệu có thể tìm kiếm và tương tác.

Alibaba cho biết Qwen3.8-Max có thể chỉnh sửa video thô thành vlog, tạo hoạt hình giáo dục từ câu lệnh, dựng lại một dự án giao diện web từ ảnh chụp màn hình hoặc chuyển bản vẽ mặt bằng 2D thành hình ảnh nội thất 3D.

Tương tự Kimi K3, Qwen3.8-Max có khả năng xử lí văn bản, hình ảnh và video, đồng thời tiếp nhận tới 1 triệu token trong một lần. Điều này cho thấy các công ty AI Trung Quốc đang hướng tới những mô hình có khả năng xử lí lượng thông tin rất lớn và thực hiện các nhiệm vụ phức tạp trong thời gian dài.

Các hãng công nghệ Trung Quốc, vốn đang đóng vai trò lớn trong lĩnh vực AI trọng số mở trên toàn cầu, đang cạnh tranh quyết liệt để xây dựng những mô hình mạnh hơn nhưng không khiến chi phí vận hành trở nên quá cao.

Qwen3.8-Max đã được triển khai thông qua API (giao diện lập trình ứng dụng) trên nền tảng Alibaba Cloud Model Studio dành cho nhà phát triển trên toàn cầu. Alibaba cho biết trọng số của Qwen3.8-Max dự kiến được phát hành vào tuần tới, qua đó mở thêm khả năng cho các nhà phát triển sử dụng và điều chỉnh mô hình theo nhu cầu.

Nổi bật
      Mới nhất
      DeepSeek V4-Flash có chi phí vận hành thấp hơn 105 lần so với Claude Fable 5
      • Mặc định

      POWERED BY ONECMS - A PRODUCT OF NEKO