Review công nghệ

Gemini 4 Argon có ngang tầm GPT-6 Astra, Claude Fable 5.1 và Opus 5.5?

Sơn Vân • 01/10/2026 09:11

Google vừa công bố Gemini 4 Argon, mô hình AI mới được thiết kế cho những công việc phức tạp, kéo dài nhiều bước, từ lập trình, nghiên cứu tài chính, pháp lý đến an ninh mạng.

Điểm đáng chú ý là Gemini 4 Argon không đơn thuần được Google quảng bá như mô hình AI có điểm đánh giá cao, mà được xây dựng để các tác tử AI có thể theo đuổi nhiệm vụ trong thời gian dài mà ít phải chia nhỏ công việc.

Gemini 4 Argon đánh dấu bước đi quan trọng của Google sau nhiều tháng trì hoãn mô hình AI cao cấp nhất, trong lúc OpenAI và Anthropic liên tục tung ra những phiên bản mới. Google trước đó từng dự kiến phát hành Gemini 3.5 Pro, nhưng hiện đã hủy kế hoạch này để chuyển sang thế hệ Gemini 4 Argon.

Gemini 4 Argon có ngang tầm GPT-6 Astra, Claude Fable 5.1 và Opus 5.5
Google vừa công bố Gemini 4 Argon sau một thời gian trì hoãn phát hành Gemini 3.5 Pro. Ảnh: Google

Google thông báo Gemini 4 Argon hiện mới được triển khai cho một số tổ chức phòng thủ mạng đáng tin cậy thông qua Fairwind Program, đồng thời tham gia chương trình tự nguyện của chính quyền Trump về việc cho phép tiếp cận các mô hình AI trước khi phát hành rộng rãi.

Hãng chưa công bố ngày phát hành Gemini 4 Argon rộng rãi, nhưng cho biết đang tiến hành thêm các vòng kiểm thử an toàn trước khi cung cấp cho nhà phát triển, doanh nghiệp và người dùng.

Fairwind Program là chương trình tiếp cận có giới hạn của Google dành cho các cơ quan chính phủ và đối tác đáng tin cậy, trong đó có khách hàng Google Cloud và các tổ chức an ninh mạng, để thử nghiệm những công cụ AI tiên tiến trong việc phát hiện và khắc phục lỗ hổng.

"Gemini 4 Argon là mô hình AI mạnh mẽ nhất mà chúng tôi từng xây dựng để xử lý các tác vụ phức tạp"

Một người phát ngôn của Google cho biết Gemini 4 Argon có quy mô lớn hơn so với dòng mô hình Gemini Pro trước đây.

"Đây là mô hình AI mạnh mẽ nhất mà chúng tôi từng xây dựng để xử lý các tác vụ phức tạp. Chúng tôi đánh giá Gemini 4 Argon ngang hàng với các mô hình tiên phong như Astra (của OpenAI) và Opus (của Anthropic) dựa trên các tiêu chuẩn đánh giá chính về lập trình và an ninh mạng", người phát ngôn này chia sẻ.

Theo Google, Gemini 4 Argon vượt GPT-6 Astra, Claude Fable 5.1 và Claude Opus 5.5 trong 12/18 bài kiểm tra tiêu chuẩn của ngành. Tuy nhiên, Gemini 4 Argon vẫn kém hơn ở vài chỉ số, trong đó có 2/4 bài kiểm tra liên quan đến lập trình.

Gemini 4 Argon có ngang tầm GPT-6 Astra, Claude Fable 5.1 và Opus 5.5
Kết quả 18 bài kiểm tra tiêu chuẩn của Gemini 4 Argon so với GPT-6 Astra, Claude Fable 5.1 và Claude Opus 5.5 do Google công bố

Trong thời gian trì hoãn Gemini 3.5 Pro kéo dài, Google đã tái cơ cấu DeepMind - phòng nghiên cứu AI tiên tiến của hãng. Nhà sáng lập Demis Hassabis đã rời khỏi vị trí giám đốc điều hành Google DeepMind, còn một số lãnh đạo phụ trách các mô hình Gemini cũng rời công ty.

Hồi tháng 7, Giám đốc điều hành Sundar Pichai bác bỏ nhận định rằng Google đang mất vị thế trong cuộc đua AI. Song trong những tháng gần đây, thông điệp từ Google đã chuyển từ việc nhấn mạnh những khả năng tiên tiến của Gemini sang tập trung vào lợi thế về chi phí so với các đối thủ.

Gemini 4 Argon được thiết kế cho những công việc kéo dài

Điểm khác biệt quan trọng nhất của Gemini 4 Argon nằm ở khả năng xử lý các nhiệm vụ có thời gian thực hiện dài. Google nâng giới hạn đầu ra của Gemini 4 Argon lên tới 1 triệu token, so với 64.000 token ở thế hệ trước.

Ngoài ra, Google cho biết Gemini 4 Argon còn được thử nghiệm với những khối dữ liệu đầu vào rất lớn. Trong bài kiểm tra GraphWalks, Gemini 4 Argon phải xử lý lượng thông tin từ 256.000 đến 1 triệu token và vẫn duy trì khả năng suy luận trên toàn bộ dữ liệu. Điều này có ý nghĩa quan trọng với các tác tử AI khi phải đọc nhiều tài liệu, phân tích kho mã nguồn lớn hoặc thực hiện công việc gồm rất nhiều bước liên tiếp.

Hiểu đơn giản, thay vì phải xử lý công việc lớn thành nhiều phần rồi liên tục tóm tắt những gì đã làm để chuyển sang bước tiếp theo, Gemini 4 Argon có thể giữ lại nhiều thông tin trong cùng một quá trình. Nhờ đó, Gemini 4 Argon có thể theo dõi mục tiêu, kết quả của các bước trước và tiếp tục xử lý những bước sau mà ít bị mất thông tin giữa chừng.

Đây đang trở thành một hướng phát triển quan trọng của AI. Các mô hình AI hàng đầu không còn chỉ được đánh giá bằng khả năng trả lời chính xác một câu hỏi khó, mà ngày càng phải chứng minh khả năng hoàn thành công việc thực tế gồm hàng chục, thậm chí hàng trăm bước. Với các tác tử AI, khả năng duy trì thông tin và mục tiêu trong suốt công việc dài có thể quan trọng không kém khả năng suy luận ở từng bước riêng lẻ.

Gemini 4 Argon đã được Google dùng trong công việc thực tế như thế nào?

Google cho biết hàng nghìn nhân viên đang sử dụng Gemini 4 Argon trong các quy trình nội bộ liên quan đến lập trình, nghiên cứu và viết.

Một ví dụ là nhóm nghiên cứu điện toán lượng tử của Google sử dụng Gemini 4 Argon để tối ưu các thuật toán. Trong một trường hợp, Gemini 4 Argon giúp tối ưu lượng tài nguyên cần thiết cho thuật toán lượng tử, tính theo tích giữa số qubit và số cổng lượng tử, tốt hơn 40% so với kết quả được công bố trước đó.

Ở một trường hợp khác, các tác tử AI sử dụng Gemini 4 Argon phân tích dữ liệu theo dõi mức sử dụng bộ nhớ tại các trung tâm dữ liệu Google và tự động tìm ra những cơ hội tối ưu. Google cho biết các thay đổi đã được triển khai giúp giải phóng hơn 300 TiB bộ nhớ, trong khi tổng mức tiết kiệm ước tính có thể đạt 500 TiB đến 1 PiB khi triển khai đầy đủ.

Đáng chú ý hơn, Gemini 4 Argon có thể hỗ trợ xử lý những dự án phần mềm có lượng mã nguồn rất lớn. Các tác tử AI của Google đang dùng Gemini 4 Argon để chuyển đổi mã viết bằng C/C++ sang Rust, ngôn ngữ lập trình được thiết kế để tăng độ an toàn và giảm nguy cơ lỗi phần mềm.

Công việc này được thực hiện trên nhiều dự án, từ những thư viện có hàng chục nghìn dòng mã đến Zircon, phần lõi của hệ điều hành Fuchsia, với hơn 800.000 dòng mã. Google cho biết những dự án lớn và quan trọng như vậy vẫn phải trải qua nhiều vòng kiểm tra tự động, kiểm tra thủ công và thử nghiệm trước khi được đưa vào sử dụng.

Gemini 4 Argon mạnh ở lập trình nhưng không thắng mọi bài kiểm tra

Google công bố Gemini 4 Argon đạt 77,9% trên DeepSWE v1.1, bài kiểm tra tập trung vào các nhiệm vụ kỹ thuật phần mềm kéo dài trong môi trường thực tế. Đây là một trong những kết quả nổi bật nhất của Gemini 4 Argon.

Gemini 4 Argon đạt 51,3% trên AutomationBench, bài kiểm tra đánh giá khả năng thực hiện các quy trình kinh doanh đầu - cuối, đồng thời đạt 91,7% trên LVBench về khả năng hiểu video dài.

Google cho biết Gemini 4 Argon đứng đầu Vals Index, bài kiểm tra tập đánh giá tác động kinh tế của AI trong các công việc tài chính, lập trình, pháp lý và thuế.

Tuy nhiên, nếu nhìn sang những bài kiểm tra khác, bức tranh trở nên cân bằng hơn.

Trong bảng so sánh do Google công bố, Gemini 4 Argon đạt 55% trên FrontierSWE v2 (khả năng tự thực hiện những công việc phát triển phần mềm phức tạp), thấp hơn GPT-6 Astra với 65,5% và Claude Opus 5.5 với 62,3%.

Trên Terminal-Bench 4.0 (khả năng sử dụng công cụ dòng lệnh để tự thực hiện các công việc lập trình), Gemini 4 Argon đạt 57,4%, trong khi GPT-6 Astra đạt 58,2%, Claude Fable 5.1 đạt 57,9% và Claude Opus 5.5 đạt 66,4%.

So sánh Gemini 4 Argon và GPT-6 Astra

GPT-6 Astra là mô hình AI cao cấp nhất nay của OpenAI trên thị trường, được thiết kế cho những công việc phức tạp như suy luận, lập trình, nghiên cứu, xử lý tài liệu và sử dụng máy tính. OpenAI cho biết GPT-6 Astra có thể làm việc với các phần mềm doanh nghiệp theo cách tương tự con người, kể cả trong trường hợp phần mềm không cung cấp công cụ kết nối trực tiếp.

Điểm khác biệt đáng chú ý giữa GPT-6 Astra và Gemini 4 Argon nằm ở cách hai hãng phát triển khả năng xử lý những công việc kéo dài. Google nhấn mạnh Gemini 4 Argon có thể tạo tới 1 triệu token đầu ra, cho phép mô hình AI xử lý một nhiệm vụ trong thời gian rất dài.

Trong khi đó, GPT-6 Astra có khả năng tiếp nhận hơn 1 triệu token với cùng một lần làm việc và tập trung mạnh vào việc sử dụng máy tính, gọi công cụ và thực hiện các thao tác ở môi trường phần mềm.

Nói đơn giản, Gemini 4 Argon được Google hướng tới những công việc mà AI phải “làm mãi cho đến khi xong”, chẳng hạn đọc lượng lớn tài liệu, phân tích kho mã nguồn hoặc thực hiện hàng loạt bước để hoàn thành dự án. GPT-6 Astra lại nổi bật ở khả năng làm việc trực tiếp trên máy tính, chẳng hạn mở phần mềm, thao tác với các chức năng, sử dụng công cụ và hoàn thành từng bước trong một quy trình.

Sự khác biệt này thể hiện khá rõ qua các bài đánh giá. Trong bảng số liệu Google công bố, GPT-6 Astra đạt 65,5% trên FrontierSWE v2, cao hơn Gemini 4 Argon ở mức 55%. Đây là bài đánh giá khả năng xử lý các nhiệm vụ kỹ thuật phần mềm phức tạp.

Với OSWorld 2.0 - bài kiểm tra khả năng sử dụng máy tính, GPT-6 Astra đạt 72,6%, so với 69,2% của Gemini 4 Argon.

So với Gemini 4 Argon và Claude Fable 5.1

Claude Fable 5.1 được Anthropic giới thiệu vào tháng 9, tập trung vào lập trình, nghiên cứu khoa học và những công việc đòi hỏi xử lý nhiều thông tin. Anthropic thiết kế Claude Fable 5.1 để các tác tử AI có thể tự nghiên cứu, lập kế hoạch, sử dụng công cụ, thực hiện nhiều bước rồi kiểm tra lại kết quả.

Điểm đáng chú ý là Claude Fable 5.1 không chỉ được đánh giá bằng khả năng trả lời câu hỏi. Anthropic cho biết mô hình AI này có thể xử lý những công việc kéo dài và giải quyết các vấn đề mà kỹ sư đã mất nhiều thời gian nhưng chưa tìm ra nguyên nhân. Chẳng hạn, trong một thử nghiệm tại công ty đầu tư Millennium, Claude Fable 5.1 đã tìm ra nguyên nhân của một lỗi hiếm gặp trong hệ thống nội bộ mà các kỹ sư và những mô hình AI khác trước đó chưa giải thích được.

Các số liệu do Anthropic công bố cho thấy Claude Fable 5.1 đạt 55,8% trên Terminal-Bench 4.0 (khả năng lập trình theo kiểu tác tử AI) và 73,4% trên CursorBench 3.2.0 (khả năng tự thực hiện các công việc lập trình trong môi trường Cursor).

Với khả năng sử dụng máy tính, Claude Fable 5.1 đạt 77,9% ở phiên bản đánh giá có mức độ hoàn thành một phần và 41,7% ở cách chấm nghiêm ngặt hơn trên OSWorld 2.0.

Claude Fable 5.1 đạt 31,4% trên AutomationBench, bài đánh giá khả năng thực hiện các quy trình công việc doanh nghiệp.

Claude Opus 5.5 là đối thủ đáng gờm của Gemini 4 Argon trong lập trình

Anthropic định vị Claude Opus 5.5 là mô hình AI có khả năng xử lý những công việc phức tạp tương đương Claude Fable 5.1 nhưng chi phí vận hành thấp hơn 40% so với Claude Opus 5.

Theo Anthropic, một người thử nghiệm đã dùng Claude Opus 5.5 để hoàn thành việc chuyển đổi một kho mã nguồn khoảng 680.000 dòng trong chưa đầy một ngày, trong khi công việc tương tự có thể mất nhiều tuần với cả đội kỹ sư.

Vì vậy, Claude Opus 5.5 trở thành đối thủ gờm của Gemini 4 Argon trong những công việc lập trình phức tạp. Tuy nhiên, cần thận trọng khi so sánh khả năng giữa hai mô hình AI này vì Google và Anthropic sử dụng những bộ bài kiểm tra, cấu hình chạy và cách tính điểm khác nhau.

Một điểm đáng chú ý khác là chi phí sử dụng. Trong thời gian đầu, Google tính 2 USD cho mỗi 1 triệu token đầu vào và 10 USD cho mỗi 1 triệu token đầu ra của Gemini 4 Argon. Sau thời gian ưu đãi, mức giá sẽ tăng lên 4 USD cho 1 triệu token đầu vào và 20 USD cho 1 triệu token đầu ra.

Mức giá này tương đương Claude Opus 5.5, hiện cũng ở mức 4 USD cho 1 triệu token đầu vào và 20 USD cho 1 triệu token đầu ra. Trong khi đó, Claude Fable 5.1 đắt hơn đáng kể, với giá 10 USD cho 1 triệu token đầu vào và 50 USD cho 1 triệu token đầu ra.

Nói đơn giản, sau khi hết thời gian ưu đãi, Google đang đặt Gemini 4 Argon ở cùng mức giá với Claude Opus 5.5 và thấp hơn đáng kể so với Claude Fable 5.1. Điều này cho thấy Google không chỉ cạnh tranh về khả năng của mô hình AI mà còn muốn dùng chi phí để thu hút các doanh nghiệp sử dụng AI cho những công việc kéo dài và tiêu tốn nhiều dữ liệu.

An ninh mạng trở thành mặt trận mới của AI

An ninh mạng là một trong những lĩnh vực cho thấy rõ nhất sự thay đổi của các mô hình AI mới. Với Gemini 4 Argon, Google không chỉ muốn AI phát hiện lỗi mà còn có thể tìm ra lỗ hổng, kiểm tra xem lỗ hổng có thực sự tồn tại hay không và đề xuất cách sửa.

Vì thế, Google chưa phát hành Gemini 4 Argon công khai mà chỉ cung cấp trước cho một nhóm chuyên gia phòng thủ mạng đáng tin cậy thông qua Fairwind Program.

OpenAI xác định GPT-6 Astra có năng lực an ninh mạng rất cao. Theo đánh giá an toàn của OpenAI, GPT-6 Astra đạt ngưỡng nghiêm trọng trong khung đánh giá Preparedness Framework về năng lực an ninh mạng. OpenAI cho biết GPT-6 Astra có thể tìm và phát triển cách khai thác những lỗ hổng chưa từng được biết đến trong một số hệ thống thực tế được bảo vệ.

Với Gemini 4 Argon, Google đặc biệt nhấn mạnh khả năng chống prompt injection, tức kiểu tấn công trong đó kẻ xấu cài các chỉ dẫn độc hại vào website, email, tài liệu hoặc dữ liệu mà AI đang xử lý, nhằm đánh lừa tác tử AI và khiến nó thực hiện những hành động ngoài ý muốn. Đây là rủi ro đặc biệt đáng chú ý với các tác tử AI có khả năng tự sử dụng máy tính, đọc dữ liệu và gọi các công cụ bên ngoài.

Nổi bật
      Mới nhất
      Gemini 4 Argon có ngang tầm GPT-6 Astra, Claude Fable 5.1 và Opus 5.5?
      • Mặc định

      POWERED BY ONECMS - A PRODUCT OF NEKO