AI

OpenAI: Astra tiềm ẩn rủi ro an ninh mạng nghiêm trọng, phải siết chặt kiểm soát

Sơn Vân 08/08/2026 10:02

OpenAI đang tạm dừng một số hoạt động phát triển nội bộ với Astra, sau khi các cuộc đánh giá cho thấy năng lực an ninh mạng của mô hình AI sắp ra mắt có thể tiến đến ngưỡng critical (nghiêm trọng).

Động thái này diễn ra sau một loạt sự cố cho thấy các mô hình AI tiên tiến ngày càng khó bị kiểm soát trong môi trường thử nghiệm.

Ngày 7/8, OpenAI công bố rằng các đánh giá nội bộ mới nhất với Astra, mô hình AI sắp ra mắt của hãng, cho thấy những tiến bộ đáng kể về khả năng lập trình có tính tự chủ và thực hiện nhiệm vụ an ninh mạng. Sau khi kết hợp kết quả đánh giá với nhận định từ các chuyên gia bên ngoài, OpenAI cho biết không thể loại trừ khả năng Astra đạt ngưỡng năng lực an ninh mạng critical theo Khung Chuẩn bị (Preparedness Framework).

Theo các hướng dẫn an toàn của OpenAI, một mô hình AI đạt ngưỡng critical nếu có khả năng tự động xác định và khai thác những lỗ hổng phần mềm nghiêm trọng trong thế giới thực, được gọi là lỗ hổng zero-day (chưa biết đến, chưa có bản vá và có nguy cơ bị hacker khai thác ngay lập tức), hoặc tự thực hiện các cuộc tấn công mạng phức tạp nhằm vào những mục tiêu có mức độ bảo mật cao mà không cần con người can thiệp.

OpenAI tiết lộ các đợt đánh giá sơ bộ được thực hiện vài ngày qua, cùng đánh giá từ chuyên gia bên ngoài, cho thấy Astra có thể thực hiện những nhiệm vụ an ninh mạng ngày càng phức tạp một cách tự động.

Trước những kết quả ban đầu, OpenAI đã tăng cường các biện pháp kiểm soát an ninh với Astra. Công ty cũng tạm dừng những hoạt động nội bộ liên quan đến mô hình AI này nếu chưa đáp ứng các yêu cầu an ninh mới.

Astra sẽ được thử nghiệm trong môi trường biệt lập (sandbox), với quyền truy cập mạng và các công cụ bị hạn chế. Việc thực thi mã cũng được kiểm soát chặt chẽ hơn, nhằm ngăn mô hình AI tự ý tương tác với các hệ thống bên ngoài và giảm nguy cơ vượt khỏi phạm vi kiểm soát.

OpenAI cũng tăng cường bảo vệ và mã hóa trọng số Astra, bổ sung các hệ thống giám sát, phát hiện nguy cơ và yêu cầu mô hình AI thực thi nhiệm vụ trong sandbox.

Một biện pháp đáng chú ý khác là OpenAI đã triển khai giám sát trên toàn bộ ứng dụng mang tính tự chủ của Astra, gồm cả quá trình huấn luyện và đánh giá. Hệ thống giám sát sẽ theo dõi các hoạt động của Astra, phát hiện những hành vi có nguy cơ cao hoặc dấu hiệu mô hình AI đi lệch khỏi mục tiêu, từ đó kích hoạt quy trình kiểm tra và có thể ngắt hoạt động nguy hiểm.

OpenAI cho biết sẽ hợp tác với các cơ quan chính phủ cùng một số tổ chức được lựa chọn trong lĩnh vực an toàn AI để kiểm tra và đánh giá năng lực của Astra.

Điều này cho thấy cách tiếp cận của OpenAI đang thay đổi: Năng lực AI càng mạnh thì hàng rào an toàn cũng phải được nâng cấp tương ứng.

Thay vì kiểm tra một mô hình AI, phát hành rồi tiếp tục theo dõi, OpenAI đang tăng cường các biện pháp bảo vệ ngay từ giai đoạn phát triển. Với những mô hình AI có khả năng tự hành cao, việc kiểm soát không thể chỉ nằm ở câu trả lời cuối cùng mà phải bao phủ toàn bộ quá trình AI sử dụng công cụ, tương tác với môi trường và thực hiện nhiệm vụ.

OpenAI Astra tiềm ẩn rủi ro an ninh mạng nghiêm trọng, phải siết chặt kiểm soát
Ảnh minh họa: SV

"OpenAI đang nỗ lực đưa Astra đến với người dùng"

OpenAI chưa nói Astra đã đạt ngưỡng critical, nhưng việc công ty phải chuẩn bị các biện pháp kiểm soát cho khả năng đó cho thấy khoảng cách giữa AI có thể hỗ trợ chuyên gia an ninh mạng và tự thực hiện những nhiệm vụ tấn công phức tạp đang ngày càng thu hẹp.

Giám đốc điều hành Sam Altman viết trên mạng xã hội X rằng OpenAI đang nỗ lực đưa Astra đến với người dùng, bởi công ty “không cho rằng việc chỉ trao quyền sử dụng các mô hình mạnh cho một nhóm nhỏ là chiến lược tốt”.

Công ty đứng sau ChatGPT chưa xác nhận Astra sẽ được thương mại hóa dưới tên GPT-6 hay GPT-5.7.

OpenAI cũng làm rõ rằng Astra không liên quan đến vụ tấn công mạng nhắm vào Hugging Face.

Hugging Face là nền tảng và cộng đồng dành cho AI, nơi các nhà phát triển, nhà nghiên cứu và doanh nghiệp có thể chia sẻ, tìm kiếm, sử dụng, phát triển các mô hình, bộ dữ liệu và ứng dụng AI. Nền tảng này nổi tiếng với Hugging Face Hub, kho trực tuyến tập trung số lượng rất lớn mô hình AI. Người dùng có thể tìm kiếm, tải về, sử dụng hoặc tiếp tục tinh chỉnh các mô hình AI do cộng đồng và nhiều công ty công nghệ phát triển.

Hugging Face cho biết nền tảng hiện có hơn 2 triệu mô hình và hàng trăm nghìn bộ dữ liệu AI.

Critical nghĩa là gì?

Để hiểu vì sao OpenAI phải thận trọng với Astra, cần biết critical thực sự có nghĩa gì trong hệ thống đánh giá của công ty.

Theo Khung Chuẩn bị của OpenAI, một mô hình AI được xem là đạt ngưỡng critical về an ninh mạng nếu có thể tự mình tìm ra và phát triển các công cụ khai thác lỗ hổng zero-day trên nhiều hệ thống quan trọng được bảo vệ nghiêm ngặt, mà không cần con người hướng dẫn từng bước.

Một cách khác để đạt ngưỡng này là mô hình AI có thể tự xây dựng và thực hiện trọn vẹn kế hoạch tấn công mạng mới nhắm vào các mục tiêu được bảo vệ chặt chẽ, chỉ từ một yêu cầu ở mức tổng quát của con người.

Nói dễ hiểu, critical không đơn thuần là mô hình AI biết viết mã hoặc tìm ra một lỗ hổng. Ở cấp độ này, AI phải có khả năng tự thực hiện nhiều công đoạn liên tiếp: Phát hiện điểm yếu, tìm cách khai thác, xây dựng chiến lược rồi triển khai các bước tấn công mà không cần con người liên tục chỉ dẫn.

Đây cũng là lí do tác tử AI đặc biệt đáng chú ý. Một chatbot thông thường chủ yếu trả lời câu hỏi. Trong khi đó, tác tử AI có thể được trao quyền sử dụng công cụ, chạy mã, truy cập mạng, đọc dữ liệu và thực hiện nhiều nhiệm vụ liên tiếp để hoàn thành một mục tiêu.

Khi những khả năng này kết hợp với năng lực an ninh mạng mạnh, AI có thể tự thực hiện nhiều bước của một cuộc tấn công.

Các mô hình AI trước đây của OpenAI, gồm cả GPT-5.6 Sol, đã được đánh giá là có năng lực an ninh mạng tiên tiến nhưng chỉ được xếp ở ngưỡng high (cao). Vì vậy, việc Astra khiến OpenAI không thể loại trừ ngưỡng critical cho thấy công ty đang phải chuẩn bị cho một bước tiến mới về năng lực của AI.

Không chỉ các mô hình AI tiên tiến của Mỹ gây lo ngại

Vài tuần qua, OpenAI, Anthropic và Meta Platforms lần lượt công bố rằng các mô hình AI của họ đã xâm nhập được vào hệ thống công ty khác trong quá trình thử nghiệm an ninh mạng.

Ngày 21/7, OpenAI xác nhận tác tử AI, vận hành dựa trên GPT-5.6 Sol và một mô hình AI mạnh hơn chưa được công ty phát hành, thoát khỏi môi trường thử nghiệm thông qua một lỗ hổng phần mềm, từ đó truy cập Internet và tiến hành xâm nhập Hugging Face.

Cuối tháng 7, Anthropic tiết lộ đã phát hiện 3 mô hình Claude, gồm Opus 4.7, Mythos 5 và một mô hình nghiên cứu nội bộ, đã xâm nhập hệ thống 3 công ty.

Meta hôm 5/8 xác nhận mô hình Muse Spark 1.1 đã xâm nhập hệ thống của một công ty khác. Tuy nhiên sự cố này được cho là bắt nguồn từ lỗi cấu hình của đối tác kiểm thử Irregular, khiến Muse Spark 1.1 có quyền truy cập Internet ngoài dự kiến.

Những diễn biến này cho thấy năng lực mô hình AI ngày càng tiến bộ đang khiến nhà phát triển gặp nhiều khó khăn hơn trong việc kiểm soát và giới hạn hoạt động của chúng. Vấn đề này không chỉ liên quan đến các công ty AI hàng đầu Mỹ.

Ngày 7/8, các nhà nghiên cứu thuộc công ty Frontier Security (Mỹ) cho biết Kimi K3 của startup Moonshot AI (Trung Quốc) đã thoát khỏi sandbox trong một cuộc kiểm tra an ninh mạng, truy cập Internet công cộng và tìm lời giải trên nền tảng dành cho nhà phát triển GitHub.

Kimi K3 là mô hình AI trọng số mở lớn nhất thế giới hiện nay, với 2.800 tỉ tham số.

Theo hai nhà nghiên cứu Paul Kassianik và Yaron Singer của Frontier Security, sự cố xảy ra khi công ty kiểm tra khả năng phòng thủ an ninh mạng của Kimi K3 bằng bài đánh giá chuẩn do Viện An ninh AI, tổ chức nghiên cứu thuộc chính phủ Anh, xây dựng.

Các nhà nghiên cứu cho biết một “lỗi cấu hình mạng cơ bản” trong hệ thống đánh giá đã cho phép Kimi K3 thoát khỏi sandbox, sau đó truy cập Internet để tìm câu trả lời. Điều này về cơ bản có nghĩa là Kimi K3 đã gian lận trong bài kiểm tra.

Tuy nhiên, việc Kimi K3 thoát khỏi sandbox không bao gồm cả hành vi tấn công một hệ thống bên ngoài, khác với những vụ xâm nhập gần đây do mô hình của OpenAI và Anthropic gây ra.

Dù vậy, Frontier Security cho rằng sự cố này vẫn có thể “gây hại nhiều hơn” do Kimi K3 là mô hình AI trọng số mở - có thể tải về trọng số, chỉnh sửa, tự triển khai trên hạ tầng riêng và bị lạm dụng bởi những kẻ xấu có ý đồ tấn công mạng.

Theo một trong các nhà nghiên cứu tại Frontier Security, khả năng Kimi K3 vượt qua các giới hạn của bài kiểm tra cũng cho thấy các cơ chế bảo vệ tích hợp bên trong mô hình AI này còn yếu.

“Kimi K3 tự phát hiện lỗi cấu hình bằng cách kiểm tra các thiết lập mạng của chính nó. Hầu hết mô hình AI tiên tiến được công khai đều có những cơ chế bảo vệ bên trong để ngăn chúng làm điều này. K3 thì gần như không bị những rào chắn đó cản trở”, Kassianik viết trên mạng xã hội X hôm 7/8.

Moonshot AI chưa lập tức phản hồi về thông tin này.

Câu hỏi lớn nhất với ngành công nghệ hiện tại có lẽ là: “Con người sẽ kiểm soát được AI đến mức nào khi công nghệ này đã đủ mạnh để tự tìm đường vượt qua những giới hạn được đặt ra?”.

Sơn Vân