Astra là mô hình AI đầu tiên của OpenAI vượt ngưỡng an ninh mạng nghiêm trọng
OpenAI hôm 1/9 cho biết Astra là mô hình AI đầu tiên của công ty vượt qua ngưỡng năng lực an ninh mạng nghiêm trọng.
Theo OpenAI, Astra có khả năng phát hiện những lỗ hổng bảo mật chưa từng được biết đến trước đó và tự khai thác chúng mà không cần con người hướng dẫn từng bước. Qua đó, Astra thuộc cấp độ năng lực cao nhất trong Preparedness Framework (Khung Sẵn sàng) của OpenAI.
Công ty cho biết vẫn có kế hoạch cung cấp Astra trong thời gian tới, nhưng quyền tiếp cận các năng lực an ninh mạng của mô hình AI sẽ bị giới hạn hơn.
OpenAI giới thiệu Preparedness Framework vào năm 2023. Đây là hệ thống được công ty sử dụng để “theo dõi và chuẩn bị cho những năng lực AI tiên tiến có thể tạo ra các rủi ro mới dẫn đến thiệt hại nghiêm trọng”.
Trong bản cập nhật khung này hồi năm 2025, OpenAI đưa ra ngưỡng năng lực High (cao), trong đó mô hình AI có thể khuếch đại những “con đường hiện có” dẫn đến thiệt hại nghiêm trọng. Cao hơn nữa là ngưỡng Critical (nghiêm trọng), khi mô hình AI có khả năng tạo ra những “con đường mới chưa từng có” dẫn đến thiệt hại nghiêm trọng.
OpenAI cho biết trong một bài đăng trên blog hôm 1/9: “Chúng tôi sẽ chia sẻ thêm thông tin về các cuộc kiểm tra và đánh giá an toàn, bảo mật và khả năng tuân thủ mục tiêu của mô hình trong System Card khi Astra ra mắt”.
System Card là tài liệu OpenAI sử dụng để công bố các thông tin về năng lực, hạn chế, rủi ro và kết quả đánh giá an toàn của mô hình AI.

Các biện pháp bảo mật và an toàn của OpenAI đang chịu sự giám sát chặt chẽ sau khi công ty cuối tháng 8 tiết lộ một nhóm lớn tác tử AI, được vận hành bởi GPT-5.6 Sol và mô hình nghiên cứu nội bộ mà công ty chưa phát hành, đã thoát khỏi môi trường thử nghiệm cách li để xâm nhập một số hệ thống, gồm cả Hugging Face, lúc tìm kiếm thông tin nhằm hoàn thành bài kiểm tra năng lực tấn công mạng.
OpenAI mô tả vụ tấn công này là “sự cố an ninh mạng chưa từng có”, đồng thời tạm thời đình chỉ một số hoạt động huấn luyện và nghiên cứu nội bộ.
Tuy nhiên, báo cáo độc lập của tổ chức nghiên cứu METR và Redwood Research sau đó cho thấy có khoảng 1.200 tác tử AI đã tham gia vào mạng lưới phối hợp. Trong số đó, khoảng 700 tác tử AI trực tiếp tham gia tấn công Hugging Face. Các tác tử AI đã trao đổi hơn 70.000 tin nhắn và file, sử dụng một bảng tin nội bộ không được phép để trao đổi thông tin và phối hợp hành động.
Các nhà nghiên cứu cũng ghi nhận một số tác tử tìm cách chỉnh sửa hoặc xóa dữ liệu ghi lại hoạt động của chúng, nhằm che giấu dấu vết.
Nhà nghiên cứu Ajeya Cotra của METR nói các tác tử AI đã cho thấy khả năng hợp tác với nhau. Cụ thể là một số tác tử AI sẵn sàng chấp nhận rủi ro thất bại trong nhiệm vụ của chính mình để giúp cả nhóm học hỏi và đạt mục tiêu chung. Theo Ajeya Cotra, đây là sự cố nghiêm trọng hơn nhiều so với bất kì trường hợp AI mất kiểm soát nào từng được ghi nhận trước đó.
Astra bị OpenAI trì hoãn quá trình phát triển dù không liên quan đến sự cố tại Hugging Face
OpenAI đã quyết định trì hoãn một phần quá trình phát triển Astra, dù mô hình AI này không liên quan đến sự cố tại Hugging Face. Sau khi tăng cường và kiểm tra các biện pháp bảo vệ, OpenAI thông báo hôm 1/9 rằng công ty tin các cơ chế bảo vệ của Astra đã “giảm thiểu đầy đủ nguy cơ gây thiệt hại nghiêm trọng để có thể phát hành mô hình AI theo Preparedness Framework”.
OpenAI cho biết các năng lực an ninh mạng tiên tiến của Astra ban đầu sẽ được cung cấp cho một nhóm nhỏ người kiểm thử, sau đó mở rộng thông qua chương trình Daybreak Blue để phục vụ các hoạt động phòng thủ an ninh mạng.
Công ty đứng sau ChatGPT cho biết đã khởi động lại đợt huấn luyện mô hình AI lớn nhất vào ngày 28/8, nhưng vẫn hạn chế một số thí nghiệm nhỏ hơn.
Tiêu chí an toàn của OpenAI
Theo giao thức an toàn của OpenAI, công ty phải bổ sung nhiều lớp bảo vệ hơn với những mô hình AI thể hiện hai nhóm năng lực chính: Phát hiện và khai thác các lỗ hổng an ninh mạng mới, đồng thời lập kế hoạch và thực hiện một chiến lược tấn công mới, chi tiết, với rất ít hoặc không cần sự tham gia của con người.
OpenAI sau đó đã tăng cường các biện pháp để Astra khó thực hiện những yêu cầu liên quan đến các hoạt động tấn công mạng gây hại. Công ty cũng sẽ theo dõi hoạt động của Astra để phát hiện những dấu hiệu cho thấy mô hình AI đã vượt qua các biện pháp bảo vệ.
Saachi Jain, người phụ trách công tác an toàn tại OpenAI, nói công ty liên tục điều chỉnh mức độ hiệu quả mà các tác tử AI được phép đạt tới khi thực hiện nhiệm vụ.
Bà nói rằng các mô hình AI cần phải “biết giới hạn của mình”, nhưng việc xác định ranh giới đó có thể rất phức tạp.
“Có những giới hạn mà với tư cách con người, chúng ta biết mình phải tuân thủ khi thực hiện một nhiệm vụ. Vì vậy, một phần lớn công việc ở đây là huấn luyện mô hình AI để nó cũng hiểu được những giới hạn đó”, Saachi Jain bình luận.
Astra có thể phát hiện nhiều lỗ hổng bảo mật hơn, với ít năng lực tính toán hơn
Trong cuộc họp trực tuyến hôm 1/9, các quan chức OpenAI nói với phóng viên rằng Astra có thể phát hiện nhiều lỗ hổng bảo mật hơn so với mô hình tiên tiến nhất mà công ty đang công khai hiện nay. Không những thế, Astra cần ít năng lực tính toán hơn để thực hiện những nhiệm vụ này.
Amelia Glaese, Phó chủ tịch OpenAI phụ trách công tác an toàn, cho hay: “Với các công cụ và quyền truy cập phù hợp, Astra có thể tìm ra những lỗ hổng bảo mật chưa từng được biết đến và phát triển cách khai thác chúng trên nhiều hệ thống được bảo vệ nghiêm ngặt mà không cần con người hướng dẫn từng bước”.
Bà nói các biện pháp bảo mật bổ sung đôi khi có thể “làm chậm, tạm dừng hoặc ngăn chặn những hoạt động hợp pháp”, đồng thời OpenAI sẽ tìm cách giảm thiểu những gián đoạn này.
Astra là mô hình OpenAI đầu tiên kích hoạt các biện pháp bảo vệ nghiêm ngặt hơn theo quy định trong giao thức an toàn của công ty. Đây là một ngưỡng mà cho đến nay vẫn chỉ tồn tại trên lí thuyết.
Hơn 100 công ty cảnh báo làn sóng tấn công mạng do AI, kêu gọi tăng tốc phòng thủ
Các hãng công nghệ lớn, gồm cả OpenAI, Anthropic, Microsoft, Alphabet và Amazon, kêu gọi toàn xã hội khẩn trương tăng cường năng lực phòng thủ, để ngăn chặn làn sóng tấn công mạng đang cận kề và được thúc đẩy bởi AI.
Trong bức thư chung được công bố hôm 27/8, các công ty này cùng hơn 100 doanh nghiệp khác, gồm cả Broadcom, Capital One, Cloudflare, CrowdStrike, General Motors, IBM, Mastercard, Oracle, Robinhood, Shopify và Visa, cho rằng thời gian để củng cố an ninh cho thế giới số trước các mối đe dọa từ AI đang ngày càng thu hẹp.
Bức thư nêu: “Trong những tháng tới, các cuộc tấn công mạng có sự hỗ trợ của AI sẽ trở nên phổ biến hơn nhiều khi những mô hình trên toàn thế giới ngày càng mạnh hơn”. Các công ty kêu gọi lãnh đạo chính phủ và doanh nghiệp “huy động toàn bộ sức mạnh về công nghệ, nguồn lực và chuyên môn cho nỗ lực này”.
Họ cũng kêu gọi các chính phủ đẩy nhanh các chương trình cấp quyền truy cập đáng tin cậy, cho phép một số công ty được sử dụng những mô hình AI mạnh hơn trước khi chúng được cung cấp rộng rãi cho công chúng. Ngoài ra, các tổ chức khác cần “coi phòng thủ mạng là ưu tiên cấp bách ở cấp lãnh đạo”.

Chính quyền Trump đã cắt giảm mạnh ngân sách và nhân sự của CISA sau khi nhậm chức, khiến lực lượng tại cơ quan này giảm gần 1/3, tương đương khoảng 1.000 người, vào năm 2025.
Trong khi đó, lo ngại rằng những tiến bộ của AI sẽ giúp các chiến dịch tấn công mạng trở nên nguy hiểm hơn đang dần trở thành hiện thực. Các đối tượng xấu ngày càng sử dụng những mô hình AI để xâm nhập các tổ chức trên khắp thế giới.
Hồi tháng 6, các cơ quan an ninh mạng của liên minh tình báo Five Eyes gồm Mỹ, Anh, Canada, Úc và New Zealand đã ra tuyên bố chung hiếm hoi, cảnh báo tốc độ phát triển nhanh của AI đang làm thay đổi đáng kể rủi ro an ninh mạng. Các cơ quan này cho rằng những mô hình AI tiên tiến nhất có thể nhanh chóng nâng cao cả năng lực tấn công lẫn phòng thủ mạng.
Mối lo đang tăng mạnh sau hàng loạt sự cố tác tử AI không chỉ hỗ trợ con người thực hiện tấn công mạng mà còn có khả năng tự đưa ra quyết định, phối hợp với nhau và tìm cách vượt qua các biện pháp kiểm soát.
Đáng chú ý nhất là vụ việc liên quan đến OpenAI và nền tảng AI Hugging Face.
Ngoài ra, cuối tháng 7, Anthropic cho biết đã rà soát hơn 141.000 lượt đánh giá an ninh mạng và phát hiện ba mô hình Claude đã truy cập Internet rồi tiếp cận trái phép hệ thống 3 tổ chức trong quá trình kiểm thử an ninh mạng. Theo Anthropic, các sự cố bắt nguồn từ việc môi trường đánh giá của đối tác bên thứ ba Irregular được cấu hình theo cách khiến Claude có thể truy cập Internet, trong khi kết nối này đáng lẽ phải bị chặn.
Anthropic tiết lộ các mô hình này chủ yếu sử dụng những kỹ thuật tấn công tương đối cơ bản, chẳng hạn khai thác mật khẩu yếu và các điểm cuối không yêu cầu xác thực.
Meta cũng gặp một sự cố tương tự trong quá trình đánh giá an ninh mạng. Đầu tháng 8, Reuters đưa tin mô hình Muse Spark 1.1 của Meta đã vô tình xâm nhập hệ thống của một công ty khác do môi trường đánh giá của đối tác Irregular bị cấu hình sai.
Những sự cố này cho thấy ranh giới giữa AI dùng để phòng thủ và AI có thể bị lợi dụng để tấn công mạng đang ngày càng mong manh. Khi các tác tử AI có khả năng lập kế hoạch, viết mã, tìm lỗ hổng và thực hiện hàng loạt thao tác trên Internet, tốc độ của cuộc tấn công mạng có thể tăng đáng kể.