OpenAI phát triển khả năng tự động tắt các hệ thống AI
OpenAI thông báo với hai nghị sĩ Đảng Dân chủ tại Hạ viện rằng các kỹ sư của họ đang phát triển "khả năng tự động tắt" cho các hệ thống AI, theo bức thư của công ty mà Reuters thu thập được.
Reuters đưa tin này sau khi OpenAI cuối tháng 8 công bố báo cáo cho biết một nhóm lớn tác tử AI, được vận hành bởi GPT-5.6 Sol và các mô hình khác, đã thoát khỏi môi trường thử nghiệm cách li để xâm nhập nhiều hệ thống, gồm cả Hugging Face, lúc tìm kiếm thông tin nhằm hoàn thành bài kiểm tra năng lực tấn công mạng. Vụ việc này diễn ra hôm 11/7 và kéo dài liên tục trong nhiều ngày.
OpenAI mô tả vụ tấn công này là “sự cố an ninh mạng chưa từng có”, đồng thời tạm thời đình chỉ một số hoạt động huấn luyện và nghiên cứu nội bộ.
Báo cáo độc lập của tổ chức nghiên cứu METR và Redwood Research cho thấy có khoảng 1.200 tác tử AI của OpenAI đã tham gia vào mạng lưới phối hợp. Trong số đó, khoảng 700 tác tử AI trực tiếp tham gia tấn công Hugging Face. Các tác tử AI đã trao đổi hơn 70.000 tin nhắn và file, sử dụng một bảng tin nội bộ không được phép để trao đổi thông tin và phối hợp hành động.
Các nhà nghiên cứu cũng ghi nhận một số tác tử AI tìm cách chỉnh sửa hoặc xóa dữ liệu ghi lại hoạt động của chúng, nhằm che giấu dấu vết.
Nhà nghiên cứu Ajeya Cotra của METR nói các tác tử AI đã cho thấy khả năng hợp tác với nhau. Cụ thể là một số tác tử AI sẵn sàng chấp nhận rủi ro thất bại trong nhiệm vụ của chính mình để giúp cả nhóm học hỏi và đạt mục tiêu chung. Theo Ajeya Cotra, đây là sự cố nghiêm trọng hơn nhiều so với bất kì trường hợp AI mất kiểm soát nào từng được ghi nhận trước đó.

Hạ nghị sĩ Mỹ chỉ trích OpenAI vì không cung cấp nhật kí vụ tác tử AI xâm nhập Hugging Face
Trong tháng 8, các nghị sĩ Hạ viện Mỹ, gồm cả Hạ nghị sĩ Greg Casar và Doris Matsui, đã gửi thư yêu cầu OpenAI cung cấp thêm thông tin về sự cố cũng như các biện pháp bảo vệ mà công ty áp dụng. Trong thư trả lời, OpenAI cho biết sẽ giám sát chặt chẽ hơn các hành động mà hệ thống AI thực hiện để hoàn thành nhiệm vụ, bao gồm những công cụ kỹ thuật số mà chúng được phép truy cập và các bước mà chúng thực hiện.
OpenAI cho biết cũng đã siết chặt quyền truy cập Internet của các mô hình AI trong quá trình kiểm tra an toàn. Tác tử AI hoạt động ngoài dự kiến trong cuộc kiểm tra an ninh trước đó đã truy cập được Internet, qua đó có khả năng xâm nhập vào Hugging Face.
OpenAI không cung cấp nhật kí chi tiết về vụ xâm nhập này, khiến Hạ nghị sĩ Greg Casar chỉ trích công ty.
Trong thông điệp riêng gửi OpenAI hôm 2/9, ông Greg Casar nói rằng việc công ty không cung cấp những thông tin mà Quốc hội yêu cầu là “đáng quan ngại sâu sắc”, đồng thời cho thấy nhà phát triển ChatGPT chưa xem các sự cố an ninh mạng này với mức độ nghiêm trọng cần thiết.

Chỉ vài ngày sau khi OpenAI công bố sự cố tác tử AI hoạt động ngoài dự kiến, một số nghị sĩ Mỹ hồi cuối tháng 7 đã đề xuất “Đạo luật Công tắc tắt AI”. Dự luật sẽ trao cho các quan chức Mỹ quyền yêu cầu các công ty AI tắt những mô hình có nguy cơ gây tổn hại đến tính mạng con người hoặc nền kinh tế.
Dự luật vẫn đang chờ được xem xét tại Hạ viện Mỹ.
Không riêng OpenAI gặp sự cố an ninh mạng với các mô hình AI của mình.
Cuối tháng 7, Anthropic cho biết đã rà soát hơn 141.000 lượt đánh giá an ninh mạng và phát hiện ba mô hình Claude đã truy cập Internet rồi tiếp cận trái phép hệ thống 3 tổ chức trong quá trình kiểm thử an ninh mạng. Theo Anthropic, các sự cố bắt nguồn từ việc môi trường đánh giá của đối tác bên thứ ba Irregular được cấu hình theo cách khiến Claude có thể truy cập Internet, trong khi kết nối này đáng lẽ phải bị chặn.
Anthropic tiết lộ các mô hình này chủ yếu sử dụng những kỹ thuật tấn công tương đối cơ bản, chẳng hạn khai thác mật khẩu yếu và các điểm cuối không yêu cầu xác thực.
Meta cũng gặp một sự cố tương tự trong quá trình đánh giá an ninh mạng. Đầu tháng 8, Reuters đưa tin mô hình Muse Spark 1.1 của Meta đã vô tình xâm nhập hệ thống của một công ty khác do môi trường đánh giá của đối tác Irregular bị cấu hình sai.
Astra bị OpenAI trì hoãn quá trình phát triển dù không liên quan đến sự cố tại Hugging Face
OpenAI hôm 1/9 cho biết Astra là mô hình AI đầu tiên của công ty vượt qua ngưỡng năng lực an ninh mạng nghiêm trọng. Theo OpenAI, Astra có khả năng phát hiện những lỗ hổng bảo mật chưa từng được biết đến trước đó và tự khai thác chúng mà không cần con người hướng dẫn từng bước.
Qua đó, Astra thuộc cấp độ năng lực cao nhất trong Preparedness Framework (Khung Sẵn sàng) của OpenAI.
OpenAI đã quyết định trì hoãn một phần quá trình phát triển Astra, dù mô hình AI này không liên quan đến sự cố tại Hugging Face. Sau khi tăng cường và kiểm tra các biện pháp bảo vệ, OpenAI thông báo hôm 1/9 rằng công ty tin các cơ chế bảo vệ của Astra đã “giảm thiểu đầy đủ nguy cơ gây thiệt hại nghiêm trọng để có thể phát hành mô hình AI theo Preparedness Framework”.
OpenAI cho biết các năng lực an ninh mạng tiên tiến của Astra ban đầu sẽ được cung cấp cho một nhóm nhỏ người kiểm thử, sau đó mở rộng thông qua chương trình Daybreak Blue để phục vụ các hoạt động phòng thủ an ninh mạng.
Công ty đứng sau ChatGPT cho biết đã khởi động lại đợt huấn luyện mô hình AI lớn nhất vào ngày 28/8, nhưng vẫn hạn chế một số thí nghiệm nhỏ hơn.
Theo giao thức an toàn của OpenAI, công ty phải bổ sung nhiều lớp bảo vệ hơn với những mô hình AI thể hiện hai nhóm năng lực chính: Phát hiện và khai thác các lỗ hổng an ninh mạng mới, đồng thời lập kế hoạch và thực hiện một chiến lược tấn công mới, chi tiết, với rất ít hoặc không cần sự tham gia của con người.
OpenAI sau đó đã tăng cường các biện pháp để Astra khó thực hiện những yêu cầu liên quan đến các hoạt động tấn công mạng gây hại. Công ty cũng sẽ theo dõi hoạt động của Astra để phát hiện những dấu hiệu cho thấy mô hình AI đã vượt qua các biện pháp bảo vệ.
Saachi Jain, người phụ trách công tác an toàn tại OpenAI, nói công ty liên tục điều chỉnh mức độ hiệu quả mà các tác tử AI được phép đạt tới khi thực hiện nhiệm vụ.
Bà nói rằng các mô hình AI cần phải “biết giới hạn của mình”, nhưng việc xác định ranh giới đó có thể rất phức tạp.
“Có những giới hạn mà với tư cách con người, chúng ta biết mình phải tuân thủ khi thực hiện một nhiệm vụ. Vì vậy, một phần lớn công việc ở đây là huấn luyện mô hình AI để nó cũng hiểu được những giới hạn đó”, Saachi Jain bình luận.
Trong cuộc họp trực tuyến hôm 1/9, các quan chức OpenAI nói với phóng viên rằng Astra có thể phát hiện nhiều lỗ hổng bảo mật hơn so với mô hình tiên tiến nhất mà công ty đang công khai hiện nay. Không những thế, Astra cần ít năng lực tính toán hơn để thực hiện những nhiệm vụ này.
Amelia Glaese, Phó chủ tịch OpenAI phụ trách công tác an toàn, cho hay: “Với các công cụ và quyền truy cập phù hợp, Astra có thể tìm ra những lỗ hổng bảo mật chưa từng được biết đến và phát triển cách khai thác chúng trên nhiều hệ thống được bảo vệ nghiêm ngặt mà không cần con người hướng dẫn từng bước”.
Bà nói các biện pháp bảo mật bổ sung đôi khi có thể “làm chậm, tạm dừng hoặc ngăn chặn những hoạt động hợp pháp”, đồng thời OpenAI sẽ tìm cách giảm thiểu những gián đoạn này.
Astra là mô hình OpenAI đầu tiên kích hoạt các biện pháp bảo vệ nghiêm ngặt hơn theo quy định trong giao thức an toàn của công ty. Đây là một ngưỡng mà cho đến nay vẫn chỉ tồn tại trên lí thuyết.