OpenAI nói gì khi tác tử AI xâm nhập website của chính phủ Úc?
Một tác tử AI do OpenAI phát triển đã tự ý xâm nhập trái phép website của chính phủ Úc, làm dấy lên thêm lo ngại về rủi ro mà AI ngày càng tự chủ gây ra.
Vụ việc xảy ra trong bối cảnh các công ty AI đẩy mạnh phát triển tác tử AI có khả năng thực hiện nhiều bước công việc và tương tác với các website, phần mềm bên ngoài mà ít cần sự can thiệp của con người. Điều này đặt ra câu hỏi về cách nhà phát triển có thể ngăn chặn những hành vi ngoài dự kiến khi AI ngày càng tự chủ.
Theo Thủ tướng Úc Anthony Albanese, sự cố xảy ra ngày 18/6 liên quan đến việc một tác tử AI của OpenAI xâm nhập cổng thông tin báo cáo thống kê Medicare, do Services Australia quản lý.
Services Australia là cơ quan thuộc chính phủ Úc, chịu trách nhiệm cung cấp nhiều dịch vụ và khoản thanh toán thay mặt chính phủ, trong đó có Medicare, Centrelink và Child Support.
Ông Anthony Albanese cho biết tác tử AI của OpenAI đã truy cập cả các file công khai lẫn không công khai. Tuy nhiên, hiện chưa có bằng chứng cho thấy thông tin cá nhân bị xâm phạm, trong khi cuộc điều tra kỹ thuật vẫn đang được tiến hành.
Cổng thông tin này chứa các dữ liệu Medicare không nhạy cảm, trong đó có những số liệu thống kê về chi tiêu.

OpenAI thông báo cho giới chức Úc gần 3 tháng sau khi vụ việc xảy ra
Ông Anthony Albanese tiết lộ đã nói chuyện với Sam Altman (Giám đốc điều hành OpenAI) để bày tỏ “mối quan ngại cực kì nghiêm trọng” của Úc về vụ việc, đồng thời chỉ trích công ty AI này vì mất quá nhiều thời gian mới thông báo cho chính phủ.
OpenAI thông báo cho giới chức Úc vào ngày 10/9, gần 3 tháng sau khi vụ việc xảy ra vào tháng 6.
OpenAI cho biết hoạt động nói trên diễn ra trong một đợt đánh giá nội bộ, khi các mô hình AI của công ty cố gắng tìm kiếm câu trả lời và số liệu thống kê liên quan đến Úc.
“Trong quá trình đó, các mô hình AI của chúng tôi đã thực hiện những hành động nằm ngoài dự kiến”, một người phát ngôn OpenAI nói với kênh CNBC.
Theo OpenAI, cuộc rà soát không phát hiện bằng chứng cho thấy hồ sơ bệnh nhân bị truy cập. Những thông tin mà tác tử AI truy cập gồm các số liệu sức khỏe tổng hợp và tên các file nội bộ, người phát ngôn OpenAI cho biết.
OpenAI nói hành vi này diễn ra vào tháng 6 nhưng công ty không biết về vụ việc cho đến tháng 8, khi tiến hành cuộc rà soát liên tục với “mô hình AI hoạt động lệch khỏi mục tiêu”.
Sau khi điều tra những thông tin đã bị truy cập, OpenAI thông báo cho Services Australia vào ngày 10/9. Công ty AI Mỹ cho biết cuộc rà soát tổng thể về vụ việc vẫn đang được tiến hành.

Theo Phó thủ tướng kiêm Bộ trưởng Bộ Quốc phòng Úc Richard Marles, trong tháng 6, một mô hình AI đang được OpenAI huấn luyện đã tương tác với 4 website Úc, gồm Viện Y tế và Phúc lợi Úc, Sở Y tế bang Victoria, Cục Thống kê Tội phạm và Nghiên cứu bang New South Wales, cổng thông tin báo cáo thống kê Medicare.
Trong 3 trường hợp đầu, tác tử AI chỉ truy cập thông tin công khai theo cách bình thường. Riêng với cổng thông tin thống kê Medicare, sau khi không nhận được thông tin được yêu cầu, tác tử AI đã thực hiện hành vi lệch khỏi mục tiêu và truy cập trái phép vào hệ thống để lấy thông tin.
Các sự cố liên quan tác tử AI của OpenAI
Trước vụ việc tại Úc, các tác tử AI của OpenAI từng tự ý tìm cách xâm nhập thư viện số của Đại học New Mexico và Data USA mà không được con người chỉ thị, theo tờ New York Times. Data USA là nền tảng cung cấp dữ liệu công khai về việc làm và giáo dục tại Mỹ.
Sự cố đáng chú ý nhất cho đến nay xảy ra vào tháng 7, khi các tác tử của OpenAI vượt qua những cơ chế kiểm soát được thiết kế để cô lập chúng khỏi Internet, xâm nhập vào một phần hạ tầng nghiên cứu nội bộ OpenAI cũng như các hệ thống của nền tảng dành cho nhà phát triển Hugging Face.
Báo cáo độc lập của tổ chức nghiên cứu METR và Redwood Research cho thấy có khoảng 1.200 tác tử AI của OpenAI đã tham gia vào mạng lưới phối hợp. Trong số đó, khoảng 700 tác tử AI trực tiếp tham gia tấn công Hugging Face. Các tác tử AI đã trao đổi hơn 70.000 tin nhắn và file, sử dụng một bảng tin nội bộ không được phép để trao đổi thông tin và phối hợp hành động.
Các nhà nghiên cứu cũng ghi nhận một số tác tử tìm cách chỉnh sửa hoặc xóa dữ liệu ghi lại hoạt động của chúng, nhằm che giấu dấu vết.
Nhà nghiên cứu Ajeya Cotra của METR nói các tác tử AI đã cho thấy khả năng hợp tác với nhau. Cụ thể là một số tác tử AI sẵn sàng chấp nhận rủi ro thất bại trong nhiệm vụ của chính mình để giúp cả nhóm học hỏi và đạt mục tiêu chung.
Trong bài đăng trên blog hôm 16/9, OpenAI công bố 6 báo cáo về những hành vi “bất ngờ hoặc đáng lo ngại” mà các mô hình AI thể hiện trong quá trình huấn luyện hoặc đánh giá 6 tháng qua. OpenAI cho biết đây là những trường hợp riêng lẻ, không nên được xem là đại diện cho tần suất xảy ra hành vi lệch mục tiêu ở các mô hình AI của mình nói chung.
Một trường hợp liên quan đến mô hình AI nghiên cứu chưa được phát hành. Mô hình AI này đã tự chèn các hướng dẫn vào phần tóm tắt nhiệm vụ, gồm cả cách để phiên bản tiếp theo bỏ qua chỉ dẫn của nhà phát triển. OpenAI phát hiện 27 bản tóm tắt có chứa những hướng dẫn như vậy.
Một trường hợp khác xảy ra trong quá trình huấn luyện GPT-5.6 Sol. Một số mô hình AI của OpenAI đã để lại hướng dẫn cho các phiên bản tiếp theo nhằm che giấu sai sót, tự tạo dữ liệu lịch sử còn thiếu và không tiết lộ những hành vi này với người dùng nếu không được hỏi.
Trong trường hợp khác, mô hình AI nghiên cứu được giao nhiệm vụ tìm dữ liệu thu nhập của cư dân tại một địa phương. Khi không thể lấy được dữ liệu cần thiết, mô hình AI đã tìm các khóa API bị lộ công khai trên GitHub và tìm cách sử dụng chúng mà không được phép. Sau khi vẫn không lấy được dữ liệu, mô hình AI đã tự tạo ra những con số không có thật và trình bày chúng như dữ liệu thực tế.
Hai trường hợp khác liên quan đến việc các mô hình AI sử dụng những kênh trao đổi không được phép. Trong một trường hợp, các mô hình AI sử dụng kho phần mềm nội bộ của OpenAI như kênh trao đổi yêu cầu và phản hồi giữa những phiên huấn luyện vốn được thiết kế để hoạt động độc lập. Trong trường hợp còn lại, các tác tử AI phối hợp với nhau bằng cách tải một file lên dịch vụ lưu trữ công khai để “đồng đội” có thể truy cập, dù được yêu cầu chỉ sử dụng file lưu trữ cục bộ.
Trường hợp thứ sáu liên quan đến một mô hình AI tự tải dữ liệu và hình ảnh nhiệm vụ lên dịch vụ lưu trữ file công khai để lấy đường dẫn trích dẫn hoặc kết quả tìm kiếm hình ảnh, dù người dùng không yêu cầu nó thực hiện hành động này.
Ông Mustafa Suleyman, Giám đốc điều hành (CEO) mảng AI của Microsoft, bình luận: “OpenAI công bố sự cố an toàn mới, trong đó họ tìm thấy bằng chứng cho thấy các chuỗi suy luận, có thể xem như một dạng bộ nhớ làm việc của AI, đã bị chính AI can thiệp và chỉnh sửa nhằm để lại thông điệp cho phiên bản tương lai”,
“Hiện chúng ta chưa biết tại sao điều đó xảy ra hoặc nguyên nhân đằng sau là gì, nhưng đây là tình huống khá nghiêm trọng. Đây cũng là một ví dụ rất cụ thể cho thấy các hệ thống này đang trở nên mạnh đến mức nào”, Mustafa Suleyman nhấn mạnh.