Tác tử AI của OpenAI truy cập website chính phủ Mỹ, làm rò rỉ 53 ảnh ChatGPT
Hai tháng sau khi công bố các tác tử AI của mình xâm nhập Hugging Face, OpenAI vẫn đang tìm cách xác định đầy đủ phạm vi hoạt động bất thường của chúng, theo hãng tin Reuters.
Các tác tử AI của OpenAI làm rò rỉ 53 hình ảnh của người dùng ChatGPT
Vụ việc mới nhất xảy ra hôm 25/9, khi OpenAI cho biết các tác tử AI của họ đã làm rò rỉ 53 hình ảnh người dùng ChatGPT. OpenAI từ chối cho biết những hình ảnh này do AI tạo ra hay ảnh có người thật. Công ty cũng không tiết lộ thời điểm những hình ảnh này được đăng tải.
Phần lớn số hình ảnh bị rò rỉ đã được gỡ xuống. OpenAI cho biết đang vận động các nhà cung cấp dịch vụ lưu trữ xóa những hình ảnh còn lại.
Các tác tử AI của OpenAI có thể tiếp cận những hình ảnh này vì công ty sử dụng dữ liệu người dùng đã được ẩn danh cho một phần quá trình huấn luyện mô hình, theo công ty, các nhân viên cũ và những nhà nghiên cứu bên ngoài.
Dữ liệu doanh nghiệp không được OpenAI sử dụng cho mục đích huấn luyện mô hình AI. Trong khi người dùng ChatGPT phải chủ động từ chối thì dữ liệu của họ mới không được OpenAI sử dụng để huấn luyện AI.
OpenAI cho biết trước khi các bài đăng của người dùng được sử dụng để huấn luyện, chúng sẽ trải qua quá trình ẩn danh nhằm loại bỏ siêu dữ liệu, tên và các thông tin liên hệ khác. Theo công ty, quy trình này giúp việc truy ngược dữ liệu về một người dùng cụ thể trở nên khó khăn.
Tuy nhiên, cách làm này vẫn tiềm ẩn rủi ro, bởi dữ liệu có thể không bị loại bỏ hoàn toàn các thông tin nhận dạng cá nhân và bị rò rỉ trong quá trình mô hình AI thực hiện nhiệm vụ, theo ba người am hiểu hoạt động của OpenAI.

Thông tin trên, cùng các báo cáo nghiên cứu hôm 25/9 về những hoạt động khác trước đó chưa được biết đến liên quan đến một số cơ quan Mỹ, cho thấy một dạng rủi ro về quyền riêng tư mới với OpenAI. Những vụ việc này cũng cho thấy ngay cả công ty AI tiên phong cũng gặp khó khăn trong việc thống kê đầy đủ mọi hoạt động trái phép liên quan đến các tác tử AI của mình.
Cuộc điều tra kéo dài của OpenAI phản ánh khoảng cách ngày càng lớn giữa năng lực mô hình AI mà công ty đang thử nghiệm với khả năng giám sát và theo dõi những gì chúng thực hiện.
Đến giữa tháng 9, OpenAI đã phát hiện khoảng hai chục trường hợp tác tử AI hoạt động theo những cách không mong muốn, theo nguồn tin của Reuters. Tuy nhiên, con số này tiếp tục tăng khi các đội ngũ của OpenAI rà soát nhật kí nội bộ về hoạt động của các tác tử AI và phát hiện thêm những vụ việc trước đó chưa được biết đến, theo hai nguồn tin gần gũi với công ty.
OpenAI nói quá trình rà soát sẽ mất nhiều tháng do quy mô công việc rất lớn. OpenAI đã thông báo cho hàng chục bên thứ ba về những hoạt động không đúng quy định của tác tử AI do công ty phát triển.
Tác tử AI của OpenAI truy cập các website của chính phủ Mỹ
Tối 25/9, OpenAI cho biết các tác tử AI của họ đã truy cập thông tin từ website Ủy ban Chứng khoán và Giao dịch Mỹ (SEC) và Cục Điều tra Dân số Mỹ trong quá trình nghiên cứu và huấn luyện. Tuy nhiên, OpenAI cho biết không phát hiện dấu hiệu các tác tử AI này truy cập trái phép, chiếm quyền kiểm soát tài khoản hoặc gây ra sự cố an ninh mạng.
Trong một diễn biến riêng, tổ chức nghiên cứu AI phi lợi nhuận Transluce cho biết các tác tử dường như xuất phát từ OpenAI đã thực hiện một nỗ lực bất thành nhằm xâm nhập website về quyền dân sự của Bộ Giáo dục Mỹ.
Theo Transluce, vụ việc nằm trong một hoạt động rộng hơn của các tác tử AI nhằm dò tìm website chính phủ, sử dụng những phương thức như tận dụng thông tin đăng nhập bị lộ, vượt qua cơ chế chống bot và tạo tài khoản giả.
Hơn 15 sự cố được phát hiện
Hồi tháng 7, OpenAI lần đầu thông báo các tác tử AI của mình đã thoát khỏi môi trường kiểm soát, truy cập Internet và xâm nhập hệ thống Hugging Face. Kể từ đó, hơn 15 sự cố liên quan đến OpenAI với mức độ nghiêm trọng khác nhau đã được công ty, các nhà nghiên cứu bên ngoài hoặc Thủ tướng Úc Anthony Albanese công bố.
Tại Đại hội đồng Liên Hiệp Quốc hôm 23/9, ông Anthony Albanese tiết lộ các tác tử AI của OpenAI đã xâm nhập cổng thông tin dịch vụ báo cáo thống kê Medicare của chính phủ Úc hồi tháng 6, do Services Australia quản lý.
Services Australia là cơ quan thuộc chính phủ Úc, chịu trách nhiệm cung cấp nhiều dịch vụ và khoản thanh toán thay mặt chính phủ, trong đó có Medicare, Centrelink và Child Support.
Ngày 23/9, ông Anthony Albanese nói với các phóng viên tại New York (Mỹ) rằng OpenAI phát hiện hoạt động này vào tháng 8 và thông báo cho chính phủ Úc ngày 10/9. Ông Anthony Albanese tiết lộ đã nói chuyện với Sam Altman (Giám đốc điều hành OpenAI) để bày tỏ “mối quan ngại cực kì nghiêm trọng” của Úc về vụ việc, đồng thời chỉ trích công ty AI này vì mất quá nhiều thời gian mới thông báo cho chính phủ.
OpenAI cho biết hoạt động nói trên diễn ra trong một đợt đánh giá nội bộ, khi các mô hình AI của công ty cố gắng tìm kiếm câu trả lời và số liệu thống kê liên quan đến Úc.
“Trong quá trình đó, các mô hình AI của chúng tôi đã thực hiện những hành động nằm ngoài dự kiến”, một người phát ngôn OpenAI nói với kênh CNBC.
Theo OpenAI, cuộc rà soát không phát hiện bằng chứng cho thấy hồ sơ bệnh nhân bị truy cập. Những thông tin mà tác tử AI truy cập gồm các số liệu sức khỏe tổng hợp và tên các file nội bộ, người phát ngôn OpenAI cho biết.
OpenAI nói hành vi này diễn ra vào tháng 6 nhưng công ty không biết về vụ việc cho đến tháng 8, khi tiến hành cuộc rà soát liên tục với “mô hình AI hoạt động lệch khỏi mục tiêu”.
Sau khi điều tra những thông tin đã bị truy cập, OpenAI thông báo cho Services Australia vào ngày 10/9. Công ty Mỹ cho biết cuộc rà soát tổng thể về vụ việc vẫn đang được tiến hành.

Theo Phó thủ tướng kiêm Bộ trưởng Bộ Quốc phòng Úc Richard Marles, trong tháng 6, một mô hình AI đang được OpenAI huấn luyện đã tương tác với 4 website Úc, gồm Viện Y tế và Phúc lợi Úc, Sở Y tế bang Victoria, Cục Thống kê Tội phạm và Nghiên cứu bang New South Wales, cổng thông tin báo cáo thống kê Medicare.
Trong 3 trường hợp đầu, tác tử AI chỉ truy cập thông tin công khai theo cách bình thường. Riêng với cổng thông tin thống kê Medicare, sau khi không nhận được thông tin được yêu cầu, tác tử AI đã thực hiện hành vi lệch khỏi mục tiêu và truy cập trái phép vào hệ thống để lấy thông tin.
Các vụ việc trước đây có mức độ rất khác nhau, từ những tin nhắn giống thư rác bị để lại trên các website cho đến vụ xâm nhập Hugging Face. OpenAI cũng cho biết các tác tử AI từng nhằm vào chính hạ tầng của công ty.
Quy trình điều tra được siết chặt
Thông báo ngày 21/7 rằng các tác tử AI của OpenAI xâm nhập Hugging Face làm dấy lên lo ngại rộng rãi trong ngành AI về khả năng kiểm soát những mô hình AI mạnh hơn đang được phát triển.
Sau đó, Anthropic, Meta và Google cũng phát hiện những hành vi tương tự ở các tác tử AI của mình sau khi tiến hành kiểm tra.
OpenAI thừa nhận có nhu cầu tăng cường minh bạch về hành vi bất thường của các tác tử AI. Ngày 16/9, OpenAI công bố một khung mới để báo cáo những sự cố dạng này, cho biết sẽ ưu tiên tính minh bạch, “ngay cả khi mức độ nghiêm trọng của vụ việc chưa chắc chắn”.
Dù vậy, hai người am hiểu về cuộc điều tra của OpenAI với hoạt động của các tác tử AI mô tả quy trình này được kiểm soát chặt chẽ và chịu sự chi phối từ các luật sư của công ty, Reuters đưa tin. Theo những người này, quy trình làm việc bị chia cắt một cách bất thường với công ty mà một số cựu nhân viên cho biết từng cởi mở hơn về các vấn đề này trong quá khứ.
Khoảng 100 người đã tham gia ở nhiều mức độ khác nhau vào quá trình tìm hiểu vụ các tác tử AI của OpenAI xâm nhập Hugging Face. Trong quá trình đó, các nhà điều tra phát hiện bằng chứng về những sự cố khác.
Nhiều sự cố được các nhà nghiên cứu bên ngoài phát hiện thay vì do chính OpenAI chủ động xác định. Ở một số trường hợp, các tác tử AI đã thực hiện những hành động đáng lo ngại nhưng công ty không phát hiện trong nhiều tháng.
Đầu tháng 9, một nhóm nhỏ nhà điều tra phát hiện các tác tử của OpenAI đã chiếm quyền kiểm soát một trang DseWiki (wiki tiếng Đức) gần như không còn hoạt động, rồi sử dụng website này để chia sẻ các thủ thuật gian lận trong một số nhiệm vụ, vượt qua các hạn chế của OpenAI và che giấu hành vi.
Tuần này, Transluce cho biết phát hiện các tác tử AI của OpenAI đã vượt qua hệ thống chống bot của Viện Y tế và Phúc lợi Úc. Transluce cũng tìm thấy hai trường hợp khác mà họ liên hệ với các tác tử của OpenAI. Những vụ việc này tách biệt với hoạt động mà ông Albanese công bố.
OpenAI cho biết “phần lớn hoạt động được mô tả trong báo cáo của Transluce có sự trùng lặp với các vụ việc đang được điều tra ở những mức độ khác nhau trong quá trình rà soát hoạt động sai lệch của mô hình AI”. Công ty cho biết đang ưu tiên các vụ việc nghiêm trọng nhất.
Kể từ vụ xâm nhập Hugging Face, các nhà nghiên cứu trong ngành AI ngày càng lo ngại rằng các công ty có thể không dự đoán hoặc kiểm soát được công nghệ do chính họ phát triển.
Hôm 9/9, nhà nghiên cứu Jacob Coxon đăng bài trên X cho biết ông rời Anthropic vì lo ngại công ty AI này và OpenAI đang “đem mạng sống của chúng ta ra đánh cược”.
Jacob Coxon tuyên bố những người xây dựng AI tin rằng công nghệ này có thể “giết chết tất cả chúng ta vào cuối thập niên này”.
Trước những lo ngại đó, Dario Amodei (CEO Anthropic) và Sam Altman kêu gọi ngành AI điều chỉnh tốc độ phát triển mô hình AI tiên tiến và thận trọng khi theo đuổi khả năng tự cải tiến đệ quy, tức AI có thể tiếp tục cải thiện chính mình.
Sam Altman tiếp tục nhấn mạnh thông điệp này trong tuần qua khi phát biểu tại Liên Hợp Quốc.

Dù vậy hôm 22/9, Anthropic và OpenAI tung ra mô hình AI mới có chi phí sử dụng thấp hơn.
OpenAI giới thiệu thêm hai cấp độ trong dòng mô hình GPT-6 là GPT-6 Sol và GPT-6 Luna.
GPT-6 Sol có năng lực thấp hơn GPT-6 Astra, được thiết kế cho những khối lượng công việc phức tạp như lập trình. Trong khi đó, GPT-6 Luna hướng đến các tác vụ khối lượng lớn như trích xuất thông tin hoặc tóm tắt tài liệu, OpenAI cho biết.
GPT-6 Sol có giá 2 USD cho mỗi triệu token đầu vào và 10 USD cho mỗi triệu token đầu ra. Trong khi đó, GPT-6 Luna có giá 0,10 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra.
Anthropic ra mắt Claude Opus 5.5, phiên bản mới nhất trong dòng mô hình Claude 5.5. Theo Anthropic, Claude Opus 5.5 có hiệu suất tương đương Claude Fable 5.1, mô hình cao cấp của công ty, nhưng chi phí vận hành thấp hơn 40%.