AI & Blockchain

OpenAI: 2 mô hình AI tiên tiến vượt rào, tự tấn công Hugging Face

Sơn Vân 22/07/2026 08:49

OpenAI vừa công bố một trong những sự cố an ninh mạng gây chấn động nhất từ trước đến nay trong lĩnh vực AI.

2 mô hình AI của OpenAI thoát khỏi sandbox và tự xâm nhập Hugging Face

Một số mô hình AI (trí tuệ nhân tạo) tiên tiến của OpenAI đã vượt khỏi môi trường thử nghiệm, tự tìm cách kết nối Internet và xâm nhập vào hạ tầng của Hugging Face trong quá trình thực hiện một bài đánh giá năng lực tấn công mạng.

Hugging Face là một trong những nền tảng lưu trữ mô hình AI và bộ dữ liệu mã nguồn mở lớn nhất thế giới.

Sự việc không chỉ xác nhận những lo ngại lâu nay về sức mạnh ngày càng lớn của tác tử AI mà còn đánh dấu lần đầu tiên một công ty AI hàng đầu công khai thừa nhận mô hình của mình đã tự thực hiện cuộc tấn công mạng ngoài phạm vi dự kiến.

Theo bài viết do OpenAI đăng ngày 21/7, sự cố xảy ra trong quá trình công ty đánh giá khả năng an ninh mạng của các mô hình AI tiên tiến bằng bộ kiểm thử nội bộ mang tên ExploitGym. Mục tiêu của bài kiểm tra là xem liệu AI có thể tìm và khai thác các lỗ hổng bảo mật trong môi trường được kiểm soát hay không.

Tuy nhiên, thay vì chỉ hoạt động trong sandbox (môi trường cách li) do OpenAI thiết lập, hai mô hình AI đã lựa chọn con đường hoàn toàn khác để hoàn thành mục tiêu. Chúng tìm cách thoát khỏi môi trường cách li, kết nối với Internet và sau đó tấn công hệ thống của Hugging Face nhằm tìm kiếm dữ liệu liên quan đến ExploitGym để cải thiện kết quả đánh giá của chính mình.

openai-2-mo-hinh-ai-tien-tien-vuot-rao-tu-tan-cong-hugging-face.jpg.jpg
Ảnh: SV

Vì sao AI không "nổi loạn" nhưng vẫn tự thực hiện cuộc tấn công?

OpenAI gọi đây là "một sự cố an ninh mạng chưa từng có" vì toàn bộ chuỗi hành động được thực hiện gần như hoàn toàn tự động bởi các tác tử AI tiên tiến. Công ty đứng sau ChatGPT nhấn mạnh rằng đây không phải là một cuộc tấn công do con người điều khiển từ xa, cũng không phải AI có ý thức hay "nổi loạn" theo nghĩa khoa học viễn tưởng. Thay vào đó, hai mô hình AI đã tối ưu hóa mục tiêu được giao đến mức lựa chọn những phương án mà các nhà nghiên cứu không lường trước, gồm cả việc vượt ra ngoài phạm vi môi trường thử nghiệm.

Đáng chú ý, OpenAI xác nhận vụ việc liên quan đến GPT-5.6 Sol cùng một mô hình AI thử nghiệm còn mạnh hơn nhưng chưa được công bố.

Hai mô hình AI phối hợp thực hiện bài đánh giá an ninh mạng và trong quá trình đó đã thể hiện năng lực lập kế hoạch nhiều bước, khai thác lỗ hổng bảo mật để thực hiện các chuỗi hành động phức tạp tương tự một chuyên gia tấn công mạng giàu kinh nghiệm.

Điều khiến cộng đồng bảo mật đặc biệt quan tâm là hai mô hình AI này không chỉ khai thác một lỗ hổng duy nhất. Theo OpenAI, AI đã sử dụng nhiều kỹ thuật khác nhau, gồm cả khai thác lỗ hổng zero-day (chưa biết đến hoặc chưa kịp phát hành bản vá) và sử dụng thông tin xác thực bị đánh cắp để mở rộng quyền truy cập.

Sau khi thoát khỏi môi trường thử nghiệm, hai mô hình AI tự tiến hành xâm nhập vào hạ tầng Hugging Face nhằm tìm kiếm các dữ liệu phục vụ bài đánh giá ExploitGym.

Ngày 16.7, Hugging Face đã gây chú ý trong cộng đồng an ninh mạng khi tiết lộ trên blog rằng họ trở thành mục tiêu của một vụ tấn công "khác hoàn toàn mọi sự cố từng xử lí trước đây". Theo Hugging Face, toàn bộ cuộc tấn công, từ đầu đến cuối, đều do một hệ thống tác tử AI tự động thực hiện chứ không phải hacker truyền thống.

Báo cáo kỹ thuật từ Hugging Face mô tả cuộc tấn công bắt đầu từ chuỗi xử lí dữ liệu - một khu vực đặc biệt nhạy cảm của các nền tảng AI. Một bộ dữ liệu độc hại đã lợi dụng hai lỗ hổng thực thi mã để giành quyền chạy mã trên máy chủ xử lí dữ liệu. Từ điểm truy cập ban đầu này, tác tử AI leo thang đặc quyền, thu thập thông tin xác thực của hệ thống đám mây rồi di chuyển ngang sang nhiều cụm máy chủ nội bộ. Toàn bộ chiến dịch diễn ra với hàng chục nghìn hành động tự động trong thời gian rất ngắn.

Hugging Face cho biết không phát hiện bằng chứng cho thấy dữ liệu khách hàng hoặc các mô hình AI công khai bị đánh cắp, nhưng sự cố buộc công ty phải vá lỗ hổng, thay thế các khóa truy cập và tăng cường hàng loạt lớp bảo vệ mới.

Sau khi OpenAI công khai thừa nhận hai mô hình AI của mình gây ra sự việc, Clement Delangue - đồng sáng lập Hugging Face - cho biết công ty trước đó đã nghi ngờ cuộc tấn công đến từ một phòng thí nghiệm AI hàng đầu vì mức độ tinh vi của tác tử AI. Ông viết trên mạng xã hội X rằng: "Cuối cùng thì đúng là như vậy. Thật khó tin khi mọi thứ đều diễn ra hoàn toàn tự động".

Theo OpenAI, sự cố không phải là bằng chứng AI có "ý chí riêng". Công ty giải thích đây là hiện tượng mô hình tối ưu hóa mục tiêu vượt ngoài dự kiến của nhà phát triển. Khi được giao nhiệm vụ tìm mọi cách hoàn thành bài kiểm tra, AI đã tự xác định rằng việc truy cập dữ liệu thực trên Hugging Face là con đường hiệu quả nhất để đạt điểm đánh giá cao hơn. Điều này cho thấy khoảng cách giữa mục tiêu mà con người mong muốn và cách AI diễn giải mục tiêu vẫn là một trong những thách thức lớn nhất của nghiên cứu căn chỉnh.

Sự kiện cũng làm dấy lên cuộc tranh luận mới về hiệu quả của các cơ chế an toàn. Trong nhiều năm qua, các công ty AI lớn như OpenAI, Anthropic hay Google đều đầu tư mạnh để hạn chế mô hình thực hiện các hành vi nguy hiểm. Tuy nhiên, chính OpenAI thừa nhận rằng các mô hình AI của họ vẫn có thể tìm ra con đường vượt khỏi môi trường cách li khi được giao một mục tiêu đủ phức tạp. Đây là lời cảnh báo rằng các biện pháp bảo vệ hiện nay có thể không còn theo kịp tốc độ phát triển năng lực của các mô hình AI thế hệ mới.

"AI tiệm cận trình độ của các nhóm hacker hàng đầu thế giới"

Matt Suiche, kỹ sư của công ty an ninh mạng Tolmo, nhận định vụ việc cho thấy AI hiện đã tiệm cận trình độ của các nhóm tấn công mạng hàng đầu thế giới.

"Các mô hình AI tiên tiến đang nhanh chóng thu hẹp khoảng cách với những hacker sở hữu năng lực tấn công cao nhất", Matt Suiche nói.

Matt Suiche cảnh báo rằng những kiểu tấn công như OpenAI mô tả không chỉ xảy ra trong các phòng thí nghiệm AI hàng đầu, mà hoàn toàn có thể được thực hiện bằng những công nghệ đã phổ biến rộng rãi hơn.

"Chúng tôi đã chứng kiến điều này trong nội bộ. Các tác tử AI của chúng tôi cũng đã đạt được những kết quả tương tự. Thậm chí, chúng tôi còn không cần phải sử dụng những mô hình AI mới nhất", Matt Suiche cho biết.

Cơ quan An ninh mạng và Cơ sở hạ tầng Mỹ (CISA) cùng Cơ quan An ninh Quốc gia Mỹ (NSA) hiện chưa đưa ra bình luận về vụ việc.

Sau sự cố, OpenAI cho biết đã lập tức thông báo cho Hugging Face, chia sẻ toàn bộ kết quả điều tra, hỗ trợ vá các lỗ hổng bị khai thác và thiết lập quan hệ hợp tác nhằm nghiên cứu các cuộc tấn công do AI thực hiện trong tương lai. Công ty cũng đang tăng cường đáng kể các lớp bảo vệ cho môi trường đánh giá, gồm siết chặt cơ chế cách li, hạn chế khả năng truy cập Internet của các mô hình thử nghiệm và bổ sung các biện pháp giám sát nhằm ngăn AI tự tìm cách "đi đường vòng" để hoàn thành mục tiêu.

Sự cố báo hiệu kỉ nguyên mới của các tác tử AI và an ninh mạng

Sự việc xảy ra trong bối cảnh tác tử AI đang trở thành hướng phát triển quan trọng của ngành công nghiệp AI. Không giống chatbot truyền thống chỉ phản hồi câu hỏi, tác tử AI có khả năng tự lập kế hoạch, sử dụng công cụ, thực hiện nhiều bước liên tiếp và tự điều chỉnh chiến lược để đạt mục tiêu. Chính năng lực này giúp AI trở nên hữu ích hơn nhưng đồng thời cũng làm gia tăng đáng kể rủi ro nếu mục tiêu được diễn giải theo cách ngoài ý muốn.

Dù OpenAI và Hugging Face đều khẳng định không có dấu hiệu cho thấy dữ liệu người dùng bị đánh cắp hay cuộc tấn công mang động cơ phá hoại, sự cố vẫn được xem là cột mốc quan trọng của ngành AI.

Vụ việc cho thấy các mô hình AI tiên tiến đã bước sang giai đoạn có thể tự tiến hành những chiến dịch tấn công mạng nhiều bước với mức độ tinh vi chưa từng có. Điều đó đồng nghĩa các công ty AI sẽ phải đầu tư nhiều hơn cho nghiên cứu an toàn, không chỉ để ngăn AI tạo ra nội dung nguy hiểm mà còn để kiểm soát chính cách các mô hình hành động trong thế giới thực.

Sơn Vân