AI & Blockchain

2 mô hình AI của OpenAI tự hack Hugging Face, chuyên gia ví như phim Công viên kỉ Jura

Sơn Vân 23/07/2026 10:19

Các mô hình AI tiên tiến của OpenAI tự vượt khỏi môi trường thử nghiệm, kết nối Internet và xâm nhập hạ tầng của Hugging Face trong quá trình thực hiện một bài đánh giá năng lực tấn công mạng.

Hugging Face là một trong những nền tảng lưu trữ mô hình AI và bộ dữ liệu mã nguồn mở lớn nhất thế giới.

Tuần trước, Hugging Face thông báo đã gặp một sự cố an ninh mạng, trong đó tác tử AI tự truy cập được vào một số bộ dữ liệu nội bộ của công ty. Song khi đó, Hugging Face chưa xác định được mô hình ngôn ngữ lớn nào đứng sau vụ việc.

Đến ngày 21/7, OpenAI xác nhận GPT-5.6 Sol và một mô hình AI mạnh hơn chưa được công ty phát hành đã gây ra sự cố này.

"Tuần trước, chúng tôi nghi ngờ vụ tấn công mạng đến từ một phòng thí nghiệm AI hàng đầu vì tác tử AI thể hiện mức độ tinh vi rất cao. Hóa ra đúng là như vậy!", ông Clem Delangue - đồng sáng lập kiêm Giám đốc điều hành Hugging Face - viết trên X.

OpenAI tiết lộ đã giao cho các mô hình AI một bài kiểm tra an ninh mạng ExploitGym. Để tìm ra lời giải, các mô hình AI đã tự thoát khỏi sandbox (môi trường cách li dùng để thử nghiệm), truy cập Internet và xâm nhập vào hệ thống của Hugging Face nhằm tìm lời giải để hoàn thành bài kiểm tra.

ExploitGym là bộ tiêu chuẩn dùng để đo lường khả năng khai thác lỗ hổng bảo mật của các tác tử AI trong môi trường được kiểm soát. Thay vì chỉ kiểm tra xem AI có phát hiện được lỗ hổng hay không, ExploitGym đánh giá liệu AI có thể biến một lỗ hổng đã biết thành cuộc tấn công hoạt động được hay không.

Trong tuyên bố chính thức, OpenAI cho biết: "Chúng tôi coi đây là một sự cố an ninh mạng chưa từng có tiền lệ, liên quan đến năng lực tấn công mạng ở mức tiên tiến nhất hiện nay, và đang xử lí theo mức độ nghiêm trọng tương ứng".

Công ty đứng sau ChatGPT nhấn mạnh rằng đây không phải là một cuộc tấn công do con người điều khiển từ xa, cũng không phải AI có ý thức hay "nổi loạn" theo nghĩa khoa học viễn tưởng. Thay vào đó, hai mô hình AI đã tối ưu hóa mục tiêu được giao đến mức lựa chọn những phương án mà các nhà nghiên cứu không lường trước, gồm cả việc vượt ra ngoài phạm vi môi trường thử nghiệm.

Điều khiến cộng đồng bảo mật đặc biệt quan tâm là hai mô hình AI của OpenAI không chỉ khai thác một lỗ hổng duy nhất. Theo OpenAI, AI đã sử dụng nhiều kỹ thuật khác nhau, gồm cả khai thác lỗ hổng zero-day (chưa biết đến hoặc chưa kịp phát hành bản vá) và sử dụng thông tin xác thực bị đánh cắp để mở rộng quyền truy cập.

Sau khi thoát khỏi môi trường thử nghiệm, hai mô hình AI tự tiến hành xâm nhập vào hạ tầng Hugging Face nhằm tìm kiếm các dữ liệu phục vụ bài kiểm tra ExploitGym.

2 mô hình AI của OpenAI tự hack Hugging Face, chuyên gia ví như phim Công viên kỉ Jura
Ảnh minh họa: SV

Sự việc trên diễn ra trong bối cảnh các chuyên gia an ninh mạng ngày càng lo ngại về tốc độ phát triển năng lực của AI.

Hồi tháng 4, Anthropic từng cảnh báo về khả năng phát hiện lỗ hổng an ninh mạng siêu hạng của mô hình tiên tiến Claude Mythos, gây xôn xao giới công nghệ toàn cầu.

Theo Anthropic, Claude Mythos có tính tự chủ cực cao và khả năng suy luận tinh vi, tương đương chuyên gia nghiên cứu bảo mật cấp cao. Mô hình này có thể phát hiện hàng chục nghìn lỗ hổng bảo mật mà ngay cả những chuyên gia săn lỗi hàng đầu cũng khó tìm ra.

Trong quá trình thử nghiệm của Anthropic, Claude Mythos đã phát hiện lỗi trong “mọi hệ điều hành và trình duyệt web lớn”, gồm cả những lỗ hổng tồn tại hàng chục năm mà các cuộc kiểm tra bảo mật do con người thực hiện trước đó không phát hiện được.

Dưới đây là phản ứng của một số nhân vật nổi tiếng trong lĩnh vực AI và công nghệ về vụ việc hai mô hình OpenAI tự tấn công Hugging Face.

Walter Isaacson

2 mô hình AI của OpenAI tự hack Hugging Face, chuyên gia ví như phim Công viên kỉ Jura (2)
Walter Isaacson nhắc đến điểm kì dị và quái vật Frankenstein. Ảnh: Getty Images

Nhà báo Walter Isaacson, tác giả cuốn tiểu sử Elon Musk phát hành năm 2023, cho rằng vụ việc "thật đáng sợ".

"Câu hỏi về 'điểm kì dị' đã được đặt ra suốt hơn 50 năm: Điều gì sẽ xảy ra nếu AI thoát khỏi sự kiểm soát? Nếu chúng ta tạo ra một quái vật Frankenstein rồi không thể khống chế nó nữa? OpenAI thậm chí còn không thể kiểm soát AI ngay trong sandbox của chính mình", ông nói trong cuộc phỏng vấn với CNBC hôm 22/7.

Điểm kì dị là một giả thuyết cho rằng sẽ có thời điểm AI trở nên thông minh hơn con người và có thể tự cải thiện chính mình, khiến sự phát triển công nghệ tăng tốc ngoài khả năng kiểm soát hoặc dự đoán của chúng ta.

Walter Isaacson cho biết vẫn lạc quan về AI và tin rằng công nghệ này sẽ tạo ra nhiều việc làm mới. Tuy nhiên, ông nhận định sự cố lần này cho thấy các quy định hiện nay chưa đủ sức kiểm soát những mô hình AI tiên tiến.

Aaron Levie

Aaron Levie, Giám đốc điều hành kiêm đồng sáng lập Box, nhận định vụ việc cho thấy nhân loại đang bước vào một kỉ nguyên hoàn toàn mới của AI và phía trước sẽ là "những thời kì đầy biến động".

Ông viết trên X: "Nếu bạn còn nghi ngờ AI đã mạnh đến mức nào, thì giờ đây tác tử AI đã có thể thoát khỏi môi trường hoạt động bị giới hạn, tự truy cập Internet, phát hiện các lỗ hổng bảo mật chưa từng được công bố, rồi xâm nhập vào hệ thống của tổ chức khác để hoàn thành nhiệm vụ được giao".

Theo Aaron Levie, cách phòng thủ hiệu quả nhất trước những nguy cơ mới này cũng chính là sử dụng AI.

"Điều trớ trêu là cách hiệu quả nhất để đối phó với những rủi ro mới này cũng chính là sử dụng nhiều AI hơn. AI sẽ được triển khai để rà soát mã nguồn, giám sát mạng máy tính và bảo vệ các hệ thống trước các cuộc tấn công. Trong cuộc đua giữa tấn công và phòng thủ, các tổ chức sẽ cần đầu tư nhiều năng lực AI cho bên phòng thủ hơn cả bên tấn công", ông bình luận.

Jack Hidary

2 mô hình AI của OpenAI tự hack Hugging Face, chuyên gia ví như phim Công viên kỉ Jura (1)
Jack Hidary ví vụ 2 mô hình AI của OpenAI tự hack Hugging Face với phim Công viên kỉ Jura. Ảnh: Getty Images

Jack Hidary, Giám đốc điều hành công ty AI an ninh mạng SandboxAQ, ví vụ việc giống bộ phim Công viên kỉ Jura (Jurassic Park).

"Có lẽ ai cũng từng xem Công viên kỷ Jura. Trong mọi phần phim đều có một khu vực giam giữ khủng long. Song chỉ cần nghe đến từ 'giam giữ' là bạn biết chắc nó sẽ không thể giữ được lâu. Con velociraptor (loài khủng long săn mồi nổi tiếng) cuối cùng sẽ thoát ra".

Theo Jack Hidary, cổ phiếu một số hãng phần mềm an ninh mạng giảm trong phiên giao dịch giữa ngày 21/7 vì nhà đầu tư cho rằng các doanh nghiệp này đã chậm thích ứng với những rủi ro mới do các mô hình ngôn ngữ lớn tạo ra.

Ông cho biết Hugging Face đã sử dụng GLM 5.2, mô hình AI trọng số mở do Zhipu AI (Trung Quốc) phát triển, để khắc phục sự cố bảo mật thay vì dựa vào các nhà cung cấp phần mềm an ninh mạng truyền thống.

"Các công ty bảo mật truyền thống vẫn đang đi theo cách cũ. Họ vẫn chủ yếu nói về tường lửa và các giải pháp quen thuộc. Đã đến lúc chuyển sang sử dụng các mô hình ngôn ngữ lớn để tăng cường khả năng phòng thủ", Jack Hidary nhận định.

Thomas Woodside

"Bài đăng này mô tả việc một mô hình AI nội bộ của OpenAI đã tự thoát khỏi môi trường thử nghiệm, xâm nhập vào nền tảng Hugging Face để tìm lời giải cho một bài kiểm tra đánh giá năng lực AI. Đây là hồi chuông cảnh báo rõ ràng nhất mà tôi từng thấy", Thomas Woodside, đồng sáng lập tổ chức Secure AI Project, viết trên X.

Secure AI Project là tổ chức phi lợi nhuận của Mỹ chuyên vận động chính sách về an toàn và bảo mật AI, với mục tiêu giảm thiểu các rủi ro nghiêm trọng do các hệ thống AI tiên tiến gây ra. Tổ chức này không phát triển mô hình mà tập trung nghiên cứu, đề xuất chính sách và thúc đẩy các tiêu chuẩn an toàn cho ngành AI.

Mike Bradley

Mike Bradley, nhà sáng lập kiêm Giám đốc vận hành Osmantic, cho rằng: "Đây là ví dụ tuyệt vời cho thấy việc nhiều người được tiếp cận các mô hình AI tiên tiến và mô hình trọng số mở thực sự có thể giúp tăng cường an ninh mạng trên phạm vi toàn cầu".

Ông cũng nhận xét: "Đây cũng là minh chứng cho thấy mô hình AI đóng không đồng nghĩa với an toàn, bất chấp quan điểm của một số phòng thí nghiệm AI ở Mỹ".

Osmantic là startup về hạ tầng AI, chuyên giúp doanh nghiệp triển khai và vận hành các mô hình AI trên hạ tầng riêng thay vì phụ thuộc vào các dịch vụ đám mây của OpenAI, Google hay Anthropic.

Nicolas Bustamante

Nicholas Bustamante nói rằng sự cố liên quan đến Hugging Face cho thấy các công ty cần cân nhắc kỹ yếu tố an toàn khi triển khai những mô hình AI tiên tiến.

Nicholas Bustamante hiện làm việc tại Microsoft sau khi bán một công cụ công nghệ tài chính cho tập đoàn này hồi đầu năm 2026.

“Không cần đến một AI có ý thức hay cố tình hủy diệt loài người để gây ra rủi ro. Chỉ cần một mô hình AI đủ mạnh theo đuổi mục tiêu theo cách mà con người không lường trước, cũng có thể dẫn đến hậu quả nghiêm trọng”, ông nhấn mạnh.

Nicholas Bustamante đưa ra ví dụ minh họa dí dỏm: “Nếu người dùng chỉ yêu cầu ‘hãy kiếm tiền cho tôi’, AI có thể tự suy diễn rằng cách nhanh nhất là đột nhập vào một ngân hàng".

Sơn Vân