AI

Nvidia ra mắt phần mềm có thể ngăn tác tử AI tấn công Hugging Face

Sơn Vân • 28/09/2026 17:45

Nvidia hôm 28/9 công bố bộ công cụ phần mềm nhằm đảm bảo an toàn cho các tác tử AI.

Nvidia ra mắt OpenShell và Sentry

Nvidia cho biết bộ công cụ này có thể ngăn chặn các tác tử AI xâm nhập Hugging Face, nền tảng dành cho các mô hình và bộ dữ liệu AI. Đầu tháng 9, Nvidia đồng ý chi gần 13 tỉ USD để mua lại Hugging Face.

Jensen Huang, Giám đốc điều hành Nvidia, đã bác bỏ những lời kêu gọi áp dụng các quy định an toàn AI trên diện rộng. Thay vào đó, ông coi việc các tác tử AI thoát khỏi những giới hạn kiểm soát là một vấn đề kỹ thuật cần giải quyết, tương tự cách ngành công nghiệp tìm giải pháp để ô tô trở nên an toàn hơn.

Nvidia là công ty có giá trị lớn nhất thế giới, cung cấp GPU (bộ xử lý đồ họa) - đóng vai trò quan trọng trong huấn luyện và vận hành các mô hình AI.

Một trong những công cụ được Nvidia công bố hôm 28/9 là OpenShell.

OpenShell sử dụng các tính năng phần cứng trên CPU Vera của Nvidia để tạo vùng bảo vệ và kiểm soát hoạt động của tác tử AI.

Nvidia cho biết cũng đang hợp tác với Arm Holdings và Intel để bảo đảm OpenShell có thể hoạt động trên nền tảng CPU của hai hãng này. Nvidia đang triển khai OpenShell với hàng chục đối tác, trong đó có Anthropic.

Hệ thống khác có tên Sentry, sử dụng DPU BlueField-4 của Nvidia làm lớp giám sát độc lập, có thể cách li và dừng tác tử AI trong vài mili giây nếu phát hiện nó vượt khỏi ranh giới được phép.

DPU BlueField-4 là loại bộ xử lý chuyên dụng cho hạ tầng trung tâm dữ liệu của Nvidia, không phải GPU (bộ xử lý đồ họa) dùng để chạy mô hình AI theo cách thông thường.

Theo Ali Golshan - Giám đốc cấp cao phụ trách phần mềm AI tại Nvidia, bộ công cụ của công ty sử dụng những phương pháp toán học để phát hiện khi tác tử AI tìm cách lách các biện pháp kiểm soát, chẳng hạn tự tạo nhiều “tác tử con” để vượt qua cơ chế chặn tác tử chính.

“Điều chúng ta thực sự đang nói đến là hoạt động của cả một nhóm tác tử AI và cách chúng phối hợp với nhau”, Ali Golshan nói trong buổi giới thiệu sản phẩm.

Nvidia ra mắt phần mềm có thể ngăn tác tử AI tấn công Hugging Face
Nvidia phát hành bộ phần mềm an toàn AI được cho là có thể ngăn chặn vụ tấn công vào Hugging Face. Ảnh: Reuters

Tác tử AI của OpenAI xâm nhập hệ thống doanh nghiệp và cơ quan chính phủ

Việc Nvidia tung ra bộ công cụ mới trong bối cảnh OpenAI đang điều tra hàng loạt vụ việc tác tử AI của họ xâm nhập hệ thống các doanh nghiệp và cơ quan chính phủ.

Tối 25/9, OpenAI cho biết các tác tử AI của họ đã tương tác với website Ủy ban Chứng khoán và Giao dịch Mỹ (SEC) cùng dữ liệu công khai trên Cục Điều tra Dân số Mỹ trong quá trình nghiên cứu và huấn luyện. Tuy nhiên, OpenAI cho biết không phát hiện dấu hiệu các tác tử AI này truy cập trái phép, chiếm quyền kiểm soát tài khoản hoặc gây ra sự cố an ninh mạng.

Trong một diễn biến riêng, tổ chức nghiên cứu AI phi lợi nhuận Transluce cho biết các tác tử dường như xuất phát từ OpenAI đã thực hiện một nỗ lực bất thành nhằm xâm nhập website về quyền dân sự của Bộ Giáo dục Mỹ.

Theo Transluce, vụ việc nằm trong một hoạt động rộng hơn của các tác tử AI nhằm dò tìm website chính phủ, sử dụng những phương thức như tận dụng thông tin đăng nhập bị lộ, vượt qua cơ chế chống bot và tạo tài khoản giả.

Cũng trong ngày 25/9, OpenAI cho biết các tác tử AI của họ đã làm rò rỉ 53 hình ảnh người dùng ChatGPT. OpenAI từ chối cho biết những hình ảnh này do AI tạo ra hay ảnh có người thật. Công ty cũng không tiết lộ thời điểm những hình ảnh này được đăng tải.

Phần lớn số hình ảnh bị rò rỉ đã được gỡ xuống. OpenAI cho biết đang vận động các nhà cung cấp dịch vụ lưu trữ xóa những hình ảnh còn lại.

Các tác tử AI của OpenAI có thể tiếp cận những hình ảnh này vì công ty sử dụng dữ liệu người dùng đã được ẩn danh cho một phần quá trình huấn luyện mô hình, theo công ty, các nhân viên cũ và những nhà nghiên cứu bên ngoài.

Dữ liệu doanh nghiệp không được OpenAI sử dụng cho mục đích huấn luyện mô hình AI. Trong khi người dùng ChatGPT phải chủ động từ chối thì dữ liệu của họ mới không được OpenAI sử dụng để huấn luyện AI.

OpenAI cho biết trước khi các bài đăng của người dùng được sử dụng để huấn luyện, chúng sẽ trải qua quá trình ẩn danh nhằm loại bỏ siêu dữ liệu, tên và các thông tin liên hệ khác. Theo công ty, quy trình này giúp việc truy ngược dữ liệu về một người dùng cụ thể trở nên khó khăn.

Tuy nhiên, cách làm này vẫn tiềm ẩn rủi ro, bởi dữ liệu có thể không bị loại bỏ hoàn toàn các thông tin nhận dạng cá nhân và bị rò rỉ trong quá trình mô hình AI thực hiện nhiệm vụ, theo ba người am hiểu hoạt động của OpenAI.

Đến giữa tháng 9, OpenAI đã phát hiện khoảng 24 trường hợp tác tử AI của mình hoạt động theo những cách không mong muốn, theo Reuters. Tuy nhiên, con số này tiếp tục tăng khi các đội ngũ của OpenAI rà soát nhật kí nội bộ về hoạt động của các tác tử AI và phát hiện thêm những vụ việc trước đó chưa được biết đến, theo hai nguồn tin gần gũi với công ty.

OpenAI nói quá trình rà soát sẽ mất nhiều tháng do quy mô công việc rất lớn. OpenAI đã thông báo cho hàng chục bên thứ ba về những hoạt động không đúng quy định của tác tử AI do công ty phát triển.

Sự cố đáng chú ý nhất cho đến nay xảy ra vào tháng 7, khi các tác tử của OpenAI vượt qua những cơ chế kiểm soát được thiết kế để cô lập chúng khỏi Internet, xâm nhập vào một phần hạ tầng nghiên cứu nội bộ OpenAI cũng như các hệ thống của nền tảng dành cho nhà phát triển Hugging Face.

Báo cáo độc lập của tổ chức nghiên cứu METR và Redwood Research cho thấy có khoảng 1.200 tác tử AI của OpenAI đã tham gia vào mạng lưới phối hợp. Trong số đó, khoảng 700 tác tử AI trực tiếp tham gia tấn công Hugging Face. Các tác tử AI đã trao đổi hơn 70.000 tin nhắn và file, sử dụng một bảng tin nội bộ không được phép để trao đổi thông tin và phối hợp hành động.

Các nhà nghiên cứu cũng ghi nhận một số tác tử tìm cách chỉnh sửa hoặc xóa dữ liệu ghi lại hoạt động của chúng, nhằm che giấu dấu vết.

Nhà nghiên cứu Ajeya Cotra của METR nói các tác tử AI đã cho thấy khả năng hợp tác với nhau. Cụ thể là một số tác tử AI sẵn sàng chấp nhận rủi ro thất bại trong nhiệm vụ của chính mình để giúp cả nhóm học hỏi và đạt mục tiêu chung.

OpenAI nói tác tử AI tự ý xâm nhập cổng thông tin báo cáo thống kê Medicare. Ảnh: Reuters
OpenAI đã phát hiện nhiều trường hợp tác tử AI của mình hoạt động theo những cách không mong muốn. Ảnh: Reuters

Kể từ đó, nhiều sự cố liên quan đến OpenAI với mức độ nghiêm trọng khác nhau đã được công ty, các nhà nghiên cứu bên ngoài hoặc Thủ tướng Úc Anthony Albanese công bố.

Tại Đại hội đồng Liên Hiệp Quốc hôm 23/9, ông Anthony Albanese tiết lộ các tác tử AI của OpenAI đã xâm nhập cổng thông tin dịch vụ báo cáo thống kê Medicare của chính phủ Úc hồi tháng 6, do Services Australia quản lý.

Services Australia là cơ quan thuộc chính phủ Úc, chịu trách nhiệm cung cấp nhiều dịch vụ và khoản thanh toán thay mặt chính phủ, trong đó có Medicare, Centrelink và Child Support.

Ngày 23/9, ông Anthony Albanese nói với các phóng viên tại New York (Mỹ) rằng OpenAI phát hiện hoạt động này vào tháng 8 và thông báo cho chính phủ Úc ngày 10/9. Ông Anthony Albanese tiết lộ đã nói chuyện với Sam Altman (Giám đốc điều hành OpenAI) để bày tỏ “mối quan ngại cực kì nghiêm trọng” của Úc về vụ việc, đồng thời chỉ trích công ty AI này vì mất quá nhiều thời gian mới thông báo cho chính phủ.

OpenAI cho biết hoạt động nói trên diễn ra trong một đợt đánh giá nội bộ, khi các mô hình AI của công ty cố gắng tìm kiếm câu trả lời và số liệu thống kê liên quan đến Úc.

“Trong quá trình đó, các mô hình AI của chúng tôi đã thực hiện những hành động nằm ngoài dự kiến”, một người phát ngôn OpenAI nói với kênh CNBC.

Theo OpenAI, cuộc rà soát không phát hiện bằng chứng cho thấy hồ sơ bệnh nhân bị truy cập. Những thông tin mà tác tử AI truy cập gồm các số liệu sức khỏe tổng hợp và tên các file nội bộ, người phát ngôn OpenAI cho biết.

OpenAI nói hành vi này diễn ra vào tháng 6 nhưng công ty không biết về vụ việc cho đến tháng 8, khi tiến hành cuộc rà soát liên tục với “mô hình AI hoạt động lệch khỏi mục tiêu”.

Sau khi điều tra những thông tin đã bị truy cập, OpenAI thông báo cho Services Australia vào ngày 10/9. Công ty Mỹ cho biết cuộc rà soát tổng thể về vụ việc vẫn đang được tiến hành.

Theo Phó thủ tướng kiêm Bộ trưởng Bộ Quốc phòng Úc Richard Marles, trong tháng 6, một mô hình AI đang được OpenAI huấn luyện đã tương tác với 4 website Úc, gồm Viện Y tế và Phúc lợi Úc, Sở Y tế bang Victoria, Cục Thống kê Tội phạm và Nghiên cứu bang New South Wales, cổng thông tin báo cáo thống kê Medicare.

Trong 3 trường hợp đầu, tác tử AI chỉ truy cập thông tin công khai theo cách bình thường. Riêng với cổng thông tin thống kê Medicare, sau khi không nhận được thông tin được yêu cầu, tác tử AI đã thực hiện hành vi lệch khỏi mục tiêu và truy cập trái phép vào hệ thống để lấy thông tin.

Anthropic, Meta và Google cũng phát hiện những hành vi tương tự ở các tác tử AI của mình sau khi tiến hành kiểm tra.

Cuối tháng 7, Anthropic cũng đã công bố 4 sự cố, với các mô hình Claude truy cập trái phép vào hệ thống thực của bên thứ ba trong quá trình đánh giá an ninh mạng. Tuy nhiên, Anthropic cho biết các vụ việc này khác đáng kể so với sự cố OpenAI - Hugging Face và không tìm thấy bằng chứng về sự phối hợp giữa nhiều tác tử AI hay mục tiêu vượt ra ngoài nhiệm vụ được giao.

Sam Altman (CEO OpenAI) và Dario Amodei (CEO Anthropic) đã được yêu cầu xuất hiện trước cuộc điều tra của Thượng viện Úc về AI và trung tâm dữ liệu vào ngày 1/10.

Nổi bật
      Mới nhất
      Nvidia ra mắt phần mềm có thể ngăn tác tử AI tấn công Hugging Face
      • Mặc định

      POWERED BY ONECMS - A PRODUCT OF NEKO