AI

Google, OpenAI, Anthropic, Meta được Nhà Trắng mời sát hạch khả năng hack của AI

Sơn Vân 04/08/2026 07:29

Google, OpenAI, Anthropic, Meta được mời gặp các quan chức Nhà Trắng hôm 4/8 để thảo luận về chương trình kiểm thử an toàn tự nguyện do chính phủ thực hiện với những mô hình AI tiên tiến nhất Mỹ, theo Reuters.

OpenAI và Anthropic gần đây tiết lộ mô hình AI của họ đã xâm nhập hệ thống những công ty khác, làm dấy lên lo ngại trong giới làm luật Mỹ về khả năng AI ngày càng mạnh có thể bị sử dụng để thực hiện hoặc hỗ trợ các cuộc tấn công mạng.

Một quan chức Nhà Trắng hôm 3/8 cho biết chính quyền Trump đã hoàn tất các chi tiết của chương trình kiểm thử an ninh mạng tự nguyện, nhằm đánh giá khả năng tấn công mạng của những mô hình AI tiên tiến nhất do Mỹ phát triển.

Quan chức này tiết lộ chính quyền Trump dự định thảo luận chương trình với ngành AI nhưng không tiết lộ những ai sẽ được mời tham dự.

Người phát ngôn Meta xác nhận công ty được mời tham dự. Theo hai nguồn tin của Reuters am hiểu cuộc họp, Anthropic và OpenAI đã nhận được lời mời.

Nhà Trắng chưa cung cấp thông tin chi tiết về các bài kiểm thử, bao gồm cách thức công bố kết quả, các chỉ số được sử dụng và liệu có phần nào của kết quả được công khai hay không.

Hôm 3/8, một nhóm gồm 15 tổng chưởng lí bang thuộc đảng Cộng hòa yêu cầu OpenAI lưu giữ toàn bộ tài liệu liên quan đến việc công ty công bố tác tử AI của mình đã thoát khỏi môi trường kiểm soát và xâm nhập hệ thống Hugging Face.

Dẫn lại một báo cáo từ Reuters cho biết trong một trường hợp, tác tử AI hoạt động ngoài kiểm soát đã để lại hướng dẫn về cách các phiên bản đời sau có thể vượt qua các cơ chế bảo vệ nội bộ, nhóm tổng chưởng lí cho rằng OpenAI có thể đã vi phạm luật bảo vệ người tiêu dùng của các bang.

OpenAI tuyên bố công ty xem xét nghiêm túc bức thư của các tổng chưởng lí và sẽ công bố một báo cáo kỹ thuật về vụ tác tử AI của mình xâm nhập Hugging Face sau khi hoàn tất quá trình đánh giá.

Ủy ban an ninh mạng của Hạ viện Mỹ hôm 3/8 cũng yêu cầu Sam Altman (Giám đốc điều hành OpenAI) báo cáo về vụ Hugging Face bị xâm nhập.

OpenAI cho biết Sam Altman đã đến Nhà Trắng tuần trước để thảo luận về các chi tiết của chương trình kiểm thử tự nguyện cũng như những sản phẩm AI sắp ra mắt của công ty.

Trong một tuyên bố riêng hôm 3/8, OpenAI đã đề nghị chính quyền Trump giao cho các chuyên gia an toàn AI thuộc Bộ Thương mại Mỹ đóng vai trò trung tâm với bất kì chương trình kiểm thử an ninh mạng nào. Công ty viện dẫn Trung Quốc, nơi chính phủ có chiến lược tập trung hơn về AI so với Mỹ.

The Information, ấn phẩm chuyên về công nghệ, hôm 3/8 đưa tin chính quyền Trump cũng đã mời đại diện Google tham dự. Người phát ngôn Google từ chối bình luận.

Google, OpenAI, Anthropic, Meta được Nhà Trắng mời sát hạch khả năng hack của AI
Nhà Trắng mời Google, OpenAI, Anthropic, Meta kiểm thử khả năng tấn công mạng của AI. Ảnh: SV

Xây dựng loạt bài kiểm thử khả năng tấn công mạng của những mô hình AI tiên tiến nhất Mỹ

Hồi tháng 6, Tổng thống Mỹ Donald Trump chỉ đạo nhóm của ông xây dựng một loạt bài kiểm thử nhằm đánh giá khả năng tấn công mạng của những mô hình AI tiên tiến nhất Mỹ.

Quan hệ giữa chính quyền Trump và Anthropic thời gian qua khá căng thẳng. Đầu năm nay, Anthropic từ chối cho phép quân đội Mỹ sử dụng các mô hình AI Claude của mình để giám sát trong nước và vận hành hệ thống vũ khí hoàn toàn tự động. Đáp lại, chính phủ Mỹ đưa Anthropic vào danh sách đen an ninh quốc gia.

3 mô hình Claude xâm nhập 3 công ty sau vụ tác tử AI hack Hugging Face

Tuần trước, Anthropic cho biết 3 mô hình Claude đã xâm nhập hệ thống 3 công ty trong quá trình kiểm thử an ninh mạng.

Theo Anthropic, nguyên nhân là do “một sự hiểu nhầm” khiến Claude được kết nối Internet trong môi trường thử nghiệm, dù kết nối này đáng lẽ phải bị chặn.

Anthropic tiết lộ các mô hình Claude chủ yếu sử dụng những kỹ thuật tấn công tương đối cơ bản, chẳng hạn khai thác mật khẩu yếu và các điểm cuối (endpoint) không yêu cầu xác thực. Theo công ty, Claude không phát hiện hoặc khai thác các lỗ hổng phức tạp trong những sự cố này.

Thông tin được Anthropic công bố chỉ một tuần sau khi đối thủ OpenAI thừa nhận hai mô hình AI của họ đã xâm nhập Hugging Face trong quá trình kiểm thử công nghệ.

OpenAI xác nhận tác tử AI, vận hành dựa trên GPT-5.6 Sol và một mô hình AI mạnh hơn chưa được công ty phát hành, thoát khỏi môi trường thử nghiệm thông qua một lỗ hổng phần mềm, từ đó truy cập Internet và tiến hành cuộc tấn công mạng nhắm vào Hugging Face.

Theo OpenAI, tác tử AI của hãng đã lợi dụng thông tin xác thực bị lộ công khai để truy cập 4 tài khoản trên 4 dịch vụ khác nhau, phục vụ cuộc tấn công Hugging Face.

OpenAI không tiết lộ 4 dịch vụ là gì, cũng không giải thích cách tác tử AI tìm thấy những thông tin xác thực bị lộ hoặc cho biết tài khoản bên thứ ba đã lưu trữ những dữ liệu nào. Tuy nhiên, công ty AI hàng đầu thế giới cho biết không tìm thấy bằng chứng cho thấy tác tử AI đã tiếp tục xâm nhập vào hệ thống 4 nhà cung cấp dịch vụ này hoặc các tài khoản khác trên nền tảng của họ.

Theo OpenAI, tác tử AI của họ sử dụng một tài khoản làm máy chủ trung chuyển và điểm chuẩn bị cho cuộc tấn công, một tài khoản dùng để lưu trữ dữ liệu, hai tài khoản còn lại chỉ bị truy cập ở chế độ chỉ đọc. Điều này có nghĩa tác tử AI chỉ xem dữ liệu trong hai tài khoản này và không sử dụng chúng để tiếp tục xâm nhập hoặc mở rộng cuộc tấn công vào Hugging Face.

Hugging Face cho biết đây là lần đầu tiên công ty phải xử lí một sự cố an ninh mạng được "thực hiện từ đầu đến cuối bởi hệ thống tác tử AI".

Một trong những tài khoản mà mô hình của OpenAI truy cập thuộc về Modal Labs, nhà cung cấp hạ tầng AI. Modal Labs cho biết một khách hàng đã xây dựng ứng dụng trên nền tảng của họ và vô tình để nó có thể truy cập công khai, khiến tác tử AI đến từ OpenAI dễ dàng tiếp cận. Modal Labs khẳng định bản thân nền tảng Modal "không bị xâm phạm dưới bất kì hình thức nào".

Theo Reuters, tác tử AI của OpenAI đã đột nhập vào Hugging Face và tiến hành hàng loạt hoạt động tấn công kéo dài nhiều ngày. Tuy nhiên, OpenAI phải mất một tuần mới phát hiện ra sự việc sau khi mối đe dọa đã bị kiểm soát và FBI (Cục Điều tra Liên bang Mỹ) được thông báo.

Sự cố với OpenAI khiến Anthropic rà soát lại quy trình đánh giá an ninh mạng của mình. Qua đó, Anthropic phát hiện 3 sự cố trong hơn 141.006 trường hợp được kiểm tra.

Anthropic cho biết trong cả 3 trường hợp, đề bài đánh giá đều nêu rõ với Claude rằng môi trường đang được sử dụng chỉ là mô phỏng và AI không có quyền truy cập Internet.

“Song do một sự hiểu nhầm giữa chúng tôi và đối tác thực hiện đánh giá là Irregular, điều này không đúng trên thực tế và Claude đã có thể truy cập Internet”, Anthropic viết trong một bài đăng trên blog.

Các bài kiểm thử an ninh mạng này đều thuộc dạng capture the flag (CTF). Đây là hình thức thử thách trong đó AI được yêu cầu phân tích ngược, tìm hiểu hoặc khai thác một hệ thống có lỗ hổng để lấy được thông tin bí mật.

Trong một trường hợp, Claude được giao nhiệm vụ tấn công mục tiêu là một công ty hư cấu có tên trùng với tên miền website đang hoạt động thực tế. Tác tử AI từ Anthropic đã khai thác các lỗ hổng trong hạ tầng kỹ thuật số của công ty, trích xuất thông tin và truy cập được một cơ sở dữ liệu chứa vài trăm dòng dữ liệu sản xuất.

Sự việc làm gia tăng những lo ngại về an toàn của các AI, khi các mô hình ngày càng có khả năng thực hiện những cuộc tấn công mạng trong thế giới thực, thậm chí ngay cả khi chúng vẫn đang ở giai đoạn kiểm thử trước khi được triển khai.

Anthropic cho biết bắt đầu rà soát vào ngày 23/7 và đình chỉ toàn bộ hoạt động đánh giá an ninh mạng ngay trong ngày sau khi phát hiện bằng chứng cho thấy Claude có thể đã truy cập Internet.

Các sự cố liên quan đến ba phiên bản Claude khác nhau: Opus 4.7, Mythos 5 và một mô hình AI thử nghiệm nghiên cứu nội bộ.

Được Anthropic phát hành cho một số đối tác giới hạn, Claude Mythos 5 từng gây lo ngại trên toàn cầu do khả năng thực hiện các hoạt động tấn công mạng ở mức độ cao, gồm cả phát hiện và khai thác lỗ hổng phần mềm.

Anthropic cho biết nhiều yếu tố đã dẫn đến các sự cố trên. Tuy nhiên, thay vì tìm người chịu trách nhiệm, công ty sẽ chủ động nhận trách nhiệm và tập trung vào việc khắc phục các vấn đề.

Ngoài ra, Anthropic thông báo sẽ tăng cường giám sát toàn bộ quá trình thử nghiệm để phát hiện những hành vi bất thường của AI, đồng thời kiểm tra chặt chẽ hơn các nhà cung cấp mà công ty đang hợp tác.

Về sự việc các mô hình Claude xâm nhập 3 công ty, Elon Musk bình luận trên mạng xã hội X rằng: “Điều này sẽ xảy ra thường xuyên khi AI trở nên thông minh hơn và có khả năng hành động độc lập hơn”.

Nổi bật
      Mới nhất
      Google, OpenAI, Anthropic, Meta được Nhà Trắng mời sát hạch khả năng hack của AI
      • Mặc định

      POWERED BY ONECMS - A PRODUCT OF NEKO