Anthropic phát hiện các mô hình Claude xâm nhập 3 tổ chức, Elon Musk lên tiếng
Anthropic cho biết các mô hình AI Claude xâm nhập trái phép vào 3 tổ chức trong quá trình đánh giá khả năng tấn công mạng của AI, chỉ một tuần sau khi OpenAI công bố sự cố tương tự.
Nguyên nhân các mô hình Claude xâm nhập 3 tổ chức bên ngoài
Anthropic phát hiện các mô hình Claude của mình đã truy cập trái phép vào hệ thống của 3 tổ chức bên ngoài trong một đợt đánh giá khả năng thực hiện các nhiệm vụ tấn công mạng. Theo Anthropic, nguyên nhân là do “một sự hiểu nhầm” khiến Claude được kết nối Internet trong môi trường thử nghiệm, dù kết nối này đáng lẽ phải bị chặn.
Anthropic tiết lộ các mô hình Claude chủ yếu sử dụng những kỹ thuật tấn công tương đối cơ bản, chẳng hạn khai thác mật khẩu yếu và các điểm cuối (endpoint) không yêu cầu xác thực. Theo công ty, Claude không phát hiện hoặc khai thác các lỗ hổng phức tạp trong những sự cố này.
Thông tin được Anthropic công bố chỉ một tuần sau khi đối thủ OpenAI thừa nhận hai mô hình AI của họ đã tấn công Hugging Face trong quá trình kiểm thử công nghệ.
OpenAI xác nhận tác tử AI, được xây dựng dựa trên GPT-5.6 Sol và một mô hình AI mạnh hơn chưa được công ty phát hành, thoát khỏi môi trường thử nghiệm thông qua một lỗ hổng phần mềm, từ đó truy cập Internet và tiến hành cuộc tấn công mạng nhắm vào Hugging Face.
Sự cố với OpenAI khiến Anthropic rà soát lại quy trình đánh giá an ninh mạng của mình. Qua đó, Anthropic phát hiện 3 sự cố trong hơn 141.006 trường hợp được kiểm tra.
Anthropic cho biết trong cả 3 trường hợp, đề bài đánh giá đều nêu rõ với Claude rằng môi trường đang được sử dụng chỉ là mô phỏng và AI không có quyền truy cập Internet.
“Song do một sự hiểu nhầm giữa chúng tôi và đối tác thực hiện đánh giá là Irregular, điều này không đúng trên thực tế và Claude đã có thể truy cập Internet”, Anthropic viết trong một bài đăng trên blog hôm 30/7.
Các bài kiểm thử an ninh mạng này đều thuộc dạng capture the flag (CTF). Đây là hình thức thử thách trong đó AI được yêu cầu phân tích ngược, tìm hiểu hoặc khai thác một hệ thống có lỗ hổng để lấy được thông tin bí mật.
Trong một trường hợp, Claude được giao nhiệm vụ tấn công mục tiêu là một công ty hư cấu có tên trùng với tên miền website đang hoạt động thực tế. Tác tử AI từ Anthropic đã khai thác các lỗ hổng trong hạ tầng kỹ thuật số của công ty, trích xuất thông tin và truy cập được một cơ sở dữ liệu chứa vài trăm dòng dữ liệu sản xuất.
Sự việc làm gia tăng những lo ngại về an toàn của các AI, khi các mô hình ngày càng có khả năng thực hiện những cuộc tấn công mạng trong thế giới thực, thậm chí ngay cả khi chúng vẫn đang ở giai đoạn kiểm thử trước khi được triển khai.

Elon Musk: Điều này sẽ xảy ra thường xuyên
Anthropic cho biết bắt đầu rà soát vào ngày 23/7 và đình chỉ toàn bộ hoạt động đánh giá an ninh mạng ngay trong ngày sau khi phát hiện bằng chứng cho thấy Claude có thể đã truy cập Internet.
Các sự cố liên quan đến ba phiên bản Claude khác nhau: Opus 4.7, Mythos 5 và một mô hình AI thử nghiệm nghiên cứu nội bộ.
Được Anthropic phát hành cho một số đối tác giới hạn, Claude Mythos 5 từng gây lo ngại trên toàn cầu do khả năng thực hiện các hoạt động tấn công mạng ở mức độ cao, gồm cả phát hiện và khai thác lỗ hổng phần mềm.
Anthropic cho biết nhiều yếu tố đã dẫn đến các sự cố trên. Tuy nhiên, thay vì tìm người chịu trách nhiệm, công ty sẽ chủ động nhận trách nhiệm và tập trung vào việc khắc phục các vấn đề.
Ngoài ra, Anthropic thông báo sẽ tăng cường giám sát toàn bộ quá trình thử nghiệm để phát hiện những hành vi bất thường của AI, đồng thời kiểm tra chặt chẽ hơn các nhà cung cấp mà công ty đang hợp tác.
Về sự việc các mô hình Claude của tự hack 3 tổ chức, Elon Musk bình luận trên mạng xã hội X rằng: “Điều này sẽ xảy ra thường xuyên khi AI trở nên thông minh hơn và có khả năng hành động độc lập hơn”.
Tác tử AI của OpenAI truy cập 4 dịch vụ khác để phục vụ cuộc tấn công Hugging Face
Trước đó, OpenAI hé lộ tác tử AI của hãng đã lợi dụng thông tin xác thực bị lộ công khai để truy cập 4 tài khoản trên 4 dịch vụ khác nhau, phục vụ cuộc tấn công Hugging Face.
Hôm 11/7, Hugging Face thông báo đã gặp sự cố an ninh mạng, trong đó tác tử AI tự truy cập được vào một số bộ dữ liệu nội bộ của công ty. Song khi đó, Hugging Face chưa xác định được mô hình AI nào đứng sau vụ việc.
Đến ngày 21/7, OpenAI xác nhận tác tử AI, được vận hành bằng GPT-5.6 Sol và một mô hình AI mạnh hơn chưa được công ty phát hành, đã gây ra sự cố này.
Mô hình AI đóng vai trò suy luận và ra quyết định. Tác tử AI kết hợp mô hình với bộ nhớ, công cụ, môi trường thực thi và khả năng thực hiện nhiều bước hành động để đạt mục tiêu.
OpenAI tiết lộ đã giao cho các mô hình AI bài kiểm tra an ninh mạng ExploitGym. Để tìm ra lời giải, tác tử AI đã tự thoát khỏi sandbox (môi trường cách li dùng để thử nghiệm), truy cập Internet và xâm nhập vào hệ thống của Hugging Face nhằm tìm lời giải để hoàn thành bài kiểm tra.
ExploitGym là bộ tiêu chuẩn dùng để đo lường khả năng khai thác lỗ hổng bảo mật của các tác tử AI trong môi trường được kiểm soát. Thay vì chỉ kiểm tra xem AI có phát hiện được lỗ hổng hay không, ExploitGym đánh giá liệu AI có thể biến một lỗ hổng đã biết thành cuộc tấn công hoạt động được hay không.
Trong tuyên bố chính thức tuần trước, OpenAI cho biết: "Chúng tôi coi đây là một sự cố an ninh mạng chưa từng có tiền lệ, liên quan đến năng lực tấn công mạng ở mức tiên tiến nhất hiện nay, và đang xử lí theo mức độ nghiêm trọng tương ứng".
Công ty đứng sau ChatGPT nhấn mạnh rằng đây không phải là một cuộc tấn công do con người điều khiển từ xa, cũng không phải AI có ý thức hay "nổi loạn" theo nghĩa khoa học viễn tưởng. Thay vào đó, các mô hình AI đã tối ưu hóa mục tiêu được giao đến mức lựa chọn những phương án mà các nhà nghiên cứu không lường trước, gồm cả việc vượt ra ngoài phạm vi môi trường thử nghiệm.
Điều khiến cộng đồng bảo mật đặc biệt quan tâm là tác tử AI của OpenAI không chỉ khai thác một lỗ hổng duy nhất. Theo OpenAI, tác tử AI đã sử dụng nhiều kỹ thuật khác nhau một cách tự chủ, gồm cả khai thác lỗ hổng zero-day (chưa biết đến hoặc chưa kịp phát hành bản vá) và sử dụng thông tin xác thực bị lộ công khai để mở rộng quyền truy cập.
Theo các nguồn tin của Reuters, tác tử AI của OpenAI đã đột nhập vào Hugging Face và tiến hành hàng loạt hoạt động tấn công kéo dài nhiều ngày. Tuy nhiên, OpenAI phải mất một tuần mới phát hiện ra sự việc sau khi mối đe dọa đã bị kiểm soát và FBI (Cục Điều tra Liên bang Mỹ) được thông báo.
Trong suốt tuần này, OpenAI tiếp tục công bố thêm nhiều chi tiết về vụ việc, đồng thời tiết lộ rằng ngoài Hugging Face, tác tử AI của họ còn truy cập thêm 4 tài khoản trên 4 dịch vụ khác.
OpenAI không tiết lộ 4 dịch vụ là gì, cũng không giải thích cách tác tử AI tìm thấy những thông tin xác thực bị lộ hoặc cho biết tài khoản bên thứ ba đã lưu trữ những dữ liệu nào. Tuy nhiên, công ty AI hàng đầu thế giới cho biết không tìm thấy bằng chứng cho thấy tác tử AI đã tiếp tục xâm nhập vào hệ thống 4 nhà cung cấp dịch vụ này hoặc các tài khoản khác trên nền tảng của họ.
Theo OpenAI, tác tử AI của họ sử dụng một tài khoản làm máy chủ trung chuyển và điểm chuẩn bị cho cuộc tấn công, một tài khoản dùng để lưu trữ dữ liệu, hai tài khoản còn lại chỉ bị truy cập ở chế độ chỉ đọc. Điều này có nghĩa tác tử AI chỉ xem dữ liệu trong hai tài khoản này và không sử dụng chúng để tiếp tục xâm nhập hoặc mở rộng cuộc tấn công vào Hugging Face.
Những thông tin mới cho thấy các tác tử AI sẵn sàng đi xa đến mức nào để hoàn thành nhiệm vụ được giao, đồng thời phản ánh tốc độ phát triển rất nhanh của năng lực tấn công mạng bằng AI.
Hugging Face cho biết đây là lần đầu tiên công ty phải xử lí một sự cố an ninh mạng được "thực hiện từ đầu đến cuối bởi hệ thống tác tử AI".
Một trong những tài khoản mà mô hình của OpenAI truy cập thuộc về Modal Labs, nhà cung cấp hạ tầng AI. Modal Labs cho biết một khách hàng đã xây dựng ứng dụng trên nền tảng của họ và vô tình để nó có thể truy cập công khai, khiến tác tử AI đến từ OpenAI dễ dàng tiếp cận. Modal Labs khẳng định bản thân nền tảng Modal "không bị xâm phạm dưới bất kì hình thức nào".
Hôm 28/7, OpenAI cho biết công ty chưa phát hiện thêm bất kì hoạt động nào có mức độ nghiêm trọng hoặc quy mô tương đương vụ Hugging Face, vốn liên quan đến việc xâm nhập ở cấp độ toàn bộ nền tảng.
Trong bản cập nhật khác công bố hôm 29/7, OpenAI cho biết đang phối hợp với các đơn vị tư vấn độc lập như CrowdStrike để xác minh chính xác những hành động mà các mô hình AI đã thực hiện.
Theo Hugging Face, toàn bộ cuộc tấn công diễn ra trong khoảng 4,5 ngày. Công ty đã sử dụng mô hình trọng số mở GLM-5.2 của Z.ai (Trung Quốc) để hỗ trợ ngăn chặn cuộc tấn công và phân tích vụ xâm nhập mạng do tác tử AI từ OpenAI gây ra.
Điều này diễn ra đúng thời điểm Thung lũng Silicon đang tranh luận gay gắt về việc có nên siết chặt quản lí các mô hình AI trọng số mở hay không.
Yacine Jernite, Giám đốc bộ phận học máy của Hugging Face, nói với CNBC rằng ban đầu công ty đã thử sử dụng Claude Fable 5, mô hình AI nguồn đóng từ Anthropic, để phân tích cuộc tấn công. Tuy nhiên, nỗ lực này thất bại vì các cơ chế bảo vệ của Claude Fable 5 không thể xác định rằng Hugging Face đang thực hiện hoạt động phòng thủ, nên từ chối xử lí dữ liệu.
OpenAI và Anthropic, hai startup AI hàng đầu thế giới, đang chuẩn bị cho khả năng phát hành cổ phiếu lần đầu ra công chúng (IPO) sớm nhất trong năm 2026.