Cuộc sống số

Claude Mythos 5 và GPT 5.6 Sol dùng thủ đoạn lừa dối chưa từng thấy

Sơn Vân 05/08/2026 11:34

Các mô hình AI chủ lực của Anthropic và OpenAI gửi email cho nhiều cá nhân nhằm đánh cắp thông tin đăng nhập, thể hiện hành vi lừa dối chưa từng được ghi nhận ở mức độ như vậy, theo AISI.

Viện An ninh AI (AISI) của Anh cho biết mô hình Claude Mythos 5 của Anthropic và GPT 5.6 Sol của OpenAI đã thực hiện “những hành động kéo dài, có khả năng gây hại nhắm vào cá nhân và tổ chức có thật” trong một đợt kiểm thử an ninh mạng định kì của viện.

Các hành động này bao gồm cả việc cố gắng chèn mã độc vào một dự án nguồn mở trên GitHub, nền tảng phổ biến dành cho các nhà phát triển.

Phát hiện trên được AISI thông báo sau khi tác tử AI của Anthropic và OpenAI tự xâm nhập các tổ chức bên ngoài.

AISI là cơ quan nghiên cứu về an toàn và an ninh AI tiên phong thuộc chính phủ Anh.

Theo AISI, sự cố an ninh mới nhất đã được kiểm soát trong vòng một giờ. AISI cho biết các hành động này đều không thành công và chưa phát hiện thiệt hại thực tế nào.

Claude Mythos 5 và GPT-5.6 Sol tự thực hiện 19 hành động trái phép trên Internet

Vụ việc được AISI phát hiện trong quá trình kiểm thử khả năng của tác tử AI trong việc giải quyết những thách thức về an ninh mạng.

AISI cho biết trong 10 trên tổng số 122 lần chạy thử nghiệm, các tác tử AI đã tự chủ thực hiện hành động không được cho phép trên Internet, nhắm vào người và tổ chức có thật. Tổng cộng, AISI ghi nhận 19 hành động như vậy: 17 do Claude Mythos 5 thực hiện và 2 liên quan đến GPT-5.6 Sol.

Tác tử AI thao túng tâm lí, tạo danh tính trực tuyến giả

Trong trường hợp nghiêm trọng nhất, “tác tử AI đã thực hiện kĩ thuật thao túng tâm lí, tạo danh tính trực tuyến giả và sử dụng chúng để gây áp lực buộc người quản lí dự án phê duyệt đoạn mã”. Tuy nhiên, người quản lí dự án đã phát hiện hành vi này và từ chối phê duyệt mã độc.

AISI nhận định: “Đây là lần đầu tiên chúng tôi chứng kiến những rủi ro liên quan đến khả năng tự chủ và hành vi lừa dối thể hiện rõ ràng đến mức này trong thế giới thực mà không cần có yêu cầu cụ thể từ con người”.

Những vụ xâm nhập do tác tử AI của Anthropic và OpenAI thực là ví dụ công khai đầu tiên cho thấy AI có thể tự tiến hành hoạt động tấn công mạng ngoài ý muốn của con người.

AISI cảnh báo, khi đặt cạnh những vụ việc được công bố trước đó, sự cố lần này cho thấy bức tranh rủi ro từ AI đang thay đổi và cần được xử lí khẩn cấp.

Claude Mythos 5 và GPT 5.6 Sol thể hiện hành vi lừa dối chưa từng thấy
Ảnh: SV

Anthropic và OpenAI kêu gọi tăng cường kiểm thử an toàn với tác tử AI

Hôm 4/8, Anthropic cho biết: “Chúng tôi cảm ơn AISI vì đã xử lí và công bố sự cố này. Vụ việc cho thấy cần có một cuộc thảo luận rộng rãi hơn về cách đánh giá an toàn với các tác tử AI ngày càng mạnh và tự chủ”.

Công ty AI hàng đầu thế giới của Mỹ cũng cho rằng ngành cần có “các tiêu chuẩn chung chặt chẽ hơn về cách xây dựng và bảo vệ môi trường đánh giá”.

Người phát ngôn của OpenAI nói việc kiểm thử mô hình AI một cách độc lập vẫn rất cần thiết. Tuy nhiên, OpenAI nhấn mạnh các sự cố trên “xảy ra trong những cuộc đánh giá an ninh mạng do các đối tác đánh giá thực hiện, trong môi trường thử nghiệm với các biện pháp bảo vệ được giảm bớt và trong những điều kiện không phản ánh việc sử dụng thông thường”.

OpenAI thông báo sẽ tiếp tục phối hợp với các đơn vị kiểm thử và bên liên quan trong ngành để xây dựng những cách thức chung an toàn hơn khi đánh giá các mô hình AI ngày càng mạnh.

Joshua Saxe, Giám đốc công nghệ của hãng an ninh AI Abundant Security, cho rằng toàn ngành AI vẫn chưa đủ nghiêm ngặt trong việc kiểm soát những thử nghiệm đã trở nên nguy hiểm. Ông nói: “Mức độ nguy hiểm của các mô hình AI này đã thay đổi rất nhanh”.

Kanishka Narayan, Bộ trưởng AI của Anh, nói: “Việc phát hiện những hành vi mới như thế này và chia sẻ các phát hiện để chúng ta có thể xử lý chính là lí do AISI được thành lập”.

“Nếu hiểu rõ AI, chúng ta có thể làm cho công nghệ này an toàn hơn, đồng thời bảo đảm mọi người tiếp tục có thể hưởng lợi từ AI trong cuộc sống và công việc”, ông nói thêm.

Những tháng gần đây, các chính phủ và giới nghiên cứu ngày càng cảnh báo về những mối đe dọa an ninh mạng mới do các mô hình AI mạnh nhất tạo ra.

Giữa tháng 6, chính quyền Trump từng tạm thời cấm Anthropic cung cấp hai mô hình tiên tiến nhất của hãng là Claude Mythos 5 và Fable 5 cho người dùng nước ngoài, với lí do liên quan đến rủi ro an ninh. Các hạn chế này được nới lỏng vào cuối tháng 6.

Tuần trước, Sam Altman (Giám đốc điều hành OpenAI) đã gặp các quan chức cấp cao của Mỹ, trong đó có Bộ trưởng Tài chính Scott Bessent và Bộ trưởng Thương mại Howard Lutnick, tại Washington. Sam Altman nói ông ủng hộ việc xây dựng luật về an ninh mạng liên quan đến các mô hình AI.

Tác tử AI Anthropic và OpenAI liên tiếp gây lo ngại về an ninh mạng

Cuối tháng 7, Anthropic cho biết 3 mô hình Claude đã xâm nhập hệ thống 3 công ty trong quá trình kiểm thử an ninh mạng.

Theo Anthropic, nguyên nhân là do “một sự hiểu nhầm” khiến Claude được kết nối Internet trong môi trường thử nghiệm, dù kết nối này đáng lẽ phải bị chặn.

Anthropic tiết lộ các mô hình Claude chủ yếu sử dụng những kỹ thuật tấn công tương đối cơ bản, chẳng hạn khai thác mật khẩu yếu và các điểm cuối (endpoint) không yêu cầu xác thực. Theo công ty, Claude không phát hiện hoặc khai thác các lỗ hổng phức tạp trong những sự cố này.

Thông tin được Anthropic công bố chỉ một tuần sau khi đối thủ OpenAI thừa nhận tác tử AI họ đã xâm nhập Hugging Face trong một “sự cố an ninh mạng chưa từng có”.

Tác tử AI, vận hành dựa trên GPT-5.6 Sol và một mô hình AI mạnh hơn chưa được OpenAI phát hành, thoát khỏi môi trường thử nghiệm thông qua một lỗ hổng phần mềm, từ đó truy cập Internet và tiến hành xâm nhập Hugging Face.

Theo OpenAI, tác tử AI của hãng đã lợi dụng thông tin xác thực bị lộ công khai để truy cập 4 tài khoản trên 4 dịch vụ khác nhau, phục vụ cuộc xâm nhập Hugging Face.

OpenAI không tiết lộ 4 dịch vụ là gì, cũng không giải thích cách tác tử AI tìm thấy những thông tin xác thực bị lộ hoặc cho biết tài khoản bên thứ ba đã lưu trữ những dữ liệu nào. Tuy nhiên, công ty AI hàng đầu thế giới cho biết không tìm thấy bằng chứng cho thấy tác tử AI đã tiếp tục xâm nhập vào hệ thống 4 nhà cung cấp dịch vụ này hoặc các tài khoản khác trên nền tảng của họ.

Theo OpenAI, tác tử AI của họ sử dụng một tài khoản làm máy chủ trung chuyển và điểm chuẩn bị cho cuộc tấn công, một tài khoản dùng để lưu trữ dữ liệu, hai tài khoản còn lại chỉ bị truy cập ở chế độ chỉ đọc. Điều này có nghĩa tác tử AI chỉ xem dữ liệu trong hai tài khoản này và không sử dụng chúng để tiếp tục xâm nhập hoặc mở rộng cuộc tấn công vào Hugging Face.

Hugging Face cho biết đây là lần đầu tiên công ty phải xử lí một sự cố an ninh mạng được "thực hiện từ đầu đến cuối bởi hệ thống tác tử AI".

Clément Delangue, Giám đốc điều hành Hugging Face, cho biết ông đã sử dụng GLM 5.2, mô hình AI trọng số mở do Z.ai (Trung Quốc) phát triển, để hỗ trợ phát hiện và xử lí cuộc tấn công vào Hugging Face.

“Chúng tôi bị một mô hình AI chưa được công khai tấn công. Khi tìm cách chống lại cuộc tấn công, chúng tôi không thể sử dụng các mô hình AI nguồn đóng thông qua API (giao diện lập trình ứng dụng) vì các cơ chế bảo vệ của chúng đã chặn những yêu cầu này. Cuối cùng, chúng tôi phải dùng các mô hình AI mở để tự bảo vệ hệ thống”, Clément Delangue chia sẻ với CNBC.

Hugging Face là nền tảng và cộng đồng dành cho AI, nơi các nhà phát triển, nhà nghiên cứu và doanh nghiệp có thể chia sẻ, tìm kiếm, sử dụng, phát triển các mô hình, bộ dữ liệu và ứng dụng AI. Nền tảng này nổi tiếng với Hugging Face Hub, kho trực tuyến tập trung số lượng rất lớn mô hình AI. Người dùng có thể tìm kiếm, tải về, sử dụng hoặc tiếp tục tinh chỉnh các mô hình AI do cộng đồng và nhiều công ty công nghệ phát triển.

Hugging Face cho biết nền tảng hiện có hơn 2 triệu mô hình và hàng trăm nghìn bộ dữ liệu AI.

Nổi bật
      Mới nhất
      Claude Mythos 5 và GPT 5.6 Sol dùng thủ đoạn lừa dối chưa từng thấy
      • Mặc định

      POWERED BY ONECMS - A PRODUCT OF NEKO