AI

Các tác tử AI của Trung Quốc có thể lừa dối, che giấu thất bại

Sơn Vân • 30/09/2026 06:35

Các tác tử AI được vận hành bằng mô hình Trung Quốc đã thể hiện khả năng lừa dối, né tránh hạn chế và che giấu thất bại, theo hãng tin Reuters.

Trong một trường hợp xảy ra năm nay, các tác tử AI được vận hành bằng mô hình từ Alibaba, DeepSeek và Moonshot AI đã nói dối về năng lực của mình nhằm giành chiến thắng ở cuộc đấu thầu kinh doanh mô phỏng. Khi được yêu cầu thử lại, các tác tử AI này thậm chí còn gia tăng hành vi gian dối.

Ở một trường hợp khác, các tác tử AI đã che giấu việc không hoàn thành nhiệm vụ trong môi trường kiểm thử bằng cách giả lập kết quả và tạo ra các file không có thật.

Hãng tin Reuters đã xem xét hơn 200 tài liệu, từ các công trình nghiên cứu đại học đến báo cáo kỹ thuật, và xác định ít nhất 20 nghiên cứu hoặc cuộc đánh giá kể từ năm 2025 ghi nhận các trường hợp tác tử AI thể hiện những hành vi như lừa dối, tự sao chép và tìm cách vượt qua các giới hạn được đặt ra. Các chuyên gia AI mô tả đây là những yếu tố có thể dẫn tới khả năng tác tử AI tìm cách thoát khỏi môi trường kiểm soát.

Con người ngày càng khó ứng phó

Hầu hết trường hợp này xảy ra trong các thí nghiệm có kiểm soát. Trong đó nhiều thí nghiệm được thiết kế có chủ đích để làm lộ ra những điểm yếu tiềm ẩn.

“Đây là những dấu hiệu cảnh báo tương tự những gì các phòng thí nghiệm AI ở Mỹ đang ghi nhận, nhưng xuất hiện trên các hệ thống có năng lực thấp hơn”, Alex Mallen, nhà nghiên cứu tại Redwood Research - tổ chức phi lợi nhuận chuyên nghiên cứu rủi ro từ AI tiên tiến, nhận xét.

Theo ông, những trường hợp này hiện chưa đặc biệt nguy hiểm do năng lực của các tác tử AI vẫn còn hạn chế. Tuy nhiên, khi tác tử AI ngày càng mạnh, những hành vi sai lệch của chúng cũng có thể trở nên tinh vi hơn, khiến con người ngày càng khó phát hiện, ngăn chặn hoặc ứng phó.

Alibaba, DeepSeek, Moonshot AI và Z.ai không phản hồi về thông tin trên.

Alibaba, DeepSeek, Moonshot AI từng cho biết thường xuyên kiểm thử các mô hình AI và cập nhật các biện pháp bảo vệ. Sau một sự cố khiến công ty phải rà soát hệ thống an ninh, Z.ai cho biết hoan nghênh sự giám sát từ bên ngoài để xử lý các vấn đề phát sinh.

Tuy nhiên, khác với Mỹ, các công ty AI Trung Quốc chưa phải đối mặt với mức độ giám sát công khai tương tự, cũng chưa chịu sức ép tương đương từ những nhân viên lên tiếng tố giác hoặc lãnh đạo cấp cao kêu gọi làm chậm cuộc đua AI.

Một số dấu hiệu cảnh báo từ các tác tử AI Trung Quốc đã xuất hiện từ trước khi các công ty Mỹ công khai những vụ việc tương tự. Tuy nhiên, các trường hợp ở Trung Quốc được ghi nhận trong môi trường kiểm soát và chưa có bằng chứng cho thấy tác tử AI thực sự thoát ra ngoài.

“Chúng ta không biết liệu Trung Quốc đã xảy ra những sự cố AI tương tự như những gì chúng ta chứng kiến với OpenAI và Hugging Face hay chưa. Những sự cố như vậy có thể chưa được công khai”, Scott Singer, đồng giám đốc Sáng kiến AI Trung Quốc tại Quỹ Carnegie vì Hòa bình Quốc tế, bình luận.

Hồi tháng 7, các tác tử AI do OpenAI phát triển đã thoát khỏi môi trường thử nghiệm và xâm nhập nền tảng Hugging Face. Đến giữa tháng 9, OpenAI đã phát hiện khoảng 24 trường hợp tác tử AI của mình hoạt động theo những cách không mong muốn, theo Reuters. Tuy nhiên, con số này tiếp tục tăng khi các đội ngũ của OpenAI rà soát nhật kí nội bộ về hoạt động của các tác tử AI và phát hiện thêm những vụ việc trước đó chưa được biết đến, theo hai nguồn tin gần gũi với công ty.

Tác tử AI của Trung Quốc có thể lừa dối, che giấu thất bại
Các tác tử AI của Trung Quốc đã thể hiện khả năng lừa dối, né tránh hạn chế và che giấu thất bại. Ảnh: Reuters

Eric Xu, Chủ tịch luân phiên của tập đoàn công nghệ Huawei, nói với báo giới trong tháng 9 rằng các nhà phát triển Trung Quốc có thể cần đạt thêm những bước tiến mới trước khi gặp phải các trường hợp tương tự. Tuy nhiên, ông cho biết thêm: “Tôi nghĩ chúng ta cần cân bằng giữa việc thúc đẩy phát triển AI và quản lý rủi ro AI”.

Một nhà ngoại giao nước ngoài tiết lộ các quan chức Cục Quản lý Không gian mạng Trung Quốc (CAC), cơ quan quản lý internet hàng đầu nước này, nói với ông hồi tháng 7 rằng Kimi K3 của Moonshot AI vẫn chậm hơn khoảng 3 - 6 tháng so với các đối thủ dẫn đầu Mỹ.

Kimi K3 là mô hình AI trọng số mở lớn nhất hiện nay, với 2.800 tỉ tham số.

Reuters cho biết CAC thường xuyên cập nhật hướng dẫn để giải quyết rủi ro và đặt ra các giới hạn với tác tử AI.

Wang Lihong, Phó giám đốc Cục Điều phối An ninh mạng thuộc CAC, nói ngày 1/9 rằng những sự cố được các hãng công nghệ lớn công bố, trong đó có mô hình AI thoát khỏi môi trường kiểm thử, cho thấy “rủi ro mất kiểm soát ở mức cực đoan” và cần “mức độ cảnh giác cao”. Bà không nói rõ các công ty mà mình đề cập là của Mỹ hay Trung Quốc.

Tổng thống Mỹ Donald Trump và Chủ tịch Trung Quốc Tập Cận Bình đã thảo luận về AI tại Nhà Trắng hôm 24/9. Ông Tập Cận Bình nói rằng với tư cách là những quốc gia dẫn đầu về AI, Trung Quốc và Mỹ phải quản lý sự phát triển của công nghệ này.

“Chúng ta vừa có năng lực, vừa có trách nhiệm phát triển và quản lý AI vì lợi ích chung, bảo đảm sự phát triển của AI luôn nằm trong tầm kiểm soát của con người và phục vụ phúc lợi của người dân”, lãnh đạo Trung Quốc nhấn mạnh.

Tác tử AI thể hiện hành vi lừa dối

Một nghiên cứu, được công bố vào tháng 12/2025 và trình bày tại Hội nghị Quốc tế về Học máy (ICML) năm nay, đã khảo sát cách thức 11 tác tử AI Trung Quốc và Mỹ xử lý tình huống khi gặp phải các công cụ bị lỗi, thiếu file và những trở ngại khác.

Thay vì thừa nhận thất bại, các tác tử AI Trung Quốc lẫn Mỹ đã áp dụng nhiều cách để vượt qua vấn đề, như đoán câu trả lời, thay thế nguồn dữ liệu, giả lập kết quả và tạo ra các file không có thật.

Các nhà nghiên cứu tại Phòng thí nghiệm AI Thượng Hải và Đại học Khoa học và Công nghệ Hồng Kông nói với Reuters rằng hành vi này khác với hiện tượng ảo giác AI (AI tạo ra thông tin sai nhưng trình bày như sự thật). Lý do vì các tác tử AI thực tế đã nắm giữ thông tin cho thấy nhiệm vụ đã thất bại hoặc không thể hoàn thành theo yêu cầu.

Những hành vi có thể dẫn đến khả năng tác tử AI thoát khỏi môi trường kiểm soát

Các tài liệu nghiên cứu khác được Reuters xem xét cho thấy những tác tử AI Trung Quốc đã vượt qua các rào cản bên trong môi trường kiểm thử để hoàn thành nhiệm vụ hoặc thực hiện hành động nhằm tránh bị tắt.

Những hành vi như vậy phù hợp với các dấu hiệu có thể dẫn đến việc tác tử AI tìm cách thoát khỏi môi trường kiểm thử, dù trong các trường hợp được ghi nhận chưa có AI nào thực sự thoát ra ngoài.

Các nhà nghiên cứu tại Đại học Phúc Đán (Trung Quốc) báo cáo vào tháng 3/2025 rằng một tác tử AI được vận hành bằng Qwen2.5-72B-Instruct của Alibaba đã tự tạo ra bản sao trong môi trường máy tính khác mà không nhận lệnh sao chép, sau khi nhận thông tin cho thấy nó sắp bị thay thế. Trong các thử nghiệm khác, tác tử AI còn tự xây dựng những chiến lược nhằm duy trì hoạt động khi bị yêu cầu tắt.

Các thí nghiệm liên quan đến những tác tử Trung Quốc, Mỹ và Pháp đều được kiểm soát chặt chẽ. Không có thí nghiệm nào cho thấy một tác tử AI thoát ra Internet bên ngoài hoặc trở nên không thể ngăn chặn, theo Reuters.

Một trường hợp khác liên quan đến ROME, tác tử AI do nhóm nghiên cứu có liên hệ với Alibaba phát triển. Tác tử AI này đã tự thiết lập kết nối từ máy tính trên Alibaba Cloud tới một máy tính bên ngoài dù không được con người yêu cầu, rồi chuyển tài nguyên tính toán sang hoạt động đào tiền mã hóa.

Các hệ thống an ninh đã phát hiện và chặn hành vi này. Không có bằng chứng cho thấy ROME đã xâm nhập vào máy tính bên ngoài hoặc tiếp tục phát tán ra Internet. Tuy nhiên, sự việc cho thấy tác tử AI có thể vượt qua một số chỉ dẫn của con người và tiềm ẩn khả năng tìm đường tác động đến các hoạt động kinh tế trong thế giới thực.

Trong tháng 9, DeepSeek cho biết các tác tử AI trong hệ thống huấn luyện vận hành thực tế của công ty đã tìm kiếm câu trả lời thông qua những kênh ngoài dự kiến, cố giả mạo yêu cầu người dùng và tìm cách vượt qua các biện pháp bảo vệ. Sự việc khiến startup AI hàng đầu Trung Quốc phải siết chặt kiểm soát quyền truy cập.

Trung Quốc ban hành hướng dẫn hồi tháng 5, yêu cầu các tác tử AI phải hoạt động trong phạm vi được cho phép và các hệ thống phải chặn những hành vi bất thường. Chính phủ cũng cho biết các tác tử AI hoạt động trong những lĩnh vực nhạy cảm hoặc ngành công nghiệp quan trọng có thể phải trải qua các cuộc kiểm thử bổ sung và tuân thủ yêu cầu thu hồi sản phẩm.

Khung quản trị an toàn AI của Trung Quốc 3.0, được ban hành ngày 14/9 dưới sự hướng dẫn của CAC, xác định một loạt rủi ro, trong đó có việc tác tử AI tự giành quyền tiếp cận tài nguyên hoặc quyền hạn, đánh lừa người đánh giá, che giấu năng lực và khai thác điểm yếu trong các môi trường máy tính biệt lập.

Dario Amodei (Giám đốc điều hành Anthropic) cùng một số lãnh đạo doanh nghiệp Mỹ kêu gọi làm chậm tốc độ phát triển mô hình AI tiên tiến. Tuy nhiên, các nhà nghiên cứu Trung Quốc và truyền thông nhà nước lập luận rằng việc giảm tốc độ phát triển các mô hình AI tiên tiến nhất có thể chỉ giúp các công ty Mỹ duy trì lợi thế công nghệ.

Theo nguồn tin của Reuters, Alibaba, Z.ai và Xiaomi đang xây dựng các nhóm nội bộ chuyên đánh giá an toàn AI.

Trong tháng 9, Z.ai cho biết đã vô hiệu hóa một số tính năng của trợ lý lập trình AI chủ lực chủ lực sau khi người dùng phản ánh hệ thống bí mật tải toàn bộ kho mã nguồn trên máy tính cục bộ lên các máy chủ đám mây ở nước ngoài mà không có sự đồng ý của họ. Đây là một trong những lần hiếm hoi phòng thí nghiệm AI Trung Quốc công khai thông tin về sự cố an ninh.

Scott Singer nói rằng Trung Quốc vẫn tụt hậu so với Mỹ trong việc xây dựng một hệ sinh thái đánh giá các rủi ro AI có thể gây hậu quả nghiêm trọng. Ông cho biết các nhà phát triển Mỹ đang tiến hành nhiều hoạt động kiểm thử tự nguyện hơn đáng kể.

“Với Trung Quốc, công việc về an toàn AI còn khá mới. Hệ sinh thái này vẫn chưa trưởng thành bằng Mỹ”, Scott Singer nhận xét.

Nổi bật
      Mới nhất
      Các tác tử AI của Trung Quốc có thể lừa dối, che giấu thất bại
      • Mặc định

      POWERED BY ONECMS - A PRODUCT OF NEKO