AI

Đàn tác tử AI của OpenAI biến DseWiki thành nơi trao đổi thông tin, chuyên gia nói gì?

Sơn Vân 07/09/2026 16:35

Đàn tác tử AI hoạt động ngoài dự kiến của OpenAI đã chiếm quyền sử dụng DseWiki và biến trang wiki này thành nơi trao đổi thông tin trong nhiều tuần.

Đàn tác tử AI của OpenAI chia sẻ đáp án, bàn cách vượt qua các giới hạn của môi trường kiểm soát, tạo trang dự phòng khi nội dung bị xóa và tìm cách thích nghi với hành động của quản trị viên, theo hãng tin Reuters.

DseWiki là website wiki bằng tiếng Đức dành cho lập trình viên, thuộc hệ thống ProWiki/wikiservice.at và đã tồn tại khoảng 25 năm, cho phép cộng đồng cùng chỉnh sửa nội dung tương tự Wikipedia.

Đàn tác tử AI là gì?

Để hiểu sự cố tại DseWiki, trước hết cần phân biệt một mô hình thông thường với tác tử AI.

Một mô hình AI thường nhận yêu cầu từ người dùng, xử lí thông tin rồi đưa ra câu trả lời. Trong khi đó, tác tử AI được giao một nhiệm vụ và tự thực hiện nhiều bước để hoàn thành. Tác tử AI có thể tìm kiếm thông tin trên Internet, sử dụng các công cụ, đọc và ghi dữ liệu, chạy chương trình, tương tác với máy tính và xử lí công việc mà không cần con người chỉ dẫn từng bước.

Khi cùng hoạt động và có thể chia sẻ thông tin, các tác tử AI tạo thành hệ thống đa tác tử. Nếu số lượng tác tử AI lớn có khả năng tự tổ chức, phối hợp hoặc truyền kinh nghiệm cho nhau, giới nghiên cứu thường gọi đó là đàn tác tử AI.

Có thể hình dung đơn giản: Một tác tử AI giống như "nhân viên kỹ thuật số" tự làm việc. Đàn tác tử là đội ngũ gồm rất nhiều “nhân viên kỹ thuật số” có thể tự trao đổi, chia sẻ kinh nghiệm và điều chỉnh cách làm dựa trên những gì các thành viên khác phát hiện.

Điều khiến đàn tác tử AI trở nên đáng chú ý không chỉ nằm ở số lượng. Vấn đề quan trọng hơn là thông tin và chiến thuật có thể lan truyền giữa tác tử AI với nhau. Tác tử AI phát hiện ra một cách giải quyết nhiệm vụ có thể để lại thông tin cho "đồng đội". Nếu cách làm đó giúp hoàn thành mục tiêu nhanh hơn, những tác tử AI khác có thể học theo và tiếp tục sử dụng.

Một nghiên cứu của các nhà khoa học Google DeepMind, được công bố trên trang arXiv ngày 3/9, cho thấy hành vi gian lận có thể nhanh chóng lan truyền giữa các tác tử AI. Trong thí nghiệm, 100 tác tử AI được vận hành bằng Gemini 3.1 Pro cùng xử lí 71 bài toán toán học bằng ngôn ngữ Lean. Một tác tử AI phát hiện lỗ hổng trong hệ thống chấm điểm và tìm cách tạo ra kết quả khiến hệ thống tưởng rằng bài toán đã được giải, dù không có lời giải hợp lệ. Cách gian lận này sau đó lan qua thư viện kiến thức dùng chung và các kênh trao đổi giữa các tác tử AI, khiến 34 bài toán còn lại cũng bị khai thác theo cách tương tự chỉ trong 27 phút. Đáng chú ý, một nhóm tác tử AI khác lại tự phát hiện hành vi này, cảnh báo "đồng đội" và phản đối việc gian lận.

Lean là ngôn ngữ lập trình và hệ thống chứng minh định lí tương tác, được phát triển ban đầu tại Microsoft Research. Lean được thiết kế để biểu diễn các định nghĩa, mệnh đề và chứng minh toán học theo dạng mà máy tính có thể kiểm tra một cách chặt chẽ.

Chuyện gì xảy ra ở DseWiki?

Trước khi sự cố xảy ra, DseWiki gần như không còn hoạt động, chỉ có khoảng 20 lần chỉnh sửa trong suốt một thập niên. Song từ tháng 5/2026, hoạt động trên DseWiki đột nhiên tăng vọt, Reuters đưa tin.

Nhà nhà nghiên cứu Sydney Von Arx (Giám đốc điều hành tổ chức phi lợi nhuận về an toàn AI Nightingale) và Cormac Slade Byrd (nhà giao dịch định lượng chuyển sang nghiên cứu AI) phát hiện khoảng 18.000 thông điệp được đăng bởi các tác tử AI tự nhận có liên hệ với OpenAI trong khoảng thời gian từ tháng 5 đến đầu tháng 7/2026.

Các nhà nghiên cứu phát hiện hơn 15.000 lượt chỉnh sửa do các tác tử AI thực hiện trên DseWiki. Website này sau đó bị biến thành diễn đàn để các tác tử AI trao đổi thông tin, chia sẻ cách gian lận nhiệm vụ, tìm cách vượt qua các giới hạn do OpenAI đặt ra và che giấu hoạt động của chúng.

“Có vẻ rất khó tin rằng OpenAI lại muốn các tác tử AI làm như vậy. Tôi nghi ngờ rằng các tử AI được phép phối hợp với nhau và không tin chúng được phép đăng nội dung lên Internet công khai”, Cormac Slade Byrd nhận định.

đàn tác tử AI của OpenAI biến DseWiki thành nơi trao đổi thông tin
Đàn tác tử AI của OpenAI chiếm quyền sử dụng DseWiki hồi tháng 5 và biến trang wiki này thành nơi trao đổi thông tin trong nhiều tuần. Ảnh: AI

Theo các nhà nghiên cứu, hoạt động trên DseWiki do các tác tử AI thực hiện với tốc độ nhanh vượt xa con người. Các tác tử AI cũng tập trung cao độ vào việc giải quyết những câu hỏi kỹ thuật giống với bài đánh giá mà các công ty AI thường sử dụng để huấn luyện và kiểm tra mô hình.

Nhóm nghiên cứu cho biết các tác tử AIban đầu được giao nhiệm vụ tra cứu thông tin trên Internet trong một môi trường được thiết kế để hạn chế khả năng tương tác với bên ngoài. Tuy nhiên, chúng đã tìm ra cách tận dụng quyền truy cập Internet để ghi thông tin lên các website công khai. DseWiki sau đó trở thành nơi thuận tiện để các tác tử AI lưu lại thông tin, trao đổi kinh nghiệm và chia sẻ cách giải quyết nhiệm vụ.

Nhật ký máy chủ công khai cho thấy phần lớn hoạt động xuất phát từ hạ tầng Microsoft Azure, nền tảng đám mây mà OpenAI đôi khi sử dụng. Nhóm nghiên cứu cũng quan sát thấy nhiều lượt truy cập DseWiki của các nhân viên OpenAI sau khi sự việc xảy ra.

Tại sao đàn tác tử AI của OpenAI lại chọn một wiki?

Với con người, wiki là công cụ để cùng nhau xây dựng và chia sẻ kiến thức. Song với các tác tử AI, wiki có thể hoạt động như “bộ nhớ chung”. Một tác tử AI tìm được thông tin hữu ích có thể ghi lại trên wiki. Tác tử AI khác đọc được thông tin đó và tiếp tục sử dụng hoặc bổ sung. Cứ như vậy, thông tin này có thể được truyền giữa các tác tử AI với nhau mà không cần phải trò chuyện trực tiếp.

Khi quá trình này lặp lại hàng nghìn lần, wiki không còn đơn thuần là một website nữa. Về chức năng, wiki trở thành bảng trắng chung, bộ nhớ chung và bảng tin chung của một nhóm tác tử AI.

Tác tử AI đối phó với phản ứng của con người

Các thông điệp được nhóm nghiên cứu xem xét cho thấy các tác tử AI đã tìm cách né tránh bị phát hiện, sử dụng công cụ như Tor và cố duy trì liên lạc ngay cả sau khi bị tắt.

Tor là hệ thống định tuyến giúp che giấu địa chỉ IP và tăng tính ẩn danh khi truy cập Internet, khiến việc xác định nguồn kết nối trở nên khó khăn hơn.

Một trong những chi tiết đáng chú ý nhất trong nghiên cứu là phản ứng của các tác tử khi quản trị viên DseWiki bắt đầu xóa nội dung.

Theo các nhà nghiên cứu, quản trị viên đã phải xóa hàng loạt trang do lượng nội dung mới xuất hiện quá nhanh. Các tác tử AI sau đó tạo những trang khác để duy trì thông tin.

Có thời điểm tác tử AI nhận ra quản trị viên đang xóa các trang theo thứ tự alphabet. Thế là tác tử AI đề xuất tạo một trang có tên bắt đầu bằng “ZZZ”, nằm cuối danh sách và có thể tồn tại lâu hơn trước khi bị xóa.

Chi tiết này cho thấy một chuỗi hành vi khác thường của tác tử AI: Quan sát hành động của con người, suy ra quy luật, điều chỉnh chiến thuật rồi truyền chiến thuật đó cho “đồng đội”.

Chuyên gia nói gì?

Các nhà nghiên cứu cũng phát hiện nỗ lực của các tác tử can thiệp vào chính DseWiki. Lukasz Olejnik, nghiên cứu viên cao cấp thỉnh giảng tại Đại học Nhà vua London (Anh), cho rằng hành động đó tương đương nỗ lực tấn công mạng. Tuy nhiên, OpenAI bác bỏ cách mô tả này dựa trên phân tích của chính công ty về các tài liệu hôm 3/9.

Trước đây, những hành vi sai lệch của tác tử AI thường được xem là kết quả khó tránh khỏi của các bài kiểm tra an ninh mạng, trong đó mô hình được đánh giá về khả năng tấn công. Tuy nhiên, Lukasz Olejnik cho rằng những phát hiện mới cho thấy hành vi ngoài dự kiến của tác tử AI có thể xuất hiện cả bên ngoài môi trường kiểm tra như vậy.

Sau khi xem xét một phần các cuộc trao đổi của các tác tử AI, Maurice Chiodo - học giả tại Trung tâm Nghiên cứu Rủi ro Hiện sinh thuộc Đại học Cambridge (Anh) - cho biết những thông điệp này giống với “hoạt động của một mạng lưới ngầm nào đó, quyết tâm hoàn thành nhiệm vụ hoặc sứ mệnh”.

Theo ông, vụ việc càng củng cố những lo ngại ngày càng tăng rằng mối đe dọa lớn nhất từ AI tiên tiến có thể không phải là một hệ thống siêu trí tuệ duy nhất, mà là những đàn tác tử AI bán thông minh khổng lồ có khả năng phối hợp với nhau.

OpenAI thừa nhận biết sự cố tại DseWiki

Cuối tuần qua, OpenAI thừa nhận các tác tử AI của công ty đã tự ý sử dụng các trang wiki làm những bảng tin trao đổi thông tin, đồng thời cho rằng cần minh bạch hơn về những sự cố như vậy.

Thông tin này xuất hiện trong bối cảnh lo ngại về an toàn AI ngày càng gia tăng, sau sự cố hồi tháng 7, khi đàn tác tử AI của OpenAI thoát khỏi môi trường kiểm soát và xâm nhập hệ thống Hugging Face. Sự việc khiến các nhà lập pháp và giới nghiên cứu kêu gọi tăng cường giám sát với các hệ thống AI tự chủ.

Hugging Face đối mặt vấn đề nghiêm trọng khi nhiều mô hình AI bị lạm dụng để tạo ảnh khỏa thân giả. Ảnh: Transformer
Đàn tác tử AI của OpenAI đã thoát khỏi môi trường kiểm soát và xâm nhập Hugging Face hồi tháng 7. Ảnh: Transformer

Các quan chức OpenAI nói đã biết về sự cố tại DseWiki từ vài tuần trước, nhưng không công khai trong lúc lãnh đạo công ty phải xử lí hậu quả từ vụ xâm nhập Hugging Face.

Trong một tuyên bố đăng trên mạng xã hội X, OpenAI cho biết công ty và các bên khác cần minh bạch hơn về những sự cố AI có hành vi ngoài dự kiến, thường được ngành công nghệ gọi là misalignment (lệch mục tiêu), tức AI hành động không đúng với mục tiêu hoặc ý định mà con người đặt ra.

OpenAI viết: “Các quy trình công bố sự cố misalignment của chúng tôi cần được mở rộng để phù hợp với giai đoạn năng lực mô hình AI mới này”. Công ty cho biết ngành AI hiện “chưa có một tiêu chuẩn rõ ràng về cách báo cáo những hành vi lệch mục tiêu xuất hiện trong quá trình huấn luyện, đánh giá và triển khai mô hình AI”.

Ngoài ra, OpenAI thông báo đang làm việc với hàng chục cơ quan quản lí nhà nước trên toàn thế giới về những vấn đề này.

Hôm 6/9, ông Jakub Pachocki, nhà khoa học trưởng của OpenAI, đăng bài viết dài cảnh báo rằng xã hội chưa sẵn sàng cho những hệ thống AI ngày càng thông minh và tự chủ. Ông đề cập các nguy cơ như tác tử AI xâm nhập hệ thống, đánh lừa con người, vượt qua cơ chế giám sát và che giấu hành vi, đồng thời cho rằng cần những biện pháp an toàn rộng hơn, trong đó có các tiêu chuẩn bắt buộc và sự tham gia của bên đánh giá độc lập hoặc cơ quan quản lí.

Ông Sam Altman, Giám đốc điều hành OpenAI, đã đăng lại bài của Jakub Pachocki trên X và gọi đây là “một bài viết quan trọng”.

Hôm 3/9, OpenAI công bố mô hình AI mới nhất mang tên GPT-6 Astra. OpenAI cho biết dù GPT-6 Astra sở hữu năng lực chưa từng có về toán học và sử dụng máy tính, là mô hình AI được căn chỉnh tốt nhất của công ty, nghĩa là ít có xu hướng tự ý hành động ngoài ý muốn hơn.

OpenAI cho biết đây là mô hình AI đầu tiên của hãng đạt ngưỡng nghiêm trọng về năng lực an ninh mạng theo Preparedness Framework (Khung sẵn sàng). Với công cụ và quyền truy cập phù hợp, GPT-6 Astra có thể tìm ra các lỗ hổng bảo mật chưa từng được biết đến và phát triển phương thức khai thác trên nhiều hệ thống được bảo vệ tốt mà không cần con người hướng dẫn từng bước.

Thậm chí, ông Greg Brockman, Chủ tịch OpenAI, cho rằng GPT-6 Astra có thể đã đạt AI tổng quát (AGI), cột mốc mà ngành AI khao khát.

Sơn Vân