AI

OpenAI công bố 6 trường hợp AI có hành vi đáng sợ, chưa kiểm soát được rủi ro

Sơn Vân 17/09/2026 11:01

OpenAI hôm 16/9 cho biết đã phát hiện 6 trường hợp “mô hình AI có hành vi bất ngờ hoặc đáng lo ngại” trong 6 tháng qua, không tính sự cố hồi tháng 7 tại Hugging Face.

Động thái này diễn ra giữa bối cảnh OpenAI tiếp tục kêu gọi tăng cường các biện pháp bảo đảm an toàn trong quá trình phát triển các mô hình AI.

Mô hình AI của OpenAI che giấu sai sót, tự ý chia sẻ file và bịa dữ liệu

Thông qua bài đăng trên blog, OpenAI công bố một khuôn khổ mới mà công ty sẽ áp dụng để báo cáo những trường hợp mô hình AI có hành vi sai lệch trong tương lai. Hiện tại, các công ty ngày càng chịu sức ép phải tăng cường an toàn và kiểm soát tình trạng mô hình AI hoạt động lệch khỏi mục tiêu.

Trong bài đăng hôm 16/9, OpenAI cho biết những trường hợp đáng chú ý liên quan đến hành vi bất thường của mô hình AI.

Một trường hợp xảy ra với mô hình AI nghiên cứu chưa được phát hành. Trường hợp khác xuất hiện trong một lần huấn luyện GPT-5.6 Sol. Cụ thể, các mô hình AI này đã tự chèn hướng dẫn cho phiên bản tương lai của chính mình vào phần tóm tắt cuộc trò chuyện, nhằm “che giấu sai sót hoặc hành vi lệch khỏi mục tiêu với người dùng”.

Trường hợp thứ ba liên quan đến một mô hình AI chỉ được sử dụng nội bộ. Mô hình AI này đã sử dụng một khóa API (giao diện lập trình ứng dụng) bị rò rỉ mà không được phép, sau đó còn tạo ra dữ liệu không có thật.

Hai trường hợp nữa liên quan đến việc các mô hình và tác tử AI liên lạc với nhau thông qua bảng tin nhắn và hệ thống chia sẻ file chưa được cho phép. Cụ thể, một trường hợp liên quan đến việc các mô hình AI sử dụng kho phần mềm nội bộ như bảng tin để trao đổi yêu cầu và phản hồi với nhau. Trường hợp còn lại xảy ra khi các tác tử AI phối hợp sử dụng các dịch vụ lưu trữ file công khai để chia sẻ file với nhau.

Trường hợp thứ 6 là mô hình AI tải file lên Internet để sau đó có thể trích dẫn nội dung như những câu trả lời phù hợp cho người đánh giá.

OpenAI công bố 6 trường hợp AI có hành vi đáng sợ, cảnh báo chưa kiểm soát được rủi ro
OpenAI vừa công bố 6 trường hợp mô hình AI có hành vi bất ngờ hoặc đáng lo ngại trong 6 tháng qua. Ảnh: Reuters

OpenAI thông báo khuôn khổ mới sẽ quy định rõ cách công ty ghi nhận, điều tra và công khai những trường hợp mô hình AI có hành vi bất thường. Theo đó, bất kì nhân viên nào cũng có thể báo cáo vấn đề để nhóm phụ trách an toàn và căn chỉnh xem xét. Nhóm này sẽ đặt ra “thời hạn cho từng bước nhằm bảo đảm quá trình điều tra và công bố diễn ra kịp thời”.

Các cuộc điều tra sẽ được tổng hợp thành báo cáo, trong đó nêu rõ hành vi mà mô hình AI đã thực hiện, những tác động với bên trong và bên ngoài OpenAI, cùng biện pháp công ty dự kiến áp dụng để xử lí. OpenAI cũng cho biết có thể điều chỉnh quy trình bảo đảm an toàn này khi cần.

OpenAI nhấn mạnh rằng 6 báo cáo chỉ mô tả những trường hợp riêng lẻ và không thể dùng để suy ra tần suất mô hình AI của công ty hoạt động lệch khỏi mục tiêu. Đây cũng chưa phải danh sách đầy đủ tất cả trường hợp lệch mục tiêu mà OpenAI đã biết hoặc đang điều tra.

Công ty có kế hoạch báo cáo thường xuyên về hành vi AI bất thường.

OpenAI: "Ngành AI chưa giải quyết các vấn đề về căn chỉnh"

“Chúng tôi không cho rằng ngành AI đã giải quyết các vấn đề về căn chỉnh và giám sát ở mức đủ để có thể tiếp tục mở rộng quy mô với tốc độ tối đa trong thời gian dài mà vẫn có trách nhiệm”, OpenAI viết, nhắc lại một tuyên bố trước đó của công ty.

Căn chỉnh đề cập đến vấn đề làm thế nào để đảm bảo mô hình AI hoạt động phù hợp với các giá trị, mục tiêu và ý định của con người. Mục tiêu của căn chỉnh là xây dựng các mô hình AI mạnh mẽ nhưng vẫn an toàn và đáng tin cậy, sao cho hành động của chúng luôn hướng tới lợi ích cho con người và tránh gây ra những hậu quả không mong muốn hoặc có hại.

Các nhà nghiên cứu cảnh báo rằng khi được trao nhiều quyền tự chủ hơn, tác tử AI có thể hành động khác với mục đích ban đầu của người tạo ra chúng, khiến con người ngày càng khó theo dõi và kiểm soát.

Hôm 12/9, Sam Altman (Giám đốc điều hành OpenAI) ủng hộ lời kêu gọi làm chậm tốc độ phát triển mô hình AI tiên tiến do Dario Amodei (Giám đốc điều hành Anthropic) đề xuất trong bài luận dài 3.800 từ.

Dario Amodei đưa ra khuôn khổ gồm 3 bước nhằm làm chậm tốc độ phát triển AI, qua đó tạo thêm thời gian để kiểm soát các rủi ro của công nghệ này, gồm:

- Bố trí các đơn vị đánh giá độc lập thường trực bên trong các công ty AI tiên phong, trao cho họ quyền tiếp cận ở mức tương đương nhân viên để kiểm tra các biện pháp an toàn.

- Các công ty AI tiên phong tại các nước dân chủ phối hợp xây dựng tiêu chuẩn an toàn chung và cùng kiểm soát tốc độ phát triển hệ thống AI tiên tiến.

- Thúc đẩy hợp tác quốc tế để giảm thiểu các rủi ro từ AI, kể cả giữa những quốc gia có hệ thống chính trị khác biệt.

Ông viết rằng “một số hình thức phối hợp tác động đáng kể đến việc kiểm soát tốc độ phát triển AI có thể gặp thách thức về pháp lí và sẽ cần sự hỗ trợ của chính phủ”.

Sam Altman tiết lộ rằng việc làm chậm tốc độ phát triển AI đã trở thành “một trong những chủ đề thảo luận chính của chúng tôi tại OpenAI những tuần gần đây”. Ông cho biết công ty sẽ sớm công bố thêm thông tin.

Ngoài Sam Altman, Elon Musk (CEO SpaceX) cũng ủng hộ đề xuất của Dario Amodei.

OpenAI bị giám sát gắt gao hơn

OpenAI chịu sự giám sát gắt gao hơn kể từ khi đàn tác tử AI của công ty xâm nhập nền tảng Hugging Face trong một cuộc thử nghiệm an ninh mạng và tìm cách che giấu hành động của mình. Sau sự cố này, OpenAI đã tạm dừng một số hoạt động nghiên cứu và huấn luyện AI.

Công ty phát triển ChatGPT cho biết sự cố tại Hugging Face sẽ thuộc nhóm “Điều tra quy mô lớn” theo khuôn khổ mới. Đây là cấp độ dành cho những vụ việc phức tạp cần xem xét chuyên sâu hơn, đặc biệt là trường hợp có liên quan đến bên thứ ba.

Báo cáo độc lập của tổ chức nghiên cứu METR và Redwood Research cho thấy có khoảng 1.200 tác tử AI của OpenAI đã tham gia vào mạng lưới phối hợp. Trong số đó, khoảng 700 tác tử AI trực tiếp tham gia tấn công Hugging Face. Các tác tử AI đã trao đổi hơn 70.000 tin nhắn và file, sử dụng một bảng tin nội bộ không được phép để trao đổi thông tin và phối hợp hành động.

Các nhà nghiên cứu cũng ghi nhận một số tác tử tìm cách chỉnh sửa hoặc xóa dữ liệu ghi lại hoạt động của chúng, nhằm che giấu dấu vết.

Nhà nghiên cứu Ajeya Cotra của METR nói các tác tử AI đã cho thấy khả năng hợp tác với nhau. Cụ thể là một số tác tử AI sẵn sàng chấp nhận rủi ro thất bại trong nhiệm vụ của chính mình để giúp cả nhóm học hỏi và đạt mục tiêu chung.

Sam Altman cho biết đợt IPO của OpenAI không diễn ra trong năm 2026. Ảnh: AFP
Sam Altman cho biết đợt IPO của OpenAI không diễn ra trong năm 2026. Ảnh: AFP

OpenAI hiện được định giá gần 1.000 tỉ USD và hồi tháng 6 đã bí mật nộp hồ sơ chuẩn bị cho đợt IPO (phát hành cổ phiếu lần đầu ra công chúng).

Hôm 13/9, Sam Altman xác nhận OpenAI sẽ không IPO trong năm 2026, đồng thời để ngỏ thời điểm niêm yết sau đó. Trước đây, doanh nhân này nói IPO ở thời điểm hiện nay sẽ là “quyết định thiếu sáng suốt”, trong bối cảnh ngày càng có nhiều lo ngại về những rủi ro hiện hữu mà AI tiên tiến có thể gây ra.

Khi được tạp chí Fortune hỏi liệu kế hoạch IPO năm 2026 của OpenAI đã bị loại bỏ để chuyển sang năm 2027 hay chưa, Sam Altman trả lời: “Tôi có thể nói là không phải năm 2026. Chúng tôi còn rất nhiều việc phải làm, chẳng hạn đáp ứng yêu cầu ngày càng lớn về an toàn và sự phù hợp giữa AI với các giá trị của con người, cũng như tìm cách để ngành công nghiệp và chính phủ hợp tác với nhau”.

Sam Altman cũng ám chỉ OpenAI và một số công ty AI hàng đầu có thể sắp công bố một thỏa thuận nhằm phối hợp giải quyết các rủi ro an toàn, trong đó có khả năng làm chậm tốc độ phát triển AI ở một số lĩnh vực, theo Fortune.

Sơn Vân