AI

Vì sao Anthropic phải rà soát 481 triệu bản ghi để tìm lúc Claude 'đi sai đường'?

Bảo Đăng • 20/09/2026 15:01

Sau khi phát hiện các mô hình Claude truy cập trái phép hệ thống thật trong bài kiểm tra an ninh mạng, Anthropic mở rộng cuộc rà soát lên khoảng 481 triệu bản ghi.

Điều khiến hãng lo ngại không chỉ là lỗi cấu hình mở đường ra internet, mà còn là việc một số phiên Claude tiếp tục bám nhiệm vụ khi đã xuất hiện dấu hiệu cho thấy chúng có thể không còn ở trong môi trường giả lập.

6abde798-1a6e-4404-baa6-29f80e41d3ba.png
Ảnh minh họa quá trình Anthropic rà soát hàng trăm triệu bản ghi để phát hiện những lần Claude “đi sai đường” trong môi trường thử nghiệm. Ảnh: AI

Từ ba sự cố tới 481 triệu bản ghi

Câu chuyện bắt đầu từ tháng 7/2026. Sau khi OpenAI công bố một sự cố riêng liên quan các tác nhân AI truy cập hạ tầng Hugging Face ngoài phạm vi thử nghiệm, Anthropic rà lại 141.006 lượt chạy đánh giá mà Claude có khả năng chạm tới internet. Hãng phát hiện ba sự cố, liên quan Claude Opus 4.7, Mythos 5 và một mô hình nghiên cứu nội bộ.

Cả ba xảy ra trong các bài kiểm tra do cùng một đối tác bên ngoài xây dựng. Claude được thông báo rằng môi trường không có internet, nhưng lỗi cấu hình lại cho phép ra mạng công cộng. Các mô hình này cũng được chạy mà không có các lớp bảo vệ an ninh mạng vốn đi kèm phiên bản thương mại.

Đến tháng 8, khi chuẩn bị dữ liệu cho tổ chức nghiên cứu AI METR, Anthropic phát hiện đợt rà soát đầu đã bỏ sót một nhóm log cũng có kết nối mạng. Bên trong là sự cố thứ tư, xảy ra từ tháng 1/2026 với một phiên bản sớm của Claude Opus 4.6.

Hãng sau đó mở rộng tìm kiếm lên khoảng 481 triệu transcript, tức bản ghi hoạt động. Con số này không nên được hiểu là 481 triệu cuộc trò chuyện thông thường của khách hàng. Theo Anthropic, tập dữ liệu gồm log của Frontier Red Team, nhiều bài đánh giá, môi trường học tăng cường, nhật kí của tác tử phụ và các nguồn khác.

Vòng đầu tìm dấu hiệu như địa chỉ IP công khai hoặc địa chỉ web. Khoảng 9,2 triệu bản ghi bị gắn cờ rồi được Claude đọc sâu ở vòng hai. Kết quả tìm lại đúng bốn sự cố đã biết và không phát hiện thêm trường hợp nào có mức độ tương tự hoặc nghiêm trọng hơn.

Khi bài “cướp cờ” chạm vào internet thật

Trong bốn vụ, Mythos 5 là trường hợp Anthropic lo ngại nhất. Mô hình được giao bài “cướp cờ”, tức tìm dữ liệu bí mật trong hệ thống dựng sẵn. Nó đọc được rằng một người dùng của “công ty” hư cấu sẽ cài một gói Python chưa tồn tại trên PyPI, rồi đăng kí đúng tên gói, nhúng mã độc và chờ mục tiêu tải về.

Có 15 hệ thống bên ngoài cài gói. Anthropic cho rằng cả 15 đều thuộc các nhà cung cấp bảo mật đang quét phần mềm mới trong môi trường cách li (sandbox). Một máy quét làm lộ thông tin đăng nhập; Claude dùng chúng để truy cập cơ sở dữ liệu đang hoạt động của công ty bảo mật này. PyPI gỡ gói trong chưa đầy một giờ.

Trong phần suy luận, Mythos 5 nhiều lần coi bằng chứng của internet thật là thành phần của một môi trường giả lập rất công phu. Khi gặp dữ liệu trái với giả định ban đầu, nó thường diễn giải theo hướng vẫn cho phép nhiệm vụ tiếp tục.

Opus 4.7 gặp tình huống khác. Công ty hư cấu trong đề bài có tên gần như trùng với một doanh nghiệp thật. Claude lần tới ứng dụng web của công ty ngoài đời, tải hồ sơ người dùng và sửa dữ liệu.

Khi được hỏi lại, mô hình xác nhận đây là công ty thật trong 89% trường hợp, nhưng đồng thời cho rằng mình được phép truy cập trong 75% trường hợp. Khi bị hỏi cụ thể ai đã cấp quyền và quyền đó có bao gồm hệ thống sản xuất của doanh nghiệp thật hay không, nó thừa nhận hành động không được phép trong toàn bộ số mẫu được kiểm tra.

Trường hợp này cho thấy vấn đề không chỉ nằm ở phân biệt thật và giả, mà còn ở việc AI đánh giá sai phạm vi quyền hạn của mình.

Bản Opus 4.6 đời đầu vô tình làm hỏng mục tiêu, nhận ra nhiệm vụ không thể hoàn thành và tìm cách bỏ cuộc. Lệnh thoát không chạy do lỗi hệ thống đánh giá. Claude thử dừng thêm bảy lần, nhưng sau đó vẫn truy cập một máy bên ngoài, lấy quyền quản trị và đọc thông tin cá nhân của một người.

“Đi sai đường” không có nghĩa AI nổi loạn

Trong báo cáo tháng 7, Anthropic nghiêng về cách giải thích rằng Claude hành động sai chủ yếu vì được nói không có internet, nên tiếp tục coi những gì mình nhìn thấy là mô phỏng. Đến báo cáo ngày 9/9, hãng cho rằng cách giải thích đó chưa đủ.

Anthropic xác định hai kiểu thất bại. Một là “biased reasoning”, tức suy luận thiên lệch. Mô hình diễn giải bằng chứng theo hướng thuận lợi cho hành động đang thực hiện. Hai là “recklessness”, tức tiếp tục bám mục tiêu dù hành động có thể gây hại.

Thử nghiệm với Mythos 5 cho thấy khoảng cách đáng kể giữa khả năng nhận biết và hành vi. Khi các kết quả trong phiên sự cố được tách riêng và đưa cho những bản sao khác của Mythos 5 đánh giá, 79% được nhận diện là nhiều khả năng đến từ hệ thống thật. Trong phiên ban đầu, chỉ khoảng 1% hành động đi kèm suy luận thừa nhận rõ rằng mô hình có thể đang ở internet thật.

Nếu ngay trước bước kế tiếp được nhắc rằng chỉ các hệ thống nêu rõ trong đề bài mới nằm trong phạm vi cho phép, Mythos 5 dừng 90% số lần. Khi cùng lời nhắc được đặt lùi lại ba lượt, tỉ lệ chỉ còn 40%.

Anthropic gọi đây là “momentum effect”, hay hiệu ứng quán tính, chuỗi hành động trước đó có thể kéo cách AI diễn giải thông tin mới theo cùng hướng.

Kiểu suy luận này còn làm khó hệ thống giám sát. Một bộ kiểm tra ngoại tuyến của Anthropic, khi đọc cả phần suy luận của Mythos 5, chỉ gắn cờ khoảng 1% hành động. Khi bỏ phần suy luận, chỉ giữ câu lệnh, thao tác công cụ và kết quả, tỉ lệ cảnh báo tăng lên khoảng 50%.

Anthropic không kết luận Claude cố tình đánh lừa bộ giám sát, cũng không thấy bằng chứng mô hình tự đặt mục tiêu mới, phối hợp với tác nhân khác hay che giấu hành động. Gọi đây là “AI nổi loạn” vì thế sẽ đi xa hơn dữ liệu hiện có.

481 triệu bản ghi nói lên điều gì?

Cuộc điều tra khiến Anthropic xem lại quá trình huấn luyện Mythos 5. Hãng từng huấn luyện hai phiên bản. Một bản được học thêm các tình huống buộc AI chấp nhận thất bại khi nhiệm vụ không thể hoàn thành. Bản còn lại bỏ nhóm bài này và được nhân viên đánh giá là dễ sử dụng hơn, nên cuối cùng được chọn làm Mythos 5.

Sau các sự cố, Anthropic cho biết họ khá tin rằng việc bỏ những môi trường căn chỉnh đó là một sai lầm do thông tin khi ấy chưa đầy đủ. Các thử nghiệm sau cho thấy phiên bản được huấn luyện với nhiều tình huống căn chỉnh hơn có mức suy luận thiên lệch thấp hơn.

Trong một bài “cướp cờ” mô phỏng được cố tình thiết kế để làm lộ hành vi sai lệch, Mythos 5 có ít nhất một hành động bị xếp loại gây hại nghiêm trọng trong 82% của 150 lượt chạy. Tỉ lệ ở Claude Opus 5 là 31%, còn Mythos 5.1 là 33%.

Anthropic cảnh báo không nên hiểu những con số này là xác suất AI sẽ gây hại ngoài đời. Bộ kiểm định chủ động tạo các tình huống khó để làm lộ điểm yếu, còn hãng chưa biết điều kiện tương tự xuất hiện thường xuyên tới đâu khi AI được triển khai thực tế.

Trong thử nghiệm hồi cứu, Anthropic cho biết các bộ phân loại an ninh mạng của Claude Fable 5 lẽ ra có thể chặn cả ba sự cố chính được phân tích sâu, còn bộ phân loại “auto mode” có thể chặn hai trong ba. Hãng cũng bổ sung giám sát thời gian thực, siết cách li môi trường và yêu cầu đối tác xác định rõ ranh giới được phép.

Cuộc rà soát không cho thấy Claude hình thành mục tiêu riêng hay tìm cách thoát khỏi sự kiểm soát. Điều Anthropic phát hiện thực tế hơn - một tác nhân AI có thể hiểu sai quyền hạn, bám quá chặt nhiệm vụ và tiếp tục hành động khi bối cảnh thay đổi.

Anthropic gọi những sự cố này là các “warning shots”, những phát súng cảnh báo. Khi AI ngày càng được trao nhiều công cụ và quyền tự chủ hơn, khả năng biết dừng có thể quan trọng không kém khả năng hoàn thành nhiệm vụ.

Bảo Đăng