Nhịp đập công nghệ

Báo động trò chuyện với AI bị rò rỉ lên công cụ tìm kiếm

Minh Trí 28/07/2026 13:17

Ngày 27/7, hàng loạt trang tin công nghệ lớn như TechCrunch, Fortune, VentureBeat, 404 Media đồng loạt đưa tin về một lỗi nghiêm trọng. Nội dung những cuộc trò chuyện riêng tư mà người dùng từng chia sẻ qua chatbot Claude của Anthropic bị lộ trên các công cụ tìm kiếm.

Trong các thông tin bị lộ có cả hồ sơ bệnh án, dữ liệu thử nghiệm lâm sàng, tên và số điện thoại của trẻ em, tài liệu đóng dấu "lưu hành nội bộ" hay mật mã ví tiền điện tử. Đáng chú ý, đây là kiểu sự cố mà bất kỳ đội ngũ kĩ thuật nào cũng có thể ngăn chặn chỉ bằng thẻ “noindex” để nói với công cụ tìm kiếm rằng "đừng lập chỉ mục trang này".

Vấn đề nằm ở việc đây không phải lần đầu tiên một chatbot AI lớn mắc lỗi này và cũng không phải lần đầu với riêng Claude.

Một giả định sai về cách Internet vận hành

Gốc rễ của vấn đề nằm ở tính năng "chia sẻ" của Claude, cho phép người dùng tạo một đường dẫn để gửi cuộc trò chuyện ra ngoài. Giao diện của Claude ghi rõ: "bất kỳ ai có đường dẫn đều xem được”. Điều này ẩn chứa một giả định sai lầm rằng một đường link chỉ được biết đến bởi những người nhận được nó. Trên thực tế, Internet không hoạt động theo cách đó.

ai-ro-ri-du-lieu.jpg
Ảnh minh họa: Shutterstock

Chỉ cần một đường dẫn được dán vào một bài đăng, dòng trạng thái hay kênh mạng xã hội công khai, các bot thu thập dữ liệu của Google, Bing hay Brave Search sẽ tìm thấy và lập chỉ mục. Đường dẫn chuyển từ "kín" thành một trang web công khai có thể tìm thấy bằng từ khóa.

Đây chính là điều thẻ “noindex” được sinh ra để ngăn chặn. Thẻ có tác dụng chặn công cụ đưa trang đó vào kết quả tìm kiếm. Có thể lấy ví dụ, Google Docs cũng cho phép chia sẻ theo kiểu "ai có link đều xem được", nhưng tài liệu Google Docs không tự nhiên xuất hiện trên tìm kiếm, vì Google đã áp noindex mặc định cho các trang chia sẻ riêng tư. Điều này lại chưa áp dụng với Claude.

Phản hồi chính thức của Anthropic lại cho thấy công ty này nhìn nhận vấn đề theo hướng có phần đổ lỗi. Anthropic cho rằng đường dẫn chia sẻ "không thể đoán được và không thể bị phát hiện trừ khi chính người dùng tự đăng công khai". Một khi người dùng chọn chia sẻ, nội dung đó có thể bị các dịch vụ bên thứ ba lưu trữ lại. Điều đó "giống như bất kỳ nội dung công khai nào khác trên mạng”, công ti khẳng định.

Cách lý giải này bỏ qua một khía cạnh quan trọng. Người dùng bình thường không có khả năng biết được một đường dẫn "gửi riêng" có thể bị Google thu thập vì người khác vô tình dán nó lên một nơi công khai.

Lỗi cả ngành AI liên tục lặp lại

Trong vòng 12 tháng trở lại đây, gần như mọi chatbot lớn đều đã dính lỗi này. Đáng chú ý nhất, chính Claude đã từng bị một lần trước đó.

ChatGPT của OpenAI là cái tên đầu tiên vướng phải. Giữa năm 2025, các cuộc trò chuyện mà người dùng đặt ở chế độ "có thể chia sẻ" đã bị Google lập chỉ mục ngoài ý muốn. Sau làn sóng chỉ trích, OpenAI đã gỡ hẳn tùy chọn này khỏi sản phẩm thay vì chỉ vá lỗi.

Ngày 7/8/2025, 404 Media phát hiện hơn 130.000 cuộc trò chuyện từ các mô hình AI có thể đọc được qua Internet Archive. Điều này cho thấy đây không chỉ là chuyện của riêng Google Search, mà còn liên quan đến cách các dịch vụ lưu trữ web thu thập dữ liệu.

Ngày 20/8/2025, Grok của xAI hứng chịu một sự cố tương tự nhưng ở quy mô lớn hơn. Khoảng 370.000 cuộc trò chuyện với Grok bị lộ trên Google, trong đó có cả những đoạn hội thoại chứa thông tin riêng tư. Tháng 9/2025, Google bị phát hiện đã lập chỉ mục cho gần 600 cuộc trò chuyện với Claude theo đúng cơ chế thiếu noindex.

Trong đợt sự cố năm nay, một kho lưu trữ trên GitHub mang tên "Shared-Claude-Chats" kịp lưu 453 cuộc trò chuyện với Claude cùng 519 cuộc trò chuyện với Grok trước khi bị vô hiệu hóa. Sự cố cho thấy dữ liệu vẫn tiếp tục bị rò rỉ qua lỗ hổng này.

Cái giá không nằm ở dòng code, mà ở dữ liệu đã lộ

Đã có ít nhất 5 lần một nền tảng chatbot lớn mắc lỗi “noindex”. Ngành công nghiệp AI vì vậy đã có sẵn một quy trình xử lí từ sớm. Nhưng Anthropic lần này để lỗ hổng đó lặp lại lần thứ hai với chính sản phẩm của mình.

Vấn đề còn trầm trọng hơn chỉ từ năm ngoái tới nay, ngày càng nhiều tổ chức dùng chatbot như một công cụ làm việc nhóm. Nhân viên có thể trao đổi với chatbot rồi chia sẻ cho đồng nghiệp xem. Nhân viên y tế dán dữ liệu bệnh nhân vào để phân tích rồi gửi link cho cấp trên. Lập trình viên dán mã nguồn và khóa API để nhờ chữa lỗi rồi gửi cho cả nhóm dự án.

Chỉ cần một mắt xích trong chuỗi chia sẻ đó đăng lên nơi công khai, toàn bộ nội dung nhạy cảm phía sau có thể trở thành công khai trên Internet, vì các dịch vụ lưu trữ của bên thứ ba hoạt động nhanh hơn tốc độ các công ty có thể gỡ lỗi.

Đại diện Google, ông Ned Adriance, khẳng định với TechCrunch rằng "không có công cụ tìm kiếm nào kiểm soát việc trang nào được công khai trên web". Google chỉ tuân thủ chỉ thị mà chủ trang web đưa ra qua các thẻ như "noindex".

Câu nói này gián tiếp cho thấy trách nhiệm cuối cùng nằm ở phía các công ty phát triển chatbot. Google hay người dùng, không phải là bên có thể quyết định một trang chia sẻ có nên xuất hiện trên kết quả tìm kiếm hay không.

Vòng lặp sẽ còn tiếp diễn?

Đến hết ngày 27/7, kết quả tìm kiếm liên quan trên Google đã biến mất, cho thấy Anthropic phản ứng khá nhanh sau khi báo chí vào cuộc. Nhưng các trang này vẫn hiển thị trên Bing và Brave Search. Đáng chú ý, những gì đã bị kho GitHub nói trên sao lưu thì không thể thu hồi. Với người dùng, lời khuyên thực tế nhất lúc này là tự vào phần cài đặt trên Claude để rà soát và xóa mọi cuộc trò chuyện từng được đặt ở chế độ chia sẻ công khai.

Trong một ngành đang chạy đua ra tính năng mới với tốc độ chóng mặt, rủi ro không phải là thiếu giải pháp ngăn chặn lỗi. Câu hỏi là liệu các công ty có đủ nhanh và đủ kỉ luật để áp dụng chúng trước khi có sự cố tiếp theo hay không?

Minh Trí