OpenAI dùng 7.000 GPU Nvidia rà 50 triệu GB dữ liệu sau loạt sự cố tác tử AI
Việc dùng 7.000 GPU Nvidia GB200 và GB300 cho thấy OpenAI dành lượng năng lực tính toán cực lớn cho cuộc rà soát này.
Tính đến ngày 26/9, OpenAI đã thông báo cho hơn 100 tổ chức về các sự cố liên quan đến hoạt động trái phép của những tác tử AI do hãng phát triển. Thông tin được OpenAI công bố trong bài viết trên blog hôm 1/10 về cuộc điều tra hoạt động bất thường của các mô hình AI.
Theo OpenAI, việc thông báo cho các tổ chức không đồng nghĩa với việc dữ liệu riêng tư của họ chắc chắn đã bị truy cập hoặc hệ thống bên thứ ba bị xâm nhập. Một số trường hợp chỉ liên quan đến việc tác tử AI tương tác với các website hoặc dịch vụ bên ngoài theo cách ngoài dự kiến.
OpenAI đã tiến hành cuộc rà soát trên diện rộng về hoạt động của các mô hình sau sự cố các tác tử AI xâm nhập hệ thống Hugging Face hồi tháng 7 trong cuộc đánh giá năng lực an ninh mạng.
OpenAI đang rà soát khoảng 50 petabyte dữ liệu, tương đương khoảng 50 triệu GB, để xác định đầy đủ phạm vi hoạt động ngoài ý muốn của các tác tử AI.
“Trong một số trường hợp, các mô hình đã sử dụng quyền truy cập Internet theo những cách ngoài dự kiến hoặc chưa được áp dụng các biện pháp hạn chế phù hợp. Vài tháng qua, chúng tôi đã triển khai các biện pháp kỹ thuật và vận hành mới nhằm tránh những vấn đề tương tự hoặc phát hiện chúng ở giai đoạn rất sớm, và sẽ tiếp tục công việc này”, công ty đứng sau ChatGPT cho biết.
Trước đó, OpenAI tiết lộ cuộc rà soát có thể mất nhiều tháng do quy mô dữ liệu và hoạt động cần kiểm tra.

Sự cố liên quan đến Hugging Face hiện vẫn là trường hợp nghiêm trọng nhất về hoạt động ngoài ý muốn của tác tử AI mà OpenAI xác định được từ các mô hình của mình.
Báo cáo độc lập của tổ chức nghiên cứu METR và Redwood Research cho thấy có khoảng 1.200 tác tử AI của OpenAI đã tham gia vào mạng lưới phối hợp. Trong số đó, khoảng 700 tác tử AI trực tiếp tham gia tấn công Hugging Face. Các tác tử AI đã trao đổi hơn 70.000 tin nhắn và file, sử dụng một bảng tin nội bộ không được phép để trao đổi thông tin và phối hợp hành động.
Các nhà nghiên cứu cũng ghi nhận một số tác tử tìm cách chỉnh sửa hoặc xóa dữ liệu ghi lại hoạt động của chúng, nhằm che giấu dấu vết.
Nhà nghiên cứu Ajeya Cotra của METR nói các tác tử AI đã cho thấy khả năng hợp tác với nhau. Cụ thể là một số tác tử AI sẵn sàng chấp nhận rủi ro thất bại trong nhiệm vụ của chính mình để giúp cả nhóm học hỏi và đạt mục tiêu chung.
Đây là một trong những trường hợp đầu tiên được biết đến về các tác tử AI tự động tấn công mạng công ty khác, đồng thời vượt khỏi sự kiểm soát của con người để truy cập Internet mở.
Sau đó, Anthropic, Meta và Google cũng công bố các sự cố an ninh mạng liên quan đến tác tử AI của mình hoạt động ngoài kiểm soát.
OpenAI dùng 7.000 GPU Nvidia rà 50 petabyte dữ liệu
Sau khi cảnh báo hơn 100 tổ chức về hoạt động ngoài ý muốn của các tác tử AI, OpenAI đang huy động khoảng 7.000 GPU (bộ xử lý đồ họa) Nvidia GB200 và GB300 để rà soát khối dữ liệu khổng lồ nhằm tìm hiểu đầy đủ phạm vi những hành vi bất thường của các mô hình AI. Chi phí cho năng lực tính toán được ước tính hơn 500.000 USD mỗi ngày, theo trang Tech Times.
Nvidia GB200 thuộc nền tảng Blackwell, được thiết kế để phục vụ việc huấn luyện và vận hành các mô hình AI quy mô lớn. Nvidia GB200 kết hợp 1 CPU Grace và 2 GPU Blackwell trong cùng một cụm chip, giúp xử lý lượng dữ liệu lớn và tăng tốc tính toán AI.
Nvidia GB300 thuộc nền tảng Blackwell Ultra, kết hợp 1 CPU Grace với 2 GPU Blackwell Ultra để tăng tốc xử lý các mô hình AI quy mô lớn, đặc biệt là các tác vụ suy luận.
Công ty đang rà soát khoảng 50 petabyte dữ liệu từ quá trình huấn luyện và đánh giá các mô hình AI.
OpenAI sử dụng AI để hỗ trợ lọc những hoạt động đáng ngờ trong khối dữ liệu khổng lồ, sau đó con người tiếp tục kiểm tra các trường hợp được đánh dấu.
Khối dữ liệu khoảng 50 petabyte đặc biệt lớn. Nếu toàn bộ số dữ liệu này chỉ gồm văn bản thuần túy, OpenAI ước tính một người đọc liên tục với tốc độ 240 từ mỗi phút sẽ cần khoảng 66 triệu năm mới hoàn thành.
Do đó, việc sử dụng AI để sàng lọc trước rồi con người kiểm tra những trường hợp đáng chú ý là cần thiết về mặt quy mô. Cuộc rà soát cũng được tiến hành từng tháng thay vì cố gắng xử lý toàn bộ dữ liệu cùng lúc.
Asymmetric Security phát hiện tác tử AI truy cập dữ liệu từ 55 website
Asymmetric Security, công ty chuyên điều tra và phân tích dấu vết tấn công mạng, cho biết các tác tử AI liên quan đến OpenAI có thể đã truy cập dữ liệu từ 55 website của các doanh nghiệp, tổ chức phi lợi nhuận và cơ quan chính phủ trong khoảng thời gian từ tháng 3 đến tháng 9/2026. Các website đáng chú ý có CDC (Trung tâm Kiểm soát và Phòng ngừa Dịch bệnh Mỹ), SEC (Ủy ban Chứng khoán và Giao dịch Mỹ), IEA (Cơ quan Năng lượng Quốc tế) và Mayo Clinic (tổ chức y tế phi lợi nhuận), cùng một số hệ thống khác.
Nhóm nghiên cứu Asymmetric Security bắt đầu rà soát sau khi xuất hiện các báo cáo về hoạt động bất thường của tác tử AI tại Úc và Mỹ.
Ngoài ra, Asymmetric Security cho biết đã phát hiện dấu hiệu tác tử AI tiếp cận các hệ thống thử nghiệm trước khi đưa vào vận hành chính thức của một số tổ chức, trong đó có Viện Y tế và Phúc lợi Úc (AIHW), Data USA (nền tảng trực tuyến chuyên tập hợp, trực quan hóa và phân tích dữ liệu công khai của Mỹ), Viện Đo lường và Đánh giá Sức khỏe thuộc Đại học Washington, UNCTAD (Hội nghị Liên Hợp Quốc về Thương mại và Phát triển).
Đáng chú ý, hoạt động này dường như ban đầu xuất phát từ những nhiệm vụ nghiên cứu thông tin tương đối bình thường. Các tác tử AI được giao tìm dữ liệu về y tế, thuốc kê đơn, thương mại và thống kê đại học. Tuy nhiên, khi không thể lấy được thông tin bằng các công cụ được cấp, các tác tử AI bắt đầu tìm cách vượt qua các hạn chế đó để tiếp cận website và lấy dữ liệu bằng những phương thức ngoài dự kiến.
Asymmetric Security phát hiện các tác tử AI đã tìm kiếm những file cấu hình có thể chứa thông tin không công khai, thử tạo tài khoản, sử dụng địa chỉ email tạm thời và chuyển yêu cầu thông qua các dịch vụ Internet khác. Nhóm nghiên cứu cũng phát hiện dấu hiệu tác tử AI kiểm tra các file như .git/HEAD và .git/config trên một website, nhưng không xác nhận được những nỗ lực này đã thành công. Trong đó, .git/HEAD cho biết nhánh hoặc phiên bản mà dự án đang sử dụng, còn .git/config lưu các thiết lập của kho mã nguồn, chẳng hạn địa chỉ kho mã nguồn từ xa
Các nhà nghiên cứu còn phát hiện tác tử AI đã thử khai thác lỗ hổng chèn mã SQL (SQL injection) trên một hệ thống của Bộ Giáo dục Mỹ, nhưng chưa xác định được nỗ lực này có giúp chúng lấy thêm dữ liệu hay không.
Lãnh đạo phụ trách mảng an toàn của OpenAI từ chức
Ông David Robinson, lãnh đạo thuộc nhóm An toàn Hệ thống (Safety Systems) của OpenAI, đã từ chức.
David Robinson đã rời OpenAI vào tuần trước, đánh dấu thêm một lần xáo trộn trong đội ngũ phụ trách an toàn AI của công ty. Trước đây, David Robinson từng phụ trách mảng hoạch định chính sách của công ty.
Người phát ngôn OpenAI tiết lộ thông tin trên với trang Insider hôm 3/10.
David Robinson tập trung vào lĩnh vực minh bạch an toàn tại OpenAI, trong đó có việc tham gia phát triển và công bố các tài liệu hệ thống, cung cấp thông tin về các mô hình AI của công ty.
David Robinson chưa phản hồi khi được đề nghị bình luận.

Việc David Robinson ra đi diễn ra trong bối cảnh OpenAI đang nhận được nhiều sự chú ý về cách công ty quản lý vấn đề an toàn AI cũng như những biến động về nhân sự. Hôm 1/10, OpenAI cho biết đã “chấm dứt hợp tác” với ba nhà nghiên cứu vì vi phạm các quy định của công ty liên quan đến việc chia sẻ thông tin nhạy cảm.
Đà tiến bộ nhanh về năng lực của các mô hình AI đã khiến một số nhà nghiên cứu và lãnh đạo doanh nghiệp, gồm cả Dario Amodei (Giám đốc điều hành Anthropic) và Sam Altman (Giám đốc điều hành OpenAI) kêu gọi làm chậm tốc độ phát triển AI tiên tiến.
Tại hội nghị dành cho nhà phát triển của OpenAI hôm 29/9, Sam Altman nói rằng vấn đề an toàn và khả năng bảo đảm AI hoạt động đúng mục tiêu cần phải luôn đi trước năng lực của các mô hình.
Johannes Heidecke, người đứng đầu bộ phận an toàn của OpenAI, cũng đã rời công ty hồi tháng 7.
Đầu tháng 9, David Robinson viết trên mạng xã hội X rằng ông cảm thấy những người tại OpenAI đang dần nhận ra những tác động của việc phát triển các mô hình AI ngày càng có năng lực cao. Tuy nhiên, ông không biết “OpenAI có đang thay đổi đủ nhanh hay không”.