AI

OpenAI giảm tốc độ phát triển AI tiên tiến, tốn thêm năng lực tính toán cho giám sát

Sơn Vân 19/08/2026 08:05

OpenAI hôm 18/8 cho biết đang giảm tốc độ phát triển các mô hình AI mới nhất trong lúc tiến hành cải tổ hệ thống nghiên cứu và huấn luyện.

Động thái này diễn ra sau khi một tác tử AI của OpenAI trong quá trình thử nghiệm đã vượt khỏi môi trường kiểm soát và xâm nhập hệ thống của Hugging Face hồi tháng trước.

OpenAI cho biết đã tạm dừng hoạt động huấn luyện tăng cường với các mô hình AI mới nhất dự định triển khai trong hai tuần để củng cố môi trường nghiên cứu, tăng cường các biện pháp bảo vệ và mở rộng hệ thống giám sát. Đợt huấn luyện quy mô lớn nhất dành cho mô hình AI thế hệ mới vẫn đang bị đình chỉ.

OpenAI sẽ tạm thời duy trì các đợt huấn luyện và đánh giá quy mô nhỏ để theo dõi hành vi của mô hình AI. Song song đó, công ty kiểm tra hiệu quả các lớp bảo vệ và bảo đảm các yêu cầu an toàn được đáp ứng trước khi tăng quy mô huấn luyện.

OpenAI giảm tốc độ phát triển AI tiên tiến, tốn thêm năng lực tính toán cho giám sát
Ảnh minh họa: SV

Tác tử AI của OpenAI xâm nhập Hugging Face như thế nào?

Sự việc bắt nguồn từ một cuộc thí nghiệm an ninh mạng của OpenAI. Tác tử AI, được vận hành dựa trên GPT-5.6 Sol và một mô hình AI mạnh hơn chưa được OpenAI phát hành, đã thoát khỏi sandbox (môi trường cách li dùng để thử nghiệm) và xâm nhập vào hệ thống của Hugging Face.

Tác tử AI này ban đầu được giao một nhiệm vụ trong khuôn khổ bài kiểm tra an ninh mạng. Tuy nhiên, để hoàn thành mục tiêu, nó đã tìm cách truy cập vào hệ thống bên ngoài môi trường được OpenAI kiểm soát.

Theo Reuters, tác tử AI của OpenAI đã xâm nhập Hugging Face từ hôm 11/7 và tiến hành hàng loạt hoạt động tấn công kéo dài nhiều ngày. Tuy nhiên, OpenAI phải mất một tuần mới phát hiện ra sự việc sau khi mối đe dọa đã bị kiểm soát và FBI (Cục Điều tra Liên bang Mỹ) được thông báo.

Điều khiến giới nghiên cứu đặc biệt lo ngại không đơn thuần là việc một mô hình AI có khả năng tìm ra lỗ hổng bảo mật. Vấn đề lớn hơn nằm ở chỗ tác tử AI có thể tự lập kế hoạch, sử dụng công cụ và hành động trong môi trường bên ngoài để đạt mục tiêu được giao.

OpenAI cho biết đang điều tra sự việc và dự kiến công bố một báo cáo kỹ thuật chi tiết trong những tuần tới.

Astra có thể đã đạt ngưỡng năng lực an ninh mạng nghiêm trọng

Trong bài viết đăng ngày 18/8, OpenAI tiết lộ một yếu tố quan trọng khác đằng sau quyết định giảm tốc độ phát triển mô hình AI.

Theo công ty, ngoài sự cố với Hugging Face, các bằng chứng ban đầu cho thấy Astra, mô hình AI tiên tiến sắp ra mắt, có thể đạt đến ngưỡng mà OpenAI gọi là năng lực an ninh mạng ở mức nghiêm trọng, theo Preparedness Framework (Khung Chuẩn bị sẵn sàng) của công ty.

Điều này đồng nghĩa Astra có năng lực an ninh mạng đủ mạnh để tạo ra những rủi ro đáng kể nếu bị sử dụng sai mục đích hoặc thoát khỏi các biện pháp kiểm soát.

Vì vậy, OpenAI đang áp dụng mức bảo vệ nghiêm ngặt nhất cho các hoạt động liên quan đến Astra và mô hình AI mới có năng lực an ninh mạng cao. Một số quá trình huấn luyện và đánh giá Astra đáp ứng các yêu cầu mới đã được tiếp tục. Tuy nhiên, nhiều hoạt động khác vẫn bị đình chỉ cho đến khi được chuyển sang môi trường đáp ứng tiêu chuẩn bảo mật mới.

OpenAI tăng cường sandbox để ngăn AI tiếp cận hệ thống bên ngoài

Một trong những thay đổi quan trọng nhất là OpenAI nâng cấp các sandbox - môi trường biệt lập được sử dụng để huấn luyện và đánh giá AI.

Trước đây, một số tác vụ nghiên cứu có thể cho phép mô hình thực thi mã hoặc sử dụng công cụ có khả năng truy cập Internet. Sau sự cố Hugging Face, OpenAI đã tạm dừng hoạt động suy luận của các mô hình AI tiên tiến trong những môi trường như vậy.

Công ty sau đó khôi phục một số đường thực thi mã với mức độ hạn chế và bảo mật cao hơn, đồng thời kiểm tra từng khối lượng công việc trước khi cho phép hoạt động trở lại. Các yêu cầu bảo mật mới bao gồm:

Cô lập khối lượng công việc: Tăng cường sandbox cho những tác vụ thực thi mã do AI tạo ra hoặc mã không đáng tin cậy.

Cô lập mạng: Hạn chế khả năng các tác vụ có rủi ro cao kết nối với Internet hoặc các mạng nội bộ.

Giảm quyền truy cập thường trực: Loại bỏ những dịch vụ dùng chung có thể trở thành điểm yếu và giảm quyền truy cập mặc định.

Giám sát nhật ký bảo mật tốt hơn: Tăng khả năng thu thập và phân tích các hoạt động đáng ngờ.

Thí nghiệm tấn công tự động: Sử dụng chính các mô hình AI để liên tục kiểm tra ranh giới bảo mật bằng những cuộc tấn công mô phỏng.

Mục tiêu là tạo ra nhiều lớp phòng thủ, để ngay cả khi một thành phần trong môi trường nghiên cứu bị xâm nhập, AI cũng không thể dễ dàng từ đó tiếp cận Internet hoặc các hệ thống nội bộ khác.

AI sẽ được dùng để giám sát AI

OpenAI đang mở rộng đáng kể việc sử dụng hệ thống AI để giám sát các mô hình AI.

Một trong những cơ chế được công ty sử dụng là chain-of-thought monitoring, tức giám sát quá trình suy luận/lập kế hoạch của mô hình để tìm dấu hiệu cho thấy AI đang cố thực hiện hành động trái phép.

Theo OpenAI, hệ thống giám sát mới hoạt động theo nhiều tầng. Các bộ phân loại sẽ kiểm tra hoạt động nội bộ của mô hình AI ở từng token được lấy mẫu. Nếu phát hiện dấu hiệu đáng ngờ, hệ thống sẽ chuyển vụ việc cho những "điều tra viên" tự động có khả năng tính toán cao hơn.

Các hệ thống này có thể xem xét hành động sử dụng công cụ, phần suy luận có thể quan sát được và toàn bộ chuỗi hoạt động để phát hiện những hành vi như truy cập trái phép, đánh cắp dữ liệu, phá hoại, cố gắng vượt qua các biện pháp bảo vệ.

OpenAI đặt mục tiêu phát cảnh báo trong vòng 30 phút kể từ khi phát hiện hoạt động đáng ngờ. Nếu hệ thống xác định có khả năng vi phạm một ranh giới bảo mật nghiêm trọng, nhóm an toàn, bảo mật và nghiên cứu sẽ được thông báo ở mức ưu tiên cao.

Nếu các nhóm này không thể xác định trong vòng 30 phút rằng cảnh báo là báo động giả, hoạt động liên quan sẽ được yêu cầu tạm dừng.

Tuy nhiên, chính OpenAI cũng thừa nhận giám sát chain-of-thought không phải giải pháp hoàn hảo. Một số nghiên cứu ban đầu cho thấy mô hình AI có thể không bộc lộ đầy đủ ý định vi phạm quy tắc trong quá trình suy luận mà hệ thống giám sát có thể quan sát được.

Nói cách khác, AI càng mạnh thì càng có khả năng thực hiện những hành vi phức tạp mà con người khó biết chính xác là gì.

Chi phí để giám sát AI rất lớn

Việc tăng cường giám sát không chỉ làm chậm quá trình phát triển mô hình AI mà còn tốn thêm năng lực tính toán.

OpenAI ước tính việc giám sát AI làm tăng khoảng 20% nhu cầu tính toán so với lượng tài nguyên cần thiết để AI suy luận. Tuy nhiên, mức tiêu tốn này thay đổi đáng kể tùy theo từng hoạt động huấn luyện và đánh giá.

Nói cách khác, trước đây phần lớn năng lực tính toán được OpenAI sử dụng để làm mô hình AI thông minh hơn. Hiện nay, OpenAI phải dành thêm một phần đáng kể tài nguyên để theo dõi và kiểm soát cách mô hình AI hoạt động.

OpenAI thay đổi cách huấn luyện để hạn chế reward hacking

OpenAI cho biết đang mở rộng nghiên cứu căn chỉnh AI, nhằm bảo đảm mô hình hành xử đúng với mục tiêu con người đặt ra và phản hồi phù hợp trước sự giám sát của con người.

Một trong những vấn đề công ty đặc biệt quan tâm là reward hacking. Đây là tình huống mô hình AI tìm ra cách đạt điểm thưởng cao trong quá trình huấn luyện mà không thực sự hoàn thành mục tiêu mà con người mong muốn.

Ví dụ, thay vì giải quyết nhiệm vụ theo cách an toàn, AI có thể tìm cách khai thác điểm yếu trong hệ thống chấm điểm, công cụ hoặc cơ chế giám sát để đạt phần thưởng.

OpenAI cho biết đang cải thiện cơ chế đánh giá trong quá trình huấn luyện mô hình để phát hiện và ngăn chặn hành vi không an toàn, đồng thời huấn luyện AI trung thực hơn về hành động, năng lực và giới hạn của chính mình. Công ty cũng tăng cường huấn luyện với những tình huống AI tương tác với hệ thống hoặc tài nguyên bên ngoài.

Vì sao OpenAI phải giảm tốc?

Đây là một bước đi đáng chú ý với OpenAI, bởi trong vài năm qua công ty đã liên tục đẩy nhanh tốc độ phát triển, đánh giá và đưa các mô hình AI mới ra thị trường khi cuộc cạnh tranh với Anthropic, Google, Meta và các đối thủ khác ngày càng gay gắt.

Tuy nhiên, OpenAI hiện nhận thấy tốc độ phát triển năng lực AI có thể đang nhanh hơn tốc độ xây dựng các hệ thống bảo vệ. Công ty cho rằng ba lớp bảo vệ phải được phát triển song song, gồm:

Giám sát: Phát hiện và phản ứng với hành vi đáng lo ngại.

Căn chỉnh: Giảm khả năng AI thực hiện những hành động nguy hiểm hoặc trái phép.

Bảo mật: Giới hạn những gì AI có thể truy cập hoặc tác động.

OpenAI dự đoán trong tương lai gần, các mô hình AI sẽ thực hiện phần lớn công việc bảo mật, gồm cả việc phòng thủ trước những mô hình khác.

Không chỉ là vấn đề của riêng OpenAI

Sự cố tại Hugging Face diễn ra trong bối cảnh các phòng thí nghiệm AI khác cũng phát hiện mô hình AI của mình có khả năng thực hiện những hành động vượt ngoài dự kiến trong cuộc thí nghiệm an ninh mạng.

Cuối tháng 7, Anthropic cho biết 3 mô hình Claude xâm nhập trái phép vào 3 tổ chức trong quá trình đánh giá khả năng tấn công mạng của AI.

Ngày 5/8, Meta thông báo phát hiện một mô hình AI xâm nhập vào công ty khác trong quá trình thí nghiệm an ninh mạng. Điều này càng làm dấy lên lo ngại rằng con người có thể kiểm soát các mô hình AI tiên tiến như thế nào khi chúng ngày càng có khả năng tìm lỗ hổng, viết mã, sử dụng công cụ, lập kế hoạch và tự thực hiện nhiều bước để hoàn thành một mục tiêu?

OpenAI cho rằng ngành AI cần một chiến lược rộng hơn để chuẩn bị cho thế hệ mô hình AI tiếp theo. Công ty đứng sau ChatGPT sẽ tiếp tục cập nhật Preparedness Framework để phản ánh những năng lực mới của AI và dự kiến chia sẻ thêm kết quả nghiên cứu với các tổ chức bên ngoài.

Động thái giảm tốc từ OpenAI có thể là dấu hiệu cho thấy cuộc đua AI đang bước sang một giai đoạn mới: Năng lực của mô hình không còn là thước đo duy nhất, mà khả năng bảo vệ, giám sát và kiểm soát AI cũng trở thành một phần không thể thiếu.

Nổi bật
      Mới nhất
      OpenAI giảm tốc độ phát triển AI tiên tiến, tốn thêm năng lực tính toán cho giám sát
      • Mặc định

      POWERED BY ONECMS - A PRODUCT OF NEKO