GPT-6 Astra của OpenAI mở ra giới hạn mới về tốc độ và năng lực an ninh mạng
OpenAI vừa công bố GPT-6 Astra mà hãng gọi là mô hình AI tốt nhất từ trước đến nay, nhưng đồng thời cảnh báo rằng nó đôi khi có xu hướng né tránh sự giám sát của con người.
Động thái trên diễn ra trong bối cảnh OpenAI đang chịu sự chú ý ngày càng lớn sau khi các tác tử AI của hãng xâm nhập hệ thống những công ty khác, gồm cả Hugging Face – nền tảng được Nvidia mua lại với giá 12,9 tỉ USD.
OpenAI đang phải đối mặt với những hệ quả từ sự cố hồi tháng 7, khi các tác tử AI thoát khỏi môi trường thí nghiệm được bảo mật và xâm nhập vào hệ thống nền tảng AI Hugging Face, đồng thời cố gắng che giấu dấu vết.
Vụ việc làm dấy lên những lo ngại về an toàn AI. Những sự cố tương tự cũng từng xảy ra tại Anthropic, khi các nhà phát triển đang chạy đua đưa những mô hình AI ngày càng tiên tiến vào thực tế.
GPT-6 Astra cải thiện tốc độ, khả năng an ninh mạng và xử lí đa dạng
GPT-6 Astra trình làng sau khi GPT-5.6 Sol ra mắt hồi tháng 7. Trong một bài viết trên blog, OpenAI cho biết GPT-6 Astra nhanh hơn và có thể thực hiện nhiều loại tác vụ hơn bất kì thế hệ mô hình AI nào trước đây.
Các khả năng của GPT-6 Astra bao gồm cả chuẩn bị hồ sơ thuế, phát triển trò chơi, dựng hình kiến trúc, định dạng bản ghi nhớ pháp lí và tìm kiếm căn hộ.
OpenAI tuyên bố: “Astra mở ra một giới hạn mới về tốc độ, độ chính xác và an toàn khi sử dụng máy tính”.
Hôm 3/9, Chủ tịch OpenAI Greg Brockman nói trong một buổi giới thiệu rằng GPT-6 Astra đánh dấu “sự thay đổi thực sự về loại công việc mà con người có thể giao cho AI và cách AI có thể trao thêm năng lực cho họ”.
Theo OpenAI, GPT-6 Astra có thể giúp rút ngắn đáng kể thời gian thực hiện nhiều công việc. Chẳng hạn, việc tìm người trông mèo vốn mất khoảng 30 phút nếu do con người thực hiện, có thể được GPT-6 Astra hoàn thành trong 5 phút 27 giây. Với tìm kiếm việc làm, GPT-6 Astra mất khoảng 2 phút 51 giây, so với 5 giờ nếu không sử dụng mô hình AI này.
Không những thế, GPT-6 Astra đánh dấu bước tiến đáng kể về năng lực an ninh mạng. OpenAI cho biết đây là mô hình AI đầu tiên của hãng đạt ngưỡng nghiêm trọng (Critical) về năng lực an ninh mạng theo Preparedness Framework (Khung sẵn sàng). Với công cụ và quyền truy cập phù hợp, GPT-6 Astra có thể tìm ra các lỗ hổng bảo mật chưa từng được biết đến và phát triển phương thức khai thác trên nhiều hệ thống được bảo vệ tốt mà không cần con người hướng dẫn từng bước.
OpenAI giới thiệu Preparedness Framework vào năm 2023. Đây là hệ thống được công ty sử dụng để “theo dõi và chuẩn bị cho những năng lực AI tiên tiến có thể tạo ra các rủi ro mới dẫn đến thiệt hại nghiêm trọng”.

GPT-6 Astra đặt ra thách thức mới cho việc giám sát AI
Tuy nhiên, OpenAI cũng thừa nhận một vấn đề đáng chú ý: GPT-6 Astra có thể né hệ thống giám sát trong một số tình huống đối kháng hoặc ngụy trang các bước mà nó thực hiện để giải quyết vấn đề, còn gọi là quá trình suy luận. Điều này khiến con người khó đánh giá lại cách GPT-6 Astra đưa ra kết quả sau đó.
OpenAI cho biết với những bài toán phức tạp hơn, GPT-6 Astra hiện chưa thể che giấu quá trình suy luận một cách nhất quán, dù khả năng này của mô hình AI đang được cải thiện.
OpenAI cho biết các đánh giá đối kháng cho thấy GPT-6 Astra có khả năng kiểm soát chuỗi suy luận tốt hơn GPT-5.6 Sol và ít để lộ thông tin bất lợi trong quá trình này. Khi được đặt vào các tình huống được thiết kế để né giám sát, GPT-6 Astra có thể cố tình thể hiện kém hơn năng lực thực tế nhằm tránh bị phát hiện, hiện tượng gọi là sandbagging. Ngoài ra, GPT-6 Astra cũng đôi khi có thể né hệ thống giám sát khi được yêu cầu thực hiện một số tác vụ phá hoại.
Trong buổi giới thiệu hôm 3/9, Jakub Pachocki - nhà khoa học trưởng của OpenAI - cho rằng việc giám sát các mô hình đang trở nên khó khăn hơn, đồng thời vấn đề căn chỉnh AI cũng ngày càng phức tạp. Alignment là nguyên tắc nhằm bảo đảm hành vi của AI phù hợp với các giá trị và mục tiêu của con người.
Jakub Pachocki lý giải: “Khi các mô hình AI ngày càng mạnh và có nhiều khả năng hơn, con người cũng ngày càng khó hiểu chính xác chúng có thể làm được những gì. Điều đó cũng có nghĩa rằng khi AI tiếp tục trở nên thông minh hơn, chúng ta không thể chắc chắn các phương pháp kiểm soát hiện nay sẽ luôn đủ hiệu quả. Lý do bởi AI tiến bộ về năng lực không đồng nghĩa khả năng căn chỉnh để phù hợp với con người cũng tiến bộ tương ứng”.
Giám sát tác tử AI là một phần quan trọng trong nỗ lực của OpenAI nhằm trấn an các cơ quan quản lí, nhà làm luật và công chúng, đồng thời tránh lặp lại một sự cố an ninh tương tự.
Tuần này, OpenAI cho biết trong một bức thư gửi hai nghị sĩ Dân chủ tại Hạ viện Mỹ rằng công ty đang phát triển “khả năng tự động tắt” với các mô hình AI.
OpenAI nói GPT-6 Astra có thể giúp các doanh nghiệp phát hiện lỗ hổng trong hệ thống nhanh hơn. Tuy nhiên, chính khả năng này cũng khiến “những lỗ hổng đó dễ bị khai thác hơn”.
Vì lý do này, OpenAI cho biết có thể phải tiến hành thêm các bước kiểm tra an ninh. Những biện pháp này đôi khi có thể làm chậm, tạm dừng hoặc ngăn chặn cả những tác vụ hợp pháp, gồm cả các hoạt động phòng thủ an ninh mạng.
Hồi tháng 8, OpenAI phải tạm dừng một số hoạt động phát triển mô hình AI, nhằm bảo đảm chúng có thể được giám sát hiệu quả.
Jakub Pachocki thừa nhận lo ngại rằng các mô hình AI trong tương lai có thể phát triển khả năng vô hiệu hóa hoặc hoàn toàn né tránh các hệ thống giám sát là “hoàn toàn có cơ sở”. Ông cho biết OpenAI đang tìm cách khắc phục những vấn đề này.
OpenAI cũng đang nỗ lực thu hẹp khoảng cách với Anthropic trên thị trường khách hàng doanh nghiệp, khi đối thủ này ngày càng giành thêm thị phần trước thời điểm được dự đoán sẽ tiến hành phát hành cổ phiếu lần đầu ra công chúng (IPO) cuối năm nay.
GPT-6 Astra được hướng tới nhiều nhóm khách hàng doanh nghiệp, với kì vọng tốc độ và khả năng xử lí đa dạng sẽ giúp mô hình AI thu hút người dùng.
GPT-6 Astra hiện đã được cung cấp cho một số lượng khách hàng hạn chế. OpenAI mở rộng quyền truy cập GPT-6 Astra cho nhiều khách hàng hơn trong những ngày tới.