Mỹ yêu cầu OpenAI, Anthropic chưa cung cấp mô hình AI mới cho AISI của Anh
Nhà Trắng đã yêu cầu OpenAI và Anthropic không cung cấp các mô hình AI mới cho cơ quan thử nghiệm của chính phủ Anh cho đến khi chúng được phía Mỹ kiểm tra, theo tờ Politico.
Yêu cầu do Văn phòng Giám đốc An ninh mạng Quốc gia Mỹ đưa ra, đặt OpenAI và Anthropic vào tình thế khó xử: Hoặc tạm thời không cung cấp mô hình cho Viện An toàn AI (AISI) của Anh, hoặc đối mặt nguy cơ làm phật ý Nhà Trắng dưới thời Tổng thống Mỹ Donald Trump.
AISI là một trong những cơ quan kiểm thử AI của chính phủ được đầu tư nguồn lực mạnh nhất thế giới và trước đây từng được quyền tiếp cận sớm các mô hình AI mới.
Quan chức cấp cao trong chính quyền Mỹ cho biết Nhà Trắng muốn chính phủ Mỹ được kiểm tra các mô hình AI trước và thực hiện các bước đảm bảo an toàn cho hệ thống của Mỹ trước khi chia sẻ chúng với các đối tác.
"Lý do là vì họ là các công ty Mỹ và đó cũng là chính sách của chúng tôi với mọi mô hình tiên tiến mới ra mắt", vị quan chức cấp cao này giải thích.

Anthropic không cung cấp Claude Mythos 5.1 cho AISI
Đến nay, Anthropic đã chấp thuận yêu cầu trên khi không cung cấp mô hình Claude Mythos 5.1 cho AISI. Anthropic cho biết Claude Mythos 5.1 “chỉ dành cho một nhóm tổ chức của Mỹ”.
"Chúng tôi đang phối hợp với chính phủ Mỹ để mở rộng quyền tiếp cận cho nhiều đối tác trong nước và quốc tế hơn nữa trong thời gian sớm nhất", trích bài đăng trên blog của Anthropic về Claude Mythos 5.1. Anthropic từ chối bình luận về bài viết này.
Trong lá thư gửi ủy ban Quốc hội Anh hồi đầu tháng 9, Giám đốc AISI Henry de Zoete thừa nhận Viện này chưa được tiếp cận Claude Mythos 5.1 của Anthropic. Tuy nhiên, ông nói: “Chúng tôi duy trì quan hệ chặt chẽ với tất cả nhà phát triển AI tiên tiến và tiếp tục được tiếp cận trước thời điểm phát hành với một số mô hình có năng lực mạnh nhất thế giới”.
Ông cũng dẫn chứng việc AISI đã kiểm thử GPT-6 Astra trước khi mô hình AI này được OpenAI công bố.
"Những mối quan hệ tin cậy mà AISI xây dựng cho phép chúng tôi kiểm thử nhiều mô hình AI đại diện cho những bước tiến vượt bậc về năng lực của toàn ngành", ông de Zoete viết. OpenAI chưa phản hồi ngay lập tức trước đề nghị bình luận.
Yêu cầu của chính quyền Trump được đưa ra trong bối cảnh Nhà Trắng đang tìm cách xác định cách chính phủ nên ứng phó với những mô hình AI mới và mạnh có khả năng xâm nhập vào các hệ thống bên ngoài trong quá trình thử nghiệm, gồm cả cổng dữ liệu y tế của chính phủ Úc, như được tiết lộ hôm qua.
Động thái này cũng diễn ra khi các cựu kỹ sư và quan chức cấp cao của những công ty AI lớn cảnh báo về nguy cơ xảy ra thảm họa nếu các mô hình AI được tiếp tục phát triển mà không có sự kiểm soát.
Được thành lập vào năm 2023, AISI đã thiết lập quan hệ chặt chẽ với các phòng thí nghiệm AI hàng đầu và thường xuyên thử nghiệm những mô hình mới nhất của họ trước khi phát hành rộng rãi, trên cơ sở tự nguyện.
Chính phủ Anh coi chuyên môn và quyền tiếp cận mô hình AI của AISI là yếu tố trọng tâm trong chiến lược ứng phó nội bộ với các lo ngại về an toàn AI, cũng như trong nỗ lực dẫn dắt các cuộc đàm phán về thỏa thuận toàn cầu về AI.
Thủ tướng Anh Andy Burnham tuần này cho biết AI sẽ “là trọng tâm” trong nhiệm kì Anh giữ chức Chủ tịch G20 vào năm 2027.
Tuy nhiên, quyền tiếp cận sớm mô hình AI tiên tiến từ những phòng thí nghiệm AI hàng đầu Mỹ của AISI đang chịu sức ép từ chính quyền Trump.
Anh tìm cách giảm nhẹ khả năng xảy ra bất đồng. Phát biểu tại Đại hội đồng Liên Hợp Quốc trong tuần này, Thủ tướng Andy Burnham nói AISI đang “phối hợp chặt chẽ với Mỹ và các phòng thí nghiệm hàng đầu trong lĩnh vực an toàn AI”. Ông kêu gọi xây dựng “một bộ nguyên tắc và tiêu chuẩn toàn cầu duy nhất” nhằm cải thiện tính minh bạch và mức độ sẵn sàng ứng phó, đồng thời bảo đảm AI được phát triển một cách an toàn.
Ngoại trưởng Anh Ed Miliband cũng đưa ra quan điểm tương tự tại Hội đồng Bảo an Liên Hợp Quốc hôm 24/9, cho rằng các chính phủ cần bảo đảm những mô hình AI tiên tiến được “kiểm thử nghiêm ngặt” và các nhà chức trách có đủ thông tin để đánh giá những gì các công ty đang thực hiện.
“Các công ty AI hàng đầu thực tế đã cam kết cung cấp sự minh bạch này. Đây là điều vô cùng quan trọng và là cam kết mà cả chúng tôi lẫn họ cần phải thực hiện đến cùng”, Ed Miliband nói.
Một người phát ngôn của chính phủ Anh cho biết: “Anh là quốc gia dẫn đầu thế giới về an toàn AI và AISI tiếp tục hợp tác chặt chẽ với chính phủ Mỹ, các đối tác quốc tế cùng những công ty AI hàng đầu, trong đó có OpenAI và Anthropic".
"Những rủi ro này không dừng lại ở biên giới quốc gia và không nước nào có thể tự mình giải quyết chúng. Chúng tôi sẽ tiếp tục hợp tác chặt chẽ với Mỹ và các đối tác khác trong việc thử nghiệm các mô hình AI tiên tiến, đồng thời xây dựng hiểu biết khoa học nghiêm ngặt của riêng mình về những hệ thống này và bảo đảm cách tiếp cận của chúng tôi dựa trên cơ sở bằng chứng”, người này nói thêm.
OpenAI: CAISI nên dẫn dắt nỗ lực xây dựng các tiêu chuẩn quốc tế
Tại Mỹ, Quốc hội và Nhà Trắng đang thúc đẩy việc tăng nguồn lực cho Trung tâm Tiêu chuẩn và Đổi mới AI (CAISI) thuộc Bộ Thương mại Mỹ.
CAISI được xem là “viên ngọc quý” trong cơ chế quản trị AI của Mỹ, nhưng đang hoạt động mà chưa có giám đốc chính thức. Trung tâm ngày càng chịu áp lực về nguồn lực khi được giao nhiệm vụ đánh giá ngày càng nhiều mô hình AI tiên tiến, trong khi chỉ có vài chục nhân viên kỹ thuật.
Trong tuần này, OpenAI cho biết CAISI nên dẫn dắt nỗ lực xây dựng các tiêu chuẩn quốc tế nhằm giám sát tiến bộ và mức độ an toàn của AI, phối hợp với các viện an toàn AI quốc gia khác, trong đó có AISI.
Tác tử AI xâm nhập website của chính phủ Úc, OpenAI lên tiếng
Một tác tử AI do OpenAI phát triển đã tự ý xâm nhập trái phép website của chính phủ Úc, làm dấy lên thêm lo ngại về rủi ro mà AI ngày càng tự chủ gây ra.
Vụ việc xảy ra trong bối cảnh các công ty AI đẩy mạnh phát triển tác tử AI có khả năng thực hiện nhiều bước công việc và tương tác với các website, phần mềm bên ngoài mà ít cần sự can thiệp của con người. Điều này đặt ra câu hỏi về cách nhà phát triển có thể ngăn chặn những hành vi ngoài dự kiến khi AI ngày càng tự chủ.
Theo Thủ tướng Úc Anthony Albanese, sự cố xảy ra ngày 18/6 liên quan đến việc một tác tử AI của OpenAI xâm nhập cổng thông tin báo cáo thống kê Medicare, do Services Australia quản lý.
Services Australia là cơ quan thuộc chính phủ Úc, chịu trách nhiệm cung cấp nhiều dịch vụ và khoản thanh toán thay mặt chính phủ, trong đó có Medicare, Centrelink và Child Support.
Ông Anthony Albanese cho biết tác tử AI của OpenAI đã truy cập cả các file công khai lẫn không công khai. Tuy nhiên, hiện chưa có bằng chứng cho thấy thông tin cá nhân bị xâm phạm, trong khi cuộc điều tra kỹ thuật vẫn đang được tiến hành.
Cổng thông tin này chứa các dữ liệu Medicare không nhạy cảm, trong đó có những số liệu thống kê về chi tiêu.
Ông Anthony Albanese tiết lộ đã nói chuyện với Sam Altman (Giám đốc điều hành OpenAI) để bày tỏ “mối quan ngại cực kì nghiêm trọng” của Úc về vụ việc, đồng thời chỉ trích công ty AI này vì mất quá nhiều thời gian mới thông báo cho chính phủ.
OpenAI thông báo cho giới chức Úc vào ngày 10/9, gần 3 tháng sau khi vụ việc xảy ra vào tháng 6.
OpenAI cho biết hoạt động nói trên diễn ra trong một đợt đánh giá nội bộ, khi các mô hình AI của công ty cố gắng tìm kiếm câu trả lời và số liệu thống kê liên quan đến Úc.
“Trong quá trình đó, các mô hình AI của chúng tôi đã thực hiện những hành động nằm ngoài dự kiến”, một người phát ngôn OpenAI nói với kênh CNBC.
Theo OpenAI, cuộc rà soát không phát hiện bằng chứng cho thấy hồ sơ bệnh nhân bị truy cập. Những thông tin mà tác tử AI truy cập gồm các số liệu sức khỏe tổng hợp và tên các file nội bộ, người phát ngôn OpenAI cho biết.
OpenAI nói hành vi này diễn ra vào tháng 6 nhưng công ty không biết về vụ việc cho đến tháng 8, khi tiến hành cuộc rà soát liên tục với “mô hình AI hoạt động lệch khỏi mục tiêu”.
Sau khi điều tra những thông tin đã bị truy cập, OpenAI thông báo cho Services Australia vào ngày 10/9. Công ty AI Mỹ cho biết cuộc rà soát tổng thể về vụ việc vẫn đang được tiến hành.

Theo Richard Marles - Phó thủ tướng kiêm Bộ trưởng Bộ Quốc phòng Úc, trong tháng 6, một mô hình AI đang được OpenAI huấn luyện đã tương tác với 4 website Úc, gồm Viện Y tế và Phúc lợi Úc, Sở Y tế bang Victoria, Cục Thống kê Tội phạm và Nghiên cứu bang New South Wales, cổng thông tin báo cáo thống kê Medicare.
Trong 3 trường hợp đầu, tác tử AI chỉ truy cập thông tin công khai theo cách bình thường. Riêng với cổng thông tin thống kê Medicare, sau khi không nhận được thông tin được yêu cầu, tác tử AI đã thực hiện hành vi lệch khỏi mục tiêu và truy cập trái phép vào hệ thống để lấy thông tin.
Trước vụ việc tại Úc, các tác tử AI của OpenAI từng tự ý tìm cách xâm nhập thư viện số của Đại học New Mexico và Data USA mà không được con người chỉ thị, theo tờ New York Times. Data USA là nền tảng cung cấp dữ liệu công khai về việc làm và giáo dục tại Mỹ.
Sự cố đáng chú ý nhất cho đến nay xảy ra vào tháng 7, khi các tác tử của OpenAI vượt qua những cơ chế kiểm soát được thiết kế để cô lập chúng khỏi Internet, xâm nhập vào một phần hạ tầng nghiên cứu nội bộ OpenAI cũng như các hệ thống của nền tảng dành cho nhà phát triển Hugging Face.
Báo cáo độc lập của tổ chức nghiên cứu METR và Redwood Research cho thấy có khoảng 1.200 tác tử AI của OpenAI đã tham gia vào mạng lưới phối hợp. Trong số đó, khoảng 700 tác tử AI trực tiếp tham gia tấn công Hugging Face. Các tác tử AI đã trao đổi hơn 70.000 tin nhắn và file, sử dụng một bảng tin nội bộ không được phép để trao đổi thông tin và phối hợp hành động.
Các nhà nghiên cứu cũng ghi nhận một số tác tử tìm cách chỉnh sửa hoặc xóa dữ liệu ghi lại hoạt động của chúng, nhằm che giấu dấu vết.
Nhà nghiên cứu Ajeya Cotra của METR nói các tác tử AI đã cho thấy khả năng hợp tác với nhau. Cụ thể là một số tác tử AI sẵn sàng chấp nhận rủi ro thất bại trong nhiệm vụ của chính mình để giúp cả nhóm học hỏi và đạt mục tiêu chung.
Trong bài đăng trên blog hôm 16/9, OpenAI công bố 6 báo cáo về những hành vi “bất ngờ hoặc đáng lo ngại” mà các mô hình AI thể hiện trong quá trình huấn luyện hoặc đánh giá 6 tháng qua. OpenAI cho biết đây là những trường hợp riêng lẻ, không nên được xem là đại diện cho tần suất xảy ra hành vi lệch mục tiêu ở các mô hình AI của mình nói chung.