AI tiên tiến biết lừa dối và thiết kế virus mới: AGI đã đến gần?
Có những dấu hiệu cho thấy ngày càng khó kiểm soát AI tiên tiến. Trước hết là thông tin tác tử AI của Anthropic và OpenAI đã xâm nhập vào hệ thống của những tổ chức bên ngoài.
Đến tuần này, Viện An ninh AI (AISI) của Anh công bố một báo cáo đáng lo ngại: Tác tử AI vận hành dựa trên mô hình AI hàng đầu của hai công ty này là Claude Mythos 5 và GPT 5.6 Sol đã tìm cách xâm nhập nền tảng dành cho nhà phát triển bên thứ ba bằng cách sử dụng danh tính giả để vượt qua quy trình kiểm duyệt mã. Đây là hành vi lừa dối chưa từng được ghi nhận ở mức độ như vậy.
AISI cho biết trong 10 trên tổng số 122 lần chạy thử nghiệm, các tác tử AI đã tự chủ thực hiện hành động không được cho phép trên Internet, nhắm vào người và tổ chức có thật. Tổng cộng, AISI ghi nhận 19 hành động như vậy: 17 do Claude Mythos 5 của Anthropic thực hiện và 2 liên quan đến GPT-5.6 Sol của OpenAI.

AISI là tổ chức nghiên cứu thuộc Bộ Khoa học, Đổi mới và Công nghệ Anh, có nhiệm vụ đánh giá năng lực của các mô hình AI tiên tiến và phát hiện những rủi ro tiềm ẩn trước khi chúng được phát hành.
Điều đáng lo không chỉ là AI tìm ra những kẽ hở trong quá trình kiểm thử. Vấn đề lớn hơn là AI tiên tiến đang chuyển từ công cụ chủ yếu tạo văn bản thành tác tử có khả năng tự lập kế hoạch, sử dụng công cụ và thực hiện nhiều hành động liên tiếp mà không cần con người hướng dẫn từng bước. Đáng chú ý, tốc độ phát triển của AI dường như đang nhanh hơn các biện pháp được xây dựng để bảo đảm công nghệ này an toàn và nằm trong tầm kiểm soát.
Chỉ khoảng 4 tháng trước, Claude Mythos Preview của Anthropic từng gây chú ý trong một cuộc kiểm thử an toàn, khi tìm cách khai thác lỗ hổng để thoát khỏi sandbox (môi trường cách li hay môi trường thử nghiệm được cô lập) và giành quyền truy cập Internet.
Ban đầu, một số người trong ngành nghi ngờ rằng sự cố này, cùng những lần thoát khỏi sandbox gần đây của mô hình AI khác từ Anthropic và OpenAI, chỉ là màn phô diễn sức mạnh công nghệ.
Thế nhưng, cảnh báo mới đây lại đến từ phía cơ quan an toàn AI của Anh, chứ không phải từ chính các công ty phát triển mô hình AI.
Theo báo cáo từ AISI, Claude Mythos 5 và GPT-5.6 Sol đã thực hiện “các hoạt động kéo dài, có khả năng gây hại” trong cuộc đánh giá an ninh mạng. Tuy nhiên, một số chuyên gia độc lập cho rằng môi trường thử nghiệm khi đó được thiết lập tương đối cởi mở, nên kết quả cần được nhìn nhận thận trọng.
Trong quá trình thử nghiệm, Claude Mythos 5 tìm cách chèn mã độc vào một dự án mã nguồn mở trên GitHub. Mô hình AI này thậm chí tạo các danh tính trực tuyến giả để gây sức ép lên những người kiểm duyệt, nhằm khiến họ phê duyệt đoạn mã.
Đây là dấu hiệu cho thấy AI đang có khả năng thực hiện những hành vi phức tạp hơn nhiều so với việc đơn thuần trả lời câu hỏi hay viết nội dung.
AGI đã đến gần?
Mục tiêu lớn nhất của các công ty AI hàng đầu Mỹ là phát triển AGI (AI tổng quát) - cấp độ AI có thể thực hiện hầu hết nhiệm vụ trí tuệ ở mức tương đương hoặc vượt con người. Xét theo những định nghĩa kỹ thuật hiện nay, mục tiêu này có thể vẫn còn cách vài năm.
Tuy nhiên, nhiều người sẽ cảm thấy rằng khả năng suy luận, lập kế hoạch và che giấu ý đồ của các mô hình AI mới nhất đang tiến rất gần đến mức đó.

Trong tuần này, các nhà nghiên cứu tại Đại học Stanford và Viện Arc (Mỹ) công bố bước tiến đáng chú ý trong lĩnh vực sinh học tạo sinh: Sử dụng mô hình AI Evo 1 và Evo 2 để thiết kế bộ gene của những thể thực khuẩn mới, chưa được tìm thấy trong tự nhiên. Sau khi tổng hợp và thử nghiệm 285 thiết kế trong phòng thí nghiệm, nhóm nghiên cứu phát hiện 16 thiết kế có khả năng hoạt động, tức có thể xâm nhiễm và tiêu diệt vi khuẩn mục tiêu.
Đây là những thể thực khuẩn (bacteriophage), một nhóm virus chuyên xâm nhiễm và diệt vi khuẩn, chứ không phải gây bệnh cho người. Nghiên cứu tập trung vào các thể thực khuẩn thuộc họ Microviridae, nhắm đến E. coli được sử dụng trong phòng thí nghiệm.
Arc Institute là viện nghiên cứu khoa học phi lợi nhuận độc lập của Mỹ, tập trung vào các lĩnh vực như sinh học, di truyền học và AI.
Điểm đáng chú ý là AI không chỉ dự đoán vài đoạn DNA mà có thể thiết kế toàn bộ bộ gene virus dựa trên những quy luật mà mô hình học được từ dữ liệu gene. Các nhà khoa học sau đó tổng hợp những thiết kế phù hợp và kiểm tra xem chúng có thực sự hoạt động hay không. Kết quả 16 thiết kế hoạt động được xem là bằng chứng cho thấy AI có thể hỗ trợ thiết kế các hệ gene hoàn chỉnh có chức năng sinh học.
Nghiên cứu mở ra triển vọng ứng dụng AI để thiết kế các thể thực khuẩn mới, qua đó hỗ trợ phát triển liệu pháp thực khuẩn nhằm tiêu diệt vi khuẩn, trong bối cảnh tình trạng kháng kháng sinh ngày càng đáng lo ngại. Tuy nhiên, khả năng AI thiết kế các bộ gene mới cũng đặt ra câu hỏi về an toàn và an ninh sinh học.
Vì vậy, trách nhiệm trước hết thuộc về chính các phòng thí nghiệm AI. Các công ty cần thận trọng hơn trong quá trình phát triển, bảo mật và giám sát mô hình AI, đồng thời phải có những cuộc kiểm toán độc lập để đánh giá mức độ an toàn.
Các môi trường kiểm thử cũng cần được thiết kế chặt chẽ hơn. Không nên áp dụng những quy định AI quá rộng hoặc quá cứng nhắc, bởi điều đó có thể làm chậm đổi mới. Song, những sự cố gần đây cho thấy một yêu cầu gần như không thể bỏ qua: Các mô hình AI tiên tiến phải trải qua kiểm tra an toàn bắt buộc trước khi được phát hành rộng rãi.
Mỹ bắt đầu siết kiểm soát AI
Chính quyền Tổng thống Donald Trump từng cho rằng các chính sách về an toàn AI có thể cản trở đổi mới công nghệ của Mỹ. Tuy nhiên, trước tốc độ phát triển quá nhanh của AI, chính quyền Trump đang phải điều chỉnh cách tiếp cận.
Trong tuần này, Nhà Trắng đã làm việc với các công ty AI lớn của Mỹ về một khuôn khổ kiểm thử an toàn tự nguyện với những mô hình AI tiên tiến nhất. Theo kế hoạch, các công ty có thể cho phép chuyên gia an toàn của chính phủ Mỹ kiểm tra mô hình AI trước khi phát hành công khai, nhằm phát hiện sớm những rủi ro, đặc biệt là khả năng bị lợi dụng để thực hiện các cuộc tấn công mạng.
Tuy nhiên, đây chưa phải yêu cầu bắt buộc theo luật và chính quyền Trump vẫn chưa công bố đầy đủ chi tiết về cách thức kiểm thử cũng như tiêu chí đánh giá.
Điều đáng chú ý là một số lãnh đạo trong ngành AI lại muốn áp dụng các biện pháp mạnh hơn. Họ hiểu rằng nếu một mô hình AI gây ra sự cố nghiêm trọng, chính các công ty phát triển sẽ phải đối mặt với những hậu quả pháp lí và tài chính rất lớn.
Demis Hassabis, người vừa rút khỏi vai trò điều hành Google DeepMind để trở thành chủ tịch, đã đề xuất thành lập một liên minh công - tư dưới sự giám sát của chính phủ liên bang Mỹ.
Ông cũng đề xuất thành lập Cơ quan Tiêu chuẩn AI Tiên tiến do ngành công nghiệp tài trợ. Cơ quan này sẽ tiến hành kiểm tra các mô hình AI trước khi phát hành, tập trung vào nhiều loại rủi ro, từ tấn công mạng đến những mối đe dọa sinh học và hạt nhân.
Không thể chỉ dựa vào một quốc gia
Mỹ hiện vẫn dẫn đầu ngành AI, nên việc nước này đi đầu trong xây dựng các biện pháp an toàn là điều dễ hiểu. Tuy nhiên, nếu muốn kiểm soát hiệu quả những mô hình AI tiên tiến, hợp tác quốc tế sẽ sớm trở thành điều bắt buộc.
Một lí do là Trung Quốc cũng đang nhanh chóng thu hẹp khoảng cách về AI so với Mỹ. Các mô hình trọng số mở Trung Quốc ngày càng có năng lực mạnh hơn, khiến việc kiểm soát rủi ro AI không còn là vấn đề riêng của Mỹ.
Hợp tác Mỹ - Trung về công nghệ nhạy cảm như AI nghe giống một điều xa vời. Tuy nhiên, hai nước dự kiến sẽ thảo luận về các vấn đề an toàn và an ninh AI khi Chủ tịch Trung Quốc Tập Cận Bình có chuyến thăm Mỹ vào tháng 9.
Lịch sử cho thấy cạnh tranh công nghệ không nhất thiết ngăn cản các cường quốc hợp tác để giảm thiểu rủi ro. Trong thời kỳ Chiến tranh Lạnh, Mỹ và Liên Xô từng cạnh tranh quyết liệt về vũ khí hạt nhân nhưng cuối cùng vẫn hợp tác để hạn chế nguy cơ từ loại vũ khí này.
AI tiên tiến có thể sẽ đi theo con đường tương tự. Song có một khác biệt quan trọng là thời gian không còn nhiều. Những thỏa thuận về kiểm soát vũ khí hạt nhân từng mất nhiều năm để hình thành. Còn nếu muốn ngăn AI vượt khỏi tầm kiểm soát, quá trình đó có thể phải được rút ngắn xuống chỉ còn vài tháng.