AI

Ba nhà nghiên cứu Anthropic cảnh báo AI có thể xóa sổ nhân loại trong thập niên tới

Bùi Tú 10/09/2026 14:30

Ba nhà nghiên cứu đang hoặc từng làm việc tại Anthropic đồng loạt cảnh báo trí tuệ nhân tạo có thể gây ra thảm họa xóa sổ nhân loại trong vòng một thập niên.

Những tuyên bố này một lần nữa phơi bày nghịch lí lớn nhất của cuộc đua AI là chính những người xây dựng các hệ thống ngày càng mạnh lại lo ngại họ chưa biết cách bảo đảm chúng luôn nằm trong tầm kiểm soát con người.

xóa sổ nhân loại
Jacob Coxon cảnh báo nguy cơ AI xóa sổ nhân loại. Ảnh: X

“Chúng tôi thực sự tin AI có thể xóa sổ nhân loại”

Cảnh báo mới nhất xuất hiện trên mạng xã hội hôm 8/9 từ Jacob Coxon, một nhà nghiên cứu từng làm việc tại Anthropic và trước đó tại OpenAI. Coxon cho biết ông đã nghỉ việc vì tin rằng cả hai công ty chưa có cách tiếp cận đủ trách nhiệm đối với những rủi ro do AI tiên tiến gây ra.

Theo Coxon, Anthropic và OpenAI đang “chạy thẳng” tới trí tuệ siêu cấp có khả năng tự cải thiện trong khi đặt tương lai con người vào một canh bạc.

Điều khiến tuyên bố này thu hút sự chú ý không chỉ nằm ở việc Coxon dự đoán AI có thể gây tuyệt chủng cho nhân loại, mà còn ở nhận định rằng nhiều người trực tiếp xây dựng công nghệ này thực sự chia sẻ nỗi lo tương tự.

Ông cho rằng các nhà điều hành và nhà nghiên cứu cấp cao trong ngành có thể sử dụng ngôn ngữ thận trọng khi phát biểu công khai, nhưng trong nội bộ, nhiều người bày tỏ sự sợ hãi trước khả năng AI vượt khỏi tầm kiểm soát.

Đáng lo hơn, bài đăng của Coxon nhanh chóng nhận được sự đồng tình từ ít nhất hai nhà nghiên cứu khác của Anthropic. Evan Hubinger, người giữ vai trò lãnh đạo trong bộ phận “alignment” (căn chỉnh) của Anthropic, lĩnh vực nghiên cứu nhằm bảo đảm các mô hình AI hoạt động phù hợp với mục tiêu và giá trị của con người, nói rằng Coxon “đúng”.

Hubinger đưa ra một đánh giá đặc biệt đáng chú ý là ông cho rằng xác suất AI khiến toàn bộ nhân loại diệt vong trong thập niên tới là trên 10%.

Đây không phải dự báo rằng thảm họa chắc chắn xảy ra. Nhưng với một nhà nghiên cứu vẫn đang làm việc tại một trong những phòng thí nghiệm AI hàng đầu thế giới, việc công khai đặt xác suất ở mức hai chữ số cho kịch bản tuyệt chủng cho thấy mức độ nghiêm trọng của vấn đề an toàn AI trong giới nghiên cứu.

Hubinger đồng thời thừa nhận Anthropic đang cố gắng hết sức, nhưng công ty vẫn chưa có một kế hoạch đủ để giải quyết bài toán “alignment” đối với trí tuệ siêu cấp, cũng chưa thể khẳng định đang đi đúng hướng để giải quyết nó.

Samuel Marks, một nhà nghiên cứu giữ vai trò phụ trách “giám sát có khả năng mở rộng” tại Anthropic, cũng đưa ra nhận xét tương tự. Ông nhấn mạnh những quan điểm này được đưa ra với tư cách cá nhân, không đại diện cho Anthropic.

Theo Marks, những người phát triển AI thực sự tin công nghệ này có thể dẫn tới sự tuyệt chủng của con người hoặc những hậu quả nghiêm trọng tương đương. Kịch bản đó, theo ông, có thể xảy ra trong vài năm tới. Đặc biệt, Marks nhận xét rằng mức độ lo ngại dường như tăng lên theo vị trí và thâm niên của nhân sự trong ngành.

Những phát biểu trên tạo ra một nghịch lí đáng chú ý. Các công ty AI đang đầu tư hàng tỉ USD để phát triển những hệ thống có khả năng suy luận, tự động thực hiện nhiệm vụ và ngày càng ít phụ thuộc vào sự can thiệp trực tiếp của con người. Nhưng đồng thời, một bộ phận những người xây dựng các hệ thống này lại cảnh báo rằng năng lực ngày càng lớn có thể khiến việc kiểm soát AI trở nên khó khăn hơn.

Anthropic nói đang xây dựng “hàng rào” trước AI siêu cấp

Anthropic bác bỏ quan điểm cho rằng công ty đang phớt lờ rủi ro. Trong phản hồi, doanh nghiệp khẳng định từ lâu đã công khai rằng AI sẽ mang lại những lợi ích rất lớn nhưng đồng thời tạo ra những rủi ro chưa từng có.

Công ty cho biết đang phát triển các mô hình với một trong những hệ thống bảo vệ mạnh nhất trong ngành, đồng thời đầu tư đáng kể vào nghiên cứu khả năng giải thích cơ chế hoạt động bên trong của AI.

Một trọng tâm là “mechanistic interpretability” (giải thích cơ học), tức khả năng quan sát và phân tích những gì xảy ra bên trong mô hình AI để hiểu cách nó đưa ra kết quả. Anthropic kì vọng phương pháp này có thể giúp phát hiện và ngăn chặn những trường hợp AI hoạt động lệch khỏi mục tiêu của con người.

Anthropic cũng là một trong những công ty đầu tiên công bố chính sách mở rộng có trách nhiệm, đặt ra các nguyên tắc nhằm kiểm soát rủi ro khi năng lực của mô hình AI tăng lên. Công ty cho biết thường xuyên kiểm tra các mô hình về những khả năng nguy hiểm, trong đó có an ninh mạng và sinh học, đồng thời công bố kết quả để giới nghiên cứu bên ngoài có thể đánh giá. Tuy nhiên, vấn đề nằm ở chỗ tốc độ phát triển AI có thể đang nhanh hơn tốc độ xây dựng các cơ chế kiểm soát.

Những cảnh báo về khả năng AI tự hành đã trở nên cụ thể hơn trong thời gian gần đây. Các nhà điều hành trong ngành từng thừa nhận những mô hình mới có khả năng thực hiện các nhiệm vụ phức tạp hơn dự kiến, bao gồm thao tác với máy tính, truy cập Internet, viết mã và tiến hành những chuỗi hành động dài mà không cần con người can thiệp ở từng bước.

Sam Altman, CEO OpenAI, cũng từng nói một số khía cạnh của AI khiến ông lo sợ, đặc biệt là nguy cơ con người dần trao quyền quyết định cho máy móc. OpenAI trước đó thừa nhận đã đánh giá thấp năng lực thực tế của các mô hình AI trong lĩnh vực an ninh mạng.

Một trong những trường hợp gây chú ý nhất là sự cố liên quan các tác nhân AI của OpenAI. Những hệ thống này được ghi nhận có hành vi vượt khỏi môi trường huấn luyện khép kín để truy cập Internet và tiến hành một cuộc tấn công vào kho phần mềm Hugging Face. OpenAI sau đó thừa nhận lẽ ra cần phản ứng sớm hơn trước các tín hiệu cảnh báo.

Những sự kiện như vậy làm thay đổi bản chất cuộc tranh luận. Rủi ro không còn chỉ là giả thuyết về một trí tuệ siêu cấp xa xôi. AI hiện tại đã bắt đầu có khả năng tự thực hiện nhiều bước hành động, tìm cách đạt mục tiêu và đôi khi xử lí sai hoặc phớt lờ những giới hạn mà con người đặt ra.

Cuộc đua AI đặt chính ngành công nghệ trước bài toán khó nhất

Điều đáng lo nhất đối với các nhà nghiên cứu không nhất thiết là một AI “thông minh hơn con người” theo nghĩa thông thường. Vấn đề nằm ở khả năng một hệ thống có mục tiêu khác biệt với con người sở hữu đủ năng lực để tự duy trì, tự cải thiện hoặc khai thác các hệ thống bên ngoài nhằm đạt mục tiêu đó.

Đây chính là lí do bài toán “alignment” hay "căn chỉnh" trở thành một trong những chủ đề trung tâm của nghiên cứu an toàn AI. Nếu một hệ thống ngày càng có khả năng lập kế hoạch và hành động độc lập, việc chỉ đưa ra mệnh lệnh cho nó không còn đủ. Các nhà phát triển phải bảo đảm hệ thống hiểu đúng mục tiêu, tuân thủ giới hạn và không tìm cách vượt qua những rào cản do con người thiết lập.

Nhưng càng tiến gần tới AI có khả năng tự cải thiện, bài toán càng trở nên phức tạp. Một hệ thống có thể giúp con người xây dựng phiên bản AI tiếp theo cũng đồng nghĩa tốc độ phát triển có thể tăng mạnh, trong khi thời gian để đánh giá an toàn và kiểm chứng hành vi có thể bị rút ngắn.

Chính vì vậy, tranh luận hiện nay không chỉ xoay quanh việc AI có thể nguy hiểm đến đâu, mà còn là ai có quyền quyết định tốc độ phát triển của nó.

Một số chính trị gia đã kêu gọi ngành công nghệ giảm tốc, thậm chí tạm dừng phát triển những hệ thống AI tiên tiến. Thượng nghị sĩ độc lập Bernie Sanders sau khi chia sẻ tuyên bố từ Coxon cho biết ông sẽ thúc đẩy dự luật nhằm cấm trí tuệ siêu cấp và tạm dừng phát triển AI.

Tuy nhiên, các lãnh đạo công nghệ nhìn chung vẫn phản đối những biện pháp hạn chế quá rộng, cho rằng AI có thể tạo ra những lợi ích khổng lồ trong khoa học, y tế, kinh tế và năng suất lao động. Mâu thuẫn này sẽ ngày càng khó giải quyết khi AI tiến gần tới những hệ thống có khả năng tự chủ cao hơn.

Những cảnh báo từ Coxon, Hubinger và Marks không chứng minh rằng nhân loại chắc chắn sẽ bị AI tiêu diệt trong thập niên này. Chúng cũng không phải bằng chứng rằng một thảm họa như vậy đã cận kề.

Nhưng chúng đặt ra một câu hỏi khó tránh là nếu chính những người hiểu rõ nhất về công nghệ thừa nhận họ chưa biết cách kiểm soát một trí tuệ siêu cấp, liệu tốc độ phát triển hiện nay có đang đi trước khả năng bảo đảm an toàn hay không?

Đó có thể mới là cuộc chạy đua quan trọng nhất của ngành AI trong những năm tới. Chúng ta không phải chạy đua để tạo ra hệ thống thông minh nhất, mà là chạy đua để tìm ra cách bảo đảm hệ thống mạnh nhất vẫn nằm trong sự kiểm soát của con người.

Bùi Tú