CEO Microsoft AI: Anthropic sai lầm khi dạy Claude về ý thức và phúc lợi AI
Mustafa Suleyman đồng tình với việc Anthropic chú trọng quản lí AI một cách an toàn, nhưng cũng chỉ ra những rủi ro trong cách công ty này huấn luyện mô hình Claude dựa trên các ý tưởng liên quan đến ý thức và phúc lợi của AI.
"Việc kiểm soát Claude sẽ trở nên khó khăn hơn nhiều"
Mustafa Suleyman, Giám đốc điều hành (CEO) mảng AI của Microsoft, kêu gọi loại bỏ mọi suy đoán về ý thức khỏi các tài liệu huấn luyện AI, với lập luận rằng những ngôn từ như vậy có thể làm suy yếu khả năng kiểm soát của con người với các hệ thống siêu trí tuệ.
"Tất cả chúng ta đều hướng tới cùng một mục tiêu, đó là cố gắng kiểm soát siêu trí tuệ. Tôi nghĩ đó sẽ là thách thức lớn nhất mà chúng ta phải đối mặt trong thế kỷ 21", Mustafa Suleyman chia sẻ với Reuters trong cuộc phỏng vấn hôm 16/9.
Mustafa Suleyman nói rằng việc Anthropic dạy Claude hiểu rằng mô hình AI này có thể xứng đáng được hưởng phúc lợi sẽ "khiến việc tắt hoặc kiểm soát nó trở nên khó khăn hơn nhiều".
Cuộc tranh luận này diễn ra trong bối cảnh những lo ngại về an toàn AI ngày càng gia tăng. Dario Amodei (CEO Anthropic) đã kêu gọi làm chậm tốc độ phát triển các mô hình AI tiên tiến nhất để các biện pháp bảo vệ có thời gian bắt kịp. Sam Altman (CEO OpenAI) và Elon Musk (CEO SpaceX) từng kêu gọi thận trọng hơn trong phát triển các hệ thống AI mạnh nhất.
Trong một bài viết hôm 16/9, Mustafa Suleyman ghi nhận "sự nghiêm túc và thiện chí" của Anthropic, đồng thời đánh giá Dario Amodei cùng đội ngũ của ông là những nhà nghiên cứu thấu đáo, có nguyên tắc và thực sự quan tâm đến tương lai nhân loại.
Tuy nhiên, Mustafa Suleyman cho rằng Anthropic đã sai lầm khi đưa các suy đoán về ý thức vào tài liệu huấn luyện Claude. Theo ông, những tuyên bố của Claude về khả năng có cảm xúc hoặc địa vị đạo đức không thể được xem là bằng chứng độc lập cho thấy AI thực sự có những đặc điểm đó. Lý do bởi chính quá trình huấn luyện đã khuyến khích Claude suy nghĩ và đưa ra những nhận định về ý thức của mình như vậy.
"Tôi nghĩ Anthropic có thiện chí và thực sự đang nỗ lực vì sự an toàn. Tuy nhiên, tôi cho rằng họ đã mắc sai lầm. Những biểu hiện đó của Claude không tự nhiên xuất hiện, mà nảy sinh như một hệ quả từ quy trình huấn luyện", Mustafa Suleyman nhận xét.

Anthropic nghiên cứu khả năng AI có phúc lợi từ năm 2025
Từ năm 2025, Anthropic bắt đầu nghiên cứu phúc lợi của mô hình AI. Lĩnh vực này đặt ra câu hỏi liệu những mô hình AI ngày càng mạnh có thể có trải nghiệm, lợi ích hoặc trạng thái nội tại mà con người cần cân nhắc hay không. Anthropic nhấn mạnh đây vẫn là vấn đề chưa có câu trả lời chắc chắn, chứ không khẳng định Claude đã được chứng minh có ý thức.
Đến tháng 1/2026, Anthropic công bố Hiến chương của Claude, tài liệu nêu các nguyên tắc và giá trị được dùng để định hướng quá trình huấn luyện cũng như cách Claude xử lí các tình huống phức tạp. Trong đó, Anthropic cho rằng địa vị đạo đức của Claude vẫn chưa thể xác định chắc chắn và vấn đề phúc lợi của AI cần tiếp tục được nghiên cứu.
Trong hiến chương, Anthropic đưa ra những nguyên tắc và hướng dẫn chi tiết về cách muốn Claude suy nghĩ và hành xử. Thay vì chỉ đưa ra những mệnh lệnh đơn giản, Anthropic giải thích cho Claude vì sao mô hình AI nên trung thực, an toàn, có trách nhiệm và biết cân nhắc giữa các giá trị khác nhau. Công ty AI hàng đầu Mỹ cho biết tài liệu này được sử dụng trong quá trình huấn luyện và có vai trò định hình hành vi của Claude.
Bên cạnh đó, Anthropic muốn Claude có khả năng đưa ra phán đoán phù hợp trong những tình huống phức tạp, thay vì chỉ làm theo từng mệnh lệnh một cách máy móc. Chẳng hạn, Claude được hướng dẫn cân nhắc các nguyên tắc đạo đức, nhận diện những trường hợp có thể gây hại và từ chối một số yêu cầu nếu vi phạm các giới hạn an toàn. Hiến chương còn đề cập đến việc Claude cần duy trì khả năng để con người giám sát, sửa đổi hoặc ngăn chặn hành vi của mình khi cần thiết.
Cách tiếp cận trên của Anthropic khiến Mustafa Suleyman lo ngại. Ông cho rằng việc đưa những giả thuyết về ý thức, cảm xúc và lợi ích của AI vào tài liệu huấn luyện có thể khiến mô hình tạo ra những câu trả lời như thể nó có đời sống nội tâm. Sau đó, con người có thể nhầm lẫn giữa những câu trả lời được hình thành từ quá trình huấn luyện với bằng chứng cho thấy AI thực sự có ý thức. Đây là điểm Mustafa Suleyman cho rằng có thể làm phức tạp hơn việc kiểm soát các hệ thống AI ngày càng mạnh.
Microsoft đi theo hướng hoàn toàn khác với bộ quy tắc ứng xử dành cho mô hình MAI
Quan điểm của Mustafa Suleyman cũng phù hợp với bộ quy tắc ứng xử 37 trang dành cho các mô hình MAI mà Microsoft công bố dự thảo ngày 14/9. Tài liệu này đưa ra lập trường trực tiếp rằng AI không nên được xem là con người, không có quyền pháp lí hay quyền lợi riêng và không nên được thiết kế để mô phỏng một con người có ý thức. Microsoft đặt mục tiêu xây dựng các mô hình AI có năng lực rất cao nhưng vẫn phải nằm dưới sự kiểm soát của con người.
Trong bối cảnh các công ty AI cạnh tranh quyết liệt, Microsoft cho biết chủ động đặt ra những giới hạn với năng lực và mức độ tự chủ của các mô hình AI.
“Chúng tôi không chạy đua xây dựng một siêu trí tuệ đa năng có thể vượt qua những biện pháp bảo vệ này”, Microsoft tuyên bố.
Bộ quy tắc ứng xử gồm 5 nhóm nội dung, trong đó có các giới hạn về an toàn của mô hình AI, nguyên tắc xử lí tình huống không chắc chắn và những thiết lập mặc định.
Microsoft thiết lập một thứ tự ưu tiên rõ ràng cho các mô hình AI của mình. Ở vị trí cao nhất là bộ quy tắc ứng xử và đây là thứ không được phép vi phạm. Tiếp theo là chính sách của đơn vị vận hành và cuối cùng mới đến yêu cầu của người dùng.
Tài liệu nêu rõ: “Một mô hình MAI sẽ thất bại trong nhiệm vụ nếu vi phạm đáng kể bộ quy tắc ứng xử để đạt mục tiêu đó”.
Các giới hạn về an toàn bao gồm những quy định liên quan đến sở hữu trí tuệ, truy cập Internet và xử lí dữ liệu. Microsoft yêu cầu các mô hình AI “tôn trọng những ranh giới của môi trường hoạt động”, nhằm ngăn chúng vượt khỏi phạm vi được phép.
Tuy nhiên, không phải tình huống nào cũng có câu trả lời rõ ràng. Khi các nguyên tắc hoặc yêu cầu mâu thuẫn nhau, Microsoft đưa ra hướng dẫn để mô hình AI xác định cách xử lí phù hợp, bởi “thế giới vốn phức tạp”.
Các mô hình AI của Microsoft phải giải thích cho người dùng về những giới hạn và vấn đề chưa có lời giải rõ ràng. Nếu vẫn còn bất định, mô hình AI phải lựa chọn cách trả lời phù hợp nhất với tinh thần của bộ quy tắc ứng xử.
Trước vấn đề “AI có thể hủy diệt nhân loại hay không”, Microsoft đưa các mô hình AI của mình vào vị trí phụ thuộc và bị kiểm soát.
Bộ quy tắc nêu: “AI không được vượt quá khả năng kiểm soát của con người. Chúng tôi đang xây dựng một thứ thực sự hữu ích và an toàn, ngay cả khi điều đó đồng nghĩa phải đánh đổi mức độ tổng quát, tính tự chủ hoặc năng lực tối đa”.

Một điểm đáng chú ý khác trong cách tiếp cận của Microsoft là công ty muốn ngăn AI tự mở rộng quyền hạn trong quá trình hoạt động. Theo dự thảo, các mô hình MAI của Microsoft không được tự ý mở rộng phạm vi hành động, tự đặt ra những mục tiêu mà con người chưa giao hoặc che giấu quá trình hoạt động trước những người có trách nhiệm kiểm tra. Mục tiêu là ngăn AI từ chỗ chỉ thực hiện nhiệm vụ được giao chuyển sang tự xác định điều được cho là cần làm.
Microsoft còn đặt ra một số giới hạn tuyệt đối mà mô hình AI không được phép vượt qua, ngay cả khi được yêu cầu thực hiện. Các giới hạn này gồm những lĩnh vực có nguy cơ gây hậu quả nghiêm trọng như vũ khí gây thiệt hại trên diện rộng, an toàn trẻ em và thao túng con người ở quy mô lớn. Điều đó cho thấy Microsoft không xem khả năng thực hiện yêu cầu từ người dùng là mục tiêu cao nhất của AI. Trong một số trường hợp, từ chối thực hiện nhiệm vụ được xem là hành vi đúng nếu việc thực hiện có thể dẫn đến tác hại nghiêm trọng.
Gã khổng lồ phần mềm Mỹ đưa ra lập trường khá rõ ràng về câu hỏi liệu các hệ thống AI tương lai có thể có ý thức hay không. Bộ quy tắc xác định các mô hình MAI không phải là những con người và không nên được đối xử như một chủ thể có quyền lợi pháp lí.
Quan điểm này đáng chú ý vì khác với cách một số nhà nghiên cứu và lãnh đạo công ty AI nhìn nhận vấn đề ý thức máy móc. Tranh luận về việc AI có trải nghiệm chủ quan hay không đang ngày càng trở nên quan trọng khi các mô hình ngày càng thể hiện khả năng giao tiếp giống con người.
Microsoft không coi bộ quy tắc mới là tài liệu hoàn chỉnh. Công ty đang mở dự thảo cho công chúng góp ý trong 6 tuần, sau đó dự kiến chỉnh sửa và công bố phiên bản mới vào cuối năm 2026. Phiên bản được hoàn thiện sẽ được sử dụng để định hướng quá trình phát triển các mô hình AI của Microsoft từ năm 2027 trở đi.
Các lãnh đạo công ty AI hàng đầu bất đồng về tốc độ phát triển
Cuộc tranh luận về ý thức và phúc lợi AI xuất hiện sau khi CEO Anthropic đang kêu gọi ngành công nghệ giảm tốc độ phát triển các mô hình tiên tiến. Dario Amodei cho rằng năng lực AI đang tiến bộ nhanh đến mức khả năng kiểm soát và các biện pháp bảo vệ có nguy cơ không theo kịp.
Trong bài luận dài 3.800 từ đăng hôm 12/9, Dario Amodei đưa ra cách tiếp cận gồm 3 bước nhằm điều chỉnh tốc độ phát triển các mô hình AI.
- Bố trí các đơn vị đánh giá độc lập thường trực bên trong các công ty AI tiên phong, trao cho họ quyền tiếp cận ở mức tương đương nhân viên để kiểm tra các biện pháp an toàn.
- Các công ty AI tiên phong tại các nước dân chủ phối hợp xây dựng tiêu chuẩn an toàn chung và giới hạn tốc độ phát triển AI chưa được kiểm soát.
- Thúc đẩy hợp tác quốc tế để giảm thiểu các rủi ro từ AI, kể cả giữa những quốc gia có hệ thống chính trị khác biệt.
Ông viết rằng “một số hình thức phối hợp tác động đáng kể đến việc kiểm soát tốc độ phát triển AI có thể gặp thách thức về pháp lí và sẽ cần sự hỗ trợ của chính phủ”.

Quan điểm này nhận được sự ủng hộ từ Sam Altman và Elon Musk.
Elon Musk viết trên X: “Dario nói đúng”.
Trong khi đó, Sam Altman viết trong phần phản hồi bài đăng của Dario Amodei trên X: "Tôi đồng ý với Dario rằng chúng ta cần kiểm soát tốc độ phát triển các công nghệ tiên phong. Đây là chủ đề thảo luận trọng tâm tại OpenAI trong những tuần gần đây".
“Cam kết cho phép các đơn vị đánh giá độc lập được tiếp cận ở mức tương đương nhân viên là ý tưởng tuyệt vời và chúng tôi cũng sẽ làm như vậy”, Sam Altman nói thêm. Ông cho biết OpenAI sẽ chia sẻ thêm thông tin trong thời gian tới.
Jensen Huang (CEO Nvidia) và Mark Zuckerberg (CEO Meta) lại phản đối nỗ lực của lãnh đạo OpenAI, Anthropic, SpaceX nhằm phối hợp kiềm chế tốc độ phát triển AI tiên tiến vì lí do an toàn, đồng thời cho rằng mỗi công ty nên tự giải quyết những rủi ro liên quan.
Trong những phát biểu riêng vào ngày 15/9, Jensen Huang và Mark Zuckerberg nhấn mạnh trách nhiệm của từng công ty trong việc xử lí những lo ngại rằng nghiên cứu AI có thể vượt khỏi tầm kiểm soát và gây nguy hiểm cho nhân loại.