Các nhà nghiên cứu Trung Quốc vạch lộ trình 5 giai đoạn để AI tự cải tiến
Tự động hóa hoạt động nghiên cứu AI nổi lên như chiến trường mới trong cuộc đua công nghệ, khi các công ty Mỹ hiện dẫn trước Trung Quốc nhờ có khả năng tiếp cận nguồn lực tính toán vượt trội.
Các nhà nghiên cứu đến từ những trường đại học hàng đầu và tập đoàn công nghệ lớn của Trung Quốc đang hướng tới một mặt trận quan trọng mới trong cuộc đua AI với Mỹ: Phát triển hệ thống có khả năng tự xây dựng những phiên bản tốt hơn của chính mình mà không cần con người can thiệp.
Trong nghiên cứu chung được công bố gần đây, ByteDance, Đại học Thanh Hoa và Phòng thí nghiệm AI Thượng Hải cùng nhiều tổ chức khác đã đề xuất lộ trình 5 giai đoạn hướng tới khả năng tự cải tiến đệ quy (RSI).
RSI có thể trở thành bước ngoặt với ngành AI. Nếu một AI có thể giúp con người tạo ra phiên bản tốt hơn, rồi phiên bản mới lại làm điều tương tự thì sẽ hình thành vòng lặp tự cải thiện, đưa quá trình phát triển AI sang một quỹ đạo hoàn toàn mới.
Nghiên cứu với tiêu đề AI cuối cùng do con người tạo ra: Hướng tới khả năng tự cải tiến đệ quy thực sự cho thấy sự quan tâm ngày càng lớn của ngành AI với việc tự động hóa những công đoạn tốn nhiều nhân lực trong quá trình phát triển AI, từ huấn luyện, đánh giá đến tinh chỉnh mô hình.
5 giai đoạn để hướng tới AI tự cải tiến
Nghiên cứu chia quá trình này thành 5 giai đoạn với mức độ tự chủ tăng dần.
Ở giai đoạn đầu, AI chỉ thực hiện các quy trình cải tiến do kỹ sư thiết kế.
Sau đó, AI bắt đầu tự lựa chọn cách nâng cấp chính mình, thay vì chỉ làm theo những chỉ dẫn được lập trình sẵn.
Đến giai đoạn 3, hệ thống có thể tự xác định những thông tin hoặc trải nghiệm mới cần thu thập để cải thiện.
Sang giai đoạn 4, AI có khả năng thích ứng với những thay đổi của môi trường sau khi được triển khai.
Giai đoạn cuối cùng là khi AI có thể liên tục tinh chỉnh chính những phương pháp được sử dụng để cải tiến công nghệ này.

Khác với việc chatbot sửa lỗi cho một phản hồi riêng lẻ, RSI đòi hỏi các cải tiến phải được duy trì sau khi một nhiệm vụ kết thúc và được kế thừa bởi các hệ thống AI thế hệ sau.
Các tác giả cho rằng khả năng tự động hóa một phần hoạt động nghiên cứu AI có thể trở thành lợi thế cạnh tranh quan trọng với các nhà phát triển mô hình.
Nếu trở thành hiện thực, sự thay đổi này có thể rút ngắn chu kì phát triển, đồng thời cắt giảm đáng kể nhân lực và năng lực tính toán cần thiết để xây dựng các mô hình nền tảng, theo các tác giả.
Tự động hóa nghiên cứu AI trở thành mặt trận cạnh tranh Mỹ - Trung
Tự động hóa hoạt động nghiên cứu AI đang trở thành một trong những mặt trận cốt lõi của cuộc cạnh tranh công nghệ giữa Mỹ và Trung Quốc. Dù các tổ chức Trung Quốc đang đạt được những bước tiến nhanh trong ứng dụng thực tế, chuyên gia nhận định các công ty Mỹ vẫn dẫn trước, chủ yếu nhờ khả năng tiếp cận nguồn năng lực tính toán lớn hơn.
“Các công ty Mỹ dường như vẫn đi trước Trung Quốc vài tháng và có nhiều năng lực tính toán hơn để triển khai AI”, Erich Grunewald, nhà nghiên cứu cấp cao tại Viện Chính sách và Chiến lược AI, nhận xét.
“Các nhà nghiên cứu Trung Quốc rất giỏi trong việc khai thác tối đa hiệu suất từ phần cứng khan hiếm, nhưng những hạn chế về năng lực tính toán vẫn là một trở ngại thực sự”, ông nói thêm.
Wei Sun, nhà phân tích chính về AI tại hãng nghiên cứu thị trường Counterpoint Research, dẫn nghiên cứu từ Anthropic hồi tháng 6 làm bằng chứng cho lợi thế ban đầu của Mỹ. Anthropic cho biết các phiên bản Claude của họ đã có thể thiết kế thí nghiệm, viết mã và phát triển những kỹ thuật hậu huấn luyện có thể được chuyển sang mô hình AI lớn hơn.
Dù vậy, các nhà phân tích nhấn mạnh rằng cả Mỹ lẫn Trung Quốc vẫn chưa chứng minh được khả năng AI tự cải tiến hoàn toàn tự động và không giới hạn, đúng với ý nghĩa đầy đủ của RSI.
Kyle Chan, nghiên cứu viên tại Viện Brookings, cho rằng AI có thể tối ưu thiết kế chip hoặc cách thực thi mã, nhưng những đột phá mang tính nền tảng về kiến trúc mô hình vẫn phụ thuộc vào chuyên môn của con người.
Bất chấp những thách thức, các công ty Trung Quốc đang đẩy mạnh đầu tư vào hạ tầng phục vụ quá trình huấn luyện AI tự động.
Z.ai, công ty được biết đến tại Trung Quốc với tên Zhipu AI, hôm 13/9 cho biết sẽ dành khoảng 60% số tiền thu ròng từ vòng gọi vốn mới nhất trị giá 5 tỉ USD để hỗ trợ phát triển các mô hình nền tảng GLM thế hệ tiếp theo và “hệ thống tự huấn luyện hoàn toàn”.
Tại buổi trình bày kết quả kinh doanh của Z.ai hồi tháng 8, nhà sáng lập Tang Jie đưa ra khái niệm “tự huấn luyện hoàn toàn”, được xem là lộ trình kỹ thuật cho GLM-6.0. Theo đó, Z.ai muốn AI có thể tự quản lí toàn bộ quy trình huấn luyện, từ tiền huấn luyện đến hậu huấn luyện.
Theo Tang Jie, một trong những thách thức lớn nhất là khả năng phán đoán của mô hình: Làm sao để AI tự xác định khi nào nên dừng huấn luyện và sửa những sai sót của chính mình.
Trong bài viết có tiêu đề Những dấu hiệu ban đầu của tự tiến hóa, các nhà nghiên cứu đứng sau MiniMax M2.7 hồi tháng 3 cho biết mô hình AI này có thể cập nhật bộ nhớ và xây dựng các kĩ năng phức tạp khi thực hiện những thí nghiệm học tăng cường. Những trải nghiệm thu được sau đó được đưa trở lại quá trình học của hệ thống.
Tháng 8, DeepSeek phát triển một khung hỗ trợ tác tử AI, giúp các mô hình có mức độ tự chủ cao hơn khi xử lí những nhiệm vụ nhiều bước, thực thi mã và tương tác với phần mềm bên ngoài. Tuy nhiên, các chuyên gia cảnh báo rằng những khả năng như vậy chưa thể được xem là một vòng lặp tự cải tiến đệ quy thực sự.
Philipp Schmid, kỹ sư cấp cao tại Google DeepMind, lập luận trong bài viết trên blog hồi tháng 8 rằng các tác tử AI có mức độ tự chủ cao như hệ thống của DeepSeek vẫn cần người hoặc hệ thống đánh giá bên ngoài để xác định liệu một thay đổi có thực sự là cải tiến hay không.
“RSI thực sự phải tiến xa hơn khả năng tự thực hiện các thay đổi. Hệ thống phải tự cải thiện cả cách tìm ra những thay đổi và cách đánh giá liệu chúng có thực sự tốt hơn hay không. Hệ thống phải tăng cường khả năng kiểm chứng mà không thể tìm cách qua mặt cơ chế đó. Đến nay, bằng chứng công khai cho thấy điều này vẫn còn rất ít”, Philipp Schmid viết.
Chưa rõ thời điểm RSI có thể trở thành hiện thực
Trong nghiên cứu chung gần đây, các tác giả từ ByteDance, Đại học Thanh Hoa và Phòng thí nghiệm AI Thượng Hải lưu ý tốc độ tiến triển qua 5 giai đoạn sẽ rất khác nhau tùy thuộc vào lĩnh vực AI. Kỹ thuật phần mềm có một con đường tương đối rõ ràng để tiến tới RSI, trong khi robot và khám phá khoa học phải đối mặt với những trở ngại lớn hơn.
An toàn cũng là mối quan ngại lớn. Các nhà nghiên cứu cho rằng RSI thực sự phải đi kèm những cơ chế bảo vệ nghiêm ngặt, trong đó có các môi trường thử nghiệm được kiểm chứng để bảo đảm mọi thay đổi đều an toàn và mang lại lợi ích trước khi triển khai.
Các tác giả không đưa ra thời điểm cụ thể cho việc RSI có thể trở thành hiện thực.
Trong bài đăng trên blog gần đây, OpenAI cho biết mục tiêu của họ là xây dựng một nhà nghiên cứu AI tự động, có khả năng thúc đẩy hoạt động nghiên cứu về học sâu. Tuy nhiên, công ty Mỹ đứng sau ChatGPT thừa nhận vẫn còn những câu hỏi chưa có lời giải về cách tiến tới RSI, đồng thời bảo đảm an toàn và sự phù hợp với con người.
OpenAI công bố GPT-6 Astra ngày 3/9, mô tả đây là “mô hình AI thông minh nhất và phù hợp với con người nhất thế giới”.