Cuộc sống số

Mô hình hành động lớn đã tiến đến đâu trong cuộc đua tạo bộ não cho robot?

Sơn Vân 23/08/2026 09:49

Các kỹ sư và nhà đầu tư đang đổ xô vào mô hình thế giới, hay còn gọi là mô hình hành động lớn, với kì vọng tạo ra bước đột phá cho robot giống như ChatGPT từng làm với việc xử lí văn bản và lập trình.

"Mô hình hành động lớn mới chỉ ở cấp độ GPT-2"

Các mô hình ngôn ngữ lớn hiện nay có thể rất giỏi trong việc xử lí văn bản, viết mã hay thực hiện những tác vụ trên máy tính, nhưng giới chuyên gia cho rằng để AI có thể thực hiện công việc vật lí trong thế giới thực, cần đến các mô hình hành động lớn, hay còn gọi là mô hình thế giới.

Khác với mô hình ngôn ngữ lớn chủ yếu học từ văn bản, mã nguồn và hình ảnh, một số mô hình thế giới dành cho điều khiển robot được huấn luyện bằng trò chơi điện tử và môi trường mô phỏng.

Gần đây, công nghệ này đã có bước tiến đáng kể. Trong một số tình huống, AI có thể di chuyển trong không gian ba chiều (3D) và thậm chí tự động thao tác với các vật thể chỉ bằng một tập hợp hướng dẫn đơn giản..

Tuy nhiên, Moritz Baier-Lentz - nhà đầu tư vào nhiều công ty trong lĩnh vực này - cho rằng mô hình thế giới vẫn còn ở giai đoạn rất sơ khai.

“Nếu so với các mô hình ngôn ngữ lớn, mô hình thế giới mới chỉ ở cấp độ GPT-2”, ông nói. GPT-2 là mô hình được OpenAI phát hành từ năm 2019.

Dù vậy, nhiều nhân vật nổi tiếng trong ngành công nghệ đang đổ vốn vào lĩnh vực mô hình thế giới. Họ đặt cược rằng một kiến trúc hoàn toàn mới có thể giúp AI làm được những việc mà các hệ thống dựa trên mô hình ngôn ngữ lớn hiện nay chưa thể thực hiện.

Về lâu dài, những người tiên phong kì vọng có thể kết hợp hai hướng phát triển này thành hệ thống AI vừa hiểu ngôn ngữ, vừa có khả năng hành động trong thế giới thực.

Từ ngôn ngữ đến thế giới thực

Khoảng 500 triệu năm qua, các loài động vật đã dần tiến hóa bộ não có khả năng hình dung và hiểu môi trường xung quanh, từ đó dự đoán điều gì có thể xảy ra và quyết định hành động tiếp theo. Trong khi đó, ngôn ngữ chỉ xuất hiện khoảng 100.000 năm trước, là một dạng kí hiệu do con người tạo ra để xử lí và truyền đạt các khái niệm từ đơn giản đến phức tạp.

“Văn bản chỉ là một hình thức thể hiện không đầy đủ của thế giới thực. Thế giới đã tồn tại từ rất lâu trước khi chúng ta có văn bản, nên việc sử dụng nó để mô tả thế giới về cơ bản sẽ bỏ sót những khía cạnh cốt lõi”, Kent Rollins, Giám đốc sản phẩm tại startup General Intuition và cựu giám đốc hệ sinh thái Fortnite tại hãng Epic Games, nhận xét.

Các nhà nghiên cứu robot từ lâu đã nhận ra vấn đề này. Những robot tiên tiến hiện nay thường được điều khiển bằng các hệ thống dựa trên mô phỏng vật lí, trong đó máy tính được lập trình để mô phỏng cách các vật thể va chạm, chuyển động và phản ứng trong thế giới thực. Đây cũng có thể xem là một dạng mô hình thế giới, đòi hỏi rất nhiều công sức để xây dựng và thường chỉ phù hợp với một loại robot hoặc nhóm nhiệm vụ nhất định. Hệ thống được thiết kế cho robot này chưa chắc có thể dùng cho robot khác.

Các startup phát triển mô hình thế giới hiện muốn tạo ra một hệ thống điều khiển linh hoạt cho robot, tương tự cách mô hình ngôn ngữ lớn có thể xử lí nhiều loại nội dung khác nhau, từ làm thơ cho đến viết phần mềm.

General Intuition (có trụ sở tại thành phố New York, Mỹ) đang hoàn tất một vòng gọi vốn mới với mức định giá hơn 6 tỉ USD. Nền tảng huấn luyện của General Intuition là trò chơi điện tử. Mô hình của công ty ghi lại từng khung hình trong trò chơi, đồng thời ghi nhận hành động của người chơi, chẳng hạn mỗi lần nhấn nút hoặc điều khiển cần gạt.

Khác với những robot chỉ được huấn luyện bằng video, phương pháp này giúp AI hiểu mối liên hệ giữa hành động và kết quả trong thế giới ảo, từ đó hình thành một mô hình hành động lớn. Chẳng hạn, khi người chơi nhấn một nút, AI biết nhân vật sẽ di chuyển hoặc vật thể sẽ thay đổi như thế nào.

Sau một chút tinh chỉnh, mô hình có thể điều khiển robot trong thế giới thực như thể đó là nhân vật trong trò chơi điện tử.

Tuy nhiên, công nghệ hiện chỉ phù hợp với robot bốn chân, phương tiện có bánh hoặc máy bay không người lái. Đó là những thiết bị có thể truyền hình ảnh trực tiếp về cho chúng ta và được điều khiển bằng tay cầm chơi game, chuột hoặc bàn phím. Đây là kiểu điều khiển khá phổ biến ở nhiều robot hiện nay, nhưng chưa phù hợp với phần lớn robot hình người hai chân.

Mô hình của General Intuition được huấn luyện từ hàng triệu giờ chơi game của người thật, với dữ liệu được thu thập thông qua Medal.tv. Đây là nền tảng cho phép người dùng ghi lại và chia sẻ các đoạn video chơi game.

Mô hình hành động lớn đã tiến đến đâu trong cuộc đua tạo bộ não cho robot (2)
MIRA là mô hình thế giới tạo sinh dành cho nhiều người chơi, dựa trên tựa game Rocket League. Ảnh: WSJ
Mô hình hành động lớn đã tiến đến đâu trong cuộc đua tạo bộ não cho robot (3)
Các kỹ sư của General Intuition đang thử nghiệm mô hình hành động lớn với robot bốn chân tại văn phòng ở Geneva. Ảnh: WSJ

Tại văn phòng ở New York và Geneva (Thụy Sĩ), General Intuition trình diễn một robot chó. Thông thường, để AI có thể điều khiển một robot như vậy, hệ thống phải trải qua quá trình huấn luyện với lượng dữ liệu rất lớn. Tuy nhiên, mô hình của General Intuition chỉ cần vài phút tinh chỉnh trước khi có thể điều khiển robot.

Theo Baier-Lentz, nhà đầu tư vào General Intuition, hệ thống chỉ cần biết robot đang ở đâu, đang điều khiển loại cơ thể nào và mục tiêu cần đạt được là gì. Sau đó, robot có thể tự bắt đầu di chuyển và thực hiện nhiệm vụ.

Các mô hình thế giới trước đây, chẳng hạn dòng Genie do Google DeepMind phát triển, chủ yếu được dùng để tạo ra những môi trường ảo mới nhằm huấn luyện robot.

Thế hệ mô hình mới có mục tiêu lớn hơn: Không chỉ tạo ra thế giới mà còn quan sát môi trường xung quanh, hiểu tình huống và tự quyết định hành động tiếp theo.

Jack Parker-Holder, người từng dẫn dắt các dự án về mô hình thế giới tại Google, đã đồng sáng lập startup Emulate ở London (thủ đô Anh). Emulate đang đàm phán để huy động hơn 500 triệu USD từ các nhà đầu tư. Theo các tài liệu mà tờ WSJ xem xét, đội ngũ công nghệ của Emulate còn có khoảng nửa tá cựu nhân viên Google khác.

Kết hợp mô hình ngôn ngữ lớn với mô hình thế giới

Các công ty khác trong lĩnh vực mô hình thế giới khá kín tiếng về những hệ thống AI mà họ đang phát triển. Tuy nhiên, các thương vụ mua lại và những công trình nghiên cứu do kỹ sư của họ công bố cũng phần nào hé lộ hướng đi.

World Labs, startup do Fei-Fei Li điều hành, gần đây đã mua lại công ty robot Scenix. Fei-Fei Li là giáo sư tại Đại học Stanford, cựu nhân viên Google, thường được gọi là “mẹ đỡ đầu của AI”.

Fei-Fei Li, Giám đốc điều hành World Labs, được mệnh danh là
Fei-Fei Li là Giám đốc điều hành World Labs - Ảnh: Internet

AMI Labs, startup do Yann LeCun lãnh đạo, dường như đang theo đuổi một hướng rộng hơn khi nghiên cứu nhiều kiến trúc AI khác nhau, thay vì chỉ tập trung vào các mô hình ngôn ngữ lớn truyền thống. Yann LeCun là cựu nhà khoa học trưởng về AI của Meta, thường được gọi là “cha đẻ AI”.

Cả hai công ty đều từ chối bình luận về thông tin trên.

‘Cha đẻ AI’ gọi Claude Mythos trò bịp, các chuyên gia an ninh mạng nói gì (3)
Yann LeCun hiện là Chủ tịch điều hành AMI Labs. Ảnh: Getty Images

Trong khi General Intuition cùng các startup khác nhấn mạnh khả năng ứng dụng mô hình thế giới vào robot, các nhà đầu tư tiềm năng và đối tác kinh doanh lại đặt ra một câu hỏi khác: Mô hình thế giới có thể nâng cao khả năng của các mô hình AI dựa trên ngôn ngữ hiện nay như thế nào?

Để xử lí hình ảnh và âm thanh, mô hình ngôn ngữ lớn phải được huấn luyện trực tiếp trên những dữ liệu đó, chuyển các đầu vào thành token tương tự như cách xử lí từ ngữ.

Song nếu áp dụng phương pháp này cho một không gian ba chiều, lượng dữ liệu cần xử lí sẽ tăng lên rất nhiều, khiến mô hình ngôn ngữ lớn trở nên quá chậm để có thể điều khiển robot trong phần lớn tình huống.

Mô hình thế giới cũng có những hạn chế riêng. Theo George Konidaris - giáo sư robot học tại Đại học Brown và đồng sáng lập hãng Realtime Robotics, việc OpenAI phát triển GPT qua từng thế hệ tương đối dễ dàng vì ngay từ đầu mô hình này chỉ xử lí văn bản.

Khi ngày càng được mở rộng và huấn luyện trên nhiều dữ liệu hơn, các mô hình ngôn ngữ lớn trở nên lớn hơn và thông minh hơn, nhưng vẫn không tránh khỏi hiện tượng ảo giác (trả lời sai y như thật). Với robot, vấn đề này còn nghiêm trọng hơn vì những sai sót trong thế giới thực có thể dẫn đến hậu quả ngay lập tức.

“Thế giới thực rất phức tạp, với vô số tình huống đặc biệt và những giới hạn mà robot không thể bỏ qua. Bạn không thể chỉ sai một chút là được. Chỉ cần robot va phải một vật gì đó trong lúc di chuyển, toàn bộ tình huống có thể thay đổi”, George Konidaris nói.

Một số người cho rằng nếu được nâng cao hiệu quả, mô hình ngôn ngữ lớn có thể đủ khả năng trở thành nền tảng AI điều khiển robot và các ứng dụng không gian ba chiều khác.

Song cũng có một hướng tiếp cận lai là kết hợp mô hình ngôn ngữ lớn với mô hình thế giới. Mô hình ngôn ngữ lớn có thể gọi đến mô hình thế giới như một công cụ để hỗ trợ hoàn thành nhiệm vụ, tương tự cách sử dụng các phần mềm khác.

Mô hình hành động lớn đã tiến đến đâu trong cuộc đua tạo bộ não cho robot (2)
Đội ngũ General Intuition ở Geneva, từ trái sang là Adam Jelley, Giám đốc điều hành Pim de Witte, Vincent Micheli và James Swingos. Ảnh: WSJ

General Intuition và Emulate đều đáng chú ý ở chỗ không đặt trụ sở tại Vùng Vịnh San Francisco (Mỹ), nơi đang đặc biệt hào hứng với tiềm năng của AI dựa trên mô hình ngôn ngữ lớn trong việc tiến tới “siêu trí tuệ”.

Khi được hỏi liệu siêu trí tuệ có phải mục tiêu của công ty hay không, Pim de Witte - Giám đốc điều hành General Intuition - không trực tiếp trả lời.

“Tôi ở New York vì muốn tránh xa những tư tưởng mang tính sùng bái và chỉ tập trung đánh giá một cách khoa học năng lực của các mô hình khi được đưa vào robot. Chúng ta không cần biến nó thành thứ gì đó lớn lao hơn bản chất vốn có”, ông nhấn mạnh.

Sơn Vân