Nhịp đập công nghệ

Robot sắp có 'khoảnh khắc ChatGPT', nhưng còn thiếu điều gì?

Bảo Đăng 23/08/2026 12:52

Chỉ trong vài tuần, nhiều lãnh đạo ngành robot cùng nhắc tới một “khoảnh khắc ChatGPT”, nhưng mỗi người lại đặt nó ở một thời điểm khác nhau.

Jensen Huang của Nvidia thậm chí tuyên bố bước ngoặt đã đến từ tháng 1. Sự chênh lệch cho thấy vấn đề lớn hơn, ngành robot vẫn chưa có một phép thử chung để xác định khi nào cỗ máy thực sự hiểu thế giới vật lí.

cdn.i-scmp.com-sites-default-files-styles-1020x680-public-d8-images-canvas-2024-08-23-_f570162d-5e50-47b7-a2ec-f46576510d5a_ea4f1ddb.jpg
Deep Robotics, công ty có trụ sở tại Hàng Châu, ra mắt robot hình người hai chân Dr.01 tại Hội nghị Robot Thế giới, diễn ra từ ngày 21 đến 25/8 ở Bắc Kinh. Ảnh: SCMP

Ngày 20/8 tại một hội nghị robot ở Bắc Kinh, Wang Xingxing (Vương Hưng Hưng), nhà sáng lập Unitree, nói ngành đang tiến gần “khoảnh khắc ChatGPT” của trí tuệ nhập thể. Một ngày sau, Wang Xiaogang, Chủ tịch ACE Robotics, dự báo bước ngoặt có thể xuất hiện vào cuối năm 2027 và cần thêm bốn đến năm năm để triển khai rộng.

Wang He của Galbot chọn mốc năm 2028, với tiêu chí cụ thể hơn. Chẳng hạn, robot có thể xử lí khoảng 70-80% công việc thường ngày mà không cần được huấn luyện riêng cho từng nhiệm vụ. Trong khi đó, Jensen Huang của Nvidia đã tuyên bố tại CES tháng 1 rằng “khoảnh khắc ChatGPT của AI vật lí” đã đến. Bốn nhận định đều nói về cùng một ý tưởng, nhưng lại mô tả những trạng thái rất khác nhau của ngành robot.

Một cụm từ, nhiều cách hiểu

ChatGPT tạo ra một bước ngoặt dễ nhận biết. Người dùng chỉ cần mở một ô nhập liệu, đặt câu hỏi và ngay lập tức thấy AI có thể làm được những gì.

robot 1
Một nhân viên mặc trang phục hóa trang tạo dáng cùng các robot VBot được dắt bằng dây như chó tại Hội nghị Robot Thế giới 2026. Ảnh: Reuters

Bessemer Venture Partners cho rằng bằng chứng thuyết phục phải đến từ một cỗ máy có thể hoàn thành nhiệm vụ phức tạp trong môi trường chưa từng gặp mà không cần con người can thiệp trực tiếp. Quỹ này ví năng lực robot hiện tại mới ở khoảng “GPT-2.5”, công nghệ đã chứng minh được tiềm năng, nhưng khoảng cách từ phòng thí nghiệm tới ứng dụng thực tế vẫn lớn.

Nhóm kỹ sư của Agility Robotics thậm chí đặt câu hỏi liệu ngành có thực sự xuất hiện một “khoảnh khắc ChatGPT” hay không. Theo họ, robot nhiều khả năng tiến bộ nhờ ghép nhiều công nghệ với nhau, từ thị giác máy tính, mô hình ngôn ngữ, lập kế hoạch tới điều khiển chuyển động, thay vì một mô hình duy nhất tạo ra cú nhảy đột ngột.

Đây cũng là lí do các video robot chạy, nhảy hay nhào lộn chưa nói lên nhiều về khả năng ứng dụng. Điều khó hơn là đưa cỗ máy vào một môi trường lạ, giao một nhiệm vụ chưa được lập trình trước rồi để nó tự xử lí những tình huống phát sinh.

Robot thiếu thứ Internet từng cho ChatGPT gần như miễn phí

Một trong những trở ngại lớn nhất là dữ liệu. Mô hình ngôn ngữ được huấn luyện từ kho văn bản khổng lồ đã tồn tại trên Internet từ trước khi làn sóng AI bùng nổ. Robot không có một kho dữ liệu tương đương về cách mở cửa, cầm cốc, kéo ngăn tủ, gấp quần áo hay xử lí hàng nghìn vật thể khác nhau.

robot 3
Một robot được trang trí theo hình tượng WALL-E di chuyển trong khu triển lãm tại Hội nghị Robot Thế giới 2026 ở Bắc Kinh, Trung Quốc. Ảnh: Reuters

Open X-Embodiment, một trong những bộ dữ liệu robot mở quy mô lớn, tập hợp hơn một triệu quỹ đạo thao tác từ 22 dạng robot và hàng chục bộ dữ liệu riêng biệt. Con số này đáng kể với ngành robot, nhưng vẫn nhỏ nếu so với hàng tỉ mẫu dữ liệu từng được dùng để huấn luyện các mô hình thị giác và ngôn ngữ.

Physical Intelligence cho biết mô hình π0 của họ được pretrain trên hơn 10.000 giờ dữ liệu robot. Đồng sáng lập Sergey Levine từng nhận xét quy mô dữ liệu robot vẫn thấp hơn các tập dữ liệu đa phương thức khoảng một đến hai bậc độ lớn, nhưng cũng thừa nhận chưa ai biết chính xác phải tăng thêm bao nhiêu mới đủ.

Khó khăn nằm ở cách tạo dữ liệu. Một đoạn văn trên Internet có thể được sao chép và xử lí gần như tức thời. Dữ liệu robot thường phải được thu bằng cách cho người hoặc robot thực hiện thao tác ngoài đời, ghi lại camera, vị trí khớp, lực và kết quả của từng hành động.

Tiền có thể giúp mua thêm robot, xây phòng thí nghiệm và thuê người vận hành, nhưng không thể khiến quá trình thu thập biến mất. Bởi vậy, ngành đang tìm cách giảm phụ thuộc vào dữ liệu robot thật.

Một hướng là mô phỏng. Robot có thể luyện hàng nghìn tình huống song song trong môi trường ảo trước khi mang kĩ năng sang phần cứng. Hướng thứ hai là dùng video con người. EgoScale, một nghiên cứu được giới thiệu năm nay, pretrain trên hơn 20.000 giờ video góc nhìn thứ nhất, sau đó sử dụng lượng dữ liệu nhỏ hơn nhiều để căn chỉnh chuyển động con người với robot. Nếu phương pháp này mở rộng được, ngành robot có thể khai thác kho video khổng lồ do con người tạo ra thay vì phải ghi lại mọi thao tác bằng máy thật.

Benchmark cho thấy khoảng cách vẫn rất lớn

Những màn trình diễn của từng hãng thường được thực hiện trên phần cứng, môi trường và nhiệm vụ do chính họ lựa chọn. Benchmark độc lập vì thế cho một góc nhìn khác. Tháng 7, nhóm nghiên cứu do Đại học Hồng Kông dẫn đầu cùng nhiều trường đại học công bố RoboDojo, gồm 42 nhiệm vụ mô phỏng và 18 nhiệm vụ ngoài đời.

robot 2
Các robot giao đấu trong màn trình diễn theo phong cách MMA tại gian hàng của Engine AI ở Hội nghị Robot Thế giới 2026. Ảnh: Reuters

Mô hình tốt nhất trong thử nghiệm chỉ hoàn thành 8,80% nhiệm vụ mô phỏng và 12,8% nhiệm vụ thực tế. Khi con người điều khiển robot từ xa trên cùng bộ bài kiểm tra, tỷ lệ lần lượt là 76,03% và 100%. Robot thường không thất bại ngay từ bước đầu. Chúng có thể tiếp cận đúng vật thể rồi mắc kẹt khi cần căn chỉnh chính xác, xử lí tiếp xúc hoặc phục hồi sau một lỗi nhỏ.

Các con số Google DeepMind công bố cho Gemini Robotics 2 cũng cho thấy sự chênh lệch lớn giữa từng loại thao tác. Robot đạt tỷ lệ thành công 92% khi tháo bóng đèn, nhưng chỉ 44% khi buộc túi rác, 40% khi đóng túi zip và 32% với nhiệm vụ sử dụng ki hốt rác. Sự khác biệt này phản ánh một phiên bản hiện đại của nghịch lí Moravec khi nhiều công việc con người thực hiện gần như theo bản năng lại đặc biệt khó đối với máy.

Một robot có thể phân loại hàng chục nghìn kiện hàng hoặc thực hiện cùng thao tác trong nhà máy hàng tháng trời mà vẫn chưa trở thành robot đa dụng. Những môi trường đó thường được kiểm soát chặt, đồ vật và quy trình ít thay đổi. Thử thách lớn hơn là khi chiếc hộp nằm lệch vị trí, vật bị rơi, một người bất ngờ bước ngang qua hoặc robot gặp đồ vật nó chưa từng nhìn thấy.

Mảnh ghép còn thiếu là khả năng hiểu và thích nghi

Đây là lí do “mô hình thế giới”, hay world model, đang nhận được nhiều chú ý. Thay vì chỉ nhận diện vật thể, AI cần học cách thế giới vận động, chuyện gì xảy ra nếu kéo một ngăn tủ, nghiêng một chiếc cốc hay đặt vật nặng lên bề mặt không vững.

robot 4
Mọi người đứng cạnh một robot của AiMOGA Robotics tại Hội nghị Robot Thế giới 2026 ở Bắc Kinh. Ảnh: Reuters

Wang Xingxing cho biết Unitree đang tập trung đáng kể nguồn lực vào hướng này và thừa nhận công ty còn tụt lại trong việc đưa AI vật lí vào ứng dụng thực tế. Sự quan tâm cũng thể hiện qua dòng vốn. AMI Labs của Yann LeCun huy động hơn một tỉ USD với luận điểm rằng AI cần học từ thế giới vật lí thông qua quan sát và tương tác, thay vì chủ yếu dựa vào ngôn ngữ.

Nhưng ngay cả một world model mạnh cũng chưa đủ. Robot còn phải kết hợp nhận thức, lập kế hoạch, điều khiển cơ thể, trí nhớ và cơ chế phát hiện lỗi thành một hệ thống đủ ổn định để hoạt động hàng giờ mà không cần người đứng cạnh.

Đây có thể là khoảng cách quan trọng nhất giữa demo và sản phẩm. Thị trường tài chính đã bắt đầu đặt cược rằng khoảng cách đó sẽ nhanh chóng thu hẹp. Cổ phiếu Unitree tăng gần sáu lần trong phiên chào sàn ngày 19/8, trước khi giảm 11% vào hôm sau.

Chính trong ngày giảm giá đó, Wang Xingxing nói robot hình người hiện vẫn chưa đủ năng lực để triển khai đại trà và nút thắt chính nằm ở các mô hình AI điều khiển, chứ không phải phần cứng.

Nhận định này có lẽ mô tả chính xác nhất trạng thái hiện tại của ngành. Robot đã có những cơ thể đủ ấn tượng để chạy, nhảy và làm việc trong các môi trường được kiểm soát. Điều chưa được giải quyết là làm sao để cỗ máy bước vào một nơi chưa từng thấy, hiểu mục tiêu, tự tìm cách thực hiện và phục hồi khi mọi thứ không diễn ra đúng kế hoạch.

Đến khi robot làm được điều đó một cách ổn định, tranh luận xem “khoảnh khắc ChatGPT” đã tới năm 2026, 2027 hay 2028 mới thực sự có câu trả lời.

Nổi bật
      Mới nhất
      Robot sắp có 'khoảnh khắc ChatGPT', nhưng còn thiếu điều gì?
      • Mặc định

      POWERED BY ONECMS - A PRODUCT OF NEKO