AI

Trung Quốc tạo lợi thế trước Mỹ trong cuộc đua AI tạo video thế nào?

Sơn Vân 29/08/2026 20:13

Các mô hình AI tạo video của Alibaba, MiniMax và ByteDance hiện thống trị bảng xếp hạng Artificial Analysis.

Các công ty Trung Quốc đang tạo ra khoảng cách đáng kể với đối thủ Mỹ trong lĩnh vực AI tạo video. Họ tận dụng hệ sinh thái video ngắn khổng lồ, môi trường bản quyền tương đối linh hoạt và mức giá cạnh tranh để chiếm ưu thế trong lĩnh vực mà năng lực tính toán không phải yếu tố duy nhất quyết định thành công, theo các nhà phân tích.

Khi các công ty Mỹ như OpenAI và Anthropic vẫn dẫn đầu về mô hình ngôn ngữ lớn nguồn đóng tiên tiến nhất, các doanh nghiệp Trung Quốc đang nổi lên như đối thủ đáng gờm trong cuộc đua AI tạo video.

Mô hình AI của những công ty Trung Quốc như Alibaba, MiniMax và ByteDance hiện chiếm phần lớn vị trí dẫn đầu trên bảng xếp hạng Artificial Analysis.

Artificial Analysis là nền tảng đánh giá độc lập chuyên theo dõi, so sánh và xếp hạng các mô hình AI như tạo văn bản, hình ảnh, video. Nền tảng này xây dựng các bảng đánh giá chuẩn để đo lường chất lượng, tốc độ, chi phí và hiệu năng của từng mô hình. Từ đó, doanh nghiệp, nhà phát triển và giới đầu tư sẽ hiểu rõ mô hình AI nào đang dẫn đầu, có lợi thế về giá hay khả năng mở rộng.

Wan 3.0 của Alibaba đứng đầu bảng xếp hạng tạo video từ văn bản kèm âm thanh trên Artificial Analysis, vượt qua Gemini Omni Flash của Google (xếp thứ hai).

Một phiên bản của MiniMax H3 được tinh chỉnh bởi nền tảng fal (Mỹ) đứng thứ ba, theo sau là phiên bản H3 gốc với trọng số mở và Seedance 2.0 của ByteDance. Tổng cộng, các mô hình AI tạo video của Trung Quốc chiếm tới 8 trong số 10 vị trí dẫn đầu.

Những mô hình AI Trung Quốc cũng dẫn đầu ở nhiều hạng mục liên quan khác, gồm chuyển hình ảnh thành video và chỉnh sửa video, dựa trên các thử nghiệm so sánh mù (người dùng đánh giá mà không biết mô hình nào tạo ra kết quả) với cùng một câu lệnh.

Trung Quốc tạo lợi thế trước Mỹ trong cuộc đua AI tạo video như thế nào
Trung Quốc sở hữu nhiều lợi thế trước Mỹ trong cuộc đua AI tạo video. Ảnh: SV

Những lợi thế của Trung Quốc trước Mỹ trong cuộc đua AI tạo video

Các nhà phân tích trong ngành cho rằng đà phát triển mạnh của lĩnh vực AI tạo video tại Trung Quốc đến từ sự kết hợp giữa dữ liệu huấn luyện độc quyền, tốc độ cải tiến mô hình nhanh và nhu cầu lớn trong nước với nội dung số dạng ngắn.

Kyle Chan, nghiên cứu viên tại Trung tâm John L. Thornton về Trung Quốc thuộc Viện Brookings, cho rằng cả Mỹ và Trung Quốc đều có những nền tảng mạng xã hội lớn có thể cung cấp dữ liệu và kênh phân phối, nhưng “các công ty như ByteDance ưu tiên công nghệ tạo video hơn”.

Theo ông Kyle Chan, ByteDance đã tạo ra “vòng lặp tích cực”, biến video ngắn do AI tạo ra thành một ngành kinh doanh thực sự. Những sản phẩm thành công ban đầu cho thấy người xem có nhu cầu lớn, qua đó thúc đẩy ByteDance tiếp tục đầu tư mạnh vào công nghệ và biến lĩnh vực này thành một mảng kinh doanh sinh lợi.

Nhu cầu thương mại từ các doanh nghiệp trong nước tạo thêm động lực cho lĩnh vực AI tạo video của Trung Quốc. Wang Zebin, quản lí đầu tư tại công ty cổ phần tư nhân JG Investment, nói: “Ngành công nghiệp phim ngắn và phim truyện tranh do AI tạo ra tại Trung Quốc đã phát triển nhanh chóng, với các đội ngũ sản xuất trong nước còn cung cấp nội dung cho cả thị trường nước ngoài”.

Các nhà phân tích nhận định rằng cách tiếp cận khác nhau với rủi ro bản quyền cũng đang tạo ra sân chơi có lợi hơn cho các công ty Trung Quốc.

Theo Kyle Chan, các nhà phát triển AI tại Mỹ phải đối mặt với “rủi ro và trách nhiệm pháp lí tiềm ẩn lớn hơn nhiều” liên quan đến quyền sở hữu trí tuệ. Wang Zebin cho rằng việc thực thi luật bản quyền tương đối linh hoạt tại Trung Quốc đã tạo điều kiện thuận lợi hơn cho các doanh nghiệp trong nước thử nghiệm và thương mại hóa các mô hình của họ.

Cecilia Huang, một người đam mê AI ở thành phố Thâm Quyến (Trung Quốc), đã chỉ ra tác động thực tế của sự khác biệt này. Cô cho biết Google Gemini từ chối yêu cầu biến một bức ảnh thành nhân vật trong phim Ratatouille (Chuột đầu bếp) để tạo video 15 giây vì lí do bản quyền. Trong khi đó, Doubao của ByteDance vẫn thực hiện yêu cầu.

Trước những cáo buộc cho rằng ByteDance sử dụng nội dung có bản quyền để huấn luyện Seedance 2.0, công ty mẹ TikTok nói với báo SCMP hồi tháng 2 rằng họ “tôn trọng quyền sở hữu trí tuệ” và đang thực hiện các biện pháp nhằm tăng cường cơ chế bảo vệ hiện có, đồng thời ngăn người dùng sử dụng trái phép tài sản trí tuệ và hình ảnh của người khác.

Wan 3.0 - vũ khí mới của Alibaba trong cuộc đua AI tạo video

Wan 3.0 là một trong những minh chứng rõ nhất cho tham vọng của Trung Quốc trong lĩnh vực AI tạo video.

Wan 3.0, thế hệ mới nhất trong dòng mô hình tạo video Wan, được Alibaba chính thức ra mắt ngày 24/8. Theo Alibaba, Wan 3.0 là mô hình tạo video “tất cả trong một”, có thể xử lí nhiều dạng đầu vào và tạo video tới 30 giây.

Điểm đáng chú ý của Wan 3.0 là khả năng kết hợp nhiều phương thức tạo video. Mô hình AI này hỗ trợ chuyển văn bản thành video, chuyển ảnh thành video và tạo video dựa trên ảnh tham chiếu. Điều này cho phép người dùng không chỉ mô tả bằng câu chữ mà còn cung cấp hình ảnh để định hướng nhân vật, bối cảnh hoặc phong cách của video. Alibaba cho biết Wan 3.0 có thể tạo video dựa trên khung hình đầu tiên hoặc cặp khung hình đầu - cuối, giúp người dùng kiểm soát diễn biến của cảnh tốt hơn.

Wan 3.0 không chỉ nhận văn bản, hình ảnh, âm thanh và video mà còn có thể xử lí tài liệu như PDF, bảng tính, slide và trang web để tạo video. Đây là hướng tiếp cận giúp mô hình AI tạo video vượt ra ngoài nhu cầu sáng tạo nội dung đơn thuần, tiến gần hơn tới các ứng dụng doanh nghiệp như biến báo cáo, tài liệu sản phẩm hoặc nội dung trình chiếu thành video.

Khả năng tạo video tới 30 giây đặc biệt đáng chú ý trong bối cảnh các mô hình AI ngày càng chuyển từ việc tạo những clip ngắn sang phục vụ sản xuất nội dung có cấu trúc phức tạp hơn. Người dùng có thể sử dụng Wan 3.0 để tạo quảng cáo, nội dung mạng xã hội, video thương mại điện tử, hoạt hình hoặc các cảnh phục vụ sản xuất phim.

Wan 3.0 xuất hiện đúng thời điểm Alibaba đang đẩy mạnh đầu tư vào AI. Ngày 24/8, gã khổng lồ công nghệ Trung Quốc công bố kế hoạch phát hành khoảng 710 triệu cổ phiếu mới, huy động khoảng 10,2 tỉ USD. Toàn bộ tiền thu được dự kiến phục vụ việc mở rộng năng lực AI, bao gồm cả hạ tầng.

Alibaba trước đó cam kết đầu tư 380 tỉ nhân dân tệ (khoảng 56,5 tỉ USD) trong ba năm cho cơ sở hạ tầng điện toán đám mây và AI. Đến cuối quý 2/2026, công ty cho biết đã sử dụng gần một nửa khoản đầu tư này.

Việc Wan 3.0 vươn lên vị trí dẫn đầu trên bảng xếp hạng tạo video từ văn bản kèm âm thanh của Artificial Analysis vì thế không chỉ là một thành tích kĩ thuật. Sự kiện này cho thấy Alibaba đang cố gắng xây dựng hệ sinh thái AI hoàn chỉnh, từ mô hình, điện toán đám mây đến hạ tầng phục vụ người dùng doanh nghiệp.

Đáng chú ý, Wan 3.0 không đứng một mình. Trung Quốc hiện chứng kiến cuộc cạnh tranh gay gắt giữa các mô hình AI tạo video của Alibaba, ByteDance, MiniMax và Kuaishou.

Ngày 31/7, MiniMax ra mắt H3, mô hình AI đa phương thức có thể tạo video 15 giây ở độ phân giải 2K, kèm âm thanh stereo, hướng tới các ứng dụng như quảng cáo, thương mại điện tử và game.

Do đó, lợi thế của Trung Quốc trong lĩnh vực AI tạo video không chỉ đến từ một mô hình riêng lẻ. Hệ sinh thái nội dung khổng lồ, nhu cầu thương mại lớn và sự cạnh tranh quyết liệt giữa nhiều công ty đang giúp các mô hình AI Trung Quốc được cải tiến với tốc độ rất nhanh.

Nổi bật
      Mới nhất
      Trung Quốc tạo lợi thế trước Mỹ trong cuộc đua AI tạo video thế nào?
      • Mặc định

      POWERED BY ONECMS - A PRODUCT OF NEKO