AI

Trung Quốc gặp khó khi nguồn dữ liệu cho AI cạn kiệt và bài học với Việt Nam

Bùi Tú 09/08/2026 08:31

Sau cuộc đua chip và năng lực tính toán, Trung Quốc đang phải đối mặt với một nút thắt mới trong tham vọng AI: Thiếu dữ liệu chất lượng cao bằng tiếng Trung.

Khi nguồn dữ liệu văn bản do con người tạo ra trên internet ngày càng cạn kiệt, Bắc Kinh buộc phải tìm cách khai thác kho tri thức khổng lồ còn nằm ngoài môi trường số.

dữ liệu
Trung Quốc gặp khó khi nguồn dữ liệu cho AI cạn kiệt.

Dữ liệu có thể trở thành giới hạn mới của cuộc đua AI

Cuộc đua phát triển các mô hình trí tuệ nhân tạo thế hệ mới của Trung Quốc đang bước vào một giai đoạn khó khăn hơn. Nếu nhiều năm qua, năng lực tiếp cận chip tiên tiến và sức mạnh tính toán được xem là những rào cản lớn nhất, thì giờ đây một vấn đề ít được chú ý hơn đang nổi lên: Nguồn dữ liệu chất lượng cao để huấn luyện AI đang ngày càng khan hiếm.

Đây không chỉ là vấn đề riêng của Trung Quốc. Viện nghiên cứu Epoch AI tại Mỹ dự báo nguồn văn bản chất lượng cao, do con người tạo ra và công khai trên internet, có thể bị khai thác gần như hết trong vòng sáu năm tới. Andrej Karpathy, đồng sáng lập OpenAI, cũng từng cảnh báo về một “bức tường dữ liệu” có thể xuất hiện vào cuối thập niên này, khiến năng lực của các mô hình AI khó tiếp tục tăng trưởng nếu không có nguồn thông tin mới, đáng tin cậy.

Các công ty AI hàng đầu của Mỹ đã bắt đầu tìm kiếm những nguồn dữ liệu nằm ngoài internet. Theo hồ sơ tòa án được The Washington Post đưa tin hồi tháng 1, Anthropic, công ty được Amazon hậu thuẫn, từng triển khai sáng kiến nội bộ có tên Project Panama, chi hàng chục triệu USD để mua hàng triệu cuốn sách, tháo gáy, quét từng trang thành dữ liệu số rồi loại bỏ bản gốc.

Thông tin này lập tức gây tranh cãi khi các tác giả, nhà lưu trữ và tổ chức bảo tồn cho rằng các công ty công nghệ đang coi di sản tri thức của con người như nguyên liệu có thể sử dụng rồi vứt bỏ. Anthropic sau đó bác bỏ cáo buộc cho rằng chương trình của công ty mua và tiêu hủy các cuốn sách quý hiếm hoặc cổ.

Dù tranh cãi về bản quyền và bảo tồn vẫn tiếp diễn, câu chuyện cho thấy mức độ khốc liệt của cuộc cạnh tranh dữ liệu. Khi dữ liệu trên web không còn tăng đủ nhanh, các phòng thí nghiệm AI phải tìm đến những kho tri thức ngoại tuyến vốn chưa được số hóa.

Với Trung Quốc, bài toán thậm chí khó hơn vì dữ liệu tiếng Trung chiếm tỉ trọng rất nhỏ trên internet toàn cầu. Theo W3Techs, tính đến tháng 8/2026, tiếng Anh chiếm gần một nửa nội dung web được thống kê, trong khi tiếng Trung chỉ khoảng 1,3%. Tỉ lệ này thấp hơn đáng kể so với tiếng Tây Ban Nha, tiếng Đức hay tiếng Nhật.

Điều đó tạo ra một nghịch lí. Trung Quốc sở hữu dân số lớn, hệ sinh thái công nghệ phát triển và một lượng khổng lồ tài liệu, sách, dữ liệu chuyên ngành bằng tiếng Trung, nhưng phần lớn kho tri thức này chưa được chuẩn hóa và số hóa để có thể dễ dàng sử dụng trong quá trình huấn luyện AI.

Bắc Kinh vì vậy đang tìm cách biến dữ liệu thành một tài sản chiến lược. Tháng 6, Cục Quản lí Dữ liệu Quốc gia Trung Quốc công bố kế hoạch trên toàn quốc nhằm mở rộng nguồn cung, thúc đẩy lưu thông và thương mại hóa các bộ dữ liệu chất lượng cao phục vụ AI.

Mục tiêu đến năm 2028 là xây dựng hệ sinh thái dữ liệu đã được xác thực, bao phủ các lĩnh vực nền tảng như sản xuất, năng lượng, y tế, tài chính và nông nghiệp, đồng thời mở rộng sang những lĩnh vực AI mới như AI hiện thân, xe tự hành và hàng không tầm thấp.

Yu Xiaohui, Chủ tịch Học viện Công nghệ Thông tin và Truyền thông Trung Quốc, cho rằng cạnh tranh AI không còn chỉ xoay quanh mô hình và năng lực tính toán. Quốc gia nào xây dựng được chuỗi hoàn chỉnh từ tạo lập, xử lí đến khai thác dữ liệu huấn luyện sẽ có lợi thế trong thế hệ AI tiếp theo.

Bắc Kinh tìm dữ liệu ngoài Internet, nhưng vấp phải bài toán bản quyền

Một trong những hướng đi được giới nghiên cứu Trung Quốc đề xuất là xây dựng quy mô lớn các corpus (kho dữ liệu ngôn ngữ) được tuyển chọn, chuẩn hóa và cấu trúc để phục vụ huấn luyện cũng như đánh giá mô hình AI.

Sun Maosong, nhà khoa học máy tính tại Đại học Thanh Hoa, gần đây kêu gọi Trung Quốc thực hiện một chiến dịch có hệ thống nhằm số hóa các nguồn tài liệu ngoại tuyến. Theo ông, corpus đã trở thành nền tảng quan trọng đối với sự phát triển của mô hình ngôn ngữ lớn và nếu không có corpus thì sẽ không thể có các mô hình ngôn ngữ.

Thay vì chỉ dựa vào việc thu thập dữ liệu trên web, Sun đề xuất số hóa các kho lưu trữ lịch sử, địa phương chí, bản thảo cổ và tài liệu khoa học. Các bộ dữ liệu cũng cần mở rộng sang từ điển, nội dung nghe nhìn và phương ngữ vùng miền.

Đây là một kho tài nguyên khổng lồ. Trung Quốc có lịch sử văn hóa kéo dài hàng nghìn năm, cùng hệ thống sách cổ, tài liệu địa phương, công trình nghiên cứu và tư liệu hành chính rất lớn. Nếu được số hóa và chuẩn hóa, những nguồn này có thể bổ sung lượng dữ liệu tiếng Trung đáng kể cho các mô hình AI. Tuy nhiên, việc biến kho tri thức đó thành dữ liệu huấn luyện không đơn giản.

Các nhà xuất bản và chủ sở hữu bản quyền đang ngày càng chủ động thiết lập ranh giới đối với việc sử dụng nội dung cho AI. Một ví dụ gần đây là bản dịch hai kinh điển Đạo giáo Hoàng Đình Kinh và Âm Phù Kinh do Nhà xuất bản Hoa Hạ phát hành. Trên trang bản quyền của sách xuất hiện cảnh báo cấm sử dụng nội dung để huấn luyện AI và đe dọa trách nhiệm pháp lí đối với các trường hợp vi phạm.

Hoa Hạ cho biết điều khoản này được bổ sung theo yêu cầu của đối tác cấp phép đối với các tác phẩm nhập khẩu. Tuy nhiên, chính nhà xuất bản cũng thừa nhận rằng việc phát hiện nội dung bị sử dụng để huấn luyện AI và thực thi quyền sở hữu trí tuệ là một thách thức.

Bên cạnh việc số hóa dữ liệu có sẵn, Trung Quốc cũng đang đặt kì vọng vào dữ liệu tổng hợp và môi trường mô phỏng. Một báo cáo của AliResearch năm 2024 xác định thuật toán, năng lực tính toán và dữ liệu là ba trụ cột của quá trình phát triển mô hình AI. Báo cáo nhấn mạnh rằng dữ liệu vừa phong phú vừa có chất lượng cao là động lực quan trọng thúc đẩy các mô hình AI tạo sinh.

Điều này mở ra một hướng đi khác: Thay vì phụ thuộc hoàn toàn vào dữ liệu do con người tạo ra, các mô hình có thể sử dụng dữ liệu tổng hợp được tạo ra bởi thuật toán hoặc dữ liệu từ môi trường mô phỏng. Tạp chí, mã lập trình, nội dung nghe nhìn và nhiều nguồn chuyên biệt khác cũng có thể trở thành nguyên liệu cho quá trình huấn luyện.

Nhưng dữ liệu tổng hợp không phải lời giải hoàn hảo. Nếu AI ngày càng dựa vào dữ liệu do chính AI tạo ra, nguy cơ lặp lại sai sót, khuếch đại định kiến hoặc làm suy giảm chất lượng thông tin có thể xuất hiện. Trong khi đó, việc số hóa sách, tài liệu lịch sử và kho lưu trữ lại đụng đến những vấn đề phức tạp về bản quyền.

Vì vậy, “bức tường dữ liệu” đang trở thành một thách thức khác với cuộc chiến chip. Chip có thể được thay thế bằng thiết kế mới, công nghệ đóng gói hoặc các giải pháp phần cứng khác. Nhưng dữ liệu chất lượng cao do con người tạo ra là một nguồn tài nguyên hữu hạn hơn.

Đối với Trung Quốc, bài toán không chỉ là có bao nhiêu dữ liệu, mà còn là bao nhiêu dữ liệu tiếng Trung có chất lượng, hợp pháp, được chuẩn hóa và đủ đa dạng để giúp AI tiếp tục tiến bộ. Trong cuộc đua AI giai đoạn tới, khả năng khai thác kho tri thức chưa được số hóa có thể trở nên quan trọng không kém khả năng sở hữu những con chip tiên tiến nhất.

Từ bài toán của AI Trung Quốc đến bài học cho AI Việt Nam

Câu chuyện thiếu dữ liệu tiếng Trung của Trung Quốc cho thấy một thực tế quan trọng: AI không chỉ cần chip, thuật toán hay năng lực tính toán, mà trước hết cần một nguồn dữ liệu đủ lớn, chất lượng và phù hợp với ngôn ngữ, văn hóa của từng quốc gia. Đây cũng là bài toán Việt Nam cần tính đến ngay từ giai đoạn xây dựng hệ sinh thái AI.

Trong cuộc đua dữ liệu cho AI, tiếng Việt cũng đang ở vị thế bất lợi khi lượng nội dung trên internet nhỏ hơn rất nhiều so với tiếng Anh. Quan trọng hơn, một phần đáng kể dữ liệu tiếng Việt chất lượng cao đang nằm trong sách, báo in, tài liệu nghiên cứu, hồ sơ hành chính, kho lưu trữ, dữ liệu chuyên ngành và các nguồn tư liệu lịch sử chưa được số hóa hoặc chưa được chuẩn hóa để phục vụ huấn luyện AI.

Nếu chỉ dựa vào dữ liệu công khai trên internet, các mô hình AI tiếng Việt có nguy cơ thiếu chiều sâu về ngôn ngữ, văn hóa và tri thức bản địa. Trong khi đó, việc thu thập dữ liệu một cách tự phát cũng có thể dẫn đến những vấn đề về bản quyền, quyền riêng tư và chất lượng thông tin.

Bài học từ Trung Quốc vì vậy là cần xem dữ liệu tiếng Việt như một hạ tầng chiến lược, thay vì chỉ coi đó là nguyên liệu cho từng dự án AI riêng lẻ. Việt Nam có thể xây dựng các chương trình số hóa có hệ thống đối với sách, tài liệu khoa học, di sản, dữ liệu chuyên ngành và ngôn ngữ vùng miền; đồng thời hình thành các chuẩn dữ liệu thống nhất để doanh nghiệp, viện nghiên cứu và cơ quan nhà nước có thể khai thác hợp pháp.

Một hệ sinh thái như vậy không chỉ giúp các mô hình AI hiểu tiếng Việt tốt hơn mà còn tạo lợi thế cho Việt Nam trong những lĩnh vực mà dữ liệu bản địa có giá trị đặc biệt. Nếu chip là “phần cứng” của cuộc đua AI, thì dữ liệu tiếng Việt có thể trở thành một trong những tài sản chiến lược quyết định khả năng Việt Nam làm chủ AI của chính mình.

Nổi bật
      Mới nhất
      Trung Quốc gặp khó khi nguồn dữ liệu cho AI cạn kiệt và bài học với Việt Nam
      • Mặc định

      POWERED BY ONECMS - A PRODUCT OF NEKO