Trung Quốc vẫn phải dùng chip Nvidia để huấn luyện AI, bất chấp tham vọng tự chủ
Các mô hình AI tiên tiến nhất của Trung Quốc vẫn chủ yếu được huấn luyện trên chip Nvidia do chi phí và độ phức tạp khi chuyển sang phần cứng nội địa quá lớn.
Nút thắt không chỉ nằm ở phần cứng mà còn ở hệ sinh thái phần mềm CUDA (Compute Unified Device Architecture) đã ăn sâu vào quy trình phát triển AI.

CUDA trở thành “điểm nghẽn” khiến Trung Quốc lệ thuộc chip Nvidia
Trong cuộc đua phát triển trí tuệ nhân tạo, Trung Quốc đang đạt nhiều bước tiến về phần cứng nội địa, nhưng các phòng nghiên cứu và công ty phát triển mô hình ngôn ngữ lớn (LLM) vẫn chưa thể dễ dàng từ bỏ chip Nvidia.
Theo các nguồn tin tại một số nhà phát triển LLM lớn của Trung Quốc, những mô hình AI tiên tiến nhất hiện vẫn được huấn luyện chủ yếu trên phần cứng Nvidia. Lí do không đơn giản là chip Trung Quốc chưa đủ mạnh, mà nằm ở chi phí kĩ thuật khổng lồ khi chuyển đổi toàn bộ hệ thống.
Một người am hiểu ngành cho biết việc huấn luyện LLM trên chip Nvidia hiện vẫn là “chuẩn mực” đối với các nhà phát triển AI Trung Quốc.
Nút thắt lớn nhất nằm ở hệ sinh thái phần mềm. Trong nhiều năm, nền tảng CUDA của Nvidia đã trở thành tiêu chuẩn phổ biến trong phát triển AI. Hàng loạt thư viện, công cụ và quy trình huấn luyện mô hình được xây dựng xoay quanh CUDA, tạo ra một hệ sinh thái mà các đối thủ rất khó thay thế trong thời gian ngắn.
Huawei Technologies đã phát triển nền tảng CANN (Compute Architecture for Neural Networks) để phục vụ dòng chip Ascend. Tuy nhiên, việc chuyển từ CUDA sang CANN không đơn giản là thay một loại chip bằng loại khác.
Theo một nhà nghiên cứu AI tham gia phát triển mô hình, các hệ thống huấn luyện hiện tại phụ thuộc rất lớn vào CUDA. Mã CUDA không thể chạy trực tiếp trên chip Ascend và phải được viết lại, sau đó tối ưu hóa đáng kể.
James Wang, một nhà phát triển AI tại viện nghiên cứu trực thuộc một trường đại học ở Thượng Hải, cho biết các quy trình huấn luyện hiện tại của nhóm ông phụ thuộc vào CUDA. Nếu chuyển sang Ascend, mã nguồn phải được viết lại trên diện rộng. Wang ước tính việc di chuyển quy trình hiện tại sang chip Ascend có thể khiến thời gian và chi phí của nhóm tăng ít nhất 50%.
Đối với những doanh nghiệp đang chạy đua để đưa mô hình AI mới ra thị trường, chi phí này là một trở ngại lớn. Mỗi tháng dành cho việc chuyển đổi hệ thống đồng nghĩa với thời gian phát triển bị kéo dài, trong khi đối thủ vẫn tiếp tục cải thiện mô hình trên nền tảng Nvidia đã hoàn thiện.
Mức độ khó khăn còn phụ thuộc vào loại mô hình và độ trưởng thành của hệ sinh thái phần mềm xung quanh chip.
Một kỹ sư tại Bắc Kinh tham gia chuyển các workload LLM sang Ascend cho biết những mô hình nguồn mở như DeepSeek có thể chuyển đổi tương đối dễ dàng. Với sự hỗ trợ từ hệ sinh thái hiện có, một nhóm khoảng hai đến ba kỹ sư có thể mất thêm khoảng một tháng để huấn luyện trên Ascend so với hệ thống Nvidia. Nhưng với những mô hình đóng hơn, câu chuyện hoàn toàn khác.
Bài toán không chỉ là thay chip, mà là xây lại cả hệ sinh thái
Theo kỹ sư này, một mô hình như Kimi K3 của Moonshot AI chỉ công bố trọng số (tức các tham số nền tảng mã hóa năng lực của mô hình, thay vì mã nguồn) có thể cần khoảng 10 kỹ sư làm việc thêm hơn sáu tháng nếu chuyển sang nền tảng nội địa.
Khoảng cách này cho thấy vấn đề mà Trung Quốc phải đối mặt không chỉ là năng lực sản xuất chip. Bắc Kinh có thể đầu tư mạnh vào GPU nội địa, nhưng để các GPU đó thay thế Nvidia trên quy mô lớn, Trung Quốc còn cần một hệ sinh thái phần mềm đủ hoàn thiện.
CUDA đã được xây dựng qua nhiều năm với hàng loạt thư viện và công cụ hỗ trợ. Đó là lợi thế mà các nhà sản xuất chip AI Trung Quốc không thể nhanh chóng sao chép.
Sự phụ thuộc này đặc biệt đáng chú ý ở giai đoạn huấn luyện AI. Chu trình phát triển một mô hình thường gồm huấn luyện và suy luận (inference). Huấn luyện đòi hỏi lượng tài nguyên tính toán khổng lồ và thời gian dài, trong khi inference tương đối nhẹ hơn.
Do đó, một số mô hình Trung Quốc đã có thể được điều chỉnh để chạy trên nền tảng nội địa dù quá trình huấn luyện ban đầu vẫn dựa vào Nvidia.
DeepSeek-V4 và Kimi K3 được cho là đã được tối ưu để hoạt động trên các nền tảng Trung Quốc như Huawei và Alibaba. Tuy nhiên, cả DeepSeek lẫn Moonshot AI chưa công bố chính thức họ sử dụng loại chip nào để huấn luyện các mô hình này.
Kimi K3 từng được The Information đưa tin hồi tháng 7 là đã được huấn luyện trên chip Nvidia, trong đó có các bộ xử lí Blackwell tiên tiến. Báo cáo cũng cho biết các công ty AI Trung Quốc vẫn tiếp tục dựa vào phần cứng Nvidia để phát triển những mô hình tiên phong, bất chấp nỗ lực mở rộng lựa chọn chip nội địa.
Nếu thông tin này chính xác, nó cho thấy một nghịch lí trong chiến lược tự chủ công nghệ của Trung Quốc: nước này có thể nhanh chóng phát triển chip AI nội địa và đưa chúng vào các hệ thống thương mại, nhưng việc loại bỏ hoàn toàn Nvidia khỏi quy trình phát triển những mô hình tiên tiến vẫn là mục tiêu rất khó đạt được.
Dù vậy, một số doanh nghiệp Trung Quốc đã bắt đầu chứng minh rằng huấn luyện AI hoàn toàn bằng phần cứng nội địa là khả thi.
Tháng 6, Meituan công bố LongCat-2.0, mô hình có 1,6 nghìn tỉ tham số. Công ty cho biết mô hình được huấn luyện và vận hành hoàn toàn trên một cụm điện toán nội địa gồm 50.000 card, dù không tiết lộ nhà cung cấp chip.
Đây là tín hiệu đáng chú ý đối với ngành bán dẫn Trung Quốc. Nó cho thấy khi phần cứng, phần mềm và đội ngũ kĩ thuật được phối hợp đủ lâu, các mô hình lớn có thể dần thoát khỏi sự phụ thuộc vào Nvidia.
Tuy nhiên, để biến những trường hợp riêng lẻ thành xu hướng toàn ngành, Trung Quốc vẫn cần giải quyết bài toán khó hơn: xây dựng một hệ sinh thái có khả năng cạnh tranh với CUDA.
Cuộc chiến chip AI vì thế không chỉ diễn ra trong các nhà máy bán dẫn. Nó còn diễn ra trong từng dòng mã nguồn, thư viện phần mềm và quy trình huấn luyện của các phòng nghiên cứu. Chừng nào các nhà phát triển Trung Quốc vẫn phải dựa vào CUDA để huấn luyện những mô hình tiên tiến nhất, tham vọng tự chủ AI của Bắc Kinh vẫn chưa thể hoàn toàn thoát khỏi cái bóng của Nvidia.

