Chip AI Trung Quốc hụt hơi khi chạy lập trình, GPU Nvidia vẫn là hàng hiếm
Các công ty AI Trung Quốc đang tối ưu hóa phần mềm để đáp ứng nhu cầu suy luận tăng mạnh.
Một phần khối lượng công việc này vẫn phải dựa vào năng lực tính toán từ nguồn chip cao cấp khan hiếm, trong bối cảnh Trung Quốc bị hạn chế tiếp cận các GPU (bộ xử lí đồ họa) tiên tiến của Nvidia.
So với huấn luyện mô hình AI - vốn phụ thuộc nhiều vào chip cao cấp, suy luận là giai đoạn sau đó, khi mô hình đã được huấn luyện sử dụng kiến thức của mình để xử lí và tạo ra câu trả lời. Giai đoạn này có thể được điều chỉnh để chạy trên phần cứng trong nước. Tuy nhiên, những người trong ngành cho biết các tác vụ phức tạp như lập trình vẫn cần đến GPU Nvidia. Điều này khiến ngành AI Trung Quốc đối mặt với tình trạng thiếu năng lực tính toán nghiêm trọng khi AI chuyển từ giai đoạn phát triển mô hình sang triển khai trên quy mô lớn.
“Phía nhu cầu đang cho thấy sự phân cực rõ rệt”, ông Guan Jiawei, Phó chủ tịch công ty khởi nghiệp tối ưu hóa suy luận Approaching.AI (Trung Quốc), cho biết. Theo Guan Jiawei, nhu cầu xử lí các token chất lượng cao đang vượt xa năng lực cung ứng
Token là đơn vị dữ liệu mà mô hình AI xử lí hoặc tạo ra dưới dạng văn bản hoặc hình ảnh, có thể là một từ, một phần của từ, hoặc thậm chí là dấu câu. Nhiều công ty sử dụng token như một đơn vị kinh tế để đo lường khối lượng tính toán mà AI thực hiện. Văn bản càng dài thì càng cần nhiều token để xử lí, vì vậy chi phí thường được tính theo số token (trên mỗi nghìn hoặc mỗi triệu token).
Guan Jiawei cho rằng các tác vụ cấp cao đòi hỏi những tiêu chuẩn hiệu năng khắt khe mà các chip Trung Quốc chưa thể đáp ứng một cách ổn định. Các mô hình AI tiên tiến của Trung Quốc “đặt ra yêu cầu rất cao với chip, đặc biệt trong những tình huống như lập trình, nơi người dùng sẵn sàng trả mức phí cao hơn”.
Guan Jiawei cho biết: “Nếu chỉ sử dụng chip trong nước để thực hiện suy luận, các doanh nghiệp chỉ có thể xử lí những tác vụ có yêu cầu thấp, vốn có nhu cầu ít và khó tạo ra doanh thu. Điều này khiến việc xây dựng mô hình kinh doanh khả thi trở nên rất khó khăn. Vì vậy, việc xử lí các token chất lượng cao vẫn phụ thuộc vào GPU Nvidia”.

Tình trạng thiếu hụt năng lực tính toán thêm trầm trọng
Việc sử dụng token tăng vọt, khi AI ngày càng thể hiện tính chủ động, tức là thực hiện các tác vụ thực tế thay vì chỉ trả lời câu hỏi, làm trầm trọng thêm tình trạng thiếu hụt năng lực tính toán. Theo Cục Quản lý Dữ liệu Quốc gia Trung Quốc, số lượt sử dụng token trung bình mỗi ngày tại nước này đã vượt 140 nghìn tỉ vào tháng 3, tăng hơn 1.000 lần so với đầu năm 2024.
Áp lực lên nguồn cung năng lực tính toán cũng được phản ánh qua giá chip. Theo dữ liệu của Approaching.AI, giá thuê GPU Nvidia H200 theo tháng đã tăng lên hơn 100.000 nhân dân tệ (14.857 USD) vào đầu năm 2026, từ mức 50.000 - 80.000 nhân dân tệ vào cuối quý III/2025.
“Nếu tiếp tục dựa vào cùng một công nghệ suy luận như hiện nay, sự gia tăng nhu cầu về token sẽ đòi hỏi năng lực tính toán khổng lồ, vượt quá khả năng đáp ứng. Dựa trên tính toán này, Trung Quốc có thể cần khoảng 300.000 chip cao cấp cho tác vụ suy luận trong năm 2026 và con số này có thể lên tới 300 triệu chip vào năm 2030. Điều đó rõ ràng là không thực tế”, Guan Jiawei nhận định.
Các công ty AI Trung Quốc phải tối ưu hóa phần mềm vì chip nội địa tụt hậu so với Nvidia
Trước tình hình này, các doanh nghiệp Trung Quốc buộc phải tìm kiếm những giải pháp khác thường.
Chẳng hạn, Moonshot AI đã thiết kế một thư viện truyền dữ liệu dành cho các tình huống suy luận không đồng nhất, trong đó nhiều loại chip khác nhau cùng phối hợp xử lí. Theo website của dự án, hệ thống này cho phép trao đổi dữ liệu hiệu quả giữa GPU Nvidia H20 và chip Ascend 910B của Huawei.
Tương tự Moonshot AI, Approaching.AI cũng sử dụng kỹ thuật gọi là phân tách P/D không đồng nhất, cho phép các loại chip khác nhau đảm nhiệm những phần việc khác nhau trong cùng một tác vụ AI. Cụ thể, Ascend 910B có thể đảm nhận khâu xử lí ban đầu của yêu cầu, trong khi Nvidia H20 tạo ra câu trả lời, với phần mềm đóng vai trò trung gian truyền tải thông tin giữa hai loại chip này.
Approaching.AI cho biết công cụ suy luận KTransformers của họ đã được sử dụng để chạy phiên bản đầy đủ mô hình DeepSeek trên chỉ một GPU Nvidia RTX 4090 kết hợp với CPU và lượng lớn bộ nhớ. Công ty Trung Quốc cho biết phương pháp này có thể giúp giảm 10 - 20 lần chi phí vận hành mô hình AI.
Giải pháp trên dường như đang mang lại hiệu quả. Approaching.AI cho biết doanh thu trong tháng 6 đã vượt tổng doanh thu của cả năm ngoái.
KTransformers là framework (khung phần mềm) suy luận và tinh chỉnh mô hình theo kiến trúc CPU/GPU không đồng nhất, do nhóm MADSys của Đại học Thanh Hoa (Trung Quốc), Approaching.AI và các cộng tác viên phát triển.


