Thầy trò Tang Jie - Yang Zhilin và các bộ óc giúp AI Trung Quốc tiến bộ thần tốc
Hơn 10 năm trước, Tang Jie và Yang Zhilin còn là thầy trò, cùng nuôi giấc mơ tạo ra cỗ máy có thể suy nghĩ như con người. Ngày nay, họ trở thành hai doanh nhân AI hàng đầu Trung Quốc, khiến những người tiên phong trong lĩnh vực AI tại Mỹ phải lo ngại.
Yang Zhilin là học trò của Tang Jie ở Đại học Thanh Hoa
Tang Jie (Đường Kiệt), giáo sư tại Đại học Thanh Hoa, là đồng sáng lập Z.ai, một trong những công ty AI đang nhanh chóng đuổi kịp Anthropic và OpenAI về năng lực mô hình AI cũng như mức độ sử dụng trên toàn cầu.
Từng được Tang Jie đề cử cho giải thưởng học thuật cao nhất của Đại học Thanh Hoa, Yang Zhilin (Dương Thực Lân) đang điều hành Moonshot AI, startup AI gây chấn động thế giới với mô hình AI trọng số mở lớn nhất thế giới Kimi K3 có 2.800 tỉ tham số. Mỗi công ty hiện được định giá hàng chục tỉ USD.
Sự trỗi dậy nhanh chóng của các mô hình AI Trung Quốc đã đặt ra hàng loạt câu hỏi tại Thung lũng Silicon và Washington: Làm thế nào các phòng thí nghiệm AI Trung Quốc có thể tiến xa đến vậy chỉ trong thời gian ngắn? Z.ai và Moonshot AI có đang đánh cắp công nghệ từ các mô hình AI Mỹ hay không? Liệu có nên cấm sản phẩm của họ để bảo vệ an ninh quốc gia Mỹ?
Sự nghiệp Tang Jie và Yang Zhilin cho thấy nỗ lực phát triển AI của Trung Quốc không phải là điều xuất hiện đột ngột. Tang Jie (49 tuổi) đã nghiên cứu học máy khoảng 25 năm. Hơn một thập niên trước, ông đã nằm trong nhóm các chuyên gia AI Trung Quốc đi đầu trong việc sử dụng máy tính để thực hiện những nhiệm vụ giống con người, chẳng hạn hiểu ngôn ngữ và nhận diện khuôn mặt.

Tang Jie và Yang Zhilin, cùng các nhà nghiên cứu khác bắt đầu sự nghiệp tại Đại học Thanh Hoa cùng một số cơ sở nghiên cứu khác, đã tạo nên một “Thung lũng Silicon thu nhỏ” trong các trung tâm công nghệ ở Trung Quốc. Kiến thức dễ dàng được chia sẻ giữa họ nhờ văn hóa công bố nghiên cứu, cùng xu hướng ưa chuộng công nghệ nguồn mở của các nhà phát triển Trung Quốc. Những công nghệ này phần lớn có thể được tải xuống, chỉnh sửa và sử dụng miễn phí.
Để bắt kịp đối thủ trong kỉ nguyên AI tạo sinh, các công ty Trung Quốc đã dựa vào sự kết hợp quen thuộc giữa sáng tạo và mô phỏng, vốn từng góp phần thúc đẩy thành công của nước này trong các ngành điện tử, ô tô và năng lượng xanh. Các hãng phát triển AI Trung Quốc đưa những nhà khoa học máy tính từng được đào tạo tại Mỹ trở về nước, đồng thời theo sát những tiến bộ AI tại Mỹ.
Gây tranh cãi hơn, một số công ty Trung Quốc dường như đã sử dụng kỹ thuật chưng cất để hỗ trợ huấn luyện mô hình AI của mình nhanh hơn.
Anthropic đã cáo buộc một số công ty Trung Quốc, trong đó có Z.ai và Moonshot, vi phạm chính sách của hãng khi thực hiện chưng cất mô hình AI trên quy mô lớn. Cả hai công ty Trung Quốc đều không bình luận về vấn đề này.
Những người làm việc tại các công ty AI Trung Quốc thừa nhận chưng cất mô hình đang được sử dụng rộng rãi trên toàn cầu và một số công ty nước này có thể sử dụng kỹ thuật này nhiều hơn các đối thủ Mỹ.
Tháng 6, Elon Musk dự đoán Trung Quốc sẽ chưa thể đạt được năng lực tương đương mô hình Claude Fable 5 cao cấp nhất của Anthropic trước quý 1/2027. Tang Jie đáp lại trên mạng xã hội X: “Sẽ không lâu đến thế”.
Một số lãnh đạo trong ngành AI ở cả hai nước cho rằng mô hình AI tốt nhất của Trung Quốc hiện chỉ chậm hơn sản phẩm hàng đầu Mỹ vài tháng.
Trong tháng 8, Z.ai phát hành GLM-5.3 và tuyên bố mô hình AI này đã đạt năng lực an ninh mạng tương đương Claude Mythos 5 của Anthropic.
Chính phủ Trung Quốc từ lâu xem AI và khoa học máy tính là những động lực quan trọng với tăng trưởng kinh tế và an ninh quốc gia. Công thức bắt kịp đối thủ của Trung Quốc là kết hợp cả hỗ trợ từ nhà nước và cạnh tranh trong khu vực tư nhân.
Nhà nước đã rót tiền vào nghiên cứu tại các trường đại học như Thanh Hoa, đồng thời tài trợ cho startup. Chính quyền trung ương và địa phương cũng sớm trở thành khách hàng sử dụng dịch vụ của những startup này.
Sau khi Anthropic giới thiệu phiên bản Claude Mythos Preview hồi tháng 4 với khả năng phát hiện lỗ hổng an ninh mạng xuất sắc, một số quan chức Trung Quốc ví nó như “vũ khí hạt nhân của kỉ nguyên AI”.
Nhận thức được việc Washington có thể ngăn người nước ngoài tiếp cận những mô hình AI hàng đầu Mỹ, Trung Quốc đang hỗ trợ các nhà phát triển AI trong nước thông qua một quỹ quốc gia, đồng thời nới lỏng quy định để giúp startup đưa cổ phiếu lên thị trường chứng khoán.
Theo Hiệp hội Đầu tư của các Doanh nghiệp Nhà nước Trung ương, gần một nửa tổng vốn đầu tư cổ phần tại Trung Quốc trong nửa đầu năm 2026 đã chảy vào lĩnh vực AI, phần lớn đến từ các quỹ có sự hậu thuẫn của chính phủ.
Tách Z.ai ra khỏi phòng thí nghiệm ở Đại học Thanh Hoa
Đầu những năm 2000, ngành Internet Trung Quốc bắt đầu bùng nổ và tạo ra lượng dữ liệu khổng lồ khi hàng triệu người dùng bắt đầu mua sắm, tìm kiếm thông tin và giao tiếp trực tuyến. Các công ty bắt đầu đầu tư vào học máy để nâng cao hiệu quả thương mại điện tử và phân tích hành vi trực tuyến của người dùng.
Trong nỗ lực tìm kiếm các phương thức giám sát dân số và phát hiện những mối đe dọa, chính phủ Trung Quốc cũng tìm đến các chương trình máy tính có khả năng nhận diện khuôn mặt và giọng nói. Các trường đại học Trung Quốc đào tạo ngày càng nhiều sinh viên chuyên về thị giác máy tính, một nhánh của khoa học máy tính nhằm giúp máy móc “nhìn” giống con người.
Thời kì đó đã sản sinh ra “bốn con rồng AI nhỏ”, gồm, Megvii, Yitu Technology, CloudWalk Technology và SenseTime, nơi đào tạo ra nhiều kỹ sư đang hoạt động trong lĩnh vực AI.
Tiền bạc và nhân tài đổ về Thanh Hoa, trường đại học khoa học và công nghệ hàng đầu Trung Quốc. Năm 2005, Andrew Yao, cựu giáo sư Đại học Princeton (Mỹ) và người từng đoạt giải thưởng mang tên nhà tiên phong khoa học máy tính Alan Turing, thành lập “lớp Yao” tinh hoa tại Đại học Thanh Hoa nhằm đào tạo những tài năng hàng đầu.
Tang Jie, giáo sư Đại học Thanh Hoa và đồng sáng lập Z.ai, đã gắn bó với trường từ thời làm tiến sĩ. Ông nghiên cứu về khai phá dữ liệu, lĩnh vực tìm cách phát hiện những quy luật ẩn trong các tập dữ liệu lớn và sau này trở thành nền tảng quan trọng của AI.
Theo nhà báo công nghệ Mehran Gul trong cuốn sách The New Geography of Innovation, Tang Jie từng nói rằng sau khi nhận bằng tiến sĩ tại Đại học Thanh Hoa, ông nghĩ có thể làm được điều gì đó lớn lao ở Trung Quốc và qua đó giúp ích cho đất nước. Vì vậy, ông quyết định ở lại.
Tang Jie thích thử thách sức bền bằng cách chạy marathon và tham gia các cuộc thi ba môn phối hợp. Ông điều hành phòng thí nghiệm AI của mình cũng với tinh thần tương tự.
Kevin Zhong, người từng làm việc trong thời gian ngắn với Tang Jie khi học thạc sĩ tại Đại học Thanh Hoa và hiện làm việc ở London, nhận xét: “Nhóm nghiên cứu của Giáo sư Tang nổi tiếng là làm việc với cường độ cực cao”.
Kevin Zhong nhớ lại rằng Tang Jie luôn yêu cầu nhóm thử nghiệm các kỹ thuật học máy tiềm năng bằng những thí nghiệm thực tế. Đôi khi, các nhà nghiên cứu phải ở lại phòng thí nghiệm đến 3 giờ sáng để hoàn thành các bài kiểm tra.
“Họ thực sự rất giỏi trong việc liên tục công bố nghiên cứu trên các tạp chí hàng đầu và cực kì giỏi trong việc thương mại hóa công trình của mình”, Kevin Zhong nói.
Đến những năm 2010, phòng thí nghiệm của Tang Jie đã nổi tiếng trên toàn quốc trong giới những người trẻ muốn theo đuổi công nghệ. Các cựu sinh viên của ông bắt đầu góp mặt tại những công ty hàng đầu ở Thung lũng Silicon.
Yang Zhilin (sau này sáng lập Moonshot AI) bắt đầu được đào tạo chuyên sâu về lập trình từ năm 17 tuổi và tham gia các cuộc thi Tin học quốc gia của Trung Quốc. Khi học tại Đại học Thanh Hoa, Yang Zhilin nghiên cứu các thuật toán học máy cùng Tang Jie.
Năm 2018, Trung Quốc mở đường cho các nhà nghiên cứu tại viện nghiên cứu và trường đại học nhà nước thành lập công ty và thương mại hóa công nghệ của họ. Năm sau, Tang Jie tách Z.ai ra khỏi phòng thí nghiệm tại Đại học Thanh Hoa. Ông dùng một phần nguồn vốn từ nền tảng phân tích dữ liệu do mình điều hành, với khách hàng gồm Google và IBM, để tài trợ cho Z.ai.

Tang Jie xem Sam Altman là đối thủ
Từ rất lâu trước khi cuộc cạnh tranh AI Mỹ - Trung trở thành chủ đề lớn trên truyền thông, Tang Jie đã xem mình là đối thủ của Sam Altman (Giám đốc điều hành OpenAI). Khi OpenAI phát hành mô hình GPT-3 tiên phong vào năm 2020, Z.ai đặt mục tiêu tạo ra một mô hình có năng lực tương đương.
“Tôi đang dồn toàn bộ nỗ lực vào AI tổng quát (AGI), với sứ mệnh dạy máy móc suy nghĩ như con người”, Tang Jie viết trên trang web cá nhân vài năm trước.
Sau khi học với Tang Jie, Yang Zhilin lấy bằng tiến sĩ tại Đại học Carnegie Mellon (Mỹ). Yang Zhilin trở về Trung Quốc để hỗ trợ công trình nghiên cứu của người thầy cũ, đồng thời quyết định thành lập công ty riêng.
Là người mê chơi trống nhạc rock, Yang Zhilin đặt tên startup theo tiếng Trung là “Mặt tối của Mặt trăng”, lấy cảm hứng từ album The Dark Side of the Moon của ban nhạc Pink Floyd. Tên tiếng Anh của công ty là Moonshot AI.
“Liang Wenfeng có tư duy khác biệt”
Tại Thượng Hải, hai cựu nhà nghiên cứu khác của Đại học Thanh Hoa, trong đó có một người từng học lớp Yao danh tiếng, cũng thành lập công ty riêng để phát triển các mô hình AI.
DeepSeek là cái tên đáng chú ý khác. Liang Wenfeng (Lương Văn Phong), nhà sáng lập kiêm giám đốc điều hành DeepSeek, bắt đầu sự nghiệp trong lĩnh vực thị giác máy tính cách đây hai thập niên, sau đó thành lập quỹ phòng hộ High-Flyer sử dụng AI để phân tích thị trường tài chính.
Năm 2023, Liang Wenfeng gặp Tang Jie. Sau đó, Tang Jie nói với nhân viên rằng ông ấn tượng với “những cách tư duy khác biệt” của Liang Wenfeng. Cũng trong năm đó, Liang Wenfeng tách DeepSeek khỏi High-Flyer và tuyên bố theo đuổi cùng một mục tiêu với Tang Jie: Tạo ra trí tuệ giống như con người.
Các nhà sáng lập startup này đến từ nhiều vùng khác nhau của Trung Quốc. Tang Jie xuất thân từ một vùng hẻo lánh ở tỉnh Tứ Xuyên, miền tây Trung Quốc, trong khi Yang Zhilin và Liang Wenfeng đến từ tỉnh Quảng Đông. Họ tập trung tại Bắc Kinh và Hàng Châu, nơi Liang Wenfeng từng học và bắt đầu sự nghiệp kinh doanh.

Làm nhiều hơn với ít nguồn lực hơn
Các nhà sáng lập startup AI này hiểu rõ những điểm yếu của Trung Quốc so với Mỹ: Thiếu vốn và thiếu khả năng tiếp cận những chip AI tiên tiến nhất do các biện pháp kiểm soát xuất khẩu.
Đến giữa năm 2025, Tang Jie đã huy động khoảng 1,25 tỉ USD từ các nhà đầu tư, trong đó có những tập đoàn công nghệ lớn Trung Quốc và nhà đầu tư mạo hiểm Neil Shen ở Hồng Kông. Các quỹ được nhà nước hậu thuẫn cũng rót vốn, hưởng ứng lời kêu gọi của Trung Quốc về việc nuôi dưỡng các công ty AI trong nước.
Tuy nhiên, những con số này vẫn rất nhỏ so với hàng tỉ USD mà OpenAI và Anthropic huy động được.
Ngân hàng đầu tư Jefferies sau đó tính toán rằng trong giai đoạn này, các hãng công nghệ Trung Quốc chỉ đầu tư chưa đến 1/5 số tiền mà các đối thủ Mỹ bỏ ra. Họ buộc phải tìm cách làm được nhiều hơn với nguồn lực ít hơn.
DeepSeek đã phát triển một số giải pháp quan trọng, trong đó có Multi-Head Latent Attention (MLA). Kỹ thuật này giúp giảm đáng kể lượng bộ nhớ mà mô hình AI cần sử dụng, chẳng hạn trong một cuộc trò chuyện với chatbot, bằng cách tạo ra một dạng tóm lược những thông tin đã xuất hiện trước đó. Dùng ít bộ nhớ hơn đồng nghĩa với việc tiêu thụ ít năng lực tính toán và chi phí hơn.
DeepSeek cũng là một trong những công ty đầu tiên tại Trung Quốc áp dụng rộng rãi kiến trúc mô hình mixture of experts (MoE), hay hỗn hợp chuyên gia. Trong kiến trúc này, một cơ chế định tuyến ban đầu sẽ chuyển mỗi bài toán đến một mô hình chuyên gia phù hợp, giống như một bếp trưởng chuyển món mì spaghetti cho đầu bếp chuyên món Ý.
DeepSeek cho ngành AI Trung Quốc thấy một hướng đi khả thi để nâng cao hiệu năng mô hình AI trong khi giảm yêu cầu về chip.
Những kỹ thuật này góp phần tạo nên “cú sốc DeepSeek” vào tháng 1/2025, khi công ty của Liang Wenfeng phát hành mô hình suy luận R1 có hiệu năng ngang các sản phẩm Mỹ của OpenAI, Anthropic và Google nhưng chi phí huấn luyện thấp hơn rất nhiều. Thị trường chứng khoán Mỹ khi đó đã có lúc chao đảo trước sự trỗi dậy bất ngờ của đối thủ AI Trung Quốc.
Trong một bài đăng trên X, Sam Altman gọi mô hình DeepSeek R1 là ấn tượng và cho rằng việc xuất hiện một đối thủ mới là điều “thực sự khích lệ”.
Các đối thủ Trung Quốc của DeepSeek cũng choáng váng. Tại Moonshot AI, Yang Zhilin liên tục nhận được cuộc gọi từ những nhà đầu tư thể hiện sự lo lắng. Một nhà đầu tư thậm chí hỏi tại sao Yang Zhilin không dự đoán được sự trỗi dậy của DeepSeek, theo tờ WSJ.
Yang Zhilin sau đó đưa các kỹ thuật do DeepSeek phát minh hoặc chứng minh hiệu quả vào những mô hình AI tiếp theo của Moonshot AI. Các mô hình K2 và K3 của Moonshot AI áp dụng kiến trúc MoE cùng các biến thể MLA. Đổi lại, DeepSeek cũng sử dụng một kỹ thuật do Moonshot AI tối ưu hóa để nâng cao hiệu quả và độ ổn định khi huấn luyện mô hình AI.
Tại một cuộc họp của DeepSeek vào tháng 5, một số nhà đầu tư hỏi Liang Wenfeng liệu ông có thể kiếm được nhiều tiền khi cho đi các bí quyết công nghệ hay không.
Câu trả lời của Liang Wenfeng phản ánh tinh thần của phong trào nguồn mở tại Trung Quốc: “Tôi không lo cạnh tranh vì thị trường đủ lớn”.
Ngoài việc chưng cất các mô hình AI, một số công ty Trung Quốc còn tận dụng chuyên môn của Mỹ bằng cách tuyển dụng những người Trung Quốc từng làm việc cho các công ty AI hàng đầu Mỹ.
Tencent tuyển hai cựu sinh viên Đại học Thanh Hoa từng làm việc tại OpenAI. ByteDance, công ty mẹ của TikTok, đưa một nhà nghiên cứu Google về Trung Quốc. Chỉ trong vòng một năm, ByteDance đã phát triển công cụ AI tạo video mạnh mẽ Seedance, hiện được các nhà sáng tạo nội dung và các hãng phim Hollywood sử dụng rộng rãi.
Tháng 1, các lãnh đạo Z.ai, khi đó còn có tên Zhipu AI, đã gõ chiêng tại Sở giao dịch chứng khoán Hồng Kông, đưa công ty trở thành startup phát triển mô hình AI đầu tiên của Trung Quốc lên sàn.
Đến tháng 7, doanh thu định kì hằng năm của Z.ai đã tăng lên 1 tỉ USD, theo WSJ. Con số này cao gấp khoảng hai lần DeepSeek.
Tuy nhiên, Z.ai vẫn còn kém xa các gã khổng lồ AI Mỹ. Doanh thu hằng năm của Anthropic đạt 65 tỉ USD vào tháng 7.
Tại cuộc họp của DeepSeek vào tháng 5, Liang Wenfeng cho rằng chip, chứ không phải con người, mới là yếu tố tạo ra khoảng cách lớn nhất giữa các công ty Trung Quốc và Mỹ.
Các nhà nghiên cứu tại Alibaba và Z.ai cho biết họ thường chỉ được cấp khoảng 1/5 số chip AI cao cấp so với lượng chip mà đồng nghiệp ở OpenAI và Google có thể sử dụng.
Laila Khawaja, nhà phân tích tại hãng Gavekal Technologies (Mỹ), nhận xét rằng các công ty AI Trung Quốc đang theo đuổi “hiệu quả chi phí đến mức cực đoan”. Trong khi đó, các công ty Mỹ có chip tiên tiến hơn và sẵn sàng đốt nhiều vốn hơn nên có thể chi mạnh cho những nghiên cứu mang tính thăm dò, có khả năng tạo ra những bước đột phá lớn về công nghệ.
Một số nhà phát triển AI Trung Quốc đang xây dựng các mô hình có 5.000 - 10.000 tỉ tham số, chỉ số thường được dùng để mô tả quy mô của mô hình. Những người trong ngành ước tính các mô hình mới nhất của Anthropic có hơn 5.000 tỉ tham số.
Tang Jie đang huấn luyện mô hình chủ lực tiếp theo của Z.ai. Đội ngũ của ông kỳ vọng mô hình này có thể thực hiện những nhiệm vụ nghiên cứu phức tạp kéo dài nhiều tuần.
Trong bản ghi nhớ gửi nhân viên vào tháng 7, Tang Jie viết: “Ai là người đầu tiên đẩy giới hạn công nghệ lên cao hơn dù chỉ một chút, người đó sẽ định nghĩa lại những gì có thể làm được trong mọi ngành”.