ByteDance huấn luyện mô hình AI 10.000 tỉ tham số, hơn 3 lần Kimi K3
ByteDance đang huấn luyện một mô hình AI lớn hơn ba lần so với Kimi K3 của Moonshot AI.
ByteDance, công ty mẹ TikTok, đang huấn luyện một mô hình AI có quy mô có thể tiệm cận Claude Mythos - dòng mô hình tiên tiến nhất của Anthropic. Đây là dấu hiệu cho thấy các công ty AI Trung Quốc đang tiếp tục thu hẹp khoảng cách với những đối thủ hàng đầu Mỹ.
Theo ba nguồn tin của trang FT, ByteDance hiện ở giai đoạn đầu huấn luyện mô hình AI có thể đạt tới 10.000 tỉ tham số, lớn hơn ba lần mức 2.800 tỉ tham số của Kimi K3. Moonshot AI gọi Kimi K3 là mô hình AI trọng số mở lớn nhất Trung Quốc hiện nay.
FT cho biết mô hình AI của ByteDance đang trong giai đoạn tiền huấn luyện, công đoạn thường kéo dài từ 3 đến 6 tháng. Sau đó, nếu mọi việc diễn ra thuận lợi, mô hình AI này sẽ được tinh chỉnh rồi mới phát hành. Quy mô tham số cuối cùng chỉ được xác định khi quá trình huấn luyện tiến xa hơn.
Anthropic không công bố số lượng tham số của các mô hình AI. Tuy nhiên, giới chuyên môn ước tính Claude Mythos 5, mô hình mạnh nhất của Anthropic, có khoảng 8.000 tỉ tham số, còn Claude Fable 5 có khoảng 5.000 tỉ tham số.
Tham số là các giá trị số mà mô hình AI học được và điều chỉnh trong suốt quá trình huấn luyện trên lượng lớn dữ liệu. Nó là các biến nội bộ của mô hình AI, quyết định cách xử lí thông tin đầu vào và tạo kết quả đầu ra. Mục tiêu của quá trình huấn luyện là tìm ra bộ tham số tối ưu nhất để mô hình AI có thể thực hiện nhiệm vụ (dự đoán từ tiếp theo trong câu, dịch ngôn ngữ, trả lời câu hỏi...) chính xác nhất có thể dựa trên dữ liệu đã học.
Số lượng tham số thường là chỉ số về kích thước và khả năng của mô hình AI. Mô hình AI càng có nhiều tham số thì tiềm năng học được các mẫu phức tạp hơn càng lớn, nhưng cũng đòi hỏi nhiều dữ liệu, tài nguyên tính toán để huấn luyện.
Tuy nhiên, hiệu năng thực tế của mô hình AI còn phụ thuộc vào nhiều yếu tố khác như chất lượng dữ liệu, phương pháp huấn luyện và kiến trúc.

Nỗ lực xây dựng một trong những mô hình lớn nhất thế giới cho thấy ByteDance cũng như các phòng thí nghiệm AI Trung Quốc không chỉ muốn đuổi kịp, mà còn vượt qua các đối thủ Mỹ trong cuộc đua AI tiên tiến.
Vài tuần gần đây, Kimi K3 và Qwen3.8 Max của Alibaba đã đạt kết quả rất cao trên nhiều bảng đánh giá, chỉ xếp sau Claude Fable 5 ở một số hạng mục.
Ngày 12/6, Bộ Thương mại Mỹ ban hành lệnh kiểm soát xuất khẩu, yêu cầu Anthropic đình chỉ quyền truy cập Claude Fable 5 và Mythos 5 với người nước ngoài do lo ngại an ninh quốc gia liên quan đến khả năng bị jailbreak.
jailbreaklà kỹ thuật sử dụng các câu lệnh hoặc phương pháp khác để vượt qua các cơ chế an toàn mà nhà phát triển đã cài đặt cho mô hình AI. Điều này khiến mô hình AI thực hiện hoặc tiết lộ những nội dung mà bình thường nó sẽ từ chối.
Cuối tháng 6, Bộ Thương mại Mỹ dỡ bỏ một phần hạn chế, cho phép Anthropic khôi phục quyền truy cập Claude Mythos 5 cho một số tổ chức và đối tác đã được thẩm định trước.
Đầu tháng 7, Bộ Thương mại Mỹ dỡ bỏ lệnh kiểm soát xuất khẩu với Claude Fable 5 và Mythos 5, cho phép Anthropic khôi phục việc triển khai hai mô hình này. Động thái đó diễn ra sau khi Anthropic và Bộ Thương mại Mỹ thống nhất các biện pháp bảo mật bổ sung.
ByteDance hướng tới mô hình AI có quy mô lớn nhất
Theo nhiều người trong ngành, nhiều phòng thí nghiệm AI Trung Quốc đang huấn luyện các mô hình có quy mô tương đương Claude Fable 5. Tuy nhiên, ByteDance là công ty tham vọng nhất khi hướng tới mô hình AI có quy mô lớn nhất.
Khác với nhiều đối thủ Trung Quốc thường công bố mô hình trọng số mở, ByteDance khá kín tiếng trong chiến lược AI vì phần lớn các mô hình của hãng đều là nguồn đóng.
Dù vậy, mô hình AI tạo video SeeDance của ByteDance hiện được đánh giá nằm trong nhóm tiên tiến nhất thế giới. Trong khi đó, Doubao của ByteDance là ứng dụng AI phổ biến nhất Trung Quốc với 324 triệu người dùng hoạt động hằng tháng.
Trong ba năm qua, ByteDance được cho là đầu tư mạnh tay vào AI hơn bất kì tập đoàn công nghệ lớn nào của Trung Quốc. Công ty liên tục mở rộng hệ thống trung tâm dữ liệu, tuyển dụng các nhà nghiên cứu AI và tăng tốc phát triển Volcano Engine, nền tảng điện toán đám mây chuyên cung cấp giải pháp AI cho doanh nghiệp.
ByteDance cũng đang theo đuổi tham vọng tự phát triển chip AI.
Seed là đội ngũ phát triển mô hình AI của ByteDance, do Wu Yonghui (cựu nhà khoa học Google DeepMind) lãnh đạo. Seed hiện có khoảng 2.000 thành viên tại Trung Quốc và nhiều quốc gia khác, gồm các nhà nghiên cứu cốt lõi, kỹ sư hạ tầng, đội ngũ gán nhãn dữ liệu và chuyên gia ngôn ngữ.
ByteDance không dùng kỹ thuật chưng cất mô hình AI
Theo nguồn tin của FT, Seed theo đuổi hướng phát triển độc lập, không sử dụng kỹ thuật chưng cất từ các mô hình AI của đối thủ. Chiến lược này đã được áp dụng hơn một năm qua và được cho là khiến tiến độ phát triển của ByteDance chậm hơn một số đối thủ.
Chưng cất là kỹ thuật huấn luyện mô hình AI nhỏ hơn bằng cách học lại kiến thức và đầu ra của mô hình lớn hơn, giúp giảm chi phí tính toán và tăng tốc triển khai.
Ban lãnh đạo ByteDance, đứng đầu là nhà sáng lập Zhang Yiming (Trương Nhất Minh), tin rằng chỉ có tự nghiên cứu và phát triển mới có thể tạo ra mô hình AI vượt trội hơn các đối thủ.
Tại cuộc họp nội bộ cách đây hai tuần, Trương Nhất Minh đã nhấn mạnh với đội ngũ Seed rằng mục tiêu dài hạn phải là xây dựng "mô hình AI có năng lực hàng đầu thế giới", thay vì quá lo lắng về việc tạm thời tụt lại phía sau trong ngắn hạn.
LatePost và The Information là trang tin công nghệ đầu tiên đưa tin về các phát biểu này của Trương Nhất Minh trong cuộc họp nội bộ.
Phát hiện quy luật mở rộng mới với tác tử
Đầu tháng 7, nhóm Seed của ByteDance công bố đã phát hiện một quy luật mở rộng mới với tác tử - hệ thống AI có thể tự thực hiện nhiều bước để hoàn thành nhiệm vụ.
Theo nghiên cứu, tốc độ của tác tử AI cải thiện năng lực không chỉ phụ thuộc vào quy mô mô hình hay lượng dữ liệu huấn luyện, mà còn tuân theo quy luật toán học khi AI dạng này liên tục thực hiện các tác vụ thực tế và học từ chính trải nghiệm đó.
Nói cách khác, AI có thể tiếp tục tiến bộ bằng cách làm việc để học, thay vì chỉ học từ dữ liệu có sẵn.
Những điểm chính của quy luật mới gồm:
Hiệu năng của tác tử AI tăng theo quy luật có thể dự đoán được khi tăng số lượng tác vụ thực tế mà nó thực hiện.
Việc mở rộng số lượng trải nghiệm thực tế (thay vì chỉ mở rộng dữ liệu huấn luyện hoặc số tham số) giúp AI tiếp tục cải thiện năng lực.
Điều này mở ra một hướng phát triển mới khi quy luật mở rộng truyền thống (tăng dữ liệu, sức mạnh tính toán và số tham số) đang dần cho thấy hiệu quả giảm sút và chi phí ngày càng cao.
Nghiên cứu được nhiều chuyên gia chú ý vì gợi ý rằng trải nghiệm có thể trở thành nguồn tài nguyên mới để huấn luyện AI, tương tự cách con người học hỏi thông qua thực hành.
Nếu quy luật này tiếp tục được xác nhận, các công ty AI có thể chuyển trọng tâm từ việc chỉ xây dựng mô hình lớn hơn sang phát triển những tác tử AI có khả năng tự tương tác với thế giới, tự thử nghiệm và tự tích lũy kinh nghiệm.
Đây cũng là một trong những lý do ByteDance đang đầu tư mạnh vào các tác tử AI và phát triển mô hình khổng lồ có thể tới 10.000 tỉ tham số, với tham vọng cạnh tranh trực tiếp với các công ty AI hàng đầu Mỹ như Anthropic, OpenAI và Google.