Nhịp đập công nghệ

AI có giá tính bằng… cốc cà phê: Tiềm năng to lớn

Minh Trí 31/07/2026 10:54

Nhà phát triển Slava S. (tài khoản slvDev trên GitHub) đã chạy thành công mô hình AI có 28,9 triệu tham số trên bộ vi điều khiển có giá khoảng 8 USD (hơn 200.000 VND), tương đương 5-7 cốc cà phê ở Việt Nam.

Mô hình không cần Internet, server hay đám mây. Nhưng câu chuyện thú vị nằm ở tiềm năng ẩn chứa sau dự án nhỏ này. Nếu 8 USD đã đủ cho một mô hình AI chuyên biệt, mô hình kinh doanh xoay quanh những trung tâm dữ liệu tỉ đô sẽ bị ảnh hưởng thế nào?

“Lạc đà” chui được qua “lỗ kim”

Để hiểu vì sao dự án của Slava S. gây chú ý, cần hiểu những rào cản mà nó vượt qua thành công.

Vi điều khiển ESP32-S3 có 512 KB bộ nhớ SRAM, ít hơn dung lượng một bức ảnh chụp từ điện thoại. Trước dự án này, mô hình ngôn ngữ lớn nhất từng chạy trên dòng chip này chỉ có 260.000 tham số, do nhà phát triển DaveBben thực hiện vào tháng 9/2024 bằng bộ khung llama2.c của Andrej Karpathy. Con số 28,9 triệu của Slava S. nhiều hơn gấp 100 lần.

ai-ca-phe.jpg
Ảnh minh họa: Internet

Bí quyết nằm ở cách chia nhỏ gánh nặng. Slava S. mượn kỹ thuật Per-Layer Embeddings từ dòng Gemma 3n và Gemma 4 của Google, rồi đưa xuống vi điều khiển. Thay vì nhồi toàn bộ mô hình vào RAM, Slava S. để 25 triệu tham số nhúng trong bộ nhớ flash 16 MB, tốc độ đọc chậm nhưng rẻ và dung lượng lớn.

Mỗi lần sinh một token, mô hình chỉ cần đọc khoảng 6 hàng từ bảng này, tương đương 450 byte. Phần lõi thực sự làm nhiệm vụ "suy nghĩ" chỉ chiếm một phần rất nhỏ so với tổng mô hình, nằm vừa vặn trong SRAM.

Kết quả là một mô hình 14,9 MB sau lượng tử hóa 4-bit, chạy ở tốc độ 9,5 token mỗi giây, tự viết được những câu chuyện ngắn trên tập dữ liệu TinyStories của Microsoft Research.

Mô hình không trả lời câu hỏi, viết code, hay làm các tác vụ phức tạp khác. Tác giả thừa nhận ưu tiên chỉ là chứng minh việc nhét kiến trúc lớn vào chip nhỏ.

Mô hình 8 USD so với 8 tỉ USD

Để vận hành ChatGPT, OpenAI chi hàng tỉ USD cho trung tâm dữ liệu, GPU và điện năng. Theo ResearchAndMarkets, thị trường chip suy luận AI ước tính đạt khoảng 20 tỉ đô la trong năm 2026 và còn đang tăng nhanh.

Những con số này phản ánh một giả định đã thống trị ngành AI suốt nửa thập kỷ qua. Đó là mô hình thông minh thì phải đồ sộ và tốn kém. Người dùng sẽ trả phí để truy cập chúng qua internet.

Nhưng giả định đó đang bị tấn công từ hai phía. Phía thứ nhất đến từ Trung Quốc. Từ "địa chấn" DeepSeek tới nay, Trung Quốc tung ra các mô hình rẻ hơn 20 đến 50 lần so với đối thủ Mỹ, nhưng có hiệu suất tương đương.

Phía thứ hai đến từ chính những mô hình nhỏ. Một nghiên cứu được trình bày tại hội thảo AAAI 2026 cho thấy mô hình 350 triệu tham số đạt tỉ lệ hoàn thành tác vụ lên tới 77% trong bài kiểm tra trên ToolBench. Trong khi đó, ChatGPT chỉ đạt 26%. Trên bài phân loại văn bản đơn giản, mô hình nửa tỉ tham số đạt 91,7%, vượt mô hình 72 tỉ tham số (88,6%). Theo khảo sát của Hyperscience và Harris Poll trên 503 lãnh đạo doanh nghiệp công nghệ - thông tin tại Mỹ, 75% đồng ý rằng mô hình nhỏ chuyên biệt vượt trội mô hình lớn về tốc độ, độ chính xác và lợi tức đầu tư.

Mô hình 8 USD của Slava S. đẩy logic này đến cực hạn, không chỉ rẻ hơn mà hoàn toàn miễn phí về chi phí vận hành. Mô hình không cần thuê server, không trả phí API, không kết nối internet. Sau khi mua chip, chi phí biên cho mỗi token sinh ra gần như bằng không.

Mark Zuckerberg nhìn thấy xu hướng này sớm. Tại hội nghị LlamaCon vào tháng 4/2025, ông nói về ý tưởng xây dựng những "nhà máy chưng cất", nơi mô hình khổng lồ như Llama được nén thành các mô hình chuyên biệt, giữ lại phần lớn trí thông minh nhưng rẻ hơn và dễ triển khai hơn. CEO Microsoft Satya Nadella cũng nói về tương lai mà từ chuỗi bán lẻ đến bệnh viện cũng sẽ có mô hình AI riêng để phục vụ đúng nghiệp vụ.

Khi AI không cần Internet

Nếu giá thành là một nửa câu chuyện, thì nửa còn lại là chuyện hoạt động mà không cần mạng.

Phần lớn ứng dụng AI hiện tại đều yêu cầu người dùng gửi dữ liệu lên đám mây. Mô hình xử lí tác vụ trên server, rồi trả kết quả. Mô hình này hoạt động tốt ở thành phố lớn có băng thông Internet ổn định. Nhưng trên thực tế, phần lớn thế giới không sống trong điều kiện đó.

Một cảm biến nông nghiệp giữa cánh đồng lúa ở Đồng bằng sông Cửu Long không có Wi-Fi. Một thiết bị giám sát sức khỏe trên tàu cá ngoài khơi Biển Đông không có sóng điện thoại. Một hệ thống cảnh báo sớm trong nhà máy ở khu công nghiệp mất điện hay Internet vẫn cần hoạt động.

Nhạy cảm hơn nữa, trong lĩnh vực quốc phòng, việc gửi dữ liệu qua mạng Internet không chỉ bất tiện mà còn là rủi ro an ninh. Đó là lý do quân đội Mỹ đang triển khai các hệ thống hoàn toàn “đóng” như EdgeRunner AI và Defense Llama của Scale AI trên mạng nội bộ.

Với những mô hình như của Slava S., bài toán "AI ở nơi không có mạng" bắt đầu có lời giải khả thi về mặt kinh tế. ABI Research dự báo 2,5 tỉ thiết bị tích hợp TinyML sẽ được xuất xưởng vào năm 2030. Texas Instruments vào tháng 3/2026 đã ra mắt hai dòng vi điều khiển mới tích hợp NPU (bộ xử lý thần kinh), giảm độ trễ suy luận tới 90 lần và năng lượng tiêu thụ tới 120 lần so với xử lý bằng phần mềm thuần. Qualcomm đẩy NPU trên Snapdragon 8 Gen 5 lên 70 token/giây cho LLM lượng tử hóa. Đây là những công nghệ sẽ hiện thực hóa trợ lí AI không cần Internet.

Công nghệ đã không còn là thí nghiệm. Nó đang trở thành sản phẩm và các cơ hội đang mở ra. Khi AI đủ nhỏ để chạy trên chip giới hạn tài nguyên, cuộc chơi không còn thuộc riêng về những ai có nhiều tiền nhất, mà thuộc về những ai biết đặt đúng bài toán để giải.

Minh Trí