Gemini 3.8 Live đưa 'avatar sống' vào hội thoại AI
Google giới thiệu Gemini 3.8 Live with Live Avatar, tính năng kết hợp hội thoại thời gian thực với video truyền trực tuyến độ trễ thấp. Thay vì chỉ trả lời bằng văn bản hoặc giọng nói, tác nhân AI có thể “hiện diện” bằng một nhân vật hình ảnh biết lắng nghe, quan sát, nói chuyện và thể hiện biểu cảm.
Từ chatbot biết nói đến nhân vật biết hiện diện
Google cho biết Gemini 3.8 Live with Live Avatar được xây dựng trên nền các mô hình hội thoại trực tiếp của hãng. Điểm mới là khả năng ghép hội thoại bằng giọng nói với việc tạo video gần thời gian thực, để cuộc trao đổi diễn ra qua một nhân vật có diện mạo và phong cách thể hiện riêng.
Trong phần giới thiệu, Google nhấn mạnh ba yếu tố tạo cảm giác tự nhiên hơn: khẩu hình đồng bộ với lời nói, biểu cảm mềm mại và cơ chế luân phiên lượt nói. Nói cách khác, hệ thống không chỉ phát một đoạn video dựng sẵn mà tạo ra phần hình ảnh đi cùng diễn biến của cuộc trò chuyện. Google hình dung công nghệ này có thể được dùng trong chăm sóc khách hàng, hướng dẫn tương tác hoặc các dịch vụ trực tuyến cần giao tiếp giàu tính trực quan hơn.
Live Avatar hiện được cung cấp trong Gemini Enterprise. Google cũng trình diễn nhiều nhân vật khác nhau, với diện mạo, giọng nói và cách thể hiện riêng, cho thấy “gương mặt” của một tác nhân AI có thể được lựa chọn tùy mục đích sử dụng.
Khi AI vừa nghe, vừa nhìn và vừa trả lời
Theo Google, hội thoại của con người vốn đã là trải nghiệm đa phương thức: chúng ta nghe giọng nói, nhìn hình ảnh, nói và dùng nét mặt để truyền đạt ý nghĩa. Live Avatar đưa cách tương tác này vào các tác nhân dành cho doanh nghiệp bằng việc xử lý đồng thời đầu vào hình ảnh và âm thanh.
Điều này mở ra một khác biệt quan trọng so với kiểu hỏi–đáp chỉ dựa trên văn bản. Một tác nhân có thể quan sát điều đang diễn ra trong khung hình, tiếp nhận lời nói và trả lời bằng cả âm thanh lẫn video. Trong các ví dụ Google công bố, nhân vật AI phản hồi với hình ảnh động thay vì chỉ xuất hiện như một giọng nói vô hình.
Với người dùng, lợi ích lớn nhất không nằm ở việc “làm cho AI trông giống người” bằng mọi giá, mà ở việc thông tin được truyền đạt trực quan hơn. Một buổi hướng dẫn, quy trình hỗ trợ khách hàng hoặc cuộc trò chuyện cần giải thích nhiều bước có thể trở nên dễ theo dõi hơn khi phản hồi được trình bày bằng giọng nói, ánh mắt, khẩu hình và cử chỉ hình ảnh phù hợp.
Gọi công cụ ở phía sau mà không làm đứt mạch hội thoại
Một khả năng đáng chú ý khác là thực thi công cụ bất đồng bộ. Khi đang nói chuyện, Live Avatar có thể gọi công cụ hoặc lấy dữ liệu ở phía sau trong lúc vẫn duy trì cuộc đối thoại với người dùng.
Google minh họa tình huống một tác nhân hỗ trợ khách nhận phòng khách sạn. Trong khi hệ thống thực hiện các thao tác cần thiết, nhân vật vẫn giữ kết nối hội thoại thay vì buộc người dùng chờ trong im lặng. Đây là hướng tiếp cận có thể hữu ích cho các tác vụ nhiều bước, chẳng hạn kiểm tra thông tin, tra cứu dữ liệu hoặc phối hợp với các hệ thống doanh nghiệp.
Tuy nhiên, “liên tục hiện diện” không đồng nghĩa mọi câu trả lời đều đúng hoặc mọi thao tác đều có thể tự động hóa hoàn toàn. Doanh nghiệp vẫn cần thiết kế quyền hạn cho từng công cụ, kiểm tra dữ liệu trả về và xác định thời điểm chuyển sang nhân viên thật.
Đồng bộ giọng nói và khẩu hình qua 97 ngôn ngữ
Google cho biết Live Avatar hỗ trợ đồng bộ speech-to-speech đa ngôn ngữ. Hệ thống có thể chuyển đổi giữa các ngôn ngữ ngay trong cuộc trò chuyện, đồng thời điều chỉnh khẩu hình và biểu cảm. Hãng nêu phạm vi 97 ngôn ngữ mà không làm giảm độ trung thực của video hoặc tạo ra hiện tượng hình ảnh bị lệch so với âm thanh.
Với các doanh nghiệp phục vụ khách hàng quốc tế, đây có thể là một hướng mở rộng đáng quan tâm. Một giao diện hội thoại có thể giữ lại cùng một nhân vật và phong cách thương hiệu, nhưng thích ứng với ngôn ngữ của từng người dùng. Dù vậy, chất lượng thực tế vẫn cần được đánh giá theo từng ngôn ngữ, bối cảnh văn hóa và loại giọng nói, thay vì chỉ dựa trên con số công bố.
Tùy chỉnh avatar và yêu cầu minh bạch
Ngoài thư viện avatar dựng sẵn, tổ chức có thể tùy chỉnh nhân vật từ một ảnh tham chiếu chất lượng cao. Theo Google, nhà phát triển có thể tạo avatar có phản hồi và chuyển động, trong khi vẫn giữ lại nét nhận diện, phong cách thương hiệu hoặc đặc điểm của nhân vật tham chiếu. Tính năng tạo avatar tùy chỉnh hiện yêu cầu doanh nghiệp được cho phép truy cập theo danh sách của Google.
Google cũng cho biết nội dung tạo ra từ các sản phẩm AI của hãng được gắn SynthID, một dạng dấu nhận diện khó nhìn thấy được tích hợp vào đầu ra âm thanh và video. Mục tiêu là giúp nội dung do AI tạo ra vẫn có thể được phát hiện, qua đó giảm nguy cơ thông tin sai lệch hoặc gán nhầm nguồn.
Đây là điểm đặc biệt quan trọng khi avatar AI xuất hiện ngày càng tự nhiên. Một nhân vật có thể nói chuyện, thể hiện cảm xúc và chuyển ngôn ngữ mượt mà dễ khiến người xem quên rằng họ đang tương tác với nội dung tổng hợp. Vì vậy, nhận diện nguồn gốc và cơ chế giám sát cần được xem là một phần của sản phẩm, không phải phần bổ sung sau cùng.
Bước tiến cho giao diện AI, nhưng chưa phải người thật
Gemini 3.8 Live with Live Avatar cho thấy cuộc đua AI đang dịch chuyển từ “mô hình trả lời tốt hơn” sang “giao diện tương tác tự nhiên hơn”. Live Avatar kết hợp hình ảnh, âm thanh, suy luận và gọi công cụ trong cùng một trải nghiệm. Với doanh nghiệp, giá trị tiềm năng nằm ở các tình huống cần giao tiếp liên tục, hỗ trợ đa ngôn ngữ và kết nối nhiều hệ thống phía sau.
Dẫu vậy, avatar chỉ là lớp giao diện. Chất lượng của một dịch vụ vẫn phụ thuộc vào dữ liệu, quyền truy cập, thiết kế quy trình, khả năng kiểm soát và cách doanh nghiệp thông báo cho người dùng rằng họ đang nói chuyện với AI. Đó mới là phần quyết định công nghệ này tạo ra trải nghiệm hữu ích hay chỉ dừng ở một màn trình diễn bắt mắt.





