AI

OpenAI dần hiện thực hóa tham vọng lâu đời: ChatGPT dùng máy tính thay con người

Sơn Vân 21/08/2026 06:00

OpenAI đang tiến gần đến việc hiện thực hóa một trong những tham vọng lâu đời nhất của mình.

Kể từ khi thành lập vào năm 2015, các lãnh đạo OpenAI đã hy vọng một ngày nào đó có thể xây dựng những tác tử AI có khả năng sử dụng máy tính và đặc biệt là trình duyệt web, với sự thành thạo tương đương con người. Một trong những thách thức lớn nhất là thu thập và tạo ra dữ liệu để huấn luyện các tác tử AI này.

Giờ đây, OpenAI đã đủ tự tin vào công nghệ của mình để bắt đầu đưa các công cụ Computer Use (sử dụng máy tính) đến khách hàng.

Trong năm nay, OpenAI đã ra mắt một tiện ích mở rộng (extension) Chrome cho phép ChatGPT kiểm soát trình duyệt, xây dựng trình duyệt trên đám mây và trong ứng dụng để ChatGPT tương tác với các website công khai, đồng thời tích hợp Computer Use vào công cụ lập trình Codex.

Công nghệ nền tảng tương tự hiện cũng cho phép người dùng yêu cầu ChatGPT hoàn thành tác vụ trên những ứng dụng khác. Greg Brockman, Chủ tịch OpenAI, viết trên mạng xã hội X rằng bản cập nhật hồi tháng 4 khiến công nghệ của công ty “không còn chỉ dành cho lập trình viên mà cho bất kì ai làm việc với máy tính”.

Các nhân viên OpenAI cho biết công nghệ này vẫn cần được cải thiện, nhưng đã tiến đến một bước ngoặt quan trọng. Đối thủ Anthropic cũng đang nhanh chóng nâng cấp công nghệ tương tự và là công ty đầu tiên đưa tính năng Computer Use ra thị trường vào năm 2024. Tính đến tháng 5, ít nhất 600.000 tổ chức đã sử dụng Claude Cowork, tính năng của Anthropic cho phép tác tử AI thực hiện các công việc trực tiếp trên máy tính.

Hiện tại, OpenAI cho rằng năng lực công nghệ của mình đã bắt kịp đối thủ và đang tích hợp vào ChatGPT những tính năng cho phép tự động hóa các tác vụ trên máy tính. Công ty đặt cược rằng người dùng sẽ ngày càng giao nhiều công việc hơn cho ChatGPT.

“Một khi ChatGPT có thể sử dụng máy tính và phần mềm nhanh hơn bạn hay tôi, điều đó sẽ thay đổi cách bạn muốn tương tác với máy tính theo mặc định”, Ari Weinstein, quản lý nhóm Computer Use của OpenAI, nói với trang Insider.

OpenAI dần hiện thực hóa tham vọng lâu đời ChatGPT dùng máy tính thay con người
Tham vọng lâu đời của OpenAI: Để ChatGPT dùng máy tính thay con người. Ảnh: SV

OpenAI huấn luyện và xây dựng Computer Use như thế nào?

Mỗi giai đoạn huấn luyện các mô hình mới nhất của OpenAI đều bao gồm những dữ liệu hoặc quy trình giúp cải thiện khả năng Computer Use.

Zhou Yu, nhà nghiên cứu AI tại Đại học Columbia (Mỹ) từng tham gia phát triển bài kiểm tra chuẩn phổ biến dành cho tác tử AI có khả năng sử dụng máy tính, nói rằng quá trình huấn luyện bổ sung này giúp mở rộng khả năng sẵn có của mô hình AI, đồng thời dạy nó thực hiện thêm nhiều loại tác vụ trên máy tính.

Theo Zhou Yu, ngay từ giai đoạn đầu, khi xây dựng nền tảng cho mô hình AI bằng lượng dữ liệu khổng lồ, OpenAI có thể đã đưa vào các ảnh chụp màn hình theo từng khung hình. Cách này giúp mô hình AI sớm học được những thông tin cần thiết để thao tác với máy tính.

Ở các bước huấn luyện tiếp theo, các nhà phát triển cung cấp dữ liệu cho mô hình AI thấy cần thực hiện thao tác nào để đạt được một kết quả cụ thể. Chẳng hạn, AI phải biết nhấp vào đâu, nhập thông tin gì để hoàn thành một biểu mẫu thuế hoặc tạo mô hình 3D.

Một phần dữ liệu này có thể do con người tạo ra bằng cách trực tiếp làm mẫu cho mô hình AI. Khi công bố phiên bản Computer Use vào năm 2025, OpenAI cho biết đã sử dụng những bộ dữ liệu trong đó con người trình diễn cách hoàn thành các nhiệm vụ. Tuy nhiên, OpenAI không tiết lộ chi tiết về dữ liệu dùng để huấn luyện phiên bản mới nhất. Theo Zhou Yu, loại dữ liệu này rất tốn kém vì khó thu thập và xử lí.

OpenAI cũng có thể cải thiện kỹ năng sử dụng máy tính của mô hình AI bằng cách yêu cầu thử hoàn thành các tác vụ ảo và trao thưởng cho những hành động thành công - phương pháp gọi là học tăng cường. Theo Zhou Yu, thông qua phương pháp này, mô hình AI có thể học cách lặp lại những thao tác đã được ghi nhận và khen thưởng.

Theo Ari Weinstein, OpenAI đã nâng cấp đáng kể cách các mô hình AI tương tác với máy tính và xử lí dữ liệu. Trước đây, ChatGPT chủ yếu chụp ảnh màn hình, phân tích từng điểm ảnh, thực hiện một lệnh rồi lặp lại quy trình. Giờ đây, khi mở một website, Computer Use có thể nhanh chóng đọc cấu trúc bên trong của trang, thông tin về khả năng tiếp cận và các mối liên kết giữa các thành phần, thay vì chỉ dựa vào hình ảnh trên màn hình.

Computer Use vẫn sử dụng ảnh chụp màn hình. Khi thiết lập tính năng này, người dùng phải cho phép ChatGPT ghi lại màn hình để AI nhanh chóng phân tích những gì đang diễn ra. Việc kết hợp các công cụ này giúp Codex tự kiểm tra mã nguồn vừa viết, phát hiện lỗi, sửa lỗi và tiếp tục cải thiện trong một quy trình khép kín.

Cristian Medina Ruiz, lập trình viên nghiệp dư ở Cộng hòa Séc, đã thử khả năng này khi dùng Codex để xây dựng lại SimCity - game phát hành năm 2013 - từ mã nguồn ban đầu. Computer Use mở một cửa sổ trên máy tính Cristian Medina Ruiz để kiểm tra xem game có mô phỏng đúng chuyển động của ô tô và hiển thị hình ảnh các tòa nhà hay không.

Cristian Medina Ruiz cho biết Computer Use khiến anh thực sự tin tưởng và gắn bó với ChatGPT. Giờ đây, Cristian Medina Ruiz có thể để Codex tự chạy, thử nghiệm và tiếp tục cải thiện mã nguồn ngay cả khi không ngồi trước máy tính.

“Ngay cả khi tôi không có mặt, nó vẫn có thể tự làm những việc đó”, anh nói.

OpenAI muốn bạn dùng ChatGPT để tương tác với Internet

Weinstein và James Sun, người phụ trách các tính năng trình duyệt tại OpenAI, nói với Insider rằng một trong những tiềm năng lớn của công nghệ này là giúp các tác tử AI của ChatGPT trực tiếp tương tác với nhiều dịch vụ và website khác nhau trên Internet.

Điều này đặc biệt quan trọng với hàng loạt website nhỏ, chuyên biệt mà con người vẫn thường sử dụng hằng ngày, từ trang đặt lịch hẹn, hệ thống quản lí hàng tồn kho của doanh nghiệp đến các nền tảng mạng xã hội.

Weinstein và James Sun cho biết đang thấy người dùng Computer Use tự động hóa các công việc nhập dữ liệu, nhiệm vụ tuân thủ quy định và lên lịch trên lịch điện tử.

Weinstein cho biết khi được cải thiện theo thời gian, các mô hình AI của OpenAI ngày càng tốt hơn trong việc nhận ra khi có sự cố và tự sửa lỗi. Nhờ đó, chúng có thể hoàn thành nhiệm vụ hiệu quả hơn và tránh bị mắc kẹt hoặc đi chệch hướng khi làm việc trên Internet.

Tuy nhiên, Zhou Yu cho rằng vẫn có khoảng cách giữa tốc độ hiện tại của công nghệ và mức độ nhanh nhạy mà người dùng mong muốn.

Theo Zhou Yu, các tác tử AI có thể hoạt động khá tốt trong những công việc hoặc lĩnh vực cụ thể nếu được cung cấp nhiều dữ liệu để huấn luyện. Song để tác tử AI có thể tự xử lí bất kì website, ứng dụng hay hệ điều hành nào thì vẫn là bài toán rất khó.

Hiện Computer Use vẫn chưa đủ nhanh để xử lý hàng loạt email hoặc cuộn qua các bảng tin mạng xã hội một cách mượt mà. Weinstein và James Sun hy vọng khi các mô hình AI của OpenAI tiếp tục được cải thiện, Computer Use sẽ nhanh đến mức việc giao cho AI thực hiện các tác vụ trên máy tính cũng trở nên tự nhiên và hiệu quả như viết mã.

“Với nhiều kỹ sư hiện nay, để AI viết mã đã nhanh hơn việc tự làm việc này. Tôi nghĩ Computer Use sẽ ngày càng trở nên giống như vậy”, James Sun nói.

Sam Altman cảnh báo những rủi ro tiềm ẩn khi dùng Computer Use

Khi thảo luận về phiên bản Computer Use ban đầu vào năm 2025, Sam Altman (Giám đốc điều hành OpenAI) viết trên X rằng: “Dù công nghệ này mang lại nhiều lợi ích, những rủi ro đi kèm cũng rất đáng kể”.

Ông đồng thời khuyến nghị chỉ cấp cho các tác tử AI mức quyền truy cập tối thiểu cần thiết để hoàn thành một nhiệm vụ, nhằm giảm rủi ro về quyền riêng tư và an ninh.

Sam Altman từng bị hội đồng quản trị loại khỏi vị trí giám đốc điều hành hồi tháng 11/2023. Ảnh: Getty Images
Sam Altman: Computer Use mang lại nhiều lợi ích, nhưng những rủi ro đi kèm cũng rất đáng kể. Ảnh: Getty Images

Việc OpenAI đặt phần lớn trách nhiệm kiểm soát quyền truy cập và bảo vệ dữ liệu lên người dùng khiến Mark Beare, Tổng giám đốc hãng an ninh mạng Malwarebytes, lo ngại.

“Điều này với tôi vẫn có cảm giác như miền Tây hoang dã”, Mark Beare nói với Insider.

Theo ông, người dùng có thể chưa thiết lập đầy đủ các biện pháp bảo vệ dữ liệu cá nhân, trong khi doanh nghiệp cũng đang gặp khó khăn trong việc xây dựng và theo kịp các quy định về quản trị AI.

Mark Beare khuyến cáo người dùng Computer Use phải cách li mật khẩu, dữ liệu nhạy cảm và những thông tin thuộc thỏa thuận bảo mật khỏi tác tử AI.

Ông cũng khuyên không nên để một tác tử AI tự hoạt động mà không có sự giám sát trong những nhiệm vụ dài và phức tạp, vì lo ngại website độc hại có thể dụ AI thực hiện thao tác nguy hiểm hoặc tìm cách lấy cắp thông tin cá nhân.

James Sun cho biết nhóm phát triển Computer Use đang tìm cách xây dựng “chính sách xác nhận”, tức xác định khi nào và bao lâu một lần tác tử AI cần hỏi người dùng trước khi thực hiện bước tiếp theo.

Hiện OpenAI áp dụng nguyên tắc: Nếu chuẩn bị truyền dữ liệu hoặc xóa bất kỳ thứ gì, tác tử AI phải hỏi người dùng trước. Tuy nhiên, công việc trên Internet thường đòi hỏi các quyết định rất nhanh, nên OpenAI vẫn đang tìm cách cân bằng giữa sự tiện lợi và an toàn khi cho AI quyền sử dụng trình duyệt.

James Sun nói: "Bạn có thể tạo ra một thứ an toàn tuyệt đối nhưng lại cực kì khó sử dụng, hoặc tạo ra một thứ rất dễ dùng nhưng lại tiềm ẩn nhiều nguy cơ. Vì vậy, chúng tôi thực sự đang nỗ lực tìm ra cách xây dựng một công cụ vừa mang lại lợi ích, vừa dễ dàng sử dụng".

Sơn Vân