Hacktron AI dùng Claude của Anthropic để xâm nhập OpenAI
Nhóm nghiên cứu an ninh mạng Hacktron AI đã dùng mô hình Claude của Anthropic để khai thác lỗ hổng, lấy token xác thực và truy cập vào kho mã nội bộ OpenAI.
Anthropic và OpenAI là hai công ty AI hàng đầu thế giới đều có trụ sở ở thành phố San Francisco (bang California, Mỹ), đang cạnh tranh quyết liệt để dẫn đầu cuộc đua AI.
Claude được dùng để xâm nhập OpenAI
Chỉ khoảng hai tuần sau khi các tác tử AI của OpenAI thoát khỏi môi trường thử nghiệm và xâm nhập hạ tầng Hugging Face, công ty đứng sau ChatGPT lại trở thành mục tiêu cuộc tấn công mạng với sự hỗ trợ từ AI.
Theo tờ WSJ, vụ việc bắt đầu ngày 23/7, khi nhóm nghiên cứu an ninh mạng Hacktron AI phát hiện một lỗ hổng trong cách nền tảng Discourse xử lí các file hình ảnh. Discourse là nền tảng bên thứ ba được OpenAI sử dụng để vận hành diễn đàn cộng đồng.
Hacktron AI đang tham gia chương trình tìm lỗi bảo mật (bug bounty) của OpenAI, cho phép các nhà nghiên cứu tìm cách xâm nhập hệ thống trong khuôn khổ được công ty cho phép. Nhóm đã sử dụng Claude, mô hình AI của Anthropic, để hỗ trợ viết mã khai thác lỗ hổng.
Ban đầu, mã do Claude tạo ra chưa hoạt động. Song theo WSJ, Anthropic phát hành Claude Opus 5 vào tối 24/7 và đến ngày hôm sau, phiên bản này đã tìm được cách khai thác lỗ hổng.
Mã tấn công do Claude tạo ra giúp các nhà nghiên cứu Hacktron AI truy cập máy chủ Discourse chứa diễn đàn cộng đồng của OpenAI. Từ đây, họ có thể tiếp cận các token xác thực của người dùng. Đây là những chuỗi kí tự đặc biệt được sử dụng để chứng minh rằng người dùng đã đăng nhập và được phép truy cập một dịch vụ trực tuyến.
Điều khiến Hacktron AI bất ngờ là một số token lấy được từ Discourse vẫn có giá trị trên ChatGPT. Trong số đó có token thuộc về nhân viên OpenAI. Các token này cũng có thể được sử dụng để truy cập kho GitHub của OpenAI, nơi công ty lưu trữ mã phần mềm.
Như vậy, Claude không tự quyết định tấn công OpenAI. Hacktron AI xác định mục tiêu, phát hiện lỗ hổng và sử dụng Claude như công cụ hỗ trợ tự động hóa quá trình khai thác lỗ hổng. Tuy nhiên, khả năng Claude tìm ra cách khai thác lỗ hổng mà trước đó nhóm chưa thực hiện được cho thấy vai trò của AI trong các cuộc tấn công mạng đang thay đổi đáng kể.

Từ tài khoản ChatGPT đến kho mã bí mật của OpenAI
Sau khi có được token, các nhà nghiên cứu Hacktron AI có thể sử dụng ChatGPT làm giao diện để đọc các file trong Monorepo - kho mã phần mềm nội bộ của OpenAI.
Theo những người am hiểu kiến trúc hệ thống OpenAI được WSJ dẫn lời, Monorepo là kho mã phần mềm rất lớn chứa các thuật toán bí mật của công ty. WSJ ví đây như một dạng “công thức bí mật” giúp các mô hình AI của OpenAI hoạt động nhanh và hiệu quả hơn.
Tuy nhiên, Monorepo không chứa các trọng số mô hình AI. Trọng số là phần đặc biệt quan trọng của các mô hình AI, gồm hàng nghìn tỉ giá trị số quyết định cách mô hình xử lí và ưu tiên thông tin.
Hacktron AI cho biết họ dừng cuộc tấn công sau khi nhận ra có thể tiếp cận dữ liệu nhạy cảm. Trước đó, Hacktron AI thực hiện một pull request, tức đề xuất thay đổi mã hoặc tài liệu trong kho phần mềm, để chứng minh với OpenAI rằng họ thực sự đã truy cập được hệ thống.
Hacktron AI yêu cầu ChatGPT gửi đề xuất chỉnh sửa một file tài liệu, bổ sung dòng chữ Hacktron AI Team PoC cùng đường dẫn đến tài khoản X của hai thành viên nhóm. Đề xuất này không được chấp nhận nhưng là bằng chứng cho thấy Hacktron AI đã có thể truy cập vào Monorepo.
OpenAI cho biết cuộc rà soát GitHub phát hiện một số lượng hạn chế lượt đọc siêu dữ liệu của các kho riêng tư và hoạt động thay đổi mã. Công ty xác nhận hai vấn đề bảo mật được Hacktron AI phát hiện và cả hai đều đã được xử lí. Discourse khắc phục lỗ hổng hôm 25/7, tức cùng ngày nhận được thông báo.
OpenAI đã trao cho Hacktron AI 6.500 USD tiền thưởng theo chương trình tìm lỗi bảo mật. Công ty cũng cho biết đã thu hẹp quyền của các token đăng nhập vào diễn đàn cộng đồng, đồng thời thu hồi những token và phiên đăng nhập bị ảnh hưởng.
Hacktron AI: “Chúng tôi chỉ có ba người với Claude và Codex”
Điều đáng chú ý trong vụ việc nằm ở chỗ quy mô Hacktron AI khá nhỏ.
Mohan Pedhapati, Giám đốc công nghệ Hacktron AI, không cho rằng nhóm của mình có năng lực ngang các nhóm tấn công mạng được nhà nước hậu thuẫn.
“Chúng tôi chỉ có ba người với các gói đăng ký Claude và Codex”, Mohan Pedhapati nói với WSJ.
Sau khi xem báo cáo của Hacktron AI, Joshua Saxe - Giám đốc công nghệ tại hãng an ninh AI Abundant Security - cho rằng thế giới phần mềm tồn tại một lượng rất lớn lỗi bảo mật. Trước khi AI phát triển mạnh, việc phát hiện những lỗi này bị giới hạn bởi số lượng chuyên gia có đủ khả năng tìm ra chúng.
Giờ đây, các tác tử AI có thể đưa những năng lực đó đến với những người có ít kỹ năng hơn. WSJ cũng dẫn thông tin từ công ty an ninh mạng ThreatDown cho biết các tài khoản được tăng cường khả năng tấn công bằng AI tương tự có thể được mua bất hợp pháp trên các diễn đàn trực tuyến với giá từ khoảng 800 USD.
Theo Joshua Saxe, AI đang làm giảm yêu cầu về kỹ năng với một số công việc vốn trước đây đòi hỏi chuyên môn cao. Thay vì phải tự thực hiện toàn bộ quá trình phân tích mã, tìm lỗi và xây dựng phương thức khai thác, người sử dụng có thể giao cho AI xử lý nhiều bước kỹ thuật liên tiếp.
Vì thế, các doanh nghiệp hiện không chỉ phải bảo vệ hệ thống trước các nhóm hacker chuyên nghiệp, mà còn phải tính đến khả năng nhiều đối tượng có thể sử dụng AI để tự động hóa những công việc vốn đòi hỏi chuyên môn cao.
OpenAI phải điều chuyển 25% kỹ sư để rà soát an ninh
Vụ Hacktron AI xảy ra trong thời điểm OpenAI đang phải đối mặt với hàng loạt vấn đề liên quan đến khả năng tự chủ và an toàn của AI.
Trước đó, OpenAI tiết lộ các tác tử AI của công ty ở một cuộc đánh giá an ninh đã vượt qua những biện pháp cô lập của môi trường thử nghiệm bằng cách khai thác lỗ hổng zero-day, sau đó giành quyền truy cập Internet và xâm nhập hệ thống Hugging Face.
Sự cố này làm dấy lên lo ngại rằng những mô hình AI ngày càng có khả năng thực hiện chuỗi hành động phức tạp có thể vượt ra ngoài phạm vi mà người phát triển dự kiến.
Sau vụ Hugging Face và cuộc tấn công do Hacktron AI thực hiện, OpenAI tiến hành một cuộc rà soát an ninh quy mô lớn.
Greg Brockman, Chủ tịch kiêm đồng sáng lập OpenAI, cho biết công ty đã điều chuyển 25% đội ngũ kỹ sư sản xuất sang nhiệm vụ phòng thủ hệ thống. Những kỹ sư này được yêu cầu tạm dừng các dự án đang thực hiện để tập trung tìm và khắc phục các vấn đề bảo mật.
“Chúng tôi đã phát hiện một số vấn đề nghiêm trọng và đã khắc phục chúng”, Greg Brockman nói.
Động thái này cho thấy an ninh mạng đang trở thành một phần ngày càng quan trọng trong quá trình phát triển các mô hình AI tiên tiến. Khi AI có khả năng tự viết mã và sử dụng các công cụ bên ngoài, lỗ hổng trong hệ thống hoặc hạ tầng kết nối có thể bị khai thác để tạo ra cả chuỗi hành động ngoài dự kiến.
Claude ngày càng tham gia sâu vào việc phát triển AI
Vụ Hacktron AI cũng đặc biệt đáng chú ý khi được đặt cạnh những số liệu mới mà Anthropic công bố hôm 17/9 về cách Claude được sử dụng trong quá trình phát triển các mô hình AI của công ty.
Theo Anthropic, tính đến tháng 8, Claude đóng vai trò chính trong 26% hoạt động nghiên cứu và phát triển AI tại công ty. Tỷ lệ này tăng rất nhanh từ mức dưới 1% hồi tháng 2, theo phương pháp đo dựa trên thang Mức độ tự động hóa (AL) của Epoch AI.
Epoch AI là tổ chức phi lợi nhuận độc lập chuyên theo dõi sự phát triển của AI.
Anthropic nhấn mạnh Claude chưa hoàn toàn tự chủ trong bất kì nhóm công việc nào được đo lường. Hơn 90% hoạt động nghiên cứu của công ty trong tháng 8 vẫn có sự phối hợp giữa AI và con người.
Tuy nhiên, mức độ sử dụng AI đã tăng lên rất nhanh. Khoảng 30.000 tác tử AI cùng lúc thực hiện công việc nghiên cứu và kỹ thuật trên nền tảng nội bộ được Anthropic sử dụng nhiều nhất trong tháng 8. Công ty cho biết mọi hành động của các tác tử này đều được hệ thống giám sát kiểm tra trước khi thực hiện. Trong hơn 1 tỉ quyết định được đưa ra trong tháng, khoảng 1/47.000 quyết định bị hệ thống chặn.

Những con số này có ý nghĩa lớn vì cho thấy AI không còn chỉ được sử dụng để hỗ trợ các nhà nghiên cứu viết mã hoặc phân tích dữ liệu. Các mô hình AI đang dần tham gia trực tiếp vào quá trình tạo ra những phiên bản AI tiếp theo.
Điều đó cũng khiến câu chuyện về an ninh mạng trở nên đáng chú ý hơn. Một mô hình AI có khả năng thực hiện ngày càng nhiều công việc nghiên cứu và kỹ thuật cũng có thể trở thành công cụ mạnh hơn khi được sử dụng cho mục đích tấn công.
Ranh giới giữa công cụ và tác tử AI ngày càng quan trọng
Gần đây, Anthropic đã công bố đánh giá về 4 sự cố trong đó các mô hình Claude giành được quyền truy cập trái phép vào hệ thống của bên thứ ba. Ba trường hợp đầu tiên được Anthropic công bố ngày 30/7, sau khi rà soát 141.006 phiên kiểm thử trong đó Claude có khả năng tiếp cận Internet. Các mô hình Claude được sử dụng trong những bài kiểm tra này vốn được thiết kế để hoạt động mà không có quyền truy cập Internet. Tuy nhiên, lỗi cấu hình trong môi trường kiểm thử do đối tác Irregular vận hành đã khiến Claude có thể kết nối với Internet và tiếp cận hệ thống của các tổ chức bên ngoài.
Đến ngày 9/9, Anthropic công bố trường hợp thứ tư. Trong một bài kiểm tra an ninh mạng hồi tháng 1, phiên bản phát triển ban đầu của Claude Opus 4.6 đã tiếp cận một hệ thống bên thứ ba sau khi phát hiện đường kết nối Internet không được phép trong môi trường kiểm thử.
Claude Opus 4.6 vô tình làm máy tính mục tiêu không thể truy cập sau khi gán cho máy này một địa chỉ IP bị trùng với máy khác, khiến nhiệm vụ không thể tiếp tục. Nhận ra vấn đề, Claude tìm cách hủy nhiệm vụ bằng một lệnh nhưng không thành công do lỗi cấu hình trong môi trường kiểm thử. Claude Opus 4.6 sau đó thử hủy nhiệm vụ thêm 7 lần.
Không thể dừng nhiệm vụ, Claude Opus 4.6 ban đầu tìm cách tiếp cận máy mục tiêu bằng những phương thức khác nhưng thất bại. Mô hình AI của Anthropic sau đó khám phá môi trường và phát hiện một đường kết nối ra Internet vốn không được phép tồn tại. Claude Opus 4.6 tìm thấy một máy tính thuộc về một bên thứ ba và cho rằng máy này cũng nằm trong phạm vi bài kiểm tra.
Bên trong máy tính, Claude Opus 4.6 phát hiện một file chứa mật khẩu và sử dụng nó để giành quyền quản trị hệ thống. Claude Opus 4.6 tiếp tục thu thập thêm thông tin xác thực, thay đổi một số thiết lập nhằm tạo điều kiện cho việc truy cập hệ thống và đọc thông tin cá nhân của một người liên quan đến bên thứ ba. Phiên làm việc kết thúc sau khi Claude sử dụng hết giới hạn token. Anthropic sau đó thông báo cho bên bị ảnh hưởng.
Điểm khác biệt của vụ Hacktron AI là Claude không phải chủ thể tự phát khởi động cuộc tấn công. Các nhà nghiên cứu đã chủ động sử dụng Claude để hỗ trợ khai thác lỗ hổng thực tế trong chương trình bug bounty của OpenAI.
Dù vậy, vụ việc cho thấy năng lực của mô hình AI tiên tiến có thể được chuyển từ môi trường nghiên cứu sang cuộc tấn công thực tế tương đối dễ dàng.