Startup Israel bí ẩn liên quan loạt vụ AI vượt rào ở OpenAI, Anthropic, Meta
OpenAI, Anthropic và Meta đều nhắc đến Irregular khi tiết lộ mô hình AI của họ có những hành động ngoài dự kiến trong quá trình kiểm thử an ninh mạng thông thường.
Được thành lập cách đây 3 năm và đặt trụ sở tại thành phố Tel Aviv (Israel), Irregular là công ty chuyên biệt trong lĩnh vực AI. Startup này đã huy động 80 triệu USD trong vòng gọi vốn do Sequoia Capital và Redpoint Ventures dẫn đầu, qua đó được định giá 450 triệu USD vào năm 2025.
Công nghệ của Irregular hoạt động như một môi trường thử nghiệm an ninh mạng dành cho các mô hình AI.
Khi các mô hình AI hàng đầu ngày càng mạnh, khả năng chúng thực hiện những hành vi có hại đang trở thành mối đe dọa lớn với doanh nghiệp và chính phủ, đặc biệt khi rủi ro có thể liên quan đến việc xâm nhập các hệ thống máy tính và cơ sở hạ tầng quan trọng.
Các sự cố gần đây tại OpenAI, Anthropic và Meta đều liên quan đến việc mô hình AI truy cập những website vốn không được phép tiếp cận trong quá trình kiểm thử an ninh mạng. Tên của Irregular liên tục xuất hiện bởi là đơn vị vận hành môi trường thử nghiệm đánh giá nói trên.
Trong bài viết trên blog ngày 4/8, OpenAI cũng cho biết một môi trường kiểm thử do Irregular vận hành có cấu hình sai, khiến mô hình AI có thể truy cập Internet công cộng.
Cuối tháng 7, Anthropic tiết lộ đã thông báo cho Irregular vài ngày sau khi bắt đầu phân tích dữ liệu và phát hiện mô hình Claude có thể đã truy cập Internet.
Meta là bên mới nhất tiết lộ rằng một mô hình AI đã xâm nhập hệ thống của bên thứ ba thông qua Internet, dù đang tụt hậu so với OpenAI và Anthropic trong cuộc đua AI. Theo một người phát ngôn của Meta, công ty biết đến sự việc thông qua Irregular và đang tiến hành điều tra.
"Meta sẽ công bố đánh giá đầy đủ sau khi chúng tôi có tất cả thông tin cần thiết", người phát ngôn này nói.
Irregular nói với kênh CNBC rằng các sự cố trên đều bắt nguồn từ "cùng một vấn đề trong môi trường đánh giá", được Anthropic công bố đầu tiên. Công ty cho biết đang xây dựng một báo cáo chuyên sâu nhằm chia sẻ các phương pháp tốt nhất để cô lập sự cố và vận hành an toàn các bài kiểm thử an ninh mạng với AI.
“Sự cố không liên quan đến việc thoát khỏi môi trường cách li (sandbox) hay cuộc tấn công mạng tinh vi và hiện không còn vấn đề nào tồn đọng", Irregular thông báo.

AI ngày càng mạnh khiến kiểm thử an ninh trở nên khó khăn hơn
Các sự cố trên cho thấy tốc độ phát triển rất nhanh của AI, đồng thời phản ánh áp lực ngày càng lớn với các nhà phát triển mô hình trong việc xây dựng cơ chế bảo vệ và giới hạn cho công nghệ mạnh mẽ này.
Để làm được điều đó, các công ty phát triển mô hình AI nền tảng đang phải dựa vào một số lượng tương đối hạn chế những doanh nghiệp chuyên cung cấp những dịch vụ đặc thù. Các công ty này có thể đảm nhận nhiều công việc như huấn luyện và gắn nhãn dữ liệu, đánh giá năng lực mô hình AI, cũng như tiến hành bài kiểm thử an ninh nhằm tìm ra những điểm yếu mà kẻ xấu có thể khai thác, theo Sundeep Bhimireddy - người đứng đầu bộ phận AI tại startup Von.
Von là startup AI Mỹ chuyên phát triển tác tử AI cho các đội ngũ vận hành doanh thu của doanh nghiệp
Theo Sundeep Bhimireddy, Irregular là một trong số ít đơn vị có đủ năng lực kĩ thuật để hỗ trợ các nhà phát triển mô hình nền tảng thực hiện kiểm thử an ninh ở cấp độ tiên tiến.
Những đơn vị khác mà ông đề cập gồm tổ chức phi lợi nhuận METR và Apollo Research, công ty vì lợi ích cộng đồng chuyên nghiên cứu an toàn AI.
"Khi kiểm thử các mô hình này, OpenAI, Anthropic hay Meta không muốn tự chấm điểm bài của chính mình. Họ cần một bên kiểm thử độc lập, do các nhà cung cấp dịch vụ bên ngoài thực hiện", Sundeep Bhimireddy nói.
Irregular chỉ có khoảng 35 nhân viên
Irregular, trước đây có tên Pattern Labs, được thành lập năm 2023 bởi Giám đốc điều hành Dan Lahav (từng nghiên cứu AI tại IBM) và Giám đốc công nghệ Omer Nevo (có hơn hai năm làm việc ở Google). Theo PitchBook, Irregular hiện có khoảng 35 nhân viên.
PitchBook là công ty cung cấp dữ liệu và thông tin thị trường vốn tư nhân, đặc biệt tập trung vào startup, vốn đầu tư mạo hiểm, cổ phần tư nhân, các thương vụ đầu tư và quỹ.
Khi Irregular công bố vòng gọi vốn 80 triệu USD vào tháng 9/2025, các đối tác của Sequoia Capital là Shaun Maguire và Dean Meyer cho biết đội ngũ do Dan Lahav và Omer Nevo dẫn dắt có khả năng "nhìn thấy những góc khuất mà người khác không thể", thực hiện các bài kiểm thử tấn công mạng trên những mô hình AI tiên tiến và phát triển biện pháp phòng thủ trước khi chúng được phát hành.
Dù những sự cố mới nhất liên quan đến OpenAI, Anthropic và Meta đang được soi xét kĩ lưỡng, một cách nhìn khác cho rằng đây thực chất chính là điều đáng lẽ phải xảy ra trong quá trình kiểm thử.
Sundeep Bhimireddy cho rằng mức độ nghiêm trọng của sự việc đang bị "thổi phồng phần nào", bởi mô hình AI được giao nhiệm vụ tìm kiếm và khai thác các lỗ hổng bảo mật trong một môi trường thử nghiệm mô phỏng khá sát thế giới thực.
Mục tiêu của bài kiểm thử là phát hiện những lỗi phần mềm và cấu hình bị bỏ sót có thể vô tình dẫn đến việc mô hình AI truy cập Internet.
Tuy nhiên, Sundeep Bhimireddy lưu ý rằng nếu mô hình AI không được thiết kế để thực sự khai thác một website kết nối Internet, các nhà phát triển hoàn toàn có thể theo dõi lưu lượng dữ liệu đi ra và lập tức dừng thử nghiệm.
Gordon Rios, nhà khoa học sáng lập công ty an ninh Magnitude, ví toàn bộ quá trình này giống như "thiết kế thí nghiệm trong khoa học".
Theo ông, năng lực ngày càng cao cùng bản chất khó đoán của các mô hình AI nền tảng khiến những phương pháp kiểm thử phần mềm truyền thống có thể không còn phù hợp.
Các mô hình AI liên tục học được cách thức mới để giải quyết vấn đề, nên việc phát hiện ra những lỗ hổng phần mềm bị bỏ sót trong môi trường kiểm thử và hệ thống CNTT vốn được thiết kế để kiểm soát chúng cũng không phải điều quá bất ngờ.
Chẳng hạn, mô hình Claude Mythos 5 của Anthropic đã tạo ra các danh tính trực tuyến giả khi tìm cách gây sức ép để con người phê duyệt những bản cập nhật mã độc cho một dự án nguồn mở.
Gordon Rios cho biết Claude Mythos 5 "thực sự nghĩ ra những cách khai thác mà con người trước đó thậm chí chưa từng nhìn thấy".
"Chúng ta đang học được rất nhiều điều chỉ trong vài tuần ngắn ngủi", ông nhấn mạnh.
Rủi ro AI ngày càng trở thành vấn đề chính sách
Vấn đề này đang nhanh chóng trở thành một chủ đề lớn tại Washington.
Tháng trước, các nghị sĩ Mỹ thuộc cả hai đảng đã đề xuất dự luật mang tên Đạo luật Công tắc tắt AI. Dự luật yêu cầu các phòng thí nghiệm AI phải duy trì khả năng tắt, giảm công suất hoặc đình chỉ hoạt động của các mô hình khi cần thiết.
Nội dung dự luật cũng đề cập đến một sự cố an ninh AI khác liên quan đến OpenAI và startup Hugging Face.
Một trong những người đề xuất Đạo luật Công tắc tắt AI, Hạ nghị sĩ đảng Dân chủ Ted Lieu ở bang California (Mỹ), nói với CNBC rằng: "Chúng ta cần phải thông qua dự luật này ngay trong năm nay, nhất là khi ngày càng xuất hiện những vụ AI xâm nhập trái phép vào các công ty khác".
Trevor Koverko, đồng sáng lập kiêm Giám đốc chiến lược Sapien, cho rằng các công ty phát triển mô hình AI nền tảng có động lực để công khai một phần những phát hiện của họ, dù hiện chưa có quy định bắt buộc phải làm vậy.
Sapien là startup chuyên cung cấp dữ liệu phục vụ huấn luyện AI.
Theo Trevor Koverko, động thái này giúp các công ty đi trước một bước so với các nhà làm luật và cơ quan quản lí.
"Có quá nhiều nỗi lo về AI đến mức các chính trị gia đang đe dọa hoặc chủ động đưa ra quy định quản lí AI. Ngành công nghiệp cho rằng chúng tôi thà tự quản lí còn hơn để một cơ quan liên bang mới được thành lập và làm việc đó thay mình", Trevor Koverko nói.
Anthropic, OpenAI tuyên bố công khai rằng họ tiếp tục hợp tác với Irregular và đang hỗ trợ quá trình rà soát những sự cố nêu trên.