Văn hóa - Đời sống

Các tác phẩm nghệ thuật không còn an toàn trước thuật toán AI

Bùi Tú 29/08/2026 11:00

Từng được xem là “nơi trú ẩn” của các nghệ sĩ muốn tránh việc tác phẩm nghệ thuật bị Big Tech và các công ty AI khai thác để huấn luyện mô hình, Cara đã thu hút khoảng 1,5 triệu người dùng.

Nhưng trong tháng 8, nền tảng này liên tiếp hứng chịu 3 vụ cào dữ liệu quy mô lớn, phơi bày một thực tế đáng lo là trên internet, gần như không có nền tảng nào có thể bảo đảm tác phẩm nghệ thuật của nghệ sĩ không bị lấy đi.

“Nơi trú ẩn” của tác phẩm nghệ thuật trở thành mục tiêu

Từ đầu năm 2023, nhiếp ảnh gia Jingna Zhang cùng một nhóm tình nguyện viên nhỏ đã dành nhiều công sức duy trì Cara, nền tảng chia sẻ hình ảnh và xây dựng hồ sơ dành cho nghệ sĩ. Điểm khác biệt quan trọng của Cara là nền tảng này chủ động lọc các tác phẩm do AI tạo ra, đồng thời cung cấp những công cụ giúp nghệ sĩ hạn chế nguy cơ tác phẩm bị sử dụng để huấn luyện AI.

nghệ sĩ
Nhiếp ảnh gia Jingna Zhang cùng một nhóm tình nguyện viên nhỏ đã dành nhiều công sức duy trì Cara. Ảnh chụp màn hình

Một trong những lí do khiến Cara nhanh chóng thu hút khoảng 1,5 triệu nghệ sĩ là sự phản đối việc các tác phẩm được sử dụng trái phép để đào tạo mô hình AI. Nhiều nghệ sĩ muốn quảng bá tác phẩm của mình trên internet nhưng không muốn phải đánh đổi quyền kiểm soát tác phẩm cho các nền tảng công nghệ lớn.

Cara cũng tích hợp Glaze, công cụ được phát triển nhằm tạo ra những thay đổi khó nhận biết đối với con người nhưng có thể gây nhiễu quá trình AI bắt chước phong cách nghệ thuật. Tuy nhiên, các biện pháp này chủ yếu nhằm giảm khả năng AI sao chép hoặc bắt chước tác phẩm, chứ không thể ngăn một bên thứ ba thu thập chính những hình ảnh đang được công khai trên internet.

Điểm yếu đó đã bị phơi bày trong tháng 8. Bắt đầu từ ngày 13/8, Cara liên tiếp trở thành mục tiêu của ba vụ cào dữ liệu lớn. Vụ đầu tiên gây chấn động nhất khi một người dùng có tên MandarinDawnPoppy994 công khai trên Reddit một kho dữ liệu 12 TB chứa khoảng 12 triệu tác phẩm từ Cara, gần như toàn bộ thư viện hình ảnh được công khai trên nền tảng.

Theo Zhang, nhóm Cara thậm chí biết chuyện thông qua chính người dùng gắn thẻ tài khoản của nền tảng. Người thực hiện vụ cào dữ liệu còn công khai kho dữ liệu trên Reddit để tìm người cùng khai thác.

Đáng chú ý, người này cho biết toàn bộ quá trình chỉ tốn chưa đến 10 USD và gọi đây đơn giản là một “dự án thú vị”. Đối với Cara, đây không chỉ là vấn đề kĩ thuật. Zhang cho rằng vụ việc mang tính nhắm mục tiêu và gây tổn thương nghiêm trọng cho cộng đồng nghệ sĩ.

Ba vụ cào dữ liệu và cái giá của sự “công khai”

Sau vụ đầu tiên, những cuộc tấn công tương tự tiếp tục xuất hiện. Một người khác đã thu thập khoảng 8,5 triệu đường link từ Cara, cùng dữ liệu đi kèm như tên người dùng, tiêu đề và thẻ tác phẩm, rồi đưa lên Hugging Face, nền tảng dành cho các nhà phát triển AI.

Hugging Face sau đó nhận được rất nhiều yêu cầu gỡ bỏ. Công ty cho biết sẽ yêu cầu người dùng có tên CaptiveDreamer xóa dữ liệu cá nhân, nhưng không gỡ các URL vì những đường dẫn này không chứa bản sao tác phẩm mà chỉ dẫn đến các tác phẩm do nghệ sĩ công khai trên Cara.

Lập luận này cho thấy một khoảng trống quan trọng trong cuộc tranh luận về dữ liệu AI rằng liệu việc lưu trữ đường dẫn đến một tác phẩm có khác biệt căn bản với việc lưu trữ chính tác phẩm đó hay không?

Với nghệ sĩ, câu hỏi không đơn giản như vậy. Metadata như tên tài khoản, tiêu đề, thẻ và thông tin hồ sơ có thể gắn trực tiếp với danh tính và hoạt động sáng tạo của họ.

Đến ngày 22/8, Cara tiếp tục bị cào dữ liệu lần thứ ba. Khoảng 123.000 hình ảnh, cùng các bài đăng dạng văn bản và tiểu sử người dùng có chứa thông tin cá nhân, bị thu thập và đưa lên Academic Torrents.

Ba vụ việc liên tiếp khiến chi phí máy chủ của Cara tăng mạnh, đồng thời làm nhiều nghệ sĩ hoang mang. Một số người đã xóa toàn bộ hồ sơ portfolio và rời nền tảng.

Zhang sau đó mở chiến dịch GoFundMe nhằm huy động 120.000 USD cho chi phí pháp lí, với mục tiêu tìm kiếm các phương án bảo vệ Cara bằng cả luật an ninh mạng và luật bản quyền. Đến cuối tuần, chiến dịch đã huy động hơn 100.000 USD. Nhưng bài toán của Cara khó hơn việc đơn giản “chặn hacker”.

Zhang thừa nhận đội ngũ của mình đã áp dụng những biện pháp hợp lí trong phạm vi nguồn lực cho phép, song không muốn biến Cara thành một nền tảng khó sử dụng. Những biện pháp tạm thời như yêu cầu đăng nhập có thể làm tăng rào cản đối với hoạt động cào dữ liệu nhưng không thể giải quyết tận gốc vấn đề.

Bởi một khi tác phẩm được công khai trên internet, việc ngăn hoàn toàn người khác sao chép nó gần như bất khả thi. Điều đó cũng khiến Zhang không đồng tình với quan điểm cho rằng nghệ sĩ chỉ cần rời Cara để tìm một nơi an toàn hơn. Theo bà, các nền tảng lớn thậm chí còn có thể là mục tiêu hấp dẫn hơn đối với những người thu thập dữ liệu.

Chân dung người cào dữ liệu làm rúng động Cara

Trớ trêu nhất trong câu chuyện là người khởi đầu cuộc khủng hoảng lại trở thành một trong những người giúp Cara tìm cách ứng phó. Sau khi Zhang đối chất, MandarinDawnPoppy994 xin lỗi và xóa kho dữ liệu. Người này, được biết với tên Heft, sau đó tham gia máy chủ Discord của Cara với vai trò hỗ trợ xử lí sự cố.

Heft là một sinh viên tại Bắc Mỹ, có nền tảng về phần mềm và quan tâm đến bảo tồn dữ liệu cũng như các dự án lưu trữ số. Anh yêu cầu chỉ sử dụng tên trên mạng do từng nhận những lời đe dọa và nguy cơ bị truy tìm danh tính liên quan đến vụ việc.

Theo Heft, ban đầu việc cào Cara chỉ là một dự án kĩ thuật. Anh không định công khai dữ liệu nhưng sau đó quyết định đăng nó lên Reddit nhằm “ragebait” và bị cuốn vào việc khiêu khích những người phản đối.

Heft thừa nhận đó là một quyết định sai lầm. Anh không lường trước được mức độ tổn thương đối với nghệ sĩ khi chứng kiến nhiều người chia sẻ rằng họ hoảng loạn, thậm chí xóa toàn bộ portfolio khỏi internet.

Sau khi trực tiếp nói chuyện với các nghệ sĩ, Heft hiểu rằng những hình ảnh không đơn thuần là dữ liệu. Đó là thành quả sáng tạo, tài sản và đôi khi là một phần rất riêng tư trong cuộc sống của họ.

Từ đó, Heft bắt đầu giúp Cara xác định những điểm yếu khiến nền tảng dễ bị cào. Theo Zhang, trong các cuộc thảo luận về biện pháp bảo vệ mới, Heft có thể chỉ ra cách vượt qua một số giải pháp chỉ trong vài phút.

Chính trải nghiệm này dẫn đến sự ra đời của Lantern, một công cụ mã nguồn mở mà Zhang và Heft đang hợp tác phát triển. Lantern không cố biến internet thành nơi “không thể cào dữ liệu”, bởi theo Heft, điều đó gần như không thể. Thay vào đó, công cụ tạo một “dấu vân tay một chiều” cho hình ảnh mà không cần lưu bản sao tác phẩm trên nền tảng.

Lantern sau đó thường xuyên quét các bộ dữ liệu AI được công khai. Nếu phát hiện tác phẩm của nghệ sĩ trong một bộ dữ liệu, hệ thống sẽ thông báo cho họ và cung cấp đường dẫn đến bộ dữ liệu để nghệ sĩ có thể yêu cầu gỡ bỏ hoặc cân nhắc gửi thông báo vi phạm bản quyền.

Đây rõ ràng chưa phải lời giải hoàn hảo. Nhưng nó chuyển trọng tâm từ ngăn mọi người lấy tác phẩm sang giúp nghệ sĩ biết tác phẩm của mình đã bị lấy đi đâu. Và đây có thể mới là cuộc chiến dài hạn.

Zhang cho rằng việc các tác phẩm bị AI khai thác sẽ ngày càng trở nên phổ biến. Vấn đề không chỉ nằm ở bản quyền, mà còn ở quyền riêng tư, quyền kiểm soát dữ liệu, trách nhiệm của nền tảng và cách pháp luật xử lí việc thu thập dữ liệu hàng loạt.

Cara được xây dựng để trở thành nơi nghệ sĩ có thể tránh những rủi ro mà họ lo ngại trên các nền tảng lớn. Nhưng chuỗi vụ cào dữ liệu tháng 8 cho thấy một nghịch lí là ngay cả một nền tảng được tạo ra để bảo vệ nghệ sĩ cũng không thể tự mình bảo vệ họ khỏi cách internet vận hành.

Và nếu những khoảng trống pháp lí không sớm được lấp đầy, cuộc đối đầu giữa nghệ sĩ và AI có thể sẽ không còn là những vụ kiện hiếm hoi hay những cuộc tranh luận trên mạng. Nó có thể trở thành một cuộc chiến thường trực, trong đó mỗi tác phẩm được đưa lên internet đều có nguy cơ bị một hệ thống nào đó âm thầm thu gom.

Nổi bật
      Mới nhất
      Các tác phẩm nghệ thuật không còn an toàn trước thuật toán AI
      • Mặc định

      POWERED BY ONECMS - A PRODUCT OF NEKO