Cuộc chiến giành quyền kiểm soát dữ liệu trên Internet vừa có một bước ngoặt lớn. Cloudflare, gã khổng lồ về hạ tầng web, đã chính thức chĩa mũi dùi vào các công ty AI, thay đổi luật chơi về cách nội dung được thu thập và sử dụng để huấn luyện máy móc.
Cloudflare vừa tuyên bố sẽ tự động chặn các trình thu thập dữ liệu web (web crawler) "đa dụng" – những con bot vừa lập chỉ mục cho công cụ tìm kiếm, vừa âm thầm thu thập dữ liệu để huấn luyện AI. Đây là một động thái mạnh tay, thay đổi hoàn toàn chính sách cũ vốn chỉ cho khách hàng tùy chọn bật tính năng này.
"Giờ đây, khi phần lớn lưu lượng truy cập trên Internet không phải do con người tạo ra, chúng ta phải đi xa hơn và hành động nhanh hơn," Matthew Prince, CEO của Cloudflare, chia sẻ. Ông nhấn mạnh rằng một hệ sinh thái bền vững cần được thiết lập lại.
"Những công cụ mới từ Cloudflare hứa hẹn sẽ trao cho chủ website nhiều quyền kiểm soát và cơ hội thương mại hơn, đồng thời tạo ra một sân chơi công bằng cho các công ty AI hoạt động minh bạch."
Chính sách mới: Ưu tiên quyền kiểm soát của chủ website
Kể từ ngày 15 tháng 9 tới, các trang web mới trên hệ thống Cloudflare sẽ mặc định chặn việc dùng nội dung để huấn luyện AI trên các trang có quảng cáo, trong khi vẫn cho phép thu thập dữ liệu cho mục đích tìm kiếm.
Các trình thu thập dữ liệu đa dụng, không cho phép chủ sở hữu lựa chọn, cũng sẽ bị chặn thẳng tay. Người dùng tài khoản miễn phí cũng sẽ tự động được áp dụng chính sách này trừ khi họ chủ động từ chối trước thời hạn.
Đối với các blogger hay chủ website nhỏ, đây là một tin vui. Họ sẽ không còn phải bất lực nhìn nội dung của mình bị các mô hình AI "hút" miễn phí để rồi cạnh tranh lại với chính mình trong kết quả tìm kiếm.
Tác động đến Google và các công ty công nghệ lớn
Chính sách mới của Cloudflare dường như đang nhắm thẳng vào Google. Công ty chỉ ra rằng "công cụ tìm kiếm lớn nhất" đang có lợi thế không công bằng khi buộc các nhà xuất bản phải chấp nhận việc nội dung của họ bị dùng cho AI nếu muốn được xuất hiện trên kết quả tìm kiếm.
Trình thu thập dữ liệu chính của Google, Googlebot, thực hiện cả hai nhiệm vụ: lập chỉ mục cho tìm kiếm và thu thập dữ liệu để huấn luyện mô hình Gemini.
Google có cung cấp một lựa chọn riêng là Google-Extended để chỉ thu thập dữ liệu cho tìm kiếm truyền thống. Tuy nhiên, điều này tạo ra một thế khó: các nhà xuất bản không thể vừa xuất hiện trong kết quả AI, vừa từ chối việc nội dung của mình bị dùng để huấn luyện mô hình.
Động thái của Cloudflare là một nỗ lực để phá vỡ thế lưỡng nan này, buộc Google và các công ty khác phải tách bạch rõ ràng giữa thu thập dữ liệu cho tìm kiếm và cho AI. Đây có thể là phát súng mở màn cho một cuộc tái định hình sâu sắc về quyền sở hữu dữ liệu trong kỷ nguyên trí tuệ nhân tạo.