OpenAI dùng bot thu thập dữ liệu Internet

OpenAI triển khai GPTbot để tự động thu thập dữ liệu từ các trang web toàn cầu, nhưng bị lo ngại sẽ trở thành công cụ phá hoại Internet.

OpenAI, nhà phát triển ChatGPT, ngày 8/8 xác nhận sự tồn tại của GPTbot - trình thu thập dữ liệu web để huấn luyện AI. Mô hình GPT-5 dự kiến được đào tạo bằng nguồn dữ liệu này.

"Việc cho phép GPTBot truy cập website của bạn giúp các mô hình AI trở nên chính xác hơn, đồng thời cải thiện khả năng và độ an toàn của chúng", OpenAI cho biết.

Trước đó, người dùng đã quen với Googlebot, có nhiệm vụ lọc thông tin, ưu tiên hiển thị và xếp hạng trang web trong các kết quả tìm kiếm. Dù cũng thu thập dữ liệu, Business Insider đánh giá Goolgebot hữu ích vì website có thêm lưu lượng truy cập nếu được đề xuất. Tuy nhiên, sự trỗi dậy của AI tạo sinh và mô hình ngôn ngữ lớn đang phá vỡ sự cộng tác này.

Các công cụ như GPTbot sẽ giúp ChatGPT và GPT-4 có thể tổng hợp và trả lời câu hỏi, người dùng không cần truy cập các đường link. Điều này khiến nhiều trang web mất lượng truy cập lớn. Có nghĩa, các nhà sáng tạo nội dung cung cấp dữ liệu để GPTbot thu thập và phát triển lớn mạnh, sau đó quay lại cạnh tranh với chính họ. Stack Overflow, web cộng đồng của những lập trình viên chuyên nghiệp, ghi nhận sụt giảm người tham gia khi ChatGPT đủ khả năng giải quyết các lỗi lập trình khó.

Giao diện ChatGPT. Ảnh: Bảo Lâm — Giao diện ChatGPT. Ảnh: *Bảo Lâm*

Theo Business Insider, nỗi lo về GPTbot đang lan truyền mạnh. Trang công nghệ The Verge đã triển khai việc chặn GPTbot. OpenAI cũng cho biết người dùng có thể lựa chọn không cho phép GPTbot thu thập thông tin.

"Sau khi lấy tất cả nội dung có bản quyền trên mạng để xây dựng một sản phẩm độc quyền, OpenAI giờ lại cung cấp cho mọi người cách để ngăn chặn", Prasad Dhumal, chuyên gia tư vấn về công cụ tìm kiếm, bình luận.

Neil Clarke, biên tập viên của Clarkesworld, cho rằng các nhà sáng tạo nội dung đang ngày càng mất niềm tin vào OpenAI. Bên cạnh GPTbot, một số công cụ khác như CCbot của Common Crawl cũng chuyên thu thập dữ liệu nhằm huấn luyện AI. Theo Clarke, CCbot thường xuyên tiến hành sao lưu dữ liệu đã lấy. Do đó, ngay cả khi ngăn không cho bot tiếp tục truy cập, chủ sở hữu website cũng không thể thu hồi dữ liệu cũ.

"Tôi không biết có ai từng thành công khi yêu cầu Common Crawl xóa các nội dung lấy từ trang web hay chưa. Tôi đã thử liên hệ nhưng họ không phản hồi", ông nói.

Trong khi đó, OpenAI cho biết GPTbot được lập trình để tránh nguồn nội dung có tính phí và thông tin cá nhân. Vào tháng 7, công ty đạt thỏa thuận với hãng thông tấn AP để mua quyền thu thập nội dung báo chí.

Dù vậy, OpenAI được cho là phải trả phí trước khi lấy nội dung của bên khác. "OpenAI cần làm việc với các nhà lập pháp về vấn đề thu thập dữ liệu trong quá khứ, hiện tại và tương lai", Clarke nói. Ngoài ra, ông cho rằng OpenAI không được phép đẩy trách nhiệm chặn GPTbot cho người dùng, mà họ nên xin phép để công cụ được tiếp cận một trang web nhất định.

OpenAI dùng bot thu thập dữ liệu Internet

Tin xem nhiều

Vàng sắp tăng gần 30% vì 3 lý do này!

Chính thức từ hôm nay (1/7), nhà ở dưới 3 tầng, không tầng hầm với tổng diện tích sàn nhỏ hơn 250m2 được miễn giấy phép xây dựng

Vào tay hãng dược Trung Quốc, Imexpharm thay Chủ tịch HĐQT

4 khoảnh khắc khẳng định "quyền lực mềm" diệu kỳ của bóng đá tại World Cup 2026

Chủ nhà xác tại Paris từ chối hàng trăm cuộc gọi mỗi ngày vì không còn chỗ: “Chúng ta đang thực sự thảm khốc”

Đi đón con ở trường mẫu giáo, người bố mới phát hiện bé trai đã tử vong ở ghế sau ô tô vì chưa hề được đưa vào trường từ sáng

Hối hận muộn màng: Loạt công ty tái tuyển dụng nhân sự sau khi trót sa thải diện rộng vì AI

GS25 lên tiếng sau phản ánh về điều kiện vệ sinh: Rà soát toàn hệ thống, phối hợp cơ quan chức năng xác minh

Chủ tịch sáng lập Geleximco Vũ Văn Tiền: Cảng Cái Mép Hạ hoàn thành có thể đón siêu tàu container lớn nhất thế giới 250.000 tấn

"1 ly Luyện khí, 2 ly Trúc cơ": Quán cafe tu tiên độc lạ bùng nổ viral, hot đến nỗi chủ quán phải xin đóng cửa tạm thời

Các tin khác