Công nghệ

OpenAI dùng bot thu thập dữ liệu Internet

OpenAI, nhà phát triển ChatGPT, ngày 8/8 xác nhận sự tồn tại của GPTbot - trình thu thập dữ liệu web để huấn luyện AI. Mô hình GPT-5 dự kiến được đào tạo bằng nguồn dữ liệu này.

"Việc cho phép GPTBot truy cập website của bạn giúp các mô hình AI trở nên chính xác hơn, đồng thời cải thiện khả năng và độ an toàn của chúng", OpenAI cho biết.

Trước đó, người dùng đã quen với Googlebot, có nhiệm vụ lọc thông tin, ưu tiên hiển thị và xếp hạng trang web trong các kết quả tìm kiếm. Dù cũng thu thập dữ liệu, Business Insider đánh giá Goolgebot hữu ích vì website có thêm lưu lượng truy cập nếu được đề xuất. Tuy nhiên, sự trỗi dậy của AI tạo sinh và mô hình ngôn ngữ lớn đang phá vỡ sự cộng tác này.

Các công cụ như GPTbot sẽ giúp ChatGPT và GPT-4 có thể tổng hợp và trả lời câu hỏi, người dùng không cần truy cập các đường link. Điều này khiến nhiều trang web mất lượng truy cập lớn. Có nghĩa, các nhà sáng tạo nội dung cung cấp dữ liệu để GPTbot thu thập và phát triển lớn mạnh, sau đó quay lại cạnh tranh với chính họ. Stack Overflow, web cộng đồng của những lập trình viên chuyên nghiệp, ghi nhận sụt giảm người tham gia khi ChatGPT đủ khả năng giải quyết các lỗi lập trình khó.

Giao diện ChatGPT. Ảnh: Bảo Lâm

Giao diện ChatGPT. Ảnh: Bảo Lâm

Theo Business Insider, nỗi lo về GPTbot đang lan truyền mạnh. Trang công nghệ The Verge đã triển khai việc chặn GPTbot. OpenAI cũng cho biết người dùng có thể lựa chọn không cho phép GPTbot thu thập thông tin.

"Sau khi lấy tất cả nội dung có bản quyền trên mạng để xây dựng một sản phẩm độc quyền, OpenAI giờ lại cung cấp cho mọi người cách để ngăn chặn", Prasad Dhumal, chuyên gia tư vấn về công cụ tìm kiếm, bình luận.

Neil Clarke, biên tập viên của Clarkesworld, cho rằng các nhà sáng tạo nội dung đang ngày càng mất niềm tin vào OpenAI. Bên cạnh GPTbot, một số công cụ khác như CCbot của Common Crawl cũng chuyên thu thập dữ liệu nhằm huấn luyện AI. Theo Clarke, CCbot thường xuyên tiến hành sao lưu dữ liệu đã lấy. Do đó, ngay cả khi ngăn không cho bot tiếp tục truy cập, chủ sở hữu website cũng không thể thu hồi dữ liệu cũ.

"Tôi không biết có ai từng thành công khi yêu cầu Common Crawl xóa các nội dung lấy từ trang web hay chưa. Tôi đã thử liên hệ nhưng họ không phản hồi", ông nói.

Trong khi đó, OpenAI cho biết GPTbot được lập trình để tránh nguồn nội dung có tính phí và thông tin cá nhân. Vào tháng 7, công ty đạt thỏa thuận với hãng thông tấn AP để mua quyền thu thập nội dung báo chí.

Dù vậy, OpenAI được cho là phải trả phí trước khi lấy nội dung của bên khác. "OpenAI cần làm việc với các nhà lập pháp về vấn đề thu thập dữ liệu trong quá khứ, hiện tại và tương lai", Clarke nói. Ngoài ra, ông cho rằng OpenAI không được phép đẩy trách nhiệm chặn GPTbot cho người dùng, mà họ nên xin phép để công cụ được tiếp cận một trang web nhất định.

Các tin khác

"Sự thân mật giả tạo" với chatbot AI

"Sự thân mật giả tạo" với chatbot AI

Cuộc sống cô đơn khiến nhiều người tìm đến chatbot AI như một cách để giải tỏa nỗi buồn, nhưng bị cuốn vào lúc nào không hay.
AI có thể "hiểu" tiếng bàn phím

AI có thể "hiểu" tiếng bàn phím

AI có thể xác định nội dung người dùng gõ trên bàn phím bằng cách nghe âm thanh từ chiếc laptop trong quán cà phê với độ chính xác 95%.
VNeID đã hoạt động trên iOS 17

VNeID đã hoạt động trên iOS 17

Bản thử nghiệm iOS 17 Beta 5 vừa được Apple tung ra với một số cải tiến, trong đó lỗi VNeID không hoạt động đã được khắc phục.
Những nâng cấp trên Reno10 5G

Những nâng cấp trên Reno10 5G

Oppo Reno10 nâng cấp về màn hình với tần số quét 120 Hz, tập trung vào tính năng chụp ảnh qua ống kính 64 megapixel, hỗ trợ sạc nhanh.
Apple Pay ra mắt tại Việt Nam

Apple Pay ra mắt tại Việt Nam

iPhone, Apple Watch có thể được dùng để thanh toán trực tiếp khi mua sắm hay sử dụng dịch vụ thay cho thẻ vật lý của các ngân hàng.