Công nghệ

OpenAI dùng bot thu thập dữ liệu Internet

OpenAI, nhà phát triển ChatGPT, ngày 8/8 xác nhận sự tồn tại của GPTbot - trình thu thập dữ liệu web để huấn luyện AI. Mô hình GPT-5 dự kiến được đào tạo bằng nguồn dữ liệu này.

"Việc cho phép GPTBot truy cập website của bạn giúp các mô hình AI trở nên chính xác hơn, đồng thời cải thiện khả năng và độ an toàn của chúng", OpenAI cho biết.

Trước đó, người dùng đã quen với Googlebot, có nhiệm vụ lọc thông tin, ưu tiên hiển thị và xếp hạng trang web trong các kết quả tìm kiếm. Dù cũng thu thập dữ liệu, Business Insider đánh giá Goolgebot hữu ích vì website có thêm lưu lượng truy cập nếu được đề xuất. Tuy nhiên, sự trỗi dậy của AI tạo sinh và mô hình ngôn ngữ lớn đang phá vỡ sự cộng tác này.

Các công cụ như GPTbot sẽ giúp ChatGPT và GPT-4 có thể tổng hợp và trả lời câu hỏi, người dùng không cần truy cập các đường link. Điều này khiến nhiều trang web mất lượng truy cập lớn. Có nghĩa, các nhà sáng tạo nội dung cung cấp dữ liệu để GPTbot thu thập và phát triển lớn mạnh, sau đó quay lại cạnh tranh với chính họ. Stack Overflow, web cộng đồng của những lập trình viên chuyên nghiệp, ghi nhận sụt giảm người tham gia khi ChatGPT đủ khả năng giải quyết các lỗi lập trình khó.

Giao diện ChatGPT. Ảnh: Bảo Lâm

Giao diện ChatGPT. Ảnh: Bảo Lâm

Theo Business Insider, nỗi lo về GPTbot đang lan truyền mạnh. Trang công nghệ The Verge đã triển khai việc chặn GPTbot. OpenAI cũng cho biết người dùng có thể lựa chọn không cho phép GPTbot thu thập thông tin.

"Sau khi lấy tất cả nội dung có bản quyền trên mạng để xây dựng một sản phẩm độc quyền, OpenAI giờ lại cung cấp cho mọi người cách để ngăn chặn", Prasad Dhumal, chuyên gia tư vấn về công cụ tìm kiếm, bình luận.

Neil Clarke, biên tập viên của Clarkesworld, cho rằng các nhà sáng tạo nội dung đang ngày càng mất niềm tin vào OpenAI. Bên cạnh GPTbot, một số công cụ khác như CCbot của Common Crawl cũng chuyên thu thập dữ liệu nhằm huấn luyện AI. Theo Clarke, CCbot thường xuyên tiến hành sao lưu dữ liệu đã lấy. Do đó, ngay cả khi ngăn không cho bot tiếp tục truy cập, chủ sở hữu website cũng không thể thu hồi dữ liệu cũ.

"Tôi không biết có ai từng thành công khi yêu cầu Common Crawl xóa các nội dung lấy từ trang web hay chưa. Tôi đã thử liên hệ nhưng họ không phản hồi", ông nói.

Trong khi đó, OpenAI cho biết GPTbot được lập trình để tránh nguồn nội dung có tính phí và thông tin cá nhân. Vào tháng 7, công ty đạt thỏa thuận với hãng thông tấn AP để mua quyền thu thập nội dung báo chí.

Dù vậy, OpenAI được cho là phải trả phí trước khi lấy nội dung của bên khác. "OpenAI cần làm việc với các nhà lập pháp về vấn đề thu thập dữ liệu trong quá khứ, hiện tại và tương lai", Clarke nói. Ngoài ra, ông cho rằng OpenAI không được phép đẩy trách nhiệm chặn GPTbot cho người dùng, mà họ nên xin phép để công cụ được tiếp cận một trang web nhất định.

Các tin khác

Dự báo thị trường sẽ phân hóa rõ nét hơn, Agriseco gợi ý 6 cổ phiếu tiềm năng cho tháng 8

Agriseco đưa ra danh mục đầu tư tiềm năng trong tháng 8/2023, trong đó các doanh nghiệp được ưu tiên lựa chọn có kỳ vọng kết quả kinh doanh nửa cuối năm 2023 tăng trưởng tốt, định giá hợp lý, hoặc thuộc những ngành hưởng lợi từ các chính sách hỗ trợ tăng trưởng nền kinh tế của nhà nước.

Mitsubishi và Vinhomes đồng hành áp dụng “siêu chính sách” miễn lãi 8 năm tại The Zurich 1 – Vinhomes Ocean Park 1

Ngày 10/08/2023, Mitsubishi Corporation và Vinhomes công bố siêu chính sách “Mua nhà không lo lãi suất lên đến 8 năm” áp dụng cho tòa căn hộ ZR1 - phân khu The Zurich thuộc dự án The Metropolitan (Vinhomes Ocean Park). Chính sách đột phá được đánh giá tốt bậc nhất thị trường hiện nay mang tới cho khách hàng cơ hội dễ dàng sở hữu căn hộ tại đại đô thị hiện đại - đẳng cấp bậc nhất phía Đông.

6 lý do Wyndham Garden Cam Ranh mê hoặc du khách mùa nghỉ lễ

Trong rất nhiều các khu nghỉ dưỡng nằm dọc Bãi Dài (Khánh Hòa), Wyndham Garden Cam Ranh nổi bật với những dãy biệt thự xinh đẹp hợp thành kiến trúc hình xương cá độc đáo, hòa cùng màu xanh mướt mắt của cây cối tạo nên một khung cảnh hài hòa giữa không gian bao la, hùng vĩ của vịnh Cam Ranh.