← Trang chủ
TechCrunch1 nguồn

Hồ sơ tòa án mở lại: Microsoft và OpenAI thừa nhận thu thập dữ liệu AI có thể là “ăn cắp” và đe dọa báo chí

Microsoft exec called AI scraping ‘the largest theft of labor in human history,’ new unredacted filings reveal

Tóm tắt nhanh

  • Hồ sơ tòa án chưa bị gỡ bỏ trong vụ kiện bản quyền của The New York Times tiết lộ lời thú nhận rằng việc thu thập dữ liệu để huấn luyện AI tương đương với “trộm cắp” lao động theo một lãnh đạo Microsoft.
  • Theo hồ sơ, OpenAI lãnh đạo nội bộ mô tả các mô hình AI là mối “đe dọa hiện sinh” với các nhà xuất bản và nhà báo vì sản phẩm AI có thể thay thế nội dung gốc.
  • Tài liệu nêu rõ các công ty bị cáo buộc vượt qua tường trả phí, quét dữ liệu hàng loạt để xây dựng tập dữ liệu huấn luyện và cố ý loại bỏ thông báo bản quyền khỏi dữ liệu.
  • Nhiều thông tin mới được trích từ bản tóm tắt của The New York Times chứ không phải từ các bằng chứng kèm theo, và các chứng cứ gốc vẫn đang bị niêm phong.
  • Bằng chứng nội bộ Microsoft cho thấy công cụ Copilot làm giảm tỷ lệ nhấp vào tên miền NYT tới 93% so với tìm kiếm Bing truyền thống.
  • Tài liệu nội bộ Microsoft gọi sự giảm lượt truy cập này là “doom loop” có thể gây tổn hại cho hiệu suất mô hình và toàn bộ web.
  • CEO Microsoft Satya Nadella khai rằng mọi nội dung trả phí nên được cấp phép để sử dụng cho huấn luyện, và ông sẽ yêu cầu OpenAI huấn luyện lại nếu biết OpenAI đã quét nội dung trả phí.
  • Các lãnh đạo OpenAI như Nick Turley và Greg Brockman mô tả sản phẩm AI là “lý thuyết thay thế” và “xuất sắc với tin tức,” làm suy yếu lập luận ‘fair use’ vì khả năng thay thế thị trường nội dung gốc.
  • Một tài liệu Microsoft cảnh báo “rủi ro thực sự” là AI sinh tạo có thể làm gián đoạn đáng kể việc làm của những người tạo ra dữ liệu đã dùng để huấn luyện mô hình.
  • Thắc mắc pháp lý còn mở: mặc dù thẩm phán thường ủng hộ lập luận huấn luyện là “fair use,” các thừa nhận mới mâu thuẫn với yếu tố rằng việc sử dụng không được gây tổn hại thị trường cho tác phẩm gốc.

Tóm tắt tự động bằng AI từ bài gốc, có thể có sai sót. Hãy kiểm chứng ở bài gốc.

Trích đoạn bài gốc

Newly unsealed court filings show Microsoft privately called OpenAI's data practices "theft" while both companies scraped paywalled Times content, built datasets from it, and warned internally it would gut publishers.
Đọc bài gốc trên TechCrunch

Tapview chỉ hiển thị tiêu đề, trích đoạn ngắn, tóm tắt và đường dẫn tới bài gốc. Nội dung gốc thuộc bản quyền của TechCrunch.

Tin khác đang nóng