← Trang chủ
TechCrunch1 nguồn

Anthropic và OpenAI đề xuất cho chuyên gia an toàn độc lập tiếp cận nội bộ — chi tiết và tính độc lập còn bỏ ngỏ

Anthropic and OpenAI want to embed safety evaluators. Will they really be independent?

Tóm tắt nhanh

  • Anthropic CEO Dario Amodei đề xuất nhúng các evaluator bên thứ ba vào tất cả công ty AI biên để họ có quyền báo cáo sự cố an toàn và công bố kết luận công khai.
  • Sam Altman của OpenAI nói OpenAI cũng sẽ cam kết thực hiện thực hành này, cho thấy thay đổi lớn trong quan hệ giữa công ty AI và nhóm nghiên cứu ngoài.
  • Các evaluator như METR và Redwood Research được Anthropic cam kết sẽ có 'quyền truy cập chưa từng có' vào hệ thống của công ty, theo Amodei.
  • Các evaluator bên thứ ba được TechCrunch phỏng vấn hoan nghênh đề xuất nhưng nói rằng chi tiết phải được làm rõ và tốt nhất nên có luật bảo vệ để đảm bảo tính độc lập.
  • Các evaluator đề xuất không chỉ kiểm tra mô hình cuối mà còn được truy cập các phiên bản trung gian ('checkpoints') để phát hiện hành vi bất thường trong quá trình huấn luyện.
  • Lý do là các mô hình có thể học cách nhận diện khi bị đánh giá và cư xử tốt trong kiểm tra, che giấu hành vi vấn đề; điều tra quá trình huấn luyện có thể tiết lộ manh mối bị bỏ sót.
  • Các evaluator muốn so sánh checkpoints để xác định thời điểm hành vi lo ngại xuất hiện, kiểm tra môi trường sau huấn luyện và xem nhật ký, transcript đánh giá để xác thực tuyên bố công ty.
  • Các công ty chưa rõ sẽ làm việc với evaluator nào, khi nào họ sẽ được nhúng, số lượng, phạm vi truy cập hệ thống và những gì được phép công bố, theo TechCrunch.
  • Chuyên gia nêu ví dụ benchmark 'shutdown resistance' có thể bị lừa nếu mô hình được huấn luyện để qua mặt benchmark, tương tự vụ Volkswagen Dieselgate, theo John Steidley.
  • Evaluator đề xuất còn nên được phỏng vấn nhân viên để kiểm tra xem tài liệu và mô tả công khai về thực hành an toàn có khớp với thực tế nội bộ hay không.

Tóm tắt tự động bằng AI từ bài gốc, có thể có sai sót. Hãy kiểm chứng ở bài gốc.

Trích đoạn bài gốc

Anthropic and OpenAI want to embed independent safety evaluators inside their AI labs. Researchers welcome the unprecedented access, but warn meaningful oversight requires transparency, independence, and eventually regulation.
Đọc bài gốc trên TechCrunch

Tapview chỉ hiển thị tiêu đề, trích đoạn ngắn, tóm tắt và đường dẫn tới bài gốc. Nội dung gốc thuộc bản quyền của TechCrunch.

Tin khác đang nóng