← Trang chủ
Tom's Hardware1 nguồn

OpenAI tố nhóm liên quan Moonshot AI từ Trung Quốc dẫn chiến dịch trích xuất 'hidden reasoning' từ mô hình

OpenAI says actors linked to China-based Moonshot AI spearheaded a campaign to extract its models’ hidden reasoning

Tóm tắt nhanh

  • OpenAI cho biết người liên quan Moonshot AI (Trung Quốc) đứng sau chiến dịch có phối hợp vào tháng 7 nhằm trích xuất ‘protected reasoning’ từ mô hình.
  • Chiến dịch bắt đầu 1/7, tăng đột biến ngày 24–25/7 với 16.000 yêu cầu theo mẫu trích xuất từ hơn 4.000 người dùng.
  • OpenAI nói nỗ lực trích xuất được thực hiện nhưng “không nhất thiết thành công” và chiến dịch bị “hoàn toàn gián đoạn” vào 28/7.
  • Công ty không nêu tỉ lệ thành công, mô hình bị tấn công cụ thể hay bao nhiêu người dùng liên quan tới Moonshot.
  • OpenAI định nghĩa ‘protected reasoning’ là hồ sơ nội bộ của mô hình khi giải bài, và ‘adversarial distillation’ là dùng hệ thốngatic output để huấn luyện mô hình khác.
  • Một phương pháp dùng reasoning được mã hóa từ cuộc trò chuyện này, rồi hỏi mô hình khác giải mã; OpenAI khẳng định mã hóa không bị bẻ và không có cơ sở dữ liệu người dùng nào bị xâm phạm.
  • OpenAI đã đóng một lỗ hổng cho phép phát lại reasoning mã hóa của người khác và thêm kiểm tra để chặn output stream có thể tiết lộ reasoning.
  • Công ty tăng cường bảo vệ reasoning giữa người dùng, workspace, tổ chức và họ mô hình, làm việc với bên thứ ba để gián đoạn tài khoản liên quan và chia sẻ phát hiện với Frontier Model Forum cùng kênh chính phủ.
  • Nghiên cứu độc lập “Stealing Reasoning Traces from Proprietary LLM APIs” (10/8) mô tả thí nghiệm lấy reasoning mã hóa từ mô hình frontier, đưa vào mô hình yếu hơn để giải mã; các nhà cung cấp sau đó đã ngăn chặn được các tấn công tương tự.
  • Anthropic cũng báo cáo Moonshot chuyển gần 300.000 yêu cầu tới Claude trong 10 ngày và thực hiện “cross-session replay attacks”; OpenAI dự báo nỗ lực distillation sẽ tinh vi hơn và tiếp tục củng cố bảo vệ.

Tóm tắt tự động bằng AI từ bài gốc, có thể có sai sót. Hãy kiểm chứng ở bài gốc.

Trích đoạn bài gốc

OpenAI says operators copied its models’ encrypted reasoning and asked a model in a separate conversation to decrypt it.
Đọc bài gốc trên Tom's Hardware

Tapview chỉ hiển thị tiêu đề, trích đoạn ngắn, tóm tắt và đường dẫn tới bài gốc. Nội dung gốc thuộc bản quyền của Tom's Hardware.

Tin khác đang nóng