← Trang chủ
Gizmochina1 nguồn

Xiaomi phát hành mô hình nhận diện giọng nói CocktailASR-1 cho môi trường ồn và nhiều người nói

Xiaomi releases CocktailASR-1, a speech recognition model built for noisy, multi-speaker rooms

Tóm tắt nhanh

  • Xiaomi phát hành và mở mã nguồn Xiaomi-CocktailASR-1, một mô hình nhận dạng giọng nói hướng tới giải quyết “cocktail party problem”.
  • Mô hình được thiết kế để tách và nhận diện giọng của một người khi nhiều người cùng nói trong phòng ồn.
  • Theo Gizmochina, CocktailASR-1 nhắm vào tình huống khó hơn so với mô hình nhận dạng giọng nói thông thường, vốn hoạt động tốt khi chỉ có một người nói.

Tóm tắt tự động bằng AI từ bài gốc, có thể có sai sót. Hãy kiểm chứng ở bài gốc.

Trích đoạn bài gốc

Xiaomi has released and open-sourced Xiaomi-CocktailASR-1, a speech recognition model designed to handle one of the harder problems in audio transcription: picking out one person’s voice when multiple people are speaking at the same time. Xiaomi calls this the “cocktail party problem.” Most speech recognition models work well when only one person is talking, but
Đọc bài gốc trên Gizmochina

Tapview chỉ hiển thị tiêu đề, trích đoạn ngắn, tóm tắt và đường dẫn tới bài gốc. Nội dung gốc thuộc bản quyền của Gizmochina.

Tin khác đang nóng