← Trang chủ
TechCrunch1 nguồn

ElevenLabs ra mắt mô hình giọng nói v4 và v4 Turbo hỗ trợ 90 ngôn ngữ và điều khiển biểu cảm tốt hơn

ElevenLabs’ new v4 speech model supports more expression control and 90 languages

Tóm tắt nhanh

  • ElevenLabs ra mắt hai mô hình giọng nói mới, ElevenLabs v4 và v4 Turbo, với kiến trúc mới cho phép kiểm soát biểu cảm tốt hơn và nhân bản giọng nhanh hơn.
  • Công ty cho biết v4 có thể nhân bản giọng chỉ với 10 giây audio và giữ được nhận dạng giọng qua đoạn văn dài hơn.
  • v4 mở rộng thẻ inline để định nghĩa biểu cảm, cho phép xếp chồng nhiều thẻ và theo thứ tự để thay đổi biểu cảm khi đọc.
  • Mô hình trước hỗ trợ 70 ngôn ngữ; v4 nâng lên hơn 90 ngôn ngữ, với bước nhảy chất lượng lớn nhất ở tiếng Nhật, Bồ Đào Nha Brazil, Quan Thoại và Phổ Thông.
  • ElevenLabs nói v4 có độ trễ thấp hơn, phù hợp cho voice agents vì có thể bắt đầu sinh âm thanh ngay khi LLM bắt đầu tạo câu trả lời.
  • Mô hình xử lý tốt các tình huống đối chất, leo thang và giữ cuộc gọi để giải quyết vấn đề hiệu quả hơn trong môi trường gọi doanh nghiệp.
  • Công ty cho biết hơn 55% doanh thu đến từ khách hàng lớn; doanh thu chạy hàng năm tăng từ ~330 triệu USD lên trên 600 triệu USD trong năm nay.
  • ElevenLabs huy động 500 triệu USD từ Sequoia với định giá 11 tỷ USD, có tin đồn vòng gọi vốn tiếp theo có thể định giá 22 tỷ USD; công ty muốn IPO “trong những năm tới”.

Tóm tắt tự động bằng AI từ bài gốc, có thể có sai sót. Hãy kiểm chứng ở bài gốc.

Trích đoạn bài gốc

ElevenLabs v4 can clone voices with a 10 second clip
Đọc bài gốc trên TechCrunch

Tapview chỉ hiển thị tiêu đề, trích đoạn ngắn, tóm tắt và đường dẫn tới bài gốc. Nội dung gốc thuộc bản quyền của TechCrunch.

Tin khác đang nóng