ElevenLabs представила моделі v4 із підтримкою понад 90 мов
ElevenLabs представила моделі v4 і v4 Turbo з підтримкою понад 90 мов, швидшим клонуванням голосу та нижчою затримкою.
Компанія ElevenLabs представила нові моделі синтезу мовлення ElevenLabs v4 і v4 Turbo, які підтримують понад 90 мов, дають більше контролю над виразністю голосу та мають нижчу затримку для голосових агентів. Про запуск повідомляє TechCrunch.
Нове покоління моделей побудоване на іншій архітектурі. За даними компанії, v4 дає змогу клонувати голос, використовуючи лише 10-секундний аудіозапис. Модель також має точніше зберігати голосову ідентичність у довших фрагментах тексту та враховувати контекст під час озвучення, змінюючи інтонацію й виразність.
Більше контролю над озвученням
ElevenLabs розширила систему вбудованих тегів для задання виразності мовлення, яку започаткувала у попередній версії v3. У v4 користувачі можуть поєднувати кілька тегів і задавати послідовність, якої має дотримуватися модель.
Попередня версія підтримувала 70 мов. У компанії заявили, що найбільше поліпшення якості в новій моделі зафіксували для японської, бразильської португальської, мандаринської та кантонської мов.
Застосування для голосових агентів
Моделі v4 розраховані, зокрема, на голосових агентів. Нижча затримка має зробити розмову плавнішою, а генерація аудіо може починатися одночасно з тим, як мовна модель формує відповідь. ElevenLabs також зазначила, що v4 по-різному обробляє конфронтаційні ситуації, ескалації та утримання дзвінка.
Компанія повідомила, що понад 55% її бізнесу припадає на великі підприємства. За інформацією TechCrunch, річний темп доходів ElevenLabs зріс приблизно з 330 млн доларів на початку року до понад 600 млн доларів, а штат перевищив 800 працівників.