ElevenLabs از تازهترین مدل تبدیل متن به گفتار خود، Eleven v4، و نسخهای بلادرنگ با نام v4 Turbo رونمایی کرد. بهگفته شرکت، صداهای جدید بیانگرترند و میتوانند لحن یک شخصیت را در متنهای طولانی ثابت نگه دارند. هر دو مدل هماکنون از طریق پلتفرم ElevenAgents، اپلیکیشن ElevenCreative و API عمومی در دسترساند.
چه چیزهایی تازه است و قیمت چقدر است؟
Eleven v4 در هر درخواست میتواند تا ۱۰٬۰۰۰ نویسه را پردازش کند؛ حجمی معادل حدود ۱۰ دقیقه صدا. این مدل از بیش از ۹۰ زبان پشتیبانی میکند، درحالیکه مدل قبلی، v3، حدود ۷۰ زبان را پوشش میداد. نسخه Turbo برای عاملهای صوتی طراحی شده و میتواند پس از حدود ۱۵۰ میلیثانیه شروع به صحبت کند؛ سرعتی بهمراتب بیشتر از ۲۶۲ میلیثانیهای که شرکت برای یکی از رقبا اندازهگیری کرده است.
هزینه استفاده از API برای مدل استاندارد v4 بهازای هر ۱۰۰۰ نویسه ۰٫۰۸ دلار است (۸۰ دلار بهازای هر یک میلیون نویسه) و برای v4 Turbo به ۰٫۰۴ دلار بهازای هر ۱۰۰۰ نویسه میرسد (۴۰ دلار بهازای هر یک میلیون). تا ۱۲ اکتبر، این نرخها بهترتیب به ۰٫۰۲۲ و ۰٫۰۱۱ دلار بهازای هر ۱۰۰۰ نویسه کاهش مییابند.
اهمیت این مدلها برای تولیدکنندگان محتوا
قیمت کمتر و پاسخگویی سریعتر Turbo باعث میشود صداهای هوش مصنوعی باکیفیت و بیانگر برای پادکسترهای مستقل، سازندگان بازی و کسبوکارهای کوچکی که به عاملهای صوتی بلادرنگ نیاز دارند، مقرونبهصرفهتر شوند. افزایش سقف تعداد نویسهها نیز نیاز به تقسیم متنهای طولانی را کمتر میکند و در تولید کتاب صوتی یا آموزشهای ویدئویی در زمان صرفهجویی میکند.
چرا مهم است
برای کاربران عادی، هزینه کمتر بهازای هر نویسه یعنی هزینه پایینتر برای پروژههایی که به حجم زیادی محتوای گفتاری نیاز دارند. مدل سریعتر Turbo به توسعهدهندگان امکان میدهد دستیارهای صوتی بلادرنگی بسازند که طبیعی به نظر برسند و تأخیر محسوسی نداشته باشند.