عنوان: استارتاپ صوتی Rime با جذب 24 میلیون دلار در سری A، روی مدل‌های گفتار‌-به‌گفتار برای پاسخگویی تلفنی سازمانی سرمایه‌گذاری می‌کند

Rime، استارتاپ حوزه هوش صوتی مستقر در سان‌فرانسیسکو، اعلام کرده در دور سرمایه‌گذاری سری A مبلغ 24 میلیون دلار (حدود ۲۴ میلیون دلار) جذب کرده است تا توسعه مدل‌های صوتی خود را که مخصوص تماس‌های تلفنی سازمانی طراحی شده‌اند، سرعت ببخشد. این شرکت می‌گوید هدفش کاهش بار سفارشی‌سازی برای مشتریان سازمانی با استفاده از داده‌های گفتگومحور ضبط‌شده و بهینه‌سازی مدل‌ها برای تلفظ دقیق نام‌های برند و اصطلاحات تخصصی صنعت است.

چرا ضبط داده‌های مکالمه مهم است
برخلاف بسیاری از رقبا که به داده‌های صوتی عمومی روی وب متکی‌اند، Rime استودیوی ضبط اختصاصی در سان‌فرانسیسکو راه‌اندازی کرده تا داده‌های مکالمه‌ای کنترل‌شده و با کیفیت بالا جمع‌آوری کند. این رویکرد چند مزیت کلیدی دارد: کنترل بیشتر روی تنوع آکوستیک و نویز پس‌زمینه، تضمین انطباق با مقررات محرمانگی (به‌ویژه در صنایع حساس مانند سلامت)، و تولید داده‌هایی که دقیقاً با سناریوهای تماس تلفنی سازمانی مطابقت دارند—چیزی که داده‌های خالص وب به‌سختی فراهم می‌کنند.

معماری فونمی و تطبیق تلفظ برندها
Rime از معماری مبتنی بر فونم (واحدهای صوتی پایه زبان) استفاده می‌کند تا بتواند تلفظ‌های مختلف یک واژه—به‌ویژه نام‌های برند و اصطلاحات تخصصی—را بهتر پوشش دهد. این روش به مشتریان امکان می‌دهد بدون نیاز به بازآموزی گسترده مدل‌ها برای هر حوزه، پاسخ‌های صوتی با تلفظ‌های معتبر و قابل‌قبول دریافت کنند.

تحول فنی: از زنجیره مدل‌های جداگانه به گفتار-به-گفتار
در مرحله اولیه، Rime از چند مدل مجزا برای گفتار-به-نوشتار، متن-به-گفتار و مدل زبانی بزرگ استفاده می‌کرد، اما اکنون تمرکز خود را به سمت توسعه مدل‌های گفتار-به-گفتار (speech-to-speech) منتقل کرده است. مزایای این تغییر شامل کاهش تأخیر، بهبود مدیریت نوبت‌گیری در مکالمه، کاهش تأثیر نویز پس‌زمینه و کمتر شدن وابستگی به ارکستراسیون پیچیده میان چند مدل است. در عمل، مدل‌های یکپارچه گفتار-به-گفتار می‌توانند تجربه تعاملی طبیعی‌تر و پاسخ‌دهی سریع‌تری در تماس‌های تلفنی فراهم کنند—امری که برای پذیرش گسترده در محیط‌های سازمانی حیاتی است.

چالش بازار و جایگاه Rime
با وجود پیشرفت‌های قابل توجه در هوش صوتی، مدیرعامل Rime اشاره کرده که بسیاری از سازمان‌ها همچنان به سیستم‌های قدیمی IVR (پاسخگوی صوتی تعاملی) وفادار هستند، چون تجربه تعامل با عامل‌های صوتی هوش مصنوعی هنوز از نظر اثربخشی و رضایت کاربر کامل نیست. به گفته او، مدل‌های زبانی بزرگ توسعه ساخت اپلیکیشن‌های صوتی را ساده‌تر کرده‌اند، اما تجربه نهایی کاربر هنوز شبیه یک IVR بهبود یافته است و به اندازه کافی قانع‌کننده نیست.

مشتریان، قراردادها و مزیت رقابتی
Rime می‌گوید مشتریانی در صنعت غذا، سلامت، هواپیمایی و فین‌تک دارد و با سازمان‌هایی مانند Mayo Clinic، Dialpad، Upstart و Asurion قراردادی امضا کرده است. شرکت ادعا می‌کند به‌دلیل کیفیت داده‌ها و موقعیت‌یابی مدل، کاربران زمان بیشتری را در تماس‌ها می‌مانند که به برنده‌شدن در مناقصه‌ها و قراردادهای سازمانی کمک کرده است.

جزئیات تأمین مالی و برنامه‌های توسعه
دور سرمایه‌گذاری سری A توسط M13 Ventures رهبری شد و سرمایه‌گذارانی مانند Twilio Ventures، Corazon Capital، Unusual Ventures و سایر سرمایه‌گذاران قبلی در این دور حضور داشتند. این شرکت پیش‌تر در ماه مه دور بذر به میزان 5.5 میلیون دلار جذب کرده بود. Morgan Blumberg از M13 در جریان این سرمایه‌گذاری به‌عنوان عضو هیئت‌مدیره به تیم Rime پیوست.

Rime در حال حاضر تیمی حدود 35 نفره دارد و با سرمایه جدید قصد دارد استخدام در حوزه توسعه مدل، مهندسی و شراکت‌های تجاری را گسترش دهد. این شرکت اخیراً Rafael Valle، پژوهشگری با سابقه در درک صوتی از Meta Superintelligence Labs و تیم پژوهشی صوتی یادگیری عمیق Nvidia، را به‌عنوان دانشمند ارشد جذب کرده است.

چشم‌انداز و رقابت در بازار صوتی
بازار خدمات صوتی سازمانی به‌سرعت شلوغ شده است؛ بازیگرانی مانند ElevenLabs و Deepgram در سطح مدل و زیرساخت فعال‌اند و شرکت‌هایی مانند Decagon و Sierra خدمات تخصصی پشتیبانی مشتری را ارائه می‌دهند. سرمایه‌گذار M13 معتقد است که تمرکز Rime روی مدل‌های با تاخیر پایین و قابلیت اطمینان بالا در محیط‌های دارای مقررات، می‌تواند این استارتاپ را از رقبا متمایز کند. موفقیت نهایی در بازار بستگی به توانایی فنی در کاهش فاصله تجربه کاربری بین هوش صوتی و راه‌حل‌های سنتی IVR، و همچنین انطباق با نیازهای حریم خصوصی و مطابقت صنعتی خواهد داشت.

ادیت عکس با هوش مصنوعی

دیدگاه‌ خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

اسکرول به بالا