Fish Audio با جذب ۵۲ میلیون دلار برای توسعه مدل‌های صوتی مبتنی بر هوش مصنوعی

شرکت Palo Alto‌ای Fish Audio که در زمینه تولید صداهای طبیعی با هوش مصنوعی فعالیت می‌کند، در دور سرمایه‌گذاری اولیه ۵۲ میلیون دلار جذب کرد. این دور سرمایه‌گذاری توسط Coreline Ventures و Capital Today رهبری شد و سرمایه‌گذاران دیگری از جمله 359 Capital، Parable، Play Time، Alphalist Partners، Bayhouse Ventures، Carya Venture Partners و HF0 نیز در آن حضور داشتند.

رشد و آمار کلیدی
– بیش از ۸ میلیون کاربر از نسخه‌های متن‌باز یا میزبانی‌شده مدل‌های Fish Audio استفاده می‌کنند.
– درآمد تکرارشونده سالانه (ARR) این شرکت حدود ۲۱ میلیون دلار گزارش شده است.
– مخزن متن‌باز Fish Speech در GitHub بیش از ۳۱ هزار ستاره دارد و توسط توسعه‌دهندگان مستقل، طراحان بازی و تولیدکننده‌های محتوا مورد استفاده قرار می‌گیرد.
– مجموعه کنترل‌های زبانی طبیعی Fish Audio شامل بیش از ۱۵ هزار دستور برای کنترل لحن و بیان صدا است.

محصولات و مدل‌ها
Fish Audio در یک سال گذشته پنج مدل منتشر کرده است: چهار مدل تولید گفتار و یک مدل تبدیل گفتار به متن. سه مدل تولید گفتار به‌صورت متن‌باز عرضه شده‌اند، اما مدل پیشرفته S2.1 Pro تنها از طریق API پولی در دسترس است. شرکت پلن‌های ماهانه پرداختی برای سازندگان و تیم‌ها ارائه می‌دهد که شامل دقایق تولید صدا و امکاناتی مانند کلونینگ صدا است، و همچنین نسخه سازمانی API و پلتفرم برای شرکت‌ها در دسترس است.

تاریخچه فنی و خاستگاه
این استارتاپ از پروژه‌ای کوچک توسط شی‌جیا لیاو، پژوهشگر پیشین NVIDIA، شکل گرفت که از کیفیت پایین صداهای مصنوعی ناراضی بود و با آموزش یک مدل تولید صدا روی یک کارت گرافیک، آن را متن‌باز کرد. استقبال سریع جامعه باعث رشد سریع داشبورد توسعه و کاربردهای متنوع شد.

چالش‌های حقوقی و حریم خصوصی
Fish Audio از روش‌هایی برای سازوکار جامعه‌محور آموزش مدل‌ها بهره می‌برد، از جمله دریافت نمونه‌های صوتی از کاربران و پرداخت به کسانی که صدایشان برای آموزش استفاده می‌شود. با این وجود، چند ماه پیش برخی سازندگان مدعی شدند صدای آن‌ها بدون اجازه روی پلتفرم آپلود شده است. شرکت در ابتدا فرآیند DMCA برای حذف محتوای مورد انتقاد داشت اما زمان‌بر بودن روند، انتقادات را به دنبال داشت. طبق اعلام مدیرعامل ریسّا کائو، اکنون فرآیند حذف خودکار شده است: سازندگان می‌توانند با ارسال نمونه کوتاه یا قرارداد مالکیت، درخواست حذف کنند و معمولاً حذف در کمتر از سه دقیقه انجام می‌شود. با این حال، مشکل آپلود غیرمجاز همچنان وجود دارد تا زمانی که صاحب اثر متوجه و درخواست حذف را ثبت کند.

نیاز به استانداردسازی مالکیت صوتی
سرمایه‌گذارانی مانند اوسوکه هوندا از Coreline Ventures بر این باورند که مدل‌های جامعه‌محور تنها زمانی پایدار خواهند بود که اعتماد سازندگان جلب شود. استانداردهایی مانند تأیید مالکیت صوتی، شفافیت در مجوزها، مکانیزم‌های ساده گزارش و حذف، و مدل‌های تقسیم درآمد برای زمانی که صداها به‌صورت تجاری مورد استفاده قرار می‌گیرند، ضروری است.

چرا سرمایه گرفتند و برنامه‌های آتی
در حالی که در مراحل اولیه به‌عنوان یک پروژه متن‌باز کارایی خوبی داشتند و نیازی به سرمایه خارجی احساس نمی‌شد، Fish Audio برای توسعه مدل‌های پیچیده‌تر و پاسخگویی به نیازهای سازمانی تصمیم به جذب سرمایه گرفت. این شرکت قصد دارد در سال جاری مدل درک صوتی (audio understanding) و مدل گفتار به گفتار (speech-to-speech) منتشر کند.

رقابت بازار
بازار تولید صداهای مبتنی بر هوش مصنوعی رقابتی است و بازیگرانی مانند ElevenLabs، WellSaid، Cartesia، Speechify، Async (قبلاً Podcastle) و Krisp نیز خدمات مشابهی به سازندگان و شرکت‌ها ارائه می‌دهند. به گفته سرمایه‌گذاران 359 Capital، کنترل‌های دقیق برای توسعه‌دهندگان و آموزش مدل با هزینه کارآمد از عوامل کلیدی کمک‌کننده به رقابت Fish Audio در برابر آزمایشگاه‌های بزرگ هوش مصنوعی خواهد بود.

جمع‌بندی
با جذب ۵۲ میلیون دلار و رشد کاربری قابل‌توجه، Fish Audio در موقعیتی قرار دارد که هم بازار سازندگان خلاق و هم نیازهای سازمانی را هدف قرار دهد. چالش‌های حقوقی مرتبط با مالکیت صدا و شفافیت در مجوزدهی همچنان از مهم‌ترین مسائل حوزه تولید صدا با هوش مصنوعی هستند که حل آن‌ها برای تداوم رشد و جلب اعتماد سازندگان حیاتی است. Fish Audio با تمرکز بر توسعه مدل‌های پیشرفته و مکانیزم‌های حذف و تأیید مالکیت، در صدد تبدیل شدن به بازیگری کلیدی در این حوزه است.

تبدیل صوت به متن با هوش مصنوعی

دیدگاه‌ خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

اسکرول به بالا