Fish Audio با جذب ۵۲ میلیون دلار برای توسعه مدلهای صوتی مبتنی بر هوش مصنوعی
شرکت Palo Altoای Fish Audio که در زمینه تولید صداهای طبیعی با هوش مصنوعی فعالیت میکند، در دور سرمایهگذاری اولیه ۵۲ میلیون دلار جذب کرد. این دور سرمایهگذاری توسط Coreline Ventures و Capital Today رهبری شد و سرمایهگذاران دیگری از جمله 359 Capital، Parable، Play Time، Alphalist Partners، Bayhouse Ventures، Carya Venture Partners و HF0 نیز در آن حضور داشتند.
رشد و آمار کلیدی
– بیش از ۸ میلیون کاربر از نسخههای متنباز یا میزبانیشده مدلهای Fish Audio استفاده میکنند.
– درآمد تکرارشونده سالانه (ARR) این شرکت حدود ۲۱ میلیون دلار گزارش شده است.
– مخزن متنباز Fish Speech در GitHub بیش از ۳۱ هزار ستاره دارد و توسط توسعهدهندگان مستقل، طراحان بازی و تولیدکنندههای محتوا مورد استفاده قرار میگیرد.
– مجموعه کنترلهای زبانی طبیعی Fish Audio شامل بیش از ۱۵ هزار دستور برای کنترل لحن و بیان صدا است.
محصولات و مدلها
Fish Audio در یک سال گذشته پنج مدل منتشر کرده است: چهار مدل تولید گفتار و یک مدل تبدیل گفتار به متن. سه مدل تولید گفتار بهصورت متنباز عرضه شدهاند، اما مدل پیشرفته S2.1 Pro تنها از طریق API پولی در دسترس است. شرکت پلنهای ماهانه پرداختی برای سازندگان و تیمها ارائه میدهد که شامل دقایق تولید صدا و امکاناتی مانند کلونینگ صدا است، و همچنین نسخه سازمانی API و پلتفرم برای شرکتها در دسترس است.
تاریخچه فنی و خاستگاه
این استارتاپ از پروژهای کوچک توسط شیجیا لیاو، پژوهشگر پیشین NVIDIA، شکل گرفت که از کیفیت پایین صداهای مصنوعی ناراضی بود و با آموزش یک مدل تولید صدا روی یک کارت گرافیک، آن را متنباز کرد. استقبال سریع جامعه باعث رشد سریع داشبورد توسعه و کاربردهای متنوع شد.
چالشهای حقوقی و حریم خصوصی
Fish Audio از روشهایی برای سازوکار جامعهمحور آموزش مدلها بهره میبرد، از جمله دریافت نمونههای صوتی از کاربران و پرداخت به کسانی که صدایشان برای آموزش استفاده میشود. با این وجود، چند ماه پیش برخی سازندگان مدعی شدند صدای آنها بدون اجازه روی پلتفرم آپلود شده است. شرکت در ابتدا فرآیند DMCA برای حذف محتوای مورد انتقاد داشت اما زمانبر بودن روند، انتقادات را به دنبال داشت. طبق اعلام مدیرعامل ریسّا کائو، اکنون فرآیند حذف خودکار شده است: سازندگان میتوانند با ارسال نمونه کوتاه یا قرارداد مالکیت، درخواست حذف کنند و معمولاً حذف در کمتر از سه دقیقه انجام میشود. با این حال، مشکل آپلود غیرمجاز همچنان وجود دارد تا زمانی که صاحب اثر متوجه و درخواست حذف را ثبت کند.
نیاز به استانداردسازی مالکیت صوتی
سرمایهگذارانی مانند اوسوکه هوندا از Coreline Ventures بر این باورند که مدلهای جامعهمحور تنها زمانی پایدار خواهند بود که اعتماد سازندگان جلب شود. استانداردهایی مانند تأیید مالکیت صوتی، شفافیت در مجوزها، مکانیزمهای ساده گزارش و حذف، و مدلهای تقسیم درآمد برای زمانی که صداها بهصورت تجاری مورد استفاده قرار میگیرند، ضروری است.
چرا سرمایه گرفتند و برنامههای آتی
در حالی که در مراحل اولیه بهعنوان یک پروژه متنباز کارایی خوبی داشتند و نیازی به سرمایه خارجی احساس نمیشد، Fish Audio برای توسعه مدلهای پیچیدهتر و پاسخگویی به نیازهای سازمانی تصمیم به جذب سرمایه گرفت. این شرکت قصد دارد در سال جاری مدل درک صوتی (audio understanding) و مدل گفتار به گفتار (speech-to-speech) منتشر کند.
رقابت بازار
بازار تولید صداهای مبتنی بر هوش مصنوعی رقابتی است و بازیگرانی مانند ElevenLabs، WellSaid، Cartesia، Speechify، Async (قبلاً Podcastle) و Krisp نیز خدمات مشابهی به سازندگان و شرکتها ارائه میدهند. به گفته سرمایهگذاران 359 Capital، کنترلهای دقیق برای توسعهدهندگان و آموزش مدل با هزینه کارآمد از عوامل کلیدی کمککننده به رقابت Fish Audio در برابر آزمایشگاههای بزرگ هوش مصنوعی خواهد بود.
جمعبندی
با جذب ۵۲ میلیون دلار و رشد کاربری قابلتوجه، Fish Audio در موقعیتی قرار دارد که هم بازار سازندگان خلاق و هم نیازهای سازمانی را هدف قرار دهد. چالشهای حقوقی مرتبط با مالکیت صدا و شفافیت در مجوزدهی همچنان از مهمترین مسائل حوزه تولید صدا با هوش مصنوعی هستند که حل آنها برای تداوم رشد و جلب اعتماد سازندگان حیاتی است. Fish Audio با تمرکز بر توسعه مدلهای پیشرفته و مکانیزمهای حذف و تأیید مالکیت، در صدد تبدیل شدن به بازیگری کلیدی در این حوزه است.
