General Intuition: وقتی مدل‌های پایه جای جمع‌آوری داده‌های عظیم رباتیک را می‌گیرند

شرکت General Intuition با رهیافتی مشابه انقلاب مدل‌های پایه در پردازش زبان طبیعی، مدعی است که آینده «هوش‌مصنوعی تجسدی» (embodied AI) بر پایه مدل‌های عمومی و قابل تعمیم خواهد بود و نه مجموعه‌های عظیم و اختصاصی داده‌های دنیای واقعی. پیم دو ویت، مدیرعامل این استارتاپ، در گفت‌وگو با TechCrunch اعلام کرد که به‌جای ساخت مدل‌های ویژه برای هر ربات یا محیط خاص، سرمایه‌گذاری روی داده‌های باکیفیت و آموزش مدل‌های پایه‌ای که «شهود حرکتی و تعاملی» را منتقل کنند، راه مقرون‌به‌صرفه‌تر و مقیاس‌پذیرتری است.

از مدل‌های تخصصی تا مدل‌های پایه: یک تغییر پارادایم
تا پیش از ظهور GPT-3 و نسل مدل‌های پایه زبان، شرکت‌ها مدل‌های پردازش زبان را از صفر و برای هر کاربرد مشخص آموزش می‌دادند. امروز اغلب سازمان‌ها با یک مدل عمومی مانند خانواده GPT، Claude یا Llama آغاز کرده و سپس آن را برای کاربردهای خاص تنظیم می‌کنند. General Intuition معتقد است همین الگو در رباتیک نیز قابل اجراست: به‌جای صرف میلیون‌ها ساعت ضبط داده‌های واقعی، کافی است مدل پایه‌ای داشته باشیم که سطحی از استدلال فضایی-زمانی را در خود جای داده باشد و سپس با داده‌های اندک، آن را به ربات‌های واقعی تطبیق دهیم.

روش و داده‌ها: بازی‌های ویدیویی به‌عنوان منبع آموزشی
این شرکت مدل پایه خود را با آموزش روی میلیون‌ها ساعت داده از بازی‌های ویدیویی توسعه داده است؛ داده‌هایی که فقط ویدئو نیستند بلکه «داده‌های کنشی» مانند فشردن دکمه‌ها و زمان‌بندی آن‌ها را نیز ثبت می‌کنند. دو ویت و سرمایه‌گذار ارشد شرکت، وینود خوسلا، معتقدند همین اطلاعات مربوط به عمل و واکنش انسانی کلید به‌دست‌آوردن شهودی انسان‌مانند در استدلال فضایی-زمانی است.

نمونه‌های عملکرد و دستاوردها
General Intuition نشان داده که مدل فعلی آن‌ها هم توانایی بازی طولانی در محیط‌های ویدیویی را دارد و هم می‌تواند پس از «فاین‌تیون» با تنها هشت دقیقه داده واقعی رباتیک، یک ربات چهارپای واقعی را راه‌اندازی کند. به‌گفته دو ویت، ربات توانسته به‌صورت صفر-شات (بدون تجربه قبلی در آن سناریو) و تنها با استفاده از دوربین جلویی در محیط اداری و در حضور اشیاء متحرک و انسان‌ها عملکرد قابل‌توجهی نشان دهد — دستاوردی که تیم را شگفت‌زده کرده است.

مدل پایه به‌عنوان زیرساخت: نه تولید نهایی ربات
هدف نهایی General Intuition تولید ربات نیست؛ آن‌ها می‌خواهند به عنوان «مدل پایه فیزیکی» شناخته شوند؛ بستری که سایر شرکت‌های رباتیک بتوانند روی آن بنا کنند و توسعه محصولات فیزیکی را ساده‌تر و سریع‌تر کنند. به بیان دو ویت: ما نمی‌خواهیم شرکت خودران بسازیم؛ بلکه قصد داریم ده برابر ساختن چنین شرکتی را آسان‌تر کنیم.

پیامدها و ملاحظات برای صنعت
– کاهش نیاز به داده‌های حجیم دنیای واقعی: اگر ادعای General Intuition صحیح باشد، بسیاری از پروژه‌های پرهزینه جمع‌آوری داده ممکن است غیرضروری شوند و سرعت نوآوری افزایش یابد.
– مقیاس‌پذیری و صرفه‌جویی در زمان توسعه: مدل‌های پایه می‌توانند به شرکت‌های کوچک‌تر امکان دهند با حجم کمتر داده واقعی به عملکردهای پیچیده دست یابند.
– چالش‌ها و محدودیت‌ها: شکاف دامنه (domain gap) بین شبیه‌سازی/بازی و دنیای واقعی، مسائل ایمنی و قابلیت اعتماد در محیط‌های نامطمئن، و نیاز به آزمایش گسترده در شرایط واقعی همچنان از موانع مهم باقی می‌مانند.
– پیامدهای اقتصادی و شغلی: تسهیل توسعه رباتیک ممکن است ساختار بازار و مدل‌های کسب‌وکار در حوزه رباتیک را تغییر دهد.

سرمایه و رشد
این استارتاپ اخیراً حدود 320 میلیون دلار سرمایه جذب کرده و بر اساس ارزش‌گذاری، معادل 2.3 میلیارد دلار ارزیابی شده است؛ نشانه‌ای از اعتماد سرمایه‌گذاران به فرضیه کاربردی‌سازی مدل‌های پایه در جهان فیزیکی.

جمع‌بندی
رویکرد General Intuition بازتاب‌دهنده یک تحول استراتژیک در مسیر تکامل هوش‌مصنوعی تجسدی: حرکت از ساخت مدل‌های اختصاصی برای هر ربات و محیط به سمت توسعه مدل‌های پایه‌ای که با داده‌های کمتر قابل تطبیق هستند. اگرچه نتیجه نهایی و میزان تعمیم‌پذیری در محیط‌های پیچیده دنیای واقعی هنوز نیازمند آزمون و تأیید بیشتر است، این رویکرد می‌تواند سرعت نوآوری در رباتیک را به‌طور چشمگیری افزایش دهد و نحوه طراحی و توسعه سامانه‌های فیزیکی هوشمند را تغییر دهد.

ایجاد تصاویر خلاقانه با هوش مصنوعی

دیدگاه‌ خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

اسکرول به بالا