سرمایهگذاری در تفسیرپذیری هوش مصنوعی: هدف جدید آنتروپیک
در جدیدترین مقالهای که به قلم داریو آمودئی، مدیرعامل آنتروپیک، منتشر شده است، به کمبودهای موجود در درک عمیق از عملکرد مدلهای پیشرفته هوش مصنوعی اشاره شده است. آمودئی هدفی بلندپروازانه برای آنتروپیک تعیین کرده است تا تا سال ۲۰۲۷، بتواند مشکلات مدلهای هوش مصنوعی را بهطور قابل اعتمادی شناسایی کند.
در این مقاله با عنوان “ضرورت تفسیرپذیری”، آمودئی به چالشهای پیش روی محققان در زمینه شفافسازی فرآیندهای تصمیمگیری مدلهای هوش مصنوعی پرداخته و تاکید میکند که راهکارهای ابتدایی در این زمینه به نتیجه رسیدهاند، ولی تحقیقات بیشتری برای فهم عمیقتر از این سیستمها لازم است. او در این زمینه ابراز نگرانی کرده و میگوید: “بسیار نگرانم که چنین سیستمهایی بدون درک بهتری از تفسیرپذیری به کار گرفته شوند. این سیستمها به شدت در اقتصاد، فناوری و امنیت ملی مهم خواهند بود و به قدری خودمختار خواهند بود که تصور میکنم بیخبر بودن کامل بشریت از نحوه کار آنها غیرقابل قبول است.”
آنتروپیک یکی از پیشگامان در زمینه تفسیرپذیری مکانیکی است؛ حوزهای که هدف آن بازکردن “جعبه سیاه” مدلهای هوش مصنوعی و درک دلیل تصمیمگیریهای آنها است. با وجود پیشرفتهای سریع در عملکرد مدلهای هوش مصنوعی، هنوز هم دانش ما در مورد علل تصمیمگیری این سیستمها نسبتاً محدود است. برای مثال، OpenAI به تازگی مدلهای هوش مصنوعی جدیدی به نامهای o3 و o4-mini را رونمایی کرده است که در برخی وظایف عملکرد بهتری دارند، اما به طور همزمان تناقضهایی بیشتری هم بروز میدهند و دلیل این پدیده مشخص نیست.
آمودئی در این مقاله به نظرات کریس اولاه، همبنیانگذار آنتروپیک، اشاره کرده و میگوید مدلهای هوش مصنوعی بیشتر “پرورش داده میشوند تا ساخته شوند”، به این معنی که محققان روشهایی برای بهبود هوش مدلها یافتهاند، اما دلیل این پیشرفتها را بهخوبی نمیدانند. او ادامه میدهد که رسیدن به هوش مصنوعی عمومی (AGI) بدون درک از چگونگی عملکرد این مدلها میتواند خطرناک باشد.
آمودئی میگوید آنتروپیک در درازمدت قصد دارد “تصویربرداریهای مغزی” یا “امآرآی” از مدلهای پیشرفته هوش مصنوعی انجام دهد. این آزمایشها به شناسایی انواع مختلفی از مشکلات در مدلهای هوش مصنوعی کمک خواهد کرد. او این فرآیند را ممکن است پنج تا ده سال به طول بینجامد، اما آن را برای آزمایش و توسعه مدلهای آینده آنتروپیک ضروری میداند.
این شرکت اخیراً پیشرفتهایی در زمینه درک نحوه عملکرد مدلهای هوش مصنوعی خود داشته و به تازگی راههایی برای شناسایی مسیرهای تفکر مدلهای هوش مصنوعی پیدا کرده است. آنتروپیک تنها تعداد کمی از این مسیرهای تفکر را شناسایی کرده و تخمین میزند که میلیونها مورد در مدلهای هوش مصنوعی وجود دارد.
آمودئی همچنین از شرکتهای OpenAI و گوگل دیپمایند خواسته است تا تلاشهای تحقیقاتی خود در این زمینه را افزایش دهند و از دولتها درخواست کرده که با ایجاد سیاستهای ملایم، زمینههای تفسیرپذیری را بهبود بخشند. او همچنین اشاره کرد که ایالات متحده باید کنترلهایی بر صادرات تراشهها به چین وضع کند تا احتمال رقابت خطرناک جهانی در زمینه هوش مصنوعی کاهش یابد.
آنتروپیک همواره با تمرکز بر ایمنی از سایر شرکتهای فناوری متمایز بوده است. در حالیکه سایر شرکتها به لایحه امنیتی جنجالی هوش مصنوعی کالیفرنیا، SB 1047، واکنش منفی نشان دادند، آنتروپیک از آن به شکل ملایمی حمایت کرده و پیشنهادهایی برای بهبود آن ارائه کرد. بهطور کلی، به نظر میرسد که آنتروپیک در تلاش است تا درکی جامع از مدلهای هوش مصنوعی ایجاد کند و نه تنها به افزایش قابلیتهای این سیستمها بپردازد.
