به گزارش سایت بینا ویرا، تحولات جدید در ارزیابی هوش مصنوعی به بحث‌های داغی در این حوزه دامن زده است. هوش مصنوعی نه تنها در زندگی روزمره بلکه در جنبه‌های مختلف صنعتی حضور عمیقی دارد و با وجود این، اندازه‌گیری آن به نظر می‌رسد که همچنان مبحثی پیچیده و به شدت بحث‌برانگیز باشد.

در حالی که بسیاری از دانشمندان به استفاده از معیارهای سنجش مانند MMLU (Massive Multitask Language Understanding) برای ارزیابی قابلیت‌های مدل‌های هوش مصنوعی پرداخته‌اند، انتقادات زیادی پیرامون کفایت این استانداردها برای سنجش دقیق هوش وجود دارد. به عنوان مثال، مدل‌های مختلف مانند Claude 3.5 Sonnet و GPT-4.5 به رغم کسب امتیازات مشابه در این آزمون‌ها، در عملکرد واقعی تفاوت‌های قابل توجهی دارند.

اخیراً با آغاز نسل جدیدی از بنچمارک‌ها، مانند ARC-AGI که با هدف ارتقاء توانایی استدلال عمومی و حل مسائل خلاقانه طراحی شده، بحث‌ها در مورد چگونگی سنجش “هوش” در هوش مصنوعی دوباره شدت گرفته است. این بنچمارک و دیگر تلاش‌ها برای بهبود چارچوب‌های ارزیابی، تحولی مورد استقبال صنعت محسوب می‌شود.

به‌علاوه، پروژه‌ای به نام “آخرین امتحان بشریت” نیز به این زمینه افزوده شده است که شامل ۳۰۰۰ سوال بررسی‌شده از نظر علمی در زمینه‌های مختلف است. با این حال، نتایج اولیه نشان داده‌اند که این آزمون نیز از نظر ارزیابی قابلیت‌های عملی هوش مصنوعی با چالش‌هایی مواجه است.

برای مثال، برخی مدل‌های پیشرفته در دقت و توانایی شمارش ساده ناتوان بوده‌اند، که این موضوع نشان‌دهنده عدم تطابق بین پیشرفت‌های ناشی از استانداردهای بنچمارک و قابلیت‌های واقعی در دنیای کاراست. در این راستا، بنچمارک GAIA به عنوان یک تغییر ضروری در روش‌های ارزیابی هوش مصنوعی معرفی شده است و با همکاری تیم‌های Meta-FAIR، Meta-GenAI، HuggingFace و AutoGPT ایجاد شده است.

GAIA با ۴۶۶ سوال متنوع در سه سطح دشواری طراحی شده که نمایانگر پیچیدگی واقعی مسائل تجاری است. با تمرکز بر انعطاف‌پذیری، این بنچمارک به بررسی توانایی‌های کلیدی از جمله مرور وب، درک چندوجهی و استدلال پیچیده پرداخته و به مدل‌ها کمک می‌کند تا در زمینه‌های واقعی عملکرد بهتری از خود نشان دهند.

با توجه به پیشرفت‌های صورت گرفته در ارزیابی هوش مصنوعی، مشخص است که آینده این حوزه به سمت ارزیابی‌های جامع‌تری از قابلیت‌های حل مسئله پیش خواهد رفت. بنچمارک GAIA به‌عنوان استاندارد جدیدی در سنجش قابلیت‌های هوش مصنوعی، چالش‌ها و فرصت‌های استقرار هوش مصنوعی در دنیای واقعی را بهتر منعکس می‌کند.

تبدیل صوت به متن فارسی

دیدگاه‌ خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

اسکرول به بالا