به گزارش سایت بینا ویرا، تحولات جدید در ارزیابی هوش مصنوعی به بحثهای داغی در این حوزه دامن زده است. هوش مصنوعی نه تنها در زندگی روزمره بلکه در جنبههای مختلف صنعتی حضور عمیقی دارد و با وجود این، اندازهگیری آن به نظر میرسد که همچنان مبحثی پیچیده و به شدت بحثبرانگیز باشد.
در حالی که بسیاری از دانشمندان به استفاده از معیارهای سنجش مانند MMLU (Massive Multitask Language Understanding) برای ارزیابی قابلیتهای مدلهای هوش مصنوعی پرداختهاند، انتقادات زیادی پیرامون کفایت این استانداردها برای سنجش دقیق هوش وجود دارد. به عنوان مثال، مدلهای مختلف مانند Claude 3.5 Sonnet و GPT-4.5 به رغم کسب امتیازات مشابه در این آزمونها، در عملکرد واقعی تفاوتهای قابل توجهی دارند.
اخیراً با آغاز نسل جدیدی از بنچمارکها، مانند ARC-AGI که با هدف ارتقاء توانایی استدلال عمومی و حل مسائل خلاقانه طراحی شده، بحثها در مورد چگونگی سنجش “هوش” در هوش مصنوعی دوباره شدت گرفته است. این بنچمارک و دیگر تلاشها برای بهبود چارچوبهای ارزیابی، تحولی مورد استقبال صنعت محسوب میشود.
بهعلاوه، پروژهای به نام “آخرین امتحان بشریت” نیز به این زمینه افزوده شده است که شامل ۳۰۰۰ سوال بررسیشده از نظر علمی در زمینههای مختلف است. با این حال، نتایج اولیه نشان دادهاند که این آزمون نیز از نظر ارزیابی قابلیتهای عملی هوش مصنوعی با چالشهایی مواجه است.
برای مثال، برخی مدلهای پیشرفته در دقت و توانایی شمارش ساده ناتوان بودهاند، که این موضوع نشاندهنده عدم تطابق بین پیشرفتهای ناشی از استانداردهای بنچمارک و قابلیتهای واقعی در دنیای کاراست. در این راستا، بنچمارک GAIA به عنوان یک تغییر ضروری در روشهای ارزیابی هوش مصنوعی معرفی شده است و با همکاری تیمهای Meta-FAIR، Meta-GenAI، HuggingFace و AutoGPT ایجاد شده است.
GAIA با ۴۶۶ سوال متنوع در سه سطح دشواری طراحی شده که نمایانگر پیچیدگی واقعی مسائل تجاری است. با تمرکز بر انعطافپذیری، این بنچمارک به بررسی تواناییهای کلیدی از جمله مرور وب، درک چندوجهی و استدلال پیچیده پرداخته و به مدلها کمک میکند تا در زمینههای واقعی عملکرد بهتری از خود نشان دهند.
با توجه به پیشرفتهای صورت گرفته در ارزیابی هوش مصنوعی، مشخص است که آینده این حوزه به سمت ارزیابیهای جامعتری از قابلیتهای حل مسئله پیش خواهد رفت. بنچمارک GAIA بهعنوان استاندارد جدیدی در سنجش قابلیتهای هوش مصنوعی، چالشها و فرصتهای استقرار هوش مصنوعی در دنیای واقعی را بهتر منعکس میکند.
