در ابتدای هفته جاری، متا با استفاده از نسخهای آزمایشی و غیرمنتشره از مدل Llama 4 Maverick دچار حاشیه شد. این اقدام باعث شد نمره بالایی در یک معیار جمعسپاری شده تحت عنوان LM Arena کسب کند. این واقعه موجب شد که برگزارکنندگان LM Arena از کاربرانی که تحت تأثیر این اتفاق قرار گرفته بودند، عذرخواهی کنند و سیاستهای خود را تغییر دهند، به طوری که اکنون تنها نمرات مدلهای بدون تغییر را میسنجند. بررسیها نشان داد که نسخه اصلی و بدون تغییر Maverick با نام “Llama-4-Maverick-17B-128E-Instruct” در مقایسه با مدلهایی نظیر GPT-4 OpenAI، Claude 3.5 Sonnet از Anthropic و Gemini 1.5 Pro از گوگل در رتبهبندی پایینتری قرار گرفته است. بسیاری از این مدلها ماههاست که عرضه شدهاند.
نسخه منتشره Llama 4 پس از فاش شدن تقلب در LM Arena به این پلتفرم اضافه شد، اما به دلیل جایگاه پایین آن، ممکن است کاربرانی متوجه حضور آن نشوند، چرا که به رتبه 32 ام در لیست نمرات نیاز است تا به آن دسترسی پیدا کنند.
اما دلیل عملکرد ضعیف این مدل چیست؟ متا توضیح داده که Maverick آزمایشی، با نام Llama-4-Maverick-03-26-Experimental، «برای مکالمه بهینهسازی شده» است. این بهینهسازیها به وضوح در LM Arena عملکرد خوبی داشت، جایی که ارزیابهای انسانی خروجیهای مدلها را مقایسه و انتخاب میکنند. همانطور که پیشتر اشاره کردیم، LM Arena به دلایل مختلف هرگز بهعنوان یک معیار قابل اعتماد برای ارزیابی عملکرد مدلهای هوش مصنوعی شناخته نشده است. با این حال، سازگار کردن یک مدل با یک معیار خاص، نه تنها گمراهکننده است، بلکه پیشبینی اینکه مدل در شرایط مختلف چگونه عمل خواهد کرد را دشوار میکند.
در بیانیهای، یکی از سخنگویان متا به TechCrunch گفت: «متا با تمامی انواع نسخههای سفارشی آزمایش میکند.» وی افزود: «‘Llama-4-Maverick-03-26-Experimental’ نسخهای بهینهشده برای چت است که ما آن را آزمایش کردهایم و همچنین در LM Arena عملکرد خوبی دارد. ما اکنون نسخه متنباز خود را منتشر کردهایم و منتظر هستیم ببینیم توسعهدهندگان چگونه Llama 4 را برای موارد استفاده خود سفارشیسازی میکنند. ما بسیار هیجانزده هستیم که چه چیزی از سوی آنها ساخته خواهد شد و منتظر بازخوردهای مداوم آنها هستیم.»
