عنوان: ادعای مشاور علمی کاخ سفید درباره Kimi K3: تقطیر از Fable و استفاده از تراشه‌های ممنوعه

مشاور علمی کاخ سفید، مایکل کراسیوس، در پستی توییتری مدعی شد مدل زبانی بزرگ Kimi K3 که توسط شرکت چینی Moonshot عرضه شده و به‌عنوان یکی از بزرگ‌ترین مدل‌های متن‌باز (open-weight LLM) شناخته می‌شود، با «تقلید و تقطیر» از مدل Fable شرکت Anthropic ساخته شده و در فرایند آموزشی از تراشه‌هایی بهره برده است که صادرات آنها به چین مجاز نیست. کراسیوس این اقدامات را «تقطیر صنعتی گسترده و مخفیانه» برای سرقت فناوری‌های اختصاصی ایالات متحده و تضعیف تحقیقات آمریکایی خواند.

واکنش شرکت‌ها و ابهامات فنی
Moonshot تا کنون به پرسش‌ها درباره روش آموزش مدل خود پاسخی نداده و کراسیوس نیز جزئیات بیشتری درباره منابع اتهاماتش منتشر نکرده است. در همین راستا، برخی مقامات دیگر نیز از وجود «واترمارک»های مدل‌های آمریکایی در نمونه‌هایی از مدل‌های چینی گزارش داده‌اند، هرچند ماهیت فنی این واترمارک‌ها روشن نیست و نهادهای مربوطه در توضیح بیشتر درباره شواهد اعلام‌شده سکوت کرده‌اند.

تقطیر مدل چیست و چرا محل بحث است؟
تقطیر (distillation) به فرایندی اطلاق می‌شود که در آن یک مدل بزرگ‌تر با پرسش و پاسخ‌گیری سیستماتیک، اطلاعات و رفتار خود را در اختیار یک مدل کوچک‌تر قرار می‌دهد تا مدل جدید بتواند رفتار مشابهی ارائه کند. این فرایند می‌تواند شامل استخراج «زنجیرهٔ فکری» یا پاسخ‌های میانی باشد تا سپس با روش‌هایی مانند آموزش نظارتی (supervised fine-tuning) یا تنظیم با یادگیری تقویتی، مدل مقصد آموزش داده شود. اما کارشناسان می‌گویند رسیدن به سطح عملکرد مدل‌هایی چون Kimi K3 صرفاً با تقطیر سریع از یک مدل گذشته‌ای مانند Fable بعید به‌نظر می‌رسد.

نظر کارشناسان درباره سرعت پیشرفت و نقش تقطیر
برادن هنکاک، پژوهشگر مؤسسه Laude و یکی از بنیان‌گذاران Snorkel AI، به این نکته اشاره می‌کند که Fable از اوایل ژوئیه در دسترس عموم بوده و به‌دست آوردن دیتای کافی، آموزش و عرضه مدلی با قدرت مشابه ظرف چند هفته منطقی نیست. نیتن لمبرت از مؤسسه آلن نیز معتقد است که با پیچیده‌تر شدن معماری‌ها، مزیت آموزش نظارتی کاهش یافته و برای رسیدن به قابلیت‌های پیشرفته‌تر معمولاً نیاز به روش‌های یادگیری تقویتی (RL) و زیرساخت‌های محاسباتی گسترده‌تر است.

زیرساخت و هزینه‌های یادگیری تقویتی
برای اجرای چرخه‌های یادگیری تقویتی در مقیاس بزرگ معمولاً نیاز به عامل‌های متعدد و توان محاسباتی فراوان است؛ استفاده از API مدل‌های پیشرو برای این منظور می‌تواند هزینه‌بر و زمان‌بر باشد و ممکن است حتی بازدهی قابل‌توجهی ایجاد نکند. بنابراین بسیاری از خبره‌ها معتقدند که رسیدن سریع به عملکردهای مرزآفرین بدون دسترسی به زیرساخت و داده‌های گسترده نامحتمل است.

اتهامات Anthropic و سابقه تقطیر
پیش‌تر شرکت Anthropic مدعی شده بود که شرکت‌های مختلفی از جمله Moonshot، DeepSeek و MiniMax به‌صورت سیستماتیک از مدل‌های آن‌ها تقطیر انجام داده‌اند و میلیون‌ها تبادل بین مدل‌های Anthropic و کاربرانی که از طریق آدرس‌های IP و سایر متادیتاها مربوط به این شرکت‌ها تشخیص داده شده‌اند را یافته‌اند؛ Anthropic این رفتارها را «خلاف الگوهای استفادهٔ عادی» و نشان‌دهنده استخراج عمدی قابلیت‌ها توصیف کرده است. این شرکت در پاسخ به پرسش‌های رسانه‌ای درباره تقطیر Fable توضیحات تکمیلی ارائه نکرده است.

مسأله تراشه‌ها: Grace Blackwell 300 و GB300
هم‌زمان با اتهامات مربوط به تقطیر، کراسیوس و دیگران اشاره کرده‌اند که Moonshot به تراشه‌های پیشرفته Nvidia مانند Grace Blackwell 300 و سرورهای مجهز به GB300 دسترسی داشته است؛ این تراشه‌ها صادرات‌شان به چین ممنوع است. وجود بازار سیاه برای تراشه‌های پیشرفته و پرونده‌هایی مانند کیفرخواست علیه بنیان‌گذار یک سازنده سرور آمریکایی به‌دلیل قاچاق تراشه‌ها، نشان می‌دهد دسترسی به سخت‌افزار پیشرفته یک چالش امنیتی و حقوقی است.

نیاز به شفافیت، قوانین «مشتری‌شناسی» و نظارت بر دیتاسنترها
تحلیل‌گران امنیت فناوری خواستار قوانین «مشتری‌شناسی» (know-your-customer) برای دیتاسنترها و شفافیت بیشتر در مورد اجرای آموزش‌های بزرگ روی سخت‌افزارهای پیشرفته هستند. وزارت بازرگانی آمریکا در ۲۰۲۴ پیش‌نویس قواعدی برای این منظور پیشنهاد داده بود، اما پیشرفت قانونی کامل در این زمینه هنوز مبهم است. صادرکنندگان سخت‌افزار هم موظف‌اند اطمینان حاصل کنند که تجهیزات فقط برای مقاصد مجاز استفاده می‌شوند.

جمع‌بندی و پیامدها
اتهامات مبنی بر تقطیر سیستماتیک و استفاده از تراشه‌های ممنوعه اگر ثابت شوند، می‌توانند پیامدهای گسترده‌ای برای سیاست‌گذاری صادرات، تنظیم بازار هوش مصنوعی و رقابت بین‌المللی در فناوری‌های پیشرفته داشته باشند. در عین حال، کارشناسان فنی هشدار می‌دهند که صرفاً تقطیر ممکن است عامل واحدی برای رسیدن به مرزهای عملکردی نباشد و ترکیبی از دسترسی به داده، تخصص پژوهشی و زیرساخت محاسباتی برای ایجاد مدل‌های پیشرفته ضروری است. ادامه بررسی‌ها و انتشار شواهد فنی بیشتر برای روشن شدن ابعاد این پرونده ضروری است.

راهنمای هوش مصنوعی

دیدگاه‌ خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

اسکرول به بالا