عنوان: نیویورک‌تایمز و نیویورک دیلی‌نیوز: ادعای پنهان‌کاری اوپن‌ای‌آی درباره جست‌وجوی داده‌های گفتگو و مجموعه‌های آموزشی

نیویورک‌تایمز و نیویورک دیلی‌نیوز مدعی شده‌اند که اوپن‌ای‌آی (OpenAI) در جریان پرونده دعاوی حقوق نشر دو ساله، درباره توانایی‌اش در جست‌وجوی داده‌های لاگ‌های گفتگو با کاربران و مجموعه‌های آموزشی که ممکن است شامل آثار دارای حق نشر این رسانه‌ها باشد، اطلاعات نادرست ارائه کرده است. این پرونده که به‌دنبال آن است تعیین کند آیا مدل‌های مولد زبانی اوپن‌ای‌آی با استفاده از محتوای روزنامه‌ها آموزش داده شده و آثار روزنامه‌نگاری را بازتولید کرده‌اند یا خیر، در ماه‌های اخیر به یکی از مهم‌ترین نبردهای حقوقی در حوزه هوش مصنوعی و حقوق نشر تبدیل شده است.

در دفاعیات قبلی، اوپن‌ای‌آی اعلام کرده بود که امکان جست‌وجو در کورپوس آموزشی خود را ندارد و بازیابی و پردازش لاگ‌های گفتگوی کاربران را به‌دلیل دشواری فنی و ملاحظات حفظ حریم خصوصی کاربران غیرعملی می‌داند. رسانه‌ها اما خواستار دسترسی به این داده‌ها بودند تا مشخص شود آیا محتوای دارای حق نشر آنها در مجموعه آموزش قرار دارد و تا چه اندازه پاسخ‌های تولیدشده توسط ChatGPT حاوی یا متأثر از آن محتوا بوده است.

طبق ادعاهای تازه منتشرشده، در یک ادای سوگند دادگاه در آوریل، مهندس حریم خصوصی داده‌های اوپن‌ای‌آی، وینی موناکو، گفته است که شرکت قبلاً جست‌وجوها و ارزیابی‌های داخلی روی مجموعه آموزشی خود برای یافتن آثار روزنامه‌نگاری دارای حق نشر انجام داده است. بر اساس این اظهارات، اوپن‌ای‌آی از پیش از اقامه دعوی نیویورک‌تایمز مجموعه‌ای شامل حدود 78 میلیون گفتگوی «غیرقابل شناسایی‌شده» (de-identified) از مکالمات ChatGPT گردآوری کرده بود تا میزان بازتولید آثار دیگران توسط مدل را بررسی کند. «غیرقابل شناسایی‌شده» در اینجا به معنای حذف یا مبهم‌سازی اطلاعات هویتی کاربران است تا حریم خصوصی آنها حفظ شود، اما همچنان امکان تحلیل محتوا را فراهم می‌کند.

علاوه بر این، گفته می‌شود اوپن‌ای‌آی ابزار فیلترِ به‌اصطلاح «بلوم» (Bloom) را در چارچوب مجموعه‌ای از ابزارها تحت عنوان «پروژه زرافه» (Project Giraffe) پیاده‌سازی کرده تا موارد بازتولید مستقیم متن‌ها در خروجی‌ها را شناسایی و ثبت کند؛ اقدامی که ظاهراً اندکی پس از آغاز رأی‌گیری‌های حقوقی دنبال شده است. این دو افشاگری برای شاکیان اهمیت ویژه‌ای دارد، زیرا نشان می‌دهد برخلاف ادعاهای قبلی شرکت، داده‌ها و ابزارهایی برای بررسی بازتولید محتوا موجود بوده است.

شاکیان پیش‌تر از اوپن‌ای‌آی خواسته بودند نمونه‌ای از 120 میلیون لاگ گفتگو را ارائه کند، اما شرکت پس از مذاکرات نمونه را به 20 میلیون کاهش داد. اوپن‌ای‌آی در دسامبر گذشته نمونه کاهش‌یافته را به دادگاه تحویل داد، اما شاکیان مدعی‌اند که حجم زیاد خطوط سیاه‌پوش (redactions) در نمونه موجب شده بود نمونه «غیرقابل استفاده» باشد. همچنین ادعا شده اوپن‌ای‌آی پس از اقامه دعوی میلیاردها خروجی ChatGPT را حذف کرده که نقض دستور حفظ مدارک دادگاه بوده و در نمونه ارائه‌شده نیز میلیون‌ها لاگ جایگزین شده است. به بیان دیگر، شاکیان می‌گویند شرکت عمداً دسترسی به شواهدی را که پیش‌تر گردآوری کرده بود دشوار ساخته است.

ایان بی. کراسبی، وکیل ارشد شاکیان، در بیانیه‌ای گفته است: «اگر اوپن‌ای‌آی واقعاً معتقد بود که کپی‌برداری از آثار روزنامه‌نگاری موکلان‌مان منصفانه و قانونی است، حقیقت در مورد انجام این کار را پنهان نمی‌کرد.» شاکیان از قاضی خواسته‌اند اوپن‌ای‌آی را به‌خاطر آنچه «ممانعت از کشف مدارک و دستکاری در فرآیند دادرسی» می‌نامند، تنبیه کند. خواسته‌های مشخص آنها شامل عدم پذیرش نمونه 20 میلیونی به‌عنوان مدرک به‌دلیل غیرقابل اطمینان بودن، رسمیت‌دادن این فرض که لاگ‌های ChatGPT نشان‌دهنده بازتولید گسترده محتوا هستند، منع اوپن‌ای‌آی از طرح دفاع‌هایی مبتنی بر اینکه لاگ‌ها نشان‌دهنده بازتولید قابل‌توجهی نیستند، و جبران هزینه‌های حقوقی شاکیان است.

اوپن‌ای‌آی اما اتهامات را رد کرده و سخنگوی شرکت، درو پوساتری، نیویورک‌تایمز را متهم به تلاش برای دسترسی به گفتگوهای خصوصی کاربران با هدف تقویت پرونده ضعیفش کرده است. او گفته است: «با تضعیف پرونده نیویورک‌تایمز و حذف برخی ادعاها، آنها در تلاش‌اند حریم خصوصی افراد بی‌ارتباط با این پرونده را نقض کنند. ما به دفاع از حریم خصوصی کاربران و اصول دیرپای استفاده منصفانه (fair use) ادامه خواهیم داد.»

ابعاد این مناقشه حقوقی فراتر از اختلافات میان یک شرکت فناور و چند رسانه است؛ نتیجه آن می‌تواند تعیین‌کننده مرزبندی‌های حقوق نشر در آموزش مدل‌های هوش مصنوعی، الزام به شفافیت در فرآیندهای آموزشی و نحوه حفظ و استفاده از لاگ‌های مکالمه کاربران باشد. پیگیری این پرونده و تصمیمات دادگاه می‌تواند تأثیر قابل‌توجهی بر آینده دسترسی رسانه‌ها به شواهد و نیز سازوکارهای حریم خصوصی در سرویس‌های مبتنی بر هوش مصنوعی داشته باشد.

پرونده هم‌اکنون در جریان است و منتظر تصمیم قضات درباره درخواست‌های تنبیهی و تعیین صلاحیت مدارک ارائه‌شده توسط اوپن‌ای‌آی است.

تبدیل متن‌ به صوت

دیدگاه‌ خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

اسکرول به بالا