عنوان: نیویورکتایمز و نیویورک دیلینیوز: ادعای پنهانکاری اوپنایآی درباره جستوجوی دادههای گفتگو و مجموعههای آموزشی
نیویورکتایمز و نیویورک دیلینیوز مدعی شدهاند که اوپنایآی (OpenAI) در جریان پرونده دعاوی حقوق نشر دو ساله، درباره تواناییاش در جستوجوی دادههای لاگهای گفتگو با کاربران و مجموعههای آموزشی که ممکن است شامل آثار دارای حق نشر این رسانهها باشد، اطلاعات نادرست ارائه کرده است. این پرونده که بهدنبال آن است تعیین کند آیا مدلهای مولد زبانی اوپنایآی با استفاده از محتوای روزنامهها آموزش داده شده و آثار روزنامهنگاری را بازتولید کردهاند یا خیر، در ماههای اخیر به یکی از مهمترین نبردهای حقوقی در حوزه هوش مصنوعی و حقوق نشر تبدیل شده است.
در دفاعیات قبلی، اوپنایآی اعلام کرده بود که امکان جستوجو در کورپوس آموزشی خود را ندارد و بازیابی و پردازش لاگهای گفتگوی کاربران را بهدلیل دشواری فنی و ملاحظات حفظ حریم خصوصی کاربران غیرعملی میداند. رسانهها اما خواستار دسترسی به این دادهها بودند تا مشخص شود آیا محتوای دارای حق نشر آنها در مجموعه آموزش قرار دارد و تا چه اندازه پاسخهای تولیدشده توسط ChatGPT حاوی یا متأثر از آن محتوا بوده است.
طبق ادعاهای تازه منتشرشده، در یک ادای سوگند دادگاه در آوریل، مهندس حریم خصوصی دادههای اوپنایآی، وینی موناکو، گفته است که شرکت قبلاً جستوجوها و ارزیابیهای داخلی روی مجموعه آموزشی خود برای یافتن آثار روزنامهنگاری دارای حق نشر انجام داده است. بر اساس این اظهارات، اوپنایآی از پیش از اقامه دعوی نیویورکتایمز مجموعهای شامل حدود 78 میلیون گفتگوی «غیرقابل شناساییشده» (de-identified) از مکالمات ChatGPT گردآوری کرده بود تا میزان بازتولید آثار دیگران توسط مدل را بررسی کند. «غیرقابل شناساییشده» در اینجا به معنای حذف یا مبهمسازی اطلاعات هویتی کاربران است تا حریم خصوصی آنها حفظ شود، اما همچنان امکان تحلیل محتوا را فراهم میکند.
علاوه بر این، گفته میشود اوپنایآی ابزار فیلترِ بهاصطلاح «بلوم» (Bloom) را در چارچوب مجموعهای از ابزارها تحت عنوان «پروژه زرافه» (Project Giraffe) پیادهسازی کرده تا موارد بازتولید مستقیم متنها در خروجیها را شناسایی و ثبت کند؛ اقدامی که ظاهراً اندکی پس از آغاز رأیگیریهای حقوقی دنبال شده است. این دو افشاگری برای شاکیان اهمیت ویژهای دارد، زیرا نشان میدهد برخلاف ادعاهای قبلی شرکت، دادهها و ابزارهایی برای بررسی بازتولید محتوا موجود بوده است.
شاکیان پیشتر از اوپنایآی خواسته بودند نمونهای از 120 میلیون لاگ گفتگو را ارائه کند، اما شرکت پس از مذاکرات نمونه را به 20 میلیون کاهش داد. اوپنایآی در دسامبر گذشته نمونه کاهشیافته را به دادگاه تحویل داد، اما شاکیان مدعیاند که حجم زیاد خطوط سیاهپوش (redactions) در نمونه موجب شده بود نمونه «غیرقابل استفاده» باشد. همچنین ادعا شده اوپنایآی پس از اقامه دعوی میلیاردها خروجی ChatGPT را حذف کرده که نقض دستور حفظ مدارک دادگاه بوده و در نمونه ارائهشده نیز میلیونها لاگ جایگزین شده است. به بیان دیگر، شاکیان میگویند شرکت عمداً دسترسی به شواهدی را که پیشتر گردآوری کرده بود دشوار ساخته است.
ایان بی. کراسبی، وکیل ارشد شاکیان، در بیانیهای گفته است: «اگر اوپنایآی واقعاً معتقد بود که کپیبرداری از آثار روزنامهنگاری موکلانمان منصفانه و قانونی است، حقیقت در مورد انجام این کار را پنهان نمیکرد.» شاکیان از قاضی خواستهاند اوپنایآی را بهخاطر آنچه «ممانعت از کشف مدارک و دستکاری در فرآیند دادرسی» مینامند، تنبیه کند. خواستههای مشخص آنها شامل عدم پذیرش نمونه 20 میلیونی بهعنوان مدرک بهدلیل غیرقابل اطمینان بودن، رسمیتدادن این فرض که لاگهای ChatGPT نشاندهنده بازتولید گسترده محتوا هستند، منع اوپنایآی از طرح دفاعهایی مبتنی بر اینکه لاگها نشاندهنده بازتولید قابلتوجهی نیستند، و جبران هزینههای حقوقی شاکیان است.
اوپنایآی اما اتهامات را رد کرده و سخنگوی شرکت، درو پوساتری، نیویورکتایمز را متهم به تلاش برای دسترسی به گفتگوهای خصوصی کاربران با هدف تقویت پرونده ضعیفش کرده است. او گفته است: «با تضعیف پرونده نیویورکتایمز و حذف برخی ادعاها، آنها در تلاشاند حریم خصوصی افراد بیارتباط با این پرونده را نقض کنند. ما به دفاع از حریم خصوصی کاربران و اصول دیرپای استفاده منصفانه (fair use) ادامه خواهیم داد.»
ابعاد این مناقشه حقوقی فراتر از اختلافات میان یک شرکت فناور و چند رسانه است؛ نتیجه آن میتواند تعیینکننده مرزبندیهای حقوق نشر در آموزش مدلهای هوش مصنوعی، الزام به شفافیت در فرآیندهای آموزشی و نحوه حفظ و استفاده از لاگهای مکالمه کاربران باشد. پیگیری این پرونده و تصمیمات دادگاه میتواند تأثیر قابلتوجهی بر آینده دسترسی رسانهها به شواهد و نیز سازوکارهای حریم خصوصی در سرویسهای مبتنی بر هوش مصنوعی داشته باشد.
پرونده هماکنون در جریان است و منتظر تصمیم قضات درباره درخواستهای تنبیهی و تعیین صلاحیت مدارک ارائهشده توسط اوپنایآی است.
