
به گزارش ایسنا، برای شرکتهایی که مدلهای زبانی بزرگ (LLM) میسازند، کتابها چیزی جز خوراکی نیستند که باید بهصورت انبوه بلعیده شوند و پس از استخراج اطلاعاتشان، مانند استخوان ماهی دور انداخته شوند. در بسیاری از موارد، آنها ترجیح میدهند از نسخههای دیجیتالی کتابها استفاده کنند یا حتی بهتر از آن، از نسخههای دیجیتالی دزدیشده استفاده کنند. برای مثال، شرکت «متا» به استفاده از کتابهای دیجیتالی غیرقانونی متهم شده و شرکت «آنتروپیک» نیز به دلیل انجام اقدامی مشابه، مجبور شد ۱.۵ میلیارد دلار به نویسندگان غرامت بپردازد.
اما بسیاری از شرکتها، از جمله «آنتروپیک»، به جای نسخههای دیجیتالی، به سراغ کتابهای چاپی رفتهاند؛ چراکه میتوانند تعداد زیادی نسخه دستدوم را با قیمت بسیار پایین خریداری کنند.
«فیوچریسم» نوشت: بر اساس اسناد مرتبط با همان پرونده حقوقی، «آنتروپیک» از یک دستگاه برش هیدرولیکی استفاده میکرد تا صفحات کتابهایی را که از فروشندگان کتاب خریده بود، بهطور مرتب از جلد جدا کند. سپس این صفحات با تجهیزات تصویربرداری صنعتی اسکن میشدند. به بیان دیگر، این شرکت واقعا کتابهای نویسندگان را تکهتکه میکرد تا هوش مصنوعی خود را آموزش دهد.
این فرایند از یک اصل حقوقی به نام (First-Sale Doctrine) بهره میبرد که به خریدار اجازه میدهد پس از خرید یک کالا، بدون نیاز به اجازه صاحب حق نشر، هر کاری که میخواهد با نسخه خریداریشده انجام دهد.
از آنجا که شرکت «آنتروپیک» متن چاپی را به نسخه دیجیتال تبدیل میکرد، قاضی آن را استفاده منصفانه تشخیص داد.
اکنون، به گزارش «404 Media»، این شیوه آنقدر رایج شده که حتی فروشندگان باسابقه کتاب نیز به دنبال بهرهبرداری از رونق بازار هوش مصنوعی هستند.
یکی از این شرکتها که «ISBNdb» است و خود را «بزرگترین پایگاه داده کتاب جهان» معرفی میکند، اعلام کرده است: «بهترین دادههای آموزشی جهان برای هوش مصنوعی، همین حالا روی یک قفسه کتاب قرار دارند.»
این شرکت تاکید میکند که کتابهای چاپی، برخلاف بسیاری از مطالب اینترنتی امروز، هنوز به نوشتههای ضعیف تولیدشده توسط هوش مصنوعی که اکنون بخش بزرگی از فضای اینترنت و حتی برخی کتابهای جدید را فرا گرفتهاند، آلوده نشدهاند.
در مقالهای که در وبسایت «ISBNdb» منتشر شده و «404 Media» آن را نقل کرده است، اینطور آمده است: «کتابهای چاپی متعلق به دوران پیش از ظهور مدلهای زبانی بزرگ (LLM)، تضمین میشوند که از نظر ساختاری عاری از این آلودگی هستند. همین موضوع بهتنهایی یک مزیت بسیار مهم محسوب میشود.»
همچنین نوشته است: «کتابهای فیزیکی منتشرشده پیش از این دوره (پیش از سال ۲۰۲۲) از نظر ساختاری از آلودگی ناشی از ابزارهای مدرن تولید محتوا در امان ماندهاند.»
شرکت «ISBNdb» که زمانی تمرکز اصلیاش کمک به کتابخانهها، توزیعکنندگان و کتابفروشیها برای یافتن و فروش کتاب بود، اکنون طبق گزارش«404 Media» به شرکتهای هوش مصنوعی کمک میکند تا در هر سفارش، بین ۱,۰۰۰ تا یک میلیون جلد کتاب را بهصورت عمده خریداری کنند.
این شرکت، بهعنوان یک مزیت دیگر، به مشتریان هوش مصنوعی خود وعده میدهد که هویتشان محرمانه باقی بماند، چرا که هیچ شرکتی نمیخواهد مانند «متا» یا «آنتروپیک» در مرکز توجه رسانهها قرار بگیرد. در عین حال، واضح است که این وبسایت «ISBNdb» نشان میدهد که خود این شرکت نیز از بحثبرانگیز بودن این فعالیت آگاه است.
یکی از کتابفروشان مستقل نیز گفته است که در ماه آوریل، فروش هفتگی او ناگهان از حداکثر ۲۰ کتاب به صدها کتاب افزایش یافت و تقریبا مطمئن است که خریداران، آزمایشگاههای هوش مصنوعی هستند.
این کتابفروش افزود که موجودی فروشگاهش شامل کتابهای کمیاب و چاپنشده (Out of Print) است و بنابراین ممکن است، شرکتهای هوش مصنوعی در حال نابود کردن برخی از آخرین نسخههای باقیمانده این آثار باشند.
این کتابفروش به «404 Media» گفت: «از نظر شخصی، احساسات دوگانهای نسبت به این موضوع دارم.
از یک طرف، از نظر مالی به نفع من است و باعث میشود موجودی قدیمیای که احتمال فروشش کم بود، از انبار خارج شود. بهخصوص که کتابهای خارجی زیادی در اختیار دارم و برای چنین فروشهایی مناسب هستند. اما از طرف دیگر، با کاربرد نهایی این کتابها موافق نیستم و خوشم نمیآید که کتابهای کمیاب خمیر شوند.»
به نظر میرسد کتابهای قدیمی بیشتری نیز در معرض خطر باشند.
«404 Media» گزارش داده است که کتابفروشان آثار کمیاب در هلند نیز با موجی از سفارشهای عمده روبهرو شدهاند که گمان میکنند از سوی شرکتهای هوش مصنوعی ثبت میشوند، هرچند راهی برای اطمینان قطعی از این موضوع ندارند.
هرچند نشانههای زیادی ممکن است حاکی از آن باشد که یک سفارش عمده متعلق به یک آزمایشگاه هوش مصنوعی است، اما در بیشتر موارد کتابفروشان فقط میتوانند حدس بزنند و هیچ راهی برای اثبات آن ندارند.
انتهای پیام