بنبست در «ماشین زمان» اینترنت؛ ناشران بزرگ راه را بر Internet Archive بستند
آرشیو اینترنت (Internet Archive) که با ابزار مشهور Wayback Machine شناخته میشود، دهههاست وظیفه ثبت تاریخچه وب را بر عهده دارد. اما در سال ۲۰۲۶، این نهاد غیرانتفاعی در آتش جنگ میان ناشران خبر و شرکتهای هوش مصنوعی گرفتار شده است. ناشران معتقدند این آرشیو به یک «درِ پشتی» (Backdoor) برای شرکتهای AI تبدیل شده تا بدون پرداخت هزینه، محتواهای کپیرایتدار را استخراج کنند.
چرا ناشران نگران هستند؟
مشکل اصلی در APIهای ساختاریافته آرشیو اینترنت است. رابرت هان، مدیر امور تجاری The Guardian، توضیح میدهد:
«بسیاری از کسبوکارهای AI به دنبال پایگاههای داده ساختاریافته هستند. APIهای آرشیو اینترنت مکانی ایدهآل برای آنهاست تا ماشینهایشان را متصل کرده و مالکیت معنوی ما را بمکند!»
اقدامات ناشران بزرگ علیه آرشیو اینترنت:
-
The Guardian: دسترسی آرشیو را به مقالات منتشر شده محدود کرده و صفحات خود را از اینترفیس URLهای Wayback Machine حذف کرده است.
-
New York Times: به طور کامل دسترسی رباتهای آرشیو (
archive.org_bot) را مسدود (Hard Block) کرده است. -
Reddit: دسترسی این آرشیو را محدود کرده، چرا که معتقد است شرکتهای AI از طریق این سایت، سیاستهای ردیت را دور میزنند.
-
Gannett (USA Today): بیش از ۲۰۰ وبسایت زیرمجموعه این غول رسانهای، حالا رباتهای آرشیو را مسدود کردهاند.
آیا Internet Archive واقعاً مقصر است؟
بروس کال (Brewster Kahle)، بنیانگذار آرشیو اینترنت، هشدار میدهد که این محدودیتها باعث میشود نسلهای آینده به سوابق تاریخی دسترسی نداشته باشند. او معتقد است آرشیو کردن برای حفظ دانش است، نه برای آموزش مدلهای تجاری.
با این حال، شواهد نشان میدهد که نگرانی ناشران بیدلیل نیست:
-
تحلیلها نشان داده که دامنه
web.archive.orgدر رتبه ۱۸۷ میان پرکاربردترین دامنهها در دیتای آموزشی مدلهای T5 گوگل و Llama متا بوده است. -
در سال ۲۰۲۳، یک شرکت AI با ارسال دهها هزار درخواست در ثانیه، باعث از دسترس خارج شدن موقت آرشیو اینترنت شد.
این یک تراژدی کلاسیک “Collateral Damage” (تلفات جانبی) است. آرشیو اینترنت که همیشه «پسر خوب» دنیای وب بود، حالا به خاطر استفاده ابزاری «پسرهای بد» (شرکتهای AI که کپیرایت را نقض میکنند)، توسط ناشران طرد شده است. اگر این روند ادامه یابد، وبِ آینده «بدون حافظه» خواهد بود؛ چرا که هیچ نسخهای از اخبار امروز برای ۱۰ سال بعد ذخیره نخواهد شد.
منبع: Nieman Lab
دیدگاهتان را بنویسید