
محتوای نوشته شده توسط هوش مصنوعی، به معنای واقعی کلمه، همهجا هست.
طبق مطالعهای از مرکز تحقیقات پیو که روز پنجشنبه منتشر شد، از هر ۱۰ صفحه وب انگلیسیزبان، یک صفحه اکنون نشانههای قابل توجهی از نگارش توسط هوش مصنوعی را نشان میدهد. اگر این نمونه را فقط به صفحاتی که از زمان راهاندازی ChatGPT در نوامبر ۲۰۲۲ منتشر شدهاند، محدود کنیم، این سهم به ۳۵٪ میرسد.
این یافتهها پس از آن به دست آمد که محققان تقریباً ۴۹۰,۰۰۰ صفحه را از آرشیو وب Common Crawl (که از ژانویه ۲۰۲۱ تا جولای ۲۰۲۶ را شامل میشود) استخراج کرده و سپس متن را از طریق Open Pangram، یک مدل تشخیص هوش مصنوعی، پردازش کردند.
ردپای هوش مصنوعی به طور یکنواخت توزیع نشده است. صفحات در دامنههای .com نشانههایی از نگارش توسط هوش مصنوعی را تقریباً ۱۰ برابر بیشتر از دامنههای .edu یا .gov (که هر کدام نزدیک به ۱٪ هستند) و حدود دو برابر نرخ ۴.۶٪ در سایتهای .org نشان میدهند.
در سال ۲۰۲۱، هر چهار نوع دامنه تقریباً یکسان به نظر میرسیدند.
چگونه پیو ماشینها را شناسایی کرد
این ردیاب هیچ کلمه یا عبارت واحدی را نشانگذاری نمیکند، بلکه الگوهای آماری را در دستههای بزرگ متن میسنجد. اما برخی نشانههای فردی از سال ۲۰۲۳ به شدت رایجتر شدهاند: مظنونین همیشگی، خطتیرههای بلند (که خودمان هم خیلی دوستشان داریم) اکنون تقریباً دو برابر بیشتر ظاهر میشوند، کاماهای آکسفورد ۶۳٪ افزایش یافتهاند، و کلمات مورد علاقه هوش مصنوعی مانند «کاوش کردن» (delve)، «تعامل» (interplay) و «گواه» (testament) بیش از دو برابر شدهاند.
«موازات منفی»—ساختارهایی مانند «فقط X نیست، بلکه Y است»—از سال ۲۰۲۳ تقریباً سه برابر شده است، اگرچه پیو اشاره میکند که در کل هنوز نادر است. Decrypt قبلاً همین نشانهها را دنبال کرده بود، و مریام-وبستر در دسامبر با نامگذاری «slop» به عنوان واژه سال خود، آن را رسمی کرد.
پیو با دقت به محدودیتها اشاره میکند: مدلهای تشخیص میتوانند صفحات منفرد را در هر دو جهت اشتباه طبقهبندی کنند، و «نشانههای قابل توجه نگارش توسط هوش مصنوعی» به این معنی نیست که یک صفحه کاملاً توسط یک ماشین نوشته شده است—بسیاری از متنها احتمالاً به کمک هوش مصنوعی نوشته شدهاند تا اینکه کاملاً توسط آن تولید شده باشند.
Open Pangram از Pangram Labs میآید، که ردیاب آن در تحقیقات جداگانهای نیز کشف کرده است که تقریباً ۹٪ از مقالات روزنامههای ایالات متحده در سال جاری، از جمله صفحات نظری در نشریاتی مانند The New York Times، حاوی متن تولید شده توسط هوش مصنوعی هستند.
با این حال، تشخیص هوش مصنوعی ممکن است با گذشت زمان به کاری آسانتر تبدیل شود، نه به دلیل الگوها بلکه به دلیل فناوری زیربنایی. شرکتهای بزرگ هوش مصنوعی مانند Anthropic در حال حاضر روی اثرانگشت متنی در سطح مدل کار میکنند که شناسایی متن هوش مصنوعی را آسان و در عین حال خطاها را به حداقل میرساند.
شکاف دامنه نشان میدهد که چه کسی و چرا محتوا منتشر میکند. سایتهای دانشگاهی و دولتی از بررسیهای تحریریه، تأیید سازمانی و چرخههای انتشار کندتر عبور میکنند؛ دامنههای .com شامل همهچیز از اتاقهای خبر گرفته تا مزارع محتوای بازاریابی وابسته است که صفحات را با سرعتی تولید میکنند که هیچ ویراستار انسانی نمیتواند آن را تحمل کند.
در مقیاس وسیع، روند شیبدار است: نرخ نگارش توسط هوش مصنوعی در دامنههای .com از تقریباً ۱٪ در ژانویه ۲۰۲۱ به ۹.۳۵٪ پنج سال بعد، تنها در ژانویه ۲۰۲۶، افزایش یافت.