شرکت آنتروپیک (Anthropic) اخیراً از فعال‌سازی یک واترمارک نامرئی در متون تولیدشده توسط هوش مصنوعی کلود (Claude) خبر داده است؛ اقدامی که در نگاه نخست، زنگ خطر را برای فعالان حوزه بهینه‌سازی موتورهای جستجو (SEO) که از هوش مصنوعی برای تولید محتوا در مقیاس انبوه استفاده می‌کنند، به صدا درمی‌آورد. با این حال، تحلیل دقیق رویکرد گوگل نشان می‌دهد که این واترمارک‌ها تهدیدی برای رتبه‌بندی وب‌سایت‌ها محسوب نمی‌شوند. گوگل محتوا را صرفاً به دلیل مداخله هوش مصنوعی جریمه نمی‌کند، بلکه معیار اصلی این موتور جستجو، میزان کاربردی بودن، اصالت و ارزش‌افزوده محتوا برای کاربران است.

مکانیزم واترمارک آنتروپیک و الزامات قانونی جدید

در تاریخ ۱۱ اوت، شرکت آنتروپیک تایید کرد که متون تولیدی Claude اکنون مجهز به یک واترمارک نامرئی هستند. تمامی مدل‌های عرضه‌شده توسط این شرکت از تاریخ ۲ اوت به این فناوری مجهز شده‌اند. این سیستم با مداخله در فرآیند انتخاب کلمات توسط مدل کار می‌کند؛ به این صورت که مدل‌های زبانی بزرگ کلمات را یکی پس از دیگری از میان فهرستی از گزینه‌های محتمل انتخاب می‌کنند و این واترمارک، انتخاب‌ها را به سمت نیمه مخفی و خاصی از دایره واژگان سوق می‌دهد.

اگرچه هیچ جمله‌ای به تنهایی غیرطبیعی به نظر نمی‌رسد، اما در یک متن چندصد کلمه‌ای، این سوگیری واژگانی برای هر کسی که کلید رمزگشایی را در اختیار داشته باشد، قابل اندازه‌گیری است. ویژگی متمایز این واترمارک، قرارگیری آن در خود بافت کلمات است، نه در متادیتای فایل که توسط سیستم‌های مدیریت محتوا (CMS) حذف شود. بنابراین، کپی کردن متن از چت‌بات و انتقال آن به وب‌سایت، این امضای نامرئی را نیز منتقل می‌کند.

اقدام آنتروپیک در خلاء صورت نگرفته است. بخش شفافیت قانون هوش مصنوعی اتحادیه اروپا (EU AI Act) از تاریخ ۲ اوت اجرایی شده و تمامی توسعه‌دهندگان را ملزم به نشانه‌گذاری محتوای تولیدی با هوش مصنوعی می‌کند تا سایر سیستم‌ها قادر به شناسایی آن باشند. با توجه به واکنش‌های منفی نسبت به محتوای بی‌کیفیت تولیدی با هوش مصنوعی، انتظار می‌رود این نوع نشانه‌گذاری‌ها به زودی فراگیر شوند.

موضع رسمی گوگل در قبال محتوای هوش مصنوعی و جریمه‌های سئو

بسیاری از بازاریابان نگرانند که گوگل با شناسایی این واترمارک‌ها، ترافیک سایت‌های آن‌ها را قطع کند. اما گوگل در فوریه ۲۰۲۳ موضع رسمی خود را در این باره اعلام کرد: «استفاده مناسب از هوش مصنوعی یا اتوماسیون، مغایر با دستورالعمل‌های ما نیست.» گوگل به جای ورود به جنگ بی‌پایان شناسایی محتوای هوش مصنوعی، تمرکز خود را بر ارزش محتوا قرار داده است.

در قوانین ضد اسپم گوگل که شامل ۱۶ بند است، عبارت «هوش مصنوعی مولد» تنها دو بار تکرار شده است؛ یک بار در رابطه با سوءاستفاده از ویژگی‌های هوش مصنوعی و بار دوم در بخش «سوءاستفاده از محتوای انبوه» (scaled content abuse). طبق تعریف گوگل، سوءاستفاده از محتوای انبوه زمانی رخ می‌دهد که صفحات متعددی با هدف اصلی دستکاری رتبه‌بندی جستجو و نه کمک به کاربران تولید شوند؛ فارغ از اینکه این محتوا توسط انسان تولید شده باشد یا ماشین.

گوگل این وضعیت را با موج تولید محتوای انبوه توسط نویسندگان فریلنسر در ده سال پیش مقایسه می‌کند که در آن زمان نیز جریمه‌های مشابهی اعمال می‌شد. یک نمونه عینی، پروژه موسوم به «سرقت سئو» (SEO heist) در نوامبر ۲۰۲۳ بود که در آن یک متخصص سئو با استخراج نقشه سایت (sitemap) رقیب و تولید ۱۸۰۰ مقاله انبوه با هوش مصنوعی، توانست ۳.۶ میلیون بازدید جذب کند. این موضوع حتی به گوش ساندار پیچای، مدیرعامل گوگل نیز رسید. اما در عرض چند ماه، تمامی این دستاوردها از بین رفت و ترافیک سایت به حالت اولیه بازگشت، زیرا محتوای تولیدی فاقد ارزش‌افزوده واقعی بود.

تمایز میان محتوای عمومی و اختصاصی

بر اساس دستورالعمل‌های ارزیاب کیفیت جستجوی گوگل (Search Quality Rater Guidelines)، کیفیت محتوای اصلی (MC) بر اساس میزان تلاش، اصالت و مهارت به‌کاررفته در خلق آن سنجیده می‌شود. گوگل مفهوم «تلاش» را به عنوان میزان فعالیت مستمر انسان برای خلق محتوای رضایت‌بخش تعریف می‌کند. در یک مطالعه توسط Semrush که روی ۴۲ هزار پست وبلاگ انجام شد، مشخص گردید که در رتبه اول نتایج جستجو، احتمال انسانی بودن محتوا ۸۰.۵ درصد و احتمال تولید آن توسط هوش مصنوعی تنها ۱۰ درصد است. این آمار نشان می‌دهد که تنبلی در تولید محتوا نمی‌تواند جایگاه‌های برتر گوگل را حفظ کند.

دنی سالیوان (Danny Sullivan)، از مدیران گوگل، در جریان رویداد Search Central Live در تورنتو، محتوا را به دو دسته «عمومی» (commodity) و «اختصاصی» (non-commodity) تقسیم کرد. محتوای اختصاصی باید منحصربه‌فرد، خاص و اصیل باشد. به عنوان مثال:

  • در یک فروشگاه تجهیزات ورزشی، مقاله عمومی می‌تواند «۱۰ نکته برای خرید کفش دویدن» باشد، در حالی که مقاله اختصاصی به بررسی این می‌پردازد که «چرا فوم کفش یک مشتری پس از ۴۰۰ مایل دویدن از بین رفت».
  • در حوزه املاک، مقاله عمومی «۷ توصیه برای خریداران خانه اولی» است، اما مقاله اختصاصی توضیح می‌دهد که «چرا ما از بازرسی فنی چشم‌پوشی کردیم و ۱۵ هزار دلار پس‌انداز کردیم».
  • برای یک طراح دکوراسیون داخلی، مقاله عمومی «ترندهای آشپزخانه» است، اما مقاله اختصاصی به این موضوع می‌پردازد که «چرا من از نصب سنگ مرمر برای یک خانواده پنج‌نفره خودداری کردم».

این تفاوت نشان‌دهنده تجربه واقعی و دست‌اول است که هوش مصنوعی بدون نظارت انسانی قادر به تولید آن نیست. این رویکرد در پتنت ثبت‌شده گوگل با عنوان «تخمین زمینه‌ای کسب اطلاعات بیشتر» (information gain) نیز دیده می‌شود که به اسنادی رتبه بهتر می‌دهد که اطلاعاتی فراتر از نتایج موجود ارائه کنند.

راهکارهای عملی برای ارتقای کیفیت محتوا

برای اطمینان از اینکه محتوای وب‌سایت تحت تاثیر به‌روزرسانی‌های الگوریتم گوگل قرار نمی‌گیرد، بازاریابان باید سه استراتژی را به کار گیرند:

  • توسعه ابزارهای تعاملی: ساخت ابزارهایی مانند ماشین‌حساب‌های محاسباتی مالیاتی یا آزمون‌های آنلاین در فروشگاه‌های اینترنتی، نشان‌دهنده تلاشی است که مدل‌های زبانی نمی‌توانند آن را جعل کنند.
  • استفاده از فرمت‌های چندرسانه‌ای اصیل: تولید ویدیوهای کوتاه یا نمودارهای اختصاصی بر اساس داده‌های داخلی، کپی‌برداری را برای رقبا سخت‌تر می‌کند.
  • ارائه داده‌ها و تجربیات دست‌اول: انتشار آمار واقعی کسب‌وکار، نظیر اقدام شرکت Buffer در انتشار عمومی فرمول حقوق و درآمدهای خود از سال ۲۰۱۳، محتوایی غیرقابل تقلید خلق می‌کند. همچنین درج نام نویسنده واقعی با سوابق مشخص، به اعتبار صفحه می‌افزاید.

در نهایت، واترمارک آنتروپیک تنها یک نشان اصالت است که به سوال «آیا از مدل استفاده شده است؟» پاسخ می‌دهد؛ سوالی که گوگل سال‌ها پیش تصمیم گرفته رتبه‌بندی خود را بر اساس آن استوار نکند. چالش اصلی در پلتفرم‌هایی مانند لینکدین است که اکنون گزینه گزارش محتوای بی‌کیفیت هوش مصنوعی را فعال کرده‌اند. بنابراین، تلاش‌ها باید به جای حذف واترمارک، صرف ارتقای کیفیت و ارائه اطلاعات جدید شود.