شرکت آنتروپیک (Anthropic) اخیراً از فعالسازی یک واترمارک نامرئی در متون تولیدشده توسط هوش مصنوعی کلود (Claude) خبر داده است؛ اقدامی که در نگاه نخست، زنگ خطر را برای فعالان حوزه بهینهسازی موتورهای جستجو (SEO) که از هوش مصنوعی برای تولید محتوا در مقیاس انبوه استفاده میکنند، به صدا درمیآورد. با این حال، تحلیل دقیق رویکرد گوگل نشان میدهد که این واترمارکها تهدیدی برای رتبهبندی وبسایتها محسوب نمیشوند. گوگل محتوا را صرفاً به دلیل مداخله هوش مصنوعی جریمه نمیکند، بلکه معیار اصلی این موتور جستجو، میزان کاربردی بودن، اصالت و ارزشافزوده محتوا برای کاربران است.
مکانیزم واترمارک آنتروپیک و الزامات قانونی جدید
در تاریخ ۱۱ اوت، شرکت آنتروپیک تایید کرد که متون تولیدی Claude اکنون مجهز به یک واترمارک نامرئی هستند. تمامی مدلهای عرضهشده توسط این شرکت از تاریخ ۲ اوت به این فناوری مجهز شدهاند. این سیستم با مداخله در فرآیند انتخاب کلمات توسط مدل کار میکند؛ به این صورت که مدلهای زبانی بزرگ کلمات را یکی پس از دیگری از میان فهرستی از گزینههای محتمل انتخاب میکنند و این واترمارک، انتخابها را به سمت نیمه مخفی و خاصی از دایره واژگان سوق میدهد.
اگرچه هیچ جملهای به تنهایی غیرطبیعی به نظر نمیرسد، اما در یک متن چندصد کلمهای، این سوگیری واژگانی برای هر کسی که کلید رمزگشایی را در اختیار داشته باشد، قابل اندازهگیری است. ویژگی متمایز این واترمارک، قرارگیری آن در خود بافت کلمات است، نه در متادیتای فایل که توسط سیستمهای مدیریت محتوا (CMS) حذف شود. بنابراین، کپی کردن متن از چتبات و انتقال آن به وبسایت، این امضای نامرئی را نیز منتقل میکند.
اقدام آنتروپیک در خلاء صورت نگرفته است. بخش شفافیت قانون هوش مصنوعی اتحادیه اروپا (EU AI Act) از تاریخ ۲ اوت اجرایی شده و تمامی توسعهدهندگان را ملزم به نشانهگذاری محتوای تولیدی با هوش مصنوعی میکند تا سایر سیستمها قادر به شناسایی آن باشند. با توجه به واکنشهای منفی نسبت به محتوای بیکیفیت تولیدی با هوش مصنوعی، انتظار میرود این نوع نشانهگذاریها به زودی فراگیر شوند.
موضع رسمی گوگل در قبال محتوای هوش مصنوعی و جریمههای سئو
بسیاری از بازاریابان نگرانند که گوگل با شناسایی این واترمارکها، ترافیک سایتهای آنها را قطع کند. اما گوگل در فوریه ۲۰۲۳ موضع رسمی خود را در این باره اعلام کرد: «استفاده مناسب از هوش مصنوعی یا اتوماسیون، مغایر با دستورالعملهای ما نیست.» گوگل به جای ورود به جنگ بیپایان شناسایی محتوای هوش مصنوعی، تمرکز خود را بر ارزش محتوا قرار داده است.
در قوانین ضد اسپم گوگل که شامل ۱۶ بند است، عبارت «هوش مصنوعی مولد» تنها دو بار تکرار شده است؛ یک بار در رابطه با سوءاستفاده از ویژگیهای هوش مصنوعی و بار دوم در بخش «سوءاستفاده از محتوای انبوه» (scaled content abuse). طبق تعریف گوگل، سوءاستفاده از محتوای انبوه زمانی رخ میدهد که صفحات متعددی با هدف اصلی دستکاری رتبهبندی جستجو و نه کمک به کاربران تولید شوند؛ فارغ از اینکه این محتوا توسط انسان تولید شده باشد یا ماشین.
گوگل این وضعیت را با موج تولید محتوای انبوه توسط نویسندگان فریلنسر در ده سال پیش مقایسه میکند که در آن زمان نیز جریمههای مشابهی اعمال میشد. یک نمونه عینی، پروژه موسوم به «سرقت سئو» (SEO heist) در نوامبر ۲۰۲۳ بود که در آن یک متخصص سئو با استخراج نقشه سایت (sitemap) رقیب و تولید ۱۸۰۰ مقاله انبوه با هوش مصنوعی، توانست ۳.۶ میلیون بازدید جذب کند. این موضوع حتی به گوش ساندار پیچای، مدیرعامل گوگل نیز رسید. اما در عرض چند ماه، تمامی این دستاوردها از بین رفت و ترافیک سایت به حالت اولیه بازگشت، زیرا محتوای تولیدی فاقد ارزشافزوده واقعی بود.
تمایز میان محتوای عمومی و اختصاصی
بر اساس دستورالعملهای ارزیاب کیفیت جستجوی گوگل (Search Quality Rater Guidelines)، کیفیت محتوای اصلی (MC) بر اساس میزان تلاش، اصالت و مهارت بهکاررفته در خلق آن سنجیده میشود. گوگل مفهوم «تلاش» را به عنوان میزان فعالیت مستمر انسان برای خلق محتوای رضایتبخش تعریف میکند. در یک مطالعه توسط Semrush که روی ۴۲ هزار پست وبلاگ انجام شد، مشخص گردید که در رتبه اول نتایج جستجو، احتمال انسانی بودن محتوا ۸۰.۵ درصد و احتمال تولید آن توسط هوش مصنوعی تنها ۱۰ درصد است. این آمار نشان میدهد که تنبلی در تولید محتوا نمیتواند جایگاههای برتر گوگل را حفظ کند.
دنی سالیوان (Danny Sullivan)، از مدیران گوگل، در جریان رویداد Search Central Live در تورنتو، محتوا را به دو دسته «عمومی» (commodity) و «اختصاصی» (non-commodity) تقسیم کرد. محتوای اختصاصی باید منحصربهفرد، خاص و اصیل باشد. به عنوان مثال:
- در یک فروشگاه تجهیزات ورزشی، مقاله عمومی میتواند «۱۰ نکته برای خرید کفش دویدن» باشد، در حالی که مقاله اختصاصی به بررسی این میپردازد که «چرا فوم کفش یک مشتری پس از ۴۰۰ مایل دویدن از بین رفت».
- در حوزه املاک، مقاله عمومی «۷ توصیه برای خریداران خانه اولی» است، اما مقاله اختصاصی توضیح میدهد که «چرا ما از بازرسی فنی چشمپوشی کردیم و ۱۵ هزار دلار پسانداز کردیم».
- برای یک طراح دکوراسیون داخلی، مقاله عمومی «ترندهای آشپزخانه» است، اما مقاله اختصاصی به این موضوع میپردازد که «چرا من از نصب سنگ مرمر برای یک خانواده پنجنفره خودداری کردم».
این تفاوت نشاندهنده تجربه واقعی و دستاول است که هوش مصنوعی بدون نظارت انسانی قادر به تولید آن نیست. این رویکرد در پتنت ثبتشده گوگل با عنوان «تخمین زمینهای کسب اطلاعات بیشتر» (information gain) نیز دیده میشود که به اسنادی رتبه بهتر میدهد که اطلاعاتی فراتر از نتایج موجود ارائه کنند.
راهکارهای عملی برای ارتقای کیفیت محتوا
برای اطمینان از اینکه محتوای وبسایت تحت تاثیر بهروزرسانیهای الگوریتم گوگل قرار نمیگیرد، بازاریابان باید سه استراتژی را به کار گیرند:
- توسعه ابزارهای تعاملی: ساخت ابزارهایی مانند ماشینحسابهای محاسباتی مالیاتی یا آزمونهای آنلاین در فروشگاههای اینترنتی، نشاندهنده تلاشی است که مدلهای زبانی نمیتوانند آن را جعل کنند.
- استفاده از فرمتهای چندرسانهای اصیل: تولید ویدیوهای کوتاه یا نمودارهای اختصاصی بر اساس دادههای داخلی، کپیبرداری را برای رقبا سختتر میکند.
- ارائه دادهها و تجربیات دستاول: انتشار آمار واقعی کسبوکار، نظیر اقدام شرکت Buffer در انتشار عمومی فرمول حقوق و درآمدهای خود از سال ۲۰۱۳، محتوایی غیرقابل تقلید خلق میکند. همچنین درج نام نویسنده واقعی با سوابق مشخص، به اعتبار صفحه میافزاید.
در نهایت، واترمارک آنتروپیک تنها یک نشان اصالت است که به سوال «آیا از مدل استفاده شده است؟» پاسخ میدهد؛ سوالی که گوگل سالها پیش تصمیم گرفته رتبهبندی خود را بر اساس آن استوار نکند. چالش اصلی در پلتفرمهایی مانند لینکدین است که اکنون گزینه گزارش محتوای بیکیفیت هوش مصنوعی را فعال کردهاند. بنابراین، تلاشها باید به جای حذف واترمارک، صرف ارتقای کیفیت و ارائه اطلاعات جدید شود.
