شرکت Cloudflare از راه‌اندازی تنظیمات جدیدی تحت عنوان «منع آموزش هوش مصنوعی» (Disallow AI Training) خبر داد. این ابزار به وب‌سایت‌ها اجازه می‌دهد ترجیح خود مبنی بر عدم استفاده از محتوایشان برای آموزش مدل‌های هوش مصنوعی را در فایل robots.txt ثبت کنند، در حالی که همچنان به خزنده‌های اصلی مانند Googlebot، Applebot و Bingbot اجازه می‌دهند تا با هدف نمایه‌سازی (Indexing) و جستجو، صفحات سایت را بررسی کنند. این تصمیم گام مهمی برای حل چالش بزرگ ناشران و مدیران وب‌سایت‌ها به شمار می‌رود که مایلند از دارایی‌های فکری خود در برابر مدل‌های هوش مصنوعی محافظت کنند، بدون اینکه ترافیک ورودی از موتورهای جستجوی سنتی را از دست بدهند.

تغییر در استراتژی مسدودسازی خزنده‌های چندمنظوره

این رویکرد جدید با برنامه‌ای که Cloudflare در ماه ژوئیه اعلام کرده بود تفاوت دارد. در آن زمان، این شرکت توضیح داده بود که از تاریخ ۱۵ سپتامبر، وب‌سایت‌هایی که آموزش هوش مصنوعی را مسدود می‌کنند، دسترسی سه خزنده بزرگ (گوگل، اپل و بینگ) را نیز از دست خواهند داد؛ زیرا این خزنده‌ها به طور هم‌زمان برای جستجو و آموزش مدل‌ها استفاده می‌شوند. اما اکنون با به‌روزرسانی جدید، انتخاب گزینه مسدودسازی کامل (Block) به طور کلی دسترسی Googlebot، Applebot و Bingbot را حتی برای نتایج جستجو قطع می‌کند، در حالی که گزینه جدید Disallow AI Training مسیر متفاوتی را پیش پای کاربران می‌گذارد.

تنظیمات Disallow AI Training ویژگی جدیدی در بخش کنترل آموزش (Training Control) کلودفلر است که در کنار دو ابزار دیگر یعنی Search و Agent قرار می‌گیرد. این شرکت اولین بار در ماه اوت به تشریح این ویژگی پرداخت. با فعال‌سازی این ابزار، خزنده‌های چندمنظوره که هم برای جستجو و هم برای آموزش استفاده می‌شوند، در صورتی که توسط Cloudflare به عنوان «پاسخگو» (Accountable) شناسایی شوند، همچنان اجازه دسترسی به سایت برای اهداف جستجو را خواهند داشت. با این حال، سایر خزنده‌های صرفاً آموزشی مسدود خواهند شد.

گزینه‌های Block و Block on pages with ads اکنون برای خزنده‌های چندمنظوره نیز اعمال می‌شوند. Cloudflare اعلام کرده است که پیش از این، این خزنده‌ها را از هر دو تنظیمات حذف کرده بود زیرا مسدود کردن آن‌ها می‌توانست به دیده شدن سایت در نتایج جستجو آسیب جدی وارد کند. بیشتر مشتریان نیازی به تغییر دستی تنظیمات خود ندارند؛ چرا که انتخاب‌های قبلی آن‌ها در بخش Training (مانند Block یا Block on pages with ads) به طور خودکار به تنظیمات جدید Disallow AI Training منتقل می‌شود. همچنین ابزارهای قدیمی‌تر مانند Block AI Bots و ویژگی Managed Robots.txt کلودفلر به زودی منسوخ (Deprecated) خواهند شد. برای دامنه‌های جدیدی که از طریق تبلیغات کسب درآمد می‌کنند، گزینه Disallow AI Training به عنوان تنظیم پیش‌فرض ارائه می‌شود.

معیارهای کلودفلر برای خزنده‌های «پاسخگو»

خزنده‌های چندمنظوره تنها در صورتی دسترسی خود را برای جستجو حفظ می‌کنند که Cloudflare آن‌ها را پاسخگو (Accountable) تشخیص دهد. این دسته‌بندی پس از گفتگوهای این شرکت با اپراتورهای خزنده‌ها در ماه ژوئیه شکل گرفت. برای واجد شرایط شدن، یک اپراتور باید چهار شرط اصلی را برآورده کند یا متعهد به اجرای آن‌ها شود:

  • ارائه راهکاری برای انصراف (Opt-out) از آموزش هوش مصنوعی از طریق فایل robots.txt یا استانداردهای مشابه.
  • ارائه راهکاری برای انصراف از خلاصه‌های هوش مصنوعی (AI summaries) که اکنون از طریق خود اپراتور و از سال آینده از طریق کلودفلر قابل تنظیم خواهد بود.
  • ایجاد شفافیت در سطح آدرس اینترنتی (URL) برای مشخص کردن اینکه کدام صفحات برای آموزش استفاده شده‌اند، به همراه ارائه معیارهای نحوه نمایش محتوا در جستجو.
  • تضمین اینکه انصراف از آموزش هوش مصنوعی هیچ تأثیری بر رتبه‌بندی و نتایج جستجوی سنتی نخواهد داشت.

به گفته کلودفلر، شرکت‌های Apple، Google و Microsoft این شرایط را برآورده کرده‌اند؛ به طوری که برخی ویژگی‌ها هم‌اکنون فعال هستند و برای مابقی تعهدات نیز ضرب‌الاجل‌های مشخصی تعیین شده است. همچنین خزنده‌های شرکت‌های Amazon، Anthropic، Meta و OpenAI نیز در لیست پاسخگو قرار گرفته‌اند، زیرا این شرکت‌ها خزنده‌های جستجو و آموزش هوش مصنوعی خود را به صورت مجزا اجرا می‌کنند. با این حال، خزنده‌های آموزشی آن‌ها همچنان تحت تنظیمات Disallow AI Training مسدود خواهند بود.

سازوکار فنی در پلتفرم‌های بزرگ جستجو

در گوگل، تنظیمات Disallow AI Training از طریق قانون Disallow برای دستورالعمل Google-Extended اعمال می‌شود. این توکن در فایل robots.txt به وب‌سایت‌ها اجازه می‌دهد محتوای خود را از چرخه آموزش مدل Gemini خارج کنند. مستندات گوگل تأیید می‌کند که استفاده از Google-Extended تأثیری بر حضور سایت در نتایج جستجوی گوگل یا رتبه‌بندی آن ندارد. همچنین کنترل نمایش محتوا در بخش‌های AI Overviews، AI Mode و ویژگی‌های هوش مصنوعی مولد در Discover از طریق تنظیمات مجزایی در Search Console مدیریت می‌شود که ارتباطی با آموزش هوش مصنوعی ندارد. گوگل قصد دارد ابزارهای شفافیت در سطح URL را برای Google-Extended در هفته‌های آینده ارائه دهد.

در اپل، این تنظیمات از طریق قانون Disallow برای Applebot-Extended کار می‌کند. بر اساس مستندات اپل، این توکن صفحات را خزش نمی‌کند و در رتبه‌بندی جستجو تأثیری ندارد. برای جلوگیری از نمایش محتوا در پاسخ‌های تولیدشده توسط هوش مصنوعی به سؤالات عمومی در Siri و بخش جستجو، استفاده از متاتگ nosnippet الزامی است. اپل نیز در حال توسعه ابزار شفافیت سطح URL خود برای سال آینده است.

در سمت مقابل، انتخاب گزینه Disallow AI Training هنوز ترجیح عدم آموزش را از طریق robots.txt به بینگ ارسال نمی‌کند، زیرا مایکروسافت همچنان باید پشتیبانی از آن را اضافه کند. کلودفلر اشاره کرد که این ویژگی در دست توسعه است و پشتیبانی مایکروسافت برای اوایل سال ۲۰۲۷ برنامه‌ریزی شده است. در حال حاضر، راهکار انصراف از آموزش در بینگ استفاده از متاتگ NOARCHIVE است که مانع از آموزش مدل‌های هوش مصنوعی مایکروسافت و لینک شدن محتوا در Chat و Copilot می‌شود.

برنامه‌های آینده برای خلاصه‌های هوش مصنوعی

تمرکز بعدی Cloudflare بر مدیریت خلاصه‌های هوش مصنوعی (AI summaries) خواهد بود. هدف این شرکت ایجاد راهکاری تا اوایل سال آینده است که به کاربران اجازه می‌دهد میزان محتوای ارائه‌شده در خلاصه‌ها را تنها از طریق یک تنظیم واحد در کلودفلر کنترل کنند، به جای اینکه مجبور باشند تنظیمات را برای هر اپراتور به طور جداگانه تغییر دهند.