پژوهشگران گوگل در یک مقاله پژوهشی جدید به صورت نظری و ریاضی اثبات کردهاند که یک مدل زبانی واحد میتواند بدون نیاز به ایندکس مجزای وب، تعداد نامحدودی از اسناد را رتبهبندی کند. بر اساس این معماری جدید، فهرست رتبهبندیشده دیگر یک صفحه وب قابل مشاهده نیست، بلکه فرآیندی محاسباتی است که مدل زبانی در مسیر رسیدن به پاسخ انجام میدهد. این دستاورد فنی، اگرچه در قالب آزمایشهای اولیه ارائه شده، نشاندهنده تغییر مسیر بنیادی گوگل از ساختار سنتی نمایش ۱۰ لینک آبی به سمت جستجوی کاملاً مولد مبتنی بر هوش مصنوعی است.
سیر تکاملی پنجساله گوگل در حذف ایندکس سنتی
در سال ۲۰۲۱، چهار پژوهشگر گوگل مقالهای با عنوان «بازاندیشی در جستجو: تبدیل غیرمتخصصان به متخصصان حوزه» (Rethinking Search: Making Domain Experts out of Dilettantes) منتشر کردند و پیشنهاد دادند که سیستم جستجو باید به جای ارائه فهرستی از ارجاعات، مستقیماً از مجموعه اسناد پاسخ دهد. یک سال بعد در سال ۲۰۲۲، همان تیم مقاله «ایندکس جستجوی دیفرانسیلپذیر» (Differentiable Search Index یا DSI) را ارائه دادند که نشان میداد یک مدل ترنسفورمر میتواند پرسوجو را مستقیماً به شناسههای سند (docID) نگاشت کند.
مقاله ژانویه ۲۰۲۶ پایه نظری این ایده را تکمیل کرده است. این پژوهش اثبات میکند که ابعاد امبدینگ (embedding dimension) در انکودرهای دوگانه (dual encoders) باید به صورت خطی با افزایش تعداد اسناد رشد کند تا بتواند تمام رتبهبندیهای ممکن را نشان دهد؛ در حالی که یک مدل خودبازگشت (autoregressive model) با ابعاد پنهان ثابت میتواند تعداد دلخواهی از اسناد را رتبهبندی کند. پژوهشگران در این مقاله تابع زیان جدیدی به نام SToICaL معرفی کردهاند که به مدل آموزش میدهد به کل فهرست رتبهبندی توجه کند، نه فقط به نتیجه اول.
در این آزمایشها، تیم پژوهشی مدل Mistral-7B را تنظیم دقیق (fine-tune) کرد. ارزیابی رتبهبندی روی پایگاه داده WordNet دانشگاه پرینستون با حدود ۸۲,۰۰۰ مفهوم اسم و همچنین یک ارزیابی خریدی روی ۳۱۰ نمونه انجام شد. در این معماری، اسناد دیگر لینک (URL) نیستند، بلکه یک شناسه کوتاه شامل زنجیرهای از توکنها هستند که مدل به صورت خودبازگشت تولید میکند. در آزمایش خریدی، شناسه هر محصول از امبدینگ عنوان آن استخراج و به سه عدد فشرده شد تا محصولات مشابه، ارقام ابتدایی یکسانی داشته باشند.
پیامدهای ساختاری برای سئو و استراتژی محتوا
ورود مدلهای خودبازگشت به عرصه رتبهبندی، فرضیات سنتی بازاریابی دیجیتال و بهینهسازی موتورهای جستجو (SEO) را دستخوش تغییر میکند. سه پیامد اصلی این معماری برای فعالان این حوزه عبارتند از:
- متمایز بودن به عنوان هدف بهینهسازی: اگر صفحهای در فضای امبدینگ از صفحات مجاور خود قابل تشخیص نباشد، نمیتواند شناسه مجزایی داشته باشد. دو صفحه محصول مشابه دیگر برای کسب رتبههای مجاور رقابت نمیکنند، بلکه برای یک شناسه واحد میجنگند و یکی از آنها به کلی حذف میشود.
- مجموعه داده آموزشی به عنوان تابع رتبهبندی: الگوریتم دیگر یک لایه جداگانه از فاکتورهای رتبهبندی نیست، بلکه توزیعی از ترجیحات یادگرفتهشده در زمان تنظیم دقیق است که شامل دادههای کلیک، ارزیابی داوران و سیگنالهای تعامل میشود.
- تازهسازی محتوا به عنوان چالش آموزشی: در ایندکس سنتی، صفحه جدید خزش و وارد سیستم میشود؛ اما در ایندکس مولد، صفحه جدید باید توسط مدل یاد گرفته شود. پژوهشهای بعدی گوگل با نام DSI++ نشان داد که ایندکس مداوم اسناد جدید میتواند باعث فراموشی اسناد قبلی شود.
ناپدید شدن صفحه دوم و تغییر سناریوی تبلیغات
بزرگترین تغییر برای بازاریابان، سازوکار «جستجوی باریکهای» (Beam Search) در مدلهای مولد است. در این فرآیند، مدل تنها تعداد محدودی از احتمالهای برتر (مثلاً ۱۰ مورد) را حفظ کرده و مابقی را حذف میکند. بنابراین، نتایجی که خارج از این عرض باریکه قرار میگیرند، هرگز تولید نمیشوند. مفاهیمی مانند «صفحه دوم نتایج» یا ردیابی رتبه برای رتبههای پایینتر دیگر وجود خارجی نخواهند داشت و رتبهبندی به حالت صفر و یک (حضور در مجموعه تولیدشده یا غیبت کامل) تبدیل میشود.
این تغییر معماری بر هزینههای گوگل نیز تأثیرگذار است. در سه ماهه دوم، درآمد گوگل از بخش جستجو و سایر بخشها با ۱۷ درصد رشد به ۶۳.۲۷ میلیارد دلار رسید (پس از رشد ۱۹ درصدی در سه ماهه قبل). حذف ایندکس سنتی و عدم نیاز به محاسبه امتیاز تمام اسناد، هزینههای زیرساختی پاسخهای مولد را به شدت کاهش میدهد.
همچنین این معماری با سیستمهای تبلیغاتی آینده پیوند میخورد. بر اساس مقاله حراج توکن گوگل که برنده بهترین مقاله در کنفرانس وب ۲۰۲۴ شد و فرمتهای تبلیغاتی معرفیشده در Google Marketing Live، تبلیغدهندگان به جای خرید یک موقعیت ثابت، برای سهم احتمالی در زمان تولید توکن به توکن پاسخها رقابت خواهند کرد. در این فضا، نقش بازاریابان از ساخت کمپین به سمت مدیریت دادههای کسبوکار، مشخصات محصولات و الزامات برند حرکت خواهد کرد.
