شرکت گوگل در تاریخ ۸ اکتبر ۲۰۲۶ (۱۶ مهر ۱۴۰۵) از سه محصول جدید در حوزه هوش مصنوعی رونمایی کرد. این مجموعه شامل نسخه جدید مدل تولید و ویرایش تصویر با نام Nano Banana 2.1، دستیار جامع سازمانی موسوم به Gemini Agent و ابزار فرامدل شناسایی محتوای هوش مصنوعی به نام SynthID Detector است. این رونمایی‌ها نشان‌دهنده رویکرد جامع گوگل برای پوشش نیازهای تولید، مدیریت و اعتبارسنجی محتوای دیجیتال در سطوح فردی و سازمانی است.

مدل تصویرساز Nano Banana 2.1؛ ارتقای کیفیت و کاهش ۵۰ درصدی هزینه‌ها

گوگل نسخه به‌روزرسانی‌شده مدل ویرایش و ساخت تصویر خود را با عنوان Nano Banana 2.1 معرفی کرد. این مدل که بر پایه معماری Gemini 3.6 Flash توسعه یافته، از دانش به‌روزرسانی‌شده تا مارس ۲۰۲۶ بهره می‌برد و قابلیت‌های متعددی را برای طراحان و تولیدکنندگان محتوا فراهم کرده است:

  • ویرایش ماسک‌محور: کاربران می‌توانند بخش مشخصی از تصویر را انتخاب و تنها همان بخش را ویرایش کنند، بدون آنکه تغییری در سایر اجزای تصویر ایجاد شود.
  • ثبات کاراکتر و شیء: این مدل قادر است تا ۱۴ تصویر مرجع (شامل ۱۰ شیء و ۴ شخصیت) را دریافت کرده و ثبات دیداری، چهره و هویت محصول را در مراحل مختلف ویرایش حفظ کند.
  • خروجی با وضوح 4K: پشتیبانی از تولید و ویرایش تصاویر با کیفیت 4K و بهینه‌سازی ویژه برای ساخت اینفوگرافیک و طرح‌های حاوی متن انجام شده است. همچنین رندر متن به زبان‌های غیرانگلیسی به‌ویژه زبان چینی بهبود یافته است.

هزینه تولید هر تصویر با کیفیت 1K در این مدل برابر با ۰.۰۳۴ دلار تعیین شده که ۵۰ درصد ارزان‌تر از نسخه Nano Banana 2 است. در ارزیابی‌های پلتفرم Arena، این مدل موفق به کسب رتبه چهارم در ویرایش چندتصویری و رتبه پنجم در تولید تصویر از متن شده است. با وجود این ویژگی‌ها، برخی کاربران از وجود باگ در واترمارک گزارش داده‌اند که طی ویرایش‌های متوالی موجب افت کیفیت تصویر می‌شود؛ موضوعی که هنوز با واکنش رسمی گوگل همراه نشده است. این مدل از طریق اپلیکیشن Gemini، حالت AI جستجو، Google AI Studio، Flow و API قابل دسترسی است.

دستیار سازمانی Gemini Agent؛ هویت مستقل و حافظه چهارلایه

در جریان رویداد Gemini at Work 2026، بخش ابری گوگل از ابزار جدیدی به نام Gemini Agent برای مشتریان تجاری رونمایی کرد. این دستیار هوشمند درون سرویس‌های Gemini Enterprise، گوگل ورک‌اسپیس و دیگر برنامه‌های کاربردی سیستم‌عامل کاری گوگل یکپارچه می‌شود.

برخلاف سیستم‌های سنتی نیازمند دستورهای گام‌به‌گام، Gemini Agent بر پایه دریافت هدف نهایی عمل می‌کند. این سیستم به صورت خودکار برنامه‌ریزی کرده، کارهای دانش‌محور را انجام می‌دهد، محتوا تولید کرده و کد اجرا می‌کند. ویژگی‌های اصلی این دستیار عبارتند از:

  • حافظه چهارلایه ابری: معماری حافظه این ابزار به چهار بخش نشست (Session)، معنایی (Semantic)، رویه‌ای (Procedural) و رویدادی (Episodic) تقسیم شده تا هماهنگی فرآیندها در پروژه‌های چندروزه حفظ شود.
  • هویت مستقل سازمانی: این ایجنت می‌تواند دارای ایمیل، تقویم و حساب کاربری اختصاصی باشد و همانند یک نیروی انسانی در ساختار سازمانی فعالیت کند.
  • قابلیت چندمدلی: Gemini Agent محدود به مدل‌های گوگل نیست و می‌تواند بنا بر نیاز وظیفه تعریف‌شده، مدل‌های رقیب از جمله Claude محصول شرکت آنتروپیک (Anthropic) را فراخوانی کند.

دسترسی به این ابزار از طریق Gmail، Google Docs، Sheets، Slides، Slack و Microsoft 365 با درج عبارت @Gemini یا استفاده مستقیم از API امکان‌پذیر است. Gemini Agent در حال حاضر در مرحله پیش‌نمایش خصوصی قرار دارد و به‌زودی در اختیار مشتریان تجاری منتخب قرار خواهد گرفت.

ابزار SynthID Detector؛ شناسه همه‌جانبه برای تشخیص دیپ‌فیک

سومین محصول معرفی‌شده، ابزار SynthID Detector است که با هدف شناسایی محتوای تصویری، ویدیویی و صوتیِ تولیدشده توسط هوش مصنوعی عرضه شده است. برخلاف سامانه‌های قبلی که محدود به شناسایی محصولات یک شرکت خاص بودند، این ابزار قادر است واترمارک‌های نامرئی محتوای تولیدشده توسط مدل‌های گوگل، OpenAI، انویدیا (Nvidia) و Kakao را به صورت یکپارچه شناسایی کند.

ابزار SynthID Detector به صورت رایگان از طریق وب‌سایت اختصاصی گوگل در دسترس عموم قرار گرفته است تا گامی عملی در جهت مبارزه با دیپ‌فیک و افزایش شفافیت در اکوسیستم رسانه‌ای باشد.