شرکت گوگل در تاریخ ۸ اکتبر ۲۰۲۶ (۱۶ مهر ۱۴۰۵) از سه محصول جدید در حوزه هوش مصنوعی رونمایی کرد. این مجموعه شامل نسخه جدید مدل تولید و ویرایش تصویر با نام Nano Banana 2.1، دستیار جامع سازمانی موسوم به Gemini Agent و ابزار فرامدل شناسایی محتوای هوش مصنوعی به نام SynthID Detector است. این رونماییها نشاندهنده رویکرد جامع گوگل برای پوشش نیازهای تولید، مدیریت و اعتبارسنجی محتوای دیجیتال در سطوح فردی و سازمانی است.
مدل تصویرساز Nano Banana 2.1؛ ارتقای کیفیت و کاهش ۵۰ درصدی هزینهها
گوگل نسخه بهروزرسانیشده مدل ویرایش و ساخت تصویر خود را با عنوان Nano Banana 2.1 معرفی کرد. این مدل که بر پایه معماری Gemini 3.6 Flash توسعه یافته، از دانش بهروزرسانیشده تا مارس ۲۰۲۶ بهره میبرد و قابلیتهای متعددی را برای طراحان و تولیدکنندگان محتوا فراهم کرده است:
- ویرایش ماسکمحور: کاربران میتوانند بخش مشخصی از تصویر را انتخاب و تنها همان بخش را ویرایش کنند، بدون آنکه تغییری در سایر اجزای تصویر ایجاد شود.
- ثبات کاراکتر و شیء: این مدل قادر است تا ۱۴ تصویر مرجع (شامل ۱۰ شیء و ۴ شخصیت) را دریافت کرده و ثبات دیداری، چهره و هویت محصول را در مراحل مختلف ویرایش حفظ کند.
- خروجی با وضوح 4K: پشتیبانی از تولید و ویرایش تصاویر با کیفیت 4K و بهینهسازی ویژه برای ساخت اینفوگرافیک و طرحهای حاوی متن انجام شده است. همچنین رندر متن به زبانهای غیرانگلیسی بهویژه زبان چینی بهبود یافته است.
هزینه تولید هر تصویر با کیفیت 1K در این مدل برابر با ۰.۰۳۴ دلار تعیین شده که ۵۰ درصد ارزانتر از نسخه Nano Banana 2 است. در ارزیابیهای پلتفرم Arena، این مدل موفق به کسب رتبه چهارم در ویرایش چندتصویری و رتبه پنجم در تولید تصویر از متن شده است. با وجود این ویژگیها، برخی کاربران از وجود باگ در واترمارک گزارش دادهاند که طی ویرایشهای متوالی موجب افت کیفیت تصویر میشود؛ موضوعی که هنوز با واکنش رسمی گوگل همراه نشده است. این مدل از طریق اپلیکیشن Gemini، حالت AI جستجو، Google AI Studio، Flow و API قابل دسترسی است.
دستیار سازمانی Gemini Agent؛ هویت مستقل و حافظه چهارلایه
در جریان رویداد Gemini at Work 2026، بخش ابری گوگل از ابزار جدیدی به نام Gemini Agent برای مشتریان تجاری رونمایی کرد. این دستیار هوشمند درون سرویسهای Gemini Enterprise، گوگل ورکاسپیس و دیگر برنامههای کاربردی سیستمعامل کاری گوگل یکپارچه میشود.
برخلاف سیستمهای سنتی نیازمند دستورهای گامبهگام، Gemini Agent بر پایه دریافت هدف نهایی عمل میکند. این سیستم به صورت خودکار برنامهریزی کرده، کارهای دانشمحور را انجام میدهد، محتوا تولید کرده و کد اجرا میکند. ویژگیهای اصلی این دستیار عبارتند از:
- حافظه چهارلایه ابری: معماری حافظه این ابزار به چهار بخش نشست (Session)، معنایی (Semantic)، رویهای (Procedural) و رویدادی (Episodic) تقسیم شده تا هماهنگی فرآیندها در پروژههای چندروزه حفظ شود.
- هویت مستقل سازمانی: این ایجنت میتواند دارای ایمیل، تقویم و حساب کاربری اختصاصی باشد و همانند یک نیروی انسانی در ساختار سازمانی فعالیت کند.
- قابلیت چندمدلی: Gemini Agent محدود به مدلهای گوگل نیست و میتواند بنا بر نیاز وظیفه تعریفشده، مدلهای رقیب از جمله Claude محصول شرکت آنتروپیک (Anthropic) را فراخوانی کند.
دسترسی به این ابزار از طریق Gmail، Google Docs، Sheets، Slides، Slack و Microsoft 365 با درج عبارت @Gemini یا استفاده مستقیم از API امکانپذیر است. Gemini Agent در حال حاضر در مرحله پیشنمایش خصوصی قرار دارد و بهزودی در اختیار مشتریان تجاری منتخب قرار خواهد گرفت.
ابزار SynthID Detector؛ شناسه همهجانبه برای تشخیص دیپفیک
سومین محصول معرفیشده، ابزار SynthID Detector است که با هدف شناسایی محتوای تصویری، ویدیویی و صوتیِ تولیدشده توسط هوش مصنوعی عرضه شده است. برخلاف سامانههای قبلی که محدود به شناسایی محصولات یک شرکت خاص بودند، این ابزار قادر است واترمارکهای نامرئی محتوای تولیدشده توسط مدلهای گوگل، OpenAI، انویدیا (Nvidia) و Kakao را به صورت یکپارچه شناسایی کند.
ابزار SynthID Detector به صورت رایگان از طریق وبسایت اختصاصی گوگل در دسترس عموم قرار گرفته است تا گامی عملی در جهت مبارزه با دیپفیک و افزایش شفافیت در اکوسیستم رسانهای باشد.
