
تغییر رویکرد گوگل در تعامل با کاربر
گوگل در تلاش است تا جمینای را از یک ابزار کاربردی به یک دستیار شخصی تبدیل کند. قابلیت جدید Avatar (که در دل Gemini Live قرار دارد) به کاربران اجازه میدهد تا با هوش مصنوعی به شکلی کاملاً طبیعی و بدون وقفه صحبت کنند. در این مدل جدید، دیگر نیازی نیست کاربر منتظر پایان جملات ماشین بماند؛ بلکه میتواند مانند یک گفتگوی انسانی، در میان حرفهای جمینای بپرد و مسیر بحث را تغییر دهد.
ویژگیهای کلیدی و قابلیتهای صوتی
این سیستم بر پایه مدلهای چندوجهی (Multimodal) گوگل بنا شده است. این یعنی جمینای همزمان صدا، متن و تصویر را پردازش میکند. یکی از برجستهترین بخشهای این بهروزرسانی، تنوع در صداها و لحنها است. گوگل چندین گزینه صوتی مختلف ارائه داده تا کاربران بر اساس سلیقه خود، شخصیت صوتی دستیارشان را انتخاب کنند.
- قطع کردن هوشمند:کاربر میتواند در هر لحظه صحبت هوش مصنوعی را متوقف کرده و سوال جدیدی بپرسد.
- درک بافتار (Context):جمینای اکنون بهتر میفهمد که در کجای گفتگو قرار دارد و ارجاعات قبلی را فراموش نمیکند.
- ادغام با خدمات گوگل:این قابلیت با اکوسیستم گوگل (مانند تقویم و ایمیل) متصل است تا کارهای اجرایی را در حین گفتگو انجام دهد.
رقابت با OpenAI و آینده دستیاران مجازی
رونمایی از این قابلیت در زمانی اتفاق میافتد که OpenAI با مدل GPT-4o، استانداردهای جدیدی برای تعاملات صوتی تعریف کرده است. گوگل با تکیه بر دادههای عظیم خود و یکپارچگی با اندروید، قصد دارد سهم بازار دستیاران صوتی را بازپس بگیرد. هدف نهایی گوگل ایجاد تجربهای است که در آن کاربر حس نکند با یک کد برنامهنویسی حرف میزند، بلکه با موجودیتی مواجه است که لحن و ریتم گفتار انسان را میشناسد.
این قابلیت در ابتدا برای کاربران Gemini Advanced در دسترس قرار میگیرد و سپس به تدریج برای سایر کاربران اندروید عرضه خواهد شد. گوگل تأکید کرده که حریم خصوصی در این تعاملات صوتی به شدت رعایت شده و دادهها برای بهبود مدلها به صورت ناشناس پردازش میشوند.