
مدل صوتی Grok Voice Think Fast 2.0 اکنون در صدر شاخص Artificial Analysis Speech-to-Speech Index قرار دارد. این شاخص به طور خاص توانایی مدلهای صوتی را در انجام کارهایی فراتر از تبدیل ساده متن به صدا بررسی میکند و معیارهایی نظیر درک گفتار انسان، استدلال در حین مکالمه و اجرای وظایف واقعی با استفاده از ابزارهای نرمافزاری را میسنجد.
معیارهای ارزیابی در شاخص Artificial Analysis
در نسخه فعلی این شاخص، چهار بخش اصلی با وزن برابر مورد ارزیابی قرار میگیرند که عبارتند از:
- استدلال صوتی (Big Bench Audio)
- عملکرد عاملمحور (Agentic Performance)
- ترجیح کاربران در مکالمهی صوتی
- موفقیت در انجام وظایف واقعی (Task Success)
در بخش موفقیت در وظایف واقعی، مدل باید بتواند در نقش یک عامل پشتیبانی مشتری، با استفاده از ابزارهای مختلف مشکلات کاربران را حل کرده و سیستم را به وضعیت صحیح برساند.
مقایسه امتیازات Grok با رقبا
بر اساس ارزیابیهای منتشر شده توسط xAI، مدل Grok Voice Think Fast 2.0 با کسب امتیاز 79 درصد در رتبه اول قرار گرفته است. در همین حال، رقبای اصلی این مدل امتیازات متفاوتی را به ثبت رساندهاند:
- مدل GPT-Realtime-2.1 High با امتیاز 73.9 درصد
- مدل Gemini 3.1 Flash Live با امتیاز 71.5 درصد
تفاوتهای فنی Think Fast 2.0 با دستیاران صوتی
تمایز اصلی مدل Think Fast 2.0 با دستیارهای صوتی معمولی در این است که این مدل صرفاً صدای کاربر را به متن تبدیل نمیکند تا سپس پاسخی تولید کند؛ بلکه قابلیت استدلال همزمان با صحبت کردن کاربر را دارد و میتواند ابزارهای لازم را در لحظه به کار بگیرد.
به گفته شرکت xAI، این رویکرد باعث میشود تعامل با عامل صوتی طبیعیتر شود، به گونهای که برخی فراخوانیهای ابزار حتی پیش از پایان جمله اول کاربر انجام میگردد.