گوگل Gemini 3.8 Live و Extended Thinking را معرفی کرد

...

گوگل از دو مدل جدید هوش مصنوعی با تمرکز بر مکالمه صوتی بلادرنگ و استدلال پیشرفته رونمایی کرده است. مدل‌های Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking جدیدترین تلاش گوگل برای نزدیک‌تر کردن تعامل انسان و هوش مصنوعی به یک گفت‌وگوی طبیعی، سریع و هوشمند هستند. Gemini 3.8 Live با تمرکز بر مقیاس‌پذیری و هزینه پایین‌تر طراحی شده و در کنار توانایی‌های مکالمه‌ای، از درک بصری و پردازش ورودی‌های تصویری در زمان نزدیک به واقعی نیز بهره می‌برد. این مدل می‌تواند در جریان مکالمه میان ۹۷ زبان پشتیبانی‌شده جابه‌جا شود و درک بهتری از زمینه گفت‌وگو ارائه دهد. یکی از قابلیت‌های مهم این مدل، امکان اجرای ابزارها و APIها در پس‌زمینه است. به این ترتیب، مدل می‌تواند در حالی که یک وظیفه در حال اجراست، مکالمه با کاربر را ادامه دهد و بدون ایجاد وقفه طولانی، وضعیت انجام کار را مدیریت کند. این ویژگی می‌تواند برای توسعه عامل‌های صوتی هوش مصنوعی (Voice Agents) کاربرد زیادی داشته باشد.

در طرف دیگر، Gemini 3.8 Live Extended Thinking برای وظایف پیچیده‌تر ساخته شده است. این مدل علاوه بر مکالمه بلادرنگ، از قابلیت استدلال چندمرحله‌ای بهره می‌برد و می‌تواند هنگام فکر کردن و انجام یک وظیفه، به‌صورت هم‌زمان با کاربر صحبت کند. گوگل می‌گوید این مدل برای گردش‌کارهای پیچیده و وظایفی که به تصمیم‌گیری و استدلال بیشتری نیاز دارند، عملکرد بالاتری ارائه می‌کند.

بر اساس اطلاعات منتشرشده، Gemini 3.8 Live Extended Thinking در شاخص Speech to Speech Quality Index شرکت Artificial Analysis امتیاز ۸۲.۶ را کسب کرده و در رتبه نخست قرار گرفته است. این مدل همچنین در معیار τ-Voice به امتیاز ۶۸.۶ درصد و در بنچمارک بانکی τ-Voice شرکت Sierra به ۳۵.۱ درصد رسیده است. در آزمون Big Bench Audio نیز امتیاز ۹۷.۷ درصد برای آن گزارش شده است.

 

Gemini 3.8 Live and 3.8 Live Extended

 

گوگل همچنین اعلام کرده که مدل‌های جدید در بنچمارک EVA-Bench متعلق به ServiceNow توانسته‌اند میان کیفیت مکالمه و دقت در انجام وظایف پیچیده تعادل ایجاد کنند. Gemini 3.8 Live نیز در Speech Agent Arena جایگاه دوم را به دست آورده است. این مدل‌ها تنها برای کاربران عادی طراحی نشده‌اند و بخش مهمی از هدف گوگل، توسعه اکوسیستم عامل‌های صوتی برای کسب‌وکارها و توسعه‌دهندگان است. API مربوط به Gemini Live اکنون توسط پلتفرم‌هایی مانند Agora، LangChain، LiveKit، Pipecat و Vercel پشتیبانی می‌شود و به توسعه‌دهندگان اجازه می‌دهد رابط‌های صوتی و عامل‌های هوشمند مبتنی بر مکالمه ایجاد کنند.

گوگل همچنین از همکاری با شرکت‌هایی مانند Salesforce، Genspark و Lumeris خبر داده است. هدف این همکاری‌ها استفاده از قابلیت‌هایی مانند تأخیر پایین، مکالمه روان و فراخوانی ابزارها در کاربردهای واقعی است. در بخش ایمنی نیز گوگل اعلام کرده است که تمام فایل‌های صوتی تولیدشده توسط محصولات هوش مصنوعی این شرکت با فناوری SynthID واترمارک می‌شوند. این واترمارک به شکل نامحسوس در صدای تولیدشده قرار می‌گیرد تا امکان شناسایی محتوای تولیدشده توسط هوش مصنوعی فراهم شود.

معرفی Gemini 3.8 Live و نسخه Extended Thinking نشان می‌دهد که رقابت در حوزه هوش مصنوعی صوتی و عامل‌های هوشمند وارد مرحله جدیدی شده است؛ مرحله‌ای که در آن مدل‌های هوش مصنوعی تنها به پاسخ دادن محدود نیستند و می‌توانند هم‌زمان با مکالمه، اطلاعات بصری را درک کنند، استدلال انجام دهند، ابزارها را اجرا کنند و وظایف چندمرحله‌ای را به‌صورت مستقل پیش ببرند.

منبع خبر: blog.google

نظرات 0

wave

ارسال نظر

wave
برای ثبت نظر ابتدا وارد حساب کاربری خود شوید. ورود | ثبت نام

در آرتیجنس دنبال چی میگردی؟