گزارش ICTNews – گوگل در تاریخ ۱۵ سپتامبر ۲۰۲۶ (۲۴ شهریور ۱۴۰۵) از دو مدل جدید گفتوگوی زنده خود رونمایی کرد. مدل Gemini 3.8 Live برای مقیاسپذیری و بهینهبودن هزینه طراحی شده و مدل Gemini 3.8 Live Extended Thinking برای وظایف بسیار پیچیده با استدلال چندمرحلهای ساخته شده است. این دو مدل صوتی در رقابت با GPT-Live-1 Astra و Grok Voice وارد بازار شدهاند و از طریق Gemini API و Google AI Studio در اختیار توسعهدهندگان قرار گرفتهاند.
Gemini 3.8 Live؛ بهینه برای مقیاسپذیری
Gemini 3.8 Live ترکیبی از هوش مکالمهای، گفتوگوی روان و درک بصری را ارائه میدهد. این مدل برای کاربردهایی طراحی شده که به حجم بالای پردازش صوتی نیاز دارند و هزینه بهینه برای توسعهدهندگان اهمیت بالایی دارد.
در شاخص کیفیت گفتوگوی صوتی Artificial Analysis، این مدل امتیاز ۷۶.۰ را کسب کرده و در Speech Agent Arena رتبه دوم را از نظر ترجیح کاربران به دست آورده است.
Gemini 3.8 Live Extended Thinking؛ استدلال چندمرحلهای
مدل Extended Thinking برای وظایف بسیار پیچیده طراحی شده و از استدلال چندمرحلهای پشتیبانی میکند. مهمترین نوآوری این مدل، قابلیت «فکر کردن همزمان با صحبت کردن» است. این مدل با استفاده از نشانههای کلامی طبیعی مانند «بگذارید بررسی کنم…» درخواست کاربر را تأیید میکند و با روایت زنده پیشرفت کار، او را در جریان مراحل چندگانه قرار میدهد.
در شاخص کیفیت گفتوگوی صوتی Artificial Analysis، این مدل با امتیاز ۸۲.۶ رتبه نخست را کسب کرده و از GPT-Live-1 Astra با امتیاز ۸۱.۵ و Grok Voice Think Fast 2.0 با امتیاز ۸۱.۳ پیشی گرفته است. در بنچمارک Big Bench Audio نیز امتیاز ۹۷.۷ درصد در استدلال صوتی ثبت کرده است.
اجرای ابزارها در پسزمینه
هر دو مدل میتوانند ابزارها و APIها را در پسزمینه اجرا کنند بدون اینکه مکالمه قطع شود. کاربر میتواند درخواستی بدهد و مدل ضمن تأیید آن، در پسزمینه کار را انجام دهد و همزمان به گفتوگو ادامه دهد. این قابلیت برای کاربردهایی مانند رزرو بلیت، پیگیری سفارش یا جستجوی اطلاعات بسیار کاربردی است.
پشتیبانی از ۹۷ زبان
Gemini 3.8 Live میتواند میان ۹۷ زبان پشتیبانیشده در میانه گفتوگو بهطور خودکار جابهجا شود و یکپارچگی لهجه را حفظ کند. این ویژگی برای کاربران چندزبانه و کسبوکارهای بینالمللی مزیت قابلتوجهی محسوب میشود.
قیمتگذاری و دسترسی
قیمت هر دقیقه ورودی صوتی ۰.۰۰۵ دلار و هر دقیقه خروجی صوتی ۰.۰۱۸ دلار است. به این ترتیب، یک ساعت گفتوگوی دوطرفه حدود ۱.۳۸ دلار هزینه خواهد داشت.
دسترسی مصرفکنندگان:
· Gemini 3.8 Live در Search Live برای عموم کاربران در دسترس است· Gemini 3.8 Live Extended Thinking در Gemini Live و برای مشترکان Google AI Pro و Ultra در Docs، و برای تمام مشترکان AI در Gmail و Keep
نشانهگذاری SynthID
تمام صداهای تولیدشده توسط این مدلها با فناوری SynthID واترمارک میشوند تا محتوای تولیدشده با هوش مصنوعی قابل شناسایی باشد. این اقدام گوگل در راستای شفافیت و جلوگیری از سوءاستفاده از محتوای صوتی مصنوعی انجام شده است.
شرکای توسعهدهنده و سازمانی
پلتفرمهایی مانند Agora، LangChain، LiveKit، Pipecat و Vercel از Live API برای ساخت برنامههای صوتی استفاده میکنند. گوگل همچنین با شرکتهایی مانند Salesforce، Genspark و Lumeris همکاری میکند که از سرعت، روانی و قابلیت اجرای وظایف این مدلها در حین گفتوگو تمجید کردهاند.
تحلیل ICTNews
معرفی دو مدل گفتوگوی زنده گوگل، نشاندهنده عزم این شرکت برای تسخیر بازار دستیارهای صوتی هوش مصنوعی است. مدل Extended Thinking با کسب رتبه نخست در شاخص کیفیت گفتوگوی صوتی و پیشی گرفتن از GPT-Live-1 Astra و Grok Voice، جایگاه گوگل را در این حوزه تثبیت کرده است. قابلیت «فکر کردن همزمان با صحبت کردن» نیز یک نوآوری مهم محسوب میشود که تجربه کاربری طبیعیتری را فراهم میکند. با این حال، رقابت در این حوزه بسیار فشرده است و شرکتهایی مانند OpenAI و xAI نیز بهسرعت در حال توسعه مدلهای صوتی خود هستند. موفقیت گوگل در این بازار به توانایی آن در جذب توسعهدهندگان و ارائه تجربه کاربری روان و بدون وقفه بستگی دارد.