OpenAI با مدل صوتی جدید GPT-Live تجربه مکالمه صوتی در ChatGPT را طبیعیتر کرده است؛ مدلی که میتواند همزمان به صحبت کاربر گوش دهد و پاسخ دهد، مکثهای کوتاه را با پایان صحبت اشتباه نگیرد و حتی در جریان مکالمه واکنشهای کوتاهی مانند «هوم» یا «آره» نشان دهد.
نسخه اولیه حالت صوتی ChatGPT که در سال ۲۰۲۳ معرفی شد، برای برقراری مکالمه از سه سامانه جداگانه استفاده میکرد. ابتدا صدای کاربر به متن تبدیل میشد، سپس مدل زبانی پاسخ را تولید میکرد و در مرحله آخر یک سامانه تبدیل متن به گفتار، پاسخ را با صدای بلند میخواند.
بعدتر Advanced Voice Mode با یک مدل چندوجهی واحد معرفی شد و تجربه صوتی را بهبود داد. حالا GPT-Live گام دیگری در همین مسیر برداشته است. OpenAI معماری این مدل را «دوطرفه کامل» یا Full-Duplex مینامد؛ معماریای که به ChatGPT اجازه میدهد همزمان به صحبت کاربر گوش دهد و صحبت کند.
این تغییر بهخصوص در مکالمههای طولانی اهمیت دارد. در نسخههای قبلی ممکن بود ChatGPT یک مکث کوتاه را پایان صحبت کاربر تصور کند و پیش از تمام شدن جمله، پاسخ دادن را آغاز کند. GPT-Live تلاش میکند این مشکل را برطرف کند و حتی هنگام صحبت کاربر گاهی واکنشهای کوتاهی مانند «هوم» یا «آره» نشان میدهد؛ رفتاری که بیشتر به مکالمه میان دو انسان شباهت دارد.
«مهمترین تغییر GPT-Live فقط افزایش هوش مدل نیست، بلکه طبیعیتر شدن خودِ مکالمه است؛ کاربر دیگر مجبور نیست برای پایان پاسخ ChatGPT صبر کند یا نگران باشد که یک مکث کوتاه باعث قطع شدن صحبتش شود.»
GPT-Live همچنین میتواند در صورت نیاز، انجام برخی وظایف پیچیدهتر را در پسزمینه به مدلهای قدرتمندتر مانند GPT-5.5 بسپارد. به این ترتیب، مکالمه میتواند سریع و روان باقی بماند، در حالی که پرسشهای نیازمند استدلال یا تحقیق عمیقتر توسط مدل مناسبتری پردازش میشوند.

چگونه GPT-Live را فعال کنیم؟
مدل صوتی جدید در اپلیکیشن ChatGPT برای اندروید و iOS و همچنین نسخه وب در دسترس است. کاربران طرحهای Pro، Plus و Go به مدل GPT-Live-۱ دسترسی دارند و کاربران رایگان میتوانند از نسخه کوچکتر آن یعنی GPT-Live-۱ mini استفاده کنند.
GPT-Live جایگزین حالت صوتی Advanced Voice به عنوان گزینه پیشفرض شده است. برای شروع مکالمه کافی است روی آیکون صوتی به شکل موج در سمت راست کادر نوشتن ChatGPT ضربه بزنید. اگر برای نخستین بار از حالت صوتی استفاده میکنید، ممکن است لازم باشد اجازه دسترسی برنامه به میکروفون دستگاه را صادر کنید.
پس از ورود به حالت صوتی، یک گوی شناور روی صفحه ظاهر میشود و میتوانید مکالمه را مانند یک گفتوگوی معمولی آغاز کنید. با انتخاب آیکون تنظیمات در گوشه بالای صفحه نیز امکان تغییر سطح هوش مدل وجود دارد.
در حال حاضر سه سطح Instant، Medium و High در اختیار کاربران قرار دارد. البته این قابلیت در نسخه GPT-Live-۱ mini ارائه نشده و به همین دلیل برای استفاده از آن به یکی از طرحهای پولی نیاز دارید.
“”توسعه برند را در اینستاگرام و تلگرام و لینکدین دنبال کنید””
یکی دیگر از ویژگیهای کاربردی این حالت آن است که مکالمه صوتی حتی هنگام جابهجایی به یک برنامه دیگر یا قفل کردن گوشی نیز میتواند ادامه پیدا کند.
با وجود این پیشرفتها، GPT-Live هنوز محدودیتهایی دارد. برای مثال، اشتراکگذاری صفحه یا ویدئو در حالت صوتی جدید فعلاً پشتیبانی نمیشود. کاربرانی که همچنان مدل قبلی را ترجیح میدهند میتوانند از تنظیمات ChatGPT وارد بخش Voice شوند و مدل صوتی دیگری را انتخاب کنند.
در همین بخش میتوان صدای ChatGPT را نیز تغییر داد، زبان مورد استفاده را انتخاب کرد و حالت صوتی را به عنوان گزینه پیشفرض هنگام اجرای برنامه تنظیم کرد.

نقطه قوت GPT-Live چیست؟
مهمترین تفاوت GPT-Live با نسلهای قبلی را شاید بتوان در طبیعیتر شدن ریتم مکالمه خلاصه کرد. در یک مکالمه طولانی، کاربر کمتر احساس میکند با یک سامانه هوش مصنوعی صحبت میکند؛ زیرا دیگر لازم نیست بعد از هر جمله منتظر پایان پاسخ مدل بماند و سپس صحبت خود را ادامه دهد.
این مدل همچنین برای ترجمه زنده کاربرد قابل توجهی دارد. در طول مکالمه میتوان صفحه را به سمت پایین پیمایش کرد تا متن کامل گفتوگو نمایش داده شود و کاربر بتواند آنچه گفته شده را به صورت نوشتاری نیز دنبال کند.
GPT-Live در صورت تشخیص اینکه پاسخ یک پرسش با نمایش اطلاعات تصویری بهتر منتقل میشود، میتواند در کنار پاسخ صوتی یک ابزار تعاملی روی صفحه نیز ایجاد کند.
بهصورت پیشفرض، سطح هوش مدل روی حالت Instant قرار دارد؛ گزینهای که برای پرسشهای روزمره طراحی شده و سرعت پاسخگویی را در اولویت قرار میدهد. با این حال، مدل همچنان میتواند در صورت نیاز، جستوجو یا استدلالهای پیچیدهتر را به مدلهای قدرتمندتر منتقل کند.
برای کاربرانی که قصد دارند درباره موضوعات پیچیدهتر با ChatGPT گفتوگو کنند، انتخاب حالتهای Medium یا High میتواند نتیجه بهتری داشته باشد. این دو حالت ممکن است یک یا دو ثانیه زمان بیشتری برای پردازش نیاز داشته باشند، اما به گفته تجربه آزمایشی انجامشده، این تأخیر تأثیر محسوسی بر روان بودن مکالمه ندارد.
«GPT-Live بیش از آنکه صرفاً یک حالت صوتی سریعتر باشد، تلاش OpenAI برای تبدیل ChatGPT به یک همراه مکالمهای واقعیتر است؛ مدلی که میتواند مکثها، قطع و وصل شدن صحبت و حتی واکنشهای کوتاه حین گفتوگو را بهتر مدیریت کند.»
در مجموع، OpenAI با GPT-Live فاصله میان گفتوگو با انسان و تعامل صوتی با هوش مصنوعی را یک قدم دیگر کاهش داده است. اگرچه قابلیتهایی مانند اشتراکگذاری ویدئو و صفحه هنوز در این مدل وجود ندارد، اما توانایی گوش دادن و صحبت کردن همزمان، مدیریت بهتر مکثها، ترجمه زنده و استفاده از مدلهای قدرتمندتر در پسزمینه میتواند حالت صوتی ChatGPT را به یکی از کاربردیترین روشهای تعامل با این سرویس تبدیل کند.



