OpenAI روز پنجشنبه اعلام کرد که اپلیکیشن دسکتاپ ChatGPT را با پشتیبانی از قابلیت صوتی (ChatGPT Voice) بهروزرسانی کرده است. با این قابلیت جدید کاربران میتوانند تنها با صحبت کردن، با دستیار هوش مصنوعی تعامل کنند، چند عامل (agent) را مدیریت نمایند و وظایف پیچیدهای را روی کامپیوتر خود اجرا کنند.
قابلیت صوتی جدید از خانواده مدلهای صوتی تازهمعرفیشده OpenAI که با نام ChatGPT‑Live عرضه شدهاند استفاده میکند (در برخی منابع این خانواده با عنوان GPT‑Live نیز ذکر شده است). این مدلها امکان شنیدن، صحبتکردن و هماهنگی همزمان کارها در داخل اپ را فراهم میکنند و به گفته OpenAI، اکنون در نسخه دسکتاپ توانایی اجرای دستورات چندمرحلهای و پاسخدهی پویا زمانی که نیاز به ورودی کاربر هست را دارا هستند.
ویژگیهای کلیدی بهروزرسانی:
– کنترل چندگانهی عاملها: کاربران میتوانند با فرمان صوتی چند عامل فعال در ChatGPT Work یا Codex را هدایت و همزمان کنترل کنند.
– یکپارچگی با Codex و ChatGPT Work: قابلیت صوتی در هر دو حالت کاری قابل استفاده است و میتواند از مهارتهای مربوط به استفاده از نرمافزارها و جستجوی وب بهره ببرد.
– دسترسی صفحه در macOS با Appshots: روی مک، اپ میتواند با اجازه کاربر محتوای صفحه (از جمله متنهای جایگزین یا alt-text) را مشاهده کند تا اجرای وظایف مرتبط با محتوای نمایش دادهشده سادهتر شود.
– بهبود نسبت به نسخه موبایل: نسخه موبایل ChatGPT Voice در زمان رونمایی اولیه گفتگوهای روانتر و مدیریت بهتر وقفهها را ارائه میداد اما توانایی اجرای خودکار عملیات روی موبایل محدود بود؛ نسخه دسکتاپ اکنون قادر است دستوراتی که شامل چند گام متوالی هستند را نیز اجرا کند.
در ویدیوی نمایشی OpenAI، نمونهای نشان داده شد که یک توسعهدهنده تنها با یک دستور صوتی از ChatGPT خواست یک موضوع جدید ایجاد کند، Pull Request بسازد و علت رخداد یک باگ را پیدا کند — نمونهای که توانایی انجام چند عمل پیچیده با یک فرمان واحد را نشان میدهد. OpenAI همچنین اعلام کرده که دسترسی از راه دور از طریق اپ iOS امکان استفاده از ChatGPT Voice در Codex را فراهم میسازد.
نکتههای مهم درباره حریم خصوصی و دسترسیها:
برای استفاده از قابلیتهایی مانند Appshots و دسترسی از راه دور، کاربر باید بهصورت صریح مجوزهای لازم را بدهد. کاربران باید هنگام فعالکردن قابلیتهای صوتی و دسترسی به محتوای صفحه توجه داشته باشند که چه اطلاعاتی در دسترس مدل قرار میگیرد و تنظیمات حریم خصوصی را مطابق نیاز تنظیم کنند.
رقابت در فضای صوتی هوش مصنوعی:
در همین زمان، Anthropic نیز حالت صوتی Claude را بهروزرسانی کرده است؛ این حالت میتواند از مدلهای صوتی Opus، Sonnet و Haiku برای تکمیل وظایف در اپلیکیشنهایی مانند Gmail، Calendar، Slack، Notion و Canva بهره ببرد. بهروزرسانیهای اخیر نشان میدهد رقابت برای ارائه تجربه صوتی تعاملی و عملی در ابزارهای هوش مصنوعی شدت گرفته و کاربران در آینده نزدیک با گزینههای متنوعتری برای کار صوتی با هوش مصنوعی روبهرو خواهند بود.
OpenAI اعلام کرده که این قابلیت از امروز بهصورت جهانی در دسترس قرار میگیرد؛ برای بهرهمندی از آن، کاربران میتوانند اپ دسکتاپ ChatGPT را بهروزرسانی کرده و مجوزهای لازم را تنظیم کنند.
