OpenAI 为 ChatGPT 桌面应用推出语音控制功能,可操控 AI 智能体执行复杂任务
OpenAI 本周为其 ChatGPT 桌面应用带来重要更新,正式上线 ChatGPT Voice 语音交互功能。用户现在可以直接通过语音与 ChatGPT 对话,并控制 AI 智能体在电脑上独立完成多步骤复杂操作。
该功能底层基于 OpenAI 本月初发布的全新语音模型系列 ChatGPT-Live。目前 ChatGPT Voice 已全面支持 ChatGPT Work 和 Codex 平台,具备计算机操作能力,可协助用户访问各类网站与应用程序。在 macOS 系统上,结合 Appshots 功能,用户还可授权 AI 访问屏幕全部内容及其替代文本。
与手机端侧重流畅对话和打断优化的语音功能不同,此次桌面端更新显著提升了任务执行能力。用户能够用语音下达包含多个步骤的复合指令,并在 AI 需要补充信息或确认时实时互动。官方演示显示,开发者仅用一句语音指令即可引导 AI 创建代码线程、提交 Pull Request 并定位 Bug 根源。此外,用户还可通过 iOS 应用的远程访问功能在 Codex 中调用 ChatGPT Voice。
竞争对手 Anthropic 也在加速布局语音交互。该公司为 Claude 推出的全新语音模式可调用 Opus、Sonnet 和 Haiku 模型,在 Gmail、Calendar、Slack、Notion 及 Canva 等主流办公应用中处理日常工作。