谷歌升级Gemini Live语音功能,AI交互简化仍存挑战
谷歌近日发布Gemini Live全新语音功能更新,用户可通过自然语音指令调用聊天、Spark、每日简报等功能,完成信息处理与任务执行。谷歌表示,升级后的Gemini应用能够自动理解用户需求,无需用户自行判断该使用哪项具体功能。
不过,这一设计也暴露出当前AI应用面临的交互难题。尽管谷歌希望以语音入口简化操作,但Gemini仍将聊天、Spark和每日简报作为独立功能呈现,各自拥有不同图标和入口,反而增加了用户的理解与选择成本。
具体来看,每日简报依托Gmail、日历等谷歌生态数据,为用户提供主动式个性化更新,但其信息筛选能力仍有不足,部分提醒可能并非用户当前所需。Spark作为具备任务执行能力的AI代理,更接近未来AI助手的发展方向,但谷歌将其独立品牌化,也让用户需要额外理解不同功能之间的区别。
这一问题并非Gemini独有。当前AI行业普遍存在将内部模型架构、功能模式直接暴露给用户的现象。部分AI产品要求用户区分聊天、协作、代理等不同模式,而消费者更期待通过统一入口提出需求,由AI自动判断并调用合适能力。
业内认为,未来AI助手的发展方向在于降低交互复杂度,将复杂的模型、代理和工具调用隐藏在后台。苹果围绕Siri的策略,以及部分基于文本交互的AI代理产品,均强调通过熟悉的聊天方式完成任务。随着AI能力持续增强,如何让用户无需学习新的操作逻辑,或将成为下一阶段AI产品竞争的关键方向。