最新消息:关注人工智能 AI赋能新媒体运营

OpenRouter统一API:一个key同时搞定ChatGPT对话与Whisper语音转录,按token计价STT上线

科技资讯 admin 浏览

OpenRouter 统一语音转录与聊天接口,开发者无需再维护独立服务

OpenRouter 近日在其平台上线语音转文本端点,允许开发者使用与 Chat Completions 相同的认证密钥完成音频转录,解决此前聊天与转写服务割裂的问题。

新端点为 POST /api/v1/audio/transcriptions,接收 base64 编码的音频文件,返回包含转录文本和用量对象的 JSON。这意味着已使用 OpenRouter 的团队无需额外申请密钥或搭建 Whisper 服务器,即可在同一平台内完成文本对话与语音转录。

模型方面,OpenRouter 提供两类选择:一类为 openai/whisper-1 等按音频时长计费的 Whisper 模型;另一类为按 token 计费的新式语音转文本模型。后者需通过 ?output_modalities=transcription 参数筛选,不会出现在默认模型目录中。平台 Playground 支持浏览器内直接上传文件测试。

调用方式上,开发者需提交 model、input_audio.data 及 input_audio.format 三个必填字段,格式支持 wav、mp3、flac、m4a、ogg、webm、aac。若已有面向 OpenAI /v1/audio/transcriptions 的客户端,仅需将 base URL 改为 https://openrouter.ai/api/v1 即可完成迁移。端点同时支持 OpenAI 风格的 multipart/form-data 上传,文件大小上限 25MB。

响应默认返回 json 格式,设 response_format 为 verbose_json 可额外获取语言、时长及片段时间戳,配合 timestamp_granularities=word 可获得词级时间戳,但后者目前仅兼容 OpenAI、Groq、Together 等提供商。响应中的 usage 对象支持按请求精确计量费用,响应头附带 X-Generation-Id 便于追踪。

路由机制沿用聊天接口的负载均衡逻辑,按价格在多提供商间自动分发请求。不过转录端点尚未开放按请求路由控制,order、only 等字段暂不生效。OpenRouter 承诺不加价,目录价即为实付价,失败请求不计费;支持 BYOK 模式,使用自有密钥可免除模型成本,仅付平台费。

实际使用中存在四项主要约束:60 秒上游超时限制,大文件或需分段处理;不支持音频 URL,仅接受 base64 JSON 或 25MB 以内文件;不支持 SRT/VTT 输出格式,字幕需自行拼接;格式兼容性因提供商而异,wav 兼容性最佳。

此外,OpenRouter 对转录与音频理解做了明确区分:/audio/transcriptions 用于纯转录场景;若需模型对音频内容推理分析,应使用 /chat/completions 的 input_audio 内容类型。文本转语音则为另一独立端点。