今天留下两条 OpenAI 的产品发布。它们不是同一件事,却都在把原来藏在产品里的能力拆出来:一边是让开发者部署和运行 Agent,另一边是把全双工语音交互放进 API。
Agents API:不只给一个模型,还给它干活的场地
OpenAI 在 9 月 10 日发布了 Agents API,目前处于公测。按官方说明,开发者可以在一次 API 调用中配置任务、模型、工具和运行环境,使用由 OpenAI 托管的 Agent harness;运行环境也可以选 OpenAI 的沙盒、自有基础设施或合作伙伴环境。
这条消息的重点不在“又多了一个 API”。做长任务时,模型只是其中一张牌。上下文怎么续、工具怎么找、文件放在哪里、权限给到哪一步、失败以后怎么恢复,才决定这套东西能不能真进工作流。OpenAI 在这次发布中提供了长会话、上下文压缩、工具搜索和多 Agent 编排等能力,但这些能力最终能不能交付,还是要看你的任务、数据和权限是怎么接进去的。
如果你在评估这类产品,别先问模型名字。先拿一个边界清楚的小任务试:它能否完成、你能否验收、出错以后能否接回来。跑通这三步,再谈把更多工作交给它。
GPT-Live-1:语音层少一次来回转手
同日,OpenAI 还把 GPT-Live-1 上线到 API。官方称,它能同时听和说,并把更深的推理或工具调用委派给后端文本模型。与传统的语音识别、文本模型、语音合成串联方案相比,这种设计试图减少中间交接带来的延迟和上下文丢失。
语音 Agent 真正难的地方,常常不是把一句话识别出来,而是人在停顿、插话、改口时,系统还能不能跟上。官方把这次产品的重点放在打断处理、背景噪声、长会话和电话场景上,也说明语音产品开始从“能对话”进入“能放进具体流程”的阶段。
它现在的定价是前端语音层每分钟 0.05 美元,后端模型和工具还要另外算。做产品的人得把这笔账单独摊开:体验更自然当然有价值,但调用频率、任务时长和人工兜底,最后都会落到成本上。
今天可以带走什么
模型能力还在涨,但普通人能感受到差异的地方,越来越不只是回答好不好,而是流程有没有少一道麻烦。无论是 Agent 还是语音,都别只看演示。先找一项重复、可验收、出错后能接手的工作,把它跑一遍;能稳定交付,才算摸到了一张能上桌的牌。