
xAI 在 2026 年 7 月 1 日宣布 Voice Agent Builder beta,定位是让 operators 和 developers 不用自己拼接底层 stack,也能在 Grok Voice 上配置 production voice agents。官方说法很直接:不用写 code,约两分钟内可以建立个人化语音代理。
这个产品重要,是因为语音 AI agent 的工程成本一直很高。传统 voice stack 通常要把 speech-to-text、language model、text-to-speech 三段服务接在一起,中间每一次 handoff 都会增加 latency、成本和 failure mode。xAI 的做法,是把它放进一个 speech-to-speech interface,并和 Grok Voice 紧密连接。
功能组合也很完整。Voice Agent Builder 内建 telephony、knowledge retrieval、tools、guardrails、MCPs 和 observability;企业也可以带入现有 phone numbers、通过 SIP 接驳、把 tools 接到自家 API 和 MCP servers,或用 WebSocket 连接自己的 client。这表示它不是只做 demo voice bot,而是面向真实业务流程。
语音 agent 最难的地方,是真实电话从来不干净。xAI 特别提到低质素电话音频、背景噪音、口音、打断、改变主意,以及跨 25+ languages 的模糊流程。这些场景对纯文字 agent 不常见,但对客服、销售、预约和内部支持电话来说,正是每天发生的情况。
另一个值得留意的地方,是 review 和 guardrails。每通电话会被录音和转录,团队可以查看工具使用记录;guardrails 可限制 agent 不应做的事,例如读出卡号或偏离 script。这些功能决定 voice agent 能否由试玩走向 production,因为语音互动的错误成本通常比文字更高。
价格讯号也很清楚:xAI 把 agent 按 API 音频用量计价,并列出 $0.05/min 的音频费用,free provisioned number 的 telephony 另计。对企业来说,这令 voice AI 成本可以更容易用 call volume 估算,而不用拆开多个供应商的收费表。
Voice Agent Builder 反映 AI workflow 的下一个战场:不只是 chat、coding 或文件,而是直接进入电话、客服、销售和预约这些高频交互。当语音 agent 同时有知识库、工具、guardrails、电话号码和 observability,语音自动化就开始由「语音模型」变成一个可管理的营运工作流。



