ByteDance 发布 SeedRealtime:面向 audio-visual full-duplex interaction

ByteDance Seed 发布 SeedRealtime,主打原生 audio-visual、full-duplex 的 LLM,让模型持续理解声音、影像和文字,并在对话中主动回应及调用工具。

ByteDance Seed 于 2026 年 8 月 5 日发布 SeedRealtime,将它描述为面向 omni-modal natural interaction 的 audio-visual full-duplex LLM。产品方向不是等用户说完一句话才处理下一轮,而是把 audio、video、text 和持续输入放在同一个互动流程中,让模型可以更接近人与人之间的即时对话。

SeedRealtime 的一个核心能力是 joint audio-visual understanding。模型不只处理说出的内容,也可以把画面、声音和语境放在一起理解。例如在用户操作 espresso machine 时,它可以根据画面和声音给出提示;在阅读 paper、参观 museum 或身处嘈杂 airport 时,模型可以根据持续感知的环境作出相关回应。这些是 ByteDance 公布的示例,不代表每个场景的实际可靠度都相同。

Full-duplex interaction 也改变了轮流发言的节奏。SeedRealtime 可以在对话未完全结束时处理新的 audio-visual signals,并在看见指定目标、察觉环境变化或需要提醒时主动说话。自然的体验不只是 latency 变低,也包括何时打断、何时保持安静,以及如何避免重复或不合时宜的提示。

ByteDance 表示,SeedRealtime 可以在回应中调用 tools,因此不只是一种能看和能听的 chatbot。如果把它接到 lookup、calendar、booking 或其他外部系统,模型就可以由感知和对话进一步走向 action。不过,主动触发工具需要清楚的 user intent、权限、确认和 audit controls;没有这些控制时,proactive interaction 也可能变成不必要的外部操作。

公司公布的 human evaluation 表示,和 cascaded models 比较,SeedRealtime 将 pacing issues 减少约一半。这个结果是 ByteDance 自己的评估,文章没有提供足够的独立 benchmark、数据集和完整方法让外界重现,因此应理解为供应商对产品体验的报告,而不是已经确立的行业标准。

ByteDance 也表示 SeedRealtime 已 fully rolled out 并进入 large-scale deployment。这是公司对产品部署状态的说法;读者仍需要分清「已在特定场景大规模使用」与「已对所有开发者公开、可用于所有地区和用途」之间的差异。模型的可用 API、价格、延迟、数据保留和安全设置要以实际产品文档为准。

这类模型的难点会由单轮回答质量,延伸到连续感知和互动策略。团队需要测试 interruption、false trigger、background noise、多人对话、视觉误判、工具重试和长时间 session 的成本,也要让用户知道模型何时正在聆听、看见什么和准备采取行动。

ByteDance 将下一步方向列为更低 latency、更主动的 perception、多人的互动,以及整合 tools、lookup 和 booking。如果这些能力成熟,audio-visual agent 会由「被动回答问题」更接近「在环境中持续观察并协助行动」。但越主动的 agent,越需要可见的权限、可撤回操作和以事件为本的监测,才不会把自然互动变成不可预期的自动化。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。