
ByteDance Seed 在 2026 年 8 月 5 日發布 SeedRealtime,將它描述為面向 omni-modal natural interaction 的 audio-visual full-duplex LLM。產品方向不是等使用者說完一句話才處理下一輪,而是把 audio、video、text 和持續輸入放在同一個互動流程中,讓模型可以更接近人與人之間的即時對話。
SeedRealtime 的一個核心能力是 joint audio-visual understanding。模型不只處理講出的內容,也可以把畫面、聲音和語境放在一起理解。例如在使用者操作 espresso machine 時,它可以根據畫面和聲音給出提示;在閱讀 paper、參觀 museum 或身處嘈雜 airport 時,模型可以根據持續感知的環境作出相關回應。這些是 ByteDance 公布的示例,不代表每個場景的實際可靠度都相同。
Full-duplex interaction 亦改變了輪流發言的節奏。SeedRealtime 可以在對話未完全結束時處理新的 audio-visual signals,並在看見指定目標、察覺環境變化或需要提醒時主動說話。自然的體驗不只是 latency 變低,也包括何時打斷、何時保持安靜,以及如何避免重覆或不合時宜的提示。
ByteDance 表示,SeedRealtime 可以在回應中呼叫 tools,因此不只是一個能看和能聽的 chatbot。若把它接到 lookup、calendar、booking 或其他外部系統,模型就可以由感知和對話進一步走向 action。不過,主動觸發工具需要清楚的 user intent、權限、確認和 audit controls;在沒有這些控制時,proactive interaction 也可能變成不必要的外部操作。
公司公布的 human evaluation 表示,和 cascaded models 比較,SeedRealtime 將 pacing issues 減少約一半。這個結果是 ByteDance 自己的評估,文章沒有提供足夠的獨立 benchmark、資料集和完整方法讓外界重現,因此應理解為供應商對產品體驗的報告,而不是已確立的行業標準。
ByteDance 亦表示 SeedRealtime 已 fully rolled out 並進入 large-scale deployment。這是公司對產品部署狀態的說法;讀者仍需要分清楚「已在特定場景大規模使用」與「已對所有開發者公開、可用於所有地區和用途」之間的差異。模型的可用 API、價格、延遲、資料保留和安全設定要以實際產品文件為準。
這類模型的難點會由單輪回答品質,延伸到連續感知和互動策略。團隊需要測試 interruption、false trigger、background noise、多人對話、視覺誤判、工具重試和長時間 session 的成本,也要讓使用者知道模型何時正在聆聽、看見甚麼和準備採取行動。
ByteDance 把下一步方向列為更低 latency、更主動的 perception、多人的互動,以及整合 tools、lookup 和 booking。若這些能力成熟,audio-visual agent 會由「被動回答問題」更接近「在環境中持續觀察並協助行動」。但越主動的 agent,越需要可見的權限、可撤回操作和以事件為本的監測,才不會把自然互動變成不可預期的自動化。



