摘要
Omni Interaction Agent 技术报告发布 Gander:一个统一全模态感知、实时交互与 agent 能力的端到端模型——持续接收视频、语音、文本的流式输入,在日常对话与工作流 agent 场景中实现全双工交互,支持用户随时打断、模型主动给中间反馈与追问。两个关键设计:Cerebellum-Brain 协作框架(Cerebellum 负责实时交互与全模态对话,Brain 负责复杂推理与高层 agent 任务,两者经工具调用与 agent 编排运行时持续交互)与流式 Thinker-Talker 的 Cerebellum(把用户输入与模型输出展平为一个按 chunk 排序的统一 token 流,支撑低延迟连续交互)。内部人工评测:保持 SOTA 开源口语对话的自然与表现力,omni 交互具竞争力,在背景噪声、多方对话、backchannel 场景下稳健。模型、代码、数据一并发布。
为什么重要
全双工语音 agent 本周刚以商业 API 形态上线(GPT-Live 1 GA);Gander 是开放权重一侧的对应物,还附带编排运行时——首个把实时全模态交互与 agent 工具使用打包在一起的开源发布,其快/慢双层 + 统一 token 流的参考架构,适合所有想做自己能审查的语音 agent 的团队。
技术细节
| ArXiv | 2609.08977(9 月 10 日周四 digest,2026-09-11T00:00Z 宣告) |
|---|---|
| 架构 | Cerebellum-Brain 分工(实时全模态对话 vs 复杂推理 + agent 任务;经工具调用与编排运行时交互);流式 Thinker-Talker Cerebellum;chunk 级有序统一 token 流 |
| 能力 | 全双工、用户打断、主动中间反馈、追问;视频+语音+文本流式输入 |
| 评测 | 内部人工评测:SOTA 开源口语对话自然度;omni 交互具竞争力;噪声 / 多方 / backchannel 稳健 |
| 发布 | 模型 + 代码 + 数据一并发布 |
标签
omni-agentvoicefull-duplexopen-weightsmultimodal