互动模式:全双工、聆听、对讲机
2026-08-25
场景说明
在与智能体互动时,有以下三种互动形式,可以通过创建智能体实例时的 AdvancedConfig.CommunicationMode 参数配置:
| 互动形式 | 使用场景 | 常见场景 |
|---|---|---|
| 全双工互动(默认) | 自由对话场景,用户随时可以说AI随时可以回应。 | AI 语音通话 |
| 聆听模式 | 持续语音转写场景,AI 仅聆听不回复。 | 云端语音识别、AI 面试、用户内容总结 |
| 对讲机模式 | 按需发言的短轮交互场景,用户按住说话、松开后获得 AI 回复。 | 在线会议中的临时发言、AI 硬件中的隐私保护 |
AI Agent 行为差异
| 维度 | 全双工模式 | 聆听模式 | 对讲机模式 |
|---|---|---|---|
| 用户说话与结束条件 | 由 VAD 自动检测断句结束 | 由 VAD 自动检测断句结束 | 由 StartListening 开始、StopListening 结束一次聆听;通常在 30 秒以内 |
| AI 说话触发时机 | ✅ 用户结束说话后 AI 自动回复 ✅ 调用 SendAgentInstanceTTS 等方式让 AI 主动说话 | ✅ 调用 SendAgentInstanceTTS 等方式让 AI 主动说话 | ✅ 用户结束聆听后 AI 自动回复 ✅ 调用 SendAgentInstanceTTS 等方式让 AI 主动说话 |
| ASR 回调 | 用户说话结束后下发结果 | 每个符合断句规则的结果均下发;持续聆听可能产生多次回调 | StopListening 后下发本次结果 |
| LLM 请求 | 请求 LLM,生成回复 | 不请求 LLM | 请求 LLM,生成回复 |
| TTS | 播报 AI 回复内容 | 不自动播报 | 播报 AI 回复内容 |
| 字幕 | 正常下发 | 正常下发 | 正常下发 |
互动模式切换
- 全双工模式(0)与聆听模式(1)可以互相切换,切换后从下一句用户说话开始生效。
- 对讲机模式(2)不支持切换到其他模式。
实现步骤
前提条件
- 开通 AI Agent 服务,并按快速发起语音通话完成基本流程。
