实时互动 AI Agent
当前页

互动模式:全双工、聆听、对讲机

2026-08-25

场景说明

在与智能体互动时,有以下三种互动形式,可以通过创建智能体实例时的 AdvancedConfig.CommunicationMode 参数配置:

互动形式使用场景常见场景
全双工互动(默认)自由对话场景,用户随时可以说AI随时可以回应。AI 语音通话
聆听模式持续语音转写场景,AI 仅聆听不回复。云端语音识别、AI 面试、用户内容总结
对讲机模式按需发言的短轮交互场景,用户按住说话、松开后获得 AI 回复。在线会议中的临时发言、AI 硬件中的隐私保护

AI Agent 行为差异

维度全双工模式聆听模式对讲机模式
用户说话与结束条件由 VAD 自动检测断句结束由 VAD 自动检测断句结束由 StartListening 开始、StopListening 结束一次聆听;通常在 30 秒以内
AI 说话触发时机✅ 用户结束说话后 AI 自动回复
✅ 调用 SendAgentInstanceTTS 等方式让 AI 主动说话
✅ 调用 SendAgentInstanceTTS 等方式让 AI 主动说话✅ 用户结束聆听后 AI 自动回复
✅ 调用 SendAgentInstanceTTS 等方式让 AI 主动说话
ASR 回调用户说话结束后下发结果每个符合断句规则的结果均下发;持续聆听可能产生多次回调StopListening 后下发本次结果
LLM 请求请求 LLM,生成回复不请求 LLM请求 LLM,生成回复
TTS播报 AI 回复内容不自动播报播报 AI 回复内容
字幕正常下发正常下发正常下发

互动模式切换

  • 全双工模式(0)与聆听模式(1)可以互相切换,切换后从下一句用户说话开始生效。
  • 对讲机模式(2)不支持切换到其他模式。

实现步骤

前提条件

实现不同的互动形式

上一篇

控制智能体语音情绪

下一篇

AI 播报时获取 MetaInfo

当前页

返回到顶部