跨越语音模态的鸿沟——领域知识增强

 

 

近两年,端到端语音模型(S2S)的快速发展正在把语音 Agent 从“会播报的系统”推向“能实时对话的系统”。从 Moshi、Qwen2.5-Omni、GLM-4-Voice,到 OpenAI Realtime API,语音系统已经逐渐具备了低延迟、自然打断、更拟真的语音交互能力。但对保险、金融、医疗、销售等垂类业务而言,真正值得关注的问题不是“如何把语音做得更像真人”,而是在语音模型的应用中如何将企业的知识以及业务逻辑融合进这个系统中,从而让语音 Agent 既实现低延迟和高拟人度,同时又具备专业的领域知识并遵守领域约束。本文通过分析近年来语音模型应用层的知识增强方法,尝试探讨:当语音 Agent 从级联式系统走向原生 S2S 架构时,领域知识应该如何参与实时语音理解、推理与生成?
 

本文主要内容包括:
 

1. 对比和阐述四种主流S2S架构的知识增强方案

2. 探讨在保险金融领域落地的演进之路

3. 结语 - 从“会说话”到“懂业务”的语音智能体

分享嘉宾|林映如 暖哇科技算法高级专家


01 语音端到端架构下的知识增强

 

1. 方案1:端到端跨模态检索增强

 

端到端语音模型不再依赖传统的 ASR 将语音转化成文本后再进行检索,而是让语音输入本身直接参与知识检索,这种方案旨在解决 ASR 传输错误对系统的影响以及保留传统 ASR 会丢掉的语气,停顿,情绪,非语言信息等。


WavRAG 直接引用原始音频生成嵌入做检索

 

 

MoshiRAG 在全双工场景下进行异步知识检索

 

技术机制:摒弃 ASR 模块,通过直接引入原始音频作为检索 query(如 WavRAG)以及利用全双工语音隐式输出 Trigger Token(如 MoshiRAG)触发后台知识库检索的方式,降低语音模型的幻觉率,同时保持低延迟和自然的交互。

 

优点和适用场景:在专业名词多导致 ASR 容易出错的场合可以降低 ASR 错误对知识召回的影响,适用于动态知识频繁变化的业务场景。由于更接近 S2S 模型的架构,该方案的延迟相较三级联模式会更低。
 

缺点:通过音频直接指导知识的检索会使得可解释性降低,其次是业务知识绝大多数是天然文本形式,需要构建音频-文本共享嵌入,否则语音 query 很难精准匹配文本知识。

 

2. 方案 2. 语音原生 Agentic 能力

 

在一些延迟容忍度更高且任务导向更明确的业务场景中,业务对 S2S 语音模型的预期更多的不是得到一个解释,而是更关注一切既定任务的完成度。在这种情况下,语音模型需要在听用户说话的过程中自动完成任务理解、参数抽取、工具选择和 API 调用,并将工具返回结果继续融合进后续语音回复。

 

 

 

VoxMind 在语音模型中引入了 Think-before-Speak 机制,并通过工具调用异步检索相关工具注入主模型推理路径

 

 

Thinking Machines Lab 发布的语音模型支持实时交互并利用异步调用模型进行推理任务

 

技术机制: 为了让语音模型在知识理解和任务执行的表现更优,即不只是听懂用户问题并准确回答,还需要在语音交互过程中状态理解,任务规划和结果输出。这类方案把外部工具视为语音 Agent 能力的一部分,包括但不仅限于知识检索,强调调用工具不打断对话流。VoxMind 专注于推理过程和工具调用能力,而 Thinking Machines lab 的方向更强调后台异步执行带来的低延迟体验。

 

优点和适用场景:此类方案将回答问题升级为执行任务,将外部系统视为语音 Agent 的一部分,非常适用于任务型对话任务。

 

缺点:任务执行能力(Agent 能力)和事实性存在着天然矛盾,任务规划,推理,以及工具调用通常需要高首包延迟或打断语音流。工具调用以及任务执行错误存在的风险更大。

 

3. 方案 3. 上下文提示和长音频推理

 

如果场景要求不依赖知识检索和外部的工具调用,也不改变模型参数,而将参考的知识和业务 SOP 以及历史对话,原始音频和视频,以及文本用户信息等放入上下文,让多模态语音模型在长上下文中遵循规则并完成推理,这需要极强的模型基座,超长上下文窗口以及多模态能力(至少是文本和语音),Gemini 系列模型是这一类场景的解法之一。 

 

 

 

Gemini 系列模型具备很强的超长音频上下文检索/定位能力,甚至在非常长的音频上下文里仍能找到目标信息

 

技术机制: 不通过微调把领域知识写入模型参数,而是在会话上下文中直接提供业务规则、SOP、合规限制、用户状态和历史交互,让模型依靠长上下文理解与指令遵循能力完成约束生成。

 

优点和适用场景:此类方案适用于业务知识和规则简单,不需要搭建复杂知识库以及 Agent 系统的场景,也适用于业务流程和产品解释口径、转人工规则经常调整的场景。

 

缺点:由于长上下文导致延迟无法保证,随着规则和约束变多上下文约束不稳定。

 

4. 方案 4. 模态对齐与领域微调

 

此类方案不再依赖挂载外部垂类知识,也不再通过调用工具执行任务从而获取回答,而是通过训练阶段的模态对齐,语音 Token 建模,领域数据微调或音频推理数据蒸馏等方法,把领域知识和理解能力以及业务表达内化到语音模型本身。

 

 

 

GLM-4-Voice 通过 speech tokenizer、speech-text interleaved data 和大规模预训练,把文本 LLM 的知识能力迁移到语音模态

 

 

 

Qwen2.5-Omni 提出 Thinker-Talker 架构:Thinker 负责语义理解、文本生成和推理,Talker 生成 audio tokens

 

技术机制: 模态对齐与领域微调的解法是内化知识,核心是通过 对多模态的 encoder 以及 decoder 进行领域微调,让模型在参数层或语义层掌握领域知识和行业术语以及业务逻辑。

 

优点和缺点:这一路线更适合稳定知识、通用话术和声学理解能力的内化,不适合承载频繁变化的业务知识、强执行的业务环境。在语音系统中,它更适合作为语音底座能力,与 RAG、工具调用和实时上下文机制共同使用。

 

02 保险金融领域落地的演进之路

语音模型的飞速发展,为保险领域的需求端带来了诸多机会,例如保险销售、售后服务、理赔问答等需要实时语音交互的场景。技术的发展最终要在业务中体现价值,而保险金融行业的大部分知识仍然以文本形式沉淀,例如产品条款、业务规则、合规要求和服务流程,这也是语音交互系统通常会从级联模式起步的原因。而当语音 Agent 从级联式系统走向原生 S2S 架构时,领域知识增强,并参与实时语音理解和生成就显得尤为重要。

1. 知识飞轮建设

在保险金融行业,产品条款、保费规则、健康告知、核保限制、理赔流程等都属于高风险知识。现阶段我们通过知识飞轮(Knowledge Flywheel)驱动知识的加工,入库和再生产过程,用以作为 Agentic 系统的核心知识枢纽,在级联系统和语音系统中间构造知识的桥梁。

2. 引入语音模型能力层

随着语音模型的技术逐步成熟,先将其放在前台交互层,而不直接让它承载所有业务知识。语音模型主要承载前端的轮次检测,打断处理,副语音元素保留和处理以及低风险对话推进;而产品规则、价格、核保、理赔和 SOP 业务逻辑判断仍然由知识系统提供事实校正。

3. 高风险知识外部化,稳定能力内化

稳定高效的语音系统最终应该由多个有机体组成,多模态模型基座是其中之一,领域知识系统是其二,而工具调用等 agentic 能力也不可或缺。通过模型的微调将基础概念、通用话术和口语化表达能力通过领域微调内化到语音模型中,将产品条款、价格、核保、理赔和用户保单状态等一些高风险高变动信息保留在外部系统,最终达到既保留了语音模型的高度拟人和低延迟,同时返回的回答又有外部依据和可追踪链。

 

03 结语 - 从“会说话”到“懂业务”的语音智能体

 

从端到端跨模态检索增强,到语音原生 Agentic 能力,再到模态对齐与领域微调,以及基于上下文的长程会话约束,语音模型的知识增强路径正在逐渐清晰:未来的语音 Agent 不会只是一个更自然的发声模型,也不会只是传统文本 Agent 外面套上一层语音外壳,而会成为一个由语音模型、领域知识、业务工具、上下文记忆和合规约束共同组成的实时智能系统。

 

对于保险金融行业而言,这一点尤其重要。语音自然度决定了用户是否愿意继续交流,但知识准确性、业务可控性和合规边界,才决定了系统是否能够真正上线。一个保险语音 Agent 不能只做到低延迟、能打断、像真人,它还必须理解产品条款、遵守核保规则、避免违规承诺。

 

因此,语音模型在保险金融领域的落地,不是简单地用一个端到端语音模型替代现有系统,而是要重新思考语音模型与企业知识体系的关系。这也意味着,未来真正有价值的不是单点模型能力,而是一个持续演进的领域语音系统:客户交互、知识命中、工具调用等都可以反过来沉淀为新的训练数据、评估样本和知识资产。语音 Agent 的竞争力,将不只来自模型本身,而来自能否把自己的领域知识、业务流程和真实交互经验,持续转化为系统能力。

 

我们正处在语音 Agent 从“能实时对话”走向“能承担业务”的过渡阶段。对保险金融行业来说,语音 Agent 的终局不只是让机器听起来更像人,而是让它在真实业务中更可靠、更专业。只有当实时语音交互、领域知识增强、业务工具调用真正融合在一起时,语音 Agent 才能从一个交互入口,成长为保险金融服务的智能执行单元。

 

 

我们的解决方案

发布时间:2026-06-04 15:38