全球第三!百融智能的语音模型:让AI听懂长语音、答对复杂问题!

全球第三!百融智能的语音模型:让AI听懂长语音、答对复杂问题!

拿下INTERSPEECH 2026任务全球第三!百融算法团队用「动态证据路由」刷新多语种对话理解新高度

全球语音顶会 INTERSPEECH 2026 官方挑战赛 · MLC-SLM 2026 Challenge · 任务二「多语种对话语音理解」全球第三 · 国内产业界第一 · 官方准确率 94.84%

又一个全球第三,但这次不一样

全球第三!百融智能的语音模型:让AI听懂长语音、答对复杂问题!

✦ 赛事规模 · 14 种语言 / 2,100 小时 / 94.84%

2026 年 7 月,来自全球110多支队伍参赛的——INTERSPEECH 2026 多语种对话语音语言模型挑战赛(MLC-SLM 2026 Challenge)官方公布最终成绩。百融智能算法团队 BRVoice 凭借自研的「动态问题感知证据路由」框架,在任务二「多语种对话语音理解」中斩获全球第三名、位列国内产业界第一,官方准确率达到 94.84%。

INTERSPEECH 是国际语音领域公认的三大顶会之一(与 ICASSP、ASRU 并列),其官方挑战赛历来以赛题硬、数据严著称,被视为语音技术领域的”硬指标考场”。而 MLC-SLM 2026 是 INTERSPEECH 2026 的官方卫星赛事,聚焦多语种对话语音大模型这一前沿方向。主办方由国内外顶尖高校与数据机构联合组成,赞助方包括 Meta、Google、中国移动、Samsung、NAVER、DataTang 等——也就是说,这场赛事的难度和分量,是行业公认的。

拿下一个名次不难。难的是:在一个不提供训练集、没有预切分、还要面对 14 种语言、约 2,100 小时真实双人长对话的赛制下,把准确率做到接近 95%。

这件事,百融算法团队做到了。

▶先看看 BR-Voice 已经做到了什么

在讲”全球第三”、“110多支队伍参赛”、”94.84%”这些数字之前,先回到一个更基础的问题:一个语音大模型,强到能参加国际顶会挑战赛,在真实业务里到底能做到什么?

这是 BR-Voice 在 RC 生态规模化落地中已经验证过的能力清单(详细数据见本系列前文《从”听懂”到”会共情”:BR-Voice 语音多模态大模型核心拆解》):

字错误率 0.92%——转写一万字,错不到一百字。

TTS 拟人度约 95%——听完能分辨出是 AI 说话的用户不到 5%。

行业热词检索 F1 值 97.03%——”等额本息””宽限期””年化利率”这类专业词不会识别错。

对话轮次感知 F1 值 96.35%——自然停顿、节奏切换都能精准捕捉。

副语言识别:性别 99.28%、年龄 95.86%、情绪 90.29%。

端到端响应低于 500 毫秒——边听、边想、边说,几乎无感。

这些数据意味着什么?

它意味着当一位带方言口音的客户打电话咨询业务术语时,硅基员工不会听错、不会卡顿。

它意味着当一位客户在销售会谈里说”我再考虑考虑”时,硅基员工能识别出这句话背后的语气是”礼貌拒绝”还是”真的犹豫”,并把这个判断写进复盘报告。

它意味着在跨境客服会话分析等真实业务场景下,硅基员工能像一位资深的多语种客服一样,稳定、准确、有温度地工作。

而 MLC-SLM 2026 任务二验证的”动态证据路由”能力,是让 BR-Voice 在长对话复杂场景下保持上述精度的下一代方法——它让硅基员工不是”听完再说”,而是”边听边想边定位关键证据”,是 BR-Voice 工业级产品力的一次重要迭代。

01 一场什么样的比赛?

全球第三!百融智能的语音模型:让AI听懂长语音、答对复杂问题!

✦ 赛题结构 · 任务一 vs 任务二

MLC-SLM 2026 的全称是「多语种对话语音语言模型挑战赛」,围绕”多语种对话语音理解”展开。赛事分两大赛道,难度层层递进:

任务一:多语种对话的自动语音识别加上说话人归属。即:在一段两个人用外语聊天的长录音里,先把”谁是谁、谁说了什么话”准确还原出来。

任务二:在任务一的基础上,让模型真正”听懂”对话内容,回答关于这段对话的问题。例如”对话里第三个方案是谁提的?””说话人 A 的情绪是怎么变化的?”

任务二的难度在于:不给训练集,不给预切分。 主办方直接丢给你一段几十分钟的双人长对话音频,参赛系统需要自己完成切分、说话人归属、识别、上下文理解,再作答。

数据集覆盖 14 种语言、约 2,100 小时真实双人对话,评测时也没有任何预切分语句和说话人标签——这意味着参赛队伍必须端到端地处理真实场景中最复杂的那一类语音数据。

如果说任务一是”考听力”,任务二就是”听力 + 阅读理解 + 推理”三合一。我们这次拿到第三名的,是任务二。

02 行业痛点:为什么这道题这么难?

全球第三!百融智能的语音模型:让AI听懂长语音、答对复杂问题!

✦ 行业痛点 · 只喂文本 vs 只喂音频 vs 我们的方案

多语种双人对话口语问答是语音大模型领域公认的前沿难题。在一段真实长对话里,不同的问题往往依赖完全不同维度的”证据”——这正是任务二真正难的地方。

例如,要回答”对话主要讨论什么?”这类全局性问题,需要全局长文本语义作为证据;回答”第三个方案是谁提的?”需要说话人角色归属,把”谁”和”哪句话”精准匹配;回答”他刚才说这话时是什么语气?”则高度依赖声学细节,比如语调、笑声、语气词。

而现有系统普遍面临两难困境——

只喂文本 方案,能保留长上下文语义,但会丢失声学副语言信息,语气、笑声、说话人音色全没了。

只喂音频 方案,能保留丰富的声学信息,但在超长音频里,冗余和无关段落会急剧消耗模型的算力,并分散大模型的注意力。

那么,能不能针对不同的问题,智能、动态地决定”该看什么文本”+”该听什么音频”?这正是百融算法团队这次提交方案要解决的核心命题。

03 我们的解题思路:动态问题感知证据路由

全球第三!百融智能的语音模型:让AI听懂长语音、答对复杂问题!

✦ 核心创新 · 二维路由空间

针对这一痛点,BRVoice 团队提出了一种混合型”问题感知证据路由”框架。

核心思想只有一句话:以文本为骨干,按需激活声学证据。 系统不是”一刀切”地决定输入策略,而是先看问题,再决定给模型”看什么”和”听什么”

3.1 把”该怎么组织输入”建模成二维空间

团队把路由目标建模为一个二维空间:

证据类型 决定用哪种媒介的信息,包括纯文本语义、语义加局部声学细节、说话人敏感信息(音色、角色)、全局声学特征。

上下文范围 决定信息提取的跨度,包括单时间戳邻域、多时间戳跨段对比、特定发言人的关联回合、对话全局稀疏采样。

3.2 混合路由器三步走

粗粒度估计:基于Base模型仅根据”问题 + 选项”预测粗粒度的证据类型与范围。。

确定性解析:用正则和规则直接从文本中提取时间戳、说话人标识等硬约束。

映射与执行:把前两步结果融合,映射成最终的执行策略。例如对”包含时间戳的声学问题”,自动截取对应时段前后的局部音频和文本,做多模态融合输入。

简单说,就是先看题,再决定”听哪段 + 看哪段”。不是把整段几十分钟的音视频一股脑塞给模型,而是有选择地、按需地喂给模型最相关的那一截。

这个方法背后的直觉是:当 AI 已经知道用户想问什么,它就不需要把所有信息都装进工作记忆——它只需要精准调出”那一段”。 这种”按需取证”的能力,本质上是在模拟人类专家在长对话中快速定位关键证据的认知方式。

04 实战成绩单

全球第三!百融智能的语音模型:让AI听懂长语音、答对复杂问题!

✦ 消融实验 · M1→M4→M6 准确率跃升

空口说技术没用,成绩单说话

在 MLC-SLM 2026 任务二的官方排行榜上,百融算法团队 BRVoice 提交的系统最终以 94.84% 的准确率锁定全球第三、国内产业界第一。

而在这背后,是一次次实打实的消融实验

基线方案:仅输入全文文本,准确率 93.16%

方案二:在基线方案基础上融入局部音视频融合,准确率提升至 94.22%,相对基线提升 1.06 个百分点——说明声学证据确实重要。

最终方案:换成”动态问题感知证据路由”框架后,准确率进一步提升至 94.84%,相对基线提升 1.68 个百分点——说明”按需分配”比”无脑塞入更多音频”更聪明、更划算。

任务一同步表现同样扎实:级联式说话人归属与语音识别系统在测试集上分别实现 25.70% 和 18.44% 的 tcpMER,为任务二构建了高质量的文本主干。

94.84% 这个数字背后,藏着的不只是模型能力,更是一套”如何让大模型在长语音场景下保持高精度”的工程方法论

05 为什么这场胜利,对”硅基员工”和”RaaS”很重要?

全球第三!百融智能的语音模型:让AI听懂长语音、答对复杂问题!

✦ 价值链 · 学术→产品→业务

拿下一个国际赛事的名次,对一家企业级 AI Agent 公司来说,绝不是为了发新闻、贴 logo。它的真正价值,是验证一条工程路径是否真的走得通——并且,能把赛场上的方法论搬回真实业务里

5.1 获奖能力直接反哺 BR-Voice 产品线

这次挑战赛验证的”动态证据路由”能力,不是纸面技术。它会直接进入百融语音大模型 BR-Voice 的产品迭代里:

复杂人机交互场景:让语音 Agent 能在长对话中精准定位关键证据,避免”听了半小时还在兜圈子”。在百融 RC 生态下的硅基员工业态中,这意味着客户咨询从”被反复转接、平均十几分钟无解”,变成”AI 一次就定位到关键信息、几分钟闭环”。

客服与销售会谈分析:自动捕捉”谁说了哪句关键话 + 当时是什么情绪”,把过去沉睡的通话录音变成可量化、可检索、可复盘的结构化资产。这正是百服(硅基联络中心)、百回(催收)、百盈(营销)这三个硅基员工每天在做的事。

多语种跨国协作:14 种语言的覆盖能力,直接对应中国企业出海、跨境客服、全球化部署的硬需求——百销(企业级 AI 全球营销)的核心场景。

5.2 RaaS:客户为”经营结果”付费,语音能力是关键交付通道

百融一直对外讲一个核心叙事:“结果即服务”(Results as a Service,简称 RaaS)。意思是——客户不再为”软件账号”付费,而是为 AI 员工交付的经营结果付费

那么问题来了:客户愿意为什么样的”结果”买单?

是”上线了一个 AI 系统”吗?不是。

是”AI 多说了几句话”吗?不是。

是 “客户满意度提升了几个百分点”、”通话平均处理时长缩短了几分钟”、”销售线索转化率提高了百分之几”、”逾期客户被提前几天精准触达”——这才是客户真正愿意付费的”结果”。

语音能力,恰恰是把这些”结果”真正交付出去的通道。一个听不懂客户在说什么、读不懂客户情绪、找不到关键对话节点的语音 Agent,再先进的系统也无法形成结果。这次 MLC-SLM 2026 任务二拿下的”动态证据路由”能力,本质上就是硅基员工在语音通道上”按需取证、精准作答”的核心能力

5.3 已经在 8,000+ 企业、20 万硅基员工一线被验证

纸上谈兵的模型能力不值钱。真正值钱的,是这条能力已经被无数真实业务场景反复锤炼过

百融 RC 生态下的硅基员工产品矩阵,包括百盈(营销)、百回(催收)、百服(联络中心)、百才(招聘)、百灵(个贷不良资产管理)、百销(企业级 AI 全球营销)、百智(WiseNote)等,已经在金融、保险、电信、互联网、汽车等行业的 8,000+ 企业客户中规模化落地,核心客户留存率高达 98%。全双工端到端响应低于 500 毫秒,语音识别准确率达 98%,情绪、场景等识别准确率达 90%–99%,已具备从技术研发到商业落地的成熟转化能力。

这次国际赛场的成绩,是这条工程能力第一次被全球学术权威机构”打分定级”。反过来,这次验证的方法论,又会回流到 RC 生态、让 20 万硅基员工在真实业务里”听得更准、答得更稳”

这是百融”以研促产、以产养研”的双轮飞轮。

写在最后

全球第三!百融智能的语音模型:让AI听懂长语音、答对复杂问题!

✦ AI 语音系列 · 四篇回顾

MLC-SLM 2026 全球第三,对百融算法团队来说,是一个阶段性的肯定,更是一个新的起点。

它验证了三件事:

BR-Voice 的多语种对话理解能力,已经进入国际第一梯队;

“动态证据路由”这条工程路线,是处理长语音复杂对话的有效解法;

百融的语音大模型不仅能在 RC 生态里规模化落地,也能在学术最严苛的考场上交出漂亮答卷

未来,我们还会继续把学术赛场上的方法论,一项一项搬回 BR-Voice 的产品线,搬回 RC 生态的硅基员工,搬回 8,000+ 客户的真实业务场景里

让语音大模型从”能听会说”,真正走向”能思考、能落地、能交付结果”。

这才是 RaaS——客户为结果付费,AI 为结果而生。

(0)
上一篇 3小时前
下一篇 33分钟前

猜你喜欢