Skills Plugins MCP Prompt Model 导航 博客 资讯 我的中心

网易有道子曰4-Live模型“双登顶”Hugging Face Trending子榜,受到全球开发者喜爱

近日,网易有道开源的子曰Live系列两款实时交互模型——真流式语音识别模型Confucius4-R2T2(Real Real-Time Transcription)与流式翻译模型Confucius4-T3PO(simulTaneous Translation via pareTo Policy Optimization),先后登顶Hugging Face各自细分领域Trending榜,在全球开发者

Article


近日,网易有道开源的子曰Live系列两款实时交互模型——真流式语音识别模型Confucius4-R2T2(Real Real-Time Transcription)与流式翻译模型Confucius4-T3PO(simulTaneous Translation via pareTo Policy Optimization),先后登顶Hugging Face各自细分领域Trending榜,在全球开发者社区形成“双登顶”。


图注:T3PO登顶Hugging Face Translation Trending榜第一 

图片来源:Hugging Face截图


图注:R2T2登顶Hugging Face ASR Trending榜第一 

图片来源:Hugging Face截图


其中,R2T2登上Automatic Speech Recognition(ASR)Trending榜首,T3PO则登上Translation Trending榜首。榜单中不乏全球AI行业中最领先的科技公司发布的模型,例如OpenAI和谷歌旗下的多个模型。


两款模型分别解决实时语音交互中的“听得快、听得稳”和“译得快、译得准”问题,并能够组合形成一套面向实时AI语音Agent和同声传译的基础技术链路。




开源社区主动跟进适配




相比榜单本身,更值得关注的是模型开源后迅速出现的社区适配。


R2T2发布后,Hugging Face开源团队主动基于模型搭建ZeroGPU在线Demo,并向网易有道提供免费的ZeroGPU资源支持,希望降低全球开发者体验模型的门槛。



第三方开发者随后将R2T2移植至纯C++本地音频推理框架audio.cpp。9月19日,相关代码正式合入主仓库。此次适配并非简单调用官方接口,而是重新实现了R2T2的Longest Stable Prefix流式状态机,并加入GGUF、本地实时麦克风识别、Streaming API等能力,使其能够更方便地进入Mac、本地AI应用和Voice Agent工具链。


海外量化社区同样迅速跟进。开发者已经推出R2T2的多个GGUF量化版本,从Q2到Q8覆盖不同部署需求,并支持通过llama.cpp、Ollama等工具进行本地调用。


T3PO也出现了类似的社区响应。模型发布后不久,便完成了从Q2_K到Q8_0等多个GGUF量化版本,使这款140亿参数级实时翻译模型进一步具备本地部署条件。




为什么实时语音Agent需要“稳定的快”




模型能够快速受到开发者社区追捧的核心原因,主要是在构架上针对AI语音Agent的需求进行了专门的设计和优化,对未来语音智能体应用的开发,实时字幕,实时同传等场景会有非常好的适配能力。


例如在语音同传场景下(例如短剧、直播、会议、AI客服等),R2T2和T3PO能够提供实时快速上屏的双语稳定文字展示效果,不用等到用户说完整句话才展示,提升了交流的效率和体验。


在AI语音Agent应用开发中,传统流式ASR即使输出速度很快,如果前文识别结果仍在不断变化,下游LLM也很难提前介入处理;而稳定的增量文本能够让Agent在用户尚未说完时,就开始理解上下文并执行后续任务,从而显著提升语音Agent的实时性和开发效率。


两款模型受到关注,与其实时交互技术路线密切相关。




从“实时显示”走向“实时互动”




R2T2支持80毫秒至2秒灵活可配置的流式输入,并通过Longest Stable Prefix机制判断哪些语音内容已经足够稳定。一旦确认,文字便遵循Append-only原则永久提交,不再因为后续音频而反复改写。官方测试显示,R2T2在保持接近离线ASR准确率的同时,平均识别延迟(平均说完每个字到识别出这个字的时间)约为200至600毫秒。


图注:英文测试集质量和延迟结果对比 

来源:https://github.com/netease-youdao/Confucius4-R2T2


图注:中文测试集质量和延迟结果对比 

来源:https://github.com/netease-youdao/Confucius4-R2T2




解决实时翻译的“质量-速度”矛盾




T3PO则进一步解决实时翻译中的另一组矛盾——速度与质量。模型通过帕累托策略优化推进了实时翻译的延迟-质量的前沿,能够在非常低延迟的情况下提供接近offline的翻译质量。



当R2T2与T3PO组合后,一条实时同传链路由此形成:


语音持续进入R2T2,生成稳定、可立即消费的文本;T3PO接收这些文本,并自主判断何时开始翻译。


这使AI语音交互有机会从传统的“说完—识别—翻译”,转向“边说—边听—边理解—边翻译”。


R2T2与T3PO正在从两款开源模型进一步进入全球开发者的实时语音工具链。


2023年,网易有道推出国内首个教育大模型——“子曰”。之后,网易有道迭代模型能力,针对多模态推理,翻译和实时语音交互持续发力。现在,“子曰”已经打造成了一个完整的模型矩阵,建立了包含多模态推理、翻译以及语音和实时交互的AI模型能力。





产品化和工程化进展



基于子曰4-R2T2和子曰4-T3PO等AI模型的能力,网易有道的AI语音产品化和工程化也取得了很大的进展:

网易近日推出了首个AI原生语音Agent“网易叭哥说”,让语音输入不再停留在传统的Speech-to-Text,而是进一步走向“Speech-to-Intent”。

用户可以一边思考一边说,语音Agent自动理解语义、删除冗余表达、整理零散思路,将口语直接转化为可发送、可编辑、可使用的成稿。通过自研ASR模型子曰4-R2T2与语义理解链路优化,其整体文字输出效率可以达到传统打字的5倍以上,同时支持本地语音处理,在效率与隐私之间取得平衡。

在实时跨语言沟通场景中,有道AI同传Agent则将语音识别、实时翻译等能力进一步串联成完整工作流。目前,有道AI同传累计服务用户已超过2500万,使用次数同比增长近一倍;有道智云也已经向开发者提供基于WebSocket的同传PaaS能力,可实时返回识别与翻译结果,并进一步衔接TTS和说话人识别。

在工程化和产业部署层面,网易有道也在持续推动语音大模型与国产算力生态融合。目前,包括R2T2所代表的ASR能力以及TTS语音合成模型在内的有道语音技术体系,已经完成华为昇腾系列和海光算力平台适配。在指定普通话近场测试集上,ASR字错误率(CER)控制在3%以内,流式结果更新延迟P50不超过300毫秒;TTS自然度MOS达到4.3分,首包音频时延P50不超过300毫秒,RTF不超过0.10。

从“听懂用户”到“理解意图”,再到“生成并说出回答”,完整的AI语音Agent链路已经具备在国产算力环境下低时延部署的基础,可以进一步面向企业私有化部署,在智能终端、客服、会议、车载等场景提供自主可控的实时AI语音能力。

Source: a public AI news aggregator. Copyright belongs to the original authors and outlets; this site only indexes and summarises. Contact us for removal.

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

提交后我们会发送一封确认邮件,点击邮件里的链接才会开始收信。

完全免费,取消任意时间。我们不会发送垃圾邮件。