近日,网易有道开源的子曰Live系列两款实时交互模型——真流式语音识别模型Confucius4-R2T2(Real Real-Time Transcription)与流式翻译模型Confucius4-T3PO(simulTaneous Translation via pareTo Policy Optimization),先后登顶Hugging Face各自细分领域Trending榜,在全球开发者社区形成“双登顶”。
其中,R2T2登上Automatic Speech Recognition(ASR)Trending榜首,T3PO则登上Translation Trending榜首。榜单中不乏全球AI行业中最领先的科技公司发布的模型,例如OpenAI和谷歌旗下的多个模型。
两款模型分别解决实时语音交互中的“听得快、听得稳”和“译得快、译得准”问题,并能够组合形成一套面向实时AI语音Agent和同声传译的基础技术链路。
相比榜单本身,更值得关注的是模型开源后迅速出现的社区适配。
R2T2发布后,Hugging Face开源团队主动基于模型搭建ZeroGPU在线Demo,并向网易有道提供免费的ZeroGPU资源支持,希望降低全球开发者体验模型的门槛。
第三方开发者随后将R2T2移植至纯C++本地音频推理框架audio.cpp。9月19日,相关代码正式合入主仓库。此次适配并非简单调用官方接口,而是重新实现了R2T2的Longest Stable Prefix流式状态机,并加入GGUF、本地实时麦克风识别、Streaming API等能力,使其能够更方便地进入Mac、本地AI应用和Voice Agent工具链。
R2T2与T3PO正在从两款开源模型进一步进入全球开发者的实时语音工具链。
2023年,网易有道推出国内首个教育大模型——“子曰”。之后,网易有道迭代模型能力,针对多模态推理、翻译和实时语音交互持续发力。现在,“子曰”已经被打造成了一个完整的模型矩阵,形成了包含多模态推理、翻译以及语音和实时交互的AI模型能力。
红星新闻记者 郭晶晶
编辑 李星龙