通义百聆迎来重磅升级 Fun-CosyVoice3(0.5B)正

互联网资讯
智通财经 互联网资讯 发布于 昨天 18:15
本条新闻为单纯事实消息的时事新闻,转载自智通财经,版权归源站所有,如有侵权,烦请联系我们

智通财经APP获悉,12月15日,“通义大模型”微信公众号发文表示,通义百聆语音模型再升级,本次发布包括:Fun-CosyVoice3模型升级,首包延迟降低50%,中英混字准确率翻倍,支持9语种 18方言口音、跨语种克隆与情感控制;Fun-CosyVoice3(0.5B)正式开源,该版本提供了zero-shot音色克隆能力,只需要提供一段3秒以上的参考音频,即可复刻其音色并合成新语音,并且支持本地部署和二次开发。此外,通义推出轻量化版本Fun-ASR-Nano模型,总参数量压缩到0.8B,推理成本更低,现已开源,支持本地部署与定制化微调。

通义团队称,本次Fun-CosyVoice3大模型完成多项关键升级:

首包延迟降低50%,支持双向流式合成,真正实现“输入即发声”,适用于语音助手、直播配音、无障碍阅读等实时场景;

中英混说词错误率(WER)相比之前降低 56.4%,不论是含专业术语、大小写混排,还是语码转换的句子,都能精准、自然地发音;

在 zero-shot TTS评测中,内容一致性与音色相似度全面提升,复杂场景(test-hard)字符错误率(CER)相对降低 26%,接近人类录音水平;

9种通用语言、18种中文方言、9种情感控制,并具备跨语种音色复刻能力——用一段普通话录音,即可生成粤语、日语、英语等语音,音色保持高度一致。

Fun-ASR模型能力同样得到了增强。作为通义百聆推出的端到端语音识别大模型,Fun-ASR 基于数千万小时真实语音数据训练,已在钉钉“AI听记”、视频会议等场景中大规模落地。本次,通义对 Fun-ASR 的核心能力进行了全面升级,重点优化了嘈杂环境鲁棒性、多语言自由混说、中文方言与口音覆盖、歌词识别、定制化能力,并将流式识别模型的首字降低到160ms。

点赞 0 收藏(0)  分享
0个评论
  • 消灭零评论
本版公告

欢迎访问资讯板块,我们将在本版块为您带来最新最全最热的资讯,包含互联网、科技、数码、电脑、科普、体育、娱乐、国内等新闻。所有新闻都为单纯事实消息的时事新闻,转载均注明了来源,版权归源站所有,如有侵权,烦请联系我们

更多【互联网】资讯...
200多个迪士尼经典IP入库Sora! OpenAI突破式“ 0
ChatGPT实现“一心多用”,iOS和Android平台也 0
李国庆宣布再创业:打造线上高端会员店;腾讯元 0
刹住自媒体造谣敲诈歪风(纵横) 0
微言 | 网约货车乱象不止,平台不能只顾收费 0
媒体:消费者和司机都不满意?网约货运野蛮生长 0
ChatGPT引入PS 一句话即可修图 0
多家超10年店龄女装网店接连关闭,连张大奕都说 0
4名工程师+智能体+28天=安卓版Sora?OpenAI给出 0
智能体编程平台Qoder Teams版正式上线 0