看到网易有道开源的消息,你最先想到的会是什么?是那个27B参数且数理能力达到SOTA的模型吗?
我最初也这么以为,但仔细看下来,真正让我眼前一亮的东西,其实是他们居然把跨语言语音克隆这个老大难问给拿下了。
以前跨语种时那股生硬的口音,连ElevenLabs这类主流工具都处理不好。一个中文母语者说日语,听起来就像外国人在硬背台词,尴尬得能让人脚趾抠地。
现在不一样了。用你原本的声音说日语,听上去可以跟本地人几乎没有分别。3秒克隆,覆盖14门语言,无论是做配音还是虚拟人,都既省钱又高效。
更难得的是,他们直接把完整的模型权重都放出来了,足足54个G让你能在本地运行,绝不是用API来敷衍了事。连配套的“龙虾智能体”也一并开源了。
想亲自上手试试?
TTS语音克隆在线Demo:
多模态模型主页:https://huggingface.co/netease-youdao/Confucius4
语音模型源码仓库:https://github.com/netease-youdao/Confucius4-TTS

互联网充电优质资源
优质内容内幕消息
 
 
Back to Top