ElevenLabs推出v4和v4Turbo语音模型:支持90余种语言,10秒素材即可克隆声音
发布时间:16小时前阅读:5
IT之家9月29日消息,ElevenLabs于当地时间周一正式推出了两款全新语音模型,分别为ElevenLabs v4与v4Turbo。新版模型强化了情绪表达控制能力,降低了语音智能体的响应延迟,同时支持90余种语言。
该公司去年发布了v3模型,并于今年早些时候在华沙举办的活动上对新一代模型进行了预热。v4系列采用全新架构,实现了更精细的语音控制以及速度更快的声音克隆。官方表示,借助v4,用户仅需10秒音频素材即可完成语音克隆。
在内容创作方面,当朗读大段文本时,新版模型可以更好地维持说话人的音色特征;朗读过程中还能够记住前后文本语境,随之调整语气。ElevenLabs曾在v3版本当中引入内联标签用以设定语音情绪;到了v4,标签功能得到进一步扩充,用户可以叠加多个标签,模型将按照标签的先后顺序执行。
旧版模型支持70种语言。经过优化之后,新版本的语言支持数量提升至90种。这家初创企业称,日语、巴西葡萄牙语、普通话以及粤语的合成质量提升最为显著。
过去一年,ElevenLabs的企业语音通话业务扩张迅速,目前超过55%的业务收入来自大型企业。官方指出,新模型非常适配语音智能体场景:更低的延迟可以带来更加流畅的对话体验。除此之外,当后端大语言模型刚开始输出回答时,v4就可以同步生成语音音频。不仅如此,该模型还能够差异化地处理争执对话、诉求升级以及通话等待场景,以此更好地解决业务问题。
今年早些时候,ElevenLabs从红杉资本(Sequoia)获得5亿美元(IT之家注:现汇率约合33.6亿元人民币)融资,本轮投后估值达到110亿美元(现汇率约合739.14亿元人民币)。目前已有传闻称该公司正在筹备新一轮融资,目标估值或将达到220亿美元(现汇率约合1,478.29亿元人民币)。ElevenLabs的年化营收运行速率已经从年初约3.3亿美元(现汇率约合22.17亿元人民币)攀升至6亿美元(现汇率约合40.32亿元人民币)以上。公司还在印度、欧洲、巴西等多个市场大举招人,员工总人数现已突破800人。
在近期接受TechCrunch采访时,联合创始人兼首席执行官马蒂.斯坦尼舍夫斯基(Mati Staniszewski)表示,公司计划“未来几年内”完成IPO上市,但并未给出确切时间节点。
温馨提示:投资有风险,选择需谨慎。
-
标普上调中国券商评级:“bb+”是什么意思?信用评级符号一次讲清”
2026-09-29 14:00
-
股票突然停牌,钱会被锁住吗?停复牌规则和期限一次讲清
2026-09-29 14:00
-
银行理财也会亏?R1到R5风险等级怎么看,"业绩比较基准"不等于收益
2026-09-29 14:00



问一问
身份认证
分享该文章
