英伟达推出新AI模型Fugatto,可修改并生成新声音

花花2024-11-26日常分享6

英伟达(NVDA.US)推出了一款用于生成音乐和音频的新型人工智能(AI)模型,旨在为制作音乐、电影和视频游戏的人们提供服务。

根据英伟达的说法,这款模型名为Fugatto(Foundational Generative Audio Transformer Opus),可以使用任何文本和音频文件来生成或修改音乐和声音。

英伟达推出新AI模型Fugatto,可修改并生成新声音

例如,该模型可以根据文本提示创建音乐片段,从现有歌曲中删除或添加乐器,改变声音中的口音或情绪,甚至发出从未听过的声音。

英伟达应用音频研究经理、管弦乐队指挥兼作曲家Rafael Valle表示:“我们希望创建一个能像人类一样理解和产生声音的模型。”

英伟达指出,广告代理商可以使用Fugatto快速定位多个地区的现有广告,并在配音中加入不同的口音和情感。此外,视频游戏开发者可以使用人工智能模型修改游戏中预先录制的资产,以适应用户在玩游戏时不断变化的动作。

Fugatto可以使小号发出狗吠声或萨克斯管发出喵喵声。该公司补充说,通过微调和少量的歌唱数据,研究人员发现它可以处理未经预先训练的任务,比如从文本中生成高质量的歌声。

英伟达表示,Fugatto的完整版本使用了25亿个参数,并在包含32个Nvidia H100 Tensor Core GPU的Nvidia DGX系统上进行了训练。该模型的整体工作耗时一年多。

Fugatto可能会与Runway等初创公司以及 Meta Platforms(META.US)等大公司的类似技术展开竞争。10月,Meta 发布了名为Movie Gen的人工智能模型,该模型可以根据用户提示创建逼真的视频和音频剪辑。

今年 2 月,ChatGPT制造商OpenAI推出了Sora,它可以根据文本指令创建逼真且富有想象力的场景。这家由微软(MSFT.US)支持的公司尚未向公众发布文本转视频模型。

相关文章

大消费板块持续活跃,黑芝麻6连板,西王食品5连板,兰州黄河、

大消费板块持续活跃,黑芝麻6连板,西王食品5连板,兰州黄河、

  大消费板块持续活跃,黑芝麻6连板,西王食品5连板,兰州黄河、中央商场涨停,水井坊、酒鬼酒大涨超6%。...

青岛啤酒:121 岁“高龄” 引领“未来制造”

青岛啤酒:121 岁“高龄” 引领“未来制造”

专题:2024ESG全球领导者大会   “2024 ESG 全球领导者大会”于 10 月 16 日-18 日在 上海召开。青岛啤酒股份有限公司青岛啤...

“必须结束战争”,泽连斯基给出时间表!俄军:击落乌军102架无人机!

“必须结束战争”,泽连斯基给出时间表!俄军:击落乌军102架无人机!

  据参考消息援引路透社11月16日报道,乌克兰总统泽连斯基表示,乌克兰必须竭尽全力确保明年通过外交结束与俄罗斯的战争。   报...

余承东:一直关注和欣赏小鹏汽车在创新方面的坚持和努力

余承东:一直关注和欣赏小鹏汽车在创新方面的坚持和努力

  8月26日上午消息,华为常务董事、终端BG董事长,智能汽车解决方案BU董事长余承东在视频中为小鹏汽车成立10周年送祝福。余承东表示,虽然在不同的赛道上奔跑,但一直关注和欣...

同程旅行柴莹辉:乡村振兴要扣准时代脉搏,把项目和当下旅行行业发展阶段相结合

同程旅行柴莹辉:乡村振兴要扣准时代脉搏,把项目和当下旅行行业发展阶段相结合

专题:2024中国企业社会责任创新发展论坛   10月23日,“2024中国企业社会责任创新发展论坛”在北京举行,主题为“责任引领 凝聚共识”。同程旅行副总裁、同...