英伟达推出新AI模型Fugatto,可修改并生成新声音

花花2024-11-26日常分享281

英伟达(NVDA.US)推出了一款用于生成音乐和音频的新型人工智能(AI)模型,旨在为制作音乐、电影和视频游戏的人们提供服务。

根据英伟达的说法,这款模型名为Fugatto(Foundational Generative Audio Transformer Opus),可以使用任何文本和音频文件来生成或修改音乐和声音。

英伟达推出新AI模型Fugatto,可修改并生成新声音

例如,该模型可以根据文本提示创建音乐片段,从现有歌曲中删除或添加乐器,改变声音中的口音或情绪,甚至发出从未听过的声音。

英伟达应用音频研究经理、管弦乐队指挥兼作曲家Rafael Valle表示:“我们希望创建一个能像人类一样理解和产生声音的模型。”

英伟达指出,广告代理商可以使用Fugatto快速定位多个地区的现有广告,并在配音中加入不同的口音和情感。此外,视频游戏开发者可以使用人工智能模型修改游戏中预先录制的资产,以适应用户在玩游戏时不断变化的动作。

Fugatto可以使小号发出狗吠声或萨克斯管发出喵喵声。该公司补充说,通过微调和少量的歌唱数据,研究人员发现它可以处理未经预先训练的任务,比如从文本中生成高质量的歌声。

英伟达表示,Fugatto的完整版本使用了25亿个参数,并在包含32个Nvidia H100 Tensor Core GPU的Nvidia DGX系统上进行了训练。该模型的整体工作耗时一年多。

Fugatto可能会与Runway等初创公司以及 Meta Platforms(META.US)等大公司的类似技术展开竞争。10月,Meta 发布了名为Movie Gen的人工智能模型,该模型可以根据用户提示创建逼真的视频和音频剪辑。

今年 2 月,ChatGPT制造商OpenAI推出了Sora,它可以根据文本指令创建逼真且富有想象力的场景。这家由微软(MSFT.US)支持的公司尚未向公众发布文本转视频模型。

相关文章

*ST有树收到深交所监管函:业绩预告净利与年报相比存在较大差异

*ST有树收到深交所监管函:业绩预告净利与年报相比存在较大差异

7月26日,*ST有树(300209)收到深交所监管函,2024年1月29日,公司披露《2023年度业绩预告》,预计2023年度归属于上市公司股东的净利润(以下简称净...

荣昌生物修订定增预案 将募资额调减至不超19.53亿元

荣昌生物修订定增预案 将募资额调减至不超19.53亿元

7月24日晚间,荣昌生物(688331)发布公告称,公司董事会对本次发行方案中的募集资金规模及相关事项进行调整,将拟募资额从不超25.5亿元调整至不超19.53亿元,...

特朗普为其关税政策辩护 ,称盟友比敌人更会利用美国

特朗普为其关税政策辩护 ,称盟友比敌人更会利用美国

专题:特朗普将赢得大选?聚焦特朗普第二任期的政策诉求和市场影响   特朗普声称,美国的盟友比敌人更会利用他们,并认为字典里最美的词就是...

佳云科技(300242)投资者索赔提交立案,日海智能(002313)索赔案新增索赔条件

佳云科技(300242)投资者索赔提交立案,日海智能(002313)索赔案新增索赔条件

  2025年1月2日,上海久诚律师事务所许峰律师代理的佳云科技(维权)(300242)投资者索赔案已向广州市中级人民法院提交立案,目前正在等待法院的下一步安排...

中国汽车左培文:2023年中国新能源汽车销量达1465.3万辆,在新能源汽车领域全球领先

中国汽车左培文:2023年中国新能源汽车销量达1465.3万辆,在新能源汽车领域全球领先

  5月28-29日,“2024全国企业家活动日暨中国企业家年会”在河南郑州举行。中国汽车技术研究中心中汽信科党支部书记、技术总监左培文出席“新能...