阿里通义实验室开源音频生成模型ThinkSound,首创思维链技术实现听懂画面

7.8 该技术通过模拟人类逻辑推理过程,显著提升了视频转音频V2A任务中对画面动态细节和事件逻辑的理解能力,实现高保真强同步的空间音频生成

20250708115250
来源:Aiyxl/Jimeng AI


近日,阿里通义实验室宣布开源全球首个基于思维链(Chain-of-Thought, CoT)技术的音频生成模型ThinkSound,标志着AI在跨模态内容生成领域取得重要突破。该技术通过模拟人类逻辑推理过程,显著提升了视频转音频(V2A)任务中对画面动态细节和事件逻辑的理解能力,实现高保真、强同步的空间音频生成。

 

技术突破:从"看图配音"到"听懂画面"  

传统V2A技术通常依赖简单的画面特征匹配,导致生成的音频与视频内容存在逻辑割裂,例如画面出现爆炸场景却生成轻柔音乐。ThinkSound创新性地将自然语言处理领域的思维链技术引入音频生成,通过以下核心机制实现质的飞跃:

1. 多层级语义解析:对视频帧序列进行事件时序分析、物体运动轨迹预测和情感倾向判断,构建动态逻辑关系图

2. 因果推理引擎:模拟人类"观察-分析-联想"的认知过程,如识别到"玻璃碎裂→人物躲避"的因果链后自动生成撞击声与惊叫音效

3. 三维声场建模:结合视觉深度信息生成具有空间方位感的音频,实现声源定位与声音传播的物理模拟


2025060803
来源:通义

 

实测表现超越主流方案  

在公开数据集测试中,ThinkSound的音频-画面同步准确率达到92.7%,较Meta的AudioGen提升38%,在复杂场景(如多人对话、环境骤变等)下的自然度评分超出业界基准25个百分点。典型案例包括:

  • 精确生成科幻电影中激光武器从蓄能到发射的全过程音效

  • 根据足球比赛视频实时生成符合攻防节奏的解说与观众欢呼

  • 对默片时代电影进行符合当代审美的智能配乐


2025060804
ThinkSound 音频生成模型的工作流

 

开源生态布局  

此次开源的ThinkSound基础版包含:

  • 支持8种语言的环境音效生成模块

  • 预训练的视觉-音频关联模型(参数量5.8B)

  • 可插拔的物理声学引擎插件

阿里云同时推出配套的"听视界"开发者平台,提供10万小时标注的影视音频训练数据集及GPU算力支持。

 

行业专家认为,该技术将重塑影视后期、游戏开发、元宇宙内容创作等领域的工作流程。据悉,已有好莱坞特效公司与国内头部游戏厂商开始对接技术合作,未来或实现影视剧配音成本降低70%、游戏动态音效制作效率提升3倍。

 

随着多模态大模型竞争进入深水区,阿里此次开源不仅填补了音频生成领域的技术空白,更通过思维链技术为AI理解物理世界提供了新范式。后续团队透露,正在研发支持实时生成的轻量化版本,预计年内应用于智能座舱、AR眼镜等消费级场景。


开源地址:
https://github.com/FunAudioLLM/ThinkSound 
https://huggingface.co/spaces/FunAudioLLM/ThinkSound 
https://www.modelscope.cn/studios/iic/ThinkSound