视频-音乐跨模态生成是多模态研究的重要方向。然而,受限于高质量对齐方法和大规模数据集的缺乏,现有模型在生成内容的丰富性与视听匹配度方面仍存在不足。
针对上述问题,浙江大学设计学团队研发了GVMGen:一种基于层次化注意力机制的通用视频音乐生成模型。该模型在空间与时间维度分别引入自注意力与交叉注意力机制,实现跨模态对齐,无需依赖额外特征或辅助模态,显著提升了生成内容的丰富性与视听一致性,具备端到端建模能力。团队还构建了大规模视听数据集和视听评价模型,以支持模型训练和性能验证。
该成果的第一作者是浙江大学人工智能博士生左鹤达,“在视听跨模态生成领域,传统方法多依赖文本或定量特征进行对齐,我们希望通过注意力机制规避这些显式特征的偏见与局限,以促进模型在多元文化风格场景下的泛化应用。”左鹤达分享道。
项目成果:
项目成果于2025年3月发表在国际人工智能领域顶级会议AAAI 2025。研究团队:左鹤达、尤伟涛、吴俊贤、任时弘、陈培、周洺旭、鲁雨佳、孙凌云。本项目受到国家重点研发计划项目资助。
论文原文链接:
Heda Zuo, Weitao You*, Junxian Wu, Shihong Ren, Pei Chen, Mingxu Zhou, Yujia Lu, Lingyun Sun. 2025. GVMGen: A General Video-to-Music Generation Model with Hierarchical Attentions. Proceedings of the AAAI Conference on Artificial Intelligence, 39(21), 23099-23107.
https://doi.org/10.1609/aaai.v39i21.34474



