浙大设计研究|文生图标准化评估

2026-06-20

文生图模型

文生图模型虽能生成极具真实感的图像,但仍常出现属性、状态、实体关系和视觉效果与文本不一致的问题。人类评估被视为“金标准”,但现有方法缺乏统一规范,评估结果的可靠性、可解释性和可扩展性仍存在不足。

SCoRE的开发流程
SCoRE的开发流程

针对上述问题,浙江大学设计学团队提出SCoRE:首个基于心理测量学构建的文生图语义一致性标准化人类评估量表。SCoRE量表具有良好的信度与效度,相比临时设计的评估方法,SCoRE能产生可解释性更强、一致性更高的人类评估数据。团队进一步开发StanHumEval评估平台,发布43,540条高质量人类标注,为自动评估与模型优化提供可靠基准。

SCoRE的内部相关性
SCoRE的内部相关性

StanHumEval界面
StanHumEval界面

该成果的第一学生作者是浙江大学人工智能专业博士生刘绮。“我们希望通过标准化人类评估建立可靠基准,精准发现模型问题,推动自动评估优化与生成模型发展。”刘绮分享道。

浙江大学人工智能博士生刘绮
浙江大学人工智能博士生刘绮

项目成果:
项目成果于2026年4月发表在计算机视觉领域顶级期刊IJCV。研究团队:李泽健、刘绮、潘嘉漫、黄锐、侯乐凡、胡翔斐、马佳芮、张晟源、张杰斯、田雪涛、吕韵、江浩、杨灵、邓小明。本项目受到国家自然科学基金的资助支持。

论文原文链接:
Zejian Li, Qi Liu*, Jiaman Pan, Rui Huang, Lefan Hou, Xiangfei Hu, Jiarui Ma, Shengyuan Zhang, Jiesi Zhang, Xuetao Tian, Yun Lu, Hao Jiang, Ling Yang & Xiaoming Deng. SCoRE: Standardized Human Evaluation Provides a Reliable Measure for Semantic Consistency of Text-to-Image Generation. International Journal of Computer Vision, 134(5):234, 2026.
https://doi.org/10.1007/s11263-026-02842-y