浙大设计研究|给AI出张UI质检考卷

2026-08-01

多模态大模型

多模态大模型虽能“看懂”手机界面,却在检查界面设计质量时,对文字溢出、内容裁剪、容器重叠等像素级显示缺陷感知甚微。这类缺陷的判定需要精细到元素边界与设计规范的理解,而现有模型普遍缺乏这种能力。

UI-Lens基准概览
UI-Lens基准概览

为检验UI智能质检工具在前端界面检查中的真实水平,浙江大学设计学团队提出UI-Lens基准测试,包含数千张由设计专家精细标注的中文UI页面,涵盖文字溢出、内容裁剪、容器重叠、内容未展示、文字省略异常、文本语义不一致共六类典型显示缺陷。基于UI-Lens对多款主流模型展开评测,结果显示,现有模型在精细边界识别上接近随机猜测,在跨页面语义一致性判断上同样表现不佳。这些发现反映出当前模型在界面视觉理解上的短板,为UI自动化质检研究提供了可靠的参考基准与优化方向。

主流多模态大模型在UI-Lens上的得分
主流多模态大模型在UI-Lens上的得分

UI-Lens包含的主要缺陷检测任务类型
UI-Lens包含的主要缺陷检测任务类型

本研究由浙江大学人工智能学院向为副教授团队完成。该成果的第一学生作者为浙江大学设计学硕士生吴烨心睿。“我的科研愿景是把人的‘taste’翻译成可验证、可测量的信号。”吴烨心睿分享道。

浙江大学设计学硕士生吴烨心睿
浙江大学设计学硕士生吴烨心睿

项目成果:
项目成果于2026年7月发表于国际计算机视觉与模式识别顶级会议CVPR 2026。研究团队:向为、吴烨心睿、陈新立、李昕然、陈实*。本项目受到国家自然科学基金等项目支持。

论文原文链接:
Wei Xiang, Yexinrui Wu, Xinli Chen, Xinran Li, Shi Chen*. 2026. UI-Lens: Assessing General MLLMs‘ Potential to Automate UI Display Quality Assurance. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 25882–25892.
https://openaccess.thecvf.com/content/CVPR2026/html/Xiang_UI-Lens_Assessing_General_MLLMs_Potential_to_Automate_UI_Display_Quality_CVPR_2026_paper.html
(*通讯作者)