arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-30 至 2026-03-30 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2510.04428 2026-03-30 cs.CV 70%

A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering

A.I.R.: 为视频问答实现适应性、迭代性和基于推理的帧选择

Yuanhao Zou, Shengji Jin, Andong Deng, Youpeng Zhao, Jun Wang, Chen Chen

机构 * University of Central Florida(中佛罗里达大学) Weill Cornell Medicine(威尔康奈尔医学院)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出A.I.R方法,通过深度语义分析和高效迭代循环提升视频问答的帧选择效果,实验表明其在性能和计算效率上均优于现有方法。

Comments ICLR 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26122 2026-03-30 cs.CV cs.AI 62%

SkinGPT-X: A Self-Evolving Collaborative Multi-Agent System for Transparent and Trustworthy Dermatological Diagnosis

SkinGPT-X: 一种自演化协作多智能体系统用于透明和可信的皮肤病诊断

Zhangtianyi Chen, Yuhao Shen, Florensia Widjaja, Yan Xu, Liyuan Sun, Zijian Wang, Hongyi Chen, Wufei Dai, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Department of Dermatology, Tianjin Institute of Integrative Dermatology, Tianjin Academy of Traditional Chinese Medicine Affiliated Hospital(天津中医药大学附属医院天津市中西医结合皮肤病研究所皮肤科) Department of Dermatology, Beijing AnZhen Hospital, Capital Medical University(首都医科大学附属北京安贞医院皮肤科)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 SkinGPT-X通过自演化皮肤病记忆机制,解决单一大语言模型在细粒度多类诊断和罕见皮肤病诊断中的不足,实现透明可信的皮肤病诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26174 2026-03-30 cs.CV 57%

CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions

CREval: 一种自动化可解释的评估方法用于复杂指令下的创意图像操纵

Chonghuinan Wang, Zihan Chen, Yuxiang Wei, Tianyi Jiang, Xiaohe Wu, Fan Li, Wangmeng Zuo, Hongxun Yao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Pengcheng Lab, Guangzhou(广州鹏城实验室)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出CREval,一种基于问答的自动化评估框架,用于评估复杂指令下的创意图像编辑任务,通过CREval-Bench基准测试揭示模型在复杂创意任务中的表现及挑战。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏