arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-08 至 2026-04-08 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2411.05961 2026-04-08 cs.CV cs.AI 86%

Aligned Vector Quantization for Edge-Cloud Collabrative Vision-Language Models

对齐的向量量化用于边缘-云协作的视觉-语言模型

Xiao Liu, Lijun Zhang, Deepak Ganesan, Hui Guan

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);LLaVA(abstract);visual question answering(abstract)

AI总结 本文提出LLaVA-AlignedVQ系统,通过AlignedVQ算法实现中间特征高效压缩,减少数据传输开销,提升推理速度,保持高精度。

Comments I found a big mistake in the paper that causes significant bias on the results. The residual links are not taken into consideration when computing the transmission. All results about the compressed data size and transmission latency would be affected

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04838 2026-04-08 cs.CV 70%

Less Detail, Better Answers: Degradation-Driven Prompting for VQA

细节越少,答案越好:基于退化的提示方法用于视觉问答

Haoxuan Han, Weijie Wang, Zeyu Zhang, Yefei He, Bohan Zhuang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出退化驱动提示(DDP)方法,通过降低图像清晰度迫使模型关注关键结构信息,提升视觉问答性能。在物理属性和感知现象任务中,DDP通过降采样、结构辅助和提示技术实现更准确的推理。

Comments Accepted to CVPRW 2026. Project page: https://hhx-jpg.github.io/ddp/ , Code: https://github.com/ziplab/DDP

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04638 2026-04-08 cs.AI cs.CL cs.IR 70%

Advancing AI Research Assistants with Expert-Involved Learning

通过专家参与学习推进AI研究助手

Tianyu Liu, Simeng Han, Hanchen Wang, Xiao Luo, Pan Lu, Biqing Zhu, Yuge Wang, Keyi Li, Jiapeng Chen, Rihao Qu, Yufeng Liu, Xinyue Cui, Aviv Yaish, Yuhang Chen, Minsheng Hao, Chuhan Li, Kexing Li, Yinsheng Lu, Xinyu Wei, Qinzhe Xing, Antonia Panescu, Mengbo Wang, Vibha Annaswamy, Alicia Sanchez, Jack Cloherty, Arman Cohan, Hua Xu, Mark Gerstein, James Zou, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) Genentech(基因泰克) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文提出ARIEL框架,通过专家验证任务评估大语言模型和多模态模型在生物医学领域的表现,发现提示工程和轻量级微调能提升文本覆盖,计算扩展策略增强视觉问答能力,构建了集成文本和视觉线索的AI助手,提出可检验的机理假设。

Comments 43 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13856 2026-04-08 cs.IR 50%

QKVQA: Question-Focused Filtering for Knowledge-based VQA

基于知识的视觉问答中基于问题的过滤

Wei Ye, Yixin Su, Yueguo Chen, Longxiang Gao, Jianjun Li, Ruixuan Li, Rui Zhang

专题命中 视觉问答 :visual question answering(abstract)

AI总结 本文提出基于问题的跨文章过滤方法,通过设计可训练的问题聚焦过滤器和基于块的动态跨文章选择模块,提升知识过滤效率和问答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏