arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-27 至 2026-03-27 共收录 60 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 13 篇

2603.25186 2026-03-27 cs.LG 57%

Knowledge-Guided Retrieval-Augmented Generation for Zero-Shot Psychiatric Data: Privacy Preserving Synthetic Data Generation

基于知识的检索增强生成用于零样本心理数据:隐私保护的合成数据生成

Adam Jakobsen, Sushant Gautam, Hugo Lewi Hammer, Susanne Olofsdotter, Miriam S Johanson, Pål Halvorsen, Vajira Thambawita

机构 * SimulaMet Oslo Metropolitan University(奥斯陆城市大学) Uppsala University(乌普萨拉大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出一种零样本知识引导框架,利用检索增强生成技术生成隐私保护的合成心理数据,通过对比CTGAN和TVAE模型,证明临床知识增强LLM在生成高质量、隐私保护的合成数据方面具有优势。

Comments Submitted to CBMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22752 2026-03-27 cs.CL cs.AI 57%

Towards Simulating Social Media Users with LLMs: Evaluating the Operational Validity of Conditioned Comment Prediction

向LLMs模拟社交媒体用户迈进:评估条件评论预测的运作有效性

Nils Schwager, Simon Münker, Alistair Plum, Achim Rettinger

机构 * Trier University(特里尔大学) University of Luxembourg(卢森堡大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过条件评论预测任务评估LLMs在模拟社交媒体用户行为方面的运作有效性,发现监督微调在低资源环境下会导致表层结构与语义脱节,强调真实行为轨迹优于描述性人设。

Comments 14 pages, 1 figure, 7 tables. Accepted to the 15th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA) at EACL 2026, Rabat, Morocco

Journal ref Proceedings of the 15th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15186 2026-03-27 cs.CV 57%

Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Dataset

基于指令的胸部X光片病变分割方法及大规模数据集构建

Geon Choi, Hangyul Yoon, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Eunho Yang, Edward Choi

机构 * KAIST(韩国科学技术院) Samsung Medical Center(三星医学中心) AITRICS

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出基于指令的病变分割方法,构建首个大规模指令-回答数据集,通过自动化流程生成标注,提升胸部X光片病变分割的实用性与准确性。

Comments Camera-ready version for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15869 2026-03-27 cs.CV 57%

Self-Calibrated CLIP for Training-Free Open-Vocabulary Segmentation

自校准CLIP用于无训练开放词汇分割

Sule Bai, Yong Liu, Yifei Han, Haoji Zhang, Yansong Tang, Jie Zhou, Jiwen Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出自校准CLIP,通过消除异常token影响,提升CLIP在开放词汇分割中的表现,实现更精细的特征表示和语义一致性。

Comments Accepted by IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25097 2026-03-27 cs.AI 57%

ElephantBroker: A Knowledge-Grounded Cognitive Runtime for Trustworthy AI Agents

ElephantBroker:一个基于知识的认知运行时用于可信AI代理

Cristian Lupascu, Alexandru Lupascu

机构 * Elephant Broker(大象经纪人)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出ElephantBroker,一个结合Neo4j知识图谱与Qdrant向量存储的认知运行时,通过Cognee SDK实现可信AI代理的记忆管理,包含认知循环、证据验证、安全防护等模块,支持多部署层级和安全审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07237 2026-03-27 cs.CV 57%

Unified Camera Positional Encoding for Controlled Video Generation

统一的相机位置编码用于受控视频生成

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Cruz Gambardella, Dinh Phung, Jianfei Cai

机构 * Monash University(莫纳什大学) Building 4.0 CRC(4.0建筑CRC) VAST(VAST研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。

Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09575 2026-03-27 cs.RO 50%

Traffic Scene Generation from Natural Language Description for Autonomous Vehicles with Large Language Model

基于大语言模型的自然语言描述生成交通场景用于自动驾驶车辆

Bo-Kai Ruan, Hao-Tang Tsui, Yung-Hui Li, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Carnegie Mellon University(卡内基梅隆大学) AI Research Center, Hon Hai Research Institute(鸿海研究院人工智能研究中心)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出TTSG框架,通过自然语言生成可控交通场景,解决文本到空间布局、无预设位置场景构建及多智能体行为规划问题,实验表明其在安全关键场景中碰撞率低且提升驾驶 captioning 模型性能。

Comments Accepted by WAD@CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 3 篇

2603.25293 2026-03-27 cs.AI cs.CL 70%

DAGverse: Building Document-Grounded Semantic DAGs from Scientific Papers

DAGverse: 从科学论文构建文档导向的语义DAG

Shu Wan, Saketh Vishnubhatla, Iskander Kushbay, Tom Heffernan, Aaron Belikoff, Raha Moraffah, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 文档图表理解 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出DAGverse框架,通过科学论文中的显式DAG图和文本上下文,自动构建文档导向的语义DAG,提升DAG分类和标注的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13303 2026-03-27 cs.CV 57%

ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement

ShowTable:通过协作反思与精炼解锁创意表格可视化

Zhihang Liu, Xiaoyi Bao, Pandeng Li, Junjie Zhou, Zhaohe Liao, Yefei He, Kaixun Jiang, Chen-Wei Xie, Yun Zheng, Hongtao Xie

机构 * USTC(中国科学技术大学) CASIA(中国科学院自动化研究所) NJU(南京大学) SJTU(上海交通大学) ZJU(浙江大学) FDU(福建师范大学) Tongyi Lab(通义实验室)

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

AI总结 本文提出ShowTable框架,结合大语言模型与扩散模型,通过逐步自我纠正过程实现创意表格可视化,引入TableVisBench基准测试,展示其在多模态推理、生成和纠错方面的优势。

Comments Accepted to CVPR 2026, project page: https://lntzm.github.io/showtable-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16889 2026-03-27 cs.CL 50%

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

专题命中 文档图表理解 :LLaVA(abstract)

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 2 篇

2512.19918 2026-03-27 cs.CV 57%

Widget2Code: From Visual Widgets to UI Code via Multimodal LLMs

Widget2Code: 通过多模态大语言模型从视觉小部件到UI代码

Houston H. Zhang, Tao Zhang, Baoze Lin, Yuanqi Xue, Yincheng Zhu, Huan Liu, Li Gu, Linfeng Ye, Ziqiang Wang, Xinxin Zuo, Yang Wang, Yuanhao Yu, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) Concordia University(康考迪亚大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Widget2Code任务,通过多模态大语言模型提升小部件到UI代码的生成能力,设计了图像-only基准测试和WidgetFactory框架,提升视觉保真度。

Comments CVPR 2026, Code: https://github.com/Djanghao/widget2code

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16861 2026-03-27 cs.RO 50%

MolmoB0T: Large-Scale Simulation Enables Zero-Shot Manipulation

MolmoB0T:大规模模拟实现零样本操控

Abhay Deshpande, Maya Guru, Rose Hendrix, Snehal Jauhri, Ainaz Eftekhar, Rohun Tripathi, Max Argus, Jordi Salvador, Haoquan Fang, Matthew Wallingford, Wilbert Pumacay, Yejin Kim, Quinn Pfeifer, Ying-Chun Lee, Piper Wolters, Omar Rayyan, Mingtong Zhang, Jiafei Duan, Karen Farley, Winson Han, Eli Vanderbilt, Dieter Fox, Ali Farhadi, Georgia Chalvatzaki, Dhruv Shah, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校) Princeton University(普林斯顿大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出MolmoB0T,通过大规模模拟数据实现零样本操控,展示了在静态和移动操控任务中,无需真实世界微调即可有效迁移的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 7 篇

2603.25088 2026-03-27 cs.CV 79%

Visual Attention Drifts,but Anchors Hold:Mitigating Hallucination in Multimodal Large Language Models via Cross-Layer Visual Anchors

视觉注意力漂移,但锚点仍有效:通过跨层视觉锚点缓解多模态大语言模型的幻觉

Chengxu Yang, Jingling Yuan, Chuang Hu, Jiawei Jiang

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出CLVA方法,通过跨层视觉锚点缓解多模态大语言模型的幻觉问题,强调中间层视觉锚点的重要性,无需额外训练,有效抑制深度层注意力漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25035 2026-03-27 cs.AI 79%

Mechanistically Interpreting Compression in Vision-Language Models

视觉语言模型压缩的机理解释

Veeraraju Elluru, Arth Singh, Roberto Aguero, Ajay Agarwal, Debojyoti Das, Hreetam Paul

机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校) AIM Intelligence National Institute of Technology Agartala(国立阿加尔塔拉理工学院) Fordham University(福特汉姆大学) University of Fukui(福井大学) Independent Researcher(独立研究员)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文通过因果电路分析和交叉编码器特征比较,研究了剪枝和量化对视觉语言模型内部结构的影响,并提出VLMSafe-420基准测试,揭示压缩对安全行为的影响。

Comments 15 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06790 2026-03-27 cs.LG 70%

Get RICH or Die Scaling: Profitably Trading Inference Compute for Robustness

获取鲁棒性或死亡扩展:通过推理计算获利地进行鲁棒性交易

Tavish McDonald, Bo Lei, Stanislav Fort, Bhavya Kailkhura, Brian Bartoldson

机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Independent Researcher(独立研究者)

专题命中 幻觉与鲁棒性 :VLM(abstract);InternVL(abstract);分类 cs.LG

AI总结 研究探讨了推理计算与模型鲁棒性之间的关系,发现初始鲁棒性足以使模型遵循指令时,推理计算能提升对抗鲁棒性,通过强化视觉编码器可进一步增强模型的鲁棒性。

Comments 23 pages

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25613 2026-03-27 cs.CV cs.AI 62%

Demographic Fairness in Multimodal LLMs: A Benchmark of Gender and Ethnicity Bias in Face Verification

多模态大语言模型中的人口公平性:面部验证中性别和种族偏见的基准测试

Ünsal Öztürk, Hatef Otroshi Shahreza, Sébastien Marcel

机构 * Idiap Research Institute(Idiap 研究所)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文评估了九种开源多模态大语言模型在面部验证协议中的表现,揭示了不同种族和性别群体间的偏见差异,发现专用面部模型在性能和公平性上均优于通用模型。

Comments Accepted in CVPR 2026 workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25711 2026-03-27 cs.CV 57%

Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs

视觉注意:用于抗幻觉的MDLLMs

Vishal Narnaware, Animesh Gupta, Kevin Zhai, Zhenyi Wang, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 本文提出VISAGE框架,通过校准解码器目标来减少多模态幻觉,通过空间熵分析提升视觉基础性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22013 2026-03-27 cs.CV 57%

RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations

RobustVisRAG: 基于因果性的视觉增强检索增强生成方法在视觉退化下的鲁棒性

I-Hsiang Chen, Yu-Wei Liu, Tse-Yu Wu, Yu-Chien Chiang, Jen-Chien Yang, Wei-Ting Chen

机构 * National Taiwan University(国立台湾大学) Microsoft(微软)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出RobustVisRAG,通过双路径框架分离语义与退化因素,提升在视觉退化下的检索生成性能,实验显示在真实退化条件下性能提升显著。

Comments Accepted by CVPR2026; Project Page: https://robustvisrag.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24653 2026-03-27 cs.CV 57%

From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition

从权重到概念:通过奇异向量分解实现CLIP的数据无关可解释性

Francesco Gentile, Nicola Dall'Asen, Francesco Tonini, Massimiliano Mancini, Lorenzo Vaquero, Elisa Ricci

机构 * University of Trento(特伦托大学) University of Pisa(比萨大学) Fondazione Bruno Kessler(布鲁诺·凯撒基金会)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SITH框架,通过奇异向量分解分析CLIP视觉Transformer的权重空间,利用COMP算法实现细粒度概念解释,提升模型可解释性和下游性能。

Comments Accepted @ CVPR 2026. Project page: https://frangente.github.io/SITH/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 9 篇

2603.24696 2026-03-27 cs.CV 86%

LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration

LLaVA-LE:用于月球探索的大型语言和视觉助手

Gokce Inal, Pouyan Navard, Alper Yilmaz

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出LLaVA-LE,一个专为月球表面和地下特征分析设计的多模态模型,通过构建大规模月球数据集LLUCID和两阶段训练方法,提升了行星科学领域的视觉语言模型性能。

Comments Accepted in AI4Space Workshop CVPR2026. Website: https://osupcvlab.github.io/LLaVA-LE/, Dataset: https://huggingface.co/datasets/pcvlab/lucid

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25733 2026-03-27 cs.CV 85%

SlotVTG: Object-Centric Adapter for Generalizable Video Temporal Grounding

SlotVTG: 用于通用视频时间定位的对象中心适配器

Jiwook Han, Geo Ahn, Youngrae Kim, Jinwoo Choi

机构 * Kyung Hee University(庆熙大学) University of Southern California(南加州大学)

专题命中 VLM训练与架构 :grounding(title,abstract);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 SlotVTG通过引入轻量级槽适配器,使MLLMs在最小成本下实现对象中心的输入关联视觉推理,提升跨域鲁棒性的同时保持领域内性能。

Comments Accepted to GRAIL-V workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24934 2026-03-27 cs.LG cs.AI cs.CV 82%

CVA: Context-aware Video-text Alignment for Video Temporal Grounding

CVA: 基于上下文的视频-文本对齐用于视频时间定位

Sungho Moon, Seunghun Lee, Jiwan Seo, Sunghoon Im

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST), Republic of Korea(韩国大邱庆北科学技术院(DGIST))

专题命中 VLM训练与架构 :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出CVA框架,通过查询感知上下文多样化、上下文不变边界判别损失和上下文增强Transformer编码器,提升视频时间定位的鲁棒性和准确性,显著提高Recall@1分数。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23953 2026-03-27 cs.CV cs.ET 81%

VOLMO: Versatile and Open Large Models for Ophthalmology

VOLMO:面向眼科学的多功能和开放型大模型

Zhenyue Qin, Younjoon Chung, Elijah Lee, Wanyue Feng, Xuguang Ai, Serina Applebaum, Minjie Zou, Yang Liu, Pan Xiao, Mac Singer, Amisha Dave, Aidan Gilson, Tiarnan D. L. Keenan, Emily Y. Chew, Zhiyong Lu, Yih-Chung Tham, Ron Adelman, Luciano V. Del Priore, Qingyu Chen

机构 * Department of Biomedical Informatics & Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系) Ray and Stephanie Lane Computational Biology Department, Carnegie Mellon University(卡内基梅隆大学雷和斯蒂芬妮·兰德计算生物学系) Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨洛林医学院) Department of Radiology, Washington University in Saint Louis(圣路易斯华盛顿大学放射科) National Eye Institute, National Institutes of Health(国家卫生研究院眼科研究所) National Library of Medicine, National Institutes of Health(国家卫生研究院国家医学图书馆)

专题命中 VLM训练与架构 :LLaVA(abstract);InternVL(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 VOLMO提出了一种通用框架,用于开发专门的眼科多模态大语言模型,通过预训练、微调和临床推理三个阶段,提升了眼科疾病筛查和诊断的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24804 2026-03-27 cs.CV cs.AI cs.LG 75%

GoldiCLIP: The Goldilocks Approach for Balancing Explicit Supervision for Language-Image Pretraining

GoldiCLIP:平衡显式监督的Goldilocks方法用于语言-图像预训练

Deen Dayal Mohan, Hossein Souri, Vitali Petsiuk, Juhong Min, Gopal Sharma, Luowei Zhou, Suren Kumar

机构 * AI Center – Mountain View, Samsung Electronics(三星电子山景城AI中心)

专题命中 VLM训练与架构 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 GoldiCLIP通过平衡监督信号提出新框架,结合文本条件自蒸馏、编码器解码器与VQA目标及不确定性加权机制,在3000万数据下实现高效预训练,提升多任务检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23159 2026-03-27 cs.CV cs.LG 73%

Conformal Cross-Modal Active Learning

符合性跨模态主动学习

Huy Hoang Nguyen, Cédric Jung, Shirin Salehi, Tobias Glück, Anke Schmeink, Andreas Kugi

机构 * AIT Austrian Institute of Technology(奥地利理工学院) Automation & Control Institute, Technical University of Vienna(维也纳技术大学自动化与控制研究所) Chair of Information Theory and Data Analytics (INDA), RWTH Aachen University(亚琛工业大学信息理论与数据分析教席)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出CCMA框架,通过教师-学生架构融合视觉与语言模态,利用多模态符合评分与多样性意识选择策略,提升数据效率。

Comments 20 pages, 14 figures

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25145 2026-03-27 cs.CV cs.LG 62%

Learning to Rank Caption Chains for Video-Text Alignment

学习排名图注链以实现视频-文本对齐

Ansel Blume, Burak Uzkent, Shalini Chaudhuri, Garin Kessler

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Prime Video(亚马逊Prime Video)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出通过重复图注退化生成大规模挑战性图注链,改进视频-文本对齐的排名优化方法,优于二元DPO并在长形式内容生成中表现更优,需对视觉编码器进行微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24965 2026-03-27 cs.CV cs.AI 62%

Self-Corrected Image Generation with Explainable Latent Rewards

可解释性潜在奖励的自校正图像生成

Yinyi Luo, Hrishikesh Gokhale, Marios Savvides, Jindong Wang, Shengfeng He

机构 * Carnegie Mellon University(卡内基梅隆大学) Singapore Management University(新加坡管理大学) William & Mary(威廉与玛丽学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出xLARD框架,利用多模态大语言模型通过可解释性潜在奖励指导生成,改进语义对齐和视觉保真度,同时保持生成先验。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25072 2026-03-27 cs.CV 57%

GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding

GIFT:全局不可替代性帧目标用于高效视频理解

Junpeng Ma, Sashuai Zhou, Guanghao Li, Xin Gao, Yue Cao, Hengyu Zeng, Yuxiang Yan, Zhibin Wang, Jun Song, Bo Zheng, Shanghang Zhang, Jian Pu

机构 * Institute of Science and Technology for Brain-inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Zhejiang University(浙江大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 GIFT通过评估帧的内在不可替代性选择关键帧,解决视频理解中处理密集帧的高计算成本问题,提升视频分析效率。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 2 篇

2603.25195 2026-03-27 cs.HC 78%

On-Demand Instructional Material Providing Agent Based on MLLM for Tutoring Support

基于MLLM的按需教学材料提供代理用于辅导支持

Takumi Kato, Masato Kikuchi, Tadachika Ozono

专题命中 其他VLM :MLLM(title);multimodal large language model(abstract)

AI总结 本文提出基于多模态大语言模型的代理,用于在一对一辅导中按需提供教学材料,通过分析对话自动检索相关图片,实验显示检索时间减少44.4秒,85.7%的试次提供可接受质量的图片。

Comments The 20th International Conference on E-Service and Knowledge Management (ESKM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03361 2026-03-27 cs.AI cs.NE 61%

Concepts Learned Visually by Infants Can Contribute to Visual Learning and Understanding in AI Models

婴儿通过视觉学习的概念可以促进AI模型中的视觉学习和理解

Shify Treger, Shimon Ullman

专题命中 其他VLM :vision-language model(abstract,comments);分类 cs.AI

AI总结 研究探讨婴儿早期视觉学习概念如何促进AI模型学习,通过比较早期概念与标准深度网络模型,发现早期概念提升学习准确性和效率,改善模型表征和泛化能力。

Comments Significantly extended version of earlier work, with additional experiments, expanded discussion and related work, new experiments with human participants, and broader evaluation across multiple vision-language models

详情

展开后加载摘要…

URL PDF HTML 收藏