arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-02 至 2026-04-02 共收录 57 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 23 篇

2603.29620 2026-04-02 cs.CV cs.MM 57%

Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis

Unify-Agent:一种用于世界 grounded 图像合成的统一多模态代理

Shuang Chen, Quanxin Shou, Hangting Chen, Yucheng Zhou, Kaituo Feng, Wenbo Hu, Yi-Fan Zhang, Yunlong Lin, Wenxuan Huang, Mingyang Song, Dasen Dai, Bolin Jiang, Manyuan Zhang, Shi-Xue Zhang, Zhengkai Jiang, Lucas Wang, Zhao Zhong, Yu Cheng, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出Unify-Agent,一种统一多模态代理,用于世界 grounded 图像合成,通过代理流程提升图像生成质量,结合事实IP基准测试,展示其在多种任务中的优越表现。

Comments Project Page: https://github.com/shawn0728/Unify-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00248 2026-04-02 cs.CL cs.AI 57%

REM-CTX: Automated Peer Review via Reinforcement Learning with Auxiliary Context

REM-CTX:通过强化学习与辅助上下文实现的自动化同行评审

Pawin Taechoyotin, Daniel E. Acuna

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 REM-CTX通过强化学习与辅助上下文提升同行评审质量,实验显示其在多个领域中优于基线模型,且在质量和上下文关联性指标上表现突出。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00010 2026-04-02 cs.CL cs.AI 57%

Can LLMs Perceive Time? An Empirical Investigation

大语言模型能感知时间吗?一项实证研究

Aniketh Garikaparthi

机构 * TCS Research(塔塔咨询服务公司研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究探讨大语言模型在时间估计上的局限性,通过68项任务和四类模型进行实验,发现模型在预任务估计、相对排序和事后回忆中均存在显著误差,表明模型缺乏对自身推理时间的体验性认知。

Comments ICLR 2026 I Can't Believe It's Not Better Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01110 2026-04-02 cs.SE 50%

Harnessing Hype to Teach Empirical Thinking: An Experience With AI Coding Assistants

利用 hype 教授实证思维:与 AI 编码助手的实践经验

Marvin Wyrich, Norman Peitek, Kallistos Weis, Sven Apel

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨通过 hype 驱动技术使学生更易理解实证方法,结合 AI 编码助手实践,提升学生批判性思维与实证研究能力。

Comments Accepted to FSE'26 (Education Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24116 2026-04-02 eess.AS 50%

How Open is Open TTS? A Practical Evaluation of Open Source TTS Tools

开放程度如何?对开源语音合成工具的实用性评估

Teodora Răgman, Adrian Bogdan Stânea, Horia Cucu, Adriana Stan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文评估了四种开源语音合成框架在构建新型TTS模型的可行性,特别是在资源受限语言中的挑战,通过客观指标和主观测试揭示了工具链设置、数据预处理和计算效率的问题。

Comments Published in IEEE Access https://ieeexplore.ieee.org/document/11269795

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09504 2026-04-02 cs.CL 50%

MVSS: A Unified Framework for Multi-View Structured Survey Generation

MVSS:多视图结构化调查生成的统一框架

Yinqi Liu, Yueqi Zhu, Yongkang Zhang, Feiran Liu, Yutong Shen, Yufei Sun, Xin Wang, Renzhao Liang, Yidong Wang, Cunxiang Wang

机构 * Beijing University of Technology(北京工业大学) Peking University(北京大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出MVSS框架,通过结构优先方法生成和对齐引用支撑的层级树、结构化比较表和调查文本,提升调查生成的结构组织和证据呈现质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12993 2026-04-02 cs.SE cs.CR 50%

SmartPoC: Generating Executable and Validated PoCs for Smart Contract Bug Reports

SmartPoC: 为智能合约漏洞报告生成可执行且验证的PoC

Longfei Chen, Ruibin Yan, Taiyu Wong, Yiyang Chen, Jialai Wang, Chao Zhang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SmartPoC通过生成并执行可执行的PoC测试用例,验证审计报告中的漏洞。该方法通过提取关键函数切片、生成-修复-执行循环及差分验证提高可执行性与准确性,实现了高精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23418 2026-04-02 cs.CR 50%

Beyond Metadata: Multimodal, Policy-Aware Detection of YouTube Scam Videos

超越元数据:多模态、政策感知的YouTube诈骗视频检测

Ummay Kulsum, Aafaq Sabir, Abhinaya S. B., Anupam Das

专题命中 视觉定位与Grounding :LLaVA(abstract)

AI总结 本文提出多模态、政策感知的YouTube诈骗视频检测方法,通过结合文本、音频和视频信息,提升检测性能和鲁棒性,同时提供可解释的政策依据。

Comments Accepted at AAAI ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 2 篇

2601.18242 2026-04-02 cs.CV cs.NI 57%

Vision-Language-Model-Guided Differentiable Ray Tracing for Fast and Accurate Multi-Material RF Parameter Estimation

基于视觉-语言模型的可微射线追踪:用于快速且准确的多材料射频参数估计

Zerui Kang, Yishen Lim, Zhouyou Gu, Seung-Woo Ko, Tony Q. S. Quek, Jihong Park

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

AI总结 本文提出一种基于视觉-语言模型的可微射线追踪框架,通过解析场景图像推断材料类别并指导射频参数估计,实现更快的收敛速度和更低的参数误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03992 2026-04-02 cs.IR 50%

Nemotron ColEmbed V2: Top-Performing Late Interaction Embedding Models for Visual Document Retrieval

Nemotron ColEmbed V2:视觉文档检索中表现优异的后期交互嵌入模型

Gabriel de Souza P. Moreira, Ronay Ak, Mengyao Xu, Oliver Holworthy, Benedikt Schifferer, Zhiding Yu, Yauhen Babakhin, Radek Osmulski, Jiarui Cai, Ryan Chesler, Bo Liu, Even Oldridge

专题命中 文档图表理解 :VLM(abstract)

AI总结 本文提出Nemotron ColEmbed V2模型,通过集群采样、硬负样本挖掘等技术,在ViDoRe基准上实现最佳性能,展示了低维嵌入在准确率与存储间的平衡实验。

Comments Proceedings of the 1st Late Interaction Workshop (LIR) @ ECIR 2026, April 02, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 2 篇

2604.00055 2026-04-02 cs.RO cs.CV cs.LG 73%

Generalizable Dense Reward for Long-Horizon Robotic Tasks

可泛化的密集奖励用于长周期机器人任务

Silong Yong, Stephen Sheng, Carl Qi, Xiaojie Wang, Evan Sheehan, Anurag Shivaprasad, Yaqi Xie, Katia Sycara, Yesh Dattatreya

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Robotics(亚马逊机器人) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出VLLR框架,结合外部奖励和内部奖励提升长周期机器人任务性能,通过任务分解和自信心引导实现无需人工奖励工程的高效训练。

Comments Project page: https://silongyong.github.io/vllr_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24212 2026-04-02 cs.RO cs.CV 70%

RANGER: A Monocular Zero-Shot Semantic Navigation Framework through Visual Contextual Adaptation

RANGER:通过视觉上下文适应的单目零样本语义导航框架

Ming-Ming Yu, Yi Chen, Börje F. Karlsson, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 RANGER通过视觉上下文学习实现零样本语义导航,无需依赖深度和姿态信息,利用3D基础模型和视觉语言模型提升任务效率与环境适应性。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 3 篇

2604.01010 2026-04-02 cs.CV cs.MM 85%

PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks

PDA:用于对抗图像攻击的文本增强防御框架

Jingning Xu, Haochen Luo, Chen Liu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

AI总结 PDA通过测试时文本增强提升视觉语言模型对多种对抗攻击的鲁棒性,无需修改底层模型,平衡了鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27982 2026-04-02 cs.CV cs.AI cs.CL 81%

CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models

CDH-Bench:一种基于常识的幻觉基准,用于评估视觉语言模型中的视觉保真度

Kesheng Chen, Yamin Hu, Qi Zhou, Zhenqian Zhu, Wenjian Luo

机构 * Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies, Institute of Cyberspace Security, School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(广东省新型安全智能技术重点实验室,网络空间安全研究院,计算机科学与技术学院,哈尔滨工业大学(深圳))

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CDH-Bench基准,用于评估视觉语言模型在视觉证据与常识冲突时的视觉保真度,通过三种异常类型和两种QA任务,揭示模型在常识驱动下的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15411 2026-04-02 cs.CV cs.LG 62%

D4C: Data-Free Quantization for Contrastive Language-Image Pre-training Models

D4C: 无数据量化用于对比语言-图像预训练模型

Wenlun Zhang, Yunshan Zhong, Zihao Ding, Xinyu Li, Kentaro Yoshioka

机构 * Keio University(庆应义塾大学) Hainan University(海南大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出D4C框架,解决无数据量化在CLIP模型中的性能问题,通过生成语义丰富且结构多样的伪图像提升模型压缩效果。

Comments Accepted to CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 9 篇

2510.00766 2026-04-02 cs.CV cs.AI 84%

Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?

大视觉-语言模型是否准备好指导盲人和低视力者?

Eunki Kim, Na Min An, Wan Ju Kang, Sangryul Kim, James Thorne, Hyunjung Shim

机构 * SKT KAIST AI(韩国科学技术院人工智能) NAVER Theia Insights

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出统一框架,通过用户研究和定制数据集,开发出更高效的评估器,提升大视觉-语言模型在盲人和低视力用户导航中的应用性能。

Comments 42 pages, 14 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00592 2026-04-02 cs.CV cs.HC 83%

HarassGuard: Detecting Harassment Behaviors in Social Virtual Reality with Vision-Language Models

HarassGuard: 在社交虚拟现实中利用视觉-语言模型检测骚扰行为

Junhee Lee, Minseok Kim, Hwanjo Heo, Seungwon Woo, Jinwoo Kim

机构 * Kwangwoon University(光云大学) ETRI(韩国电子通信研究院) Chungbuk National University(忠北大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出HarassGuard系统,通过视觉输入检测社交VR中的身体骚扰行为,利用提示工程和微调VLMs,在不使用敏感生物数据的情况下实现高准确率的骚扰检测。

Comments To appear in the 2026 TVCG Special Issue on the 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (VR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01118 2026-04-02 cs.CV cs.AI cs.LG 75%

Lightweight Prompt-Guided CLIP Adaptation for Monocular Depth Estimation

轻量级提示引导的CLIP适应用于单目深度估计

Reyhaneh Ahani Manghotay, Jie Liang

机构 * School of Engineering Science, Simon Fraser University(西蒙弗雷泽大学工程科学学院) School of Information Science and Technology, Eastern Institute of Technology(东方理工学院信息科学与技术学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出MoA-DepthCLIP框架,通过轻量级MoA模块和选择性微调提升单目深度估计的精度与效率,优于基线模型。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02966 2026-04-02 cs.PL cs.AI cs.MA 70%

Lumos: Let there be Language Model System Certification

Lumos: 让语言模型系统认证成为可能

Isha Chaudhary, Vedaant Jain, Prineet Parhar, Kavya Sachdeva, Avaljot Singh, Sayan Ranu, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indian Institute of Technology Delhi(印度理工学院德里分校)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 Lumos提出首个系统化框架,通过概率编程DSL实现语言模型系统行为的正式认证,支持复杂关系和时间规格,揭示了先进视觉语言模型在自动驾驶场景中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00886 2026-04-02 cs.CV cs.AI cs.CL 62%

PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding

PixelPrune: 通过预测编码实现像素级的视觉令牌减少

Nan Wang, Zhiwei Jin, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO AI中心)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 PixelPrune通过预测编码压缩技术,在视觉变换器编码器前消除冗余像素块,提升文档和GUI任务的推理速度和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00279 2026-04-02 cs.CV cs.AI 62%

The Geometry of Compromise: Unlocking Generative Capabilities via Controllable Modality Alignment

妥协的几何学:通过可控的模态对齐解锁生成能力

Hongyuan Liu, Qinli Yang, Wen Li, Zhong Zhang, Jiaming Liu, Wei Han, Zhili Qin, Jinxia Guo, Junming Shao

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Bristol(布里斯托大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过几何分析揭示模态间隙的两个组成部分,提出TPC-CMA框架以减少两者,显著提升跨模态对齐性能,实验显示在不同目标α下模态间隙大幅降低,同时保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00983 2026-04-02 cs.CV 57%

ACT Now: Preempting LVLM Hallucinations via Adaptive Context Integration

现在行动:通过自适应上下文整合预防治愈LVLM幻觉

Bei Yan, Yuecong Min, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ACT方法,通过自适应整合上下文信息缓解LVLM幻觉问题,采用视觉上下文探索和语义上下文聚合技术,有效减少幻觉并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01155 2026-04-02 cs.SD 50%

FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining

FineLAP: 通过异质监督驯化细粒度语言-音频预训练

Xiquan Li, Xuenan Xu, Ziyang Ma, Wenxi Chen, Haolin He, Qiuqiang Kong, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University(上海交通大学巴黎卓越工程师学院) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出FineLAP,一种新型预训练范式,通过异质数据提升CLAP在clip和frame级对齐能力,引入双流sigmoid损失和聚类采样策略,结合大规模合成SED数据集,实现多任务SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04822 2026-04-02 cs.CL 50%

Evaluating Vision-Language and Large Language Models for Automated Student Assessment in Indonesian Classrooms

评估视觉语言和大语言模型用于印度尼西亚课堂自动学生评估

Nurul Aisyah, Muhammad Dehan Al Kautsar, Arif Hidayat, Raqib Chowdhury, Fajri Koto

机构 * Quantic School of Business and Technology(Quantic商业与技术学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Indonesia University of Education(印度尼西亚教育大学) Monash University(莫纳什大学)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 研究评估了视觉语言和大语言模型在印尼课堂中的自动学生评估效果,发现VLM在手写识别上存在困难,但LLM反馈仍具教学价值。

Comments Accepted at AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 3 篇

2502.14883 2026-04-02 cs.CV cs.AI 81%

How Blind and Low-Vision Individuals Prefer Large Vision-Language Model-Generated Scene Descriptions

盲人和低视力者如何偏好大型视觉-语言模型生成的场景描述

Na Min An, Eunki Kim, Wan Ju Kang, Sangryul Kim, James Thorne, Hyunjung Shim

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了盲人和低视力用户对大型视觉-语言模型生成场景描述的偏好,通过用户研究评估了六种描述类型,发现用户对描述的充分性和简洁性存在较大差异,提出需构建以盲人和低视力用户为中心的评估指标。

Comments This paper has been superseded by version 2 of arXiv:2510.00766

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00820 2026-04-02 cs.CV 57%

Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis

遥感持续视觉-语言学习:基准测试与分析

Xingxing Weng, Ruifeng Ni, Chao Pang, XiangYu Hao, Yishan Wang, Xiaokang Zhang, Wei Xu, Gui-Song Xia

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CLEaRS基准,评估遥感视觉-语言模型的持续学习能力,发现现有模型存在灾难性遗忘,需开发专用持续学习方法。

Comments 23 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00530 2026-04-02 cs.CV 57%

AceTone: Bridging Words and Colors for Conditional Image Grading

AceTone:连接词语与颜色的条件图像评分

Tianren Ma, Mingxiang Liao, Xijin Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance(字节跳动)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 AceTone提出了一种基于多模态条件的颜色评分方法,通过生成颜色转换任务实现统一框架,利用VQ-VAE tokenizer压缩LUT向量并结合大规模数据集训练,提升图像评分的感知和美学一致性。

Comments Accepted by CVPR 2026. Project Page: github.com/martian422/AceTone

详情

展开后加载摘要…

URL PDF HTML 收藏