arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-28 至 2026-07-28 共收录 117 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 7 篇

2607.22723 2026-07-28 cs.CV 新提交 79%

Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models

通过分类引导的大型视觉语言模型从文档中提取视觉信息

Huafu Li, Guo Chen, Jia Xia, Lei Wang, Wei Du, Yun Yao, Weijun Peng, Liming Li

机构 * China Mobile Information Technology Co., Ltd.(中国移动信息技术有限公司) School of Information Science and Engineering, NingboTech University(宁波诺丁汉大学信息科学与工程学院)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究从视觉丰富文档提取视觉信息的挑战,提出分类引导大型视觉语言模型框架,通过解耦分类与提取、运用动态提示工程实现零样本推理,在真实数据集上性能超监督基线,为办公自动化文档理解提供高效方案。

Comments 14 pages, 3 figures

Journal ref Scientific Reports 16, 14158 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24554 2026-07-28 cs.IR cs.CV 新提交 70%

DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for Complex Document Understanding

DeCoRAG:用于复杂文档理解的认知解耦和语义感知裁剪

Shuo Wang, Kai Zhang, Wenyuan Huang, Yizheng Yu, Xia Liao, Junming Su, Qing Wang, Fang Xi

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 研究针对复杂文档理解中多模态检索增强生成的难题,提出DeCoRAG方法,通过认知解耦、建立语义锚及区域感知裁剪机制,提升语义通过率,减少提示令牌,在复杂文档基准测试中取得良好效果。

Comments 11 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05080 2026-07-28 q-fin.TR 版本更新 67%

MM-ARC: Multimodal Adaptive Routing of Capital with Robustness-Audited Strategy Pools

MM-ARC:具有稳健性审核策略池的资本多模态自适应路由

Yang Chen, Yuchen Cao, Jacky Keung, Leilei Gan, Kun Kuang, Yueheng Jiang, Zhaozhao Ma, Jianping Zhu, Fei Wu, Jinpeng Li

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract)

AI总结 研究金融交易系统如何转化多模态市场历史,提出MM-ARC方法,通过多视图在不同专家间分配资本,经稳健性审核筛选候选方案,实验显示该方法在夏普比率和最大回撤等指标上优于基线,有相对基准的支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19259 2026-07-28 cs.CV cs.AI 版本更新 62%

TextRich: A Multi-Domain Benchmark for Detecting AI-Generated Text-Rich Images from GPT-Image-2

一个用于检测 GPT-Image-2 生成的含丰富文本图像的多领域基准

Yijin Wang, Shuyi Wang, Wenhan Zhang, Yuqi Ouyang

机构 * College of Computer Science(计算机科学学院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对现有基准缺乏文本丰富图像检测的问题,构建了包含8602张图像、覆盖6个类别的多领域基准,评估5种检测器,发现性能高度依赖领域且易受JPEG压缩影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24651 2026-07-28 cs.CV cs.CL cs.IR 新提交 57%

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

无坐标或区域标签的视觉文档理解中的证据归因

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿尔托大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 研究视觉文档理解中无坐标或区域标签时的证据归因问题,通过对比坐标与语言接口,发现语言接口能提升证据召回率、降低幻觉率。基于此用引述和检索管道作训练框架,引入GRPO方法,提高了模型严格归因准确率,找到改善归因的实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与屏幕智能体 8 篇

2607.22708 2026-07-28 cs.CV 新提交 85%

StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design

StepX-Edge:一种通过架构-训练-部署协同设计的端侧用户界面视觉语言模型

Yin Wang, Haotian Hu, Jineng Han, Wentao Qiu, Zhenhua Ge, Liujian Tang, Fanyi Wang

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 研究旨在解决端侧视觉语言模型在准确性和效率间的矛盾,提出StepX-Edge模型,通过架构、训练和部署协同设计,在多项任务中表现出色,参数少且运行稳定,还将开源相关数据、方法和管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24411 2026-07-28 cs.AI cs.CL cs.CV cs.HC 版本更新 85%

OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows

OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理

Qiushi Sun, Mukai Li, Zhoumianze Liu, Zhihui Xie, Fangzhi Xu, Zhangyue Yin, Kanzhi Cheng, Zehao Li, Zichen Ding, Qi Liu, Zhiyong Wu, Zhuosheng Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。

Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10577 2026-07-28 cs.RO 版本更新 83%

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

AgenticNav:零样本视觉与语言导航作为工具调用框架

Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 提出AgenticNav,通过将动作、深度和记忆作为可调用工具暴露给VLM,实现零样本连续环境导航,在R2R-CE基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06882 2026-07-28 cs.RO cs.AI 版本更新 83%

GemNav: Discrete-Token Visual Robot Navigation using a Multimodal Large Language Model

GemNav:使用多模态大语言模型的离散令牌视觉机器人导航

Peter Bohm, Saimunur Rahman, Abdelwahed Khamis, Sagun Man Singh Shrestha, Chris McCool, Peyman Moghadam

机构 * CSIRO Technology(联邦科学与工业研究组织)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 研究探索基于大型预训练模型的视觉机器人导航策略新方法,提出GemNav,仅对语言塔用LoRA适配冻结的多模态大语言模型用于中短程航点导航,无辅助视觉编码器等,在小语料库上零样本转移到未见环境,提供了数据高效、可部署的导航替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22721 2026-07-28 cs.CV cs.AI 新提交 62%

An Interactive Vision Language Platform for Cognitive Remediation in Schizophrenia

用于精神分裂症认知康复的交互式视觉语言平台

Nassira Ait Mehdi, Milissa Temmam, Slimane Larabi

机构 * Computer Science Faculty, USTHB University(USTHB大学计算机科学学院) RIIMA Laboratory(RIIMA实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对精神分裂症患者认知康复任务中动作评估依赖人工观察的问题,提出基于视觉语言模型的自动化框架,通过分析视频和微调模型验证动作,收集数据集评估,有效连接物理与临床反馈,提供可扩展客观方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22798 2026-07-28 cs.SE cs.CV 新提交 57%

StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents

StateAct:在像素之前的程序状态,用于长期计算机使用代理

Yan Yang, Xiangru Jian, Ziyang Luo, Zirui Zhao, Yutong Dai, Ziji Shi, Hanshu Yan, Jun Hao Liew, Silvio Savarese, Junnan Li

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 研究针对计算机使用代理,提出基于程序状态的StateAct多代理框架,主要代理用代码处理状态,GUI子代理辅助,支持验证,在OSWorld 2.0上提升了Claude Opus 4.8的成功率,且成本降低,实现从感知到推理的瓶颈转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00288 2026-07-28 cs.RO cs.CV 版本更新 57%

UAV-ON: A Benchmark for Open-World Object Goal Navigation with Aerial Agents

UAV-ON:用于空中智能体的开放世界目标导航基准测试

Jianqiang Xiao, Yuexuan Sun, Yixin Shao, Boxi Gan, Rongqiang Liu, Yanjin Wu, Weili Guan, Xiang Deng

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 介绍用于空中智能体开放世界目标导航的UAV-ON基准测试,含14个环境及1270个目标对象,通过实例级指令编码。实现多种基线方法评估,结果凸显空中导航和语义目标基础的复合挑战,推动复杂环境下无人机可扩展自主性研究。

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22342 2026-07-28 cs.RO 版本更新 50%

VL-LN Bench: Towards Long-horizon Goal-oriented Navigation with Active Dialogs

VL-LN基准:通过主动对话实现长视界目标导向导航

Wensi Huang, Shaohao Zhu, Meng Wei, Siqi Zhang, Jinming Xu, Xihui Liu, Hanqing Wang, Tai Wang, Feng Zhao, Jiangmiao Pang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 VL-LN基准通过引入主动对话机制,提升长视界目标导向导航任务的性能和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与鲁棒性 9 篇

2607.24440 2026-07-28 cs.CV cs.CL cs.LG 新提交 84%

Bigger or Cheaper? Scale and Quantization Effects on Uncertainty Signals in Vision-Language Models Under Image Degradation

更大还是更便宜?图像退化下视觉语言模型中尺度和量化对不确定性信号的影响

M M Asif Ferdous

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn,comments);分类 cs.CV、cs.LG

AI总结 研究在图像退化下视觉语言模型中尺度和量化对不确定性信号的影响,通过对Qwen2-VL系列模型的实验发现,尺度提升内部不确定性信号,4位量化对准确性影响小但对置信信号影响大,建议固定内存预算下选更大量化模型,如7B-4bit。

Comments 12 pages, 4 figures. Code and data: https://github.com/Asif-Ferdous/vlm-scale-quant

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23702 2026-07-28 cs.RO 新提交 75%

Try Once, Then Optimal: De-Redundified Procedure Memory for Cross-Episode Exploration Amortization

一试即优:用于跨情节探索摊销的去冗余过程记忆

Haizhou Ge, Haochen Ouyang, Zhixing Chen, Yufei Jia, Yue Li, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

机构 * Tsinghua University(清华大学) DISCOVER Robotics(DISCOVER机器人公司) Northeast Agricultural University(东北农业大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 研究如何让机器人避免重复探测隐藏状态物体,提出面向实例的记忆框架IOM,用视觉语言模型实例化,在多任务中减少操纵操作,提升效率且不降低成功率,即使过程错误也能成功。

Comments 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24017 2026-07-28 cs.CV cs.AI 新提交 73%

Disentangling Semantic Attention from Structural Bias in the Attention Manifold

在注意力流形中分离语义注意力与结构偏差

Pengkun Jiao, Bin Zhu, Jingjing Chen, Yu-gang Jiang

机构 * Fudan University(复旦大学) Singapore Management University(新加坡管理大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型中注意力机制对无信息视觉 tokens 关注过多的问题,提出无需训练的 SPAR 方法,通过净化噪声和重分配注意力,有效恢复真实视觉基础且计算开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22745 2026-07-28 cs.CV cs.AI 新提交 73%

AI-generated Images Challenge Visual Trust in High-risk Scenarios

人工智能生成的图像在高风险场景中挑战视觉信任

Yi-Zhi Wang, Yichen Xiao, Linan Yue, Weibo Gao, Yichao Du, Pengfei Fang, Shimin Di, Min-Ling Zhang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究聚焦人工智能生成图像在高风险场景下对视觉信任的挑战,提出SafeIMG基准,涵盖12个安全场景。评估专门探测器和视觉语言模型,发现它们检测可靠性不足,模型解释覆盖低,表明当前探测器在多方面欠缺,难以可靠评估此类图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22716 2026-07-28 cs.CV cs.LG 新提交 73%

Visual Token Compression Enhances Robustness of MLLMs

视觉令牌压缩增强多模态大语言模型的鲁棒性

Shishen Gu, Jiequan Cui, Wenbo Hu, Zenglin Shi, Zhenzhen Hu, Richang Hong

机构 * Hefei University of Technology(合肥工业大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 研究如何增强多模态大语言模型的鲁棒性,核心方法是通过测量视觉令牌与语言特征空间的距离来识别并剪枝分布外视觉令牌,该方法能有效防御越狱攻击、减轻幻觉,提升模型在通用数据集上的表现。

Comments 20 pages, 16 figures. Accepted at ACM Multimedia 2026. Code: https://github.com/Eurek001/OOD-VTP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24194 2026-07-28 cs.CV 新提交 57%

Face Age Verification Vulnerabilities Under Simple Appearance Manipulations

简单外观操纵下的面部年龄验证漏洞

Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos

机构 * Information Technologies Institute, Centre for Research and Technology Hellas(信息技术研究所,希腊研究与技术中心)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究简单外观操纵下面部年龄验证的漏洞,评估七个模型在三个数据集及四种操纵类型下的情况,发现胡茬操纵影响大,不同人口统计特征受影响有差异,还探索了用偏差缓解方法减轻偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23537 2026-07-28 cs.AI 新提交 57%

ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness

ObsDriveBench:具有可观测性意识的恶劣天气下多模态理解基准测试

Qiao Yan, Yihan Wang, Zhenghao Xing, Jiaqi Xu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学医学智能与扩展现实研究所)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 研究恶劣天气下视觉语言模型在多模态输入时的表现,引入ObsDriveBench基准测试,通过可观测性元标注等构建含多类问题的测试集,实验发现现有模型性能降,还引入ObsDrive模型提升其在多方面的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02913 2026-07-28 cs.CV 版本更新 57%

Improving Adversarial Robustness of Zero-Shot CLIP with Confidence-Aware Weighting

通过置信感知加权提高零样本CLIP的对抗鲁棒性

Nikoo Naghavian, Mostafa Tavassolipour

机构 * School of ECE, College of Engineering University of Tehran(电子工程学院,工程学院,伊朗塔里哈大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 研究如何提高零样本CLIP的对抗鲁棒性,提出置信感知加权方法,该方法含置信感知损失和特征对齐正则化两个关键组件,实验证明其在强对抗攻击下优于现有方法且内存效率更高。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23718 2026-07-28 cs.IR 新提交 50%

Melo: A Production LLM-Powered Music Recommendation Agent

Melo:一个由大语言模型驱动的音乐推荐代理

Shijia Wang, Da Guo, Qiang Xiao, Fanghui Bi, Weisheng Li, Dongjing Wang, Chuanjiang Luo

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 研究基于网易云音乐部署的大语言模型驱动音乐推荐代理Melo,针对实体幻觉和长尾退化故障模式,采用推理时实体基础和反思性重试机制,经测试在播放列表留存和参与度指标上有提升,强调运行时机制对推荐进展的重要性。

Journal ref Proceedings of the 20th ACM Conference on Recommender Systems (RecSys '26), September 27-October 02, 2026, Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏

4. VLM训练与架构 28 篇

2607.24516 2026-07-28 cs.CV cs.AI 新提交 89%

DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

DecoupleMix:用于可扩展视觉语言模型数据配方的解耦比率搜索和凸分配

Jiahao Xie, Zhongbin Guo, Qianle Wang, Ruiqi Lu, Dongling Xiao, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 VLM训练与架构 :VLM(title,summary_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视觉语言模型数据构建缺乏原则性标准的问题,提出DecoupleMix框架,将其解耦为类间比率搜索和类内凸分配两个子问题,实验证明该方法优于启发式基线,且最优比率可跨规模转移,提升了VLM竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23913 2026-07-28 cs.AI 新提交 87%

GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language Models

GOTS:用于高分辨率视觉语言模型的贪婪正交令牌选择

Jun Ling, Tao Huang, Junzhuo Liu, Bowen Tang, Peng Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);InternVL(abstract);分类 cs.AI

AI总结 研究高分辨率视觉语言模型中令牌减少问题。提出GOTS方法,通过所选跨度互补性,无训练且与查询无关,每步选正交最大剩余能量令牌。在多主干和基准测试中性能优,还减少模型端首次令牌时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23944 2026-07-28 cs.AI 新提交 85%

DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

DICA:多模态大语言模型中的双指标引导对比对齐

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23368 2026-07-28 cs.CV cs.AI cs.CL 新提交 85%

Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing

用基于树图解析支持的加权班扎夫交互解释生物医学CLIP

Jakub Rymarski, Adam Rempała, Bartłomiej Sobieski, Przemysław Biecek

机构 * University of Warsaw(华沙大学) Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉语言模型在医学任务中解释难的问题,引入ParseFIxLIP方法,将树图解析融入班扎夫交互博弈,通过smart_depth分组策略减轻概念碎片化,提升跨模态交互可解释性,为VLM决策提供医学领域相关见解。

Comments 12 pages, 13 figures. Accepted at EXPLIMED 2026 (Third Workshop on Explainable Artificial Intelligence for the medical domain), IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23605 2026-07-28 cs.AI 新提交 83%

Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning

用于视觉语言模型智能体强化学习的统一评论家混合优势估计

Wenxuan Zhang, Yuhui Wang, Donggang Jia, Xiaoqian Shen, Jian Ding, Ivan Viola, Jürgen Schmidhuber, Mohamed Elhoseiny

机构 * KAUST(沙特阿卜杜拉国王科技大学)

专题命中 VLM训练与架构 :VLM(title,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 研究视觉语言模型智能体强化学习,提出HyGAE框架,用统一评论家估计值,推导混合优势联合优化令牌和轮次级目标,在多轮决策环境评估中平均成功率91%,比其他方法显著提升10%,证明混合优势解析形式对优化关键。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23373 2026-07-28 cs.CV 新提交 83%

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

UltraViT:用于大型视觉语言模型的延迟优化设备端视觉编码器

Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati, Anestis Zaganidis, Yassine Ouali, Hyeonuk Kim, Georgios Tzimiropoulos

机构 * Samsung AI Cambridge(三星人工智能剑桥实验室) Technical University of Iasi(雅西技术大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 针对大型视觉语言模型在设备端部署受限问题,提出UltraViT视觉编码器,通过考虑设备延迟设计金字塔架构,并采用两阶段生成式预训练策略,有效提升编码效率,优于现有基线。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23488 2026-07-28 cs.LG cs.CV 新提交 82%

Learning Sampling Parameters for Diffusion Models

学习扩散模型的采样参数

Arisrei Lim, Yossi Gandelsman

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV、cs.LG

AI总结 研究针对扩散模型推理时采样参数固定的问题,提出LeSAMP框架,将参数选择转化为强化学习问题,通过人类偏好模型和VLM评判优化,实验表明该方法相比基线有更高胜率,为改进扩散模型输出提供补充途径。

Comments Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23052 2026-07-28 cs.CV cs.CL cs.LG 新提交 82%

Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models

相似性并非逻辑:双编码器视觉语言模型的因式推理

Sultan Alshehri, Zhantao Yang, Han Zhang, Marios Savvides

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG;VLM(comments)

AI总结 研究双编码器视觉语言模型组合约束失效问题,提出因式推理,将证据提取与约束执行分离,引入LCSE方法,在FACTOR-Bench上实验,提升了准确率并保持检索性能。

Comments Accepted at ICML 2026. 18 pages, 8 figures. Project page: https://sultanmo.github.io/factored-vlm Code and benchmark: https://github.com/SultanMo/factored-vlm

详情

展开后加载摘要…

URL PDF HTML 收藏