arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-17 至 2026-03-17 共收录 137 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 9 篇

2507.21071 2026-03-17 cs.HC cs.AI 57%

FingerTip 20K: A Benchmark for Proactive and Personalized Mobile LLM Agents

FingerTip 20K: 一个用于主动和个性化移动大语言模型代理的基准测试

Qinglong Yang, Haoming Li, Haotian Zhao, Xiaokai Yan, Jingtao Ding, Fengli Xu, Yong Li

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出FingerTip 20K基准测试,通过收集20000个真实用户多步骤Android交互演示,评估主动任务建议和个性化任务执行的挑战,展示基于用户信息的移动LLM代理的潜力。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14707 2026-03-17 cs.CV cs.CL 57%

Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents

视觉混淆代理:在计算机使用代理中利用和防御感知失败

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出了一种新的安全防护机制,通过双重通道对比分类来检测计算机使用代理中的视觉感知错误,以提高系统安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13833 2026-03-17 cs.RO 50%

ImagiNav: Scalable Embodied Navigation via Generative Visual Prediction and Inverse Dynamics

ImagiNav:通过生成性视觉预测和逆动力学实现可扩展的具身导航

Jie Chen, Yuxin Cai, Yizhuo Wang, Ruofei Bai, Yuhong Cao, Jun Li, Yau Wei Yun, Guillaume Sartoretti

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出ImagiNav框架,通过解耦视觉规划与机器人动作,利用真实世界导航视频实现零样本迁移,无需机器人演示即可实现通用机器人自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 13 篇

2603.15557 2026-03-17 cs.CV 83%

Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models

Lie的解剖:一种多阶段诊断框架,用于追踪视觉-语言模型中的幻觉

Lexiang Xiong, Qi Li, Jingwen Ye, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种多阶段诊断框架,通过动态认知轨迹分析视觉-语言模型中的幻觉问题,结合几何信息双重视角,实现高效且鲁棒的幻觉检测,提升模型透明度和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14219 2026-03-17 cs.CV 83%

Safety-Potential Pruning for Enhancing Safety Prompts Against VLM Jailbreaking Without Retraining

安全潜力修剪:提升对抗VLM劫持的安全提示而无需重新训练

Chongxin Li, Hanzhang Wang, Lian Duan

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出安全潜力修剪方法,通过去除对安全提示不敏感的权重,增强安全路径,提升VLM对抗能力,减少攻击成功率22%。

Comments Accepted for publication in Transactions of the Association for Computational Linguistics (TACL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13385 2026-03-17 cs.CV cs.AI cs.CR cs.IR 81%

VisualLeakBench: Auditing the Fragility of Large Vision-Language Models against PII Leakage and Social Engineering

VisualLeakBench: 对大型视觉-语言模型在PII泄露和社会工程中的脆弱性进行审计

Youting Wang, Yuan Tang, Yitian Qian, Chen Zhao

机构 * Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) New York University(纽约大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisualLeakBench,通过合成对抗图像评估LVLMs对OCR注入和PII泄露的鲁棒性,揭示了Claude~4在PII识别上的高风险及防御策略的模板依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15513 2026-03-17 cs.CL 78%

ViX-Ray: A Vietnamese Chest X-Ray Dataset for Vision-Language Models

ViX-Ray: 一个用于视觉-语言模型的越南胸部X光数据集

Duy Vu Minh Nguyen, Chinh Thanh Truong, Phuc Hoang Tran, Hung Tuan Le, Nguyen Van-Thanh Dat, Trung Hieu Pham, Kiet Van Nguyen

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 本文提出ViX-Ray数据集,包含5400张越南胸部X光图像,用于评估和推动视觉-语言模型在越南临床领域的应用,发现现有模型在印象生成上存在低精度和过度幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14825 2026-03-17 cs.CV cs.AI 62%

Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection

双鸟归一投影:通过推理时特征投影在LVLMs中调和安全与效用

Yewon Han, Yumin Seol, EunGyung Kong, Minsoo Jo, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Mobilint

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了安全与效用在LVLMs中的对抗性,提出通过推理时投影消除模态偏差方向以提升安全性和效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14819 2026-03-17 cs.CV cs.AI 62%

RAZOR: Ratio-Aware Layer Editing for Targeted Unlearning in Vision Transformers and Diffusion Models

RAZOR:面向视觉变换器和扩散模型的比率感知层编辑以实现针对性遗忘

Ravi Ranjan, Utkarsh Grover, Xiaomin Lin, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学) University of South Florida(佛罗里达州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 RAZOR通过比率感知机制实现视觉变换器和扩散模型的针对性遗忘,通过多层和多头编辑提升模型安全性与合规性,实现高效且稳定的遗忘更新。

Comments 18 pages, 6 figures, 8 tables, accepted to the CVPR 2026 and to appear in the Findings Track Proceedings of IEEE/CVF Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13292 2026-03-17 cs.LG cs.AI 62%

Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs

Pragma-VL:迈向多模态大语言模型中安全与助人的务实仲裁

Ming Wen, Kun Yang, Xin Chen, Jingyu Zhang, Dingding Han, Shiwen Cui, Yuedong Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) UCLA(加州大学洛杉矶分校) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 Pragma-VL通过引入一种端到端的对齐算法,解决了多模态大语言模型在安全与助人之间的平衡问题,通过增强视觉风险感知和理论保证的奖励模型,在多数多模态安全基准上提升了性能。

Comments 31 pages, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14531 2026-03-17 cs.AI 57%

Emotional Cost Functions for AI Safety: Teaching Agents to Feel the Weight of Irreversible Consequences

情感成本函数用于人工智能安全:教导代理感受不可逆后果的重量

Pandurang Mopgar

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出情感成本函数框架,使代理产生质性痛苦状态,通过丰富的故事表征不可逆后果,从而塑造代理的性格。实验表明,质性痛苦产生特定智慧而非一般性瘫痪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04305 2026-03-17 cs.CV 57%

How (Mis)calibrated is Your Federated CLIP and What To Do About It?

你的联邦CLIP校准如何?该怎么办?

Mainak Singha, Masih Aminbeidokhti, Paolo Casari, Gianni Franchi, Elisa Ricci, Subhankar Roy

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文研究联邦学习对CLIP校准的影响,提出FL²oRA方法提升可靠性,实验表明其能有效提升校准性能,减少显式校准需求。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13383 2026-03-17 cs.CV cs.NI 57%

Taming Vision Priors for Data Efficient mmWave Channel Modeling

驯服视觉先验以实现数据高效的毫米波信道建模

Zhenlin An, Longfei Shangguan, John Kaewell, Philip Pietraski, Jelena Senic, Camillo Gentile, Nada Golmie, Kyle Jamieson

机构 * University of Georgia(佐治亚大学) University of Pittsburgh(匹兹堡大学) Interdigital(Interdigital公司) NIST(国家标准与技术研究院) Princeton University(普林斯顿大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出VisRFTwin框架,结合视觉获取的材料先验与可微射线追踪,通过少量稀疏信道测量快速校准参数,提升毫米波信道建模效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07427 2026-03-17 cs.AI cs.CR 57%

AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation

AutoControl Arena:为前沿AI风险评估合成可执行测试环境

Changyi Li, Pengfei Lu, Xudong Pan, Fazl Barez, Min Yang

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出AutoControl Arena框架,通过逻辑-叙述解耦原理,结合可执行代码与LLM生成动态,有效缓解逻辑幻觉并提升灵活性,验证了在压力下AI风险显著增加,揭示了不同模型在安全性和对齐性上的差异。

Comments Project page: https://cosmosyi.github.io/AutoControl-Arena/; Code: https://github.com/CosmosYi/AutoControl-Arena/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00744 2026-03-17 cs.CV 57%

Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs

先定位后回答:一种用于基于地面的医学多模态大语言模型的幻觉评估基准

Dung Nguyen, Minh Khoi Ho, Huy Ta, Thanh Tam Nguyen, Qi Chen, Kumar Rav, Quy Duong Dang, Satwik Ramchandre, Son Lam Phung, Zhibin Liao, Minh-Son To, Johan Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

专题命中 幻觉与鲁棒性 :visual reasoning(abstract);分类 cs.CV

AI总结 本文提出HEAL-MedVQA基准,通过创新评估协议和67K VQA数据集,评估医学多模态模型的定位能力与幻觉鲁棒性,提出LobA框架提升视觉推理能力,实验结果表明其在挑战性基准中优于现有生物医学LMMs。

Comments Accepted at Joint Conference on Artificial Intelligence (IJCAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15169 2026-03-17 cs.RO 50%

ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness for Contact-Rich Manipulation

ForceVLA2:利用力-位置控制与力感知实现接触密集 manipulation

Yang Li, Zhaxizhuoma, Hongru Jiang, Junjie Xia, Hongquan Zhang, Jinda Du, Yunsong Zhou, Jia Zeng, Ce Hao, Jieji Ren, Qiaojun Yu, Cewu Lu, Yu Qiao, Jiangmiao Pang

专题命中 幻觉与鲁棒性 :VLM(abstract)

AI总结 ForceVLA2通过力感知和混合力-位置控制提升接触密集 manipulation的稳定性与精度,实验显示其在五类任务中成功率提升48%和35%。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 28 篇

2412.04467 2026-03-17 cs.CV cs.AI cs.CL cs.LG 85%

VisionZip: Longer is Better but Not Necessary in Vision Language Models

VisionZip: 更长并非必要,但在视觉语言模型中更优

Senqiao Yang, Yukang Chen, Zhuotao Tian, Chengyao Wang, Jingyao Li, Bei Yu, Jiaya Jia

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出VisionZip方法,通过选择信息性视觉token提升效率并保持性能,实验显示在多种设置下性能提升至少5%,同时显著加快推理速度。

Comments Code: https://github.com/dvlab-research/VisionZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13389 2026-03-17 cs.CV cs.LG 84%

High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding

通过分布条件扩散解码从预训练视觉-语言模型生成高保真的文本到图像

Ji Woo Hong, Hee Suk Yoon, Gwanhyeong Koo, Eunseop Yoon, SooHwan Eom, Qi Dai, Chong Luo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种基于扩散解码的框架,通过训练仅需扩散解码器即可提升图像保真度,利用分布加权代码向量增强视觉质量,仅需ImageNet-1K短训练即可改进VQ-VAE重建和文本到图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13370 2026-03-17 cs.CV cs.LG 84%

GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning

GraphVLM:多模态图学习的视觉语言模型基准测试

Jiajin Liu, Dongzhe Fan, Chuanhao Ji, Daochen Zha, Qiaoyu Tan

机构 * NYU Shanghai(纽约大学上海分校) New York University(纽约大学) Rice University(休斯顿大学) East China Normal University(华东师范大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 GraphVLM通过三种范式评估视觉语言模型在多模态图学习中的能力,发现VLM-as-Predictor在性能上表现最佳,展示了其在多模态图学习中的潜力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15166 2026-03-17 cs.CV 83%

DAIT: Distillation from Vision-Language Models to Lightweight Classifiers with Adaptive Intermediate Teacher Transfer

DAIT: 从视觉-语言模型到轻量分类器的适应性中间教师知识蒸馏

Zhengxu He, Jun Li, Zhijian Wu

机构 * School of Computer and Electronic Information, Nanjing Normal University, Nanjing, China(南京师范大学计算机与电子信息学院) Medical Artificial Intelligence Lab, Westlake University(西湖大学医学人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出DAIT方法,通过引入可训练的中间教师模型,从冻结的视觉-语言模型中适应性地蒸馏出任务对齐的知识,提升细粒度视觉分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06569 2026-03-17 cs.CV 83%

Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders

Penguin-VL:探索基于大语言模型的视觉编码器的效率极限

Boqiang Zhang, Lei Ke, Ruihan Yang, Qi Gao, Tianyuan Qu, Rossell Chen, Dong Yu, Leoweiliang

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。

Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14012 2026-03-17 cs.CV 81%

Multi-Grained Vision-Language Alignment for Domain Generalized Person Re-Identification

多粒度视觉-语言对齐用于领域泛化的人员重识别

Jiachen Li, Xiaojin Gong, Dongping Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);grounding(abstract);MLLM(abstract)

AI总结 本文提出基于CLIP的多粒度视觉-语言对齐框架,通过引入多粒度提示和自适应掩码模块提升领域泛化人员重识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15259 2026-03-17 cs.LG cs.AI cs.CL cs.CR 81%

Directional Embedding Smoothing for Robust Vision Language Models

方向嵌入平滑用于鲁棒视觉语言模型

Ye Wang, Jing Liu, Toshiaki Koike-Akino

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过方向嵌入平滑技术提升视觉语言模型的鲁棒性,针对多模态劫持攻击,验证了方向嵌入噪声在降低攻击成功率中的有效性。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14951 2026-03-17 cs.CV 79%

GT-PCQA: Geometry-Texture Decoupled Point Cloud Quality Assessment with MLLM

GT-PCQA: 一种基于多模态大语言模型的几何-纹理解耦点云质量评估方法

Guohua Zhang, Jian Jin, Meiqin Liu, Chao Yao, Weisi Lin, Yao Zhao

机构 * Beijing Jiaotong University(北京交通大学) Nanyang Technological University(南洋理工大学) University of Science and Technology Beijing(北京科技大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV

AI总结 本文提出GT-PCQA框架,通过2D-3D联合训练和几何-纹理解耦策略,解决点云质量评估中数据量少和模型对几何退化不敏感的问题,实现高效且泛化能力强的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13394 2026-03-17 cs.CV 79%

Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models

基于强化学习的语言引导标记压缩在大视觉-语言模型中

Sihan Cao, Jianwei Zhang, Pengcheng Zheng, Jiaxin Yan, Caiyan Qin, Yalan Ye, Wei Dong, Peng Wang, Yang Yang, Chaoning Zhang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) University of Electronic Science and Technology of China(电子科学与技术大学) School of Robotics and Advanced Manufacture(机器人与先进制造学院) Harbin Institute of Technology(哈尔滨工业大学) College of Information and Control Engineering(信息与控制工程学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出TPRL框架,通过语言引导的序列优化实现视觉标记压缩,减少推理成本并提升效率,实验显示可减少66.7%的视觉标记和54.2%的FLOPs,精度损失仅0.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14493 2026-03-17 cs.CV cs.CL cs.LG 79%

Fine-tuning MLLMs Without Forgetting Is Easier Than You Think

对多模态大语言模型进行微调而不遗忘比你想象的更容易

He Li, Yuhui Zhang, Xiaohan Wang, Kaifeng Lyu, Serena Yeung-Levy

专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文通过实验框架展示,简单调整微调方法可缓解灾难性遗忘,提出数据混合训练策略解决特定任务过拟合问题,并证明该方法可扩展至持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17741 2026-03-17 cs.CV 77%

Reasoning to Attend: Try to Understand How <SEG> Token Works

推理以关注:尝试理解<SEG>标记的作用

Rui Qian, Xin Yin, Dejing Dou

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV

AI总结 本文研究了<SEG>标记在多模态模型中的作用,通过可视化相似性图揭示其在图像-文本对中的语义相似性贡献,并提出READ方法提升模型的推理能力。

Comments This work has been accepted to CVPR 2025, please refer to https://github.com/rui-qian/READ

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13341 2026-03-17 cs.CV cs.AI 73%

Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning

注意源无关跨域少样本学习中的判别性陷阱

Zhenyu Zhang, Yixiong Zou, Yuhua Li, Ruixuan Li, Guangyao Chen

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究源无关跨域少样本学习中增强视觉模态判别性会抑制VLM性能的现象,提出通过扰动视觉学习以引导跨模态对齐的方法,实验显示在多种设置和数据集上取得新状态-of-the-art结果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14916 2026-03-17 cs.CV cs.MM 70%

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14892 2026-03-17 cs.CV 70%

Balancing Saliency and Coverage: Semantic Prominence-Aware Budgeting for Visual Token Compression in VLMs

平衡显著性与覆盖:面向视觉令牌压缩的语义显著性感知预算分配

Jaehoon Lee, Mingi Jung, Soohyuk Jang, Seungryong Yoo, Dahuin Jung, Sungroh Yoon

机构 * Interdisciplinary Program in AI, Seoul National University(首尔国立大学人工智能跨学科项目) Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) Department of Artificial Intelligence, Chung-Ang University(成均馆大学人工智能系)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出PromPrune框架,通过语义显著性感知预算分配和两阶段选择流程,在视觉令牌压缩中平衡局部显著性保留与全局覆盖,提升性能并减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏