arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-01 至 2026-04-01 共收录 70 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 17 篇

2603.28888 2026-04-01 cs.RO 67%

A Semantic Observer Layer for Autonomous Vehicles: Pre-Deployment Feasibility Study of VLMs for Low-Latency Anomaly Detection

面向自动驾驶的语义观察层:VLMs在低延迟异常检测中的预部署可行性研究

Kunal Runwal, Swaraj Gajare, Daniel Adejumo, Omkar Ankalkope, Siddhant Baroth, Aliasghar Arab

机构 * The City College of New York, Grove School of Engineering(纽约市立学院格罗夫工程学院) Department of Mechanical and Aerospace Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院机械与航空航天工程系) Department of Electrical and Computer Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院电气与计算机工程系)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 本文提出一种语义观察层,通过量化视觉-语言模型实现低延迟异常检测,验证了其在自动驾驶平台上的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29777 2026-04-01 cs.CV cs.AI 62%

From Skeletons to Semantics: Design and Deployment of a Hybrid Edge-Based Action Detection System for Public Safety

从骨架到语义:一种混合边缘基于的动作检测系统在公共安全中的设计与部署

Ganen Sethupathy, Lalit Dumka, Jan Schagen

机构 * Sopra Steria Germany(Sopra Steria德国) Sopra Steria India(Sopra Steria印度)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种混合边缘动作检测系统,结合骨架运动分析与视觉语言模型,以提升公共安全中的实时视频分析能力,通过系统级对比展示两种方法在边缘计算中的互补性与局限性。

Comments Preprint version of a manuscript currently under review at IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29847 2026-04-01 cs.GR cs.CV cs.HC 57%

CADReasoner: Iterative Program Editing for CAD Reverse Engineering

CADReasoner: 用于CAD逆向工程的迭代程序编辑

Soslan Kabisov, Vsevolod Kirichuk, Andrey Volkov, Gennadii Savrasov, Marina Barannikov, Anton Konushin, Andrey Kuznetsov, Dmitrii Zhemchuzhnikov

机构 * Lomonosov Moscow State University(莫斯科国立大学) Université Paris Dauphine(巴黎多芬大学) Innopolis University(因诺波利斯大学) FusionBrain Lab(FusionBrain实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 CADReasoner通过迭代优化几何差异,提升CAD逆向工程的精度与效率,实现多视角渲染与点云的融合,并在多个基准测试中取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29741 2026-04-01 cs.SI cs.AI cs.MA 57%

BotVerse: Real-Time Event-Driven Simulation of Social Agents

BotVerse: 基于事件驱动的实时社会代理高保真模拟

Edoardo Allegrini, Edoardo Di Paolo, Angelo Spognardi, Marinella Petrocchi

机构 * Computer Science Dept., Sapienza University of Rome(罗马大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 BotVerse通过LLM代理实现高保真社会模拟,提供安全实验环境用于红队测试和计算社会科学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29422 2026-04-01 cs.CV 57%

Multimodal Models Meet Presentation Attack Detection on ID Documents

多模态模型在身份证文档呈现攻击检测中的应用

Marina Villanueva, Juan M. Espin, Juan E. Tapia

机构 * Security Research Group Hochschule Darmstadt, Germany

专题命中 视觉定位与Grounding :LLaVA(abstract);分类 cs.CV

AI总结 本文探讨了将视觉和文本模态结合,利用预训练多模态模型提升身份证文档呈现攻击检测性能,但实验表明这些模型在该任务上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00524 2026-04-01 cs.CV 57%

Text-guided Fine-Grained Video Anomaly Understanding

基于文本引导的细粒度视频异常理解

Jihao Gu, Kun Li, He Wang, Kaan Akşit

机构 * University College London(伦敦大学学院) CVLab, College of Information Technology, United Arab Emirates University(阿联酋大学信息技术学院计算机视觉实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出T-VAU框架,通过多模态推理提取细粒度视频异常证据,结合Anomaly Heatmap Decoder和Region-aware Anomaly Encoder提升异常检测与解释能力。

Comments Accepted by CVPR 2026 SVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20155 2026-04-01 cs.CV 57%

PartNeXt: A Next-Generation Dataset for Fine-Grained and Hierarchical 3D Part Understanding

PartNeXt:面向细粒度和层次化3D部件理解的下一代数据集

Penghao Wang, Yiyang He, Xin Lv, Yukai Zhou, Lan Xu, Jingyi Yu, Jiayuan Gu

机构 * ShanghaiTech University(上海科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 PartNeXt通过23000个高质量纹理3D模型,解决传统数据集在可扩展性和实用性上的不足,提升细粒度部件分割和3D部件问答任务的性能。

Comments NeurIPS 2025 DB Track. Project page: https://authoritywang.github.io/partnext

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08005 2026-04-01 cs.SE cs.AI 57%

Past, Present, and Future of Bug Tracking in the Generative AI Era

过去、现在与未来:生成AI时代的缺陷跟踪

Utku Boran Torun, Mehmet Taha Demircan, Mahmut Furkan Gön, Eray Tüzün

机构 * Bilkent University, Department of Computer Engineering(比尔肯大学计算机工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文探讨生成AI时代缺陷跟踪的发展,提出基于大语言模型和智能代理的框架,旨在通过自然语言报告和AI自动化降低解决时间与协调成本。

Comments Accepted to ACM TOSEM Special Issue: 2030 Software Engineering Roadmap

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21223 2026-04-01 cs.CV cs.CL 57%

Sigma: Semantically Informative Pre-training for Skeleton-based Sign Language Understanding

Sigma:基于骨骼的语义信息预训练用于手语理解

Muxin Pu, Mei Kuan Lim, Chun Yong Chong, Chen Change Loy

机构 * School of Information Technology, Monash University(莫纳什大学信息技术学院) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 Sigma提出一种统一的骨骼手语理解框架,通过语义对齐学习和预训练策略提升手语识别与翻译性能,展现语义信息预训练在多语言手语任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09666 2026-04-01 cs.CV 57%

Unified Multimodal Models as Auto-Encoders

统一多模态模型作为自编码器

Zhiyuan Yan, Kaiqing Lin, Zongjian Li, Junyan Ye, Hui Han, Haochen Wang, Zhendong Wang, Bin Lin, Hao Li, Xinyan Xiao, Jingdong Wang, Haifeng Wang, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Baidu(百度) Rabbitpre AI(兔展智能) SYSU(中山大学) USTC(中国科学技术大学) CASIA(中国科学院自动化研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出统一GRPO方法,通过强化学习联合优化图像到文本和文本到图像任务,利用重建奖励提升语义一致性,增强多模态协同效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29856 2026-04-01 cs.HC cs.GR cs.RO 50%

An Interactive LLM-Based Simulator for Dementia-Related Activities of Daily Living

基于交互式大语言模型的痴呆相关日常活动模拟器

Kruthika Gangaraju, Shu-Fen Wung, Kevin Berner, Jing Wang, Fengpei Yuan

机构 * Worcester Polytechnic Institute(伍斯特理工学院) University of California Davis(加州大学戴维斯分校) MGH Institute of Health Professionals(麻省总医院健康专业学院) University of New Hampshire(新罕布什尔大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一个交互式模拟器,利用大语言模型生成痴呆患者在日常活动中的多轮行为,通过专家反馈优化策略,提升辅助AI和机器人在痴呆护理中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29820 2026-04-01 cs.SD 50%

SIREN: Spatially-Informed Reconstruction of Binaural Audio with Vision

SIREN:基于视觉的双耳音频重建

Mingyeong Song, Seoyeon Ko, Junhyug Noh

机构 * Ewha Womans University, Seoul, Korea(韩国首尔梨花女子大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SIREN通过视觉引导将单声道音频转换为双耳音频,利用双头自注意力机制生成场景图,并通过两阶段波形域融合抑制混响,提升时间频率和相位敏感度指标。

Comments 5 pages, 1 figure, to appear in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 1 篇

2603.01142 2026-04-01 cs.CV 57%

ArtLLM: Generating Articulated Assets via 3D LLM

ArtLLM: 通过3D语言模型生成拟合资产

Penghao Wang, Siyuan Xie, Hongyu Yan, Xianghui Yang, Jingwei Huang, Chunchao Guo, Jiayuan Gu

机构 * ShanghaiTech University(上海科技大学) Tencent Hunyuan(腾讯混元) HKUST(香港科技大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 ArtLLM通过3D语言模型直接从完整3D网格生成高质量拟合资产,解决了传统方法在关节拟合和部分检索中的局限,提升了部分布局和关节预测的准确性。

Comments CVPR 2026. Project page: https://authoritywang.github.io/artllm/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 7 篇

2512.05955 2026-04-01 cs.RO cs.CV 83%

SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models

SIMPACT:基于视觉-语言模型的仿真增强动作规划

Haowen Liu, Shaoxiong Yao, Haonan Chen, Jiawei Gao, Jiayuan Mao, Jia-Bin Huang, Yilun Du

机构 * UMD(马里兰大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学) Amazon FAR(亚马逊FAR) UPenn(宾夕法尼亚大学)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 SIMPACT通过仿真循环世界建模赋予视觉-语言模型物理推理能力,实现高效动作规划,优于现有通用机器人操作模型,在五个复杂真实世界任务中表现优异。

Comments Accepted to CVPR 2026; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29161 2026-04-01 cs.AI 83%

Webscraper: Leverage Multimodal Large Language Models for Index-Content Web Scraping

Webscraper:利用多模态大语言模型进行索引-内容网页抓取

Guan-Lun Huang, Yuh-Jzer Joung

机构 * Dept. of Information Management, National Taiwan University, Taipei, Taiwan(国立台湾大学资讯管理学系,台北,台湾)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出Webscraper框架,利用多模态大语言模型自动导航交互界面并提取结构化数据,通过五阶段提示和定制工具提升动态网站抓取准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08533 2026-04-01 cs.CV 70%

SecAgent: Efficient Mobile GUI Agent with Semantic Context

SecAgent:基于语义上下文的高效移动GUI代理

Yiping Xie, Song Chen, Jingxuan Xing, Wei Jiang, Zekun Zhu, Yingyao Wang, Pi Bu, Jun Song, Yuning Jiang, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘天集团)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 SecAgent通过构建中文移动GUI数据集和语义上下文机制,提升移动GUI代理的效率与性能,实现高效任务处理与多语言支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29692 2026-04-01 cs.CV 57%

SkeletonContext: Skeleton-side Context Prompt Learning for Zero-Shot Skeleton-based Action Recognition

SkeletonContext:基于骨架的零样本动作识别中的骨架侧上下文提示学习

Ning Wang, Tieyue Wu, Naeha Sharif, Farid Boussaid, Guangming Zhu, Lin Mei, Mohammed Bennamoun, zhang liang

机构 * Xidian University(西安电子科技大学) University of Western Australia(西澳大利亚大学) Donghai Lab(东海实验室)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出SkeletonContext框架,通过引入跨模态上下文提示模块和关键部位解耦模块,提升骨架动作识别中上下文信息的利用,实现零样本场景下的高精度动作区分。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22846 2026-04-01 cs.AI 57%

CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models

CoMaTrack: 基于竞争的多智能体博弈跟踪与视觉-语言-动作模型

Youzhi Liu, Li Gao, Liu Liu, Mingyang Lv, Yang Cai

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI

AI总结 本文提出CoMaTrack,一种基于竞争的多智能体强化学习框架,通过动态对抗环境训练,提升跟踪任务的适应性和鲁棒性,并引入首个开源的CoMaTrack-Bench基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29627 2026-04-01 cs.RO 50%

Semantic Zone-Based Map Management for Stable AI-Integrated Mobile Robots

基于语义区域的映射管理:用于稳定集成AI的移动机器人

Huichang Yun, Seungho Yoo

机构 * Dept. of computer Engineering, Pukyong National University(釜庆大学计算机工程系)

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 本文提出一种基于语义区域的映射管理方法,以在内存限制下稳定使用密集地图。通过将关键帧与语义室内区域关联,该方法减少了关键帧加载和卸载频率,提高了内存使用效率,并在实验中验证了其在内存压力下的稳定性和性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28901 2026-04-01 cs.RO 50%

See Something, Say Something: Context-Criticality-Aware Mobile Robot Communication for Hazard Mitigations

看见即应言:面向灾害缓解的上下文感知移动机器人通信

Bhavya Oza, Devam Shah, Ghanashyama Prabhu, Devika Kodi, Aliasghar Arab

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) The City College of New York, Grove School of Engineering(纽约市立学院格罗夫工程学院) ASAS LABS, Department of Mechanical and Aerospace Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院机械与航空航天工程系ASAS实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 本文提出一种上下文感知的移动机器人通信框架,通过感知驱动自适应消息生成,提升灾害响应速度和有效性,在60多次实验中验证了结构化关键性评估对响应速度和缓解效果的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 5 篇

2603.29410 2026-04-01 cs.CV cs.AI cs.LG 82%

AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models

AGFT:基于对齐的微调以提升视觉-语言模型的零样本对抗鲁棒性

Yubo Cui, Xianchao Guan, Zijun Xiong, Zheng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute, Shenzhen, China(深圳市环域研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出AGFT框架,通过概率预测进行文本引导对抗训练,提升视觉-语言模型的零样本对抗鲁棒性,同时保持跨模态语义结构。

Comments Accepted by CVPR 2026; Code is available at \url{https://github.com/YuboCui/AGFT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29405 2026-04-01 cs.CV cs.AI 81%

Hallucination-aware intermediate representation edit in large vision-language models

具有幻觉意识的中间表示编辑在大视觉-语言模型中

Wei Suo, Hanzu Zhang, Lijun Zhang, Ji Ma, Peng Wang, Yanning Zhang

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种动态检测和消除幻觉表示的框架,通过最小额外计算成本在现有基准上实现最先进的性能,展示了高效且稳健的幻觉消除能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26984 2026-04-01 cs.CV 79%

A Provable Energy-Guided Test-Time Defense Boosting Adversarial Robustness of Large Vision-Language Models

一种可证明的能量引导测试时间防御提升大视觉-语言模型的对抗鲁棒性

Mujtaba Hussain Mirza, Antonio D'Orazio, Odelia Melamed, Iacopo Masi

机构 * OmnAI Lab, Computer Science Department, Sapienza University of Rome, Italy(罗马大学计算机科学系OmnAI实验室,意大利) Weizmann Institute of Science, Israel(魏茨曼科学研究所,以色列)

专题命中 幻觉与鲁棒性 :vision-language model(title);visual question answering(abstract);分类 cs.CV

AI总结 本文提出ET3,一种轻量且无需训练的防御方法,通过最小化输入样本的能量提升模型鲁棒性,实验显示其在分类和提升大视觉-语言模型鲁棒性方面表现优异。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21482 2026-04-01 cs.CV 57%

ALADIN:Attribute-Language Distillation Network for Person Re-Identification

ALADIN:基于属性-语言的知识蒸馏网络用于人重识别

Wang Zhou, Boran Duan, Haojun Ai, Ruiqi Lan, Ziyue Zhou

机构 * Wuhan University(武汉大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 ALADIN通过属性-语言知识蒸馏网络,提升人重识别中细粒度属性特征的捕捉能力,增强鲁棒性与泛化性。

Comments 14pages, 3figures, 7charts

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29492 2026-04-01 cs.CL 50%

Calibrated Confidence Expression for Radiology Report Generation

放射报告生成中的校准置信度表达

David Bani-Harouni, Chantal Pellegrini, Julian Lüers, Su Hwan Kim, Markus Baalmann, Benedikt Wiestler, Rickmer Braren, Nassir Navab, Matthias Keicher

机构 * Computer Aided Medical Procedures, Technical University of Munich, Germany(德国慕尼黑工业大学计算机辅助医疗程序) Munich Center for Machine Learning (MCML), Germany(德国慕尼黑机器学习中心) Department of Diagnostic and Interventional Radiology, TUM Klinikum rechts der Isar, Germany(德国慕尼黑工业大学伊萨尔河右岸医院诊断与介入放射科) Department of Diagnostic and Interventional Neuroradiology, TUM Klinikum rechts der Isar, Germany(德国慕尼黑工业大学伊萨尔河右岸医院诊断与介入神经放射科) Department of Diagnostic and Interventional Radiology and Nuclear Medicine, University Medical Center Hamburg-Eppendorf, Germany(德国汉堡-埃彭多夫大学医学中心诊断与介入放射学及核医学科) AI for Image-Guided Diagnosis and Therapy, Technical University of Munich, Germany(德国慕尼黑工业大学人工智能图像引导诊断与治疗)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 本文提出ConRad框架,通过强化学习提升医学大视觉-语言模型的置信度校准,以生成更可靠的放射报告。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 12 篇

2511.08917 2026-04-01 cs.HC cs.CV 84%

"It's trained by non-disabled people": Evaluating How Image Quality Affects Product Captioning with Vision-Language Models

由非残障人士训练的模型:评估图像质量如何影响产品描述生成

Kapil Garg, Xinru Tang, Jimin Heo, Dwayne R. Morgan, Darren Gergle, Erik B. Sudderth, Anne Marie Piper

机构 * University of California, Irvine(加州大学尔湾分校) Northwestern University(西北大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV

AI总结 研究评估图像质量对视觉语言模型生成产品描述准确性的影响,发现图像质量下降会导致模型性能显著降低,提出改进模型可靠性的建议。

Comments Published at CHI 2026; Honorable Mention for Best Paper (Top 5%). Dataset available at: https://github.com/Accessibility-Research-Collective-UCI/image-quality-vlm-chi26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11919 2026-04-01 cs.CV 83%

TimeSenCLIP: A Time Series Vision-Language Model for Remote Sensing

TimeSenCLIP: 一种用于遥感的时序视觉-语言模型

Pallavi Jain, Diego Marcos, Dino Ienco, Roberto Interdonato, Tristan Berchoux

机构 * Mediterranean Agronomic Institute of Montpellier - CIHEAM-IAMM(地中海农艺研究所蒙彼利埃分校 - CIHEAM-IAMM) Inria(法国国家信息与自动化研究所) INRAE(法国国家农业、食品与环境研究院) Cirad(法国农业国际合作研究发展中心) UMR TETIS(TETIS 联合研究单位) Univ. of Montpellier(蒙彼利埃大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出TimeSenCLIP,一种轻量级遥感时序视觉-语言模型,通过跨视图时间对比框架对多光谱Sentinel-2时序与地理标记地面影像对齐,无需文本标注,强调时序和光谱信号,探索单像素时序信息在多种任务中的有效性。

Comments Accepted (ISPRS Journal of Photogrammetry and Remote Sensing)

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing Volume 236, June 2026, Pages 99-119

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29676 2026-04-01 cs.LG cs.CL cs.CV 81%

A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models

大型视觉-语言模型的全面信息分解分析

Lixin Xiu, Xufang Luo, Hideki Nakayama

机构 * The University of Tokyo(东京大学) Microsoft Research(微软研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文通过信息分解方法分析大型视觉-语言模型的信息谱,揭示任务模式和模型策略,为模型设计提供新视角。

Comments Accepted at ICLR 2026. Project page: https://riishin.github.io/pid-lvlm-iclr26/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08829 2026-04-01 cs.CV cs.AI 81%

InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models

InfiniteVL: 融合线性与稀疏注意力以实现高效率、无限输入的视觉-语言模型

Hongyuan Tao, Bencheng Liao, Shaoyu Chen, Haoran Yin, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Horizon Robotics(地平线机器人)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 InfiniteVL通过融合线性与稀疏注意力机制,实现高效率和无限输入的视觉-语言模型,提升解码速度和长上下文处理能力。

Comments 20 pages, 8 figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15713 2026-04-01 cs.CV 79%

DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models

DiffusionVL: 将任意自回归模型转化为扩散视觉语言模型

Lunbin Zeng, Jingfeng Yao, Bencheng Liao, Hongyuan Tao, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV

AI总结 本文提出DiffusionVL,通过高效扩散微调将预训练自回归模型转化为扩散视觉语言模型,实现高效生成和性能提升。

Comments 12 pages, 4 figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏