arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-30 至 2026-03-30 共收录 64 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 1 篇

2603.25804 2026-03-30 cs.CL 50%

RealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task Evaluation

RealChart2Code:通过真实数据和多任务评估推进图表到代码生成

Jiajun Zhang, Yuying Li, Zhixun Li, Xingyu Guo, Jingzhuo Wu, Leqi Zheng, Yiran Yang, Jianke Zhang, Qingbin Li, Shannan Yan, Zhetong Li, Changguo Jia, Junfei Wu, Zilei Wang, Qiang Liu, Liang Wang

机构 * USTC(中国科学技术大学) THU(清华大学) CUHK(香港中文大学) UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) BNU(北京师范大学) BUPT(北京邮电大学) BIT(北京理工大学) PKU(北京大学)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 本文提出RealChart2Code基准,通过真实数据和多任务评估,评估VLMs在复杂图表生成中的性能,揭示其在多面板图表上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与屏幕智能体 5 篇

2603.26211 2026-03-30 cs.CV cs.AI 84%

Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

迈向GUI代理:用于GUI定位的视觉-语言扩散模型

Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

机构 * Arizona State University(亚利桑那州立大学) AWS Agentic AI

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了离散扩散视觉-语言模型在GUI定位中的应用,通过混合掩码策略提升定位精度,并在多个数据集上验证了其有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26033 2026-03-30 cs.CV 77%

Knowledge is Power: Advancing Few-shot Action Recognition with Multimodal Semantics from MLLMs

知识即力量:利用大语言模型的多模态语义提升少样本动作识别

Jiazheng Xing, Chao Xu, Hangjie Yuan, Mengmeng Wang, Jun Dan, Hangwei Qian, Yong Liu

专题命中 GUI与屏幕智能体 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出FSAR-LLaVA,首次利用大语言模型作为多模态知识库直接增强少样本动作识别。通过多模态解码器提取时空丰富表示,结合多模态特征增强模块生成视觉和文本特征,并利用MLLM的灵活性设计复合任务导向原型构造,提升跨数据集性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26586 2026-03-30 cs.CV 57%

MA-Bench: Towards Fine-grained Micro-Action Understanding

MA-Bench:迈向细粒度微动作理解

Kun Li, Jihao Gu, Fei Wang, Zhiliang Wu, Hehe Fan, Dan Guo

机构 * CVLab, College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息技术学院CVLab) University College London(伦敦大学学院) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MA-Bench基准,包含1000个视频和三级评估架构,系统评估微动作识别与解释,通过23个MLLM的实验发现微动作细粒度理解存在挑战,并构建MA-Bench-Train训练集提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21723 2026-03-30 cs.RO cs.MA 50%

Can a Robot Walk the Robotic Dog: Triple-Zero Collaborative Navigation for Heterogeneous Multi-Agent Systems

机器人能否行走:异构多智能体系统的三零协同导航

Yaxuan Wang, Yifan Xiang, Ke Li, Xun Zhang, BoWen Ye, Zhuochen Fan, Fei Wei, Tong Yang

机构 * Yuanpei College, Peking University(北京大学元培学院) School of Computer Science, Peking University(北京大学计算机学院) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) Pengcheng Laboratory(鹏城实验室) Beijing Jinruyi Large Model Technology Co., Ltd.(北京金如意大模型科技有限公司)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)

AI总结 本文提出三零路径规划框架,通过协调者-探索者架构实现无需训练、无需先验知识和无需模拟的异构多机器人系统协作导航,实验显示其在复杂环境中具有鲁棒性和适应性。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22498 2026-03-30 cs.RO 50%

HELIOS: Hierarchical Exploration for Language-Grounded Interaction in Open Scenes

HELIOS:面向开放场景的语言引导交互的分层探索

Katrina Ashton, Chahyon Ku, Shrey Shah, Saumit Vedula, Tingrui Zhang, Wen Jiang, Kostas Daniilidis, Bernadette Bucher

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Michigan(密歇根大学)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 HELIOS通过分层场景表示和搜索目标,解决开放环境中语言指令与部分观测场景的语义关联及动态更新问题,实现高仿真实验和现实场景中的语言引导抓取放置任务。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与鲁棒性 6 篇

2502.00262 2026-03-30 cs.CV cs.AI 84%

INSIGHT: Enhancing Autonomous Driving Safety through Vision-Language Models on Context-Aware Hazard Detection and Edge Case Evaluation

洞察:通过基于视觉-语言模型的上下文感知危险检测与边缘案例评估提升自动驾驶安全性

Dianwei Chen, Zifan Zhang, Lei Cheng, Yuchen Liu, Xianfeng Terry Yang

机构 * University of Maryland(马里兰大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出INSIGHT框架,通过多模态数据融合提升自动驾驶中危险检测和边缘案例评估的准确性和泛化能力,实验表明在BDD100K数据集上显著提高了危险预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15613 2026-03-30 cs.CV cs.CL 77%

When to Think and When to Look: Uncertainty-Guided Lookback

何时思考,何时回顾:不确定性引导的回顾

Jing Bi, Filippos Bellos, Junjia Guo, Yayuan Li, Chao Huang, Yolo Y. Tang, Luchuan Song, Susan Liang, Zhongfei Mark Zhang, Jason J. Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan(密歇根大学) Binghamton University(宾汉姆顿大学)

专题命中 幻觉与鲁棒性 :vision language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 本文探讨了在大视觉语言模型中思考与回顾的平衡,提出不确定性引导的回顾策略,通过大规模对比实验提升MMMU性能,并在多个基准上取得新突破。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26486 2026-03-30 cs.CV 57%

ClipTTT: CLIP-Guided Test-Time Training Helps LVLMs See Better

ClipTTT: CLIP引导的测试时间训练帮助LVLMs看得更清楚

Mriganka Nath, Anurag Das, Jiahao Xie, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ClipTTT方法,通过CLIP模型的图像-文本对齐能力,在测试时引导LVLMs适应退化条件,减少幻觉并提升描述准确性。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25747 2026-03-30 cs.AI 57%

BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments

BeSafe-Bench:揭示功能环境中情境代理的行为安全风险

Yuxuan Li, Yi Lin, Peng Wang, Shiming Liu, Xuetao Wei

机构 * Southern University of Science and Technology(南方科技大学) Huawei RAMS Lab(华为RAMS实验室)

专题命中 幻觉与鲁棒性 :VLM(abstract);分类 cs.AI

AI总结 本文提出BeSafe-Bench,通过构建功能环境和引入九类安全关键风险,评估代理在Web、Mobile、Embodied VLM和Embodied VLA等领域的行为安全风险,发现最佳性能代理在安全约束下完成任务的比例不足40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25039 2026-03-30 quant-ph cs.LG 57%

Uncertainty Quantification for Quantum Computing

量子计算中的不确定性量化

Ryan Bennink, Olena Burkovska, Konstantin Pieper, Jorge Ramirez, Elaine Wong

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) Universidad Nacional de Colombia, Sede Medellin(哥伦比亚国立大学麦德林校区)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文通过不确定性量化方法,介绍量子计算中的噪声和随机性对计算结果的影响,探讨数学工具在误差传播和可靠性中的应用,以及其在可扩展算法和相关误差表征中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02569 2026-03-30 cs.HC cs.RO 50%

Reframing Human-Robot Interaction Through Extended Reality: Unlocking Safer, Smarter, and More Empathic Interactions with Virtual Robots and Foundation Models

通过扩展现实重新定义人机交互:利用虚拟机器人和基础模型实现更安全、更智能和更具同理心的交互

Yuchong Zhang, Yong Ma, Danica Kragic

机构 * Division of Robotics, Perception, and Learning, KTH Royal Institute of Technology(KTH皇家理工学院机器人、感知与学习部) Department of Clinical Medicine, University of Bergen(卑尔根大学临床医学系)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 本文探讨通过扩展现实技术,利用基础模型驱动的虚拟机器人实现更安全、智能和具同理心的人机交互,同时讨论多模态大模型在认知和情感交互中的应用及潜在风险。

Comments This paper is under review

Journal ref Empathic Computing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. VLM训练与架构 18 篇

2602.18846 2026-03-30 cs.CV cs.AI 87%

DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference

DUET-VLM:双阶段统一高效令牌减少用于VLM训练和推理

Aditya Kumar Singh, Hitesh Kandala, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc. (AMD)(超威半导体公司(AMD))

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 DUET-VLM通过双阶段令牌压缩框架,在保持语义的同时显著减少视觉令牌数量,实现高效训练和推理。

Comments 15 Pages, 8 figures, 15 tables, CVPR 2026; Code: AGI/DUET-VLM" target="_blank" rel="noopener">https://github.com/AMD-AGI/DUET-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21077 2026-03-30 cs.CV 85%

CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models

CoVFT:面向多模态大语言模型的上下文感知视觉微调

Nan Zhou, Huiqun Wang, Yaoyan Zheng, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出CoVFT框架,通过整合上下文向量提取和上下文混合专家模块,解决多模态任务中视觉微调的不稳定性问题,实现更稳定的视觉更新。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25403 2026-03-30 cs.CR cs.AI cs.LG 84%

Shape and Substance: Dual-Layer Side-Channel Attacks on Local Vision-Language Models

形状与物质:针对本地视觉-语言模型的双层侧信道攻击

Eyal Hadad, Mordechai Guri

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.AI、cs.LG

AI总结 本文针对本地视觉-语言模型的动态高分辨率预处理引入的算法侧信道,提出双层攻击框架,通过执行时间差异和缓存竞争分析,揭示隐私敏感内容的推理能力。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26589 2026-03-30 cs.CV 83%

The Limits of Learning from Pictures and Text: Vision-Language Models and Embodied Scene Understanding

图像与文本学习的极限:视觉语言模型与具身场景理解

Gillian Rosenberg, Skylar Stadhard, Bruce C. Hansen, Michelle R. Greene

机构 * Barnard College, Columbia University(哥伦比亚大学巴纳德学院) Colgate University(科尔盖特大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 研究探讨图像与文本学习在人类场景理解中的局限性,通过对比18个视觉语言模型与2000名人类观察者在15项任务中的表现,发现模型在具身认知任务中存在显著缺陷,表明分布学习不足以实现基于 affordance 的场景理解。

Comments 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19530 2026-03-30 cs.CV 83%

ORION: ORthonormal Text Encoding for Universal VLM AdaptatION

ORION:用于通用视觉语言模型适应的正交文本编码

Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed

机构 * ÉTS Montréal, Canada(蒙特利尔高等技术学院(加拿大))

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 ORION通过低秩适应优化正交损失,提升预训练VLM的文本嵌入质量,实验表明其在多个基准上显著提升性能。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26015 2026-03-30 cs.CV cs.AI 81%

VLAgeBench: Benchmarking Large Vision-Language Models for Zero-Shot Human Age Estimation

VLAgeBench: 大视觉-语言模型在零样本人类年龄估计中的基准测试

Rakib Hossain Sajib, Md Kishor Morol, Rajan Das Gupta, Mohammad Sakib Mahmood, Shuvra Smaran Das

机构 * Begum Rokeya University, Rangpur(贝古姆·罗基亚大学,朗布尔) American International University - Bangladesh(美国国际大学-孟加拉国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLAgeBench,评估大视觉-语言模型在零样本人类年龄估计中的性能,展示通用LVLM在无微调情况下表现优异,揭示图像质量和人口子群体差异对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25870 2026-03-30 cs.CV cs.LG 81%

Speech-Synchronized Whiteboard Generation via VLM-Driven Structured Drawing Representations

通过VLM驱动的结构化绘图表示实现语音同步的白板生成

Suraj Prasad, Pinak Mahapatra

机构 * Latent Spaces IITB(印度理工学院孟买分校潜在空间实验室)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出首个包含24对Excalidraw演示与叙述音频的白板数据集,研究基于Qwen2-VL-7B模型通过时间戳条件化实现语音同步的绘图预测,验证了模型在跨学科领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26498 2026-03-30 cs.DC cs.AI 79%

Rocks, Pebbles and Sand: Modality-aware Scheduling for Multimodal Large Language Model Inference

岩石、鹅卵石和沙子:面向多模态大语言模型推理的模态感知调度

Konstantinos Papaioannou, Thaleia Dimitra Doudali

机构 * IMDEA Software Institute(IMDEA软件研究所) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型推理中资源需求差异大导致的延迟和内存问题,提出RPS-Serve调度器,通过动态优先级和老化机制实现高效资源利用,降低TTFT并提升响应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26330 2026-03-30 cs.CV cs.AI 73%

Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation

通过输入自适应深度聚合缓解视觉语言微调中的推理税

Yiming Ren, Yujiu Yang, Junjie Wang

机构 * Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IADA机制,通过输入自适应的跨深度检索提升视觉语言模型的推理能力,实验表明其在参数效率方面优于LoRA微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18746 2026-03-30 cs.CV cs.AI 73%

Any4D: Open-Prompt 4D Generation from Natural Language and Images

Any4D: 从自然语言和图像生成开放提示的4D生成

Hao Li, Qiao Sun

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Primitive Embodied World Models,通过限制视频生成时间范围,实现语言与视觉表示的细粒度对齐,降低学习复杂度,提升数据效率,并减少推理延迟,支持复杂任务的组合泛化。

Comments The authors identified issues in the 4D generation pipeline and evaluation that affect result validity. To ensure scientific accuracy, we will revise the methodology and experiments thoroughly before resubmitting. This version should not be cited or relied upon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26008 2026-03-30 cs.CV cs.AI 73%

FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants

FairLLaVA: 大规模视觉-语言助手中的公平性感知参数高效微调

Mahesh Bhosale, Abdul Wasi, Shantam Srivastava, Shifa Latif, Tianyu Luan, Mingchen Gao, David Doermann, Xuan Gong

机构 * University at Buffalo(布法罗大学) University of Kashmir(克什米尔大学) Accenture(埃森哲) Harvard Medical School(哈佛医学院)

专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 FairLLaVA通过减少目标属性间的互信息,实现视觉指令微调中的公平性改进,提升医疗影像生成的公平性和自然语言生成质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22918 2026-03-30 cs.CV cs.AI cs.CL 73%

EVA: Efficient Reinforcement Learning for End-to-End Video Agent

EVA: 为端到端视频代理的高效强化学习

Yaolun Zhang, Ruohui Wang, Jiahao Wang, Yepeng Tang, Xuanyu Zheng, Haonan Duan, Hao Lu, Hanming Deng, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 EVA通过迭代总结-计划-行动-反思推理实现先规划后感知,提升长视频理解效率,采用三阶段学习流程和高质量数据集,在六个视频理解基准上取得显著提升。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26049 2026-03-30 cs.CV cs.AI 62%

Seeing Like Radiologists: Context- and Gaze-Guided Vision-Language Pretraining for Chest X-rays

像放射科医生一样观察:面向胸部X光片的上下文和目光引导的视觉-语言预训练

Kang Liu, Zhuoqi Ma, Siyu Liang, Yunan Li, Xiyue Gao, Chao Liang, Kun Xie, Qiguang Miao

机构 * Xidian University(西安电子科技大学) Wuhan University(武汉大学)

专题命中 VLM训练与架构 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CoGaze框架,通过整合临床上下文和放射科医生目光引导,提升胸部X光片的视觉-语言预训练效果,实验显示在多个任务上均优于现有方法。

Comments Code: https://github.com/mk-runner/CoGaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02650 2026-03-30 cs.CV cs.LG cs.MM cs.SD eess.AS 62%

Hear What Matters! Text-conditioned Selective Video-to-Audio Generation

听重点!基于文本的视频到音频生成

Junwon Lee, Juhan Nam, Jiyoung Lee

机构 * Graduate School of Cultural Technology, KAIST(韩国科学技术院文化技术研究生院) Division of AI and Software, Ewha Womans University(梨花女子大学人工智能与软件学部)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出基于文本的视频到音频生成任务,通过文本提示选择性提取视频中相关声音源,提升多对象视频音频处理精度。SELVA模型通过文本提示选择视频编码器中的视觉特征,结合补充标记和自监督学习提升音频质量与同步性。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25942 2026-03-30 cs.CV cs.AI 62%

Reinforcing Structured Chain-of-Thought for Video Understanding

强化结构链式思考以提升视频理解

Peiyao Wang, Haotian Xu, Noranart Vesdapunt, Rui Hou, Jingyi Zhang, Haibin Ling, Oleksandr Obiednikov, Ning Zhou, Kah Kuen Fu

机构 * Stony Brook University(石溪大学) Amazon(亚马逊)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SDRL框架,通过结构化链式思考格式和自监督机制,解决多模态大语言模型在视频理解中的推理漂移和时间感知问题,实现单阶段强化学习,提升模型泛化能力。

Comments Accepted to CVPR 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26365 2026-03-30 cs.CV 57%

Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning

通过强化学习实现高效的视频理解动态令牌压缩

Shida Wang, YongXiang Hua, Zhou Tao, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出SCORE框架,通过强化学习学习自适应令牌压缩策略,有效解决视频理解中的计算成本和上下文旋转问题,实现16倍的预填充加速且性能损失仅0.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26128 2026-03-30 cs.CV 57%

TaxaAdapter: Vision Taxonomy Models are Key to Fine-grained Image Generation over the Tree of Life

TaxaAdapter:视觉分类模型是生命树上细粒度图像生成的关键

Mridul Khurana, Amin Karimi Monsefi, Justin Lee, Medha Sawhney, David Carlyn, Julia Chae, Jianyang Gu, Rajiv Ramnath, Sara Beery, Wei-Lun Chao, Anuj Karpatne, Cheng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) The Ohio State University(俄亥俄州立大学) MIT(麻省理工学院) Boston University(波士顿大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出TaxaAdapter,通过整合视觉分类模型提升细粒度物种生成的精度与一致性,实验表明其在形态学和物种识别准确性上优于现有方法,且具备良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13239 2026-03-30 cs.CY cs.CV cs.IR 57%

CrisiSense-RAG: Crisis Sensing Multimodal Retrieval-Augmented Generation for Rapid Disaster Impact Assessment

CrisiSense-RAG:面向快速灾害影响评估的多模态检索增强生成系统

Yiming Xiao, Kai Yin, Ali Mostafavi

机构 * Zachry Department of Civil Environmental Engineering, Texas A\&M University Department of Computer Science Engineering, Texas A\&M University

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出CrisiSense-RAG系统,通过多模态检索增强生成技术,解决灾害影响评估中时空不对齐问题,实现零样本设置下的高精度灾害评估。

Comments 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏