arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-04 至 2026-05-04 共收录 34 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2506.22982 2026-05-04 cs.CV 87%

Revisiting CroPA: A Reproducibility Study and Enhancements for Cross-Prompt Adversarial Transferability in Vision-Language Models

重新审视CroPA:面向视觉-语言模型跨提示对抗转移性的可重复性研究与改进

Atharv Mittal, Agam Pandey, Amritanshu Tiwari, Sukrit Jindal, Swadesh Swain

机构 * Mehta Family School of Data Science and Artificial Intelligence(梅hta家族数据科学与人工智能学院) Indian Institute of Technology, Roorkee(印度理工学院罗奥克学院) Department of Civil Engineering(土木工程系) Department of Electronics and Communication(电子与通信系)

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 本文重新审视CroPA,验证其跨提示转移性,并提出改进方法,包括新的初始化策略、跨图像迁移性研究及针对视觉编码器的损失函数,提升对抗有效性。

Comments Accepted to MLRC 2025

Journal ref Transactions on Machine Learning Research (TMLR), 2025. Available at OpenReview: https://openreview.net/forum?id=5L90cl0xtf

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21199 2026-05-04 cs.LG cs.CV 82%

ARFBench: Benchmarking Time Series Question Answering Ability for Software Incident Response

ARFBench: 用于软件事件响应的时间序列问题回答能力基准测试

Stephan Xie, Ben Cohen, Mononito Goswami, Junhong Shen, Emaad Khwaja, Chenghao Liu, David Asker, Othmane Abou-Amal, Ameet Talwalkar

机构 * Machine Learning Department, Carnegie Mellon University(卡内基梅隆大学机器学习系) Datadog AI Research(Datadog AI研究) Amazon Web Services(亚马逊网络服务)

专题命中 视觉问答 :VLM(summary_cn,abstract);分类 cs.CV、cs.LG

AI总结 本文提出ARFBench基准测试,评估多模态基础模型对软件事件数据中时间序列异常的理解能力,发现前沿VLM表现优异,提出混合模型并建立模型-专家 oracle,达到超人类水平。

Comments Updated author affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22285 2026-05-04 cs.CV 57%

VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding

VideoDetective:通过外在查询和内在相关性进行长视频理解的线索搜索

Ruoliu Yang, Chu Wu, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出VideoDetective框架,通过结合查询与片段的相关性及片段间亲和力,有效定位长视频问答中的关键片段,提升多模态大语言模型在长视频理解中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 6 篇

2506.11991 2026-05-04 cs.CV cs.AI cs.CL 87%

VGR: Visual Grounded Reasoning

VGR:视觉基础推理

Jiacong Wang, Zijian Kang, Haochen Wang, Haiyong Jiang, Jiawen Li, Bohong Wu, Ya Wang, Jiao Ran, Xiao Liang, Chao Feng, Jun Xiao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ByteDance Inc.(字节跳动公司)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);LLaVA(abstract);visual reasoning(abstract);grounding(abstract)

AI总结 本文提出VGR,一种增强视觉感知的多模态大语言模型,通过图像区域检测与回放提升多模态推理能力,在多个基准测试中表现优异。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07630 2026-05-04 cs.CL cs.AI cs.CV 81%

InterChart: Benchmarking Visual Reasoning Across Decomposed and Distributed Chart Information

InterChart:跨分解与分布式图表信息的基准测试

Anirudh Iyengar Kaniyar Narayana Iyengar, Srija Mukhopadhyay, Adnan Qidwai, Shubhankar Singh, Dan Roth, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) IIIT, Hyderabad(海得拉巴印度理工学院) Mercer Mettl University(梅森-梅特尔大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 InterChart通过评估视觉语言模型在多图表间推理的能力,揭示了模型在复杂图表集成中的局限性,推动多模态推理的发展。

Comments 22 pages, 8 figures, 14 tables. Accepted at IJCNLP-AACL 2025

Journal ref Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics 2025, 2046-2067

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00072 2026-05-04 cs.CV cs.AI cs.LG 67%

Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards

通过间接奖励解锁零样本地理推理

Chenhui Xu, Fuxun Yu, Michael J. Bianco, Jacob Kovarskiy, Raphael Tang, Qi Zhang, Zirui Xu, Will LeVine, Brandon Dubbs, Heming Liao, Cassandra Burgess, Suvam Bag, Jay Patravali, Rupanjali Kukal, Mikael Figueroa, Rishi Madhok, Nikolaos Karianakis, Jinjun Xiong

机构 * University at Buffalo(布法罗大学) Microsoft(微软)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Geo-R1方法,利用间接可验证奖励提升地理推理能力,在多个下游任务中实现卓越的零样本迁移性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20823 2026-05-04 cs.LG cs.AI cs.CV 67%

CaTS-Bench: Can Language Models Describe Time Series?

CaTS-Bench:语言模型能否描述时间序列?

Luca Zhou, Pratham Yashwante, Marshall Fisher, Alessio Sampieri, Zihao Zhou, Fabio Galasso, Rose Yu

机构 * Sapienza University of Rome(罗马大学) UC San Diego(圣地亚哥大学) ItalAI Labs(意大利AI实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出CaTS-Bench,一个涵盖11个领域的时间序列推理基准,通过1746个人工重写描述进行评估,揭示语言模型在时间序列描述中的不足,并提出合成数据生成方法以提升性能。

Comments 9 pages, 6 figures, 4 tables in the main paper. Many more in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00438 2026-05-04 cs.AI cs.RO 57%

Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation

文本与图像思考:用于长周期机器人操作的交错视觉-语言推理轨迹

Jinkun Liu, Haohan Chi, Lingfeng Zhang, Yifan Xie, YuAn Wang, Long Chen, Hangjun Ye, Xiaoshuai Hao, Wenbo Ding

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Xiaomi Group(小米集团)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出IVLR框架,通过显式轨迹表示交替文本子目标与视觉关键帧,提升长周期机器人操作的逻辑与几何一致性,实验显示在LIBERO和SimplerEnv-WidowX上取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05950 2026-05-04 cs.AI 57%

Training-Free Time Series Classification via In-Context Reasoning with LLM Agents

无需训练的时间序列分类通过LLM代理的上下文推理

Songyuan Sui, Zihang Xu, Xia Hu

机构 * Rice University(Rice大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出FETA框架,利用上下文推理实现无需训练的时间序列分类,通过多代理结构提升效率和可解释性,在多个数据集上取得优异性能。

Comments 8 pages main content, 12 pages total including appendix, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 6 篇

2605.00684 2026-05-04 cs.CV 79%

Static and Dynamic Graph Alignment Network for Temporal Video Grounding

静态与动态图对齐网络用于时序视频定位

Zhanjie Hu, Bolin Zhang, Jianhua Wang, Jianbo Zheng, Chenchen Yan, Takahiro Komamizu, Ichiro Ide, Jiangbo Qian

机构 * Faculty of Electronic Engineering and Computer Science, Ningbo University(宁波大学电子工程与计算机科学学院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) College of Computing and Engineering, Hunan Normal University(湖南师范大学计算机与工程学院) Faculty of Computing, Georg-August-Universität Göttingen(哥廷根大学计算机学院) Center for Artificial Intelligence, Mathematical and Data Science, Nagoya University(名古屋大学人工智能、数学与数据科学中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出SDGAN,通过联合静态和动态视觉特征构建互补的时序图,引入查询-片段对比学习和自适应图建模,结合多粒度时间提案和渐进易难训练策略,提升时序视频定位的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00060 2026-05-04 cs.AI cs.SY eess.SY 70%

TADI: Tool-Augmented Drilling Intelligence via Agentic LLM Orchestration over Heterogeneous Wellsite Data

TADI:通过异构钻井现场数据的代理LLM编排实现工具增强的钻井智能

Rong Lu

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 TADI通过代理LLM编排整合钻井数据,实现证据驱动的分析智能,展示了领域专用工具设计对分析质量的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13305 2026-05-04 cs.CV cs.AI 62%

WildfireVLM: AI-powered Analysis for Early Wildfire Detection and Risk Assessment Using Satellite Imagery

WildfireVLM:基于卫星影像的AI分析用于早期野火检测与风险评估

Aydin Ayanzadeh, Prakhar Dixit, Sadia Kamal, Milton Halem

机构 * Department of Computer Science and Electrical Engineering(计算机科学与电气工程系) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 WildfireVLM结合卫星影像检测与语言驱动的风险评估,利用YOLOv12检测火区与烟雾,并通过多模态大语言模型生成风险评估和应急响应建议,验证其有效性并实现实时处理与长期追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00631 2026-05-04 cs.CL cs.IR 50%

H-RAG at SemEval-2026 Task 8: Hierarchical Parent-Child Retrieval for Multi-Turn RAG Conversations

H-RAG在SemEval-2026任务8中的应用:多轮RAG对话中的层次父-子检索

Passant Elchafei, Hossam Emam, Mohamed Alansary, Monorama Swain, Markus Schedl

机构 * Johannes Kepler University Linz(约翰尼斯·开普勒大学林茨) Linz Institute of Technology(林茨技术学院) Artificial Intelligence Lab(人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 H-RAG通过层次化父-子检索方法提升多轮RAG对话性能,结合密集-稀疏搜索与上下文重构,实现检索与生成的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00353 2026-05-04 cs.IR 50%

Negative Data Mining for Contrastive Learning in Dense Retrieval at IKEA.com

密集检索中对比学习的负样本挖掘

Eva Agapaki, Amritpal Singh Gill

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于结构化负样本策略和LLM评估方法提升IKEA产品检索,通过生成语义挑战性负样本和训练数据生成,提升检索性能,但发现在线用户参与度无显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21723 2026-05-04 cs.RO 50%

VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation

VLBiMan: 视觉-语言锚定的一次示例演示使通用化双臂机器人操作成为可能

Huayi Zhou, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 VLBiMan通过任务感知分解从单个示例中提取可重用技能,实现双臂机器人操作的通用化,减少演示需求并增强跨平台适应性。

Comments accepted by ICLR 2026. The project link is https://hnuzhy.github.io/projects/VLBiMan/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 4 篇

2602.14276 2026-05-04 cs.CV 85%

ScreenParse: Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision

ScreenParse:超越稀疏标注的完整屏幕解析监督

A. Said Gurbuz, Sunghwan Hong, Ahmed Nassar, Marc Pollefeys, Peter Staar

机构 * IBM Research Zurich, Zurich, Switzerland(IBM苏黎世研究实验室,瑞士苏黎世) ETH Zurich, Computer Vision(苏黎世联邦理工学院,计算机视觉) ETH AI Center, Switzerland(苏黎世联邦理工学院人工智能中心,瑞士) ETH Zurich, Photogrammetry(苏黎世联邦理工学院,摄影测量学) Microsoft, Switzerland(微软公司,瑞士)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 ScreenParse通过大规模完整屏幕解析标注,训练出性能优异的ScreenVLM模型,显著提升了密集解析能力和迁移表现。

Comments Accepted at ICML 2026. 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07669 2026-05-04 cs.LG cs.AI cs.CE 62%

Reinforcement Learning with LLM-Guided Action Spaces for Synthesizable Lead Optimization

基于LLM引导的动作空间的强化学习用于可合成先导优化

Tao Li, Kaiyuan Hou, Tuan Vinh, Monika Raj, Zhichun Guo, Carl Yang

机构 * Emory University(埃默里大学) University of Oxford(牛津大学) Independent Researcher(独立研究者)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MolReAct框架,通过合成约束的动作空间和GRPO算法优化先导分子,提升性质同时保证合成可行性,实现高效分子生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00551 2026-05-04 cs.CL cs.AI 57%

A11y-Compressor: A Framework for Enhancing the Efficiency of GUI Agent Observations through Visual Context Reconstruction and Redundancy Reduction

A11y-Compressor:通过视觉上下文重建和冗余减少提升GUI代理观察效率的框架

Michito Takeshita, Takuro Kawada, Takumi Ohashi, Shunsuke Kitada, Hitoshi Iyatomi

机构 * Hosei University(Hosei大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 本文提出A11y-Compressor框架,通过视觉上下文重建和冗余减少技术,将线性化可访问性树转换为紧凑结构化表示,实验表明其在OSWorld基准测试中将输入token减少至原22%,任务成功率提升5.1个百分点。

Comments 18 pages, 5 figures, 5 tables. Accepted to ACL SRW 2026. Project page: https://iyatomilab.github.io/a11y-compressor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14093 2026-05-04 cs.RO cs.CL cs.CV 57%

A Survey on Vision-Language-Action Models for Embodied AI

具身人工智能中视觉-语言-动作模型的综述

Yueen Ma, Zixing Song, Yuzheng Zhuang, Jianye Hao, Irwin King

机构 * Chinese University of Hong Kong(香港中文大学) University of Bristol(布里斯托大学) Huawei Noah’s Ark Laboratory(华为诺亚实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文综述了具身人工智能中视觉-语言-动作模型的发展,探讨了其在机器人任务中的应用,分类了三种主要研究方向,并讨论了面临的挑战与未来方向。

Comments Project page: https://github.com/yueen-ma/Awesome-VLA

Journal ref IEEE Transactions on Neural Networks and Learning Systems (Early Access), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 5 篇

2605.00323 2026-05-04 cs.CV cs.LG 81%

Online Self-Calibration Against Hallucination in Vision-Language Models

在线对抗幻觉的视觉-语言模型自我校准

Minghui Chen, Chenxu Yang, Hengjie Zhu, Dayan Wu, Zheng Lin, Qingyi Si

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出OSCAR框架,通过蒙特卡洛树搜索和双粒度奖励机制在线校准视觉-语言模型,减少幻觉并提升多模态能力。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00326 2026-05-04 cs.CL cs.CV 77%

Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification

零样本二元视觉语言安全分类中的提示诱导分数方差

Charles Weng, Dingwen Li, Alexander Martin

机构 * Johns Hopkins University(约翰霍普金斯大学) Independent(独立)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究发现零样本视觉语言模型安全分类器的单提示首词概率在语义等价提示改写下不可靠,提出训练自由的均值集成方法提升模型性能,推荐提示家族评估与均值聚合作为标准无标签可靠性基准。

Comments Preprint. 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00474 2026-05-04 cs.CV 57%

From Local to Global to Mechanistic: An iERF-Centered Unified Framework for Interpreting Vision Models

从局部到全局到机制:一种以iERF为中心的统一框架,用于解释视觉模型

Yearim Kim, Sangyu Han, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 本文提出一种以iERF为中心的统一框架,通过点特征向量和实例特定的有效感受野,统一了局部、全局和机制可解释性,提高了解释的准确性和鲁棒性。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2026

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27209 2026-05-04 cs.SE cs.AI 57%

Theory Under Construction: Orchestrating Language Models for Research Software Where the Specification Evolves

构建中的理论:协调语言模型用于研究软件,其中规范在演变

Halley Young, Nikolaj Björner

机构 * Microsoft Research(微软研究院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出Comet-H框架,通过迭代提示自动机协调语言模型在研究软件中的应用,解决规范演变中的 hallucination accumulation 和 desynchronization 问题,并通过实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27345 2026-05-04 cs.CL 50%

LLMs Capture Emotion Labels, Not Emotion Uncertainty: Distributional Analysis and Calibration of Human-LLM Judgment Gaps

大型语言模型捕捉情绪标签而非情绪不确定性:人类与LLM判断差距的分布分析与校准

Keito Inoshita, Xiaokang Zhou, Akira Kawai, Katsutoshi Yada

机构 * Faculty of Business and Commerce(商科学院) Faculty of Business Data Science(商务数据科学学院) RIKEN Center for Advanced Intelligence Project(先进智能项目研究所) Faculty of Data Science(数据科学学院) Japan Safety Society Research Center(日本安全协会研究中心)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文通过对比人类标注与LLM在GoEmotions和EmoBank基准上的情绪判断分布,发现零样本模型与人类分布差异显著,需领域微调而非模型规模扩大以缩小差距,并提出三种轻量校准方法以提升情绪标注的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 9 篇

2605.00480 2026-05-04 cs.CV 89%

Leveraging Vision-Language Models as Weak Annotators in Active Learning

利用视觉语言模型作为弱标注器在主动学习中的应用

Phuong Ngoc Nguyen, Kaito Shiku, Ryoma Bise, Seiichi Uchida, Shinnosuke Matsuo

机构 * Kyushu University(九州大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出结合细粒度人工标注与粗粒度VLM生成弱标注的主动学习框架,通过实例级标注分配和系统噪声建模,在CUB200和FGVC-Aircraft数据集上优于现有方法。

Comments Accepted at ICIP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00583 2026-05-04 cs.CV cs.AI cs.LG 87%

Jailbreaking Vision-Language Models Through the Visual Modality

通过视觉模态 jailbreak 视觉-语言模型

Aharon Azulay, Jan Dubiński, Zhuoyun Li, Atharv Mittal, Yossi Gandelsman

机构 * Warsaw University of Technology(华沙理工大学) NASK National Research Institute(波兰国家研究研究院) University of Liverpool(利物浦大学) Indian Institute of Technology Roorkee(印度理工学院拉胡尔分校) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出四种利用视觉组件的 jailbreak 攻击,揭示了文本安全训练无法自动推广到视觉传达的有害意图,展示了视觉模态在安全对齐中的关键作用。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18064 2026-05-04 cs.CV 84%

Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement

适配大型视觉语言模型以生成低光照增强

Xiaoran Sun, Liyan Wang, Yeying Jin, Kin-man Lam, Zhixun Su, Yang Yang, Jinshan Pan, Cong Wang

机构 * Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学) University of California, San Francisco(加州大学旧金山分校) Nanjing University of Science and Technology(南京理工大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出VLM-IMI框架,通过迭代和手动指令适配大型视觉语言模型,用于生成低光照增强。该框架包含正常光照指令先验生成和指令感知光照增强扩散两个分支,通过融合模块整合跨模态先验,提升生成效果。

Comments 11 papers,8 figures, CVPR2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00347 2026-05-04 cs.LG cs.AI cs.CL 79%

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02327 2026-05-04 cs.CV 70%

PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance

PPLLaVA:通过提示引导的视频序列理解

Shangkun Sun, Ruyang Liu, Haoran Tang, Yixiao Ge, Haibo Lu, Wei Gao, Jiankun Yang, Chen Li

机构 * Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学) XPeng Inc.(小鹏汽车有限公司) Ministry of Industry and Information Technology of the People’s Republic of China, China Electronics Standardization Institute, Beijing, China(中华人民共和国工业和信息化部,中国电子标准化研究院,北京,中国)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 PPLLaVA通过提示引导的池化策略实现视频序列高效理解,减少18倍token,提升推理效率并在多种视频理解任务中取得最佳性能。

Comments Accepted to ICLR' 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00371 2026-05-04 cs.SD cs.AI 70%

GaMMA: Towards Joint Global-Temporal Music Understanding in Large Multimodal Models

GaMMA:迈向大规模多模态模型中的联合全局-时间音乐理解

Zuyao You, Zhesong Yu, Mingyu Liu, Bilei Zhu, Yuan Wan, Zuxuan Wu

机构 * Fudan University(复旦大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.AI

AI总结 GaMMA通过融合音频编码器和跨模态学习,实现音乐内容的全面理解,并在MusicBench基准测试中取得新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏