arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-11 至 2026-03-11 共收录 60 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 13 篇

2603.09497 2026-03-11 cs.SE 50%

EmbC-Test: How to Speed Up Embedded Software Testing Using LLMs and RAG

EmbC-Test: 如何利用LLMs和RAG加速嵌入式软件测试

Maximilian Harnot, Sebastian Komarnicki, Michal Polok, Timo Oksanen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出利用LLMs和RAG技术,通过生成自动测试用例,显著提高嵌入式软件测试效率,节省66%的测试时间并每小时生成270个测试用例。

Journal ref Technical University of Munich. 2026. ISBN 978-3-911430-12-8. https://mediatum.ub.tum.de/1846559

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与屏幕智能体 11 篇

2603.06656 2026-03-11 cs.CV cs.AI 81%

GameVerse: Can Vision-Language Models Learn from Video-based Reflection?

GameVerse: 视觉-语言模型能否通过视频反思学习?

Kuan Zhang, Dongchen Liu, Qiyue Zhao, Jinkun Hou, Xinran Zhang, Qinlei Xie, Miao Liu, Yiming Li

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 GameVerse通过反思-重试范式评估视觉-语言模型在视频反思中的学习能力,结合失败轨迹和专家教程提升模型性能。

Comments https://gameverse-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09961 2026-03-11 cs.RO cs.AI cs.CV 79%

BEACON: Language-Conditioned Navigation Affordance Prediction under Occlusion

BEACON: 语言条件下的遮挡区域导航可行性预测

Xinyu Gao, Gang Chen, Javier Alonso-Mora

机构 * Department of Cognitive Robotics (CoR), Delft University of Technology(认知机器人学系(CoR),代尔夫特理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 BEACON通过融合视觉语言模型与深度信息,提升遮挡区域导航可行性预测的准确性。

Comments 8 pages. Project page: https://xin-yu-gao.github.io/beacon

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17439 2026-03-11 cs.RO cs.AI cs.CV cs.LG 78%

From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors

从空间到动作:在空间先验基础上构建视觉-语言-动作模型

Zhengshen Zhang, Hao Li, Yalun Dai, Zhengbang Zhu, Lei Zhou, Chenchen Liu, Dong Wang, Francis E. H. Tay, Sijin Chen, Ziwei Liu, Yuxiao Liu, Xinghang Li, Pan Zhou

机构 * ByteDance Seed(字节跳动种子) NUS(新加坡国立大学) NTU(国立技术大学) THU(清华大学) SMU(南方大学)

专题命中 GUI与屏幕智能体 :grounding(title);分类 cs.CV、cs.AI、cs.LG

AI总结 FALCON通过引入丰富的3D空间标记,改进了视觉-语言-动作模型的空间表示、模态可转移性和对齐能力,在多个基准和现实任务中取得最佳性能。

Comments Accepted at ICLR 2026. Project page: https://falcon-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20503 2026-03-11 cs.RO cs.AI cs.CL cs.CV cs.LG 75%

Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review

基于基础模型的具身AI在移动服务机器人中的应用:系统综述

Matthew Lisondra, Beno Benhabib, Goldie Nejat

专题命中 GUI与屏幕智能体 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文系统综述了基础模型在移动服务机器人中的应用,探讨了其在具身AI中的整合、核心挑战及未来研究方向。

Comments v2: Expanded systematic review; resubmitted to Robotics

Journal ref Robotics 2026, 15(3), 55

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09079 2026-03-11 cs.CV cs.AI cs.RO 73%

GST-VLA: Structured Gaussian Spatial Tokens for 3D Depth-Aware Vision-Language-Action Models

GST-VLA: 结构化高斯空间标记用于3D深度感知视觉-语言-动作模型

Md Selim Sarowar, Omer Tariq, Sungho Kim

机构 * Yeungnam University(延世大学) Korea Advanced Institute of Science and Technology, KAIST(韩国科学技术院)

专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 GST-VLA通过结构化高斯空间标记和深度感知链式思维提升3D视觉-语言-动作模型的精度和性能。

Comments The results presented in this paper are preliminary. Please note that the experiments are currently ongoing, and the final data is subject to change upon the completion of the study. All ideas, results, methods, and any content herein are the sole property of the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09743 2026-03-11 cs.CV 70%

LAP: A Language-Aware Planning Model For Procedure Planning In Instructional Videos

LAP:一种语言感知的规划模型用于教学视频中的过程规划

Lei Shi, Victor Aregbede, Andreas Persson, Martin Längkvist, Amy Loutfi, Stephanie Lowry

机构 * Örebro University(奥雷布罗大学)

专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 LAP通过利用语言描述提升过程规划的准确性,实现教学视频中动作序列的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08173 2026-03-11 cs.RO cs.AI cs.CL cs.CV 62%

NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions

NavSpace: 导航代理如何遵循空间智能指令

Haolin Yang, Yuxing Long, Zhuoyuan Yu, Zihan Yang, Minghan Wang, Jiapeng Xu, Yihan Wang, Ziyan Yu, Wenzhe Cai, Lei Kang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 NavSpace基准测试通过评估导航代理的空间感知与推理能力,提出SNav模型在指令遵循任务中表现优异,为具身智能研究提供新基准。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13338 2026-03-11 cs.RO cs.CV cs.LG 62%

CuriousBot: Interactive Mobile Exploration via Actionable 3D Relational Object Graph

CuriousBot: 通过可操作的3D关系物体图进行交互式移动探索

Yixuan Wang, Leonor Fermoselle, Tarik Kelestemur, Jiuguang Wang, Yunzhu Li

机构 * School of Engineering and Applied Science, Columbia University(工程与应用科学学院,哥伦比亚大学) Robotics and AI Institute(机器人与人工智能研究所)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 CuriousBot通过可操作的3D关系物体图实现交互式移动探索,优于仅依赖视觉-语言模型的方法。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L). Project Page: https://curiousbot.theaiinstitute.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09482 2026-03-11 cs.RO 50%

StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving

StyleVLA: 驾驶风格感知的视觉语言动作模型用于自动驾驶

Yuan Gao, Dengyuan Hua, Mattia Piccinini, Finn Rasmus Schäfer, Korbinian Moller, Lin Li, Johannes Betz

专题命中 GUI与屏幕智能体 :vision language model(abstract)

AI总结 StyleVLA通过引入物理约束和混合损失,生成多样且物理合理的驾驶行为,优于现有专有和先进模型。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09163 2026-03-11 cs.RO 50%

SPAN-Nav: Generalized Spatial Awareness for Versatile Vision-Language Navigation

SPAN-Nav: 通用空间感知用于多功能视觉-语言导航

Jiahang Liu, Tianyu Xu, Jiawei Chen, Lu Yue, Jiazhao Zhang, Zhiyong Wang, Minghan Li, Qisheng Zhao, Anqi Li, Qi Su, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot BAAI(北京人工智能研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 SPAN-Nav通过端到端模型和空间感知机制,在复杂环境中实现高效的视觉-语言导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09031 2026-03-11 cs.RO 50%

ImpedanceDiffusion: Diffusion-Based Global Path Planning for UAV Swarm Navigation with Generative Impedance Control

阻抗扩散:基于扩散的全局路径规划用于无人机群导航的生成阻抗控制

Faryal Batool, Yasheerah Yaqoot, Muhammad Ahsan Mustafa, Roohan Ahmed Khan, Aleksey Fedoseev, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室,数字工程中心,斯克尔科夫科学与技术研究所)

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 ImpedanceDiffusion通过结合扩散模型和人工势场跟踪,实现无人机群在复杂环境中的可靠路径规划与自适应阻抗控制。

Comments This is paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与鲁棒性 8 篇

2603.08897 2026-03-11 cs.CV 83%

Comparative Analysis of Patch Attack on VLM-Based Autonomous Driving Architectures

基于VLM的自动驾驶架构中补丁攻击的比较分析

David Fernandez, Pedram MohajerAnsari, Amir Salarpour, Long Cheng, Abolfazl Razi, Mert D. Pesé

机构 * School of Computing, Clemson University(计算机学院,克莱姆森大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文比较了三种基于VLM的自动驾驶架构对物理对抗攻击的鲁棒性,发现所有架构均存在严重漏洞,揭示了不同架构在对抗威胁下的脆弱性。

Comments Accepted at the 2025 IEEE Intelligent Vehicles Symposium (IV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09706 2026-03-11 cs.AI 79%

OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences

OOD-MMSafe: 推进多模态大语言模型安全性从有害意图到隐藏后果

Ming Wen, Kun Yang, Jingyu Zhang, Yuxuan Liu, shiwen cui, Shouling Ji, Xingjun Ma

专题命中 幻觉与鲁棒性 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

AI总结 OOD-MMSafe通过CASPO框架提升多模态大语言模型对隐藏后果的识别能力,显著降低风险识别失败率。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25896 2026-03-11 cs.CV 79%

LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models

LLaVAShield: 保障视觉语言模型中的多模态多轮对话安全

Guolei Huang, Qinzhi Peng, Gan Xu, Yao Huang, Yuxuan Lu, Yongjun Shen

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Zhejiang University of Technology(浙江工业大学) Tsinghua University(清华大学) RealAI

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 LLaVAShield通过构建MMDS数据集和MMRT框架,有效提升多模态多轮对话的安全性,优于现有VLMs和内容审查工具,揭示了主流模型的安全漏洞。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09125 2026-03-11 cs.CV cs.AI 73%

QUSR: Quality-Aware and Uncertainty-Guided Image Super-Resolution Diffusion Model

QUSR: 一种基于质量感知和不确定性引导的图像超分辨率扩散模型

Junjie Yin, Jiaju Li, Hanfa Xing

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 QUSR通过引入质量感知先验和不确定性引导噪声生成模块,提升图像超分辨率在复杂场景下的真实感和细节还原能力。

Comments This paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18811 2026-03-11 cs.CV cs.AI 62%

Mitigating Long-Tail Bias in HOI Detection via Adaptive Diversity Cache

通过自适应多样性缓存缓解HOI检测中的长尾偏差

Yuqiu Jiang, Xiaozhen Qiao, Yifan Chen, Ye Zheng, Zhe Sun, Xuelong Li

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 幻觉与鲁棒性 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出自适应多样性缓存模块,通过无训练机制缓解HOI检测中的长尾偏差,提升稀有类别检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07071 2026-03-11 cs.CV 57%

VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding

VirtueBench: 在长视频理解中评估在不确定性下的可信度

Xueqing Yu, Bohan Li, Yan Li, Zhenheng Yang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 VirtueBench通过评估模型在不确定性下的可信度,揭示了长视频理解中模型拒绝行为的差异及可靠性问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05433 2026-03-11 cs.LG cs.NE 57%

Multimodal LLM-assisted Evolutionary Search for Programmatic Control Policies

多模态大语言模型辅助进化搜索用于程序化控制策略

Qinglong Hu, Xialiang Tong, Mingxuan Yuan, Fei Liu, Zhichao Lu, Qingfu Zhang

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.LG

AI总结 本研究提出多模态大语言模型辅助进化搜索方法,用于生成透明且可验证的程序化控制策略,通过结合视觉反馈与进化搜索提高策略发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08988 2026-03-11 cs.RO 50%

Characterization, Analytical Planning, and Hybrid Force Control for the Inspire RH56DFX Hand

Inspire RH56DFX手的表征、分析规划与混合力控

Xuan Tan, William Xie, Nikolaus Correll

机构 * Department of Computer Science, University of Colorado Boulder(计算机科学系,科罗拉多大学博尔德分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 本文通过硬件表征、MuJoCo模型和混合力控方法改进Inspire RH56DFX手,提升其在抓取任务中的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. VLM训练与架构 9 篇

2603.09877 2026-03-11 cs.CV 86%

InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing

InternVL-U: 使统一多模态模型在理解、推理、生成和编辑方面更加普及

Changyao Tian, Danni Yang, Guanzhou Chen, Erfei Cui, Zhaokai Wang, Yuchen Duan, Penghao Yin, Sitao Chen, Ganlin Yang, Mingxin Liu, Zirun Zhu, Ziqian Fan, Leyao Gu, Haomin Wang, Qi Wei, Jinhui Yin, Xue Yang, Zhihang Zhong, Qi Qin, Yi Xin, Bin Fu, Yihao Liu, Jiaye Ge, Qipeng Guo, Gen Luo, Hongsheng Li, Yu Qiao, Kai Chen, Hongjie Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Nanjing University(南京大学) Xiamen University(厦门大学) CUHK MMLab(香港中文大学MMLab)

专题命中 VLM训练与架构 :InternVL(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 InternVL-U通过轻量级统一多模态模型,在保持强大生成能力的同时,实现了在理解、推理、生成和编辑方面的高效平衡。

Comments technical report, 61 pages, https://github.com/OpenGVLab/InternVL-U

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08800 2026-03-11 cs.CV 83%

Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM

Granulon: 通过自适应多粒度语义唤醒像素级视觉编码器以实现MLLM

Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming Jin

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 Granulon通过自适应多粒度语义增强,提升多模态大语言模型的像素级视觉理解和多粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03477 2026-03-11 cs.CV cs.LG 81%

Fairness-Aware Fine-Tuning of Vision-Language Models for Medical Glaucoma Diagnosis

面向医疗青光眼诊断的公平性感知视觉语言模型微调

Zijian Gu, Yuxi Liu, Zhenhao Zhang, Song Wang

机构 * Department of Computer Science, University of Rochester, NY, USA(罗切斯特大学计算机科学系) Biostatistics and Health Data Science, School of Medicine, Indiana University, Indianapolis, IN, USA(印第安纳大学医学院生物统计学与健康数据科学系) Department of Computer Science, University of Central Florida, FL, USA(佛罗里达州立大学计算机科学系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出公平性感知的低秩适应方法,通过三种机制减少医疗影像诊断中的种族差异,实现高效公平的青光眼诊断。

Comments AMIA 2026 Amplify Informatics Conference (Poster), Denver, CO, May 18-21, 2026. 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21609 2026-03-11 cs.CV cs.LG 79%

VLCE: A Knowledge-Enhanced Framework for Image Description in Disaster Assessment

VLCE:一种用于灾害评估图像描述的知识增强框架

Md. Mahfuzur Rahman, Kishor Datta Gupta, Marufa Kamal, Fahad Rahman, Sunzida Siddique, Ahmed Rafi Hasan, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) BRAC University(布拉克大学) United International University(国际联合大学) Daffodil International University(花王国际大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 VLCE通过整合知识图谱提升灾害影像描述的准确性和领域相关性,其在RescueNet上优于QwenVL基线。

Comments 28 pages, 30 figures, 1 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15414 2026-03-11 eess.IV 78%

Entropy-and-Channel-Aware Adaptive-Rate Semantic Communication with MLLM-Aided Feature Compensation

熵与信道感知的自适应速率语义通信 with MLLM辅助特征补偿

Weixuan Chen, Qianqian Yang, Yuhao Chen, Chongwen Huang, Qian Wang, Zehui Xiong, Zhaoyang Zhang

专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract)

AI总结 本文提出一种基于熵与信道感知的自适应速率语义通信框架,利用MLLM辅助特征补偿提升通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20223 2026-03-11 cs.CV 77%

V-Attack: Targeting Disentangled Value Features for Controllable Adversarial Attacks on LVLMs

V-Attack:针对解耦价值特征的可控对抗攻击LVLMs

Sen Nie, Jie Zhang, Jianxin Yan, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);InternVL(abstract);分类 cs.CV

AI总结 V-Attack通过精准操控LVLMs中的价值特征,提升对抗攻击的成功率,揭示视觉语言理解的关键漏洞。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09627 2026-03-11 eess.AS 71%

Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models

Speech-Omni-Lite: 用于视觉-语言模型的便携式语音接口

Dehua Tao, Xuan Luo, Daxin Tan, Kai Chen, Lanqing Hong, Jing Li, Ruifeng Xu, Xiao Chen

专题命中 VLM训练与架构 :vision-language model(title)

AI总结 Speech-Omni-Lite通过轻量模块扩展视觉-语言模型,实现低成本语音理解和生成,同时保持原有性能,实验显示其在少量语音数据下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09312 2026-03-11 cs.CV 70%

IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator-Critic Framework

IntroSVG: 通过反思生成器-批评者框架从渲染反馈中学习以实现文本到SVG生成

Feiyu Wang, Jiayuan Yang, Zhiyuan Zhao, Da Zhang, Bingyu Li, Peng Liu, Junyu Gao

机构 * Fudan University(复旦大学) TeleAI Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.CV

AI总结 IntroSVG通过反思生成器-批评者框架,结合监督微调和直接偏好优化,实现文本到SVG生成的高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09160 2026-03-11 cs.CV cs.AI cs.LG 67%

RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning

RubiCap:基于评分标准的强化学习用于密集图像描述

Tzu-Heng Huang, Sirajul Salekin, Javier Movellan, Frederic Sala, Manjot Bilkhu

机构 * Apple(苹果公司) University of Wisconsin—Madison(威斯康星大学麦迪逊分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 RubiCap通过基于评分标准的强化学习方法,在密集图像描述任务中实现了更高的胜率和词效,优于监督蒸馏和传统RL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他VLM 1 篇

2411.16722 2026-03-11 cs.CV 79%

Active Prompt Learning with Vision-Language Model Priors

基于视觉-语言模型先验的主动提示学习

Hoyoung Kim, Seokhee Jin, Changhwan Sung, Jaechang Kim, Jungseul Ok

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于视觉-语言模型先验的主动提示学习框架,通过类引导聚类和自适应阈值筛选,提升主动学习效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏