arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-13 至 2026-03-13 共收录 50 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 4 篇

2601.16667 2026-03-13 cs.RO cs.CV 57%

ReViP: Mitigating False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance

ReViP: 通过视觉-本体感知再平衡缓解视觉语言动作模型中的虚假完成

Zhuohao Li, Yinghao Li, Jian-Jian Jiang, Lang Zhou, Tianyu Zhang, Jiadong Yin, Mu Lin, Yi-Lin Wei, Wei-Shi Zheng

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 ReViP通过引入视觉-本体感知再平衡机制,缓解视觉语言动作模型中的虚假完成问题,提升模型在扰动下的鲁棒性和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12263 2026-03-13 cs.RO 50%

$Ψ_0$: An Open Foundation Model Towards Universal Humanoid Loco-Manipulation

$Ψ_0$:一种面向通用人形机器人运动- manipulation 的开放基础模型

Songlin Wei, Hongyi Jing, Boqian Li, Zhenyu Zhao, Jiageng Mao, Zhenhao Ni, Sicheng He, Jie Liu, Xiawei Liu, Kaidi Kang, Sheng Zang, Weiduo Yuan, Marco Pavone, Di Huang, Yue Wang

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 本文提出$Ψ_0$模型,通过分阶段训练和异构数据利用,实现高效的人形机器人运动- manipulation 任务,仅用800小时视频和30小时机器人数据即超越基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 4 篇

2603.10577 2026-03-13 cs.AI cs.HC 79%

CUAAudit: Meta-Evaluation of Vision-Language Models as Auditors of Autonomous Computer-Use Agents

CUAAudit: 视觉语言模型作为自主计算机使用代理的元评估

Marta Sumyk, Oleksandr Kosovan

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型作为自主计算机使用代理审计员的元评估,发现尽管先进模型在准确性方面表现良好,但在复杂环境中性能下降,突显了现实部署中需考虑评估者可靠性与不确定性的重要性。

Comments This work has been accepted to appear at the HEAL @ CHI 2026 Worshop on Human-centered Evaluation and Auditing of Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10061 2026-03-13 cs.RO 78%

Decision-Aware Uncertainty Evaluation of Vision-Language Model-Based Early Action Anticipation for Human-Robot Interaction

基于视觉语言模型的早期动作预测在人机交互中的决策感知不确定性评估

Zhaoda Du, Michael Bowman, Qiaojie Zheng, Xiaoli Zhang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 本文提出了一种系统评估基于视觉语言模型的短期动作识别在人机交互中的不确定性方法,通过引入时间前缀评估协议和校准度量标准,揭示了部分观测下的误校准模式和失败模式,为信心门控的人机交互模块提供了可靠性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11542 2026-03-13 cs.CV cs.AI 62%

ReHARK: Refined Hybrid Adaptive RBF Kernels for Robust One-Shot Vision-Language Adaptation

ReHARK:基于重构混合自适应RBF核的鲁棒单样本视觉-语言适应

Md Jahidul Islam

机构 * Buet.ac.bd(巴特西大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 ReHARK通过重构混合自适应RBF核框架,利用全局近端正则化提升单样本视觉-语言适应的稳定性与准确性,实现65.83%的平均准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12089 2026-03-13 cs.CR 50%

EmbTracker: Traceable Black-box Watermarking for Federated Language Models

EmbTracker: 用于联邦语言模型的可追溯黑盒水印

Haodong Zhao, Jinming Hu, Yijie Bai, Tian Dong, Wei Du, Zhuosheng Zhang, Yanjiao Chen, Haojin Zhu, Gongshen Liu

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 EmbTracker是一种用于联邦语言模型的可追溯黑盒水印框架,通过嵌入后门水印实现模型泄露的可追溯性,同时具备高鲁棒性和低性能影响。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 12 篇

2510.13108 2026-03-13 cs.CV cs.AI cs.RO 84%

DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models

DriveCritic: 向基于情境的、与人类对齐的自动驾驶评估迈进:基于视觉-语言模型

Jingyu Song, Zhenxin Li, Shiyi Lan, Xinglong Sun, Nadine Chang, Maying Shen, Joshua Chen, Katherine A. Skinner, Jose M. Alvarez

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达) Fudan University(复旦大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 DriveCritic通过结合视觉-语言模型和情境意识,提升自动驾驶系统评估的准确性与人类对齐性。

Comments Accepted at ICRA 2026; 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11219 2026-03-13 cs.CV 83%

Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision Making and Planning

Senna-2:对齐视觉语言模型与端到端驾驶策略以实现一致的决策与规划

Yuehao Song, Shaoyu Chen, Hao Gao, Yifan Zhu, Weixiang Yue, Jialv Zou, Bo Jiang, Zihao Lu, Yu Wang, Qian Zhang, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 Senna-2通过三阶段训练范式对齐视觉语言模型与端到端驾驶策略,提升决策与规划的一致性,增强驾驶安全性和效率。

Comments 15 pages, 8 figures. Project page: https://ambitious-idiot.github.io/senna2-project

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02421 2026-03-13 cs.CV 83%

Generalizing Vision-Language Models with Dedicated Prompt Guidance

通过专用提示引导泛化视觉语言模型

Xinyao Li, Yinjie Min, Hongbo Chen, Zhekai Du, Fengling Li, Jingjing Li

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出GuiDG框架,通过提示微调和跨模态注意力模块提升视觉语言模型的领域泛化能力,并在ImageNet-DG上验证了其有效性。

Comments Accepted to AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03964 2026-03-13 cs.CV cs.AI 81%

BLOCK: An Open-Source Bi-Stage MLLM Character-to-Skin Pipeline for Minecraft

BLOCK:一个开源的双阶段MLLM字符到皮肤生成Minecraft pipeline

Hengquan Guo

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV、cs.AI

AI总结 BLOCK通过双阶段流程生成Minecraft皮肤,结合MLLM和FLUX.2模型,提出EvolveLoRA提升生成稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05391 2026-03-13 cs.CV 79%

LoC-Path: Learning to Compress for Pathology Multimodal Large Language Models

LoC-Path:学习压缩用于病理多模态大语言模型

Qingqiao Hu, Weimin Lyu, Meilong Xu, Kehan Qi, Xiaoling Hu, Saumya Gupta, Jiawei Zhou, Chao Chen

专题命中 VLM训练与架构 :multimodal large language model(title);MLLM(abstract);分类 cs.CV

AI总结 LoC-Path通过压缩滑片图像特征,降低多模态模型的训练和推理成本,使在有限资源下实现高效病理大语言模型成为可能。

Comments Code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11421 2026-03-13 cs.CV 70%

ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation

ShotVerse: 提升文本驱动多镜头视频创作的电影级摄像机控制

Songlin Yang, Zhe Wang, Xuyi Yang, Songchun Zhang, Xianghao Kong, Taiyi Wu, Xiaotong Zhao, Ran Zhang, Alan Zhao, Anyi Rao

机构 * Tencent Video AI Center, PCG, Tencent(腾讯视频AI中心)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 ShotVerse通过'计划然后控制'框架,结合视觉语言模型和摄像机适配器,实现多镜头视频创作中精准的摄像机控制与高保真电影效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03400 2026-03-13 cs.RO 67%

GUIDES: Guidance Using Instructor-Distilled Embeddings for Pre-trained Robot Policy Enhancement

GUIDES: 利用教师蒸馏嵌入进行预训练机器人策略增强

Minquan Gao, Xinyi Li, Qing Yan, Xiaojian Sun, Xiaopan Zhang, Chien-Ming Huang, Jiachen Li

机构 * University of California, Riverside(加州大学河滨分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 GUIDES通过教师蒸馏嵌入提升预训练机器人策略,实现语义增强与高效升级

Comments IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12108 2026-03-13 cs.CV 57%

EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation

EvoTok:通过残差潜在进化实现统一的图像分词器用于视觉理解和生成

Yan Li, Ning Liao, Xiangyu Zhao, Shaofeng Zhang, Xiaoxing Wang, Yifan Yang, Junchi Yan, Xue Yang

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Corporation(微软公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 EvoTok通过残差潜在进化统一图像理解和生成,实现高效视觉表征建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11617 2026-03-13 cs.CV 57%

Noise-aware few-shot learning through bi-directional multi-view prompt alignment

通过双向多视图提示对齐实现噪声感知的少样本学习

Lu Niu, Cheng Xue

机构 * Southeast University(东南大学) AIIA, Ministry of Education, China(教育部人工智能研究院,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 NA-MVP通过双向多视图提示对齐实现噪声感知少样本学习,有效区分干净与噪声线索,提升模型在噪声环境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11220 2026-03-13 cs.CV cs.CL 57%

Frequency-Modulated Visual Restoration for Matryoshka Large Multimodal Models

频率调制的视觉修复用于Matryoshka大多模态模型

Qingtao Pan, Zhihao Dou, Shuo Li

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 本文提出FMVR策略,通过频率调制修复视觉语义,提升LMMs在减少视觉token时的推理能力,并在多个基准测试中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13723 2026-03-13 cs.CV 57%

SOTA: Self-adaptive Optimal Transport for Zero-Shot Classification with Multiple Foundation Models

SOTA: 自适应最优传输用于多基础模型的零样本分类

Zhanxuan Hu, Qiyu Xu, Yu Duan, Yonghang Tai, Huafeng Li

机构 * Yunnan Normal University(云南师范大学) Xidian University(西安电子科技大学) Xi’an University of Posts and Telecommunications(西安邮电大学) Kunming University of Science and Technology(昆明理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 SOTA通过自适应最优传输方法整合多基础模型,提升零样本分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11397 2026-03-13 cs.SD 50%

Edge-Cloud Collaborative Speech Emotion Captioning via Token-Level Speculative Decoding in Audio-Language Models

边缘-云协同语音情绪描述 via 令牌级推测解码在音频-语言模型中

Xiangyuan Xue, Jiajun Lu, Yan Gao, Gongping Huang, Ting Dang, Hong Jia

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出基于不确定性引导推测解码的边缘-云协同框架,通过轻量级边缘模型和云验证器的协同,提升语音情绪描述的准确率和效率,同时降低延迟和隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 2 篇

2503.23830 2026-03-13 cs.DC cs.AI 83%

OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training

OrchMLLM: 通过批量后平衡 orchestrate 多模态数据以加速多模态大语言模型训练

Yijie Zheng, Bangjun Xiao, Lei Shi, Xiaoyang Li, Faming Wu, Tianyu Li, Xuefeng Xiao, Yang Zhang, Yuxuan Wang, Shouda Liu

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 OrchMLLM通过批量后平衡调度器和全局协调器解决多模态数据训练中的模态不一致问题,提升训练效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12126 2026-03-13 cs.CV cs.LG 62%

Hoi3DGen: Generating High-Quality Human-Object-Interactions in 3D

Hoi3DGen:生成高质量的人-物交互的3D模型

Agniv Sharma, Xianghui Xie, Tom Fischer, Eddy Ilg, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院) Technische Universität Nürnberg(纽伦堡技术大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 Hoi3DGen通过多模态大语言模型生成高质量3D人-物交互模型,显著提升交互保真度和3D生成质量,实现文本到3D的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏