arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-15 至 2026-07-15 共收录 46 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 6 篇

2607.00333 2026-07-15 cs.CR 版本更新 75%

(A)I Sees What You Don't: Exploiting New Attack Surfaces in Third-Party Mobile Agents

(AI)看见你看不见的:利用第三方移动代理中的新攻击面

Zidong Zhang, Zhentao Xie, Wenrui Diao, Jianliang Wu

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本文识别了第三方移动代理在屏幕感知和通道滥用方面的两种新攻击面,并设计了七种具体攻击,证明恶意应用可在无权限下劫持代理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12680 2026-07-15 cs.CV 新提交 70%

ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning

ReflectVLN:通过反思推理训练视觉语言导航智能体

Jiahang Wang, Yirong Yang, Yanqing Zhu, Minghua Luo, Shichao Xie, Fei Liu, Mu Xu

机构 * Amap, Alibaba Group(高德软件有限公司,阿里巴巴集团) Beihang University(北京航空航天大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对现有视觉语言导航方法缺乏闭环机制问题,提出ReflectVLN框架,通过双向交互智能体决策,引入行动思维链训练方案,实验证明该框架在有限数据下提升成功率和路径效率,且具良好训练成本与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08862 2026-07-15 cs.RO cs.LG 版本更新 57%

APPLV: Adaptive Planner Parameter Learning from Vision-Language-Action Model

APPLV: 从视觉-语言-动作模型中自适应学习规划器参数

Yuanjie Lu, Beichen Wang, Zhengqi Wu, Yang Li, Xiaomin Lin, Chengzhi Mao, Xuesu Xiao

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学) Department of Engineering Science, University of South Florida(工程科学系,佛罗里达州立大学) Department of Computer Science, Rutgers University(计算机科学系,罗格斯大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

AI总结 本文提出APPLV,通过从视觉-语言-动作模型中自适应学习规划器参数,提升移动机器人在受限环境中的导航性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12185 2026-07-15 cs.CL 新提交 50%

Entropy in Semantic Memory Navigation in Blind and Sighted Individuals: The Effect of Visual Experience

盲人与视力正常者语义记忆导航中的熵:视觉经验的影响

Felipe D. Toro-Hernández, Rodrigo Lagos, Sergio E. Chaigneau

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 研究通过属性列举任务及语义熵指标,对比盲人与视力正常者语义记忆导航差异,发现视力正常者抽象概念熵高于具体概念,盲人在视觉突出具体概念上熵更高,强调视觉经验对语义记忆组织和导航的作用。

Comments Cogsci paper 2026

Journal ref Proceedings of the Annual Meeting of the Cognitive Science Society, 48(0), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11638 2026-07-15 cs.RO 版本更新 50%

DA-Nav: Direction-Aware City-Scale Vision-Language Navigation

DA-Nav:方向感知的城市规模视觉语言导航

Ye Yuan, Kehan Chen, Xinqiang Yu, Wentao Xu, Heng Wang, Libo Huang, Chuanguang Yang, Yan Huang, Jiawei He, Zhulin An

机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) National Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) XYZ Embodied AI(XYZ具身人工智能)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 研究城市规模户外导航难题,提出DA-Nav框架,利用商业导航工具方向指示,经思维链推理实现轨迹恢复,引入ReDA数据集。实验表明其在未见环境成功率高,优于现有方法,还能适应多种机器人实现稳定户外导航。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 3 篇

2602.15892 2026-07-15 cs.CV cs.AI 版本更新 81%

Egocentric Bias in Vision-Language Models

视觉语言模型中的自我中心偏差

Maijunxian Wang, Yijiang Li, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao, Emmy Liu, Hokin Deng, Dezhi Luo

机构 * Cognitive Science Program, University of California, Berkeley(加州大学伯克利分校认知科学项目) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) School of Computer Science, Georgia Institute of Technology & Emory University(佐治亚理工学院计算机科学学院及埃默里大学) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Equal Advising Department of Computer Science & Wilmer Eye Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系及威尔默眼科研究所) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Weinberg Institute for Cognitive Science, University of Michigan(密歇根大学韦恩伯格认知科学研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出FlipSet基准,揭示视觉语言模型在第二级视觉视角推理中存在系统性自我中心偏差,表明模型在整合社会认知与空间操作方面存在根本性不足。

Comments Accepted at CogSci 2026 (Best Undergraduate Student Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13698 2026-07-15 cs.CV 版本更新 70%

Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment

注意力忽视视觉风险:多模态安全对齐的风险适应性转向

Jonghyun Park, Minhyuk Seo, Chaewon Yeo, Jonghyun Choi

机构 * Seoul National University(首尔大学) KU Leuven(鲁汶大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MoRAS,通过简洁的视觉上下文增强关键安全区域的视觉注意力,以实现多模态安全对齐,减少推理开销并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13033 2026-07-15 cs.RO 新提交 50%

DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation

DenseReward:通过失败合成进行密集奖励学习以实现机器人操作

Yu Fang, Wanxi Dong, Jiaqi Liu, Yue Yang, Mingxiao Huo, Yao Mu, Huaxiu Yao, Li Erran Li, Daniel Szafir, Mingyu Ding

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) Amazon AWS AI(亚马逊AWS人工智能)

专题命中 幻觉与鲁棒性 :VLM(abstract_cn)

AI总结 研究针对强化学习中缺乏可靠奖励模型的问题,提出DenseReward模型,通过自动生成失败数据合成逼真轨迹,从视觉和语言预测密集奖励分数,在模拟和现实操作中表现优异,还为下游任务提供指导并发布相关资源。

Comments Website: https://dense-reward.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 8 篇

2607.12894 2026-07-15 cs.CV 新提交 90%

Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

Hy-Embodied-VLM-1.0:高效的物理世界智能体

Ziyi Wang, Xumin Yu, Yongming Rao, Yonggen Ling, Yunheng Li, Oran Wang, Mingqi Gao, Yuchen Zhou, Yves Liang, Zuyan Liu, Yani Zhang, Rui Huang, Xiaoran Xu, Bowen Yuan, Yifu Yuan, Xu Tan, He Zhang, Yufei Huang, Shenghao Zhang, Hongsheng Wu, Han Hu, Zhengyou Zhang

机构 * Tencent Robotics X(腾讯Robotics X团队) Hy Vision Team(腾讯混元视觉团队) Futian Laboratory(福田实验室)

专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV

AI总结 研究旨在构建物理世界具身智能体,介绍Hy-Embodied-VLM-1.0模型。定义以行动为中心的能力分类法,开发数据管道。基于特定主干和编码器构建模型,用专家混合架构提升效率。在多基准测试中性能出色,较上一代有显著提升,在具身智能任务中也表现强大。

Comments Tech Report. Code and models are open-sourced at https://github.com/Tencent-Hunyuan/HY-Embodied

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12112 2026-07-15 cs.LG cs.AI cs.CV cs.DC 新提交 85%

Continual Learning with Elastic Regularization and Synthetic Replay for Federated MLLM Fine-Tuning

用于联邦多模态大语言模型微调的弹性正则化和合成重放持续学习

Jing Liu, Chenxuanyin Zou, Jiayang Ren, Gaoyun Fang, Chengfang Li, Yan Wang, Zhenchao Ma, Bo Hu

机构 * The University of British Columbia(英属哥伦比亚大学) Fudan University(复旦大学) Royal College of Science, Imperial College London(伦敦帝国理工学院皇家科学学院) Dyson School of Design Engineering(戴森设计工程学院) Suzhou Institute of Biomedical Engineering and Technology (SIBET), Chinese Academy of Sciences(中国科学院苏州生物医学工程技术研究所) East China Normal University(华东师范大学)

专题命中 VLM训练与架构 :MLLM(title,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究针对联邦多模态大语言模型微调中灾难性遗忘问题,提出FedCMM框架,在参数、数据、聚合三个层面嵌入持续学习保障,经实验验证该框架在准确性和反向迁移上优于基线,能实现跨异构网络AI部署的稳健进化适应。

Comments submitted to IEEE JSTSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12418 2026-07-15 cs.CV 新提交 83%

MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning

MQAdapter:用于从粗到细的视觉语言模型微调的多模态量子适配器

Yumiao Zhao, Bo Jiang, Min Lu, Xiao Wang, Jin Tang

机构 * Anhui University(安徽大学) Origin Quantum Computing Company Limited(本源量子计算有限公司)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对视觉语言模型在少样本学习中细粒度区分不足的问题,提出多模态量子适配器MQAdapter。先检索Top-K候选类别作语义锚点,再用跨模态量子学习机制,利用量子特性建模高阶交互,细化视觉特征,参数高效且能集成现有算法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12364 2026-07-15 cs.CV cs.AI 新提交 76%

Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction

迷失在视觉翻译中:用于脑电到图像重建的基于视觉语言模型的感知语义连贯框架

Sukriti Tiwari, BHVSP Subrahmanyam, Nidhi Goyal, Sai Amrit Patnaik

机构 * Mahindra University(马欣德拉大学) MU-VT Interdisciplinary Advanced Research Centre for Transformative Technologies, Mahindra University(马欣德拉大学MU-VT变革性技术跨学科高级研究中心)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.AI

AI总结 研究脑电到图像重建中视觉保真度与语义可恢复性评估问题,引入基于四个视觉语言模型的框架,通过结构化问题评估图像对,产生宽容感知和语义对齐分数,提炼出脑机接口连贯分数,有效评估感知语义可恢复性。

Comments 27 pages, 3 figures, 13 tables. Accepted at the 5th International Workshop on Human Brain and Artificial Intelligence (HBAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10385 2026-07-15 cs.CV 版本更新 70%

GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models

GTASA:用于视频模型空间时间分析、评估和训练的地面真实标注

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出GTASA,一种包含多主体视频的标注数据集,通过空间关系图和事件级时间映射,验证了其在视频模型训练和评估中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12111 2026-07-15 cs.LG cs.AI cs.DC cs.MA cs.NI 新提交 62%

PFAdapter: Hierarchical LoRA Decomposition for Personalized Federated MLLMs

PFAdapter:用于个性化联邦多模态大语言模型的分层LoRA分解

Jing Liu, Kun Yang, Yan Wang, Dingkang Yang, Xiaoshuai Hao, Wei Zhang, Yang Liu, Wei Zhou

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) Division of Natural and Applied Sciences, Duke Kunshan University(昆山杜克大学自然科学与应用科学部) Department of Electrical and Computer Engineering, The University of British Columbia(英属哥伦比亚大学电气与计算机工程系) Ant Group(蚂蚁集团) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University & Fysics AI(复旦大学智能机器人与先进制造学院及复肆智能科技(上海)有限公司) Xiaomi EV, Xiaomi Campus(小米汽车、小米园区) Information and Communications Technology Cluster, Singapore Institute of Technology (SIT)(新加坡理工学院信息通信技术集群) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对分布式网络中联邦微调平衡全局知识与局部适应的挑战,提出PFAdapter框架,用分层LoRA分解将适配器参数分离,通过正交正则化和选择性聚合协议减少通信成本,实验证明该框架在多数据集上性能优于基线,为智能AI部署提供有效方案。

Comments submitted to IEEE TCCN

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12557 2026-07-15 cs.CV 新提交 57%

Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding

用于长视频理解中事件感知视觉分配的高斯混合模型

Yifan Lu, Ziqi Zhang, Chunfeng Yuan, Jun Gao, Bing Li, Weiming Hu

机构 * Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information, CASIA(中国科学院自动化所多模态信息超智能安全北京市重点实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Hello Group(未知(保留英文)) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对长视频理解中视觉分配问题,提出GMM-EVA方法,利用高斯混合模型建模事件级结构,采用差异化分配策略,在多个长视频基准实验中显著优于均匀采样,以约一半视觉令牌预算达可比性能,凸显高效性。

Comments accepted at PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24787 2026-07-15 cs.AI 版本更新 57%

ReLope: KL-Regularized LoRA Probes for Multimodal LLM Routing

ReLope:KL正则化的LoRA探针用于多模态大语言模型路由

Yaopei Zeng, Congchao Wang, Blake JianHang Chen, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon AGI(亚马逊AGI) Google(谷歌)

专题命中 VLM训练与架构 :MLLM(abstract_cn);分类 cs.AI

AI总结 针对多模态大语言模型路由中探针性能下降问题,提出Attention Probe和KL正则化的LoRA探针ReLope,通过改进隐藏状态质量提升路由效果。

详情

展开后加载摘要…

URL PDF HTML 收藏