arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-16 至 2026-06-16 共收录 136 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 32 篇

2606.15427 2026-06-16 cs.LG cs.AI cs.CV 新提交 82%

Post-Launch Capability Expansion of Vision-Language Models via Prompting for On-Orbit Spacecraft Inspection

通过提示实现视觉语言模型发射后能力扩展用于在轨航天器检测

Nicholas A. Welsh, Lennon J. Shikhman, Monty Nehru Attazs, Seemanthini K. Putane, Van Minh Nguyen, Ryan T. White

机构 * Florida Institute of Technology(佛罗里达理工学院) University of Florida(佛罗里达大学)

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究利用提示驱动的视觉语言模型在轨扩展语义能力,无需修改权重即可通过自然语言提示检测新航天器部件,在129张图像上零样本实例分割达到0.385 mAP@0.5。

Comments 5 pages, 1 figure, 2 tables. Equal contribution by Nicholas A. Welsh and Lennon Shikhman. Published in the CVPR2026 Workshop on AI4Space

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16601 2026-06-16 cs.CV 新提交 81%

DifferAD-R1: A Difference-Guided IndustrialAnomaly Localization with Multimodal LargeLanguage Models

DifferAD-R1: 基于差异引导的多模态大语言模型工业异常定位

Dingrong Wang, Xian Tao, Zhen Qu, Hengliang Luo, Xinyi Gong, Fei Shen, Zhengtao Zhang, Guiguang Ding

机构 * Institute of Automation, Chinese Academy of Sciences (CAS)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CASI Vision Technology Co., Ltd.(中科慧远视觉技术有限公司) Shandong Laboratory of Aluminum Advanced Manufacturing in Binzhou (SLAAMB), Binzhou Institute of Technology, Weiqiao-UCAS Science and Technology Park(山东省滨州市铝先进制造实验室(SLAAMB),滨州技术学院,魏桥国科科技园) Space Information Research Institute, Hangzhou Dianzi University(杭州电子科技大学空间信息研究院) School of Software, Tsinghua University(清华大学软件学院)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出DifferAD-R1框架,通过差异引导双图像范式将异常定位转化为一次性差异定位问题,并设计双一致性定位奖励和难度感知策略,在AD-DualDiff数据集上优于现有方法。

Comments Submitted to IEEE Transactions on Circuits and Systems for Video Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16470 2026-06-16 cs.CV cs.RO 新提交 81%

Decoupled Object-Centric Video Understanding for Generating Robotic Manipulation Commands

解耦的以对象为中心的视频理解用于生成机器人操作指令

Thanh Nguyen Canh, Thanh-Tuan Tran, Haolan Zhang, Ziyan Gao, Xiem HoangVan, Nak Young Chong

机构 * School of Information Science, Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学信息科学学院) University of Engineering and Technology, Vietnam National University(越南国立大学工程与技术大学) Department of Robotics, Hanyang University(汉阳大学机器人学系)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出解耦动作识别与对象选择的框架,通过TSM分类动作和对象选择算法识别任务相关对象,结合VLM生成精确指令,在Something-Something V2上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07343 2026-06-16 cs.CV cs.AI cs.LG cs.RO 版本更新 80%

Seeing Roads Through Words: A Language-Guided Framework for RGB-T Driving Scene Segmentation

通过文字看道路:一种语言引导的RGB-T驾驶场景分割框架

Ruturaj Reddy, Hrishav Bakul Barua, Junn Yong Loo, Thanh Thi Nguyen, Ganesh Krishnasamy

机构 * National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼科技大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出CLARITY框架,利用视觉语言模型先验动态调整RGB-T融合策略,并引入暗目标语义保留和层次化解码器,在MFNet数据集上达到62.3% mIoU和77.5% mAcc的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16432 2026-06-16 cs.CL cs.AI 新提交 79%

ACCORD: Action-Conditioned Contextual Grounding for Language Agents

ACCORD: 面向语言智能体的动作条件上下文接地

Lai Jiang, Cheng Qian, Zhenhailong Wang, Pan Lu, Heng Ji, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 针对用户指令常因隐含环境假设而欠指定,导致LLM智能体执行失败的问题,提出ACCORD框架,在每次动作前主动探测缺失信息并整合轨迹上下文,无需额外训练,在AppWorld和AlfWorld上显著提升任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16137 2026-06-16 cs.CL cs.AI 新提交 74%

XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models

基于XAI的语音深度伪造检测解释生成:使用免训练多模态大语言模型

Yupei Li, Qiyang Sun, Xiaoliang Wu, Chenxi Wang, Berrak Sisman, Björn W. Schuller

机构 * Imperial College London(帝国理工学院) Technical University of Munich(慕尼黑工业大学) University of Southampton(南安普顿大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉定位与Grounding :multimodal large language model(title);分类 cs.AI

AI总结 针对语音深度伪造检测缺乏可解释性的问题,提出一种免训练框架,融合XAI证据与多模态大语言模型,生成基于证据的特定解释,在PartialSpoof数据集上内部准确率提升超45%。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00344 2026-06-16 cs.CV cs.AI cs.CL 版本更新 73%

When RAG Hurts: Diagnosing and Mitigating Attention Distraction in Retrieval-Augmented LVLMs

当RAG有害:诊断和缓解检索增强LVLMs中的注意力分散

Beidi Zhao, Wenlong Deng, Xinting Liao, Yushu Li, Nazim Shaikh, Yao Nie, Xiaoxiao Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文发现检索增强生成(RAG)在LVLMs中导致注意力分散(AD)问题,即检索文本抑制视觉注意力并偏离问题相关区域,提出MAD-RAG方法通过双问题公式和注意力混合来解耦视觉定位与上下文整合,在三个基准上提升性能并纠正大部分失败案例。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11201 2026-06-16 cs.DB cs.AI 版本更新 70%

Bridging the Gap: Enabling Natural Language Queries for NoSQL Databases through Text-to-NoSQL Translation

弥合差距:通过文本到NoSQL翻译实现NoSQL数据库的自然语言查询

Jinwei Lu, Jiawei Lu, Chen Zhang, Zhiqian Qin, Haodi Zhang, Yuanfeng Song, Raymond Chi-Wing Wong

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究Text-to-NoSQL任务,提出TEND基准和SAG求解器,用于将自然语言请求翻译为MongoDB聚合管道,验证了无模式文档推理的独特挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15994 2026-06-16 cs.AI cs.LG 新提交 62%

Agentic Framework for Deep Learning workload migration via In-Context Learning

基于上下文学习的深度学习工作负载迁移智能体框架

Qiyue Liang, Steven Ingram, George Vanica, Andi Gavrilescu, Newfel Harrat, Hassan Sipra, Sethuraman Sankaran

机构 * Google(谷歌)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出结合上下文学习与Oracle驱动的自调试的自主系统,实现从PyTorch到JAX的深度学习模型自动迁移,在神经模块上达到91%数值等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14754 2026-06-16 cs.CV cs.AI 新提交 62%

Sub-Semantic Image Segmentation

子语义图像分割

Aviad Cohen Zada, Nadav Orenstein, Shai Avidan, Gal Oren

机构 * Tel Aviv University(特拉维夫大学) Stanford University(斯坦福大学) Technion(以色列理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出子语义图像分割,通过耦合视觉-语言模型与SAM,并引入DETECTURE解决语言泄漏、提示竞争和语义失真问题,在自建数据集TextureADE上取得最优性能。

Comments 23 pages. Code: https://github.com/Scientific-Computing-Lab/TextureDetecture

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16592 2026-06-16 cs.RO cs.AI cs.CV cs.ET 版本更新 62%

Human Cognition in Machines: A Unified Perspective of World Models

机器中的人类认知:世界模型的统一视角

Timothy Rupprecht, Pu Zhao, Amir Taherin, Arash Akbari, Arman Akbari, Yumei He, Tooba Imtiaz, Sean Duffy, Juyi Lin, Yixiao Chen, Rahul Chowdhury, Enfu Nan, Yixin Shen, Yifan Cao, Haochen Zeng, Weiwei Chen, Geng Yuan, Jennifer Dy, Sarah Ostadabbas, Xuan Zhang, David Kaeli, Edmund Yeh, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc.(EmbodyX公司) Tulane University(路易斯安那州立大学) Cornell University(康奈尔大学) University of Georgia(佐治亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出统一框架整合记忆、感知等认知功能,指出动机和元认知研究不足,并引入认知世界模型新类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17531 2026-06-16 cs.CV cs.AI cs.CR 版本更新 62%

Rel-Zero: Harnessing Patch-Pair Invariance for Robust Zero-Watermarking Against AI Editing

Rel-Zero:利用补丁对不变性实现鲁棒的零水印以抵御AI编辑

Pengzhen Chen, Yanwei Liu, Xiaoyan Gu, Xiaojun Chen, Wu Liu, Weiping Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对AI编辑对图像真实性的威胁,提出Rel-Zero零水印框架,利用编辑中补丁对关系距离的不变性,无需修改原图即可生成鲁棒水印,实验证明其优于现有方法。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09831 2026-06-16 cs.AI cs.LG cs.MA cs.SI 版本更新 62%

Interpretation as Linear Transformation: A Cognitive-Geometric Model of Concepts and Meaning

解释作为线性变换:概念与意义的认知几何模型

Chainarong Amornbunchornvej

机构 * National Electronics and Computer Technology Center(国家电子与计算机技术中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出一个几何框架,通过线性映射和向量空间建模异构智能体间的概念传递、动机与影响,揭示误解与概念消亡的结构条件,并给出领导力的可达性解释。

Comments The revised draft w.r.t. reviewer comments. The code is at https://github.com/DarkEyes/Cognitive-Geometry

Journal ref Minds and Machines, Volume 36, Issue 3, Article number 36, (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16826 2026-06-16 cs.RO cs.AI 新提交 57%

ATOM-Bench: A Real-World Benchmark for Atomic Skills and Compositional Generalization in Manipulation Policies

ATOM-Bench:用于操作策略中原子技能与组合泛化的真实世界基准

Zenan Wu, Bingqing Wei, Lu Liu, Zheqi He, Xi Wang, Jiakang Liu, Zehui Li, Guocai Yao, Jing-Shu Zheng, Xi Yang, Yongtao Wang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出ATOM-Bench基准,通过分解桌面操作为原子任务和组合任务,评估操作策略的原子技能获取与组合泛化能力,发现当前策略在细粒度原子技能和组合重用上存在不足。

Comments Homepage: https://flageval-baai.github.io/AtomBenchPage

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16603 2026-06-16 cs.CL cs.AI 新提交 57%

VeriGraph: Towards Verifiable Data-Analytic Agents

VeriGraph: 迈向可验证的数据分析智能体

Jiajie Jin, Zhao Yang, Wenle Liao, Yuyang Hu, Guanting Dong, Xiaoxi Li, Yutao Zhu, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出VeriGraph框架,通过构建显式异质证据有向无环图(DAG)实现数据分析智能体的可验证性,并设计基于图的策略优化提升正确性与可审计性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16184 2026-06-16 cs.CV cs.MM 新提交 57%

Closed-Loop Triplet Synergistic Generation for Long-Form Video

闭环三元组协同生成用于长视频

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出CoTriSyGen框架,通过闭环视觉-文本-记忆协同过程,结合分析器进行镜头内和镜头间修正,解决长视频生成中的身份漂移和不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16003 2026-06-16 cs.AI 新提交 57%

SciText2Eq: Assessing LLMs for Explainable Equation Generation for Scientific Creativity

SciText2Eq: 评估大语言模型在科学创造力中的可解释方程生成

Yifan Mo, Xiao Fu, Yue Su, Qingyu Meng, Koen Hindriks, Qingzhi Liu, Jiahuan Pei

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Wageningen University & Research(瓦赫宁根大学及研究中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究大语言模型从科学文本生成数学方程的能力,构建AI论文数据集,提出可解释方程生成流程,并设计结合自动指标、LLM评估和人工判断的评估协议,发现LLM在语义准确性上表现不足。

Comments Accepted by findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15685 2026-06-16 cs.RO cs.CV 新提交 57%

Learning New Tasks via Reusable Skills: Skill-Compositional Experts for Embodied Continual Learning

通过可复用技能学习新任务:面向具身持续学习的技能组合专家

Shuaike Zhang, Shaokun Wang, Haoyu Tang, Jianlong Wu, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shandong University(山东大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出技能组合专家(SCE)框架,通过组合技能基础(CSG)分解演示为可复用技能,并利用双执行-转换专家(DETE)实现新任务学习,有效缓解具身持续学习中的灾难性遗忘。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15646 2026-06-16 cs.AI 新提交 57%

NeuroSymbolic AI for Legal AI-TRISM: Trustworthy, Reliable, Interpretable, Safe Models

面向法律AI-TRISM的神经符号AI:可信、可靠、可解释、安全模型

Deepa Tilwani, Yash Saxena, Ankur Padia, Srinivasan Parthasarathy, Manas Gaur

机构 * Department of Computer Science, AI Institute, University of South Carolina(南卡罗来纳大学计算机科学系,人工智能研究所) Department of Computer Science and Electrical Engineering, University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校计算机科学与电气工程系) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对法律领域LLM缺乏可解释推理和易产生幻觉的问题,提出TRISM框架,融合神经符号AI与LLM,通过结构化法律知识集成和RAG验证机制提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15591 2026-06-16 cs.AI cs.CL cs.MA 新提交 57%

Agentic Retrieval and Reinforcement Learned Equation Chains: A Controlled Generation Framework for Complex and Novel Physics Word Problems

智能检索与强化学习方程链:面向复杂新颖物理文字题的可控生成框架

Tirthankar Mittra

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出ARVRE两阶段框架,通过离线时序差分学习构建有效物理方程链,结合智能检索增强生成控制问题结构与难度,再由大语言模型生成自然语言问题,实现复杂、新颖且可解的物理文字题生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15307 2026-06-16 cs.CL cs.AI 新提交 57%

Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes

利用思维链监督的强化学习进行仇恨和宣传模因的可解释检测

Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor, Abul Hasnat, Firoj Alam

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) Qatar University(卡塔尔大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

AI总结 提出基于强化学习的后训练方法,结合任务特定奖励和组相对策略优化(GRPO),提升思考型多模态大语言模型在仇恨和宣传模因检测中的分类性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01131 2026-06-16 cs.MA cs.AI 版本更新 57%

MedCollab: IBIS-Guided Multi-Agent Collaboration with Hierarchical Disease Relation Chains for Clinical Diagnosis

MedCollab:基于IBIS引导的多智能体协作与分层疾病关系链的临床诊断

Yuqi Zhan, Xinyue Wu, Tianyu Lin, Yutong Bao, Xiaoyu Wang, Weihao Cheng, Huangwei Chen, Feiwei Qin, Zhu Zhu

机构 * Princeton University(普林斯顿大学) Springer Heidelberg(斯普林格海德堡) ABC Institute(ABC研究所) Rupert-Karls-University Heidelberg(海德堡鲁珀特-卡尔大学) Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Children’s Hospital, Zhejiang University School of Medicine, National Clinical Research Center for Children and Adolescents’ Health and Diseases(浙江大学医学院儿童医院,国家儿童青少年健康与疾病临床研究中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出MedCollab框架,通过IBIS结构化论证和分层疾病关系链(HDRC)增强多智能体协作,提升临床诊断的准确性、可追溯性和报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16523 2026-06-16 cs.CL 新提交 50%

SkillWiki: A Living Knowledge Infrastructure for Agent Skills

SkillWiki: 一个用于智能体技能的活知识基础设施

Dingcheng Huang, Yuda Ding, Bingshuo Liu, Qingbin Liu, Xi Chen, Jiang Bian, Hongliang Sun, Zhiying Tu, Dianhui Chu, Xiaoyan Yu, Dianbo Sui

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出SkillWiki,一个支持智能体技能组织、落地和持续演化的活知识基础设施,通过将异构知识转化为可复用技能资产并关联原始证据,实现从知识摄入到技能生产、溯源探索、治理和执行驱动演化的完整生命周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15509 2026-06-16 cs.HC cs.CY 新提交 50%

What do you mean by human-AI collaboration: Prerequisite functions and the affordances needed to achieve it

你说的人机协作是什么意思:实现协作所需的前提功能和可供性

Mutlu Cukurova

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文基于学习科学对协作的严格定义,提出人机协作需满足对称关系、共享目标等条件,并通过五级诊断分类法指出当前人机交互多为咨询而非协作,最后推导出实现协作所需的功能。

Comments 22 pages,1 table, Submitted for Review to the Handbook of AI and the Future of Education (R. Wegerif, I. Casebourne, A. Zhou & I. J. Ness, Eds.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15330 2026-06-16 cs.IR 新提交 50%

OneBar: An End-to-End Content-Grounded Generative Query Recommendation Framework for E-Commerce Video Feeds

OneBar:一种面向电商视频流的端到端内容驱动生成式查询推荐框架

Yao Tang, Ying Yang, Ben Chen, Yufei Ma, Zihan Liang, Chenyi Lei, Wenwu Ou, Jian Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出OneBar框架,通过协同多模态意图对齐、统一端到端架构和渐进偏好学习,解决短视频平台查询推荐中的延迟和偏好漂移问题,显著提升查询曝光和点击。

Comments Any questions feel free to contact: benchen4395@gmail.com

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与屏幕智能体 10 篇

2505.14418 2026-06-16 cs.CL 版本更新 88%

Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI Agents

隐藏的幽灵之手:揭示MLLM驱动的移动GUI代理中的后门漏洞

Pengzhou Cheng, Haowen Hu, Zheng Wu, Zongru Wu, Tianjie Ju, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Huawei Inc.(华为公司)

专题命中 GUI与屏幕智能体 :MLLM(title,title_cn);multimodal large language model(abstract)

AI总结 本研究提出AgentGhost框架,通过组合目标和交互层触发器,利用监督对比学习和微调注入后门,在移动GUI代理中实现高成功率和隐蔽性,攻击准确率达99.7%。

Comments EMNLP-Findings 2025 (Correcting model settings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16198 2026-06-16 cs.CV 新提交 84%

GRACE: Boosting Video MLLMs with Grounded Action-Centric Evidence for Viewer Sentiment Prediction

GRACE: 基于接地动作中心证据增强视频多模态大语言模型用于观众情感预测

Ruoxuan Yang, Tieyuan Chen, Xiaofeng Huang, Haibing Yin, Jun Wang, Xiping Chen, Jun Yin, Xuesong Gao, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Hangzhou Dianzi University(杭州电子科技大学) The 52nd Research Institute of China Electronics Technology Group Corporation(中国电子科技集团公司第五十二研究所) Hangzhou Bywin Technology Co., Ltd.(杭州百威科技有限公司) Zhejiang Dahua Technology Co., Ltd.(浙江大华技术股份有限公司) School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) Haihe Laboratory of Information Technology Application Innovation(海河信息技术应用创新实验室)

专题命中 GUI与屏幕智能体 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出GRACE框架,通过提取时间有序的主谓宾三元组和视觉实体裁剪,增强视频MLLM对细粒度情感线索的提取与推理,在Pitts数据集上提升Qwen2.5-VL和Qwen3-VL性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15417 2026-06-16 cs.CV 新提交 83%

From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models

从帧到时间图:基于视觉语言模型的上下文第一人称动作识别

Bessie Dominguez-Dager, Francisco Gomez-Donoso, Miguel Cazorla, Marc Pollefeys, Daniel Barath, Zuria Bauer

机构 * University of Alicante(阿利坎特大学) ETH Zürich(苏黎世联邦理工学院) Microsoft(微软)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出将视频转换为时间动作图,通过多阶段提示生成自然语言叙述并结构化,实现上下文学习,在EGTEA和Epic-Kitchens-100上显著提升零样本和少样本动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13578 2026-06-16 cs.CL cs.AI cs.LG cs.MM cs.RO 新提交 76%

LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories

LabVLA:在科学实验室中落地视觉-语言-动作模型

Baochang Ren, Xinjie Liu, Xi Chen, Yanshuo Liu, Chenxi Li, Daqi Gao, Zeqin Su, Jintao Xing, Zirui Xue, Rui Li, Xiangyu Zhao, Shuofei Qiao, Minting Pan, Wangmeng Zuo, Lei Bai, Dongzhan Zhou, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 GUI与屏幕智能体 :grounding(title);分类 cs.AI、cs.LG

AI总结 针对科学实验室中机器人执行协议面临的数据和实体瓶颈,提出模拟数据引擎RoboGenesis和两阶段训练策略LabVLA,在LabUtopia基准上取得最高平均成功率。

Comments Work in progress. Project website at https://zjunlp.github.io/LabVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27284 2026-06-16 cs.RO cs.AI 版本更新 70%

FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies

FineVLA:面向可操控视觉-语言-动作策略的细粒度指令对齐

Xintong Hu, Xuhong Huang, Jinyu Zhang, Yutong Yao, Yuchong Sun, Qiuyue Wang, Mingsheng Li, Sicheng Xie, Yitao Liu, Junhao Chen, Yixuan Chen, Yingming Zheng, Shuai Bai, Tao Yu

机构 * XLANG Lab, The University of Hong Kong(XLANG实验室,香港大学) Qwen Team, Alibaba Inc.(通义团队,阿里巴巴公司)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出FineVLA框架,通过构建细粒度数据集和训练策略,在保持任务成功率的同时实现机器人动作的细粒度可控性。

Comments 26 pages, 7 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏