arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-28 至 2026-05-28 共收录 111 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 22 篇

2602.12843 2026-05-28 cs.CV 79%

MMRad-22K: A Structured Multimodal Evidence Dataset for Chest X-ray Report Generation

MMRad-22K:用于胸部X光报告生成的结构化多模态证据数据集

Yichen Zhao, Zelin Peng, Fenghe Tang, Piao Yang, Yu Huang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能MOE实验室、人工智能研究院、计算机科学学院、上海交通大学) School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China (USTC)(生物医学工程学院、生命科学与医学系、中国科学技术大学) Center for Medical Imaging, Robotics, Analytic Computing & Learning (MIRACLE), Suzhou Institute for Advanced Research, USTC(医学影像、机器人、分析计算与学习中心(MIRACLE)、苏州市先进研究院、中国科学技术大学) Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine(放射科、浙江大学医学院第一附属医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对胸部X光报告生成中现有资源监督信号碎片化的问题,提出结构化多模态证据数据集MMRad-22K,并基于统一LVLM骨干进行适配,证明结构化多模态证据优于纯文本或边界框证据,在语言和临床指标上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02857 2026-05-28 cs.CV cs.AI cs.CY 76%

Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024

Deepfake-Eval-2024:2024年传播的深度伪造多模态野外基准

Nuria Alina Chandra, Hannah Lee, Ryan Murtfeldt, Lin Qiu, Arnab Karmakar, Emmanuel Tanumihardja, Kevin Farhat, Ben Caffee, Changyeon Lee, Jongwook Choi, Sejin Paik, Aerin Kim, Oren Etzioni

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院) University of Maryland(马里兰大学) Chung-Ang University(Chung-Ang 大学) Georgetown University(乔治城大学) Miraflow AI

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI

AI总结 针对现有学术基准过时且不反映真实深度伪造的问题,提出包含2024年社交媒体和用户提交的多模态深度伪造基准Deepfake-Eval-2024,评估发现开源模型性能大幅下降,而商业模型和微调模型表现更优但未达到专家水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19358 2026-05-28 cs.CE 71%

RoofNet: A Global Multimodal Dataset for Roof Material Identification from Earth Observation

RoofNet: 用于地球观测屋顶材料识别的全球多模态数据集

Benjamin Tarver, Noelle Law, Sasha Getz, Yuki Miura

专题命中 多模态评测 :multimodal(title)

AI总结 针对建筑屋顶材料数据缺失问题,提出RoofNet数据集,包含101个国家49,662个建筑实例的14类屋顶材料标签,结合多模态标注流程和微调方法,将零样本分类准确率从4.9%提升至47.7%,并展示了材料感知数据对灾害风险评估的影响。

Comments v3: Restructured manuscript with updated framing, added hazard case study, clarified data release/licensing, and refined main text and appendix for clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28806 2026-05-28 cs.CV cs.CL cs.IR 62%

Personal Visual Memory from Explicit and Implicit Evidence

来自显式和隐式证据的个人视觉记忆

Viet Nguyen, Thao Nguyen, Vishal M. Patel, Yuheng Li

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出个人视觉记忆基准和VisualMem混合架构,通过显式与隐式视觉证据增强AI代理的长期记忆,显著提升个性化任务性能。

Comments Project Page: https://viettmab.github.io/visualmem-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28084 2026-05-28 cs.CL cs.AI 62%

SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter

SMILE-Next: 教授大型语言模型检测、分类和推理笑声

Lee Jung-Mok, Kim Sung-Bin, Joohyun Chang, Lee Hyun, Tae-Hyun Oh

机构 * School of EE, KAIST(韩国科学技术院电子工程系) Dept. of EE, POSTECH(POSTECH电子工程系) School of Computing, KAIST(韩国科学技术院计算机科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出SMILE-Next数据集和包含笑声特定Self-Instruct与混合笑声专家框架的方法,用于实现多模态笑声理解,显著优于基线模型。

Journal ref Annual Meetings of the Association for Computational Linguistics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27767 2026-05-28 cs.CL cs.AI cs.LG 62%

UniMaia: Steering Chess Policies with Language for Human-like Play

UniMaia:用语言引导国际象棋策略以实现类人玩法

Sherman Siu, Lesley Istead

机构 * University of Waterloo(滑铁卢大学) Carleton University(卡尔顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出UniMaia框架,通过参数高效文本编码器和ControlNet风格调节机制,在冻结的Lc0国际象棋策略网络上实现提示条件策略调制,实现语义控制(如开局选择和玩家强度)并保持预训练策略表征,同时构建大规模元数据增强的Lichess数据集和半自动提示生成管道,在多个基准上取得最优或竞争性结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04540 2026-05-28 cs.CV cs.AI 62%

The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study

点、视觉与文本:点云能否提升大语言模型的空间推理能力?一项偏差控制研究

Weichen Zhang, Ruiying Peng, Xin Zeng, Jianjie Fang, Ziyou Wang, Kaiyuan Li, Heng Dong, Wei Li, Chen Gao, Xin Wang, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过引入包含文本、视觉和点云模态的3D空间推理基准ScanReQA,评估不同模态下大语言模型的空间推理能力,发现点云和视觉模态的模型表现优于纯文本模型,并揭示了3D大语言模型中的注意力下沉现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28277 2026-05-28 cs.AI 57%

Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning

LLMs 是否从文本构建世界模型?多语言空间推理诊断

Zhikai Pan, Chih-Ting Liao, Chunrui Liu, Xi Xiao, Yitong Qiao, Chunlei Meng, Zhangquan Chen, Xin Cao

机构 * University of New South Wales(新南威尔士大学) Essential Energy University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 通过多语言诊断基准 MentalMap 评估大语言模型的空间推理能力,发现所有模型在视角推理上存在普遍的性能瓶颈(L3 推理悬崖),表明该限制源于纯文本工作记忆约束而非特定架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28136 2026-05-28 cs.CV cs.RO 57%

SAM-Enhanced Segmentation on Road Datasets: Balancing Critical Classes in Autonomous Driving

SAM增强的道路数据集分割:自动驾驶中关键类别的平衡

Toomas Tahves, Mauro Bellone, Junyi Gu, Raivo Sell

机构 * Department of Mechanical and Industrial Engineering, Tallinn University of Technology(塔林技术大学机械与工业工程系) FinEst Centre for Smart Cities, Tallinn University of Technology(塔林技术大学智能城市研究中心) Department of Computer Science and Engineering, Universitas Mercatorum(默卡托姆大学计算机科学与工程系) Department of Computer Science and Engineering, Chalmers University of Technology(挑战者技术大学计算机科学与工程系) University of Gothenburg(哥德堡大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出基于SAM的标注流水线,将ZOD数据集的边界框转换为密集像素级语义掩码,并评估不同架构在类别不平衡下的性能,通过双向迁移学习实现跨传感器配置的有效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19342 2026-05-28 cs.CV 57%

Semantic-Enriched Latent Visual Reasoning

语义增强的潜在视觉推理

Tianrun Xu, Yue Sun, Qixun Wang, Jingyi Lu, Yuan Wang, Tianren Zhang, Longteng Guo, Fengyun Rao, Jing Lyu, Feng Chen, Jing Liu

机构 * Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) Zhongguancun Academy, Beijing, China(中关村学院) China Agricultural University, Beijing, China(中国农业大学) Peking University, Beijing, China(北京大学) Beijing Institute of Technology, Beijing, China(北京理工大学) Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院) WeChat Vision, Tencent Inc, Beijing, China(微信视觉,腾讯公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出两阶段学习框架SLVR,通过属性级语义监督和多查询组相对策略优化增强潜在表示的语义丰富性,提升潜在视觉推理的鲁棒性和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16358 2026-05-28 cs.LG cs.CL 57%

SaFeR-Steer: Evolving Multi-Turn MLLMs via Synthetic Bootstrapping and Feedback Dynamics

SaFeR-Steer:通过合成引导和反馈动力学进化多轮多模态大语言模型

Haolong Hu, Hanyu Li, Tiancheng He, Huahui Yi, An Zhang, Qiankun Li, Kun Wang, Yang Liu, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) West China Biomedical Big Data Center, Sichuan University(四川大学西部生物医学大数据中心) School of Public Policy and Administration, Chongqing University(重庆大学公共政策与管理学院) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 提出SaFeR-Steer框架,通过分阶段合成引导和导师参与的GRPO训练单学生模型,并引入轨迹一致总结奖励(TCSR)以解决多轮安全对齐中的长上下文安全衰减问题,显著提升多轮安全性和有用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27886 2026-05-28 cs.RO 50%

Tabero: Learning Gentle Manipulation with Closed-Loop Force Feedback from Vision, Touch, and Language

Tabero: 通过视觉、触觉和语言闭环力反馈学习轻柔操作

Qiwei Wu, Rui Zhang, Xin Xiang, Tao Li, Weihua Zhang, Junjie Lai, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nvidia, Beijing, China(英伟达(北京,中国))

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对现有视觉-语言-动作模型缺乏触觉反馈导致无法实现轻柔操作的问题,提出Tabero基准和模型套件,通过数据高效管道生成视觉-触觉-语言任务,并采用解耦力-位置命令接口的Tabero-VTLA架构,在保持高任务成功率的同时将轻柔指令下的平均夹持力降低70%以上。

Comments Code:https://github.com/NathanWu7/Tabero

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19174 2026-05-28 cs.SE 50%

Restructure This: Using AI to Restructure Onboarding Documents to Reduce Cognitive Overload

重组文档:使用AI重组入职文档以减少认知负荷

Zixuan Feng, Prashant Tandan, Igor Steinmacher, Marco Aurelio Gerosa, Anita Sarma

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究基于多媒体学习认知理论(CTML),利用生成式AI流水线通过原型VisDoc重组开源软件入职文档,实验证明该方法能降低认知负荷、提高可用性和任务成功率。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13743 2026-05-28 cs.LG 50%

GHGbench: A Unified Multi-Entity, Multi-Task Benchmark for Carbon Emission Prediction

GHGbench:一个统一的多实体、多任务碳排放预测基准

Yifan Duan, Siyuan Zheng, Lihuan Li, Chao Xue, Flora Salim

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出GHGbench,一个包含公司和建筑层面温室气体排放预测的统一开放数据集与基准,通过多模态数据融合和标准化评估揭示结构化难度与分布外泛化差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 15 篇

2605.28629 2026-05-28 cs.CL 89%

Mobile-Aptus: Confidence-Driven Proactive and Robust Interaction in MLLM-based Mobile-Using Agents

Mobile-Aptus: 基于MLLM的手机使用代理中的置信度驱动的主动与鲁棒交互

Zheng Wu, Pengzhou Cheng, Zongru Wu, Yuan Guo, Tianjie Ju, Aston Zhang, Gongshen Liu, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) GenAI, Meta(Meta的GenAI)

专题命中 多模态Agent :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL

AI总结 针对手机使用代理中的过度执行和过度请求问题,提出一种置信度驱动的主动与鲁棒交互框架,通过监督微调和置信度偏差校正实现最优性能。

Comments Accepted by TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28607 2026-05-28 cs.AI cs.CL 81%

Adaptive Multimodal Agents-Based Framework for Automatic Workflow Execution

基于自适应多智能体框架的自动工作流执行

Susanna Cifani, Mario Luca Bernardi, Marta Cimitile

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) Department of Engineering University of Sannio(萨尼奥大学工程系) Faculty of Jurisprudence Unitelma Sapienza University(法理学院萨皮恩扎大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一种多模态多智能体框架,通过离线构建拓扑知识库和在线自适应检索增强生成与闭环协作验证,实现自动工作流执行。

Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses. Accepted for publication at the 2026 IEEE International Conference on Evolving and Adaptive Intelligent Systems (EAIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28774 2026-05-28 cs.CL 79%

Agent Explorative Policy Optimization for Multimodal Agentic Reasoning

Agent探索性策略优化用于多模态Agent推理

Minki Kang, Shizhe Diao, Ryo Hachiuma, Sung Ju Hwang, Pavlo Molchanov, Yu-Chiang Frank Wang, Byung-Kwan Lee

机构 * NVIDIA KAIST(韩国科学技术院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 针对多模态Agent推理中思考与工具使用的不对称性(Thinking-Acting Gap),提出AXPO算法,通过固定思考前缀并重采样工具调用及其延续,结合基于不确定性的前缀选择,显著提升工具使用率和模型性能。

Comments Project page: https://byungkwanlee.github.io/AXPO-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27960 2026-05-28 cs.CV 79%

Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning

Mags-RL: 通过智能体强化学习为多模态大语言模型戴上放大镜以进行复杂场景推理

Xuanzhao Dong, Wenhui Zhu, Peijie Qiu, Xiwen Chen, Xiaobing Yu, Xin Li, Zhipeng Wang, Shao Tang, Gen Li, Yujian Xiong, Hao Wang, Yanxi Chen, Prayag Tiwari, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Washington University in St. Louis(圣路易斯华盛顿大学) Halmstad University(哈姆斯塔德大学) Florida State University(佛罗里达州立大学) Rice University(里士满大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 提出Mags-RL框架,通过智能体强化学习让多模态大语言模型调用超分辨率代理进行高分辨率细粒度检查,实现两轮推理以提升复杂场景下的视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28369 2026-05-28 cs.AI cs.SI 70%

CyberJurors: A Multi-Agent Simulation Task for E-Commerce Disputes Verdict

CyberJurors:电商纠纷裁决的多智能体模拟任务

Yanhui Sun, Wu Liu, Haifeng Ming, Xinru Wang, Hantao Yao, Yongdong Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 针对电商纠纷裁决需要从冗余多轮多模态证据中提取关键线索并依据平台特定惯例决策的问题,提出多智能体框架CyberJurors,通过个体裁决链式思维和集体陪审共识裁决提升裁决质量,在包含6000真实案例的基准上超越现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27582 2026-05-28 cs.RO cs.CV 70%

Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation

Uni-LaViRA:面向统一具身导航的语言-视觉-机器人动作翻译

Hongyu Ding, Sizhuo Zhang, Ziming Xu, Jinwen Guo, Hongxiu Liu, Xingzhi Cheng, Zixuan Chen, Haifei Qi, Duo Wang, Hao Xu, Jieqi Shi, Yifan Zhang, Jing Huo, Jian Cheng, Yang Gao, Jiebo Luo

机构 * Nanjing University(南京大学) Beihang University(北京航空航天大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) BMW (Nanjing) Information Technology Co., Ltd.(宝马(南京)信息技术有限公司) University of Rochester(罗切斯特大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出Uni-LaViRA统一智能体架构,通过语言-视觉-机器人动作翻译结构,结合待办列表记忆和二次机会回溯机制,在零训练下实现四类导航任务和四种真实机器人的零样本泛化,性能匹配或超越近期训练式导航基础模型。

Comments Project page: https://xetroubadour.github.io/Uni-LaViRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27378 2026-05-28 cs.CL cs.CV cs.MA 62%

OralAgent: Integrating Reasoning, Tools, and Knowledge for Interactive Dental Image Analysis

OralAgent: 融合推理、工具与知识的交互式牙科影像分析

Jing Hao, Siyuan Dai, Yongxin Zhang, Yuci Liang, Jiamin Wu, Jiahao Bao, Yuxuan Fan, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Ming Hu, Liang Zhan, James Kit Hon Tsoi, Linlin Shen, Junjun He, Kuo Feng Hung

机构 * Faculty of Dentistry, the University of Hongkong, Hong Kong SAR, China(香港大学牙科学院,中国香港特别行政区) Department of Electrical and Computer Engineering, University of Pittsburgh, Pittsburgh, PA, USA(匹兹堡大学电气与计算机工程系,美国宾夕法尼亚州匹兹堡) Shenzhen University, China(深圳大学,中国) Department of Craniomaxillofacial Surgery, Shanghai Ninth People’s Hospital, China(上海第九人民医院口腔颌面外科部,中国) Nanyang technological University, Singapore(南洋理工大学,新加坡) School of Biomedical Engineering, Southern Medical University, China(南方医科大学生物医学工程学院,中国) Singapore University of Technology and Design, Singapore(新加坡科技设计大学,新加坡) University of Auckland, new zealand(奥克兰大学,新西兰) Shanghai Artificial Intelligence Laboratory , China(上海人工智能实验室,中国)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出首个牙科专用AI智能体OralAgent,通过集成22种视觉分析工具和368本经典牙科教科书,实现多模态推理、工具决策与知识检索的自动化框架,在多个基准上达到最优性能。

Comments 14 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28683 2026-05-28 cs.AI 57%

VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

VeriTrip: 面向非结构化网络语料的旅行规划智能体可验证基准

Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学技术大学网络安全学院) Amap, Alibaba Group(阿里巴巴集团阿地图) NLPR & MAIS, Institute of Automation, CAS(中国科学院自动化研究所神经信息处理实验室及机器智能研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出VeriTrip基准,通过多模态检索库和可验证知识库,评估智能体在非结构化网络语料中基于证据推理的旅行规划能力,揭示检索-推理权衡问题。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28534 2026-05-28 cs.CL 57%

GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection

GUI-CIDER:通过因果内化和密度感知示例重选进行GUI代理的中期训练

Zheng Wu, Chengcheng Han, Zhengxi Lu, Tianjie Ju, Yanyu Chen, Qi Gu, Xunliang Cai, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 提出GUI-CIDER中期训练方法,通过因果内化和密度感知示例重选显式内化GUI世界知识,提升代理对GUI操作的理解和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28083 2026-05-28 cs.CV 57%

VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking

VLA-Hijack: 通过视觉本体感觉劫持实现针对视觉-语言-动作模型的可迁移补丁攻击

Jiyuan Fu, Kaixun Jiang, Jingkai Jia, Zhaoyu Chen, Xueyao Chen, Lingyi Hong, Shuyong Gao, Chenzhi Tan, Dingkang Yang, Wenqiang Zhang

机构 * Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出VLA-Hijack框架,通过注意力引导的本体感觉抑制和多模态本体感觉注入攻击视觉自定位过程,实现跨架构黑盒迁移攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28077 2026-05-28 cs.AI 57%

MACReD: A Multi-Agent Collaborative Reasoning Framework for Reaction Diagram Parsing

MACReD:一种用于反应图解解析的多智能体协作推理框架

Chuang Tang, Chenhao Lin, Yin Xu, Hao Wang, Jinrui Zhou, Xin Li, Mingjun Xiao, Enhong Chen

机构 * University of Science Technology of China \& iFLYTEK Co., Ltd. Hefei China Technology of China \& iFLYTEK Co., Ltd.

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出MACReD分层多智能体框架,通过协调分子感知、箭头理解、文本提取和反应重建等专用智能体,在统一VLM引导架构下实现化学图解解析,在RxnScribe基准上达到最优性能。

Comments Preprint. Code is available at https://github.com/TC9905/MACReD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28056 2026-05-28 cs.CV 57%

CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning

CogPortrait: 通过分层智能体规划实现肖像动画中的细粒度眼部区域控制

He Feng, Yongjia Ma, Donglin Di, Lei Fan, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出CogPortrait两阶段框架,利用多模态大语言模型智能体从高层标签生成关键点,再通过DiT视频生成骨干合成动画,实现细粒度眼部控制,并引入EMH基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27705 2026-05-28 cs.CR cs.MM 57%

AgenticVBench: Can AI Agents Complete Real-World Post-Production Tasks?

AgenticVBench: AI代理能否完成真实的后期制作任务?

Zongheng Cao, Yi Zheng, Rui Song, Xinyu Hu

专题命中 多模态Agent :multimodal(abstract);分类 cs.MM

AI总结 本文提出AgenticVBench基准,包含100个来自真实后期制作流程的代理任务,评估多模态AI代理的复合能力,发现最佳代理栈性能仅略超30%,远低于人类专家。

Comments 22 pages, 6 figures. Benchmark website: https://agenticvbench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05673 2026-05-28 cs.RO cs.AI 57%

Rectified Schrödinger Bridge Matching for Few-Step Visual Navigation

整流薛定谔桥匹配用于少步视觉导航

Wuyang Luan, Junhui Li, Weiguang Zhao, Wenjian Zhang, Tieru Wu, Rui Ma

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) College of Computer Science, Chongqing University(重庆大学计算机学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Changchun GenY Technology Co., Ltd.(长春GenY科技有限公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出整流薛定谔桥匹配(RSBM)框架,利用速度场结构不变性和线性方差减少,在仅3步积分中实现高保真生成策略,满足具身AI低延迟需求。

Comments 18 pages, 7 figures, 10 tables. Code available at https://github.com/WuyangLuan/RSBM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09367 2026-05-28 cs.CV 57%

EpiAgent: An Agent-Centric System for Ancient Inscription Restoration

EpiAgent: 一种以智能体为中心的古铭文修复系统

Shipeng Zhu, Ang Chen, Na Nie, Pengfei Fang, Min-Ling Zhang, Hui Xue

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用关键实验室(东南大学),教育部,中国) Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China(计算机网络与信息集成关键实验室(东南大学),教育部,中国) Nanjing University Museum, Nanjing University, China(南京大学博物馆,南京大学,中国) The China Centre for Linguistic and Strategic Studies, Nanjing University, China(中国语言战略研究中心,南京大学,中国)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出基于智能体的EpiAgent系统,通过分层规划与LLM协调多模态分析、历史经验和专用工具,实现灵活自适应的古铭文修复,在真实退化铭文上取得更优修复质量和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 19 篇

2605.28575 2026-05-28 cs.AI 83%

A Conflict-Aware Penalty and Statistical Loss Framework for Balancing Modalities and Enhancing Stability in Multimodal Sentiment Analysis

一种冲突感知惩罚与统计损失框架,用于平衡模态并增强多模态情感分析的稳定性

Jianheng Dai, Jiazhang Liang, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对多模态情感分析中文本模态主导导致梯度冲突的问题,提出冲突感知惩罚和统计损失框架,实现模态平衡与训练稳定,在CMU-MOSI上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏