arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-12 至 2026-05-12 共收录 203 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 54 篇

2605.08222 2026-05-12 cs.CV cs.AI cs.IR 62%

From Historical Tabular Image to Knowledge Graphs: A Provenance-Aware Modular Pipeline

从历史表格图像到知识图谱:一个具有溯源意识的模块化流水线

Sarah Binta Alam Shoilee, Victor de Boer, Jacco van Ossenbruggen, Susan Legêne

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个模块化、具有溯源意识的流水线,将手写表格图像转换为知识图谱,支持人机协作。通过分解为表格重建、信息提取和知识图谱构建三个阶段,确保提取实体和文字可追溯至其视觉和文本来源。

Comments Shorter version of this paper has been accepted in the 5th International Conference on Hybrid Human-Artificial Intelligence (HHAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10912 2026-05-12 cs.CL 57%

WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

WildClawBench: 一个用于真实世界、长周期代理评估的基准测试

Shuangrui Ding, Xuanlang Dai, Long Xing, Shengyuan Ding, Ziyu Liu, Yang JingYi, Penghui Yang, Zhixiong Zhang, Xilin Wei, Xinyu Fang, Yubo Ma, Haodong Duan, Jing Shao, Jiaqi Wang, Dahua Lin, Kai Chen, Yuhang Zang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出WildClawBench,一个包含60个双语多模态任务的原生运行时基准测试,评估代理在真实工具环境中的长周期任务能力,结果显示当前前沿模型在真实运行时表现仍不理想。

Comments Github link: https://github.com/internlm/WildClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10887 2026-05-12 cs.CV 57%

Count Anything at Any Granularity

按任意粒度计数

Chang Liu, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(人工智能学院,上海交通大学,中国) CMIC, Shanghai Jiao Tong University, China(计算机医学研究所,上海交通大学,中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出多粒度计数框架,通过显式定义计数粒度解决开放世界计数问题,构建了最大的标注数据集KubriCount,并训练了HieraCount模型提升计数精度与泛化能力。

Comments Project page: https://verg-avesta.github.io/KubriCount/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10529 2026-05-12 cs.AI cs.LG 57%

PrimeKG-CL: A Continual Graph Learning Benchmark on Evolving Biomedical Knowledge Graphs

PrimeKG-CL:一个在演进生物医学知识图谱上的持续图学习基准

Yousef A. Radwan, Yao Li, Qing Qing, Ziqi Xu, Xingtong Yu, Jiaxing Huang, Renqiang Luo, Xikun Zhang

机构 * Technology, Innovation, Entrepreneurship Department(技术、创新与创业系) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学) School of Computing and Information Systems(计算与信息系) The University of Melbourne(墨尔本大学) College of Computer Science and Technology(计算机科学与技术学院) School of Computing Technologies(计算技术学院) Jilin University(吉林大学) RMIT University(皇家墨尔本理工大学) Department of Systems Engineering and Engineering Management(系统工程与工程管理系) The Chinese University of Hong Kong(香港中文大学) Department of Data Science and Artificial Intelligence(数据科学与人工智能系) Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出PrimeKG-CL基准,基于九个权威生物医学数据库构建,包含时间快照、任务和多模态特征,评估六种持续学习策略在不同解码器上的性能,发现解码器选择和策略交互显著,仅DistMult能区分持久与过时知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10394 2026-05-12 cs.CV 57%

Sens-VisualNews: A Benchmark Dataset for Sensational Image Detection

Sens-VisualNews: sensational image detection 的基准数据集

Andreas Goulas, Damianos Galanopoulos, Evlampios Apostolidis, Vasileios Mezaris

机构 * IDT-ITI

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Sens-VisualNews数据集,用于研究图像中的煽动性内容检测,评估多种多模态大模型的性能和鲁棒性。

Comments Authors' Accepted Version; Accepted at IEEE ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08136 2026-05-12 cs.CL 57%

EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments

EconWebArena:在现实网络环境中评估自主代理在经济任务上的基准测试

Zefang Liu, Yinzhu Quan

机构 * Capital One Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出EconWebArena基准,通过360个精心挑选的任务测试自主代理在经济任务中的能力,强调权威数据源和基于网络的经济推理,评估多种多模态LLM的表现,揭示性能差距和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04077 2026-05-12 cs.CV 57%

H-POPE: Hierarchical Polling-based Probing Evaluation of Hallucinations in Large Vision-Language Models

H-POPE:基于分层轮询的大型视觉-语言模型幻觉评估

Nhi Pham, Michael Schott

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland University(萨尔兰州大学) Zuse School(祖斯学校)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 H-POPE通过文本和图像结合的方式评估大型视觉-语言模型的幻觉问题,发现模型在物体存在和细粒度属性上易出现幻觉,且依赖视觉输入生成文本。

Comments Poster at https://sites.google.com/berkeley.edu/bb-stat/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09839 2026-05-12 cs.LG cs.AI 57%

Free Energy Manifold: Score-Based Inference for Hybrid Bayesian Networks

自由能流形:基于分数的混合贝叶斯网络推断

Cheol Young Park, Shou Matsumoto

机构 * ATOS Co., Ltd.(ATOS公司) C5I Center, George Mason University(乔治·马歇尔大学C5I中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出自由能流形(FEM),一种用于混合贝叶斯网络推断的分数训练条件能量模型,通过能量叠加实现多连续变量的后验评估和生成采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09703 2026-05-12 cs.CV 57%

MOTOR-Bench: A Real-world Dataset and Multi-agent Framework for Zero-shot Human Mental State Understanding

MOTOR-Bench:一个现实世界数据集和多智能体框架,用于零样本人类心理状态理解

Xiaoyu Yuan, Niklas Heikkala, Tiina Törmänen, Hanna Järvenoja, Guoying Zhao, Haoyu Chen

机构 * University of Oulu(奥卢大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MOTOR-Bench,通过现实世界数据集和多智能体框架,解决零样本人类心理状态理解问题,展示了多智能体框架在行为、认知和情绪预测上的优越性能。

Comments Accepted by CVPR 2026 workshop AI4RWC

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09677 2026-05-12 cs.CV 57%

VFM-SDM: A vision foundation model-based framework for training-free, marker-free, and calibration-free structural displacement measurement

VFM-SDM:一种基于视觉基础模型的框架,用于无训练、无标记和无校准的结构位移测量

Qingyu Xian, Hao Cheng, Berend Jan van der Zwaag, Rolands Kromanis, Ozlem Durmaz Incel

机构 * Pervasive Systems Research Group, Faculty of Electrical Engineering, Mathematics and Computer Science, University of Twente(普罗普及系统研究组,电气工程、数学与计算机科学学院,埃因霍温理工大学) Department of Earth Observation Science, Faculty of Geo-Information Science and Earth Observation (ITC), University of Twente(地球观测科学系,地理信息科学与地球观测(ITC)学院,埃因霍温理工大学) Department of Civil Engineering and Management, Faculty of Engineering Technology, University of Twente(土木工程与管理系,工程科技学院,埃因霍温理工大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出VFM-SDM框架,通过视觉基础模型推断相机参数和点跟踪,实现无需特定训练或现场准备的多方向结构位移测量,展现低误差和强时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05831 2026-05-12 cs.CV 57%

Unifying Scientific Communication: Fine-Grained Correspondence Across Scientific Media

统一科学交流:跨科学媒体的细粒度对应

Megha Mariam K. M, Vineeth N. Balasubramanian, C. V. Jawahar

机构 * IIIT Hyderabad(IIIT海得拉尔学院) Microsoft Research India & IIT Hyderabad(微软研究院印度分部及IIIT海得拉尔学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MCD数据集,通过整合科研论文、演示视频、解释视频和幻灯片,评估不同模型在发现跨格式细粒度对应关系中的能力,揭示了视觉语言模型和嵌入模型的优缺点。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19525 2026-05-12 cs.LG cs.AI 57%

Rethinking Gating Mechanism in Sparse MoE: Handling Arbitrary Modality Inputs with Confidence-Guided Gate

重新思考稀疏MoE中的门控机制:通过置信度引导的门来处理任意模态输入

Liangwei Nathan Zheng, Wei Emma Zhang, Mingyu Guo, Olaf Maennel, Weitong Chen

机构 * School of Computer Science and Information Technology, Adelaide University, Adelaide, Australia(计算机科学与信息技术学院,阿德莱德大学,阿德莱德,澳大利亚)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出ConfSMoE,通过两阶段填补模块解决稀疏MoE中缺失模态问题,引入置信度引导门控机制,缓解专家崩溃问题,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08965 2026-05-12 cs.CV 57%

Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning

大语言模型能否进行视觉说服推理?评估推理的有效性与忠实性

Naeun Lee, Hyunjong Kim, Sunghwan Choi, Injin Kong, Yohan Jo

机构 * Seoul National University(首尔国立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文研究大语言模型在视觉说服推理中的有效性与忠实性,提出通过多样化的教师生成推理进行监督微调以提升预测性能,并引入三维忠实性评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08412 2026-05-12 cs.CV 57%

SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding

SYNCR: 一个具有合成接地的跨视频推理基准

Sara Ghazanfari, Siddharth Garg, Prashanth Krishnamurthy, Farshad Khorrami

机构 * New York University(纽约大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 SYNCR通过合成数据评估多视频推理能力,发现现有模型在物理空间推理上表现不足,参数扩展和训练后优化能提升时间对齐能力,但无法可靠解决细粒度物理跟踪和全局空间合成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08302 2026-05-12 cs.LG cs.AI 57%

SGC-RML: A reliable and interpretable longitudinal assessment for PD in real-world DNS

SGC-RML: 一种可靠的和可解释的纵向评估方法用于现实世界中的帕金森病

Wenbin Wei, Ruixiang Gao, Suyuan Yao, Xuanzhen Zhao, Cheng Huang, Hen-Wei Huang

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出SGC-RML方法,通过统一的症状节点空间整合多模态数据,实现帕金森病的可靠和可解释的纵向评估,实验显示其在多个数据集上表现优异。

Comments Preprint. The first five authors contributed equally. Corresponding author: Hen-Wei Huang. 9 pages main text + appendix; 4 figures, 5 tables in main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10921 2026-05-12 cs.RO 50%

RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark

RoboMemArena:一个全面且具有挑战性的机器人记忆基准

Huashuo Lei, Wenxuan Song, Huarui Zhang, Jieyuan Pei, Jiayi Chen, Haodong Yan, Han Zhao, Pengxiang Ding, Zhipeng Zhang, Lida Huang, Donglin Wang, Yan Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Tsinghua University(清华大学) Zhejiang University of Technology(浙江工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出RoboMemArena,一个包含26个任务的大型基准,通过多模态注释和真实世界评估,改进了现有机器人记忆基准的不足。PrediMem在基准测试中表现优异,为复杂记忆系统提供了新的见解。

Comments Project website: https://robomemarena.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18962 2026-05-12 cs.HC 50%

UniMind: Unleashing the Power of LLMs for Unified Multi-Task Brain Decoding

UniMind: 激活大型语言模型的统一多任务脑解码能力

Weiheng Lu, Zhouheng Yao, Jiamin Wu, Pengyu Zhu, Yuchen Zhou, Weijian Mai, Qihao Zheng, Wanli Ouyang, Chunfeng Song

专题命中 多模态评测 :cross-modal(abstract)

AI总结 UniMind通过引入大型语言模型解码复杂神经模式,提升多任务脑解码的泛化能力,实验表明其在十个数据集上平均提升12%。

Comments 19pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09485 2026-05-12 cs.LG stat.ML 50%

SEMASIA: A Large-Scale Dataset of Semantically Structured Latent Representations

SEMASIA:一个大规模的语义结构化潜在表示数据集

Mario Edoardo Pandolfo, Enrico Grimaldi, Lorenzo Marinucci, Leonardo Di Nino, Simone Fiorellino, Sergio Barbarossa, Paolo Di Lorenzo

机构 * Dept. Computer, Control and Management Engineering(计算机、控制与管理工程系) Sapienza University of Rome(罗马大学西皮恩扎分校) National Inter-University Consortium for Telecommunications (CNIT)(电信全国大学联合体(CNIT)) Dept. of Statistical Sciences(统计科学系) Dept. of Information Engineering, Electronics, and Telecommunications(信息工程、电子与电信系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 SEMASIA通过收集1700多个预训练视觉模型的潜在表示,提供语义结构化的元数据,用于分析潜在空间组织、对齐映射基准测试及回归分析预训练数据复杂性与嵌入几何特性之间的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00953 2026-05-12 cs.LG 50%

SAGE: Agentic Framework for Interpretable and Clinically Translatable Computational Pathology Biomarker Discovery

SAGE:可解释且临床可转化的计算病理学生物标志物发现代理框架

Sahar Almahfouz Nasser, Juan Francisco Pesantez Borja, Jincheng Liu, Sandeep Manandhar, Shikhar Shiromani, Mohammad Tanvir Hasan, Zenghan Wang, Suman Ghosh, Jinchu Li, Xuejian Xu, Aniket Ramkrishnan Iyer, Naoto Tokuyama, Twisha Shah, Tilak Pathak, Soundharya Kumaresan, Yohei Abe, Himanshu Maurya, Anant Madabhushi

机构 * Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(NVIDIA公司) University of Arkansas at Little Rock(阿拉伯州立大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 SAGE通过生物证据引导生物标志物发现,结合多代理系统生成和评估假设,实现结构化、可追溯的病理学研究方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21671 2026-05-12 cs.LG q-bio.NC 50%

Neuroprobe: Evaluating Intracranial Brain Responses to Naturalistic Stimuli

Neuroprobe:评估自然刺激下的颅内脑响应

Andrii Zahorodnii, Christopher Wang, Geeling Chau, Bennett Stankovits, Charikleia Moraitaki, Eli Gross, Alexander Brady, Andrei Barbu, Boris Katz, Ila R Fiete

机构 * MIT CSAIL, CBMM(MIT CSAIL,CBMM) MIT McGovern Institute(MIT McGovern研究所) Caltech(加州理工学院) Columbia University(哥伦比亚大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 Neuroprobe通过高分辨率颅内EEG数据研究多模态语言处理,提供评估框架比较不同模型架构,揭示语言处理在大脑中的时间与空间动态。

Comments 38 pages, 7 main figures, 16 supplementary figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08924 2026-05-12 cs.CE 50%

PPI2Text: Captioning Protein-Protein Interactions with Coordinate-Aligned Pair-Map Decoding

PPI2Text:基于坐标对齐的配对映射解码进行蛋白质-蛋白质相互作用描述

Xiao Fei, Sarah Almeida Carneiro, Yang Zhang, Lawrence P. Petalidis, Achilleas Tsortos, Costas Bouyioukos, Michalis Vazirgiannis

专题命中 多模态评测 :multimodal(abstract)

AI总结 PPI2Text通过自由文本描述蛋白质-蛋白质相互作用,利用ESM3编码器和Qwen3解码器生成更丰富的表达,提升可解释性和文献整合能力,同时引入PaCo-RoPE位置编码和PPI2Text-Dataset数据集,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08645 2026-05-12 physics.plasm-ph cs.LG 50%

Energy-based models for diagnostic reconstruction and analysis in a laboratory plasma device

基于能量模型的实验室等离子体装置诊断重建与分析

Phil Travis, Troy Carter

机构 * Ergodic LLC(Ergodic公司) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出利用能量模型处理实验室等离子体数据,通过重建诊断信号和解决逆向问题,展示其在等离子体分析中的灵活性和有效性。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08515 2026-05-12 cs.LG cs.RO 50%

Quantile-Coupled Flow Matching for Distributional Reinforcement Learning

分位数耦合流匹配用于分布性强化学习

Michael Groom, Victor-Alexandru Darvariu, Lars Kunze, James Wilson, Nick Hawes

机构 * Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所) Bristol Robotics Laboratory, University of the West of England(布里斯托尔机器人实验室,西英格兰大学) Dyson Institute of Engineering & Technology(戴森工程与技术研究院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出FlowIQN,通过分位数对齐的流路径改进流匹配批评者,解决分布性强化学习中分布Bellman算子在p-瓦瑟斯坦距离下的收缩性问题,提升瓦瑟斯坦返回分布精度并兼容DRL流程。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 18 篇

2605.09269 2026-05-12 cs.CL cs.CV 86%

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

DeltaRubric: 通过联合规划和验证实现生成式多模态奖励建模

Rui Liu, Dian Yu, Zhenwen Liang, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文元) University of Maryland, College Park(马里兰大学 College Park 分校) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 DeltaRubric通过联合规划和验证流程,提升多模态奖励建模的可靠性与泛化能力,实验表明其在多模态任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08526 2026-05-12 cs.LG 82%

Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck

Skill-CMIB: 多模态代理技能用于通过条件多模态信息瓶颈实现一致行动

Zihan Huang, Junda Wu, Tong Yu, Qianqi Yan, Rohan Surana, Uttaran Bhattacharya, Lina Yao, Xin Eric Wang, Julian McAuley

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院) UC Santa Barbara(UC圣芭芭拉大学) University of New South Wales(新南威尔士大学)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出Skill-CMIB方法,通过条件多模态信息瓶颈构建多模态技能,解决多模态环境下代理执行不一致的问题,提升执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09443 2026-05-12 cs.CV cs.CL 81%

Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent

通过角色视角:解决多模态角色扮演代理中的模态-角色干扰

Yihong Tang, Kehai Chen, Xuefeng Bai, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Loop Area Institute (SLAI)(深圳环城院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出CAVI框架,通过角色视角减少多模态角色扮演代理中的模态-角色干扰,提升角色一致的多模态交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07177 2026-05-12 cs.LG cs.AI 79%

HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents

HyperEyes: 双粒度效率感知强化学习用于并行多模态搜索代理

Guankai Li, Jiabin Chen, Yi Xu, Xichen Zhang, Yuan Lu

机构 * Xiaohongshu Inc.(小红书公司) University of Cambridge(剑桥大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 HyperEyes通过双粒度效率感知强化学习,实现并行多模态搜索代理,提升搜索效率与准确性,其在六个基准测试中超越现有开源代理。

Comments Code & Data: https://github.com/DeepExperience/HyperEyes

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09934 2026-05-12 cs.CL 79%

TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents

TRACER:多模态工具使用代理的可验证生成溯源

Bihui Yu, Caijun Jia, Jing Chi, Xiaohan Liu, Yining Wang, He Bai, Yuchen Liu, Jingxuan Wei, Junnan Zhu

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算电力网络与信息安全重点实验室,山东计算机科学中心(济南国家超算中心),齐鲁工业大学(山东省科学院))

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 TRACER通过生成带结构溯源记录的答案句子,解决多模态工具使用代理中缺乏的 claim-level 依赖结构问题,提升工具使用可验证性和优化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01774 2026-05-12 cs.RO cs.SY eess.SY 71%

MOBIUS: A Multi-Modal Bipedal Robot that can Walk, Crawl, Climb, and Roll

MOBIUS:一种能够行走、爬行、攀爬和滚动的多模态双足机器人

Alexander Schperberg, Yusuke Tanaka, Stefano Di Cairano, Dennis Hong

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室) Robotic Systems Lab(机器人系统实验室) Robotics and Mechanisms Laboratory(机器人与机构实验室) Department of Mechanical and Aerospace Engineering, University of California, Los Angeles(加州大学洛杉矶分校机械与航空航天工程系)

专题命中 多模态Agent :multi-modal(title)

AI总结 MOBIUS机器人通过四条肢体实现多种运动模式切换,结合强化学习与混合规划架构,实现动态攀爬与负载支撑,拓展了移动操作与抓取能力。

Comments Paper is accepted at the Robotics: Science and Systems conference, held in Sydney, Australia, July 13th-17th, 2026. Alexander Schperberg and Yusuke Tanaka are co-first authors. Both were at the Robotics and Mechanisms Laboratory (RoMeLa) at UCLA when the work started, and are now with Mitsubishi Electric Research Laboratories and ETH Zurich (RSL) respectively

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00370 2026-05-12 cs.LG cs.CY cs.MM 70%

Group Cognition Learning: Making Everything Better Through Governed Two-Stage Agents Collaboration

群体认知学习:通过受控的双阶段智能体协作使一切变得更好

Chunlei Meng, Pengbin Feng, Rong Fu, Hoi Leong Lee, Xiaojing Du, Zhaolu Kang, Zeyu Zhang, Weilin Zhou, Chun Ouyang, Zhongxue Gan

机构 * University of Macau(澳门大学) Universiti Malaysia Perlis(马来西亚霹雳大学) Peking University(北京大学) Xinjiang University(新疆大学)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出群体认知学习框架,通过双阶段智能体协作解决多模态学习中的模态主导和虚假耦合问题,实验表明其在回归和分类任务中达到最优性能。

Comments This study has been Accepted by ICML 2026. The current version is a manuscript, please refer to the official version released at ICML 2026 for the final published version

详情

展开后加载摘要…

URL PDF HTML 收藏