arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-02 至 2026-07-02 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 6 篇

2603.12056 2026-07-02 cs.AI cs.CL 版本更新 81%

XSkill: Continual Learning from Experience and Skills in Multimodal Agents

XSkill: 多模态智能体中的经验与技能持续学习

Guanyu Jiang, Zhaochen Su, Xiaoye Qu, Yi R. Fung

机构 * Zhejiang University(浙江大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出XSkill双流框架,通过视觉经验与技能的知识提取、检索和自适应,实现多模态智能体在开放场景中无需参数更新的持续学习,显著提升工具使用和推理泛化能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00547 2026-07-02 cs.CV cs.AI 新提交 62%

EgoGapBench: Benchmarking Egocentric Action Selection in Multi-Agent Scenes

EgoGapBench:多智能体场景中自我中心动作选择的基准测试

Jihyeok Jung, Jeewu Lee, Sanghyeop Kim, Chanhee Han, Seong Joon Oh

机构 * KAIST AI(韩国科学技术院人工智能研究所) Sogang University(成均馆大学) Ministry of Science and ICT(科学技术信息通信部)

专题命中 多模态Agent :MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出EgoGapBench基准,用于评估多智能体场景中的自我中心动作选择能力,发现多模态大语言模型表现远逊于人类,且现有自我中心数据微调无法弥合差距。

Comments 15 pages, 2 figures, 8 tables. Code and benchmark are available at https://github.com/jhCOR/EgoGapBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00881 2026-07-02 cs.CV 新提交 57%

OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping

OmniView-Space: 通过多视角空间映射增强空间推理

Xudong Li, Mengdan Zhang, Peixian Chen, Jiaxi Tan, Zihao Huang, Jingyuan Zheng, Yan Zhang, Xiawu Zheng, Xing Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) Tencent Youtu Lab(腾讯优图实验室) Beijing Institute of Technology(北京理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出OmniView-Space框架,通过多视角空间映射、工具引导的自我中心推理和认知图蒸馏,解决多模态大模型在多步空间推理中的参考框架动态重锚问题,在单/多图像基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31410 2026-07-02 cs.AI 新提交 57%

Xiaomi-GUI-0 Technical Report

Xiaomi-GUI-0 技术报告

Wanxia Cao, Chengzhen Duan, Pei Fu, Pengzhi Gao, Niu Lian, Fazhan Liu, Hui Liu, Heng Qu, Qinzhuo Wu, Zhehao Yu, Tongbo Chen, Shiqi Cui, Anan Du, Shukai Jia, Yuanfa Li, Wei Liu, Yike Liu, Wenchao Lu, Zhenbo Luo, Haoyuan Sun, Jiatong Sun, Cheng Tan, Yajie Wang, Changqiao Wu, Tao Xiong, Jiahui Yang, Yuxuan Yuan, Ruoceng Zhang, Shaojie Zhang, Jian Zhu, Jian Luan, Cong Zou

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出Xiaomi-GUI-0,一种在真实移动设备上训练和评估的原生多模态GUI智能体,通过真实设备主导的混合基础设施、多源训练数据和渐进式三阶段训练,在真实任务中实现72.0%成功率,显著提升执行稳定性和异常状态识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00342 2026-07-02 eess.SP 新提交 50%

Semantic-based Internet of Embodied Intelligence: Visions and Frontiers

基于语义的具身智能物联网:愿景与前沿

Yaheng Wang, Rui Meng, Xiaodong Xu, Yiming Liu, Feiliang Song, Linyuan Hu, Huishi Song, Lexi Xu, Tony Q. S. Quek, Ping Zhang

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出基于语义的具身智能物联网(SIoEI),通过语义信息统一度量解决多智能体网络中的多模态数据传输开销和逻辑推理与物理约束解耦问题,并验证其在信道鲁棒性和端到端延迟方面的优势。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00031 2026-07-02 cs.RO 新提交 50%

Joint Discovery of Object and Action Symbols through Effect Prediction for Robotic Manipulation Planning

通过效应预测联合发现物体与动作符号以进行机器人操作规划

Burcu Kilic, Berke Kartal, Fatih Dogangun, Erhan Oztop, Emre Ugur

机构 * Bogazici University(博阿齐奇大学) Ozyegin University(厄兹耶金大学) Osaka University(大阪大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出一种通过二元瓶颈层联合发现操作原语和物体类别的方法,利用预测多模态交互效应进行离散规划,在桌面重定位和堆叠任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏