arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-16 至 2026-07-16 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 8 篇

2607.13854 2026-07-16 cs.CL 新提交 79%

SPyCE: Skill-Policy Co-evolution for Multimodal Agents

SPyCE:多模态智能体的技能-策略协同进化

Ru Zhang, Weijie Qiu

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 研究多模态智能体,提出SPyCE框架,将推理轨迹提炼为分层技能库与策略协同进化,执行技能捕获局部操作,工作流技能编码高级先验,实验证明该框架优于基线,为构建多模态智能体提供新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13558 2026-07-16 cs.AI 新提交 70%

Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling

基于工具增强证据的多智能体协作推理用于城市区域剖析

Xixuan Hao, Yutian Jiang, Jiabo Liu, Yihang Yang, Guangyin Jin, Song Gao, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Washington(华盛顿大学) Chang’an University(长安大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究针对城市区域剖析问题,提出UrbanAgent框架,通过多智能体协作推理解决跨模态不一致,将指标预测扩展为闭环过程,经实验验证其性能优于现有基线,在未见城市设置中有强泛化性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14075 2026-07-16 cs.SE 新提交 67%

VisualRepair: Dynamic Tool Calling and Region Focusing for Visual Software Issue Repair

VisualRepair:用于视觉软件问题修复的动态工具调用和区域聚焦

Jingyu Xiao, Zhongyi Zhang, Haoran Hou, Yuxuan Wan, Yuan Jiang, Yintong Huo, Michael R. Lyu

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract)

AI总结 针对现代软件视觉信息利用难题,提出VisualRepair框架,通过图像类型感知工具调用和动态测试时区域聚焦两模块,在SWE-bench基准测试中性能超现有方法,有效提升自动视觉软件问题修复能力。

Comments The paper was completed in March 2026 and is currently under review. The code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13560 2026-07-16 q-bio.NC cs.AI 新提交 57%

Grounded world models in biological organisms and future embodied AI

生物有机体和未来具身人工智能中的基础世界模型

Giovanni Pezzulo, Davide Nuzzi, Marco D'Alessandro, Riccardo Proietti, Roberto Bottini, Paul Cisek

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究探讨生物有机体中基础世界模型,通过五个神经回路例子揭示当前具身人工智能缺失的特征,如内在动力学作用等,还讨论了生物系统原则对未来具身人工智能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12477 2026-07-16 cs.CV 版本更新 57%

Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence

自我在空间中:无人机具身智能中的自我意识与空间认知基准测试

Zhishan Zou, Guoyan Sun, Zhiwei Wei, Jiancheng Pan, Yujie Li, Mugen Peng, Wenjia Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Hunan Normal University(湖南师范大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 研究针对无人机具身智能中自我意识与空间认知问题,引入SIS - Bench基准,通过多维度层次评估,揭示现有模型局限,探索运动感知表征提升性能,强调自我意识重要性,提供新基准和实证依据。

Comments Website:https://choucisan.github.io/publications/self-in-space ; Code:https://github.com/IntelliSensing/Self-in-Space

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18685 2026-07-16 cs.CV cs.RO 版本更新 57%

Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents

超越描述:为具身智能体进行细粒度动作的认知基准测试

Dayong Liu, Chao Xu, Weihong Chen, Suyu Zhang, Juncheng Wang, Jiankang Deng, Baigui Sun, Yang Liu

机构 * Zhejiang University(浙江大学) Wolf 1069 b(沃尔夫1069b) Sany Group(三一集团) The Hong Kong Polytechnic University(香港理工大学) Imperial College London(帝国理工学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出CFG-Bench基准测试,旨在评估具身智能体在物理交互中的细粒度动作能力,揭示现有MLLMs在高层次推理中的不足,并通过监督微调提升其性能。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12349 2026-07-16 cs.CR cs.AI cs.SE 版本更新 57%

Mind the Gap: Action Rebinding Attacks against Android GUI Agents

零权限操纵:我们能否信任由大型多模态模型驱动的GUI代理?

Yi Qian, Kunwei Qian, Xingbang He, Ligeng Chen, Jikang Zhang, Tiantai Zhang, Haiyang Wei, Linzhang Wang, Hao Wu, Bing Mao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Hornor Device Co., Ltd(Hornor设备有限公司) Institute of Dataspace, Hefei Comprehensive National Science Center(数据空间研究所,合肥综合性国家科学中心)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究揭示了由大型多模态模型驱动的GUI代理在Android中存在视觉原子性假设的漏洞,通过零权限攻击实现对代理执行的重新绑定,并利用意图对齐策略绕过验证门,展示了代理-操作系统集成中的安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13067 2026-07-16 cs.RO 新提交 50%

A 3DGS-Driven Dynamic Viewpoint and Vibrotactile Framework for Subsea Teleoperation Validated via fNIRS

一种由 3DGS 驱动的用于水下遥操作的动态视点和振动触觉框架,并通过功能近红外光谱法进行验证

Fang Xu, Tianyu Zhou, Ruitong Tian, Md Jahidul Islam, Jing Du

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究针对水下遥操作受限于二维视图和通信延迟的问题,提出基于 ROS - Unity 框架的多模态架构,用 3DGS 驱动的 DAVS 及振动触觉套装辅助,经实验验证该方式能提升操作员性能与认知耐力。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏