arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 112 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 112 篇

2505.14418 2026-06-16 cs.CL 版本更新 89%

Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI Agents

隐藏的幽灵之手:揭示MLLM驱动的移动GUI代理中的后门漏洞

Pengzhou Cheng, Haowen Hu, Zheng Wu, Zongru Wu, Tianjie Ju, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Huawei Inc.(华为公司)

专题命中 多模态Agent :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL

AI总结 本研究提出AgentGhost框架,通过组合目标和交互层触发器,利用监督对比学习和微调注入后门,在移动GUI代理中实现高成功率和隐蔽性,攻击准确率达99.7%。

Comments EMNLP-Findings 2025 (Correcting model settings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30931 2026-06-15 cs.CL 版本更新 89%

MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft

MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索能力

Tianjie Ju, Yueqing Sun, Zheng Wu, Wei Zhang, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Gongshen Liu, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团)

专题命中 多模态Agent :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL

AI总结 提出MineExplorer基准,通过多智能体合成工作流构建隐式多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力,发现长轨迹协调仍是挑战。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00810 2026-07-01 cs.CV cs.AI cs.CL cs.HC cs.LG 版本更新 87%

GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding

GUI-AIMA: 对齐内在多模态注意力与上下文锚点以实现GUI定位

Shijie Zhou, Viet Dac Lai, Hao Tan, Jihyung Kil, Wanrong Zhu, Changyou Chen, Ruiyi Zhang

机构 * University at Buffalo(布法罗大学) Adobe Research(Adobe研究院)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 GUI-AIMA通过多模态注意力对齐与上下文锚点,实现高效的GUI定位,无需坐标生成,提升数据效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23483 2026-07-07 cs.CV cs.CL 版本更新 86%

SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning

SpecEyes: 通过推测感知和规划加速代理多模态大语言模型

Haoyu Huang, Jinfa Huang, Zhongwei Wan, Xiawu Zheng, Rongrong Ji, Jiebo Luo

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 SpecEyes通过推测规划框架减少代理多模态大语言模型的序列开销,提升并发性能,实验显示在保持准确性的同时实现1.1-3.35倍的加速。

Comments ECCV 2026, Code: https://github.com/MAC-AutoML/SpecEyes

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14157 2026-07-03 cs.AI cs.CV 版本更新 85%

Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

Ophiuchus: 激励工具增强的“图像思考”用于联合医学分割、理解与推理

Yankai Jiang, Yujie Zhang, Peng Zhang, Wenjie Li, Yichen Li, Jintai Chen, Xiaoming Shi, Shihui Zhen

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Information Hub, HKUST (Guangzhou)(信息枢纽,香港科技大学(广州))

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出Ophiuchus框架,通过三阶段训练策略(冷启动SFT、自反思微调、工具强化学习)使MLLM动态聚焦细粒度视觉区域,实现精准医学分割与诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21457 2026-06-09 cs.CV cs.AI 版本更新 85%

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力

Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Mingyu Liu, Zheng Huang, Anzhou Li, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。

Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08340 2026-08-04 cs.CV cs.AI 版本更新 84%

Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time

PokeGym: 一种以视觉驱动的长周期基准用于视觉-语言模型

Ruizhi Zhang, Ye Huang, Yuangang Pan, Chuanfu Shen, Zhilin Liu, Ting Xie, Haijun Lei, Lixin Duan

机构 * SIAS, UESTC(电子科技大学深圳高等研究院) CFAR/IHPC A*STAR(新加坡科技研究局高性能计算研究所)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 PokeGym通过复杂的3D开放世界游戏评估视觉-语言模型在长周期任务中的表现,揭示了物理死锁恢复是当前模型的主要瓶颈,并发现高级模型存在元认知分歧。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21013 2026-07-28 cs.AI cs.CV 版本更新 84%

EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization

EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解

Lihuang Fang, Yuchen Zou, kebing Jin, Jinghui Qin

机构 * Guangdong University of Technology(广东工业大学) Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有多模态情感识别方法忽视情感源动态性和复杂性的问题,提出基于强化学习的动态智能体专业化框架EmoAgent-R1,采用冷启动策略和两步智能体工作流程训练,并用P-GRPO优化,实验证明其在情感推理性能和优化稳定性上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21005 2026-07-17 cs.AI cs.CL 版本更新 84%

Building Agent Harnesses for Scientific Curation from Multimodal Sources

构建用于多模态来源科学数据提取的智能体框架

Sheng Zhang, Qin Liu, Renqian Luo, Shufang Xie, Reuben Tan, Sean Hayes, Gregory Bryman, Wendong Ge, Ruilian Zhang, Oluwaseun Egbelowo, Kelly Yee, Hoifung Poon

机构 * Microsoft Research(微软研究院) University of California, Davis(加州大学戴维斯分校) Merck & Co., Inc., Rahway, NJ, USA(默克公司(美国新泽西州拉威))

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 提出Beaver框架,通过任务分解、多模态证据工具和可追溯性,将科学文献中的结构化信息提取转化为可审计的工作流,在GRAS指标上比前沿智能体提升23个绝对百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24112 2026-08-12 cs.AI 版本更新 83%

ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection

ReMMD: 面向多模态虚假信息检测的现实多语言多图像智能体验证

Chenhao Dang, Dantong Zhu, Jun Yang, Conghui He, Weijia Li

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Central South University(中南大学) China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出ReMMD框架,包含多语言多图像基准ReMMDBench和持久记忆验证器ReMMD-Agent,通过原子点分解和可重用证据集实现高效准确的多模态虚假信息检测。

Comments The project is available at https://dang-ai.github.io/ReMMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14029 2026-07-30 cs.CV 版本更新 83%

POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management

POINTS-Seeker:从零开始训练多模态代理搜索模型

Yikun Liu, Yuan Liu, Haicheng Wang, Zhongyin Zhao, Le Tian, Xiao Zhou, Jiangchao Yao, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) CMIC, Shanghai Jiao Tong University(上海交通大学CMIC) WeChat AI, Tencent(腾讯WeChat AI)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出POINTS-Seeker模型,通过引入代理播种机制和V-Fold压缩方案,解决长周期交互中的证据检索问题,并在六个基准测试中超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04514 2026-06-10 cs.AI cs.CE cs.CL cs.CV stat.ME 版本更新 83%

ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering

ChartAgent: 一种用于复杂图表问答中视觉基础推理的多模态智能体

Rachneet Kaur, Nishan Srishankar, Zhen Zeng, Sumitra Ganesh, Manuela Veloso

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出ChartAgent框架,通过迭代分解查询为视觉子任务并利用图表专用视觉工具(如绘制注释、裁剪区域)进行空间域推理,在ChartBench和ChartX上取得最先进性能,尤其对无标注图表提升显著。

Comments Accepted at ACL 2026 (Main Conference). Also presented as an oral paper at the NeurIPS 2025 Multimodal Algorithmic Reasoning Workshop (https://marworkshop.github.io/neurips25/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14593 2026-07-20 cs.HC cs.AI cs.CL 版本更新 82%

Memory-Driven Self-Disclosure and Relational Turning Points: A Longitudinal Multimodal Study of Human-AI Interaction

记忆驱动的自我表露与关系转折点:人机交互的纵向多模态研究

Ryuichi Sumida, Mao Saeki, Masaki Eguchi, Sadahiro Yoshikawa, Koji Inoue, Tatsuya Kawahara, Yoichi Matsuyama

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科) Equmenopolis, Inc.(Equmenopolis公司) Waseda University(早稻田大学) School of Informatics, Kyoto University(京都大学信息学系)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究通过纵向多模态研究,探讨对话式人工智能系统中交互如何发展为关系。核心方法是让参与者对五个关系构建要素评分,发现对话质量影响当下愉悦感,感知记忆受关系制约,关系有崩溃和激增等转折点,揭示了人机关系建立的方式。

Comments 15 pages, 3 figures. Accepted to ICMI 2026 (International Conference on Multimodal Interaction), October 5-9, 2026, Napoli, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11844 2026-08-05 cs.CV 版本更新 81%

Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding

超越单摄像头:体育视频理解中的智能多视角推理

Kerui Chen, Jinglu Wang, Xiaoyi Zhang, Yan Lu

机构 * Zhejiang University(浙江大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 针对体育视频多视角理解缺乏评估基准及MLLMs难以利用多视角信息的问题,引入SportMV - Bench基准,分析瓶颈所在,并提出SportMV - Agent框架,通过迭代循环实现主动视角选择等,相比最强MLLM基线有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16300 2026-07-23 cs.AI 版本更新 81%

Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection

循环代码取证:面向图像伪造检测的代理工具使用

Fanrui Zhang, Qiang Zhang, Sizhuo Zhou, Jianwen Sun, Chuanhao Li, Jiaxin Ai, Yukang Feng, Yujie Zhang, Wenjie Li, Zizhen Li, Yifan Chang, Jiawei Liu, Kaipeng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态Agent :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出ForenAgent框架,通过多轮交互使MLLM自主生成并迭代优化Python工具,提升图像伪造检测的灵活性和可解释性,构建FABench数据集进行系统训练和评估。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11459 2026-07-21 cs.CL cs.CV 版本更新 81%

Octopus v3: Technical Report for On-device Sub-billion Multimodal AI Agent

章鱼v3:用于设备端低于十亿参数的多模态人工智能代理的技术报告

Wei Chen, Zhiyuan Li

机构 * Stanford University(斯坦福大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究针对多模态人工智能代理将图像数据转化为可行动结果的挑战,引入含功能令牌概念的多模态模型,优化至小于10亿参数,能处理中英文,可在多种边缘设备高效运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10079 2026-07-17 cs.AI cs.CL 版本更新 81%

MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation

MAG:用于多模态动作与引导生成的网络智能体基准测试与工具包

Chengguang Gan, Hanjun Wei, Yunhao Liang, Zhixi Cai, Qinghao Zhang, Shiwen Ni

机构 * University of Chinese Academy of Sciences(中国科学院大学) Monash University(莫纳什大学) Pusan National University(釜山国立大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 介绍MAG这一网络智能体基准测试,统一任务执行与引导写作,有基于截图的定位方案和完整工具包。用其评估模型并详细分析,还设计GRPO训练方法,提升智能体成功率与引导质量,指出当前模型任务完成率低,为后续研究提供方向。

Comments 8 pages main text, 21 pages total including appendices; 11 figures, 7 tables, 2 algorithms. Benchmark, harness, and model checkpoints to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13572 2026-07-17 cs.CL cs.AI 版本更新 81%

ArogyaSutra: A Multi-Agent Framework for Multimodal Medical Reasoning in Indic Languages

ArogyaSutra:面向印度语言的多模态医学推理的多智能体框架

Tanmoy Kanti Halder, Akash Ghosh, Subhadip Baidya, Arijit Roy, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度理工学院巴特那分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) Prasannadeb Women’s College(普拉萨纳德布女子学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对印度语言医疗场景中多模态大语言模型性能不足的问题,提出多模态医学问答数据集ArogyaBodha和基于演员-评论家的多智能体框架ArogyaSutra,通过工具接地与双记忆机制提升多语言医学推理准确性。

Comments Accepted for publication in IJCAI,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12056 2026-07-02 cs.AI cs.CL 版本更新 81%

XSkill: Continual Learning from Experience and Skills in Multimodal Agents

XSkill: 多模态智能体中的经验与技能持续学习

Guanyu Jiang, Zhaochen Su, Xiaoye Qu, Yi R. Fung

机构 * Zhejiang University(浙江大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出XSkill双流框架,通过视觉经验与技能的知识提取、检索和自适应,实现多模态智能体在开放场景中无需参数更新的持续学习,显著提升工具使用和推理泛化能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19436 2026-08-12 cs.CV cs.AI cs.LG cs.MM 版本更新 80%

VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection

VDC-Agent:当视频详细描述器通过代理自我反思而自我进化

Qiang Wang, Xinyuan Gao, Yuhang He, Jizhou Han, Jiangyang Li, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。

Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07126 2026-08-12 cs.RO cs.AI cs.LG 版本更新 79%

RankFormer: A Propose-then-Select Transformer for Multi-Agent Multimodal Trajectory Prediction

自发现意图感知变换器用于多模态车辆轨迹预测

Diyi Liu, Zihan Niu, Tu Xu, Xingchen Zhang, Lishan Sun

专题命中 多模态Agent :multimodal(title);multi-modal(abstract);分类 cs.AI

AI总结 本文提出一种基于Transformer的多模态车辆轨迹预测模型,通过分离空间模块和轨迹生成模块提升预测性能,并通过预测残差偏移学习有序轨迹。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03571 2026-08-07 cs.CV 版本更新 79%

Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning

超越单纯的环境规模扩展:为多模态智能体学习设计有效的环境分布

Kejian Zhu, Zhuoran Jin, Dongqi Huang, Hongbang Yuan, Yupu Hao, Kang Liu, Jun Zhao

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对多模态智能体学习中单纯扩展环境数量无效的问题,提出AES与HDC两种方法优化环境分布,提升了智能体训练效果。

Comments Code: https://github.com/GaryStack/Beyond-MMEnv-Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28978 2026-08-04 cs.AI cs.CE 版本更新 79%

VFEAgent: A Multimodal Agent Framework for End-to-End Automated Finite Element Analysis

VFEAgent: 面向端到端自动化有限元分析的多模态智能体框架

Jiachen Zhang, Junyi Lao, Chenghao Liu, Siyuan Liu, Shixin Wu, Linsen Zhang, Boyu Wang, Songfang Huang

机构 * Peking University(北京大学) China Agricultural University(中国农业大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出VFEAgent多智能体系统,通过多模态视觉-语言流水线和验证优先的代码合成框架,实现从输入图像和问题描述到有限元建模与仿真的端到端自动化。

Comments 9 pages, 3 figures, 2 tables. Equal contribution: Jiachen Zhang and Junyi Lao. Corresponding author: Songfang Huang. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03438 2026-08-03 cs.AI 版本更新 79%

Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents

具有自适应验证器的多模态强化学习

Reuben Tan, Baolin Peng, Zhengyuan Yang, Hao Cheng, Oier Mees, Theodore Zhao, Andrea Tupini, Isar Meijer, Qianhui Wu, Yuncong Yang, Lars Liden, Yu Gu, Sheng Zhang, Xiaodong Liu, Lijuan Wang, Marc Pollefeys, Yong Jae Lee, Jianfeng Gao

机构 * Microsoft Research(微软研究院) UMass Amherst(马萨诸塞大学阿默斯特分校) ETH Zurich(苏黎世联邦理工学院) UW–Madison(威斯康星大学麦迪逊分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Argos验证器,通过结合SFT数据筛选与RL训练,提升多模态推理模型在空间推理、视觉幻觉及机器人任务中的性能,同时减少奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00446 2026-07-21 cs.AI 版本更新 79%

Benchmarking Agentic Newswriting via Journalistic Workflows

通过新闻工作流程对智能新闻写作进行基准测试

Yen-Che Chien, Kuang-Da Wang, Wei-Yao Wang, Wen-Chih Peng

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Sony Group Corporation(索尼集团)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 研究智能体在新闻写作工作流程中的表现,引入NEWSAGENT基准,给定写作指令和部分材料,评估智能体搜索、选信息及改草稿能力,发现其检索事实尚可,但规划和叙事整合有困难,为评估智能体能力提供现实测试平台。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10350 2026-07-20 cs.AI cs.RO 版本更新 79%

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

ABot-AgentOS:一个具有终身多模态记忆的通用机器人智能体操作系统

Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Zixiao Tang, Zhining Gu, Yang Cai, Linbo Zheng, Jingjing Ma, Mingyang Yin, Zedong Chu, Wenbin Tang, Mu Xu

机构 * AMAP CV Lab(AMAP计算机视觉实验室)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 研究针对长期具身智能体运行需求,提出ABot-AgentOS通用机器人智能体操作系统,引入EmbodiedWorldBench基准,采用通用多模态图记忆及失败驱动自我进化循环,在相关测试中表现良好,证明该系统层可提升具身执行并提供持久记忆。

Comments Code: https://github.com/amap-cvlab/ABot-AgentOS Project page: https://amap-cvlab.github.io/ABot-AgentOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29538 2026-07-20 cs.SE cs.AI 版本更新 79%

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

RESOURCE2SKILL: 从人类创建的多模态资源中提取可执行智能体技能

Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng, Qi Dai, Bei Liu, Kai Qiu, Yue Dong, Ji Li, Chong Luo

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Shanghai Jiao Tong University(上海交通大学) Microsoft(微软)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出RESOURCE2SKILL框架,从教程视频、代码库、文章等人类多模态资源中提取可执行技能,构建分层多模态技能维基,提升智能体在七个领域的任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13771 2026-07-07 cs.CV 版本更新 79%

AppAgent: Multimodal Agents as Smartphone Users

AppAgent:作为智能手机用户的多模态智能体

Chi Zhang, Zhao Yang, Jiaxuan Liu, Yanda Li, Yucheng Han, Xin Chen, Zebiao Huang, Bin Fu, Gang Yu

机构 * Tencent(腾讯)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 介绍基于大语言模型的多模态智能体框架,通过简化动作空间操作智能手机应用,无需系统后端访问,经自主探索或观察人类示范学习,能执行复杂任务,测试验证其处理多种高级任务的能力。

Comments Accepted to CHI 2025, project page is https://appagent-official.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00588 2026-06-24 cs.CV 版本更新 79%

Response-Aware Multimodal Learning for Post-Treatment Visual Acuity Forecasting

响应感知的多模态学习用于治疗后视力预测

Phuoc-Nguyen Bui, Van-Vi Vo, Duc-Tai Le, Junghyun Bum, Van-Nguyen Pham, Ki-Young Kim, Seung-Young Yu, Hyunseung Choo

机构 * Research Convergence Institute(研究融合研究所) Sungkyunkwan University(全北大学) Dept. of AI Systems Engineering(人工智能系统工程系) Dept. of Ophthalmology(眼科系) Kyung Hee University Medical Center(庆熙大学医学院) Dept. of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 提出ReVA框架,利用基线与第1个月OCT影像及表格数据,通过多模态融合预测糖尿病性黄斑水肿患者抗VEGF治疗后3-24个月的视力轨迹。

Comments To appear in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23014 2026-06-16 cs.CV 版本更新 79%

Planning with Unified Multimodal Models

统一多模态模型规划

Yihao Sun, Zhilong Zhang, Yang Yu, Pierre-Luc Bacon

机构 * Mila - Québec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Nanjing University(南京大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 提出Uni-Plan框架,利用统一多模态模型同时作为策略、动态模型和价值函数,通过自判别过滤避免动态预测幻觉,在具身决策任务中优于VLM方法,无需专家演示且数据可扩展。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏