arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2773 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2773 篇

2604.10169 2026-06-03 cs.AI cs.LG 57%

MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction

MAVEN-T:用于实时多智能体轨迹预测的强化异构蒸馏

Wenchang Duan, Zhenguo Gao, Jinguo Xian, Yi Shi

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Bio-X Institutes, Key Laboratory for the Genetics of Developmental and Neuropsychiatric Disorders, Shanghai Jiao Tong University(上海交通大学Bio-X研究院、发育与神经精神疾病遗传学重点实验室) Shanghai Key Laboratory of Psychotic Disorders, Brain Science and Technology Research Center, Shanghai Jiao Tong University(上海精神疾病重点实验室、脑科学与技术研究中心,上海交通大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出MAVEN-T框架,通过高容量教师模型和紧凑学生模型的异构蒸馏,结合强化学习优化,实现实时多智能体轨迹预测,在多个数据集上达到高精度与低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08173 2026-06-03 cs.AI 57%

The Agent's First Day: Benchmarking Learning, Exploration, and Scheduling in the Workplace Scenarios

Agent 的第一天:在工作场景中基准测试学习、探索和调度

Daocheng Fu, Jianbiao Mei, Rong Wu, Xuemeng Yang, Jia Xu, Ding Wang, Pinlong Cai, Yong Liu, Licheng Wen, Botian Shi

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在动态工作场景中面临的任务调度、主动探索和持续学习三大挑战,提出动态评估环境 EvoEnv,实验表明现有 agent 在这些方面存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01848 2026-06-02 cs.CV 57%

RescueBench: Can Embodied Agents Save Lives in the Wild ?

RescueBench: 具身智能体能否在野外拯救生命?

Kui Wu, Beiyu Guo, Hao Chen, ShuHang Xu, Yuling Li, Yongdan Zeng, Zhoujun Li, Yizhou Wang, Fangwei Zhong

机构 * Beihang University(北京航空航天大学) Beijing Normal University(北京师范大学) Peking University(北京大学) City University of Macau(澳门城市大学) ATEC2025 Challenge Committee(ATEC2025挑战委员会)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出 RescueBench,一个四阶段流水线的逼真诊断基准,用于评估具身智能体在搜索与救援任务中的探索、记忆和交互能力,并揭示探索和记忆失败如何传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01414 2026-06-02 cs.CV 57%

Agent Skills Should Go Beyond Text: The Case for Visual Skills

Agent技能应超越文本:视觉技能的必要性

Binxiao Xu, Ruichuan An, Bocheng Zou, Hang Hua

机构 * Peking University(北京大学) University of Wisconsin(威斯康星大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 针对现有技能学习方法仅存储文本经验导致视觉任务瓶颈的问题,提出多模态技能范式,结合文本逻辑与视觉支持,通过自动系统将经验转化为可复用的视觉技能,在GUI等视觉任务中显著优于纯文本技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00664 2026-06-02 cs.RO cs.CV 57%

SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models

SKIP: 用于高效具身世界模型的稀疏关键帧插值范式

Ziheng He, Yixiang Chen, Ning Yang, Zhanqian Wu, Qisen Ma, Yuan Xu, Jiabing Yang, Peiyan Li, Xiangnan Wu, Xiaofeng Wang, Zheng Zhu, Jing Liu, Nianfeng Liu, Yan Huang

机构 * UCAS(中国科学院自动化研究所) CASIA(中国科学院自动化研究所) NJU(南京大学) GigaAI THU(清华大学) FiveAges

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出稀疏关键帧插值范式(SKIP),通过识别任务相关关键帧并仅生成这些帧,再基于机器人动作插值缺失帧,实现高效视频生成,在LIBERO上速度提升4.16倍,FVD降低89%,且生成视频作为训练数据时策略性能下降极小。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00090 2026-06-02 cs.RO cs.AI 57%

Silent Failures in Physical AI: A Literature Review of Runtime Action Authorization for Autonomous Systems

物理AI中的静默故障:自主系统运行时动作授权的文献综述

Barak Or

机构 * STATE16

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文综述了物理AI系统中黑箱模型发出看似合理但实际错误的物理动作导致的静默故障问题,提出了运行时防护栏的分类和评估要求。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24919 2026-06-02 cs.CV 57%

Agentic AI for Remote Sensing: Technical Challenges and Research Directions

Agentic AI 在遥感中的应用:技术挑战与研究方向

Muhammad Akhtar Munir, Muhammad Umer Sheikh, Akashah Shabbir, Muhammad Haris Khan, Fahad Khan, Xiao Xiang Zhu, Begüm Demir, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 本文指出遥感中的多步分析工作流存在结构性的地理空间约束,提出面向地球观测的原生智能体设计原则,包括结构化地理空间状态、工具感知推理、验证器引导执行和有效性感知学习评估。

Comments 31 pages. Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23351 2026-06-02 cs.CV 57%

CountGD++: Generalized Prompting for Open-World Counting

CountGD++: 面向开放世界计数的通用提示

Niki Amini-Naieni, Andrew Zisserman

机构 * Visual Geometry Group (VGG)(视觉几何组(VGG)) University of Oxford, UK(牛津大学,英国)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 提出CountGD++模型,通过扩展提示方式(包括负样本描述、伪示例自动标注和外部图像示例)提升开放世界计数的灵活性、准确性和泛化能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31365 2026-06-01 cs.AI 57%

Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration

学习适应:通过认知感知探索实现自我改进的网络智能体

Weile Chen, Bingchen Miao, Qifan Yu, Wendong Bu, Guoming Wang, Wenqiao Zhang, Shengyu Zhang, Juncheng Li, Siliang Tang

机构 * Zhejiang University(浙江大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出SCALE框架,利用选择器、预测器和评判器三个对抗角色,通过环境探索自主发现智能体局限性并扩展认知边界,结合SCALE-Hop图探索策略和SCALE-20k数据集,显著提升多模态大语言模型在多种网络环境中的性能和泛化能力。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22409 2026-06-01 cs.CV 57%

SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception-Memory Integration in Embodied Environments

SpaMEM:具身环境中通过感知-记忆集成进行动态空间推理的基准测试

Chih-Ting Liao, Xi Xiao, Chunlei Meng, Zhangquan Chen, Yitong Qiao, Weilin Zhou, Tianyang Wang, Xu Zheng, Xin Cao

机构 * The University of New South Wales(新南威尔士大学) The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Fudan University(复旦大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Xinjiang University(新疆大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出SpaMEM基准,通过动作条件场景变换和多模态数据,分层评估多模态大模型在具身环境中的空间信念演化能力,揭示坐标一致性和视觉记忆瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29560 2026-05-29 cs.AI 57%

Battery-Sim-Agent: Leveraging LLM-Agent for Inverse Battery Parameter Estimation

Battery-Sim-Agent: 利用LLM智能体进行电池逆参数估计

Jiawei Chen, Xiaofan Gui, Shikai Fang, Shengyu Tao, Shun Zheng, Weiqing Liu, Jiang Bian

机构 * Peking University(北京大学) Microsoft Research(微软研究院) Zhejiang University(浙江大学) Chalmers University of Technology(皇家理工学院)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 提出Battery-Sim-Agent框架,将电池逆参数估计重构为推理任务,利用LLM智能体与高保真模拟器闭环交互,通过物理假设和结构化参数更新,显著优于贝叶斯优化等黑箱优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29074 2026-05-29 cs.CV cs.RO 57%

Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models

Embodied3DBench: 视觉语言模型低级具身空间智能的基准测试

Jiyao Zhang, Mingxu Zhang, Yitong Peng, Haoxuan Liu, Chenshuo Wang, Yuxing Long, Haoyang Huang, Dongjiang Li, Nan Duan, Hui Shen, Hao Dong

机构 * CFCS, School of CS, PKU(计算机学院CFCS,北京大学) Jingdong Technology Information Technology Co., Ltd(京东科技信息技术有限公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出Embodied3DBench基准,通过6类任务(空间结构理解与交互导向感知)系统评估视觉语言模型在3D环境中的低级空间智能,并合成130万QA对训练数据以弥补能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28683 2026-05-28 cs.AI 57%

VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

VeriTrip: 面向非结构化网络语料的旅行规划智能体可验证基准

Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学技术大学网络安全学院) Amap, Alibaba Group(阿里巴巴集团阿地图) NLPR & MAIS, Institute of Automation, CAS(中国科学院自动化研究所神经信息处理实验室及机器智能研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出VeriTrip基准,通过多模态检索库和可验证知识库,评估智能体在非结构化网络语料中基于证据推理的旅行规划能力,揭示检索-推理权衡问题。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28534 2026-05-28 cs.CL 57%

GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection

GUI-CIDER:通过因果内化和密度感知示例重选进行GUI代理的中期训练

Zheng Wu, Chengcheng Han, Zhengxi Lu, Tianjie Ju, Yanyu Chen, Qi Gu, Xunliang Cai, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 提出GUI-CIDER中期训练方法,通过因果内化和密度感知示例重选显式内化GUI世界知识,提升代理对GUI操作的理解和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28083 2026-05-28 cs.CV 57%

VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking

VLA-Hijack: 通过视觉本体感觉劫持实现针对视觉-语言-动作模型的可迁移补丁攻击

Jiyuan Fu, Kaixun Jiang, Jingkai Jia, Zhaoyu Chen, Xueyao Chen, Lingyi Hong, Shuyong Gao, Chenzhi Tan, Dingkang Yang, Wenqiang Zhang

机构 * Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出VLA-Hijack框架,通过注意力引导的本体感觉抑制和多模态本体感觉注入攻击视觉自定位过程,实现跨架构黑盒迁移攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28077 2026-05-28 cs.AI 57%

MACReD: A Multi-Agent Collaborative Reasoning Framework for Reaction Diagram Parsing

MACReD:一种用于反应图解解析的多智能体协作推理框架

Chuang Tang, Chenhao Lin, Yin Xu, Hao Wang, Jinrui Zhou, Xin Li, Mingjun Xiao, Enhong Chen

机构 * University of Science Technology of China \& iFLYTEK Co., Ltd. Hefei China Technology of China \& iFLYTEK Co., Ltd.

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出MACReD分层多智能体框架,通过协调分子感知、箭头理解、文本提取和反应重建等专用智能体,在统一VLM引导架构下实现化学图解解析,在RxnScribe基准上达到最优性能。

Comments Preprint. Code is available at https://github.com/TC9905/MACReD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28056 2026-05-28 cs.CV 57%

CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning

CogPortrait: 通过分层智能体规划实现肖像动画中的细粒度眼部区域控制

He Feng, Yongjia Ma, Donglin Di, Lei Fan, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出CogPortrait两阶段框架,利用多模态大语言模型智能体从高层标签生成关键点,再通过DiT视频生成骨干合成动画,实现细粒度眼部控制,并引入EMH基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27705 2026-05-28 cs.CR cs.MM 57%

AgenticVBench: Can AI Agents Complete Real-World Post-Production Tasks?

AgenticVBench: AI代理能否完成真实的后期制作任务?

Zongheng Cao, Yi Zheng, Rui Song, Xinyu Hu

专题命中 多模态Agent :multimodal(abstract);分类 cs.MM

AI总结 本文提出AgenticVBench基准,包含100个来自真实后期制作流程的代理任务,评估多模态AI代理的复合能力,发现最佳代理栈性能仅略超30%,远低于人类专家。

Comments 22 pages, 6 figures. Benchmark website: https://agenticvbench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05673 2026-05-28 cs.RO cs.AI 57%

Rectified Schrödinger Bridge Matching for Few-Step Visual Navigation

整流薛定谔桥匹配用于少步视觉导航

Wuyang Luan, Junhui Li, Weiguang Zhao, Wenjian Zhang, Tieru Wu, Rui Ma

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) College of Computer Science, Chongqing University(重庆大学计算机学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Changchun GenY Technology Co., Ltd.(长春GenY科技有限公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出整流薛定谔桥匹配(RSBM)框架,利用速度场结构不变性和线性方差减少,在仅3步积分中实现高保真生成策略,满足具身AI低延迟需求。

Comments 18 pages, 7 figures, 10 tables. Code available at https://github.com/WuyangLuan/RSBM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09367 2026-05-28 cs.CV 57%

EpiAgent: An Agent-Centric System for Ancient Inscription Restoration

EpiAgent: 一种以智能体为中心的古铭文修复系统

Shipeng Zhu, Ang Chen, Na Nie, Pengfei Fang, Min-Ling Zhang, Hui Xue

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用关键实验室(东南大学),教育部,中国) Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China(计算机网络与信息集成关键实验室(东南大学),教育部,中国) Nanjing University Museum, Nanjing University, China(南京大学博物馆,南京大学,中国) The China Centre for Linguistic and Strategic Studies, Nanjing University, China(中国语言战略研究中心,南京大学,中国)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出基于智能体的EpiAgent系统,通过分层规划与LLM协调多模态分析、历史经验和专用工具,实现灵活自适应的古铭文修复,在真实退化铭文上取得更优修复质量和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27074 2026-05-27 cs.CV 57%

IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams

IPIBench: 在连续流下评估多模态大模型的交互式主动智能

Jinzhao Li, Yinuo Chen, Wenxuan Song, Yijia Lei, Yichi Zhang, Honglei Yan, Panwang Pan, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) ByteDance(字节跳动)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出IPIBench基准,用于评估多模态大模型在流式视频场景中的交互式主动智能,并设计IPI-Agent框架以改善主动触发和交互协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24456 2026-05-27 cs.CV 57%

EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy

EgoProx: 在认知层级上评估多模态大语言模型的自我中心3D邻近推理能力

Jinzhao Li, Yinuo Chen, Dongxu Piao, Panwang Pan, Yifan Yu, Dong Wang, Honglei Yan, Liang Yue, Shaofei Wang, Yixin Chen, Siyuan Huang, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) ByteDance(字节跳动) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出EgoProx基准,通过认知链任务和基于智能体的数据引擎,评估多模态大语言模型在自我中心3D邻近推理中的表现,发现模型虽具备空间知识但难以有效利用。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25748 2026-05-26 cs.AI 57%

Agent-Centric Social Trajectory Prediction: A Free Energy Principle Perspective

以智能体为中心的社交轨迹预测:自由能原理视角

Yanping Wu, Ji Zhang, Hao Chen, Edmond S. L. Ho, Chongfeng Wei

机构 * University of Glasgow(格拉斯哥大学) Southwest Jiaotong University(西南交通大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 针对现有轨迹预测方法依赖全局状态、部分可观测下信念推理不足及缺乏认知行为约束的问题,提出基于自由能原理的智能体中心轨迹预测框架FEP-Diff,通过双分支时空编码器、目标条件信念学习器和残差扩散轨迹生成器,在受限可观测条件下实现认知合理的预测。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03804 2026-05-26 cs.AI 57%

ScrapMem: A Bio-inspired Framework for On-device Personalized Agent Memory via Optical Forgetting

ScrapMem: 一种基于生物启发的光学遗忘机制用于设备端个性化智能体记忆

Jiale Chang, Yuxiang Ren

机构 * Nanjing Agricultural University(南京农业大学) Nanjing University(南京大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出ScrapMem框架,通过光学遗忘机制压缩旧记忆并构建情节记忆图,在资源受限设备上实现高效多模态长期记忆,在ATM-Bench上取得51.0% Joint@10新最优,存储降低93%,召回率提升至70.3%。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15777 2026-05-26 cs.AI 57%

SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows?

SaaS-Bench:计算机使用代理能否利用真实世界SaaS解决专业工作流程?

Kean Shi, Zihang Li, Tianyi Ma, Zengji Tu, Jialong Wu, Xinbo Xu, Qingyao Yang, Ruoyu Wu, Weichu Xie, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

机构 * UniPat AI PKU(北京大学) HKU(香港大学) G Labs(0G实验室) Pipeline Lab(Pipeline实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出SaaS-Bench基准,包含23个可部署SaaS系统和106个真实工作场景任务,评估计算机使用代理在长期规划、跨应用协调等能力上的表现,发现最强模型端到端任务完成率不足4%。

Comments 24 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09179 2026-05-26 cs.AI 57%

Hide-and-Shill: A Reinforcement Learning Framework for Market Manipulation Detection in Symphony-a Decentralized Multi-Agent System

Hide-and-Shill:面向交响乐系统中市场操纵检测的强化学习框架——一个去中心化多智能体系统

Ronghua Shi, Yiou Liu, Yuchun Feng, Lynn Ai, Bill Shi, Zhuang Liu

机构 * Department of Information Systems, City University of Hong Kong(香港城市大学信息系统系) Business School, University of New South Wales(新南威尔士大学商学院) Division of Engineering Science, University of Toronto(多伦多大学工程科学系) ProphetAI Data Technology Co., Ltd.(ProphetAI数据技术有限公司) Gradient, 3 FRASER STREET DUO TOWER, SINGAPORE(Gradient新加坡办公室)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 提出一个多智能体强化学习框架,通过动态对抗博弈建模操纵者与检测者的交互,利用延迟代币价格反应识别可疑模式,并集成GRPO、理论奖励函数和多模态智能体管道,在去中心化交响乐系统中实现无需中心化预言机的鲁棒操纵检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24002 2026-05-26 physics.chem-ph cond-mat.mtrl-sci cs.AI physics.comp-ph 57%

Harnessing AtomisticSkills for Agentic Atomistic Research

利用原子技能实现代理原子研究

Bowen Deng, Bohan Li, Matthew Cox, Hoje Chun, Juno Nam, Artur Lyssenko, Sathya Edamadaka, Jurgis Ruza, Xiaochen Du, Nofit Segal, Jesus Diaz Sanchez, Mingrou Xie, Ty Perez, Yu Yao, Miguel Steiner, Sauradeep Majumdar, Charles B. Musgrave, Anirban Chandra, Abhirup Patra, Detlef Hohl, Connor W. Coley, Ju Li, Rafael Gómez-Bombarelli

机构 * Department of Materials Science Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA Department of Chemical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA Department of Chemistry, Kookmin University, Seoul 02707, Republic of Korea Harvard University, Department of Chemistry Department of Chemistry, Massachusetts Institute of Technology, Cambridge, MA 02139, USA Department of Nuclear Science Shell Information Technology International Inc., Texas 77082, United States Shell International Exploration \& Production Inc., Texas 77079, United States

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出AtomisticSkills框架,通过分层分解科学工作流为技能和工具,使通用AI编码代理能够进行原子级研究,并在多个科学任务中验证其能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09583 2026-05-25 cs.RO cs.AI 57%

AirVista-II: An Agentic System for Embodied UAVs Toward Dynamic Scene Semantic Understanding

AirVista-II:面向动态场景语义理解的具身无人机智能体系统

Fei Lin, Yonglin Tian, Tengchao Zhang, Jun Huang, Sangtian Guan, Fei-Yue Wang

机构 * Department of Engineering Science, Faculty of Innovation Engineering, Macau University of Science and Technology(创新工程学院工程科学系,澳门科学技术大学) State Key Laboratory for Management and Control of Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统管理与控制国家重点实验室,中国科学院自动化研究所) State Key Laboratory for Management and Control of Complex Systems, Chinese Academy of Sciences(复杂系统管理与控制国家重点实验室,中国科学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出AirVista-II端到端智能体系统,通过集成智能体任务识别调度、多模态感知和差异化关键帧提取策略,实现零样本下无人机动态场景的通用语义理解与推理。

Journal ref Proc. 2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC), pp. 6319-6324, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22177 2026-05-22 cs.LG cs.CL 57%

Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles

Maestro:通过强化学习协调分层模型-技能集合

Jinyang Wu, Guocheng Zhai, Ruihan Jin, Yuhao Shen, Zhengxi Lu, Fan Zhang, Haoran Luo, Zheng Lian, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 本文提出Maestro框架,通过强化学习协调多模态任务,利用分层模型-技能集合提升多模态任务性能,实现高效且通用的协调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20342 2026-05-22 cs.CV 57%

ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning

ParaVT: 平衡工具先验悖论以实现代理视频强化学习中的并行工具使用

Zuhao Yang, Kaichen Zhang, Sudong Wang, Keming Wu, Zhongyu Yang, Bo Li, Xiaojuan Qi, Shijian Lu, Xingxuan Li, Lidong Bing

机构 * MiroMind NTU(国立台湾大学) HKU(香港大学) HKUST(GZ)(香港科技大学(广州)) THU(清华大学) LMMs-Lab(LMMs实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出ParaVT,一种用于并行视频工具调用的端到端强化学习框架,通过引入PARA-GRPO机制解决工具先验悖论,提升了长视频理解的性能。

Comments Project Page: https://evolvinglmms-lab.github.io/ParaVT/

详情

展开后加载摘要…

URL PDF HTML 收藏