arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2773 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2773 篇

2608.07959 2026-08-11 cs.AI 新提交 57%

SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning

SCOUT:面向超长时长自我中心视频推理的自检查与恢复感知工具思维智能体

Keyang Zhong, Kuo Wang, Peng Liu, Quanlong Zheng, Junlin Xie, Zhijia Liang, Yanhao Zhang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute(深圳河套学院) Guangdong OPPO Mobile Telecommunications Corp., Ltd.(广东欧珀移动通信有限公司) OPPO AI Center(OPPO人工智能中心) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本研究提出SCOUT智能体框架,结合自适应策略与UPS-GRPO方法,解决超长自我中心视频推理的错误传播及信用分配问题,在对应基准上达最优性能且短时长场景仍具竞争力。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07955 2026-08-11 cs.AI 新提交 57%

Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning

面向工具增强空间推理的自演化神经符号技能

Shi-Yu Tian, Zhuo-Xia Wang, Xuan-Yi Zhu, Zhi Zhou, Xinwei Yang, Kun-Yang Yu, Ming Yang, Yang Chen, Yu-Feng Li

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 该研究针对视觉-语言模型在细粒度空间任务上的不可靠问题,提出神经符号框架NeSy-Spatial,通过自演化空间技能提升工具利用精度与空间推理准确率。

Comments 25 pages, 9 figures, 10 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21165 2026-08-11 cs.RO cs.AI 版本更新 57%

OmniV2X: A Generative Foundation Planner for Efficient End-to-End Cooperative Driving

OmniV2X:一种用于高效端到端协同驾驶的生成式基础规划器

Juntong Peng, Juanwu Lu, Yupeng Zhou, Can Cui, Yaobin Chen, Ziran Wang

机构 * Purdue University(普渡大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 提出OmniV2X生成式基础模型,通过端到端监督训练和交叉注意力注入,利用多模态多智能体上下文实现高效协同驾驶,在DAIR-V2X-Seq数据集上以少于10%微调数据和1%通信带宽达到最优性能。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26041 2026-08-11 cs.CV 版本更新 57%

Where and How to Prune: An Empirical Study of Visual Token Pruning for GUI Agent Navigation

重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角

Daiqiang Li, Zihao Pan, Zeyu Zhang, Xuyang Liu, Shijia Xu, Ronghao Chen, Huacan Wang, Honggang Chen, Linfeng Zhang, Zhangquan Chen, Haiyun Jiang

机构 * Sichuan University(四川大学) Sun Yat-sen University(中山大学) Australian National University(澳大利亚国立大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :MLLM(abstract_cn);分类 cs.CV

AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11741 2026-08-11 cs.AI 版本更新 57%

Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasoning in Murder Mystery Games

协作多智能体脚本生成以增强谋杀谜游戏中的不完全信息推理

Keyang Zhong, Junlin Xie, Hefeng Wu, Haofeng Li, Guanbin Li

机构 * Sun Yat-sen University(中山大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出协作多智能体框架,通过生成丰富多模态上下文提升VLMs在叙事推理和欺骗鲁棒性中的表现,解决多玩家游戏中不完全信息下的复杂推理问题。

Comments 9 pages, 5 figures, Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11868 2026-08-11 cs.CY cs.AI 版本更新 57%

Ethical Framework for Responsible Foundational Models in Medical Imaging

医学影像领域负责任基础模型的伦理框架

Debesh Jha, Gorkem Durak, Abhijit Das, Jasmer Sanjotra, Onkar Susladkar, Suramyaa Sarkar, Ashish Rauniyar, Nikhil Kumar Tomar, Linkai Peng, Sirui Li, Koushik Biswas, Ertugrul Aktas, Elif Keles, Matthew Antalek, Zheyuan Zhang, Bin Wang, Xin Zhu, Hongyi Pan, Deniz Seyithanoglu, Alpay Medetalibeyoglu, Vanshali Sharma, Vedat Cicek, Amir A. Rahsepar, Rutger Hendrix, A. Enis Cetin, Bulent Aydogan, Mohamed Abazeed, Frank H. Miller, Rajesh N. Keswani, Hatice Savas, Sachin Jambawalikar, Daniela P. Ladner, Amir A. Borhani, Concetto Spampinato, Michael B. Wallace, Ulas Bagci

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本研究针对医学影像领域基础模型整合临床实践时的隐私、偏差、可解释性等伦理挑战,提出含隐私保护、偏差应对、人类监督的伦理框架,以平衡创新与医学伦理原则。

Journal ref https://www.frontiersin.org/journals/medicine/articles/10.3389/fmed.2025.1544501/full

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07214 2026-08-10 cs.DB cs.AI cs.SY eess.SY 新提交 57%

Toward a Causal Data Management Ecosystem for Decision Making and Agentic AI

面向决策与智能体AI的因果数据管理生态系统

Dazhuo Qiu, Yingli Zhou, Amedeo Pachera, Angela Bonifati, Andrea Mauri

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文针对AI生态系统决策混杂问题,提出构建共享可查询的因果世界系统(CWS),为面向决策与智能体AI的因果数据管理生态系统提供支持。

Comments Accepted at ACM AI Leadership Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05587 2026-08-07 cs.AI 新提交 57%

StepReflect: Structured UI Transition Reflection for Mobile GUI Agents

StepReflect:面向移动GUI智能体的结构化UI过渡反射

Linqiang Guo, Wei Liu, Li Gu, Yang Wang, Tse-Hsun, Chen

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 针对移动GUI智能体长时序执行的动作反射需求,提出StepReflect模型,在离线和在线实验中均优于GPT-5.2相关方案,成本更低且可本地部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19880 2026-08-07 cs.RO cs.CV 版本更新 57%

EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness

EA-Nav:通过具身感知学习安全的视觉导航策略

Jialu Zhang, Yong Du, Xianda Guo, Shunwang Sun, Xinqi Liu, Yue Sun, Guodong Lu, Wei Sui, Jituo Li

机构 * Zhejiang University(浙江大学) Wuhan University(武汉大学) Hunan University(湖南大学) D-Robotics(D机器人公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 针对跨具身导航挑战,提出基于模仿学习的具身感知导航框架,通过模块化多阶段设计,预训练构建数据集并引入具身几何,微调设计多模态信息注入机制,有效提高不同具身设置下的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04533 2026-08-06 cs.CV 新提交 57%

EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

EgoAfford:基于自我中心指称分割的面向任务的可供性定位

Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 针对部件级可供性定位难以适配复杂多步桌面任务的问题,提出基准EgoAfford及参考模型EgoLens,验证了下一步推理与动作角色条件部件定位的互补挑战,为感知与规划联合研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04530 2026-08-06 cs.CV 新提交 57%

FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory

FocusMem:对潜在GUI记忆中的内容、读出和信任进行因子分解

Zhuoran Zhang, Bowen Li, Jingcheng Ju, Yang Shi, Qixun Wang, Haotian Wang, Wei Chen, Tengjiao Wang

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 FocusMem将潜在GUI记忆的内容、读出和信任因子分解,解决现有固定记忆方法的细节丢失、阶段适配差和误导问题,在五个GUI智能体基准测试中性能优于基线与现有方法。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06024 2026-08-06 q-bio.QM cs.AI 交叉投稿 57%

TourSynbio-Search: A Large Language Model Driven Agent Framework for Unified Search Method for Protein Engineering

TourSynbio-Search:一种用于蛋白质工程的统一搜索方法的大语言模型驱动智能体框架

Yungeng Liu, Zan Chen, Yu Guang Wang, Yiqing Shen

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 TourSynbio-Search是TourSynbio-7B驱动的双模块搜索智能体框架,可跨多平台检索文献与蛋白质数据,降低技术门槛,提升蛋白质工程研究的信息检索效率与生产力

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02643 2026-08-05 cs.SE cs.AI 新提交 57%

CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

CUADebug:计算机使用智能体故障的诊断与修复

Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng Ji, Jiaxuan You

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。

Comments 23 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02217 2026-08-04 cs.CV 新提交 57%

VC-Tooler: Learning Compositional and Adaptive Visual Tool Use

VC-Tooler:学习组合式与自适应视觉工具使用

Yizheng Wu, Jiashen Hua, Bing Deng, Jieping Ye

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 VC-Tooler是一种学习组合式与自适应视觉工具使用的模型,通过分层合成轨迹库与两阶段训练,在通用和具身基准上达到开源模型最优性能,且具良好迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00548 2026-08-04 cs.CV 新提交 57%

DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable

DrawAI:用于生成可编辑光栅图像的智能体基准与工作流

Pu Cao, Qingye Kong, Xuedan Yin, Xuekun Zhao, Rupeng Yan, Qing Song, Yao Zhang, Lu Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 DrawAI提出图像到可编辑重建任务,构建含DrawAI-Bench基准与DrawAI-Flow工作流的智能体方案,经实验验证DrawAI-Flow可提升可编辑结构,不同模型-harness配置的重建质量与成本差异显著。

Comments Project URL: https://drawai.renaissancemind.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00540 2026-08-04 cs.CV 新提交 57%

DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

DiffuseAgent-MI:用于忠实视觉推理的基于分布、集成工具的自进化智能体

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 DiffuseAgent-MI是基于分布、集成工具的自进化视觉推理智能体,通过KL最小能量模型与轨迹级验证器提升忠实性,在多数据集上准确率及相关指标表现优于现有模型。

Comments 11 pages, 9 figures, accepted by ICML 2026 manitrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00289 2026-08-04 cs.AI cs.HC cs.RO 新提交 57%

RF-HOI: Recognize Human-Object Interaction with Radio Frequency Signals

RF-HOI:利用射频信号识别人体-物体交互

Lihao Wang, Linlu Gao, Jiacan Yu, Yanyu Lin, Yifan Yin, Jianxin Wang, Tianmin Shu, Renjie Zhao

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 该研究针对视觉HOI识别的隐私与光照问题,提出仅用射频信号的RF-HOI框架,融合毫米波雷达与RFID,结合合成RF数据提升性能,效果优于基线且接近视觉模型。

Comments Accepted by ACM IMWUT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28242 2026-07-31 cs.SE cs.AI cs.MA 新提交 57%

Agentic Metaverse Services: A New As-a-Service Paradigm

智能体元宇宙服务:一种新的即服务范式

Xiaofei Xu, Quan Z. Sheng, Zhongjie Wang, Boualem Benatallah, Xiao Wang, Ruipeng Han

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 该研究提出智能体元宇宙服务(AMServ)与元宇宙环境下的智能体即服务(Meta-AaaS)新范式,概述其特征、原理、应用实例,指出发展趋势,将推动AI时代新兴服务产业发展。

Comments 11 pages, 5 figures; Accepted at the 2026 IEEE International Conference on Web Services (ICWS 2026); Corresponding author: Prof. Xiaofei Xu

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28225 2026-07-31 cs.CV 新提交 57%

FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification

FaithEyes:通过多智能体过程图像验证实现可信的工具使用

Haoqing Wang, Xingrun Xing, Wei Xia, Ziheng Li, Yehui Tang

机构 * Samsung Research(三星研究院) Peking University(北京大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本研究提出多智能体框架FaithEyes,通过子智能体判断主智能体的工具调用以提升工具使用可信性,在视觉感知与推理基准上实现了更优准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26172 2026-07-31 cs.HC cs.AI cs.SI 版本更新 57%

Linking Heterogeneous Data with Coordinated Agent Flows for Social Media Analysis

通过协调智能体流关联异构数据以开展社交媒体分析

Shifu Chen, Dazhen Deng, Zhihong Xu, Sijia Xu, Linyu Qin, Tai-Quan Peng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Department of Communication, Michigan State University(密歇根州立大学通讯系)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本研究提出LLM智能体系统SIA,通过协调智能体流关联社交媒体异构多模态数据,采用阶段同步策略挖掘洞见,经评估可发现多样有意义的洞见,为社交媒体分析提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24313 2026-07-28 cs.IR cs.CV cs.MA cs.RO 新提交 57%

Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG

通过局部多智能体RAG实现能量受限的分层水下监测

Mohamed Amine Janati, Laurent Gautier, Stéphane Barbot

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 针对海洋生物监测受能量等限制的问题,提出结合边缘传感与局部推理的低功耗水下监测架构,采用分层设计,利用特定嵌入、识别层及多智能体框架,经案例研究评估,实现低功耗连续传感与局部多模态智能结合,减少能耗与通信开销。

Comments Contains 25 pages, 11 figures. To be submitted to Elsevier Ocean Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24259 2026-07-28 cs.AI 新提交 57%

Generative Artificial Intelligence (GenAI) to convert images of queuing networks into verifiable simulation models: an open-weight LLM workflow approach

生成式人工智能(GenAI)将排队网络图像转换为可验证的仿真模型:一种开放权重的大语言模型工作流方法

Thomas Monks, Alison Harper, Amy Heather, Navonil Mustafee

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究提出Sketch2DES工作流,利用开放权重LLMs将排队网络图像转换为可验证仿真模型,经多阶段处理,在多图表评估中各阶段可靠性高,相比直接代码生成提升多项性能,证明结构化工作流模型生成对LLM辅助仿真建模的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24112 2026-07-28 cs.AI 新提交 57%

Scaling GUI Agents with Visual State Transitions

通过视觉状态转换扩展 GUI 智能体

Xiangyan Liu, Kaixin Li, Haonan Wang, Biao Wu, Meng Fang, Longxu Dou, Chao Du, Michael Qizhe Shieh, Tianyu Pang

机构 * NUS(新加坡国立大学) Sea AI Lab(Sea人工智能实验室) UTS(悉尼科技大学) University of Liverpool(利物浦大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究通过状态转换预训练扩展 GUI 智能体,联合优化逆动力学和正向动力学预训练统一多模态模型,在桌面和移动 GUI 场景基准测试中优于基线,联合动力学优化有稳定改进,下游性能随转换数据量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23910 2026-07-28 cs.CV cs.LG cs.MA cs.RO 新提交 57%

SimBEV2X: A Large-Scale Dataset and Data Generation Tool for Multi-Task Vehicle-to-Everything Cooperative Perception

SimBEV2X:用于多任务车联网协同感知的大规模数据集与数据生成工具

Goodarz Mehr, Sepideh Gohari, Montasir Abbas, Azim Eskandarian

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 研究针对V2X协同感知算法发展受限问题,介绍基于CARLA模拟器的SimBEV2X数据生成工具及数据集,通过它建立基线并提出CoBEVFusion架构,实现上下文感知多智能体特征聚合,性能优越。

Comments Submitted to IEEE for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23899 2026-07-28 cs.RO cs.AI 新提交 57%

Embodied GPT-5.1: Evidence of a World Model?

具身化GPT-5.1:世界模型的证据?

Roberto Spinelli, Thiago C. Martins

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究探索无实体化训练的GPT-5.1能否控制物理移动机器人,通过低分辨率图像和离散动作集执行任务。它展现出空间推理等新兴能力,但也有效率和感知局限。结果挑战传统观点,促使深入研究大语言模型中物理理解相关问题。

Comments 6 pages, 16 figures. Published in the 2026 Brazilian Conference on Robotics (CROS)

Journal ref R. Spinelli and T. C. Martins, "Embodied GPT-5.1: Evidence of a World Model?," 2026 Brazilian Conference on Robotics (CROS), pp. 394-399, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23511 2026-07-28 cs.CV 新提交 57%

MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving

MOJITO:用于统一端到端自动驾驶的模态联合学习

Zhijing Cheng, Xuancheng Zhang, Donglin Di, Lei Fan, Baorui Ma, Hao Li, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto(理想汽车) University of New South Wales(新南威尔士大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 研究针对端到端自动驾驶系统问题,提出基于模态联合学习的MOJITO框架,去除级联接口,执行逐块模态联合注意力更新多模态特征,在数据集上取得新的最优成绩,展现出强大能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22689 2026-07-28 cs.AI 新提交 57%

Beyond Sequential Interaction: Benchmarking Parallel Execution and Coordination for GUI Agents

超越顺序交互:GUI 智能体并行执行与协调的基准测试

Zedong Yu, Qianxing Li, Zhi Gao, Liuyu Xiang, Chenrui Shi, Yang Liu, Huiming Wu, Yujie Wei, Yuhao Fei, Yubo Fu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory for General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) China University of Geosciences (Beijing)(中国地质大学(北京)) Beijing Institute of Technology(北京理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究 GUI 智能体长周期任务扩展性差的问题,引入 ParaGUIBench 基准测试及 ParaGUI 智能体,通过实验证明并行执行能提升可分解长周期 GUI 任务的成功率与效率。

Comments 15 pages, 5 figures. Project page: https://github.com/pkgunboat/ParaGUIBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22651 2026-07-28 cs.AI 新提交 57%

ARdena: Scenario-driven control of real-time LLM agents

ARdena:实时大语言模型智能体的场景驱动控制

Luka Borozan, Domagoj Matijević

机构 * Faculty of Applied Mathematics and Informatics, University of Osijek Croatia(奥西耶克大学应用数学与信息学院,克罗地亚) Meet Intelligent Innovations LLC(Meet智能创新有限责任公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究如何在实时交互环境中控制大语言模型智能体行为,提出分层场景驱动的LLM控制框架,通过结构化提示实现运行时行为控制,在ARDena中实现该框架并评估,结果显示场景驱动提示能有效控制LLM智能体。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05147 2026-07-28 cs.CV cs.RO 版本更新 57%

Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models

行动、思考或退缩:面向视觉-语言-动作模型的复杂度感知自适应推理

Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering, Politecnico di Milano(电子、信息与生物工程系,米兰理工学院)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种复杂度感知的自适应推理框架,通过动态路由视觉-语言-动作模型的执行,提升任务复杂性检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21653 2026-07-27 cs.LG cs.CL cs.DC 新提交 57%

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

Molt:用于智能体强化学习的可扩展原生 PyTorch 训练框架

Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang, Shaokun Zhang, Hemil Desai, Michael Demoret, Pavlo Molchanov, Jan Kautz, Yi Dong

机构 * NVIDIA(英伟达)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 研究针对智能体强化学习中算法修改成本高的问题,提出原生 PyTorch 训练框架 Molt,其代码简洁,智能体是普通程序,通过异步循环训练策略,在全异步协议下性能与先进堆栈相当,且开源提供资源。

Comments tech report for Molt

详情

展开后加载摘要…

URL PDF HTML 收藏