arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2777 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2777 篇

2604.09167 2026-04-13 cs.CV cs.MA 57%

MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding

MAG-3D:多智能体基础推理用于3D理解

Henry Zheng, Chenyue Fang, Rui Huang, Siyuan Wei, Xiao Liu, Gao Huang

机构 * Tsinghua University(清华大学) Pico, ByteDance(字节跳动Pico)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出MAG-3D,一种无需训练的多智能体框架,通过动态协调专家代理实现灵活的3D基础推理,解决复杂场景中的空间和几何关系推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03512 2026-04-13 cs.AI 57%

ActionNex: A Virtual Outage Manager for Cloud Computing

ActionNex:云计算中的虚拟故障管理器

Zhenfeng Lin, Haoji Hu, Ming Hao, Xuchao Zhang, Ryan Zhang, Junhao Li, Ze Li, Oleg Kulygin, Chetan Bansal, Hatay Tuna, Murali Chintalapati, Sheila Jiang, Salman Zafar, Angie Anderson

机构 * Microsoft PRIMO(微软PRIMO) Microsoft Research(微软研究院) Microsoft Azure Core(微软Azure Core)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出ActionNex,一个生产级智能系统,通过多模态信号处理和分层记忆子系统,实现故障管理的端到端支持,包括实时更新、知识蒸馏和基于角色和阶段的最优行动推荐,实验表明其在真实Azure故障中达到71.4%的精度和52.8-54.8%的召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03370 2026-04-13 cs.CV 57%

ShelfGaussian: Shelf-Supervised Open-Vocabulary Gaussian-based 3D Scene Understanding

ShelfGaussian:基于货架的开放词汇高斯3D场景理解

Lingjun Zhao, Yandong Luo, James Hays, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 本文提出ShelfGaussian框架,利用货架监督学习方法,结合多模态高斯变换,提升3D场景理解的开放词汇能力,实验显示其在零样本语义占用预测中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08516 2026-04-10 cs.CV 57%

MolmoWeb: Open Visual Web Agent and Open Data for the Open Web

MolmoWeb:开放视觉网络代理和开放数据用于开放网络

Tanmay Gupta, Piper Wolters, Zixian Ma, Peter Sushko, Rock Yuren Pang, Diego Llanes, Yue Yang, Taira Anderson, Boyuan Zheng, Zhongzheng Ren, Harsh Trivedi, Taylor Blanton, Caleb Ouellette, Winson Han, Ali Farhadi, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出MolmoWeb,一个开放的多模态网络代理,通过公开的浏览器任务演示和网页GUI感知数据,实现状态-of-the-art的网络代理性能,促进开放研究。

Comments https://allenai.org/blog/molmoweb

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08232 2026-04-10 cs.AI 57%

HiRO-Nav: Hybrid ReasOning Enables Efficient Embodied Navigation

HiRO-Nav:混合推理实现高效具身导航

He Zhao, Yijun Yang, Zichuan Lin, Deheng Ye, Chunyan Miao

机构 * Nanyang Technological University(南洋理工大学) Tencent(腾讯) Independent Researcher(独立研究员)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 HiRO-Nav通过混合推理策略,在导航任务中根据动作熵动态决定是否进行推理,提升决策质量并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07784 2026-04-10 cs.AI cs.MA cs.SY eess.SY 57%

Automotive Engineering-Centric Agentic AI Workflow Framework

以汽车工程为中心的代理式人工智能工作流框架

Tong Duy Son, Zhihao Liu, Piero Brigida, Yerlan Akhmetov, Gurudevan Devarajan, Kai Liu, Ajinkya Bhave

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出Agentic Engineering Intelligence (AEI)框架,通过建模工程工作流为约束性序列决策过程,将设计优化、模拟诊断等任务整合为统一流程,展示如何在汽车工程中实现多样化工作流的统一表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07774 2026-04-10 cs.RO cs.CV 57%

RoboAgent: Chaining Basic Capabilities for Embodied Task Planning

RoboAgent: 通过基本能力串联实现具身任务规划

Peiran Xu, Jiaqi Zheng, Yadong Mu

机构 * Peking University(北京大学) XYZ Embodied AI(XYZ具身智能)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出RoboAgent,通过串联基本能力实现具身任务规划,利用单个VLM构建能力驱动的规划框架,结合多阶段训练方法提升规划效果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06180 2026-04-09 eess.IV cs.CV cs.LG cs.MA 57%

MedRoute: RL-Based Dynamic Specialist Routing in Multi-Agent Medical Diagnosis

MedRoute: 基于强化学习的多智能体医疗诊断动态专家路由

Ashmal Vayani, Parth Parag Kulkarni, Joseph Fioresi, Song Wang, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida, Orlando, United States(中佛罗里达大学人工智能研究所,奥兰多,美国)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出MedRoute框架,通过强化学习动态选择专家进行医疗诊断,提升诊断准确性,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04108 2026-04-07 cs.CV 57%

Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation

假设图细化:基于假设的探索与级联错误校正的具身导航

Peixin Chen, Guoxi Zhang, Jianwei Ma, Qing Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Peking University(北京大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出HGR框架,通过假设节点的可修改性实现具身导航中的定向探索,并通过级联校正系统性地纠正错误。实验显示HGR在GOAT-Bench和QA基准上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03631 2026-04-07 cs.AI 57%

Single-agent vs. Multi-agents for Automated Video Analysis of On-Screen Collaborative Learning Behaviors

单 agent 与多 agent 在自动视频分析上的协作学习行为研究

Likai Peng, Shihui Feng

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Institute of Data Science, The University of Hong Kong(香港大学数据科学研究所)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文比较了单 agent 和多 agent 框架在自动编码协作学习场景视频中的性能,提出两种多 agent 方法,分别在场景检测和动作检测任务中表现优异。

Comments 15 pages, 4 figures. To be published in the 27th International Conference on Artificial Intelligence in Education (AIED2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01891 2026-04-07 cs.CV 57%

Agentic AI in Remote Sensing: Foundations, Taxonomy, and Emerging Systems

遥感中的代理AI:基础、分类与新兴系统

Niloufar Alipour Talemi, Julia Boone, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文探讨遥感中代理AI的基础、分类及新兴系统,提出统一的分类框架,分析规划机制、检索增强生成和记忆结构,并评估轨迹感知推理的准确性。

Comments Accepted to the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026, GeoCV Workshop

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) Workshops, 2026, pp. 786-799

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15279 2026-04-06 cs.RO cs.CV 57%

Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception

看、聚焦、理解:用于具身感知的机器人眼球

Jiashu Yang, Yifan Han, Yucheng Xie, Ning Guo, Wenzhao Lian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dalian University of Technology(大连理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出EyeVLA框架,通过整合视觉感知、语言理解和物理摄像头控制,实现语言引导的主动视觉感知。该框架在500个真实样本上训练,使机器人在50种不同场景中完成任务的平均完成率为96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07553 2026-04-06 cs.CL 57%

VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents

VeriOS: 基于查询的人机GUI交互以实现可信操作系统代理

Zheng Wu, Heyuan Huang, Xingyu Lou, Xiangmou Qu, Pengzhou Cheng, Zongru Wu, Weiwen Liu, Weinan Zhang, Jun Wang, Zhaoxiang Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 VeriOS通过引入查询驱动的人机GUI交互框架,提升操作系统代理在不可信环境中的任务完成能力,实验显示其在不可信场景中性能显著提升,同时保持正常场景下的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10853 2026-04-03 cs.AI cs.HC 57%

Advanced Assistance for Traffic Crash Analysis: An AI-Driven Multi-Agent Approach to Pre-Crash Reconstruction

交通碰撞分析的高级辅助:一种基于AI的多智能体方法用于碰撞前重建

Gerui Xu, Boyou Chen, Huizhong Guo, Dave LeBlanc, Arpan Kusari, Efe Yarbasi, Ananna Ahmed, Zhaonan Sun, Shan Bao

机构 * Industrial and Manufacturing Systems Engineering Department, University of Michigan-Dearborn(密歇根大学迪尔伯恩分校工业与制造系统工程系) University of Michigan Transportation Research Institute(密歇根大学交通研究所) Toyota Motor Engineering & Manufacturing North America, Inc.(丰田汽车工程与制造北美公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的多智能体框架,通过多模态输入生成碰撞前场景重建,并结合事件数据记录器信号识别碰撞车辆,验证了该框架在碰撞前行为推断中的高准确率。

Comments 36 pages, 14 figures

Journal ref SAE International Journal of Transportation Safety, 14(1), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23752 2026-04-03 cs.CV 57%

ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks

ThinkGeo: 评估用于遥感任务的工具增强代理

Akashah Shabbir, Muhammad Akhtar Munir, Akshay Dudhane, Muhammad Umer Sheikh, Muhammad Haris Khan, Paolo Fraccaro, Juan Bernabe Moreno, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) IBM Research(IBM研究院) Linköping University(林雪平大学) Australian National University(澳大利亚国立大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 ThinkGeo是一个针对遥感任务设计的代理基准,评估LLM驱动代理在结构化工具使用和多步骤规划中的能力,通过人类 curated 查询和专家验证的推理步骤测试不同模型的工具准确性和规划一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00977 2026-04-02 cs.LG cs.AI 57%

Flow-based Policy With Distributional Reinforcement Learning in Trajectory Optimization

基于分布强化学习的流式策略在轨迹优化中的应用

Ruijie Hao, Longfei Zhang, Yang Dai, Yang Ma, Xingxing Liang, Guangquan Cheng

机构 * College of Systems Engineering, National University of Defense Technology(国防科技大学系统工程学院) Aviation University of Air Force(空军航空大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种流式策略与分布强化学习结合的算法,以解决传统策略在多模态分布建模中的局限性,提升多解问题中的策略更新效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29163 2026-04-01 cs.CV 57%

SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving

SparseDriveV2:仅需评分即可实现端到端自动驾驶

Wenchao Sun, Xuewu Lin, Keyu Chen, Zixiang Pei, Xiang Li, Yining Shi, Sifa Zheng

机构 * Tsinghua University(清华大学) Horizon Continental Technology(地平线大陆科技) Horizon(地平线)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SparseDriveV2,通过可扩展的词汇表示和评分策略提升端到端自动驾驶性能,实现在NAVSIM和Bench2Drive上的高评分和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08533 2026-04-01 cs.CV 57%

SecAgent: Efficient Mobile GUI Agent with Semantic Context

SecAgent:基于语义上下文的高效移动GUI代理

Yiping Xie, Song Chen, Jingxuan Xing, Wei Jiang, Zekun Zhu, Yingyao Wang, Pi Bu, Jun Song, Yuning Jiang, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘天集团)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 SecAgent通过构建中文移动GUI数据集和语义上下文机制,提升移动GUI代理的效率与性能,实现高效任务处理与多语言支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12882 2026-04-01 cs.RO cs.AI 57%

Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos

面向多视角轨迹视频的高一致性具身世界模型

Taiyi Su, Jian Zhu, Yaxuan Li, Chong Ma, Jianjun Zhang, Zitai Huang, Hanli Wang, Yi Xu

机构 * Midea Group(美的集团) Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出MTV-World模型,通过多视角轨迹视频控制实现精准的视觉-运动预测,解决低层次动作与真实物理交互不一致的问题,实验表明其在复杂双臂场景中表现优异。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28010 2026-03-31 cs.AI 57%

HeteroHub: An Applicable Data Management Framework for Heterogeneous Multi-Embodied Agent System

HeteroHub:一种适用于异构多具身代理系统的数据管理框架

Xujia Li, Xin Li, Junquan Huang, Beirong Cui, Zibin Wu, Lei Chen

机构 * HKUST(香港科技大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出HeteroHub框架,整合静态元数据、任务对齐训练语料和实时数据流,支持任务感知模型训练和闭环控制,实现复杂任务的协调执行。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22120 2026-03-27 cs.CV 57%

StreamingClaw Technical Report

流式Claw技术报告

Jiawei Chen, Zhe Chen, Chaoqun Du, Maokui He, Wei He, Hengtao Li, Qizhen Li, Zide Liu, Hao Ma, Xuhao Pan, Chang Ren, Xudong Rao, Xintian Shen, Chenfeng Wang, Tao Wei, Chengjun Yu, Pengfei Yu, Shengyu Yao, Chunpeng Zhou, Kun Zhan, Lihao Zheng, Pan Zhou, Xuhan Zhu, Yufei Zheng

机构 * Li Auto Inc.(理想汽车)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出StreamingClaw框架,解决流式视频理解与具身智能中的实时推理、多模态记忆和闭环控制问题,提升复杂环境下的自主决策能力。

Comments Under Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24157 2026-03-26 cs.CV 57%

CarePilot: A Multi-Agent Framework for Long-Horizon Computer Task Automation in Healthcare

CarePilot: 一种用于医疗领域长周期计算机任务自动化的多智能体框架

Akash Ghosh, Tajamul Ashraf, Rishu Kumar Singh, Numan Saeed, Sriparna Saha, Xiuying Chen, Salman Khan

机构 * Indian Institute of Technology Patna(印度理工学院帕纳布分校) Mohamed bin Zayed University of AI (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出CarePilot多智能体框架,通过双记忆机制和actor-critic范式,解决医疗领域长周期任务自动化中的复杂推理问题,实验表明其在基准和分布外数据集上均优于现有基线。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23295 2026-03-25 cs.CV 57%

Mamba-driven MRI-to-CT Synthesis for MRI-only Radiotherapy Planning

基于Mamba的MRI到CT合成用于仅MRI的放疗计划

Konstantinos Barmpounakis, Theodoros P. Vagenas, Maria Vakalopoulou, George K. Matsopoulos

机构 * School of Electrical Computer Engineering, National Technical University of Athens Archimedes, Athena Research Center CentraleSup\'elec, University of Paris-Saclay

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于Mamba架构的MRI到CT合成方法,以提高跨模态翻译的准确性与效率,通过3D Mamba架构捕捉复杂体积特征和长距离依赖,实现快速且精确的CT合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23149 2026-03-25 cs.AI 57%

Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models

描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航

Massimiliano Pappa, Luca Romani, Valentino Sacco, Alessio Palma, Stéphane Lathuilière, Fabio Galasso, Xavier Alameda-Pineda, Indro Spinelli

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07315 2026-03-25 cs.MA cs.AI cs.AR 57%

VLM-CAD: VLM-Optimized Collaborative Agent Design Workflow for Analog Circuit Sizing

VLM-CAD:面向模拟电路尺寸设计的VLM优化协作代理设计流程

Guanyuan Pan, Shuai Wang, Yugui Lin, Tiansheng Zhou, Pietro Liò, Zhenxin Zhao, Yaqi Wang

机构 * Hangzhou Dianzi University(杭州电子科技大学) SCBC, Guangdong University of Foreign Studies(广东外语外贸大学) University of Cambridge(剑桥大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出VLM-CAD流程,通过神经符号结构解析模块和ExTuRBO方法提升多模态推理的鲁棒性和可解释性,实验表明其在模拟电路设计中具有高准确性和低功耗。

Comments submitted to the 34th ACM International Conference on Multimedia (ACMMM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22280 2026-03-24 cs.CV cs.RO 57%

DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models

DualCoT-VLA: 通过并行推理实现视觉-语言链式思维的视觉-语言-动作模型

Zhide Zhong, Junfeng Li, Junjie He, Haodong Yan, Xin Gong, Guanyi Zhao, Yingjie Cai, Jiantao Gao, Xu Yan, Bingbing Liu, Yingcong Chen, Liuqing Yang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Huawei Foundation Model Department(华为基础模型部门)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 DualCoT-VLA通过并行推理机制,结合视觉和语言链式思维,解决传统VLA模型在复杂多步骤任务和精细空间感知中的不足,实现更高效的视觉-语言-动作处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21029 2026-03-24 cs.AI 57%

KLDrive: Fine-Grained 3D Scene Reasoning for Autonomous Driving based on Knowledge Graph

KLDrive: 基于知识图谱的细粒度3D场景推理用于自动驾驶

Ye Tian, Jingyi Zhang, Zihao Wang, Xiaoyuan Ren, Xiaofan Yu, Onat Gungor, Tajana Rosing

机构 * University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校) University of California Merced, Merced, California, USA(加州大学默塞德分校)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 KLDrive通过构建可靠场景知识图谱和LLM代理进行事实驱动推理,提升自动驾驶中的细粒度问答性能,实验表明其在NuScenes-QA和GVQA上均取得最佳准确率和SPICE分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19993 2026-03-23 cs.CV 57%

MedSPOT: A Workflow-Aware Sequential Grounding Benchmark for Clinical GUI

MedSPOT: 一种面向临床GUI的流程感知序列接地基准

Rozain Shakeel, Abdul Rahman Mohammad Ali, Muneeb Mushtaq, Tausifa Jan Saleem, Tajamul Ashraf

机构 * Gaash Research Lab, National Institute of Technology Srinagar, India(加什研究实验室,印度锡里纳杰尔国家理工学院) e\& Group, UAE(e&集团,阿联酋) Mohammad Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(穆罕默德·本·扎耶德人工智能大学(MBZUAI),阿联酋) King Abdullah University of Science and Technology (KAUST), Saudi Arabia(国王 Abdullah 科学技术大学(KAUST),沙特阿拉伯)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 MedSPOT针对临床GUI中需流程驱动的序列推理问题,通过216个任务驱动视频和597个标注关键帧,评估多模态模型在医疗软件中的可靠性与安全性。

Comments Project page: https://rozainmalik.github.io/MedSPOT_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19270 2026-03-23 cs.CL cs.LG 57%

Autonoma: A Hierarchical Multi-Agent Framework for End-to-End Workflow Automation

Autonoma:面向端到端工作流自动化的分层多智能体框架

Eslam Reda, Maged Yasser, Sara El-Metwally

机构 * Artificial Intelligence Program, Faculty of Computers and Information, Mansoura University(人工智能项目,计算机与信息学院,曼苏拉大学) Computer Science Department, Faculty of Computers and Information, Mansoura University(计算机科学系,计算机与信息学院,曼苏拉大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CL

AI总结 本文提出Autonoma框架,通过分层多智能体结构实现端到端工作流自动化,解决传统单一架构在可扩展性、错误传播和任务聚焦方面的不足,实现高可靠性与可扩展性。

Comments 26 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17694 2026-03-19 cs.AI 57%

MALLES: A Multi-agent LLMs-based Economic Sandbox with Consumer Preference Alignment

MALLES:基于多智能体LLM的经济沙盒与消费者偏好对齐

Yusen Wu, Yiran Liu, Xiaotie Deng

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出MALLES,通过大规模模型的泛化能力构建统一模拟框架,利用偏好学习对齐LLM,解决高维环境下的数据稀疏问题,提升经济模拟的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏