arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2777 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2777 篇

2605.14154 2026-05-15 physics.chem-ph 50%

TSAgent: An Agentic Workflow for Autonomous Transition State Search

TSAgent:一种用于自主过渡态搜索的智能工作流

Varun Madhavan, Ankit Mathanker, Dean M. Sweeney, Oluwatosin A. Ohiro, Yixin Wang, Bryan R. Goldsmith

专题命中 多模态Agent :multimodal(abstract)

AI总结 TSAgent通过持续的计划-执行-分析-重新计划循环,自动在密度泛函理论水平上搜索过渡态,实现了83%的准确率,并在对比实验中表现出优于人类专家的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06138 2026-05-14 cs.LG 50%

Flow Matching for Offline Reinforcement Learning with Discrete Actions

基于流匹配的离线强化学习中离散动作的处理

Fairoz Nower Khan, Nabuat Zaman Nahim, Ruiquan Huang, Haibo Yang, Peizhong Ju

机构 * Department of Computer Science, University of Kentucky(计算机科学系,肯塔基大学) Department of Computing and Information Sciences, Rochester Institute of Technology(计算与信息科学系,罗切斯特理工学院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出一种适用于离散动作空间的流匹配框架,通过连续时间马尔可夫链和因子化条件路径,扩展了离线强化学习的应用范围,并在多种任务中展示了优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15784 2026-05-12 physics.soc-ph 50%

Comparing Analytical Approaches for Bike Station Expansion: A Location-Allocation Study in Trondheim, Norway

比较自行车站点扩展的分析方法:挪威特罗姆瑟市的选址-分配研究

M. Tsaqif Wismadi, Oluwaleke Yusuf, Adil Rasheed, Yngve Karl Frøyen, Thomas Alexander Sick Nielsen

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文通过对比三种选址分配方法,探讨了不同模型对城市空间优先级的影响,发现方法选择对空间决策结果有根本性影响。

Comments 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09522 2026-05-12 cs.MA 50%

Emergent Communication for Co-constructed Emotion Between Embodied Agents via Collective Predictive Coding

通过集体预测编码实现具身智能体间共构情感的涌现通信

Zehang Zhang, Nguyen Le Hoang, Tadahiro Taniguchi, Takato Horii

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文通过集体预测编码框架,利用Metropolis-Hastings命名游戏模型,研究具身智能体间共构情感的涌现通信过程,发现通信显著提升情感类别的对齐性和一致性,并验证了内脏异质性对共享情感意义的构成作用。

Comments 13 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09265 2026-05-12 cs.CE 50%

Agentic AI for Particle-Based Simulation: Automating SPH Workflows for Debris Flow Modeling

基于代理的AI用于粒子模拟:自动化SPH工作流用于碎屑流建模

Danrong Zhang, Ruijia Wang, Chenying Liu, Yumeng Zhao

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出首个用于无网格模拟的代理AI工作流,通过整合工具编排、多模态输入和人机交互,实现了碎片流建模的端到端模拟,展示了多模态输入在提升用户体验和减少失败模式方面的优势。

Comments 24 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08801 2026-05-12 cs.LG 50%

Data-driven transport modelling without overfit

基于数据的运输建模无需过拟合

Peter Vanya, Katarína Šimková, Rastislav Farkaš

机构 * Sev.en Global Investments(Sev.en全球投资) Vrije Universiteit Brussels(布鲁塞尔自由大学) Université Libre de Bruxelles(布鲁塞尔自由大学) Ministry of Finance of the Slovak Republic(斯洛伐克共和国财政部)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种基于交通流量计数的数据驱动建模方法,通过可解释的模型权重和受控路径提升模型复杂度与准确性,用于预测公共政策干预后的交通流。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07101 2026-05-11 cs.MA stat.ML 50%

Decentralized Diffusion Policy Learning for Enhanced Exploration in Cooperative Multi-agent Reinforcement Learning

去中心化扩散策略学习用于增强合作多智能体强化学习中的探索

Yuyang Zhang, Haldun Balim, Na Li

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出去中心化扩散策略学习方法,通过扩散概率模型提升多智能体强化学习中的探索能力,解决了高维动作空间下的策略表达限制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01166 2026-05-11 cs.RO 50%

Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models

隐式推理VLA:面向视觉-语言-动作模型的隐式思考与预测

Shuanghao Bai, Jing Lyu, Wanqi Zhou, Zhe Li, Dakai Wang, Lei Xing, Xiaoguang Zhao, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Badong Chen, Shanghang Zhang

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, University of Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出LaRA-VLA框架,通过连续潜在表示实现多模态推理,减少推理开销,提升机器人实时控制效率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05338 2026-05-08 cs.RO 50%

Track A*: Fast Visibility-Aware Trajectory Planning for Active Target Tracking

Track A*: 为主动目标跟踪的快速可见性感知轨迹规划

Hanxuan Chen, Kangli Wang, Ji Pei

机构 * Autel Robotics(奥特 Robotics)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出Track A*,一种基于离线搜索的轨迹规划器,用于在离散的四维时空网格上实现可见性感知的目标跟踪。通过分层有向无环图搜索和三种工程优化,Track A*在保证实用性的同时提升了可扩展性,实验证明其在计算成本低的情况下具有稳健的可见性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00708 2026-05-04 cs.LG 50%

Deep Kernel Learning for Stratifying Glaucoma Trajectories

基于深度核学习的青光眼轨迹分层

Bruce Rushing, Angela Danquah, Alireza Namazi, Arjun Dirghangi, Heman Shakeri

机构 * Research Computing(研究计算中心) University of Virginia(弗吉尼亚大学) School of Data Science(数据科学学院) School of Medicine(医学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种深度核学习方法,利用高斯过程后端对多模态电子健康记录数据建模,识别青光眼患者不同亚群,区分疾病进展与当前严重程度,为临床决策提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13007 2026-05-04 cs.LG cs.CE 50%

Latent Generative Modeling of Random Fields from Limited Training Data

从有限训练数据中学习随机场的潜在生成建模

James E. Warner, Tristan A. Shah, Patrick E. Leser, Geoffrey F. Bomarito, Joshua D. Pribe, Michael C. Stanley

机构 * NASA Langley Research Center(美国国家航空航天局兰利研究中心) Texas Tech. University(德克萨斯技术大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种结合领域知识的潜在空间生成模型,用于在数据有限时建模随机场,通过约束-aware VAE和函数解码器学习紧凑的潜在表示,提升生成质量与鲁棒性。

Comments 24 pages plus references and appendices, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27887 2026-05-01 stat.ME 50%

Meta-Analysis Without Normality: Estimating the True Effect Distribution with Penalized Gaussian Mixtures

无需正态性:基于惩罚高斯混合的真效应分布估计

Daihe Sui, Elizabeth Tipton

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出基于惩罚高斯混合的方法,用于在不假设正态分布的情况下估计真效应分布,适用于大规模异质数据集,提高尾部概率和密度估计的准确性。

Comments 38 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27435 2026-05-01 cs.CY 50%

Structural Dissolution: How Artificial Intelligence Dismantles Coordination Architecture and Reconfigures the Political Economy of Production

结构溶解:人工智能如何解构协调架构并重构生产的政治经济

Chao Li, Chunyi Zhao

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出结构溶解框架,探讨人工智能如何重构传统产业的协调架构,通过内部化人类多模态接口,导致生产关系的质变,产生四个主要转变:企业与行业边界的消解、价值创造从物理资源和人力协作转向持续的数据流、领域特定数据精炼基础设施的兴起以及区域数据主权实体的出现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05907 2026-04-30 cs.RO 50%

EvolvingAgent: Curriculum Self-evolving Agent with Continual World Model for Long-Horizon Tasks

EvolvingAgent: 基于持续世界模型的课程自进化代理用于长周期任务

Tongtong Feng, Xin Wang, Zekai Zhou, Ren Wang, Yuwei Zhan, Guangyao Li, Qing Li, Wenwu Zhu

机构 * Department of Computer Science and Technology, Beijing National Research Center for Information Science and Technology, Tsinghua University(计算机科学与技术系,北京信息科学与技术国家研究中心,清华大学) Department of Computer Science, University of Sydney(计算机科学系,悉尼大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出EvolvingAgent,通过持续世界模型实现自主完成长周期任务,采用任务规划、动作控制和反思模块,提升Minecraft和Atari环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23802 2026-04-28 cs.MA 50%

EndoGov: A knowledge-governed multi-agent expert system for endometrial cancer risk stratification

EndoGov:一种基于知识的多智能体专家系统用于子宫内膜癌风险分层

Weiye Dai, Liyun Shi, Zanxiang He, Yuling Ma, Mengyuan Lin, Dianxiang Sun, Liming Nie

专题命中 多模态Agent :multimodal(abstract)

AI总结 EndoGov通过多智能体系统结合规则治理,实现子宫内膜癌风险分层的指南合规性与高准确性,同时保持竞争性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22685 2026-04-27 astro-ph.IM astro-ph.EP cs.NI cs.PF 50%

CosmicDancePro -- Measuring LEO satellite's orbital decay and network connectivity implications during solar storms

CosmicDancePro -- 评估太阳风暴期间低地球轨道卫星轨道衰减和网络连接影响

Suvam Basak, Amitangshu Pal, Debopam Bhattacherjee

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究利用CosmicDancePro工具分析太阳风暴对低地球轨道卫星网络的影响,揭示轨道衰减机制和网络连接降级现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20834 2026-04-27 cs.RO 50%

PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance

PokeVLA:通过全面的世界知识指导赋能便携式视觉-语言-动作模型

Yupeng Zheng, Xiang Li, Songen Gu, Yuhang Zheng, Shuai Tian, Weize Li, Linbo Wang, Senyu Fei, Pengfei Li, Yinfeng Gao, Zebin Xing, Yilun Chen, Qichao Zhang, Haoran Li, Wenchao Ding

机构 * CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人实验室) Tsinghua University(清华大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出PokeVLA,一种轻量但强大的具身体验模型,通过预训练视觉语言模型和多视角目标感知学习提升机器人操作效率与空间认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17706 2026-04-27 cs.RO 50%

OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL

OmniVLA-RL:具备空间理解与在线强化学习的视觉-语言-动作模型

Haoxiang Jie, Yaoyuan Yan, Xiangyu Wei, Kailin Wang, Hongjie Yan, Zhiyou Heng, Daocheng Chen

机构 * AI Lab, Country Garden Services(国家花园服务人工智能实验室) Omni AI(奥米尼人工智能) VBot East China Normal University(东华大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出OmniVLA-RL模型,通过混合Transformer架构整合推理、空间和动作专家,结合Flow-GSPO提升动作精度与训练稳定性,在LIBERO和LIBERO-Plus基准上表现优异,克服了现有VLA模型的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20948 2026-04-24 cs.HC 50%

Can Virtual Agents Care? Designing an Empathetic and Personalized LLM-Driven Conversational Agent

虚拟代理能关心吗?设计一个具有同理心和个性化的LLM驱动对话代理

Truong Le Minh Toan, Dieu Bang Mach, Tan Duy Le, Nguyen Tan Viet Tuyen

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种框架,通过检索增强架构、结构化记忆和多模态交互,设计出具有同理心和个性化支持的虚拟代理,以提升心理健康支持的质量和可靠性。

Comments Accepted manuscript version to be presented at the SCI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09693 2026-04-22 q-bio.TO eess.IV 50%

Glorbit: A Modular, Web-Based Platform for AI Based Periorbital Measurement in Low-Resource Settings

Glorbit:一种模块化、基于网页的AI驱动低资源环境下的眼周测量平台

George R. Nahass, Jacob van der Ende, Sasha Hubschman, Benjamin Beltran, Bhavana Kolli, Caitlin Berek, James D. Edmonds, R. V. Paul Chan, Pete Setabutr, James W. Larrick, Darvin Yi, Ann Q. Tran

专题命中 多模态Agent :multimodal(abstract)

AI总结 Glorbit是一款轻量级网页应用,利用人工智能实现自动化眼周距离测量,适用于低资源临床环境,具备离线模式、本地预处理和云上传功能,通过模拟研究验证了其在不同设备和浏览器上的稳定性和高可用性。

Comments 10 pages, 3 figures, 3 tables

Journal ref JMIR Hum Factors 2026;13:e82859

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19148 2026-04-22 cs.RO 50%

Multi-Step Gaussian Process Propagation for Adaptive Path Planning

多步高斯过程传播用于自适应路径规划

Alex Beaudin, Bjørn Andreas Kristiansen, Kristoffer Gryte, Corrado Chiatante, Morten Omholt Alver, Murat Arcak, Tor Arne Johansen

机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) Department of Engineering Cybernetics, Norwegian University of Science and Technology (NTNU)(挪威科技与自然大学(NTNU)工程控制系) Department of Electronic Systems, Norwegian University of Science and Technology (NTNU)(挪威科技与自然大学(NTNU)电子系统系)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出基于高斯过程的多步路径规划方法OLAhGP,通过融合多模态环境传感数据和状态输入约束,提升自主水面舰在藻类监测中的路径规划效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16571 2026-04-21 cs.AR cs.SE 50%

EquivFusion: Unifying Hardware Equivalence Checking from Algorithms to Netlists via MLIR

EquivFusion:通过MLIR统一算法到网络列表的硬件等价性检查

Jiaying Zhu, Baoqi Zhang, Mengxia Tao, Kezhi Li, Hao Yan, Qiang Xu, Min Li

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出EquivFusion工具,通过MLIR统一多模态电路设计的算法与硬件等价性检查,解决软件与硬件之间语义差距的问题。

Comments Accepted to FSE 2026 (Tool Demonstration Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
1609.02249 2026-04-16 math.OC stat.ME 50%

Clustering sequence data with mixture Markov chains with covariates using multiple simplex constrained optimization routine (MSiCOR)

利用多重简单形约束优化程序(MSiCOR)对带有协变量的混合马尔可夫链进行序列数据聚类

Priyam Das, Deborshee Sen, Debsurya De, Jue Hou, Zahra S. H. Abad, Nicole Kim, Zongqi Xia, Tianxi Cai

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出一种基于模式搜索的全局优化方法,用于在简单形集合上优化目标函数,从而改进混合马尔可夫模型(MMM)参数估计。该方法在MS患者治疗序列聚类中表现出色,并结合协变量进行患者分群。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13128 2026-04-16 cs.MA cs.LG cs.RO cs.SY eess.SY 50%

Learning Probabilistic Responsibility Allocations for Multi-Agent Interactions

多智能体交互中的概率责任分配学习

Isaac Remy, Caleb Chang, Karen Leung

机构 * University of Washington, Department of Aeronautics and Astronautics(华盛顿大学航空航天系) NVIDIA

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种学习多智能体交互中概率责任分配模型的方法,通过条件变分自动编码器的潜在空间和多智能体轨迹预测技术,实现基于场景和智能体上下文的责任分配分布学习,展示了在INTERACTION驾驶数据集上的强预测性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07464 2026-04-16 cs.RO cs.SY eess.SY 50%

Safe and Nonconservative Contingency Planning for Autonomous Vehicles via Online Learning-Based Reachable Set Barriers

通过基于在线学习的可达集屏障实现自主车辆的安全非保守应急规划

Rui Yang, Lei Zheng, Shuzhi Sam Ge, Jun Ma

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出基于在线学习的实时应急轨迹优化框架,通过动态量化多模态HV不确定性并逐步细化其可达集,确保安全性和效率,在不确定环境下提升驾驶效率和乘客舒适度。

Comments 16 pages, 13 figures

Journal ref IEEE Trans. Control Syst. Technol., 2026, pp.1-16

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10703 2026-04-16 cs.LG eess.SP 50%

Hybrid Attention Model Using Feature Decomposition and Knowledge Distillation for Glucose Forecasting

基于特征分解和知识蒸馏的混合注意力模型用于血糖预测

Ebrahim Farahmand, Shovito Barua Soumma, Nooshin Taheri Chatrudi, Hassan Ghasemzadeh

机构 * College of Health Solutions at Arizona State University(亚利桑那州立大学健康解决方案学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出GlucoNet系统,通过特征分解和知识蒸馏提升血糖预测精度与效率,实现更准确的实时预测与干预。

Comments Final accepted version. IEEE TMC Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12909 2026-04-15 cs.RO 50%

Tree Learning: A Multi-Skill Continual Learning Framework for Humanoid Robots

树学习:一种面向双足机器人的人机交互连续学习框架

Yifei Yan, Linqi Ye

机构 * School of Future Technology, Shanghai University(上海大学未来技术学院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出Tree Learning框架,通过参数继承机制和多模态适应机制,实现双足机器人多技能连续学习,避免灾难性遗忘,提升技能切换和交互控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12831 2026-04-15 cs.RO 50%

VULCAN: Vision-Language-Model Enhanced Multi-Agent Cooperative Navigation for Indoor Fire-Disaster Response

VULCAN:基于视觉-语言模型的多智能体协作导航用于室内火灾应急响应

Shengding Liu, Qiben Yan

机构 * Computer Science \& Engineering Michigan State University East Lansing, MI, USA

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出VULCAN框架,结合多模态感知与视觉语言模型,解决火灾环境下多智能体协作导航的挑战,通过模拟真实火灾场景评估现有方法的失效模式,强调鲁棒感知与危险意识规划的重要性。

Comments INFOCOM EIN Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16615 2026-04-15 cs.RO 50%

LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning

基于大型语言模型的任务与能力层面探索的强化学习

Jelle Luijkx, Runyu Ma, Zlatan Ajanović, Jens Kober

机构 * RWTH Aachen University(亚琛工业大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出LLM-TALE框架,利用大型语言模型的规划能力引导强化学习探索,提升学习效率和任务成功率,实验证明在抓取放置任务中表现出更高的样本效率和成功率。

Comments 8 pages, 7 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11715 2026-04-14 eess.SY cs.SY math.OC 50%

Koopman Representations for Non-Vanishing Time Intervals: An Optimization Approach and Sampling Effects

Koopman表示用于非消失时间间隔:一种优化方法和采样效应

Younghwan Cho, Richard Sowers

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出通过优化方法学习Koopman特征函数,分析了采样模式对aliasing的影响,并展示了不规则采样在恢复真实Koopman谱中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏