arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2773 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2773 篇

2603.03198 2026-03-04 cs.RO cs.CL cs.CV 73%

ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments

ACE-Brain-0:空间智能作为通用具身化体系的共享框架

Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen Luo, Haolan Kang, Shuang Luo, Yue Zhou, Yong Luo, Li Shen, Xiaosong Jia, Yao Mu, Xue Yang, Chunxiao Liu, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of Science(科学技术大学) Fudan University(复旦大学) Xiamen University(厦门大学) East China Normal University(华东师范大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 ACE-Brain-0 通过空间智能作为共享框架,统一了自动驾驶、机器人和 UAVs 的具身化任务,采用 SSR 范式和 GRPO 方法实现跨领域泛化和领域精通的平衡。

Comments Code: https://github.com/ACE-BRAIN-Team/ACE-Brain-0 Hugging Face: https://huggingface.co/ACE-Brain/ACE-Brain-0-8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05611 2026-01-19 cs.CL cs.AI 73%

MADIAVE: Multi-Agent Debate for Implicit Attribute Value Extraction

MADIAVE:多智能体辩论用于隐式属性值提取

Wei-Chieh Huang, Cornelia Caragea

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 MADIAVE通过多智能体辩论框架提升隐式属性值提取的准确性和鲁棒性,适用于多模态电子商务场景。

Comments Accepted by EACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07107 2026-01-13 cs.CV cs.AI 73%

MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning

MEDVISTAGYM:一种通过工具集成强化学习进行医学图像思考的可扩展训练环境

Meng Lu, Yuxing Lu, Yuchen Zhuang, Megan Mullins, Yang Xie, Guanghua Xiao, Charles Fleming, Wenqi Shi, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学) UT Southwestern Medical Center(德克萨斯大学西南医学中心) Georgia Institute of Technology(佐治亚理工学院) Cisco(思科公司)

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 MedVistaGym通过工具集成强化学习提升医学图像分析的代理训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22351 2026-01-08 cs.CV cs.AI 73%

VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement

VULCAN:工具增强的多智能体用于迭代3D物体排列

Zhengfei Kuang, Rui Lin, Long Zhao, Gordon Wetzstein, Saining Xie, Sanghyun Woo

机构 * Stanford University(斯坦福大学) Google(谷歌) New York University(纽约大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 VULCAN通过引入MCP API、视觉工具和多智能体框架,提升了3D物体排列任务中MLLMs的视觉接地能力与迭代处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08098 2025-11-12 cs.RO cs.AI cs.CL cs.HC 73%

PerspAct: Enhancing LLM Situated Collaboration Skills through Perspective Taking and Active Vision

Sabrina Patania, Luca Annese, Anita Pellegrini, Silvia Serino, Anna Lambiase, Luca Pallonetto, Silvia Rossi, Simone Colombani, Tom Foulsham, Azzurra Ruggeri, Dimitri Ognibene

机构 * University of Milan-Bicocca(米兰-比科卡大学) University of Naples Federico II(那不勒斯费德里科二世大学) Oversonic Robotics(Oversonic机器人公司) University of Essex(埃塞克斯大学) TUM School of Social Sciences and Technology(慕尼黑技术大学社会科学与技术学院)

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

Comments Accepted at IAS19

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13757 2025-11-11 cs.MA cs.AI cs.CL cs.HC 73%

MobA: Multifaceted Memory-Enhanced Adaptive Planning for Efficient Mobile Task Automation

Zichen Zhu, Hao Tang, Yansi Li, Dingye Liu, Hongshen Xu, Kunyao Lan, Danyang Zhang, Yixuan Jiang, Hao Zhou, Chenrun Wang, Situo Zhang, Liangtai Sun, Yixiao Wang, Yuheng Sun, Lu Chen, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

Comments NAACL 2025 Demo Track [code] https://github.com/OpenDFM/MobA [dataset] https://huggingface.co/datasets/OpenDFM/MobA-MobBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24161 2025-10-29 cs.AI cs.MM cs.RO 73%

BLM$_1$: A Boundless Large Model for Cross-Space, Cross-Task, and Cross-Embodiment Learning

Wentao Tan, Bowen Wang, Heng Zhi, Chenyu Liu, Zhe Li, Jian Liu, Zengrong Lin, Yukun Dai, Yipeng Chen, Wenjie Yang, Enci Xie, Hao Xue, Baixu Ji, Chen Xu, Zhibin Wang, Tianshi Wang, Lei Zhu, Heng Tao Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21148 2025-10-21 cs.CL cs.AI 73%

A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers

Ming Hu, Chenglong Ma, Wei Li, Wanghan Xu, Jiamin Wu, Jucheng Hu, Tianbin Li, Guohang Zhuang, Jiaqi Liu, Yingzhou Lu, Ying Chen, Chaoyang Zhang, Cheng Tan, Jie Ying, Guocheng Wu, Shujian Gao, Pengcheng Chen, Jiashi Lin, Haitao Wu, Lulu Chen, Fengxiang Wang, Yuanyuan Zhang, Xiangyu Zhao, Feilong Tang, Encheng Su, Junzhi Ning, Xinyao Liu, Ye Du, Changkai Ji, Pengfei Jiang, Cheng Tang, Ziyan Huang, Jiyao Liu, Jiaqi Wei, Yuejin Yang, Xiang Zhang, Guangshuai Wang, Yue Yang, Huihui Xu, Ziyang Chen, Yizhou Wang, Chen Tang, Jianyu Wu, Yuchen Ren, Siyuan Yan, Zhonghua Wang, Zhongxing Xu, Shiyan Su, Shangquan Sun, Runkai Zhao, Zhisheng Zhang, Dingkang Yang, Jinjie Wei, Jiaqi Wang, Jiahao Xu, Jiangtao Yan, Wenhao Tang, Hongze Zhu, Yu Liu, Fudi Wang, Yiqing Shen, Yuanfeng Ji, Yanzhou Su, Tong Xie, Hongming Shan, Chun-Mei Feng, Zhi Hou, Diping Song, Lihao Liu, Yanyan Huang, Lequan Yu, Bin Fu, Shujun Wang, Xiaomeng Li, Xiaowei Hu, Yun Gu, Ben Fei, Benyou Wang, Yuewen Cao, Minjie Shen, Jie Xu, Haodong Duan, Fang Yan, Hongxia Hao, Jielan Li, Jiajun Du, Yanbo Wang, Imran Razzak, Zhongying Deng, Chi Zhang, Lijun Wu, Conghui He, Zhaohui Lu, Jinhai Huang, Wenqi Shao, Yihao Liu, Siqi Luo, Yi Xin, Xiaohong Liu, Fenghua Ling, Yuqiang Li, Aoran Wang, Siqi Sun, Qihao Zheng, Nanqing Dong, Tianfan Fu, Dongzhan Zhou, Yan Lu, Wenlong Zhang, Jin Ye, Jianfei Cai, Yirong Chen, Wanli Ouyang, Yu Qiao, Zongyuan Ge, Shixiang Tang, Junjun He, Chunfeng Song, Lei Bai, Bowen Zhou

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20021 2025-09-25 cs.AI cs.CL cs.RO 73%

Embodied AI: From LLMs to World Models

Tongtong Feng, Xin Wang, Yu-Gang Jiang, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

Comments Accepted by IEEE CASM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10778 2025-08-15 cs.CV cs.AI 73%

Warehouse Spatial Question Answering with LLM Agent

Hsiang-Wei Huang, Jen-Hao Cheng, Kuang-Ming Chen, Cheng-Yen Yang, Bahaa Alattar, Yi-Ru Lin, Pyongkun Kim, Sangwon Kim, Kwangju Kim, Chung-I Huang, Jenq-Neng Hwang

机构 * Information Processing Lab, University of Washington, USA(华盛顿大学信息处理实验室) Electronics and Telecommunications Research Institute, South Korea(韩国电子电信研究院) National Center for High-performance Computing, Taiwan(台湾高性能计算国家研究中心)

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 1st Place Solution of the 9th AI City Challenge Track 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19769 2025-06-25 cs.MM cs.AI 73%

A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects

Shulan Ruan, Rongwei Wang, Xuchen Shen, Huijie Liu, Baihui Xiao, Jun Shi, Kun Zhang, Zhenya Huang, Yu Liu, Enhong Chen, You He

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14021 2025-03-19 cs.CV cs.AI cs.HC 73%

MP-GUI: Modality Perception with MLLMs for GUI Understanding

Ziwei Wang, Weizhi Chen, Leyang Yang, Sheng Zhou, Shengchu Zhao, Hanbei Zhan, Jiongchao Jin, Liangcheng Li, Zirui Shao, Jiajun Bu

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Paper accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02828 2024-10-07 cs.CR cs.AI cs.CL 73%

PyRIT: A Framework for Security Risk Identification and Red Teaming in Generative AI System

Gary D. Lopez Munoz, Amanda J. Minnich, Roman Lutz, Richard Lundeen, Raja Sekhar Rao Dheekonda, Nina Chikanov, Bolor-Erdene Jagdagdorj, Martin Pouliot, Shiven Chawla, Whitney Maxwell, Blake Bullwinkel, Katherine Pratt, Joris de Gruyter, Charlotte Siska, Pete Bryan, Tori Westerhoff, Chang Kawaguchi, Christian Seifert, Ram Shankar Siva Kumar, Yonatan Zunger

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17781 2024-06-27 cs.CV cs.AI cs.HC 73%

Large Language Models estimate fine-grained human color-concept associations

Kushin Mukherjee, Timothy T. Rogers, Karen B. Schloss

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10227 2024-06-17 cs.CV cs.AI 73%

VideoGUI: A Benchmark for GUI Automation from Instructional Videos

Kevin Qinghong Lin, Linjie Li, Difei Gao, Qinchen WU, Mingyi Yan, Zhengyuan Yang, Lijuan Wang, Mike Zheng Shou

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

Comments 24 pages, 16 tables, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01014 2024-06-04 cs.CL cs.CV 73%

Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration

Junyang Wang, Haiyang Xu, Haitao Jia, Xi Zhang, Ming Yan, Weizhou Shen, Ji Zhang, Fei Huang, Jitao Sang

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL

Comments 22 pages, 11 figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.15837 2023-06-29 cs.CL cs.AI 73%

Symbol emergence as interpersonal cross-situational learning: the emergence of lexical knowledge with combinatoriality

Yoshinobu Hagiwara, Kazuma Furukawa, Takafumi Horie, Akira Taniguchi, Tadahiro Taniguchi

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.10638 2020-04-07 cs.CV cs.CL cs.LG cs.RO 73%

Towards Learning a Generic Agent for Vision-and-Language Navigation via Pre-training

Weituo Hao, Chunyuan Li, Xiujun Li, Lawrence Carin, Jianfeng Gao

专题命中 多模态Agent :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL

Comments To appear at CVPR 2020. The first two authors contributed equally to this manuscript. Code: https://github.com/weituo12321/PREVALENT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13190 2026-06-12 cs.RO cs.HC 新提交 71%

Multi-Modal Multi-Agent Robotic Cognitive Alignment enabled by Non-Invasive Consumer Brain Computer Interfaces: A Proof of Concept Exploration

基于非侵入式消费级脑机接口的多模态多智能体机器人认知对齐:概念验证探索

Nataliya Kosmyna, Liz Jenkins, Anoop K. Sinha

机构 * GOOGLE(谷歌) Paradigms of Intelligence(智能范式) Cambridge, MA, United States(马萨诸塞州剑桥市,美国) Mountain View, CA, United States(加利福尼亚州山景城,美国)

专题命中 多模态Agent :multi-modal(title)

AI总结 提出一种框架,利用消费级脑机接口监测脑电信号,在高认知负荷时延迟智能体通信,实现认知对齐的多智能体交互,初步验证了实时信号处理、大语言模型与机器人结合的可行性。

Comments 19 pages, 9 figures, for associated video, see https://youtu.be/0Tav-G87XGs

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01774 2026-05-12 cs.RO cs.SY eess.SY 71%

MOBIUS: A Multi-Modal Bipedal Robot that can Walk, Crawl, Climb, and Roll

MOBIUS:一种能够行走、爬行、攀爬和滚动的多模态双足机器人

Alexander Schperberg, Yusuke Tanaka, Stefano Di Cairano, Dennis Hong

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室) Robotic Systems Lab(机器人系统实验室) Robotics and Mechanisms Laboratory(机器人与机构实验室) Department of Mechanical and Aerospace Engineering, University of California, Los Angeles(加州大学洛杉矶分校机械与航空航天工程系)

专题命中 多模态Agent :multi-modal(title)

AI总结 MOBIUS机器人通过四条肢体实现多种运动模式切换,结合强化学习与混合规划架构,实现动态攀爬与负载支撑,拓展了移动操作与抓取能力。

Comments Paper is accepted at the Robotics: Science and Systems conference, held in Sydney, Australia, July 13th-17th, 2026. Alexander Schperberg and Yusuke Tanaka are co-first authors. Both were at the Robotics and Mechanisms Laboratory (RoMeLa) at UCLA when the work started, and are now with Mitsubishi Electric Research Laboratories and ETH Zurich (RSL) respectively

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21410 2026-03-24 cs.RO 71%

Bayesian Active Object Recognition and 6D Pose Estimation from Multimodal Contact Sensing

基于多模态接触传感的贝叶斯主动物体识别与6D位姿估计

Haodong Zheng, Gabriele M. Caddeo, Andrei C. Jalba, Wijnand A. IJsselsteijn, Lorenzo Natale, Raymond H. Cuijpers

机构 * Eindhoven University of Technology(埃因霍温理工大学) Italian Institute of Technology(意大利理工学院) Humanoid Sensing and Perception Group(人形感知与感知小组)

专题命中 多模态Agent :multimodal(title)

AI总结 本文提出一种结合触觉与自由空间约束的贝叶斯框架,用于联合物体识别和6D位姿估计,通过定制粒子滤波器提升推理效率,并利用推理结果指导主动探索,实验表明触觉信息显著提升了识别和位姿估计的准确性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08260 2026-03-10 cs.RO 71%

Seed2Scale: A Self-Evolving Data Engine for Embodied AI via Small to Large Model Synergy and Multimodal Evaluation

Seed2Scale: 一种通过小到大模型协同和多模态评估的自我进化数据引擎用于具身AI

Cong Tai, Zhaoyu Zheng, Haixu Long, Hansheng Wu, Zhengbin Long, Haodong Xiang, Rong Shi, Zhuo Cui, Shizhuang Zhang, Gang Qiu, He Wang, Ruifeng Li, Biao Liu, Zhenzhe Sun, Tao Shen

机构 * ZTE Corporation(中兴通讯公司)

专题命中 多模态Agent :multimodal(title)

AI总结 Seed2Scale通过小到大模型协同和多模态评估,实现具身AI的自我进化数据引擎,显著提升性能并提供可扩展的开发路径

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16895 2026-02-20 cs.HC 71%

Connecting the Dots: Surfacing Structure in Documents through AI-Generated Cross-Modal Links

连接点:通过AI生成的跨模态链接揭示文档结构

Alyssa Hwang, Hita Kambhamettu, Yue Yang, Ajay Patel, Joseph Chee Chang, Andrew Head

专题命中 多模态Agent :cross-modal(title)

AI总结 本文提出通过AI生成跨模态链接的框架,帮助用户更高效地理解和整合复杂文档中的信息。

Comments 40 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10648 2026-02-12 cs.HC 71%

Generative Muscle Stimulation: Providing Users with Physical Assistance by Constraining Multimodal-AI with Embodied Knowledge

生成性肌肉刺激:通过将多模态AI与具身知识相结合,为用户提供物理帮助

Yun Ho, Romain Nith, Peili Jiang, Steven He, Bruno Felalaga, Shan-Yuan Teng, Rhea Seeralan, Pedro Lopes

专题命中 多模态Agent :multimodal(title)

AI总结 本研究提出通过结合多模态AI与具身知识生成肌肉刺激指令,实现更通用的物理辅助系统。

Comments 22 pages, 29 figures

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10809 2026-01-28 cs.CR cs.LG 71%

MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents

针对代理的恶意图像补丁:多模态操作系统代理劫持

Lukas Aichberger, Alasdair Paren, Guohao Li, Philip Torr, Yarin Gal, Adel Bibi

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) University of Oxford(牛津大学)

专题命中 多模态Agent :multimodal(title)

AI总结 本文提出恶意图像补丁(MIPs)攻击,通过篡改屏幕区域使多模态OS代理执行有害操作,揭示了OS代理的安全漏洞。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03630 2025-12-04 cs.RO 71%

Multimodal Control of Manipulators: Coupling Kinematics and Vision for Self-Driving Laboratory Operations

多模态操作臂控制:结合运动学与视觉的自我驱动实验室操作

Shifa Sulaiman, Amarnath H, Simon Bogh, Naresh Marturi

机构 * 1 Department of Electronics Systems, Aalborg University, Denmark 3 Extreme Robotics Laboratory, School of Metallurgy \& Materials, University of Birmingham, Birmingham, United Kingdom

专题命中 多模态Agent :multimodal(title)

AI总结 本文提出三种基于雅可比方法的运动规划方案,结合RRT*算法和螺旋理论,用于优化冗余机械臂与耦合手指夹具的轨迹规划与逆解计算,以提升实验室自动化操作的效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20904 2025-11-27 cs.IR 71%

Generating Querying Code from Text for Multi-Modal Electronic Health Record

从文本生成多模态电子健康记录的查询代码

Mengliang ZHang

专题命中 多模态Agent :multi-modal(title)

AI总结 本文提出TQGen-EHRQuery框架,通过整合表格和文本数据,提升多模态电子健康记录查询的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24413 2025-09-30 cs.RO cs.HC 71%

DynaMIC: Dynamic Multimodal In-Context Learning Enabled Embodied Robot Counterfactual Resistance Ability

Tianqiang Yan, Ziqiao Lin, Sicheng Wang, Tianwei Zhang, Zhenglong Sun

机构 * Faculty of Information Technology, Monash University(墨尔本大学信息技术学院) School of Science and Engineering, the Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)科学与工程学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society, the Chinese University of Hong Kong-Shenzhen(深圳人工智能与机器人研究院)

专题命中 多模态Agent :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00586 2025-08-14 cs.RO cs.LG 71%

ParkDiffusion: Heterogeneous Multi-Agent Multi-Modal Trajectory Prediction for Automated Parking using Diffusion Models

Jiarong Wei, Niclas Vödisch, Anna Rehr, Christian Feist, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系) CARIAD SE(CARIAD公司)

专题命中 多模态Agent :multi-modal(title)

Comments IROS 2025 Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07894 2025-08-08 math.OC 71%

Complexity Analysis of a Bicriteria Directed Multimodal Transportation Network Design Problem

Dominik Leib, Susanne Fritzler, Neele Leithäuser

专题命中 多模态Agent :multimodal(title)

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏