arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2777 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2777 篇

2507.10722 2026-04-13 q-bio.NC cs.NE 50%

Bridging Brains and Machines: A Unified Frontier in Neuroscience, Artificial Intelligence, and Neuromorphic Systems

连接大脑与机器:神经科学、人工智能与神经形态系统的统一前沿

Sohan Shankar, Yi Pan, Hanqi Jiang, Zhengliang Liu, Mohammad R. Darbandi, Agustin Lorenzo, Junhao Chen, Weihang You, Md Mehedi Hasan, Arif Hassan Zidan, Eliana Gelman, Joshua A. Konfrst, Jillian Y. Russell, Katelyn Fernandes, Tianze Yang, Yiwei Li, Huaqin Zhao, Afrar Jahin, Triparna Ganguly, Shair Dinesha, Yifan Zhou, Zihao Wu, Xinliang Li, Lokesh Adusumilli, Aziza Hussein, Sagar Nookarapu, Jixin Hou, Kun Jiang, Jiaxi Li, Brenden Heinel, XianShen Xi, Hailey Hubbard, Zayna Khan, Levi Whitaker, Ivan Cao, Max Allgaier, Andrew Darby, Lin Zhao, Lu Zhang, Xiaoqiao Wang, Xiang Li, Wei Zhang, Xiaowei Yu, Dajiang Zhu, Yohannes Abate, Tianming Liu

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文探讨神经科学、通用人工智能与神经形态计算的融合,提出基于脑生理学的框架,总结了突触可塑性、稀疏脉冲通信和多模态关联在下一代AGI系统中的应用,并讨论了突破冯·诺依曼瓶颈的物理子系统及四个关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21354 2026-04-10 cs.LG cs.DC 50%

The Workload-Router-Pool Architecture for LLM Inference Optimization: A Vision Paper from the vLLM Semantic Router Project

面向LLM推理优化的负载-路由-池架构:来自vLLM语义路由项目的愿景论文

Huamin Chen, Xunzhuo Liu, Bowei He, Fuyuan Lyu, Yankai Chen, Xue Liu, Yuhan Liu, Junchen Jiang

机构 * McGill University(麦吉尔大学) University of Chicago(芝加哥大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出Workload-Router-Pool架构,通过负载、路由、池三个维度优化LLM推理,结合路由策略与负载特征,解决多任务、多模态、多代理场景下的推理效率与安全性问题。

Comments Vision Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05265 2026-04-08 cs.HC 50%

Semantic Reality: Interactive Context-Aware Visualization of Inter-Object Relationships in Augmented Reality

语义现实:增强现实中的交互式上下文感知多物体关系可视化

Xiaoan Liu, Eric J Gonzalez, Nels Numan, Andrea Colaço, Lucy Abramyan, Chen Zhu-Tian, Ryo Suzuki, Mar Gonzalez-Franco

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出Semantic Reality系统,通过多模态推理和空间锚定技术,实现增强现实中的多物体关系交互可视化,提升任务理解和参与度。

Comments 15 pages, 15 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03327 2026-04-07 math.OC 50%

Approximation Algorithms for Line Planning with Heterogeneous Fleets and Multiple Resource Constraints

具有异质车队和多重资源约束的线路规划近似算法

Hongyi Jiang, Igor Averbakh, Samitha Samaranayake

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文研究了面临预算、劳动力和排放限制的公共交通巴士网络线路规划问题,提出了一种具有理论保证的近似算法,解决了异质车队和多重资源约束下的线路规划问题,实验表明其在大规模应用中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03509 2026-04-07 physics.med-ph 50%

Applications of Large Language Models in Radiation Oncology: From Workflow Automation to Clinical Intelligence

大型语言模型在放射肿瘤学中的应用:从工作流自动化到临床智能

Yuzhen Ding, Jason Holmes, Yuexing Hao, Zhengliang Liu, Peilong Wang, Junjie Cui, Meiyun Cao, Caiwen Jiang, Shuoyang Wei, Lin Zhao, Chenbin Liu, Lian Zhang, Yunze Yang, Tianming Liu, Wei Liu

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文探讨了大型语言模型在放射肿瘤学中的应用,包括工作流自动化、临床智能及决策支持,展示了其在标准化命名、注册管理及放疗计划评估中的核心贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03406 2026-04-07 cs.GR 50%

SASAV: Self-Directed Agent for Scientific Analysis and Visualization

SASAV:面向科学分析和可视化的自主代理

Jianxin Sun, David Lenz, Tom Peterka, Hongfeng Yu

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出SASAV,首个无需外部提示或人类在环反馈的自主AI代理,可自动执行科学数据分析并生成有洞察力的可视化,推动AI for Science加速大规模科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02759 2026-04-06 cs.RO 50%

OMNI-PoseX: A Fast Vision Model for 6D Object Pose Estimation in Embodied Tasks

OMNI-PoseX:一种用于具身任务中6D物体姿态估计的高效视觉模型

Michael Zhang, Wei Ying, Fangwen Chen, Shifeng Bai, Hanwen Kang

机构 * KernalMind Tech Co., Ltd.(KernalMind科技有限公司)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出OMNI-PoseX,一种结合开放词汇感知与SO(3)感知的高效视觉模型,通过轻量级多模态融合策略实现稳定且高效的6D姿态估计,并在多个基准测试中展示了SOTA的精度和实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10970 2026-04-06 cs.CY cs.HC 50%

Simulating Couple Conflict: Designing A Multi-Agent System for Therapy Training and Practice

模拟夫妻冲突:为治疗训练和实践设计一个多智能体系统

Canwen Wang, Angela Chen, Catherine Bao, Siwei Jin, Holly Swartz, Tongshuang Wu, Robert E Kraut, Haiyi Zhu

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出一个多智能体系统,用于模拟夫妻治疗中的复杂情感动态,通过结构化交互阶段提升治疗师的实践能力与反馈准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00699 2026-04-02 physics.soc-ph 50%

Public transport in the 15-minute city

15分钟城市的公共交通

Zsófia Zádor, Gergő Pintér, Máté Mizsák, Bence Kovács, Imre Felde, Balázs Lengyel

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出将公共交通纳入15分钟城市模型的框架,通过比较赫尔辛基、马德里和布达佩斯,展示多模式交通如何提升对设施的可达性并增强社会空间整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00628 2026-04-02 cs.RO cs.HC 50%

StretchBot: A Neuro-Symbolic Framework for Adaptive Guidance with Assistive Robots

StretchBot:一种用于辅助机器人自适应指导的神经符号框架

Luca Vogelgesang, Ahmed Mehdi Soltani, Mohammadhossein Khojasteh, Xinrui Zu, Stefano De Giorgis, Madalina Croitoru, Filip Ilievski

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Montpellier(蒙彼利埃大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出StretchBot,结合多模态感知与知识图谱引导的大语言模型推理,实现短时间伸展指导中的情境感知调整,同时保持结构化流程。实验显示自适应指导在适应性和相关性上更优,而脚本指导在流畅性和可预测性上仍具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11062 2026-04-02 cs.HC cs.MA 50%

Auto-Slides: An Interactive Multi-Agent System for Creating and Customizing Research Presentations

Auto-Slides:一个用于创建和定制研究演示的交互式多智能体系统

Yuheng Yang, Wenjia Jiang, Yang Wang, Yi Song, Yiwei Wang, Chi Zhang

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出Auto-Slides系统,利用大语言模型将学术论文转化为结构化的多模态幻灯片,通过交互式编辑器实现个性化学习,提升学习者对复杂概念的理解与参与度。

Comments Project Homepage: https://auto-slides.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28952 2026-04-01 cs.RO 50%

World2Rules: A Neuro-Symbolic Framework for Learning World-Governing Safety Rules for Aviation

World2Rules: 一种用于航空领域学习世界治理安全规则的神经符号框架

Haichuan Wang, Jay Patrikar, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 World2Rules通过结合神经网络和符号方法,从航空多模态数据中学习安全规则,提升规则的准确性和可解释性,实验显示其在F1得分上优于纯神经和单步神经符号基线。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28889 2026-04-01 cs.DB 50%

DeepEye: A Steerable Self-driving Data Agent System

DeepEye:一种可调节的自动驾驶数据代理系统

Boyan Li, Yiran Peng, Yupeng Xie, Sirong Lu, Yizhang Zhu, Xing Mu, Xinyu Liu, Yuyu Luo

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出DeepEye,一种基于工作流的生产级数据代理系统,通过统一多模态协调协议和分层推理机制,解决异构数据源联合分析和上下文爆炸问题,实现透明执行和自动化优化。

Comments SIGMOD Demo (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26997 2026-03-31 cs.RO cs.HC 50%

ROSClaw: An OpenClaw ROS 2 Framework for Agentic Robot Control and Interaction

ROSClaw: 一种用于代理机器人控制与交互的OpenClaw ROS 2框架

Irvin Steve Cardenas, Marcus Anthony Arnett, Natalie Catherine Yeo, Lucky Sah, Jong-Hoon Kim

机构 * Advanced Telerobotics Research Lab, Kent State University(肯特州立大学先进远程机器人研究实验室) OpenDive Technologies

专题命中 多模态Agent :multimodal(abstract)

AI总结 ROSClaw通过整合OpenClaw代理运行时与ROS 2,实现任意基础模型与ROS-enabled机器人之间的交互,支持动态能力发现、多模态观察归一化、预执行动作验证和结构化审计日志,验证了执行层设计对任务完成与安全行为的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21723 2026-03-30 cs.RO cs.MA 50%

Can a Robot Walk the Robotic Dog: Triple-Zero Collaborative Navigation for Heterogeneous Multi-Agent Systems

机器人能否行走:异构多智能体系统的三零协同导航

Yaxuan Wang, Yifan Xiang, Ke Li, Xun Zhang, BoWen Ye, Zhuochen Fan, Fei Wei, Tong Yang

机构 * Yuanpei College, Peking University(北京大学元培学院) School of Computer Science, Peking University(北京大学计算机学院) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) Pengcheng Laboratory(鹏城实验室) Beijing Jinruyi Large Model Technology Co., Ltd.(北京金如意大模型科技有限公司)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出三零路径规划框架,通过协调者-探索者架构实现无需训练、无需先验知识和无需模拟的异构多机器人系统协作导航,实验显示其在复杂环境中具有鲁棒性和适应性。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24328 2026-03-26 eess.SP 50%

Towards Semantic-based Agent Communication Networks: Vision, Technologies, and Challenges

迈向基于语义的智能体通信网络:愿景、技术与挑战

Ping Zhang, Rui Meng, Xiaodong Xu, Yaheng Wang, Zixuan Huang, Yiming Liu, Ruichen Zhang, Yinqiu Liu, Haonan Tong, Huishi Song, Gang Wu, Zhaoming Lu, Jiawen Kang, Geng Sun, Qinghe Du, Zhaohui Yang, Jingxuan Zhang, Han Meng, Lexi Xu, Haitao Zhao, Zesong Fei, Yiqing Zhou, Pei Xiao, Meixia Tao, Qinyu Zhang, Shuguang Cui, Rahim Tafazolli

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文探讨语义在智能体通信网络中的作用,提出新的架构并综述现有技术,识别关键挑战并提出解决方案。

Comments 46 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23393 2026-03-25 cs.RO 50%

Rectify, Don't Regret: Avoiding Pitfalls of Differentiable Simulation in Trajectory Prediction

纠正,而非后悔:避免可微模拟在轨迹预测中的陷阱

Harsh Yadav, Christian Bohn, Tobias Meisen

机构 * University of Wuppertal(乌珀塔尔大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出一种非可微的递推滚动方法,通过切断计算图来避免可微模拟中的捷径学习,提升轨迹预测的鲁棒性和恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23079 2026-03-25 cs.RO 50%

AirSimAG: A High-Fidelity Simulation Platform for Air-Ground Collaborative Robotics

AirSimAG:一种高保真空地协同机器人仿真平台

Yangjie Cui, Xin Dong, Boyang Gao, Jinwu Xiang, Daochun Li, Zhan Tu

机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) Institution of Unmanned System, Beihang University(北京航空航天大学无人系统研究院)

专题命中 多模态Agent :cross-modal(abstract)

AI总结 本文提出AirSimAG,一种高保真的空地协同机器人仿真平台,支持多智能体同步仿真和异构传感控制接口,通过多个代表性任务验证其在多智能体协调和跨模态数据一致性方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22903 2026-03-25 cs.RO 50%

Task-Aware Positioning for Improvisational Tasks in Mobile Construction Robots via an AI Agent with Multi-LMM Modules

面向即兴任务的移动建筑机器人AI代理的定位任务感知

Seongju Jang, Francis Baek, SangHyun Lee

机构 * University of Michigan(密歇根大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种AI代理,通过多LMM模块实现对自然语言描述的即兴任务的理解与定位,使移动建筑机器人能自主完成非预定义任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21706 2026-03-24 physics.med-ph 50%

Comprehensive Dosimetric Verification and Positional Sensitivity Analysis in Brachytherapy: A Unified ESAPI Tool for HDR and LDR Treatments

放射治疗中的全面剂量学验证与位置敏感性分析:一种用于 HDR 和 LDR 治疗的统一 ESAPI 工具

J. A. Valgoma

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出了一种基于 Varian Eclipse Scripting API 的独立软件工具,用于验证 HDR 和 LDR 放射治疗的 QA,通过比较点源和线源模型,分析位置不确定性,并提高临床工作流程的安全性。

Comments 13 pages, 2 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01834 2026-03-24 cs.RO 50%

Concept-Based Dictionary Learning for Inference-Time Safety in Vision Language Action Models

基于概念的词典学习用于推理时的安全性在视觉语言动作模型中

Siqi Wen, Shu Yang, Shaopeng Fu, Jingfeng Zhang, Lijie Hu, Di Wang

机构 * Beijing Jiaotong University(北京交通大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析实验室) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) University of Auckland(奥克兰大学) RIKEN Center for Advanced Intelligence Project (AIP)(理化学研究所高级智能项目中心) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出基于概念的词典学习框架,用于提升视觉语言动作模型推理时的安全性,通过学习稀疏可解释词典识别有害概念方向并抑制风险组件,实验表明其在多个基准上有效降低攻击成功率70%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19988 2026-03-24 stat.ML cs.LG q-bio.QM 50%

BioBO: Biology-informed Bayesian Optimization for Perturbation Design

BioBO:结合生物学知识的贝叶斯优化用于扰动设计

Yanke Li, Tianyu Cui, Tommaso Mansi, Mangal Prakash, Rui Liao

机构 * Johnson & Johnson Innovative Medicine(强生创新医药) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 BioBO结合多模态基因嵌入和富集分析,提升代理建模和获取策略,提高标签效率25-40%,并提供路径级解释,链接设计与生物调控电路。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16963 2026-03-24 cs.RO cs.SY eess.SY 50%

A Tactile-based Interactive Motion Planner for Robots in Unknown Cluttered Environments

基于触觉的交互式运动规划器用于未知杂乱环境中的机器人

Chengjin Wang, Yanmin Zhou, Zheng Yan, Feng Luan, Runjie Shen, Hongrui Sang, Zhipeng Wang, Bin He

机构 * Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心) College of Electronics and Information Engineering, Tongji University(同济大学电子与信息学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出了一种基于触觉的交互式运动规划框架,通过多模态触觉感知实时构建接触模型,从而在未知杂乱环境中安全扩展自由运动空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20560 2026-03-24 cs.HC cs.GR 50%

Nevis Digital Twin: Photogrammetry and Immersive Visualization of Historical Sites

Nevis数字孪生:历史遗址的摄影测量与沉浸式可视化

Alex Apffel, Huy Tran, Vuthea Chheang

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出了一种多模态数据采集流程,用于保护受威胁的历史遗址,通过摄影测量和3D高斯点散布实现虚拟重建,以提供可扩展的数字遗产民主化模型。

Comments ARCHERIX Workshop - IEEE VR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20355 2026-03-24 eess.IV 50%

CaroTo: A Tool for Fast Comprehensive Analysis of Carotid Artery Stenosis in 4D PC- and 3D BB-MRI Data

CaroTo:一种用于快速全面分析4D PC-和3D BB-MRI数据颈动脉狭窄的工具

Hinrich Rahlfs, Markus Hüllebrand, Sebastian Schmitter, Jonathan Andrae, Christoph Strecker, Andreas Harloff, Anja Hennemuth

专题命中 多模态Agent :multimodal(abstract)

AI总结 CaroTo工具通过多模态和多维分割、生物标志物提取和可视化,实现颈动脉动脉粥样斑块的标准化评估,提升颈动脉狭窄分析的精度和一致性。

Comments VCBM 2024, Poster Honorable Mention

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19858 2026-03-23 cs.RO cs.MA 50%

Beyond detection: cooperative multi-agent reasoning for rapid onboard EO crisis response

超越检测:用于快速在轨遥感危机响应的协作多智能体推理

Alejandro D. Mousist, Pedro Delgado de Robles Martín, Raquel Lladró Climent, Julian Cobos Aparicio

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出了一种分层多智能体架构,用于在轨遥感处理,在资源和带宽受限条件下,通过协调专用AI智能体实现互补多模态观测的利用,减少计算开销并保持决策一致性。

Comments Accepted for presentation at the ESA's 4S Symposium 2026 Conference (see https://atpi.eventsair.com/4s-symposium-2026/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19555 2026-03-23 astro-ph.IM 50%

SpecZoo: An AI-Powered Platform for Spectral Analysis and Visualization in Science and Education

SpecZoo:一个基于AI的天文光谱分析与可视化平台

Yuan-Hao Pu, Guo-Hong Lei, Yang Xu, Xun-Zhou Chen, Hai-Jun Tian

专题命中 多模态Agent :multi-modal(abstract)

AI总结 SpecZoo平台利用人工智能技术,整合现代信息技术和机器学习,提升光谱数据处理效率,支持光谱可视化、自动分类、参数测量及多波段数据融合,应用于LAMOST、SDSS等重大项目,并促进天文与数据科学的教育融合。

Comments 19 pages, 11 figures, 2 tables, published in the journal of 'universe' (see the special issue: https://www.mdpi.com/journal/universe/special_issues/77CGKMGC3Q)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17634 2026-03-19 eess.SY cs.SY 50%

Hierarchical Decision-Making under Uncertainty: A Hybrid MDP and Chance-Constrained MPC Approach

在不确定性下的分层决策:一种混合MDP和机会约束MPC方法

Siyuan Li, Chengyuan Liu, Wen-Hua Chen

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出一种混合MDP和机会约束MPC的分层决策框架,用于自动驾驶中处理不确定性,通过多模态预测与安全约束实现 maneuver 选择与动态可行性的统一,验证了其在高速公路和城市环境中的安全性和效率。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21676 2026-03-18 cs.RO cs.NI 50%

Real-World Deployment of Cloud-based Autonomous Mobility Systems for Outdoor and Indoor Environments

云原生自主移动系统在户外和室内环境中的实际部署

Yufeng Yang, Minghao Ning, Keqi Shu, Aladdin Saleh, Ehsan Hashemi, Amir Khajepour

机构 * Department of Mechanical and Mechatronics Engineering, University of Waterloo(滑铁卢大学机械与机电工程系) Technology Partnerships and Innovations, Rogers Communications, Canada Inc.(罗杰斯通讯加拿大有限公司技术伙伴关系与创新部) Mechanical Engineering Department, University of Alberta(阿尔伯塔大学机械工程系)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出云原生自主移动框架,通过基础设施智能传感与云计算协调提升自主操作能力,实验证明在城市环岛和医院类室内环境中的感知鲁棒性和安全性提升。

Comments This paper has been submitted to IEEE Robotics and Automation Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18373 2026-03-18 cs.RO cs.HC 50%

UGotMe: An Embodied System for Affective Human-Robot Interaction

UGotMe: 一种用于情感人机交互的具身系统

Peizhen Li, Longbing Cao, Xiao-Ming Wu, Xiaohan Yu, Runze Yang

机构 * School of Computing, Macquarie University(麦考瑞大学计算学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出UGotMe系统,解决多对话场景中视觉噪声和实时响应问题,通过去噪策略和高效数据传输提升情感识别能力。

Comments Accepted to the 2025 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏