arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4868 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 4868 篇

2604.16883 2026-04-21 cs.LG cs.AI 79%

SinkRouter: Sink-Aware Routing for Efficient Long-Context Decoding in Large Language and Multimodal Models

SinkRouter: 为大语言和多模态模型高效长上下文解码的感知路由

Junnan Liu, Xinyan Liu, Peifeng Gao, Zhaobo Qi, Beichen Zhang, Weigang Zhang, Antoni Bert Chen

机构 * Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海)) University of Hong Kong(香港大学) City University of Hong Kong(城市大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出SinkRouter,通过感知路由机制提升长上下文解码效率,减少计算冗余,实现在512K上下文下的2.03倍加速,保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16806 2026-04-21 cs.CV 79%

Channel Attention-Guided Cross-Modal Knowledge Distillation for Referring Image Segmentation

通道注意力引导的跨模态知识蒸馏用于指代图像分割

Chen Yang

机构 * School of Information Science and Technology, TaiShan University, Taian, China(信息科学与技术学院,泰山大学,泰安,中国)

专题命中 其他多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出通道注意力引导的跨模态知识蒸馏方法,用于指代图像分割,通过迁移教师网络学习的视觉语言高阶细粒度相关性和通道语义相关性,提升学生网络性能,减少计算资源消耗。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05574 2026-04-16 cs.CV 79%

A Hybrid CNN and ML Framework for Multi-modal Classification of Movement Disorders Using MRI and Brain Structural Features

一种结合CNN和ML的混合框架用于利用MRI和脑结构性质进行运动障碍多模态分类

Mengyu Li, Ingibjörg Kristjánsdóttir, Thilo van Eimeren, Kathrin Giehl, Lotta M. Ellingsen, the ASAP Neuroimaging Initiative

机构 * University of Iceland, Faculty of Electrical and Computer Engineering(冰岛大学电气与计算机工程学院) University of Iceland, Faculty of Medicine(冰岛大学医学院) University of Cologne, Faculty of Medicine(科隆大学医学院) University Hospital Cologne, Dept. of Nuclear Medicine and Dept. of Neurology(科隆大学医院核医学科和神经内科) the ASAP Neuroimaging Initiative(ASAP神经影像倡议)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出结合CNN与ML的混合框架,用于区分APD亚型与PD及亚型间差异,利用MRI和脑结构性质数据实现高分类精度。

Comments To be published in Proceedings of SPIE Medical Imaging 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06448 2026-04-15 cs.CL 79%

Perception-Aware Policy Optimization for Multimodal Reasoning

面向多模态推理的感知意识策略优化

Zhenhailong Wang, Xuehang Guo, Sofia Stoica, Haiyang Xu, Hongru Wang, Hyeonjeong Ha, Xiusi Chen, Yangyi Chen, Ming Yan, Fei Huang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Alibaba Group(阿里巴巴集团)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出PAPO算法,通过引入隐式感知损失提升多模态推理性能,实现4.4%-17.5%的基准提升,尤其在视觉依赖性强的任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04204 2026-04-15 cs.CV cs.LG 79%

AGMA: Adaptive Gaussian Mixture Anchors for Prior-Guided Multimodal Human Trajectory Forecasting

AGMA:自适应高斯混合锚点用于先验引导的多模态人类轨迹预测

Chao Li, Rui Zhang, Siyuan Huang, Xian Zhong, Hongbo Jiang

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出AGMA,通过两阶段方法构建表达性先验,提升多模态人类轨迹预测的准确性和多样性,实验表明其在ETH-UCY等数据集上达到SOTA性能。

Comments Withdrawn for substantial revision and will be re-uploaded as a new manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28618 2026-04-10 cs.AI 79%

Seeing with You: Perception-Reasoning Coevolution for Multimodal Reasoning

与你共见:多模态推理中的感知-推理共进化

Ziqi Miao, Haonan Jia, Lijun Li, Chen Qian, Yuan Xiong, Wenting Yan, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Zhejiang University(浙江大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出PRCO框架,通过分离的奖励信号提升多模态推理的感知与推理能力,在八个基准测试中平均提升7个百分点。

Comments 21 pages, 15 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05704 2026-04-09 cs.AI 79%

QA-MoE: Towards a Continuous Reliability Spectrum with Quality-Aware Mixture of Experts for Robust Multimodal Sentiment Analysis

QA-MoE:迈向具有质量感知专家混合的连续可靠性光谱以实现稳健的多模态情感分析

Yitong Zhu, Yuxuan Jiang, Guanxuan Jiang, Bojing Hou, Peng Yuan Zhou, Ge Lin Kan, Yuyang Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Aarhus University(奥胡斯大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出QA-MoE框架,通过自监督的aleatoric不确定性量化模态可靠性,以应对多模态输入中的动态噪声和模态缺失问题,实现稳健的情感分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02483 2026-04-06 physics.flu-dyn cs.AI 79%

A Multimodal Vision Transformer-based Modeling Framework for Prediction of Fluid Flows in Energy Systems

一种基于多模态视觉Transformer的建模框架,用于能量系统中流体流动的预测

Kiran Yalamanchi, Shivam Barwey, Ibrahim Jarrah, Pinaki Pal

机构 * Transportation and Power Systems Division, Argonne National Laboratory(阿贡国家实验室交通与电力系统部)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于Transformer的建模框架,用于预测复杂流体流动,通过多模态数据集训练模型,实现跨分辨率和模态的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02221 2026-04-03 cs.HC cs.AI 79%

Impact of Multimodal and Conversational AI on Learning Outcomes and Experience

多模态和对话式AI对学习成果和体验的影响

Karan Taneja, Anjali Singh, Ashok K. Goel

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究比较了三种生物学学习方法,发现多模态对话式AI在学习成果和体验上表现最佳,但文本仅对话式AI虽易用但效果最差,揭示了认知负荷理论下的学习效果与感知之间的差异。

Comments 16 pages, 3 figures, Accepted to AIED 2026 (Seoul, South Korea)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01921 2026-04-03 cs.CV cs.LG cs.RO 79%

Learning Spatial Structure from Pre-Beamforming Per-Antenna Range-Doppler Radar Data via Visibility-Aware Cross-Modal Supervision

通过可见性感知的跨模态监督学习从预波束成形每根天线范围-多普勒雷达数据中学习空间结构

George Sebastian, Philipp Berthold, Bianca Forkel, Leon Pohl, Mirko Maehlisch

机构 * University of the Bundeswehr Munich(慕尼黑联邦国防军大学)

专题命中 其他多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文探讨了能否直接从预波束成形的每根天线范围-多普勒测量中学习有意义的空间结构,通过可见性感知的跨模态监督学习方法,评估了不同发射配置对几何恢复能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29422 2026-04-01 cs.CV 79%

Multimodal Models Meet Presentation Attack Detection on ID Documents

多模态模型在身份证文档呈现攻击检测中的应用

Marina Villanueva, Juan M. Espin, Juan E. Tapia

机构 * Security Research Group Hochschule Darmstadt, Germany

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文探讨了将视觉和文本模态结合,利用预训练多模态模型提升身份证文档呈现攻击检测性能,但实验表明这些模型在该任务上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22601 2026-03-31 cs.LG cs.CV 79%

$ϕ$-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models

$ϕ$-DPO:面向大多模态模型持续学习的公平性直接偏好优化方法

Thanh-Dat Truong, Huu-Thien Tran, Jackson Cothren, Bhiksha Raj, Khoa Luu

机构 * CVIU Lab, University of Arkansas(阿肯色大学 CVIU 实验室) Dep. of Geosciences, University of Arkansas(阿肯色大学地球科学系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出$ϕ$-DPO框架,通过直接偏好优化缓解持续学习中的灾难性遗忘问题,并解决数据不平衡导致的公平性问题,实验表明其在多个基准上表现优异。

Comments Accepted to CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05352 2026-03-31 cs.LG cs.AI 79%

Recent Advances of Multimodal Continual Learning: A Comprehensive Survey

多模态持续学习的最新进展:综合性综述

Dianzhi Yu, Xinni Zhang, Yankai Chen, Aiwei Liu, Yifei Zhang, Philip S. Yu, Irwin King

机构 * Tsinghua University(清华大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文综述了多模态持续学习的最新进展,分析了其核心挑战与方法分类,提出四种主要方法类别,并讨论了未来研究方向和开放资源。

Comments Accepted by IEEE Transactions on Neural Networks and Learning Systems (TNNLS). DOI: 10.1109/TNNLS.2026.3658485. Copyright 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26778 2026-03-31 cs.LG cs.AI 79%

TED: Training-Free Experience Distillation for Multimodal Reasoning

TED: 无需训练的经验蒸馏用于多模态推理

Shuozhi Yuan, Jinqing Wang, Zihao Liu, Miaomiao Yuan, Haoran Peng, Jin Zhao, Bingwen Wang, Haoyi Wang

机构 * China Telecom Digital Intelligence Technology Co.,Ltd.(中国电信数字智能科技有限公司) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 TED提出一种无需训练的基于上下文的经验蒸馏框架,通过将知识转移目标从模型参数转向注入学生提示中的上下文经验,提升多模态推理性能,实验表明在低数据环境下效果优于传统方法。

Comments 13 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25088 2026-03-27 cs.CV 79%

Visual Attention Drifts,but Anchors Hold:Mitigating Hallucination in Multimodal Large Language Models via Cross-Layer Visual Anchors

视觉注意力漂移,但锚点仍有效:通过跨层视觉锚点缓解多模态大语言模型的幻觉

Chengxu Yang, Jingling Yuan, Chuang Hu, Jiawei Jiang

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出CLVA方法,通过跨层视觉锚点缓解多模态大语言模型的幻觉问题,强调中间层视觉锚点的重要性,无需额外训练,有效抑制深度层注意力漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08126 2026-03-26 cs.CL 79%

Quantification and object perception in Multimodal Large Language Models and human linguistic cognition

多模态大语言模型和人类语言认知中的量化与物体感知

Raquel Montero, Natalia Moskvina, Paolo Morosi, Tamara Serrano, Elena Pagliarini, Evelina Leivada

机构 * Universitat Autònoma de Barcelona(巴塞罗那自治大学) Institució Catalana de Recerca i Estudis Avançats (ICREA)(加泰罗尼亚高级科研与研究机构(ICREA))

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文研究多模态大语言模型和人类在量化中的关键特征,探讨其在模型架构中的编码差异及语言影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17487 2026-03-24 cs.CV 79%

Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models

智能下放:探索小型多模态模型中感知与推理的瓶颈

Mark Endo, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究小型多模态模型中感知与推理能力的瓶颈,通过分析LLM容量下降对多模态能力的影响,提出视觉提取调优方法,提升效率与性能。

Comments CVPR 2026, website at https://web.stanford.edu/~markendo/projects/downscaling_intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15825 2026-03-20 cs.CL 79%

Did somebody say "Gest-IT"? A pilot exploration of multimodal data management

有人提到“Gest-IT”吗?多模态数据管理的初步探索

Ludovica Pannitto, Lorenzo Albanesi, Laura Marion, Federica Maria Martines, Carmelo Caruso, Claudia S. Bianchini, Francesca Masini, Caterina Mauri

机构 * Alma Mater Studiorum - University of Bologna(博洛尼亚大学) University of Poitiers, FoReLLIS Laboratory(波尔多大学FoReLLIS实验室)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文探讨了多模态语料库的构建、管理和分析,通过三层标注方法研究视障人士与正常人对话中的手势变化。

Journal ref Proceedings of the Tenth Italian Conference on Computational Linguistics (CLiC-it 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17314 2026-03-20 cs.CV 79%

A Proposal-Free Query-Guided Network for Grounded Multimodal Named Entity Recognition

无提案查询引导网络用于 grounded 多模态命名实体识别

Hongbing Li, Jiamin Liu, Shuo Zhang, Bo Xiao

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出无提案查询引导网络,通过文本引导和跨模态交互统一多模态推理与解码,提升开放域场景下的命名实体识别精度与鲁棒性。

Comments There is an error in the methods section

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03715 2026-03-18 eess.SP cs.AI cs.HC cs.LG 79%

Detection of Autonomic Dysreflexia in Individuals With Spinal Cord Injury Using Multimodal Wearable Sensors

利用多模态可穿戴传感器检测脊髓损伤患者自主神经反射症

Bertram Fuchs, Mehdi Ejtehadi, Ana Cisnal, Jürgen Pannek, Anke Scheel-Sailer, Robert Riener, Inge Eriks-Hoogland, Diego Paez-Granados

机构 * SCAI-Lab, Department of Health Sciences and Technology (D-HEST), ETH Zurich(SCAI实验室,健康科学与技术系(D-HEST),苏黎世联邦理工学院) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) Swiss Paraplegic Research (SPF)(瑞士瘫痪研究机构(SPF)) Institute of Advanced Production Technologies, University of Valladolid(先进生产技术研究所,瓦尔达利德大学) Swiss Paraplegic Centre (SPZ)(瑞士瘫痪中心(SPZ)) Balgrist University Hospital(巴尔格里斯大学医院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种非侵入性的机器学习框架,通过多模态可穿戴传感器检测自主神经反射症,利用BorutaSHAP进行特征选择,并通过堆叠集成模型提高检测性能,结果显示心率和心电图特征在检测中表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14175 2026-03-17 cs.LG cs.CV 79%

Balancing Multimodal Domain Generalization via Gradient Modulation and Projection

通过梯度调节与投影平衡多模态领域泛化

Hongzhao Li, Guohao Shen, Shupan Li, Mingliang Xu, Muhammad Haris Khan

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GMP方法,通过解耦分类与领域不变目标的梯度,调节模态梯度基于语义和领域置信度,并动态调整梯度投影以平衡多模态领域泛化中的优化不均衡问题。

Comments AAAI 2026 Oral Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13176 2026-03-16 cs.CV 79%

Perceive What Matters: Relevance-Driven Scheduling for Multimodal Streaming Perception

感知关键内容:基于相关性的多模态流式感知调度

Dingcheng Huang, Xiaotong Zhang, Kamal Youcef-Toumi

机构 * Mechatronics Research Laboratory, Massachusetts Institute of Technology(机械系统实验室,麻省理工学院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种基于相关性的轻量级多模态流式感知调度框架,通过利用前一帧输出估计并调度必要的感知模块,有效减少计算延迟并提升识别召回率。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12369 2026-03-16 cs.CV 79%

Human Knowledge Integrated Multi-modal Learning for Single Source Domain Generalization

融合人类知识的多模态学习用于单源域泛化

Ayan Banerjee, Kuntal Thakur, Sandeep Gupta

机构 * Impact Lab, Arizona State University(影响实验室,亚利桑那州立大学)

专题命中 其他多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出GenEval方法,结合基础模型与人类知识提升单源域泛化性能,在糖尿病视网膜病变和癫痫发作区检测中取得优异结果。

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026, pp. 2380-2391

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10929 2026-03-13 cs.CV cs.RO 79%

Lifelong Imitation Learning with Multimodal Latent Replay and Incremental Adjustment

持续模仿学习与多模态潜在回放及渐进调整

Fanqi Yu, Matteo Tiezzi, Tommaso Apicella, Cigdem Beyan, Vittorio Murino

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种持续模仿学习方法,通过多模态潜在空间回放和渐进特征调整机制,在现实约束下实现持续策略优化,提升了在LIBERO基准上的性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10285 2026-03-10 cs.AI 79%

Reallocating Attention Across Layers to Reduce Multimodal Hallucination

跨层分配注意力以减少多模态幻觉

Haolang Lu, Bolun Chu, WeiYe Fu, Guoshun Nan, Junning Liu, Minghui Pan, Qiankun Li, Yi Yu, Hua Wang, Kun Wang

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学) Nanyang Technological University, Singapore(南洋理工大学) Guangxi Transportation Science and Technology Group, China(广西交通科学和技术集团)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 通过跨层分配注意力减少多模态幻觉,提升推理一致性和视觉忠实性。

Comments Acceptted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17355 2026-03-09 cs.CV 79%

UAM: A Unified Attention-Mamba Backbone of Multimodal Framework for Tumor Cell Classification

UAM: 多模态框架中用于肿瘤细胞分类的统一注意力-马amba骨干

Taixi Chen, Jingyun Chen, Nancy Guo

机构 * State University of New York at Binghamton(纽约州立大学布林莫尔分校)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 UAM提出了一种统一的注意力-马amba架构,用于多模态框架中的肿瘤细胞分类和图像分割,通过灵活结合两种模块提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05278 2026-03-09 cs.LG cs.CL 79%

Decoding Partial Differential Equations: Cross-Modal Adaptation of Decoder-only Models to PDEs

解码偏微分方程:解码器-only模型在偏微分方程上的跨模态适应

Paloma García-de-Herreros, Philipp Slusallek, Dietrich Klakow, Vagrant Gautam

机构 * Saarland University(萨尔兰大学) DFKI Heidelberg Institute for Theoretical Studies(海德堡理论研究所)

专题命中 其他多模态 :cross-modal(title,abstract);分类 cs.CL

AI总结 本文研究了解码器-only模型在偏微分方程时间依赖模拟任务中的跨模态适应,提出并行翻转和序列加倍两种方法,提升模型性能,缩小与编码器-only模型的差距。

Comments ICLR 2026 Workshop on AI and Partial Differential Equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04461 2026-03-06 cs.LG cs.AI 79%

MAD-SmaAt-GNet: A Multimodal Advection-Guided Neural Network for Precipitation Nowcasting

MAD-SmaAt-GNet:一种多模态输运引导的神经网络用于降水nowcasting

Samuel van Wonderen, Siamak Mehrkanoon

机构 * Department of Information and Computing Sciences, Utrecht University, Utrecht, The Netherlands(信息与计算科学系,乌特勒支大学,乌特勒支,荷兰)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 MAD-SmaAt-GNet通过多模态输入和物理输运组件提升降水nowcasting的准确性与效率

Comments 12 pages, 5 figs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03346 2026-03-05 physics.geo-ph cs.AI cs.SC 79%

Physics-constrained symbolic regression for discovering closed-form equations of multimodal water retention curves from experimental data

具有物理约束的符号回归用于从实验数据中发现多模水 retention 曲线的闭式方程

Yejin Kim, Hyoung Suk Suh

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种受物理约束的机器学习框架,通过符号回归自动从实验数据中发现多模水保留曲线的闭式方程,提升多孔材料水保留特性的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03279 2026-03-04 cs.RO cs.CV 79%

ULTRA: Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation

ULTRA:统一的多模态控制用于自主人形全身体姿Manipulation

Xialin He, Sirui Xu, Xinyao Li, Runpei Dong, Liuyu Bian, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 ULTRA通过统一多模态控制框架,实现了基于感知和高层任务规范的自主人形全身体姿Manipulation,优于传统跟踪方法。

Comments Project Page: https://ultra-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏