arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-21 至 2026-07-21 共收录 23 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 23 篇

2603.16461 2026-07-21 cs.CV 版本更新 92%

GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models

GAP-MLLM:几何对齐预训练以激活多模态大语言模型中的3D空间感知

Jiaxin Zhang, Junjun Jiang, Haijie Li, Youyu Chen, Kui Jiang, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Huawei(华为)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GAP-MLLM,通过几何对齐预训练激活多模态大语言模型中的3D空间感知,改进了传统方法在3D空间感知上的不足。

Comments Accepted by ECCV 2026. Project page: https://gapmllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16260 2026-07-21 cs.LG cs.AI cs.CV 新提交 84%

AdaSurvMamba: Dynamic Fusion and Semantic Scanning for Multimodal Survival Analysis

AdaSurvMamba:用于多模态生存分析的动态融合与语义扫描

Jialong Zhong, Tingwei Liu, Baokun Yue, Jingjing Li, Yongri Piao, Miao Zhang, Leiye Liu, Jiahong Jiang, Wei Ji, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) University of Alberta(阿尔伯塔大学) Yale University(耶鲁大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态生存分析中传统方法的局限,提出AdaSurvMamba框架,含DSIR模块动态调制跨模态交互强度、SAS模块重组令牌成连续序列,实验证明该框架在五个TCGA队列上比现有方法有优势。

Comments MICCAI 2026 Accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18920 2026-07-21 cs.IR cs.AI 版本更新 83%

SynGR: Unleashing the Potential of Cross-Modal Synergy for Generative Recommendation

SynGR:释放跨模态协同在生成推荐中的潜力

Wei Chen, Xingyu Guo, Shuang Li, Fuwei Zhang, Meng Yuan, Jing Fan, Zhao Zhang, Deqing Wang, Fuzhen Zhuang

机构 * School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出SynGR框架,通过显式鼓励生成过程中的跨模态依赖,以捕捉新兴物品语义,从而提升生成推荐性能。

Comments Accepted by ICML 2026, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17657 2026-07-21 cs.AI cs.CV cs.MM 新提交 82%

OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment

OrientSAM:通过方向感知空间对齐减轻多模态空间推理中以相机为中心的捷径

Wenxiao Fan, Hang Yin, Kan Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究多模态模型空间推理中以相机为中心的问题,提出OrientSAM框架,通过方向感知令牌、傅里叶角度编码及课程学习策略注入方向信息并改善推理,构建数据管道生成监督,实验证明其在多任务中表现出色,能减轻捷径行为,实现更强大的以对象为中心的空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14410 2026-07-21 cs.LG q-bio.GN 版本更新 82%

LATTICE: Graph Self-Supervised Learning for Multimodal Spatial Omics Integration

LATTICE:用于多模态空间组学整合的图自监督学习

Jagan Mohan Reddy Dwarampudi, Veena Kochat, Suresh Satpati, Hien Van Nguyen, Kunal Rai, Tania Banerjee

机构 * University of Houston(休斯顿大学) MD Anderson Cancer Center(MD安德森癌症中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 研究针对多模态空间组学整合下游分析常采用单模态管道的问题,提出LATTICE框架,通过构建空间邻域图并训练TransformerConv编码器,在黑色素瘤队列实验中实现多模态整合,提升相关指标,为该领域提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21693 2026-07-21 cs.AI 版本更新 81%

Deterministic Hallucination Detection in Medical VQA via Confidence-Evidence Bayesian Gain

医学VQA中通过置信度-证据贝叶斯增益实现确定性幻觉检测

Mohammad Asadi, Tahoura Nedaee, Jack W. O'Sullivan, Euan Ashley, Ehsan Adeli

机构 * Department of Electrical Engineering, Stanford University, CA, USA(电气工程系,斯坦福大学) Department of Biology, Stanford University, CA, USA(生物学系,斯坦福大学) Division of Cardiology, Department of Medicine, Stanford University, CA, USA(心脏病学部,医学系,斯坦福大学) Department of Biomedical Data Science, Stanford University, CA, USA(生物医学数据科学系,斯坦福大学) Department of Computer Science, Stanford University, CA, USA(计算机科学系,斯坦福大学) Department of Psychiatry and Behavioral Sciences, Stanford University, CA, USA(精神病学与行为科学系,斯坦福大学)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出CEBaG方法,利用模型自身log概率中的不一致置信度和弱视觉证据敏感性,实现无需随机采样和外部模型的确定性幻觉检测,在医疗MLLM和VQA基准测试中取得最佳AUC表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17351 2026-07-21 cs.AI cs.RO 新提交 79%

DeeperRadar: End-to-End MIMO Radar Design and Multi-Modal Fusion for Autonomous Vehicle Perception

深度雷达:用于自动驾驶车辆感知的端到端MIMO雷达设计与多模态融合

Eli Goldenshluger, Barak Pinkovich, Chaim Baskin

机构 * Technion–Israel Institute of Technology(以色列理工学院) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 深度雷达以雷达为中心,通过端到端学习稀疏采集模式,共同设计雷达传感与多模态3D检测。其可学习的MIMO设计模块在融合网络中训练,由其他传感器监督。在RADIal数据集上评估,能发现稀疏配置,降低成本与复杂性,表明最优设计取决于融合堆栈和感知任务。

Comments Accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17257 2026-07-21 cs.RO cs.AI 新提交 79%

Asynchronous Multimodal Diffusion Policy Composition via Latency-Aware Guidance Fusion

通过延迟感知引导融合实现异步多模态扩散策略组合

Zihao He, Hongjie Fang, Shirun Tang, Cewu Lu, Haoshu Fang

机构 * Shanghai Jiao Tong University(上海交通大学) Noematrix(无矩阵) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对多模态扩散策略在模态差异下的融合问题,提出LAG - Fusion框架,通过延迟感知引导融合实现异步策略组合,推导参考帧重定位规则,在接触丰富操纵实验中提升了策略响应性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16366 2026-07-21 cs.RO cs.AI 新提交 79%

PRISM: Multimodal Terrain Mapping for Rover Navigation in Unstructured Environments

PRISM:非结构化环境中用于漫游车导航的多模态地形映射

Raul Castilla-Arquillo, Carlos Perez-del-Pulgar, Levin Gerdes, Alfonso Garcia-Cerezo, Miguel A. Olivares-Mendez

机构 * SnT, University of Luxembourg(卢森堡大学安全、可靠性和信任跨学科中心) Department of Automation and Systems Engineering, Universidad de Málaga, Andalucía Tech(马拉加大学自动化与系统工程系,安达卢西亚技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对非结构化环境中漫游车导航问题,提出PRISM多模态感知系统,利用定制传感器套件和OmniUnet网络,经新数据集验证及现场实验,可在资源受限设备上高效生成可通行性地图,实现漫游车自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16233 2026-07-21 cs.LG cs.AI 新提交 79%

Token-Level Cross-Modal Transformer with Contrastive Multi-Task Learning for Breast Cancer Subtype Classification and Survival Prediction

用于乳腺癌亚型分类和生存预测的具有对比多任务学习的令牌级跨模态变换器

Suxing Liu Byungwon Min

机构 * Jiangxi Arts & Ceramics Technology Institute(江西艺术陶瓷科技职业学院) Mokwon University(木浦大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.AI

AI总结 针对整合异质模态进行癌症亚型分类和生存预测的挑战,提出令牌级跨模态变换器及对比多任务学习方法,克服现有方法在模态交互、融合方式及目标优化上的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30994 2026-07-21 cs.MM 版本更新 79%

Dynamic Interaction-Aware and Causality-Disentangled Framework for Multimodal Sentiment Analysis

动态交互感知与因果解耦的多模态情感分析框架

Guangyuan Dong, Ziwei Hong, Shenghao Liu, Chenyu Wu, Yuanyuan Fang, Zihao Li, Xudong Zhang, Bingchen Liu, Yuchen Zhang, Haitao Ding, Zhenzhou Zhou, Ziyu Song

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 提出动态多模态因果解耦与自适应融合框架(MCAF),通过因果干预模块解耦语言模态的偏见,动态路由器实时评估交互状态并自适应融合,以及条件扩散去噪模块过滤噪声,在CMU-MOSI和CMU-MOSEI上取得最优分类性能。

Comments This preprint is withdrawn for unauthorized posting and incorrect author metadata.It was uploaded without full consent of all co-authors, with wrong name and affiliation information. We withdraw it to avoid copyright disputes. This corrects submission irregularities only, not academic content or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24679 2026-07-21 cs.AI eess.SP 版本更新 79%

Multi-modal cross-domain mixed fusion model with dual disentanglement for fault diagnosis under unseen working conditions

用于未知工况下故障诊断的具有双重解缠的多模态跨域混合融合模型

Pengcheng Xia, Yixiang Huang, Chengjin Qin, Chengliang Liu

机构 * State Key Laboratory of Mechanical System and Vibration(机械系统与振动国家重点实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 针对未知工况下故障诊断问题,提出具有双重解缠的多模态跨域混合融合模型,通过双重解缠框架、跨域混合融合策略和三模态融合机制,实现多模态表示学习与域泛化,实验验证该方法优于先进方法及各组件有效性。

Comments Accepted for publication in Mechanical Systems and Signal Processing

Journal ref Mechanical Systems and Signal Processing, Volume 258, 2026, 114693

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18931 2026-07-21 cs.CV 版本更新 79%

Enhancing Vision Foundation Models via Multimodal Continual Pre-Training

通过多模态持续预训练增强视觉基础模型

Yitong Chen, Lingchen Meng, Wujian Peng, Jun Tao, Chenjie Xu, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Baosight Software Co., Ltd.(上海博视软件有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 研究通过多模态持续预训练增强视觉基础模型,提出M-CPT框架,用持续位置嵌入处理不同分辨率视觉输入,通过特征对齐目标提升视觉与文本表示一致性,实验证明该框架能提升多模态理解性能并保持标准视觉任务表现。

Comments Code is available in https://github.com/ShareLab-SII/CoMP-MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16789 2026-07-21 cs.LG 新提交 78%

MultiLoReFT: Decoupling Shared and Modality-Specific Subspaces in Multimodal Learning via Low-Rank Representation Fine-Tuning

MultiLoReFT:通过低秩表示微调在多模态学习中解耦共享和特定模态子空间

Sana Tonekaboni, Viktoria Schuster, Caroline Uhler

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对多模态模型训练障碍,提出MultiLoReFT框架,通过低秩表示微调,将低秩适应扩展到多模态,学习可解释投影子空间解耦信息,能在多模态预测时揭示信息分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17033 2026-07-21 cs.LG physics.chem-ph 新提交 71%

ChemFusion: A Multimodal Cross-Attention Network for Reaction Yield Prediction

ChemFusion:用于反应产率预测的多模态交叉注意力网络

Qiwei Han, Chi Zhou

机构 * Duke University(杜克大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 研究过渡金属催化反应产率预测难题,提出ChemFusion多模态交叉注意力网络,融合电子特征与3D原子坐标,用交叉注意力机制,在交叉偶联库基准测试中性能出色,还能自主学习识别和惩罚空间位阻,提供物理可解释性。

Comments 10 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20720 2026-07-21 cs.CV cs.AI cs.RO 版本更新 62%

Li-ViP3D++: Query-Gated Deformable Camera-LiDAR Fusion for End-to-End Perception and Trajectory Prediction

Li-ViP3D++:基于查询的可变形相机-激光雷达融合用于端到端感知与轨迹预测

Matej Halinkovic, Nina Masarykova, Alexey Vinel, Marek Galinski

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Slovak University of Technology(斯洛伐克技术大学) Halmstad University(哈马比大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Li-ViP3D++通过引入查询门控可变形融合技术,实现了端到端感知与轨迹预测,提升了自动驾驶系统的鲁棒性和效率。

Comments Published in IEEE Access. The version of record is available at DOI: 10.1109/ACCESS.2026.3709080

Journal ref IEEE Access, vol. 14, pp. 102999-103012, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16326 2026-07-21 cs.CV 新提交 57%

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference

CRISP:用于高效LVLM推理的预LLM文本驱动视觉令牌剪枝

Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 针对大型视觉语言模型推理开销大的问题,提出CRISP框架,通过文本驱动在预LLM阶段剪枝视觉令牌,分两阶段工作,实验表明其在激进剪枝率下能保持高性能,降低推理成本和延迟,是高效LVLM推理的实用方案。

Comments Accepted by the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026) as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12071 2026-07-21 cs.CL 版本更新 57%

Beyond Parallel Tracking: Interactive Multi-Feature Fusion Drives Semantic Reconstruction from Non-invasive Brain Recordings

超越并行跟踪:交互式多特征融合驱动非侵入性脑记录的语义重建

Boda Xiao, Xiran Xu, Songyi Li, Yujie Yan, Xihong Wu, Heping Cheng, Jing Chen

机构 * Center for BioMed-X Research, Academy for Advanced Interdisciplinary Studies,Peking University(北京大学生物医学前沿创新中心、前沿交叉学科研究院) Speech and Hearing Research Center, School of Intelligence Science and Technology,Peking University(北京大学智能科学与技术学院言语听觉研究中心) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) National Biomedical Imaging Center, State Key Laboratory of Membrane Biology, Institute of Molecular Medicine, Peking-Tsinghua Center for Life Sciences, College of Future Technology, Peking University(国家生物医学成像中心、膜生物学国家重点实验室、分子医学研究所、北京大学生命科学联合中心、未来技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL

AI总结 研究针对非侵入性脑记录语义重建中表征不匹配问题,引入多特征融合框架,通过交互式门控机制结合静态与动态表征,经实验对比线性连接和非线性交叉注意力等方法,证明交叉注意力融合性能最佳,提供了新的脑到文本解码方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00573 2026-07-21 cs.CV 版本更新 57%

BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure

BrainFIBRE:基于信息分解的脑微结构基础模型

Zijian Dong, Yi Lin, Fang Ji, Jianxiong Zhou, Kwun Kei Ng, Juan Helen Zhou

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出BrainFIBRE,首个脑微结构基础模型,通过自监督部分信息分解(SPID)和反事实候选构建(CCC)从NODDI图谱中解缠独特、协同和冗余信息,在多种预测任务上达到最优性能。

Comments ECCV 2026. Author name corrected in V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03614 2026-07-21 cs.LG cs.AI 版本更新 57%

Neural Global Optimization via Iterative Refinement from Noisy Samples

通过噪声样本迭代细化的神经全局优化

Qusay Muzaffar, David Levin, Michael Werman

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Tel Aviv University(特拉维夫大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出一种神经方法,通过迭代细化从噪声样本中寻找全局极小值,实验表明其在多模态测试函数上比传统方法有显著提升。

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19504 2026-07-21 cs.CV 版本更新 57%

FusionNet: Physics-Aware Representation Learning for Multi-Spectral and Thermal Data via Trainable Signal-Processing Priors

FusionNet:通过可训练信号处理先验对多光谱和热数据进行物理感知表示学习

Georgios Voulgaris

机构 * University of Oxford(牛津大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对水泥生产设施监测难题,提出FusionNet框架,通过整合多光谱数据,嵌入信号处理先验,经消融研究等实验验证,该框架能结合物理感知特征选择与深度学习架构,高精度检测水泥生产设施,为工业监测提供可靠框架。

Comments Accepted for publication in the IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03826 2026-07-21 q-bio.QM cs.AI 版本更新 57%

CORE -- A Cell-Level Coarse-to-Fine Image Registration Engine for Multi-stain Image Alignment

CORE——用于多染色图像对齐的细胞级粗到细图像配准引擎

Esha Sadia Nasir, Behnaz Elhaminia, Mark Eastwood, Catherine King, Owen Cain, Lorraine Harper, Paul Moss, Dimitrios Chanouzas, David Snead, Nasir Rajpoot, Adam Shephard, Shan E Ahmed Raza

机构 * Tissue Image Analytics (TIA) Centre, Department of Computer Science, University of Warwick, UK(tissue image analytics (TIA) 中心,计算机科学系,沃里克大学,英国) Department of Immunology and Immunotherapy, College of Medicine and Health, University of Birmingham, UK(免疫学与免疫治疗系,医学院与健康学院,伯明翰大学,英国) Department of Cellular Pathology, Queen Elizabeth Hospital Birmingham, UK(细胞病理学系,伯明翰女王医院,英国) Renal Unit, Queen Elizabeth Hospital Birmingham, University Hospitals Birmingham NHS Foundation Trust, UK(肾病科,伯明翰女王医院,伯明翰大学医院 NHS 基础信托,英国) Department of Applied Health Sciences, College of Medicine and Health, University of Birmingham, UK(应用健康科学系,医学院与健康学院,伯明翰大学,英国) Histofy Ltd, Coventry, UK(Histofy 有限公司,考文垂,英国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 针对多染色组织切片细胞核水平分析,提出CORE粗到细框架,粗配准利用组织掩码提取等,细粒度用形状感知模型,细胞水平用CPD估计位移场,经多数据集评估,CORE在多方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28634 2026-07-21 cs.RO 版本更新 50%

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

PrimitiveVLA:学习可复用的运动基元以实现高效且可泛化的机器人操作

Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) Jiangsu Key Laboratory of AI for Industries, Institute of AI for Industries, CAS(江苏人工智能工业重点实验室,人工智能工业研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Cambricon Technologies(寒武科技) Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出PrimitiveVLA框架,通过将视觉-语言-动作模型从直接指令到控制映射转向以基元为中心的拆解与组装范式,利用多模态规范表示和自动化流水线,提升数据效率并实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏