arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-30 至 2026-06-30 共收录 151 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 13 篇

2507.02097 2026-06-30 cs.IR 50%

The Future is Agentic: Definitions, Perspectives, and Open Challenges of Multi-Agent Recommender Systems

未来是代理的:多代理推荐系统定义、视角和开放挑战

Reza Yousefi Maragheh, Yashar Deldjoo

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文探讨多代理推荐系统从被动生成到主动规划的转变,提出基于状态代理的框架,分析其在提升推荐效果中的作用,并通过实验验证代理系统在不同场景下的有效性。

Comments Added controlled experiments to illustrate the points of the paper. Also edited for more clarity in conveying the concepts

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 23 篇

2506.08774 2026-06-30 cs.IR cs.AI 88%

Multimodal Representation Alignment for Cross-modal Information Retrieval

多模态表示对齐用于跨模态信息检索

Fan Xu, Luis A. Leiva

机构 * University of Luxembourg(卢森堡大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.AI

AI总结 本文研究多模态表示对齐对跨模态检索的影响,通过对比不同度量标准和嵌入空间,发现余弦相似度在对齐任务中表现最佳,同时 Wasserstein 距离提供了分布差异的补充视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30168 2026-06-30 cs.CV 85%

Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

潜在噪声掩码:减少多模态大语言模型中的视觉冗余

Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学和电子学(iOPEN)、西北工业大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院、中国电信(TeleAI)) Fudan University(复旦大学) The University of Hong Kong(香港大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出Lens框架,通过轻量级LET令牌为视觉令牌评分,并注入自适应噪声抑制低相关令牌,在不改变模型结构的情况下提升多模态推理性能。

Comments 21 pages, 7 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05689 2026-06-30 cs.CV cs.AI 84%

CRFT: Consistent-Recurrent Feature Flow Transformer for Cross-Modal Image Registration

CRFT:用于跨模态图像配准的一致-递归特征流变换器

Xuecong Liu, Mengzhu Ding, Zixuan Sun, Zhang Li, Xichao Teng

机构 * Northeastern University, China(东北大学(中国)) National University of Defense Technology, China(国防科技大学(中国))

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CRFT提出了一种基于特征流学习的统一粗到细框架,通过特征对齐和流估计实现鲁棒的跨模态图像配准,通过多尺度特征相关性和层次特征融合提升精度和鲁棒性。

Comments Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 34784-34794

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30244 2026-06-30 cs.CV 83%

Semantic-Driven Scale and Spatial Selection for Efficient Cross-Modal Alignment in Referring Remote Sensing Image Segmentation

语义驱动的尺度与空间选择实现指代遥感图像分割中的高效跨模态对齐

Kun Li, Shengxi Gui, Francesco Nex, Michael Ying Yang

机构 * University of Liverpool, UK(利物浦大学) University of Michigan, USA(密歇根大学) University of Twente, NL(埃因霍温理工大学) University of Bath, UK(巴斯大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出S4ECA框架,通过参数高效微调的双编码器适配器架构,利用语言引导的尺度与空间选择机制实现跨模态对齐,仅更新2.4%骨干参数即在RRSIS-D和RefSegRS数据集上达到最优性能。

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02948 2026-06-30 cs.CV 83%

CrossWeaver: Cross-modal Weaving for Arbitrary-Modality Semantic Segmentation

CrossWeaver:跨模态编织用于任意模态语义分割

Zelin Zhang, Kedi Li, Huiqi Liang, Chuanzhi Xu, Tao Zhang, Weidong Cai

机构 * The University of Sydney(悉尼大学) University of Technology Sydney(悉尼科技大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出CrossWeaver框架,通过Modality Interaction Block和Seam-Aligned Fusion模块实现高效跨模态融合,在多模态语义分割中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13326 2026-06-30 cs.LG cs.AI 83%

Feature-level Interaction Explanations in Multimodal Transformers

多模态Transformer中的特征级交互解释

Yeji Kim, Housam Khalifa Bashier Babiker, Mi-Young Kim, Randy Goebel

机构 * University of Alberta(阿尔伯塔大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出FL-I2MoE,通过特征级分离独特、协同和冗余证据,提升多模态模型的可解释性,实验表明其在三个基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28123 2026-06-30 cs.CV cs.AI cs.CL 82%

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

超越SFT到RL:通过黑盒在线策略蒸馏进行预对齐以多模态RL

Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出PRISM框架,通过在SFT和RLVR之间插入显式分布对齐阶段,解决多模态RL中的分布漂移问题,利用基于策略蒸馏的对抗游戏提升对齐效果,实验显示在多个RL算法和基准上性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29949 2026-06-30 eess.IV cs.AI q-bio.GN 74%

Data-Efficient Multimodal Alignment for Histopathology-based Molecular Prediction

基于组织病理学的分子预测的数据高效多模态对齐

Dominik Winter, Dominik Vonficht, Loïc Le Bescond, Christian Gebbe, Marco Rosati, Richard J. Chen, Markus Schick, Ross Stewart, Nicolas Brieu

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.AI

AI总结 提出一种轻量级对齐模块,在冻结的组织病理学和RNA-Seq基础模型上训练,实现无需测序或重新训练即可通过基因集签名预测通路活性的开放词汇分子提示,并在多癌队列中实现25倍检索提升。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12957 2026-06-30 cs.LG cs.AI 74%

Attribution Graphs and Causal Probing for Mechanistic Discovery and Bias Repair in Multimodal Generative Learning

揭示-修订:具有多模态注意力的可解释性偏见感知生成建模

Noor Islam S. Mohammad, Uluğ Bayazıt

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.AI

AI总结 本文提出一个统一了跨模态注意力融合、Grad-CAM++属性分析和揭示-修订反馈循环的可解释性偏见感知生成框架,通过多模态MNIST和Fashion MNIST数据集验证了其在图像生成和子组审计中的性能。

Comments We are recently authors in conflict with this work; I am heartily requesting to withdraw this paper as soon as possible

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29462 2026-06-30 cs.CV 70%

MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein

MIRROR: 通过Gromov-Wasserstein对齐从语言到图像的语义关系

Hong-Han Wang, Yuntao Wang, Hu Ding

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出MIRROR框架,通过半逆Gromov-Wasserstein问题将语言中的关系先验几何对齐到视觉表示,提升多模态大模型的关系一致性,无需额外参数或推理成本。

Comments Accepted to ECCV 2026. 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27178 2026-06-30 cs.CV 70%

Energy-Efficient Plant Monitoring via Knowledge Distillation

通过知识蒸馏实现节能的植物监测

Ilyass Moummad, Reda Bensaid, Kawtar Zaher, Hervé Goëau, Jean-Christophe Lombardo, Joseph Salmon, Pierre Bonnet, Alexis Joly

机构 * LIRMM, Univ Montpellier, CNRS, Inria, Montpellier, France(蒙彼利埃大学LIRMM研究所、CNRS、Inria、法国蒙彼利埃) IMT Atlantique, Brest, France. Polytechnique Montréal, Canada(法国布列塔尼IMT Atlantique、加拿大蒙特利尔Polytechnique) Institut National de l’Audiovisuel, Paris, France(法国巴黎国家视听研究所) AMAP, Université de Montpellier, CIRAD, INRAE, IRD, Montpellier, France(法国蒙彼利埃大学AMAP、CIRAD、INRAE、IRD、法国蒙彼利埃) IMAG, Univ Montpellier, CNRS, Inria, Montpellier, France(蒙彼利埃大学IMAG研究所、CNRS、Inria、法国蒙彼利埃)

专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文通过知识蒸馏将大预训练模型的表示能力转移到更高效的小型架构中,提升植物物种和疾病识别的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16413 2026-06-30 cs.CV 70%

BrepLLM: Enabling Large Language Models to Understand Boundary Representations

BrepLLM: 使大语言模型能够理解边界表示

Liyuan Deng, Hao Guo, Yongkang Dai, Yunpeng Bai, Yifan Zhu, Yuanyuan Gao, Huaxi Huang, Yilei Shi

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 BrepLLM通过双阶段训练管道,将B-rep数据转化为图表示并进行语义对齐,实现3D语言生成,展示了在3D物体分类和描述任务中的最佳性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30374 2026-06-30 cs.CV cs.AI cs.LG 62%

Set-Inclusive Uncertainty Modeling for Robust Brain Tumor Segmentation

面向鲁棒脑肿瘤分割的集合包含不确定性建模

Seunghun Baek, Jihwan Park, Jaeyoon Sim, Hoseok Lee, Seungjoo Lee, Won Hwa Kim

机构 * Pohang University of Science and Technology(釜山科学技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出概率表示框架,将特征建模为高斯分布,通过集合包含策略约束模态子集的不确定性排序,在缺失模态场景下提升分割鲁棒性。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05386 2026-06-30 cs.LG cs.AI cs.CL 62%

Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training

强化微调自然缓解持续训练中的遗忘

Song Lai, Haohan Zhao, Rong Feng, Changyi Ma, Wenzhuo Liu, Hongbo Zhao, Xi Lin, Dong Yi, Qingfu Zhang, Hongbin Liu, Gaofeng Meng, Fei Zhu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了监督微调与强化微调在持续训练中的影响,发现强化微调能有效保留先验知识,优于监督微调和多任务训练,且在标准基准上提升模型通用知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30291 2026-06-30 cs.AI 57%

PromptGNN-sim: Deep Fusion and Alignment of GNN and LLMs for Text-Attributed Graph Learning

PromptGNN-sim:GNN与LLM的深度融合与对齐用于文本属性图学习

Zhifei Hu, Alexandra I. Cristea

机构 * Durham University(杜伦大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 提出PromptGNN-sim框架,通过双向结构-语义融合、图注意力网络与LLM协同,解决文本属性图中模态交互浅层化问题,在跨任务、跨数据集和稀疏扰动下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29941 2026-06-30 cs.RO cs.CV 57%

Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation

从运动感知触觉:一种具有触觉运动相关性的统一模态感知视觉-触觉策略

Shengqi Xu, Guojin Zhong, Yang Liu, Fanjie Wang, Hu Luo, Hanyu Zhou, Weiyao Zhang, Ziyi Ye, Zuxuan Wu, Yu-Gang Jiang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出基于触觉运动相关性的运动感知触觉表示,并利用混合Transformer架构实现统一模态感知的视觉-触觉策略,以解决接触丰富操作中的感知模糊和跨模态融合问题。

Comments Accepted by ECCV 2026. Project website: https://shengqi77.github.io/Seeing-Touch-from-Motion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29883 2026-06-30 cs.CV 57%

Building artificial intelligence virtual tissue (AIVT) for tissue state representation, feature prediction, and dynamic simulation

构建人工智能虚拟组织 (AIVT) 用于组织状态表示、特征预测和动态模拟

Qiqi Lu, Qianjin Feng, Shaoqun Zeng, Shenghua Cheng

机构 * School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Guangdong Provincial Key Laboratory of Medical Image Processing, Southern Medical University(南方医科大学广东省医学图像处理重点实验室) Guangdong Province Engineering Laboratory for Medical Imaging and Diagnostic Technology, Southern Medical University(南方医科大学广东省医学影像与诊断技术工程实验室) MOE Key Laboratory for Biomedical Photonics, Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(教育部生物医学光子学重点实验室、武汉光电物联实验室、华中科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出人工智能虚拟组织 (AIVT) 框架,基于空间多模态数据学习统一、空间分辨且可动态操控的组织状态表示,实现组织状态分析、特征预测和时空动态模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29613 2026-06-30 cs.LG cs.AI 57%

Does Role Specialization Matter for Explanation Faithfulness in Mixture-of-Experts?

角色专业化对混合专家模型解释忠实度重要吗?

Yeji Kim, Housam Babiker, Mi-Young Kim, Randy Goebel

机构 * University of Alberta(阿尔伯塔大学) University of Waikato(怀卡托大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 研究混合专家模型中专家角色分解对解释忠实度的影响,提出表示级去相关正则化减少专家间重叠,实验表明该方法能提升忠实度指标且不损害任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28932 2026-06-30 cs.LG cs.AI 57%

DLR: Zero-Inference-Cost Latent Residuals for Low-Rank Pre-Training

DLR:低秩预训练的零推理成本潜在残差

Dong Wang, Wenwu Tang, Yun Cheng, Olga Saukh

机构 * Graz University of Technology, Austria(奥地利格拉茨技术大学) Swiss Data Science Center, Switzerland(瑞士数据科学中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出DLR插件,通过固定结构化残差增强低秩预训练,不增加参数,训练后可吸收,提升模型质量。

Comments Includes appendix, 6 figures and 11 tables. Code available at https://github.com/nanguoyu/DLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28395 2026-06-30 cs.CV 57%

JASPR: Joint Spatial Representation learning of histology and spatial genomics for improved virtual genomic screening and clinical prognostication

JASPR:组织学与空间基因组学的联合空间表示学习,用于改进虚拟基因组筛选和临床预后

Marija Pizurica, Eric Zimmermann, Neil Tenenholtz, James Hall, Olivier Gevaert, Ava P. Amini, Lorin Crawford, Kristen A. Severson

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出自监督框架JASPR,通过跨模态重建目标整合HE图像和空间转录组数据,学习联合空间表示,在乳腺癌数据上显著提升基因表达预测和预后价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14925 2026-06-30 cs.CV cs.LG 57%

Road Maps as Free Geometric Priors: Weather-Invariant Drone Geo-Localization with GeoFuse

道路地图作为免费几何先验:利用GeoFuse实现天气不变的无人机地理定位

Yunsong Fang, Tingyu Wang, Zhedong Zheng

机构 * University of Macau(澳门大学) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出GeoFuse框架,通过融合道路地图与卫星图像提升无人机在恶劣天气下的定位性能,实验表明其在University-1652和DenseUAV基准上召回率显著提升。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23353 2026-06-30 cs.LG cs.AI 57%

SOTAlign: Semi-Supervised Alignment of Unimodal Vision and Language Models via Optimal Transport

SOTAlign:通过最优传输实现半监督的单模态视觉与语言模型对齐

Simon Roschmann, Paul Krzakala, Sonia Mazelet, Quentin Bouniot, Zeynep Akata

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.AI

AI总结 本文提出SOTAlign框架,通过少量配对数据和大量未配对数据实现视觉与语言模型的半监督对齐,利用最优传输理论提升对齐效果,优于传统监督和半监督方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29948 2026-06-30 cs.RO 50%

Heterogeneous Tactile Transformer

异构触觉Transformer

Jianxin Bi, Qiang Wang, Jayaram Reddy, Kelvin Lin, Soibkhon Khajikhanov, Ruihan Gao, Harold Soh

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 提出异构触觉Transformer(HTT),通过传感器特定编码器和共享Transformer主干学习跨异构传感器的共享触觉表示,利用新HPT数据集预训练,在感知和操作任务中实现可迁移表示。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 7 篇

2606.28546 2026-06-30 cs.LG 89%

NIVA: A Multimodal Foundation Model for Actionable Earth System Intelligence

NIVA:面向可操作地球系统智能的多模态基础模型

Anisha Pal, Aodhan Sweeney, Kyle Heyblom, Kalai Ramea

机构 * Planette AI

专题命中 其他多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract)

AI总结 提出多模态基础模型NIVA,通过联合学习海洋与大气模态,捕获耦合地球系统动力学,为次季节至季节预测提供基础,并准确预测主要气候指数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29267 2026-06-30 cs.CV 84%

Enhancing Part-Level Point Grounding for Any Open-Source MLLMs

增强任意开源多模态大语言模型的部件级点定位能力

Jin-Cheng Jhang, Fu-En Wang, Xin Yang, Nan Qiao, Lu Xia, Min Sun, Cheng-Hao Kuo

机构 * National Tsing Hua University(国立清华大学) Amazon(亚马逊)

专题命中 其他多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出一种通用方法,通过冻结原模型参数并引入Q-Synth模块和注意力到点解码器,为任意开源MLLM赋予精确的2D部件级点定位能力,显著提升部件级定位精度。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30355 2026-06-30 cs.CV cs.AI 81%

Residual-Guided Expert Specialization for Incomplete Multimodal Learning

残差引导的专家特化用于不完整多模态学习

Seunghun Baek, Jihwan Park, Jaeyoon Sim, Minjae Jeong, Hoseok Lee, Won Hwa Kim

机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出MARS框架,利用缺失引起的表示偏差引导专家特化,通过残差信号路由样本到对应专家,并引入差异感知噪声正则化缓解训练-测试路由差距,在缺失场景下提升多模态分类与分割性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28920 2026-06-30 cs.CV 70%

ExACT: Exemplar-Driven Calibrated Refinement for Training-Free Visual Grounding in Remote Sensing Images

ExACT: 基于示例驱动的校准精化用于遥感图像中免训练的视觉定位

Zixiao Zhang, Lingling Li, Pei He, Xu Liu, Licheng Jiao

机构 * Xidian University(西安电子科技大学)

专题命中 其他多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出ExACT框架,通过一次性视觉提示机制弥合多模态大语言模型在遥感视觉定位中的模态差距,实现免训练的精确像素级定位。

Comments 11 pages, 8 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29205 2026-06-30 stat.CO 50%

Using Variational Inference to Improve the Efficiency of MCMC Algorithms

使用变分推断提高MCMC算法的效率

Pingping Yin, Xiyun Jiao

专题命中 其他多模态 :multi-modal(abstract)

AI总结 提出两种结合变分推断和MCMC的算法:GVI-HMC利用高斯变分推断改进哈密顿蒙特卡洛,VAE-MH结合变分自编码器与Metropolis-Hastings采样器,提高高维和多模态分布中的采样效率。

Comments Preprint. Code is available at https://github.com/YinPingping111/HMC-GVI and https://github.com/YinPingping111/VAE-MH-Sampler

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29192 2026-06-30 cs.RO 50%

Empowering a Single-Frequency GNSS Receiver to Achieve High-Precision Positioning with Relative Observations

利用相对观测实现单频GNSS接收机的高精度定位

Xingpeng Wang, Ziwen Qu, Juncheng Chen, Ruitian Pang, Xiangyu Li, Tiancheng Lai, Siqi Shen, Wentao Liu, Pengfei Wang, Chao Xu, Yanjun Cao

专题命中 其他多模态 :multi-modal(abstract)

AI总结 提出一种紧耦合状态估计框架,通过单频GNSS接收机与相对运动传感器融合,利用滑动窗口因子图和虚拟锚点机制实现分米级定位,无需基站。

Comments 8 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏