arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-16 至 2026-03-16 共收录 68 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 15 篇

2603.00947 2026-03-16 cs.CV 57%

Mobile-VTON: High-Fidelity On-Device Virtual Try-On

Mobile-VTON: 高保真设备端虚拟试衣

Zhenchen Wan, Ce Chen, Runqi Lin, Jiaxin Huang, Tianxi Chen, Yanwu Xu, Tongliang Liu, Mingming Gong

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出Mobile-VTON,一种基于设备端的高保真虚拟试衣框架,通过模块化架构和隐私保护技术,在无需云端支持的情况下实现高质量试衣效果。

Comments The project page is available at: https://zhenchenwan.github.io/Mobile-VTON/

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15369 2026-03-16 eess.IV cs.AI 57%

OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation

OpenVision 3: 一种用于理解和生成的统一视觉编码器家族

Letian Zhang, Sucheng Ren, Yanqing Liu, Xianhang Li, Zeyu Wang, Yuyin Zhou, Huaxiu Yao, Zeyu Zheng, Weili Nie, Guilin Liu, Zhiding Yu, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克ruz分校) JHU(约翰霍普金斯大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出OpenVision 3,通过统一视觉表示实现图像理解和生成。核心架构将VAE压缩的图像潜在特征输入ViT编码器,同时训练其输出以支持重建和语义学习,从而在共享潜在空间中实现良好泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00511 2026-03-16 cs.CV 57%

ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation

ID-Crafter:基于视觉语言模型的在线强化学习多主体视频生成框架

Panwang Pan, Jingjing Zhao, Yuchen Lin, Chenguo Lin, Chenxin Li, Hengyu Liu, Tingting Shen, Yadong MU

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出ID-Crafter框架,通过层次化注意力机制、预训练视觉语言模型和在线强化学习,提升多主体视频生成中身份保持与语义一致性。

Comments Project page: https://angericky.github.io/ID-Crafter, Code: https://github.com/paulpanwang/IDCrafter

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06119 2026-03-16 cs.CV 57%

Omni-Video: Democratizing Unified Video Understanding and Generation

Omni-Video:统一视频理解与生成的普及

Zhiyu Tan, Hao Yang, Luozheng Qin, Jia Gong, Mengping Yang, Hao Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Omni-Video框架,通过改进多模态大语言模型生成连续视觉线索,结合轻量架构和高效训练方案,实现视频理解、生成与编辑的统一模型。

Comments Technical report, project page: https://howellyoung-s.github.io/OmniVideo_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12868 2026-03-16 cs.RO 50%

Beyond Imitation: Reinforcement Learning Fine-Tuning for Adaptive Diffusion Navigation Policies

超越模仿:用于自适应扩散导航策略的强化学习微调

Junhe Sheng, Ruofei Bai, Kuan Xu, Ruimeng Liu, Jie Chen, Shenghai Yuan, Wei-Yun Yau, Lihua Xie

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) A*STAR, Singapore(A*STAR,新加坡) National University of Singapore, Singapore(新加坡国立大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出一种针对扩散导航的强化学习微调框架,通过Group Relative Policy Optimization提升策略适应性,在Isaac Sim中提升成功率和SPL,减少碰撞,展示出更强的零样本迁移能力和安全泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 11 篇

2603.06688 2026-03-16 cs.CV cs.AI 86%

Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning

叙事编织者:迈向多模态可控的长程视觉一致性

Zhengjian Yao, Yongzhi Li, Xinyuan Gao, Quan Chen, Peng Jiang, Yanye Lu

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Narrative Weaver通过整合精细控制、自动叙事规划和长程一致性,解决生成AI中多模态可控、长程且一致的视觉内容生成问题,提出首个综合解决方案并构建首个电商广告视频脚本数据集。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00150 2026-03-16 cs.CV cs.AI cs.CE cs.MM 82%

FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications

FCMBench: 首个大规模金融信用多模态基准用于实际应用

Yehui Yang, Dalu Yang, Fangxin Shang, Wenshuo Zhou, Jie Ren, Yifan Liu, Haojun Fei, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(奇富科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 FCMBench是首个大规模且隐私合规的多模态基准,涵盖金融信用应用中的任务和鲁棒性挑战,包含26种证书类型、5198张隐私合规图像和13806对VQA样本,评估模型在现实干扰下的感知与推理任务,揭示现代视觉语言模型的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18507 2026-03-16 cs.CV cs.AI 81%

Multimodal Continual Learning with MLLMs from Multi-scenario Perspectives

多场景视角下的多模态持续学习与MLLMs

Kai Jiang, Siqi Huang, Xiangyu Chen, Jiawei Shao, Hongyuan Zhang, Ping Luo, Xuelong Li

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出UNIFIER框架,通过视觉表征扩展和视觉一致性约束解决多场景下的持续学习问题,提升跨场景视觉问答和F1分数。

Comments 22 pages, 17 figures. This is a preprint version of a paper submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12690 2026-03-16 cs.CV 79%

CM-Bench: A Comprehensive Cross-Modal Feature Matching Benchmark Bridging Visible and Infrared Images

CM-Bench:一个综合的跨模态特征匹配基准,连接可见图像和红外图像

Liangzheng Sun, Mengfan He, Xingyu Shao, Binbin Li, Zhiqiang Yan, Chunyu Li, Ziyang Meng, Fei Xing

机构 * School of Instrument Science and Opto-Electronics Engineering, Beijing Information Science and Technology University(北京信息科技大学仪器科学与光电工程学院) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出CM-Bench,涵盖30种跨模态特征匹配算法,用于评估同源性估计、相对姿态估计和基于特征匹配的地理定位,包含自适应预处理和新的红外-卫星跨模态数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21662 2026-03-16 cs.CV 79%

Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following

多标准:在多元标准下评估多模态裁判

Tianyi Xiong, Yi Ge, Ming Li, Zuolong Zhang, Pranav Kulkarni, Kaishen Wang, Qi He, Zeying Zhu, Chenxi Liu, Ruibo Chen, Tong Zheng, Yanshuo Chen, Xiyao Wang, Renrui Zhang, Wenhu Chen, Heng Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Waterloo(滑铁卢大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Multi-Crit基准,评估多模态裁判在多元标准下的表现,揭示了专有模型和开源模型在遵循复杂标准方面的不足,以及整体判断信号对视觉理解的影响。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02108 2026-03-16 cs.CV cs.GR cs.MM 73%

Unveiling Deep Shadows: A Survey and Benchmark on Image and Video Shadow Detection, Removal, and Generation in the Deep Learning Era

揭示深层阴影:深度学习时代图像和视频阴影检测、去除与生成的综述与基准

Xiaowei Hu, Zhenghao Xing, Tianyu Wang, Chi-Wing Fu, Pheng-Ann Heng

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学院) Adobe Research(Adobe研究)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.MM

AI总结 本文综述并建立了深度学习时代图像和视频阴影检测、去除与生成的统一基准,揭示了现有研究中的不一致、模型设计依赖性和跨数据集泛化限制,并提出了未来研究方向。

Comments Accepted by International Journal of Computer Vision (IJCV). Publicly available results, trained models, and evaluation metrics at https://github.com/xw-hu/Unveiling-Deep-Shadows

Journal ref International Journal of Computer Vision (IJCV), vol.134, article 158, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13674 2026-03-16 cs.CV cs.CL cs.GR cs.HC 62%

Towards Interactive Intelligence for Digital Humans

迈向数字人类的交互智能

Yiyi Cai, Xuangeng Chu, Xiwei Gao, Sitong Gong, Yifei Huang, Caixin Kang, Kunhang Li, Haiyang Liu, Ruicong Liu, Yun Liu, Dianwen Ng, Zixiong Su, Erwin Wu, Yuhan Wu, Dingkun Yan, Tianyu Yan, Chang Zeng, Bo Zheng, You Zhou

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出交互智能新范式,通过Mio框架实现人格一致表达、自适应交互和自进化,建立新基准测试,展示框架在交互智能方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21905 2026-03-16 cs.CV 57%

TIRAuxCloud: A Thermal Infrared Dataset for Day and Night Cloud Detection

TIRAuxCloud:一种用于昼夜云检测的热红外数据集

Alexis Apostolakis, Vasileios Botsos, Niklas Wölki, Andrea Spichtinger, Nikolaos Ioannis Bountos, Ioannis Papoutsis, Panayiotis Tsanakas

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出TIRAuxCloud数据集,结合多光谱数据和辅助信息,解决昼夜云检测中的挑战,通过监督学习和迁移学习验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12663 2026-03-16 cs.CV cs.RO 57%

Learning Geometric and Photometric Features from Panoramic LiDAR Scans for Outdoor Place Categorization

从全景LiDAR扫描中学习几何和光度特征用于户外场所分类

Kazuto Nakashima, Hojung Jung, Yuki Oto, Yumi Iwashita, Ryo Kurazume, Oscar Martinez Mozos

机构 * Graduate School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程研究生院) Jet Propulsion Laboratory, California Institute of Technology(加州理工学院喷气推进实验室) Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程学部) Technical University of Cartagena(卡塔赫纳技术大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出利用CNN处理LiDAR获取的全景深度/反照率图像,通过构建MPO数据集实现户外场所分类,优于传统方法,验证了深度与反照率模态的联合使用有效性。

Comments Published in Advanced Robotics on 31 Jul 2018

Journal ref Advanced Robotics, 32(14):750-765, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12605 2026-03-16 cs.CV 57%

A2Z-10M+: Geometric Deep Learning with A-to-Z BRep Annotations for AI-Assisted CAD Modeling and Reverse Engineering

A2Z-10M+: 通过A到Z BRep注释进行几何深度学习用于辅助CAD建模与逆向工程

Pritham Kumar Jena, Bhavika Baburaj, Tushar Anand, Vedant Dutta, Vineeth Ulavala, Sk Aziz Ali

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出A2Z-10M+数据集,包含1000万种多模态注释,用于提升CAD逆向工程中的BRep学习能力,通过高分辨率网格、手绘草图和文本描述等多源数据训练基础模型,实现对CAD特征的精准识别。

Comments 27 pages, accepted to IEEE CVF CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09217 2026-03-16 cs.CV 57%

TubeMLLM: A Foundation Model for Topology Knowledge Exploration in Vessel-like Anatomy

TubeMLLM:一种用于血管状解剖拓扑知识探索的基础模型

Yaoyu Liu, Minghui Zhang, Xin You, Hanxiao Zhang, Yun Gu

机构 * Institute of Medical Robotics, Shanghai Jiao Tong University, Shanghai, China(上海交通大学医学机器人研究所) Department of Automation, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TubeMLLM,结合结构理解与可控生成,提升医学血管状解剖的拓扑感知能力,并通过TubeMData基准和自适应损失策略实现跨模态迁移。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 8 篇

2511.14099 2026-03-16 cs.CV cs.AI 73%

FAPE-IR: Frequency-Aware Planning and Execution Framework for All-in-One Image Restoration

FAPE-IR:面向全场景图像修复的频率感知规划与执行框架

Jingren Liu, Shuning Xu, Qirui Yang, Yun Wang, Xiangyu Chen, Zhong Ji

机构 * Tianjin University(天津大学) University of Macau(澳门大学) City University of Hong Kong(香港城市大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所(TeleAI))

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FAPE-IR框架,通过频率感知规划与执行模块,结合多模态大语言模型和LoRA-MoE架构,实现统一且可解释的全场景图像修复,实验显示其在七项任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12597 2026-03-16 cs.LG cs.AI cs.HC cs.MA cs.SE 70%

Feynman: Knowledge-Infused Diagramming Agent for Scalable Visual Designs

Feynman: 一种融合知识的图表生成代理,用于可扩展的视觉设计

Zixin Wen, Yifu Cai, Kyle Lee, Sam Estep, Josh Sunshine, Aarti Singh, Yuejie Chi, Wode Ni

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态Agent :multi-modal(abstract);image-text(abstract);分类 cs.AI

AI总结 本文提出Feynman代理,通过知识组件枚举和代码规划生成高质量图表-描述对,构建了可扩展的图表生成流水线,并创建了视觉语言基准Diagramma。

Comments A previous version was submitted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11975 2026-03-16 cs.CV cs.AI cs.CR 62%

HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios

HomeSafe-Bench:评估视觉-语言模型在家庭场景中对不安全行为检测的性能

Jiayue Pu, Zhongxiang Sun, Zilu Zhang, Xiao Zhang, Jun Xu

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HomeSafe-Bench,用于评估视觉-语言模型在家庭场景中检测不安全行为的能力,同时引入HD-Guard架构提升实时安全监控效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12823 2026-03-16 cs.CL cs.CV 62%

Adaptive Vision-Language Model Routing for Computer Use Agents

自适应视觉-语言模型路由用于计算机使用代理

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

机构 * vLLM Semantic Router Project(vLLM语义路由项目) MBZUAI McGill University(麦吉尔大学) AMD Red Hat(红帽公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出自适应VLM路由框架,通过动态选择模型降低推理成本,同时保持可靠性。在ScreenSpot-Pro数据集和OpenClaw基准测试中,AVR实现了高达78%的推理成本降低,并结合视觉困惑代理机制提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11545 2026-03-16 cs.CL cs.AI cs.LG 62%

One Supervisor, Many Modalities: Adaptive Tool Orchestration for Autonomous Queries

一个监督者,多种模态:面向自主查询的自适应工具协调

Mayank Saini, Arit Kumar Bishwas

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个代理AI框架,通过动态分解用户查询并分配任务给不同模态的工具,提升多模态查询处理效率,实验显示在15类任务中准确回答时间减少72%,对话重做减少85%,成本降低67%。

Comments 19 pages, 3 figures; v2: corrected author metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12482 2026-03-16 cs.CV 57%

CalliMaster: Mastering Page-level Chinese Calligraphy via Layout-guided Spatial Planning

CalliMaster:通过布局引导的空间规划掌握页面级中文书法

Tianshuo Xu, Tiantian Hong, Zhifei Chen, Fei Chao, Ying-cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Faculty of Engineering and IT, University of Technology Sydney(悉尼大学工程与信息学院) Xiamen University(厦门大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出CalliMaster框架,通过解耦空间规划与内容合成,解决页面级书法生成中精度与布局的平衡问题,支持可控生成与编辑,扩展至文物修复与鉴定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00016 2026-03-16 cs.RO cs.AI cs.HC 57%

Beyond Static Instruction: A Multi-agent AI Framework for Adaptive Augmented Reality Robot Training

超越静态指令:一种多智能体AI框架用于自适应增强现实机器人训练

Nicolas Leins, Jana Gonnermann-Müller, Malte Teichmann, Sebastian Pokutta

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出多智能体AI框架,用于增强现实机器人训练中的动态适应,通过多模态输入预处理和LLM自主推理实现个性化学习环境调整。

Journal ref Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (2026) 989-993

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12516 2026-03-16 cs.LG physics.flu-dyn 50%

Learning Pore-scale Multiphase Flow from 4D Velocimetry

从4D速度测距学习孔隙尺度多相流

Chunyang Wang, Linqi Zhu, Yuxuan Gu, Robert van der Merwe, Xin Ju, Catherine Spurin, Samuel Krevor, Rex Ying, Tobias Pfaff, Martin J. Blunt, Tom Bultreys, Gege Wen

机构 * Department of Earth Science and Engineering, Imperial College London(帝国理工学院伦敦地球科学与工程系) Department of Geology, Ghent University(根特大学地质系) Department of Energy Science and Engineering, Stanford University(斯坦福大学能源科学与工程系) Department of Computer Science, Yale University(耶鲁大学计算机科学系) NVIDIA

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种多模态学习框架,通过4D微速度测距数据直接推断多相孔隙流,结合图网络模拟和3D U-Net,实现快速预测,为地下碳和氢存储提供高效工具。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 10 篇

2603.12743 2026-03-16 cs.CV cs.AI cs.CL 82%

MoKus: Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization

MoKus: 利用跨模态知识迁移实现知识感知的概念定制

Chenyang Zhu, Hongxiang Li, Xiu Li, Long Chen

机构 * Tsinghua University(清华大学) HKUST(香港科技大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MoKus框架,通过跨模态知识迁移实现知识感知的概念定制,解决稀有token在预训练数据中缺失导致的性能不稳定问题,并引入KnowCusBench基准测试,验证了方法在概念定制任务中的优越性。

Comments Project Page: https://chenyangzhu1.github.io/MoKus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12722 2026-03-16 cs.CV cs.AI 81%

CognitionCapturerPro: Towards High-Fidelity Visual Decoding from EEG/MEG via Multi-modal Information and Asymmetric Alignment

CognitionCapturerPro:通过多模态信息和非对称对齐实现从EEG/MEG的高保真视觉解码

Kaifan Zhang, Lihuo He, Junjie Ke, Yuqi Ji, Lukun Wu, Lizi Wang, Xinbo Gao

机构 * Visual Information Processing Laboratory, School of Electronic Engineering, Xidian University(电子科技大学信息处理实验室,电子工程学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CognitionCapturerPro框架,通过整合EEG与多模态先验信息,提升EEG视觉重建的保真度与检索准确率,改进Top-1和Top-5准确率达25.9%和10.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12721 2026-03-16 cs.CV cs.AI 81%

CMHANet: A Cross-Modal Hybrid Attention Network for Point Cloud Registration

CMHANet:一种用于点云配准的跨模态混合注意力网络

Dongxu Zhang, Yingsen Wang, Yiding Sun, Haoran Xu, Peilin Fan, Jihua Zhu

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CMHANet,通过融合2D图像与3D点云信息,提升配准鲁棒性,并引入对比学习优化函数,实验表明在3DMatch和3DLoMatch数据集上效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12625 2026-03-16 cs.IR cs.AI cs.CV 81%

VLM4Rec: Multimodal Semantic Representation for Recommendation with Large Vision-Language Models

VLM4Rec:基于大视觉-语言模型的多模态语义表示推荐系统

Ty Valencia, Burak Barlas, Varun Singhal, Ruchir Bhatia, Wei Yang

机构 * University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 VLM4Rec通过语义对齐而非直接特征融合,提升多模态推荐性能,实验显示其优于原始视觉特征和融合方法。

Comments 13 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12762 2026-03-16 cs.CV cs.LG 79%

TerraFlow: Multimodal, Multitemporal Representation Learning for Earth Observation

TerraFlow:用于地球观测的多模态、多时间序列表示学习

Nazar Puriy, Johannes Jakubik, Benedikt Blumenstiel, Konrad Schindler

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 TerraFlow提出了一种新的多模态、多时间序列学习方法,适用于地球观测,能够处理变长输入,优于现有模型,在GEO-Bench-2基准测试中表现优异,并在自然灾害风险地图预测中取得进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12726 2026-03-16 cs.IR cs.LG 78%

Anchored Alignment: Preventing Positional Collapse in Multimodal Recommender Systems

锚定对齐:防止多模态推荐系统中的位置坍塌

Yonghun Jeong, David Yoon Suk Kang, Yeon-Chang Lee

机构 * UNIST Ulsan(乌尼斯特大学(乌山)) Chungbuk National University(Chungbuk国立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出AnchorRec框架,通过轻量投影域的间接锚定对齐方法,避免多模态推荐系统中的位置坍塌,提升推荐准确性和多模态表达性。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏