arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-18 至 2026-03-18 共收录 82 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 15 篇

2603.16093 2026-03-18 cs.SD cs.AI cs.CV cs.MM 67%

Diffusion Models for Joint Audio-Video Generation

用于联合音频视频生成的扩散模型

Alejandro Paredes La Torre

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出联合音频视频生成方法,通过构建高质量数据集、训练MM-扩散架构、探索联合潜在扩散及提出两步文本到音频视频生成流程,提升生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14837 2026-03-18 cs.CV cs.AI 62%

Improved Iterative Refinement for Chart-to-Code Generation via Structured Instruction

改进的图表到代码生成的迭代细化方法:基于结构化指令

Chengzhi Xu, Yuyang Wang, Lai Wei, Lichao Sun, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) Lehigh University(莱特大学) MIFA Lab(MIFA实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于结构化指令的ChartIR方法,通过区分视觉理解和代码翻译任务,提升图表到代码生成的性能,实验显示在Qwen2-VL和GPT-4o上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16392 2026-03-18 cs.CV 57%

DermaFlux: Synthetic Skin Lesion Generation with Rectified Flows for Enhanced Image Classification

DermaFlux:基于修正流的合成皮肤病变生成用于增强图像分类

Stathis Galanakis, Alexandros Koliousis, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) Northeastern University London, UK(伦敦东北大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 DermaFlux通过生成临床相关的皮肤病变图像,提升二分类性能,实验表明其在小数据集上提升6%,在合成数据上提升9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16373 2026-03-18 cs.CV 57%

Semantic One-Dimensional Tokenizer for Image Reconstruction and Generation

语义一维分词器用于图像重建与生成

Yunpeng Qu, Kaidong Zhang, Yukang Ding, Ying Chen, Jian Wang

机构 * Tsinghua University, Beijing, China(清华大学,北京,中国) Alibaba Group, Beijing, China(阿里巴巴集团,北京,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SemTok,一种语义一维分词器,通过压缩2D图像为1D离散token实现高效图像重建,采用三重创新框架提升生成效果。

Comments 18 pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16372 2026-03-18 cs.CV 57%

InViC: Intent-aware Visual Cues for Medical Visual Question Answering

InViC:面向医疗视觉问答的意图感知视觉线索

Zhisong Wang, Ziyang Chen, Zanting Ye, Hongze Zhu, Yefeng Zheng, Yong Xia

机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University, Xi’an 710072, China(集成空天地海大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学,西安710072,中国) Westlake University(西湖大学) Southern Medical University(南方医科大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出InViC框架,通过引入Cue Tokens Extraction模块和两阶段微调策略,提升医疗视觉问答中意图对齐的视觉证据利用,验证了瓶颈化训练在提高可信度上的有效性。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16139 2026-03-18 cs.CV 57%

Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training

重新思考UMM视觉生成:面向高效图像-only预训练的掩码建模

Peng Sun, Jun Xie, Tao Lin

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出IOMM框架,通过两阶段训练提升UMM视觉生成效率与性能,实验显示其在GenEval和WISE上优于现有基线。

Comments https://github.com/LINs-lab/IOMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15975 2026-03-18 cs.CV 57%

UMO: Unified In-Context Learning Unlocks Motion Foundation Model Priors

UMO:统一上下文学习解锁运动基础模型先验

Xiaoyan Cong, Zekun Li, Zhiyang Dou, Hongyu Li, Omid Taheri, Chuan Guo, Abhay Mittal, Sizhe An, Taku Komura, Wojciech Matusik, Michael J. Black, Srinath Sridhar

机构 * Brown University(布朗大学) Massachusetts Institute of Technology(麻省理工学院) Meta Reality Lab(Meta现实实验室) Max-Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) University of Hong Kong(香港大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 UMO通过统一框架解锁运动基础模型先验,支持多种跨模态和上下文生成任务,提升文本到运动合成性能。

Comments Project Page: https://oliver-cong02.github.io/UMO.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21435 2026-03-18 cs.CV 57%

Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking

融合理解与生成的交错分析-草稿思维

Shengqiong Wu, Bobo Li, Xinkai Wang, Xiangtai Li, Lei Cui, Furu Wei, Shuicheng Yan, Hao Fei, Tat-seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AD-Loop机制,通过交错分析与草稿操作提升视觉语言模型的理解与生成能力,实验表明其在多个基准测试中表现优异,具备良好的迁移性。

Comments 28 pages, 17 figures, 6 tables, ICLR conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16612 2026-03-18 cs.GR 50%

Retrieval-Augmented Sketch-Guided 3D Building Generation

增强检索的草图引导3D建筑生成

Zhengyang Wang, Nuttapong Rochanavibhata, Yuxiao Ren, Xusheng Du, Ye Zhang, Haoran Xie

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出多阶段3D生成框架,通过结合生成与检索方法实现组件级编辑与个性化定制,解决日本独栋房屋早期设计阶段因缺乏统一表示导致的设计漂移问题。

Comments 10 pages, 4 figures, Proceeding of CAADRIA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16550 2026-03-18 cs.RO 50%

ASCENT: Transformer-Based Aircraft Trajectory Prediction in Non-Towered Terminal Airspace

ASCENT:基于Transformer的非塔台终端空域飞机轨迹预测

Alexander Prutsch, David Schinagl, Horst Possegger

机构 * Institute of Visual Computing, Graz University of Technology(视觉计算研究所,格拉茨技术大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出ASCENT模型,通过轻量级Transformer架构实现多模态3D飞机轨迹预测,结合领域感知的3D坐标归一化和参数化预测,实验表明其在TrajAir和TartanAviation数据集上优于现有方法。

Comments ICRA 2026. Project Page at https://a-pru.github.io/ascent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16116 2026-03-18 eess.SP 50%

Knowledge Distillation for Collaborative Learning in Distributed Communications and Sensing

知识蒸馏在分布式通信与感知中的协同学习

Nhan Thanh Nguyen, Mengyuan Ma, Nir Shlezinger, Junil Choi, Yonina C. Eldar, A. Lee Swindlehurst, Markku Juntti

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文探讨了知识蒸馏和协同学习在6G分布式通信与感知节点中部署轻量级AI模型的有效性,通过系统性数值研究证明其在多模态感知辅助波束跟踪中的性能提升与复杂度降低。

Comments This paper has been submitted to IEEE Communications Magazine and under review for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 16 篇

2603.15800 2026-03-18 cs.CV cs.CL cs.CR 87%

Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory

通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化

Ce Zhang, Jinxi He, Junyi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 多模态评测 :multi-modal(title,abstract);MLLM(abstract,comments);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。

Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03951 2026-03-18 cs.CV 83%

ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning

ANTS: 通过测试时MLLM理解和推理实现的自适应负文本空间塑造用于OOD检测

Wenjie Zhu, Yabin Zhang, Xin Jin, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出ANTs通过利用多模态大语言模型的理解和推理能力,构建自适应负文本空间,提升OOD检测的准确性和适应性,实验表明在ImageNet上FPR95降低3.1%。

Comments Accepted by CVPR2026, Project Page: https://zhuwenjie98.github.io/ANTS-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16261 2026-03-18 cs.CV cs.AI 81%

AW-MoE: All-Weather Mixture of Experts for Robust Multi-Modal 3D Object Detection

AW-MoE:面向所有天气条件的专家混合方法用于鲁棒多模态3D目标检测

Hongwei Lin, Xun Huang, Chenglu Wen, Cheng Wang

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建城市智能感知与计算重点实验室) School of Informatics, Xiamen University(厦门大学信息学院) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出AW-MoE,通过引入天气感知路由和统一双模态增强方法,提升多模态3D目标检测在恶劣天气下的鲁棒性,实验表明其在恶劣天气下的性能提升达15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18466 2026-03-18 cs.CY cs.AI cs.CV 81%

Can Multimodal LLMs See Science Instruction? Benchmarking Pedagogical Reasoning in K-12 Classroom Videos

多模态大语言模型能否看见科学教学?K-12课堂视频中教学推理的基准测试

Yixuan Shen, Peng He, Honglu Liu, Jinxuan Fan, Yuyang Ji, Tingting Li, Tianlong Chen, Kaidi Xu, Feng Liu

机构 * Department of Computer Science, Drexel University(德雷塞尔大学计算机科学系) Department of Teaching and Learning, Washington State University(华盛顿州立大学教学与学习系) College of Chemistry, Beijing Normal University(北京师范大学化学学院) Department of Computer Science, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SciIBI视频基准,用于分析科学课堂讨论,评估多模态模型在教学推理中的表现,发现模型在区分教学实践时存在局限,需更深入的推理。

Comments 17pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16463 2026-03-18 cs.AI cs.HC 79%

Follow the Clues, Frame the Truth: Hybrid-evidential Deductive Reasoning in Open-Vocabulary Multimodal Emotion Recognition

循证推断,还原真相:面向开放词汇多模态情感识别的混合证据推理

Yu Liu, Lei Zhang, Haoxun Li, Hanlei Shi, Yuxuan Ding, Leyuan Qu, Taihao Li

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China(杭州高等研究 institute,中国科学院大学,杭州,中国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出HyDRA架构,通过混合证据推理解决多模态情感识别中的歧义问题,通过强化学习优化推理过程,提升在复杂场景下的识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16181 2026-03-18 cs.CV cs.CR 79%

KidsNanny: A Two-Stage Multimodal Content Moderation Pipeline Integrating Visual Classification, Object Detection, OCR, and Contextual Reasoning for Child Safety

KidsNanny:一种集成视觉分类、目标检测、OCR和上下文推理的双阶段多模态内容审查流水线,用于儿童安全

Viraj Panchal, Tanmay Talsaniya, Parag Patel, Meet Patel

机构 * KidsNanny Research Team, Vartit Technology Inc.(KidsNanny研究团队,Vartit技术公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出KidsNanny,一种双阶段多模态内容审查架构,通过视觉Transformer和目标检测器进行视觉筛查,结合OCR和基于文本的7B语言模型进行上下文推理,以提高儿童安全的内容审查效率和准确性。

Comments 12 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15939 2026-03-18 cs.LG cs.AI 79%

Data-Local Autonomous LLM-Guided Neural Architecture Search for Multiclass Multimodal Time-Series Classification

数据本地自主LLM引导的神经架构搜索用于多类多模态时间序列分类

Emil Hardarson, Luka Biedebach, Ómar Bessi Ómarsson, Teitur Hrólfsson, Anna Sigridur Islind, María Óskarsdóttir

机构 * University of Southampton(南安普顿大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种数据本地的LLM引导神经架构搜索框架,用于多类多模态时间序列分类,通过轻量级融合MLP和专家架构联合搜索提升模型性能,减少人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13693 2026-03-18 cs.CV 79%

A WDLoRA-Based Multimodal Generative Framework for Clinically Guided Corneal Confocal Microscopy Image Synthesis in Diabetic Neuropathy

基于WDLoRA的多模态生成框架用于临床指导的糖尿病性周围神经病变角膜共聚焦显微镜图像合成

Xin Zhang, Liangxiu Han, Tam Sobeih, Yue Shi, Yalin Zheng, Uazman Alam, Maryam Ferdousi, Rayaz Malik

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特 Metropolitan 大学计算与数学系) Department of Eye and Vision Sciences, University of Liverpool(利物浦大学眼科学与视觉科学系) Faculty of Biology, Medicine and Health, University of Manchester(曼彻斯特大学生物、医学与健康学院) Department of Medicine, Weill Cornell Medicine-Qatar(韦尔·柯尔曼医学中心-卡塔尔医学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于WDLoRA的多模态生成框架,用于生成糖尿病性周围神经病变的角膜共聚焦显微镜图像,通过结合神经分割掩膜和疾病特异性临床提示,提升图像合成的解剖学一致性与临床诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07985 2026-03-18 cs.CL 79%

Multilingual, Multimodal Pipeline for Creating Authentic and Structured Fact-Checked Claim Dataset

多语言、多模态流水线用于创建真实且结构化的事实核查数据集

Z. Melce Hüsünbeyi, Virginie Mouilleron, Leonie Uhling, Daniel Foppe, Tatjana Scheffler, Djamé Seddah

机构 * Ruhr-Universität Bochum(博尔塔尔大学波恩)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出一个多语言、多模态的数据收集与处理流水线,通过整合ClaimReview feeds、抓取完整驳斥文章、标准化异构声明裁定并添加结构化元数据和对齐的视觉内容,构建了法语和德语的事实核查数据集,提升了事实核查的可解释性和证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15880 2026-03-18 cs.LG cs.AI 70%

Electrodermal Activity as a Unimodal Signal for Aerobic Exercise Detection in Wearable Sensors

电导活动作为可穿戴传感器中有氧运动检测的单一信号

Rena Mira Krishna, Ramya Sankar, Shadi Ghiasi

机构 * Odle Middle School(Odle中学) ImagineQ Labs(ImagineQ实验室) Cambridge Center for International(剑桥国际中心) bellevue, WA, USA(西雅图,华盛顿州,美国) Research, United Kingdom(英国研究)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 研究探讨了仅使用电导活动特征是否能可靠区分静息与持续有氧运动,采用留一被试法验证,发现EDA单独分类在主体独立评估中表现中等,相位时间动态和事件时间对分类分离有贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07923 2026-03-18 cs.CV cs.AI 62%

Exploring the Underwater World Segmentation without Extra Training

探索无需额外训练的水下世界分割

Bingyu Li, Tao Huo, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国) University of Science and Technology of China, China(中国科学技术大学,中国) Northwestern Polytechnical University, China(西北工业大学,中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AquaOV255水下分割数据集及Earth2Ocean框架,通过几何引导视觉掩码生成和类别-视觉语义对齐模块,在无需额外训练的情况下实现高效的水下开放词汇分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16581 2026-03-18 cs.AI 57%

V-DyKnow: A Dynamic Benchmark for Time-Sensitive Knowledge in Vision Language Models

V-DyKnow:面向视觉语言模型的时间敏感知识动态基准

Seyed Mahed Mousavi, Christian Moiola, Massimo Rizzoli, Simone Alghisi, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, University of Trento(信号与交互系统实验室,特伦托大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出V-DyKnow基准,评估视觉语言模型对时间敏感事实知识的处理能力,分析模型响应可靠性、知识更新方法有效性及过时预测原因,揭示当前VLM在多模态时间敏感知识获取与更新中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18344 2026-03-18 cs.CV 57%

A Tri-Modal Dataset and a Baseline System for Tracking Unmanned Aerial Vehicles

多模态数据集及一个跟踪无人飞行器的基线系统

Tianyang Xu, Jinjie Gu, Xuefeng Zhu, XiaoJun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) School of Computer Science and Electronic Engineering and the Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学计算机科学与电子工程学院及视觉、语音与信号处理中心)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出多模态无人飞行器跟踪数据集MM-UAV,包含RGB、红外和事件信号三种模态,通过引入偏移引导自适应对齐模块和自适应动态融合模块,提升复杂环境下的跟踪性能。

Comments V3

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00168 2026-03-18 cs.CV 57%

Revisiting RGBT Tracking Benchmarks from the Perspective of Modality Validity: A New Benchmark, Problem, and Solution

重新审视RGBT跟踪基准测试:从模态有效性角度出发:一个新的基准、问题和解决方案

Zhangyong Tang, Tianyang Xu, Zhenhua Feng, Xuefeng Zhu, Chunyang Cheng, Xiao-Jun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey大学视觉、语音与信号处理中心)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MV-RGBT基准测试,针对多模态场景下的跟踪问题,引入'何时融合'新问题,并提出MoETrack解决方案,展示了其在多模态跟踪中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16741 2026-03-18 cs.LG q-bio.NC q-bio.QM stat.ML 50%

Bayesian Inference of Psychometric Variables From Brain and Behavior in Implicit Association Tests

基于隐性联想测试的脑和行为数据中心理量表变量的贝叶斯推断

Christian A. Kothe, Sean Mullen, Michael V. Bronstein, Grant Hanada, Marcelo Cicconet, Aaron N. McInnes, Tim Mullen, Marc Aafjes, Scott R. Sponheim, Alik S. Widge

机构 * Intheon Department of Psychiatry and Behavioral Sciences, University of Minnesota(大学医学院精神病学与行为科学系) Minneapolis VA Medical Center(明尼苏达州梅奥医疗中心) Institute for Health Informatics, University of Minnesota(健康信息学研究所) Deliberate AI

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出了一种稀疏分层贝叶斯模型,利用多模态数据预测新参与者与精神疾病症状相关的体验,实现了比传统D-score方法更高的预测性能。

Comments 43 pages, 7 figures, 6 tables, submitted to: Journal of Neural Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06698 2026-03-18 cs.RO 50%

Crowd-FM: Learned Optimal Selection of Conditional Flow Matching-generated Trajectories for Crowd Navigation

Crowd-FM: 基于学习的条件流匹配生成轨迹的最优选择用于人群导航

Antareep Singha, Laksh Nanwani, Mathai Mathew P., Samkit Jain, Phani Teja Singamaneni, Arun Kumar Singh, K. Madhava Krishna

机构 * Robotics Research Center, IIIT Hyderabad, India(IIIT海得拉巴机器人研究中心,印度) Nanyang Technological University, Singapore(新加坡南洋理工大学) University of Tartu, Estonia(爱沙尼亚塔尔图大学) Inria, Université de Lorraine, France(法国里尔大学Inria研究院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出Crowd-FM方法,通过条件流匹配学习碰撞自由的轨迹生成策略,提升机器人在人群中的安全性和人似性。

Comments Accepted at IEEE ICRA 2026. Authors Antareep Singha and Laksh Nanwani have equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 6 篇

2603.16777 2026-03-18 cs.AI 79%

Anticipatory Planning for Multimodal AI Agents

多模态AI代理的前瞻性规划

Yongyuan Liang, Shijie Zhou, Yu Gu, Hao Tan, Gang Wu, Franck Dernoncourt, Jihyung Kil, Ryan A. Rossi, Ruiyi Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究) State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出TraceR1框架,通过前瞻性轨迹推理提升多模态代理的规划能力,实现更稳定的执行和泛化性能。

Comments Published at CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10376 2026-03-18 cs.CV cs.RO 79%

MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation

MSGNav: 释放多模态3D场景图在零样本具身导航中的潜力

Xun Huang, Shijia Zhao, Yunxiang Wang, Xin Lu, Wanfa Zhang, Rongsheng Qu, Weixin Li, Yunhong Wang, Chenglu Wen

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建智能感知与计算重点实验室) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算重点实验室) Beihang University(北航) Nanyang Technological University(南洋理工大学) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV

AI总结 MSGNav通过多模态3D场景图实现零样本具身导航,引入关键子图选择模块、自适应词汇更新模块和闭环推理模块,解决开放词汇和视觉证据保留问题,实验表明其在GOAT-Bench和HM3D-ObjNav基准上表现优异。

Comments 18 pages, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14440 2026-03-18 cs.AI cs.CL cs.LG 76%

VisTIRA: Closing the Image-Text Modality Gap in Visual Math Reasoning via Structured Tool Integration

VisTIRA: 通过结构化工具集成缩小图像-文本模态差距以提升视觉数学推理

Saeed Khaki, Ashudeep Singh, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能)

专题命中 多模态Agent :image-text(title);分类 cs.CL、cs.AI

AI总结 VisTIRA通过结构化工具集成框架,解决图像形式数学问题的推理难题,改进视觉数学推理能力,实验表明工具监督和OCR定位能有效缩小模态差距。

详情

展开后加载摘要…

URL PDF HTML 收藏