arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-24 至 2026-06-24 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 6 篇

2606.24231 2026-06-24 cs.AI 新提交 79%

FlowR2A: Learning Reward-to-Action Distribution for Multimodal Driving Planning

FlowR2A: 学习奖励到动作分布用于多模态驾驶规划

Xirui Li, Zhe Liu, Xiaoqing Ye, Wenhua Han, Yifeng Pan, Junyu Han, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Changan Automobile(长安汽车)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出FlowR2A,通过流匹配解码器学习奖励条件动作分布,统一了基于评分和基于锚点的方法,实现密集监督与动态生成,在NAVSIM基准上取得最优结果。

Comments Project page: https://lixirui142.github.io/flowr2a-ad

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00588 2026-06-24 cs.CV 版本更新 79%

Response-Aware Multimodal Learning for Post-Treatment Visual Acuity Forecasting

响应感知的多模态学习用于治疗后视力预测

Phuoc-Nguyen Bui, Van-Vi Vo, Duc-Tai Le, Junghyun Bum, Van-Nguyen Pham, Ki-Young Kim, Seung-Young Yu, Hyunseung Choo

机构 * Research Convergence Institute(研究融合研究所) Sungkyunkwan University(全北大学) Dept. of AI Systems Engineering(人工智能系统工程系) Dept. of Ophthalmology(眼科系) Kyung Hee University Medical Center(庆熙大学医学院) Dept. of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 提出ReVA框架,利用基线与第1个月OCT影像及表格数据,通过多模态融合预测糖尿病性黄斑水肿患者抗VEGF治疗后3-24个月的视力轨迹。

Comments To appear in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24767 2026-06-24 cs.CV cs.RO 新提交 57%

Compact Object-Level Representations with Open-Vocabulary Understanding for Indoor Visual Relocalization

具有开放词汇理解的紧凑对象级表示用于室内视觉重定位

Zhaopeng Cui, Jiarui Hu, Jingbo Liu, Boming Zhao, Xiyue Guo, Boyin Feng, Haocheng Peng, Yujun Shen, Hujun Bao, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Ant Group(蚂蚁集团)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 提出OpenReLoc系统,利用基础模型实现多模态开放词汇语义匹配、基于DIOU的参考帧选择和双路径2D ICP损失,仅用对象单元实现室内视觉重定位,提升可解释性和准确性。

Comments Accepted by RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24450 2026-06-24 cs.RO cs.AI 新提交 57%

NoContactNoWorries: Estimating Contact through Vision and Proprioception for In-Hand Dexterous Manipulation

NoContactNoWorries: 通过视觉和本体感觉估计手内灵巧操作的接触

Soham Patil, Avirup Das, Sourabh Bhosale, Spandan Roy

机构 * Robotics Research Center (RRC), International Institute of Information Technology (IIIT), Hyderabad, India(印度海得拉巴国际信息技术研究所机器人研究中心) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出一种基于Transformer的多模态框架,融合RGB-D视觉和机器人本体感觉推断二值接触状态,作为手物交互的伪触觉信号,支持下游强化学习实现手内物体重定向并泛化至新物体。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems(IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24101 2026-06-24 cs.RO cs.CV 新提交 57%

NavWM: A Unified Navigation World Model for Foresight-Driven Planning

NavWM:一种用于前瞻性规划的统一导航世界模型

Yanghong Mei, Longteng Guo, Ming-Ming Yu, Guiyu Zhao, Xingjian He, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北京航空航天大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出NavWM统一导航世界模型,通过潜在世界令牌提取几何与语义先验,结合锚点多模态轨迹预测框架生成多样化动作空间,利用视觉前瞻评估最优路径,在多种机器人数据集上显著提升未来状态生成与零样本导航成功率。

Comments 13 pages, 5 figures, accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23997 2026-06-24 cs.IR 新提交 50%

ChartWalker: Benchmarking the Cross-Chart RAG Task with Hierarchical Knowledge Graphs

ChartWalker: 跨图表RAG任务的基准测试

Ning Tang, Chenghan Xie, Hanyang Yuan, Yi Li, Renhong Huang, Qian Kou, Xiaofeng Shi, Hua Zhou, Jiarong Xu

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出ChartWalker框架,通过层次化知识图谱和结构感知采样生成跨图表RAG基准,揭示现有方法性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏