arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-06 至 2026-03-06 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 9 篇

2510.27173 2026-03-06 cs.CE cs.AI cs.LG math.DS 86%

FMint-SDE: A Multimodal Foundation Model for Accelerating Numerical Simulation of SDEs via Error Correction

FMint-SDE:一种多模态基础模型,通过误差校正加速微分方程的数值模拟

Jiaxin Yuan, Haizhao Yang, Maria Cameron

机构 * University of Maryland(马里兰大学)

专题命中 多模态Agent :multimodal(title);multimodal foundation model(title);multi-modal(abstract);分类 cs.AI

AI总结 FMint-SDE通过多模态学习实现误差校正,提升微分方程数值模拟的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14599 2026-03-06 cs.CV cs.AI 84%

CCSD: Cross-Modal Compositional Self-Distillation for Robust Brain Tumor Segmentation with Missing Modalities

CCSD:跨模态组合自蒸馏用于缺失模态的鲁棒脑肿瘤分割

Dongqing Xie, Yonghuang Wu, Zisheng Ai, Jun Min, Zhencun Jiang, Shaojin Geng, Lei Wang

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) College of Biomedical Engineering, Fudan University(生物医学工程学院,复旦大学) School of Medicine, Tongji University(医学院,同济大学) College of Information Engineering, China Jiliang University(信息工程学院,中国嘉兴大学)

专题命中 多模态Agent :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 CCSD通过跨模态组合自蒸馏方法,提升在缺失模态下的脑肿瘤分割鲁棒性与泛化能力。

Comments 29 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19255 2026-03-06 cs.LG cs.AI 83%

VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use

VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考

Mingyuan Wu, Jingcheng Yang, Jize Jiang, Meitang Li, Kaizhuo Yan, Hanchao Yu, Minjia Zhang, Chengxiang Zhai, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Independent Researcher(独立研究者)

专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04819 2026-03-06 cs.RO cs.AI cs.LG 70%

On the Strengths and Weaknesses of Data for Open-set Embodied Assistance

关于数据在开放集具身助益中的优势与劣势

Pradyumna Tambwekar, Andrew Silva, Deepak Gopinath, Jonathan DeCastro, Xiongyi Cui, Guy Rosman

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 本文研究了多模态基础模型在开放集辅助任务中的泛化能力,通过合成数据集评估模型在新用户行为和新配置中的表现,揭示了辅助数据集设计对模型性能的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05487 2026-03-06 cs.RO 50%

Observing and Controlling Features in Vision-Language-Action Models

观察和控制视觉-语言-动作模型中的特征

Hugo Buurmeijer, Carmen Amo Alonso, Aiden Swann, Marco Pavone

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出通过特征可观察性和可控性研究,实现对视觉-语言-动作模型的在线适应与行为引导,提升其与用户需求的实时对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05019 2026-03-06 cs.HC 50%

Haptics in Cognition: Disruptor or Enabler of Memory?

触觉在认知中的作用:记忆的破坏者还是促进者?

Bibeg Limbu, Irene-Angelica Chounta

专题命中 多模态Agent :multimodal(abstract)

AI总结 本研究探讨触觉敏感度和运动强度对记忆的影响,发现增加书写压力略微降低即时回忆,但手套使用无明显影响,揭示了身体互动与认知表现之间的复杂关系。

Comments 22 Pages (including references), Book chapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04754 2026-03-06 cs.HC 50%

VizCrit: Exploring Strategies for Displaying Computational Feedback in a Visual Design Tool

VizCrit: 探索在视觉设计工具中展示计算反馈的策略

Mingyi Li, Mengyi Chen, Sarah Luo, Yining Cao, Haijun Xia, Maitraye Das, Steven P. Dow, Jane L. E

专题命中 多模态Agent :multi-modal(abstract)

AI总结 VizCrit通过算法问题检测和视觉注释生成,探索在视觉设计工具中实现可操作反馈的策略,发现以解决方案为中心的反馈能提升初学者的创造力感知和设计质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04705 2026-03-06 cs.RO cs.HC 50%

LEGS-POMDP: Language and Gesture-Guided Object Search in Partially Observable Environments

LEGS-POMDP:语言和手势引导的在部分可观测环境中的对象搜索

Ivy Xiao He, Stefanie Tellex, Jason Xinyu Liu

机构 * Brown University(布朗大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 LEGS-POMDP通过整合语言、手势和视觉信息,在部分可观测环境中实现高效的开放世界对象搜索,显著提升了多模态感知和不确定性处理能力。

Comments 10 pages, 8 figures, accepted at ACM/IEEE International Conference on Human-Robot Interaction (HRI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21161 2026-03-06 cs.RO 50%

MarketGen: A Scalable Simulation Platform with Auto-Generated Embodied Supermarket Environments

MarketGen: 一个可扩展的仿真平台,具有自动生成的具身超市环境

Xu Hu, Yiyang Feng, Junran Peng, Jiawei He, Liyi Chen, Wei Sui, Chuanchen Luo, Xucheng Yin, Qing Li, Zhaoxiang Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Science and Technology Beijing(北京科技大学) NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) XYZ Embodied AI(XYZ具身AI) Shandong University(山东大学) Linketic D-Robotics

专题命中 多模态Agent :multi-modal(abstract)

AI总结 MarketGen通过自动生成复杂超市环境,为评估超市代理提供了一个新的基准,加速了复杂商业应用中具身AI的研究。

Comments Project Page: https://xuhu0529.github.io/MarketGen

详情

展开后加载摘要…

URL PDF HTML 收藏