arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-20 至 2026-07-20 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 7 篇

2607.15713 2026-07-20 eess.SP cs.AI cs.LG 新提交 83%

Map as a Prompt: Learning Multi-Modal Spatial-Signal Foundation Models for Cross-scenario Wireless Localization

地图作为提示:学习用于跨场景无线定位的多模态空间信号基础模型

Yong Chu, Xun Zhou, Zenglin Xu, Hui Wang, Yue Yu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Shanghai Academy of AI for Science(上海人工智能科学研究院) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院)

专题命中 其他多模态 :multi-modal(title);multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 针对无线定位在不同环境中面临的挑战及现有方法的局限,提出多模态基础模型SigMap,通过循环自适应掩码策略和“地图即提示”框架学习无线表示并实现跨场景适应,实验证明其性能领先且零样本泛化能力强。

Comments 17pages, 9 figures, poster in International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15403 2026-07-20 cs.HC cs.ET 新提交 78%

Assessing Learning Processes with Multimodal Data in Virtual Reality Learning Environments

在虚拟现实学习环境中使用多模态数据评估学习过程

Eileen McGivney, Oluwatomilade Olarinde, Erica Kleinman, Kaylah Facey, Rana Jahani, Shripad Agashe, Manav Varma, Seth Cooper, Casper Harteveld

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究如何在VR学习环境中用多模态数据评估学习过程,通过探索VR密室逃脱游戏的多模态数据源,利用VR特性促进多模态交互,以了解数据对参与者推理技能与猜测行为的揭示情况。

Journal ref Proceedings of the 20th International Conference of the Learning Sciences. ICLS 2026. Irvine, CA, USA. 1807-1811

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15647 2026-07-20 cs.AI 新提交 74%

Neuro-Symbolic AI for LEED compliance: Document-Centric Benchmarking, Deterministic Numeric Checking, and When Multimodal Hurts

用于LEED合规的神经符号人工智能:以文档为中心的基准测试、确定性数值检查以及多模态何时有害

Aritro De, Juliana Felkner

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他多模态 :multimodal(title);分类 cs.AI

AI总结 研究小型本地部署语言模型对LEED文档筛选及符号组件作用,引入神经符号管道,通过对齐PDF、检索证据、语言模型验证和数值检查器检查来验证合规性,实验表明特定模型在任务中表现较好,管道及基线提供了参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01554 2026-07-20 cs.SD cs.AI eess.AS 62%

MOSS Transcribe Diarize Technical Report

MOSS 语音转录与说话人识别技术报告

MOSI. AI, :, Donghua Yu, Zhengyuan Lin, Hanfu Chen, Chen Yang, Yiyang Zhang, Jingqi Chen, Ke Chen, Liwei Fan, Yi Jiang, Jie Zhu, Muchen Li, Wenxuan Wang, Yang Wang, Zhe Xu, Botian Jiang, Yitian Gong, Yuqian Zhang, Wenbo Zhang, Songlin Wang, Zhiyu Wu, Zhaoye Fei, Qinyuan Cheng, Shimin Li, Xipeng Qiu

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 MOSS转录与识别通过端到端多模态大语言模型,实现了说话人属性化和时间戳化的转录,解决了现有系统在上下文窗口、长距离说话人记忆和时间戳输出方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15442 2026-07-20 cs.AI 新提交 57%

Beyond a Joke: Multi-Angle Reasoning for Detecting and Explaining Harmful Humor in Memes

超越玩笑:用于检测和解释表情包中有害幽默的多角度推理

Shanhong Liu, Pai Chet Ng, De Wen Soh, Malika Meghjani, Konstantinos N. Plataniotis

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究如何检测和解释表情包中有害幽默,提出MAR-12框架,利用视觉语言模型,从十二个角度解读表情包,经注意力机制和原型分类器预测,在多数据集上准确率超现有方法,且能给出有说服力的解释。

Comments Accepted for Publication at AAAI-ICWSM 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15374 2026-07-20 cs.CV 新提交 57%

Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

通过强化学习进行推理引导的部件级视觉定位

Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thomas

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究部件级视觉定位难题,提出OP - HRG粗到细推理引导定位策略,先定位父物体再定位部件,经自我检查反思结果,引入部件感知GRPO框架训练,训练的4B模型性能优异且可迁移到推理分割。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15448 2026-07-20 cs.RO 新提交 50%

VTAP Gripper: Synergizing Fingertip Sensing and a Visuo-Tactile Active Palm for Dexterous In-Hand Manipulation

VTAP 夹爪:指尖传感与视觉触觉主动手掌协同实现灵巧的手中操作

Yuhao Zhou, Sheeraz Athar, Zhixian Hu, Binghao Huang, Yunzhu Li, Juan Wachs, Yu She

机构 * Edwardson School of Industrial Engineering, Purdue University(普渡大学爱德华森工业工程学院) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 研究提出集成 VTAP 和触觉阵列传感器手指的夹爪,利用指掌协同与多模态感知实现操作。通过双模态手掌扩展能力,提出重定向框架。经多任务实验验证,该夹爪及框架为灵巧夹爪设计等提供实用参考架构。

Comments 8 pages, 10 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project webpage: https://yuhochau.github.io/vtap/

详情

展开后加载摘要…

URL PDF HTML 收藏