arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-20 至 2026-07-20 共收录 64 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 7 篇

2601.01554 2026-07-20 cs.SD cs.AI eess.AS 62%

MOSS Transcribe Diarize Technical Report

MOSS 语音转录与说话人识别技术报告

MOSI. AI, :, Donghua Yu, Zhengyuan Lin, Hanfu Chen, Chen Yang, Yiyang Zhang, Jingqi Chen, Ke Chen, Liwei Fan, Yi Jiang, Jie Zhu, Muchen Li, Wenxuan Wang, Yang Wang, Zhe Xu, Botian Jiang, Yitian Gong, Yuqian Zhang, Wenbo Zhang, Songlin Wang, Zhiyu Wu, Zhaoye Fei, Qinyuan Cheng, Shimin Li, Xipeng Qiu

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 MOSS转录与识别通过端到端多模态大语言模型,实现了说话人属性化和时间戳化的转录,解决了现有系统在上下文窗口、长距离说话人记忆和时间戳输出方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15442 2026-07-20 cs.AI 新提交 57%

Beyond a Joke: Multi-Angle Reasoning for Detecting and Explaining Harmful Humor in Memes

超越玩笑:用于检测和解释表情包中有害幽默的多角度推理

Shanhong Liu, Pai Chet Ng, De Wen Soh, Malika Meghjani, Konstantinos N. Plataniotis

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究如何检测和解释表情包中有害幽默,提出MAR-12框架,利用视觉语言模型,从十二个角度解读表情包,经注意力机制和原型分类器预测,在多数据集上准确率超现有方法,且能给出有说服力的解释。

Comments Accepted for Publication at AAAI-ICWSM 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15374 2026-07-20 cs.CV 新提交 57%

Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

通过强化学习进行推理引导的部件级视觉定位

Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thomas

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究部件级视觉定位难题,提出OP - HRG粗到细推理引导定位策略,先定位父物体再定位部件,经自我检查反思结果,引入部件感知GRPO框架训练,训练的4B模型性能优异且可迁移到推理分割。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15448 2026-07-20 cs.RO 新提交 50%

VTAP Gripper: Synergizing Fingertip Sensing and a Visuo-Tactile Active Palm for Dexterous In-Hand Manipulation

VTAP 夹爪:指尖传感与视觉触觉主动手掌协同实现灵巧的手中操作

Yuhao Zhou, Sheeraz Athar, Zhixian Hu, Binghao Huang, Yunzhu Li, Juan Wachs, Yu She

机构 * Edwardson School of Industrial Engineering, Purdue University(普渡大学爱德华森工业工程学院) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 研究提出集成 VTAP 和触觉阵列传感器手指的夹爪,利用指掌协同与多模态感知实现操作。通过双模态手掌扩展能力,提出重定向框架。经多任务实验验证,该夹爪及框架为灵巧夹爪设计等提供实用参考架构。

Comments 8 pages, 10 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project webpage: https://yuhochau.github.io/vtap/

详情

展开后加载摘要…

URL PDF HTML 收藏