arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-21 至 2026-08-21 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 12 篇

2608.19208 2026-08-21 cs.CL cs.CV 新提交 84%

When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

当无关文本起作用时:多模态大语言模型中的仿射间隔偏移

Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文研究多模态大语言模型(MLLMs)中任务无关文本对视觉判断任务的影响,发现其会使模型决策间隔发生可预测的仿射变换,为提升模型对噪声上下文的鲁棒性提供了诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19212 2026-08-21 cs.CL cs.CV 新提交 81%

NepOOC-M: Bilingual Nepali-English Benchmark and Comparative Analysis of Multimodal Architectures for OOC Detection

NepOOC-M:面向OOC检测的尼泊尔语-英语双语基准及多模态架构的对比分析

Sanjeev Khatiwada

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对尼泊尔语OOC虚假信息检测,构建首个尼泊尔语多语言OOC基准NepOOC,评估多模态等架构发现仅文本mBERT性能最优,数据集扩充比架构优化更有效。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20312 2026-08-21 cs.CV 新提交 79%

Inter-X++: A Comprehensive Benchmark for Multimodal Human-Human Interaction Analysis

Inter-X++:用于多模态人与人交互分析的综合基准

Liang Xu, Chengqun Yang, Zili Lin, Xintao Lv, Yichao Yan, Xin Jin, Zhibo Chen, Xiaokang Yang, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(宁波工程学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出多模态人与人交互基准Inter-X++,构建含精细标注的大规模数据集,开发统一HHI框架OpenHHI,其在生成与感知任务上达最优性能,验证了统一表示的有效性。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19666 2026-08-21 cs.CV 新提交 79%

MUST-PET: MUltimodal Self-supervised learning across Tracers for whole-body PET/CT-based lesion segmentation

MUST-PET:用于基于全身PET/CT的病灶分割的跨示踪剂多模态自监督学习

Bashirul Azam Biswas, Amartya Bhattacharya, Biratal Raj Wagle, Matthew E. Maeder, James B. Yu, Indrani Bhattacharya

机构 * Geisel School of Medicine at Dartmouth(达特茅斯盖泽尔医学院) Dartmouth Hitchcock Medical Center(达特茅斯-希区柯克医疗中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出MUST-PET多模态自监督学习框架,通过跨示踪剂的上下文感知掩码重建,实现全身PET-CT病灶的标注高效、可泛化分割,性能优于从头训练模型。

Comments Submitted to SPIE CAD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14497 2026-08-21 cs.CV 版本更新 79%

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

通过自我场景增强在多模态大语言模型中强化自我中心空间感知

Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究如何强化多模态大语言模型的自我中心空间感知,提出自我场景增强框架ESA,利用自我元素图作为中间表示,通过视觉基础模型增强空间感知,在EgoTextVQA基准上取得显著性能提升。

Comments 14 pages, 8 figures. Chi Kit Wong and Ye Pan contributed equally. Code: this https URL (https://github.com/Chikit-WONG/spatialGraph)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19297 2026-08-21 cs.LG 新提交 78%

Holtercare-Bench: A Multimodal Benchmark for Evaluating Long-Term Dynamic ECG Analysis

Holtercare-Bench:用于评估长期动态心电图分析的多模态基准

Yihan Xie, Hanwen Cui, Runze Ye, Juekai Lin, Haoyang Wang, Jinhao Mao, Bo Zhang, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Lei Zhang

机构 * Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态评测 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14728 2026-08-21 cs.MM cs.CL cs.CV cs.CY 版本更新 75%

Mitigating GenAI-Powered Evidence Pollution for Out-Of-Context Misinformation Detection

缓解生成式人工智能(GenAI)驱动的证据污染以检测脱离上下文的虚假信息

Zehong Yan, Peng Qi, Wynne Hsu, Mong Li Lee

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 该研究针对GenAI污染证据削弱OOC多模态虚假信息检测的问题,提出跨模态证据重排序与声明-证据推理策略,在基准数据集上验证了其对现有检测器鲁棒性的提升效果。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20122 2026-08-21 cs.CV 新提交 57%

ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation

ArmorOCR:基于观测迁移自蒸馏的 grounded 对抗性视觉感知

Linhan Cao, Siyuan Li, Jun Lan, Liangbo He, Guannan Li, Xiaolei Huang, Jun Jia, Shuheng Zhou, Huijia Zhu, Weiqiang Wang, Wei Sun

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ArmorOCR两阶段训练框架,结合OPSD与GRPO,推出含390幅图像的AdvSpot基准,可提升对抗性OCR感知能力并保留通用OCR性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10668 2026-08-21 cs.CV 版本更新 57%

XDen-1K: A Density Field Dataset of Real-World Objects

XDen-1K:一个现实世界物体的密度场数据集

Jingxuan Zhang, Tianqi Yu, Yatu Zhang, Jinze Wu, Kaixin Yao, Jingyang Liu, Yuyao Zhang, Jiayuan Gu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 XDen-1K通过提供大规模现实世界物体的多模态数据,推动物理基础视觉推理和具身AI的研究。

Comments Project Page: this https URL (https://xden-1k.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02489 2026-08-21 cs.CV 版本更新 57%

Object-aware graph matching network for cross-domain remote sensing image localization

面向跨域遥感图像定位的感知对象图匹配网络

Tao Liu, Kan Ren, Qian Chen

机构 * Jiangsu Key Laboratory of Spectral Imaging and Intelligent Sense, Nanjing University of Science and Technology(江苏光谱成像与智能感知重点实验室,南京理工大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 针对跨域跨模态遥感图像地理定位难题,提出感知对象图匹配框架,构建IRVL328数据集,在SUES-200、IRVL328等数据集上取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19735 2026-08-21 cs.LG 新提交 50%

RecPFN: Prior-Fitted Networks for In-Context-Based Recommendations

RecPFN:用于基于上下文的推荐的先验拟合网络

En Zhi Tan, Jia Xiang Lim, Bryan Lijie Chew, Tze Minh Ng, Benjamin Yan Han Yap

机构 * SAP SE(思爱普公司)

专题命中 多模态评测 :multimodal(abstract)

AI总结 RecPFN是一种将上下文学习引入序列推荐的先验拟合网络,经合成点击流环境预训练,在八个基准测试中实现最优零样本性能,部署高效且鲁棒,为通用推荐系统提供新路径。

Comments 12 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18632 2026-08-21 cs.RO 版本更新 50%

ROBOSHACKLES: A Safety Dataset for Human-Injury Prevention in Embodied Foundation Models

ROBOSHACKLES: 面向具身基础模型中人体伤害预防的安全数据集

Zhuowen Yin, Chongyang Liu, Wenzhang Yang, Renjue Li, Yinxing Xue

机构 * Institute of Al for Industries, Chinese Academy of Sciences(工业人工智能研究所,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 为解决机器人伤害人类数据难以安全收集的问题,提出基于真实观测的安全数据构建流水线,生成包含1万条视频的ROBOSHACKLES数据集,涵盖直接和间接伤害类别,评估发现现有模型在安全关键场景下100%产生不安全动作。

详情

展开后加载摘要…

URL PDF HTML 收藏