arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-15 至 2026-06-15 共收录 63 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2502.10886 2026-06-15 cs.CL 版本更新 79%

MET-Bench: Multimodal Entity Tracking for Evaluating the Limitations of Vision-Language and Reasoning Models

MET-Bench:用于评估视觉语言与推理模型局限性的多模态实体追踪

Vanya Cohen, Raymond Mooney

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 提出MET-Bench多模态实体追踪基准,发现视觉语言模型在图像实体追踪上显著弱于文本,主要源于视觉推理缺陷,强化学习可提升模态内性能但跨模态迁移不足。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05017 2026-06-15 cs.CV cs.CL 版本更新 79%

Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings

通过细化文本嵌入缓解大型视觉语言模型中的幻觉

Aakriti Agrawal, Gouthaman KV, Rohith Aralikatti, Gauri Jagatap, Jiaxin Yuan, Sarvesh Baskar, Vijay Kamarshi, Andrea Fanelli, Furong Huang

机构 * University of Maryland(马里兰大学) Dolby Laboratories(杜比实验室) Capital One

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对大型视觉语言模型因过度依赖文本先验而忽视视觉线索导致的幻觉问题,提出一种简单有效的视觉特征融入方法,通过学习视觉信息化的文本嵌入来平衡注意力分布,显著降低幻觉并提升多模态推理能力。

Comments Accepted at The 64th Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14703 2026-06-15 cs.CV cs.CL cs.LG 新提交 62%

Gaze Heads: How VLMs Look at What They Describe

注视头:视觉语言模型如何观察它们所描述的内容

Rohit Gandikota, David Bau

机构 * Northeastern University(东北大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 发现视觉语言模型的语言骨干中存在一组“注视头”,其注意力跟踪当前描述的图像区域,通过干预这些头可精确控制模型描述内容,准确率达83.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09250 2026-06-15 cs.CV cs.AI cs.LG 版本更新 62%

MirrorCheck: Efficient Adversarial Defense for Vision-Language Models

MirrorCheck: 视觉-语言模型的高效对抗防御

Samar Fares, Klea Ziu, Toluwani Aremu, Nikita Durasov, Martin Takáč, Pascal Fua, Ivan Laptev, Karthik Nandakumar

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能大学) NVIDIA École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Michigan State University(密歇根州立大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出MirrorCheck框架,利用文本到图像模型和随机化策略检测并防御针对视觉-语言模型的自适应对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05407 2026-06-15 cs.AI 版本更新 57%

PRISM: Perception Reasoning Interleaved for Sequential Decision Making

PRISM: 感知与推理交错用于序列决策

Mohamed Salim Aissi, Clemence Grislain, Clement Romac, Laure Soulier, Mohamed Chetouani, Olivier Sigaud, Nicolas Thome

机构 * Institut National de la Recherche Scientifique (INRS)(国家科学研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出PRISM框架,通过动态问答流水线紧密耦合视觉语言模型(VLM)和语言模型(LLM),实现任务驱动的感知,在ALFWorld和R2R基准上显著超越现有图像模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 6 篇

2606.13712 2026-06-15 cs.SD cs.CL 新提交 79%

Multimodal Speaker Identification in Classroom Environments

课堂环境中的多模态说话人识别

Michael L. Chrzan, Meghavarshini Krishnaswamy, Robert Gibboni, Katie Wetstone, Wei Ai, Jing Liu

机构 * University of Michigan(密歇根大学) University of Pennsylvania(宾夕法尼亚大学) University of Maryland(马里兰大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 针对课堂背景噪声和儿童语音变异性导致纯声学模型准确率低的问题,提出融合声学嵌入与LLM语义上下文的多模态框架,将学生识别准确率从39.0%提升至50.3%,长句准确率达76.9%,角色区分准确率99.3%。

Comments 9 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21182 2026-06-15 cs.CL cs.AI cs.CV 版本更新 67%

Manga109-v2026: Revisiting Manga109 Annotations for Modern Manga Understanding

Manga109-v2026: 重新审视Manga109标注以适应现代漫画理解

Jeonghun Baek, Atsuyuki Miyai, Shota Onohara, Hikaru Ikuta, Kiyoharu Aizawa

机构 * University of Tokyo(东京大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文重新审视Manga109的对话文本标注,识别出五类标注问题,包括转录错误、缺失文本区域、对话与拟声词重叠以及未分割的对话气泡,并通过结合OCR基于的问题检测和人工修订构建Manga109-v2026,修订了约29,000个对话标注,使Manga109更好地适应现代OCR和多模态漫画理解系统,同时保留漫画特有的表达结构。

Comments Accepted to the Culture x AI Workshop at ICML 2026. Project page: https://manga109.github.io/manga109-project-website/en/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14321 2026-06-15 cs.SD cs.MM 新提交 57%

MaskedFOP: Polyglot Speaker Identification under Missing Visual Modality via Cascaded Graph Label Propagation

MaskedFOP:缺失视觉模态下的多语言说话人识别通过级联图标签传播

Ayoub Elkhouzari, Youssef Iraqi, Loubna Mekouar

机构 * College of Computing, University Mohammed VI Polytechnic(穆罕默德六世理工大学计算机学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 提出MaskedFOP系统,在测试时人脸完全缺失且语音为未见语言(乌尔都语)的挑战下,通过模态丢弃双头网络、互补嵌入平均和两级级联推理实现闭集多语言说话人识别,在POLY-SIM 2026挑战赛中取得第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17633 2026-06-15 cs.SD cs.CR 版本更新 50%

SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering

SARSteer: 通过安全消融拒绝引导保护大型音频语言模型

Weilin Lin, Jianze Li, Hui Xiong, Li Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出SARSteer,首个针对大型音频语言模型的推理时防御框架,通过文本衍生的拒绝引导和分解安全空间消融,有效提升有害查询拒绝率并减少良性查询的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16835 2026-06-15 cs.CR cs.LG 版本更新 50%

NeST: Neuron Selective Tuning for LLM Safety

NeST: 面向LLM安全的神经元选择性调优

Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出NeST框架,通过激活探测识别安全相关前馈神经元并训练共享簇级更新,仅用普通恶意提示即可泛化防御多种越狱攻击,在14个模型上以极少参数实现接近全微调的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15496 2026-06-15 cs.HC cs.RO 50%

Fast Multi-Party Open-Ended Conversation with a Social Robot

快速多方开放性对话与社交机器人

Giulio Antonio Abbo, Maria Jose Pinto-Bernal, Martijn Catrycke, Tony Belpaeme

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种结合多模态感知与大语言模型的多方对话系统,评估结果显示其在平行对话和小组讨论中表现出高参与度和准确率,但存在语音识别误差和响应延迟等技术限制。

Comments 15 pages, 5 figures, 4 tables; 2 appendices

Journal ref Front. Robot. AI 13:1766383 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 4 篇

2606.14049 2026-06-15 cs.SD cs.CV 新提交 79%

FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

FoleyGenEx: 统一视频到音频生成,具备多模态控制、时间对齐与语义精度

Shiyao Wang, Xijuan Zeng, Hui Wang, Shiwan Zhao, Feng Deng, Chen Zhang, Yong Qin

机构 * Academy for Advanced Interdisciplinary Studies, Nankai University(南开大学前沿交叉学科研究院) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出FoleyGenEx统一框架,通过条件注入、多模态动态掩码和副词数据增强,实现视频到音频生成中多模态控制、帧级时间对齐与细粒度语义的同步合成。

Comments Accepted by INTERSPEECH 2026

Journal ref INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05025 2026-06-15 cs.CV 版本更新 79%

RAMEN: Resolution-Adjustable Multimodal Encoder for Earth Observation

RAMEN: 面向地球观测的分辨率可调多模态编码器

Nicolas Houdré, Diego Marcos, Hugo Riffaud de Turckheim, Dino Ienco, Laurent Wendling, Camille Kurtz, Sylvain Lobry

机构 * Institut National des Sciences de l'Univers (INSU), France(法国国家科学研究院) CNRS, France(法国国家科学研究中心)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出RAMEN,一种传感器无关的分辨率可调多模态编码器,通过将分辨率作为可控参数,在统一潜空间中实现多模态地球观测数据的连贯分析,并在PANGAEA基准上优于现有模型。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14094 2026-06-15 cs.CV cs.AI 新提交 62%

FEMOT: Multi-Object Tracking using Frame and Event Cameras

FEMOT: 使用帧和事件摄像机的多目标跟踪

Shiao Wang, Xiao Wang, Chao Wang, Yitao Li, Menghao Liu, Bo Jiang, Yaowei Wang, Yonghong Tian, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Peng Cheng Laboratory(鹏城实验室) National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理全国重点实验室) School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出FEMOT大规模RGB-事件多目标跟踪数据集和FEMOTR多模态跟踪框架,通过频域融合解耦特征,有效利用互补信息实现鲁棒跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14127 2026-06-15 cs.IR cs.CL 新提交 57%

CoRe: A Continuously Reward-Finetuned LLM Query Rewriter for Multi-Stage Context-Aware Relevance in Web-Scale Video Search

CoRe:一种持续奖励微调的LLM查询重写器,用于大规模视频搜索中的多阶段上下文感知相关性

Yilin Wen, Rong Yang, Xiaojia Chang, Hong Sun, Gefu Tang, Chunhui Liu, Jeffrey Chen, Zeyu Ma, Lisong Qiu, Xiaochuan Fan, Congjia Yu, Quan Zhou, Yuheng Chen, Zian Wang

机构 * TikTok

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出CoRe系统,通过半在线混合偏好优化和乘法奖励比,实现每周重新部署的LLM查询重写器,在多阶段视频搜索中显著降低变更查询率并提升相关性指标。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2606.14078 2026-06-15 cs.LG cs.AI 新提交 57%

Rethinking Backdoor Adversarial Unlearning through the Lens of Catastrophic Forgetting in Continual Learning

通过持续学习中的灾难性遗忘视角重新思考后门对抗性去学习

Zhenqian Zhu, Yamin Hu, Yujiang Liu, Luping Wei, Wenbo Hou, Bin Li, Haodong Li, Wenjian Luo

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Key Laboratory of Media Security, Shenzhen University(深圳大学媒体安全深圳市重点实验室)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 本文将后门学习与去学习建模为持续学习视角下的三阶段过程,基于灾难性遗忘机制推导完全后门去学习的必要条件,并提出盲反演-后门对抗性去学习(BI-BAU)方法,通过期望最大化算法优化最大后验目标,有效消除后门效应。

Comments Accepted by ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 9 篇

2510.02695 2026-06-15 cs.LG cs.AI 版本更新 79%

RAMAC: Multimodal Risk-Aware Offline Reinforcement Learning and the Role of Behavior Regularization

RAMAC: 多模态风险感知离线强化学习及行为正则化的作用

Kai Fukazawa, Kunal Mundada, Iman Soltani

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 提出RAMAC框架,结合分布性评论家与生成式演员(如扩散模型),通过条件风险价值与行为克隆的复合目标实现离线强化学习中的风险敏感学习,抑制分布外动作并提升CVaR。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14267 2026-06-15 cs.RO 新提交 78%

FloVerse: Floor Plan-Guided Multi-Modal Navigation

FloVerse:基于楼层平面图的多模态导航

Weiqi Huang, Shuangyi Dong, Jiaxin Li, Yifei Guo, Zan Wang, Wei Liang

机构 * School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

AI总结 提出FloVerse任务统一PointNav、ObjectNav和ImageNav,构建FloVerse-1.6K数据集,并设计ThreeDiff两阶段模仿学习策略,利用楼层平面图先验提升导航性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20734 2026-06-15 cs.CL cs.AI cs.CV cs.IR cs.LG 版本更新 75%

UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities

UniversalRAG: 在多样模态和粒度的语料库上实现检索增强生成

Woongyeong Yeo, Kangsan Kim, Soyeong Jeong, Jinheon Baek, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 多模态生成 :any-to-any(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出UniversalRAG,一种能够处理多种模态和粒度的检索增强生成框架,通过动态路由机制和多粒度组织,提升跨模态知识检索的有效性,实验表明其在多个模态基准上的优越性。

Comments ACL 2026. Project page : https://universalrag.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14072 2026-06-15 cs.CV cs.CL 新提交 73%

Diffusion-Refined Segmentation and Vision-Language Interpretation for Pediatric Brain Tumor MRI

扩散细化分割与视觉-语言解释用于儿童脑肿瘤MRI

Wentao Ke, Jianche Liu

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) School of Medicine, Stanford University(斯坦福大学医学院)

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出两阶段框架,先用Swin-UNETR粗分割,再用条件扩散模型细化边界,最后结合多模态语言模型生成结构化报告,提升儿童脑肿瘤分割精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13679 2026-06-15 cs.CV 新提交 70%

InterleaveThinker: Reinforcing Agentic Interleaved Generation

InterleaveThinker: 强化智能体交错生成

Dian Zheng, Harry Lee, Manyuan Zhang, Kaituo Feng, Zoey Guo, Ray Zhang, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Meituan(美团) CUHK IMIXR(香港中文大学IMIXR实验室)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出首个多智能体管线InterleaveThinker,通过规划器和评论家智能体使现有图像生成器具备交错生成能力,并利用GRPO强化单步指令修正,显著提升生成性能。

Comments Project Page: https://zhengdian1.github.io/InterleaveThinker-proj/ Code: https://github.com/zhengdian1/InterleaveThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14176 2026-06-15 cs.AI 新提交 57%

VeriGeo: Controllable Geometry Question Generation with Numerical and Analytical Verification

VeriGeo: 可控几何问题生成与数值和分析验证

Xiaoxian Duan, Zequn Liu, Yingce Xia

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出VeriGeo框架,通过可执行推理轨迹和三级验证流水线,实现用户约束下的可控几何问题生成,并利用验证引导的反思修复无效生成,提升数据可靠性。

Comments 32 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02320 2026-06-15 cs.CL 版本更新 57%

TVIR: Building Deep Research Agents Towards Text-Visual Interleaved Report Generation

TVIR:构建面向文本-视觉交错报告生成的深度研究智能体

Xinkai Ma, Zhiqi Bai, Dingling Zhang, Pei Liu, Yishuo Yuan, He Zhu, Jiakai Wang, Qianqian Xie, Yifan Zhao, Xinlong Yang, Hao Cong, Zhiheng Yao, Fengxia Xie, Zihao Xu, Haoran Xu, Zhaohui Wang, Minghao Liu, Shirong Lin, Yingshui Tan, Yuchi Xu, Wenbo Su, Zhaoxiang Zhang, Bo Zheng, Jiaheng Liu

机构 * Nanjing University Alibaba Group(南京大学阿里集团)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 提出TVIR基准和层次化多智能体框架,解决深度研究报告中视觉元素的事实可靠性与对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14255 2026-06-15 cs.RO 新提交 50%

ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation

ReactVLA: 通过改进的平均流动作生成实现快速轻量级反应式机器人操作

Yanzhao Guo, Wenkai Chen, Jianwei Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Technical Aspects of Multimodal Systems (TAMS), Department of Informatics, Universität Hamburg(汉堡大学信息学系多模态系统技术方面(TAMS))

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出ReactVLA框架,结合改进的平均流动作生成器和注意力残差机制,实现轻量低延迟的实时机器人操作,在模拟和真实任务中性能提升达1.65倍,推理速度提升4倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14032 2026-06-15 cs.RO 新提交 50%

From Attacks to Curricula: Learnability-Guided Adversarial Training for Safe Autonomous Driving

从攻击到课程:面向安全自动驾驶的可学习性引导对抗训练

Yuewen Mei, Tong Nie, Jie Sun, Haotian Shi, Wei Ma, Jian Sun

机构 * College of Transportation & Key Laboratory of Road and Traffic Engineering of Ministry of Education, Tongji University(同济大学交通运输工程学院 & 道路与交通工程教育部重点实验室) Department of Civil and Environmental Engineering, The Hong Kong Polytechnic University(香港理工大学土木与环境工程学系)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出AlignADV框架,通过偏好对齐生成可解决场景,并利用行为指纹预测策略能力,动态采样课程以提升自动驾驶对抗训练的收敛效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 12 篇

2512.02318 2026-06-15 cs.CR cs.AI 版本更新 89%

COGNITION: From Evaluation to Defense against Multimodal LLM CAPTCHA Solvers

认知:从评估到对抗多模态大语言模型CAPTCHA求解器

Junyu Wang, Changjia Zhu, Yuanbo Zhou, Lingyao Li, Xu He, Mingkui Wei, Junjie Xiong

机构 * Missouri University of Science and Technology(密苏里科技大学) University of South Florida(佛罗里达州立大学) Visa Inc.(Visa公司) George Mason University(乔治·马歇尔大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.AI

AI总结 本文研究多模态大语言模型如何削弱视觉CAPTCHA的安全性,评估7种主流MLLM在18种CAPTCHA任务中的表现,揭示其解决能力及防御策略。

Comments Accepted by USENIX Sec'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14697 2026-06-15 cs.CV cs.AI cs.CL 新提交 87%

ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning

ClinHallu: 用于诊断医学多模态大语言模型推理中阶段式幻觉的基准

Sicheng Yang, Hangjie Yuan, Wenjun Zhang, Jinwang Wang, Yichen Qian, Weihua Chen, Fan Wang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出ClinHallu基准,包含7031个实例,每个实例带有结构化推理轨迹(视觉识别、知识回忆、推理整合),通过阶段替换干预和轨迹监督微调,实现细粒度幻觉诊断与缓解。

Comments Code and datasets: https://github.com/alibaba-damo-academy/ClinHallu

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14562 2026-06-15 cs.CV cs.LG 新提交 79%

NEST3D: A High-Resolution Multimodal Dataset of Sociable Weaver Tree Nests

NEST3D:织布鸟树巢的高分辨率多模态数据集

Constanza A. Molina Catricheo, Simon Boeder, Ting-Jia Guo, Giacomo May, Clément Berthelot, Devis Tuia, Friedrich Fedor Reinhard, Fabio Remondino, Benjamin Risse

机构 * Institute for Geoinformatics (ifgi), University of Münster(明斯特大学地理信息学研究所) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) University of Konstanz(康斯坦茨大学) Kuzikus Research Station(库兹库斯研究站) Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对织布鸟巢缺乏精细3D结构数据的问题,提出包含104棵巢树、1.4TB多模态无人机数据集,并基准测试语义分割方法,PT-v3达86.35% mIoU。

Comments 14 pages, 4 figures. Dataset available at https://huggingface.co/NEST3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00336 2026-06-15 cs.CV 版本更新 79%

MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection

MVAD:多模态AI生成视频-音频检测基准数据集

Mengxue Hu, Yunfeng Diao, Changtao Miao, Tairui Ge, Taize Ge, Zhiqing Guo, Jianshu Li, Zhe Li, Zhongjie Ba, Joey Tianyi Zhou

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有数据集缺乏多模态真实性的问题,提出MVAD数据集,包含三种伪造模式、高质量样本及多样化的视觉风格和内容类别,用于检测AI生成的视频-音频内容。

Comments 10 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14251 2026-06-15 cs.CV 新提交 74%

HiST: A Hierarchical Sparse Transformer for Cross-Modal Spatial Transcriptomics Modeling

HiST:用于跨模态空间转录组建模的分层稀疏Transformer

Weiyi Wu, Xinwen Xu, Xingjian Diao, Siting Li, Zhi Wei, Alma Andersson, Jiang Gui

机构 * New Jersey Institute of Technology(新泽西理工学院) Stevens Institute of Technology(史蒂文斯理工学院) Karolinska Institutet(卡罗林斯卡学院) Dartmouth College(达特茅斯学院)

专题命中 多模态评测 :cross-modal(title);分类 cs.CV

AI总结 提出HiST,一种分层稀疏Transformer,通过稀疏窗口注意力和分辨率变换算子实现高效的多尺度空间转录组推断,显著降低计算开销并提升预测性能。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏