arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-23 至 2026-06-23 共收录 145 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 14 篇

2606.23206 2026-06-23 cs.CV cs.CL 新提交 84%

CFPO: Counterfactual Policy Optimization for Multimodal Reasoning

CFPO:用于多模态推理的反事实策略优化

Zhangyuan Yu, Wanran Sun, Guangjing Yang, Xiaohu Wu, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出反事实策略优化框架,通过跨模态反事实增强机制强制视觉与文本推理的因果一致性,显著提升多模态推理的准确性。

Comments Accepted to ICML 2026. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22339 2026-06-23 cs.CV 新提交 83%

T-IMPACT: A Severity-Aware Benchmark for Contextual Image-Text Manipulation

T-IMPACT:面向上下文图像-文本操纵的严重性感知基准

Gagandeep Singh, Aaditya Yadav, Priyanka Singh

机构 * The University of Queensland(昆士兰大学)

专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出T-IMPACT基准,包含98,786个图像-文本对,涵盖原始、仅图像、仅文本和联合操纵,通过校准的连续严重性分数和粗粒度标签评估操纵对上下文理解的影响,实验表明现有模型在严重性预测上仍远弱于人类判断。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21197 2026-06-23 cs.CV cs.AI cs.LG 新提交 81%

Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders

通过稀疏自编码器提取和分析视觉语言模型中的多模态概念

Sergio Lanza, Jae Hee Lee, Stefan Wermter

机构 * Knowledge Technology, Department of Informatics, University of Hamburg(汉堡大学信息学系知识技术实验室)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出基于稀疏自编码器的框架,从视觉语言模型中提取视觉、文本和多模态概念,通过余弦相似度评估概念与样本的对齐,在VQA数据集上提升视觉概念质量达45%。

Comments International Conference on Artificial Neural Networks (ICANN), 2026, Padua

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20873 2026-06-23 cs.CL 新提交 79%

SciLens: Multi-modal Scientific Claim Verification with Agentic Entailment and Grounding

SciLens: 多模态科学声明验证的智能蕴含与归因框架

Yueming Wang, Tianshi Zheng, Jiaxin Bai, Yangqiu Song, Ginny Wong, Simon See

机构 * The Hong Kong University of Science and Technology(香港科技大学) Hong Kong Baptist University(香港浸会大学) NVIDIA AI Technology Center(英伟达人工智能技术中心)

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.CL

AI总结 提出SciLens框架,通过将声明分解为原子命题并归因到表格/图表证据,实现多模态科学声明验证,在SciClaimEval上达到79.2%宏F1和63.1%配对准确率。

Comments KDD 2026 SciSoc Agents & LLMs (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20722 2026-06-23 cs.GR cs.CL cs.CV cs.LG 新提交 76%

Multimodal Image Colorization: Quantifying the Impact of Text-Conditioned Guidance on Grayscale-to-Color Translation

多模态图像着色:量化文本条件引导对灰度到彩色转换的影响

Colten Reissmann, Hugo Garrido-Lestache Belinchon

机构 * Department of Computer Science and Software Engineering(计算机科学与软件工程系)

专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL

AI总结 本文通过U-Net和Stable Diffusion 1.5两种架构,量化了CLIP文本条件对灰度图像着色质量的影响,发现文本条件显著提升了PSNR、SSIM和色彩度,降低了LPIPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22543 2026-06-23 cs.CV 新提交 70%

MAPS: Multi-Anchor Projection Similarity for Joint Vision-Language Geo-Localization

MAPS: 多锚点投影相似性用于联合视觉-语言地理定位

Yutong Hu, Siyuan Tan, Shaocheng Yan, Pengcheng Shi, Qingwu Hu, Jiayuan Li

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出多锚点投影相似性(MAPS)度量,将联合图像-文本查询的地理定位建模为多锚点几何对齐问题,通过目标特征在查询锚平面上的投影长度衡量相似性,并引入基于MAPS的对比损失,实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21194 2026-06-23 cs.CV cs.AI cs.CL 新提交 67%

MEDLAYXPLAIN: Benchmarking the Expert-Lay Gap in Medical Vision-Language Models

MEDLAYXPLAIN: 医学视觉语言模型中的专家-外行差距基准测试

Han Jang, Junhyeok Lee, Songsoo Kim, Chae Young Lim, Hyeonjin Goh, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔大学) Seoul National University Hospital(首尔大学医院) Seoul National University College of Medicine(首尔大学医学院) Sungkyunkwan University School of Medicine(成均馆大学医学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出首个大规模医学外行语言生成基准MedLayXPlain,包含12万+区域级样本和三层UMLS本体,通过HOVER管道构建外行描述,并引入轻量级评估器MedLayEval,揭示当前医学VLM在外行可读性与临床精度间的系统性差距。

Comments 40 pages (10 pages main text, 30 pages appendix), 4 main figures, 33 vision-language models benchmarked

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17710 2026-06-23 cs.CV cs.AI cs.CL cs.LG 新提交 67%

Vision-language models for chest radiography do not always need the image

胸部X光片的视觉-语言模型并不总是需要图像

Mahshad Lotfinia, Sebastian Ziegelmayer, Lisa Adams, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔朗根-纽伦堡大学模式识别实验室) Department of Diagnostic and Interventional Radiology, TUM University Clinic, School of Medicine and Health, Klinikum rechts der Isar, Technical University of Munich(慕尼黑工业大学医学院与健康学院伊萨尔河右岸医院诊断与介入放射学系) Lab for AI in Medicine, RWTH Aachen University(亚琛工业大学医学人工智能实验室) Department of Diagnostic and Interventional Radiology, University Hospital RWTH Aachen(亚琛工业大学医院诊断与介入放射学系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文通过因果审计方法,发现许多医学视觉-语言模型在胸部X光片任务中依赖文本先验而非图像,纯文本模型与多模态模型性能接近,并提出了基于图像依赖性的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21496 2026-06-23 cs.RO cs.AI cs.CV cs.LG 新提交 62%

Decoupling the Declarative from the Procedural in Vision-Language-Action Models

在视觉-语言-动作模型中解耦声明性知识与程序性知识

Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu, Oisin Mac Aodha, Alexandros Kouris

机构 * University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院) Samsung AI Center - Cambridge, UK(三星人工智能中心 - 英国剑桥)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有VLA模型无法解耦声明性与程序性知识导致零样本技能迁移脆弱的问题,提出w$^{2}$VLA模型,通过重构信息流实现模块化、可解释的知识解耦,显著提升对未见物体的零样本技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21419 2026-06-23 cs.CV cs.AI 新提交 62%

MIRCaps: A Large-Scale Mixed-Domain Dataset with Image-Level and Region-Level Captions for Fine-Grained Vision-Language Learning

MIRCaps: 一个大规模混合域数据集,包含图像级和区域级描述,用于细粒度视觉-语言学习

Arlindo Luciano Tulumba Roberto, Hyungjoon Kim

机构 * Changwon National University(昌原国立大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 为解决通用与监控视频领域的混合域图像-描述数据集匮乏问题,构建了包含14万图像、98万图像级描述、174万区域级描述和139万边界框的大规模数据集,通过互补描述类型帮助视觉语言模型学习细粒度视觉属性,并在图像描述和目标检测任务上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20477 2026-06-23 cs.CV cs.CL cs.LG 新提交 62%

Scalable Training of Spatially Grounded 2D Vision-Language Models for Radiology

面向放射学的空间定位2D视觉-语言模型的可扩展训练

Yusuf Salcan, Simon Ging, Robin Tibor Schirrmeister, Philipp Arnold, Elmar Kotter, Behzad Bozorgtabar, Thomas Brox

机构 * Computer Vision Group, University of Freiburg, Germany(德国弗莱堡大学计算机视觉组) Department of Radiology, Medical Center -- University of Freiburg, Germany(德国弗莱堡大学医学中心放射科) CRIION-AI Lab, Freiburg, Germany(德国弗莱堡CRIION-AI实验室)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 提出RefRad2D大规模双语数据集,通过LLM和自动分割生成空间定位数据,训练RadGrounder模型联合完成报告生成、VQA和空间定位,在外部基准上取得竞争性结果。

Comments Accepted for MICCAI 2026. First two authors: equal contribution. Last two authors: equal supervision

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23204 2026-06-23 cs.CV 新提交 57%

Unmasking LAION-5B: Age, Gender, Race, and Emotion Biases in Large-Scale Image Datasets

揭开LAION-5B的面纱:大规模图像数据集中的年龄、性别、种族和情感偏见

Iris Dominguez-Catena, Daniel Paternain, Mikel Galar

机构 * Institute of Smart Cities (ISC), Department of Statistics, Computer Science and Mathematics(智能城市研究所(ISC),统计、计算机科学与数学系)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本研究利用FairFace、DeepFace和Emo-AffectNet模型分析LAION-5B数据集中的年龄、性别、种族和情感偏见,发现年轻白人男性过度代表,少数族裔和中老年女性不足,以及情感与人口属性的刻板关联。

Comments Published as a paper at 3rd DATA-FM workshop @ ICLR 2026, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22631 2026-06-23 cs.CV 新提交 57%

4DVLT: Dynamic Scene Understanding with Worldline-Centered Vision-Language Tracking

4DVLT:以世界线为中心的视觉-语言跟踪动态场景理解

Chaoyue Li, Boxue Yang, Shengyao Zhou, Haoyang Wu, Rui Qian, Linfeng Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出世界线为中心的4D动态场景理解任务4DVLT及基准Instruct-4D,通过图条件世界线推理方法4DTrack实现指令跟踪,在指标上超越基线19.62点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21915 2026-06-23 cs.CV 新提交 57%

GTA-Net: Cooperative Game Theory for Vision-Language Alignment in Chest X-Ray Report Generation

GTA-Net:合作博弈论在胸部X光报告生成中的视觉-语言对齐

Saif ur Rehman Khan, Imad Ahmed Waqar, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

机构 * Department of Computer Science, Rhineland-Palatinate Technical University of Kaiserslautern-Landau(莱茵兰-普法尔茨凯泽斯劳滕-兰道工业大学计算机科学系) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) IntelligentX GmbH

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出GTA-Net,利用合作博弈论实现图像区域与文本的显式对齐,通过二元和三元对齐器提升胸部X光报告生成的临床一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 10 篇

2606.20970 2026-06-23 cs.CV 新提交 85%

CogniRoute: Learning to Route Social Evidence in Omni-Modal Models

CogniRoute: 在全模态模型中学习路由社会证据

Yifan Shen, Pei Tian, Xinzhuo Li, Bowen Fang, Shujun Xia, Bingxuan Li, Ana Jojic, Wenming Ye, Xu Cao, James Matthew Rehg, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) Google(谷歌)

专题命中 音频语音多模态 :omni-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出CogniRoute框架,通过模式引导的专家混合和路由感知强化学习,解决全模态模型在社会视频问答中证据选择不足的问题,在OmniSocialBench上准确率达59.38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23063 2026-06-23 cs.CV cs.AI 新提交 84%

Attention-Spectrum Regularization for Replay-Free Continual Multimodal LLMs

注意力谱正则化:无回放的连续多模态大语言模型

Chuangxin Zhao, Canran Xiao, Siyuan Ma, Mengyao Lyu, Yanbiao Ma, Jun Xia, Guiguang Ding, Yang Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出注意力谱正则化(ASR),一种无回放的连续学习框架,通过存储技能级交叉注意力原型分布并施加谱正则化约束,有效缓解多模态大语言模型在连续微调中的灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16731 2026-06-23 cs.SD cs.AI cs.HC 新提交 83%

MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild

MuVAP: 面向野外对话轮次预测的多模态多方语音活动投影

Haotian Qi, Gabriel Skantze

机构 * Department of Speech Music and Hearing, KTH Stockholm, Sweden(瑞典皇家理工学院言语、音乐与听觉系)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.AI

AI总结 提出MuVAP框架,通过将声学预测锚定到面部轨迹,实现从单声道音频和单摄像头视角进行说话人感知的轮次预测,并引入角色相对投影和AVCC数据集解决多方建模和因果跟踪问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22299 2026-06-23 cs.CV eess.AS 新提交 81%

Towards Accurate and Robust Surveillance Roadside IVD via Trackletized Audio-Visual Reasoning

面向准确鲁棒的监控路边IVD:基于轨迹化的视听推理

Xiwen Li, Xiaoya Tang, Bodong Zhang, Tolga Tasdizen

机构 * Kahlert School of Computing, University of Utah(犹他大学卡勒特计算学院) Scientific Computing and Imaging Institute, University of Utah(犹他大学科学计算与成像研究所) Department of Electrical and Computer Engineering, University of Utah(犹他大学电气与计算机工程系)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

AI总结 提出TAVR-IVD框架,通过多目标跟踪将车辆检测链接为轨迹,基于轨迹进行视听融合分类,提升信噪比、稳定时间决策、对齐车辆与麦克风空间先验,并在跨域场景下保持高效鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22983 2026-06-23 cs.DC 新提交 78%

LiveServe: Interaction-Aware Serving for Real-Time Omni-Modal LLMs

LiveServe:面向实时全模态大语言模型的交互感知服务系统

Xiangyu Zhi, Peiqi Yin, Sheng Guan, Chenguang Zheng, James Cheng, Xiao Yan

专题命中 音频语音多模态 :omni-modal(title,abstract)

AI总结 提出交互感知服务系统LiveServe,通过感知播放进度、语音活动和打断事件,优化调度与KV缓存管理,降低音频延迟并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21735 2026-06-23 eess.AS cs.SD 新提交 77%

Bridging the Age Gap: Towards Detecting Neural Audio Codec Synthesized Elderly Speech Deepfake

弥合年龄差距:面向检测神经音频编解码器合成的老年语音深度伪造

Orchid Chetia Phukan, Girish, Mohd Mujtaba Akhtar, Chi-Chun Lee

机构 * BIIC Lab, NTHU, Taiwan(国立台湾大学BIIC实验室) UPES, India(印度UPES大学) VBSPU, India(印度VBSPU大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 eess.AS

AI总结 提出老年语音编解码伪造检测(ECFD)任务,发布中英文ECF数据集,发现现有检测器泛化差,利用多模态基础模型融合(BONSAI框架)实现1.66%平均等错误率,建立新基准。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22766 2026-06-23 cs.CV 新提交 70%

READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations

READ:超越所见——基于强化学习的准确连贯音频描述生成

Bo Fang, Xinyao Zhang, Yuxin Song, Hui Zhang, Hang Zhou, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学) Baidu Inc(百度公司) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出首个基于强化学习的音频描述生成框架READ,通过序列级优化和连贯性奖励,显著提升生成准确性与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23243 2026-06-23 cs.LG cs.SD 新提交 50%

Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio

从分散的医疗音频中解锁音频-语言模型的上下文学习

Ran Piao, Tsai-Ning Wang, Martijn den Dekker, Linda Moonen, Hareld Kemps, Yuan Lu, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学) Erasmus MC(伊拉斯姆斯医学中心) Rijnstate Hospital(莱茵州医院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出联邦自上下文学习(FSC)框架,通过无监督聚类构建伪标签片段,结合渐进式三阶段流水线,在联邦医院客户端实现少样本临床音频诊断,准确率达71.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21979 2026-06-23 cs.SD 新提交 50%

Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings

面向开放集说话人属性预测的关键词附加大语言模型嵌入

Byoungjun So, Jaejun Lee, Kyogu Lee

机构 * Department of Intelligence and Information, Seoul National University(首尔大学情报信息学系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔大学人工智能跨学科项目) Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究所)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 提出利用大语言模型嵌入进行开放集说话人属性预测,通过关键词附加策略和top-k负损失,在LibriTTS-P上超越闭集基准并泛化到未见同义词。

Comments This paper has been accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21933 2026-06-23 cs.SD 新提交 50%

ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

ISCSLP 2026 CoT-TTS挑战赛:面向上下文感知文本转语音的思维链推理

Wei Xue, Junlan Feng, Shilei Zhang, Yue Wang, Ruosong Yang, Bei Liu, Liumeng Xue, Sitong Cheng, Jiahao Pan, Weizhen Bian, Boyi Kang, Bin Long

机构 * The Hong Kong University of Science and Technology(香港科技大学) China Mobile(中国移动) Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd., China Mobile(九天人工智能技术(北京)有限公司,中国移动) China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) Nanjing University(南京大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 针对现有可控TTS系统难以自动推断复杂对话场景中说话方式的问题,提出CoT-TTS挑战赛,要求系统从上下文推断说话方式并生成语音,包含文本和音频两个赛道,采用思维链推理和语音波形输出。

Comments 11 pages, ISCSLP 2026 challenge proposal

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 23 篇

2606.23581 2026-06-23 cs.DC cs.AI cs.CV 新提交 81%

Kamera: Unified Position-Invariant Multimodal KV Cache for Training-Free Reuse

Kamera: 统一的位置无关多模态KV缓存,用于免训练复用

Bole Ma, Jan Eitzinger, Harald Koestler, Gerhard Wellein

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Kamera,一种免训练的位置无关KV缓存复用方法,通过低秩条件补丁修复跨块绑定丢失,在MM-NIAH和文档QA上恢复完整精度,显著降低多模态代理的重计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22699 2026-06-23 cs.CV cs.MM 新提交 81%

Catching Lies Without Sending the Video: Privacy-Preserving Multimodal Deception Detection

无需发送视频即可识谎:隐私保护的多模态欺骗检测

Nikita Sharma, Pranav Sara, Karan Singla

机构 * University of California, San Diego(加州大学圣迭戈分校) Case Western Reserve University, Ohio(凯斯西储大学) WhissleAI, USA(WhissleAI(美国))

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 提出Whissle方法,通过设备端提取文本、情感、行为等紧凑摘要,在无需传输原始视频的情况下实现与云端模型相当的欺骗检测性能(AUC 0.741),并揭示先前75%准确率存在说话者泄露问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22043 2026-06-23 cs.AI cs.CV cs.LG 新提交 81%

When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR

视频语言模型何时停止观看?多模态RLVR中视觉捷径的形成与逆转受奖励强度控制

Zekun Xu

机构 * Zekun Xu(徐泽坤)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究多模态强化学习中视觉捷径的形成与逆转机制,发现惩罚强度可控制其出现和消除,且存在关键干预窗口。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23593 2026-06-23 cs.RO cs.CV 新提交 79%

Real-Time Multimodal Activity-Aware Error Detection in Robot-Assisted Surgery

机器人辅助手术中的实时多模态活动感知错误检测

Seyed Hamid Reza Roodabeh, Zongyu Li, Homa Alemzadeh

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出统一框架,利用视频、运动学数据和文本提示等多模态输入,通过活动提示和活动感知视觉嵌入,在JIGSAWS和SAR-RARP50数据集上分别提升F1分数达5%和16.6%。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22870 2026-06-23 cs.CV cs.AI 新提交 79%

VideoLatent: Video-Language Learning via Latent Self-Forcing

VideoLatent: 通过潜在自强制进行视频-语言学习

Zi-Yuan Hu, Zicong Tang, Shijia Huang, Yanyang Li, Michael R. Lyu, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI(微图AI)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出VideoLatent,一种通过潜在自强制训练范式(包括潜在对齐和潜在多样性目标)进行视觉潜在推理的多模态大语言模型,仅依赖标准视频-问答三元组,在14个基准上优于现有模型,并大幅降低训练/推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22171 2026-06-23 cs.LG 新提交 78%

Beyond Time Series: Spatial Reasoning for Epidemic Forecasting via Multimodal Learning

超越时间序列:基于多模态学习的空间推理用于流行病预测

Diana Guadalupe Gomez, Chenwei Wu, Zhiyi Wang, Liyue Shen, Alexander Rodríguez

机构 * University of Michigan(密歇根大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 提出M-SPICE框架,通过注意力机制融合区域级时序数据与空间辅助信号,在COVID-19、流感和ILI预测任务上超越现有基线。

Comments To appear in the Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), AI for Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏