arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-03 至 2026-04-03 共收录 76 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2603.25040 2026-04-03 cs.LG cs.CL cs.CV 90%

Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale

Intern-S1-Pro:万亿参数科学多模态基础模型

Yicheng Zou, Dongsheng Zhu, Lin Zhu, Tong Zhu, Yunhua Zhou, Peiheng Zhou, Xinyu Zhou, Dongzhan Zhou, Zhiwang Zhou, Yuhao Zhou, Bowen Zhou, Zhanping Zhong, Zhijie Zhong, Haiteng Zhao, Penghao Zhao, Xiaomeng Zhao, Zhiyuan Zhao, Yechen Zhang, Jin Zhang, Wenwei Zhang, Hongjie Zhang, Zhuo Zhang, Wenlong Zhang, Bo Zhang, Chao Zhang, Chen Zhang, Yuhang Zang, Fei Yuan, Jiakang Yuan, Jiashuo Yu, Jinhui Yin, Haochen Ye, Qian Yao, Bowen Yang, Danni Yang, Kaichen Yang, Ziang Yan, Jun Xu, Yicheng Xu, Wanghan Xu, Xuenan Xu, Chao Xu, Ruiliang Xu, Shuhao Xing, Long Xing, Xinchen Xie, Ling-I Wu, Zijian Wu, Zhenyu Wu, Lijun Wu, Yue Wu, Jianyu Wu, Wen Wu, Fan Wu, Xilin Wei, Qi Wei, Bingli Wang, Rui Wang, Ziyi Wang, Zun Wang, Yi Wang, Haomin Wang, Yizhou Wang, Lintao Wang, Yiheng Wang, Longjiang Wang, Bin Wang, Jian Tong, Zhongbo Tian, Huanze Tang, Chen Tang, Shixiang Tang, Yu Sun, Qiushi Sun, Xuerui Su, Qisheng Su, Chenlin Su, Demin Song, Jin Shi, Fukai Shang, Yuchen Ren, Pengli Ren, Xiaoye Qu, Yuan Qu, Jiantao Qiu, Yu Qiao, Biqing Qi, Runyu Peng, Tianshuo Peng, Jiahui Peng, Qizhi Pei, Zhuoshi Pan, Linke Ouyang, Wenchang Ning, Yichuan Ma, Zerun Ma, Ningsheng Ma, Runyuan Ma, Chengqi Lyu, Haijun Lv, Han Lv, Lindong Lu, Kuikun Liu, Jiangning Liu, Yuhong Liu, Kai Liu, Hongwei Liu, Zhoumianze Liu, Mengjie Liu, Ziyu Liu, Wenran Liu, Yang Liu, Liwei Liu, Kaiwen Liu, Junyao Lin, Junming Lin, Tianyang Lin, Dahua Lin, Jianze Liang, Linyang Li, Peiji Li, Zonglin Li, Zehao Li, Pengze Li, Guoyan Li, Lingkai Kong, Linglin Jing, Zhenjiang Jin, Feifei Jiang, Qian Jiang, Junhao Huang, Zixian Huang, Haian Huang, Zhouqi Hua, Ermo Hua, Han Hu, Linfeng Hou, Yinan He, Conghui He, Tianyao He, Xu Guo, Qipeng Guo, Aijia Guo, Yuzhe Gu, Lixin Gu, Jingyang Gong, Qiming Ge, Jiaye Ge, Songyang Gao, Jianfei Gao, Xinyu Fang, Caihua fan, Yue Fan, Yanhui Duan, Zichen Ding, Shengyuan Ding, Ning Ding, Xuanlang Dai, Erfei Cui, Ganqu Cui, Pei Chu, Tao Chu, Guangran Cheng, Yu Cheng, Kai Chen, Yongkang Chen, Chiyu Chen, Guanzhou Chen, Qiaosheng Chen, Sitao Chen, Xin Chen, Haojiong Chen, Yicheng Chen, Weihan Cao, Yuhang Cao, Qinglong Cao, Lei Bai

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 Intern-S1-Pro是首个万亿参数科学多模态基础模型,具备跨通用与科学领域的能力提升,融合强推理、图像-文本理解及先进代理能力,专精于100余项科学任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01251 2026-04-03 cs.CV eess.IV 83%

Camouflage-aware Image-Text Retrieval via Expert Collaboration

通过专家协作实现伪装意识的图像-文本检索

Yao Jiang, Zhongkuan Mao, Xuan Wu, Keren Fu, Qijun Zhao

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) National Key Lab of Fundamental Science on Synthetic Vision, Sichuan University(四川大学视觉合成图形图像技术国家级重点实验室)

专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出伪装意识图像-文本检索任务,构建了CamoIT数据集,并提出CECNet网络,通过双分支编码器和C²GA机制提升检索性能,实验表明在七种模型中取得29%的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01749 2026-04-03 cs.CV 79%

Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding

超声-CLIP:面向超声图像-文本理解的语义感知对比预训练

Jiayun Jin, Haolong Chai, Xueying Huang, Xiaoqing Guo, Zengwei Zheng, Zhan Zhou, Junmei Wang, Xinyu Wang, Jie Liu, Binbin Zhou

机构 * Hangzhou City University(杭州城市大学) Hong Kong Baptist University(香港浸会大学) Zhejiang University(浙江大学) The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院) City University of Hong Kong(香港城市大学)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

AI总结 本文提出超声-CLIP,通过构建US-365K数据集和UDT知识框架,引入语义软标签和损失函数,提升超声图像与文本的语义对比学习效果,实现分类和检索的SOTA性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01987 2026-04-03 cs.CV cs.LG 57%

Curia-2: Scaling Self-Supervised Learning for Radiology Foundation Models

Curia-2:用于放射学基础模型的自监督学习扩展

Antoine Saporta, Baptiste Callard, Corentin Dancette, Julien Khlaut, Charles Corbière, Leo Butsanets, Amaury Prat, Pierre Manceron

机构 * Raidium Department of Vascular and Oncological Interventional Radiology, Hôpital Européen Georges Pompidou, AP-HP, Paris, France(巴黎欧洲乔治·蓬皮杜医院血管与肿瘤介入放射科,AP-HP) Faculté de Santé, Université Paris-Cité, Paris, France(巴黎西岱大学健康学院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 Curia-2通过改进预训练策略和表征质量,提升了放射学数据的捕捉能力,首次实现了多模态CT和MRI基础模型的亿参数视觉变换器架构,并在两个新评估轨道中验证了其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01915 2026-04-03 cs.CV 57%

Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts

通过知识引导的空间提示增强医学视觉 grounding

Yifan Gao, Tao Zhou, Yi Zhou, Ke Zou, Yizhe Zhang, Huazhu Fu

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Yong Yoo Lin School of Medicine, National University of Singapore(新加坡国立大学杨潞龄医学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出KnowMVG框架,通过知识增强提示和全局局部注意力机制提升医学视觉 grounding的精度,实验显示在四个基准上优于现有方法。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12957 2026-04-03 cs.CV 57%

Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation

通过语义引导的奖励崩溃缓解实现自适应的开放性医疗推理

Yizhou Liu, Dingkang Yang, Zizhi Chen, Minghao Han, Xukun Zhang, Keliang Liu, Jingwei Wei, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲斯克智能科技有限公司(菲斯克AI)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ARMed框架,通过监督微调和强化优化提升开放性医疗VQA的推理一致性和事实准确性,实验表明其在六个医疗VQA基准上显著提升准确性和泛化能力。

Comments Accept to 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2510.11579 2026-04-03 cs.CV cs.LG 79%

MS-Mix: Sentiment-Guided Adaptive Augmentation for Multimodal Sentiment Analysis

MS-Mix:基于情感的自适应增强用于多模态情感分析

Hongyu Zhu, Lin Chen, Xin Jin, Mingsheng Shang

机构 * Chongqing Institute of Green Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究院) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院) School of Engineering, Westlake University(西湖大学工学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MS-Mix,一种基于情感的自适应增强框架,通过情感感知的样本选择策略、情感强度引导模块和情感对齐损失提升多模态情感分析的鲁棒性和实用性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 18 篇

2504.10739 2026-04-03 cs.MM eess.IV 83%

HippoMM: Hippocampal-inspired Multimodal Memory for Long Audiovisual Event Understanding

HippoMM:基于海马体的多模态记忆用于长音频视频事件理解

Yueqian Lin, Jingyang Zhang, Qinsi Wang, Hancheng Ye, Yuzhe Fu, Yudong Liu, Hai "Helen" Li, Yiran Chen

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 HippoMM通过整合事件分割、记忆巩固和分层记忆检索,实现长音频视频事件理解,达到78.2%的准确率,比基线模型快5倍。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11147 2026-04-03 cs.MM cs.CV cs.LG 82%

Catalogue Grounded Multimodal Attribution for Museum Video under Resource and Regulatory Constraints

博物馆视频下的资源与监管约束下的目录引导多模态归因

Minsak Nanang, Adrian Hilton, Armin Mustafa

机构 * University of Surrey(萨里大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出一种目录引导的多模态归因方法,用于博物馆视频内容的自动化元数据生成,以提高档案馆发现性并满足资源和监管要求。

Comments Demo video url: https://jn00767.pages.surrey.ac.uk/catalogue-grounded-multimodal-attribution-for-museum-video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06763 2026-04-03 cs.CV cs.AI 81%

SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding

SafePLUG: 通过像素级洞察和时间锚定赋能多模态大语言模型以理解交通事故

Zihao Sheng, Zilin Huang, Yansong Qu, Jiancong Chen, Yuhao Luo, Yen-Jung Chen, Yue Leng, Sikai Chen

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) Google(谷歌)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SafePLUG框架,通过像素级理解和时间锚定提升多模态大语言模型在交通事故分析中的能力,引入新数据集并实现区域问答、像素分割、时间事件定位等任务的高性能表现。

Comments The code, dataset, and model checkpoints will be made publicly available at: https://zihaosheng.github.io/SafePLUG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02248 2026-04-03 stat.ML cs.LG 78%

BVFLMSP : Bayesian Vertical Federated Learning for Multimodal Survival with Privacy

BVFLMSP:基于贝叶斯垂直联邦学习的多模态生存预测

Abhilash Kar, Basisth Saha, Tanmay Sen, Biswabrata Pradhan

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出BVFLMSP框架,通过贝叶斯神经网络处理多模态数据,实现隐私保护下的生存预测,提升预测可靠性并提供不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01659 2026-04-03 cs.RO 78%

AURA: Multimodal Shared Autonomy for Real-World Urban Navigation

AURA:多模态共享自主控制用于真实世界城市导航

Yukai Ma, Honglin He, Selina Song, Wayne Wu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学)

专题命中 视频多模态 :multimodal(title);multi-modal(abstract)

AI总结 AURA通过将城市导航分解为高层人类指令和低层AI控制,减少人工操作负担,提升导航稳定性,并在真实世界中实现44%的接管减少。

Comments 17 pages, 18 figures, 4 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02093 2026-04-03 cs.CV 74%

GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding

GroundVTS:多模态大语言模型中的视频时间定位视觉标记采样

Rong Fan, Kaiyan Xiao, Minghao Zhu, Liuyi Wang, Kai Dai, Zhao Yang

机构 * Newcapec AI Research(新开普人工智能研究院) Fudan University(复旦大学) Tongji University(同济大学)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 本文提出GroundVTS,通过细粒度查询引导机制筛选视觉标记,提升视频时间定位的时空信息保留与时间连贯性,实验表明其在三个标准基准上优于现有方法。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01712 2026-04-03 cs.LG cs.AI eess.SP physics.comp-ph 74%

Transformer self-attention encoder-decoder with multimodal deep learning for response time series forecasting and digital twin support in wind structural health monitoring

基于多模态深度学习的Transformer自注意力编码器-解码器:用于响应时间序列预测和风力结构健康监测的数字孪生支持

Feiyu Zhou, Marios Impraimakis

机构 * Department of Mechanical Engineering, University of Bath(巴斯大学机械工程系) Department of Civil Engineering, Zhejiang University(浙江大学土木工程系)

专题命中 视频多模态 :multimodal(title);分类 cs.AI

AI总结 本文提出一种基于Transformer的多模态深度学习方法,用于风力结构响应时间序列预测和数字孪生支持,通过捕捉系统时间特性提升结构健康监测的准确性与鲁棒性。

Comments 21 pages, 22 figures, 9 tables. This version corresponds to the published article in Computers & Structures. https://doi.org/10.1016/j.compstruc.2026.108216

Journal ref Computers and Structures 326 (2026) 108216

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02640 2026-04-03 cs.CY 71%

The First Mass Protest on Threads: Multimodal Mobilization and AI-Generated Visuals in Taiwan's Bluebird Movement

台湾蓝鸟运动中的首次大规模抗议:多模态动员与AI生成视觉内容

Tracy Weener, Ho-Chun Herbert Chang

专题命中 视频多模态 :multimodal(title)

AI总结 本文分析台湾2024年蓝鸟运动中文本与视觉信息的传播动态,揭示算法曝光与用户支持的不对称性及AI生成图像在抗议中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01966 2026-04-03 cs.CV cs.AI cs.RO 62%

Ego-Grounding for Personalized Question-Answering in Egocentric Videos

面向第一视角视频的个性化问答中的自我定位

Junbin Xiao, Shenglang Zhang, Pengxiang Zhu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MyEgo数据集,用于评估多模态大语言模型在需要自我定位的个性化问答中的能力,发现现有模型在自我记忆和推理方面存在显著不足。

Comments To appear at CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01881 2026-04-03 cs.CV cs.CL 62%

HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models

HieraVid:用于快速视频大语言模型的分层令牌修剪

Yansong Guo, Chaoyang Zhu, Jiayi Ji, Jianghang Lin, Liujuan Cao

机构 * Xiamen University(厦门大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 HieraVid通过分层修剪框架减少视频令牌冗余,提升视频大语言模型的效率,在保留性能的同时实现30%的令牌保留率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01766 2026-04-03 cs.CV cs.AI 62%

FSKD: Monocular Forest Structure Inference via LiDAR-to-RGBI Knowledge Distillation

FSKD:通过LiDAR到RGBI知识蒸馏推断单目森林结构

Taimur Khan, Hannes Feilhauer, Muhammad Jazib Zafar

机构 * Helmholtz Centre for Environmental Research – UFZ(亥姆霍兹环境研究中心) Leipzig University(莱比锡大学) Georg-August University of Göttingen(哥廷根大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FSKD框架,利用多模态教师模型融合RGBI影像与LiDAR衍生的平面指标和垂直剖面,通过交叉注意力机制,使RGBI-only的SegFormer学生模型在零样本情况下实现最先进的CHM性能,同时预测PAI和FHD等多指标。

Comments Paper in-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01569 2026-04-03 cs.CV cs.MM 62%

VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification

VideoZeroBench: 通过时空证据验证探测视频多模态大语言模型的极限

Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao Wang, Renrui Zhang, Yunhai Tong, Haodong Duan

机构 * PKU(北京大学) WHU(武汉大学) CASIA(中国科学院自动化研究所) BJTU(北京交通大学) CUHK(香港中文大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 VideoZeroBench通过严格验证时空证据,揭示视频多模态大语言模型在长视频问答中的不足,发现即使在标准设置下,模型正确率也低于17%,且在严格约束下性能显著下降,凸显了基于证据的视频理解仍是瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02211 2026-04-03 cs.IR cs.AI cs.MA 57%

Multi-Agent Video Recommenders: Evolution, Patterns, and Open Challenges

多智能体视频推荐系统:演进、模式与开放挑战

Srivaths Ranganathan, Abhishek Dharmaratnakar, Anushree Sinha, Debanshu Das

机构 * Google LLC(谷歌公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨多智能体视频推荐系统的演进、协作模式及挑战,分析了从早期MARL到LLM驱动架构的发展,并提出可扩展性、多模态理解等开放问题。

Comments Accepted for publication in The Nineteenth ACM International Conference on Web Search and Data Mining (WSDM Companion 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01900 2026-04-03 cs.CV 57%

FTPFusion: Frequency-Aware Infrared and Visible Video Fusion with Temporal Perturbation

FTPFusion:基于时序扰动的频率感知红外与可见视频融合

Xilai Li, Chusheng Fang, Xiaosong Li

机构 * Foshan University(佛山大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出FTPFusion方法,通过时序扰动和稀疏跨模态交互实现红外与可见视频融合,提升时序稳定性和空间细节保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01882 2026-04-03 cs.CV 57%

A3R: Agentic Affordance Reasoning via Cross-Dimensional Evidence in 3D Gaussian Scenes

A3R: 通过跨维度证据进行3D高斯场景中的代理 affordance 推理

Di Li, Jie Feng, Guanbin Li, Ronghua Shang, Yuhui Zheng, Weisheng Dong, Guangming Shi

机构 * Xidian University(西安电子科技大学) Sun Yat-sen University(中山大学) Qinghai Normal University(青海师范大学)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 本文提出A3R框架,通过跨维度证据获取提升复杂3D高斯场景中细粒度affordance推理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01678 2026-04-03 cs.CV 57%

Director: Instance-aware Gaussian Splatting for Dynamic Scene Modeling and Understanding

Director: 用于动态场景建模与理解的实例感知高斯点云

Yuheng Jiang, Yiwen Cai, Zihao Wang, Yize Wu, Sicheng Li, Zhuo Su, Shaohui Jiao, Lan Xu

机构 * ShanghaiTech University(上海科技大学) ByteDance(字节跳动)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Director通过联合建模人类性能、高保真渲染和实例级语义,实现动态场景的时空高斯表示,提升动态场景理解的稳定性与准确性。

Comments Project page: https://caiyw2023.github.io/Director/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21681 2026-04-03 cs.CV 57%

Seeing without Pixels: Perception from Camera Trajectories

无需像素的感知:从相机轨迹进行感知

Zihui Xue, Kristen Grauman, Dima Damen, Andrew Zisserman, Tengda Han

机构 * Google DeepMind(谷歌DeepMind) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文探讨通过相机轨迹而非像素感知视频内容的可能性,提出CamFormer框架,证明轨迹信息能有效用于视频内容理解及多种下游任务。

Comments Accepted by CVPR 2026, Project website: https://sites.google.com/view/seeing-without-pixels

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01860 2026-04-03 cs.RO 50%

Posterior Optimization with Clipped Objective for Bridging Efficiency and Stability in Generative Policy Learning

后验优化与截断目标:在生成策略学习中平衡效率与稳定性

Yuhui Chen, Haoran Li, Zhennan Jiang, Yuxing Qin, Yuxuan Wan, Weiheng Liu, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CFCS, School of Computer Science, Peking University(北京大学计算机学院前沿计算研究中心) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出POCO框架,通过后验推断方法改进策略,结合离线到在线范式,提升生成模型在机器人操控中的稳定性和效率,实验证明其在多个任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 7 篇

2604.01247 2026-04-03 cs.SD eess.AS 79%

Combining Masked Language Modeling and Cross-Modal Contrastive Learning for Prosody-Aware TTS

结合掩码语言建模与跨模态对比学习的语调感知语音合成

Kirill Borodin, Vasiliy Kudryavtsev, Maxim Maslov, Nikita Vasiliev, Mikhail Gorodnichev, Grach Mkrtchian

机构 * MTUCI(莫斯科电信与信息技术大学)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 eess.AS

AI总结 本文研究了基于扩散模型的语音合成中多阶段预训练对语调建模的影响,通过掩码语言建模与混合音素对比学习相结合,提升了生成质量与感知指标。

Comments This paper has been submitted to Interspeech 2026 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29376 2026-04-03 cs.CV 79%

Assessing Multimodal Chronic Wound Embeddings with Expert Triplet Agreement

基于专家三元组一致性的多模态慢性伤口嵌入评估

Fabian Kabus, Julia Hindel, Jelena Bratulić, Meropi Karakioulaki, Ayush Gupta, Cristina Has, Thomas Brox, Abhinav Valada, Harald Binder

机构 * Institute of Medical Biometry and Statistics (IMBI), Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学院与医学中心医学统计与生物统计研究所) Department of Computer Science, Faculty of Engineering, University of Freiburg(弗莱堡大学工程学院计算机科学系) Department of Dermatology, Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学院与医学中心皮肤科)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出通过专家三元组比较评估嵌入空间,引入TriDerm框架整合图像、边界掩码和专家报告,融合视觉与文本模态提升专家一致性至73.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03380 2026-04-03 cs.CV 79%

Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization

通过链看穿:通过CoT压缩和对比偏好优化缓解多模态推理模型的幻觉

Hao Fang, Jinyu Li, Jiawei Kong, Tianqu Zhuang, Kuofeng Gao, Bin Chen, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出C3PO框架,通过CoT压缩和对比偏好优化缓解多模态推理模型的幻觉问题,通过过滤冗余思考 token 提升信号效率,并利用高质量反馈和定制诱导器增强对比学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06393 2026-04-03 cs.IR 78%

MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model

MuCo:多轮对比学习用于多模态嵌入模型

Geonmo Gu, Byeongho Heo, Jaemyung Yu, Jaehui Hwang, Taekyung Kim, Sangmin Lee, HeeJae Jun, Yoohoon Kang, Sangdoo Yun, Dongyoon Han

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出MuCo,一种基于对话的多轮对比学习框架,通过多轮查询-目标对提升多模态嵌入模型的训练效率和表征一致性。

Comments CVPR 2026 camera-ready; 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18123 2026-04-03 cs.CV cs.AI cs.CL cs.LG 67%

Bias Is a Subspace, Not a Coordinate: A Geometric Rethinking of Post-hoc Debiasing in Vision-Language Models

偏差是子空间,而非坐标:视觉-语言模型中事后去偏的几何重思

Dachuan Zhao, Weiyue Li, Zhenda Shen, Yushu Qiu, Bowen Xu, Haoyu Chen, Yongchao Chen

机构 * Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出SPD框架,通过几何方法识别并去除线性可解码的偏子空间,提升视觉-语言模型的公平性与任务性能。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏