arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-14 至 2026-07-14 共收录 135 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 19 篇

2601.14954 2026-07-14 cs.LG 版本更新 78%

Multimodal rumor detection enhanced by external evidence and forgery features

通过外部证据和伪造特征增强的多模态谣言检测

Han Li, Hua Sun

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出通过外部证据和伪造特征增强的多模态谣言检测模型,利用ResNet34视觉编码器、BERT文本编码器和伪造特征模块,结合双对比学习模块和门控自适应特征缩放融合机制,提升谣言检测性能。

Comments 20pages,10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11581 2026-07-14 cs.CV 新提交 77%

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位

Xin Zhang, Haochen Wang, Yikang Zhou, Jason Li, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型的区域理解与定位问题,提出循环组相对策略优化框架CycleGRPO,利用任务对偶性构建自我评估范式,仅需区域输入,通过质量感知奖励评估字幕,在多基准测试中提升能力,为推进MLLMs像素级能力提供新途径。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09749 2026-07-14 eess.SP cs.AI cs.LG 新提交 70%

MorphologyFM: A Foundation Model for Morphology-Aware Representation Learning from ECG and Pulse Oximetry Waveforms

MorphologyFM:一种用于从心电图和脉搏血氧波形中进行形态感知表示学习的基础模型

Saiyang Feng, Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 研究针对现有生理波形方法未保留临床意义波形形态的问题,提出多模态基础模型MorphologyFM,通过形态感知自监督学习目标预训练,结合多种技术学习相关表示,在多下游任务中表现优于其他方法,证明联合建模更具可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10762 2026-07-14 cs.CV cs.LG cs.RO 新提交 57%

TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation

TOLiD:通过用于蒸馏的令牌提升弥合视觉基础模型与激光雷达预训练之间的架构差距

Sutharsan Mahendran, Darshana Priyasad, Kaushik Roy, Tharindu Fernando, Sridha Sridharan, Clinton Fookes, Peyman Moghadam

机构 * SAIVT Group, School of Electrical Engineering and Robotics, Queensland University of Technology(澳大利亚昆士兰科技大学电气工程与机器人学院SAIVT组) CSIRO Robotics, CSIRO(澳大利亚联邦科学与工业研究组织机器人部)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 研究提出TOLiD方法,通过耦合激光雷达主干与从冻结VFM教师初始化的学生ViT,利用视锥体池化、注意力及掩码双线性采样等技术,解决模态和架构差距问题,在多数据集上评估显示能提升迁移效果。

Comments Accepted to The IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10130 2026-07-14 cs.CV 新提交 57%

TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues

TextGaze:利用文本场景线索提示注视目标估计

Junhui She, Fei Wang, Kun Li, Yiqi Nie, Yuxin Liu, Zhangling Duan, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui University(安徽大学) United Arab Emirates University(阿联酋大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 研究注视目标估计问题,提出TextGaze统一跨模态架构,利用大型视觉语言模型平衡多分支与简化设计范式,通过冻结编码器提取视觉特征、设计融合模块等进行联合预测,在多数据集上评估有竞争力,为传统设计提供简化替代。

Comments Accepted by IJCAI 2026. All contents are available at: https://github.com/idremo/TextGaze-IJCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10103 2026-07-14 cs.CR cs.CL 新提交 57%

A Survey on LLM Watermarking: Theory and Deployment

大语言模型水印:理论与部署综述

Huy Phan, Kieu Dang, Ojaswi Dulal, Aiham AL Shukairi, Abby Shine, Chase Garner, Phung Lai

机构 * Truman State University(特伦特州立大学) University at Albany, State University of New York(纽约州立大学阿尔巴尼分校)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 综述大语言模型水印技术,通过从业者核心问题组织内容,综合技术家族并分析安全效用权衡,回顾攻击策略、评估协议等,为LLM水印设计提供实际指导,明确可靠部署的研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13731 2026-07-14 cs.SD eess.AS 57%

Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion

通过说话人识别、知识蒸馏和分层融合进行多说话人对话中的情绪识别

Xiao Li, Kotaro Funakoshi, Manabu Okumura

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 多模态训练与对齐 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出通过说话人识别、知识蒸馏和分层融合方法,提升多说话人对话中情绪识别的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 8 篇

2603.17343 2026-07-14 cs.CV 版本更新 81%

EvoGuard: An Extensible Agentic RL-based Framework for Practical and Evolving AI-Generated Image Detection

EvoGuard: 一种基于代理强化学习的可扩展框架,用于实际和演化的AI生成图像检测

Chenyang Zhu, Maorong Wang, Jun Liu, Ching-Chun Chang, Isao Echizen

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国家信息研究所)

专题命中 其他多模态 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出EvoGuard框架,利用多模态大语言模型和非MLLM检测器,通过能力感知的动态编排机制实现高效AIGI检测,优化后无需细粒度标注,实验表明其在准确性和可扩展性上均达最优。

Comments Template changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09884 2026-07-14 cs.CV cs.LG 新提交 79%

ShapKO: Shapley-Adaptive Modality Knockout for Robust Multimodal Learning

ShapKO:用于稳健多模态学习的Shapley自适应模态剔除

Nusrat Binta Nizam, Fengbei Liu, Sunwoo Kwak, Minh Nguyen, Ruining Deng, Mert R. Sabuncu

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技学院) Weill Cornell Medicine(威尔康乃尔医学院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态医学模型在输入缺失或模态主导时性能不佳的问题,提出ShapKO动态训练策略,基于验证效用学习特定模态剔除概率,通过评估性能、估计重要性和更新概率促进互补表示,在多数据集上提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09795 2026-07-14 cs.IT cs.AI eess.SP math.IT 新提交 79%

Large Multimodal Model-Based Environment-Aware Mobility Management

基于大型多模态模型的环境感知移动性管理

Seokhyun Jeong, Sangmok Shin, Seungnyun Kim, Jiao Wu, Byonghyo Shim

机构 * Department of Electrical and Computer Engineering and the Institute of New Media and Communications, Seoul National University(电气电子工程系和新媒体与通讯研究所,首尔国立大学) Information Systems Technology and Design (ISTD) pillar, Singapore University of Technology and Design(信息与系统技术与设计(ISTD)部门,新加坡科技设计大学) Computer, Electrical and Mathematical Sciences and Engineering Division, King Abdullah University of Science and Technology(计算机、电子与数学科学与工程系,卡塔尔科学与技术大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对LLMs在移动性管理应用少的问题,提出基于大型多模态模型的环境感知移动性管理方案,利用LMMs提取环境信息,学习信道容量图预测未来信道容量,据此确定主动切换决策,相比传统DL方法显著提升了信道容量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10945 2026-07-14 cs.HC 新提交 78%

When Context Dominates: Multimodal Signatures of Takeover Readiness Under Varying Hazard and Cognitive Load Conditions

当情境占主导时:不同危险和认知负荷条件下接管准备的多模态特征

Shiva Azimi, Yasaman Hakiminejad, Luis Gomero, Elizabeth Pantesco, Irene P. Kan, Meltem Izzetoglu, Arash Tavakoli

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究在驾驶模拟器实验中探究危险类型、次要任务等因素对驾驶员接管行为的影响,采用多模态传感框架评估,发现危险情境是主要决定因素,为半自动车辆人机协作策略奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11118 2026-07-14 cs.CV 新提交 57%

GHOST: Geometry-Guided Hallucination of Opaque Surface Textures

GHOST:不透明表面纹理的几何引导幻觉

Langxu Zhao, Zuan Gu, Tianhan Gao

机构 * School of Software, Northeastern University, Shenyang, China(软件学院,东北大学,沈阳,中国)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对透明物体给深度估计和3D重建带来的挑战,提出几何引导预处理框架GHOST,利用视觉基础模型,经多步骤处理分离属性、恢复法线先验并整合多模态线索,合成不透明RGB图像,显著提升相关模型对透明物体的处理精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10068 2026-07-14 cs.LG cs.CV cs.GR 新提交 57%

Error Aware Distribution Prediction for Lightweight Implicit Neural Representations

轻量级隐式神经表示的误差感知分布预测

Zhimin Li, Jake D. Balla, Joshua A. Levine

机构 * Vanderbilt University(范德堡大学) University of Arizona(亚利桑那大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对隐式神经表示的预测误差问题,提出轻量级方法,将基于回归的INR训练转为分类任务,通过离散连续目标为bins实现灵活分布建模,经分析权衡表明该方法能通过不确定性估计获高重建质量和误差感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20780 2026-07-14 physics.ins-det astro-ph.IM hep-ex physics.geo-ph physics.soc-ph 版本更新 50%

Deep-Ocean Application-Specific Neutrino Experiment

深海应用特定中微子实验:白皮书

Takumi Araki, Simran Chauhan, Lyla Choi, Brian C. Crow, Max A. A. Dornfest, John Graham, Misaki Hosoya, John G. Learned, Viacheslav A. Li, William F. McDonough, Takeru Ohno, Takanobu Ono, Taichi Sakai, Jackson Seligman, Nathan Sibert, Shang-Wen Stradleigh, David Vartanyan, Hiroko Watanabe, Zhihao Xu, Jeffrey G. Yepez

专题命中 其他多模态 :multi-modal(abstract)

AI总结 提出一种移动式深海探测器,通过探测地幔中铀和钍衰变产生的地球中微子,约束地球放射性热产生和化学成分,相比陆地探测器降低50-100倍地壳本底。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19926 2026-07-14 cs.HC 50%

Developers' Experience with Generative AI -- First Insights from an Empirical Mixed-Methods Field Study

开发者与生成式AI的体验——一项实证混合方法田野研究的初步洞察

Charlotte Brandebusemeyer, Tobias Schimmer, Bert Arnrich

专题命中 其他多模态 :multimodal(abstract)

AI总结 本研究通过混合方法分析开发者与生成式AI交互的体验,探讨不同交互方式对效率、准确性和工作负载的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏