arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-15 至 2026-06-15 共收录 38 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 1 篇

2606.14703 2026-06-15 cs.CV cs.CL cs.LG 新提交 62%

Gaze Heads: How VLMs Look at What They Describe

注视头:视觉语言模型如何观察它们所描述的内容

Rohit Gandikota, David Bau

机构 * Northeastern University(东北大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 发现视觉语言模型的语言骨干中存在一组“注视头”,其注意力跟踪当前描述的图像区域,通过干预这些头可精确控制模型描述内容,准确率达83.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2606.13712 2026-06-15 cs.SD cs.CL 新提交 79%

Multimodal Speaker Identification in Classroom Environments

课堂环境中的多模态说话人识别

Michael L. Chrzan, Meghavarshini Krishnaswamy, Robert Gibboni, Katie Wetstone, Wei Ai, Jing Liu

机构 * University of Michigan(密歇根大学) University of Pennsylvania(宾夕法尼亚大学) University of Maryland(马里兰大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 针对课堂背景噪声和儿童语音变异性导致纯声学模型准确率低的问题,提出融合声学嵌入与LLM语义上下文的多模态框架,将学生识别准确率从39.0%提升至50.3%,长句准确率达76.9%,角色区分准确率99.3%。

Comments 9 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14321 2026-06-15 cs.SD cs.MM 新提交 57%

MaskedFOP: Polyglot Speaker Identification under Missing Visual Modality via Cascaded Graph Label Propagation

MaskedFOP:缺失视觉模态下的多语言说话人识别通过级联图标签传播

Ayoub Elkhouzari, Youssef Iraqi, Loubna Mekouar

机构 * College of Computing, University Mohammed VI Polytechnic(穆罕默德六世理工大学计算机学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 提出MaskedFOP系统,在测试时人脸完全缺失且语音为未见语言(乌尔都语)的挑战下,通过模态丢弃双头网络、互补嵌入平均和两级级联推理实现闭集多语言说话人识别,在POLY-SIM 2026挑战赛中取得第一。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2606.14049 2026-06-15 cs.SD cs.CV 新提交 79%

FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

FoleyGenEx: 统一视频到音频生成,具备多模态控制、时间对齐与语义精度

Shiyao Wang, Xijuan Zeng, Hui Wang, Shiwan Zhao, Feng Deng, Chen Zhang, Yong Qin

机构 * Academy for Advanced Interdisciplinary Studies, Nankai University(南开大学前沿交叉学科研究院) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出FoleyGenEx统一框架,通过条件注入、多模态动态掩码和副词数据增强,实现视频到音频生成中多模态控制、帧级时间对齐与细粒度语义的同步合成。

Comments Accepted by INTERSPEECH 2026

Journal ref INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14094 2026-06-15 cs.CV cs.AI 新提交 62%

FEMOT: Multi-Object Tracking using Frame and Event Cameras

FEMOT: 使用帧和事件摄像机的多目标跟踪

Shiao Wang, Xiao Wang, Chao Wang, Yitao Li, Menghao Liu, Bo Jiang, Yaowei Wang, Yonghong Tian, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Peng Cheng Laboratory(鹏城实验室) National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理全国重点实验室) School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出FEMOT大规模RGB-事件多目标跟踪数据集和FEMOTR多模态跟踪框架,通过频域融合解耦特征,有效利用互补信息实现鲁棒跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14127 2026-06-15 cs.IR cs.CL 新提交 57%

CoRe: A Continuously Reward-Finetuned LLM Query Rewriter for Multi-Stage Context-Aware Relevance in Web-Scale Video Search

CoRe:一种持续奖励微调的LLM查询重写器,用于大规模视频搜索中的多阶段上下文感知相关性

Yilin Wen, Rong Yang, Xiaojia Chang, Hong Sun, Gefu Tang, Chunhui Liu, Jeffrey Chen, Zeyu Ma, Lisong Qiu, Xiaochuan Fan, Congjia Yu, Quan Zhou, Yuheng Chen, Zian Wang

机构 * TikTok

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出CoRe系统,通过半在线混合偏好优化和乘法奖励比,实现每周重新部署的LLM查询重写器,在多阶段视频搜索中显著降低变更查询率并提升相关性指标。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2606.14078 2026-06-15 cs.LG cs.AI 新提交 57%

Rethinking Backdoor Adversarial Unlearning through the Lens of Catastrophic Forgetting in Continual Learning

通过持续学习中的灾难性遗忘视角重新思考后门对抗性去学习

Zhenqian Zhu, Yamin Hu, Yujiang Liu, Luping Wei, Wenbo Hou, Bin Li, Haodong Li, Wenjian Luo

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Key Laboratory of Media Security, Shenzhen University(深圳大学媒体安全深圳市重点实验室)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 本文将后门学习与去学习建模为持续学习视角下的三阶段过程,基于灾难性遗忘机制推导完全后门去学习的必要条件,并提出盲反演-后门对抗性去学习(BI-BAU)方法,通过期望最大化算法优化最大后验目标,有效消除后门效应。

Comments Accepted by ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2606.14267 2026-06-15 cs.RO 新提交 78%

FloVerse: Floor Plan-Guided Multi-Modal Navigation

FloVerse:基于楼层平面图的多模态导航

Weiqi Huang, Shuangyi Dong, Jiaxin Li, Yifei Guo, Zan Wang, Wei Liang

机构 * School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

AI总结 提出FloVerse任务统一PointNav、ObjectNav和ImageNav,构建FloVerse-1.6K数据集,并设计ThreeDiff两阶段模仿学习策略,利用楼层平面图先验提升导航性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14072 2026-06-15 cs.CV cs.CL 新提交 73%

Diffusion-Refined Segmentation and Vision-Language Interpretation for Pediatric Brain Tumor MRI

扩散细化分割与视觉-语言解释用于儿童脑肿瘤MRI

Wentao Ke, Jianche Liu

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) School of Medicine, Stanford University(斯坦福大学医学院)

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出两阶段框架,先用Swin-UNETR粗分割,再用条件扩散模型细化边界,最后结合多模态语言模型生成结构化报告,提升儿童脑肿瘤分割精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13679 2026-06-15 cs.CV 新提交 70%

InterleaveThinker: Reinforcing Agentic Interleaved Generation

InterleaveThinker: 强化智能体交错生成

Dian Zheng, Harry Lee, Manyuan Zhang, Kaituo Feng, Zoey Guo, Ray Zhang, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Meituan(美团) CUHK IMIXR(香港中文大学IMIXR实验室)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出首个多智能体管线InterleaveThinker,通过规划器和评论家智能体使现有图像生成器具备交错生成能力,并利用GRPO强化单步指令修正,显著提升生成性能。

Comments Project Page: https://zhengdian1.github.io/InterleaveThinker-proj/ Code: https://github.com/zhengdian1/InterleaveThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14176 2026-06-15 cs.AI 新提交 57%

VeriGeo: Controllable Geometry Question Generation with Numerical and Analytical Verification

VeriGeo: 可控几何问题生成与数值和分析验证

Xiaoxian Duan, Zequn Liu, Yingce Xia

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出VeriGeo框架,通过可执行推理轨迹和三级验证流水线,实现用户约束下的可控几何问题生成,并利用验证引导的反思修复无效生成,提升数据可靠性。

Comments 32 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14255 2026-06-15 cs.RO 新提交 50%

ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation

ReactVLA: 通过改进的平均流动作生成实现快速轻量级反应式机器人操作

Yanzhao Guo, Wenkai Chen, Jianwei Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Technical Aspects of Multimodal Systems (TAMS), Department of Informatics, Universität Hamburg(汉堡大学信息学系多模态系统技术方面(TAMS))

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出ReactVLA框架,结合改进的平均流动作生成器和注意力残差机制,实现轻量低延迟的实时机器人操作,在模拟和真实任务中性能提升达1.65倍,推理速度提升4倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14032 2026-06-15 cs.RO 新提交 50%

From Attacks to Curricula: Learnability-Guided Adversarial Training for Safe Autonomous Driving

从攻击到课程:面向安全自动驾驶的可学习性引导对抗训练

Yuewen Mei, Tong Nie, Jie Sun, Haotian Shi, Wei Ma, Jian Sun

机构 * College of Transportation & Key Laboratory of Road and Traffic Engineering of Ministry of Education, Tongji University(同济大学交通运输工程学院 & 道路与交通工程教育部重点实验室) Department of Civil and Environmental Engineering, The Hong Kong Polytechnic University(香港理工大学土木与环境工程学系)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出AlignADV框架,通过偏好对齐生成可解决场景,并利用行为指纹预测策略能力,动态采样课程以提升自动驾驶对抗训练的收敛效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 8 篇

2606.14697 2026-06-15 cs.CV cs.AI cs.CL 新提交 87%

ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning

ClinHallu: 用于诊断医学多模态大语言模型推理中阶段式幻觉的基准

Sicheng Yang, Hangjie Yuan, Wenjun Zhang, Jinwang Wang, Yichen Qian, Weihua Chen, Fan Wang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出ClinHallu基准,包含7031个实例,每个实例带有结构化推理轨迹(视觉识别、知识回忆、推理整合),通过阶段替换干预和轨迹监督微调,实现细粒度幻觉诊断与缓解。

Comments Code and datasets: https://github.com/alibaba-damo-academy/ClinHallu

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14562 2026-06-15 cs.CV cs.LG 新提交 79%

NEST3D: A High-Resolution Multimodal Dataset of Sociable Weaver Tree Nests

NEST3D:织布鸟树巢的高分辨率多模态数据集

Constanza A. Molina Catricheo, Simon Boeder, Ting-Jia Guo, Giacomo May, Clément Berthelot, Devis Tuia, Friedrich Fedor Reinhard, Fabio Remondino, Benjamin Risse

机构 * Institute for Geoinformatics (ifgi), University of Münster(明斯特大学地理信息学研究所) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) University of Konstanz(康斯坦茨大学) Kuzikus Research Station(库兹库斯研究站) Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对织布鸟巢缺乏精细3D结构数据的问题,提出包含104棵巢树、1.4TB多模态无人机数据集,并基准测试语义分割方法,PT-v3达86.35% mIoU。

Comments 14 pages, 4 figures. Dataset available at https://huggingface.co/NEST3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14251 2026-06-15 cs.CV 新提交 74%

HiST: A Hierarchical Sparse Transformer for Cross-Modal Spatial Transcriptomics Modeling

HiST:用于跨模态空间转录组建模的分层稀疏Transformer

Weiyi Wu, Xinwen Xu, Xingjian Diao, Siting Li, Zhi Wei, Alma Andersson, Jiang Gui

机构 * New Jersey Institute of Technology(新泽西理工学院) Stevens Institute of Technology(史蒂文斯理工学院) Karolinska Institutet(卡罗林斯卡学院) Dartmouth College(达特茅斯学院)

专题命中 多模态评测 :cross-modal(title);分类 cs.CV

AI总结 提出HiST,一种分层稀疏Transformer,通过稀疏窗口注意力和分辨率变换算子实现高效的多尺度空间转录组推断,显著降低计算开销并提升预测性能。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13900 2026-06-15 cond-mat.mtrl-sci 新提交 71%

Multi-modal machine learning analysis of GaSe molecular beam epitaxy growth conditions

GaSe分子束外延生长条件的多模态机器学习分析

Mingyu Yu, Isaiah A. Moses, Wesley F. Reinhart, Stephanie Law

专题命中 多模态评测 :multi-modal(title)

AI总结 提出机器学习引导的GaSe薄膜MBE生长框架,利用RHEED原位诊断与XRD、AFM非原位表征,通过无监督学习、互信息分析和监督学习揭示生长条件对薄膜质量的影响,实现异常检测与预测优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14025 2026-06-15 cs.CV 新提交 70%

GarmentSketch: Large-scale Sketch-to-Fashion Benchmark

GarmentSketch:大规模草图到时尚基准

Duong-Duy-Khang Bui, Minh-Tan Pham, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 为解决时尚草图到图像合成缺乏大规模配对数据的问题,构建了包含26249对草图-文本描述的GarmentSketch数据集,并基于多模态大模型与人工精炼生成描述,评估了现有生成模型的性能。

Comments ICCCI 2026. Project page: https://khangbdd.github.io/garmentsketch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13877 2026-06-15 cs.RO 新提交 67%

ContactWorld: What Matters in Vision-Tactile World Models for Contact-Rich Manipulation

ContactWorld: 视觉-触觉世界模型中什么对接触丰富操作至关重要

Zhiyuan Zhang, Pokuang Zhou, Kaidi Zhang, Adeesh Desai, Temitope Amosa, Davood Soleymanzadeh, Jiuzhou Lei, Minghui Zheng, Yu She

机构 * School of Industrial Engineering, Purdue University(普渡大学工业工程学院) Department of Mechanical Engineering, Texas A&M University(德克萨斯农工大学机械工程系)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 通过12项接触丰富操作任务,发现空间结构化和时间连续的表征(如点云)能显著提升规划成功率,且触觉传感的有效性依赖于跨模态表征兼容性。

Comments 32 pages, 12 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13713 2026-06-15 q-bio.GN cs.AI 新提交 57%

CisTransCell: Single-Cell Perturbation Prediction via Gene Function, Regulatory Control, and Cellular Context

CisTransCell:通过基因功能、调控控制和细胞上下文进行单细胞扰动预测

Wei Zhang, Xun Jiang, Yuesi Xi, Ming Tang

机构 * [q-bio.GN]

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 提出CisTransCell框架,结合调控序列和编码序列先验与细胞表达状态,建模扰动响应级联,实现零样本单细胞扰动预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14169 2026-06-15 cs.LG 新提交 50%

Machine Learning for Biomedical Raman Spectroscopy: From Spectral Acquisition to Clinical Translation

生物医学拉曼光谱的机器学习:从光谱采集到临床转化

Bogdan Oancea, Ana Maria Seciu-Grama, Nicoleta Siminea, Laura Mihaela Stefan, Alice Stoica, Joel Sjoberg, Marian Necula, Ana-Maria Prelipcean, Corneliu Ovidiu Vrancianu, Eduard Milea, Andrei Păun, Ion Petre, Mihaela Păun

机构 * National Institute of Research and Development for Biological Sciences(罗马尼亚生物科学研究院) University of Bucharest(布加勒斯特大学) University of Turku(图尔库大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 综述机器学习在生物医学拉曼光谱全流程中的应用,包括预处理、诊断分类、可解释性分析及临床转化障碍,强调标准化与鲁棒验证的必要性。

Comments 52 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 3 篇

2606.14154 2026-06-15 cs.CR 新提交 78%

SkillMutator: Benchmarking and Defending Language-and-Code Cross-modal Attacks on LLM Agent Skills

SkillMutator: 基准测试与防御针对LLM代理技能的语言与代码跨模态攻击

Youngduk Kim, Minkyoo Song, Seungwon Shin

专题命中 多模态Agent :cross-modal(title,abstract)

AI总结 提出SkillMutator基准,模拟13类跨模态攻击,并设计四阶段推理轨迹蒸馏框架,将检测率从17.1%提升至88.2%,超越GPT-4o-mini。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13916 2026-06-15 cs.AI 新提交 57%

A Multi-Agent AI System for Automated High School Transcript Processing: Collaborative Document Analysis at Scale

用于自动化高中成绩单处理的多智能体AI系统:大规模协作文档分析

Ben Torkian, Jun Zhou

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出一个多智能体AI系统,通过三个专业智能体协作,自动处理不同格式的高中成绩单,以GPA提取作为协调信号,实现96.7%的准确率和每份45秒的处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13686 2026-06-15 cs.CL cs.CY 新提交 57%

Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces

电子商务欺骗性界面下的Web Agent安全基准测试

Zijing Shi, Meng Fang, Ling Chen

机构 * AAII, University of Technology Sydney(悉尼科技大学AAII) University of Liverpool(利物浦大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 提出WebDecept框架,在电子商务环境中注入七种常见欺骗性界面模式,测试多模态Web Agent的安全性,发现当前Agent极易受骗且提示约束不足。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 9 篇

2606.14700 2026-06-15 cs.CV 新提交 85%

RepFusion: Leveraging Multimodal Priors for Denoising in Representation Space

RepFusion:利用多模态先验在表示空间中进行去噪

Xichen Pan, Aashu Singh, Satya Narayan Shukla, Xiangjun Fan, Shlok Kumar Mishra, Saining Xie

机构 * Meta AI New York University(纽约大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出RepFusion方法,利用多模态大语言模型作为噪声表示编码器,为扩散变压器提供条件信号,在相似推理预算下优于新初始化解码器基线。

Comments Project Page: https://xichenpan.com/repfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14172 2026-06-15 cs.LG cs.CV 新提交 83%

Context-aware Modality-Topology Co-Alignment for Multimodal Attributed Graphs

上下文感知的模态-拓扑协同对齐用于多模态属性图

Sirui Zhang, Xu Wang, Zhengyu Wu, Xunkai Li, Hongchao Qin

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出CoMAG框架,通过任务自适应可靠上下文学习和模态保持的跳令牌对齐,统一处理图任务和模态任务,在保持稀疏边线性复杂度的同时提升结构预测、跨模态匹配和图条件生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14691 2026-06-15 cs.CL 新提交 79%

CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment

CORA: 通过一致性导向的推理对齐分析与弥合多模态RLVR中的思考-答案差距

Jiayue Cao, Zhicong Lu, Xuehan Sun, Wei Jia, Hongling Zheng, Changyuan Tian, Zichuan Lin, Wenqian Lv, Nayu Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Wuhan University(武汉大学) Tsinghua University(清华大学) Tianjin University(天津大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文分析多模态RLVR中思考与答案的语义不一致问题,提出CORA方法,通过轻量级一致性奖励模型引入语义一致性,并采用混合奖励优势分裂稳定优化,提升推理忠实度。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13896 2026-06-15 cs.CV cs.AI 新提交 62%

How do Self-Supervised Remote Sensing Vision Models Transfer to Downstream Tasks?

自监督遥感视觉模型如何迁移到下游任务?

Julia Romero, Qin Lv, Morteza Karimzadeh

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究六种代表性自监督地理空间基础模型(GeoFMs)在下游任务中的迁移表现,发现模型排名随任务和适应设置变化,中间层特征比最终层更相关,且解码器设计等适应设置影响与模型选择相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14568 2026-06-15 eess.IV cs.CV 新提交 57%

Trimodal Glioma Representation Alignment via Volumetric Contrastive Learning

三模态胶质瘤表示对齐通过体积对比学习

Denise Marini, Eleonora Grassucci, Danilo Comminiello

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出GLORIA框架,通过Gramian对比损失对齐组织病理、基因表达和MRI三模态特征,用于胶质瘤分级和生存预测,在132例患者数据上优于双模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14277 2026-06-15 cs.CV 新提交 57%

One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

一层的垃圾是另一层的宝藏:LVLMs中自适应逐层视觉标记选择

Yongru Chen, Kai Zhang, Zeliang Zong, Yuchen Lu, Wenming Tan, Ye Ren, Jilin Hu

机构 * Hikvision Research Institute(海康威视研究院) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出自适应逐层视觉标记选择(ALVTS),通过轻量级选择器为不同层路由重要标记,实现高效压缩,在89%压缩率下保留96.7%精度。

Comments Accepted by CVPR 2026 (highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏