arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3020 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 530 篇

2608.08307 2026-08-11 cs.CV cs.AI 新提交 62%

Frequency-Domain Dual-Branch Fusion for Medical Visual Question Answering

用于医学视觉问答的频域双分支融合

Yusra Tariq, Rakesh Chandra Joshi

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出频域双分支融合模块,结合BiomedCLIP与BioBART,在PMC-VQA预训练后于VQA-RAD、SLAKE微调,提升医学VQA性能且架构轻量高效。

Comments 7 Pages, 4 figures, under review at AAAI 27

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08107 2026-08-11 cs.CL cs.AI 新提交 62%

NeuPAT: Neuron-aware Plasticity Allocation Tuning for Language-Preserving MLLMs

NeuPAT:面向语言保留多模态大语言模型的神经元感知可塑性分配调优

Jiayue Jin, Jingwei Zhang, Chen Wang, Jing Liu, Longteng Guo

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 NeuPAT是一种轻量架构无关框架,通过选择性保护语言敏感神经元、促进高可塑性神经元适配多模态,在11个语言基准上恢复了普通调优94.5%的语言能力下降,同时保持相当多模态性能,实现了能力保留型多模态大语言模型扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07088 2026-08-10 cs.CV cs.AI 新提交 62%

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

RoRA:面向角色的区域分配,用于多模态大语言模型中的视觉令牌剪枝

Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对多模态大语言模型视觉令牌剪枝的高开销问题,提出无训练框架RoRA,通过角色导向的区域分配实现高效剪枝,在多个模型系列上优于基线,大幅降低推理时间且保留高准确率。

Comments 9 pages, 4 figures, 4 tables. Code is available at https://github.com/LukieLuu/RoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04698 2026-08-06 cs.CV cs.AI 新提交 62%

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解

Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03023 2026-08-05 cs.CV cs.AI 新提交 62%

Standalone DINOv3 for Training-Free Open-Vocabulary Semantic Segmentation in Remote Sensing

用于遥感领域无需训练的开放词汇语义分割的独立DINOv3模型

Changhao Zhao, Haoxiang Li, Yuke Li, Hai Liu, LingLin Zeng

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 针对遥感语义分割标注成本高的问题,提出无需训练的DinoSplat-OV框架,结合DINOv3的文本感知拉普拉斯传播与高斯溅射上采样模块,在多数据集上取得优于现有方法的性能,填补了DINO系列模型在该领域的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01979 2026-08-04 cs.CV cs.CL 新提交 62%

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs

ET-Prune:面向文本丰富型多模态大语言模型的视觉 token 剪枝的证据感知动态预算分配

Zizhong Ding, Junxian Li, Kai Liu, Shaoqiu Zhang, Xiao Xiao, Linghe Kong, Yulun Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 ET-Prune 是一种无需训练的视觉 token 剪枝框架,通过证据分配实现动态预算,在文本丰富的多模态任务中,于约一半 token 保留量下,在 OCRBench-v2、MMBench v1.1 等基准上取得优于基线的性能,实现了质量与成本的良好平衡。

Comments Code and supplementary material is at https://github.com/Labyrinth0419/ET-Prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01055 2026-08-04 cs.CV cs.AI 新提交 62%

Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception

为正确的边界框分配信用:结构化视觉感知的边际贡献分配

Xinheng Han, Jianfei Wang, Yu Chen, Xiang Wang, Shuai Li, Weixing Li, Feng Pan

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型结构化视觉感知中响应级监督的粒度不匹配问题,提出MCR-GRPO框架,通过边界框级边际贡献分配优化,在多个基准上取得了优于现有GRPO基线的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00530 2026-08-04 cs.CV cs.AI 新提交 62%

Unleashing the Power of Text: Text-Guided Flow Matching for Image Fusion under Complex Degradations

释放文本的力量:面向复杂退化场景的文本引导流匹配图像融合

Axi Niu, Jieheng Li, Kang Zhang, Qingsen Yan, Jinqiu Sun, Yanning Zhang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对复杂退化下红外-可见光图像融合的挑战,提出文本引导的TGFusion框架,通过多流联合流Transformer实现动态文本引导,在多类退化场景下取得优异融合性能。

Comments 12 pages, 9 figures, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00146 2026-08-04 cs.CL cs.AI 新提交 62%

DiffusionGemma Technical Report

DiffusionGemma 技术报告

DiffusionGemma Team, Adrien Ali Taïga, James Assiene, Daniele Calandriello, Rahma Chaabouni, João Gante, Tamara von Glehn, Nate Keating, Chris Knutsen, Martin Kukla, Tianlin Liu, Ivan Lobov, Ofir Nabati, João Gabriel Oliveira, Nicolas Perez-Nieves, Nastasia Prutianova, Bobak Shahriari, Jean Tarbouriech, Pavel Tyletski, Çağlar Ünlü, Cindy Wu, Glenn Cameron, Jerome Connor, Sertan Girgin, Maarten Grootendorst, Alon Levkovitch, Eliya Nachmani, Omar Sanseviero, Piotr Stanczyk, Quentin Berthet, Andrew Campbell, Clément Crepy, Valentin De Bortoli, Arnaud Doucet, Romuald Elie, Alexandre Galashov, Klaus Greff, Alexis Jacq, David Ruhe, Yu-Han Wu, Sebastian Flennerhag, Brendan O'Donoghue, George Scrivener, Shantanu Thakoor

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出开放权重语言模型 DiffusionGemma,通过并行优化 256 个 token 块规避 AR 模型顺序解码瓶颈,经两阶段微调后实现 1500 token/秒生成速度,性能优于带推测解码的 AR 模型,还支持多模态等功能并为混合解码提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27660 2026-07-31 cs.LG cs.AI cs.CV 新提交 62%

Understanding Submodular Information Measure Based Objectives for Representation Learning: A Variance and Separation Perspective

基于表示学习的子模信息测度目标:方差与分离视角的理解

Rishabh Iyer, Truong Pham, Anay Majee

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Adobe(奥多比公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究构建统一理论框架揭示子模信息测度(SIMs)的几何与统计特性,通过控制合成实验验证,为选择设计基于SIMs的表示学习目标提供原则性指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27614 2026-07-31 cs.CL cs.AI 新提交 62%

DualAnchor: Preserving Language Priors and Improving Lexical Fidelity in Gloss-Free Sign Language Translation

DualAnchor:无注释手语翻译中保留语言先验并提升词汇保真度

Hongbin Zhang, Junhao Liu, Xuefeng Bai, Youcheng Pan, Yang Xiang, Kehai Chen

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对现有无注释手语翻译方法的语言先验退化与词汇保真度差距问题,提出结合TPA和OTA的DualAnchor框架,在两个基准数据集上取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21371 2026-07-24 cs.CV cs.AI 新提交 62%

DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation

DINOde:用于开放词汇语义分割的连续视觉-文本对齐

Sung-Hoon Yoon, Hoyong Kwon, Changgyoon Oh, Kuk-Jin Yoon

机构 * Multimodal Intelligence and Perception Lab., DGIST(多模态智能与感知实验室,大邱庆北科学技术院) Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对开放词汇语义分割中视觉与文本对齐问题,提出基于ODE的DINOde框架,通过语义文本流和全局上下文流、速度切向投影等组件,连续对齐视觉与文本,实验证明该方法优于现有方法,性能达领先水平。

Comments Accepted to ECCV 2026. 27 pages, 8 figures, and 10 tables. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09126 2026-07-13 cs.CV cs.CL 新提交 62%

VTaMo: Video-Text Alignment Model for Sign Language Translation

VTaMo:用于手语翻译的视频-文本对齐模型

Junyi Hu, Zhewen He, Haomian Huang, Aoxiang Yang, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign科技)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 研究手语翻译问题,提出VTaMo框架,通过局部、全局对齐及位置对齐对比学习实现多粒度对齐,在多个数据集实验中展现领先性能,各组件贡献互补。

Comments 18 pages, 5 figures, 8 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08076 2026-07-10 cs.CV cs.AI 新提交 62%

LDFE: Laplacian Decoupled Feature Enhancement Block for Dual-Stream CNN-based RGB-IR Object Detection

LDFE:用于基于双流 CNN 的 RGB-IR 目标检测的拉普拉斯解耦特征增强模块

Wenhao Dong, Xiaoyan Luo, Linlin Yang, Haodong Zhu, Xiaorong Shi, Guodong Guo, Baochang Zhang

机构 * Beihang University(北京航空航天大学) State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复使用航天运输技术国家重点实验室) The School of Astronautics(航天学院) The National Key Laboratory of Integrated Air-Ground Navigation Technologies(集成空天地导航技术国家实验室) The State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室) The School of Artificial Intelligence(人工智能学院) Zhongguancun Academy(中关村学院) The School of Automation Science and Electrical Engineering(自动化科学与电气工程学院) Beijing Institute of Control and Electronics Technology(北京控制电子技术研究所) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Eastern Institute of Technology(东部技术研究所) Hangzhou Research Institute, School of Artificial Intelligence(杭州研究院,人工智能学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究基于双流 CNN 的 RGB-IR 目标检测问题,提出拉普拉斯解耦特征增强模块 LDFE,通过全局-局部分解等操作融合不同阶段特征,在多个数据集上显著提升目标检测性能,mAP 超 SOTA 方法。

Journal ref Pattern Recognition,Volume 179, Part D,2026,113935

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04541 2026-07-07 cs.CV cs.AI cs.LG cs.RO 新提交 62%

CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining

CRISP:一种通过基于预测的世界模型预训练实现驾驶的时空相机-雷达主干网络

Jingyu Song, Yi Liu, Katherine A. Skinner

机构 * Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究通过基于预测的表示学习预训练时空相机-雷达主干网络CRISP,利用历史多视图图像和雷达扫描,通过预测未来激光雷达点云学习统一鸟瞰图表示,介绍相关组件,实验表明其能提升点云预测并有效迁移至下游任务。

Comments 17 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00302 2026-07-02 cs.CV cs.MM cs.RO 新提交 62%

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

醒来触摸!多模态大语言模型中的掩码隔离触觉对齐学习

Yoonhyung Park, Minji Kim, Sungwon Moon, Jiyoung Lee

机构 * Division of Artificial Intelligence & Software(人工智能与软件系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出Splash框架,通过参数空间划分(休眠/关键子空间)实现非破坏性触觉模态扩展,在不增加推理开销下保持视觉语言能力,在触觉基准上达到SOTA。

Comments ECCV 2026, Project page: http://mmai.ewha.ac.kr/splash/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26387 2026-06-26 cs.CV cs.CL cs.LG 新提交 62%

Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs

保持VIGILant:通过多模态大语言模型中的反事实视觉对齐缓解视觉懒惰

Xi Xiao, Chen Liu, Chih-Ting Liao, Yunbei Zhang, Qizhen Lan, Yuxiang Wei, Lin Zhao, Janet Wang, Jianyang Gu, Muchao Ye, Tianyang Wang, Hao Xu

机构 * UAB(阿拉巴马大学伯明翰分校) Yale(耶鲁大学) UNSW(新南威尔士大学) Tulane(杜兰大学) Georgia Tech(佐治亚理工学院) NEU(东北大学) OSU(俄亥俄州立大学) UIowa(爱荷华大学) Harvard(哈佛大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出VIGIL框架,通过强化学习后训练最大化视觉输入与生成响应间的互信息,惩罚“盲目自信”实例,有效缓解MLLMs的视觉懒惰问题,在幻觉和推理基准上优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25278 2026-06-25 cs.CV cs.AI 新提交 62%

Heterogeneous and Adept Snapshot Distillation for 3D Semantic Segmentation

异构与专长快照蒸馏用于3D语义分割

Xiaopei Wu, Yuenan Hou, Junkai Xu, Wenxiao Wang, Binbin Lin, Yu Li, Ping Li, Haifeng Liu, Deng Cai, Wanli Ouyang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出异构和专长快照知识蒸馏(HAS-KD),通过信息导向异构蒸馏(IHD)和专长快照蒸馏(ASD)将多模态模型和多个模型专家的知识高效迁移到点云网络,在ScanNetV2和S3DIS上取得最先进结果。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17678 2026-06-17 cs.CV cs.AI 新提交 62%

See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

先看后答:基于充分性驱动的强化学习实现视觉证据预对齐

Yilian Liu, Sicong Leng, Guoshun Nan, Junyi Zhu, Jiayu Huang, Minghao Sun, Xuancheng Zhu, Yisong Chen, Zexian Wei, Xiaofeng Tao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) China Telecom(中国电信)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出视觉证据预对齐(VEPA)方法,在预训练与后训练之间引入充分性驱动的GRPO优化,以增强多模态大模型对细粒度视觉证据的利用,显著提升视觉密集型任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17650 2026-06-17 cs.CV cs.CL 新提交 62%

MambaCount: Efficient Text-guided Open-vocabulary Object Counting with Spatial Sparse State Space Duality Block

MambaCount: 基于空间稀疏状态空间对偶块的高效文本引导开放词汇目标计数

Hao-Yuan Ma, Li Zhang, Minjie Qiang, Jie Gao

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出MambaCount框架,通过空间稀疏状态空间对偶块解决Mamba在非因果视觉任务中的双向依赖限制和空间token高熵问题,实现线性复杂度的开放词汇目标计数,在FSC-147上取得12.23的测试MAE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15129 2026-06-16 cs.CV cs.AI 新提交 62%

EyeMVP: OCT-Informed Fundus Representation Learning via Paired CFP--OCT Pretraining

EyeMVP: 通过配对CFP-OCT预训练实现OCT启发的眼底表征学习

Zhuo Deng, Ruiheng Zhang, Ziheng Zhang, Weihao Gao, Yitong Li, Qian Wang, Lei Shao, Jiaoyue Dong, Zhixi Zeng, Lijian Fang, Haibo Wang, Xiaobin Lin, Tao Liu, Zhicheng Du, Zhengwei Zhang, Lin Yang, Zheng Gong, Xinyu Zhao, Zhenquan Wu, Fang Li, Zhiguang Zhou, Guoming Zhang, Sun Jing, Han Lv, Wenbin We, Lan Ma

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Beijing Tongren Eye Center, Beijing Tongren Hospital, Capital Medical University(首都医科大学附属北京同仁医院北京同仁眼科中心) Liangxiang Hospital of Beijing Fangshan District, Capital Medical University(首都医科大学北京市房山区良乡医院) The Third People's Hospital of Dalian(大连市第三人民医院) National Clinical Research Center for Endocrine and Metabolic Diseases, The Second Xiangya Hospital of Central South University(中南大学湘雅二医院国家内分泌代谢病临床医学研究中心) The Central Hospital of Baoji City(宝鸡市中心医院) Wuxi No.2 People's Hospital, Affiliated Wuxi Clinical College of Nantong University(南通大学附属无锡临床学院无锡市第二人民医院) Shenzhen Eye Hospital, Southern Medical University(南方医科大学深圳眼科医院) Beijing Friendship Hospital, Capital Medical University(首都医科大学附属北京友谊医院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出跨模态视网膜基础模型EyeMVP,利用配对CFP-OCT预训练,通过跨模态掩码重建将OCT结构信息注入CFP表征,在16项下游任务中优于现有模型,尤其对黄斑疾病诊断有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13896 2026-06-15 cs.CV cs.AI 新提交 62%

How do Self-Supervised Remote Sensing Vision Models Transfer to Downstream Tasks?

自监督遥感视觉模型如何迁移到下游任务?

Julia Romero, Qin Lv, Morteza Karimzadeh

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究六种代表性自监督地理空间基础模型(GeoFMs)在下游任务中的迁移表现,发现模型排名随任务和适应设置变化,中间层特征比最终层更相关,且解码器设计等适应设置影响与模型选择相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07593 2026-06-09 cs.CV cs.AI 新提交 62%

A Mechanistic Analysis of Adversarial Fine-tuning of Vision Transformers

视觉Transformer对抗微调的机制分析

Hannah Gao, Isha Agarwal, Dylan Hadfield-Menell, Rachel Ma

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 通过机制分析研究对抗微调对视觉Transformer在扰动和常规图像上性能的影响,发现微调仅改善特定类型扰动,未改变稀疏表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09351 2026-07-13 cs.CV 新提交 61%

Simon-SR: Spatially Adaptive Modulation and Visual Prompt Adaptation for Text-Reinforced Super-Resolution

Simon-SR:用于文本增强超分辨率的空间自适应调制和视觉提示适配

Haotong Cheng, Yuxuan Li, Zijie Cui, Rongling Tan, Chenyuan Wang

机构 * College of Electronic Science and Engineering, Jilin University(吉林大学电子科学与工程学院)

专题命中 多模态训练与对齐 :multi-modal(abstract,comments);分类 cs.CV

AI总结 针对单图像超分辨率问题,提出Simon-SR框架,利用可学习提示进行语义挖掘和文本-图像融合,结合对比提示学习与空间自适应细化,实验证明该方法超越现有技术,在多项指标上有明显提升。

Comments Multi-modal Single Image Super-Resolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19036 2026-08-20 cs.CV 新提交 57%

USR-Drive: Unified Driving Scene Representation via Joint Denoising of 3D Gaussians and Boxes

USR-Drive:通过3D高斯与边界框联合去噪实现统一驾驶场景表示

Li-Heng Chen, Haokai Pang, Chengye Su, Jiarun Liu, Qifeng Chen, Ziqian Ni, Jianxin Huang, Shi-Sheng Huang, Hongbo Fu, Sheng Yang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出USR-Drive框架,将3D高斯与边界框作为对齐的潜在令牌流,通过统一多模态扩散Transformer联合去噪,在nuScenes和VKitti数据集上实现动态重建与3D检测的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17425 2026-08-19 cs.CV 新提交 57%

GSToken: Geometry-Structured Gaussian Tokens for Compact 3D Medical Image Representation

GSToken:用于紧凑三维医学图像表示的几何结构化高斯令牌

Xiaoduo Li, Quan Gu

机构 * Taiyuan University of Technology(太原理工大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出GSToken,一种带显式几何信息的高斯令牌,通过冻结令牌生成器的评估协议验证其在多模态脑肿瘤分割中,比容量匹配基线更优,可提升三维医学图像表示的信息密度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16763 2026-08-18 cs.AI 新提交 57%

LAVA: Logic-Aware Validation and Augmentation Framework for Large-Scale Financial Document Auditing

LAVA:面向大规模财务文档审计的逻辑感知验证与增强框架

Ruoqi Shu, Xuhui Wang, Isaac Wang, Yanming Mai, Bo Wan

机构 * BMO Financial Group(蒙特利尔银行金融集团)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 针对财务文档验证的异构性与业务规则处理难题,提出基于多模态大语言模型的LAVA框架,通过四阶段设计提升幻觉控制与边缘案例处理能力,适用于高风险财务审计场景。

Journal ref Proceedings of The 10th Workshop on Financial Technology and Natural Language Processing (FinNLP 2025), Association for Computational Linguistics, pp. 75-92, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15698 2026-08-18 cs.CV cs.IR 新提交 57%

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Peng Chunyi, Xu Zhipeng, Yan Yukun, Liu Zhenghao, Yu Shi, Mei Sen, Sun Yubo, Zhang Yongheng, Zhou Jie, Gu Yu, Yu Ge, Sun Maosong

机构 * Northeastern University(东北大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15309 2026-08-18 cs.AI 新提交 57%

Physiological World Models for Human State Transitions

面向人体状态转换的生理世界模型

Chongyang Zhang, Rendong Wang, Hao Zheng, Hanwen Zhang, Yang Liu, Xiaolong Wei, Bin Chong

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出生理世界模型(PWM),引入人体状态转换标记,构建含六项基准任务的框架,用于建模人体生理状态响应现实因素的变化,助力个性化健康管理等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15163 2026-08-18 cs.CV cs.HC 新提交 57%

From "What-If" to "What-Is": Counterfactual Thinking-Inspired Semantic Alignment for Visual Brain Decoding

从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐

Kaitao Yan, Chi Liu, Congcong Zhu, Huajie Chen, Gengshen Wu, Minghao Wang, Xiaotong Han, Tianqing Zhu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏