arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 217 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 217 篇

2604.11240 2026-08-10 cs.CV 版本更新 57%

Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models

解耦相似性用于大视觉-语言模型中的任务感知token剪枝

Kexin Ma, Jing Xiao, Chaofeng Chen, Geyong Min, Guibo Zhu, Jinqiao Wang, Liang Liao

机构 * Wuhan University(武汉大学) University of Exeter(埃克塞特大学) Chinese Academy of Sciences(中国科学院) Xi'an University of Electronic Science and Technology(西安电子科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出DeSAP方法,通过解耦相似性实现精准任务感知token剪枝,提升大视觉-语言模型的效率与性能,实验表明在不同基准和架构上均优于现有方法。

Comments Accepted at ACM Multimedia 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03556 2026-08-07 cs.CV cs.RO 版本更新 57%

Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation

Afford-X:面向任务型操作的通用且轻量化的可供性推理模型

Xiaomeng Zhu, Yuyang Li, Leiyao Cui, Pengfei Li, Huan-ang Gao, Yixin Zhu, Hao Zhao

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science, Tsinghua University(清华大学计算机科学系)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28750 2026-08-06 cs.SE cs.AI 版本更新 57%

DragonCrawl: A Generative, Intent-Based Framework for Scalable Mobile End-to-End Testing

DragonCrawl:一种用于可扩展移动端到端测试的生成式意图框架

Sowjanya Puligadda, Mengdie Zhang, Ali Zamani, Dhruva Dixith Kurra, Eric Chen, Juan Marcano

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 DragonCrawl是基于GPT-4o多模态的移动端到端测试框架,通过验证用户流程阻止问题提交,缩短测试入门时间,节省大量维护工作量,实现规模化持续质量保证。

Comments 12 pages, 6 figures, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20113 2026-08-06 cs.CV eess.IV 版本更新 57%

Attention Fusion for Bridge Deck Delamination Detection

多传感器注意力网络用于混凝土桥面亚表面脱层自动检测

Alireza Moayedikia, Amirhossein Moayedikia

机构 * Department of Business Technology and Entrepreneurship, Swinburne University of Technology(斯winburne技术大学商业技术与创业系) Swinburne University of Technology(斯winburne技术大学) University of Sydney(悉尼大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出多传感器注意力网络用于混凝土桥面亚表面脱层检测,通过整合GPR和IRT数据,提升自动化检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22874 2026-08-06 cs.CV 版本更新 57%

Deformable Medical Image Registration with KAN-based Implicit Neural Representations

基于KAN的隐式神经表示的可变形医学图像配准

Nikita Drozdov, Marat Zinovev, Dmitry Sorokin

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出基于KAN的INR框架KAN-IDIR与RandKAN-IDIR,用于无需数据集级训练的逐对优化可变形医学图像配准,在多模态医学图像上实现高准确性、低开销与稳定性,适用于临床研究。

Comments Accepted at Machine Learning and Knowledge Extraction

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28818 2026-08-05 cs.CL q-bio.NC 版本更新 57%

Do VLMs Align Better with Humans than LLMs during Natural Reading?

VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs

Jinzhou Wu, Zhengwu Ma, Jixing Li, Baoping Tang, Zitong Lu

机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23193 2026-08-04 cs.CV 版本更新 57%

OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

OmniScope:用于全模态大语言模型的模态解耦令牌压缩

Jinsen Su, Yongdong Luo, Yuexiao Ma, Yibo Hu, Meiguang Jin, Xiawu Zheng

机构 * Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究所) Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对全模态大语言模型令牌压缩问题,提出无需训练的OmniScope框架,以查询为语义锚点分别估计音频和视频相关性,分配特定模态预算并采用相应策略处理,在多基准和模型规模上效果佳,实现加速和内存减少,提出跨模态推理设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11025 2026-08-04 cs.CV 版本更新 57%

Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images

图像推理中的测试时感知扩展:解决图像推理中的 grounding 困境

Zheng Jiang, Yiming Chen, Nan He, Jiahui Chen, Chaoyang Li, Houde Qian, Lifeng Sun

机构 * Tsinghua University(清华大学) Beijing University of Technology(北京工业大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出 TTSP 框架,通过测试时扩展感知解决图像推理中的 grounding 困境,通过生成多个感知轨迹并过滤不可靠轨迹来提升细粒度视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25379 2026-07-30 cs.CL 版本更新 57%

StateRAG: Typed State Contracts for Complex Retrieval-Augmented Generation

EfficientGraph-RAG:面向跨任务检索增强生成的结构化检索状态管理

Miaohe Niu, Pengxiang Li, Jingbo Zhu, Tong Xiao

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Tsinghua University, China(清华大学) Kunming University of Science and Technology, China(昆明理工大学) NiuTrans Research, Shenyang, China(沈阳NiuTrans研究院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL

AI总结 提出EfficientGraph-RAG框架,通过显式定义检索状态(TAM、MARS、SMP三个机制)实现结构化状态管理,在多个基准上提升答案质量并降低大模型token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12035 2026-07-30 cs.CV 版本更新 57%

When Does Visual Token Pruning Improve Calibration? The Role of Evidence Coverage in MLLMs

视觉标记修剪能否提高校准?关于多模态大语言模型中置信度的实证研究

Kaizhen Tan, Yang Feng, Heqing Du, Hanzhe Hong, Siru Tao, Xin Xu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文研究视觉标记修剪对模型校准的影响,通过POPE和ScienceQA-IMG数据集评估不同修剪策略下的ECE、Brier分数和AURC,发现修剪能提升校准而非仅牺牲效率,且基于显著性的修剪方法效果较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23297 2026-07-29 cs.CV 版本更新 57%

PRIMA: Pre-Training with Risk-Integrated Image--Metadata Alignment for Medical Diagnosis with LLM-Based Feature Aggregation

PRIMA:通过大语言模型进行风险集成图像-元数据对齐的医学诊断预训练

Yiqing Wang, Chunming He, Ziyun Yang, Maria Woodward, Ming-Chen Lu, Mercy Pawar, Leslie Niziol, Sina Farsiu

机构 * Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) Department of Ophthalmology and Visual Sciences, University of Michigan(密歇根大学眼科与视觉科学系)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出PRIMA框架,通过检索增强生成策展风险-疾病关联专家语料库优化文本编码器,用双编码器预训练策略及四个互补损失函数弥合模态差距,融合特征用于疾病分类,性能优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14807 2026-07-28 cs.CV cs.RO 版本更新 57%

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

HiMemVLN:通过分层记忆系统增强开源零样本视觉-语言导航的可靠性

Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HiMemVLN,通过分层记忆系统提升开源零样本视觉-语言导航的可靠性,解决导航遗忘问题,实现实验环境下的性能提升。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18681 2026-07-27 cs.CV 版本更新 57%

Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs

超越多样性:将视觉令牌剪枝视为子空间重建以实现高效视觉语言模型

Jaeyeon Lee, Shunjie Wen, Dong-Wan Choi

机构 * Inha University(延世大学)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 提出SPARE方法,将令牌剪枝重构为子空间重建问题,通过迭代选择投影残差大的令牌进行剪枝,并引入反相关性机制保留上下文信息,在LLaVA上剪枝94%令牌仍保持95%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15995 2026-07-24 cs.LG cs.AI 版本更新 57%

Constrained latent state modeling: A unifying perspective on representation learning under competing constraints

受限潜在状态建模:在竞争约束下表示学习的统一视角

Gwenolé Quellec

机构 * LaTIM UMR 1101

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出受限潜在状态建模(CLSM),统一了表示学习中在竞争约束下的核心原则与方法,揭示了潜在状态的内在耦合关系与根本权衡。

Comments Companion repository containing the reference implementation, reproducible experiments, documentation, and model cards: https://github.com/gwenole-quellec/clsm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05774 2026-07-24 cs.LG cs.AI math.PR 版本更新 57%

Variational Speculative Decoding: Rethinking Draft Training from Token Likelihood to Sequence Acceptance

变分推测解码:从令牌似然到序列接受的草稿训练再思考

Xiandong Zou, Jianshu Li, Jing Huang, Pan Zhou

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :MLLM(abstract_cn);分类 cs.AI

AI总结 提出变分推测解码(VSD),将草稿训练视为对潜在提议(草稿路径)的变分推断,通过最大化目标模型接受的边际概率来优化,结合路径级效用和期望最大化过程,显著提升解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17330 2026-07-23 cs.LG cs.AI 版本更新 57%

SubQuad: Near-Quadratic-Free Structure Inference with Distribution-Balanced Objectives in Adaptive Receptor framework

SubQuad:在自适应受体框架中利用分布平衡目标的近二次自由结构推断

Rong Fu, Zijian Zhang, Kun Liu, Jiekai Wu, Xianda Li, Simon Fong

机构 * University of Macau(澳门大学) University of Pennsylvania(宾夕法尼亚大学) University of Southampton(南安普顿大学) Juntendo University(顺天堂大学) University of Bologna(博洛尼亚大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 SubQuad通过结合抗原感知的近子二次检索、GPU加速的亲和力核、学习多模态融合和公平性约束聚类,解决大规模群体适应性免疫谱分析中的二次成本和数据不平衡问题,提升效率与公平性。

Comments 27 pages, 9 figures. In the previous version, Juntendo University was erroneously listed as the affiliation; we must clarify that this paper has absolutely no relation to Juntendo University. Therefore, we have replaced this affiliation in the new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00972 2026-07-23 cs.CV 版本更新 57%

SemICP: Semantic Non-Rigid Point Cloud Registration with Elastic Energy Regularization

SemICP:基于弹性能量正则化的语义非刚性点云配准

Wanwen Chen, Qi Zeng, Carson Studders, Zongze Li, Jamie J. Y. Kwon, Tara Kemper, Emily H. T. Pang, Eitan Prisman, Septimiu E. Salcudean

机构 * Department of Electrical and Computer Engineering, University of British Columbia(电气与计算机工程系,不列颠哥伦比亚大学) Faculty of Medicine, University of British Columbia(医学院,不列颠哥伦比亚大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对计算机辅助干预中点云配准问题,提出SemICP框架,结合语义信息点匹配与变形正则化,经多数据集测试,相比其他方法降低多种距离误差,结合AI分割后为多模态配准提供有效管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19863 2026-07-22 cs.CV 版本更新 57%

Brewing Stronger Features: Dual-Teacher Distillation for Multispectral Earth Observation

酿造更强的特征:多光谱地球观测的双教师蒸馏

Filip Wolf, Blaž Rolih, Luka Čehovin Zajc

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅纳大学计算机与信息科学学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出双教师对比蒸馏框架,用于多光谱地球观测,通过结合多光谱和光学教师,实现跨模态表示学习,提升多光谱和光学数据的性能。

Comments Accepted to CVPR 2026 as Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12071 2026-07-21 cs.CL 版本更新 57%

Beyond Parallel Tracking: Interactive Multi-Feature Fusion Drives Semantic Reconstruction from Non-invasive Brain Recordings

超越并行跟踪:交互式多特征融合驱动非侵入性脑记录的语义重建

Boda Xiao, Xiran Xu, Songyi Li, Yujie Yan, Xihong Wu, Heping Cheng, Jing Chen

机构 * Center for BioMed-X Research, Academy for Advanced Interdisciplinary Studies,Peking University(北京大学生物医学前沿创新中心、前沿交叉学科研究院) Speech and Hearing Research Center, School of Intelligence Science and Technology,Peking University(北京大学智能科学与技术学院言语听觉研究中心) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) National Biomedical Imaging Center, State Key Laboratory of Membrane Biology, Institute of Molecular Medicine, Peking-Tsinghua Center for Life Sciences, College of Future Technology, Peking University(国家生物医学成像中心、膜生物学国家重点实验室、分子医学研究所、北京大学生命科学联合中心、未来技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL

AI总结 研究针对非侵入性脑记录语义重建中表征不匹配问题,引入多特征融合框架,通过交互式门控机制结合静态与动态表征,经实验对比线性连接和非线性交叉注意力等方法,证明交叉注意力融合性能最佳,提供了新的脑到文本解码方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00573 2026-07-21 cs.CV 版本更新 57%

BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure

BrainFIBRE:基于信息分解的脑微结构基础模型

Zijian Dong, Yi Lin, Fang Ji, Jianxiong Zhou, Kwun Kei Ng, Juan Helen Zhou

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出BrainFIBRE,首个脑微结构基础模型,通过自监督部分信息分解(SPID)和反事实候选构建(CCC)从NODDI图谱中解缠独特、协同和冗余信息,在多种预测任务上达到最优性能。

Comments ECCV 2026. Author name corrected in V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03614 2026-07-21 cs.LG cs.AI 版本更新 57%

Neural Global Optimization via Iterative Refinement from Noisy Samples

通过噪声样本迭代细化的神经全局优化

Qusay Muzaffar, David Levin, Michael Werman

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Tel Aviv University(特拉维夫大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出一种神经方法,通过迭代细化从噪声样本中寻找全局极小值,实验表明其在多模态测试函数上比传统方法有显著提升。

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19504 2026-07-21 cs.CV 版本更新 57%

FusionNet: Physics-Aware Representation Learning for Multi-Spectral and Thermal Data via Trainable Signal-Processing Priors

FusionNet:通过可训练信号处理先验对多光谱和热数据进行物理感知表示学习

Georgios Voulgaris

机构 * University of Oxford(牛津大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对水泥生产设施监测难题,提出FusionNet框架,通过整合多光谱数据,嵌入信号处理先验,经消融研究等实验验证,该框架能结合物理感知特征选择与深度学习架构,高精度检测水泥生产设施,为工业监测提供可靠框架。

Comments Accepted for publication in the IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03826 2026-07-21 q-bio.QM cs.AI 版本更新 57%

CORE -- A Cell-Level Coarse-to-Fine Image Registration Engine for Multi-stain Image Alignment

CORE——用于多染色图像对齐的细胞级粗到细图像配准引擎

Esha Sadia Nasir, Behnaz Elhaminia, Mark Eastwood, Catherine King, Owen Cain, Lorraine Harper, Paul Moss, Dimitrios Chanouzas, David Snead, Nasir Rajpoot, Adam Shephard, Shan E Ahmed Raza

机构 * Tissue Image Analytics (TIA) Centre, Department of Computer Science, University of Warwick, UK(tissue image analytics (TIA) 中心,计算机科学系,沃里克大学,英国) Department of Immunology and Immunotherapy, College of Medicine and Health, University of Birmingham, UK(免疫学与免疫治疗系,医学院与健康学院,伯明翰大学,英国) Department of Cellular Pathology, Queen Elizabeth Hospital Birmingham, UK(细胞病理学系,伯明翰女王医院,英国) Renal Unit, Queen Elizabeth Hospital Birmingham, University Hospitals Birmingham NHS Foundation Trust, UK(肾病科,伯明翰女王医院,伯明翰大学医院 NHS 基础信托,英国) Department of Applied Health Sciences, College of Medicine and Health, University of Birmingham, UK(应用健康科学系,医学院与健康学院,伯明翰大学,英国) Histofy Ltd, Coventry, UK(Histofy 有限公司,考文垂,英国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 针对多染色组织切片细胞核水平分析,提出CORE粗到细框架,粗配准利用组织掩码提取等,细粒度用形状感知模型,细胞水平用CPD估计位移场,经多数据集评估,CORE在多方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26743 2026-07-20 cs.CV 版本更新 57%

Depth-Semantic Alignment and Affinity-Guided Fusion for Structured Radar Point Cloud Generation

深度语义对齐与亲和力引导融合的结构化雷达点云生成

Amjad Hussain, Wenjie Liu, Yuchen Tan, Fuyuan Ai, Zecheng Li, Chunyi Song, Xin Qiu

机构 * Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对毫米波雷达点云稀疏、噪声大、结构不完整的问题,提出基于视觉-雷达融合的多模态点云生成方法,利用图像语义约束和稀疏补全策略提升点云质量,并在检测跟踪任务中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06479 2026-07-20 cs.RO cs.CV cs.SY eess.SY 版本更新 57%

Holistic Fusion: Task- and Setup-Agnostic Robot Localization and State Estimation with Factor Graphs

整体融合:基于因子图的与任务和设置无关的机器人定位与状态估计

Julian Nubert, Turcan Tuna, Jonas Frey, Cesar Cadena, Katherine J. Kuchenbecker, Shehryar Khattak, Marco Hutter

机构 * ETH Zürich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) NASA Jet Propulsion Laboratory(美国国家航空航天局喷气推进实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究针对移动机器人定位与状态估计问题,提出整体融合方法,通过因子图公式融合多类型测量,注重局部平滑性与一致性,能在典型硬件上实现低延迟、平滑在线估计及低漂移全局定位,在多场景验证了框架有效性。

Comments 21 pages, 25 figures, 9 tables, Transactions on Robotics, accepted

Journal ref Transactions on Robotics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13800 2026-07-17 eess.IV cs.CV 版本更新 57%

Prospective clinical indication, post-hoc report leakage, and fusion design in multi-image chest radiograph classification: a patient-clustered evaluation

多图像胸部X光片分类中的前瞻性临床指征、事后报告泄露和融合设计:患者聚类评估

Kamran Shahid, Muhammad Munwar Iqbal

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究多图像胸部X光片分类,用多种模型比较,含仅图像、仅指征等。评估不同模型在多指标下表现,发现前瞻性指征与报告目标关联大,排列感知融合有竞争力,事后报告文本存在问题,如造成报告标签循环等。

Comments 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09118 2026-07-17 cs.CV 版本更新 57%

LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data

LPCAN:用于使用RGB-D数据进行铁路表面缺陷检测的轻量级金字塔交叉注意力网络

Jackie Alex, Guoqiang Huan

机构 * St. Petersburg College(斯波伯学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对铁路表面缺陷检测方法局限,提出LPCANet,利用RGB-D数据,集成MobileNetv2等模块,经多模态融合与结构分析提升性能。在多数据集上评估效果显著,消融研究验证关键模块作用,为工业缺陷检测提供实用框架,未来将聚焦模型压缩。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12503 2026-07-16 cs.CV 版本更新 57%

DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs

DynTrace:用于多模态大语言模型中4D时空推理的动态对象证据跟踪

Rongxin Gao, Yuzhi Huang, Dongxuan Liu, Chu Li, Zhenye Wang, Jie Wu, Shuzhao Xie, Jingyan Jiang, Xinghao Ding, Xiaotong Tu, Yue Huang

机构 * Xiamen University(厦门大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型在连续动态场景感知中跟踪动态对象证据的局限,提出DynTrace框架,含DTV和DT-Token两个互补组件,能为模型提供基于几何视觉先验和结构化时空轨迹的动态对象证据,在多个基准测试中达先进水平。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05623 2026-07-16 cs.CL 版本更新 57%

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

用于IWSLT 2026指令跟随任务的NAVER LABS系统重新实现

Anand Kamble, Aniket Tathe

机构 * NAVER LABS(NAVER实验室) Florida State University(佛罗里达州立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 该研究为IWSLT 2026共享任务重新实现NAVER LABS系统,采用规定组件,保留三阶段方法,构建合成示例用于微调,其主要模型在EN-ZH语音翻译和英语SQA任务中取得了一定成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19873 2026-07-07 cs.CV 版本更新 57%

SIMPLER: Efficient Foundation Model Adaptation via Similarity-Guided Layer Pruning for Earth Observation

SIMPLER:通过相似性引导的层剪枝实现高效的地球观测基础模型适应

Víctor Barreiro, Johannes Jakubik, Francisco Argüello, Dora B. Heras

机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes (CiTIUS), Universidade de Santiago de Compostela, Spain(智能技术研究中心(CiTIUS),圣地亚哥-德孔波斯特拉大学,西班牙) Departmento de Electrónica e Computación, Universidade de Santiago de Compostela, Spain(电子与计算系,圣地亚哥-德孔波斯特拉大学,西班牙) IBM Research Europe, Zurich, Switzerland(IBM欧洲研究院,瑞士苏黎世)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 SIMPLER通过在适应前选择有效的模型深度,减少推理和部署成本,同时在无需梯度、幅度启发式或超参数调优的情况下,通过预训练视觉变换器中更深层的表示稳定性,选择冗余层,实现参数减少79%且性能保留94%,提升训练和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏