arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-07 至 2026-07-07 共收录 193 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 36 篇

2607.02928 2026-07-07 cs.LG 新提交 82%

CoFEND: A Cross-Modal Fusion End-to-End Network for Cold-Start Drug-Drug Interaction Prediction

CoFEND:用于冷启动药物-药物相互作用预测的跨模态融合端到端网络

Di Wu, Hongyi Sun, Haichao Xu, Jia Chen, Zhong Chen, Jie Yang

机构 * College of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院) Beihang University(北京航空航天大学) School of Computing, Southern Illinois University Carbondale(南伊利诺伊大学卡本代尔分校计算机学院) School of Physics and Electronic Science, Zunyi Normal University(遵义师范学院物理与电子科学学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 针对新药冷启动药物-药物相互作用预测难题,提出CMF-ELN。利用多模态信息构建知识图谱,设计图自动编码器融合跨模态相似性,采用两阶段可解释性方案,提升预测准确性与机制解释性。

Comments 11 pages, 2 figures, accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03050 2026-07-07 cs.LG cs.AI cs.CV cs.SD 新提交 81%

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

OmniFocus:用于全模态大语言模型的查询引导模态平衡令牌压缩

Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所中文信息处理实验室) University of Limerick(利默里克大学) CUHK, Shenzhen(香港中文大学(深圳))

专题命中 多模态训练与对齐 :omni-modal(title);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 研究全模态大语言模型推理成本高的问题,提出无训练的查询引导令牌压缩方法OmniFocus,独立评估音视频重要性,实现模态对称压缩,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02909 2026-07-07 cs.CV cs.AI 新提交 81%

Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models

使用层次表示正则化学习大型多模态模型的分类树

Hulingxiao He, Zhi Tan, Yuxin Peng

机构 * PKU-ICST-MIPL(北京大学信息科学技术学院多媒体信息处理实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究大型多模态模型缺乏分类知识致层次视觉识别一致性低的问题,提出层次表示正则化方法,含语义感知视觉树构建框架,结合两个互补目标,有效捕捉分类结构。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20698 2026-07-07 cs.CV cs.CL 版本更新 81%

Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs

多模态大语言模型在胃肠诊断中的临床认知对齐

Huan Zheng, Yucheng Zhou, Tianyi Yan, Dubing Chen, Hongbo Lu, Wenlong Liao, Tao He, Pai Peng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院物联网国家重点实验室) Shanghai Jiao Tong University(上海交通大学) COWARobot Co. Ltd.(COWARobot有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出CogAlign框架,通过构建层次化临床认知数据集和监督微调提升模型临床分析能力,并采用反事实强化学习消除视觉偏差,实现胃肠诊断的因果关联与高准确率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14926 2026-07-07 cs.CL cs.AI cs.LG 版本更新 81%

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models

罗马尼亚视觉语言模型的参数高效多模态指令微调

George-Andrei Dima, Răzvan-Alexandru Smădu, Dumitru-Clementin Cercel

机构 * National University of Science and Technology(科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对罗马尼亚语这种低资源语言,通过翻译并扩展Flickr30K数据集,采用参数高效的LoRA方法微调开源视觉语言模型来降低多模态NLP资源差距,模型在视觉问答等任务中能力提升且语法错误减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03959 2026-07-07 eess.IV cs.CV cs.LG 新提交 79%

Cross-Modal Fusion of OCT and OCT angiography enface for Improved Diagnostics of Diabetic Retinopathy

用于改善糖尿病视网膜病变诊断的OCT与OCT血管造影en face跨模态融合

Rashadul Hasan Badhon, Atalie Carina Thompson, Jennifer I. Lim, Theodore Leng, Minhaj Nur Alam

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对糖尿病视网膜病变精准筛查需求,提出双向跨模态注意力网络融合OCT与en face OCTA实现自动分类,实验验证该方案性能优于单模态模型,生成式OCTA可降低硬件依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05311 2026-07-07 cs.CV 新提交 79%

Deep Learning for Semen Analysis in Male Infertility: Computer Vision, Multimodal Fusion, and Clinical Translation

男性不育症精液分析深度学习技术:计算机视觉、多模态融合与临床转化

Runwei Guan, Shaofeng Liang, Jiacheng Weng, Xiaoyi Gu, Jia Weng, Daizong Liu, Duo Pan, Qingxin Zhang, Xiao Liang, Weiping Ding, Suoyu Zhu, Ming Yuan, Yanhua Fei

机构 * Department of Gynaecology and Obstetrics, The Affiliated Jiangyin Hospital of Nantong University(南通大学附属江阴医院妇产科) Department of Oncology, the Affiliated Jiangyin Hospital of Nantong University(南通大学附属江阴医院肿瘤科) Thrust of AI, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能推力实验室) FertiTech AI(生殖科技人工智能公司) Department of Oncology, Suzhou Xiangcheng People’s Hospital(苏州市相城区人民医院肿瘤科) Department of Biological Sciences and Bioinformatics, School of Science, Xi’an Jiaotong-Liverpool University(西交利物浦大学理学院生物科学与生物信息学系) School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对传统精液分析的主观性强等缺陷,综述聚焦计算机视觉与深度学习驱动的精子分析技术,梳理方法、数据集与落地障碍,提出分阶段临床转化路线。

Comments 46 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03817 2026-07-07 cs.CV 新提交 79%

Global Logic and Local Search: Dual-Stream Multimodal In-Context Learning for Verifiable Industrial Anomaly Detection

全局逻辑与局部搜索:用于可验证工业异常检测的双流多模态上下文学习

Runzhi Deng, Yundi Hu, Yiming Zhong, Zhao Wang, Xixi Liu, Hongsong Wang, Caifeng Shan, Fang Zhao

机构 * Nanjing University(南京大学) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) Southeast University(东南大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对工业异常检测难题,提出无训练框架GLLS,利用视觉逻辑图谱组织参考和规范,结合全局逻辑流与细粒度动作流,实验表明其优于基线且决策可追溯

Comments Accepted by ECCV 2026. 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31604 2026-07-07 cs.CV 版本更新 79%

Representation Forcing for Bottleneck-Free Unified Multimodal Models

表示强制:无瓶颈统一多模态模型

Yuqing Wang, Zhijie Lin, Ceyuan Yang, Yang Zhao, Fei Xiao, Hao He, Qi Zhao, Zihan Ding, Fuyun Wang, Shuai Wang, Youliang Zhang, Haoqi Fan, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出表示强制(RF)技术,通过让解码器自回归预测视觉表示作为中间令牌,再在相同骨干网络中引导像素扩散,从而消除统一多模态模型对预训练VAE的依赖,实现无瓶颈的端到端模型。

Comments Project page: https://yuqingwang1029.github.io/RepresentationForcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03750 2026-07-07 cs.LG cs.CE cs.CV eess.IV 版本更新 79%

GlaBoost: A Multimodal Structured Framework for Glaucoma Risk Stratification

GlaBoost:用于青光眼风险分层的多模态结构化框架

Cheng Huang, Zeyu Han, Weizheng Xie, Karanjit Kooner, Tsengdar Lee, Jui-Kai Wang, Jia Zhang

机构 * Department of Computer Science, Southern Methodist University(计算机科学系,南方 Methodist 大学) Department of Ophthalmology, UT Southwestern Medical Center(眼科学系,UT 南方医学中心) High Performance Computing Program, National Aeronautics and Space Administration(高性能计算计划,国家航空航天局)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对青光眼检测,提出多模态梯度提升框架GlaBoost,统一眼底图像嵌入、文本评估及生物标志物三信号预测风险,融合后用增强XGBoost分类,性能超基线且可解释。

Comments Accepted by IEEE 48th EMBC (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04079 2026-07-07 cs.CV cs.AI cs.LG 新提交 79%

Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering

看一次就够了?用于3D问答的在线几何感知令牌剪枝

Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu, Yi-Hsuan Tsai, Min Sun

机构 * National Tsing Hua University(国立清华大学) Industrial Technology Research Institute ITRI(工业技术研究院) University of Toronto(多伦多大学) Atmanity Inc(Atmanity公司)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对3D问答中多模态大语言模型推理成本高的问题,提出在线令牌剪枝方法,利用深度和相机姿态投影到体素空间,识别重叠区域并剪枝冗余令牌,减少令牌使用,提升效率和性能。

Comments published at ICLR 2026 Workshop on Efficient Spatial Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03111 2026-07-07 eess.SP 新提交 78%

Edge-Assisted Multimodal UAV Localization with Resource-Efficient Compression and Robust Fusion

基于资源高效压缩和鲁棒融合的边缘辅助多模态无人机定位

Zhong Ye, Yinghui He, Guanding Yu, Pavel Loskot

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 设计多模态无人机定位框架,利用相机、LiDAR和雷达传感模态。通过信息瓶颈压缩等模块应对传感节点资源有限、数据差异大及模态数据退化缺失等挑战,实验表明该框架能准确可靠定位无人机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03099 2026-07-07 eess.IV eess.SP 新提交 78%

AirTF: Over-the-Air Token Fusion for Task-Oriented Multi-Modal Token Communications

AirTF:面向任务的多模态令牌通信的空中令牌融合

Bole Liu, Li Qiao, Minghui Wu, Yulin Shao, Zhen Gao

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 针对车联网中高维多模态传感数据传输面临的频谱瓶颈,提出AirTF框架。利用视觉变压器编码器提取语义令牌,通过共享无线信道并发传输,利用多址信道叠加特性空中融合多模态语义,提升频谱效率。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03520 2026-07-07 cs.IT cs.NI eess.SP math.IT 新提交 78%

ATS-ToDMA: Adaptive Token Selection and Token-Domain Multiple Access for Cross-Modal Semantic Communications

ATS-ToDMA:用于跨模态语义通信的自适应令牌选择和令牌域多址接入

Sachin Kadam, Dong In Kim

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 针对语义通信系统效率问题,提出ATS-ToDMA框架,通过联合进行语义令牌选择、干扰感知调度和语义感知功率分配,引入SSINR指标,开发调度器,推导分析边界,相比基准有性能提升。

Comments 13 pages, 9 figures. Submitted to a journal, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02600 2026-07-07 eess.SP 新提交 71%

A Unified Multi-Modal Sensing and Active-Stabilization Framework for Autonomous IoT Nodes in Connectivity-Denied Environments: From Perimeter Sentinel to High-Value Cargo Protection

用于连接受限环境中自主物联网节点的统一多模态传感与主动稳定框架:从周边哨兵到高价值货物保护

Naahi Mumtaj Rihan

专题命中 多模态训练与对齐 :multi-modal(title)

AI总结 探讨连接受限环境下自主物联网节点需求,提出广义节点架构,扩展其传感与通信模态,通过复合风险指数耦合遥测与地理信息系统,统一两种部署模式并给出分析与实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04378 2026-07-07 cs.RO 新提交 71%

SurgAM: Surgical Affordance Map Prediction with Multimodal Feature Fusion for Robot Autonomy

SurgAM:用于机器人自主的多模态特征融合手术能力地图预测

Lei Song, Yonghao Long, Mengya Xu, Jiayi Geng, Xiuyuan Chen, Qi Dou

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Department of Thoracic Surgery, Peking University People’s Hospital(北京大学人民医院胸外科) Thoracic Oncology Institute, Peking University People’s Hospital(北京大学人民医院胸部肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer, Chinese Academy of Medical Sciences(中国医学科学院早期非小细胞肺癌智能诊断与治疗研究组) Institute of Advanced Clinical Medicine, Peking University(北京大学先进临床医学院) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer, Peking University People’s Hospital(北京大学人民医院肺癌大数据创新应用北京市重点实验室)

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 研究如何通过视觉数据识别手术可操作区域,提出自适应特征融合框架、分层提示学习机制和场景引导注意力解码器,建立新数据集验证,在真实模型上验证框架对下游自动化的适用性。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04098 2026-07-07 cs.CV 新提交 70%

Sparse4D-Radar: An Efficient and Robust Framework for Surround-View 3D Object Detection via 4D Radar-Camera Fusion

Sparse4D-Radar:一种通过4D雷达-相机融合实现高效且稳健的环视3D目标检测框架

Fuyuan Ai, Yuchen Tan, Jiehui Chen, Zhiwei Xu, Chunyi Song

机构 * State Key Laboratory of Ocean Sensing and Ocean College, Zhejiang University(浙江大学海洋传感与海洋学院海洋传感技术国家重点实验室) Engineering Research Center of Oceanic Sensing Technology and Equipment, Ministry of Education, Zhejiang University(浙江大学海洋传感技术与装备教育部工程研究中心) Donghai Laboratory(东海实验室) Ocean College, Institute of Marine Electronics and Intelligent Systems, Zhejiang University(浙江大学海洋学院海洋电子与智能系统研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对4D成像雷达在环视感知缺乏成熟方案的问题,提出Sparse4D-Radar框架。设计可变形融合模块等,经实验验证该框架在环视3D检测性能上达先进水平,兼顾精度、鲁棒性与效率。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03677 2026-07-07 cs.LG 版本更新 67%

Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe

Uni-OPD:基于双视角方案的统一策略内蒸馏框架

Wenjin Hou, Shangpin Peng, Weinong Wang, Zheng Ruan, Yue Zhang, Zhenglin Zhou, Mingqi Gao, Yifei Chen, Kaiqi Wang, Hongming Yang, Chengquan Zhang, Zhuotao Tian, Han Hu, Yi Yang, Fei Wu, Hehe Fan

机构 * Zhejiang University(浙江大学) Shenzhen Loop Area Institute(深圳河套学院) LLM Department, Tencent(腾讯大模型部门)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

AI总结 针对策略内蒸馏存在的信息状态探索不足、教师监督不可靠问题,提出跨大语言与多模态大模型的统一框架Uni-OPD,经多域实验验证其通用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04541 2026-07-07 cs.CV cs.AI cs.LG cs.RO 新提交 62%

CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining

CRISP:一种通过基于预测的世界模型预训练实现驾驶的时空相机-雷达主干网络

Jingyu Song, Yi Liu, Katherine A. Skinner

机构 * Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究通过基于预测的表示学习预训练时空相机-雷达主干网络CRISP,利用历史多视图图像和雷达扫描,通过预测未来激光雷达点云学习统一鸟瞰图表示,介绍相关组件,实验表明其能提升点云预测并有效迁移至下游任务。

Comments 17 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22054 2026-07-07 cs.CV cs.AI 版本更新 62%

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything:利用噪声异构源扩展度量深度预训练

Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

机构 * Li Auto Inc(李自动公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对度量深度估计扩展难题,提出MetricAnything框架,通过随机掩码创建稀疏度量提示解耦空间推理与偏差,用多样3D数据预训练,在多任务中表现出色,推动度量感知发展。

Comments Accepted to ECCV 2026. Project Page: https://metric-anything.github.io/metric-anything-io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04314 2026-07-07 eess.AS cs.SD 新提交 57%

MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing

MOSAIC:融合生物语音特征与自监督表示的可解释多令牌交叉注意力统一语音防欺骗方法

Yugwon Won

机构 * AI Security R&D Team(人工智能安全研发团队)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 eess.AS

AI总结 针对现有语音防欺骗融合方法可解释性差、跨模态学习受限问题,提出MOSAIC可解释多令牌交叉注意力框架,实现跨特征对齐可视化,在多数据集上取得优异性能。

Comments 5 pages, 2 figures. Submitted to IEEE Signal Processing Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03530 2026-07-07 cs.AI 新提交 57%

MentalThink: Shaping Thoughts in Mental SVG World

MentalThink:在心理SVG世界中塑造思想

Kangheng Lin, Jisheng Yin, Dingming Li, En Yu, Yana Wei, Han Zhou, Liang Zhao, Hongyu Zhou, Hongbo Peng, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Jingyu Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 介绍MentalThink视觉符号推理范式,核心是think-with-SVG管道,通过两阶段训练框架实例化,在空间理解和推理基准测试中性能优越,为动态视角获取等提供可视化工作区。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02568 2026-07-07 cs.CV 新提交 57%

MAGE: View-guided Point Cloud Completion with Efficient Modality Alignment and Adaptive Geometry Enhancement

MAGE:基于视图引导的点云补全,具有高效模态对齐和自适应几何增强

Weize Quan, Zhengwei Wu, Kai Wang, Dong-Ming Yan

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS研究室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) GIPSA-lab, Univ. Grenoble Alpes, CNRS, Grenoble INP(格勒诺布尔大学GIPSA实验室,法国国家科学研究中心,格勒诺布尔国立综合理工学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出统一几何感知框架,集成高效模态对齐与自适应几何增强,解决视图引导点云补全的跨模态几何不一致问题,含几何感知模态对齐等模块,实验证明性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17101 2026-07-07 cs.CL cs.LG physics.comp-ph 57%

A quantitative analysis of semantic information in deep representations of text and images

深度文本和图像表示中语义信息的定量分析

Santiago Acevedo, Andrea Mascaretti, Riccardo Rende, Matéo Mahaut, Marco Baroni, Alessandro Laio

机构 * Scuola Internazionale Superiore di Studi Avanzati (SISSA)(国际先进研究科学研究所(SISSA)) Universitat Pompeu Fabra (UPF)(庞培法拉大学(UPF)) Catalan Institute of Research and Advanced Studies (ICREA)(加泰罗尼亚研究与高级科学研究所(ICREA))

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL

AI总结 本文通过信息不平衡度分析,发现语义信息在深度模型中分布广泛,且在特定网络层具有最强的预测能力,同时揭示了语言和模型规模对表示预测性的影响。

Comments Published as a journal article at Transactions of Machine Learning Research (TMLR)

Journal ref TMLR 2026: https://openreview.net/forum?id=sBnaFSIuGR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19873 2026-07-07 cs.CV 版本更新 57%

SIMPLER: Efficient Foundation Model Adaptation via Similarity-Guided Layer Pruning for Earth Observation

SIMPLER:通过相似性引导的层剪枝实现高效的地球观测基础模型适应

Víctor Barreiro, Johannes Jakubik, Francisco Argüello, Dora B. Heras

机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes (CiTIUS), Universidade de Santiago de Compostela, Spain(智能技术研究中心(CiTIUS),圣地亚哥-德孔波斯特拉大学,西班牙) Departmento de Electrónica e Computación, Universidade de Santiago de Compostela, Spain(电子与计算系,圣地亚哥-德孔波斯特拉大学,西班牙) IBM Research Europe, Zurich, Switzerland(IBM欧洲研究院,瑞士苏黎世)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 SIMPLER通过在适应前选择有效的模型深度,减少推理和部署成本,同时在无需梯度、幅度启发式或超参数调优的情况下,通过预训练视觉变换器中更深层的表示稳定性,选择冗余层,实现参数减少79%且性能保留94%,提升训练和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06205 2026-07-07 cs.LG cs.AI 版本更新 57%

Multi-Way Representation Alignment

多向表示对齐

Akshit Achara, Tatiana Gaintseva, Mateo Mahaut, Pritish Chakraborty, Viktor Stenby Johansson, Melih Barsbey, Emanuele Rodolà, Donato Crisostomi

专题命中 多模态训练与对齐 :any-to-any(abstract);分类 cs.AI

AI总结 研究M≥3模型的表示对齐,用广义普罗克汝斯忒斯分析构建共享正交空间,指出严格等距对齐对检索非最优,提出几何校正普罗克汝斯忒斯对齐,实验表明其提升任意到任意检索并保留实用共享参考空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18176 2026-07-07 cs.CV 版本更新 57%

Atlas is Your Perfect Context: One-Shot Customization for Generalizable Foundational Medical Image Segmentation

图谱是理想上下文:用于可泛化基础医学图像分割的一次性定制

Ziyu Zhang, Yi Yu, Simeng Zhu, Ahmed Aly, Yunhe Gao, Ning Gu, Yuan Xue

机构 * Nanjing University(南京大学) The Ohio State University(俄亥俄州立大学) Stanford University(斯坦福大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究医学图像中解剖结构分割问题,提出图谱引导框架AtlasSegFM,通过图谱查询配准生成提示,用冻结基础模型细化分割,经自适应融合模块结合图谱先验与模型输入及预测,实现一次性定制。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24342 2026-07-07 cs.AI 版本更新 57%

A Unified Geometric Space for Topological Alignment Between Transformer-Based Models and Human Brain Networks

基于Transformer的模型与人脑网络之间拓扑对齐的统一几何空间

Silin Chen, Yuzhong Chen, Caiwei Wang, Zifan Wang, Junhao Wang, Zifeng Jia, Keith M Kendrick, Tuo Zhang, Lin Zhao, Dezhong Yao, Tianming Liu, Xi Jiang

机构 * The Clinical Hospital of Chengdu Brain Science Institute, MOE-K Lab for NeuroInformation, Brain‑Apparatus Communication Institute, School of Life Science and Technology, University of Electronic Science and Technology of China(成都脑科学研究院临床医院,MOE-K神经信息实验室,脑-装置通信研究所,电子科技大学生命科学与技术学院) School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) School of Computing, University of Georgia(佐治亚大学计算机学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 提出一个模态无关、任务无关的拓扑对齐空间,通过图组织属性将Transformer模型的注意力拓扑映射到人脑固有连接网络,揭示了不同模态和规模模型的连续弧形分布及对齐特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15061 2026-07-07 cs.RO cs.CV 版本更新 57%

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue

Ask-to-Clarify: 通过多轮对话解决指令歧义

Xingyao Lin, Xinghao Zhu, Tianyi Lu, Guojin Zhong, Sicheng Xie, Hui Zhang, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Mechanical Systems Control Lab, UC Berkeley, California, USA(伯克利机械系统控制实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出Ask-to-Clarify框架,通过多轮对话解决指令歧义问题,结合视觉语言模型和扩散模型,采用两阶段知识绝缘策略训练,实现多任务中更高效的协作式具身代理。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.15277 2026-07-07 cs.CV 版本更新 57%

EPMF: Efficient Perception-aware Multi-sensor Fusion for 3D Semantic Segmentation

EPMF: 高效感知感知多传感器融合用于3D语义分割

Mingkui Tan, Zhuangwei Zhuang, Sitao Chen, Rong Li, Kui Jia, Qicheng Wang, Yuanqing Li

机构 * School of Software Engineering, South China University of Technology(南方科技大学软件工程学院) Pazhou Laboratory, Guangzhou, China(广州帕佐实验室) School of Electronic and Information Engineering, South China University of Technology(南方科技大学电子与信息工程学院) Minieye, Shenzhen, Guangdong, China(深圳Minieye公司)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出一种高效感知多传感器融合方法EPMF,通过透视投影对齐点云与RGB图像,利用残差融合模块和感知损失提升3D语义分割性能,在nuScenes上mIoU超越RangeFormer 0.9%。

Comments 16 pages, 12 figures, 14 tables, IEEE TPAMI 2024, extended version of the ICCV2021 paper

详情

展开后加载摘要…

URL PDF HTML 收藏