arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-16 至 2026-06-16 共收录 27 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 27 篇

2606.15308 2026-06-16 cs.AI 新提交 89%

Forced Deferral: Manipulating Routing Decisions in Multimodal LLM Cascades

强制延迟:在多模态大语言模型级联中操纵路由决策

Zhongye Liu, Yaopei Zeng, Yurui Chang, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.AI

AI总结 提出强制延迟攻击(FDA),通过对抗性图像攻击降低弱模型置信度,迫使级联系统将查询路由到强模型,揭示了MLLM级联在计算分配上的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15880 2026-06-16 cs.CV cs.AI 新提交 86%

Deep Residual Injection for Full-Spectrum Forensic Signal Perception in Multimodal Large Language Models

深度残差注入:多模态大语言模型的全频谱取证信号感知

Kaiqing Lin, Zhiyuan Yan, Ruoxin Chen, Ke-Yue Zhang, Yue Zhou, Caiyong Piao, Bin Li, Taiping Yao, Bo Wang, Youchang Xiao, Shouhong Ding

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在取证中难以同时保留语义知识和捕获低级生成器伪影的问题,提出Deep-VRM方法,通过将伪影特定视觉信号作为残差路径注入中间层,实现全频谱信号感知,达到鲁棒检测性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16354 2026-06-16 cs.CV 新提交 83%

GraphBEV++: Multi-Modal Feature Alignment for Autonomous Driving

GraphBEV++: 自动驾驶中的多模态特征对齐

Ziying Song, Caiyan Jia, Lin Liu, Shaoqing Xu, Lei Yang, Yadan Luo

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院,交通数据挖掘与具身智能北京市重点实验室) School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) University of Macau(澳门大学) Nanyang Technological University(南洋理工大学) The University of Queensland(昆士兰大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对自动驾驶中BEV感知的特征未对齐问题,提出GraphBEV++框架,通过局部对齐(LocalAlign-v2)和全局对齐(GlobalAlign-v2)模块,利用图匹配、可变形偏移和扩散去噪方法,在多种基准上实现最优性能。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15038 2026-06-16 cs.AI 新提交 83%

Fusion is not one-size-fits-all: Cross-Modal Representation Alignment for Time-to-Event Modeling

融合并非一刀切:用于时间-事件建模的跨模态表示对齐

Zhemin Zhang, Weijie Chen, David Le, Amara Tariq, Alex Wallace, Matthew Stib, Juan Maria Farina, Chadi Ayoub, Reza Arsanjani, Imon Banerjee

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 针对多模态临床数据中的模态不平衡和分布偏移问题,提出一种基于基础模型的跨模态对齐框架,通过四种融合策略在CT影像和纵向EHR数据间进行表示对齐,在肺栓塞死亡率和心血管疾病结局预测任务上验证了融合的有效性,并首次系统分析了时间-事件预测中的模态不平衡对融合行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15796 2026-06-16 cs.CV 版本更新 83%

Cross-Modal Registration Between 3D and 2D Fingerprints via Pose-Aware Unwrapping and Point-Cloud Fusion

通过姿态感知解缠和点云融合实现3D与2D指纹的跨模态注册

Xiongjun Guan, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出统一框架,实现3D指纹预处理与跨接触式和非接触式2D指纹的注册,结合非参数可视化解缠、点云融合、姿态归一化和姿态感知注册策略,提升3D与2D指纹兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14752 2026-06-16 cs.CV cs.AI cs.LG cs.RO 新提交 81%

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer: 一种用于视觉-语言-动作预训练的多模态动作分词器

Miracle Kang, Lights Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Sylas Chen, Shawn Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

机构 * Square Robot City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出X-Tokenizer,通过语义残差量化(SRQ)和掩码动作建模(MAM)将动作离散化为语义接口,在2.4M轨迹上预训练后提升VLA模型的多模态接地和长程任务性能。

Comments Project page: https://x-square-robot.github.io/X-Tokenizer_projectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06035 2026-06-16 cs.AI cs.CL 版本更新 81%

Attention, not scale, drives human-AI alignment in multimodal language prediction

注意力,而非规模,驱动多模态语言预测中的人机对齐

Viktor Kewenig, Andrew Lampinen, Samuel A. Nastase, Christopher Edwards, Quitterie Lacome D'Elascombe, Akilles Rechardt, Jeremy I Skipper, Gabriella Vigliocco

机构 * Psychology and Language Science, Experimental Psychology, University College London, London, UK(心理学与语言科学、实验心理学,伦敦大学学院,伦敦,英国) Google Deepmind, Mountain View, US(谷歌DeepMind,山景城,美国) Princeton Neuroscience Institute, Princeton University, Princeton, NJ, USA(普林斯顿神经科学研究所,普林斯顿大学,普林斯顿,新泽西州,美国) Computer Science Department, Exeter University(计算机科学系,埃克塞特大学)

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过比较五种视觉-语言模型与600名人类在视觉世界范式中的表现,发现添加视觉上下文显著提升模型与人类在预测评分上的一致性,且注意力机制而非模型规模是主要驱动因素。

Comments 39 pages, 6 Figures, published in NPJ Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16067 2026-06-16 cs.CV 新提交 79%

Stepwise Token Selection for Efficient Multimodal Large Language Models

逐步令牌选择用于高效多模态大语言模型

Landi He, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出一种基于指针机制的逐步视觉令牌选择方法,通过可微松弛实现端到端训练,动态决定保留令牌数量,在去除88.9%令牌时保持94.6%准确率并加速1.88倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15597 2026-06-16 cs.CV 新提交 79%

Fusion-E2Pulse: A Multimodal Event-RGB Fusion Network for Non-contact Pulse Wave Reconstruction

Fusion-E2Pulse:一种用于非接触式脉搏波重建的多模态事件-RGB融合网络

Qian Feng, Hao Guo, Yan Niu, Zhenhuan Xu, Yidi Li

机构 * College of Computer Science and Technology(计算机科学与技术学院) Taiyuan University of Technology(太原科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出Fusion-E2Pulse多模态融合网络,利用RGB信号结构先验抑制运动伪影,结合事件流高灵敏度恢复细粒度形态细节,在脉搏波重建中实现噪声抑制与形态保真度的最佳平衡。

Comments Accepted by MICCAI 2026. The final version will appear in the official MICCAI proceedings published by Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08597 2026-06-16 cs.AI 版本更新 79%

An Attention Mechanism for Robust Multimodal Integration in a Global Workspace Architecture

全局工作空间架构中用于鲁棒多模态集成的注意力机制

Roland Bertin-Johannet, Lara Scipio, Leopold Maytié, Rufin VanRullen

机构 * CerCo, CNRS, Université de Toulouse(CerCo、CNRS、图卢兹大学) ANITI, Artificial and Natural Intelligence Toulouse Institute(ANITI、图卢兹人工智能与自然智能研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出一种轻量级自上而下的模态选择器,在冻结的多模态全局工作空间上运行,通过注意力机制提升系统在模态噪声或缺失下的鲁棒性,并在两个数据集上验证了其高效性和可迁移性。

Comments 21 pages, 6 figures, 2 tables. Accepted at ICANN 2026. Code: https://github.com/RolandBERTINJOHANNET/GW_attention

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07920 2026-06-16 cs.CV 版本更新 79%

RLPR: Radar-to-LiDAR Place Recognition via Two-Stage Asymmetric Cross-Modal Alignment for Autonomous Driving

RLPR:面向自动驾驶的两阶段非对称跨模态对齐雷达-激光雷达地点识别

Zhangshuo Qi, Jingyi Xu, Luqi Cheng, Shichen Wen, Guangming Xiong

机构 * Beijing Institute of Technology(北京理工大学) Shanghai Jiaotong University(上海交通大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出RLPR框架,通过双流网络提取结构特征,并利用两阶段非对称跨模态对齐策略,实现雷达与激光雷达之间的鲁棒地点识别,在四个数据集上达到最优性能。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16234 2026-06-16 cs.CV cs.AI 新提交 73%

Propagating Structural Guidance: Synthesizing Fluorescein Angiography from Fundus Images and Sparse OCT Scans

传播结构引导:从眼底图像和稀疏OCT扫描合成荧光素血管造影

Tengfei Ma, Ruiqi Wu, Chenran Zhang, Ye Geng, Na Su, Xiangyuan Duanmu, Tao Zhou, Yi Zhou, Wen Fan

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室) Tianyuan Honors School, Nanjing Medical University(南京医科大学天元荣誉学院) Nanjing University of Science and Technology(南京理工大学) Department of Ophthalmology, The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院眼科)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出从彩色眼底照片(CFP)和稀疏OCT扫描合成荧光素血管造影(FFA)的框架,通过空间对齐跨模态融合和令牌级对比学习,实现非侵入性FFA合成,提升下游诊断性能。

Comments Accepted to MICCAI 2026 (Early Accept)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16158 2026-06-16 cs.CV cs.CL 新提交 73%

Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding

必要时聚焦:用于无训练视觉定位的自适应路由与协作定位

Yifan Wang, Peiming Li, Shiyu Li, Zhiyuan Hu, Xiaochen Yang, Wenming Yang, Yang Tang, Zheng Wei

机构 * East China University of Science and Technology(华东理工大学) Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出LazyMCoT动态框架,通过自适应路由评估不确定性,对简单查询跳过处理,对困难样本利用协作定位模块进行两阶段精炼,在提升推理精度的同时降低平均推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15284 2026-06-16 eess.SP cs.AI cs.LG 新提交 70%

CAP: Towards PPG Universal Representation Learning with Patient-level Supervision

CAP:面向患者级监督的PPG通用表示学习

Chenyang He, Xinyi Shao, Shun Huang, Bosong Huang, Daoqiang Zhang, Ming Jing, Cheng Ding

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Peking University(北京大学) Independent Researcher(独立研究者) Jinling Clinical Medical College College of Artificial Intelligence Nanjing University of Aeronautics and Astronautics(金陵临床医学院人工智能学院南京航空航天大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出CAP方法,通过构建大规模PPG-EHR多模态数据集和跨模态对比对齐,学习患者级临床语义的PPG表示,在四项下游任务中平均提升26.7%,呼吸率预测提升87.6%。

Comments Accepted as an Oral presentation at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15104 2026-06-16 cs.CV 新提交 70%

Text-Driven Fusion for Infrared and Visible Images: Achieving Image Scene Adaptation on Hyperbolic Space

红外与可见光图像的文本驱动融合:在双曲空间实现图像场景自适应

Huan Kang, Hui Li, Tianyang Xu, Tao Zhou, Xiao-Jun Wu, Josef Kittler

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出一种文本驱动的红外与可见光图像融合框架,利用双曲流形学习嵌入层次语义,通过BLIP文本提示引导视觉-属性对齐,实现无文本输入的自适应融合,性能优于现有方法。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10005 2026-06-16 cs.CV 版本更新 70%

TUNI: Unifying Pre-training and Fine-tuning with Modality-Aware Mutual Learning and Rectification for RGB-T Semantic Segmentation

TUNI:基于模态感知互学习和矫正的RGB-T语义分割统一预训练与微调框架

Xiaodong Guo, Xianda Guo, Tong Liu, Zhihong Deng, Yanlun Peng, Xiang Li, Wujie Zhou

机构 * School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) School of Computer Science, Wuhan University(计算机学院,武汉大学) Great Wall Motor(长城汽车) School of Information and Electronic Engineering, Zhejiang University of Science and Technology(信息电子工程学院,浙江理工大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出TUNI框架,通过模态感知互学习与矫正统一预训练和微调,解决RGB-T语义分割中多模态特征提取融合、模态依赖不平衡及热信息利用不足问题,在五个数据集上优于15种SOTA模型。

Comments This paper is an extended version of the authors' work previously presented at the ICRA conference. To appear in IEEE Transactions on Circuits and Systems for Video Technology. DOl: 10.1109/TCSVT.2026.3701706

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15129 2026-06-16 cs.CV cs.AI 新提交 62%

EyeMVP: OCT-Informed Fundus Representation Learning via Paired CFP--OCT Pretraining

EyeMVP: 通过配对CFP-OCT预训练实现OCT启发的眼底表征学习

Zhuo Deng, Ruiheng Zhang, Ziheng Zhang, Weihao Gao, Yitong Li, Qian Wang, Lei Shao, Jiaoyue Dong, Zhixi Zeng, Lijian Fang, Haibo Wang, Xiaobin Lin, Tao Liu, Zhicheng Du, Zhengwei Zhang, Lin Yang, Zheng Gong, Xinyu Zhao, Zhenquan Wu, Fang Li, Zhiguang Zhou, Guoming Zhang, Sun Jing, Han Lv, Wenbin We, Lan Ma

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Beijing Tongren Eye Center, Beijing Tongren Hospital, Capital Medical University(首都医科大学附属北京同仁医院北京同仁眼科中心) Liangxiang Hospital of Beijing Fangshan District, Capital Medical University(首都医科大学北京市房山区良乡医院) The Third People's Hospital of Dalian(大连市第三人民医院) National Clinical Research Center for Endocrine and Metabolic Diseases, The Second Xiangya Hospital of Central South University(中南大学湘雅二医院国家内分泌代谢病临床医学研究中心) The Central Hospital of Baoji City(宝鸡市中心医院) Wuxi No.2 People's Hospital, Affiliated Wuxi Clinical College of Nantong University(南通大学附属无锡临床学院无锡市第二人民医院) Shenzhen Eye Hospital, Southern Medical University(南方医科大学深圳眼科医院) Beijing Friendship Hospital, Capital Medical University(首都医科大学附属北京友谊医院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出跨模态视网膜基础模型EyeMVP,利用配对CFP-OCT预训练,通过跨模态掩码重建将OCT结构信息注入CFP表征,在16项下游任务中优于现有模型,尤其对黄斑疾病诊断有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10157 2026-06-16 cs.CV cs.CL 版本更新 62%

MolSight: Molecular Property Prediction with Images

MolSight: 基于图像的分子属性预测

Aaditya Baranwal, Akshaj Gupta, Yogesh S Rawat, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学) Birla Institute of Technology and Science(比拉理工学院和科学学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 MolSight首次系统研究基于视觉的分子属性预测,通过10种视觉架构和7种预训练策略,在10个下游任务中展示性能,提出化学引导课程提升效果,以更低的FLOPs实现优异结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16843 2026-06-16 cs.CL 新提交 57%

Data-Driven Decoding of Russell's Circumplex Model of Affect

基于数据驱动的Russell情感环状模型解码

Amdjed Belaref, Samir Sadok, Zineb Noumir, Renaud Seguier

机构 * Alten CentraleSupélec IETR UMR CNRS 6164(中央理工-高等电力学院 IETR CNRS 6164 联合研究单位) Inria at Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化研究所,格勒诺布尔阿尔卑斯大学,CNRS,LJK)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文研究Transformer嵌入是否恢复Russell环状模型的几何规律,通过文本和语音模型实验,发现多模态融合完美对齐情感排序,零样本下细粒度情感词接近人类映射坐标。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16756 2026-06-16 cs.CV 新提交 57%

3D Classification of Paramagnetic Rim Lesions in Multiple Sclerosis via Asymmetric QSM-FLAIR Modeling

多发性硬化症中顺磁性边缘病变的3D分类:基于非对称QSM-FLAIR建模

Veronica Pignedoli, Giacomo Boffa, Nicoletta Noceti, Matilde Inglese, Francesca Odone, Matteo Moro

机构 * MaLGa, DIBRIS, University of Genova(热那亚大学) DINOGMI, University of Genova(热那亚大学) IRCCS Azienda Ospedaliera Metropolitana(IRCCS大都会医院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出一种3D多模态深度学习框架,利用非对称QSM-FLAIR建模对多发性硬化症中的顺磁性边缘病变进行自动分类,通过自监督预训练和对比正则化提升有限数据下的鲁棒性,在88名患者队列中验证了有效性。

Comments 10 pages, 3 figures, accepted at MICCAI 2026. Github link: https://github.com/veronicapignedoli/FRODO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16474 2026-06-16 cs.CV cs.RO 新提交 57%

MVOFormer: Flow-Semantic Transformer for Robust Monocular Visual Odometry

MVOFormer:用于鲁棒单目视觉里程计的流-语义Transformer

Jituo Li, Shunwang Sun, Jialu Zhang, Xinqi Liu, Jinyao Hu, Zhicheng Lu, Sajad Saeedi, Guodong Lu

机构 * State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室) Zhejiang Key Laboratory of Industrial Big Data and Robot Intelligent Systems(浙江省工业大数据与机器人智能系统重点实验室) School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) Robotics Institute, Zhejiang University(浙江大学机器人研究院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Rural Health Research Institute, Charles Sturt University(查尔斯特大学农村健康研究所) University College London(伦敦大学学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出MVOFormer,一种流-语义双分支编码器与迭代多模态解码器结合的Transformer框架,通过融合密集几何运动与语义先验实现粗到细位姿优化,在零样本泛化上显著超越现有方法。

Comments 8 pages, 6 figures. Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14808 2026-06-16 eess.IV cs.CV cs.IT math.IT 新提交 57%

Explainable Task-Oriented Token Communication for AI-Native 6G Networks

面向AI原生6G网络的可解释任务导向Token通信

Feibo Jiang, Lei Mao, Li Dong, Kezhi Wang, Cunhua Pan, Jiangzhou Wang

机构 * IEEE

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出ET-TokenCom框架,通过跨模态注意力融合视觉Token与任务Token,实现可解释的任务导向图像通信,解决Token表示不足、协作差和可解释性低的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02877 2026-06-16 cs.CV 版本更新 57%

Pathway-Structured Privileged Distillation for Deployable Computational Pathology

面向可部署计算病理学的通路结构特权蒸馏

Yongxin Guo, Hao Lu, Onur Koyun, Muhammet Demir, Metin Gurcan

机构 * School of Medicine, Wake Forest University(威克森林大学医学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出MoPE框架,通过通路索引病理专家和记忆使用对齐,将多模态学习转化为仅组织学推理的特权蒸馏,提升全切片图像推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18227 2026-06-16 cs.LG cs.AI 版本更新 57%

Token Reduction Should Go Beyond Efficiency in Generative Models -- From Vision, Language to Multimodality

Token缩减应超越生成模型中的效率——从视觉、语言到多模态

Zhenglun Kong, Yize Li, Fanhu Zeng, Lei Xin, Shvat Messica, Xue Lin, Pu Zhao, Manolis Kellis, Hao Tang, Marinka Zitnik

机构 * Harvard University(哈佛大学) Northeastern University(东北大学) CAS(中国科学院) Wuhan University(武汉大学) MIT(麻省理工学院) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Token缩减应超越传统效率优化,成为生成模型的基础原则,通过减少冗余token来促进多模态融合、缓解幻觉、维持长输入连贯性并提升训练稳定性。

Comments Project page: https://github.com/ZLKong/Awesome-Collection-Token-Reduction

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00107 2026-06-16 cs.LG cs.AI eess.SP 版本更新 57%

Virtual Sensing to Enable Real-Time Monitoring of Inaccessible Locations & Unmeasurable Parameters

虚拟传感实现不可达位置与不可测参数的实时监测

Kazuma Kobayashi, Farid Ahmed, Jaewan Park, Subhankar Sarkar, Souvik Chakraborty, Syed Bahauddin Alam

机构 * Plasma & Radiological Engineering Department, Grainger College of Engineering, Nuclear, University of Illinois Urbana-Champaign(等离子体与辐射工程系,格拉inger工程学院,核能,伊利诺伊大学厄巴纳-香槟分校) Mechanical Science and Engineering Department, Grainger College of Engineering, University of Illinois Urbana-Champaign(机械科学与工程系,格拉inger工程学院,伊利诺伊大学厄巴纳-香槟分校) National Center for Supercomputing Applications, Urbana, IL, USA(国家超级计算应用中心,伊利诺伊州厄巴纳,美国) Department of Applied Mechanics, Indian Institute of Technology Delhi, New Delhi, India(应用力学系,印度理工学院德里,新德里,印度) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(Yardi人工智能学院,印度理工学院德里)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 针对能量系统中物理传感器无法部署的实时监测问题,提出基于神经算子的虚拟传感框架MIMONet,将稀疏边界测量映射到内部场,在多种热流体系统中实现亚毫秒级高精度推理。

Comments New analysis and results are added

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17010 2026-06-16 cs.LG 新提交 50%

From Tokens to Policy: Causal and Interpretable Heterogeneous Treatment Effects Identification

从令牌到策略:因果且可解释的异质性处理效应识别

Riccardo Cadei, Frank Otchere, Nyasha Tirivayi, Gustavo Angeles Tagliaferro, Falco J. Bargagli-Stoffi, Francesco Locatello

机构 * ISTA UNICEF(联合国儿童基金会) UCLA(加州大学洛杉矶分校)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 提出NEXIS方法,利用多模态预处理表示将HTE识别转化为马尔可夫毯发现问题,实现因果可解释的异质性处理效应识别,并在非洲反贫困项目中验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15221 2026-06-16 cs.CR 新提交 50%

Robust and Precise Application Fingerprinting on 5G Physical Uplink Channel

5G物理上行链路上的鲁棒且精确的应用指纹识别

Yu Li, Liqi Zhuang, Dong Wei, Jiwen Luo, Hang Zhang, Meng Zhang, Xiaona Li, Weiqing Huang

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 针对5G加密控制信道打破传统攻击链的问题,本文发现物理层侧信道(上行MCS稳定导致PRB数量反映IP包长度),结合上行控制信道重构双向流量,设计了三步被动攻击Crosshair,通过盲提取、数据增强和跨模态对齐实现高精度应用识别。

详情

展开后加载摘要…

URL PDF HTML 收藏