arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-12 至 2026-05-12 共收录 32 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 32 篇

2605.10765 2026-05-12 cs.CV cs.AI cs.LG 88%

Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning

动态跨模态提示生成用于多模态持续指令微调

Tao Hu, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出DRAPE框架,通过生成连续实例特定的软提示提升多模态持续指令微调性能,采用跨模态注意力和投影梯度投影减少遗忘,实验显示优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17497 2026-05-12 cs.LG cs.AI 87%

Multimodal Representation Learning Conditioned on Semantic Relations

基于语义关系的多模态表示学习

Yang Qiao, Yuntong Hu, Bowen Zhu, Hasibul Haque, Liang Zhao

机构 * Emory University(埃默里大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.AI

AI总结 本文提出RCML框架,通过将语义关系作为显式条件,使多模态表示学习能根据不同的关系上下文生成不同表示,提升检索和分类任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29162 2026-05-12 cs.MM 85%

From Natural Alignment to Conditional Controllability in Multimodal Dialogue

从自然对齐到条件可控性在多模态对话中

Zeyu Jin, Songtao Zhou, Haoyu Wang, Minghao Tian, Kaifeng Yun, Zhuo Chen, Xiaoyu Qin, Jia Jia

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.MM

AI总结 本文提出MM-Dia数据集和MM-Dia-Bench测试集,通过多模态条件控制提升对话生成的可控性和表达性,实验表明现有框架难以复现人类交互的细腻表达。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09902 2026-05-12 cs.CV 84%

Adversarial Attacks Against MLLMs via Progressive Resolution Processing and Adaptive Feature Alignment

通过渐进分辨率处理和自适应特征对齐对多模态大语言模型进行对抗攻击

Haobo Wang, Xiaorong Ma, Weiqi Luo, Xiaojun Jia, Jiwu Huang

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出PRAF-Attack框架,通过多尺度语义指导和中间层局部对齐提升多模态大语言模型的对抗攻击转移性,实验表明其在多种黑盒MLLM上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09899 2026-05-12 cs.CV cs.AI 84%

Hyperbolic Distillation: Geometry-Guided Cross-Modal Transfer for Robust 3D Object Detection

双曲蒸馏:几何引导的跨模态迁移用于稳健的3D物体检测

Kanglin Ning, Wenrui Li, Houde Quan, Qifan Li, Xingtao Wang, Xiaopeng Fan

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Suzhou Research Institute of HIT(哈尔滨工业大学苏州研究院) PengChengLab(鹏城实验室)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HGC-Det方法,通过双曲约束跨模态蒸馏提升3D物体检测的鲁棒性,结合图像分支和点云分支,利用双曲几何特性缓解语义损失,实验表明在多个数据集上平衡了检测精度与计算成本。

Comments Current version has been subbmitted to IEEE Transactions on Multimedia. Now, this manuscript's status is Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08592 2026-05-12 cs.CV 83%

Cross-Modal RGB-D Fusion Transformer for 6D Pose Estimation of Non-Cooperative Spacecraft with Stereo-Derived Depth

用于非合作航天器6D位姿估计的跨模态RGB-D融合Transformer

Yongliang Zhen, Bo LÜ, Hang Yang, Xiaotian WU

机构 * School of Physics, Northeast Normal University(东北师范大学物理学院) Changchun Institute of Optics, Fine Mechanics and Physics, Chinese Academy of Science(长春光学精密机械与物理研究所)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出基于被动立体视觉的6D位姿估计方法,通过TSCA-Stereo网络处理空间图像中的弱纹理和强光问题,并结合跨模态Transformer融合RGB和立体深度信息,实现高精度位姿估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12286 2026-05-12 q-bio.GN cs.CL 83%

Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer

不再有间隙:通过一个分词器实现零间隙多模态整合

Yanan Li, Christina Yi Jin, Yuan Jin, Manli Luo, Tie Xu, Shuai Jiao, Wei He, Qing Zhang

机构 * Research Center for Frontier Fundamental Studies, Zhejiang Lab(前沿基础研究研究中心,浙江实验室) Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出One Tokenizer,通过统一词汇实现多模态无缝整合,克服传统架构的几何模态间隙问题,提升生物推理性能。

Comments Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10616 2026-05-12 cs.LG cs.CL cs.CV 81%

MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image

MulTaBench: 基于文本和图像的多模态表格学习基准测试

Alan Arazi, Eilam Shapira, Shoham Grunblat, Mor Ventura, Elad Hoffer, Gioia Blayer, David Holzmüller, Lennart Purucker, Gaël Varoquaux, Frank Hutter, Roi Reichart

机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) Prior Labs(Prior实验室) NVIDIA SODA Team, INRIA Saclay, Palaiseau(SODA团队,INRIA萨克莱,帕莱索) University of Freiburg(弗赖堡大学) Probabl ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 MulTaBench通过40个数据集评估多模态表格学习,强调任务特定的表示学习,展示目标感知表示在文本和图像模态中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10498 2026-05-12 cs.CV cs.AI stat.ML 81%

Simultaneous Long-tailed Recognition and Multi-modal Fusion for Highly Imbalanced Multi-modal Data

多模态数据中长尾识别与多模态融合的联合处理

Heegeon Yoon, Heeyoung Kim

机构 * Department of Industrial and Systems Engineering, Korea Advanced Institute of Science and Technology (KAIST)(工业与系统工程系,韩国科学技术院(KAIST))

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种处理长尾分布多模态数据的新框架,通过融合异质数据并利用模态特定网络增强信息,提升在长尾类不平衡场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10177 2026-05-12 cs.CV cs.AI cs.RO 81%

MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning

MTA-RL:通过多模态Transformer-based 3D affordances和强化学习实现鲁棒的城市驾驶

Guangli Chen, Dianzhao Li, Wenjian Zhong, Bangquan Xie, Ostap Okhrin

机构 * Dongguan Key Laboratory of Intelligent Equipment and Smart Industry, School of Advanced Engineering, Great Bay University(东莞智能装备与智能制造重点实验室,先进工程学院,大湾大学) Chair of Applied Statistics, Technische Universität Dresden(应用统计学教授职位,德累斯顿技术大学) Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI)(可扩展数据解析与人工智能中心(ScaDS.AI)) College of Automation, Guangdong University of Technology(自动化学院,广东技术大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MTA-RL框架,通过多模态Transformer-based 3D affordances和强化学习实现可靠的城市自动驾驶,提升样本效率和稳定性,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09262 2026-05-12 cs.CV cs.CL 81%

Reinforcing Multimodal Reasoning Against Visual Degradation

增强多模态推理以对抗视觉退化

Rui Liu, Dian Yu, Haolin Liu, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文言) University of Maryland, College Park(马里兰大学 College Park 分校) University of Virginia(弗吉尼亚大学) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出ROMA框架,通过优化动态增强多模态大语言模型对视觉退化的鲁棒性,提升在多种基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01301 2026-05-12 cs.AI cs.CL 81%

Overcoming Multi-step Complexity in Multimodal Theory-of-Mind Reasoning: A Scalable Bayesian Planner

克服多步复杂性以实现多模态理论思维推理:一种可扩展的贝叶斯规划器

Chunhui Zhang, Zhongyu Ouyang, Kwonjoon Lee, Nakul Agarwal, Sean Dae Houlihan, Soroush Vosoughi, Shao-Yuan Lo

机构 * Dartmouth College(达特茅斯学院) Honda Research Institute USA(本田美国研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种可扩展的贝叶斯理论思维规划器,通过分步贝叶斯更新分解理论思维推理,利用弱到强控制使小语言模型专精于理论思维似然估计,并将其推理行为转移给大语言模型,从而在多模态理论思维基准测试中实现4.6%的准确率提升。

Comments Accepted as a Spotlight at the 2025 Forty-Second International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09614 2026-05-12 cs.CV 79%

Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning

反射锚点用于长链多模态推理中的传播感知视觉保留

Xuan Gong, Hanbo Huang, Hao Zheng, Yiran Zhang, Wenbin Dai, Weishu Zhao, Shiyu Liang

机构 * Shanghai Jiao Tong University(上海交通大学) Lanzhou University(兰州大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出RAPO方法,通过信息论分析优化视觉传播潜力和局部分支空间,提升长链多模态推理的视觉信息保留效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09352 2026-05-12 cs.AI 79%

The Wittgensteinian Representation Hypothesis: Is Language the Attractor of Multimodal Convergence?

维特根斯坦表示假说:语言是否是多模态收敛的吸引子?

Zhaoyang Zhang, Run Shao, Dongyue Wu, Jiajie Teng, Chao Tao, Jingdong Chen, Haifeng Li

机构 * Central South University(中南大学) Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究探讨了为何不同模态的神经网络收敛于共享表示,发现语言模态对其他模态有显著方向性吸引,提出维特根斯坦表示假说。

Comments 22 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09151 2026-05-12 cs.CV 79%

MultiMedVision: Multi-Modal Medical Vision Framework

多模态医学视觉框架:MultiMedVision

Frank Li, Bardia Khosravi, Mohammadreza Chavoshi, Young Seok Jeon, Theo Dapamede, Hari Trivedi, Janice Newsome, Judy Gichoya

机构 * Emory University(埃默里大学) Yale University(耶鲁大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出MultiMedVision框架,通过稀疏视觉Transformer实现2D/3D医学影像的统一表征学习,无需模态特定适配器,在共享潜在空间中处理混合模态数据,取得2D和3D任务的竞争力表现。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08764 2026-05-12 cs.LG cs.CV eess.IV 79%

Anchoring the Eigengap: Cross-Modal Spectral Stabilization for Sample-Efficient Representation Learning

锚定特征间隙:跨模态谱稳定化以实现样本高效表征学习

Nikhil J. Dhinagar, Vidhi Chhatbar, Chirag Jagad, Pavithra Senthilkumar, Sophia I. Thomopoulos, Mahir H. Khan, Sook-Lei Liew, the ENIGMA-Stroke Recovery Working Group, Paul M. Thompson

机构 * Imaging Genetics Center, Mark & Mary Stevens Neuroimaging & Informatics Institute, Keck School of Medicine, University of Southern California(影像基因中心,马克与玛丽史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Neuroscience Graduate Program, Mark & Mary Stevens Neuroimaging & Informatics Institute, Chan Division of Occupational Science & Occupational Therapy, Biomedical Engineering, University of Southern California(神经科学研究生项目,马克与玛丽史蒂文斯神经影像与信息学研究所,查恩职业科学与职业治疗 division,生物医学工程,南加州大学)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出跨模态谱稳定化方法,通过抑制噪声主导方向并保持特征间隙,提升样本效率下的表征学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01402 2026-05-12 cs.CL cs.CV cs.LG 79%

Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression

通过强化学习为深度不平衡回归注入分布意识

Yao Du, Shanshan Song, Xiaomeng Li

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出基于组相对策略优化的分布感知强化学习框架,通过一致性相关系数奖励实现跨样本关系监督,提升长尾回归任务的分布对齐能力,在中等和少样本场景下表现优异。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09355 2026-05-12 cs.LG 78%

FLAME: Adaptive Mixture-of-Experts for Continual Multimodal Multi-Task Learning

FLAME:适应性专家混合用于连续多模态多任务学习

Xing Han, Shravan Chaudhari, Tanvi Ranade, Rama Chellappa, Suchi Saria

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 FLAME提出了一种可扩展的专家混合框架,支持多任务预训练和连续学习,通过模态特定路由器处理不同模态的任务,同时利用低秩内存子空间压缩专家知识,提升参数效率和减少灾难性遗忘。

Comments 37 pages, 25 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03606 2026-05-12 cs.AI 74%

BioBLP: A Modular Framework for Learning on Multimodal Biomedical Knowledge Graphs

BioBLP: 一个用于多模态生物医学知识图谱学习的模块化框架

Daniel Daza, Dimitrios Alivanistos, Payal Mitra, Thom Pijnenburg, Michael Cochez, Paul Groth

机构 * Vrije Universiteit Amsterdam(荷兰阿姆斯特丹自由大学) University of Amsterdam(阿姆斯特丹大学) Elsevier B.V.(埃森哲公司) Discovery Lab, Elsevier(埃森哲发现实验室)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.AI

AI总结 本文提出BioBLP框架,用于处理多模态生物医学知识图谱中的实体属性,支持不同模态的数据编码及缺失属性处理,并通过预训练策略提升训练效率,在药物-蛋白质相互作用预测任务中表现优于基线方法。

Journal ref J Biomed Semant 14, 20 (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08288 2026-05-12 cs.LG cs.AI cs.CR cs.DC 74%

UMEDA: Unified Multi-modal Efficient Data Fusion for Privacy-Preserving Graph Federated Learning via Spectral-Gated Attention and Diffusion-Based Operator Alignment

UMEDA:统一多模态高效数据融合用于隐私保护图联邦学习的谱门控注意力与扩散算子对齐

Shih-Yu Lai, Hirozumi Yamaguchi, Shang-Tse Chen, Yu-Lun Liu, Bing-Yu Chen

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,Location,Country) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,Location,Country)

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.AI

AI总结 UMEDA通过谱门控注意力和扩散算子对齐,实现多模态数据在隐私保护下的高效联邦学习,提升准确性和通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10676 2026-05-12 cs.CV cs.LG 70%

Not Blind but Silenced: Rebalancing Vision and Language via Adversarial Counter-Commonsense Equilibrium

非盲目而是被沉默:通过对抗性反常识平衡视觉与语言

Qingxin Xiao, Peilin Zhao, Yangyang Zhao, Lingwei Dang, Qingyao Wu

机构 * South China University of Technology(华南理工大学) Institute for Super Robotics (Huangpu)(机器人研究所(黄埔)) Shanghai Jiao Tong University(上海交通大学) Changsha University of Science and Technology(长沙理工大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出ACE框架,通过对抗性反常识补丁扰动视觉上下文,动态平衡语言先验与视觉信息,提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04142 2026-05-12 cs.CV cs.AI cs.LG 62%

Turning Drift into Constraint: Robust Reasoning Alignment in Non-Stationary Multi-Stream Environments

将漂移转化为约束:非稳态多流环境中的鲁棒推理对齐

Xiaoyu Yang, En Yu, Wei Duan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所) Faulty of Engineering and Information Technology(工程与信息技术学院) University of Technology Sydney(悉尼技术大学) Australia(澳大利亚)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出APO框架,通过约束满足问题解决多源推理对齐问题,实验表明其在胸片解读中鲁棒性优于现有模型,并发布CXR-MAX基准测试集。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05066 2026-05-12 cs.LG cs.AI cs.CL 62%

Capacity-Aware Inference: Mitigating the Straggler Effect in Mixture of Experts

容量感知推理:减轻混合专家中的滞后效应

Shwai He, Weilin Cai, Jiayi Huang, Ang Li

机构 * University of Maryland, College Park(马里兰大学学院公园分校) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出容量感知令牌丢弃和扩展丢弃方法,通过减少专家负载不平衡提升混合专家模型的推理效率和性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08902 2026-05-12 cs.CV cs.AI 62%

DAPE: Dynamic Non-uniform Alignment and Progressive Detail Enhancement Techniques for Improving the Performance of Efficient Visual Language Models

DAPE:动态非均匀对齐与渐进细节增强技术以提升高效视觉语言模型的性能

Mengyuan Tian, Qiyan Zhao, Yanan Wang, Da-Han Wang

机构 * The Wang Yanan Institute for Studies in Economics, Xiamen University, Xiamen 361005, China(厦门大学王文安经济研究所) Fujian Key Laboratory of Pattern Recognition and Image Understanding, School of Computer and Information Engineering, Xiamen University of Technology, Xiamen 361024, China(福建pattern识别与图像理解重点实验室,厦门理工大学计算机与信息工程学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DAPE框架,通过动态跨模态对齐和连续细节引入技术,提升高效视觉语言模型的性能,减少计算开销并提升下游任务准确性。

Comments Accepted in ICIC 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08181 2026-05-12 cs.CV cs.AI cs.LG 62%

Text-Guided Multi-Scale Frequency Representation Adaptation

基于文本的多尺度频率表示适应

Weicai Yan, Xinhua Ma, Wang Lin, Tao Jin

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FreqAdapter,通过在频域进行多尺度信号微调,结合文本信息减少信息冗余,提升多模态模型的性能与效率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10470 2026-05-12 cs.CV 57%

Adaptive Context Matters: Towards Provable Multi-Modality Guidance for Super-Resolution

适应性上下文至关重要:迈向可证明的多模态引导超分辨率

Jinyi Luo, Minghao Liu, Yifan Li, Zejia Fan, Jiaying Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出M$^3$ESR框架,通过动态模态融合提升超分辨率的泛化和语义一致性,理论分析揭示了多模态SR的优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09982 2026-05-12 cs.CV 57%

ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning

ERASE: 通过自适应两阶段令牌剪枝消除冗余视觉令牌

Yuna Lee, Kyoungho Min, Yulhwa Kim

机构 * Department of Electrical and Computer Engineering, Sungkyunkwan University, Republic of Korea(电气与计算机工程系,成均馆大学,大韩民国) Department of Semiconductor Systems Engineering, Sungkyunkwan University, Republic of Korea(半导体系统工程系,成均馆大学,大韩民国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ERASE框架,通过自适应两阶段令牌剪枝方法减少冗余视觉令牌,实验证明在85%的令牌剪枝率下,模型准确率保持在89.46%。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09243 2026-05-12 cs.AI q-bio.NC 57%

How Much is Brain Data Worth for Machine Learning?

脑数据对机器学习有多大价值?

Lane Lewis, Zhixin Wang, David Schwab, Xaq Pitkow

机构 * Neuroscience Institute, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学神经科学研究所) Department of Machine Learning, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器学习系) NSF AI Institute for Artificial and Natural Intelligence (ARNI)(国家科学基金会人工智能与自然智能研究所) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学) CUNY Graduate Center, New York, NY, USA(纽约市立大学研究生中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文通过数学建模探讨脑数据与任务数据在机器学习中的价值与交换率,分析不同条件下脑数据对模型性能的提升作用。

Comments 9 pages main text, 5 figures, 34 pages of appendix with detailed proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09173 2026-05-12 cs.LG cs.AI 57%

WavesFM: Hierarchical Representation Learning for Longitudinal Wearable Sensor Waveforms

WavesFM:纵向可穿戴传感器波形的分层表示学习

Peng Cao, Zhijian Yang, Tennison Liu, Jonathan Wang, Jiang Wu, Magdalena Proszewska, Arvind Pillai, Mingwu Gao, Amir Farjadian, Lawrence Cai, Emily Blanchard, Daniel McDuff, Pramod Rudrapatna, Matthew Thompson, Anupam Pathak, Mark Malhotra, Shwetak Patel, Dina Katabi, Paolo Di Achille, Ming-Zher Poh

机构 * Google Research(谷歌研究) MIT(麻省理工学院) University of Washington(华盛顿大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 WavesFM通过分层自监督学习框架,解决长序列生理数据处理中的高采样频率、多模态依赖和长序列长度问题,实现对局部信号语义和复杂昼夜及跨日变化的建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08985 2026-05-12 cs.CV 57%

LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?

LLaVA-UHD v4: 什么使多模态大语言模型中的高效视觉编码成为可能?

Kechen Fang, Yihua Qin, Chongyi Wang, Wenshuo Ma, Tianyu Yu, Yuan Yao

机构 * Tsinghua University(清华大学) ModelBest

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文通过 slice-based 编码和 intra-ViT 早期压缩,提升了多模态大语言模型在高分辨率图像输入中的视觉编码效率,减少 55.8% 的 FLOPs 而不牺牲下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏