arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 502 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 502 篇

2606.31982 2026-07-01 cs.CV 新提交 57%

ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs

ERA:基于熵引导的视觉令牌剪枝与修正注意力机制的高效多模态大语言模型

Yuhao Wang, Mu Qiao, Haiwen Diao, Yunzhi Zhuge, Pingping Zhang, Xindong Zhang, Lei Zhang, Huchuan Lu

机构 * School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) S-Lab, Nanyang Technological University(南洋理工大学S-Lab) OPPO Research Institute(OPPO研究院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出ERA框架,通过熵引导的视觉令牌剪枝和修正注意力机制,解决令牌减少导致的注意力对数坍塌问题,实现高效多模态大语言模型推理加速。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31800 2026-07-01 cs.AI 新提交 57%

Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision

Evo-PI:通过演化原则引导的对齐医学推理

Xianda Zheng, Huan Gao, Meng-Fen Chiang, Michael Witbrock, Kaiqi Zhao, Shangyang Li

机构 * School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) Beijing University of Posts and Telecommunications(北京邮电大学) Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) National Yang Ming Chiao Tung University(国立阳明交通大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出Evo-PI框架,将推理原则作为可演化的语言监督信号,通过协同进化循环动态调整模型推理,在医学视觉问答中提升准确率最高达24.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31136 2026-07-01 cs.CV 新提交 57%

FROST: Training-Free Few-Shot Segmentation with Frozen Features and Nonparametric Statistics

FROST:基于冻结特征和非参数统计的无训练少样本分割

Junghwan Park

机构 * TelePIX

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出FROST,一种无训练少样本分割方法,将参考前景和背景视为冻结DINOv3特征单位球上的点云,通过非参数密度比标记查询像素,在遥感基准上超越现有方法。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30936 2026-07-01 cs.LG astro-ph.EP astro-ph.IM cs.AI 新提交 57%

Physics-informed Conditional Normalizing Flows for Angles-only Cislunar Orbit Determination

基于物理信息的条件归一化流用于仅角度地月空间轨道确定

Walther Litteri, Massimiliano Vasile

机构 * University of Strathclyde(斯特拉斯克莱德大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出使用条件归一化流从短弧角度测量中推断地月空间初始状态的后验分布,结合物理信息采样并通过非线性最小二乘优化提供经典算法的热启动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27313 2026-07-01 cs.CV 新提交 57%

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

ViQ: 任意分辨率下的文本对齐视觉量化表示

Xumin Yu, Zuyan Liu, Zhenyu Yang, Yuhao Dong, Shengsheng Qian, Jiwen Lu, Han Hu, Yongming Rao

机构 * Tencent HY Vision Team(腾讯HY视觉团队) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Chinese Academy of Sciences(中国科学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出ViQ框架,通过文本对齐预训练和特征离散化两阶段量化学习,平衡离散表示中的语义与细节,支持原生分辨率输入,在多模态任务中取得与连续高维特征编码器相当的性能,并实现20%-70%的训练加速。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27773 2026-06-29 cs.CV 新提交 57%

ModaFlow: Modality-Aware Flow Matching for High-Fidelity Virtual Try-On

ModaFlow: 模态感知流匹配实现高保真虚拟试穿

Xiangyu Sai, Meysam Madadi, Sergio Escalera, Yong Xu

机构 * South China University of Technology(华南理工大学) Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) Guangdong Provincial Key Laboratory of Multimodal Big Data Intelligent Analysis(广东省多模态大数据智能分析重点实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出ModaFlow框架,通过模态感知引导、正则化损失和掩码操作策略,在虚拟试穿中实现衣物细节与人体几何的精确对齐,FID降低约30%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27084 2026-06-26 cs.CV eess.IV 新提交 57%

Pseudo-Text-Conditioned 3D Grounding DINO for Organ Localization in Abdominal CT

伪文本条件3D Grounding DINO用于腹部CT器官定位

Siqi Chen, Han Gong, Keyi Hou, Jingxuan Yang, Sheethal Bhat, Andreas Maier

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出CT-3GDINO,一种轻量级3D检测器,通过冻结伪文本类令牌替代真实文本编码器,实现腹部CT中五个器官的定位,在193个体积上达到0.5830 mAP。

Comments 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26849 2026-06-26 cs.CV 新提交 57%

Liquid Fusion of Heterogeneous Representations Towards General Salient Object Detection

异构表示的液态融合用于通用显著目标检测

Ke Chen, Ling Zhou, Guangqi Jiang, Gengshen Wu, Yi Liu, Shoukun Xu

机构 * School of Computer Science and Artificial Intelligence, Changzhou University(常州大学计算机科学与人工智能学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出液态融合网络(LFNet),通过动态门控机制融合SSM(VMamba)和CNN(ConvNeXt)的异构表示,并设计显著引导上采样(SGU)算子,在五个任务上实现SOTA性能。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26812 2026-06-26 cs.CV 新提交 57%

Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interaction

恶劣天气下的多模态图像融合:掩码引导的特征恢复与交互

Xilai Li, Xiaosong Li, Haishu Tan, Tao Ye, Huafeng Li, Hongbin Wang

机构 * Foshan University(佛山大学) China University of Mining and Technology, Beijing(中国矿业大学(北京)) Kunming University of Science and Technology(昆明理工大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出一种掩码引导的多模态图像融合方法,通过伪真实标签和掩码生成机制同时实现特征恢复与跨模态交互,在合成和真实数据集上超越现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25319 2026-06-25 cs.CV 新提交 57%

V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning

V-Zero: 无答案标签的在线策略蒸馏与对比证据门控用于细粒度视觉推理

Haoxiang Sun, Zhihang Yi, Langxuan Deng, Yuhao Zhou, Peiqi Jia, Jian Zhao, Li Yuan, Jiancheng Lv, Tao Wang

机构 * SCU(四川大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出V-Zero框架,通过对比证据门控评估学生采样轨迹,无需答案标签即可实现细粒度视觉推理的在线策略蒸馏,训练速度比监督微调快5倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24960 2026-06-25 cs.LG cs.AI 新提交 57%

Enhancing Clinician Decision-Making via Uncertainty-Aware Multi-Expert Fusion for Stroke Rehabilitation

通过不确定性感知的多专家融合增强中风康复中的临床决策

Tamim Ahmed, Thanassis Rikakis

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出xAARA引擎,利用动态贝叶斯网络和熵门控融合多模态模型,为中风康复提供带校准不确定性和解释的ARAT评估,实现高准确率并减少不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24092 2026-06-24 cs.CV 新提交 57%

Progressive Pixel-Neighborhood Deformable Cross-Attention for Multispectral Object Detection

渐进式像素邻域可变形交叉注意力用于多光谱目标检测

Tian Qiu, Jifeng Shen, Xin Zuo

机构 * School of Electrical and Information Engineering, Jiangsu University(江苏大学电气与信息工程学院) School of Computer Science and Engineering, Jiangsu University of Science and Technology(江苏科技大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出PNAFusion,通过像素邻域交叉注意力和自适应可变形对齐模块,渐进式优化多光谱特征融合,在多个数据集上达到高精度并降低计算开销。

Comments Accepted by Sensors

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23724 2026-06-24 cs.IR cs.CL cs.HC 新提交 57%

EvidenceLens: A Claim-Evidence Matrix for Auditing Financial Question Answering

EvidenceLens: 用于审计金融问答的声明-证据矩阵

Fengchen Gu, Xiaotian Ren, Zhengyong Jiang, Zhilu Zhang, Ángel F. García-Fernández, Angelos Stefanidis, Mian Zhou, Huakang Li, Jionglong Su

机构 * 1 School of AI Advanced Computing, XJTLU Entrepreneur College (Taicang), Xi’an Jiaotong-Liverpool University, Suzhou, Jiangsu, China 2 ETSI de Telecomunicaci\' o n, Universidad Polit\' e cnica de Madrid, Madrid, Spain IEEE VIS 2026 conditionally accepted version

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 提出EvidenceLens,一种将金融问答视为声明-证据对齐问题的可视化分析工具,通过多模态声明-证据矩阵揭示覆盖、矛盾与模态不平衡,帮助分析师区分有依据的声明与过度自信的综合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21690 2026-06-24 cs.CR cs.CL cs.LG 新提交 57%

A Hybrid, Multi-Layered Pipeline for Phishing and Threat Classification: Independently Validated URL and NLP Engines with a Calibrated Multi-Channel Fusion Stage

用于钓鱼和威胁分类的混合多层管道:独立验证的URL和NLP引擎与校准的多通道融合阶段

Saifelden M. Ismail, Aser O. Ibrahim, Omar A. Mahmoud

机构 * Department of Communications and Information Engineering(通讯与信息工程系) Zewail City of Science and Technology(泽瓦尔科学与技术城)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 提出一种混合管道,分别对URL和文本模态使用独立引擎评分并融合结果,在10,677封邮件基准测试中达到F1=0.914,并将真实垃圾邮件误报率降至3.6%。

Comments Graduation project, Zewail City of Science and Technology. Code and documentation: https://github.com/XHCFS/cybersiren. Whole-system fusion results use proxy URL and header channels; treat integrated metrics as preliminary

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21885 2026-06-23 cs.LG cs.AI 新提交 57%

Cohort-Anchored Foundation Models for Electronic Health Records: From Risk Scores to Auditable Peer Cohorts

基于队列锚定的电子健康记录基础模型:从风险评分到可审计的同行队列

Kaiping Zheng

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出CAFM框架,将患者队列作为一等对象融入学习流程,通过四个阶段提升数据质量、组织表示并支持可审计决策,以解决基础模型在临床部署中的可解释性、分布偏移和临床对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19944 2026-06-19 cs.CV 新提交 57%

Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models

Timage: 一种用于微调视觉语言模型的文本嵌入图像生成范式

Yifeng Wu, Huimin Huang, Ruiluo Wu, Chunyi Lin, Guanhua Chen, Xian Wu, Wang Song, Ruize Han

机构 * Fudan University(复旦大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Tencent Jarvis Lab(腾讯贾维斯实验室) Southern University of Science and Technology(南方科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出Timage范式,通过约束薛定谔桥将查询文本作为排版覆盖层嵌入图像,以显式空间锚点引导模型关注,在不侵蚀骨干能力前提下提升细粒度空间推理性能。

Comments ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19277 2026-06-18 cs.CV 新提交 57%

A Unified Framework for Efficient Remote Sensing Visual Question Answering: Adapting Dual, Hybrid, and Encoder-Decoder Architectures

高效遥感视觉问答的统一框架:适配双编码器、混合架构和编码器-解码器架构

Timothy Agboada, Shikha Chandel, Yadav Raj Ghimire, Leila Hashemi-Beni

机构 * Computational Data Science and Engineering(计算数据科学与工程) College of Science and Technology(科学与技术学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出RS Adapter参数高效微调策略,在三种视觉语言模型架构上注入轻量瓶颈适配器,仅用不到5%可训练参数实现遥感VQA,混合架构FLAVA在多模态推理与检索间取得最佳平衡。

Comments 4 pages, 2 figures, accepted and to be presented at 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2026), scheduled for 9 to 14 August 2026 in Washington D.C

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18072 2026-06-17 eess.AS 新提交 57%

One-Step Token-to-Waveform Generation with MeanFlow in Latent Space

基于潜在空间中MeanFlow的一步式Token到波形生成

Zheqi Dai, Guangyan Zhang, Zhen Ye, Jingyu Li, Haolin He, Chunyat Wu, Yiwen Guo, Qiuqiang Kong

专题命中 多模态训练与对齐 :multimodal(abstract);分类 eess.AS

AI总结 提出MeanFlow在高度压缩潜在空间中实现一步式Token2Wav生成,解决多步流匹配解码器的速度-质量权衡,RTF提升17倍且质量损失可忽略。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17921 2026-06-17 cs.MM 新提交 57%

OlfactProfile: Profile-Conditioned Odor Prediction from Audiovisual Content

OlfactProfile: 基于用户嗅觉特征从视听内容预测气味

Zhengyu Lou, Bosheng Qin, Yanan Wang, Duanduan Yin, Wentao Ye, Yu Xin

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.MM

AI总结 提出OlfactProfile框架,通过结构化场级用户嗅觉特征调制,实现从视听内容预测气味,优于基线模型和通用多模态大模型,在背景气味和情感气味预测上提升显著。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16843 2026-06-16 cs.CL 新提交 57%

Data-Driven Decoding of Russell's Circumplex Model of Affect

基于数据驱动的Russell情感环状模型解码

Amdjed Belaref, Samir Sadok, Zineb Noumir, Renaud Seguier

机构 * Alten CentraleSupélec IETR UMR CNRS 6164(中央理工-高等电力学院 IETR CNRS 6164 联合研究单位) Inria at Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化研究所,格勒诺布尔阿尔卑斯大学,CNRS,LJK)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文研究Transformer嵌入是否恢复Russell环状模型的几何规律,通过文本和语音模型实验,发现多模态融合完美对齐情感排序,零样本下细粒度情感词接近人类映射坐标。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16756 2026-06-16 cs.CV 新提交 57%

3D Classification of Paramagnetic Rim Lesions in Multiple Sclerosis via Asymmetric QSM-FLAIR Modeling

多发性硬化症中顺磁性边缘病变的3D分类:基于非对称QSM-FLAIR建模

Veronica Pignedoli, Giacomo Boffa, Nicoletta Noceti, Matilde Inglese, Francesca Odone, Matteo Moro

机构 * MaLGa, DIBRIS, University of Genova(热那亚大学) DINOGMI, University of Genova(热那亚大学) IRCCS Azienda Ospedaliera Metropolitana(IRCCS大都会医院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出一种3D多模态深度学习框架,利用非对称QSM-FLAIR建模对多发性硬化症中的顺磁性边缘病变进行自动分类,通过自监督预训练和对比正则化提升有限数据下的鲁棒性,在88名患者队列中验证了有效性。

Comments 10 pages, 3 figures, accepted at MICCAI 2026. Github link: https://github.com/veronicapignedoli/FRODO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16474 2026-06-16 cs.CV cs.RO 新提交 57%

MVOFormer: Flow-Semantic Transformer for Robust Monocular Visual Odometry

MVOFormer:用于鲁棒单目视觉里程计的流-语义Transformer

Jituo Li, Shunwang Sun, Jialu Zhang, Xinqi Liu, Jinyao Hu, Zhicheng Lu, Sajad Saeedi, Guodong Lu

机构 * State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室) Zhejiang Key Laboratory of Industrial Big Data and Robot Intelligent Systems(浙江省工业大数据与机器人智能系统重点实验室) School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) Robotics Institute, Zhejiang University(浙江大学机器人研究院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Rural Health Research Institute, Charles Sturt University(查尔斯特大学农村健康研究所) University College London(伦敦大学学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出MVOFormer,一种流-语义双分支编码器与迭代多模态解码器结合的Transformer框架,通过融合密集几何运动与语义先验实现粗到细位姿优化,在零样本泛化上显著超越现有方法。

Comments 8 pages, 6 figures. Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14808 2026-06-16 eess.IV cs.CV cs.IT math.IT 新提交 57%

Explainable Task-Oriented Token Communication for AI-Native 6G Networks

面向AI原生6G网络的可解释任务导向Token通信

Feibo Jiang, Lei Mao, Li Dong, Kezhi Wang, Cunhua Pan, Jiangzhou Wang

机构 * IEEE

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出ET-TokenCom框架,通过跨模态注意力融合视觉Token与任务Token,实现可解释的任务导向图像通信,解决Token表示不足、协作差和可解释性低的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14568 2026-06-15 eess.IV cs.CV 新提交 57%

Trimodal Glioma Representation Alignment via Volumetric Contrastive Learning

三模态胶质瘤表示对齐通过体积对比学习

Denise Marini, Eleonora Grassucci, Danilo Comminiello

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出GLORIA框架,通过Gramian对比损失对齐组织病理、基因表达和MRI三模态特征,用于胶质瘤分级和生存预测,在132例患者数据上优于双模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14277 2026-06-15 cs.CV 新提交 57%

One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

一层的垃圾是另一层的宝藏:LVLMs中自适应逐层视觉标记选择

Yongru Chen, Kai Zhang, Zeliang Zong, Yuchen Lu, Wenming Tan, Ye Ren, Jilin Hu

机构 * Hikvision Research Institute(海康威视研究院) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出自适应逐层视觉标记选择(ALVTS),通过轻量级选择器为不同层路由重要标记,实现高效压缩,在89%压缩率下保留96.7%精度。

Comments Accepted by CVPR 2026 (highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14071 2026-06-15 cs.CV 新提交 57%

ShearFuse-UNet: Hadamard, DCT, and Shearlet Transform Fusion for Next-Day Wildfire Spread Prediction

ShearFuse-UNet: Hadamard、DCT和Shearlet变换融合用于次日野火蔓延预测

Ene Meco, Yingyi Luo, Emadeldeen Hamdan, Adam Watts, Ahmet Enis Cetin

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) US Forest Service, Pacific Wildland Fire Science Laboratory(美国林务局太平洋野火科学实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出ShearFuse-UNet,一种轻量级深度学习模型,通过融合WHT、DCT和Shearlet变换分支,在U-Net编码器中实现多模态卫星数据的次日野火蔓延预测,以267k参数达到0.596 F1分数,优于ResNet18 U-Net。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13392 2026-06-15 cs.AI 新提交 57%

MiniMax Sparse Attention

MiniMax 稀疏注意力

Xunhao Lai, Weiqi Xu, Yufeng Yang, Qiaorui Chen, Yang Xu, Lunbin Zeng, Xiaolong Li, Haohai Sun, Haichao Zhu, Vito Zhang, Jinkai Hu, Jiayao Li, Rui Gao, Zekun Li, Songquan Zhu, Jingkai Zhou, Pengyu Zhao

机构 * MiniMax Peking University(北京大学) NVIDIA(英伟达) Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出 MiniMax 稀疏注意力(MSA),一种基于分组查询注意力的块级稀疏注意力机制,通过轻量索引分支选择 Top-k 键值块,实现高效长上下文处理,在 109B 模型上以 1M 上下文减少 28.4 倍注意力计算,并带来 14.2 倍预填充和 7.6 倍解码加速。

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13241 2026-06-12 cs.AI 新提交 57%

Brick: Spatial Capability Routing for the Mixture-of-Models (MoM) Paradigm

Brick: 面向混合模型范式的空间能力路由

Francesco Massa, Marco Cristofanilli

机构 * Regolo AI Seeweb

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出Brick多模态路由器,通过六维能力评分与查询难度估计,结合成本惩罚几何规则调度模型,在质量与成本间实现灵活权衡。

Comments 17 pages, 5 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12603 2026-06-12 cs.RO cs.AI 新提交 57%

From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation

从模仿到对齐:面向长距离人行道导航的人类偏好流策略

Honglin He, Zhizheng Liu, Yukai Ma, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出FlowPilot,一种仅使用单目RGB相机的无地图导航策略,通过锚定流匹配进行预训练,并引入人类偏好学习实现对齐,在长距离人行道导航中提升鲁棒性和社会合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11645 2026-06-11 cs.CV 新提交 57%

Motion Reinforces Appearance: RGB-Skeleton Gated Residual Fusion for Micro-Gesture Online Recognition

运动增强外观:用于微手势在线识别的RGB-骨架门控残差融合

Jialin Liu, Xinwen He, Pengyu Liu, Jiale Shi, Huaijuan Zang, Yanbin Hao

机构 * School of Computer Science and Information Engineering, Hefei University of Technology (HFUT), Hefei, China(合肥工业大学计算机与信息工程学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出DyFADet+双流RGB-骨架框架,通过门控残差模块自适应融合骨架运动与RGB特征,实现微手势在线识别,在SMG数据集上F1达40.88,排名第二。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏