arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-04 至 2026-08-04 共收录 41 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 41 篇

2608.00986 2026-08-04 cs.CV 新提交 89%

Understanding and Overcoming Cross-modal Fusion Bias in Multimodal Anomaly Detection From A Fisher Information Perspective

从费舍尔信息视角理解和克服多模态异常检测中的跨模态融合偏差

Kaifang Long, Lianbo Ma, Liming Liu, Guoyang Xie

机构 * Northeastern University(东北大学) CATL(宁德时代)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV

AI总结 该研究针对多模态异常检测中被忽视的跨模态融合偏差问题,提出即插即用框架UCFB,经实验验证在多种设置下均实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27902 2026-08-04 cs.CV 版本更新 87%

One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

一个补丁就够:面向基于多模态大语言模型(MLLM)的场景文本定位的强化优化视觉标记接地

Rui Tang, Wentao Yang, Peirong Zhang, Yongxin Shi, Shun Zhang, Huiguo He, Lianwen Jin

机构 * South China University of Technology(华南理工大学) HiThink Research(海思思考研究院)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 针对现有多补丁场景文本定位范式的冗余噪声与定位歧义问题,提出以视觉为中心的单补丁文本定位框架 SPaTS,通过强化学习优化的单补丁选择等技术实现性能提升,显著优于前沿相关模型。

Comments 15 pages, 11 figures. Accepted to ACM Multimedia 2026

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01473 2026-08-04 cs.CV cs.CL cs.LG 新提交 85%

Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs

Slot2Text:面向高效且空间可追溯的手术多模态大语言模型的以对象为中心的视觉分词

Guiqiu Liao, Matjaz Jogan, Daniel A. Hashimoto

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 Slot2Text将视觉输入转为槽潜变量,推出双模式手术MLLM,在多基准上实现高效推理,Slot2Text-Fast大幅降本,Slot2Text-Reason支持可追溯空间推理。

Comments 17 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00043 2026-08-04 eess.SP cs.AI 新提交 83%

Multimodal Wearable-Based Olfactory-Induced Emotion Recognition in Arousal-Valence Dimensions

基于多模态可穿戴设备的嗅觉诱导唤醒-效价维度情感识别

Chen-Yang Xu, Lan Zhang, Fei-Yi Fan, Bin Hu, Qing-Hao Meng

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对现有嗅觉情感研究的维度失衡与多模态数据不足问题,构建多模态嗅觉情感数据集,提出STF-HFNet模型,在两个数据集上取得最优情感识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01437 2026-08-04 cs.AI 新提交 83%

Beyond Routing Saturation: A Long-Horizon Class-Incremental Perspective on Expert Routing in Multimodal Continual Instruction Tuning

超越路由饱和:多模态持续指令调优中专家路由的长程类增量视角

Huiyu Yi, Yongqi Xu, Bogang Zhang, Dunwei Tu, Xu Zhiming, Zhen-Hao Xie, Baile Xu, Furao Shen

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对多模态持续指令调优中专家路由的任务识别问题,构建含34个任务的FLEX基准,提出MCIL框架,适配CIL方法后使LoRA匹配和MacroScore分别提升最高16.3个百分点、4.6个点

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15720 2026-08-04 cs.CV cs.LG 版本更新 83%

Semi-MedRef: Semi-Supervised Medical Referring Image Segmentation with Cross-Modal Alignment

Semi-MedRef:基于跨模态对齐的半监督医学指引用图像分割

Yuchen Li, Ziru Wei, Zhen Zhao, Yi Liu, Luping Zhou

机构 * The University of Sydney(悉尼大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Changzhou University(常州大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出Semi-MedRef框架,通过三个组件维持医学图像与位置语言的一致性,实验显示其在低标签条件下优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01282 2026-08-04 stat.ME 新提交 82%

Multimodal domain adaptation under label shift and blockwise missing modalities

标签偏移与分块模态缺失下的多模态域适应

Zebin Wang, Ziang Dou, Molei Liu, Tianxi Cai

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对标签偏移与分块模态缺失的多模态域适应问题,提出参考锚定方法,结合代理标签辅助策略,在模拟与RCC应用中实现了分布偏移下的稳定预测。

Comments 49 pages, 3 figures, 15 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02092 2026-08-04 cs.CV cs.MM 新提交 81%

Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion

基于空间掩码与通道融合的深度多模态融合检测

Guandi Wang, Ming Li, Yunsen Xing, Junle Liu

机构 * KTH Royal Institute of Technology(KTH皇家理工学院) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文针对现有多模态融合检测的过拟合问题,提出Attention-Driven Complementarity Resampling框架,通过语义掩码交换与可学习通道竞争实现跨模态目标检测的性能提升,在多数据集上取得了有竞争力的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01622 2026-08-04 cs.NE cs.MM 新提交 79%

SMM Transformer: Leveraging Spiking Neural Networks for Multimodal Tasks

SMM Transformer:利用脉冲神经网络实现多模态任务

Xiubo Liang, Jinxing Han, Yuke Li, Haoqi Zhu, Yu Zhao, Hongzhi Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出基于脉冲神经网络的SMM Transformer框架,通过PLMP、SMSA、SMoE三个核心组件解决SNN多模态Transformer的训练与效率问题,在基准测试中实现了有竞争力的准确率与显著的能耗降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01488 2026-08-04 cs.CV 新提交 79%

Towards Compact Unified Multimodal Tracking: Synergizing Knowledge Distillation with Structural Pruning

迈向紧凑的统一多模态目标跟踪:知识蒸馏与结构剪枝的协同

Yuqi Li, Yuedong Tan, Huiran Duan, Weilun Feng, Chuanguang Yang, Zhulin An, Zongwei Wu, Shiping Wen, Tingwen Huang, Yingli Tian

机构 * The City College of New York(纽约城市学院) INSAIT Sofia University “St. Kliment Ohridski”(圣克莱门特奥赫里德斯基索非亚大学) Julius-Maximilians-Universität Würzburg(维尔茨堡大学) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳先进技术研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对统一多模态跟踪模型计算负担大的问题,提出双对齐蒸馏框架,结合知识蒸馏与结构剪枝,在五组基准上实现了高准确率与5倍速度提升的紧凑模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09842 2026-08-04 cs.LG cs.CL 版本更新 79%

From Direction to Magnitude: How Multimodal Instruction-Tuning Reorganizes the Geometric Encoding of Identity-Specifying Prompts in Transformer Hidden States

从方向到大小:多模态指令微调如何在Transformer隐藏状态中重新组织身份指定提示的几何编码

Jorge A. Castillo, Marco Torres Yévenes, Juan Carlos Lanas

机构 * Axis Dynamics SpA(轴动力公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 研究四种训练后模式的Transformer语言模型,通过五个几何指标比较三种提示条件,发现多模态指令微调会使身份编码从方向重组为大小,此重组特定于该模式,还定位了W_1作为方法贡献。

Comments 16 pages, 8 tables. Working draft v0.3. Uses Ollivier-Ricci curvature and edge-wise Wasserstein-1 as primary geometric statistic; four models (Gemma-4-E4B, Gemma-4-E4B-it, DeepSeek-R1-Distill-Qwen-7B, Qwen2.5-7B-Instruct)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31986 2026-08-04 cs.CV 版本更新 79%

CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

CoLT: 教会多模态模型通过潜在思维链进行思考

Lianyu Hu, Shengqian Qin, Zeqin Liao, Qing Guo, Liang Wan, Wei Feng, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) NKIARI AAIS & VCIP, Nankai University(南开大学AAIS & VCIP) Tianjin University(天津大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出CoLT框架,用潜在思维链代替文本推理,通过前向和后向解码器监督及内部监督实现高效多模态推理,在8个基准上优于现有方法,推理时间减少10.1倍。

Comments Accepted by ECCV2026. Code is available at https://github.com/hulianyuyy/CoLT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01173 2026-08-04 cs.CV 版本更新 79%

Bridging Multimodal Fusion and Expert Routing via Spectral Reliability Descriptors for Robust Object Detection

复用融合时频谱可靠性用于RGB-红外目标检测的自适应融合与专家路由

Yefeng Wu

机构 * Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract);分类 cs.CV

AI总结 提出一种无参数的7维频谱可靠性描述符,通过频谱可靠性融合和可靠性条件专家路由,提升RGB-红外目标检测在退化条件下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04831 2026-08-04 cs.LG cs.CL 版本更新 79%

EHR2Path: Comprehensive Pathway-Level Modeling of Longitudinal Patient Trajectories from Multimodal Electronic Health Records

EHR2Path:从多模态电子健康记录中可扩展地建模纵向患者路径

Chantal Pellegrini, Ege Özsoy, David Bani-Harouni, Matthias Keicher, Nassir Navab

机构 * Technical University of Munich(慕尼黑技术大学) TUM School of Computation, Information and Technology(慕尼黑技术大学计算、信息与技术学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 EHR2Path通过统一的时序表示建模更广泛的患者信息,提升对住院患者路径的预测和模拟能力,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01620 2026-08-04 eess.SP 新提交 78%

Smartwatch Photoplethysmography-Derived Heart Age via ECG-Guided Cross-Modal Pretraining as a Digital Biomarker of Vascular Aging

通过心电引导跨模态预训练从智能手表光体积描记术衍生的心龄作为血管衰老的数字生物标志物

Donglin Xie, Xueying Gui, Yutian Zhu, Feng Xu, Guangkun Nie, Chenyang Xu, Jun Li, Shuailong Tang, Xiaoyu Li, Qi Xie, Yelei Li, Shenda Hong

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本研究开发心电引导跨模态框架,利用智能手表PPG衍生的心龄差作为数字生物标志物,证实其与动脉僵硬度、高血压显著相关,可用于血管衰老评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01020 2026-08-04 cs.CR 新提交 78%

Inverting the Hidden: Unveiling Multimodal Privacy Leakage in Collaborative LVLM Inference

反转隐藏内容:揭示协作式大型视觉语言模型(LVLM)推理中的多模态隐私泄露

Shuaifan Jin, Zhibo Wang, Qiyuan Wang, Yiting Han, Yajie Zhou, Yuanfan Zhang, Jiahui Hu, Xiaoyi Pang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究针对协作式LVLM推理的隐私风险,提出RASR多模态重建攻击,可从深层LVLM隐藏状态恢复隐私信息,图像重建MSE降约50%、文本恢复token准确率达99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00621 2026-08-04 cs.LG 新提交 78%

RHEA: Reliability-Harmonized Reconstruction and Assignment for Robust Multimodal-Attributed Graph Clustering

RHEA:用于鲁棒多模态属性图聚类的可靠性协调重构与分配

Yinlin Zhu, Di Wu, Ziyu Han, Zekai Chenm, Wang Luo, Miao Hu, Guocong Quan

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态属性图聚类中属性含噪或缺失时性能下降的问题,提出RHEA框架,通过估计节点特定模态可靠性并结合邻域信息提升聚类效果,在基准测试中表现优于最强基线。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01635 2026-08-04 cs.CV 新提交 77%

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00086 2026-08-04 cs.CV cs.AI cs.CL cs.LG 版本更新 71%

Hierarchical Pre-Training of Vision Encoders with Large Language Model

基于大语言模型的视觉编码器分层预训练

Eugene Lee, Ting-Yu Chang, Jui-Huang Tsai, Jiajie Diao, Chen-Yi Lee

机构 * University of Cincinnati(辛辛那提大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract,comments);分类 cs.CV、cs.CL、cs.AI;multimodal foundation model(comments)

AI总结 本文提出HIVE框架,通过引入视觉编码器与大语言模型间的分层交叉注意力机制,提升视觉语言对齐,改进特征融合与表征学习,实验表明其在图像分类和多模态任务中表现优异。

Comments 17 pages, 14 figures, accepted to Computer Vision and Pattern Recognition Conference (CVPR) Workshops 2026. 5th MMFM Workshop: What is Next in Multimodal Foundation Models?

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 7415-7424) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02449 2026-08-04 cs.CV cs.RO 新提交 70%

MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving

MoRAL:面向边缘自动驾驶的紧凑型视觉语言模型的传感器接地鸟瞰图推理

Ambarish Govindarajulu Kaliamurthi, Kaikai Liu

专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 MoRAL是一种两阶段微调流水线,指导Cosmos-Reason2-2B基于物理编码的BEV表示进行驾驶决策,在参数仅为零样本基准四分之一的情况下,在8类驾驶问题中7类胜出,紧急制动召回率提升至47.8%,可在消费级8GB GPU高效运行。

Comments 7 pages, 5 figures, 6 tables. Accepted to the 14th IEEE International Conference on Intelligent Mobile Computing (IEEE IMC 2026), Fukuoka, Japan, July 27-30, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14061 2026-08-04 cs.SE 版本更新 67%

LLM Agents Can See Code Repositories

LLM智能体能够查看代码仓库

Dongjian Ma, Silin Chen, Yufei Yang, Yuling Shi, Yanfu Yan, Xiaodong Gu

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn)

AI总结 研究多模态大语言模型在仓库级问题解决中利用视觉表示的效果,发现纯视觉方案降低精度,而结合视觉结构图可减少26%输入token并保持或提升精度。

Comments Accepted by ASE 2026. Our code and data are available at https://github.com/cslsolow/SeeRepo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01979 2026-08-04 cs.CV cs.CL 新提交 62%

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs

ET-Prune:面向文本丰富型多模态大语言模型的视觉 token 剪枝的证据感知动态预算分配

Zizhong Ding, Junxian Li, Kai Liu, Shaoqiu Zhang, Xiao Xiao, Linghe Kong, Yulun Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 ET-Prune 是一种无需训练的视觉 token 剪枝框架,通过证据分配实现动态预算,在文本丰富的多模态任务中,于约一半 token 保留量下,在 OCRBench-v2、MMBench v1.1 等基准上取得优于基线的性能,实现了质量与成本的良好平衡。

Comments Code and supplementary material is at https://github.com/Labyrinth0419/ET-Prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01055 2026-08-04 cs.CV cs.AI 新提交 62%

Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception

为正确的边界框分配信用:结构化视觉感知的边际贡献分配

Xinheng Han, Jianfei Wang, Yu Chen, Xiang Wang, Shuai Li, Weixing Li, Feng Pan

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型结构化视觉感知中响应级监督的粒度不匹配问题,提出MCR-GRPO框架,通过边界框级边际贡献分配优化,在多个基准上取得了优于现有GRPO基线的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00530 2026-08-04 cs.CV cs.AI 新提交 62%

Unleashing the Power of Text: Text-Guided Flow Matching for Image Fusion under Complex Degradations

释放文本的力量:面向复杂退化场景的文本引导流匹配图像融合

Axi Niu, Jieheng Li, Kang Zhang, Qingsen Yan, Jinqiu Sun, Yanning Zhang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对复杂退化下红外-可见光图像融合的挑战,提出文本引导的TGFusion框架,通过多流联合流Transformer实现动态文本引导,在多类退化场景下取得优异融合性能。

Comments 12 pages, 9 figures, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00146 2026-08-04 cs.CL cs.AI 新提交 62%

DiffusionGemma Technical Report

DiffusionGemma 技术报告

DiffusionGemma Team, Adrien Ali Taïga, James Assiene, Daniele Calandriello, Rahma Chaabouni, João Gante, Tamara von Glehn, Nate Keating, Chris Knutsen, Martin Kukla, Tianlin Liu, Ivan Lobov, Ofir Nabati, João Gabriel Oliveira, Nicolas Perez-Nieves, Nastasia Prutianova, Bobak Shahriari, Jean Tarbouriech, Pavel Tyletski, Çağlar Ünlü, Cindy Wu, Glenn Cameron, Jerome Connor, Sertan Girgin, Maarten Grootendorst, Alon Levkovitch, Eliya Nachmani, Omar Sanseviero, Piotr Stanczyk, Quentin Berthet, Andrew Campbell, Clément Crepy, Valentin De Bortoli, Arnaud Doucet, Romuald Elie, Alexandre Galashov, Klaus Greff, Alexis Jacq, David Ruhe, Yu-Han Wu, Sebastian Flennerhag, Brendan O'Donoghue, George Scrivener, Shantanu Thakoor

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出开放权重语言模型 DiffusionGemma,通过并行优化 256 个 token 块规避 AR 模型顺序解码瓶颈,经两阶段微调后实现 1500 token/秒生成速度,性能优于带推测解码的 AR 模型,还支持多模态等功能并为混合解码提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02309 2026-08-04 cs.CV 新提交 57%

CalibBEV: LiDAR-Camera Calibration via BEV Alignment

CalibBEV:基于鸟瞰图对齐的激光雷达-相机标定方法

Filippo D'Addeo, Lorenzo Cipelli, Adriano Cardace, Emanuele Ghelfi, Andrea Zinelli, Massimo Bertozzi

机构 * University of Bologna(博洛尼亚大学) University of Parma(帕尔马大学) Stanford University(斯坦福大学) VisLab srl(VisLab有限公司) Ambarella Inc.(安霸公司)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 CalibBEV是一种激光雷达-相机标定方法,通过两步BEV对齐结合CLIP对比损失实现跨模态统一,在KITTI、nuScenes基准上大幅降低了标定误差,达到最优性能。

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision. 2026. p. 4345-4354

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02285 2026-08-04 cs.CV 新提交 57%

Sen-Cap: Sensor-Flexible and Noise-Resilient Human Motion Capture via LiDAR-Camera Integration

Sen-Cap:基于激光雷达-相机融合的传感器灵活且抗噪的人体运动捕捉框架

Aoru Xue, Yujing Sun, Yiming Ren, Kwok-Yan Lam, Mao Ye, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Digital Trust Centre, Nanyang Technological University(南洋理工大学数字信托中心)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 Sen-Cap是一种无需传感器间校准的激光雷达-相机融合人体运动捕捉框架,通过跨传感器运动估计器与抗噪轨迹跟踪器实现灵活部署与强鲁棒性,在多数据集上达最优性能,适用于真实场景。

Comments 16 pages, 8 figures, 4 tables. Accepted at ECCV 2026. Aoru Xue and Yujing Sun contributed equally. Yuexin Ma is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02134 2026-08-04 cs.CV 新提交 57%

Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression

消息而非令牌:用于忠实VLM压缩的基础核心集

Long Qian, Jiaqi Wei, Bingke Zhu, Yingying Chen, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Wuhan AI Research(武汉人工智能研究院) Cardiff University(卡迪夫大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对VLM视觉令牌压缩的现有缺陷,提出无需训练的GMC方法,通过联合分配多维度证据支持并传输被丢弃状态,在大幅减少视觉令牌的同时保持VLM性能,经多基准实验验证有效。

Comments 32 pages, 6 figures, 18 tables, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01975 2026-08-04 cs.SE cs.CL cs.LG cs.PF 新提交 57%

TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference

TELLER:面向大语言模型推理的非侵入式跨层根因分析

Ruilin Xu, Junyi Li, Pengfei Chen, Zongxuan Xie

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 TELLER是面向LLM推理的非侵入式跨层根因分析框架,通过跟踪与日志结合实现异常定位与自然语言解释,在多节点GPU工作负载上兼具高效压缩与诊断性能,为LLM推理RCA提供实用支撑。

Comments 12 pages, 1 figure, 9 tables. Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01807 2026-08-04 cs.CV 新提交 57%

Parameter-Dynamic Adaptive Fusion and Calibration Network for RGBT Tracking

用于RGBT跟踪的参数动态自适应融合与校准网络

Zhaoding Ding, Chenglong Li, Jiandong Jin, Kewei Ying, Wentao Wu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对现有RGBT跟踪器融合参数无法适配目标状态变化的问题,提出PAFCNet,通过TA-HyperNet生成目标条件参数,实现动态融合与时序校准,在多RGBT跟踪基准上取得竞争力性能。

Comments 9 pages,4 figures; Under review

详情

展开后加载摘要…

URL PDF HTML 收藏