arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2512.03963 2026-04-15 cs.CV 57%

TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning

TempR1:通过时间感知的多任务强化学习提升多模态大语言模型的时间理解

Tao Wu, Li Yang, Gen Zhan, Yabin Zhang, Yiting Liao, Junlin Li, Deliang Fu, Li Zhang, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Inc.(字节跳动公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 TempR1通过时间感知的多任务强化学习框架,系统增强MLLMs的时间理解能力,通过多任务语料库和改进的GRPO算法实现稳定有效的跨任务优化,提升时间依赖性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22364 2026-04-15 cs.RO cs.AI 57%

BINDER: Instantly Adaptive Mobile Manipulation with Open-Vocabulary Commands

BINDER: 基于开放词汇命令的即时自适应移动操作

Seongwon Cho, Daechul Ahn, Donghyun Shin, Hyeonbeom Choi, San Kim, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) ECE, ASRI and IPAI in SNU(SNU的电子工程系、先进机器人研究所和智能感知与人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 BINDER通过分离战略规划与连续环境监控,结合多模态大语言模型和视频大语言模型,实现动态环境下的高效移动操作,提升鲁棒性和适应性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01186 2026-04-15 cs.CV 57%

ASTRA: Let Arbitrary Subjects Transform in Video Editing

ASTRA: 让任意主体在视频编辑中变换

Fei Shen, Weihao Xu, Rui Yan, Dong Zhang, Xiangbo Shu, Jinhui Tang, Maocheng Zhao

机构 * NExT++ Research Centre, National University of Singapore(新加坡国立大学NExT++研究中心) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) College of Information Science and Technology and Artificial Intelligence, Nanjing Forestry University(南京林业大学信息科学与技术学院及人工智能学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ASTRA提出一种无需训练的视频编辑框架,通过多模态对齐模块和先验掩码重定位模块解决密集多主体场景中的注意力稀释和边界纠缠问题,实现精准操控与非目标区域的严格保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12145 2026-04-15 eess.AS cs.SD 57%

Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization

为何您的分词器在信息融合中失败:一种面向时间的预量化融合用于视频增强的音频分词

Xiangyu Zhang, Benjamin John Southwell, Siqi Pan, Xinlei Niu, Beena Ahmed, Julien Epps

机构 * School of Electrical Engineering and Telecommunications, University of New South Wales(新南威尔士大学电气工程与电信学院) Dolby Laboratories(杜比实验室)

专题命中 视频多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文研究了视频增强音频分词中重建质量下降的根本原因,提出了一种面向时间的预量化融合方法,通过在分词器架构中合理定位融合位置,结合时间轴上的特征融合,实现了高保真重建和下游任务的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11572 2026-04-14 cs.RO cs.MM 57%

DA-PTQ: Drift-Aware Post-Training Quantization for Efficient Vision-Language-Action Models

DA-PTQ:面向视觉-语言-动作模型的漂移感知后训练量化

Siyuan Xu, Tianshi Wang, Fengling Li, Lei Zhu, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(悉尼科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

AI总结 本文提出DA-PTQ,通过跨空间表示补偿和运动驱动混合精度分配,解决视觉-语言-动作模型中因量化扰动导致的轨迹漂移问题,实现低比特下的高效部署。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11498 2026-04-14 cs.CV 57%

TAG-Head: Time-Aligned Graph Head for Plug-and-Play Fine-grained Action Recognition

TAG-Head:时间对齐图头用于即插即用的细粒度动作识别

Imtiaz Ul Hassan, Nik Bessis, Ardhendu Behera

机构 * Edge Hill University(埃奇希尔大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TAG-Head,一种轻量级时空图头,通过RGB单一模态提升细粒度动作识别性能,采用Transformer编码器和图结构增强时空依赖性,实验证明其在RGB-only模型中达到SOTA,优于多模态方法。

Comments 15 pages, 3 figures, to appear in ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10789 2026-04-14 cs.CV 57%

ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment

ReplicateAnyScene:通过文本-视觉-空间对齐实现零样本视频到3D场景的合成

Mingyu Dong, Chong Xia, Mingyuan Jia, Weichen Lyu, Long Xu, Zheng Zhu, Yueqi Duan

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出ReplicateAnyScene框架,通过五阶段流水线实现视频到结构化3D场景的零样本合成,引入C3DR基准评估重建质量,实验表明其在生成高质量3D场景方面优于现有方法。

Comments Project Page: https://xiac20.github.io/ReplicateAnyScene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09547 2026-04-14 cs.CV 57%

Tango: Taming Visual Signals for Efficient Video Large Language Models

Tango:驯服视觉信号以提高视频大语言模型的效率

Shukang Yin, Sirui Zhao, Hanchao Wang, Baozhi Jia, Xianquan Wang, Chaoyou Fu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Reconova AI Lab(Reconova AI实验室) Nanjing University(南京大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 Tango通过改进注意力选择和相似性聚类方法,优化视频大语言模型的视觉信号利用,实现在保留10%视频token时性能损失仅0.1%,推理速度提升1.88倍。

Comments Code: https://github.com/xjtupanda/Tango

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02311 2026-04-14 cs.CV cs.LG 57%

Inferring Dynamic Physical Properties from Video Foundation Models

从视频基础模型推断动态物理性质

Guanqi Zhan, Xianzheng Ma, Weidi Xie, Andrew Zisserman

机构 * VGG, University of Oxford(牛津大学VGG实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文研究通过视频预测动态物理性质,提出新数据集和三种推断方法,展示视频基础模型与多模态大语言模型的性能对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06964 2026-04-14 cs.CV 57%

Adversarial Video Promotion Against Text-to-Video Retrieval

对抗性视频推广对抗文本到视频检索

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Qian Li, Shuai Liu, Chao Shen

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出首个对抗性视频推广攻击,通过改进的模态细化方法提升黑盒转移能力,实验显示在多种场景下攻击效果显著,揭示了文本到视频检索的潜在漏洞。

Comments This paper has been accepted by TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09799 2026-04-14 cs.LG cs.AI 57%

Explainable Human Activity Recognition: A Unified Review of Concepts and Mechanisms

可解释的人体活动识别:概念和机制的统一综述

Mainak Kundu, Catherine Chen, Rifatul Islam, Ismail Uysal, Ria Kanjilal

机构 * University of South Florida(南佛罗里达大学) California Polytechnic State University(加州州立理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了可解释人体活动识别方法,从概念和机制角度分析其复杂性,总结了主要挑战和未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18373 2026-04-14 cs.CV 57%

MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models

MASS:面向视觉-语言模型中物理推理与理解的运动感知空间-时间 grounding

Xiyang Wu, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha

机构 * University of Maryland(马里兰大学) Dolby Laboratories(杜比实验室) University of Southern California(南加州大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 MASS通过引入空间-时间信号提升视觉-语言模型对物理现象的理解能力,提出MASS-Bench基准测试集并验证模型在物理推理中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09513 2026-04-14 cs.CV 57%

Learning Parallax for Stereo Event-based Motion Deblurring

基于立体事件和强度相机的立体事件运动去模糊网络

Mingyuan Lin, Chi Zhang, Chu He, Lei Yu

机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出St-EDNet网络,通过粗到细框架直接从错位输入恢复高质量图像,利用立体事件和强度相机数据,无需真实深度,构建双特征嵌入架构以重建潜在锐化图像序列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09330 2026-04-13 cs.RO cs.CV 57%

VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis

VAG:用于具身数据合成的双流视频-动作生成

Xiaolei Lang, Yang Wang, Yukun Zhou, Chaojun Ni, Kerui Li, Jiagang Zhu, Tianze Liu, Jiajun Lv, Xingxing Zuo, Yun Ye, Guan Huang, Xiaofeng Wang, Zheng Zhu

机构 * GigaAI Zhejiang University(浙江大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21334 2026-04-13 cs.CV 57%

Streaming Video Instruction Tuning

流式视频指令微调

Jiaer Xia, Peixian Chen, Mengdan Zhang, Xing Sun, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港浸会大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Streamo,一个实时流式视频大语言模型,能执行多种视频任务,如实时叙述、动作理解等。通过大规模指令遵循数据集训练,Streamo在时间推理和多任务处理上表现优异,填补了离线视频模型与实时多模态助手之间的差距。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08966 2026-04-13 cs.CV 57%

How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms

视频大语言模型应如何输出时间?对高效时间接地范式的分析

Shengji Jin, Yuanhao Zou, Victor Zhu, Zhengping Ji, Chen Chen

机构 * The University of Central Florida(中佛罗里达大学) Axon(Axon公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文对比三种主流视频时间接地范式,探讨输出设计对精度与效率的影响,发现连续分布范式在效率-精度权衡中表现最佳。

Comments CVPR 2026 Workshop Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07772 2026-04-10 cs.CV 57%

ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions

ESOM:基于开放世界动态定义的高效流视频异常理解

Zihao Liu, Xiaoyu Wu, Wenna Li, Jianqin Wu, Linlin Yang

机构 * State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 本文提出ESOM模型,通过定义规范化、帧间匹配、混合流内存和概率评分模块,实现高效流视频异常检测,同时引入OpenDef-Bench基准测试,在单GPU上实现实时效率和先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06036 2026-04-10 cs.DC cs.CV cs.LG 57%

CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference

CodecSight: 利用视频编码信号实现高效的流式视频语言模型推理

Yulin Zou, Yan Chen, Wenyan Chen, JooYoung Park, Shivaraman Nitin, Luo Tao, Francisco Romero, Dmitrii Ustiugov

机构 * Beihang University(北京航空航天大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 CodecSight通过利用视频编码器内嵌的时空结构信息,实现流式视频分析的高效推理,提升吞吐量并减少GPU计算量,同时保持高精度。

Comments 18 pages, 34 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06330 2026-04-09 cs.CL 57%

STDec: Spatio-Temporal Stability Guided Decoding for dLLMs

STDec:基于时空稳定性的解码方法用于dLLMs

Yuzhe Chen, Jiale Cao, Xuyang Liu, Jin Xie, Aiping Yang, Yanwei Pang

机构 * Tianjin University(天津大学) Sichuan University(四川大学) Chongqing University(重庆大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 STDec通过结合空间和时间稳定性,改进dLLM解码,提升吞吐量并保持性能。

Comments Homepage: https://yzchen02.github.io/STDec

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05323 2026-04-08 cs.CV cs.RO 57%

VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success

VLA-InfoEntropy:一种无需训练的视觉-注意力信息熵方法,用于视觉-语言-动作模型的推理加速与成功

Chuhang Liu, Yayun He, Zuheng Kang, Xiaoyang Qu, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出VLA-InfoEntropy方法,通过图像熵和注意力熵结合时间步信息,动态调整模型关注区域,减少冗余并提升推理效率。

Comments Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05015 2026-04-08 cs.CV 57%

Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding

Video-MME-v2:迈向综合视频理解基准的下一阶段

Chaoyou Fu, Haozhi Yuan, Yuhao Dong, Yi-Fan Zhang, Yunhang Shen, Xiaoxing Hu, Xueying Li, Jinsen Su, Chengwu Long, Xiaoyao Xie, Yongkang Xie, Xiawu Zheng, Xue Yang, Haoyu Cao, Yunsheng Wu, Ziwei Liu, Xing Sun, Caifeng Shan, Ran He

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-MME-v2通过三级层次结构和非线性评估策略,评估视频理解的鲁棒性和准确性,揭示当前模型与人类专家间的差距及多模态推理瓶颈。

Comments Homepage: https://video-mme-v2.netlify.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25021 2026-04-08 cs.CV 57%

VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning

VideoTIR:通过高效工具集成推理实现长视频的准确理解

Zhe Gao, Shiyu Shen, Taifeng Chai, Weinong Wang, Haotian Xu, Xing W, Wenbin Li, Qi Fan, Yang Gao, Dacheng Tao

机构 * Nanjing University(南京大学) Nankai University(南开大学) East China Normal University(华东师范大学) Tencent(腾讯) MiroMind Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VideoTIR,通过强化学习优化工具调用策略,提升长视频理解的准确性和效率,结合零样本RL和SFT冷启动方法,减少冗余调用并生成高质量轨迹数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04811 2026-04-07 cs.RO cs.CV cs.HC 57%

AnyUser: Translating Sketched User Intent into Domestic Robots

AnyUser: 将草图用户意图翻译成家用机器人

Songyuan Yang, Huibin Tan, Kailun Yang, Wenjing Yang, Shaowu Yang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(湖南大学国家机器人视觉感知与控制技术工程研究中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 AnyUser通过相机图像上的自由形式草图(可选语言)实现直观的家庭任务指令,利用多模态输入生成无需先验地图或模型的可执行机器人动作,通过大量评估验证其在不同模拟家庭场景中的高准确性和真实环境中的可靠性。

Comments Accepted to IEEE Transactions on Robotics (T-RO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04379 2026-04-07 cs.CV 57%

Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning

强化以学习,选择以推理:视频推理的双范式

Songyuan Yang, Weijiang Yu, Jilin Ma, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao

机构 * National University of Defense Technology(国防科技大学) Sun Yat-sen University(中山大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RLER双范式,通过强化学习生成证据并验证推理一致性,提升视频推理的可靠性和可解释性,实验表明其在多个基准上均取得最佳性能。

Comments Accepted at CVPR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04372 2026-04-07 cs.CV 57%

Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning

图到帧RAG:面向无训练和可审计的视频推理的视觉空间知识融合

Songyuan Yang, Weijiang Yu, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao

机构 * National University of Defense Technology(国防科技大学) Sun Yat-sen University(中山大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出G2F-RAG,通过视觉空间知识融合提升视频推理的可解释性和效率,减少认知负担并保留可追溯的证据轨迹。

Comments Accepted at CVPR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03645 2026-04-07 eess.IV cs.CV 57%

UniSurgSAM: A Unified Promptable Model for Reliable Surgical Video Segmentation

UniSurgSAM: 一种用于可靠外科视频分割的统一提示模型

Haofeng Liu, Ziyue Wang, Alex Y. W. Kong, Guanyi Qin, Yunqiu Xu, Chang Han Low, Mingqi Gao, Lap Yan Lennon Chan, Yueming Jin

机构 * Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) School of Computer Science, The University of Sheffield(谢菲尔德大学计算机科学学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出UniSurgSAM,通过视觉、文本或音频提示实现可靠的外科视频分割,采用解耦两阶段框架解决优化干扰问题,并引入三种关键设计提升可靠性。

Comments Extended version of MICCAI 2025 paper (ReSurgSAM2). 13 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16341 2026-04-06 cs.CV 57%

Motion Capture from Inertial and Vision Sensors

从惯性与视觉传感器进行动作捕捉

Xiaodong Chen, Wu Liu, Qian Bao, Xinchen Liu, Ruoli Dai, Yongdong Zhang, Tao Mei

机构 * University of Science and Technology of China(中国科学技术大学) JD Explore Academy(京东探索研究院) Noitom Technology Ltd.(诺亦腾科技有限公司)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MINIONS数据集,用于基于单目相机和少量IMU的多模态人体动作捕捉,提出SparseNet框架以展示惯性与视觉传感器在消费级动作捕捉中的潜力。

Comments 12 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02211 2026-04-03 cs.IR cs.AI cs.MA 57%

Multi-Agent Video Recommenders: Evolution, Patterns, and Open Challenges

多智能体视频推荐系统:演进、模式与开放挑战

Srivaths Ranganathan, Abhishek Dharmaratnakar, Anushree Sinha, Debanshu Das

机构 * Google LLC(谷歌公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨多智能体视频推荐系统的演进、协作模式及挑战,分析了从早期MARL到LLM驱动架构的发展,并提出可扩展性、多模态理解等开放问题。

Comments Accepted for publication in The Nineteenth ACM International Conference on Web Search and Data Mining (WSDM Companion 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01900 2026-04-03 cs.CV 57%

FTPFusion: Frequency-Aware Infrared and Visible Video Fusion with Temporal Perturbation

FTPFusion:基于时序扰动的频率感知红外与可见视频融合

Xilai Li, Chusheng Fang, Xiaosong Li

机构 * Foshan University(佛山大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出FTPFusion方法,通过时序扰动和稀疏跨模态交互实现红外与可见视频融合,提升时序稳定性和空间细节保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01882 2026-04-03 cs.CV 57%

A3R: Agentic Affordance Reasoning via Cross-Dimensional Evidence in 3D Gaussian Scenes

A3R: 通过跨维度证据进行3D高斯场景中的代理 affordance 推理

Di Li, Jie Feng, Guanbin Li, Ronghua Shang, Yuhui Zheng, Weisheng Dong, Guangming Shi

机构 * Xidian University(西安电子科技大学) Sun Yat-sen University(中山大学) Qinghai Normal University(青海师范大学)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 本文提出A3R框架,通过跨维度证据获取提升复杂3D高斯场景中细粒度affordance推理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏