arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 320 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 320 篇

2607.00410 2026-07-02 cs.CV cs.LG 新提交 57%

MindAU: EEG-Conditioned Facial Action Unit Editing via Dual-Stream Manifold Alignment

MindAU: 基于双流流形对齐的脑电条件面部动作单元编辑

Zhenhang Li, Xin Zhou, Hao Deng, Lijun Yin

机构 * Binghamton University(宾汉姆顿大学) Massachusetts General Hospital(马萨诸塞综合医院) Harvard Medical School(哈佛医学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出MindAU框架,通过双流流形对齐将EEG特征与AU文本语义和视觉位移对齐,实现高保真身份保持的面部动作单元编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00124 2026-07-02 cs.CV 新提交 57%

Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing

分割,快与慢:双路径处理的实时开放词汇视频实例分割

Luca Barsellotti, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xian, Maxim Berman

机构 * Google TU Munich(谷歌慕尼黑分校) Munich Center for Machine Learning University of Modena(慕尼黑机器学习中心莫德纳大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出SegFS双流快慢框架,通过稀疏关键帧的开放词汇对象模型预测实例表示,并在特征空间条件化轻量快速网络,实现高效时域传播,在保持分割性能的同时将延迟降低至MOBIUS的1/14。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31167 2026-07-01 cs.RO cs.AI 新提交 57%

MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents

MIRTH:面向视觉-语言-动作智能体的基于互信息推理的时间枢纽

Hao Sun, Yu Song, Shiyu Teng, Ziwei Niu, Yen-Wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出MIRTH框架,通过双尺度时间记忆枢纽、互信息优化的潜在推理令牌和并行动作解码,解决VLA模型的时间短视、推理鸿沟和推理低效问题,在LIBERO和真实机器人上达到SOTA并展现错误恢复能力。

Comments Accepted as main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27828 2026-06-29 cs.CV 新提交 57%

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

Video-MME-Logical: 面向视频时序逻辑推理的受控诊断基准

Hohin Kwan, Hongyu Li, Ray Zhang, Manyuan Zhang, Xianghao Kong, Anyi Rao, Jiahao Xie, Si Liu

机构 * HKUST(香港科技大学) Colab, Beihang University(北京航空航天大学合作实验室) CUHK(香港中文大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 为隔离评估多模态大模型在视频中的时序逻辑推理能力,提出包含五种时序逻辑操作和25个细粒度任务类别的受控基准,通过控制时间跨度和推理复杂度进行难度可控评估,并支持中间状态诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24253 2026-06-29 cs.CV 新提交 57%

TuringViT: Making SOTA Vision Transformers Accessible to All

TuringViT:让最先进的视觉Transformer人人可用

Qiman Wu, Hanlin Chen, Lyujie Chen, Rui Xin, Jianlei Zheng, Mingyuan Wang, Jiahui Hu, Da Zhu, Yuecheng Ma, Yuhua Wei, Yizhao Wang, Hua Zhou, Yuheng Zhang, Anhua Liu, Shaman Tang, Yue He, Pengfei Diao, Shuang Su, Haotong Xin, Weichao Huang, Hang Zhang, Xianming Liu

机构 * Foundation Model Team, Xpeng Inc.(小鹏汽车基础模型团队)

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

AI总结 提出TuringViT,通过图灵线性注意力、VISTA-Curation数据构建和原生动态分辨率预训练,仅用10%数据即可超越开源ViT基线,并显著提升下游VLM性能和高分辨率延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25905 2026-06-25 cs.CV 新提交 57%

SurgAtlas: A Large-Scale Surgical Video-Language Dataset with 2,391 Hours of Open and Minimally Invasive Surgery

SurgAtlas:一个包含2,391小时开放和微创手术的大规模手术视频-语言数据集

Filippos Bellos, Andre S. Gala-Garza, Miaowei Wang, Alyssa M. Hardin, Ahmad M. Hider, Yayuan Li, Jing Bi, Susan Liang, Chenliang Xu, Donald S. Likosky, Jason J. Corso

机构 * University of Michigan(密歇根大学) University of Edinburgh(爱丁堡大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) University of Colorado(科罗拉多大学) University of Rochester(罗切斯特大学) Michigan Medicine(密歇根医学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出SurgAtlas,最大手术视频-语言数据集(15,291视频,2,391小时,18专科,5,000+术式),首次大规模纳入开放手术并建立基准,通过多层级自动标注管道生成丰富注释,微调Qwen3-VL-8B在多个基准上达到领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25736 2026-06-25 cs.CV 新提交 57%

UniTeD: Unified Temporal Diffusion for Joint Perception and Planning in Autonomous Driving

UniTeD: 面向自动驾驶联合感知与规划的时域统一扩散模型

Bo Zhao, Xinting Zhao, Naifan Li, Erkang Cheng, Haibin Ling

机构 * Nullmax Westlake University(西湖大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出UniTeD框架,通过共享生成空间的迭代去噪统一建模感知与规划,引入时域过渡模块和锚点刷新策略,在多个基准上达到最先进性能。

Comments Accept to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25535 2026-06-25 cs.CV 新提交 57%

Spatio-Temporal Mixture-of-Modality-Experts Diffusion for Quantitative DCE-MRI Synthesis from Incomplete MR Sequences

时空模态专家混合扩散:从不完整MR序列合成定量DCE-MRI

Junhyeok Lee, Kyu Sung Choi

机构 * Interdisciplinary Program in Cancer Biology, Seoul National University College of Medicine(首尔大学医学院癌症生物学跨学科项目) Department of Radiology, Seoul National University Hospital(首尔大学医院放射科) Department of Radiology, Seoul National University College of Medicine(首尔大学医学院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔大学医院医疗人工智能研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出时空模态专家混合(ST-MoME)条件扩散框架,通过时空门控网络融合多模态专家特征,从任意子集合成3D DCE参数图,在386例脑肿瘤数据上16种缺失场景下取得最优NMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25329 2026-06-25 cs.CV cs.LG 新提交 57%

State Space Models Meet Remote Sensing: A Survey

状态空间模型遇上遥感:综述

Qinzhe Yang, Chenyang Liu, Jia Xu, Zhenwei Shi, Zhengxia Zou

机构 * Shen Yuan Honors College, Beihang University(北航沈元荣誉学院) Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University(北京航空航天大学宇航学院航天智能科学与技术系) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Qian Xuesen Laboratory of Space Technology, China Academy of Space Technology(中国空间技术研究院钱学森空间技术实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文综述了状态空间模型(SSM)在遥感中的应用,分析了其在密集视觉预测、多模态和时序遥感数据中的优势,并总结了架构设计进展与未来挑战。

Comments 25 pages, 5 figures, has been published in SCIS SCIQ1 IF=8.1 https://doi.org/10.1007/s11432-025-4780-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25122 2026-06-25 cs.RO cs.AI cs.LG 新提交 57%

AeroCast: Probabilistic 3D Trajectory Prediction for Non-Cooperative Aerial Obstacles via Transformer-MDN Architecture

AeroCast: 基于Transformer-MDN架构的非合作空中障碍物概率3D轨迹预测

Syed Izzat Ullah, Jose Baca

机构 * Department of Engineering, Texas A&M University–Corpus Christi(德克萨斯A&M大学科珀斯克里斯蒂分校工程系)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 提出AeroCast框架,结合Transformer编码器和混合密度网络,预测非合作空中障碍物的多模态轨迹,在五秒预测范围内将位移误差降低约50%,并支持实时部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24986 2026-06-25 cs.LG cs.AI 新提交 57%

When Multi-Sensor Fusion Fails to Generalize: Cattle Posture Classification Under Animal-Level and Temporal Distribution Shift

当多传感器融合无法泛化:动物级别和时间分布偏移下的牛姿势分类

Leutrim Uka, Severino Pinto, Gundula Hoffmann, Marina M. -C. Höhne

机构 * Institute of Computer Science, University of Potsdam(波茨坦大学计算机科学研究所) Department of Sensors and Modelling, Leibniz Institute for Agricultural Engineering and Bioeconomy - ATB(莱布尼茨农业工程与生物经济研究所传感器与建模系) Department of Data Science in Bioeconomy, Leibniz Institute for Agricultural Engineering and Bioeconomy - ATB(莱布尼茨农业工程与生物经济研究所生物经济数据科学系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究评估多传感器融合在牛姿势分类中的鲁棒性,发现跨年评估性能大幅下降(F1从0.94降至0.49),表明常用评估高估实际性能,融合可能降低而非提升鲁棒性。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23705 2026-06-24 stat.AP cs.AI 新提交 57%

Event-Aligned Analysis of Multi-Rater Pain Assessments Using Continuous Wearable Physiology

使用连续可穿戴生理数据进行多评估者疼痛评估的事件对齐分析

Saba A. Farahani, Elahe Khatibi, Thomas D. Hughes, Ariana M. Nelson, Hung Cao, Amir M. Rahmani

机构 * University of California, Irvine(加州大学伊维奇分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出一种考虑评估者身份的事件对齐框架,将稀疏的疼痛评分转化为离散事件,并对齐连续可穿戴生理信号,揭示评估者间差异及生理模式依赖。

Comments 6 pages, 3 figures. Accepted at IEEE EMBC 2026 (Toronto, Canada, July 26-30, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24636 2026-06-24 cs.AI 新提交 57%

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning

CineCap: 基于时空锚点的结构化推理用于电影化视频描述

Xinyu Mao, Yuhui Zeng, Xiaokun Liu, Wenyu Qin, Meng Wang, Xin Tao, Pengfei Wan, Xiaohan Xing, Max Meng

机构 * The Chinese University of Hong Kong(香港中文大学) Xiamen University(厦门大学) Kling Team, Kuaishou Technology(快手科技Kling团队) National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出CineCap框架,通过时空锚点结构化推理和强化学习(覆盖完整性、准确性和门控覆盖奖励)生成电影化视频描述,在CineCap Bench基准上达到新最优。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24602 2026-06-24 cs.CV 新提交 57%

ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

ViTexQA: 面向视频文本问答的多帧时序感知数据集

Zhentao Guo, Chen Duan, Tongkun Guan, Zining Wang, Kai Zhou, Pengfei Yan

机构 * Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出ViTexQA数据集和FrameThinker方法,通过跨帧文本融合的问答对和两阶段训练(CoT微调+时序强化学习),解决多帧时序文本感知难题,ROUGE-L提升6.3%。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24282 2026-06-24 cs.CV 新提交 57%

UniRED: Unified RGB-D Video Frame Interpolation with Event Guidance

UniRED: 基于事件引导的统一RGB-D视频帧插值

Yinuo Zhang, Guangshun Wei, Yuanfeng Zhou, Yiran Shen

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出统一多模态框架UniRED,融合RGB外观、深度几何和事件时间线索,通过双向流估计与运动基细化实现高质量RGB-D视频帧插值,并构建RGB-D-Event数据集缓解数据稀缺。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24175 2026-06-24 cs.CV 新提交 57%

Tri-Efficient Transfer Learning for Point Cloud Videos

点云视频的三效迁移学习

Yiding Sun, Dongxu Zhang, Jihua Zhu, Haozhe Cheng, Zhengqiao Li, Pengcheng Li, Chaowei Fang, Yonghao Dong, Lin Chen

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院) School of Information and Communication Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) SIGS, Tsinghua University(清华大学深圳国际研究生院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出PoinTriE框架,通过伪运动轨迹合成、几何-运动对偶网络和时空侧网络,实现数据、参数和内存三方面高效的点云视频迁移学习,在动作识别和语义分割任务上取得新最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23503 2026-06-23 cs.CV 新提交 57%

UniverSat: Resolution- and Modality-Agnostic Transformers for Earth Observation

UniverSat:面向地球观测的分辨率与模态无关的Transformer

Yohann Perron, Guillaume Astruc, Nicolas Gonthier, Clement Mallet, Loic Landrieu

机构 * LIGM, Ecole Nationale des Ponts et Chaussées, IP Paris, Univ Gustave Eiffel, CNRS(LIGM,巴黎国立桥梁与道路学院,IP巴黎,埃夫尔大学,CNRS) LASTIG, Univ Gustave Eiffel, IGN, ENSG(LASTIG,埃夫尔大学,国家地理信息学院,ENSG) IGN(国家地理信息学院) CNES(国家航天中心) EFEO(埃克塞特东方研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出UniverSat,一种基于通用补丁编码器的ViT骨干网络,能处理任意空间、光谱和时间分辨率的光学与非光学传感器数据,通过自监督学习在异构多模态语料上训练单一模型,在多个EO基准上取得强分类与分割结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22126 2026-06-23 cs.CL 新提交 57%

From Recognition to Understanding: Unlocking Cognitive Time Series Reasoning with LLMs

从识别到理解:利用LLM解锁认知时间序列推理

Xin Qiu, Junlong Tong, Yao Zhang, Yunpu Ma, Wei Zhang, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(东方理工数字孪生研究所) Zhejiang University(浙江大学) Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,慕尼黑大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对现有时间序列任务与LLM能力不匹配的问题,提出多模态基准TSCognition和统一框架TSAlign,通过认知推理任务和语义对齐提升LLM的时间序列推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21607 2026-06-23 cs.CV 新提交 57%

T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition

T-MOR:学习面向运动感知的骨架表示用于人体动作识别

Di Yang, Mahmoud Ali, Quan Kong, Gianpiero Francesca, Francois Bremond

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) Inria Center at Université Côte d'Azur(法国蔚蓝海岸大学Inria中心) Woven by Toyota Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出T-MOR框架,通过多模态对比学习对齐骨架运动与视觉、文本表示,仅用轻量骨架输入实现高效动作识别,并在大规模数据集PoseCap-1M上预训练,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20857 2026-06-23 cs.AI cs.LG cs.RO 新提交 57%

SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models

SignVLA: 通过注意力LSTM和视觉-语言-动作模型实现实时手语引导的机器人操作

Ningwei Bai, Xinyu Tan, Harry Gardner, Zhengyang Zhong, Liuhaichen Yang, Luoyu Zhang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

机构 * University College London(伦敦大学学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出SignVLA框架,通过注意力LSTM网络将手语手势实时转换为语义指令,驱动VLA模型执行机器人操作任务,为听障用户提供无障碍交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20312 2026-06-19 cs.CV 新提交 57%

Reliability-Aware Prototype Calibration for Frozen Pose-Flow Video Anomaly Detection

面向冻结姿态流视频异常检测的可靠性感知原型校准

Ning Dong, Yingna Su, Xin Dong, Ziyun Jiao, Xinnian Guo, Zhuangzhuang Pan

机构 * School of Information Engineering(信息工程学院) Suqian University(宿迁大学) School of Electronic & Information Engineering(电子与信息工程学院) Nanjing University of Information Science and Technology(南京信息科学技术大学) University of Electronic Science and Technology of China(电子科学与技术大学) Institute for Advanced Studies(高级研究机构) Universiti Malaya(马来亚大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种后验评分校准方法RPC,通过标准化潜在空间中的最近原型偏差修正冻结姿态流检测器的排名,在8个骨干-数据集组合上平均提升AUROC 2.03个百分点。

Comments 15 pages, 5 figures, 7 tables. Code available at https://github.com/iNing10/RPC

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20135 2026-06-19 cs.RO cs.AI 新提交 57%

Frequency-Aware Flow Matching for Continuous and Consistent Robotic Action Generation

频率感知流匹配用于连续且一致的机器人动作生成

Jianing Guo, Fangzheng Chen, Zihao Mao, Wong Lik Hang Kenny, Zhenhong Wu, Yu Li, Yishuai Cai, Yuanpei Chen, Yikun Ban, Kai Chen, Qi Dou, Yaodong Yang, Xianglong Liu, Huijie Zhao, Simin Li

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) PKU-Psibot Lab(北大-智源机器人实验室) Zhongguancun Laboratory(中关村实验室) Hefei Comprehensive National Science Center(合肥综合性国家科学中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出频率感知流匹配(FAFM),通过离散余弦变换将离散动作序列转换到频域进行流匹配,并正则化一阶时间导数以生成平滑连续的动作,提升成功率、多模态表达性和运动平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19927 2026-06-19 cs.CV 新提交 57%

CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs

CARE: 面向视频多模态大语言模型的自适应推理长度的能力感知奖励塑形

Chengwen Liu, Hao Peng, Jisheng Dang, Hong Peng, Bin Hu, Tat-Seng Chua

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) School of Medical Technology, Beijing Institute of Technology(北京理工大学医学技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出CARE框架,通过能力感知奖励塑形自适应优化推理长度,利用指数移动平均估计能力并分阶段调整奖励偏好,结合批次归一化和后验放大器提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09547 2026-06-19 cs.CV cs.LG 新提交 57%

Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?

流式干预:视频大语言模型能否在错误发生时即时纠正?

Apratim Bhattacharyya, Shweta Mahajan, Sanjay Haresh, Rajeev Yasarla, Reza Pourreza, Litian Liu, Risheek Garrepalli, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究院) York University(约克大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出Ego-MC-Bench基准评估视频LLM在烹饪场景中的实时干预能力,并构建Ego-CoMist反事实合成数据集提升小模型性能。

Comments The project page is available at https://apratimbh.github.io/livecookv2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17298 2026-06-17 cs.CV 新提交 57%

Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins

面向手术室视频的推理式文本-视频检索:基于动作驱动数字孪生

Yiqing Shen, Hao Ding, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出OR3方法,通过动作驱动数字孪生(ActDT)将视频片段转化为结构化表示,并利用大语言模型生成假设ActDT进行检索,结合证据修正实现隐式查询推理,在手术室视频检索中显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15200 2026-06-16 cs.CV 新提交 57%

Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams

铭记于心:面向用户中心的持续空间智能推理在自我中心视频流中的应用

Yun Wang, Junbin Xiao, Han Lyu, Yifan Wang, Jing Zuo, Zhanjie Zhang, Hong Huang, Dapeng Wu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出UCS-Bench数据集和DirectMe框架,通过增量构建结构化空间记忆,实现自我中心视频流中动态空间推理、长期记忆与用户实时位置对齐,显著提升多模态大模型的空间推理能力。

Comments 45 pages. https://icml.cc/virtual/2026/poster/63682

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14127 2026-06-15 cs.IR cs.CL 新提交 57%

CoRe: A Continuously Reward-Finetuned LLM Query Rewriter for Multi-Stage Context-Aware Relevance in Web-Scale Video Search

CoRe:一种持续奖励微调的LLM查询重写器,用于大规模视频搜索中的多阶段上下文感知相关性

Yilin Wen, Rong Yang, Xiaojia Chang, Hong Sun, Gefu Tang, Chunhui Liu, Jeffrey Chen, Zeyu Ma, Lisong Qiu, Xiaochuan Fan, Congjia Yu, Quan Zhou, Yuheng Chen, Zian Wang

机构 * TikTok

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出CoRe系统,通过半在线混合偏好优化和乘法奖励比,实现每周重新部署的LLM查询重写器,在多阶段视频搜索中显著降低变更查询率并提升相关性指标。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12125 2026-06-11 cs.CV 新提交 57%

Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding

Q-Fold: 查询感知的焦点-上下文时空折叠用于长视频理解

Biao Tang, Xu Chen, Shuxiang Gou, Jingyi Yuan, Yuhan Zhang, Chenqiang Gao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出Q-Fold,一种无需训练的长视频输入构建框架,通过查询引导将相关片段保留为高保真焦点帧,不相关片段折叠为上下文布局,在固定预算下提升多模态大模型的长视频理解性能。

Comments 10 pages, 5 figures, 8 tables. Code will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11770 2026-06-11 cs.AI 新提交 57%

SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning

SVoT: 基于强化学习的空间推理状态感知思维可视化

Chao Lei, Yanbei Jiang, Markus Hiller, Zhijian Zhou, Xunye Tian, Krista A. Ehinger, Nir Lipovetzky

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出SVoT框架,通过强化学习生成可验证的中间状态和可视化,结合文本与视觉推理链,提升多模态大模型在多跳空间推理中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10517 2026-06-10 cs.CV 新提交 57%

LAFP: Preserving Latent Action Structure in Latent Policy Learning via Flow Matching

LAFP:通过流匹配在潜在策略学习中保留潜在动作结构

Jiexi Lyu, Xizhou Bu, Qingqiu Huang, Chufeng Tang, Xiaoshuai Hao, Hongbo Wang, Wei Li

机构 * Fudan University(复旦大学) Morphi

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出LAFP方法,利用流匹配学习潜在策略,并引入推理时插值机制缓解随机性导致的错位,在模仿学习任务中成功率提升10-15%,推理开销增加不到1倍。

详情

展开后加载摘要…

URL PDF HTML 收藏