arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4728 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4728 篇

2512.13247 2026-07-21 cs.CV 版本更新 57%

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster:用于身份和视图感知的会说话肖像的时空自回归视频扩散

Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) FAU Erlangen–Nürnberg, Germany(埃朗根-纽伦堡大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV

AI总结 研究提出STARCaster模型,通过重新思考参考和几何范式,采用组合方法及解耦学习,解决语音驱动肖像动画和动态视点控制问题,能有效泛化,超越先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30534 2026-07-20 cs.CV 版本更新 57%

Orca: The World is in Your Mind

Orca: 世界在你心中

Yihao Wang, Yuheng Ji, Mingyu Cao, Yanqing Shen, Runze Xiao, Huaihai Lyu, Senwei Xie, Euan Liu, Klara Tian, Tianfeng Long, Yichi Zhang, Zhengliang Cai, Ruike Chen, Jifan Zhao, Ruochuan Shi, Zihan Tang, Jing Lyu, Wenxing Tan, Ningbo Zhang, Yangtao Hu, Yuming Gao, Xiansheng Chen, Junkai Zhao, Congsheng Xu, Boan Zhu, Ziqi Wang, Yupu Feng, Qiongqiong Zhang, Yingli Zhao, Yulong Ao, Shaoxuan Xie, You Liu, Guocai Yao, Leiduo Zhang, Xiaodan Liu, Yunyan Zhang, Yance Jiao, Xinyan Yang, Jiaxing Wei, Xu Liu, Tengfei Pan, Shaokai Nie, Chunlei Men, Sen Cui, Xiaojie Jin, Hongyang Li, Jianlan Luo, Yao Mu, Yunchao Wei, Jun Yan, Hang Zhao, Xiaolong Zheng, Jiaming Li, Yonghua Lin, Tiejun Huang, Zhongyuan Wang, Pengwei Wang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出Orca通用世界基础模型,通过无意识学习和有意识学习两种互补范式,从多模态世界信号中学习统一的世界潜在空间,并支持文本生成、图像预测和具身动作生成等下游任务。

Comments Project page: https://orca-wm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16209 2026-07-17 cs.CV cs.LG 57%

VideoGAN-based Trajectory Proposal for Automated Vehicles

基于VideoGAN的自动车辆轨迹提案

Annajoyce Mariani, Kira Maag, Hanno Gottschalk

机构 * Technical University of Berlin(柏林技术大学) Heinrich-Heine-University(海因里希-海涅大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于VideoGAN的自动车辆轨迹生成方法,利用BEV视频训练生成对抗网络,以提高轨迹生成的准确性和现实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13802 2026-07-16 cs.CV 新提交 57%

RainDancer: RGB-Event Video Deraining with Rain-Oriented Spiking Dynamics

RainDancer:基于面向降雨的脉冲动力学的RGB-事件视频去雨

Kui Jiang, Runzhe Li, Zhaocheng Yu, Guanglu Sun, Junjun Jiang, Xianming Liu

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Computer Science and Technology, Harbin University of Science and Technology(哈尔滨理工大学计算机科学与技术学院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对视频去雨问题,提出RainDancer框架,基于分解-交互范式,在RGB和事件分支分别处理,分离雨和背景成分,进行组件级融合,并引入事件域监督,实验表明该方法在多方面性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13681 2026-07-16 cs.CV 新提交 57%

Towards Spatial Supersensing in the Wild

迈向野外空间超感知

Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

机构 * Tsinghua University(清华大学) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对空间超感知中多模态模型基准测试局限于合成视频和家庭场景的问题,引入VSI-Super-Wild基准,受人类认知启发探究世界状态三元组,通过大量真实视频问答对测试发现模型不足及失败模式,为空间超感知发展指明方向。

Comments Accepted to ECCV 2026. Project page: https://vsi-super-wild.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13506 2026-07-16 cs.CV 新提交 57%

TRACE-PCa: Predicting Prostate Cancer Progression from Longitudinal MRI During Active Surveillance

TRACE-PCa:在主动监测期间从纵向MRI预测前列腺癌进展

Hongye Zeng, Shreeram Athreya, Dingyuan Dai, Steve Raman, Leonard Marks, William Speier, Corey Arnold

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究提出TRACE-PCa模型,无需病变分割,通过预训练3D MRI模型编码序列扫描,引入时间注意力门,融合临床变量,在纵向AS队列验证中表现出色,能减少不必要活检,有预测前列腺癌进展的潜力。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13095 2026-07-16 cs.AR cs.AI 新提交 57%

Full-Pipeline Inference Optimization for MiMo-V2.5 Series: Pushing Hybrid SWA Efficiency to the Limit

MiMo-V2.5系列的全流程推理优化:将混合滑动窗口注意力效率推向极限

Xiaomi MiMo Team, Anqi Liu, Aoxin Ma, Bo Chen, Bo Yang, Chen Wang, Chen Zhang, Chengda Tang, Chengwei Wang, Chiheng Lou, Depeng Yan, Fuli Luo, Gang Wang, Hailin Zhang, Jiale Sun, Kang Zhou, Rui Huang, Shaohui Liu, Shen Huang, Shijie Cao, Shuaishuai Fan, Tianling Zhou, Xiangwei Deng, Xueyang Xie, Xuli Wang, Yingchun Lai, Yu Yang, Yuan Zhang, Zhen Tang, Zhonghua Deng, Zihan Jiang

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对MiMo-V2.5模型家族,结合Hybrid SWA、MoE和多模态编码器进行全流程推理优化。通过多种策略优化KVCache系统,构建GCache并开发路由器,还优化多模态输入,构成首个有效涵盖该复合架构的大规模LLM生产服务系统。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11673 2026-07-15 cs.CV 版本更新 57%

ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space

ABot-3DWorld 0:一个用于探索任意 3D 空间的通用世界模型

Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchang Zhang, Jiawei Zhang, Zhicheng Liu, Zhongxu Sun, Tianjian Ouyang, Wenzheng Chen, Shixing Yang, Nianfei Fan, Guodong Sun, Huan Li, Zheng Zhou, Yongze Li, Yingliang Peng, Mengmeng Du, Yuan Liu, Haozhe Shi, Chunnuo Gong, Chengzhen Yu, Chunxue Jia, Yang Liu, Shiying Zeng, Junnan Lai, Hang Zhang, Ning Guo, Baoquan Chen, Mu Xu, Hongyu Pan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 介绍 ABot-3DWorld 0 通用多模态 3D 世界模型,核心是 SGP,通过特定流程将多模态输入转换为 3D 世界,用于通用 3D 内容创建,在开源方法中领先,多模态输入下场景保真度更高。

Comments Official Page: https://abot-world.amap.com/plaza

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11646 2026-07-14 cs.CV cs.RO 新提交 57%

Event-RGB Adaptive Tracking for Nighttime Highway Perception

用于夜间高速公路感知的事件-RGB自适应跟踪

Haidong Wang, Hengxing Cai, Wanlei Li, Xiaogang Xiong, Renxin Zhong

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能系统工程学院) School of Intelligence Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学智能科学与工程学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对高速公路夜间低光条件下RGB感知性能差的问题,提出JEAT框架,通过自适应扩展卡尔曼滤波器动态融合事件流与RGB帧,还创建SEHN数据集,为多模态融合研究提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10990 2026-07-14 cs.CV 新提交 57%

TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding

TreeSoc:用于足球视频理解的树状结构动态推理与工具协同

Thanh-Nhan Vo, Thanh-Khoi Nguyen, Trong-Thuan Nguyen, Trung-Hoang Le, Minh-Triet Tran

机构 * University of Science, VNU-HCM(胡志明市越南国立大学科学大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对当代视觉语言模型理解足球视频的挑战,提出TreeSoc框架,通过动态深度优先搜索机制分解查询,支持自适应工具路由,在多个数据集上取得优异成绩,证明其为视频理解的有效范式。

Comments Accepted to ICMV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10369 2026-07-14 cs.RO cs.AI 新提交 57%

VINE: Taming Generative Control Policies for Reinforcement Learning

VINE:驯服强化学习中的生成控制策略

Rushuai Yang, Zhuo Han, Houlin Li, Hecheng Wang, Zhichao Wu, Rui Zhang, Zhaowei Zhang, Zihong Chen, Xiaohan Yan, Chiming Liu, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot(未知机构) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究针对流匹配策略在值梯度强化学习中训练不稳定的问题,提出VINE方法。该方法通过在去噪步骤重建插值状态,创建稳定可微路径,实现稳定的端到端值梯度优化,在相关基准和任务中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10098 2026-07-14 cs.CV cs.LG 新提交 57%

DynaFilter: Cloud-driven Dynamic Filtering for Satellite Edge Intelligence

DynaFilter:用于卫星边缘智能的云驱动动态过滤

Ziyang Zhang, Jie Liu, Luca Mottola

机构 * Politecnico di Milano(米兰理工大学) Harbin Institute of Technology Shenzhen(哈尔滨工业大学(深圳))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对卫星边缘系统带宽受限等问题,设计DynaFilter动态过滤技术,通过建立云查询语义与压缩域特征的映射,让边缘设备在压缩域直接进行选择性RoI推理,实现减少数据量、节省带宽、降低能耗及加快推理延迟等效果。

Comments 15 pages, 23 figures, accepted by ACM MobiCom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23328 2026-07-14 cs.CL 版本更新 57%

Emotion Recognition in Sign Language Conversation

手语对话中的情感识别

Yusong Wang, Keyu Mao, Takao Obi, Minghao Shao, Kotaro Funakoshi

机构 * Institute of Science Tokyo(东京科学研究所) New York University(纽约大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对手语情感识别缺乏对话上下文的问题,提出eJSL Dialog数据集,并系统评估了从孤立视觉网络到多模态对话架构的模型,发现通用多模态对话情感识别模型在手语领域存在领域差距,需要开发面向手语的上下文感知视觉提取器并扩大对话数据集规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07370 2026-07-10 cs.RO cs.AI cs.HC cs.LG 新提交 57%

Behavior Foundations for Quadruped Robots: ABot-C0 Technical Report

四足机器人的行为基础:ABot-C0技术报告

Xufeng Zhao, Fuzhi Yang, Jianhui Chen, Li Gao, Zhang Meng, Jie Gao, Yao Zheng, Congyang Zhao, Tianxiong Lv, Menglin Yang, Minqi Gu, Yaru Zhao, Wenyu Liu, Honglin Han, Shihui Su, Zixiao Tang, Liu Liu, Mu Xu, Yang Cai, Wenbin Tang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究聚焦四足机器人运动控制,提出ABot-C0通用系统,构建数据金字塔生成运动片段,训练流匹配通用策略展示跟踪缩放定律,采用特定框架推动全地形遍历运动,经实验验证其能让四足机器人迈向产品级行为智能。

Comments Abot-C0 project page will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01803 2026-07-10 cs.CV 版本更新 57%

Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos

生成式动作叙事:评估合成视频中的人体运动

Xavier Thomas, Youngsun Lim, Ananya Srinivasan, Audrey Zheng, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Belmont High School(贝利蒙高中) Canyon Crest Academy(坎波尔峡谷学院) Runway

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究视频生成模型中评估复杂人类动作指标难的问题,提出融合骨骼与外观特征的评估指标,经多方面基准验证,该指标相比现有方法有显著改进,与人类感知相关性强,揭示了当前模型局限性并建立新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05240 2026-07-10 cs.RO cs.CV 版本更新 57%

StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling

StreamVLN:通过快慢上下文建模实现流式视觉与语言导航

Meng Wei, Chenyang Wan, Xiqian Yu, Tai Wang, Yuqiang Yang, Xiaohan Mao, Chenming Zhu, Wenzhe Cai, Hanqing Wang, Yilun Chen, Xihui Liu, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01560 2026-07-10 cs.CV 版本更新 57%

XOV-Action: Towards Generalizable Open-Vocabulary Action Recognition

XOV-Action:迈向可泛化的开放词汇动作识别

Kun-Yu Lin, Henghui Ding, Jia-Run Du, Jiaming Zhou, Yi-Xing Peng, Yu-Ming Tang, Zhilin Zhao, Chen Change Loy, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) AI Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能方向) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

AI总结 研究针对开放词汇动作识别模型泛化性不足的问题,提出XOV-Action模型,通过学习多样化表示和场景无关表示克服两大挑战,还构建XOVABench基准,实验证明该模型能有效提升跨视频领域的动作识别性能。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07518 2026-07-09 cs.CV 新提交 57%

Learning to Unify Deformable Shape and Texture Representations for Cardiac Video Classification

学习统一可变形形状和纹理表示用于心脏视频分类

Tonmoy Hossain, Miaomiao Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对心脏视频分类,现有方法简单拼接形状与纹理特征未充分利用互补性。本文提出新模型,在综合空间学习时间特征,设计双向交叉注意力融合特征,能动态调整贡献,在CMR视频数据集上达最优性能,提高了可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07001 2026-07-09 cs.CV 新提交 57%

Ego-Human Motion Prediction with 3D-Aware LLM

基于3D感知语言模型的自我-人类运动预测

Yujin Bae, Jaewoo Jeong, Hyeonseong Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 研究从自我中心视角预测人类运动问题,提出Ego3DLM模型,基于准确运动预测需3D环境理解及姿势语言整体预测原则,通过三阶段训练,在相关任务中取得领先性能,实现跨模态和时间一致的运动预测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06875 2026-07-09 cs.CV cs.LG 新提交 57%

Video2Reaction: Mapping Video to Audience Reaction Distribution in the Wild

Video2Reaction:将视频映射到自然环境中的观众反应分布

Trang Nguyen, Sidong Zhang, Shiv Shankar, Gauri Jagatap, Deepak Chandran, Andrea Fanelli, Madalina Fiterau

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究旨在通过Video2Reaction数据集实现视频到观众反应分布预测,开发仅用开源语言模型的两阶段多智能体管道,建立基准,发现预训练模型零样本失败,微调可提升性能,但任务仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05994 2026-07-08 cs.CV 新提交 57%

SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation

SparseCtrl-HOI:用于人机交互视频生成的稀疏时间控制

Shenbo Xie, Mingrui Cai, Xu Yang, Yifei Liu, Changxing Ding

机构 * South China University of Technology(华南理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对人机交互视频生成中建模物理动力学及时空协调复杂、现有方法依赖密集指导成本高且影响多样性的问题,提出SparseCtrl-HOI框架,用关键帧结合新机制和模块控制,构建数据集,降低标注开销,提升直播电商视频质量。

Comments ECCV 2026, Project Page: https://mpi-lab.github.io/SparseCtrl-HOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05855 2026-07-08 cs.LG cs.AI 新提交 57%

Unsupervised Anomaly Detection of Information Operations Users via Behavioral and Language Patterns

通过行为和语言模式对信息操作用户进行无监督异常检测

Sishun Liu, Sajal Halder, Ke Deng, Yan Wang, Xiuzhen Zhang

机构 * RMIT University(皇家墨尔本理工大学) Macquarie University(麦考瑞大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究针对社交媒体网络信息操作检测难题,提出无监督方法TENSOR,利用多模态数据,通过训练时间点过程捕捉异常行为模式,并引入新证据函数调整输出,在五个真实数据集上表现优于基线。

Comments Accepted at ECML/PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13808 2026-07-08 cs.CV 版本更新 57%

VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models

VisCoP:用于视觉语言模型视频域适应的视觉探测

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学查塔努加分校) Elorian AI(Elorian人工智能公司)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型在新领域性能下降问题,提出参数高效的VisCoP框架,通过可学习视觉探测器增强视觉编码器,在多种适应设置下评估,该框架优于现有策略,能有效适应新领域且保留源域能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04559 2026-07-07 cs.CV 新提交 57%

QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding

QSVideo:用于视频理解的查询条件语义时间检索

Wei Ao, Lan Wang, Vishnu Naresh Boddeti

机构 * Michigan State University(密歇根州立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视频理解中视觉语言模型性能随视频时长下降问题,提出QSVideo框架,通过查询条件语义排序器、联合优化相关性和多样性及时间对齐策略,提升视频VLM性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03855 2026-07-07 cs.CV 新提交 57%

PRISM3D: Probabilistic Refinement and Robust Initialization for Physically Consistent Scene Modeling under Extreme Motion Blur

PRISM3D:极端运动模糊下物理一致场景建模的概率细化与鲁棒初始化

Gopi Raju Matta, Reddypalli Trisha, Vemunuri Divya Madhuri, Kaushik Mitra

机构 * Computational Imaging Lab, Dept. of Electrical Engineering, IIT Madras(印度理工学院马德拉斯分校电气工程系计算成像实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 研究从极端运动模糊图像进行盲3D场景重建问题,提出PRISM3D框架,用鲁棒初始化策略结合概率物理方法,还介绍多模态扩展PRISM3D-E及基准,实验表明其达新的最优性能。

Comments Accepted to ECCV-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01469 2026-07-07 cs.CV 新提交 57%

A Cost-Aware, Paired Protocol for Auditing Dynamic Tool Synthesis in Agentic Video Question Answering

一种成本感知的配对协议,用于审计智能视频问答中的动态工具合成

Aseel Mohamed, Rama AlHamidi, Mohamed Rayan Barhdadi, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出成本感知的配对协议,联合评估准确性与成本,揭示动态工具合成在视频问答中的效率与代价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21241 2026-07-07 cs.RO cs.AI 版本更新 57%

CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors

CorridorVLA:通过稀疏锚点实现生成动作头的显式空间约束

Dachong Li, ZhuangZhuang Chen, Jin Zhang, Jianqiang Li

机构 * College of Computer Science and Software Engineering(计算机科学与软件工程学院) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 CorridorVLA通过稀疏锚点提供显式空间约束,提升动作生成性能,在LIBERO-Plus基准上改进成功率3.4%-12.4%。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18157 2026-07-07 cs.CV cs.LG 版本更新 57%

Agentic Very Long Video Understanding

智能体超长视频理解

Aniket Rege, Arka Sadhu, Yuliang Li, Kejie Li, Ramya Korlakai Vinayak, Yuning Chai, Yong Jae Lee, Hyo Jin Kim

机构 * Reality Labs Research at Meta(Meta 实验室) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对智能眼镜等设备带来的长视频理解需求,以实体场景图为核心构建增强智能体框架EGAgent,实现结构化搜索、推理及跨模态能力,在相关数据集实验中取得较好表现。

Comments 29 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02425 2026-07-03 cs.CV 新提交 57%

Learning to Evolve Scenes: Reasoning about Human Activities with Scene Graphs

学习演化场景:用场景图推理人类活动

Francesca Pistilli, Simone Alberto Peirone, Giuseppe Averta

机构 * Politecnico di Torino(托斯托大学)

专题命中 视频多模态 :MLLM(abstract_cn);分类 cs.CV

AI总结 提出SG-Ego标注集和GLEN模型,通过时空场景图显式建模人-环境交互的动态演化,实现活动驱动的场景变化推理与预测。

Comments Project page at https://francescapistilli.github.io/GLEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02024 2026-07-03 cs.CV 新提交 57%

Spatio-Temporal and Clinical Conditioning for Fine-Grained Radiology Report Retrieval

细粒度放射学报告检索的时空与临床条件化

P. Sloan, E. Simpson, M. Mirmehdi

机构 * Department of Computer Science University of Bristol(计算机科学系 布里斯托大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出STAR3框架,通过区域级解剖信息与临床指征及纵向变化对齐,实现基于检索的放射学报告生成,在MIMIC-CXR上优于现有方法。

Comments 14 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏