arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4728 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4728 篇

2606.09532 2026-06-09 cs.CY cs.CL 新提交 57%

Interpretable Crisis Behavior Analysis Using Mobility and Social Media Data

基于移动性和社交媒体数据的可解释危机行为分析

Muhammad Hamza Arshad Majeed, Sidahmed Benabderrahmane, Talal Rahwan

机构 * New York University (NYUAD)(纽约大学(NYUAD))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出统一可解释流水线,融合移动性和社交媒体数据,通过形式概念分析和关联规则挖掘,识别危机中跨域行为模式,并在洛杉矶山火和COVID-19案例中验证,生成可操作的政策简报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09261 2026-06-09 cs.CV 新提交 57%

Self-supervised Learning Matters: A Simple Ensemble Solution for Micro-Gesture Recognition

自监督学习至关重要:一种用于微手势识别的简单集成方案

Tingyi Liu, Kun Li, Fei Wang, Junjie Chen, Zhiliang Wu, Jihao Gu, Haixu Liu, Dan Guo

机构 * Hefei University of Technology(合肥工业大学) United Arab Emirates University(阿拉伯联合酋长国大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui Evolution Technology Co., Ltd.(安徽进化科技有限公司) Nanyang Technological University(南洋理工大学) University College London(伦敦大学学院) The University of Sydney(悉尼大学) Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯科技有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种集成自监督RGB模型与监督多流模型的框架,在MiGA挑战赛微手势分类赛道取得第一名,通过自监督预训练提升性能,在iMiGUE测试集上达到74.419%的top-1准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09248 2026-06-09 cs.CV 新提交 57%

Temporal-Aware Reasoning Optimization for Video Temporal Grounding

时间感知推理优化用于视频时间定位

Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出TaRO框架,通过构造性推理探索和时间敏感性奖励,增强多模态大模型在视频时间定位中的时间感知推理能力,实现最先进性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09181 2026-06-09 cs.CV cs.LG 新提交 57%

Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA

用于视频问答中细粒度证据分离的反事实推理

Zhou Du, Hamid Krim, Xiao Wu, Zhaoquan Yuan, Liangwei Li, Keisuke Fujii

机构 * School of OptoElectonic Science and Engineering, University of Electronic Science and Technology of China(电子科技大学光电科学与工程学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出反事实推理框架CREDiT,通过结构因果模型将视频问答中的跨模态表示分解为因果和非因果成分,在独立性约束下进行特征级因果干预,提升答案准确性和推理可靠性。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08566 2026-06-09 cs.CV 新提交 57%

Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction

通过细粒度情感-原因对提取实现精确的情感归因视频字幕生成

Weidong Chen, Cheng Ye, Zhendong Mao, Liping Wang, Xinyan Liu, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出细粒度情感-原因对提取框架,通过概念感知视觉语义分解和视觉引导情感可解释学习,提升情感视频字幕的准确性和丰富性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08091 2026-06-09 cs.CV 新提交 57%

VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation

VideoWeaver: 评估与进化智能体长视频生成技能

Jianhui Wei, Jie Tan, Hengchuan Zhu, Xiaotian Zhang, Yan Zhang, Ziyi Chen, Daoan Zhang, Wei Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出VideoWeaver框架,让智能体自主组合基础技能生成视频,并设计智能体裁判评估过程与结果,通过技能进化算法提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07431 2026-06-09 cs.CV 版本更新 57%

OpenGlass: Ultra-Low-Power On-Device AI Eyewear with Event-based Vision

OpenGlass:用于设备上基于事件的手势识别的开源智能眼镜

Pietro Bonazzi, Julian Moosmann, Ahmet Celik, Philipp Mayer, Michele Magno

机构 * Department of Information Technology and Electrical Engineering, ETH Zürich(信息科技与电气工程系,瑞士联邦理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出开源智能眼镜平台OpenGlass,采用模块化设计、事件驱动电源管理和GAP9 RISC-V SoC,实现低功耗设备上ML,在LynX数据集上达到83.94%的跨主体手势识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02802 2026-06-09 cs.AI 版本更新 57%

ChatHealthAI: Aligning Electronic Health Record Representations with Large Language Models for Grounded Clinical Reasoning

ChatHealthAI: 将电子健康记录表示与大语言模型对齐以实现基于临床的推理

Bo-Hong Wang, Baicheng Peng, Ruilin Wang, Jun Bai, Ziyang Song, Yue Li

机构 * School of Computer Science, McGill University(麦吉尔大学计算机科学系) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出ChatHealthAI框架,通过任务感知重采样器将预训练的EHR基础模型的结构化表示与冻结的大语言模型语义空间对齐,实现可解释的临床推理并保持预测性能。

Comments Main paper with appendix, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17855 2026-06-09 cs.AI cs.RO 版本更新 57%

QuickLAP: Quick Language-Action Preference Learning for Semi-Autonomous Agents

QuickLAP: 为半自主代理快速语言-动作偏好学习

Jordan Abi Nader, David Lee, Nathaniel Dennler, Andreea Bobu

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出QuickLAP,一种融合物理和语言反馈的贝叶斯框架,用于实时推断奖励函数,通过大规模语言模型提取奖励特征注意力掩码和偏好偏移,从而在半自主驾驶模拟器中将奖励学习误差降低70%,并通过用户研究验证其可理解性和协作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07016 2026-06-08 stat.AP cs.CV 新提交 57%

An Integrated Roadside Sensing and Communication Framework for Vulnerable Road User Safety at Signalized Intersections

信号交叉口弱势道路使用者安全的集成路边感知与通信框架

Parvez Anowar

机构 * Department of Civil, Environmental and Construction Engineering, University of Central Florida(中央佛罗里达大学土木、环境与建设工程系)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出集成多模态感知、边缘计算、V2X/P2X通信和自适应信号控制的框架,基于公开数据集R-LiViT分析53,319个标注,发现VRU占49%、昼夜密度差异大、近距离事件变化10倍、83%行人边界框小,支持多模态感知和自适应部署。

Comments 17 pages, 5 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07161 2026-06-08 cs.CV 新提交 57%

TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance

TraRA: 面向城市监控视频文本识别的轨迹级识别聚合方法

Duc Tri Tran, Trung Thanh Nguyen, Vijay John, Phi Le Nguyen, Yasutomo Kawanishi

机构 * RIKEN(日本理化学研究所) Hanoi University of Science and Technology(河内科学技术大学) Nagoya University(名古屋大学) Lawrence Technological University(劳伦斯技术大学) Ritsumeikan University(立命馆大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出TraRA方法,通过轨迹级文本识别聚合,利用时间与多模态一致性,解决监控视频中运动模糊、遮挡等导致的帧级识别不一致问题,在多个基准上提升跟踪与识别性能。

Comments 22nd IEEE International Conference on Advanced Visual and Signal-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06891 2026-06-08 cs.CV 新提交 57%

Stream3D-VLM: Online 3D Spatial Understanding with Incremental Geometry Priors

Stream3D-VLM:基于增量几何先验的在线3D空间理解

Hanxun Yu, Xuan Qu, Lei Ke, Boqiang Zhang, Yuxin Wang, Jianke Zhu, Dong Yu

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文汇) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出在线3D视觉语言模型Stream3D-VLM,通过自回归流控制、轻量视觉-空间特征融合模块和几何自适应体素压缩,实现从流式视频中实时理解3D空间,并构建超百万在线3D问答数据集,在多项任务上超越现有模型。

Comments Project Page: https://stream3d-vlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03381 2026-06-08 cs.LG cs.AI 版本更新 57%

Proxy Reconstruction Pre-training for Ramp Flow Prediction at Highway Interchanges

高速公路立交匝道流量预测的代理重建预训练

Yongchao Li, Jun Chen, Zhuoxuan Li, Chao Gao, Yang Li, Chu Zhang, Changyin Dong

机构 * Southeast University(东南大学) Institute of Telecommunications and Information Sciences, China(中国电信与信息科学研究院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 提出时空解耦自编码器(STDAE),通过跨模态重建预训练从主线数据恢复匝道流量,结合GWNet等模型提升预测精度,在真实数据集上超越13个基线。

Comments Accepted at Applied Soft Computing Journal

Journal ref Applied Soft Computing Journal 200 (2026) 115462

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05736 2026-06-05 cs.CV 57%

VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning

VTI-CoT: 用于视频推理的视觉-文本交织思维链

Shufan Zhang, Ziyue Lin, Bairun Wang, Lei Jin, Xuanding Ding, Xinzhu Ma, Kunlin Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Hong Kong(香港大学) Beijing Shanwei Zhixing Technology Co., Ltd.(北京尚维智行科技有限公司) Tsinghua University(清华大学) Beihang University(北航)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出VTI-CoT框架,通过视觉-文本交织的思维链结合OCR压缩技术,提升视频推理准确性和训练效率。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05620 2026-06-05 cs.CL 57%

An ERP Study on Recursive Locative Processing in Mandarin-Speaking Children with Autism

自闭症儿童递归处所加工的ERP研究

Xiaoyi Wang, Chenxi Fu, Ziman Zhuang, Caimei Yang

机构 * Soochow University(苏州大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CL

AI总结 通过ERP实验,研究自闭症儿童处理递归处所结构时在预测、语义整合和句法重析三个阶段的时间动态差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05185 2026-06-05 cs.CY cs.CV cs.LG 57%

Drishti AI-Event Guardian: An Intelligent Real-Time Crowd Monitoring and Emergency Response System for Mass Gathering Events

Drishti AI-Event Guardian:面向大规模聚集事件的智能实时人群监控与应急响应系统

Ritabrata Roy Choudhury, Arkajyoti Karmakar, Rudra Pratap Mitra

机构 * School of Computer Engineering, Kalinga Institute of Industrial Technology(计算机工程学院,凯林加工业技术学院) School of Electronics Engineering, Kalinga Institute of Industrial Technology(电子工程学院,凯林加工业技术学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出Drishti AI-Event Guardian框架,结合YOLOv8、异常检测和梯度提升回归等多模态深度学习技术,实现实时人群密度估计、异常检测、预测建模、人脸识别、医疗紧急报告、聊天机器人和智能警卫重分配,在Kumbh Mela和RCB Victory Parade事件中验证了低延迟和高精度。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24481 2026-06-05 cs.CV 57%

OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

OmniEgo-R$^2$:面向CVPR 2026首届跨领域EgoCross挑战赛的路由推理框架

Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对跨领域自我中心视频推理中的时间边界模糊、语义粒度不匹配和决策不稳定问题,提出OmniEgo-R$^2$路由推理框架,在Source-Limited和Open-Source赛道均获第二名。

Comments Technical Report for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23300 2026-06-05 cs.CV cs.RO 57%

Learning Predictive Visuomotor Coordination

学习预测性视觉-运动协调

Wenqi Jia, Bolin Lai, Miao Liu, Danfei Xu, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Tech(佐治亚理工学院) Meta AI

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于预测的视觉-运动协调建模任务,通过结合第一人称视觉和运动学观测预测头部姿态、目光方向和上半身运动,展示了多模态整合在理解视觉-运动协调中的重要性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04836 2026-06-04 cs.CV 57%

3D Temporal Analysis for Autism Spectrum Disorder Screening During Attention Tasks

注意力任务期间自闭症谱系障碍筛查的3D时间分析

Inam Qadir, Elizabeth B Varghese, Dena Al-Thani, Marwa Qaraqe

机构 * College of Science and Engineering, Hamad Bin Khalifa University, Qatar Foundation, Doha, Qatar(科学与工程学院,哈马德·本·哈利法大学,卡塔尔基金会,多哈,卡塔尔)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出基于DECA的3D时间分析框架,提取头部姿态和面部表情特征,利用LSTM/GRU分类器在VR-CPT任务中实现ASD筛查,多模态融合达到84.6%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04596 2026-06-04 cs.CL 57%

A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

多视频摘要中位置偏差的系统评估:基于多模态大语言模型

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(未来科学国际中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 本研究系统评估了多模态大语言模型在多视频摘要任务中的位置偏差,通过构建基准和三种互补指标揭示了领域与模型依赖的偏差特性,并分析了提示级缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04323 2026-06-04 cs.CV 57%

Answer Self-Consistency with Margin-Triggered Question Re-Arbitration for the CVPR 2026 VidLLMs Challenge

面向CVPR 2026 VidLLMs挑战赛的基于边际触发问题重新仲裁的答案自一致性方法

Tomoya Miyazawa, Hiroyasu Okuno

机构 * Data Analytics Labo Co.(数据分析师实验室公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种无需训练的测试时推理框架ASC-MQRA,通过答案自一致性聚合多轮视频问答结果,并利用边际触发机制对低置信度样本进行条件性重新仲裁,在CVPR 2026 VidLLMs挑战赛Track 2上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04098 2026-06-04 cs.CV 57%

When Seeing Is Not Believing -- A Benchmark for Search-Grounded Video Misinformation Detection

当眼见不再为实——面向搜索辅助的视频虚假信息检测基准

Tao Yu, Yujia Yang, Shenghua Chai, Zhang Jinshuai, Haopeng Jin, Hao Wang, Minghui Zhang, Zhongtian Luo, Yuchen Long, Xinlong Chen, Jiabing Yang, Zhaolu Kang, Yuxuan Zhou, Zhengyu Man, Xinming Wang, Hongzhu Yi, Zheqi He, Xi Yang, Yan Huang, Liang Wang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) BAAI(百度人工智能研究院) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出EVID-Bench基准,通过跨视频对比和开放网络搜索检测视频虚假信息,涵盖9种操纵类型,评估前沿多模态模型发现准确率低且面临多种挑战。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01955 2026-06-02 cs.RO cs.CV 57%

WALL-WM: Carving World Action Modeling at the Event Joints

WALL-WM:在事件关节处雕刻世界动作建模

Shalfun Li, Victor Yao, Charles Yang, Truth Qu, Regis Cheng, Ryan Yu, Howard Lu, Newton Von, Vincent Chen, Yohann Tang, Maeve Zhang, Ellie Ma, Gody Li, Sage Yang, Lorien Shu, J. W. Gao, Ethan Chen, Colin Ye, Yu Sun, Elise Mon, PS Zhang, Neo Li, Lily Li, James Wang, Ping Yang, Chris Pan, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang

机构 * X Square Robot Team(X Square机器人团队)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出WALL-WM世界动作模型,通过事件级视觉-语言-动作预训练解决固定长度动作块与语言、视觉、动作之间的粒度不匹配问题,实现跨语言、场景和任务的泛化,在大规模真实世界评估中达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01933 2026-06-02 cs.CV 57%

3rd Place at CVPR 2026 CASTLE Challenge: Agentic Multi-View Long-Context Video Understanding via Hierarchical Knowledge Graph Retrieval

CVPR 2026 CASTLE挑战赛第三名:基于层次化知识图谱检索的智能多视角长视频理解

Raghad Albusayes, Munirah Alyahya

机构 * TAHAKOM(塔哈科姆)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种免训练的智能框架,通过视频知识图谱和层次化检索索引,解决大规模多视角视频中的复杂时空推理问题,在CASTLE挑战赛中获得第三名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01352 2026-06-02 cs.AI 57%

FlowTime: Towards Continuous Generative Watch Time Prediction via Flow-based Personalized Priors

FlowTime: 基于流的个性化先验实现连续生成式观看时间预测

Hongxu Ma, Han Zhou, Chenghou Jin, Jie Zhang, Xiaoyu Yang, Chunjie Chen, Jihong Guan, Shuigeng Zhou

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学) Kuaishou Technology(快手科技) Tongji University(同济大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对现有观看时间预测方法在范式上的局限性,提出连续生成式回归范式及FlowTime方法,利用一步生成变分自编码器和基于流的个性化先验,有效建模多模态用户-物品交互模式,显著提升预测性能。

Comments Accepted by KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01106 2026-06-02 cs.CV 57%

Temporal Evidence Routing with Structured Visual Evidence for TimeLogicQA

基于结构化视觉证据的时间证据路由用于TimeLogicQA

Yuyang Sun, Yongliang Wu, Xingyu Zhu, Yuxia Chen, Zhenxiang Jiang, Yangguang Ji, Wenbo Zhu, Yanxi Shi, Jay Wu, Shuo Wang, Xu Yang

机构 * Southeast University(东南大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究员) Opus AI Research(Opus AI研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出视觉证据路由流水线,分离感知与符号时间推理,通过结构化视觉证据和确定性时间规则在TimeLogicQA上达到81.8 AvgAcc。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00829 2026-06-02 cs.CV 57%

The Right Inference Strategy Is All You Need: Nearly Training-Free Domain-Wise Inference for EgoCross Challenge

正确的推理策略即是一切:面向EgoCross挑战的近乎无需训练的领域感知推理

Leyi Wu, Yifan Zhao, Jinjie Zhang, Yinchuan Li, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Knowin

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对EgoCross挑战中源受限场景下多模态大模型在领域偏移严重的自我中心视频问答任务上表现不佳的问题,提出一种领域感知推理策略,通过为四个目标领域分别设计不同的输入、提示和答案映射流程,在不进行额外训练的情况下显著提升基线模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00620 2026-06-02 cs.CV 57%

FlowNar: Scalable Streaming Narration for Long-Form Videos

FlowNar: 面向长视频的可扩展流式叙述

Zeyun Zhong, Manuel Martin, Chengzhi Wu, David Schneider, Frederik Diederichs, Juergen Gall, Juergen Beyerer

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Lamarr Institute for Machine Learning(拉马尔机器学习研究所) University of Bonn(波恩大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出FlowNar框架,通过动态上下文管理和CLAM模块实现有界视觉记忆与计算复杂度,在流式视频叙述中兼顾高质量与高效率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00582 2026-06-02 cs.AI 57%

PropLLM: Propagation-Aware Scene Reconstruction for Network Fault Diagnosis

PropLLM:面向网络故障诊断的传播感知场景重建

Zongzong Wu, Ming Zhao, Fengxiao Tang, Nei Kato

机构 * National Natural Science Foundation of China(国家自然科学基金委员会) High Performance Computing Center of Central South University(中南大学高性能计算中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出PropLLM,首次将逐跳场景重建范式与LLM生成推理能力结合,通过双知识图谱和时序因果传播注意力机制,从端点告警回溯定位根因并确定故障类型,在真实Wi-Fi多模态故障数据集上诊断准确率提升3.9%,根因定位准确率提升4.7%,幻觉率降低50.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23057 2026-06-02 cs.RO cs.CV cs.SY eess.IV eess.SY 57%

Seq-DeepIPC: Sequential Sensing for End-to-End Control in Legged Robot Navigation

Seq-DeepIPC:足式机器人导航中用于端到端控制的顺序感知

Oskar Natan, Jun Miura

机构 * Department of Computer Science and Electronics, Universitas Gadjah Mada(计算机科学与电子系,加查马达大学) Department of Computer Science and Engineering, Toyohashi University of Technology(计算机科学与工程系,东福冈技术大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出Seq-DeepIPC模型,通过融合多模态感知(RGB-D+GNSS)与时间序列,实现足式机器人在真实环境中的端到端导航控制,并在机器人狗上验证了其有效性。

Comments This work has been accepted for publication in the IEEE Sensors Journal. https://ieeexplore.ieee.org/document/11373257/

详情

展开后加载摘要…

URL PDF HTML 收藏