arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 576 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 576 篇

2502.04326 2026-03-03 cs.CV cs.AI 57%

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

WorldSense: 评估多模态大语言模型的现实世界多模态理解

Jack Hong, Shilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie

机构 * Xiaohongshu Inc.(小红书公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 WorldSense是首个评估多模态大语言模型现实世界多模态理解能力的基准,通过多模态协作、多样化视频任务和高质量标注,全面评估模型在复杂场景中的表现。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11340 2026-03-02 cs.CV 57%

GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection

GenVidBench:一个600万的AI生成视频检测基准数据集

Zhenliang Ni, Qiangyu Yan, Mouxiao Huang, Tianning Yuan, Yehui Tang, Hailin Hu, Xinghao Chen, Yunhe Wang

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 GenVidBench是一个包含600万视频的AI生成视频检测基准数据集,通过大规模、跨源和跨生成器的视频收集,提升AI生成视频检测模型的泛化能力。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05236 2026-02-26 cs.CV 57%

Unified Reward Model for Multimodal Understanding and Generation

多模态理解和生成的统一奖励模型

Yibin Wang, Yuhang Zang, Hao Li, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出统一奖励模型,通过联合学习多种视觉任务提升多模态理解和生成的性能。

Comments project page: https://codegoat24.github.io/UnifiedReward/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21137 2026-02-25 cs.CV 57%

UDVideoQA: A Traffic Video Question Answering Dataset for Multi-Object Spatio-Temporal Reasoning in Urban Dynamics

UDVideoQA: 一个用于城市动态多对象时空推理的交通视频问答数据集

Joseph Raj Vishal, Nagasiri Poluri, Katha Naik, Rutuja Patil, Kashyap Hegde Kota, Krishna Vinod, Prithvi Jai Ramesh, Mohammad Farhadi, Yezhou Yang, Bharatesh Chakravarthi

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视频数据与评测 :video language model(abstract);分类 cs.CV

AI总结 UDVideoQA是一个用于城市动态多对象时空推理的交通视频问答数据集,通过统一标注流程生成28K问题-答案对,评估视觉定位和因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20354 2026-02-25 cs.CV 57%

3DSPA: A 3D Semantic Point Autoencoder for Evaluating Video Realism

3DSPA:一种用于评估视频真实性的3D语义点自编码器

Bhavik Chandna, Kelsey R. Allen

机构 * University of California, San Diego, CA, USA(加州大学圣迭戈分校) University of British Columbia, Vancouver, BC, Canada(不列颠哥伦比亚大学) Vector Institute, Toronto, ON, Canada(向量研究所)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 3DSPA通过整合3D语义与时空点轨迹,实现无需参考视频的视频真实性自动评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17814 2026-02-23 cs.CV cs.IR cs.LG 57%

VQPP: Video Query Performance Prediction Benchmark

VQPP:视频查询性能预测基准

Adrian Catalin Lutu, Eduard Poesina, Radu Tudor Ionescu

机构 * University of Bucharest / Bitdefender(布加勒斯大学/Bitdefender) University of Bucharest(布加勒斯大学)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出VQPP基准,用于视频查询性能预测,包含两个数据集和两个系统,探索预检索和后检索预测器,并展示其在训练大型语言模型上的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13633 2026-02-17 cs.CV 57%

A generalizable foundation model for intraoperative understanding across surgical procedures

一种可泛化的术中理解基础模型用于不同手术程序

Kanggil Park, Yongjun Jeon, Soyoung Lim, Seonmin Park, Jongmin Shin, Jung Yong Kim, Sehyeon An, Jinsoo Rhu, Jongman Kim, Gyu-Seong Choi, Namkee Oh, Kyu-Hwan Jung

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 ZEN是一种基于自监督多教师蒸馏框架训练的术中手术视频理解基础模型,通过大规模数据集训练实现了跨手术程序的泛化能力,优于现有手术基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13853 2026-02-13 cs.CV 57%

Can World Simulators Reason? Gen-ViRe: A Generative Visual Reasoning Benchmark

世界模拟器能推理吗?Gen-ViRe:一个生成性视觉推理基准

Xinxin Liu, Zhaopan Xu, Ming Li, Kai Wang, Yong Jae Lee, Yuzhang Shang

机构 * University of Central Florida(中央佛罗里达大学) National University of Singapore(新加坡国立大学) UW-Madison(威斯康星大学麦迪逊分校)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 Gen-ViRe提出一个生成性视觉推理基准,通过分解CoF推理为六个认知维度和24个子任务,评估视频模型的推理能力,揭示视觉质量与推理深度的差异。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10675 2026-02-12 cs.CV cs.AI 57%

TwiFF (Think With Future Frames): A Large-Scale Dataset for Dynamic Visual Reasoning

TwiFF (Think With Future Frames): 一个大规模动态视觉推理数据集

Junhua Liu, Zhangcheng Wang, Zhike Han, Ningli Wang, Guotao Liang, Kun Kuang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) School of Computer and Computing Science, Hangzhou City University, Hangzhou, China(杭州市城市大学计算机与计算科学学院) Henan Academy of Innovations in Medical Science (AIMS), Zhengzhou, China(河南省医学创新研究院) School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 TwiFF提出一个大规模动态视觉推理数据集及模型,通过整合视频生成与图像理解能力,提升动态场景下的视觉问答性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08971 2026-02-12 cs.CV cs.RO 57%

WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models

WorldArena: 一个用于评估具身世界模型感知与功能效用的统一基准

Yu Shang, Zhuohang Li, Yiding Ma, Weikang Su, Xin Jin, Ziyou Wang, Lei Jin, Xin Zhang, Yinzhou Tang, Haisheng Su, Chen Gao, Wei Wu, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Yong Li

机构 * Tsinghua University, Beijing, China(清华大学) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) The University of Hong Kong, Hong Kong SAR, China(香港大学) Princeton University, Princeton, NJ, USA(普林斯顿大学) Chinese Academy of Sciences, Beijing, China(中国科学院) University of Science(科学技术大学) Peking University, Beijing, China(北京大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 WorldArena是一个统一的基准,用于评估具身世界模型的感知和功能效用,揭示高视觉质量与强具身任务能力之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08828 2026-02-10 cs.CV 57%

VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning

VideoVeritas:通过感知预设强化学习实现AI生成视频检测

Hao Tan, Jun Lan, Senyuan Shi, Zichang Tan, Zijian Yu, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 VideoVeritas通过感知预设强化学习提升AI生成视频检测性能,整合细粒度感知与事实推理,采用时空定位和自监督计数提升检测效果。

Comments Project: https://github.com/EricTan7/VideoVeritas

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01615 2026-02-04 cs.CV 57%

Saliency-Guided DETR for Moment Retrieval and Highlight Detection

基于显著性的DETR用于时刻检索和突出检测

Aleksandr Gordeev, Vladimir Dokholyan, Irina Tolstykh, Maksim Kuprashevich

机构 * SALUTEDEV LLC

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

AI总结 本文提出基于显著性的DETR架构,通过引入显著性引导交叉注意力机制和混合DETR结构,提升视频时刻检索和突出检测性能,并在多个基准上取得最佳结果。

Comments 8 pages, 2 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21282 2026-01-30 cs.CV 57%

WorldBench: Disambiguating Physics for Diagnostic Evaluation of World Models

WorldBench: 为世界模型诊断评估进行物理辨析

Rishi Upadhyay, Howard Zhang, Jim Solomon, Ayush Agrawal, Pranay Boreddy, Shruti Satya Narayana, Yunhao Ba, Alex Wong, Celso M de Melo, Achuta Kadambi

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Sony AI(索尼人工智能) Yale University(耶鲁大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 WorldBench通过概念特定的解耦评估,提升世界模型的物理推理能力评估的准确性和可扩展性。

Comments Webpage: https://world-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13974 2026-01-21 cs.CV 57%

STEC: A Reference-Free Spatio-Temporal Entropy Coverage Metric for Evaluating Sampled Video Frames

STEC:一种无参考的时空熵覆盖度量,用于评估采样视频帧

Shih-Yao Lin

机构 * Independent Researcher(独立研究者)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 STEC是一种无参考的时空熵覆盖度量,用于评估视频帧采样的有效性,通过联合建模空间信息强度、时间分散性和非冗余性,提供一种轻量且原则性的采样质量度量。

Comments This paper corresponds to the camera-ready version of a WACV 2026 Workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11290 2026-01-19 cs.CV 57%

Efficient On-Board Processing of Oblique UAV Video for Rapid Flood Extent Mapping

高效处理倾斜无人机视频以快速绘制洪水范围

Vishisht Sharma, Sam Leroux, Lisa Landuyt, Nick Witvrouwen, Pieter Simoens

机构 * IDLab, Department of Information Technology, Ghent University - imec(IDLab,信息科技系,根特大学 - imec) Environmental Intelligence Unit, VITO (Flemish Institute for Technological Research)(环境智能单元,VITO(佛兰德斯技术研究院))

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出TTR框架,通过利用倾斜视频的时空冗余性,实现嵌入式设备上的高效视频分割,减少推理延迟并保持分割精度,适用于时间敏感的遥感任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10165 2026-01-16 cs.CV 57%

Advancing Adaptive Multi-Stage Video Anomaly Reasoning: A Benchmark Dataset and Method

推动自适应多阶段视频异常推理:一个基准数据集和方法

Chao Huang, Benfeng Wang, Wei Wang, Jie Wen, Li Shen, Wenqi Ren, Yong Xu, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学计算机科学与技术学院(深圳校区)) Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology(哈尔滨工业大学深圳视觉目标检测与识别重点实验室)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出视频异常推理任务及相应数据集,通过结构化思维链和自适应策略优化,提升多阶段视频异常推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07290 2026-01-13 cs.CV 57%

VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding

VideoLoom:一种用于联合空间-时间理解的视频大语言模型

Jiapeng Shi, Junke Wang, Zuyao You, Bo He, Zuxuan Wu

机构 * Fudan University(复旦大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 VideoLoom是一种用于联合空间-时间理解的视频大语言模型,通过LoomData-8.7k数据集和LoomBench基准测试,在多个视频理解任务中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06198 2026-01-13 cs.CV 57%

How Does India Cook Biryani?

印度是如何烹饪饭团的?

Shubham Goel, Farzana S, C V Rishi, Aditya Arun, C V Jawahar

机构 * IIIT Hyderabad

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出首个大规模饭团制作视频数据集及多阶段框架,用于研究烹饪视频中细粒度步骤差异及文化关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05059 2026-01-09 cs.CV cs.LG 57%

From Understanding to Engagement: Personalized pharmacy Video Clips via Vision Language Models (VLMs)

从理解到参与:通过视觉语言模型(VLMs)生成个性化药学视频片段

Suyash Mishra, Qiang Li, Srikanth Patil, Anubhav Girdhar

机构 * Roche(罗氏) Accenture(埃森哲) Involead

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

AI总结 本文提出基于视觉语言模型和音频语言模型的个性化药学视频片段生成方法,通过剪切合并算法和个性化机制提升生成效率与质量,实现制药行业内容处理的高效自动化。

Comments Contributed original research to top tier conference in VLM; currently undergoing peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21402 2025-12-29 cs.CV 57%

Understanding Virality: A Rubric based Vision-Language Model Framework for Short-Form Edutainment Evaluation

理解病毒性:一种基于Rubric的视觉-语言模型框架用于短形式教育娱乐内容评估

Arnav Gupta, Gurekas Singh Sahney, Hardik Rathi, Abhishek Chandwani, Ishaan Gupta, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,比里尼)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出基于Rubric的视觉-语言模型框架,用于评估短形式教育娱乐视频的病毒性,通过提取音频视觉特征并训练回归评估器,实现可解释且可扩展的参与度预测。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20557 2025-12-24 cs.CV 57%

Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models

在4D中学习推理:面向视觉语言模型的动态空间理解

Shengchao Zhou, Yuxin Chen, Yuying Ge, Wei Huang, Jiehong Lin, Ying Shan, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG实验室)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本研究提出DSR套件,通过生成多选题-答案对和轻量级几何选择模块提升视觉语言模型的动态空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17468 2025-12-19 cs.CV cs.AI cs.LG cs.RO 57%

A Synthetic Dataset for Manometry Recognition in Robotic Applications

用于机器人应用的测压识别合成数据集

Pedro Antonio Rabelo Saraiva, Enzo Ferreira de Souza, Joao Manoel Herrera Pinheiro, Thiago H. Segreto, Ricardo V. Godoy, Marcelo Becker

机构 * University of São Paulo(圣保罗大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种混合数据合成方法,通过结合过程渲染和AI驱动视频生成,提升机器人应用中测压识别的训练效果和可靠性。

Journal ref 2025 Latin American Robotics Symposium (LARS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07981 2025-12-18 cs.CV cs.AI 57%

Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation

Omni-Effects: 统一且空间可控的视觉效果生成

Fangyuan Mao, Aiming Hao, Jintao Chen, Dongxia Liu, Xiaokun Feng, Jiashu Zhu, Meiqi Wu, Chubin Chen, Jiahong Wu, Xiangxiang Chu

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 Omni-Effects通过统一框架实现空间可控的多效果生成,结合LoRA-MoE和SAP技术,提升视觉效果生成的精度和多样性。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10945 2025-12-13 cs.CV 57%

MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation

MeViS:一种多模态数据集,用于指称运动表达视频分割

Henghui Ding, Chang Liu, Shuting He, Kaining Ying, Xudong Jiang, Chen Change Loy, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学) Nanyang Technological University(南洋理工大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 MeViS数据集通过多模态数据提升视频分割中运动表达的理解能力,提出LMPM++方法实现新突破。

Comments IEEE TPAMI, Project Page: https://henghuiding.com/MeViS/

Journal ref in IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 47, no. 12, pp. 11400-11416, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10863 2025-12-12 cs.CV cs.AI 57%

MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence

MMSI-Video-Bench: 一个面向视频基于空间智能的综合基准

Jingli Lin, Runsen Xu, Shaohao Zhu, Sihan Yang, Peizhou Cao, Yunlong Ran, Miao Hu, Chenming Zhu, Yiman Xie, Yilin Long, Wenbo Hu, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Xi’an Jiaotong University(西安交通大学) University of Hong Kong(香港大学) Fudan University(复旦大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

AI总结 MMSI-Video-Bench是一个综合评估视频基于空间智能的基准,通过多任务和多数据集评估25个MLLMs,揭示了人机推理差距和模型泛化不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05094 2025-12-12 cs.RO cs.CV 57%

From Generated Human Videos to Physically Plausible Robot Trajectories

从生成的人类视频到物理上合理的机器人轨迹

James Ni, Zekai Wang, Wei Lin, Amir Bar, Yann LeCun, Trevor Darrell, Jitendra Malik, Roei Herzig

机构 * University of California, Berkeley(加州大学伯克利分校) New York University(纽约大学) Johannes Kepler University(约翰·凯撒大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出GenMimic方法,通过物理感知强化学习策略,从生成的视频中实现零样本的人形机器人动作模仿,并建立了评估零样本泛化能力的基准。

Comments For project website, see https://genmimic.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09616 2025-12-11 cs.CV cs.AI cs.CL cs.LG 57%

Rethinking Chain-of-Thought Reasoning for Videos

重新思考视频中的链式推理

Yiwu Zhong, Zi-Yuan Hu, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

AI总结 本研究提出了一种高效的视频推理框架,通过简洁推理和减少的视觉标记提升推理效率和性能,无需依赖传统CoT注释或监督微调。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00518 2025-12-10 cs.CV cs.CL 57%

Fine-grained Spatiotemporal Grounding on Egocentric Videos

细粒度眼动视频时空定位

Shuo Liang, Yiwu Zhong, Zi-Yuan Hu, Yeyao Tao, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出EgoMask基准和EgoMask-Train数据集,针对眼动视频细粒度时空定位的挑战,通过微调提升模型性能。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06921 2025-12-09 cs.CV cs.AI cs.CL 57%

NeuroABench: A Multimodal Evaluation Benchmark for Neurosurgical Anatomy Identification

NeuroABench: 一种多模态评估基准,用于神经外科解剖识别

Ziyang Song, Zelin Zang, Xiaofan Ye, Boqiang Xu, Long Bai, Jinlin Wu, Hongliang Ren, Hongbin Liu, Jiebo Luo, Zhen Lei

机构 * Hong Kong Institute of Science and Innovation(香港科学与创新研究院) The University of Hong Kong-Shenzhen Hospital(香港大学深圳医院) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 NeuroABench是首个用于评估神经外科领域解剖理解的多模态基准,通过实验揭示了MLLMs在解剖识别任务中的局限性,并展示了人类表现与模型之间的差距。

Comments Accepted by IEEE ICIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06810 2025-12-09 cs.CV cs.CL 57%

MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning

MMDuet2:通过多轮强化学习增强视频MLLMs的主动交互

Yueqian Wang, Songxiang Liu, Disong Wang, Nuo Xu, Guanglu Wan, Huishuai Zhang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 MMDuet2通过多轮强化学习方法,实现了视频MLLMs在多轮对话中的主动交互,提升了回复时机和质量,达到ProactiveVideoQA基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏