ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.AI
Comments 68 pages, 6 figures, Project Page: https://zju-real.github.io/GSM8K-V Code: https://github.com/ZJU-REAL/GSM8K-V Datasets: https://huggingface.co/datasets/ZJU-REAL/GSM8K-V
机构 * Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; Shenzhen University(深圳大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 视觉推理 :grounding(title);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * University of Southern California(南加州大学) ; Amazon AGI(亚马逊人工智能实验室)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments Project webpage: https://ive-robot.github.io/
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI、cs.LG
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI
机构 * School of Artificial Intelligence and Software Engineering, Nanyang Normal University, Henan, China(人工智能与软件工程学院,南阳师范学院,河南) ; Institute for Artificial Intelligence, Peking University, Beijing, China(人工智能研究院,北京大学,北京) ; Collaborative Innovation Center of Intelligent Explosion-proof Equipment, Henan, China(智能防爆设备协同创新中心,河南)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments Accepted at the International Joint Conference on Artificial Intelligence (IJCAI 2025)
机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; Coolwei AI Lab(Coolwei人工智能实验室)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments COLM 2025
机构 * Carnegie Mellon University, Robotics Institute(卡内基梅隆大学,机器人研究所)
专题命中 视觉推理 :grounding(title,abstract);分类 cs.CV、cs.AI
Comments 8 pages, 6 figures, published in IROS 2025
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI
Comments ICCV 2025
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; The University of Hong Kong(香港大学) ; Central South University(中南大学)
专题命中 视觉推理 :multimodal large language model(title);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted to ACM Multimedia 2025
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视觉推理 :vision-language model(title);visual language model(abstract);分类 cs.CV、cs.AI
机构 * Shanghai Key Laboratory of Intelligent Information Processing, School of Computer Science, Fudan University(上海智能信息处理重点实验室,计算机科学学院,复旦大学)
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI
机构 * UC San Diego ; JHU Cornell Tech ; EPFL ; UMich
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments ACL 2025 (Findings)
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Ant Group(蚂蚁集团) ; CUHK MMLab(香港中文大学MMLab) ; Nanjing University(南京大学)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI
机构 * University of Copenhagen(哥本哈根大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG
Comments Code, dataset, and checkpoints are publicly available at https://github.com/danaesavi/ImageChain; v2: added human annotation study to validate SimRate
机构 * NVIDIA ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学)
专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.AI
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; National Institute of Technology, Tiruchirappalli(特里奇里帕利学院)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Comments To appear at the 63rd Annual Meeting of the Association for Computational Linguistics (ACL), Vienna, Austria, July 2025, https://2025.aclweb.org/
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments WOD Vision-based End-to-End Driving Challenge
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Comments ACL Findings 2025
机构 * UC Berkeley(加州大学伯克利分校) ; Waymo LLC(Waymo公司) ; Cornell University(康奈尔大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR2025; Project website: s4-driver.github.io
机构 * National University of Singapore(新加坡国立大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.LG
机构 * Seoul National University(首尔国立大学) ; UCLA(加州大学洛杉矶分校) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Google DeepMind(谷歌DeepMind)
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI
Comments 69 pages, 16 figures
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
机构 * Toyota Central R&D Labs., Inc.(丰田中央研究实验室)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Comments 18 pages, 11 figures
机构 * HKUST(香港科技大学) ; University of Waterloo(滑铁卢大学) ; Vector Institute(向量研究所)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI、cs.LG
Comments Preprint
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.LG
Comments Accepted at ICLR 2025. Original paper name: VCR: Visual Caption Restoration
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Comments Code & data are available at: https://qiulu66.github.io/egoplanbench2/