Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models
十年视觉语言人工智能模型中准确性和视觉认知错误的演变
Shravan Murlidaran, Miguel P. Eckstein
机构
*
Psychological & Brain Sciences, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校心理与脑科学系)
;
Department of Computer Science, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校计算机科学系)
;
Department of Electrical and Computer Engineering, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校电气与计算机工程系)
专题命中
视觉推理
:MLLM(summary_cn,abstract_cn);vision language model(abstract);VLM(abstract_cn);visual language model(abstract)
Reinforcing Dual-Path Reasoning in Spatial Vision Language Models
空间视觉语言模型中的双路径推理强化
Yatai Ji, An-Chieh Cheng, Yang Fu, Yukang Chen, Han Zhang, Zhaojing Yang, Wei Huang, Ka Chun Cheung, Song Han, Vidya Nariyambut Murali, Pavlo Molchanov, Jan Kautz, Simon See, Hongxu Yin, Ping Luo, Sifei Liu
机构
*
The University of Hong Kong(香港大学)
;
NVIDIA(英伟达)
;
University of California, San Diego(加州大学圣迭戈分校)
专题命中
视觉推理
:VLM(summary_cn,abstract);vision language model(title);grounding(abstract);分类 cs.CV、cs.AI
机构
*
School of Software Technology, Zhejiang University(浙江大学软件学院)
;
Hong Kong Polytechnic University(香港理工大学)
;
The University of Southern Queensland(南昆士兰大学)
专题命中
视觉推理
:MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV
机构
*
Zhejiang University(浙江大学)
;
Hunan University(湖南大学)
;
Tianjin University(天津大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Jilin University(吉林大学)
MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning
MedClaw:用于长程手术视频推理的启发式智能体框架
Yingying Fan, Penghui Du, Leyan Zhu, Runze He, Zimeng Wu, Yuxuan Zhang, Liang Chen, Jiahao Xie, Jiangtang Wang, Shuai Shao, Anchao Yang, Yutong Bai, Yan Wang
机构
*
School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院)
;
University of Maryland(马里兰大学)
;
Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)
Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation
先看后思:解耦感知与推理以实现抗捷径的多模态在策略自蒸馏
Sihan Wang, Xiyao Liu, Lianqing Liu, Zhi Han
机构
*
State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
专题命中
视觉推理
:MLLM(summary_cn,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG