MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning
MedClaw:用于长程手术视频推理的启发式智能体框架
Yingying Fan, Penghui Du, Leyan Zhu, Runze He, Zimeng Wu, Yuxuan Zhang, Liang Chen, Jiahao Xie, Jiangtang Wang, Shuai Shao, Anchao Yang, Yutong Bai, Yan Wang
机构
*
School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院)
;
University of Maryland(马里兰大学)
;
Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)
Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation
先看后思:解耦感知与推理以实现抗捷径的多模态在策略自蒸馏
Sihan Wang, Xiyao Liu, Lianqing Liu, Zhi Han
机构
*
State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
专题命中
视觉推理
:MLLM(summary_cn,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models
从结构到协同:多模态大语言模型中视觉-语言感知范式演进综述
Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv
机构
*
School of Computer Science, Sichuan University(四川大学计算机学院)
;
School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(北京大学深圳研究生院电子与计算机工程学院)
;
Institute of Artificial Intelligence (TeleAI), China Telecom and Northwestern Polytechnical University(中国电信与西北工业大学人工智能研究院(TeleAI))
专题命中
视觉推理
:multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AVIS: Adaptive Test-Time Scaling for Vision-Language Models
AVIS: 视觉语言模型的自适应测试时缩放
Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni, Hakki Can Karaimer, Hue Nguyen, Iqbal Mohomed, Michael Brudno, Alex Levinshtein, Konstantinos G. Derpanis, Babak Taati, Radek Grzeszczuk
机构
*
AI Center-Toronto, Samsung Electronics(三星电子多伦多AI中心)
;
University of Toronto(多伦多大学)
;
Vector Institute(向量研究所)
;
York University(约克大学)
机构
*
BARCELONA Supercomputing Center(巴塞罗那超级计算中心)
;
Universidad Pontificia Comillas(庞培法布拉大学)
;
Chung-Ang University(中央大学)
;
LUXEMBOURG Institute of Science and Technology(卢森堡科学技术研究所)
CommentsAccepted as a book chapter in "Advances in Global Applied Artificial Intelligence" (G. A. Tsihrintzis, M. Virvou, N. G. Bourbakis, L. C. Jain, Eds.), authenticated version will be published in Springer series: Learning and Analytics in Intelligent Systems
ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning
ClinHallu: 用于诊断医学多模态大语言模型推理中阶段式幻觉的基准
Sicheng Yang, Hangjie Yuan, Wenjun Zhang, Jinwang Wang, Yichen Qian, Weihua Chen, Fan Wang, Lei Zhu
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
DAMO Academy, Alibaba Group(阿里巴巴达摩院)
;
Hupan Lab(湖畔实验室)
;
Zhejiang University(浙江大学)
专题命中
视觉推理
:MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning
Visual-Seeker:通过主动视觉推理实现视觉原生多模态智能搜索
Zhengbo Zhang, Changtao Miao, Jinbo Su, Zhaowen Zhou, Chunxia Zhang, Xukai Wang, Ruiqi Liu, Kaiyuan Zheng, Jiansheng Cai, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan
机构
*
School of Artificial Intelligence UCAS(中国科学院大学人工智能学院)
;
Institute of Automation CAS(中国科学院自动化研究所)
;
Ant Digital Technologies Ant Group(蚂蚁数字科技蚂蚁集团)
;
RUC(中国人民大学)
;
BIT(北京理工大学)
专题命中
视觉推理
:visual reasoning(title,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.AI
Position: The Systemic Lack of Agency in Visual Reasoning
立场:视觉推理中系统性的能动性缺失
Yizhao Huang, Haoyang Chen, Shiqin Wang, Pohsun Huang, Jiayuan Li, Haoyuan Du, Yandong Shi, Zheng Wang, Zhixiang Wang
机构
*
National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, School of Computer Science, Wuhan University(武汉大学计算机学院人工智能研究所多媒体软件工程研究中心)
;
Hubei Key Laboratory of Multimedia(湖北省多媒体与网络通信工程重点实验室)
;
Zhongguancun Academy, Beijing, China. 100094(中关村学院,北京,中国)
;
School of Automation, Beijing Institute of Technology(北京理工大学自动化学院)
;
Shanda AI Research Tokyo(上海大势人工智能研究东京)