Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA
空间推理并非免费午餐:对LLaVA的受控研究
Nahid Alam, Leema Krishna Murali, Siddhant Bharadwaj, Patrick Liu, Timothy Chung, Drishti Sharma, Akshata A., Kranthi Kiran, Wesley Tam, Bala Krishna S Vegesna
机构
*
Cohere Labs Community(Cohere Labs社区)
;
Indian Institute of Science, Bangalore(印度科学研究所班加罗尔分校)
;
UIUC(伊利诺伊大学厄巴纳-香槟分校)
;
Imperial College London(伦敦帝国学院)
;
Eisai Inc.(卫材公司)
;
EleutherAI
;
Georgia Institute of Technology(佐治亚理工学院)
A 4D Representation for Training-Free Agentic Reasoning from Monocular Laparoscopic Video
一种用于无训练代理推理的4D表示
Maximilian Fehrentz, Nicolas Stellwag, Robert Wiebe, Nicole Thorisch, Fabian Grob, Patrick Remerscheid, Ken-Joel Simmoteit, Benjamin D. Killeen, Christian Heiliger, Nassir Navab
机构
*
Computer Aided Medical Procedures, TU Munich(慕尼黑工业大学计算机辅助医疗程序研究所)
;
Hospital of the LMU Munich, Ludwig-Maximilians-Universität (LMU)(慕尼黑大学医院)
;
Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中
视觉推理
:vision-language model(abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract)
A Reasoning-Enabled Vision-Language Foundation Model for Chest X-ray Interpretation
一种用于胸部X光解读的推理增强视觉-语言基础模型
Yabin Zhang, Chong Wang, Yunhe Gao, Jiaming Liu, Maya Varma, Justin Xu, Sophie Ostmeier, Jin Long, Sergios Gatidis, Seena Dehkharghani, Arne Michalson, Eun Kyoung Hong, Christian Bluethgen, Haiwei Henry Guo, Alexander Victor Ortiz, Stephan Altmayer, Sandhya Bodapati, Joseph David Janizek, Ken Chang, Jean-Benoit Delbrouck, Akshay S. Chaudhari, Curtis P. Langlotz
机构
*
Tsinghua University(清华大学)
;
National University of Defense Technology(国防科技大学)
;
Beihang University(北京航空航天大学)
;
Tianjin University(天津大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Peking University(北京大学)
;
Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所)
;
Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Civil Aviation University of China(中国民航大学)
;
Beijing Institute of Technology(北京理工大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.AI
RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks
RoboClaw:一个用于可扩展长周期机器人任务的代理框架
Ruiying Li, Yunlang Zhou, YuYao Zhu, Kylin Chen, Jingyuan Wang, Sukai Wang, Kongtao Hu, Minhui Yu, Bowen Jiang, Zhan Su, Jiayao Ma, Xin He, Yongjian Shen, Yang Yang, Guanghui Ren, Maoqing Yao, Wenhao Wang, Yao Mu
机构
*
AgiBot
;
National University of Singapore(新加坡国立大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
MoE Key Lab of Artificial Intelligence, AI Institute, SJTU(上海交通大学人工智能研究院教育部人工智能重点实验室)