机构
*
Hong Kong Baptist University(香港 Baptist 大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Institute of Automation, CAS(中国科学院自动化研究所)
;
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中
视觉推理
:visual language model(title,abstract);visual reasoning(abstract);分类 cs.CV
机构
*
J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX 77843, USA(杰米·沃克’66机械工程系,德克萨斯A&M大学,学院站,TX 77843,美国)
;
The Department of Engineering Technology and Industrial Distribution Texas A&M University, College Station, TX 77843, USA(工程技术与工业分配系,德克萨斯A&M大学,学院站,TX 77843,美国)
3DMedAgent: Unified Perception-to-Understanding for 3D Medical Analysis
3DMedAgent:面向3D医学分析的统一感知-理解框架
Ziyue Wang, Linghan Cai, Chang Han Low, Haofeng Liu, Junde Wu, Jingyu Wang, Rui Wang, Lei Song, Jiang Bian, Jingjing Fu, Yueming Jin
机构
*
National University of Singapore(新加坡国立大学)
;
Microsoft Research(微软研究院)
;
TUD Dresden University of Technology(德累斯顿技术大学)
;
University of Oxford(牛津大学)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构
*
Tianmushan Laboratory, Beihang University(北航之梦实验室,北京航空航天大学)
;
Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学)
;
Foshan Graduate School of Innovation, Northeastern University(佛山创新研究生学院,东北大学)
;
School of Aeronautic Science and Engineering, Beihang University(航空科学与工程学院,北京航空航天大学)
;
Faculty of Robot Science and Engineering, Northeastern University(机器人科学与工程学院,东北大学)
机构
*
Department of Computer and Network Engineering(计算机与网络工程系)
;
United Arab Emirates University(阿联酋大学)
;
Technology Innovation Institute(技术创新研究院)
;
Eötvös Loránd University(埃斯特哈齐·洛朗大学)
;
Research Institute for Digital Future(数字未来研究院)
;
Khalifa University(卡塔尔大学)
机构
*
School of Software Technology, Zhejiang University(浙江大学软件技术学院)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
Ant Group(蚂蚁集团)
Context Matters! Relaxing Goals with LLMs for Feasible 3D Scene Planning
情境至关重要!利用LLMs进行可行的3D场景规划
Emanuele Musumeci, Michele Brienza, Francesco Argenziano, Abdel Hakim Drid, Vincenzo Suriani, Daniele Nardi, Domenico D. Bloisi
机构
*
Department of Computer, Automation and Management Engineering, Sapienza University of Rome(Sapienza大学计算机、自动化与管理工程系)
;
Department of Electronics and Automation, Mohamed Khider University of Biskra(Mohamed Khider大学电子与自动化系)
;
International University of Rome UNINT, Rome(罗马国际大学UNINT)
机构
*
Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院)
;
Tsinghua University(清华大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV