Huy Hoang Nguyen, Cédric Jung, Shirin Salehi, Tobias Glück, Anke Schmeink, Andreas Kugi
机构
*
AIT Austrian Institute of Technology(奥地利理工学院)
;
Automation & Control Institute, Technical University of Vienna(维也纳技术大学自动化与控制研究所)
;
Chair of Information Theory and Data Analytics (INDA), RWTH Aachen University(亚琛工业大学信息理论与数据分析教席)
机构
*
School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)
;
National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)
MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction
MovieTeller: 借助工具的电影概要与ID一致的渐进抽象
Yizhi Li, Xiaohan Chen, Miao Jiang, Wentao Tang, Gaoang Wang
机构
*
Central Universities(中央高校)
;
National Natural Science Foundation of China(中国国家自然科学基金委员会)
;
Research Fund for International Scientists of National Natural Science Foundation of China(中国国家自然科学基金委员会国际科学家研究基金)
Merlin: A Computed Tomography Vision-Language Foundation Model and Dataset
Merlin:一种计算断层扫描视觉-语言基础模型和数据集
Louis Blankemeier, Ashwin Kumar, Joseph Paul Cohen, Jiaming Liu, Longchao Liu, Dave Van Veen, Syed Jamal Safdar Gardezi, Hongkun Yu, Magdalini Paschali, Zhihong Chen, Jean-Benoit Delbrouck, Eduardo Reis, Robbie Holland, Cesar Truyts, Christian Bluethgen, Yufu Wu, Long Lian, Malte Engmann Kjeldskov Jensen, Sophie Ostmeier, Maya Varma, Jeya Maria Jose Valanarasu, Zhongnan Fang, Zepeng Huo, Zaid Nabulsi, Diego Ardila, Wei-Hung Weng, Edson Amaro Junior, Neera Ahuja, Jason Fries, Nigam H. Shah, Greg Zaharchuk, Marc Willis, Adam Yala, Andrew Johnston, Robert D. Boutin, Andrew Wentland, Curtis P. Langlotz, Jason Hom, Sergios Gatidis, Akshay S. Chaudhari
机构
*
Stanford University(斯坦福大学)
;
Stanford Center for Artificial Intelligence in Medicine and Imaging(斯坦福大学医学与成像人工智能中心)
;
Department of Electrical Engineering(电气工程系)
;
University of California Berkeley(加州大学伯克利分校)
;
Department of Radiology(放射科)
;
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
;
Hospital Israelita Albert Einstein(以色列特医院阿尔伯特·爱因斯坦医院)
Learning to Read Where to Look: Disease-Aware Vision-Language Pretraining for 3D CT
学习如何注视:面向3D CT的疾病感知视觉-语言预训练
Simon Ging, Philipp Arnold, Sebastian Walter, Hani Alnahas, Hannah Bast, Elmar Kotter, Jiancheng Yang, Behzad Bozorgtabar, Thomas Brox
机构
*
Computer Vision Group, University of Freiburg, Germany Adaptive \& Agentic AI (A3) Lab, Aarhus University, Denmark Department of Radiology, Medical Center -- University of Freiburg, Germany Chair of Algorithms
;
Data Structures, University of Freiburg, Germany ELLIS Institute Finland School of Electrical Engineering, Aalto University, Finland
机构
*
College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)
;
School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)
专题命中
VLM训练与架构
:vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
cadrille: Multi-modal CAD Reconstruction with Reinforcement Learning
cadrille: 多模态CAD重建与强化学习
Maksim Kolodiazhnyi, Denis Tarasov, Dmitrii Zhemchuzhnikov, Alexander Nikulin, Ilya Zisman, Anna Vorontsova, Anton Konushin, Vladislav Kurenkov, Danila Rukhovich
机构
*
Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学)
;
AXXX
;
ETH Zurich(苏黎世联邦理工学院)
;
Innopolis University(因诺波利斯大学)
;
Institute of Mechanics, Armenia(亚美尼亚力学研究所)
ScalSelect: Scalable Training-Free Multimodal Data Selection for Efficient Visual Instruction Tuning
ScalSelect: 可扩展的无训练多模态数据选择用于高效的视觉指令微调
Changti Wu, Jiahuai Mao, Yuzhuo Miao, Shijie Lian, Bin Yu, Xiaopeng Lin, Cong Huang, Lei Zhang, Kai Chen
机构
*
East China Normal University(华东师范大学)
;
Zhongguancun Academy(中关村学院)
;
The Hong Kong Polytechnic University(香港理工大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Huazhong University of Science and Technology(华中科技大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)
OMNI-Dent: Towards an Accessible and Explainable AI Framework for Automated Dental Diagnosis
OMNI-Dent:迈向一个可及且可解释的AI框架,用于自动化牙科诊断
Leeje Jang, Yao-Yi Chiang, Angela M. Hastings, Patimaporn Pungchanchaikul, Martha B. Lucas, Emily C. Schultz, Jeffrey P. Louie, Mohamed Estai, Wen-Chen Wang, Ryan H. L. Ip, Boyen Huang
机构
*
University of Minnesota(明尼苏达大学)
;
Khon Kaen University(科恩卡恩大学)
;
Minnesota State University(明尼苏达州立大学)
;
The University of Western Australia(西澳大学)
;
Kaohsiung Medical University(高雄医学院)
;
Auckland University of Technology(奥克兰理工大学)
机构
*
College of Applied Science, Shenzhen University, Shenzhen, China(深圳大学应用科学学院)
;
School of Artificial Intelligence, Shenzhen Technology University, Shenzhen, China(深圳科技大学人工智能学院)
专题命中
VLM训练与架构
:multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG
机构
*
Tencent Youtu Lab
;
East China University of Science
;
Shenzhen University
;
Hong Kong University of Science
;
Department of XXX, University of YYY, Location, Country
;
School of ZZZ, Institute of WWW, Location, Country
专题命中
VLM训练与架构
:vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI