MoMA: A Mixture-of-Multimodal-Agents Architecture for Enhancing Clinical Prediction Modelling
Jifan Gao, Mahmudur Rahman, John Caskey, Madeline Oguss, Ann O'Rourke, Randy Brown, Anne Stey, Anoop Mayampurath, Matthew M. Churpek, Guanhua Chen, Majid Afshar
机构
*
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
;
Northwestern University(西北大学)
Planning for Cooler Cities: A Multimodal AI Framework for Predicting and Mitigating Urban Heat Stress through Urban Landscape Transformation
Shengao Yi, Xiaojiang Li, Wei Tu, Tianhong Zhao
机构
*
Department of City and Regional Planning, University of Pennsylvania(城市与区域规划系,宾夕法尼亚大学)
;
Guangdong Key Laboratory for Urban Informatics, Guangdong-Hong Kong-Macao Joint Laboratory for Smart Cities(广东城市信息关键实验室、粤港澳大湾区智慧城市联合实验室)
;
Shenzhen Key Laboratory of Spatial Information Smart Sensing(深圳空间信息智能感知关键实验室)
;
Department of Urban Informatics, School of Architecture and Urban Planning, Shenzhen University(城市信息系,深圳大学)
;
College of Big Data and Internet, Shenzhen Technology University(大数据与互联网学院,深圳科技大学)
GSON: A Group-based Social Navigation Framework with Large Multimodal Model
Shangyi Luo, Peng Sun, Ji Zhu, Yuhong Deng, Cunjun Yu, Anxing Xiao, Xueqian Wang
机构
*
Center for Artificial Intelligence and Robotics, Tsinghua Shenzhen International Graduate School(人工智能与机器人中心,清华大学深圳国际研究生院)
;
School of Computing, National University of Singapore(computing 学院,新加坡国立大学)
HIS-GPT: Towards 3D Human-In-Scene Multimodal Understanding
Jiahe Zhao, Ruibing Hou, Zejie Tian, Hong Chang, Shiguang Shan
机构
*
Key Laboratory of AI Safety of Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室)
;
Institute of Computing Technology, CAS(中国科学院计算技术研究所)
;
University of CAS(中国科学院大学)
;
Communication University of China(通信大学)
MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow
Ziyue Wang, Junde Wu, Linghan Cai, Chang Han Low, Xihong Yang, Qiaxuan Li, Yueming Jin
机构
*
National University of Singapore(新加坡国立大学)
;
University of Oxford(牛津大学)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
National University of Defense Technology(国防科技大学)
;
The Second Affiliated Hospital Zhejiang University School of Medicine(浙江大学医学院附属第二医院)
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
Junting Chen, Haotian Liang, Lingxiao Du, Weiyun Wang, Mengkang Hu, Yao Mu, Wenhai Wang, Jifeng Dai, Ping Luo, Wenqi Shao, Lin Shao
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
;
Shanghai Jiaotong University(上海交通大学)
;
Tsinghua University(清华大学)
MLA-Trust: Benchmarking Trustworthiness of Multimodal LLM Agents in GUI Environments
Xiao Yang, Jiawei Chen, Jun Luo, Zhengwei Fang, Yinpeng Dong, Hang Su, Jun Zhu
机构
*
Department of Computer Science & Technology, Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint Center for ML(计算机科学与技术系、人工智能研究院、BNRist中心、THBI实验室、清华-博世联合机器学习中心)
;
Shanghai Key Lab. of Multidimensional Info. Processing(上海多维信息处理重点实验室)
机构
*
The University of Adelaide(阿德莱德大学)
;
The University of Queensland(昆士兰大学)
;
CSIRO Data61(澳大利亚联邦科学与工业研究组织数据61研究中心)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
Tongji University(同济大学)
A "Wenlu" Brain System for Multimodal Cognition and Embodied Decision-Making: A Secure New Architecture for Deep Integration of Foundation Models and Domain Knowledge
Liang Geng
机构
*
College of Mechanical and Electrical Engineering, Shijiazhuang University(石家庄大学机械与电气工程学院)
;
School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
;
The Key Laboratory of Agricultural Robotics Intelligent Perception in Shijiazhuang(石家庄农业机器人智能感知重点实验室)
机构
*
University of Houston(德克萨斯大学休斯顿分校)
;
NEC Laboratories America(NEC美国实验室)
;
Florida International University(佛罗里达国际大学)
;
North Carolina State University(北卡罗来纳州立大学)