机构
*
University of Maryland, College Park(马里兰大学帕克分校)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
Peking University(北京大学)
;
Arena
;
MBZUAI(穆罕默德·本·扎耶德人工智能大学)
Orientation Reading by Production Vision-Language Models on Optotype Charts: A Controlled Multi-Model Evaluation Across Reasoning Modes, Prompts, and Access Modalities
MMIR-TCM: Memory-Integrated Multimodal Inference and Retrieval for TCM Clinical Decision Support
MMIR-TCM:面向中医临床决策支持的记忆集成多模态推理与检索
Lihui Luo, Joongwon Chae, Ziyan Chen, Yang Liu, Siyi Cheng, Weihan Gao, Zelin Zeng, Xiaoming Yin, Samaneh Beheshti Kashi, Dongmei Yu, Lian Zhang, Jing Sui, Zeming Liang, Jiansong Ji, Peter E. Lobie, Peiwu Qin
机构
*
Institute of Biopharmaceutics and Health Engineering, Tsinghua Shenzhen International Graduate School(清华深圳国际研究生院生物医药与健康工程研究院)
;
Chinese Medicine Guangdong Laboratory(广东省中医药实验室)
;
Beijing Normal University(北京师范大学)
;
First Hospital of Hebei Medical University(河北医科大学第一医院)
;
Lishui Hospital of Zhejiang University(浙江大学丽水医院)
;
XiaoMing TCM Hospital(小明中医医院)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking
PixelEyes: 解耦感知与推理以实现精准视觉证据查找
Dengxian Gong, Yuanzheng Wu, Haobo Yuan, Zhengdong Hu, Tao Zhang, Yikang Zhou, Shihao Chen, Quanzhu Niu, Kai Wang, Jason Li, Haochen Wang, Lu Qi, Shunping Ji, Ming-Hsuan Yang
机构
*
School of Electrical Engineering, Korea University(韩国大学电气工程学院)
;
Department of Hospital Pathology, The Catholic University of Korea College of Medicine(韩国天主教大学医学院医院病理学系)
OmniSpace: Efficient Geometry Awareness for Autonomous Vehicles MLLMs
OmniSpace: 自动驾驶多模态大语言模型的高效几何感知
Hao Vo, Phu Loc Nguyen, Khoa Vo, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Nguyen, Ngan Le
机构
*
University of Arkansas(阿肯色大学)
;
Google Research, Google(谷歌研究院)
;
University of Liverpool(利物浦大学)
;
Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究所)
专题命中
视觉推理
:MLLM(summary_cn);multimodal large language model(abstract);分类 cs.CV
机构
*
Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院)
;
Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室)
机构
*
School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Cloud and AI BU, Huawei(华为云与AI业务部)
;
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning
MODF-SIR:面向社交智能推理的多智能体全模态蒸馏框架
Shang Ma, Jisheng Dang, Wencan Zhang, Yifan Zhang, Bimei Wang, Hong Peng, Bin Hu, Qi Tian, Tat-Seng Chua
机构
*
School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)
;
School of Medical Technology, Beijing Institute of Technology(北京理工大学医学技术学院)
;
Cloud and AI BU, Huawei(华为云与AI业务部)
;
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
机构
*
Department of Control Science and Engineering, College of Electronic and Information Engineering, and Shanghai Institute of Intelligent Science and Technology, Tongji University(同济大学电子与信息工程学院控制科学与工程系,以及上海智能科学与技术研究院)
;
Department of Electronic Engineering, Faculty of Engineering, The Chinese University of Hong Kong(香港中文大学工程学院电子工程系)
;
Shanghai Operation Robot Co., Ltd.(上海微创医疗机器人(集团)股份有限公司)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);multimodal large language model(abstract)