FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
FlowInOne:将多模态生成统一为图像输入、图像输出的流匹配
Junchao Yi, Rui Zhao, Jiahao Tang, Weixian Lei, Linjie Li, Qisheng Su, Zhengyuan Yang, Lijuan Wang, Xiaofeng Zhu, Alex Jinpeng Wang
机构
*
University of Electronic Science and Technology of China(电子科技大学)
;
Central South University(中南大学)
;
National University of Singapore(新加坡国立大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Microsoft(微软)
LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection
LaP-Forensics:用于深度伪造检测的潜在像素一致性引导的多模态推理
Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
University College London(伦敦大学学院)
;
Tsinghua University(清华大学)
;
Sun Yat-sen University(中山大学)
;
National University of Singapore(新加坡国立大学)
机构
*
College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院)
;
School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院)
;
State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)
;
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
School of Automation, Southeast University(东南大学自动化学院)
;
Department of Geography, National University of Singapore(新加坡国立大学地理系)
ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding
ClinFusion:用于整体医学理解的以视觉为中心的多模态大语言模型系统
Hangjie Yuan, Yichen Qian, Zhiwei Tang, Xianzhe Xu, Lirong Wu, Sicheng Yang, Jinwang Wang, Pengju Wang, Zhitao Zeng, Yizeng Han, Yan Xing, Shengxuan Luo, Tao Feng, Qing Xie, Weigen Yao, Yi Yang, Zuozhu Liu, Jiasheng Tang, Shaocheng Wang, Jitao Wang, Jiahong Dong, Weihua Chen, Feng Xu, Fan Wang
机构
*
DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)
;
Hupan Laboratory(湖畔实验室)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
;
Department of Radiology, The Affiliated Yangming Hospital of Ningbo University(宁波大学附属阳明医院放射科)
;
Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University(浙江大学伊利诺伊大学厄巴纳香槟校区联合学院,浙江大学)
;
Hepato-Pancreato-Biliary Center, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua Medicine, Tsinghua University(清华长庚医院肝胆胰中心,清华大学临床医学院,清华医学,清华大学)
;
School of Software, Tsinghua University(清华大学软件学院)
;
Beijing National Research Center for Information Science and Technology, Tsinghua University(清华大学北京信息科学与技术国家研究中心)
Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases
评估具有挑战性的真实世界临床病例中的多轮多模态诊断推理
Rui Yang, Weihao Xuan, Yi Lin, Zhuhan Bao, Jonathan Chong Kai Liew, Matthew Yu Heng Wong, Nicolás Lescano, Nikita R. Paripati, Emily Ling-Lin Pai, Jiarui Liu, Heli Qi, Heng-Jui Chang, Benny Kai Guo Loo, Huitao Li, Kunyu Yu, Yufan Wang, Chuan Hong, Shijian Lu, Douglas Teodoro, Naoto Yokoya, Ross Koppel, Mona Diab, Hua Xu, David W. Bates, Nan Liu, Yifan Peng
机构
*
Center for Biomedical Data Science, Duke-NUS Medical School(生物医学数据科学中心,杜克 - 新加坡国立大学医学院)
;
Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克 - 新加坡国立大学人工智能与医学科学计划,杜克 - 新加坡国立大学医学院)
;
Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,威尔康奈尔医学院)
;
System Engineering, College of Engineering, Cornell University(系统工程,康奈尔大学工程学院)
;
Graduate School of Frontier Sciences, The University of Tokyo(前沿科学研究生院,东京大学)
;
RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)
;
Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学)
;
Perelman School of Medicine, University of Pennsylvania(佩雷尔曼医学院,宾夕法尼亚大学)
;
School of Clinical Medicine, University of Cambridge(临床医学学院,剑桥大学)
;
Hospital of the University of Pennsylvania(宾夕法尼亚大学医院)
;
Children’s Hospital of Philadelphia (CHOP)(费城儿童医院)
;
Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(解剖病理学与检验医学系,宾夕法尼亚大学医院)
;
Department of Pathology and Laboratory Medicine, University of California, San Francisco(病理学与检验医学系,加州大学旧金山分校)
;
Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
Leveraging ChatGPT's Multimodal Vision Capabilities to Rank Satellite Images by Poverty Level: Advancing Tools for Social Science Research
利用ChatGPT的多模态视觉能力按贫困水平对卫星图像进行排名:推进社会科学研究工具
Hamid Sarmadi, Ola Hall, Thorsteinn Rögnvaldsson, Mattias Ohlsson
机构
*
Center for Applied Intelligent Systems Research (CAISR), Halmstad University, Sweden(应用智能系统研究中心(CAISR),哈马斯特德大学,瑞典)
;
Department of Human Geography, Lund University, Sweden(人类地理系,吕勒奥大学,瑞典)
;
Department of Earth and Environmental Sciences, Lund University, Sweden(地球与环境科学系,吕勒奥大学,瑞典)
Towards Reliable Stain Transfer: An Iterative Data-Model Co-Optimization Framework Based on Multimodal Expert-Guided Assessment
迈向可靠的染色转移:基于多模态专家指导评估的迭代数据-模型协同优化框架
Siyuan Xu, Yan Wang, Haofei Song, Lili Gao, Jiansheng Wang, Qing Zhang, Dan Huang, Boxiang Yun, Hongkai Xiong, Qingli Li
机构
*
East China Normal University(华东师范大学)
;
Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院)
;
Hangzhou Hyperspectral Imaging Technology Co., Ltd.(杭州高光谱成像技术有限公司)
;
Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院)
RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
RefBench-PRO:面向感知与推理的指称表达理解基准
Tianyi Gao, Hao Li, Han Fang, Xin Wei, Xiaodong Dong, Hongbo Sun, Ye Yuan, Zhongjiang He, Jinglin Xu, Jingmin Xin, Hao Sun
机构
*
National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(国家人机混合增强智能重点实验室)
;
National Engineering Research Center for Visual Information and Applications(国家视觉信息与应用工程技术研究中心)
;
Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院)
;
Xi’an Jiaotong University(西安交通大学)
;
Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))
;
China Telecom(中国电信)
;
Shanghai Jiao Tong University(上海交通大学)
;
University of Science and Technology Beijing(北京科技大学)
RDVSv2: A Large-scale Benchmark for RGB-D Video Salient Object Detection
RDVSv2:用于RGB-D视频显著目标检测的大规模基准测试
Tianyu Li, Jiahao He, Keren Fu, Qijun Zhao
机构
*
National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University(四川大学合成视觉基础科学国家重点实验室)
;
College of Computer Science, Sichuan University(四川大学计算机学院)
Agentic AI in medicine: architectures, applications, evaluation, and challenges for clinical translation
医学中的智能体人工智能:临床转化的架构、应用、评估及挑战
Zheng Tong, Yang Liu, Wanshu Fan, Jing Qin, Zhongbin Han, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang
机构
*
School of Software Engineering, Dalian University(大连大学软件工程学院)
;
Affiliated Zhongshan Hospital of Dalian University(大连大学附属中山医院)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
University of California, San Francisco(加州大学旧金山分校)
;
Yale University(耶鲁大学)
;
The Hong Kong Polytechnic University(香港理工大学)
专题命中
多模态Agent
:multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV
RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning
RoboHarness:用于长期规划的异构机器人策略的内存驱动编排
Jinbang Huang, Yuanzhao Hu, Zhiyuan Li, Ran Qi, Yixin Xiao, Zhanguang Zhang, Mark Coates, Tongtong Cao, Yingxue Zhang
机构
*
Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
;
University of British Columbia(英属哥伦比亚大学)
;
University of Toronto(多伦多大学)
;
McGill University(麦吉尔大学)
;
Labs(2012实验室)
CommentsAccepted at the 43rd International Conference on Machine Learning (ICML 2026) Workshop on Efficient Multimodal Question Answering (EMM-QA), Seoul, South Korea. Copyright 2026 by the author(s). (Archival)
CHARM: A Multimodal Graph Foundation Model with Hierarchical Context Modeling for Zero-Shot Transfer
CHARM:一种用于零样本迁移的具有分层上下文建模的多模态图基础模型
Ankang Yang, Jitao Zhao, Di Jin, Yuxiao Huang, Dongxiao He
机构
*
School of Computer Science and Technology, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部计算机科学与技术学院)
;
Data Science Program, Columbian College of Arts and Sciences, The George Washington University(乔治华盛顿大学文理学院哥伦比亚艺术与科学学院数据科学项目)