Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models
理解与生成:多模态模型中的优化困境导航
Sen Ye, Mengde Xu, Shuyang Gu, Di He, Liwei Wang, Han Hu
机构
*
State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)
;
Tencent(腾讯)
;
Center for Data Science, Peking University(北京大学数据科学中心)
;
Center for Machine Learning Research, Peking University(北京大学机器学习研究中心)
机构
*
Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所)
;
Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室)
;
Bytedance Intelligent Creation(字节跳动智能创作)
;
School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)
Generative AI Enables Structural Brain Network Construction from fMRI via Symmetric Diffusion Learning
生成式AI通过对称扩散学习从fMRI构建结构脑网络
Qiankun Zuo, Bangjun Lei, Wanyu Qiu, Changhong Jing, Jin Hong, Shuqiang Wang
机构
*
Department of Computing, Hong Kong Polytechnic University(香港理工大学计算学系)
;
School of Information Engineering, Nanchang University(南昌大学信息工程学院)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
Calibrated Confidence Expression for Radiology Report Generation
放射报告生成中的校准置信度表达
David Bani-Harouni, Chantal Pellegrini, Julian Lüers, Su Hwan Kim, Markus Baalmann, Benedikt Wiestler, Rickmer Braren, Nassir Navab, Matthias Keicher
机构
*
Computer Aided Medical Procedures, Technical University of Munich, Germany(德国慕尼黑工业大学计算机辅助医疗程序)
;
Munich Center for Machine Learning (MCML), Germany(德国慕尼黑机器学习中心)
;
Department of Diagnostic and Interventional Radiology, TUM Klinikum rechts der Isar, Germany(德国慕尼黑工业大学伊萨尔河右岸医院诊断与介入放射科)
;
Department of Diagnostic and Interventional Neuroradiology, TUM Klinikum rechts der Isar, Germany(德国慕尼黑工业大学伊萨尔河右岸医院诊断与介入神经放射科)
;
Department of Diagnostic and Interventional Radiology and Nuclear Medicine, University Medical Center Hamburg-Eppendorf, Germany(德国汉堡-埃彭多夫大学医学中心诊断与介入放射学及核医学科)
;
AI for Image-Guided Diagnosis and Therapy, Technical University of Munich, Germany(德国慕尼黑工业大学人工智能图像引导诊断与治疗)
Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning
Med-CMR:一个整合视觉证据和临床逻辑的细粒度基准,用于医疗复杂多模态推理
Haozhen Gong, Xiaozhong Ji, Yuansen Liu, Wenbin Wu, Xiaoxiao Yan, Jingjing Liu, Kai Wu, Jiazhen Pan, Bailiang Jian, Jiangning Zhang, Xiaobin Hu, Hongwei Bran Li
机构
*
National University of Singapore(新加坡国立大学)
;
Nanjing University(南京大学)
;
Tongji University(同济大学)
;
Ruijin Hospital(瑞金医院)
;
Technical University of Munich(慕尼黑工业大学)
;
Zhejiang University(浙江大学)
Mind the Gap: A Framework for Assessing Pitfalls in Multimodal Active Learning
注意差距:一个多模态主动学习中陷阱评估的框架
Dustin Eisenhardt, Yunhee Jeong, Florian Buettner
机构
*
German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ))
;
German Cancer Consortium (DKTK)(德国癌症联盟(DKTK))
;
UCT Frankfurt-Marburg(法兰克福-马尔堡大学癌症中心)
;
Institute of Informatics, Goethe University Frankfurt(法兰克福歌德大学信息学研究所)
;
Department of Medicine, Goethe University Frankfurt(法兰克福歌德大学医学系)
;
Frankfurt Cancer Institute (FCI)(法兰克福癌症研究所(FCI))
;
Crop Science Division, Bayer AG(拜耳股份公司作物科学部)
MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation
MVGGT:多模态视觉几何 grounded 变换器用于多视角3D指称表达分割
Changli Wu, Haodong Wang, Jiayi Ji, Yutian Yao, Chunsai Du, Jihua Kang, Yanwei Fu, Liujuan Cao
机构
*
Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)
;
Shanghai Innovation Institute(上海创新研究院)
;
Fudan University(复旦大学)
;
ByteDance(字节跳动)
;
Tianjin University of Science and Technology(天津科技大学)
Learning Structural-Functional Brain Representations through Multi-Scale Adaptive Graph Attention for Cognitive Insight
通过多尺度自适应图注意力学习结构-功能脑表示以获得认知洞察
Badhan Mazumder, Sir-Lord Wiafe, Aline Kotoski, Vince D. Calhoun, Dong Hye Ye
机构
*
Georgia State University(佐治亚州立大学)
;
Georgia Institute of Technology(佐治亚理工学院)
;
Emory University(埃默里大学)
;
Tri-Institutional Center for Translational Research in Neuroimaging and Data Science (TReNDS)(三机构神经影像与数据科学转化研究中心 (TReNDS))
CommentsPreprint version of the paper accepted to the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026). This is the author's accepted manuscript. The final published version will appear in IEEE Xplore