Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding
统一多模态模型的免费午餐:通过内在理解的反思校正增强生成
Yibo Jiang, Tao Wu, Rui Jiang, Yehao Lu, Chaoxiang Cai, Zequn Qin, Xi Li
机构
*
School of Software Technology, Zhejiang University(浙江大学软件技术学院)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
College of Computer Science(计算机科学学院)
机构
*
School of Statistics, East China Normal University(华东师范大学统计学院)
;
Department of Statistics, University of California, Los Angeles(加州大学洛杉矶分校统计系)
;
Department of Industrial and Systems Engineering, University of Minnesota(明尼苏达大学工业与系统工程系)
;
School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)
ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding
ChartNet: 一个百万级、高质量的多模态数据集,用于稳健的图表理解
Jovana Kondic, Pengyuan Li, Dhiraj Joshi, Isaac Sanchez, Ben Wiesel, Shafiq Abedin, Amit Alfassy, Eli Schwartz, Daniel Caraballo, Yagmur Gizem Cinar, Florian Scheidegger, Steven I. Ross, Daniel Karl I. Weidele, Hang Hua, Ekaterina Arutyunova, Roei Herzig, Zexue He, Zihan Wang, Xinyue Yu, Yunfei Zhao, Sicong Jiang, Minghao Liu, Qunshu Lin, Peter Staar, Luis Lastras, Aude Oliva, Rogerio Feris
机构
*
MIT(麻省理工学院)
;
MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
;
IBM Research(IBM研究院)
;
Abaka AI & 2077AI(Abaka AI及2077AI)
Out of Context: Reliability in Multimodal Anomaly Detection Requires Contextual Inference
脱离上下文:多模态异常检测的可靠性需要上下文推断
Kevin Wilkinghoff, Neelu Madan, Juan Miguel Valverde, Kamal Nasrollahi, Radu Tudor Ionescu, Rafal Wisniewski, Thomas B. Moeslund, Wenwu Wang, Zheng-Hua Tan
机构
*
Aalborg University(奥尔堡大学)
;
Pioneer Centre for Artificial Intelligence(先锋人工智能中心)
;
Technical University of Denmark(丹麦技术大学)
;
Milestone Systems(Milestone系统)
;
University of Bucharest(布加勒斯特大学)
;
University of Surrey(萨里大学)
Cyclic 2.5D Perceptual Loss for Cross-Modal 3D Medical Image Synthesis: T1w MRI to Tau PET
循环2.5D感知损失用于跨模态3D医学图像合成:T1加权MRI到tau PET
Junho Moon, Symac Kim, Haejun Chung, Ikbeom Jang
机构
*
Department of Artificial Intelligence, Hanyang University, Seoul, South Korea(人工智能系,翰阳大学,首尔,韩国)
;
Department of Electronic Engineering, Hanyang University, Seoul, South Korea(电子工程系,翰阳大学,首尔,韩国)
;
Division of Computer Engineering, Hankuk University of Foreign Studies, Yongin, South Korea(计算机工程系,韩国外语大学, Yongin,韩国)
;
Division of AI Data Convergence, Hankuk University of Foreign Studies, Yongin, South Korea(AI数据融合系,韩国外语大学, Yongin,韩国)
;
Division of Language & AI, Hankuk University of Foreign Studies, Seoul, South Korea(语言与AI系,韩国外语大学,首尔,韩国)
Good Scores, Bad Data: A Metric for Multimodal Coherence
好分数,坏数据:一种多模态一致性度量
Vasundra Srinivasan
机构
*
AI Architect(人工智能架构师)
;
Author, Data Engineering for Multimodal AI (O’Reilly)(多模态AI数据工程作者(O’Reilly))
;
Stanford School of Engineering, Graduate Certificate (in progress)(斯坦福工程学院,研究生证书(在读))
Dental-TriageBench: Benchmarking Multimodal Reasoning for Hierarchical Dental Triage
牙科分诊基准:用于分层牙科分诊的多模态推理基准
Ziyi He, Yushi Feng, Shuangyu Yang, Yinghao Zhu, Xichen Zhang, Pak Chuen Patrick Tai, Hei Yuet Lo, Songying Wu, Weifa Yang, Lequan Yu
机构
*
School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)
;
Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院)
;
The Prince Philip Dental Hospital(菲利普王子牙科医院)
;
Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学利滋医学学院)
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
Multi-modal panoramic 3D outdoor datasets for place categorization
多模态全景三维户外数据集用于场所分类
Hojung Jung, Yuki Oto, Oscar M. Mozos, Yumi Iwashita, Ryo Kurazume
机构
*
Graduate School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程研究生院)
;
Polytechnic University of Cartagena (UPCT)(卡塔赫纳理工学院)
;
Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程学系)
机构
*
School of Data Science, Fudan University(复旦大学数据科学学院)
;
Shanghai Innovation Institute(上海创新研究院)
;
School of Integrated Circuits, Zhejiang University(浙江大学集成电路学院)
;
School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)
;
School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)
Jacob C Walker, Pedro Vélez, Luisa Polania Cabrera, Guangyao Zhou, Sayna Ebrahimi, Rishabh Kabra, Carl Doersch, Maks Ovsjanikov, João Carreira, Shiry Ginosar
机构
*
Google DeepMind(谷歌DeepMind)
;
Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥))
机构
*
Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
;
Department of Computer and Data Sciences, Case Western Reserve University(凯斯西储大学计算机与数据科学系)
GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis
GeoAgentBench: 一种面向空间分析工具增强代理的动态执行基准
Bo Yu, Cheng Yang, Dongyang Hou, Chengfu Liu, Jiayao Liu, Chi Wang, Zhiming Zhang, Haifeng Li, Wentao Yang
机构
*
School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院)
;
School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(湖南科技大学地球科学与空间信息工程学院)
机构
*
Department of Biological and Agricultural Engineering, University of Arkansas(亚拉巴马大学生物与农业工程系)
;
Department of Food Science, University of Arkansas(亚拉巴马大学食品科学系)
CausalDisenSeg: A Causality-Guided Disentanglement Framework with Counterfactual Reasoning for Robust Brain Tumor Segmentation Under Missing Modalities
CausalDisenSeg: 一种基于因果推理的解耦框架,用于在缺失模态下的鲁棒脑肿瘤分割
Bo Liu, Yulong Zou, Jin Hong
机构
*
School of Information Engineering, Nanchang University(南昌大学信息工程学院)
;
School of Mathematics and Computer Sciences, Nanchang University(南昌大学数学与计算机科学学院)
SemAttNet: Towards Attention-based Semantic Aware Guided Depth Completion
SemAttNet:基于注意力的语义感知引导深度补全
Danish Nazir, Marcus Liwicki, Didier Stricker, Muhammad Zeshan Afzal
机构
*
Department of Computer Science, University of Kaiserslautern, 67663 Kaiserslautern, Germany(凯斯莱特大学计算机科学系)
;
Mindgrage, University of Kaiserslautern, 67663 Kaiserslautern, Germany(Mindgrage凯斯莱特大学)
;
Department of Computer Science, Luleå University of Technology, 971 87 Luleå, Sweden(卢勒奥技术大学计算机科学系)
Modality-Native Routing in Agent-to-Agent Networks: A Multimodal A2A Protocol Extension
代理到代理网络中的模态本原路由:一种多模态A2A协议扩展
Vasundra Srinivasan
机构
*
AI Architect, Author—Data Engineering for Multimodal AI (O’Reilly)(人工智能架构师,作者—多模态AI的数据工程(O’Reilly))
;
Stanford School of Engineering (April 2026)(斯坦福大学工程学院(2026年4月))
A Multimodal Clinically Informed Coarse-to-Fine Framework for Longitudinal CT Registration in Proton Therapy
一种多模态的临床导向粗到细框架用于质子治疗纵向CT配准
Caiwen Jiang, Yuzhen Ding, Mi Jia, Samir H. Patel, Terence T. Sio, Jonathan B. Ashman, Lisa A. McGee, Jean-Claude M. Rwigema, William G. Rule, Sameer R. Keole, Sujay A. Vora, William W. Wong, Nathan Y. Yu, Michele Y. Halyard, Steven E. Schild, Dinggang Shen, Wei Liu
机构
*
Department of Radiation Oncology, Mayo Clinic, Phoenix, Arizona, USA(梅奥诊所放射肿瘤科)
;
School of Biomedical Engineering, ShanghaiTech University, Shanghai, China(上海科技大学生物医学工程学院)
;
Shanghai United Imaging Intelligence Co., Ltd., Shanghai 200230, China(上海联合影像智能科技有限公司)
;
Shanghai Artificial Intelligence Laboratory, Shanghai 200232, China(上海人工智能实验室)
;
Shanghai Clinical Research and Trial Center, Shanghai 201210, China(上海临床研究与试验中心)
机构
*
Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可及感知与智能系统重点实验室,浙江大学)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
AntGroup(蚂蚁集团)