TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment
TEVI: 基于稀疏自编码器的文本条件视觉表示编辑以改进视觉-语言对齐
Sweta Mahajan, Sukrut Rao, Jiahao Xie, Alexander Koller, Bernt Schiele
机构
*
Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克研究所信息学院,萨尔兰信息学院,德国萨尔布吕肯)
;
Department of Language Science and Technology, Saarland University, Saarbrücken, Germany(语言科学与技术系,萨尔兰大学,德国萨尔布吕肯)
Resolution Meets Reduction: Efficient Visual Context for 3D Radiology Report Generation
分辨率与压缩结合:面向3D放射报告生成的高效视觉上下文
Jonathan Suprijadi, Raphael Stock, Moritz Langenberg, David Zimmerer, Kim-Celine Kahl, Stefan Denner, Yannick Kirchhoff, Karol Gotkowski, Maximilian Rokuss, Jeremias Traub, Tassilo Wald, Constantin Ulrich, Klaus Maier-Hein
机构
*
German Cancer Research Center (DKFZ)(德国癌症研究中心)
Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning
裁决式字幕生成:用于严格零样本图像字幕生成的多智能体对齐评分与共识蒸馏束仲裁
Duy Tran Thanh, Thien-Phuc Doan, Long Nguyen-Vu, Ngo Tan Vu Khanh
机构
*
AI Platform OneNexus, OneMount(OneMount AI平台OneNexus)
;
School of Electronic Engineering, Soongsil University(崇实大学电子工程学院)
;
MoAdata(MoAdata公司)
;
University of Economics Ho Chi Minh City (UEH)(胡志明市经济大学)
Rethinking Clinical Relevance in Chest X-ray Machine Learning: How Evaluation References Define Performance
重新思考胸部X射线机器学习中的临床相关性:评估参考如何定义性能
Panagiotis Fytas, Ian Selby, Clemens Karner, Judith Babar, Simon Baker, Jake Beckford, Timothy J. Sadler, Shahab Shahipasand, Arthikkaa Thavakumar, John Li Chen, Alex Sawer, Michael Roberts, Jonathan Weir-McCall, J. H. F. Rudd, Carola-Bibiane Schönlieb, Anna Korhonen, Anna Breger
Comments† Equal contribution. Affiliations: 1: The University of Hong Kong 2: The University of Sydney 3: University of Electronic Science and Technology of China Corresponding authors: Zihan Deng (zhdeng@hku.hk), Chuanzhi Xu (chuanzhi.xu@sydney.edu.au) Project page: https://frankdengai.github.io/SciFigQual-Bench Source code & dataset: https://github.com/FrankDengAI/SciFigQual-Bench
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Tsinghua University(清华大学)
;
Hunan Normal University(湖南师范大学)
;
City University of Hong Kong(香港城市大学)
Comments6 pages, 5 figures, 2 tables submitted to 2026 Joint 14th International Conference on Soft Computing and Intelligent Systems and 27th International Symposium on Advanced Intelligent Systems (SCIS&ISIS 2026)
PFAdapter: Hierarchical LoRA Decomposition for Personalized Federated MLLMs
PFAdapter:用于个性化联邦多模态大语言模型的分层LoRA分解
Jing Liu, Kun Yang, Yan Wang, Dingkang Yang, Xiaoshuai Hao, Wei Zhang, Yang Liu, Wei Zhou
机构
*
College of Future Information Technology, Fudan University(复旦大学未来信息技术学院)
;
Division of Natural and Applied Sciences, Duke Kunshan University(昆山杜克大学自然科学与应用科学部)
;
Department of Electrical and Computer Engineering, The University of British Columbia(英属哥伦比亚大学电气与计算机工程系)
;
Ant Group(蚂蚁集团)
;
College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)
;
School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院)
;
College of Intelligent Robotics and Advanced Manufacturing, Fudan University & Fysics AI(复旦大学智能机器人与先进制造学院及复肆智能科技(上海)有限公司)
;
Xiaomi EV, Xiaomi Campus(小米汽车、小米园区)
;
Information and Communications Technology Cluster, Singapore Institute of Technology (SIT)(新加坡理工学院信息通信技术集群)
;
College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)
;
School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.AI、cs.LG
MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models
MedPMC:一种用于为基础模型扩展高保真医学多模态数据的系统框架
Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen
机构
*
Yale University(耶鲁大学)
;
Korea University(韩国大学)
;
Washington University in St. Louis(圣路易斯华盛顿大学)
;
The University of Queensland(昆士兰大学)
;
The University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心)
;
University of Washington(华盛顿大学)
;
Microsoft Research(微软研究院)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.CV、cs.LG