arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-09 至 2026-04-09 共收录 67 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 9 篇

2410.22177 2026-04-09 cs.HC cs.AI 74%

Analyzing Multimodal Interaction Strategies for LLM-Assisted Manipulation of 3D Scenes

分析用于LLM辅助3D场景操作的多模态交互策略

Junlong Chen, Jens Grubert, Per Ola Kristensson

机构 * University of Cambridge(剑桥大学) Coburg University of Applied Sciences(科堡应用科学大学)

专题命中 多模态生成 :multimodal(title);分类 cs.AI

AI总结 本文通过实证研究揭示LLM辅助3D场景编辑系统中的交互模式与关键障碍,提出改进自然语言界面的设计建议,证明LLM辅助交互系统在沉浸环境中的有效性。

Comments Published in the IEEE VR (IEEE Conference on Virtual Reality and 3D User Interfaces) 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06339 2026-04-09 cs.CV 57%

Evolution of Video Generative Foundations

视频生成基础的演变

Teng Hu, Jiangning Zhang, Hongrui Huang, Ran Yi, Zihan Su, Jieyu Weng, Zhucun Xue, Lizhuang Ma, Ming-Hsuan Yang, Dacheng Tao

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文综述了视频生成技术的发展,从早期GAN到扩散模型,再到AR和多模态技术,探讨了核心原理、关键进展及未来趋势,旨在为视频生成及其应用提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04746 2026-04-09 cs.CV 57%

Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning

以笔触而非像素思考:通过交错推理实现过程驱动的图像生成

Lei Zhang, Junjiao Tian, Zhipeng Fan, Kunpeng Li, Jialiang Wang, Weifeng Chen, Markos Georgopoulos, Felix Juefei-Xu, Yuxiang Bao, Julian McAuley, Manling Li, Zecheng He

机构 * Meta Superintelligence Labs(Meta超级智能实验室) University of California, San Diego(加州大学圣迭戈分校) Worcester Polytechnic Institute(伍斯特理工学院) Northwestern University(西北大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出过程驱动的图像生成方法,通过交错推理轨迹分解合成过程,通过文本规划、视觉草图、文本反思和视觉细化四个阶段,使生成过程显式、可解释且可监督。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 15 篇

2604.06714 2026-04-09 cs.AI cs.CL cs.CV cs.LG 82%

Steering the Verifiability of Multimodal AI Hallucinations

操控多模态AI幻觉的可验证性

Jianhong Pang, Ruoxi Cheng, Ziyi Ye, Xingjun Ma, Zuxuan Wu, Xuanjing Huang, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文研究多模态AI幻觉的可验证性差异,提出基于激活空间的干预方法,通过区分明显和隐秘幻觉,实现对模型可验证性的精细控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06934 2026-04-09 cs.CV cs.AI 81%

Multi-modal user interface control detection using cross-attention

基于交叉注意力的多模态用户界面控制检测

Milad Moradi, Ke Yan, David Colwell, Matthias Samwald, Rhona Asgari

机构 * AI Research Lab, Tricentis(Tricentis AI研究实验室) Institute of Artificial Intelligence, Center for Medical Statistics, Informatics, and Intelligent Systems, Medical University of Vienna(维也纳医科大学人工智能研究所、医学统计、信息学与智能系统中心)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种结合文本描述与视觉信息的多模态YOLOv5改进模型,通过交叉注意力模块提升UI控件检测的鲁棒性和语义理解能力,实验表明在复杂或模糊的UI场景中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06985 2026-04-09 cs.LG cs.AI 79%

Frailty Estimation in Elderly Oncology Patients Using Multimodal Wearable Data and Multi-Instance Learning

利用多模态可穿戴数据和多实例学习估计老年癌症患者的虚弱状态

Ioannis Kyprakis, Vasileios Skaramagkas, Georgia Karanasiou, Lampros Lakkas, Andri Papakonstantinou, Domen Ribnikar, Kalliopi Keramida, Dorothea Tsekoura, Ketti Mazzocco, Anastasia Constantinidou, Konstantinos Marias, Dimitrios I. Fotiadis, Manolis Tsiknakis

机构 * Univ. of Ioannina(约阿尼纳大学) Karolinska Univ. Hosp.(卡罗林斯卡大学医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种多模态可穿戴框架,通过整合智能手表和心电图数据,利用多实例学习方法估计老年乳腺癌患者在随访期间的虚弱状态变化,实验结果显示模型在预测功能变化方面具有较高准确性。

Comments 7 pages, 1 figure, under review for IEEE EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02676 2026-04-09 cs.CV 79%

AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process

AdaptMMBench: 多模态适应推理的基准测试用于模式选择和推理过程

Xintong Zhang, Xiaowen Zhang, Jingrong Wu, Zhi Gao, Shilin Yan, Zhenxin Diao, Kunpeng Gao, Xuanyan Chen, Yuwei Wu, Yunde Jia, Qing Li

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出AdaptMMBench,通过五类领域评估多模态适应推理,利用MCC指标评估模式选择合理性,揭示适应模式选择与最终准确率的脱钩现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19640 2026-04-09 cs.CV 79%

Focus on What Really Matters in Low-Altitude Governance: A Management-Centric Multi-Modal Benchmark with Implicitly Coordinated Vision-Language Reasoning Framework

聚焦低空治理中真正重要的问题:一种以管理为中心的多模态基准与隐式协调的视觉-语言推理框架

Hao Chang, Zhihui Wang, Lingxiang Wu, Wei An, Boyang Li, Zaiping Lin, Weidong Sheng, Jinqiao Wang

机构 * National University of Defense Technology(国防科技大学) Zidong Taichu (Beijing) Technology Co., Ltd.(紫东太初(北京)科技有限公司) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出GovLA-10K多模态基准和GovLA-Reasoner框架,通过功能显著目标和隐式协调的视觉-语言推理提升低空治理中的管理需求理解与执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07101 2026-04-09 cs.CV cs.AI cs.MM eess.IV 67%

SurFITR: A Dataset for Surveillance Image Forgery Detection and Localisation

SurFITR:用于监控图像伪造检测与定位的数据集

Qizhou Wang, Guansong Pang, Christopher Leckie

机构 * The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 SurFITR数据集旨在解决监控场景中伪造检测与定位的挑战,通过多模态LLM生成大量高质量伪造图像,提升检测模型在不同场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06250 2026-04-09 cs.CV cs.AI 62%

DISSECT: Diagnosing Where Vision Ends and Language Priors Begin in Scientific VLMs

DISSECT:诊断视觉结束和语言先验开始的位置在科学视觉-语言模型中

Dikshant Kukreja, Kshitij Sah, Karan Goyal, Mukesh Mohania, Vikram Goyal

机构 * IIIT Delhi(德里印度理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DISSECT通过12000个问题诊断科学VLMs中视觉与语言先验的界限,揭示了视觉信息提取与下游推理之间的差距,发现开源模型在自身描述推理中表现更优,而闭源模型无此差距,表明跨模态能力的前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05429 2026-04-09 eess.SY cs.AI cs.CL cs.SY 62%

Bridging Natural Language and Microgrid Dynamics: A Context-Aware Simulator and Dataset

连接自然语言与微电网动态:一种上下文感知的模拟器和数据集

Tinko Sebastian Bartels, Ruixiang Wu, Xinyu Lu, Yikai Lu, Fanzeng Xia, Haoxiang Yang, Yue Chen, Tongxin Li

机构 * School of Data Science, The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)数据科学学院) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程学系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OpenCEM模拟器和数据集,通过整合丰富的非结构化上下文信息与量化可再生能源动态,解决传统能源管理忽视人类生成上下文预测能力的问题,展示其在负载预测和电池充电控制中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23158 2026-04-09 cs.CV cs.AI 62%

REVEAL: Reasoning-Enhanced Forensic Evidence Analysis for Explainable AI-Generated Image Detection

REVEAL: 基于推理的取证分析用于可解释的AI生成图像检测

Huangsen Cao, Qin Mei, Zhiheng Li, Yuxi Li, Zhan Meng, Ying Zhang, Chen Li, Zhimeng Zhang, Xin Ding, Yongwei Wang, Jing Lyu, Fei Wu

机构 * Zhejiang University(浙江大学) WeChat Vision, Tencent Inc(腾讯微信视觉) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 REVEAL通过构建可验证的证据链,提升AI生成图像检测的可解释性与泛化能力,采用专家引导的强化学习训练框架,实现更准确和可信的检测结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03123 2026-04-09 eess.IV cs.CV cs.MM 62%

A Dynamic Prognostic Prediction Method for Colorectal Cancer Liver Metastasis

结直肠癌肝转移的动态预后预测方法

Wei Yang, Yiran Zhu, Yan su, Zesheng Li, Chengchang Pan, Honggang Qi

机构 * North China Electric Power University(华北电力大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出DyPro框架,通过残差动态演化推断术后潜在轨迹,整合多模态临床信息,提升复发和生存预测精度。

Comments Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06990 2026-04-09 cs.LG cs.AI 57%

Stress Estimation in Elderly Oncology Patients Using Visual Wearable Representations and Multi-Instance Learning

利用视觉可穿戴表示和多实例学习对老年癌症患者压力进行估计

Ioannis Kyprakis, Vasileios Skaramagkas, Georgia Karanasiou, Vasilis Bouratzis, Andri Papakonstantinou, Dimitar Stefanovski, Kalliopi Keramida, Aristofania Simatou, Ketti Mazzocco, Anastasia Constantinidou, Konstantinos Marias, Dimitrios I. Fotiadis, Manolis Tsiknakis

机构 * Breast Center Karolinska Univ. Hosp. Stockholm, Sweden

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文通过多模态可穿戴数据和轻量级预训练混合专家模型,利用视觉表示和多实例学习预测老年癌症患者压力评分,实验结果显示预测结果与问卷评分有中等一致性。

Comments 7 pages, 2 figures, under review for IEEE EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11635 2026-04-09 cs.AI 57%

Do MLLMs Really Understand Space? A Mathematical Reasoning Evaluation

大规模语言模型真的能理解空间吗?一项数学推理评估

Shuo Lu, Jianjie Cheng, Yinuo Xu, Yongcan Yu, Lijun Sheng, Peijie Wang, Siru Jiang, Yongguan Hu, Run Ling, Yihua Shao, Ao Ma, Wei Feng, Lingxiao He, Meng Wang, Qianlong Xie, Xingxing Wang, Nicu Sebe, Ran He, Jian Liang

机构 * Meituan Inc.(美团) Northeastern University(东北大学) University of Trento(特伦托大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文通过MathSpatial数据集评估了大规模语言模型在数学空间推理上的能力,发现其在空间推理任务上表现不佳,提出该数据集有助于提升模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06973 2026-04-09 cs.NE 50%

Block-Bench: A Framework for Controllable and Transparent Discrete Optimization Benchmarking

Block-Bench: 一个用于可控和透明离散优化基准测试的框架

Furong Ye, Frank Neumann, Thomas Bäck, Niki van Stein

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出Block-Bench框架,通过可控的块函数和依赖图生成离散优化基准,分析算法在目标空间和变量表示层面的行为,提升大规模多模态问题的研究实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06174 2026-04-09 cs.HC cs.CY 50%

X-BCD: Explainable Sensor-Based Behavioral Change Detection in Smart Home Environments

X-BCD:可解释的基于传感器的行为变化检测在智能家庭环境中

Gabriele Civitarese, Claudio Bettini

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出X-BCD框架,通过多模态智能家庭传感器数据检测和表征活动规律变化,结合变化点检测和聚类演变追踪,生成自然语言解释,用于临床解读。

Comments Manuscript currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14135 2026-04-09 stat.ML cs.LG 50%

Conditional flow matching for physics-constrained inverse problems with finite training data

基于有限训练数据的物理约束反问题条件流匹配

Agnimitra Dasgupta, Ali Fardisi, Mehrnegar Aminy, Brianna Binder, Bryan Shaddy, Saeed Moazami, Assad Oberai

机构 * Optimization and Uncertainty Quantification, Sandia National Laboratories(桑迪亚国家实验室优化与不确定性量化)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出条件流匹配框架解决物理约束贝叶斯反问题,通过神经网络学习概率流微分方程的流速场,有效处理非线性、高维及非可导前向模型,验证了早停策略缓解过拟合的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 7 篇

2506.19420 2026-04-09 cs.AI 83%

Commander-GPT: Dividing and Routing for Multimodal Sarcasm Detection

Commander-GPT:多模态讽刺检测的分工与路由

Yazhou Zhang, Chunwang Zou, Bo Wang, Jing Qin, Prayag Tiwari

专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文提出Commander-GPT框架,通过分工协作的LLM代理团队,结合三种指挥官类型,提升多模态讽刺检测性能,实验结果显示在F1分数上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06777 2026-04-09 cs.CV 79%

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization

行走与言说:通过多模态代理策略优化弥合图像推理与行动之间的差距

Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yuchen Zhou, Xiaobo Xia, Yuanyu Wan, Lijun Zhang, Tat-Seng Chua

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) AI Business, Alibaba Group(阿里巴巴集团智能计算研究院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, China(上海交通大学自动化与智能感知学院) School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能工程学院(深圳)) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) School of Software Technology, Zhejiang University, China(浙江大学软件学院) School of Computing, National University of Singapore, Singapore, Singapore(新加坡国立大学计算机学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MAPO方法,通过强制生成视觉内容的显式文本描述,结合语义对齐与任务奖励,提升多模态推理能力,实验表明其在多个视觉推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06376 2026-04-09 cs.CV 79%

MTA-Agent: An Open Recipe for Multimodal Deep Search Agents

MTA-Agent:多模态深度搜索代理的开放配方

Xiangyu Peng, Can Qin, An Yan, Xinyi Yang, Zeyuan Chen, Ran Xu, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce 人工智能研究院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MTA-Agent,通过构建高质量多跳视觉-语言训练数据,实现多模态深度搜索代理,其在六个基准测试中达到54.63%的平均准确率,优于其他模型,同时降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08409 2026-04-09 cs.AI 79%

Faithful-First Reasoning, Planning, and Acting for Multimodal LLMs

多模态大语言模型中的忠实优先推理、规划与行动

Junxian Li, Xinyue Xu, Sai Ma, Di Zhang, Sichao Li

机构 * Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学) The Australian National University(澳大利亚国立大学) Fudan University(复旦大学) University of Sydney(悉尼大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Faithful-First RPA框架,通过逐步监督提升多模态推理的忠实度,实验表明其在多个基准上提升了24%的感知忠实度,且不降低任务准确性。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06914 2026-04-09 cs.LG 78%

Equivariant Multi-agent Reinforcement Learning for Multimodal Vehicle-to-Infrastructure Systems

等价多智能体强化学习用于多模态车-基础设施系统

Charbel Bou Chaaya, Mehdi Bennis

机构 * Centre for Wireless Communications, University of Oulu(奥卢大学无线通信中心)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文研究了车-基础设施系统,通过分布式基站收集多模态数据,采用去中心化速率最大化方法,利用等价性对称性提出自监督学习框架,提升多模态感知和强化学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22025 2026-04-09 cs.AI cs.CL cs.CV 67%

UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding

UI-AGILE: 通过有效的强化学习和精确的推理时间接地提升GUI代理

Shuquan Lian, Yuhang Wu, Jia Ma, Yifan Ding, Zihan Song, Bingqi Chen, Xiawu Zheng, Hui Li, Rongrong Ji

机构 * Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 UI-AGILE通过改进监督微调过程和推理中的分解接地,提升了GUI代理的接地性能和通用能力,在ScreenSpot-Pro和ScreenSpot-v2基准上实现了最佳表现,地面准确率提升23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06180 2026-04-09 eess.IV cs.CV cs.LG cs.MA 57%

MedRoute: RL-Based Dynamic Specialist Routing in Multi-Agent Medical Diagnosis

MedRoute: 基于强化学习的多智能体医疗诊断动态专家路由

Ashmal Vayani, Parth Parag Kulkarni, Joseph Fioresi, Song Wang, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida, Orlando, United States(中佛罗里达大学人工智能研究所,奥兰多,美国)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出MedRoute框架,通过强化学习动态选择专家进行医疗诊断,提升诊断准确性,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 7 篇

2604.06728 2026-04-09 cs.CV cs.AI cs.MM 87%

URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection

URMF:面向多模态讽刺检测的不确定性感知鲁棒多模态融合

Zhenyu Wang, Weichen Cheng, Weijia Li, Junjie Mou, Zongyou Zhao, Guoying Zhang

机构 * School of Artificial Intelligence, China University of Mining and Technology-Beijing(中国矿业大学(北京)人工智能学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出URMF框架,通过建模模态可靠性提升多模态讽刺检测的准确性和鲁棒性,采用多头交叉注意力和自注意力机制,并结合不确定性建模和联合训练目标,在公开基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07141 2026-04-09 cs.CV 79%

USCNet: Transformer-Based Multimodal Fusion with Segmentation Guidance for Urolithiasis Classification

USCNet:基于Transformer的多模态融合与分割引导的尿路结石分类

Changmiao Wang, Songqi Zhang, Yongquan Zhang, Yifei Wang, Liya Liu, Nannan Li, Xingzhi Li, Jiexin Pan, Yi Jiang, Xiang Wan, Hai Wang, Ahmed Elazab

机构 * Shenzhen Research Institute of Big Data(深圳市大数据研究院) Zhejiang University of Finance and Economics(浙江财经大学) Anhui University of Finance and Economics(安徽财经大学) The Second Affiliated Hospital of Chinese University of Hong Kong (Longgang District People’s Hospital of Shenzhen)(香港中文大学第二附属医院(深圳市龙岗区人民医院))

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 USCNet通过融合CT图像与电子病历数据,利用Transformer架构实现尿路结石的预手术分类,提出动态损失函数平衡分割与分类任务,实验表明其分类效果优于现有方法。

Comments Accepted by IEEE Journal of Biomedical and Health Informatics. Early Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06912 2026-04-09 cs.CV cs.AI 76%

Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models

Q-Zoom:基于查询的自适应感知以实现高效多模态大语言模型

Yuheng Shi, Xiaohuan Pei, Linfeng Wen, Minjing Dong, Chang Xu

机构 * University of Sydney(悉尼大学) Sun Yat-sen University(中山大学) City University of Hong Kong(香港城市大学)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.AI

AI总结 Q-Zoom通过高效粗到细的框架优化多模态大语言模型的高分辨率感知,提升推理速度并保持精度,实验表明其在文档识别和高分辨率场景中表现优异。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07154 2026-04-09 cs.CV cs.AI 62%

Bridging MRI and PET physiology: Untangling complementarity through orthogonal representations

弥合MRI与PET生理学:通过正交表示解构互补性

Sonja Adomeit, Kartikay Tehlan, Lukas Förner, Katharina Weisser, Helen Scholtiseek, David Kaufmann, Julie Steinestel, Constantin Lapa, Thomas Kröncke, Thomas Wendler

机构 * Dept. of diagnostic and interventional Radiology and Neuroradiology, University Hospital Augsburg, Germany(德国奥格斯堡大学医院诊断与介入放射学及神经放射学系) Digital Medicine, University Hospital Augsburg, Germany(德国奥格斯堡大学医院数字医学) Chair for Computer Aided Medical Procedures and Augmented Reality, Technical University of Munich, Germany(德国慕尼黑工业大学计算机辅助医疗流程与增强现实教席) Bavarian Center for Cancer Research (BZKF) Augsburg, Germany(德国奥格斯堡巴伐利亚癌症研究中心) Dept. of Nuclear Medicine, University Hospital Augsburg, Germany(德国奥格斯堡大学医院核医学系) Dept. of Urology, University Hospital Augsburg, Germany(德国奥格斯堡大学医院泌尿外科) Center for Advanced Analytics and Predictive Sciences, University of Augsburg, Germany(德国奥格斯堡大学高级分析与预测科学中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种子空间分解框架,通过正交子空间分离重构多模态融合,区分共享信息与模态特有信息,揭示PSMA PET信号中不可由MRI生理描述恢复的部分。

Comments The code is available at https://github.com/SonjaA14/inrmri2pet

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06267 2026-04-09 cs.LG cs.AI 57%

MO-RiskVAE: A Multi-Omics Variational Autoencoder for Survival Risk Modeling in Multiple MyelomaMO-RiskVAE

MO-RiskVAE: 一种多组学变分自编码器用于多发性骨髓瘤生存风险建模

Zixuan Chen, Heng Zhang, YuPeng Qin, WenPeng Xing, Qiang Wang, Da Wang, Changting Lin, Meng Han

机构 * Binjiang Institute of Zhejiang University(浙江大学滨江研究院) Zhejiang University(浙江大学) School of Medicine, Zhejiang University(浙江大学医学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出MO-RiskVAE,通过统一扩展MyeVAE框架,系统研究了潜变量建模选择对多模态生存预测的影响,发现生存驱动训练对潜变量正则化幅度和结构更敏感,通过混合连续-离散公式提升风险排序,改进了风险分层。

详情

展开后加载摘要…

URL PDF HTML 收藏