arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-30 至 2026-06-30 共收录 33 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 33 篇

2605.26312 2026-06-30 stat.ME 88%

Cross-modal dependence analysis with asynchronous longitudinal multimodal data

异步纵向多模态数据的跨模态依赖分析

Kun Qian, Hyung G. Park

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract)

AI总结 提出一种贝叶斯潜变量模型,用于估计异步观测的多模态数据中协变量辅助的依赖结构,并应用于阿尔茨海默病神经影像学倡议数据,揭示临床有意义的纵向跨模态生物标志物依赖模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30027 2026-06-30 cs.CV 83%

Cross-Modal Iteration Distillation for Robust IHD Screening: The IDNet Framework and A New Benchmark

跨模态迭代蒸馏用于稳健的IHD筛查:IDNet框架与一个新基准

Yongchang Gao, Junjie Pang, Shuaiyu Yang, Yusheng Yang, Xichao Jia, Shaojie Li, Hongfei Zhang, Jia Mu

机构 * University of Chinese Academy of Sciences(中国科学院大学) MGI Tech Co., Ltd.(MGI科技有限公司) Shenzhen University(深圳大学)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出IDNet框架,通过跨模态蒸馏聚合器(CDA)融合左右眼眼底图像和稀疏临床变量,并构建UK Biobank基准,在IHD筛查中优于多种基线方法。

Comments Accepted to the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28329 2026-06-30 cs.IR cs.AI cs.CL cs.MM 82%

$M^3 QuestionIng$: Multi-modal Multi-span Medical Question Answering

$M^3 QuestionIng$: 多模态多跨度医学问答

Anisha Saha, Vaibhav Rathore, Abhisek Tiwari, Akash Ghosh, Sai Ruthvik Edara, Sriparna Saha

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 提出多模态多跨度医学问答框架M3QAFrame,结合文本与图像线索生成包含文本和图像的答案,在自建数据集上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02482 2026-06-30 cs.CV 81%

X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding

X-Stream: 探索多模态大语言模型作为多流理解的多路复用器

Peiwen Sun, Xudong Lu, Huadai Liu, Yang Bo, Dongming Wu, Huankang Guan, Minghong Cai, Jinpeng Chen, Xintong Guo, Shuhan Li, Fang Liu, Rui Liu, Xiangyu Yue

机构 * MMLab, Chinese University of Hong Kong(中大香港人工智能实验室) Huawei Inc.(华为公司)

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multi-modal(abstract);分类 cs.CV

AI总结 为解决多流视频理解评估缺失的问题,提出首个基准X-Stream,包含4220个QA对和932个视频,覆盖多窗口、多视角和多设备场景,并基于信号多路复用理论评估MLLM作为多路复用器的性能,发现现有模型在并发流上仅达约50%分数。

Comments Project Page: https://peiwensun2000.github.io/xstream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30492 2026-06-30 cs.CV 79%

RBE-Flow: Recurrent Bayesian Estimation on Feature Manifolds for Cross-Modal Registration

RBE-Flow:基于特征流形的递归贝叶斯估计用于跨模态配准

Mengzhu Ding, Xin Song, Xiaoke Ding, Hongwei Ding, Xuecong Liu

机构 * Northeastern University, China(东北大学)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对跨模态图像配准中非线性辐射差异和几何畸变导致的优化困难,提出RBE-Flow框架,将密集流估计重构为特征流形上的闭环递归贝叶斯估计,通过递归流形优化和不确定性自适应概率更新实现自校正,在多个基准上取得最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29808 2026-06-30 cs.HC cs.AI 79%

Making Multimodal LLMs Reliable Chart Data Extractors: A Benchmark and Training Framework

使多模态大语言模型成为可靠的图表数据提取器:一个基准和训练框架

Yuchen He, Peizhi Ying, Liqi Cheng, Kuilin Peng, Yuan Tian, Dazhen Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Guangdong University of Technology(广东工业大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型在图表数据提取中数值精度不足的问题,提出渐进式学习训练框架,显著提升7B参数模型的准确率,达到最优性能。

Comments Accepted at CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28780 2026-06-30 cs.IR cs.CV 79%

Multimodal Graph RAG for Long-range Visually Rich Document Understanding

多模态图RAG用于长程视觉丰富文档理解

Yi-Cheng Wang, Chu-Song Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国家台湾大学计算机科学与信息工程系) FinTech Center, National Taiwan University(国家台湾大学金融科技中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出多模态图RAG方法,通过构建多模态知识图谱解决长文档视觉问答中全局理解不足的问题,并引入新基准DLVQA进行评测,实验表明该方法优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28696 2026-06-30 cs.AI 79%

COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models

COMPASS:在统一多模态模型中锚定构图意图引导

Ziqi Zhou, Weize Quan, Mining Tan, Zhihan Chen, Dandan Zheng, Jingdong Chen, Jun Zhou, Weiming Dong, Dong-Ming Yan

机构 * University of Edinburgh(爱丁堡大学) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出统一框架COMPASS,通过共享专家令牌τ_c实现构图感知与生成的双向锚定,结合MoE骨干和Comp-11数据集,显著提升细粒度构图理解与可控生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28556 2026-06-30 cs.AI 79%

IMCBench: A benchmark for multimodal LLMs in Image-grounded Medical Conversations

IMCBench:面向多模态大语言模型在图像基础医疗对话中的基准测试

Maria Xenochristou, Ashutosh Joshi, Korosh Vatanparvar, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Anchal Nema, Nivedita Wadhwa, Prashams S Jain, Rebecca Abraham, Will Kimbrough, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康AI)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出IMCBench基准,结合临床图像与合成患者档案模拟多轮医疗对话,从安全性、准确性和不确定性使用三个维度评估模型,发现准确描述不等于安全指导。

Comments Accepted at ECML PKDD 2026. 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21545 2026-06-30 cs.CV 79%

EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal

EraseLoRA: 基于多模态大语言模型的前景排除与背景子类型聚合用于无数据集对象去除

Sanghyun Jo, Donghwan Lee, Eunji Jung, Seong Je Oh, Kyungsu Kim

机构 * OGQ Seoul National University(首尔大学)

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 EraseLoRA通过多模态大语言模型实现前景排除与背景子类型聚合,提升无数据集对象去除的背景重建与前景抑制效果,显著提高重建真实性并减少冗余生成。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07445 2026-06-30 cs.AI 79%

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: https://weihaotan.github.io/StarDojo

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01173 2026-06-30 cs.CV 77%

EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment

EEmo-Logic:面向全面图像诱发情感评估的统一数据集与多阶段框架

Lancheng Gao, Ziheng Jia, Zixuan Xing, Wei Sun, Huiyu Duan, Guangtao Zhai, Xiongkuo Min

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出最大图像诱发情感理解数据集EEmoDB和统一多模态大语言模型EEmo-Logic,通过指令微调和任务定制GRPO实现细粒度情感问答与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12175 2026-06-30 cs.CV 77%

Redefining Quality Criteria and Distance-Aware Score Modeling for Image Editing Assessment

重新定义质量标准与距离感知评分建模用于图像编辑评估

Xinjie Zhang, Qiang Li, Xiaowen Ma, Axi Niu, Li Yan, Qingsen Yan

机构 * Northwestern Polytechnical University(西北工业大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出DS-IEQA框架,通过反馈驱动指标优化和令牌解耦距离回归损失,改进图像编辑质量评估的指标定义与评分连续性建模。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 2812-2820

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30597 2026-06-30 cs.CV 70%

Learning from Reliable Latent Prompts for Visual Recognition with Missing Modalities

从可靠潜在提示中学习:面向缺失模态的视觉识别

Taixi Chen, Nancy Guo

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出从可靠潜在提示中学习的新范式,通过输入无关的可学习潜在提示作为稳定锚点,在极端缺失率下实现鲁棒引导和跨模态知识补偿,在三个基准数据集上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21526 2026-06-30 cs.CV 70%

VIGIL: Part-Grounded Structured Reasoning for Generalizable Deepfake Detection

VIGIL:基于部分的结构化推理用于通用深度伪造检测

Xinghan Li, Junhao Xu, Jingjing Chen

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 VIGIL通过计划-检验流程,结合部分级证据和结构化推理,提升深度伪造检测的可解释性和泛化能力。

Comments Project Page: https://vigil.best

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30059 2026-06-30 cs.LG 67%

From Failure Taxonomy to Intervention: A Diagnostic Methodology for Industry-Scale AVLM in Video and Live-Streaming Platform Moderation

从失败分类到干预:面向视频和直播平台审核的工业级AVLM诊断方法

Shuchang Ye, Jinqiang Yu, Zhujun Xiao, Yajing Kong, Yist Y. Lin, Yang Ma, Jiaxi Liu, Xiaolei Xu, Zheng Yu

机构 * TikTok The University of Sydney(悉尼大学)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract)

AI总结 提出一种工业级音视频语言模型(AVLM)诊断方法,通过失败分类法将模型失败映射为可观察的失败特征,并链接到干预空间,应用于大规模视频和直播平台的模型开发与对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30576 2026-06-30 cs.CV cs.AI 62%

Beyond 2D Matching: A Unified Single-Stage Framework for Geometry-Aware Cross-View Object Geo-Localization

超越2D匹配:用于几何感知跨视角目标地理定位的统一单阶段框架

Liyao Wang, Ruipu Wu, Haojun Xu, Lei Shi, Linjiang Huang, Si Liu

机构 * Beihang University(北航) Meituan(美团)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出GAGeo单阶段框架,利用3D基础模型和对比损失,结合多模态提示和相机位姿,实现跨视角目标地理定位,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30026 2026-06-30 cs.CV cs.AI 62%

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

MuseBench: 多模态大语言模型中意图级视听艺术理解的基准测试

Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon

机构 * NTU Singapore(南洋理工大学) The University of Hong Kong(香港大学) Johns Hopkins University(约翰霍普金斯大学) AI2(人工智能研究所) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出MuseBench基准,通过4016道涵盖电影、视觉艺术、舞台表演和游戏艺术的选择题,评估多模态大模型对艺术创作意图的理解,发现最佳模型准确率仅48.29%,远低于人类专家的87.18%。

Comments Project page: https://musebench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29928 2026-06-30 cs.CV cs.AI 62%

Latent-CURE for Breast Cancer Diagnosis

Latent-CURE:用于乳腺癌诊断的潜在空间推理框架

Weiyi Zhao, Xiaoyu Tan, Lu Gan, Liang Liu, Xihe Qiu

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大模型在乳腺癌超声诊断中因数据不平衡而忽略罕见恶性特征的问题,提出基于潜在空间非对称加权思维链的Latent-CURE框架,强制模型先推断BI-RADS形态描述符再诊断,并采用双非对称优化策略保护恶性特征,实现透明且鲁棒的诊断。

Comments 11 pages, 4 figures, 3 tables. Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29213 2026-06-30 cs.CL cs.CV 62%

Can OCR-VLMs Read Devanagari? A Stress-Test Benchmark and Post-Correction Study

OCR-VLM能阅读天城文吗?一项压力测试基准与后纠正研究

Aditya Pratap Singh

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究通过合成退化条件和真实扫描图像,系统评估了10种OCR系统在天城文(印地语)上的表现,发现专用OCR-VLM在退化条件下最脆弱,真实扫描性能远低于合成文本,并提出了错误分类和后纠正方法。

Comments 9 pages, 5 figures. Benchmark and code released

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30408 2026-06-30 cs.CV 57%

SA-Homo: Scale Adaptive Homography Estimation for Scale Variation Scenarios

SA-Homo:面向尺度变化场景的自适应单应性估计

Shangxuan Xie, Haifeng Wu, Yuhang Wang, Huarong Jia, Wen Li

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Chinese Academy of Sciences(中国科学院大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出SA-Homo框架,通过分层尺度对齐策略(全局SDBM模块与局部IHERM模块)解决大尺度差异下的单应性估计问题,在8倍尺度差异下仍保持高精度,并贡献了HMSA数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30393 2026-06-30 cs.CV 57%

SADL: What to Ignore? A Benchmark for Subject-Aware Distractor Localization

SADL:该忽略什么?面向主体感知的干扰物定位基准

Cao-Tri Nguyen, Nguyen-Khoa Luong, Vinh-Tiep Nguyen, Minh-Triet Tran

机构 * University of Science(科学大学) Vietnam National University Ho Chi Minh City(越南胡志明市国家大学) University of Information Technology(信息技术大学) John Von Neumann Institute(约翰·冯·诺依曼研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出SADL基准,包含1,800个主体感知案例,用于评估视觉语言模型在干扰物定位中的排除校准能力,揭示模型过度排除的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30378 2026-06-30 cs.CV 57%

OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning

OmniCoT: 全局与多步骤全景推理基准

Haocong He, Chenfei Liao, Zichen Wen, Zihao Dongfang, Xu Zheng, Bin Ren, Chang Su, Zixin Zhang, Harold Haodong Chen, Hongfei Zhang, Weijia Li, Kailun Yang, Conghui He, Xuming Hu, Nicu Sebe, Linfeng Zhang

机构 * MBZUAI Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出OmniCoT基准,通过链式思维标注和两阶段训练策略,增强多模态大模型在全景图像中的全局多步推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30124 2026-06-30 cs.CV 57%

SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

SciIR:面向科学图像推理生成的大规模训练数据集与基准

Zhiyuan Ma, Zhengfeng Shi, Yuning An, Peize Li, Jiabao Wei, Ruijie Li, Junhao Xiao, Jianjun Li, Bowen Zhou

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, China(华中科技大学计算机科学与技术学院,中国) School of Airspace Science and Engineering, Shandong University, China(山东大学航空航天科学与工程学院,中国) Department of Electronic Engineering, Tsinghua University, China(清华大学电子工程系,中国)

专题命中 多模态评测 :image-text(abstract);分类 cs.CV

AI总结 为解决文本到图像模型在科学图像生成中语义对齐与逻辑推理不足的问题,构建了包含8万+高质量科学图像-文本对的SciIR-82k数据集,并提出三层次科学推理框架及可验证评估基准SciIR-Bench,微调模型Qwen-Image-SciIR在基准上得分从35%提升至43%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29997 2026-06-30 cs.CV 57%

Rigel: Self-Distilled Score Adaptation for Image and Video Captioning Evaluation

Rigel: 基于自蒸馏分数自适应的图像与视频字幕评估

Shuitsu Koyama, Kazuki Matsuda, Yuiga Wada, Shinnosuke Hirano, Daichi Yashima, Komei Sugiura

机构 * Keio University(Keio大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出Rigel评估指标,通过自蒸馏从冻结LLM提取评估专用评分头,解决大词汇语言模型与小标签集不匹配问题,在视频字幕评估中超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29719 2026-06-30 cs.LG cs.CL 57%

A Diagnostic Framework and Multi-Evaluator Audit of Evaluator-Driven Preference Dynamics in Self-Adapting LLM Agents

自适应LLM代理中评估器驱动偏好动态的诊断框架与多评估器审计

Liu Zewen

机构 * Qilu Institute of Technology, School of Software Engineering(青岛理工大学软件学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 提出EPC诊断框架,包含多模态偏好崩溃指数、评估器索引耦合矩阵和JS散度,通过8个实验条件揭示GPT-4o版本漂移导致评估结论反转,证明单一快照评估研究不可靠。

Comments 9 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29193 2026-06-30 cs.SE cs.AI 57%

A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis

用于评估微服务故障诊断中LLM智能体的多数据集基准

Yuanhong Cai, Xiaohui Nie, Kanglin Yin, Changhua Pei, Yongqian Sun, Shenglin Zhang, Haibin Liu, Guiyang Liu, Xidao Wen, Fang Situ, Dan Pei

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出基于推理过程评估的基准,包含两个大规模数据集(AIOps2025和RCA100),从定位、识别和原因三个维度评估智能体诊断能力,覆盖500多个专家标注的故障案例。

Comments 10 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29118 2026-06-30 cs.IT cs.CL cs.IR cs.LG math.IT 57%

An Information-Geometric Justification for Composite Coherence in Event-Based Narrative Extraction

基于信息几何的事件叙事提取中复合一致性的证明

Brian Keith-Norambuena

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CL

AI总结 针对图叙事提取中一致性度量的信息论缺失,从信息几何角度解释复合度量C=√(A·T),并证明几何均值组合器满足四个自然公理,实验验证其有效性。

Comments Accepted to publication in Entropy on June 24, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28798 2026-06-30 cs.AI stat.AP 57%

Primary ICD Category Prediction using LLM-based Probing

基于LLM探针的主要ICD类别预测

Chengyuan Liu, Xinyue Zhang, Yao Li, Guanting Chen

机构 * Department of Statistics, Pennsylvania State University(宾夕法尼亚州立大学统计学系) Department of Biostatistics, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校生物统计学系) Department of Statistics and Operations Research, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校统计学与运筹学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本研究利用冻结的医学大语言模型表示作为共享嵌入空间,通过线性探针融合结构化变量和临床叙述,实现多模态主要诊断类别预测,在MIMIC-IV上达到87.69%的严格准确率。

Comments 9 pages, 2 figures. Supplementary materials provided as an ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18452 2026-06-30 cs.SD cs.LG eess.AS 57%

RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity

RA-QA:一种用于在现实世界异质性下呼吸音频问答的基准系统

Gaia A. Bertolino, Yuwei Zhang, Tong Xia, Domenico Talia, Cecilia Mascolo

专题命中 多模态评测 :multimodal(abstract);分类 eess.AS

AI总结 本文提出RA-QA基准系统,通过标准化数据生成流程和统一评估协议,整合900万组异构问答对,评估通用音频语言模型和领域特定架构在现实异质性下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏