arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-07-24 至 2026-07-24 共收录 39 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学影像 12 篇

2607.20561 2026-07-24 cs.LG cs.CV 新提交 90%

CT-Merging: Consensus Directions and Task-Level Scaling for LoRA Adapter Merging

CT-Merging:用于LoRA适配器合并的共识方向和任务级缩放

Keumseo Ryum, Joonhyuk Kang

机构 * KAIST(韩国科学技术院)

专题命中 医学影像 :CT(title,title_cn);分类 cs.CV、cs.LG

AI总结 研究针对LoRA适配器合并中系数不匹配问题,提出CT-Merging算法,通过平均任务子空间投影仪估计共识方向并分配任务级系数缩放,利用跨任务SVD子空间构建公共基础,在基准测试中比现有方法准确率更高。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20955 2026-07-24 cs.CV 新提交 90%

FSB-Net: Frequency-Spatial Boundary Network for Brain Stroke Lesion Segmentation in Non-Contrast CT

FSB-Net:用于非增强CT中脑卒病变分割的频率-空间边界网络

Linke Fan, Xianglong Li, Huixin Huang, Kai Shu

专题命中 医学影像 :CT(title,title_cn);分类 cs.CV

AI总结 研究旨在解决非增强CT中脑卒病变分割难题。提出FSB-Net,利用频域分析,含小波边界检测头、频率-空间交叉注意力模块和频谱边界损失。在公共数据集上评估,性能优于多种方法,达当前最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21913 2026-07-24 physics.med-ph cs.AI 版本更新 89%

Equivariant Conditional Diffusion Model for Head and Neck CT Image Synthesis from CBCT

用于从CBCT合成头颈CT图像的等变条件扩散模型

Alzahra Altalib, Chunhui Li, Alessandro Perelli

专题命中 医学影像 :CT(title,title_cn)

AI总结 针对CBCT图像有伪影、CT图像难捕捉治疗中解剖变化的问题,提出EqDiff-CT模型,基于扩散概率模型和群等变条件U-Net主干,从CBCT合成高质量CT图像,经实验验证在多方面有显著提升,为CBCT改进提供框架。

Comments 43 pages, 9 figures, 6 tables, accepted in Medical Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20993 2026-07-24 cs.CV cs.AI 新提交 89%

Sparse Concept Channels in Frozen 3D CT Vision Encoders

冻结的3D CT视觉编码器中的稀疏概念通道

Farhad Nooralahzadeh, Lea Bogensperger, Christian Bluethgen, Michael Krauthammer

专题命中 医学影像 :CT(title,title_cn);medical image(abstract);分类 cs.CV

AI总结 研究3D医学图像解释中视觉语言模型内部单元对临床发现的编码,提出无训练概念通道探测(CCP)方法,通过实验证明该方法能清晰表征冻结医学编码器对发现的表示,在临床疗效和NLG指标上表现优且延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20692 2026-07-24 cs.CV cs.AI 新提交 89%

DS@GT ARC at ImageCLEFmed GANs 2026: Geometric Filtering for Privacy-Preserving CT Slice Generation

图像CLEFmed GANs 2026竞赛中的DS@GT ARC:用于隐私保护CT切片生成的几何滤波

Eric Regina, Richard Arnaud, Samir Hadi Cisneros

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 医学影像 :CT(title,title_cn);medical image(abstract);分类 cs.CV

AI总结 为Image-CLEFmed GANs 2026挑战赛开发隐私保护框架,结合最优传输条件流匹配等,在几何潜在空间过滤候选切片。官方结果显示有真实感与隐私权衡,虽减少泄漏,但防止直接图像复制仍不足以消除患者特定解剖特征,凸显未来隐私保护医学图像生成的重要前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20691 2026-07-24 cs.CV cs.AI 新提交 83%

Spatially Grounded Concept Bottleneck Models for Trustworthy Breast Ultrasound Diagnosis

用于可靠乳腺超声诊断的空间基础概念瓶颈模型

Moshiur Rahman Tonmoy, Dunren Che, Haitham Y. Adarbah, Afzel Noore

专题命中 医学影像 :diagnosis(title,abstract);healthcare AI(abstract);分类 cs.CV

AI总结 研究乳腺超声诊断中概念瓶颈模型可信度受监督限制问题,提出空间基础概念瓶颈模型(SG-CBM),利用病变轮廓弱监督,通过导出特定区域训练概念图,经交叉验证等提升诊断指标与概念证据空间对齐,强调数据质量监督设计及可信度验证的必要。

Comments Accepted to the Workshop on Data Quality Aware, High-Performance, and Trustworthy AI Systems for Healthcare at IEEE/ACM CHASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21059 2026-07-24 astro-ph.SR 新提交 82%

Transport of angular momentum and chemical elements by the MRI dynamo in stellar radiative zones

恒星辐射区中磁旋转发电机对角动量和化学元素的输运

Laurène Jouve, François Lignières, Jérôme Guilet, Alexis Vanbesien

专题命中 医学影像 :MRI(title,abstract)

AI总结 研究红巨星深层磁场对角动量和化学元素的输运,通过零净通量剪切盒模拟建立输运效率与分层、旋转等参数的标度律,发现旋转和分层影响角动量及化学成分输运,该研究对协调恒星演化模型和星震反演有前景。

Comments 18 pages, 16 figures, accepted for publication in A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21307 2026-07-24 cs.LO cs.AI cs.ET 新提交 80%

Scaling Up Formal Representation of Clinical Trial Protocols in Ensemble Logic Using LLMs: A Preliminary Study

使用大语言模型在集成逻辑中扩大临床试验协议的形式化表示:一项初步研究

Yan Huang, Xubing Hao, Xiaojin Li, Rashmie Abeysinghe, Xiaoqian Jiang, Licong Cui, Guo-Qiang Zhang

机构 * McGovern Medical School(麦戈文医学学院) McWilliams School of Biomedical Informatics(麦克威廉斯生物医学信息学学院) The University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校)

专题命中 医学影像 :CT(summary_cn,abstract)

AI总结 研究针对临床试验协议依赖非结构化文本阻碍自动化推理等问题,引入CT-TEL工作流程,利用大语言模型将叙述性临床协议转为TEL公式,通过反向翻译评估保真度,为协议映射到可计算逻辑及临床试验模拟提供初步证据。

Comments Proceedings of the 2026 American Medical Informatics Association Symposium, to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20598 2026-07-24 eess.IV 新提交 79%

MedDiT4SR: Tri-Stream Joint Adaptation of Pre-Trained Diffusion Transformers for Medical Image Super-Resolution

MedDiT4SR:用于医学图像超分辨率的预训练扩散Transformer的三流联合自适应

Zhi Chen, Le Zhang

专题命中 医学影像 :medical image(title,abstract);分类 eess.IV

AI总结 研究针对医学图像超分辨率难题,提出MedDiT4SR三流自适应框架,集成多种表示于扩散Transformer块,引入SR Adapter和SA Refiner,实验验证该框架能有效让预训练DiT模型适应不同医学成像域的超分辨率任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20641 2026-07-24 cs.LG 新提交 79%

One Round Is All You Need: Analytic Federated Learning for Task-Heterogeneous Multi-Label Medical Image Classification

一轮就够了:用于任务异构多标签医学图像分类的解析联邦学习

Afsaneh Mahanipour, Hana Khamfroush

专题命中 医学影像 :medical image(title,abstract);分类 cs.LG

AI总结 针对任务异构的多标签医学图像分类问题,提出解析联邦学习框架,通过平衡标签投影、每类绝对聚合法则等闭式操作,最多两轮通信,优于FedMLP,提升分类指标并减少通信量。

Comments The 14th IEEE International Conference on Healthcare Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10667 2026-07-24 eess.IV 版本更新 57%

CPSNet: Physics-Inspired Label-Free Deep Unfolding for Lung Ultrasound B-Line Detection

CPSNet:用于肺部超声 B 线检测的物理启发式无标签深度展开

Tianqi Yang, Oktay Karakuş, Nantheera Anantrasirichai, Marco Allinovi, Alin Achim

专题命中 医学影像 :diagnosis(abstract);分类 eess.IV

AI总结 提出用于肺部超声图像分析的 CPSNet 无标签深度展开框架,将柯西近端分裂算法展开为网络架构,引入新损失函数,无监督训练,用于 B 线检测时比传统方法更具优势,能有效辅助临床诊断。

Comments 21 pages, 8 figures, Digital Signal Processing

Journal ref Yang, T., Karakus, O., Anantrasirichai, N., Allinovi, M., & Achim, A. (2026). CPSNet: Physics-Inspired Label-Free Deep Unfolding for Lung Ultrasound B-Line Detection. Digital Signal Processing, 184, 106399

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06416 2026-07-24 econ.GN q-fin.EC 50%

Distributional welfare impacts and compensatory transit strategies under NYC congestion pricing

纽约市拥堵收费下的分配性福利影响与补偿性交通策略

Xiyuan Ren, Zhenglei Ji, Joseph Y. J. Chow

专题命中 医学影像 :CT(abstract)

AI总结 本研究通过估计联合出行模式与目的地模型,量化纽约市拥堵收费对人口群体和区域的福利影响,并评估利用通行费收入改善公交系统(如减少等待时间和票价折扣)以补偿消费者剩余损失的效果,发现项目整体带来净福利收益但存在显著分配不公,需采用差异化补偿策略。

Journal ref Transportation Research Part A, 212 (2026), 105159

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 临床大模型 2 篇

2607.20848 2026-07-24 cs.AI 新提交 78%

Auditing Evidence Use in Medical LLM Diagnosis

医学大语言模型诊断中证据使用的审计

Junchi Liao, Jiawen Deng, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 临床大模型 :diagnosis(title,abstract)

AI总结 研究医学大语言模型诊断时证据使用情况,通过分解患者信息为证据单元等方法审计,在多个数据集上评估五个模型,发现准确性可能掩盖证据使用问题,结果促使对医学大语言模型评估进行角色感知审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25050 2026-07-24 stat.AP cs.LG q-bio.QM stat.ML 版本更新 60%

Multimodality Stacking with Blockwise missing values and application to the PIONeeR biomarkers study for prediction of resistance to immunotherapy

具有分块缺失值的多模态堆叠及其在预测免疫治疗耐药性的PIONeeR生物标志物研究中的应用

Mohamed Boussena, Florence Monville, Jacques Fieschi-Meric, Frederic Vely, Pierre Milpied, Julien Mazieres, Maurice Perol, Eric Vivier, Laurent Greillier, Fabrice Barlesi, Sebastien Benzekry

机构 * Inria – Inserm team COMPO, COMPutational pharmacology and clinical Oncology, Centre Inria Sophia Antipolis - Méditerranée, Centre de Recherches en Cancérologie de Marseille, Inserm U1068, CNRS UMR7258, Institut Paoli-Calmettes, Pharmacy faculty, Aix-Marseille University(Inria - Inserm COMPO团队,计算药理学和临床肿瘤学,Inria Sophia Antipolis -地中海, Marseille癌症研究中心,Inserm U1068,CNRS UMR7258,Paoli-Calmettes研究所,药学系,Aix-Marseille大学) Veracyte SAS, Marseille, France(Veracyte SAS,法国马赛) Assistance Publique-Hôpitaux de Marseille (APHM), Marseille, France(马赛公共医院(APHM),法国马赛) Toulouse University Hospital, Toulouse, France(图卢兹大学医院,法国图卢兹) Centre Leon Berard, Lyon, France(Leon Berard中心,法国里昂) Innate Pharma, Marseille, France(Innate Pharma,法国马赛) Université Paris Saclay, Gustave Roussy, Inserm, Prédicteurs Moléculaires et nouvelles cibles en oncologie (U981), F-94805, Villejuif, France(巴黎萨克雷大学,Gustave Roussy,Inserm,分子预测与肿瘤学新靶点(U981),法国维尔若,F-94805)

专题命中 临床大模型 :biomedical(abstract);分类 cs.LG、q-bio

AI总结 提出多模态堆叠框架MSB,通过独立建模各模态特征并利用交叉验证堆叠元学习器聚合预测,解决高维和分块缺失问题,在PIONeeR研究中预测非小细胞肺癌免疫治疗无进展生存期,性能优于基线算法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 诊断辅助 9 篇

2607.20582 2026-07-24 cs.LG cs.AI cs.MA 新提交 79%

Bayesian uncertainty estimation improves clinical decision making in medical AI agents

贝叶斯不确定性估计改善医学人工智能代理中的临床决策

Frederik Hauke, Patrick Wienholt, Christiane Kuhl, Dyke Ferber, Jakob Nikolas Kather, Sven Nebelung, Daniel Truhn

机构 * University Hospital RWTH Aachen(亚琛工业大学附属医院) Heidelberg University Hospital(海德堡大学医院) TU Dresden(德累斯顿工业大学) TUD Dresden University of Technology(德累斯顿工业大学)

专题命中 诊断辅助 :medical AI(title);medical image(abstract);分类 cs.LG

AI总结 研究针对医学图像分析机器学习模型缺乏置信度度量问题,采用蒙特卡洛随机失活获取认知不确定性信号,添加到点预测提高错误检测AUROC,在临床决策支持代理实验中,以特定形式传达该信号可降低误诊率,凸显其对决策的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20814 2026-07-24 cs.AI 新提交 78%

Enhancing Explainable Cardiac Diagnosis with Guide-Grounded Multimodal LLMs

用指南引导的多模态语言模型增强可解释的心脏诊断

Hai-Nam Duy Vuong, Duy-Anh Bui, Trong-Nghia Nguyen, Kim-Ngan Thi Nguyen, Trang Mai Xuan, Tien-Cuong Nguyen, Van-Dem Pham, Thien Van Luong

机构 * Business AI Lab, College of Technology, National Economics University(商业人工智能实验室,技术学院,越南国家经济大学) A2I Lab, Phenikaa School of Computing, Phenikaa University(A2I实验室,费尼卡计算机学院,费尼卡大学) VNPT AI, VNPT Group(VNPT人工智能,VNPT集团) FPT University(FPT大学) Department of Pediatrics, Hospital of University Medicine and Pharmacy, Vietnam National University Hanoi(越南河内国家大学医学与药学院儿科学系)

专题命中 诊断辅助 :diagnosis(title,abstract)

AI总结 研究针对深度学习模型在心脏诊断中可解释性有限等问题,提出指南引导的多模态框架,通过卷积神经网络、Grad-CAM及结构化解释指南生成诊断报告,实验证明该方法能提升报告质量,增强临床合理性。

Comments 12 pages, 3 figures, accepted at CITA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20780 2026-07-24 cs.CV 新提交 57%

Rethinking Open-World Video Anomaly Detection: Diagnosing Definition Blindness

重新思考开放世界视频异常检测:诊断定义盲目性

Inpyo Song, Jangwon Lee

专题命中 诊断辅助 :diagnosis(abstract);分类 cs.CV

AI总结 研究开放世界视频异常检测中定义盲目性问题,分解动态定义评估,引入三个定义条件评估指标及DeCoS,指出OWVAD应按定义条件异常评分评估,改进了多个基线模型的定义跟随能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20521 2026-07-24 cs.LG stat.ML 新提交 57%

Generative Bayesian Filtering for State Estimation

用于状态估计的生成式贝叶斯滤波

Lei Cao, Sihang Feng, Jixin Yan, Tao Sun, Naichen Shi

机构 * Northwestern University(西北大学)

专题命中 诊断辅助 :diagnosis(abstract);分类 cs.LG

AI总结 研究动态系统状态估计问题,提出生成式贝叶斯滤波框架GBF,用预训练条件生成模型取代简单观测模型,经贝叶斯预测-更新递归及转化,实验证明其提升了状态估计的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28241 2026-07-24 cs.CV 57%

PointQ-Bench: Benchmarking Diagnostic and Interpretable Point Cloud Quality Assessment

PointQ-Bench:诊断性和可解释的点云质量评估基准

Duanchu Wang, Cheng Li, Junjie Yang, Jing Huang, Zihang Cheng, Zhi Gao, Bohong Zhu, Di Wang

机构 * Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学) University of Chinese Academy of Sciences(中国科学院大学) Ningxia University(宁夏大学)

专题命中 诊断辅助 :diagnosis(abstract);分类 cs.CV

AI总结 提出PointQ-Bench基准,通过异常感知、缺陷诊断、可用性分级和开放式质量报告任务,将点云质量评估从标量评分扩展到全面质量理解,并揭示当前模型在感知与诊断之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05881 2026-07-24 cs.LG cs.CL cs.RO 57%

Training Fast Robot Policies with Slow Foundation Models

用慢速基础模型训练快速机器人策略

Utsav Singh, Pramit Bhattacharyya, Vinay P. Namboodiri, Amrit Singh Bedi

专题命中 诊断辅助 :diagnosis(abstract);分类 cs.LG

AI总结 本文提出VGRS方法,通过利用慢速基础模型训练快速机器人策略,结合LLM生成奖励与视觉分析诊断,提升机器人在复杂任务中的表现和部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11780 2026-07-24 stat.ME cs.CV stat.ML 版本更新 57%

Multivariate Planar Curves: A Statistical Framework for Shape Analysis in Images

多元平面曲线:图像形状分析的统计框架

Issam-Ali Moindjié, Cédric Beaulac, Marie-Hélène Descary

专题命中 诊断辅助 :diagnosis(abstract);分类 cs.CV

AI总结 研究在图像分析的监督分类中用对象轮廓作预测器,开发多元平面曲线统计学习框架,联合建模轮廓保留组件信息,扩展相关工具,经模拟和心脏肥大检测问题验证,该框架能准确恢复参数并提高分类准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21354 2026-07-24 cs.AI 新提交 50%

SPORD: A Simulation-Propose-then-OR-Dispose Approach for Supply Chain Planning

SPORD:一种用于供应链规划的模拟-提出-然后-优化-处置方法

Jiayin He, Yutong Pan, Sen Yang, Ningxuan Kang, Yongzhi Qi, Jianshen Zhang, Wei Qi, Zuo-Jun Max Shen

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) College of Engineering, UC Berkeley(加州大学伯克利分校工程学院) Faculty of Business and Economics, University of Hong Kong(香港大学经管学院)

专题命中 诊断辅助 :diagnosis(abstract)

AI总结 针对电商供应链规划中孤立项目及面临的难题,提出模拟-提出-然后-优化-处置方法(SPORD)及NetSim平台,通过解耦实现加速模拟与操作闭环,应用后提升服务质量、降低履约率并实现碳减排,推动模拟用于主动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20489 2026-07-24 cs.AI cs.DB 新提交 50%

EvoSQL: Memory-Augmented Critic-Generator Co-Evolution for Text-to-SQL

EvoSQL:用于文本到SQL的内存增强型评论家-生成器协同进化

Jiawei Zhou, Jianwei Wang, Chenyu Zhou, Chaojian Shi, Ming Dong, Kai Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of New South Wales(新南威尔士大学) Fudan University(复旦大学) Wuhan University of Technology(武汉理工大学)

专题命中 诊断辅助 :diagnosis(abstract)

AI总结 研究文本到SQL问题,提出EvoSQL协同进化框架,通过生成器与评论家迭代交互、维护内存、验证候选及自蒸馏策略优化微调等,在Spider和BIRD实验中持续改进开源模型,证明该方法是有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 病理影像 3 篇

2607.18218 2026-07-24 cs.CV cs.AI 版本更新 83%

GigaPath-Flash and GigaTIME-Flash: Efficient Pathology Foundation Models for Whole-Slide and Tumor Microenvironment Analysis

GigaPath-Flash和GigaTIME-Flash:用于全切片和肿瘤微环境分析的高效病理学基础模型

Naoto Usuyama, Jeya Maria Jose Valanarasu, Sicong Yao, Hanwen Xu, Jaspreet Bagga, Guanghui Qin, Robert E. Kramer, Cliff Wong, Soohee Lee, Hao Qiu, Theodore Zhengde Zhao, Racheli Ben Shimol, Angela Crabtree, Kevin Matlock, Eduardo Alejandro Lozano Garcia, Naiteek Sangani, Alberto Santamaria-Pang, Maximilian Rokuss, Yashna Hasija, Naisargi Manishkumar Patel, Jason Entenmann, Alexandra Q. Bartlett, Bill J. Wright, Bernard A. Fox, Brian Piening, Sheng Zhang, Sheng Wang, Tristan Naumann, Carlo Bifulco, Hoifung Poon

机构 * Microsoft Research(微软研究院) Paul G. Allen School of Computer Science and Engineering, University of Washington(华盛顿大学保罗·G·艾伦计算机科学与工程学院) Providence Genomics(普罗维登斯基因组学公司) Earle A. Chiles Research Institute, Providence Cancer Institute(普罗维登斯癌症研究所厄尔·A·奇尔斯研究所) Providence Research Network(普罗维登斯研究网络)

专题命中 病理影像 :pathology(title,abstract);diagnosis(abstract);分类 cs.CV

AI总结 研究针对计算病理学中模型局限,提出GigaPath-Flash和GigaTIME-Flash模型用于全切片和肿瘤微环境分析。前者结合特定编码器,计算量少性能优;后者扩展架构预测肿瘤免疫微环境,速度快内存省,共同为相关领域提供开放许可模型及权重。

Comments Models: https://aka.ms/gigapath-flash (GigaPath-Flash) and https://aka.ms/gigatime-flash (GigaTIME-Flash)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00945 2026-07-24 q-bio.GN cs.CV cs.LG 版本更新 65%

Evaluation and Prognostic Validation of Deep Regression Models for WSI-Based Gene-Expression Prediction

基于全切片图像的基因表达预测的深度回归模型的评估与预后验证

Fredrik K. Gustafsson, Constance Boissin, Johan Vallon-Christersson, Mattias Rantalainen

专题命中 病理影像 :pathology(abstract);分类 cs.CV、cs.LG、q-bio

AI总结 研究对基于全切片图像的基因表达预测的深度回归模型进行评估与验证,采用基于注意力的多实例学习与PFM特征提取器的直接回归,在多个数据集及队列中验证,证明该方法可泛化并恢复有意义分子结构,支持其用于转录组表型分析和风险分层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21434 2026-07-24 cs.CV cs.AI 新提交 57%

Adaptive Identity Anchoring: Closed-Loop Keyframe Placement for Synthetic Paired Supervision in Video Face Swapping

自适应身份锚定:用于视频人脸交换中合成配对监督的闭环关键帧放置

Logan Robbins

专题命中 病理影像 :pathology(abstract);分类 cs.CV

AI总结 研究视频人脸交换缺乏自然配对监督问题,提出自适应身份锚定(AIA)方法,通过闭环反馈放置锚定并结合现实参考纹理恢复,还给出可证伪实验,有望解决合成身份漂移及过度平滑皮肤问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 医疗多模态 3 篇

2607.21065 2026-07-24 cs.CV 新提交 79%

Do Pathology Vision-Language Models Truly See Pathology?

病理学视觉语言模型真的能‘看到’病理学吗?

Chengyang Zhang, Wenchuan Zhang, Bo Li, Xinyu Liu, Jiaming Yang, Mengran Li, Chenxun Deng, Jie Chen, Yang Zhang, Wei Ju, Yuhao Yi, Hong Bu, Jiancheng Lv

专题命中 医疗多模态 :pathology(title,abstract);分类 cs.CV

AI总结 研究病理学视觉语言模型评估中被忽视的问题,提出含多类型样本的PathBind基准,通过对多个VLMs评估发现,当前病理学VLMs在答案性能与视觉语义绑定间有显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21496 2026-07-24 eess.SP cs.LG 新提交 62%

Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models

使用基于语音的多模态大语言模型实现可泛化的认知障碍检测

Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao

机构 * Faculty of Digital Innovation, Arts \& Sciences, Saskatchewan Polytechnic, Regina SK S4S 5X1, Canada School of Basic Medical Sciences, Hebei University, Baoding 071000, China Department of Civil \& Environmental Engineering School of Mining \& Petroleum Engineering, University of Alberta, Edmonton AB T6G 2H5, Canada

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.LG、eess.SP

AI总结 研究针对认知障碍检测问题,提出基于开源大语言模型的多模态检测框架,整合语音音频与转录文本,提取特定模态嵌入后连接成特征向量用于分类,在相关基准数据集上评估,该框架准确率达92.4%,优于单模态基线且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20557 2026-07-24 cs.LG cs.AI 新提交 57%

Monkey King Bang: A Unified Scientific Multimodal Foundation Model

孙悟空爆炸:一个统一的科学多模态基础模型

Hesen Chen, Xinyu Su, Xiaomeng Yang, Yuetan Lin, Zixiong Yang, Junyi An, Fenglei Cao, Yifeng Jiao, Yunqi Zhang, Yuan Cheng, Zhiyu Tan, Hao Li, Libo Wu, Yuan Qi

机构 * Shanghai Academy of AI for Science(上海人工智能研究院)

专题命中 医疗多模态 :medical image(abstract);分类 cs.LG

AI总结 研究针对科学多领域推理需求,引入统一科学多模态模型MKB,围绕共享Transformer主干及定制组件构建,涵盖多科学分支。通过两阶段训练,在多方面实验表现出色,证明该范式可行,为跨领域科学多模态探索提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 生物医学文本 5 篇

2607.21343 2026-07-24 cs.LG cs.AI cs.CV 新提交 62%

M$^3$-Gen: Interpretable Multimodal Generation of Gene Expression Profiles Using Clinical and Imaging Data

M$^3$-Gen:利用临床和影像数据对基因表达谱进行可解释的多模态生成

Francesca Pia Panaccione, Carlo Sgaravatti, Marco Venere

机构 * DEIB - Dipartimento Elettronica, Informazione e Bioingegneria, Politecnico di Milano(米兰理工大学电子、信息与生物工程系)

专题命中 生物医学文本 :biomedical(abstract);分类 cs.CV、cs.LG

AI总结 研究旨在解决基因表达数据获取受限问题,提出M$^3$-Gen框架,通过对比学习从临床变量和图像中学习潜在表示,以生成生物学连贯的基因表达谱,在TCGA数据集上验证有效性,且具有内在可解释性。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏