arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-08-03 至 2026-08-03 共收录 51 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学影像 21 篇

2607.28978 2026-08-03 cs.CV 新提交 91%

Classification of COVID-19 cases from chest CT volumes using hybrid model of 3D CNN and 3D MLP-Mixer

基于3D CNN与3D MLP-Mixer混合模型的胸部CT影像的COVID-19病例分类

Masahiro Oda, Tong Zheng, Yuichiro Hayashi, Yoshito Otake, Masahiro Hashimoto, Toshiaki Akashi, Shigeki Aoki, Kensaku Mori

机构 * Nagoya University(名古屋大学) Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科) Graduate School of Science and Technology, Nara Institute of Science and Technology(奈良先端科学技术大学院大学科学技术研究科) Research Center for Medical Bigdata, National Institute of Informatics(信息学研究所医疗大数据研究中心) Keio University School of Medicine(庆应义塾大学医学院) Juntendo University(顺天堂大学)

专题命中 医学影像 :CT(title,title_cn);diagnosis(abstract,journal_ref);分类 cs.CV

AI总结 针对COVID-19患者激增导致的医疗人力短缺问题,本文提出由3D CNN与3D MLP-Mixer组成的混合模型,在含1205份CT影像的数据集上取得79.5%的分类准确率,优于传统3D CNN模型。

Comments Accepted as a poster presentation in SPIE Medical Imaging 2023

Journal ref Proceedings of SPIE Medical Imaging 2023, Computer-Aided Diagnosis, Vol. 12465

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28950 2026-08-03 cs.CV 新提交 91%

Automated classification method of COVID-19 cases from chest CT volumes using 2D and 3D hybrid CNN for anisotropic volumes

基于2D和3D混合卷积神经网络的各向异性体积胸部CT影像COVID-19病例自动分类方法

Masahiro Oda, Tong Zheng, Yuichiro Hayashi, Yoshito Otake, Masahiro Hashimoto, Toshiaki Akashi, Shigeki Aoki, Kensaku Mori

机构 * Nagoya University(名古屋大学) Keio University School of Medicine(庆应义塾大学医学院) Juntendo University(顺天堂大学)

专题命中 医学影像 :CT(title,title_cn);diagnosis(abstract,journal_ref);分类 cs.CV

AI总结 该研究针对COVID-19诊断需求,提出含2D/3D混合特征提取流的CNN,在1288例CT数据集上实现83.3%的平均分类准确率,优于无混合流的CNN,可辅助缓解医疗人力短缺。

Comments Oral Presentation in SPIE Medical Imaging 2022

Journal ref Proceedings of SPIE Medical Imaging 2022, Computer-Aided Diagnosis, Vol. 12033

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29478 2026-08-03 physics.optics physics.app-ph physics.ins-det 新提交 89%

Universal Phase Contrast in Micro-CT Systems

显微CT系统中的通用相位衬度

Grammatiki Lioliou, Alberto Astolfo, Marco Endrizzi, David Bate, Charlotte K. Hagen, Alessandro Olivo

专题命中 医学影像 :CT(title,title_cn)

AI总结 本研究指出传统显微CT系统无需可见菲涅耳条纹即可存在相位诱导分辨率增强,推导了硬件与探测器诱导相位检索的分析条件并通过实验验证,改变了对其成像机制的解读。

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25523 2026-08-03 physics.flu-dyn physics.med-ph 版本更新 87%

Trans-stenotic pressure drop estimation from PC-MRI and ultrasound imaging velocimetry using a modified Bernoulli equation

利用改进的伯努利方程估计跨狭窄压力梯度

Ali Amiri, Johan T. Padding, Selene Pirola, Willian Hogendoorn

专题命中 医学影像 :MRI(title,summary_cn)

AI总结 本文提出改进的伯努利方程以更准确估计跨狭窄压力梯度,通过引入雷诺数依赖的损失系数,实验表明该方法在生理相关流量范围内优于传统方法,且MRI成像中峰值速度更抗采样误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29253 2026-08-03 physics.med-ph cs.CV 新提交 85%

CBCT-IQ: A Publicly Available Annotated Cone-Beam CT Dataset for Image Quality Assessment and Benchmarking

CBCT-IQ:用于图像质量评估与基准测试的公开标注锥形束CT数据集

Sepideh Hatamikia, Anna Breger, Clemens Karner, Birgit Pohn, Poorya MohammadiNasab, Martin Buschmann, Stephanie Nougaret, Laura Haddad, Ali Abbasian Ardakani, Afshin Mohammadi, Paul Apfaltrer, Wolfgang Birkfellner, Alfred Pohl, Ander Biguri, Gernot Kronreif, Carola-Bibiane Schönlieb, Tess Reynolds

专题命中 医学影像 :CT(title,title_cn);medical image(abstract);分类 cs.CV

AI总结 本研究构建首个公开标注的CBCT-IQ数据集,含1764张经专家评分的CBCT图像,对26种IQA指标基准测试并提出排名方法,为CBCT IQA研究提供标准化资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09893 2026-08-03 cs.CV cs.CL 85%

Regional Attention-Enhanced Swin Transformer for Clinically Relevant Medical Image Captioning

Zubia Naz, Farhan Asghar, Muhammad Ishfaq Hussain, Yahya Hadadi, Muhammad Aasim Rafique, Wookjin Choi, Moongu Jeon

机构 * Electrical Engineering and Computer Science(电子工程与计算机科学) Gwangju Institute of Science and Technology(全州科学技术研究院) Electrical and Computer Engineering Department(电子与计算机工程系) Chonnam National University(全南国立大学) AI Convergence Department(人工智能融合部门) Department of Information Systems, CCSIT(信息系统系,CCSIT) King Faisal University(国王费萨尔大学) Thomas Jefferson University, Philadelphia(费城托马斯杰斐逊大学)

专题命中 医学影像 :medical image(title,abstract);MRI(abstract);CT(abstract);分类 cs.CV

Journal ref 2026 IEEE 5th International Conference on Computing and Machine Intelligence (ICMI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29200 2026-08-03 cs.CV 新提交 84%

UltraSAM3: A Concept-Driven Foundation Model for Universal Ultrasound Image Segmentation

UltraSAM3:一种用于通用超声图像分割的概念驱动基础模型

Bo Xu, Quanhao Zhu, Rui Lin, Boling Zhu, Chenyuan Wang, Hongfei Lin, Feng Xia, Chenhua Ji

机构 * Dalian University of Technology Affiliated Center Hospital(大连大学附属中心医院)

专题命中 医学影像 :MRI(abstract,abstract_cn);CT(abstract,abstract_cn);biomedical(abstract);分类 cs.CV

AI总结 针对现有超声分割方法的任务局限或需专家视觉提示问题,提出概念驱动的UltraSAM3模型及指令引导智能体,在多基准测试中性能优于同类模型,提升了临床交互的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29568 2026-08-03 cs.CV 新提交 83%

DynoDINO: Harnessing Dynamic Latent Information from DINO Features for Multi-Phase Medical Image Segmentation

DynoDINO:利用DINO特征中的动态潜在信息进行多阶段医学图像分割

Yu-Pu Hsu, Jen-Jee Chen, Yu-Chee Tseng

专题命中 医学影像 :medical image(title,abstract);diagnosis(abstract);分类 cs.CV

AI总结 DynoDINO是统一多阶段医学图像分割框架,通过切片级对齐、含混合注意力与自适应门控的多阶段融合模型,在三个数据集上提升了多阶段医学图像分割的边界与结构保真度。

Comments 21 pages, 8 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21736 2026-08-03 cs.CV cs.LG 版本更新 82%

Moment kernels: a simple and scalable approach for equivariance to rotations and reflections in deep convolutional networks

矩核:深度卷积网络中应对旋转与反射等变的简单可扩展方法

Siqi Fang, Zachary Schlamowitz, Andrew Bennecke, Daniel J. Tward

机构 * Department of Computational Medicine University of California, Los Angeles(计算医学系 加州大学洛杉矶分校)

专题命中 医学影像 :MRI(abstract,abstract_cn);medical image(abstract);biomedical(abstract);分类 cs.CV、cs.LG

AI总结 本文提出矩核,一种简单可扩展的正交变换等变卷积核,在生物医学图像任务中提升方向一致性,避免群卷积的方向通道扩展,适配标准CNN工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29394 2026-08-03 cs.CV cs.AI 新提交 81%

Dense Temporal Contrast Synthesis via Conditioned Latent Transport

基于条件隐式传输的密集时间对比合成

Smriti Joshi, Apostolia Tsirikoglou, Daniel M. Lang, Richard Osuala, Noah Márquez Varaa, Alejandro Guzman, Grzegorz Skorupko, Sebastian Ibarra Arregui, Lidia Garrucho, Akane Ohashi, Dimitra Ntoula, Eugen Divjak, Oğuz Lafcı, Jan C. Peeken, Julia A. Schnabel, Fredrik Strand, Oliver Diaz, Karim Lekadir

机构 * Universitat de Barcelona(巴塞罗那大学) Institució Catalana de Recerca i Estudis Avançats (ICREA)(加泰罗尼亚高级研究学院) Karolinska Institutet(卡罗林斯卡学院) Helmholtz Munich(慕尼黑亥姆霍兹中心) Technical University of Munich(慕尼黑工业大学)

专题命中 医学影像 :MRI(summary_cn,abstract);分类 cs.CV

AI总结 针对DCE-MRI依赖钆基对比剂的缺陷,本文提出条件隐式传输框架合成对比增强,提升肿瘤分割性能,70%病例的合成图像可支持等效诊疗决策,为安全成像流程提供方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28771 2026-08-03 cs.CV 新提交 81%

Do Medical Foundation Models Generalize on the African Brain?

医学基础模型能否在非洲脑部数据上实现泛化?

Kaouther Mouheb, Gonzalo Esteban Mosquera Rojas, Juancito van Leeuwen, Stefan Klein, Esther E. Bron

机构 * Erasmus MC(伊拉斯姆斯大学医学中心)

专题命中 医学影像 :MRI(summary_cn,abstract);分类 cs.CV

AI总结 该研究评估医学基础模型在非洲脑部MRI数据上的泛化性,发现其无固有偏见,性能差异多源于数据集规模,核心是非洲神经影像数据集不足。

Comments Submitted to the AFRICAI workshop (Held in conjunction with MICCAI 2026, Strasbourg, France)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28858 2026-08-03 cs.CV cs.AI 新提交 77%

A Unified Benchmark of Deep Learning Models for Multi-task 3D Brain Tumor Segmentation from Magnetic Resonance Imaging

用于磁共振成像多任务3D脑肿瘤分割的深度学习模型统一基准

Diego J. Torrejón, Luna Y. Hernández, Javier Sánchez

机构 * Centro de Tecnologías de la Imagen (CTIM)(图像技术中心(CTIM)) Instituto Universitario de Cibernética, Empresas y Sociedad (IUCES)(网络、企业与社会大学研究所(IUCES)) University of Las Palmas de Gran Canaria(拉斯帕尔马斯大加那利大学)

专题命中 医学影像 :MRI(abstract,abstract_cn);diagnosis(abstract);分类 cs.CV

AI总结 本研究构建统一基准,在相同条件下对比3D U-Net等5种深度学习模型在BraTS 2023、2024数据集上的脑肿瘤分割性能,明确了不同架构的准确率与效率权衡及适用场景。

Comments 27 pages, 16 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28687 2026-08-03 cs.LG cs.AI cs.ET 新提交 77%

Technological Advances in Detecting and Managing Cognitive Impairment in Older Adults: Trends, Challenges, and Future Directions

老年人认知障碍检测与管理的技术进展:趋势、挑战与未来方向

Mohammad Asif, Azizuddin Khan, Mohd Azam, Anurag Rajkumar Bombarde

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) T-Systems ICT India Pvt. Ltd.(德国电信系统印度信息通信技术私人有限公司)

专题命中 医学影像 :MRI(abstract,abstract_cn);diagnosis(abstract);分类 cs.LG

AI总结 本文综合老年人认知障碍检测与管理的技术进展,提出跨学科分类法等成果,指出现有模型多依赖小数据集,展望了可信多模态纵向验证系统的发展前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29182 2026-08-03 eess.IV cs.LG 新提交 73%

Few-shot Deep Learning for Phase-Amplitude Aberration Correction in Transcranial Focused Ultrasound

用于经颅聚焦超声中相位-振幅像差校正的少样本深度学习

Minju Seol, Minjee Seo, Seonaeng Cho, Kyungho Yoon

专题命中 医学影像 :CT(abstract,abstract_cn);分类 cs.LG、eess.IV

AI总结 该研究针对经颅聚焦超声像差校正的实时需求,提出少样本深度代理框架,通过预训练加少量微调实现快速适配,校正精度高且速度较传统方法提升显著。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29033 2026-08-03 cs.CV 新提交 70%

SAM+D: Parameter-Efficient Dimensional Lifting of SAM-Family Models via Depth-Routed LoRA and Depth Shifting

SAM+D:通过深度路由LoRA与深度移位实现SAM系列模型的参数高效维度提升

Yu Song, Hao Sun, Shiyu Teng, Ikuko Nishikawa, Yen-wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院)

专题命中 医学影像 :CT(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出SAM+D框架,通过DRLoRA与DSM两个轻量模块,以仅微调约2.8%(SAM)或3.7%(SAM2)参数的方式,实现2D SAM至3D、SAM2至4D的高效分割,在多个基准上取得具竞争力结果。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14300 2026-08-03 cs.LG cs.CR 版本更新 70%

Low-Cost Hard-Label Adversarial Attack with Theoretical Foundations

具有理论基础的低成本硬标签对抗攻击

Jun Liu, Leo Yu Zhang, Fengpeng Li, Isao Echizen, Jiantao Zhou

机构 * University of Macau(澳门大学) National Institute of Informatics(国家信息研究所) Griffith University(格里菲斯大学) University of Tokyo(东京大学)

专题命中 医学影像 :medical image(abstract);biomedical(abstract);分类 cs.LG

AI总结 针对硬标签黑盒攻击中忽视初始化和缺乏理论保证的问题,提出一种基于统一理论框架的零查询初始化策略和模式驱动优化算法,在低查询预算下显著提升攻击成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28992 2026-08-03 math.PR math.CO 新提交 67%

Minimal inversion of a permuton sample

排列样本的最小逆序数

Benoît Corsini

专题命中 医学影像 :CT(abstract,abstract_cn)

AI总结 该研究将逆序图最小度数定义为最小逆序,推广了相关定理,证明其可渐近缩放为n^β(β∈[0,1]),且概率呈指数衰减规律。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29337 2026-08-03 cs.CV cs.AI 新提交 57%

DualDiT: A Conditional Dual-Output Diffusion Transformer for Joint OCT Image and Segmentation Mask Generation

DualDiT:用于联合生成OCT图像与分割掩码的条件双输出扩散Transformer

Fernando García-Torres, Rocío del Amor, Sandra Morales, Álvaro Barroso, Peter Heiduschka, Björn Kemper, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-tech), Universitat Politècnica de València(瓦伦西亚理工大学以人类为中心技术大学研究所) Artikode Intelligence S.L(Artikode智能公司) Biomedical Technology Center of the Medical Faculty, University of Muenster(明斯特大学医学院生物医学技术中心) Department of Ophthalmology, University of Muenster Medical Centre(明斯特大学医学中心眼科)

专题命中 医学影像 :medical image(abstract);分类 cs.CV

AI总结 该研究提出DualDiT模型,联合生成小鼠OCT图像与分割掩码,在生成质量、下游分割性能上优于DDPM、LDM,可用于医学图像数据增强

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29266 2026-08-03 cs.CV cs.AI 新提交 57%

OsteoCAD: A Human-in-the-Loop Cloud-Edge Framework for Bone Tumor Segmentation

OsteoCAD:一种用于骨肿瘤分割的人在回路云边协同框架

Maximo Rodriguez-Herrero, Dante D. Sanchez-Gallegos, Heriberto Aguirre-Meneses, Marco Antonio Núñez-Gaona, J. L. Gonzalez-Compean, Jesus Carretero

专题命中 医学影像 :medical image(abstract);分类 cs.CV

AI总结 针对医疗机构采用AI/DL医学影像分析的资源与专业壁垒,提出OsteoCAD云边协同框架,经墨西哥骨肿瘤分割案例验证,可低门槛实现端到端DL医疗应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16891 2026-08-03 physics.app-ph 50%

Moiré patterns of space-filling curves

Henning U. Voss, Douglas J. Ballon

专题命中 医学影像 :MRI(abstract)

Comments 10 pages, 6 figures

Journal ref Physical Review Research 6, L032035 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.10650 2026-08-03 physics.med-ph physics.data-an 50%

Hypersampling of pseudo-periodic signals by analytic phase projection

Henning U. Voss

专题命中 医学影像 :MRI(abstract)

Comments Submitted to Computers in Biology and Medicine

Journal ref Computers in Biology and Medicine Volume 98, 1 July 2018, Pages 159-167

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 临床大模型 1 篇

2607.28671 2026-08-03 stat.AP cs.LG 新提交 70%

Fracture Risk Prediction in Adults Over 50 Years Old Using DXA and EHR: Comparison of Traditional and Machine Learning Models in Two Large Cohorts

利用DXA和EHR预测50岁以上成人骨折风险:两个大型队列中传统模型与机器学习模型的比较

Jiahe Qian, Hao Dai, Kunyu Yu, Hexin Dong, Xing He, Erik A. Imel, Jiang Bian, Yifan Peng, Yi Liu

专题命中 临床大模型 :diagnosis(abstract);radiology(abstract);分类 cs.LG

AI总结 该研究针对50岁以上成人,基于EHR和DXA数据构建多种生存预测模型,发现其区分度优于FRAX,为骨折风险预测提供了更优工具,但需进一步评估后才可临床应用。

Comments 5 figures, 4 tables, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 诊断辅助 15 篇

2607.27274 2026-08-03 cs.LG stat.ML 版本更新 79%

Rethinking EEG-Based Disease Diagnosis: Decoupling Instance Representation Learning from Subject-Level Supervision

基于EEG的疾病诊断再思考:将实例表示学习与受试者级监督解耦

Zhiyuan Ma, Zeyuan Li, Zhiyi Lu, Jiacheng Hao, Youlang Du, Zhen Jiang, Xinche Zhang, Yuhao Sun, Xinke Shen, Sen Song

专题命中 诊断辅助 :diagnosis(title,abstract);分类 cs.LG

AI总结 针对EEG疾病诊断中实例标签可靠性不均、受试者稀缺的问题,提出两阶段BridgeMIL框架,解耦实例表示学习与受试者级监督,在15种数据集-骨干网络设置中14种获最高准确率,总体较基线高4.28个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29306 2026-08-03 cs.NI 新提交 78%

RIGEL: Real-time Optical Anomaly Diagnosis with Stateful In-Network Inference based on Distributed On-switch GNNs

RIGEL:基于分布式交换机内GNN的有状态网络内推理的实时光异常诊断系统

Zhen Wei, Yidong Wang, Yufan Zhu, Xuefeng Yan, Binjun Tang, Xiaoliang Chen, Zuqing Zhu

专题命中 诊断辅助 :diagnosis(title,abstract)

AI总结 本研究提出RIGEL系统,通过Tofino交换机的分布式GNN实现有状态网络内推理,结合自动编码器与GraphSAGE的模型经软硬件适配后,在测试平台上实现了高精度实时光异常诊断,性能优于现有方法。

Comments 18 pages, 13 figures ,Accepted to NSDI '27. Pre-camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29530 2026-08-03 cs.LG 新提交 74%

A Neurosymbolic Approach for Explainable Early Diagnosis of Alzheimer's Disease

一种用于阿尔茨海默病可解释早期诊断的神经符号方法

Ranveer Singh, Pranuthi Tenali, Saurabh Mathur, Ameet Soni, Vaishali Phatak, Karla Lynch, Daniel Murman, Matthew Rizzo, Sriraam Natarajan

专题命中 诊断辅助 :diagnosis(title);分类 cs.LG

AI总结 该研究提出一种自动化流程,用预训练基础模型处理言语流畅性测试音频构建贝叶斯网络,以实现阿尔茨海默病的可解释早期诊断,成功恢复临床知识并识别语言标志物间新关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21544 2026-08-03 cs.CV cs.CL 74%

Vision Meets Language: A RAG-Augmented YOLOv8 Framework for Coffee Disease Diagnosis and Farmer Assistance

Semanto Mondal

机构 * University of Naples Federico II(那不勒斯费德里科二世大学)

专题命中 诊断辅助 :diagnosis(title);分类 cs.CV

Comments There are 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28906 2026-08-03 cs.CL 新提交 71%

Token-Level Diagnosis of Sycophancy in LLMs with Attribution-Guided Steering

基于归因引导调控的大语言模型谄媚行为的令牌级诊断

Hieu Nguyen, Mahammed Kamruzzaman, Anshuman Chhabra, Gene Louis Kim

专题命中 诊断辅助 :diagnosis(title)

AI总结 本研究针对大语言模型的谄媚行为,提出基于集成梯度的权威份额指数进行令牌级归因诊断,构建调控向量实现推理时无重训的谄媚缓解,使最极端案例的谄媚率从96%降至25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29621 2026-08-03 cs.LG cs.AI 新提交 57%

CENDRe: Concept Extraction with Natural Domain Representations

CENDRe:基于自然域表示的概念提取

Antonia Holzapfel, Andres Felipe Posada Moreno, Sebastian Trimpe

机构 * Institute for Data Science in Mechanical Engineering (DSME)(机械工程数据科学研究所(DSME)) RWTH Aachen University(亚琛工业大学)

专题命中 诊断辅助 :diagnosis(abstract);分类 cs.LG

AI总结 针对现有时间序列概念提取方法的局限,提出CENDRe方法,可自动确定概念数量,同时在时域和频域定位概念,在合成基准和真实轴承故障数据上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29222 2026-08-03 cs.CV 新提交 57%

Is It Time for the Renaissance of Salient Object Detection in the Era of MLLMs?

多模态大语言模型(MLLMs)时代,显著性目标检测的复兴时机已到?

Wenzhuo Zhao, Xiuzhi Li, Zhongkuan Mao, Ronghao Xian, Yao Jiang, Zhao Gao, Keren Fu, Qijun Zhao, Jian Cheng

专题命中 诊断辅助 :diagnosis(abstract);分类 cs.CV

AI总结 该研究针对MLLMs时代SOD的能力不匹配问题,提出无训练框架FOCUS,在13类SOD基准上超越SOTA方法,推动SOD从特定任务监督转向零样本前景组织。

Comments 10 pages, 4 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28993 2026-08-03 cs.RO cs.CV 新提交 57%

ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

ST-WAM:面向视觉分布偏移下鲁棒操作的语义-时间世界动作模型

Mingxin Wang, Bin Hu, Bin Qian, Kaitao Jiang, Haoning Wu, Feng Yan, Bowen Jing, Ruiyang Hao, Enyi Wang, Kangning Niu, Yandan Yang, Mu Xu, Yan Wang, Houde Liu, Tianlun Li

专题命中 诊断辅助 :diagnosis(abstract);分类 cs.CV

AI总结 该研究针对视觉分布偏移下机器人操作的鲁棒性问题,提出ST-WAM模型,采用DINOv3等技术,在多个基准测试中取得优异性能,大幅提升了偏移场景下的零样本操作表现。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏