arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 141 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 141 篇

2607.19532 2026-07-23 cs.LG cs.AI 新提交 70%

Trustworthy Privacy-Preserving Multimodal Federated Learning for Personalised Breast Cancer Prediction

用于个性化乳腺癌预测的可信隐私保护多模态联邦学习

Ruth Amey, Muhammad Arifur Rahman, Taha Osman, Nicholas Shopland, Andy Burton, Mufti Mahmud, David J. Brown

机构 * NTU(南洋理工大学)

专题命中 医学数据与评测 :MRI(abstract,abstract_cn);分类 cs.LG

AI总结 研究探讨联邦学习能否兼顾四个关键支柱,支持乳腺癌患者肿瘤进展预测模型开发。通过多模态数据评估联邦学习框架,与集中式模型比较性能,并研究相关策略,结果助于理解隐私保护多模态预测建模可行性及支持未来应用。

Comments 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16300 2026-07-21 cs.CV 新提交 70%

FedDP-PALD: A Privacy-Preserving Federated Latent Diffusion Framework with Prototype Aggregation for Medical Data Synthesis

FedDP-PALD:一种用于医学数据合成的具有原型聚合的隐私保护联邦潜在扩散框架

Md. Sajeebul Islam Sk., Khan Enaet Hossain, Md. Mehedi Hasan Shawon

机构 * BRAC University(BRAC大学) York University(约克大学) University of Maryland(马里兰大学)

专题命中 医学数据与评测 :medical image(abstract);diagnosis(abstract);分类 cs.CV

AI总结 针对医学数据合成中隐私保护及合成数据预测结构问题,提出FedDP-PALD框架,通过带掩码的门控多头注意力联合处理多模态数据,引入DP-PMA维持差分隐私,实验表明该框架能生成隐私合成表示,保持决策性能并抵抗成员推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24302 2026-06-24 cs.CV cs.DL 新提交 70%

TrOCR for Medieval HTR: A Systematic Ablation Study with Cross-Dataset Validation

TrOCR 用于中世纪手写文本识别:基于跨数据集验证的系统消融研究

Sachin Sharma, Michele Flammini, Federico Simonetta

机构 * GSSI – Gran Sasso Science Institute(格兰萨索科学研究所)

专题命中 医学数据与评测 :CT(abstract,abstract_cn);分类 cs.CV

AI总结 研究通过对比度归一化、数据增强和层冻结三种可控微调策略,提升TrOCR在中世纪手稿上的识别精度,在13世纪意大利手稿上达到8.03%字符错误率,并验证了跨数据集的鲁棒性。

Comments Accepted at Document Analysis Systems Workshop 2026 (ICDAR Satellite event)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15436 2026-06-16 cs.LG cs.AI eess.AS 新提交 70%

Beyond Classification: A Cough Regression Benchmark for Respiratory Acoustic Foundation Models

超越分类:呼吸声学基础模型的咳嗽回归基准

Mayur Sanap, Prasanna Desikan, Edgar Lobaton

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 医学数据与评测 :CT(abstract,abstract_cn);分类 cs.LG

AI总结 提出多模型多目标咳嗽回归基准,评估五个基础模型在六个目标上的表现,发现MLP-small优于线性探测,揭示数据集大小与头部容量的权衡,并展示跨数据集迁移的不对称性。

Comments Accepted at the ICML 2026 Workshop on Structured Data for Health

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00640 2026-08-04 cs.CL 新提交 67%

TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs

TreeProbe:面向大型语言模型文化偏见的藏医药基准测试集

Jin Zhang, Linyu Li, Weili Jiang, Yuqing Cai, Yutong Liu, Guanquecairang, Yongbin Yu, Jingye Cai, Nyima Tashi, Gadeng Luosang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tibet University(西藏大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学)

专题命中 医学数据与评测 :medical AI(abstract);biomedical(abstract)

AI总结 本研究针对大型语言模型的藏医药文化偏见问题,构建了首个基于藏医药“医学之树”框架的基准测试集TreeProbe,发现现有模型存在系统性本体漂移,为公平医疗AI开发提供了诊断基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26333 2026-07-30 eess.IV cs.CV cs.LG 新提交 67%

Rethinking Clinical Relevance in Chest X-ray Machine Learning: How Evaluation References Define Performance

重新思考胸部X射线机器学习中的临床相关性:评估参考如何定义性能

Panagiotis Fytas, Ian Selby, Clemens Karner, Judith Babar, Simon Baker, Jake Beckford, Timothy J. Sadler, Shahab Shahipasand, Arthikkaa Thavakumar, John Li Chen, Alex Sawer, Michael Roberts, Jonathan Weir-McCall, J. H. F. Rudd, Carola-Bibiane Schönlieb, Anna Korhonen, Anna Breger

专题命中 医学数据与评测 :pathology(abstract);分类 cs.CV、cs.LG、eess.IV

AI总结 该研究针对胸部X射线机器学习,探究评估参考选择对模型性能与排名的影响,发现常用指标与临床判断一致性差,强调需将评估参考选择作为临床有效性的核心部分。

Comments 67 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20037 2026-07-23 physics.med-ph 新提交 67%

COBRA2026: a large-scale multicenter pelvic cone-beam computed tomography projection dataset

COBRA2026:一个大规模多中心盆腔锥束计算机断层扫描投影数据集

Adrian Thummerer, Simon Rit, Florian Kamp, Matteo Maspero, Martjin P. W. Intven, Thomas G. Boné, Christopher Kurz, Guillaume Landry, Thomas Baudier, Mustafa Kadhim, Julius Arnold, Michael Rauter, Barbara Knäusl, Lukas Zimmermann

专题命中 医学数据与评测 :CT(abstract,abstract_cn)

AI总结 COBRA2026数据集用于开发和评估放疗CBCT相关方法,含欧洲六个中心867名患者数据,经处理后分为训练、验证和测试集,支持多种研究,以特定许可发布并附代码,构成重建挑战基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24145 2026-06-24 cs.AI 新提交 67%

T2D-Bench: Evidence-Gated Evaluation of LLM Outputs for Type 2 Diabetes Using a Multi-Layer Clinical-Lifestyle Knowledge Graph

T2D-Bench:基于多层临床-生活方式知识图谱的2型糖尿病LLM输出证据门控评估

Saba A. Farahani, Hung Cao, Ramesh Jain, Amir M. Rahmani

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 医学数据与评测 :diagnosis(abstract);biomedical(abstract)

AI总结 提出T2D-Bench基准,通过多层知识图谱和证据门控机制,检测LLM输出中未满足指南约束的临床遗漏,并在2型糖尿病诊断、用药安全等场景中实现可测量纠正。

Comments 7 pages, 2 figures, 2 tables. Accepted as a poster at AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10255 2026-06-10 eess.IV cs.CV cs.DL cs.LG physics.bio-ph 新提交 67%

POPSICLE: Benchmark Datasets for Segmentation and Localization in CryoET

POPSICLE: 用于冷冻电镜断层扫描中分割和定位的基准数据集

Jonathan Schwartz, Utz Heinrich Ermel, C. Braxton Owens, Zhuowen Zhao, Ariana Peck, Gus L. W. Hart, Grant J. Jensen, Bridget Carragher, Dari Kimanius

机构 * Biohub Brigham Young University

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.CV、cs.LG、eess.IV

AI总结 提出POPSICLE基准套件,基于CryoET数据门户构建,涵盖真核和原核系统、纯化与原位样本,支持体素分割和稀疏定位任务,旨在解决冷冻电镜断层扫描中缺乏标准化基准的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22743 2026-07-28 cs.LG cs.AI cs.CV 新提交 62%

QFedPolyp: A Communication- and Inference-Efficient Federated Learning Framework for Polyp Segmentation

QFedPolyp:一种用于息肉分割的通信和推理高效的联邦学习框架

Madan Baduwal, Priyanka Paudel

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 研究针对息肉分割中集中式学习需共享敏感数据、联邦学习通信成本高的问题,提出QFedPolyp框架,结合量化感知训练与低精度模型通信,经实验验证其能降低通信开销、加快推理速度,适合临床实时部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19444 2026-07-23 cs.LG cs.SY eess.SP eess.SY 新提交 62%

Marine Engine Fault Dataset: Open-Access Data under Controlled Reference and Fault Scenario Conditions

船舶发动机故障数据集:在受控参考和故障场景条件下的开放获取数据

Ahmad BahooToroody, Oleksiy Bondarenko, Mohammad Mahdi Abaei, Niki Yoichi, Enrico Zio

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG、eess.SP

AI总结 该研究提出船舶发动机故障数据集,通过在实际船舶发动机平台结合受控故障实现、多负载运行和系统级测量获取数据,包括多传感器时间序列等,为海上机械相关研究提供记录良好的基准。

Comments submitted to a journal and currently is under review, 34 pages, 13 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08978 2026-07-13 cs.LG eess.SP 新提交 62%

Federated Low-Rank Koopman Learning for Multivariate Time-Series Anomaly Detection in IoT Systems

物联网系统中用于多变量时间序列异常检测的联邦低秩库普曼学习

Tung-Anh Nguyen, Van-Phuc Bui, Anh Tuyen Le, Kim Hue Ta, Minh Thuy Le, J. Andrew Zhang, Xiaojing Huang

机构 * University of Technology Sydney(悉尼科技大学) FPT University(越南邮电大学) Hanoi University of Science and Technology(河内科技大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG、eess.SP

AI总结 研究物联网系统多变量时间序列异常检测问题,提出FedKAD框架,通过轻量级滑动窗口库普曼表示学习正常时间动态,经联邦训练优化共享表示,实验表明其检测性能良好且适用于资源受限的边缘设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09882 2026-06-10 cs.CV cs.LG 新提交 62%

WHU-Infra3D: A Full-stack Multi-modal Dataset and Benchmark for 3D Roadside Infrastructure Inventory

WHU-Infra3D:面向3D路边基础设施清单的全栈多模态数据集与基准

Chong Liu, Luxuan Fu, Xuyu Feng, Zhen Dong, Bisheng Yang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘遥感国家重点实验室) Wuhan University(武汉大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 提出WHU-Infra3D多模态基准数据集,覆盖三城市53.8公里,融合全景图像与LiDAR点云,提供2D-3D实例关联和跨帧跟踪,支持基础设施状态诊断与属性识别,填补自动化维护数据集空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24115 2026-06-24 cs.CV cs.AI 新提交 61%

A Benchmark for Hallucination Detection in VLMs for Gastrointestinal Endoscopy

胃肠内窥镜中视觉语言模型幻觉检测的基准测试

Aminu Lawal, Niyoj Oli, Sachin Acharya, Prashnna Gyawali, Maria Carmen Romano, Binod Bhattarai

机构 * University of Aberdeen(阿伯丁大学) Nepal Applied Mathematics and Informatics Institute for Research(尼泊尔应用数学与信息学研究所) West Virginia University(西弗吉尼亚大学)

专题命中 医学数据与评测 :radiology(abstract);分类 cs.CV;medical image(comments)

AI总结 针对胃肠内窥镜领域,在Gut-VLM数据集上基准测试九种幻觉检测方法,发现白盒方法ReXTrust在所有五个视觉语言模型上AUC最高,平均领先19.5点。

Comments Accepted at the Medical Image Understanding and Analysis (MIUA) 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05196 2026-08-07 cs.LG q-bio.QM 新提交 60%

MS-MLB: An Open Machine Learning Benchmark for Blood-Based MS Classification

MS-MLB:一个用于血液基质-MS分类的开源机器学习基准

Adam Simson, Ankush Dutta, Quang Bui

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG、q-bio

AI总结 该研究提出首个开源MS分类基准MS-MLB,基于GSE17048全血RNA数据,用控制数据泄露的流程评估算法,梯度提升在留存集表现最优,内置外部模型提交路径,仅用于研究比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23744 2026-06-24 q-bio.QM cs.CV 新提交 60%

Performance and Interpretability of Convolutional, Transformer, and Hybrid Deep Learning Models in Colorectal Histology Classification

卷积、Transformer和混合深度学习模型在结直肠组织学分类中的性能与可解释性

Reza Bozorgpour

机构 * College of Engineering & Applied Science, Department of Biomedical Engineering, University of Wisconsin-Milwaukee(工程与应用科学学院生物医学工程系,威斯康星大学密尔沃基分校)

专题命中 医学数据与评测 :pathology(abstract);分类 cs.CV、q-bio

AI总结 本研究系统比较了12种预训练CNN、Transformer和混合架构在结直肠组织病理学分类中的性能,发现EVA-02和ViT-B/16表现最佳,而现代CNN在准确率与模型复杂度间取得良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13911 2026-08-17 cs.LG 新提交 57%

MedMix: Specialization-Consistent Federated Sparse MoEs under Modality Heterogeneity

MedMix:模态异质性下的专业化一致联邦稀疏混合专家模型

Adiba Orzikulova, Dong Min Kim, Jaehong Yoon, Sung-Ju Lee

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡南洋理工大学)

专题命中 医学数据与评测 :medical AI(abstract);分类 cs.LG

AI总结 针对联邦多模态医疗AI的客户端与样本级模态异质性问题,提出MedMix框架,通过模态上下文感知路由、共识引导路由对齐与客户端自适应专家聚合,在多模态医疗数据集上取得最优平均F1值,严重异质性下提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13914 2026-08-17 cs.LG cs.AI cs.DC cs.ET quant-ph 新提交 57%

Hybrid Quantum-inspired Kolmogorov-Arnold Networks for Privacy-Aware Federated Biosignal Learning

面向隐私感知的联邦生物信号学习的混合量子启发式柯尔莫哥洛夫-阿诺尔德网络

Chun-Hua Lin, Samuel Yen-Chi Chen, Yu-Chao Hsu, Kuo-Chung Peng, Jiun-Cheng Jiang, Chi-Sheng Chen, Tai-Yue Li, Nan-Yow Chen, En-Jui Kuo, Hsi-Sheng Goan

机构 * National Taiwan University(台湾大学) National Center for High-Performance Computing(国家高速计算机中心) National Institutes of Applied Research(应用研究院) Brookhaven National Laboratory(布鲁克海文国家实验室) Korea Advanced Institute of Science and Technology(韩国科学技术院) Beth Israel Deaconess Medical Center(贝斯以色列女执事医疗中心) Harvard University(哈佛大学) National Yang Ming Chiao Tung University(国立阳明交通大学) National Center for Theoretical Sciences(国家理论科学中心)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.LG

AI总结 该研究针对联邦生物信号学习的隐私与效率挑战,提出混合量子启发式柯尔莫哥洛夫-阿诺尔德网络(HQKAN),在两类心电数据集上较MLP实现参数与通信成本降低,且分类性能更优。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13555 2026-08-14 cs.RO cs.AI cs.CV 新提交 57%

HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark

HumanTracker:面向全面且与人类对齐的运动跟踪基准

Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan, Yintianrun Zhang, Xuchuan Chen, Sikai Liang, Zekai Li, Chenghuai Lin, Xinqiang Yu, Wenyao Zhang, He Wang, Li Yi

机构 * Nankai University(南开大学) Tsinghua University(清华大学) Galbot Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 针对人形运动跟踪评估与人类感知不符、基准多样性不足的问题,提出HumanTracker基准及偏好对齐指标HumanScore,该指标可更好预测人类偏好并揭示运动学指标遗漏的接触与稳定性故障。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13425 2026-08-14 cs.CL eess.AS eess.SP 新提交 57%

Motor, Cognitive, or Corpus? What Survives Cross-Lingual Transfer in Speech-Based Parkinsons Disease Detection

运动、认知还是语料?基于语音的帕金森病检测中跨语言迁移能保留什么

Serli Kopar, Sam Gijsen, Abner Hernandez, Paula Andrea Perez-Toro, Kerstin Ritter

机构 * Hertie Institute for AI in Brain Health, University of Tübingen(蒂宾根大学赫蒂脑健康人工智能研究所) Tübingen AI Center, University of Tübingen(蒂宾根大学蒂宾根人工智能中心) Charité–Universitätsmedizin(夏里特医学院) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 医学数据与评测 :pathology(abstract);分类 eess.SP

AI总结 该研究通过对9个SSL语音骨干的分层分析,探究跨语言迁移中保留的语音特征类型,发现层选择依赖语料库且迁移信号缺乏病理特异性,明确了基于语音的PD检测模型的关键局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12138 2026-08-13 cs.CL cs.AI cs.HC cs.IR cs.LG 新提交 57%

A corpus-specific clinical RAG system matches or outperforms newer frontier LLMs on HealthBench

针对特定语料库的临床检索增强生成(RAG)系统在HealthBench上的表现与较新的前沿大语言模型相当或更优

Praveen Reddy, Charuta Mandke, Suvrankar Datta, Sarah Khan, Siddharth Reddy Anthireddy, Shitij Arora, Vishal Singh

专题命中 医学数据与评测 :clinical AI(abstract);分类 cs.LG

AI总结 本文评估专为中低收入环境构建的临床RAG系统VITA,其在HealthBench基准测试中与前沿LLM表现相当或更优,语料库特异性可提升模型落地性但会降低沟通流畅度。

Comments 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06112 2026-08-07 cs.AI cs.CL cs.LG cs.MA 新提交 57%

From Siloed Algorithms to Compliance-First Agentic Platforms: A Multi-Layered Architecture for Hospital AI Systems

从孤立算法到合规优先的智能体平台:面向医院AI系统的多层架构

Manideep Dhar, Ritwik Singh, Sharat Chandra Kumar Manikonda

专题命中 医学数据与评测 :healthcare AI(abstract);分类 cs.LG

AI总结 针对医院AI部署孤立、规模化难的问题,提出含智能体编排、合规策略、隐私保护数据层的多层架构,通过原型验证可减少任务耗时与文档工作量,为医院AI平台建设提供实用蓝图。

Comments Peer-reviewed published article

Journal ref IJISRT, 11-2026(5), IJISRT26MAY1651

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02589 2026-08-04 cs.CV 新提交 57%

CAPEval: A Decoupled Caption Evaluation across Understanding and Generation

CAPEval:跨理解与生成的解耦式标题评估

Zhipeng Liu, Haochen Wang, Zhaoxiang Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 本研究提出解耦式标题评估基准CAPEval,将标题质量分为覆盖度与精确度,发现二者分别对应理解与生成任务性能,为标题生成器的选择优化提供指导。

Comments 21 pages, 8 figures. Code and dataset will be available at https://liuzhipenggg.github.io/CAPEval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29055 2026-08-03 cs.LG cs.AI cs.MA 新提交 57%

Autonomous Repair for Multi-Agent Systems via Monte-Carlo Tree Search

基于蒙特卡洛树搜索的多智能体系统自主修复

Hanxiao Lu, Tianyi Zhang

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 该研究提出基于蒙特卡洛树搜索的MARS框架,将多智能体系统修复建模为搜索过程,结合分类学增强评估与诊断引导扩展,在StateMAS基准上性能优于现有方法,且令牌消耗相当。

Comments Under conference review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26521 2026-07-30 cs.LG 新提交 57%

From Unsupervised Subgroups to Hypothetical State-Intervention Policies: An Evaluation of Selected Subgrouping Methods in Observational Health Data

从无监督亚组到假设状态干预策略:观察性健康数据中选定亚组方法的评估

Vasundhara Acharya, Bulent Yener

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.LG

AI总结 该研究提出结合多模块的框架,对比多种亚组方法在两个数据集上的假设状态干预策略效用,发现结果依赖假设,无统计显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25348 2026-07-29 cs.LG cs.AI 新提交 57%

Explainable AI for Chronic Kidney Disease Prediction Using Simulated Federated Learning

使用模拟联邦学习的慢性肾病预测的可解释人工智能

Md Zahid Hasan Ontor, Md Al Amin, Anik Dev Nath, Bikash Kumar Paul

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 该研究针对慢性肾病预测问题,运用带投票分类器的联邦学习,结合随机森林等算法为全局服务器选最佳模型,用GridSearchCV优化客户端模型性能,还引入可解释人工智能技术,其全局模型平均准确率达99%,助力早期CKD诊断和数据驱动医疗。

Comments 13 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22165 2026-07-27 cs.DB cs.AI cs.CL cs.LG 新提交 57%

DBA-Bench: A Production-Fidelity Benchmark for LLM-Based Database Operations Agents

DBA-Bench:基于大语言模型的数据库操作代理的生产保真度基准测试

Junming Chen, Junyang Jiang, Xu Chen, Zibo Liang, Kai Zheng

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 研究基于大语言模型的数据库操作代理评估问题,提出DBA-Bench基准测试,通过生产保真度等解决评估与生产操作差距,含多场景和难度标签,评估多基线组,揭示安全端到端修复困难。

Comments 14 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21582 2026-07-24 cs.RO cs.CV 新提交 57%

Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation

战略扩展:通过偏差感知评估和数据收集学习机器人操作中的组合泛化

Yu Qi, Zhang Ye, Xinyi Xu, Yuxuan Lu, Amitoj Sandhu, Boce Hu, Haojie Huang, Jonathan Tremblay, Lawson L. S. Wong

机构 * Northeastern University(东北大学) NVIDIA(英伟达)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 研究机器人操作中组合泛化问题,通过引入诊断框架量化指令因素偏差,提出偏差感知数据收集策略,能定位预训练策略捷径问题,实现更高效可泛化的策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21057 2026-07-24 cs.CV 新提交 57%

Achieving Text-based Person Retrieval with Any Granularity

实现任意粒度的基于文本的行人检索

Jialong Zuo, Hanyu Zhou, Dongyue Wu, Yongtai Deng, Mengdan Tan, Nong Sang, Changxin Gao, Xiang Bai

机构 * National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院多光谱信息智能处理技术国家重点实验室) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 该研究针对基于文本的行人检索中查询粒度不确定问题提出新范式,构建多粒度数据集和评估基准,提出CMAM框架,通过多种策略实现粒度感知检索,实验证明其性能优于现有方法,为行人检索系统奠定基础。

Comments TPAMI-2026 Accepted Paper

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026, pp. 1-18

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15687 2026-07-20 cs.LG 新提交 57%

Toward Federated Multimodal Graph Foundation Models: A Topology-Aware Multimodal Alignment Framework

迈向联邦多模态图基础模型:一种拓扑感知多模态对齐框架

Xunkai Li, Guohao Fu, Yuming Ai, Zhengyu Wu, Hongchao Qin, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.LG

AI总结 研究针对多模态属性图分散在不同隐私受限孤岛的问题,提出FedGAMMA框架,将联邦多模态图基础学习视为两阶段语义结构对齐问题,经实验验证该框架在下游任务中表现出色,超越诸多基线,在少样本学习场景下也有优势。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏