Performance Evaluation of Transcriptomics Data Normalization for Survival Risk Prediction
专题命中 医学数据与评测 :biomedical(abstract);分类 q-bio
科学与医疗
医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。
专题命中 医学数据与评测 :biomedical(abstract);分类 q-bio
专题命中 医学数据与评测 :MRI(abstract);分类 q-bio
专题命中 医学数据与评测 :pathology(abstract);分类 q-bio
专题命中 医学数据与评测 :medical image(comments,journal_ref);分类 cs.CV、eess.IV
Comments Accepted to Medical Image Analysis
Journal ref Medical Image Analysis (2020), 64, 101741
专题命中 医学数据与评测 :radiology(comments,journal_ref);分类 cs.CV、eess.IV
Comments accepted in Radiology Cardiothoracic Imaging
Journal ref Radiology: Cardiothoracic Imaging 2020; 2(1):e190032
专题命中 医学数据与评测 :MRI(abstract);分类 q-bio
专题命中 医学数据与评测 :MRI(abstract);分类 q-bio
Comments 8 pages, 7 figures; Proceedings of the 2017 IEEE International Conference on Bioinformatics and Biomedicine; Keynote to The International Workshop on High Throughput Computing in Bioinformatics and Biomedicine using the Open Science Grid
专题命中 医学数据与评测 :diagnosis(abstract);分类 q-bio
Comments 8 pages, 5 figures, 4 tables
专题命中 医学数据与评测 :diagnosis(abstract);分类 q-bio
Comments 12 pages with diagrams, tables, figures and chats
专题命中 医学数据与评测 :biomedical(abstract);分类 q-bio
Comments To be presented at RECOMB 2016
专题命中 医学数据与评测 :MRI(abstract);分类 q-bio
Comments Master's thesis, July 2013
专题命中 医学数据与评测 :biomedical(abstract);分类 q-bio
Comments This version is superseded by arXiv:1306.1264
专题命中 医学数据与评测 :biomedical(abstract);分类 q-bio
专题命中 医学数据与评测 :CT(abstract);分类 q-bio
Comments Accepted by the Journal of Chemistry A
Journal ref Journal of Physical Chemistry A, 115, 1280 (2011)
专题命中 医学数据与评测 :分类 cs.LG、q-bio、eess.IV;biomedical(journal_ref)
Comments 5 pages, 4 figures, 1 table
Journal ref IEEE 17th International Symposium on Biomedical Imaging (ISBI) 2020
DeepInsight II:从基准测试到机器人的单条轨迹
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 DeepInsight II量化具身层,复现基准结果、通过MotionBench实现仿真到真实机器人的原生迁移,并扩展轨迹定位至带修复动作的交接标签,提供从基准到机器人的经验连续性。
LongRCA Bench:诊断长 horizon 智能体失败中的责任角色与根本原因
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) ; Chongqing University(重庆大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Singapore Management University(新加坡管理大学) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ; Tsinghua University(清华大学)
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 LongRCA Bench 是含1140条失败轨迹的长 horizon 智能体失败诊断基准,本文提出无需训练的 RCTA 方法,在责任角色归因和根本步骤定位上优于现有基线,表明需将二者作为独立评估目标。
Comments 17 pages, 5 figures. Yunfei Zhang and Boyu Feng contributed equally. Changhua Pei is the corresponding author
TRACE-BN:将孟加拉语-英语辅导行为迁移至参数量小于10亿的离线语言模型
机构 * North South University(北南大学)
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 本文提出TRACE-BN数据集,将其辅导行为通过LoRA迁移至Qwen3-0.6B模型,在资源受限离线部署下,相关指标及多维度辅导效果均获显著提升。
当智能体执行失败时:从遥测数据中检测和定位运行时故障
机构 * University of Toronto(多伦多大学)
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 该研究提出 AGENTCHAOSBENCH 基准,在智能体系统遥测数据中检测定位运行时故障,实验显示现有 LLM 基线对该任务的解决效果仍远未达标。
信息满意度:面向读者的摘要评估轴
机构 * St. Edward’s University(圣爱德华大学) ; Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 医学数据与评测 :biomedical(abstract)
AI总结 本研究提出以读者的信息满意度作为摘要评估的面向读者的轴,发现主流摘要指标无法衡量该满意度,且与人工判断一致性差。
AnchorSIPS:用于证据支持的精神病风险症状测量的合成数据集与评估资源
机构 * Monash University(莫纳什大学) ; Orygen(奥瑞金) ; The University of Melbourne(墨尔本大学) ; Swinburne University of Technology(斯威本科技大学) ; University of Liverpool(利物浦大学) ; Khalifa University(哈利法大学)
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 本文提出AnchorSIPS合成数据集,基于Mini-SIPS访谈构建含1万次结构化精神病风险访谈,解决临床数据隐私问题,用于研究证据提取等,实验发现LLM基线存在细节提取不足问题。
一种联邦学习和参数高效的大型语言模型在医学中的训练框架
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 本文提出Fed-MedLoRA框架,通过低秩适配器参数实现医学LLM的联邦学习,提升跨机构异质性下的模型收敛性和泛化能力。
Comments 41 pages, 11 tables, 3 figures; Just accepted
AgenticTwin:集成数字孪生的智能体大语言模型异常检测框架
机构 * School of Computing, Wichita State University(威奇托州立大学计算机学院) ; Auburn University(奥本大学)
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 本研究提出AgenticTwin框架,整合LLM推理与数字孪生异常检测管道,构建基准评估管道并验证轻量级开源LLM部署可行性,可提升异常诊断、检索及缓解质量。
可本地部署的小型语言模型用于急诊科决策支持:微调策略的系统基准测试
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 该研究针对急诊科决策支持的隐私风险,通过基准测试发现经LoRA微调的开源小型语言模型在分诊和转诊任务上优于商业模型,可本地部署且具备临床竞争力。
Comments Accepted to AMIA 2026 Annual Symposium
JunoBench: 一个Python机器学习Jupyter笔记本崩溃的基准数据集
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 JunoBench通过提供真实崩溃案例、修复方案和详细标注,促进Jupyter笔记本中机器学习bug检测、定位、诊断与修复的研究。
Journal ref Proceedings of the 3rd ACM International Conference on AI-Powered Software (AIware), pp 406-413, July 2026
当安全失败之前:在推理链中基准测试有害行为检测
机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 本文提出HarmThoughts基准,用于评估推理链中逐步的安全性。通过分析56931个句子,识别有害行为传播模式,发现现有检测器在细粒度行为检测上存在不足,揭示了过程级安全监控的关键缺口。
Comments Accepted at COLM 2026 (Main Track)
SurroPilot:用于临床试验中异质性替代终点评估的大语言模型辅助平台
专题命中 医学数据与评测 :biomedical(abstract)
AI总结 SurroPilot是集成LLM与异质性中介框架的辅助平台,可通过自然语言交互完成临床试验异质性替代终点评估全流程,降低了相关方法的应用技术门槛。
Comments Submitted for journal
面向编码智能体的需求澄清、规划与代码生成的统一问题解决基准
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 该研究推出SWE-RPG编码智能体基准,评估发现主流编码智能体在该基准上平均解决率仅31.5%,隐性需求恢复是主要瓶颈,为改进编码智能体提供了方向。
Comments 9 pages
CAP:用于评估具备复杂动作与感知能力的跨站点浏览器智能体的可扩展基准
机构 * Macau University of Science and Technology(澳门科技大学) ; Tsinghua University(清华大学) ; Southeast University(东南大学) ; FellouAI ; ARGUS Lab(ARGUS实验室) ; The University of Edinburgh(爱丁堡大学)
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 研究人员推出可扩展基准CAP,通过分解-重组流程构建420项跨站点网页任务,实验发现当前浏览器智能体在感知密集型交互上存在明显瓶颈,与真实需求差距较大。
Comments Accepted to COLM 2026. Project page: https://warriorxu0302.github.io/CAP-Bench/
前端本体论工具可用性的初步评估
专题命中 医学数据与评测 :biomedical(abstract)
AI总结 本研究针对生物医学领域,调查38名本体论研究者,用SUS量表评估15款前端本体论工具可用性,发现Protege和WebProtege可用性中等,熟悉程度影响得分,指出工具存在可用性差距。
Comments 5 pages, 1 figure