arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 1717 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 147 篇

2608.12138 2026-08-13 cs.CL cs.AI cs.HC cs.IR cs.LG 新提交 57%

A corpus-specific clinical RAG system matches or outperforms newer frontier LLMs on HealthBench

针对特定语料库的临床检索增强生成(RAG)系统在HealthBench上的表现与较新的前沿大语言模型相当或更优

Praveen Reddy, Charuta Mandke, Suvrankar Datta, Sarah Khan, Siddharth Reddy Anthireddy, Shitij Arora, Vishal Singh

专题命中 医学数据与评测 :clinical AI(abstract);分类 cs.LG

AI总结 本文评估专为中低收入环境构建的临床RAG系统VITA,其在HealthBench基准测试中与前沿LLM表现相当或更优,语料库特异性可提升模型落地性但会降低沟通流畅度。

Comments 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06112 2026-08-07 cs.AI cs.CL cs.LG cs.MA 新提交 57%

From Siloed Algorithms to Compliance-First Agentic Platforms: A Multi-Layered Architecture for Hospital AI Systems

从孤立算法到合规优先的智能体平台:面向医院AI系统的多层架构

Manideep Dhar, Ritwik Singh, Sharat Chandra Kumar Manikonda

专题命中 医学数据与评测 :healthcare AI(abstract);分类 cs.LG

AI总结 针对医院AI部署孤立、规模化难的问题,提出含智能体编排、合规策略、隐私保护数据层的多层架构,通过原型验证可减少任务耗时与文档工作量,为医院AI平台建设提供实用蓝图。

Comments Peer-reviewed published article

Journal ref IJISRT, 11-2026(5), IJISRT26MAY1651

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02589 2026-08-04 cs.CV 新提交 57%

CAPEval: A Decoupled Caption Evaluation across Understanding and Generation

CAPEval:跨理解与生成的解耦式标题评估

Zhipeng Liu, Haochen Wang, Zhaoxiang Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 本研究提出解耦式标题评估基准CAPEval,将标题质量分为覆盖度与精确度,发现二者分别对应理解与生成任务性能,为标题生成器的选择优化提供指导。

Comments 21 pages, 8 figures. Code and dataset will be available at https://liuzhipenggg.github.io/CAPEval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29055 2026-08-03 cs.LG cs.AI cs.MA 新提交 57%

Autonomous Repair for Multi-Agent Systems via Monte-Carlo Tree Search

基于蒙特卡洛树搜索的多智能体系统自主修复

Hanxiao Lu, Tianyi Zhang

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 该研究提出基于蒙特卡洛树搜索的MARS框架,将多智能体系统修复建模为搜索过程,结合分类学增强评估与诊断引导扩展,在StateMAS基准上性能优于现有方法,且令牌消耗相当。

Comments Under conference review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26521 2026-07-30 cs.LG 新提交 57%

From Unsupervised Subgroups to Hypothetical State-Intervention Policies: An Evaluation of Selected Subgrouping Methods in Observational Health Data

从无监督亚组到假设状态干预策略:观察性健康数据中选定亚组方法的评估

Vasundhara Acharya, Bulent Yener

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.LG

AI总结 该研究提出结合多模块的框架,对比多种亚组方法在两个数据集上的假设状态干预策略效用,发现结果依赖假设,无统计显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25348 2026-07-29 cs.LG cs.AI 新提交 57%

Explainable AI for Chronic Kidney Disease Prediction Using Simulated Federated Learning

使用模拟联邦学习的慢性肾病预测的可解释人工智能

Md Zahid Hasan Ontor, Md Al Amin, Anik Dev Nath, Bikash Kumar Paul

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 该研究针对慢性肾病预测问题,运用带投票分类器的联邦学习,结合随机森林等算法为全局服务器选最佳模型,用GridSearchCV优化客户端模型性能,还引入可解释人工智能技术,其全局模型平均准确率达99%,助力早期CKD诊断和数据驱动医疗。

Comments 13 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22165 2026-07-27 cs.DB cs.AI cs.CL cs.LG 新提交 57%

DBA-Bench: A Production-Fidelity Benchmark for LLM-Based Database Operations Agents

DBA-Bench:基于大语言模型的数据库操作代理的生产保真度基准测试

Junming Chen, Junyang Jiang, Xu Chen, Zibo Liang, Kai Zheng

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 研究基于大语言模型的数据库操作代理评估问题,提出DBA-Bench基准测试,通过生产保真度等解决评估与生产操作差距,含多场景和难度标签,评估多基线组,揭示安全端到端修复困难。

Comments 14 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21582 2026-07-24 cs.RO cs.CV 新提交 57%

Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation

战略扩展:通过偏差感知评估和数据收集学习机器人操作中的组合泛化

Yu Qi, Zhang Ye, Xinyi Xu, Yuxuan Lu, Amitoj Sandhu, Boce Hu, Haojie Huang, Jonathan Tremblay, Lawson L. S. Wong

机构 * Northeastern University(东北大学) NVIDIA(英伟达)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 研究机器人操作中组合泛化问题,通过引入诊断框架量化指令因素偏差,提出偏差感知数据收集策略,能定位预训练策略捷径问题,实现更高效可泛化的策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21057 2026-07-24 cs.CV 新提交 57%

Achieving Text-based Person Retrieval with Any Granularity

实现任意粒度的基于文本的行人检索

Jialong Zuo, Hanyu Zhou, Dongyue Wu, Yongtai Deng, Mengdan Tan, Nong Sang, Changxin Gao, Xiang Bai

机构 * National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院多光谱信息智能处理技术国家重点实验室) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 该研究针对基于文本的行人检索中查询粒度不确定问题提出新范式,构建多粒度数据集和评估基准,提出CMAM框架,通过多种策略实现粒度感知检索,实验证明其性能优于现有方法,为行人检索系统奠定基础。

Comments TPAMI-2026 Accepted Paper

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026, pp. 1-18

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15687 2026-07-20 cs.LG 新提交 57%

Toward Federated Multimodal Graph Foundation Models: A Topology-Aware Multimodal Alignment Framework

迈向联邦多模态图基础模型:一种拓扑感知多模态对齐框架

Xunkai Li, Guohao Fu, Yuming Ai, Zhengyu Wu, Hongchao Qin, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.LG

AI总结 研究针对多模态属性图分散在不同隐私受限孤岛的问题,提出FedGAMMA框架,将联邦多模态图基础学习视为两阶段语义结构对齐问题,经实验验证该框架在下游任务中表现出色,超越诸多基线,在少样本学习场景下也有优势。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14190 2026-07-17 cs.LG cs.IR stat.ML 新提交 57%

A Temporal Machine Learning-Based Time-to-Event Model for Predicting ALS Progression and Healthcare Utilization

基于时间序列机器学习的事件发生时间模型预测肌萎缩侧索硬化症进展及医疗保健利用情况

Zongliang Yue, Qi Li, Terry Heiman-Patterson, Frank Bearoff, Zhaohui Qin, Huanmei Wu

机构 * Harrison College of Pharmacy, Auburn University(奥本大学哈里森药学院) Fisk University(菲斯克大学) Lewis Katz School of Medicine, Temple University(天普大学刘易斯·卡茨医学院) Emory University(埃默里大学) Barnett College of Public Health, Temple University(天普大学巴尼特公共卫生学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 研究针对ALS预测临床有意义事件的挑战,开发受数字孪生启发的事件发生时间框架,整合多源数据,经聚类、建模等确定功能域及预测因素,构建TTE模型,能生成个性化生存曲线,为ALS相关决策支持提供可行方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13411 2026-07-16 cs.CR cs.LG 新提交 57%

Evaluating Frontier AI Agents as Autonomous Clinical Security Auditors

评估前沿人工智能代理作为自主临床安全审计员

Michael O. Eniolade

机构 * University of the Cumberlands(坎伯兰大学)

专题命中 医学数据与评测 :clinical AI(abstract);分类 cs.LG

AI总结 研究旨在评估前沿人工智能代理能否自主进行临床人工智能安全审计。基于METR任务标准构建评估任务,让代理按要求实施攻击、计算得分并编写报告。通过对三个前沿模型在不同数据集和模型架构上的评估,得出各模型表现及成本等情况,部分成果已公开。

Comments 29 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13386 2026-07-16 cs.CV 新提交 57%

FM$^2$: Unified Federated Foundation Models for Heterogeneous Multimodal Medical Imaging

FM$^2$:用于异构多模态医学成像的统一联邦基础模型

Shengchao Chen, Ting Shu

机构 * School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Australian AI Institute, University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.CV

AI总结 针对医学成像基础模型构建中隐私与任务统一问题,提出FM$^2$框架,通过从头训练核心主干、结合预训练编码器、配备双混合专家模块及正则化器,并引入字幕增强学习,实现跨模态泛化,优于现有联邦基线。

Comments Accepted by ACM MM 2026 (Main Track): the 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09973 2026-07-14 cs.SD cs.AI cs.SY eess.AS eess.SP eess.SY 新提交 57%

A Production-Oriented Framework for Evaluation of SFX Generation

一种面向生产的声效生成评估框架

Mélodie Desbos, Yara Bahram, Eric Granger, Mohammadhadi Shateri

专题命中 医学数据与评测 :diagnosis(abstract);分类 eess.SP

AI总结 针对工业声音设计中声效生成评估问题,提出面向生产的评估框架,通过确定生产要求、两阶段协议及结合客观指标与人类研究,揭示不同基线的优势权衡,为声效变化评估建立协议并为设计音频生成管道提供基础。

Comments 8 pages main paper, 7 pages appendix, Proceedings of the 29th International Conference on Digital Audio Effects (DAFx26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04085 2026-07-07 cs.LG cs.AI cs.DC 新提交 57%

FedSPM: Routing-Enabled Federated Learning under Dual Heterogeneity via Semiparametric Mixture

FedSPM:通过半参数混合在双重异质性下实现支持路由的联邦学习

Zijian Wang, Pengfei Li, Guangyu Yang, Qiong Zhang

机构 * Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) Department of Statistics and Actuarial Science, University of Waterloo(滑铁卢大学统计与精算科学系)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 针对路由预测联邦学习中未考虑客户端内潜在亚群致双重异质性影响路由和预测的问题,提出FedSPM框架,用特定客户端潜在组件表示客户端,结合分类预测与路由特征分布,开发算法并证明收敛,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01383 2026-07-03 cs.CV 新提交 57%

MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation

MIBE:面向个性化图像生成的多主体交互基准与评估器

Zhihan Chen, Yuhuan Zhao, Yijie Zhu, Xinyu Yao, Mengcong Ren, Suwen Wang, Qiuyang Yin, Yuchen Sun, Qin Wang, Lu Xin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) DeerLab LLC(DeerLab有限责任公司) Carnegie Mellon University(卡内基梅隆大学) Clemson University(克莱姆森大学) Google(谷歌) San Jose State University(圣何塞州立大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 提出MIBE框架,包含多主体交互基准(MIB)和评估器(MIE),通过解耦数据体制和双头排序诊断目标,解决多主体个性化图像生成中主体遗漏、外观失配和交互错误问题,在黄金集上达到0.922成对准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00733 2026-07-02 cs.LG cs.AI 新提交 57%

LLM-Guided ODE Discovery and Parameter Inference from Small-Cohort Aggregate Data

LLM引导的ODE发现与小群体聚合数据的参数推断

Hanning Yang, Meropi Karakioulaki, Lennart Purucker, Tim Litwin, Cristina Has, Moritz Hess

机构 * Institute of Medical Biometry and Statistics, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院医学统计与生物统计研究所) Department of Dermatology, Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院皮肤科) Prior Labs, University of Freiburg(弗莱堡大学Prior实验室)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 提出AgentODE框架,利用LLM提出候选ODE结构,并通过工具增强的推理代理仅基于群体级汇总统计量迭代优化参数分布,实现从稀疏、噪声数据中发现可解释的ODE结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00710 2026-07-02 cs.CV cs.AI cs.RO 新提交 57%

Creating Impactful Autonomous Driving Datasets: A Strategic Guide from Research Gap to Benchmark

创建有影响力的自动驾驶数据集:从研究空白到基准的战略指南

Richard Schwarzkopf, Jonas Merkert, Frank Bieder, Annika Bätz, Alexander Blumberg, Carlos Fernandez, Felix Hauser, Fabian Immel, Christian Kinzig, Hendrik Königshof, Fabian Konstantinidis, Martin Lauer, Willi Poh, Nils Rack, Kevin Rösch, Yinzhe Shen, Marlon Steiner, Gleb Stepanov, Dominik Strutz, Ömer Şahin Taş, Julian Truetsch, Kaiwen Wang, Royden Wagner, Jan-Hendrik Pauls, Christoph Stiller

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(FZI信息技术研究中心)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 提出一种诊断研究问题类型并选择最小数据操作符填补空白的战略框架,通过KITScenes案例验证,指导中小实验室和初创公司高效创建有影响力的自动驾驶数据集。

Comments Keywords: Autonomous Driving, Dataset Design, Benchmarks, Research Gap Identification. 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00491 2026-07-02 cs.CV cs.AI cs.CL 新提交 57%

MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos

MindEdit-Bench:基于野外照片的VLM中对象级反事实空间推理基准

Leyuan Yu, Xiao Tang, Minghao Liu, Xinyuan Li, Xiaokai Bai, Sheng Zhou, Qunshu Lin, Weihao Xuan, Naoto Yokoya

机构 * ZODA Zhejiang University(浙江大学) Tongji University(同济大学) The University of Tokyo(东京大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 提出MindEdit-Bench基准,包含六项空间推理任务,其中两项新任务(L4和L5)测试对象级反事实推理,VLM平均准确率仅8%-31%,远低于人类的81%-97%。

Comments 18 pages, 7 figures. Dataset available at https://huggingface.co/datasets/ZODAOfficial/MindEdit-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31626 2026-07-01 cs.CV 新提交 57%

PrISM-IQA: Image Quality Assessment Made Practical for Smartphone Photography

PrISM-IQA:面向智能手机摄影的实用图像质量评估

Shuyan Zhai, Jiaqi He, Weixia Zhang, Liang Wang, Zhenjie Lee, Zufeng Zhang, Kede Ma

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Computer Science, Institute of AI, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院人工智能研究院) OPPO Research Institute(OPPO研究院) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 提出PrISM-IQA,将智能手机IQA重构为多问题有序诊断,预测每个ISP相关问题的严重等级,支持可操作的ISP调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28194 2026-06-29 cs.LG 新提交 57%

COCOLogic-V2: Identifying Logical Inconsistencies via Truly Hard-Negatives

COCOLogic-V2: 通过真正的困难负样本识别逻辑不一致性

David Steinmann, Antonia Wüst, Kristian Kersting, Wolfgang Stammer

机构 * Computer Science Department, TU Darmstadt(达姆施塔特工业大学计算机科学系) Hessian Center for AI (hessian.AI)(黑森人工智能中心) German Research Center for AI (DFKI)(德国人工智能研究中心) Max Planck Institute for Informatics, SIC(马克斯·普朗克信息学研究所SIC) RTG Neuroexplicit Models(RTG神经显式模型)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 提出COCOLogic-V2数据集,通过正样本、近边界和远边界负样本分类,评估模型在真实图像上的视觉归纳推理能力,发现模型在近边界样本上表现差,视觉归纳推理仍是开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24900 2026-06-25 cs.LG cs.AI 新提交 57%

On-Device Neural Architecture Search

设备上神经架构搜索

Andrea Mattia Garavagno, Edoardo Ragusa, Paolo Gastaldo, Antonio Frisoli, Claudio Loconsole

机构 * 1 Department of Electrical, Electronic, Telecommunication Engineering Naval Architecture, DITEN University of Genoa, Genoa 16145, Italy 2 Department of Excellence in Robotics \& AI, Scuola Superiore Sant’Anna, Piazza Martiri della Libertà 33, Pisa 56127, Italy 3 Institute of Mechanical Intelligence, Scuola Superiore Sant’Anna, Ghezzano, 56010 Pisa, Italy 4 Faculty of Technological

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 提出一种在部署设备上直接进行轻量级神经架构搜索的方法,以优化传感器实时数据分析,在人机接口中实现个性化适应,并在两个数据集上验证了其优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22890 2026-06-23 cs.CV 新提交 57%

PHOEBI: An Open-World Benchmark for Bacterial Identification in Phase-Contrast Microscopy

PHOEBI:用于相差显微镜细菌识别的开放世界基准

Aaditya Baranwal, Md Jahid Hasan, Shruti Vyas

机构 * University of Central Florida(中佛罗里达大学)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.CV

AI总结 提出PHOEBI数据集(12万张相差显微镜图像,6种杆状菌的40种组合),通过留出组合评估协议模拟开放世界场景,发现聚合器存在系统性开放世界识别失败,并设计基于锚点的轻量化解码器在未见组合上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20608 2026-06-23 cs.CY cs.AI cs.CV 新提交 57%

CourseBlueprint: A Structured Pipeline for Adaptive Pedagogical Video Generation Grounded in Course Corpora

CourseBlueprint:基于课程语料库的自适应教学视频生成的结构化流程

Md Zabirul Islam, Md Motaleb Hossen Manik, Ge Wang

机构 * Department of Computer Science, Rensselaer Polytechnic Institute(计算机科学系,拉特格斯理工学院) Department of Biomedical Engineering, Rensselaer Polytechnic Institute(生物医学工程系,拉特格斯理工学院)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.CV

AI总结 提出CourseBlueprint流程,通过结构化教学蓝图(含先决条件图、自适应控制、参与合约)从课程语料库生成自适应教学视频,实验证明显式教学合约比表面流畅性更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18518 2026-06-18 cs.LG cs.AI 新提交 57%

PSyGenTAB: A Privacy-Preserving Framework for Synthetic Clinical Tabular Data Generation via Constrained Optimization

PSyGenTAB:通过约束优化生成合成临床表格数据的隐私保护框架

Arshia Ilaty, Hossein Shirazi, Manasi Chitale, Kedar Hegde, Dhanalakshmi Ramesh, Rashmi S. Manjunath, Amir Rahmani, Hajar Homayouni

机构 * San Diego State University(圣地亚哥州立大学) University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 医学数据与评测 :medical AI(abstract);分类 cs.LG

AI总结 提出PSyGenTAB框架,将合成医疗数据生成建模为约束优化问题,通过增强拉格朗日方法嵌入可配置隐私约束,在保证隐私阈值的同时最大化临床数据效用,实验表明合成数据训练的模型性能与真实数据相当。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15449 2026-06-16 cs.CL cs.IR cs.LG 新提交 57%

Transfer Learning for FHIR Questionnaire Terminology Binding

面向 FHIR 问卷术语绑定的迁移学习

Maxim Gorshkov

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.LG

AI总结 将 FHIR 问卷项与 LOINC 代码的绑定视为检索问题,比较六种方法,发现 BioLORD 在 top-1 准确率上最优,而对比微调在 top-5 和 top-10 上表现更好,并分析了分布偏移和错误类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15032 2026-06-16 cs.LG 新提交 57%

How Should World Models Be Evaluated for Embodied Decision-Making? A Decision-Making-Centric Position

世界模型应如何评估?一个以决策为中心的立场

Yang Yu, Shiyuan Zhang, Yifei Sheng, Haoxiang Ren, Haoxin Lin

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Cirquar Technologies

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 本文指出世界模型评估中声明与证据不匹配的问题,提出以决策为中心的评估框架,强调反事实推理、策略优化等能力,并定义L0-L7评估阶梯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07656 2026-06-09 physics.chem-ph cs.CE cs.LG 新提交 57%

SC3: The Multi-Solvent Solubility Challenge and Benchmark

SC3:多溶剂溶解度挑战与基准

Vansh Ramani, Har Ashish Arora, Dhairya Kuchhal, Sergei Tatarin, Lev Krasnov, Sayan Ranu, Tarak Karmakar

机构 * Indian Institute of Technology Delhi, India(印度德里印度理工学院) Kurnakov Institute of General and Inorganic Chemistry RAS, Russia(库尔诺夫一般和无机化学研究所俄罗斯科学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 针对多溶剂溶解度预测中现有基准的缺陷,提出SC3基准,包含可复现的数据处理流程、多层级共识集和评估指标,并揭示最佳模型与理论极限仍有5倍差距。

Comments 34 pages, 16 tables, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07643 2026-06-09 cs.CV cs.AI cs.SD eess.AS 新提交 57%

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

AVI-Bench:迈向全模态大语言模型的人类级视听智能

Yaoting Wang, Ziyi Zhang, Wenming Tu, Shaoxuan Xu, Wenjie Du, Cheng Liang, Weijun Wang, Yuanchao Li, Guangyao Li, Hao Fei, Yuanchun Li, Henghui Ding, Yunxin Liu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 提出AVI-Bench基准,通过感知、理解、推理三阶段跨模态任务评估全模态大语言模型的视听智能,并引入AVI-Bench-PriSe测试原始视听感知,揭示当前模型局限,构建四级AVI分类体系。

Comments 31 pages, 8 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21818 2026-06-23 q-bio.NC 新提交 54%

Dynamic Computerized Tumbling-E Testing for Temporal Reliability of Human Sequential Perceptual Decisions

动态计算机化Tumbling-E测试用于人类顺序感知决策的时间可靠性

Avneek Sandhu, Bin Hu

专题命中 医学数据与评测 :diagnosis(abstract);分类 q-bio

AI总结 通过计算机化Tumbling-E任务收集人类试次级数据,包括反应时间、超时率和自适应阶梯行为,建立时间解析的感知决策基准,为与人工智能比较提供人类基线。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏