arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 141 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 141 篇

2608.01805 2026-08-04 cs.AI 新提交 50%

CockpitHAT: Dependency-Graph-Driven Hierarchical Attribution for Embodied Multi-Agent Cockpits

CockpitHAT:面向具身多智能体座舱的依赖图驱动分层归因方法

Wei Wang, Shuanghe Liu, Zhu Zhuo, Jiaqi Zhong, Xiaozhao Zhao, Xiaojie Zuo, Jie Su

机构 * ByteDance(字节跳动)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 该研究针对LLM多智能体系统的“正确性崩溃”问题,提出CockpitHAT分层归因框架,发布含212条轨迹的CockpitBench基准,在相关基准上超越现有方法,实现可靠故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29626 2026-08-03 cs.AI 新提交 50%

AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准

Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, Jie Zhou, Xuanjing Huang

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28841 2026-08-03 cs.MA cs.SE 新提交 50%

CyberNeuro: A Privacy-Preserving Agentic Workbench for Cohort-Scale Neuroimage and Clinical Data Analysis

CyberNeuro:用于队列规模神经影像与临床数据分析的隐私保护智能体工作台

Ran Ren, Junhong Tong, Yunxi Kong, Yiyao Chen, Yucheng Li, Kunhao Zhou, Shaoqi Wang, Yuxiang Tao, Shuheng Cao, Zhihao Fan, Marissa DiPiero, Tingting Dan, Guorong Wu

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 CyberNeuro是配备WandaMind本地LLM的隐私保护智能体工作台,通过四个专用智能体实现神经影像与临床数据分析自动化,在NeuroBench上提升了域准确率,还降低了令牌使用量。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28788 2026-08-03 cs.AI 新提交 50%

EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses

EarlyDx:一个锚定入院时间的开放生成式循证急诊科就诊诊断基准

Jiahui Li, Ruili Fang, Zishuai Liu, Yutong Guo, Nan Yang, Wenzhan Song, Jin Lu, Fei Dou

机构 * University of Georgia(佐治亚大学) Beijing Luhe Hospital(北京潞河医院)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出EarlyDx基准,针对现有诊断基准不适用入院诊断场景的问题,基于MIMIC-IV数据构建,发现各类LLM均无法可靠综合入院证据,仅能提取部分诊断,微调后仍有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28478 2026-07-31 cs.CL 新提交 50%

Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning

你会步行去洗车吗?揭示大型语言模型在常识推理中的显著性偏差

Zheng Wu, Chenhao Xue, Shijie Zheng, Yijie Lu, Cheng Yang, Zhuosheng Zhang

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本研究构建SaliTrap基准数据集,发现主流LLMs存在显著性偏差,其常识推理失败源于知识被干扰项抑制,而非知识缺失,轻量级推理时提示可大幅缓解该问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28190 2026-07-31 cs.CL cs.AI 新提交 50%

The MADRS Pipeline: Supporting Depression Assessment in Clinical Trials

MADRS 流程:支持临床试验中的抑郁评估

Mila Fodor, Katalin Ócsai, Francesco Periti, Rien Sonck, Alex Boudreau

机构 * Clario, part of Thermo Fisher Scientific(赛默飞世尔科技旗下Clario)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本研究开发了一种 LLM 流程,可将临床试验的结构化音频访谈转换为文本,映射至 MADRS 10 项症状条目并评估严重程度,与专家评级整体相关性达 0.867,为抑郁评估提供可解释支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23740 2026-07-28 cs.CL 新提交 50%

Zing: Social Mind for LLMs

Zing:大语言模型的社交智能

Zing Team, Ao Xiang, Bi Jingping, Chen Jiahui, Chen Lehan, Chen Yilin, Cheng Xueqi, Fan Yixing, Gan Kairong, Gao Haowen, Gao Jinhua, Gao Shuxuan, Gong Chang, Guo Jiafeng, Guo Ruijie, Han Zhouyu, He Guangfu, He Yichun, Jiang Shuo, Jing Shaoling, Jing Ya, Lei Chenhao, Lei Yan, Li Anqi, Li Chengao, Li Haoyu, Li Shitian, Liang Xinjian, Liu Zhaoge, Lyu Xingyu, Nie Zhuwei, Pang Liang, Quan Zeping, Shan Shiguang, Shen Huawei, Tang Xinran, Tian Feng, Wang Qian, Wang Ruiping, Wang Xiaohong, Xia Zaiyu, Xiao Yi, Xu Jiayuan, Xu Kehan, Xu Qianqian, Xu Tianyu, Xu Yongjun, Yang Haoming, Yang Jun, Yao Di, Yu Xiaoming, Zhang Futong, Zhang Jie, Zhang Shixuan, Zhang Yuxuan, Zhao Xinyu, Zhao Zhuoran, Zhong Yunfei, Zhu Shengyu

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 研究大语言模型社交智能,提出Zijing框架,含测量基准SoMBench、训练方法Zing及推理架构Actio,通过实验证明社交智能大语言模型在评估、内化和落地方面需协同发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23124 2026-07-28 cs.AI cs.CL 新提交 50%

AgentOmnia: Scaling Agentic Models for Full-Scenario Applications

AgentOmnia:用于全场景应用的规模化智能体模型

Hao Jiang, Gangtao Xin, Yingdi Huang, Guojie Zhu, Jiangshan Zhang, Xinyuan Lin, Yunkun Xu, Chengyu Shen, Wenlong Fei, Jiawei Li, Yujie Fu, Sichen Kang, Tingyu Xie, Yedi Hu, Jingren Zhang, Hongcheng Gao, Jianshu Zeng, Chong Chen, Chang Guo, Chao Feng, Feng Wang, Fulin Lin, Jinchao Ma, Lang Mei, Li Huang, Liyan Liu, Qing He, Shuting Tao, Siyu Mo, Xiangnan Chen, Xiaohan Yu, Xiaoyang Li, Yanheng Hou, Yanyu Wu, Zhihan Yang, Wentao Zhang, Yang Gao, Zhao Cao

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 研究大型语言模型智能体全场景扩展问题,提出AgentOmnia框架,结合多种技术构建环境、工具和任务,通过多种方式支持训练后处理,能将多个基准测试通过率和宏平均率大幅提高,实现广泛改进并为自我进化提供证据。

Comments 69 pages, 18 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22607 2026-07-28 cs.CY 新提交 50%

The Clinical Trial Pipeline Reveals the Next Wave of Artificial Intelligence in Healthcare: A Multidimensional Analysis of 8,532 Registered Studies

临床试验管道揭示医疗保健领域人工智能的下一波浪潮:对8532项注册研究的多维分析

Lior Rokach

专题命中 医学数据与评测 :clinical AI(abstract)

AI总结 该研究通过对8532项注册研究多维分析,揭示医学人工智能临床试验格局。用关键词搜索和分类器识别试验,从多维度分类,发现虽从回顾转向前瞻,但在规模、专业覆盖等方面有差距,未来进展取决于弥合这些差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19201 2026-07-22 cs.CL cs.AI 新提交 50%

MIRA-Ev:A Benchmark for Granular Evidence Detection and Relational Reasoning in Clinical Exams

MIRA-Ev:临床考试中颗粒证据检测和关系推理的基准

Iker De la Iglesia, Johanna Ramirez-Romero, Jose Maria Villa-Gonzalez, Irune Urroz García, Ander Barrena, Aitziber Atutxa

机构 * HiTZ Center, University of the Basque Country (EHU)(巴斯克大学HiTZ中心) Hospital Universitario de Cruces(克鲁塞斯大学医院)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 该研究针对临床自然语言处理评估局限,引入基于西班牙MIR执照考试案例的MIRA-Ev基准,重新注释相关关系并发布多语言版本,将评估组织为证据句子检索、论证组件提取和关系分类的三层任务层次结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15766 2026-07-20 cs.CL 新提交 50%

Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery

行动之前:在前瞻性假设发现任务上对大语言模型进行基准测试

Tianyun Zhong, Wangyi Jiang, Wei Wang, Xuanang Chen, Yaojie Lu, Shiwei Ye, Yuzhen Shi, Boyu Yang, Jinghang Wang, Han Li, Weiqi Zhai, Bing Zhao, Hu Wei, Haiyang Yu, Yongbin Li, Hongyu Lin, Le Sun, Xianpei Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Alibaba Group(阿里巴巴集团)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 研究旨在评估大语言模型在开放式结论前阶段的发现能力,引入前瞻性假设发现任务及评估框架HypoArena,提出回顾性上下文回归构建基准数据,实验揭示模型能力分层及效应,结果支持将其作为评估大语言模型制定调查方向的独特目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14479 2026-07-17 cs.CY 新提交 50%

BioTIER: A Refusal Benchmark for Targeted Biological Risk Mitigation

BioTIER:用于针对性生物风险缓解的拒绝基准

Eleanor M. Marshall, Pedro Medeiros, Peter Peneder, Nelly Mak, Jacob Kaffey, Faith Rovenolt, Mac Walker, Seth Donoughe, Jasper Götting

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 针对大语言模型生物滥用问题,引入BioTIER基准,将生物内容分三个风险集,含542个专家策划提示及元数据,可隔离控制灾难性风险信息,确保生物科学知识获取,助力针对性生物风险缓解。

Comments 52 pages, 9 main figures, 9 supplementary figures, 1 main table, 9 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13981 2026-07-16 cs.LO cs.FL 新提交 50%

Agent-Alternation-Free Epistemic Metric Temporal Logic with Past: Model Checking and Complexity

带过去时态的无主体交替认知度量时态逻辑:模型检查与复杂性

Benedikt Bollig, Matthias Függer, Thomas Nowak, Paul Zeinaty

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 研究带过去时态的无主体交替认知度量时态逻辑的模型检查,通过结合时态测试自动机与完美回忆观察者进行分析,证明其模型检查为EXPSPACE完全,给出了该逻辑在特定条件下的复杂性结论。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13940 2026-07-16 cs.AI 新提交 50%

A Self-Evolving Agent for Longitudinal Personal Health Management

一种用于纵向个人健康管理的自我进化智能体

Haoran Li, Jiebi Deng, Tong Jin, Jinghong Han, Yuxin Wang, Zexin Wang, Qingyi Si, Weikang Gong, Xiahai Zhuang, Jia You, Wei Cheng, Jianfeng Feng, Hongcheng Guo

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) School of Life Sciences, Beijing University of Chinese Medicine(北京中医药大学生命科学学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑科学与智能技术研究院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) JD.com, Inc.(京东公司) Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, Fudan University, Ministry of Education(复旦大学计算神经科学与类脑智能教育部重点实验室) Department of Neurology, Huashan Hospital, Fudan University(复旦大学附属华山医院神经内科)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 研究针对多数健康AI系统孤立处理请求的问题,开发开源智能体架构HealthClaw,通过自我进化更新支持,经合成基准和生物医学任务评估,在准确率、隐私性及任务指标增益上表现出色,支持纵向个人健康智能体的自我进化记忆。

Comments 20 pages, 4 figures, 6 supplementary tables. Code: https://github.com/HC-Guo/HealthClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12893 2026-07-15 cs.AI cs.CL 新提交 50%

MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations

MemOps:在长期对话中对生命周期内存操作进行基准测试

Xixuan Hao, Zeyu Zhang, Zehao Lin, Yihang Sun, Ziliang Guo, Xichong Zhang, Yuxuan Liang, Feiyu Xiong, Zhiyu Li

机构 * MemTensor (Shanghai) Technology Co., Ltd.(墨天轮(上海)科技有限公司) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 研究针对长期对话中内存操作评估,引入MemOps基准测试,将对话内存视为操作生命周期,通过可控管道嵌入操作并评估,揭示了当前系统内存操作的问题,推动评估从答案评分转向操作级诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08382 2026-07-10 cs.IR 新提交 50%

H3D: Benchmarking Unsupervised Text Hashing for Fine-Grained Document Deduplication

H3D:用于细粒度文档去重的无监督文本哈希基准测试

Qianren Mao, Jiaxun Lyu, Junnan Liu, Zhijun Chen, Jingzheng Li, Hanwen Hao, Bo Li

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 H3D作为细粒度文档去重的无监督文本哈希基准测试,评估多种哈希方法,在两个数据集上进行实验,报告排名质量、效率和鲁棒性等结果,揭示不同方法权衡,分析相似性度量等效情况,提升方法比较的可解释性与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06986 2026-07-09 cs.SD 新提交 50%

MMGenre: Benchmarking Singing Voice Synthesis across Multiple Musical Genres

MMGenre:跨多种音乐流派的歌声合成基准测试

Wenhao Feng, Yuxun Tang, Jiatong Shi, Qin Jin

机构 * Renmin University of China(中国人民大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 研究跨多种音乐流派的歌声合成泛化能力,引入MMGenre基准及自动管道,涵盖多流派。评估显示流派辨别有限,零样本改进小,特定流派持续训练有显著提升,为多流派SVS评估提供框架,揭示关键挑战。

Comments Accepted by Interspeech 2026. Camera-ready version. 4 pages, 5 figures.Project page: https://fengjin1117.github.io/mmgenre-demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05638 2026-07-08 cs.SE cs.AI 新提交 50%

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems

EvalLoop:一种用于商业人工智能系统评估驱动迭代改进的方法

Kenneth Benavides, Josh Fleischer, Danti Chen

机构 * Robert Half(罗伯特·哈夫公司)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 研究针对商业AI系统评估忽视迭代改进价值的问题,提出EvalLoop方法,通过维度指标分组、故障模式分类和结构化迭代工作流程,实现评估驱动的迭代改进,经案例研究验证有效,还能助力模型选择与部署权衡,且被打包为可重用工件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05202 2026-07-07 cs.AI 新提交 50%

EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer

EvoAgentBench:通过能力迁移评测智能体自进化的基准平台

Xingze Gao, Chuanrui Hu, Hongda Chen, Pengfei Yao, Zhao Wang, Yi Bai, Zhengwei Wu, Yunyun Han, Xiaofeng Cong, Jie Gui, Yafeng Deng, Teng Li

机构 * Anhui University(安徽大学) EverMind, Shanda Group(盛趣游戏灵眸智能科技) Southeast University(东南大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对现有评测无法分离大语言模型智能体程序性经验迁移的问题,提出跨四领域的EvoAgentBench基准,可将自进化评测转为对经验编码、路由与吸收的细粒度诊断。

Comments 15 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05111 2026-07-07 cs.CR 新提交 50%

From Multiplicity to Vulnerability: Privacy Amplification Risk from One-Dataset-Multiple-Model Exposure

从多重性到脆弱性:单数据集多模型暴露带来的隐私放大风险

Qirui Huang, Na Li, Hongsheng Hu, Zhi Zhang, Anmin Fu, Yansong Gao

专题命中 医学数据与评测 :medical image(abstract)

AI总结 研究单数据集多模型范式的隐私风险,建立理论框架证明隐私泄漏会累积,提出PRIME利用成员推理攻击评估风险并量化泄漏,设计机制和元分类器推断样本成员状态,揭示该范式严重危害隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05055 2026-07-07 cs.AI 新提交 50%

Toward Trustworthy Large Language Model Agents in Healthcare

迈向医疗保健领域值得信赖的大语言模型智能体

Hadi Hasan, Safaa Salman, Adam Tai Abou Dargham, Ammar Mohanna, Ali Chehab

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03704 2026-07-07 cs.CL 新提交 50%

Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization

优化用于药物警戒中因果关系评估的大语言模型:开发一种性能指标作为贝叶斯超参数优化的目标

Nicole Sonne Heckmann, Arnault-Quentin Vermillet, Søren Norlin Mølgaard, Manuela Del Castillo Suero, Lars Melskens, Gerard Ompad, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) Safety Operations, Novo Nordisk(诺和制药安全运营部) Clinical Development Centre Denmark, Novo Nordisk(丹麦临床开发中心,诺和制药) Statistical Data Science Lead, Pfizer(辉瑞统计数据科学负责人)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 研究针对药物警戒中因果关系评估优化大语言模型,开发高斯过程兼容的优化目标,用链思维提示评估GPT-5.2,通过贝叶斯优化研究温度优化效果,EWACS指标优化提升了因果关系分类一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01846 2026-07-03 cs.AI 新提交 50%

CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

CLAP:领域智能体后训练的闭环训练、评估与发布控制

Fangfei Li, Chenyang Zhao, Long Wang, Feng Tian, Zhiyue Zheng, Lv Guo

机构 * MatrixOrigin(矩阵起源)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出CLAP闭环方法,通过数据验证、奖励/KL诊断、离线门控和应用链回放,在制造场景中评估后训练效果,发现仅部分批次提升且存在KL风险,支持集成循环管理。

Comments 6 pages, 1 figure. Accepted to CRAE 2026; to appear in SPIE Proceedings. Best Poster Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31608 2026-07-01 cs.CL 新提交 50%

CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning

CLExEval: 一种用于定性评估LLM临床推理的人机协同框架

Ajmal M., Abin Roy, Afthab Salam Kanniyan, Jawadh Abdul Kabeer, Jerin James, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) IIT Madras(印度理工学院马德拉斯分校) Calicut Medical College(卡利卡特医学院)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出CLExEval框架,通过渐进信息遮蔽和专家注释,揭示LLM临床推理中的冗长偏差、隐藏知识悖论和推理-输出不匹配问题,并验证了LLM作为评判者的局限性。

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27154 2026-07-01 cs.AI 新提交 50%

OpenRCA 2.0: From Outcome Labels to Causal Process Supervision

OpenRCA 2.0:从结果标签到因果过程监督

Aoyang Fang, Yifan Yang, Jin'ao Shang, Qisheng Lu, Junjielung Xu, Rui Wang, Songhan Zhang, Yuzhong Zhang, Boxi Yu, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对现有根因分析数据集仅标注结果而忽略因果传播路径的问题,提出PAVE协议重建因果路径,构建OpenRCA 2.0基准,发现LLM在根因定位中因果验证不足的缺陷。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26879 2026-06-29 cs.AI 新提交 50%

A Pipeline for Generating Longitudinal Synthetic Clinical Notes Using Large Language Models

使用大型语言模型生成纵向合成临床笔记的流水线

William Poulett, Alice Waterhouse, Ben Wallace, Scarlett Kynoch, Amaia Imaz Blanco, Michael Spence, Jonathan Pearson

机构 * NHS England Data Science and Applied AI Team(NHS英格兰数据科学与应用人工智能团队)

专题命中 医学数据与评测 :clinical AI(abstract)

AI总结 提出一种模块化流水线,结合结构化患者生成、半结构化旅程模拟和LLM生成非结构化笔记,生成纵向一致的合成临床数据集,支持临床AI开发并避免隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25819 2026-06-25 cs.CL cs.SE 新提交 50%

Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

超越函数调用:工具环境不可靠性下的工具使用智能体基准测试

Yang Tian, Zhengpeng Shi, Yu Zhou, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出ToolBench-X基准,在工具环境中注入五种可恢复可靠性风险,评估智能体任务完成能力,发现可靠工具下表现良好的智能体在可恢复风险下失败,失败主因是诊断和恢复能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18936 2026-06-25 cs.AI cs.CY 新提交 50%

SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

SciRisk-Bench:面向AI4Science安全的风险维度感知基准

Linghao Feng, Yinqian Sun, Dongqi Liang, Sicheng Shen, Chenfei Yan, Yuxuan Peng, Yilin Zhao, Haibo Tong, Kai Li, FeiFei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive Intelligence Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知智能实验室,自动化研究所,中国科学院,北京,中国) School of Future Technology, University of Chinese Academy of Sciences, China(未来技术学院,中国科学院大学,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(人工智能学院,中国科学院大学,中国) Zhongguancun Academy, China(中关村学院,中国) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Gaoling School of AI, Renmin University of China(甘露人工智能学院,中国人民大学) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院(北京-AISI)) School of Humanities, University of Chinese Academy of Sciences, China(人文学院,中国科学院大学,中国)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出SciRisk-Bench基准,从显式风险维度和科学学科两个角度评估AI4Science安全,覆盖7个学科、31个子学科和10个风险维度,实验揭示主流及科学大模型的安全薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24672 2026-06-24 cs.AI 新提交 50%

Cost-Optimal Decision Diagrams for Stochastic Boolean Function Evaluation

随机布尔函数评估的代价最优决策图

Xia Zong, Tuomo Lehtonen, Jussi Rintanen

机构 * Aalto University(阿尔托大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对变量代价和概率分布下的命题公式评估,提出首个实用的精确分支定界算法,含变量选择启发式、剪枝和缓存,并证明问题为#P-hard且属于PSPACE。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24200 2026-06-24 cs.CL cs.AI cs.IR 新提交 50%

MMed-Bench-IR: A Heterogeneous Benchmark for Multilingual Medical Information Retrieval

MMed-Bench-IR:多语言医学信息检索的异构基准

Junhyeok Lee, Han Jang, Hyeonjin Goh, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University College of Medicine(首尔国立大学医学院) Seoul National University Hospital(首尔国立大学医院)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 针对临床RAG的多语言检索需求,提出MMed-Bench-IR基准,涵盖跨语言对齐、概念区分和证据检索三种异构任务,评估6种语言下10个系统,发现生物医学编码器在英语与日语间性能差距巨大。

Comments Under review. 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏