arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 2124 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 2124 篇

2607.08382 2026-07-10 cs.IR 新提交 50%

H3D: Benchmarking Unsupervised Text Hashing for Fine-Grained Document Deduplication

H3D:用于细粒度文档去重的无监督文本哈希基准测试

Qianren Mao, Jiaxun Lyu, Junnan Liu, Zhijun Chen, Jingzheng Li, Hanwen Hao, Bo Li

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 H3D作为细粒度文档去重的无监督文本哈希基准测试,评估多种哈希方法,在两个数据集上进行实验,报告排名质量、效率和鲁棒性等结果,揭示不同方法权衡,分析相似性度量等效情况,提升方法比较的可解释性与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06986 2026-07-09 cs.SD 新提交 50%

MMGenre: Benchmarking Singing Voice Synthesis across Multiple Musical Genres

MMGenre:跨多种音乐流派的歌声合成基准测试

Wenhao Feng, Yuxun Tang, Jiatong Shi, Qin Jin

机构 * Renmin University of China(中国人民大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 研究跨多种音乐流派的歌声合成泛化能力,引入MMGenre基准及自动管道,涵盖多流派。评估显示流派辨别有限,零样本改进小,特定流派持续训练有显著提升,为多流派SVS评估提供框架,揭示关键挑战。

Comments Accepted by Interspeech 2026. Camera-ready version. 4 pages, 5 figures.Project page: https://fengjin1117.github.io/mmgenre-demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25605 2026-07-09 cs.IR cs.AI cs.DB 版本更新 50%

Health System Scale Semantic Search Across Unstructured Clinical Notes

跨无结构临床笔记的健康系统规模语义搜索

Faith Wavinya Mutinda, Spandana Makeneni, Anna Lin, Shivaji Dutta, Irit R. Rasooly, Patrick Dibussolo, Shivani Kamath Belman, Hessam Shahriari, Kevin Murphy, Alex B. Ruan, Barbara H. Chaiyachati, Sanjay Chainani, Robert W. Grundmeier, Scott M. Haag, Jeffrey M. Miller, Heather M. Griffis, Ian M. Campbell

机构 * Department of Biomedical and Health Informatics, Children’s Hospital of Philadelphia(儿童医院哲学学院生物医学与健康信息学系) Google Cloud(谷歌云) Department of Pediatrics, University of Pennsylvania(宾夕法尼亚大学儿科系) Division of Neonatology, Children’s Hospital of Philadelphia(儿童医院哲学学院新生儿科) Division of Human Genetics, Children’s Hospital of Philadelphia(儿童医院哲学学院人类遗传学部)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出了一种在大规模健康系统中实现语义搜索的解决方案,通过优化嵌入模型和分块策略,实现了亚秒级查询延迟和高准确率的临床问答任务,同时展示了在临床实用性评估中减少任务完成时间的效果。

Comments For associated code, see https://github.com/Ian-Campbell-Lab/clinical-semantic-search

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05638 2026-07-08 cs.SE cs.AI 新提交 50%

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems

EvalLoop:一种用于商业人工智能系统评估驱动迭代改进的方法

Kenneth Benavides, Josh Fleischer, Danti Chen

机构 * Robert Half(罗伯特·哈夫公司)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 研究针对商业AI系统评估忽视迭代改进价值的问题,提出EvalLoop方法,通过维度指标分组、故障模式分类和结构化迭代工作流程,实现评估驱动的迭代改进,经案例研究验证有效,还能助力模型选择与部署权衡,且被打包为可重用工件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05202 2026-07-07 cs.AI 新提交 50%

EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer

EvoAgentBench:通过能力迁移评测智能体自进化的基准平台

Xingze Gao, Chuanrui Hu, Hongda Chen, Pengfei Yao, Zhao Wang, Yi Bai, Zhengwei Wu, Yunyun Han, Xiaofeng Cong, Jie Gui, Yafeng Deng, Teng Li

机构 * Anhui University(安徽大学) EverMind, Shanda Group(盛趣游戏灵眸智能科技) Southeast University(东南大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对现有评测无法分离大语言模型智能体程序性经验迁移的问题,提出跨四领域的EvoAgentBench基准,可将自进化评测转为对经验编码、路由与吸收的细粒度诊断。

Comments 15 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05111 2026-07-07 cs.CR 新提交 50%

From Multiplicity to Vulnerability: Privacy Amplification Risk from One-Dataset-Multiple-Model Exposure

从多重性到脆弱性:单数据集多模型暴露带来的隐私放大风险

Qirui Huang, Na Li, Hongsheng Hu, Zhi Zhang, Anmin Fu, Yansong Gao

专题命中 医学数据与评测 :medical image(abstract)

AI总结 研究单数据集多模型范式的隐私风险,建立理论框架证明隐私泄漏会累积,提出PRIME利用成员推理攻击评估风险并量化泄漏,设计机制和元分类器推断样本成员状态,揭示该范式严重危害隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05055 2026-07-07 cs.AI 新提交 50%

Toward Trustworthy Large Language Model Agents in Healthcare

迈向医疗保健领域值得信赖的大语言模型智能体

Hadi Hasan, Safaa Salman, Adam Tai Abou Dargham, Ammar Mohanna, Ali Chehab

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03704 2026-07-07 cs.CL 新提交 50%

Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization

优化用于药物警戒中因果关系评估的大语言模型:开发一种性能指标作为贝叶斯超参数优化的目标

Nicole Sonne Heckmann, Arnault-Quentin Vermillet, Søren Norlin Mølgaard, Manuela Del Castillo Suero, Lars Melskens, Gerard Ompad, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) Safety Operations, Novo Nordisk(诺和制药安全运营部) Clinical Development Centre Denmark, Novo Nordisk(丹麦临床开发中心,诺和制药) Statistical Data Science Lead, Pfizer(辉瑞统计数据科学负责人)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 研究针对药物警戒中因果关系评估优化大语言模型,开发高斯过程兼容的优化目标,用链思维提示评估GPT-5.2,通过贝叶斯优化研究温度优化效果,EWACS指标优化提升了因果关系分类一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01846 2026-07-03 cs.AI 新提交 50%

CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

CLAP:领域智能体后训练的闭环训练、评估与发布控制

Fangfei Li, Chenyang Zhao, Long Wang, Feng Tian, Zhiyue Zheng, Lv Guo

机构 * MatrixOrigin(矩阵起源)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出CLAP闭环方法,通过数据验证、奖励/KL诊断、离线门控和应用链回放,在制造场景中评估后训练效果,发现仅部分批次提升且存在KL风险,支持集成循环管理。

Comments 6 pages, 1 figure. Accepted to CRAE 2026; to appear in SPIE Proceedings. Best Poster Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19127 2026-07-03 cs.CL 版本更新 50%

AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG

AgenticRAGTracer:用于诊断Agentic RAG中多步检索推理的跳数感知基准

Qijie You, Wenkai Yu, Wentao Zhang

机构 * University of Science and Technology Beijing(北京科技大学) Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京市数据智能与安全重点实验室(北京大学))

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出首个由大语言模型自动构建的Agentic RAG基准AgenticRAGTracer,包含1305个跨领域数据点,支持逐跳验证,揭示模型在多步推理中推理链扭曲的问题。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31608 2026-07-01 cs.CL 新提交 50%

CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning

CLExEval: 一种用于定性评估LLM临床推理的人机协同框架

Ajmal M., Abin Roy, Afthab Salam Kanniyan, Jawadh Abdul Kabeer, Jerin James, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) IIT Madras(印度理工学院马德拉斯分校) Calicut Medical College(卡利卡特医学院)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出CLExEval框架,通过渐进信息遮蔽和专家注释,揭示LLM临床推理中的冗长偏差、隐藏知识悖论和推理-输出不匹配问题,并验证了LLM作为评判者的局限性。

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27154 2026-07-01 cs.AI 新提交 50%

OpenRCA 2.0: From Outcome Labels to Causal Process Supervision

OpenRCA 2.0:从结果标签到因果过程监督

Aoyang Fang, Yifan Yang, Jin'ao Shang, Qisheng Lu, Junjielung Xu, Rui Wang, Songhan Zhang, Yuzhong Zhang, Boxi Yu, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对现有根因分析数据集仅标注结果而忽略因果传播路径的问题,提出PAVE协议重建因果路径,构建OpenRCA 2.0基准,发现LLM在根因定位中因果验证不足的缺陷。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28471 2026-06-30 cs.AI 50%

Data and Evaluation Closed-Loop for Model Capability Enhancement

数据与评估闭环用于模型能力增强

Zhixuan Li, Jiangan Yuan, Han Xu

机构 * Baidu Inc.(百度公司)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出“能力切片”单元,构建评估-数据闭环,将基准失败转化为可验证的数据干预,在两项案例中分别排除和确认数据问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28329 2026-06-30 cs.IR cs.AI cs.CL cs.MM 50%

$M^3 QuestionIng$: Multi-modal Multi-span Medical Question Answering

$M^3 QuestionIng$: 多模态多跨度医学问答

Anisha Saha, Vaibhav Rathore, Abhisek Tiwari, Akash Ghosh, Sai Ruthvik Edara, Sriparna Saha

专题命中 医学数据与评测 :medical image(abstract)

AI总结 提出多模态多跨度医学问答框架M3QAFrame,结合文本与图像线索生成包含文本和图像的答案,在自建数据集上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26879 2026-06-29 cs.AI 新提交 50%

A Pipeline for Generating Longitudinal Synthetic Clinical Notes Using Large Language Models

使用大型语言模型生成纵向合成临床笔记的流水线

William Poulett, Alice Waterhouse, Ben Wallace, Scarlett Kynoch, Amaia Imaz Blanco, Michael Spence, Jonathan Pearson

机构 * NHS England Data Science and Applied AI Team(NHS英格兰数据科学与应用人工智能团队)

专题命中 医学数据与评测 :clinical AI(abstract)

AI总结 提出一种模块化流水线,结合结构化患者生成、半结构化旅程模拟和LLM生成非结构化笔记,生成纵向一致的合成临床数据集,支持临床AI开发并避免隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17642 2026-06-29 cs.AI 版本更新 50%

Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context

Health-ORSC-Bench:衡量健康领域过度拒绝与安全完成的基准

Zhihao Zhang, Liting Huang, Guanghao Wu, Preslav Nakov, Heng Ji, Usman Naseem

专题命中 医学数据与评测 :medical AI(abstract)

AI总结 针对大语言模型在健康场景中过度拒绝良性查询或对有害查询不安全遵从的问题,提出Health-ORSC-Bench基准,通过31,920个边界提示评估模型在意图模糊下的过度拒绝与安全完成质量,揭示安全优化模型过度拒绝率达80%。

Comments Accepted by ACL'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25819 2026-06-25 cs.CL cs.SE 新提交 50%

Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

超越函数调用:工具环境不可靠性下的工具使用智能体基准测试

Yang Tian, Zhengpeng Shi, Yu Zhou, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出ToolBench-X基准,在工具环境中注入五种可恢复可靠性风险,评估智能体任务完成能力,发现可靠工具下表现良好的智能体在可恢复风险下失败,失败主因是诊断和恢复能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18936 2026-06-25 cs.AI cs.CY 新提交 50%

SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

SciRisk-Bench:面向AI4Science安全的风险维度感知基准

Linghao Feng, Yinqian Sun, Dongqi Liang, Sicheng Shen, Chenfei Yan, Yuxuan Peng, Yilin Zhao, Haibo Tong, Kai Li, FeiFei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive Intelligence Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知智能实验室,自动化研究所,中国科学院,北京,中国) School of Future Technology, University of Chinese Academy of Sciences, China(未来技术学院,中国科学院大学,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(人工智能学院,中国科学院大学,中国) Zhongguancun Academy, China(中关村学院,中国) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Gaoling School of AI, Renmin University of China(甘露人工智能学院,中国人民大学) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院(北京-AISI)) School of Humanities, University of Chinese Academy of Sciences, China(人文学院,中国科学院大学,中国)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出SciRisk-Bench基准,从显式风险维度和科学学科两个角度评估AI4Science安全,覆盖7个学科、31个子学科和10个风险维度,实验揭示主流及科学大模型的安全薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05738 2026-06-25 cs.CL 版本更新 50%

MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language Models

MedLayBench-V:面向医学视觉语言模型中专家与普通人语义对齐的大规模基准

Han Jang, Junhyeok Lee, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University College of Medicine(首尔国立大学医学院) Department of Radiology, Seoul National University Hospital(首尔国立大学医院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院健康人工智能研究所) The Advanced Imaging and Computational Neuroimaging (AICON) Laboratory(先进影像与计算神经影像实验室)

专题命中 医学数据与评测 :medical image(abstract)

AI总结 提出首个大规模多模态基准MedLayBench-V,通过结构化概念基础精炼管道实现专家-普通人语义对齐,用于训练和评估能弥合医患沟通鸿沟的医学视觉语言模型。

Comments Findings of ACL 2026. 9 pages, 5 figures, 11 tables, plus appendix

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 18375-18394

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24672 2026-06-24 cs.AI 新提交 50%

Cost-Optimal Decision Diagrams for Stochastic Boolean Function Evaluation

随机布尔函数评估的代价最优决策图

Xia Zong, Tuomo Lehtonen, Jussi Rintanen

机构 * Aalto University(阿尔托大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对变量代价和概率分布下的命题公式评估,提出首个实用的精确分支定界算法,含变量选择启发式、剪枝和缓存,并证明问题为#P-hard且属于PSPACE。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24200 2026-06-24 cs.CL cs.AI cs.IR 新提交 50%

MMed-Bench-IR: A Heterogeneous Benchmark for Multilingual Medical Information Retrieval

MMed-Bench-IR:多语言医学信息检索的异构基准

Junhyeok Lee, Han Jang, Hyeonjin Goh, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University College of Medicine(首尔国立大学医学院) Seoul National University Hospital(首尔国立大学医院)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 针对临床RAG的多语言检索需求,提出MMed-Bench-IR基准,涵盖跨语言对齐、概念区分和证据检索三种异构任务,评估6种语言下10个系统,发现生物医学编码器在英语与日语间性能差距巨大。

Comments Under review. 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21474 2026-06-23 cs.AI 新提交 50%

Towards Transparent Mental Health Insights: An Explainable AI Model for Career-Related Depression and Anxiety Among University Students Using Structured Data

迈向透明的心理健康洞察:基于结构化数据的可解释AI模型用于大学生职业相关抑郁与焦虑

Arsham Azam, Rasikh Ali, Tayyaba Farhat, Sheeraz Akram

机构 * Faculty of Computer Science and Information Technology, The Superior University(信息科技学院,超凡大学) Intelligent Data Visual Computing Research (IDVCR)(智能数据可视化计算研究组)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出一种结合多模态数据和联邦学习的可解释AI框架,在隐私保护下识别大学生职业相关心理问题早期指标,模型F1达89.12%,并识别出回避直视等关键行为标记。

Comments Accepted at AHTBE 2025 Conference, published in Medical Sciences Forum (MDPI). 18 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21359 2026-06-23 cs.CL 新提交 50%

Finetuning with Scientific Data Increases Hallucinations: A Multi-domain Factuality Evaluation of LLMs

使用科学数据微调会增加幻觉:LLMs的多领域事实性评估

Raia Abu Ahmad, Nikolas Rauscher, Ekaterina Borisova, Fabio Barth, Georg Rehm, Sebastian Möller

机构 * Deutsches Forschungszentrum für Künstliche Intelligenz GmbH(德国人工智能研究中心 GmbH) Technische Universität Berlin(柏林技术大学) Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出SciFactCheck基准和模块化评估框架,发现科学微调模型在所有幻觉类型和科学领域上事实可靠性下降,且内部更不自信但语言更武断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20601 2026-06-23 cs.HC cs.AI 新提交 50%

Zhinong AI: A Design-Science Study of an AI-Enabled Agricultural Decision-Support Platform for Smallholder Production

Zhinong AI:面向小农生产的AI赋能农业决策支持平台的设计科学研究

Zhaoyang Li, Jiaqi Liu, Ruijie Zhang

机构 * University of Sanya(三亚大学) Hebei International Studies University(河北国际关系学院)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文通过设计科学研究,提出了一个集成信息推送、问答、诊断、日历管理等功能的小农决策支持平台,并构建了分层架构、闭环流程、评估指标和治理框架,为AI农业原型转化为可测试、负责任的基础设施提供了结构化研究框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21570 2026-06-23 quant-ph 新提交 50%

A Correlation Aware Quantum Feature Map for Variational Quantum Classification

一种用于变分量子分类的相关感知量子特征映射

Murat Kurt

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出一种相关感知量子特征映射(CAQFM),通过多种相关性度量将特征依赖关系融入量子编码,在三个基准数据集上提升变分量子分类器的分类性能。

Comments 23 Pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18950 2026-06-19 cs.AI 新提交 50%

RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models

RTSGameBench: 视觉语言模型战略推理的RTS基准

San Kim, Daechul Ahn, Reokyoung Kim, Hyeonbeom Choi, Seungyeon Jwa, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出RTSGameBench,基于Beyond All Reason游戏,通过多样化对战、迷你游戏诊断和自进化生成框架,评估视觉语言模型在实时策略游戏中的战略推理能力。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01338 2026-06-19 cs.CL 版本更新 50%

Benchmarking Local LLMs for Natural-Language-to-SQL Querying in Biopharmaceutical Manufacturing: An Empirical Benchmark on Consumer-Grade Hardware

在生物制药制造中本地LLM的自然语言到SQL查询基准测试:消费级硬件上的实证基准

Sagar Bhetwal, Rajan Bastakoti, Nirajan Acharya, Gaurav Kumar Gupta, Ambika Baniya Bhandari

机构 * Department of Computer Science, University of the Cumberlands(大学的计算机科学系) Department of Computer Science, DePaul University(德保罗大学计算机科学系) Youngstown State University(亚当斯州立大学)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本研究评估了四种本地部署的开源大语言模型在生物制药制造数据库上的自然语言到SQL生成性能,发现代码调优的通用模型优于领域特定模型,但当前性能仍需人工监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18203 2026-06-17 cs.CL cs.AI 新提交 50%

RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills

RubricsTree: 面向个人健康代理在健康记忆与医疗技能上的可扩展且不断演进的开放式评估

Weizhi Zhang, Zechen Li, Hamid Palangi, Ben Graef, A. Ali Heydari, Simon A. Lee, Salman Rahman, Ray Luo, Zeinab Esmaeilpour, Erik Schenck, Chloe Zhang, Yamin Li, Menglian Zhou, Philip S. Yu, Daniel McDuff, Lindsey Sunden, Mark Malhotra, Shwetak Patel, Ahmed A. Metwally

机构 * Google Research(谷歌研究院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 医学数据与评测 :healthcare AI(abstract)

AI总结 提出RubricsTree框架,通过专家对齐的层次化分类法(含100多个原子布尔规则)和上下文自适应路由,实现可扩展、可审计且不断演进的开放式评估,在HealthBench上使模型性能提升高达约66%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17815 2026-06-17 cs.CR cs.CL 新提交 50%

Beyond Native Success: Auditing Deployment-Interface Exposure of CLIP Backdoors

超越原生成功:审计CLIP后门的部署接口暴露

Kunlan Xiang, Haomiao Yang, Wenbo Jiang

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出DIFE框架审计CLIP后门在不同部署接口下的暴露情况,发现原生成功不代表全局安全,并引入BadTextTower填补文本编码器后门缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12729 2026-06-17 cs.NI cs.AI cs.CR 版本更新 50%

Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety

用于代理网络运维和AI运维的大型语言模型:架构、评估与安全

Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar

机构 * School of Computing and Communications(计算与通信学院) University of Cambridge(剑桥大学) School of Software(软件学院) Nanjing University of Information Science and Technology(南京信息科技大學) TU Wien(维也纳技术大学) ICREA

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。

Comments 49 pages, 15 figures, 6 tables; survey article

详情

展开后加载摘要…

URL PDF HTML 收藏