arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Imperial College London(帝国理工学院)

2026-05-14 至 2026-05-14 共收录 8
2605.13542 2026-05-14 cs.AI cs.CL cs.LG cs.MA

RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation

RealICU: 大语言模型能否理解长期上下文ICU数据?一个超越行为模仿的基准测试

Chengzhi Shen, Weixiang Shen, Tobias Susetzky, Chen, Chen, Jun Li, Yuyuan Liu, Xuepeng Zhang, Zhenyu Gong, Daniel Rueckert, Jiazhen Pan

机构 * Technical University of Munich(慕尼黑技术大学) TUM University Hospital(TUM大学医院) LMU Munich(慕尼黑大学) University of Sheffield(谢菲尔德大学) University of Oxford(牛津大学) Zhongshan Hospital Fudan University(复旦大学中山医院) Sun Yat-sen University Cancer Center(中山大学肿瘤中心) Imperial College London(伦敦帝国学院) Munich Center for Machine Learning(慕尼黑机器学习中心) relAI – Konrad Zuse School of Excellence in Reliable AI(relAI – 卡诺夫茨卓越可靠人工智能学校)

AI总结 RealICU通过真实ICU场景评估大语言模型的长期上下文理解能力,提出四个医生驱动任务,揭示现有模型在临床推荐中的召回与安全性的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10755 2026-05-14 cs.CV

MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark

MMRareBench: 一种罕见疾病多模态和多图像医学基准

Junzhi Ning, Jiashi Lin, Yingying Fang, Wei Li, Jiyao Liu, Cheng Tang, Chenglong Ma, Wenhao Tang, Tianbin Li, Ziyan Huang, Guang Yang, Junjun He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Imperial College London(帝国理工学院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

AI总结 本文提出MMRareBench,首个评估多模态和多图像临床能力的罕见疾病基准,包含1756个问题-答案对和7958张医学图像,揭示23个MLLMs在多图像任务中表现低下,存在能力稀释效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29475 2026-05-14 cs.LG

Survival In-Context: Amortized Bayesian Survival Analysis via Prior-Fitted Networks

生存上下文:通过先验适应网络实现的 amortized 概率生存分析

Dmitrii Seletkov, Paul Hager, Georgios Kaissis, Rickmer Braren, Daniel Rueckert, Raphael Rehms

机构 * Institute of Diagnostic and Interventional Radiology, Technical University of Munich, Germany(慕尼黑技术大学诊断与介入放射学研究所,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich, Germany(慕尼黑技术大学医疗人工智能与医学研究所,德国) Hasso Plattner Institute for Digital Engineering, University of Potsdam, Germany(波茨坦大学数字工程哈索普兰特纳研究所,德国) University Hospital Hamburg-Eppendorf, Germany(汉堡-埃彭多夫大学医院,德国) Department of Computing, Imperial College London, UK(伦敦帝国理工学院计算系,英国) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心(MCML),德国)

AI总结 本文提出Survival In-Context模型,通过先验适应网络实现生存分析,无需任务特定训练即可进行个性化生存预测,实验证明其在小中等数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24649 2026-05-14 cs.CV

MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows

MedOpenClaw 和 MedFlowBench:在完整研究流程中审计医疗代理

Weixiang Shen, Chengzhi Shen, Yanzhu Hu, Che Liu, Junde Wu, Jiayuan Zhu, Xiao Han, Zongyue Li, Jingpei Wu, Min Xu, Daguang Xu, Yueming Jin, Benedikt Wiestler, Daniel Rueckert, Jiazhen Pan

机构 * Technical University of Munich(慕尼黑技术大学) TUM University Hospital(TUM大学医院) LMU Munich(慕尼黑大学) Imperial College London(伦敦帝国理工学院) University of Oxford(牛津大学) Carnegie Mellon University(卡内基梅隆大学) NVIDIA(NVIDIA公司) National University of Singapore(新加坡国立大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 本文提出 MedFlowBench 和 MedOpenClaw,用于评估医疗影像代理在完整研究流程中生成可审计证据的能力,发现仅依赖答案评分不够,需结合正确证据验证。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13385 2026-05-14 cs.LG

Probabilistic Prediction Markets with Intermittent Contributions

基于间歇性贡献的概率预测市场

Michael Vitali, Pierre Pinson

机构 * Dyson School of Design Engineering, Imperial College London(帝国理工学院伦敦校区设计工程学院) Halfspace, Denmark(丹麦Halfspace公司) Department of Technology, Management and Economics, Technical University of Denmark(丹麦技术大学技术、管理与经济学系) CoRE, Aarhus University(阿arhus大学CoRE)

AI总结 本文提出一种概率预测市场,考虑历史表现、适应时间变化条件,并允许参与者自由进出。通过鲁棒回归模型和收益分配机制,提升预测准确性与经济性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13171 2026-05-14 cs.AI

Formal Conjectures: An Open and Evolving Benchmark for Verified Discovery in Mathematics

形式猜想:一个开放且不断演进的数学验证发现基准

Moritz Firsching, Paul Lezeau, Salvatore Mercuri, Miklós Z. Horváth, Yaël Dillies, Calle Sönne, Eric Wieser, Fred Zhang, Thomas Hubert, Blaise Agüera y Arcas, Pushmeet Kohli

机构 * Google DeepMind(谷歌DeepMind) Imperial College London(帝国理工学院伦敦分校) Stockholms universitet(斯德哥尔摩大学)

AI总结 Formal Conjectures提供2615个形式化的数学问题,包含1029个开放猜想和836个已解决问题,用于评估自动化推理系统的能力,并通过协作项目确保正确性,推动数学证明发现的进展。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12814 2026-05-14 cs.SI cs.CL

Linking Extreme Discourse to Structural Polarization in Signed Interaction Networks

将极端言论与结构极化联系起来:在带符号交互网络中

Zhijin Guo, Li Zhang, Tyler Bonnet, Janet B. Pierrehumbert, Xiaowen Dong

机构 * University of Oxford(牛津大学) University College London(伦敦大学学院) Imperial College London(伦敦帝国学院)

AI总结 本文提出一种基于语言的带符号网络框架,通过LLM立场评分生成连续符号边权重,并利用两种互补指标量化结构极化,分析Reddit Brexit讨论中话语信号与结构极化的时间变化关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12942 2026-05-14 cs.CL cs.AI cs.LG

A3 : an Analytical Low-Rank Approximation Framework for Attention

A3:一种用于注意力机制的分析低秩近似框架

Jeffrey T. H. Wong, Cheng Zhang, Xinye Cao, Pedro Gimenes, Christos-Savvas Bouganis, George A. Constantinides, Wayne Luk, Yiren Zhao

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院伦敦校区电子与电气工程系)

AI总结 本文提出A3框架,通过将Transformer层分为QK、OV和MLP三个组件,提供分析解以减少隐藏维度并最小化功能损失,从而在不引入运行时开销的情况下降低模型大小、KV缓存大小和FLOPs,实验显示其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏