arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Oxford(牛津大学)

2026-06-16 至 2026-06-16 共收录 8
2411.05824 2026-06-16 eess.IV cs.CV cs.LG 版本更新

Navigating Distribution Shifts in Medical Image Analysis: A Survey

医学图像分析中的分布偏移导航:综述

Zixian Su, Jingwei Guo, Xi Yang, Qiufeng Wang, Frans Coenen, Amir Hussain, Kaizhu Huang

机构 * Life Simulation Research Center, Beijing Academy of Artificial Intelligence(北京人工智能生命模拟研究中心) Electrical and Mathematical Sciences and Engineering Division, King Abdullah University of Science and Technology(王国阿卜杜勒·阿齐兹国王科技大学电气与数学科学与工程系) Department of Intelligent Science, School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院智能科学系) Computer Science, School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) SDAIA-KFUPM Joint Research Centre for Artificial Intelligence, King Fahd University of Petroleum and Minerals(法赫德石油与矿物大学人工智能SDAIA-KFUPM联合研究中心) Nuffield Department of Primary Care Health Sciences, University of Oxford(牛津大学初级保健健康科学努尔菲尔德部门)

AI总结 本文系统综述了应对医学图像分析中分布偏移的深度学习方法,按临床约束分类为联合训练、联邦学习、微调和域泛化,并揭示方法从显式对齐向不确定性建模的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12670 2026-06-16 cs.AI 版本更新

SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks

SkillsBench: 基准测试智能体技能在不同任务中的有效性

Xiangyi Li, Yimin Liu, Wenbo Chen, Bingran You, Zonglin Di, Yifeng He, Shenghan Zheng, Kyoung Whan Choe, Jiankai Sun, Shuyi Wang, Chujun Tao, Binxu Li, Xuandong Zhao, Hejia Geng, Xiaojun Wu, Junwei Zhou, Xiaokun Chen, Hanwen Xing, Yubo Li, Qunhong Zeng, Di Wang, Yuanli Wang, Roey Ben Chaim, Penghao Jiang, Haotian Shen, Luyang Kong, Xinyi Liu, Runhui Wang, Xuanqing Liu, Jiachen Li, Xin Lan, Yueqian Lin, Wengao Ye, Junwei He, Songlin Li, Yue Zhang, Yipeng Gao, Yijiang Li, Ze Ma, Liqiang Jing, Tianyu Wang, Kaixin Li, Yiqi Xue, Haoran Lyu, Yizhuo He, Yuchen Tian, Shutong Wu, Bowei Wang, Yixuan Gao, Bo Chen, Litong Liu, Sikai Cheng, Jiajun Bao, Shuaicheng Tong, Shuwen Xu, Terry Yue Zhuo, Tinghan Ye, Qi Qi, Miao Li, Longtai Liao, Zelin Tan, Chang Shi, Xilin Tang, Srinath Tankasala, Boqin Yuan, Yaoyao Qian, Jianhong Tu, Chenguang Wang, Yizhou Sun, Wei Wang, Aaron Taylor, Ziyue Yang, Changkun Guan, Zhikang Dong, Xinyu Zhang, Steven Dillmann, Han-chung Lee, Dawn Song

机构 * BenchFlow OSU Amazon UC Berkeley UC Santa Cruz UC Davis Dartmouth RLWRLD Independent Princeton University Oxford University Stanford University USC CMU Foxconn Zenity UNSW UT Austin MSU Duke University ByteDance UT Dallas UC San Diego Columbia University University of Rochester Cornell Tech Georgia Tech Cornell University NEU UCLA Snap Inc. Fanshawe College University of Science and Technology of China HKUST(GZ) Anyscale

AI总结 提出SkillsBench基准,包含8领域87个任务,通过配对评估证明技能提升平均通过率16.6个百分点,小模型配备技能可匹敌大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16902 2026-06-16 cs.AI cs.LG 版本更新

LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?

LLM-WikiRace 基准测试:大语言模型在真实知识图谱上的规划能力有多强?

Juliusz Ziomek, William Bankes, Lorenz Wolf, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

机构 * University of Oxford, UK(牛津大学,英国) University College London (Centre for AI), UK(伦敦大学学院(人工智能中心),英国) University of Basel, Switzerland(巴塞尔大学,瑞士)

AI总结 提出 LLM-Wikirace 基准,通过维基百科超链接导航任务评估大语言模型的规划、推理与世界知识,发现模型在简单任务上超人类,但困难任务成功率仅 23%,且规划与长程推理是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08026 2026-06-16 cs.LG stat.ML 版本更新

Sharp analysis of linear ensemble sampling

线性集成采样的尖锐分析

David Janz, Arya Akhavan, Csaba Szepesvári

机构 * University of Oxford, UK(牛津大学,英国) University of Alberta, Canada(阿尔伯塔大学,加拿大)

AI总结 本文针对随机线性bandits中的线性集成采样(ES)方法,证明当集成大小m=Θ(d log n)时,ES达到~O(d^{3/2}√n)的高概率遗憾,缩小了与汤普森采样基准的差距,同时保持计算量相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05779 2026-06-16 cs.LG cs.IT math.IT 版本更新

How Controlling the Variance can Improve Training Stability of Sparsely Activated DNNs and CNNs

如何控制方差以提高稀疏激活DNN和CNN的训练稳定性

Emily Dent, Jared Tanner

机构 * Mathematical Institute University of Oxford(牛津大学数学研究所)

AI总结 针对稀疏激活函数,提出增大高斯过程方差可提升训练稳定性,并设计新初始化策略实现隐藏层高达90%稀疏度的稳定训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00885 2026-06-16 cs.CV 版本更新

HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamics

HanDyVQA:面向细粒度手-物交互动态的视频问答基准

Masatoshi Tateno, Gido Kato, Hirokatsu Kataoka, Yoichi Sato, Takuma Yagi

机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) Waseda University(早稻田大学) Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

AI总结 提出HanDyVQA基准,通过六类问题(11.1K QA对)和10.3K分割掩码,全面评估视频模型对手-物交互中操作与效果的细粒度时空推理能力,发现最佳模型Gemini-2.5-Pro仅73%准确率(人类97%)。

Comments CVPR 2026, Project page: https://masatate.github.io/HanDyVQA-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17431 2026-06-16 cs.CL 版本更新

Agentic Reinforcement Learning for Search Misaligns Instruction-Tuning

用于搜索的智能体强化学习使指令微调对齐失效

Yushi Yang, Shreyansh Padarha, Sarah Ball, Andrew Lee, Adam Mahdi

机构 * University of Oxford(牛津大学) Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) Harvard University(哈佛大学)

AI总结 研究智能体强化学习(RL)对指令微调模型对齐的影响,发现RL训练使模型将有害请求转化为良性搜索查询,但在触发条件下产生多步不安全搜索行为,并提出了基于表示引导的RL训练方法恢复对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05370 2026-06-16 cs.LG 版本更新

Imbalanced Semi-Supervised Learning via Label Refinement and Threshold Adjustment

通过标签精炼和阈值调整实现不平衡半监督学习

Zeju Li, Ying-Qiu Zheng, Chen Chen, Saad Jbabdi

机构 * College of Biomedical Engineering, Fudan University, Shanghai, China(复旦大学生物医学工程学院,上海,中国) FMRIB Centre, Oxford Centre for Integrative Neuroimaging (OxCIN), University of Oxford, Oxford, UK(牛津大学FMRIB研究中心,牛津大学整合神经影像中心(OxCIN),牛津,英国) School of Computer Science, University of Sheffield, Sheffield, UK(谢菲尔德大学计算机科学学院,谢菲尔德,英国) Department of Engineering Science, University of Oxford, Oxford, UK(牛津大学工程科学系,牛津,英国)

AI总结 针对半监督学习在类别不平衡数据上性能下降的问题,提出SEVAL框架,通过从类别平衡的子集学习标签精炼和阈值调整参数,联合优化生成更准确的伪标签,在多种不平衡场景下超越现有方法。

Comments Accepted by Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏