arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Oxford(牛津大学)

2026-08-04 至 2026-08-04 共收录 8
2608.02171 2026-08-04 cs.AI 新提交

From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents

从分析到综合:个性化大语言模型智能体中的隐式行为对齐基准测试

Jiajia Song, Bobo Li, Haiwen Yi, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) University of Oxford(牛津大学)

AI总结 该研究针对大语言模型智能体的个性化问题,构建了IBA-Bench基准,提出IBA-Agent框架,实验显示其可在九类场景中提升隐式行为对齐效果,但有效个性化仍是重大挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01575 2026-08-04 cs.LG cs.AI 新提交

Measuring in-context algorithmic reasoning in language models against an exact Bayes-optimal standard

基于精确贝叶斯最优标准测量语言模型的上下文内算法推理能力

Hector Zenil, Luan Ozelim

机构 * Oxford Immune Algorithmics(牛津免疫算法学公司) Oxford University Innovation(牛津大学创新公司) London Institute for Healthcare Engineering(伦敦医疗工程研究所) King’s College London(伦敦国王学院)

AI总结 本研究提出F-ICL基准,以精确贝叶斯最优标准测量语言模型的上下文内算法推理能力,发现多数模型分布与最优标准存在差距,该差距与准确率无关且不受模型规模缩小,基准已开放。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01460 2026-08-04 cs.LG 新提交

Conformalized Large Language Models under Configuration Shift

配置偏移下的共形大语言模型

Yuqicheng Zhu, Jialin Yu, Lin Li, Gengyuan Zhang, Zhen Yang, Steffen Staab, Puneet Dokania, Philip Torr, Jie Tang, Evgeny Kharlamov

机构 * University of Stuttgart(斯图加特大学) Robert Bosch GmbH(罗伯特·博世有限公司) University of Oxford(牛津大学) LMU Munich(慕尼黑大学) Tsinghua University(清华大学) University of Southampton(南安普顿大学) University of Oslo(奥斯陆大学)

AI总结 该研究针对配置偏移对共形大语言模型有效性的影响展开系统分析,通过多维度实证研究揭示其削弱覆盖率的问题,提出两种实用缓解措施以恢复覆盖率并保留效率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01370 2026-08-04 cs.CV 新提交

Understanding Synergistic Interactions among Pathology Foundation Models via Adaptive Fusion

通过自适应融合理解病理基础模型间的协同交互作用

Yuxiang Xiao, Yang Hu, Bin Li, Tianyang Zhang, Zexi Li, Huazhu Fu, Jens Rittscher, Kaixiang Yang

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) Leicester Cancer Research Centre, University of Leicester(莱斯特大学莱斯特癌症研究中心) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Nuffield Department of Medicine, University of Oxford(牛津大学纳菲尔德医学院) A*STAR, Singapore(新加坡科技研究局)

AI总结 本研究针对病理基础模型存在的表示偏差问题,提出AdaFusion自适应融合框架,在三个公共基准上验证其性能优于单个模型及其他融合方法,还可提供可解释的组织可视化。

Comments 11 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01356 2026-08-04 cs.CV 新提交

Harnessing Adversarial Distillation to Customise Debiased, Disease-Specific Pathology Foundation Models for Breast Cancer

利用对抗蒸馏定制去偏差的、针对乳腺癌的疾病专用病理学基础模型

Zhiwei Chen, Yang Hu, Yuxiang Xiao, Yakun Ju, Tianyang Zhang, Yingxue Xu, Wei Li, Hao Chen, Jens Rittscher, Kaixiang Yang

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) Leicester Cancer Research Centre, University of Leicester(莱斯特大学莱斯特癌症研究中心) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Nuffield Department of Medicine, University of Oxford(牛津大学纳菲尔德医学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程学系) ZoyMed(佐医医疗(ZoyMed))

AI总结 本研究提出SmartStu框架,通过多教师集成蒸馏与对抗蒸馏等技术,定制出比通用PFMs小30倍以上且性能相当的乳腺癌专用病理学基础模型。

Comments 11 pages, 2 figures, 2 tables. Accepted to MICCAI 2026 (early accept)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00490 2026-08-04 cs.CV 新提交

Image-Space Rule Discovery

图像空间中的规则发现

Misora Sugiyama, Toya Oyama, Hirokatsu Kataoka

机构 * The University of Tokyo(东京大学) National Institute of Advanced Industrial Science and Technology (AIST)(独立行政法人产业技术综合研究所) University of Oxford(牛津大学)

AI总结 本研究提出WISRD基准测试图像编辑模型的图像空间规则发现能力,发现Nano Banana Pro表现最优,当前模型可部分依赖图像内指令,且该模型在4×4数独等任务上有一定性能。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00355 2026-08-04 cs.CL cs.LG 新提交

CurveShift: Is Agent Progress Scalar? Separating Level from Shape

CurveShift:智能体的进展是标量吗?区分水平与形态

Hanwen Xing, Pengyun Wang, BingXu Meng, Kumail Alhamoud, Xiang Li, Jicheng Wang, Xin Yu, Xinyang Han, Xiaomin Li, Philip Torr, Yuexing Hao

机构 * University of Southern California(南加利福尼亚大学) University of Chicago(芝加哥大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) University of California, Davis(加利福尼亚大学戴维斯分校) Pennsylvania State University(宾夕法尼亚州立大学) Harvard University(哈佛大学) University of Oxford(牛津大学)

AI总结 该研究针对大型语言模型进展的标量总结问题,通过LiveCodeBench基准分离混淆,发现2024年9月后发布的模型在竞赛编程难任务上有超出预期的增益,发布了相关数据集与代码。

Comments 25 pages, 4 figures, 7 tables. Data and code: https://github.com/harvenstar/CurveShift

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00198 2026-08-04 cs.LG 新提交

AutoCause: A Python framework that automates expert decisions in environmental time-series causal discovery

AutoCause:一个自动化环境时间序列因果发现领域专家决策的Python框架

Marco Ruiz, Miguel Arana-Catania, David R. Ardila, Rodrigo Ventura

机构 * ISR-Lisbon, Instituto Superior Técnico(里斯本信号与系统研究所,里斯本高等理工学院) Digital Scholarship at Oxford, University of Oxford(牛津大学牛津数字学术中心) Jet Propulsion Lab., Caltech(加州理工学院喷气推进实验室)

AI总结 AutoCause是一款开源Python框架,通过封装四种因果发现方法、添加参考模型并分级链接,实现环境时间序列因果发现中专家决策的自动化,提升分析的可审计性与可重复性。

Comments 33 pages, 10 figures. Submitted to Environmental Modelling & Software

详情

展开后加载摘要…

URL PDF HTML 收藏