arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Edinburgh(爱丁堡大学)

共收录 73
2502.19544 2026-06-16 cs.LG cs.RO 版本更新

Efficient Reinforcement Learning by Guiding World Models with Non-Curated Data

通过非策划数据引导世界模型的高效强化学习

Yi Zhao, Aidan Scannell, Wenshuai Zhao, Yuxin Hou, Tianyu Cui, Le Chen, Dieter Büchler, Arno Solin, Juho Kannala, Joni Pajarinen

机构 * Aalto University(阿alto大学) University of Edinburgh(爱丁堡大学) ELLIS Institute Finland(芬兰ELLIS研究所) Deep Render Imperial College London(伦敦帝国理工学院) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) CIFAR AI Chair(CIFAR人工智能主席) University of Alberta(阿尔伯塔大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所(Amii)) University of Oulu(奥卢大学)

AI总结 提出利用无奖励、混合质量、多本体的非策划离线数据,通过经验回放和执行引导技术解决分布偏移问题,显著提升在线强化学习的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04021 2026-06-12 cs.DC cs.AI cs.LG cs.PF 版本更新

Prism: Cost-Efficient Multi-LLM Serving via GPU Memory Ballooning

Prism: 通过GPU内存气球实现经济高效的多LLM服务

Shan Yu, Yifan Qiao, Mingyuan Ma, Yangmin Li, Shuo Yang, Xinyuan Tong, Yang Wang, Zhiqiang Xie, Yuwei An, Shiyi Cao, Ke Bao, Deepak Vij, Xiaoning Ding, Yichen Wang, Qingda Lu, Zhong Wang, Gao Gao, Harry Xu, Junyi Shu, Jiarong Xing, Ying Sheng

机构 * UCLA(加州大学洛杉矶分校) UC Berkeley(伯克利加州大学) Harvard University(哈佛大学) CMU(卡内基梅隆大学) University of Edinburgh(爱丁堡大学) Intel(英特尔) Stanford University(斯坦福大学) LMSYS(灵州市系统实验室) ByteDance(字节跳动) Alibaba Cloud(阿里云) Tsinghua University(清华大学) Novita AI Rice University(里士满大学)

AI总结 针对多LLM服务中资源效率低下的问题,提出基于内存气球的内存中心化LLM协同服务框架Prism,统一空间与时间共享,已在10K+ GPU生产环境部署。

Comments OSDI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08558 2026-06-11 cs.LG stat.ML 版本更新

Impact of Connectivity on Laplacian Representations in Reinforcement Learning

连通性对强化学习中拉普拉斯表示的影响

Tommaso Giorgi, Pierriccardo Olivieri, Keyue Jiang, Laura Toni, Matteo Papini

机构 * University of Edinburgh(爱丁堡大学)

AI总结 本文研究了连通性对强化学习中拉普拉斯表示的误差影响,通过分析状态图的代数连通性,推导了线性价值函数近似误差的上界,并展示了表示学习管道中的端到端误差分解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09809 2026-06-10 cs.AI 版本更新

Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting

评估卡:AI评估报告的解释层

Avijit Ghosh, Anka Reuel, Jenny Chim, Wm. Matthew Kennedy, Srishti Yadav, Jennifer Mickel, Yanan Long, Andrew Tran, Anastassia Kornilova, Damian Stachura, Kevin Klyman, Felix Friedrich, Jeba Sania, Jan Batzner, Anoop Mishra, Eliya Habba, Yixiong Hao, Nathan Heath, Shalaleh Rismani, Usman Gohar, Andrea Loehr, David Manheim, Ruchira Dhar, Sree Harsha Nelaturu, Aarush Sinha, Leshem Choshen, Drishti Sharma, Ishan Khire, Amit Saha, Subramanyam Sahoo, Michael Hardy, Michael Alexander Riegler, Kabir Manghnani, Michelle Lin, Yanan Jiang, Yilin Huang, Asaf Yehudai, Jessica Ji, Aris Hofmann, Mubashara Akhtar, Max Lamparth, Nuno Moniz, Yacine Jernite, Stella Biderman, Zeerak Talat, Sanmi Koyejo, Mykel Kochenderfer, Irene Solaiman

机构 * Hugging Face Stanford University(斯坦福大学) Queen Mary University of London(伦敦玛丽女王大学) University of Copenhagen(哥本哈根大学) Trustible EleutherAI TU Darmstadt(达姆施塔特工业大学) Weizenbaum Institute & Technical University of Munich(魏森鲍姆研究所与慕尼黑工业大学) Harvard University(哈佛大学) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Iowa State University(爱荷华州立大学) IBM Research(IBM研究院) University of Chicago(芝加哥大学) Independent(独立) Berkeley AI Safety Institute (BASIS)(伯克利人工智能安全研究所) Simula University of Edinburgh(爱丁堡大学) ETH Zurich & ETH AI Center(苏黎世联邦理工学院与ETH AI中心) Oxford Internet Institute(牛津互联网研究所) Amherst College(阿默斯特学院) University of Nebraska(内布拉斯加大学) Syntony Research McGill University(麦吉尔大学) Evals Consensus Israel Institute of Technology(以色列理工学院) IOL.Learn & Zuse Institute Berlin(IOL.Learn与柏林祖泽研究所) Georgia Institute of Technology(佐治亚理工学院) Quebec AI Institute, Université de Montréal(魁北克人工智能研究所,蒙特利尔大学) University of Notre Dame(圣母大学) Georgetown University(乔治城大学) DHBW Stuttgart(斯图加特双元制大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 针对AI评估报告不一致的问题,提出EvalCards作为统一记录层,通过结构化模式、四种解释信号和监控工具,覆盖5816个模型和635个基准,揭示报告实践中的系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01951 2026-06-10 cs.CV 版本更新

Enabling Progressive Whole-slide Image Analysis with Multi-scale Pyramidal Network

利用多尺度金字塔网络实现渐进式全切片图像分析

Shuyang Wu, Yifu Qiu, Ines P Nearchou, Sandrine Prost, Jonathan A Fallowfield, Hakan Bilen, Timothy J Kendall

机构 * Institute for Regeneration and Repair, University of Edinburgh(再生与修复研究所,爱丁堡大学) School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) Indica Labs, 8700 Education Pl NW, Bldg. B Albuquerque, US(Indica实验室,美国阿尔伯克基8700教育大道西北区B座) Medical School, University of St Andrews(医学学校,圣安德鲁大学)

AI总结 提出多尺度金字塔网络(MSPN),一种即插即用模块,仅使用单一高倍输入实现渐进式多尺度全切片图像分析,通过网格重映射和粗引导网络学习粗粒度上下文,在多个任务和框架上一致提升MIL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02240 2026-06-10 cs.CL 版本更新

Lightweight Latent Reasoning for Narrative Tasks

面向叙事任务的轻量级潜在推理

Alexander Gurung, Esmeralda S. Whitammer, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) CIFAR Fellow

AI总结 提出LiteReason方法,通过轻量级推理投影器生成连续潜在令牌,在强化学习中动态切换潜在与离散推理,将推理长度减少77-92%,同时保持接近非潜在RL的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00358 2026-06-09 cs.CL cs.CV 版本更新

From Backward Spreading to Forward Replay: Revisiting Target Construction in LLM Parameter Editing

从反向传播到正向回放:重新审视LLM参数编辑中的目标构造

Wei Liu, Hongkai Liu, Zhiying Deng, Yee Whye Teh, Wee Sun Lee

机构 * University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学)

AI总结 本文重新审视LLM参数编辑中的目标构造,提出一种更简洁的替代方法,通过正向传播代替反向传播,提高目标隐藏状态的准确性和兼容性。

Comments ICML 2026, code: https://github.com/jugechengzi/FE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25781 2026-06-09 cs.CV cs.GR 版本更新

Sketch2Arti: Sketch-based Articulation Modeling of CAD Objects

Sketch2Arti:基于草图的CAD物体关节建模

Yi Yang, Hao Pan, Yijing Cui, Alla Sheffer, Changjian Li

机构 * University of Edinburgh(爱丁堡大学) Tsinghua University(清华大学) University of British Columbia(不列颠哥伦比亚大学)

AI总结 提出Sketch2Arti系统,通过用户从选定视角绘制的2D草图,自动发现CAD模型中的可动部件并预测其运动参数,支持复杂物体的多关节迭代建模,无需类别信息且可推广到多样物体。

Comments Project page: https://arlo-yang.github.io/Sketch2Arti

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08724 2026-06-09 cs.LG 版本更新

Exposing Hidden Biases in Text-to-Image Models via Automated Prompt Search

通过自动化提示搜索暴露文本到图像模型中的隐藏偏见

Manos Plitsis, Giorgos Bouritsas, Vassilis Katsouros, Yannis Panagakis

机构 * University of Edinburgh(爱丁堡大学)

AI总结 本文提出Bias-Guided Prompt Search框架,通过自动生成提示最大化图像偏见,揭示文本到图像模型中的隐藏偏见,提升公平性评估。

Comments ICML 2026. Code is here: https://github.com/manosplitsis/BGPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15829 2026-06-09 cs.LG 版本更新

Operationalising the Superficial Alignment Hypothesis via Task Complexity

通过任务复杂度操作化浅层对齐假设

Tomás Vergara-Browne, Darshan Patil, Ivan Titov, Siva Reddy, Tiago Pimentel, Marius Mosbach

机构 * University of Maryland(马里兰大学) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学) University of Edinburgh(爱丁堡大学)

AI总结 提出任务复杂度指标(达到目标性能的最短程序长度)来量化浅层对齐假设,实验表明预训练大幅降低任务复杂度,而微调可将复杂度降低数个数量级。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18676 2026-06-09 cs.CV cs.AI 版本更新

MedVision: Benchmarking Quantitative Medical Image Analysis

MedVision:定量医学图像分析的基准测试

Yongcheng Yao, Yongshuo Zong, Raman Dutt, Yongxin Yang, Sotirios A Tsaftaris, Timothy Hospedales

机构 * University of Edinburgh(爱丁堡大学) Queen Mary University of London(伦敦大学玛丽女王学院)

AI总结 针对当前医学视觉语言模型缺乏定量推理能力的问题,提出MedVision数据集和基准,涵盖22个公共数据集、3080万图像-标注对,通过监督和强化微调显著提升检测、肿瘤/病变大小估计和角度/距离测量性能。

Comments 22 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10832 2026-06-08 cs.CL 版本更新

Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents

面向视觉原生多模态深度搜索智能体的在策略数据演化

Shijue Huang, Hangyu Guo, Guanting Dong, Chenxin Li, Junting Lu, Xinyu Geng, Zhaochen Su, Zhenyu Li, Shuang Chen, Hongru Wang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tsinghua University(清华大学) University of Edinburgh(爱丁堡大学)

AI总结 提出在策略数据演化(ODE)框架,通过图像库引用协议和闭环数据生成器,解决多模态深度搜索中视觉证据不可复用和训练数据静态问题,在8个基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21407 2026-06-08 cs.LG stat.CO stat.ML 版本更新

Even More Guarantees for Variational Inference in the Presence of Symmetries

变分推断在对称性存在下的更多保证

Lena Zellinger, Antonio Vergari

机构 * School of Informatics(信息学院) University of Edinburgh(爱丁堡大学)

AI总结 本文扩展了变分推断在目标对称性下的鲁棒性理论,证明了使用前向KL散度和α-散度时,即使模型误设也能精确恢复目标均值和相关矩阵,并放宽了对数凹假设,适用于多模态分布。

Comments Accepted for presentation at the OPTIMAL Workshop at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏