arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Oxford(牛津大学)

共收录 1445
2604.15344 2026-04-20 cs.HC cs.AI cs.IR cs.LG

To LLM, or Not to LLM: How Designers and Developers Navigate LLMs as Tools or Teammates

对LLM而言,是使用还是不使用:设计师和开发者如何将LLM视为工具或队友

Varad Vishwarupe, Ivan Flechais, Nigel Shadbolt, Marina Jirotka

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系)

AI总结 研究探讨了设计师和开发者在系统设计过程中如何将LLM视为工具或队友,分析了角色框架对决策权、问责制、监督策略和组织接受度的影响。

Comments 6 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15327 2026-04-20 cs.HC cs.AI

Eco-Bee: A Personalised Multi-Modal Agent for Advancing Student Climate Awareness and Sustainable Behaviour in Campus Ecosystems

Eco-Bee:一种面向校园生态系统的个性化多模态代理,用于提升学生气候意识和可持续行为

Caleb Adu, Neil Kapadia, Binhe Liu, Jonathan Randall, Sruthi Viswanathan

机构 * University of Hull(赫尔大学) The Spaceship Academy(太空学院) City St George’s, University of London(伦敦大学城市学院) King’s College London(伦敦国王学院) Lancaster University(兰卡斯特大学) University of Oxford(牛津大学)

AI总结 Eco-Bee通过整合大语言模型、行星边界框架(Eco-Score)和对话代理,为学生提供个性化反馈和行为激励,推动校园可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21950 2026-04-20 cs.CL

MEDSYN: Benchmarking Multi-EviDence SYNthesis in Complex Clinical Cases for Multimodal Large Language Models

MEDSYN:多证据合成在复杂临床病例中的基准测试用于多模态大语言模型

Boqi Chen, Xudong Liu, Jiachuan Peng, Marianne Frey-Marti, Bang Zheng, Kyle Lam, Lin Li, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克人工智能研究所) Amazon(亚马逊) University of Oxford(牛津大学) University of Bern(伯尔尼大学) Imperial College London(伦敦帝国理工学院) Peking University(北京大学)

AI总结 MEDSYN是一个多语言、多模态的复杂临床病例基准测试,用于评估多模态大语言模型在差分诊断和最终诊断中的表现,揭示模型在异质临床证据合成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13088 2026-04-20 cs.CY cs.AI

Puppets or partners? Governing cyborg propaganda in the digital public square

傀儡还是伙伴?数字公共广场中的人机混合宣传的治理

Jonas R. Kunst, Kinga Bierwiaczonek, Meeyoung Cha, Omid V. Ebrahimi, Marc Fawcett-Atkinson, Asbjørn Følstad, Anton Gollwitzer, Nils Köbis, Gary Marcus, Jon Roozenbeek, Daniel Thilo Schroeder, Jay J. Van Bavel, Sander van der Linden, Rory White, Live Leonhardsen Wilhelmsen

机构 * BI Norwegian Business School(BI挪威商学院) University of York(约克大学) Max Planck Institute for Security and Privacy(安全与隐私研究所) Oxford University(牛津大学) Canada’s National Observer(加拿大的国家观察者) SINTEF Research Center Trustworthy Data Science and Security, University Duisburg-Essen(可信数据科学与安全研究中心,杜伊斯堡-埃森大学) Max Planck Institute for Human Development(人类发展研究所) New York University(纽约大学) University of Cambridge(剑桥大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Norwegian School of Economics(挪威经济学院)

AI总结 本文探讨了人机混合宣传对民主讨论的影响,提出三种监管措施,并分析民主与非民主国家在治理上的差异。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15066 2026-04-17 cs.LG cs.AI cs.MM

Time-RA: Towards Time Series Reasoning for Anomaly Diagnosis with LLM Feedback

Time-RA:面向时间序列推理的异常诊断方法:基于LLM反馈

Yiyuan Yang, Zichuan Liu, Lei Song, Kai Ying, Zhiguang Wang, Tom Bamford, Svitlana Vyetrenko, Jiang Bian, Qingsong Wen

机构 * University of Oxford(牛津大学) Nanjing University(南京大学) MSRA(微软研究院) SJTU(上海交通大学) Abel AI Outsampler University of Strasbourg(斯特拉斯堡大学) Squirrel Ai Learning(Squirrel AI学习)

AI总结 本文提出Time-RA,通过引入RATs40K多模态数据集,改进时间序列异常检测的生成式推理方法,提升诊断准确性和解释性,实现可解释的多模态时间序列分析。

Comments ACL 2026 Findings. 27 pages, 11 figures, 15 tables. Code and dataset are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14652 2026-04-17 cs.RO

DigiForest: Digital Analytics and Robotics for Sustainable Forestry

DigiForest: 数字分析与机器人技术用于可持续林业

Marco Camurri, Enrico Tomelleri, Matías Mattamala, Sebastián Barbas Laina, Martin Jacquet, Jens Behley, Sunni Kanta Prasad Kushwaha, Fang Nan, Nived Chebrolu, Leonard Freißmuth, Marvin Chayton Harms, Meher V. R. Malladi, Fan Yang, Jonas Frey, Cesar Cadena, Marco Hutter, Janine Schweier, Kostas Alexis, Cyrill Stachniss, Maurice Fallon, Stefan Leutenegger

机构 * Dipartimento di Ingegneria Industriale, University of Trento(工业工程系,特伦托大学) Faculty of Engineering, Free University of Bozen-Bolzano(工程学院,博兹纳-博尔扎诺自由大学) Faculty of Agricultural, Environmental and Food Sciences, Free University of Bozen-Bolzano(农业、环境与食品科学学院,博兹纳-博尔扎诺自由大学) Competence Centre for Mountain Innovation Ecosystems(山地创新生态系统研究中心) School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) Technical University of Munich, School of Computation, Information and Technology(慕尼黑技术大学,计算、信息与技术学院) Department of Engineering Cybernetics, Norwegian University of Science and Technology(工程 cybernetics 系,挪威科学技术大学) Center for Robotics, University of Bonn(机器人中心,波恩大学) Swiss Federal Research Institute WSL(瑞士联邦研究 institute WSL) Oxford Robotics Institute, Department of Engineering Science, University of Oxford(牛津大学机器人研究所,工程科学系) Mobile Robotics Lab, ETH Zürich, Department of Mechanical and Process Engineering(移动机器人实验室,苏黎世联邦理工学院机械与过程工程系)

AI总结 DigiForest通过数字技术和自主机器人实现大规模精准林业,包含自主机器人数据采集、自动提取树种特征、决策支持系统和低影响选择性采伐,已在芬兰、英国和瑞士等地验证。

Comments 34 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04930 2026-04-17 cs.CR cs.AI

Attack Selection Reduces Safety in Concentrated AI Control Settings against Trusted Monitoring

攻击选择降低集中AI控制设置中对可信监控的安全性

Joachim Schaeffer, Arjun Khandelwal, Tyler Tracy

机构 * Pivotal Research(Pivotal研究) University of Oxford(牛津大学) Redwood Research(Redwood研究)

AI总结 研究攻击选择如何通过映射攻击到质量评分和提交概率影响安全性能,发现FPR对安全影响更大,提示需谨慎评估模型攻击能力以避免安全评分过高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14140 2026-04-16 cs.LG cs.AI

LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning

LongCoT:长周期链式推理基准测试

Sumeet Ramesh Motwani, Daniel Nichols, Charles London, Peggy Li, Fabio Pizzati, Acer Blake, Hasan Hammoud, Tavish McDonald, Akshat Naik, Alesia Ivanova, Vignesh Baskaran, Ivan Laptev, Ruben Glatt, Tal Ben-Nun, Philip Torr, Natasha Jaques, Ameya Prabhu, Brian Bartoldson, Bhavya Kailkhura, Christian Schroeder de Witt

机构 * University of Oxford(牛津大学) Lawrence Livermore National Laboratory (LLNL)(劳伦斯利弗莫尔国家实验室) University of Washington(华盛顿大学)

AI总结 LongCoT通过2500个专家设计的问题评估长周期链式推理能力,揭示前沿模型在长时间推理中的不足。

Comments Long-Horizon Reasoning Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19315 2026-04-16 cs.RO cs.AI

Online Navigation Planning for Long-term Autonomous Operation of Underwater Gliders

长期自主运行的水下滑翔机在线导航规划

Victor-Alexandru Darvariu, Charlotte Z. Reed, Jan Stratmann, Bruno Lacerda, Benjamin Allsup, Stephen Woodward, Elizabeth Siddle, Trishna Saeharaseelan, Owain Jones, Dan Jones, Tobias Ferreira, Chloe Baker, Kevin Chaplin, James Kirk, Ashley Iceton-Morris, Ryan D. Patmore, Jeff Polton, Charlotte Williams, Christopher D. J. Auckland, Rob A. Hall, Alexandra Kokkinaki, Alvaro Lorenzo Lopez, Justin J. H. Buck, Nick Hawes

机构 * Oxford Robotics Institute(牛津机器人研究所) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Optiver(Optiver公司) Stateful Robotics(Stateful Robotics公司) National Oceanography Centre(国家海洋研究中心) School of Environmental Sciences, University of East Anglia(东安格利亚大学环境科学学院) Scottish Association for Marine Science(苏格兰海洋科学协会)

AI总结 本文提出基于蒙特卡洛树搜索的在线导航规划方法,通过物理信息模拟器生成样本,实现水下滑翔机在不确定环境下的自主规划,提升任务持续时间和路径长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04995 2026-04-16 cs.LG cs.NA math.NA

Power Transform Revisited: Numerically Stable, and Federated

幂变换再审视:数值稳定且联邦学习

Xuefeng Xu, Graham Cormode

机构 * University of Warwick(沃里克大学) University of Oxford(牛津大学)

AI总结 本文研究幂变换的数值稳定性问题,提出改进方法,并将其扩展到联邦学习场景,提升稳定性和鲁棒性。

Comments AISTATS 2026. 24 pages, 17 figures, 4 tables. Project page see https://xuefeng-xu.github.io/powertf.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12663 2026-04-15 cs.AI

Human-Centric Topic Modeling with Goal-Prompted Contrastive Learning and Optimal Transport

以人为中心的主题建模:基于目标提示对比学习与最优传输

Rui Wang, Yi Zheng, Dongxin Wang, Haiping Huang, Yuanzhi Yao, Yuxiang Zhou, Jialin Yu, Philip Torr

机构 * School of Computer Science, Nanjing University of Posts and Telecommunications(南京邮电大学计算机科学学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系)

AI总结 本文提出Human-TM任务框架,结合人类提供的目标进行主题建模,通过GCTM-OT方法提升主题的可解释性、多样性和目标导向性,实验表明其在主题连贯性和多样性上优于现有方法。

Comments 11 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09784 2026-04-15 stat.ML cs.LG

Discrete Flow Maps

离散流映射

Peter Potaptchik, Jason Yim, Adhi Saravanan, Peter Holderrieth, Eric Vanden-Eijnden, Michael S. Albergo

机构 * Harvard University(哈佛大学) University of Oxford(牛津大学) MIT(麻省理工学院) Kempner Institute(凯普纳研究所)

AI总结 本文提出离散流映射,通过在概率单纯形几何上实现轨迹压缩,解决离散数据生成中的几何不匹配问题,提升离散流模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06341 2026-04-15 cs.LG cs.RO cs.SY eess.SY math.OC

Scalable Verification of Neural Control Barrier Functions Using Linear Bound Propagation

基于线性边界传播的神经控制屏障函数可扩展验证

Nikolaus Vertovec, Frederik Baymler Mathiesen, Thom Badings, Luca Laurenti, Alessandro Abate

机构 * Department of Computer Science University of Oxford(牛津大学计算机科学系) St Hugh’s College University of Oxford(牛津大学圣希利学院) Delft Center for Systems and Control TU Delft(代尔夫特理工大学系统与控制中心) Dep. of Computer Science & Inst. for Data Science in Mech. Eng RWTH Aachen University(亚琛工业大学计算机科学系及机械工程数据科学研究所) AI4I Italy(意大利AI4I)

AI总结 本文提出一种基于线性边界传播的神经控制屏障函数验证方法,通过计算梯度边界和McCormick松弛,实现对神经网络作为控制屏障函数的有效验证,适用于任意控制-affine系统和多种非线性激活函数。

Comments accepted at the 8th Annual Conference on Learning for Dynamics and Control (L4DC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05206 2026-04-15 cs.CR cs.AI cs.CL cs.CV

Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety

大规模安全:大型模型和智能体安全的全面综述

Xingjun Ma, Yifeng Gao, Yixu Wang, Ruofan Wang, Xin Wang, Ye Sun, Yifan Ding, Hengyuan Xu, Yunhao Chen, Yunhan Zhao, Hanxun Huang, Yige Li, Yutao Wu, Jiaming Zhang, Xiang Zheng, Yang Bai, Zuxuan Wu, Xipeng Qiu, Jingfeng Zhang, Yiming Li, Xudong Han, Haonan Li, Jun Sun, Cong Wang, Jindong Gu, Baoyuan Wu, Siheng Chen, Tianwei Zhang, Yang Liu, Mingming Gong, Tongliang Liu, Shirui Pan, Cihang Xie, Tianyu Pang, Yinpeng Dong, Ruoxi Jia, Yang Zhang, Shiqing Ma, Xiangyu Zhang, Neil Gong, Chaowei Xiao, Sarah Erfani, Tim Baldwin, Bo Li, Masashi Sugiyama, Dacheng Tao, James Bailey, Yu-Gang Jiang

机构 * Fudan University(复旦大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡国立大学) Deakin University(德肯大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) Griffith University(格里菲斯大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Sea AI Lab(Sea AI实验室) Tsinghua University(清华大学) Virginia Tech(弗吉尼亚理工大学) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全部) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Purdue University(普渡大学) Duke University(杜克大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) RIKEN(理化学研究所) The University of Tokyo(东京大学)

AI总结 本文综述了大型模型和智能体的安全性,分析了各类攻击威胁及防御策略,指出安全评估、防御机制和数据实践的重要性,强调研究社区和国际合作的必要性。

Comments 706 papers, 60 pages, 3 figures, 14 tables; GitHub: https://github.com/xingjunm/Awesome-Large-Model-Safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12490 2026-04-15 cs.CY cs.AI

Deepfakes at Face Value: Image and Authority

深度伪造:图像与权威

James Ravi Kirkpatrick

机构 * University of Oxford and Magdalen College Oxford(牛津大学和玛格丽特学院)

AI总结 本文探讨深度伪造的伦理问题,提出其错误在于侵犯人们对自身形象使用权限和身份治理的权威,区分了合理利用与算法模拟的界限。

Comments 21 pages, accepted copy published in AI & Society (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12289 2026-04-15 cs.CY cs.CL

The Enforcement and Feasibility of Hate Speech Moderation on Twitter

推特上仇恨言论管控的执行与可行性

Manuel Tonneau, Dylan Thurgood, Diyi Liu, Niyati Malhotra, Victor Orozco-Olvera, Ralph Schroeder, Scott A. Hale, Manoel Horta Ribeiro, Paul Röttger, Samuel P. Fraiberger

机构 * University of Oxford(牛津大学) University of Copenhagen(哥本哈根大学) World Bank(世界银行) Princeton University(普林斯顿大学)

AI总结 研究通过全球审计揭示推特仇恨言论管控的执行情况,发现仇恨言论在平台上持续存在,且去除率与非仇恨言论无显著差异,表明技术限制外还有制度因素影响管控效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10861 2026-04-15 quant-ph cond-mat.dis-nn cs.ET cs.LG

Training single-electron and single-photon stochastic physical neural networks

训练单电子和单光子随机物理神经网络

Tong Dou, Shiro Kumara, Josh Burns, Ethan Sigler, Parth Girdhar, David Petty, Gerard Milburn, Jo Plested, Matt Woolley

机构 * School of Engineering(工程学院) Sussex Centre for Quantum Technologies, University of Sussex(Sussex量子技术中心,Sussex大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学) National Quantum Computing Centre, Rutherford Appleton Laboratory(国家量子计算中心,Rutherford Appleton实验室) School of Systems(系统学院)

AI总结 本文提出单电子和单光子随机神经元,通过量子点单电子隧道和光子源驱动耦合模式实现,探讨了在MNIST数据集上使用单隐藏层随机PNNs进行手写数字分类的训练策略,展示了高噪声和模型不确定性下仍能保持高测试准确率的潜力。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10559 2026-04-15 cs.LG q-fin.CP

A Bipartite Graph Approach to U.S.-China Cross-Market Return Forecasting

一种 bipartite 图方法用于美国-中国跨市场收益率预测

Jing Liu, Maria Grith, Xiaowen Dong, Mihai Cucuringu

机构 * Department of Statistics, University of Oxford, UK(英国牛津大学统计学系) Finance Department, Neoma Business School, France(法国Neoma商学院金融系) Department of Engineering Science, University of Oxford, UK(英国牛津大学工程科学系) Department of Mathematics, University of California Los Angeles, US(美国加州大学洛杉矶分校数学系) Oxford-Man Institute of Quantitative Finance, University of Oxford, UK(牛津大学量化金融研究所)

AI总结 本文通过保留经济结构的机器学习框架研究跨市场收益率可预测性,利用中美股市非重叠交易时间构建有向 bipartite 图,通过滚动窗口假设检验选择边,作为下游模型的稀疏特征选择层,发现美国前收盘到收盘收益率对中国日内收益率有显著预测信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.00480 2026-04-15 q-fin.CP cs.CL cs.LG

Realised Volatility Forecasting: Machine Learning via Financial Word Embedding

现实波动率预测:通过金融词嵌入进行机器学习

Eghbal Rahimikia, Stefan Zohren, Ser-Huang Poon

机构 * Alliance Manchester Business School at the University of Manchester(曼彻斯特大学阿利安斯商业学校) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Alliance Manchester Business School, University of Manchester(曼彻斯特大学阿利安斯商业学校)

AI总结 本文研究新闻如何提升现实波动率预测,通过现代且操作简单的NLP框架,发现新闻内容在高波动日具有更强预测作用,结合领先指标可提升统计性能和经济收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11791 2026-04-14 cs.LG cs.AI

A Mechanistic Analysis of Looped Reasoning Language Models

循环推理语言模型的机理分析

Hugh Blayney, Álvaro Arroyo, Johan Obando-Ceron, Pablo Samuel Castro, Aaron Courville, Michael M. Bronstein, Xiaowen Dong

机构 * University of Oxford(牛津大学) Mila – Quebec AI Institute(魁北克AI研究所)

AI总结 本文分析了循环推理语言模型中潜在状态的机理,揭示了循环块在潜在空间中的稳定轨迹及注意力头行为的稳定特性。

Comments 39 pages, 63 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11773 2026-04-14 cs.LG cond-mat.mtrl-sci cs.CV

Autonomous Diffractometry Enabled by Visual Reinforcement Learning

由视觉强化学习实现的自主衍射测量

J. Oppliger, M. Stifter, A. Rüegg, I. Biało, L. Martinelli, P. G. Freeman, D. Prabhakaran, J. Zhao, Q. Wang, J. Chang

机构 * Jeremiah Horrocks Institute for Mathematics, Physics and Astronomy, University of Central Lancashire(中央兰开夏大学杰里迈亚·霍罗克斯数学、物理与天文研究所) Department of Physics, Clarendon Laboratory, University of Oxford(牛津大学克拉伦登实验室物理系) State Key Laboratory of Surface Physics and Department of Physics, Fudan University(复旦大学表面物理国家重点实验室和物理系) Department of Physics, The Chinese University of Hong Kong(香港中文大学物理系) State Key Laboratory of Quantum Information Technologies and Materials, The Chinese University of Hong Kong(香港中文大学量子信息与材料国家重点实验室)

AI总结 本文提出一种无需晶体学知识的自主系统,利用强化学习从劳厄衍射图中自动对齐单晶体,提升材料科学自动化实验流程的能力。

Comments 20 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11680 2026-04-14 cs.RO

Dual-Control Frequency-Aware Diffusion Model for Depth-Dependent Optical Microrobot Microscopy Image Generation

双控频率感知扩散模型用于深度依赖光学微机器人显微图像生成

Lan Wei, Zongcai Tan, Kangyi Lu, Jian-Qing Zheng, Dandan Zhang

机构 * Department of Bioengineering, Imperial-X AI Initiative, Imperial College London(帝国理工学院生物工程系、Imperial-X人工智能计划) CAMS-Oxford Institute, University of Oxford(牛津大学CAMS-Oxford研究所)

AI总结 本文提出Du-FreqNet,通过双控频率感知扩散模型生成物理一致的显微图像,提升微机器人自主操作的3D感知能力,改进SSIM并增强下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11576 2026-04-14 cs.CV

Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models

微调如你预训练:提升视觉语言模型零样本对抗鲁棒性

Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Xi’an Jiaotong University(西安交通大学) University of Oxford(牛津大学)

AI总结 本文提出AdvFLYP方法,通过遵循CLIP预训练过程的训练配方,利用网络上收集的图像-文本对生成对抗样本,并通过对比损失匹配文本,提升视觉语言模型的零样本对抗鲁棒性。

Comments Accepted to CVPR Findings Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11386 2026-04-14 cs.RO cs.CV

ComSim: Building Scalable Real-World Robot Data Generation via Compositional Simulation

ComSim:通过组合模拟构建可扩展的现实世界机器人数据生成

Yiran Qin, Jiahua Ma, Li Kang, Wenzhan Li, Yihang Jiao, Xin Wen, Xiufeng Song, Heng Zhou, Jiwen Yu, Zhenfei Yin, Xihui Liu, Philip Torr, Yilun Du, Ruimao Zhang

机构 * CUHK-Shenzhen(香港中文大学(深圳)) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) USTC(中国科学技术大学) The University of Hong Kong(香港大学) University of Oxford(牛津大学) Harvard University(哈佛大学)

AI总结 本文提出Compositional Simulation方法,结合经典模拟与神经模拟生成准确的动作-视频对,通过闭环数据增强管道生成大规模高质量训练数据,减少仿真到现实的域差距,提升现实环境中的政策模型性能。

Comments 14 pages, 8 figures, 4 tables; supplementary material included; Project page: https://faceong.github.io/ComSim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09364 2026-04-14 cs.CV cs.CL

Arbitration Failure, Not Perceptual Blindness: How Vision-Language Models Resolve Visual-Linguistic Conflicts

仲裁失败,而非感知失明:视觉-语言模型如何解决视觉-语言冲突

Farhad Nooralahzadeh, Omid Rohanian, Yi Zhang, Jonathan Fürst, Kurt Stockinger

机构 * Institute of Computer Science, Zurich University of Applied Sciences(苏黎世应用科技大学计算机科学研究所) University of Oxford(牛津大学)

AI总结 研究探讨视觉-语言模型在视觉与语言冲突中的仲裁机制,发现编码与基础的脱节,通过多模态仲裁交叉分析揭示视觉属性在早期层可线性解码,最终层logit与基础结果相关性达0.847,表明需针对性干预提升视觉基础能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26499 2026-04-14 cs.AI

AIRA_2: Overcoming Bottlenecks in AI Research Agents

AIRA_2:克服人工智能研究代理中的瓶颈

Karen Hambardzumyan, Nicolas Baldwin, Edan Toledo, Rishi Hazra, Michael Kuchnik, Bassel Al Omari, Thomas Simon Foster, Anton Protopopov, Jean-Christophe Gagnon-Audet, Ishita Mediratta, Kelvin Niu, Michael Shvartsman, Alisia Lupidi, Alexis Audran-Reiss, Parth Pathak, Tatiana Shavrina, Despoina Magka, Hela Momand, Derek Dunfield, Nicola Cancedda, Pontus Stenetorp, Carole-Jean Wu, Jakob Nicolaus Foerster, Yoram Bachrach, Martin Josifoski

机构 * FAIR at Meta(Meta FAIR) University College London(伦敦大学学院) University of Oxford(牛津大学)

AI总结 AIRA_2通过异步多GPU工作池、隐藏一致性评估协议和ReAct代理解决AI研究代理的三个性能瓶颈,提升搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17516 2026-04-14 cs.CL cs.AI cs.CY cs.LG

SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors

SimBench:大型语言模型模拟人类行为能力的基准测试

Tiancheng Hu, Joachim Baumann, Lorenzo Lupo, Nigel Collier, Dirk Hovy, Paul Röttger

机构 * University of Cambridge(剑桥大学) Stanford University(斯坦福大学) Bocconi University(博科尼大学) University of Oxford(牛津大学)

AI总结 SimBench通过统一20个多样化的数据集,评估大型语言模型模拟人类行为的 fidelity,发现模型性能与模型大小呈对数线性关系,但与计算资源无关,且存在指令微调与模拟准确性之间的权衡。

Comments Accepted at ICLR 2026. Project Website: http://simbench.tiancheng.hu/ Data: https://huggingface.co/datasets/pitehu/SimBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10797 2026-04-14 cs.CV

WBCBench 2026: A Challenge for Robust White Blood Cell Classification Under Class Imbalance

WBCBench 2026:在类别不平衡下的白血球分类挑战

Xin Tian, Xudong Ma, Tianqi Yang, Alin Achim, Bartłomiej W Papież, Phandee Watanaboonyongcharoen, Nantheera Anantrasirichai

机构 * University of Oxford(牛津大学) University College London(伦敦大学学院) University of Bristol(布里斯托大学) Chulalongkorn University(朱拉隆功大学)

AI总结 本文提出WBCBench 2026挑战,旨在测试算法在13种细粒度白血球类别严重不平衡、患者级数据分离和合成域偏移下的鲁棒性,采用标准化数据集和评估指标。

Comments IEEE International Symposium on Biomedical Imaging (ISBI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18916 2026-04-14 cs.AI

Agentic Business Process Management: A Research Manifesto

代理业务流程管理:一项研究宣言

Diego Calvanese, Angelo Casciani, Giuseppe De Giacomo, Marlon Dumas, Fabiana Fournier, Timotheus Kampik, Emanuele La Malfa, Lior Limonad, Andrea Marrella, Andreas Metzger, Marco Montali, Daniel Amyot, Peter Fettke, Artem Polyvyanyy, Stefanie Rinderle-Ma, Sebastian Sardiña, Niek Tax, Barbara Weber

机构 * Free University of Bozen-Bolzano(博尔扎诺自由大学) University of Oxford(牛津大学) University of Tartu(塔尔图大学) IBM Research(IBM研究院) Umeå University(于默奥大学) paluno (Ruhr Institute for Software Technology), University of Duisburg Essen(帕卢诺(鲁尔软件技术研究所),杜伊斯堡-埃森大学) University of Ottawa(渥太华大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Saarland University(萨尔大学) The University of Melbourne(墨尔本大学) TUM School of Computation, Information, and Technology, TU Munich(慕尼黑工业大学计算、信息与技术学院) RMIT University(皇家墨尔本理工大学) Meta University of St. Gallen(圣加仑大学)

AI总结 本文提出了一项宣言,阐述了代理业务流程管理(APM)的概念基础,即一种扩展业务流程管理(BPM)以管理组织中自主代理执行流程的框架。APM代表了一种管理范式转变,从传统的业务流程视角转向以代理为导向的抽象,其中软件和人类代理作为主要功能实体,在显式流程框架内感知、推理和行动。

Comments 34 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02311 2026-04-14 cs.CV cs.LG

Inferring Dynamic Physical Properties from Video Foundation Models

从视频基础模型推断动态物理性质

Guanqi Zhan, Xianzheng Ma, Weidi Xie, Andrew Zisserman

机构 * VGG, University of Oxford(牛津大学VGG实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文研究通过视频预测动态物理性质,提出新数据集和三种推断方法,展示视频基础模型与多模态大语言模型的性能对比。

详情

展开后加载摘要…

URL PDF HTML 收藏