Auditing Preferences for Brands and Cultures in LLMs
对LLM中品牌和文化偏好的审计
机构 * University of Oxford(牛津大学)
AI总结 本文提出ChoiceEval框架,用于审计LLM中品牌和文化偏好,通过生成多样化查询和量化偏好指标,揭示模型在不同主题上的系统性偏好差异。
Comments 20 pages, 2 figures
高校专区
对LLM中品牌和文化偏好的审计
机构 * University of Oxford(牛津大学)
AI总结 本文提出ChoiceEval框架,用于审计LLM中品牌和文化偏好,通过生成多样化查询和量化偏好指标,揭示模型在不同主题上的系统性偏好差异。
Comments 20 pages, 2 figures
基于视觉-语言模型的多专家融合用于CT图像分类
机构 * College of Computer Science and Artificial Intelligence, Shanghai Key Laboratory of Intelligent Information Processing, Fudan University(复旦大学计算机科学与人工智能学院,上海智能信息处理重点实验室) ; University of Oxford(牛津大学) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出一种三阶段源感知多专家框架,通过构建肺部感知3D专家、开发MedSigLIP基专家和训练源分类器,提升多源CT图像中新冠检测的鲁棒性,实验结果显示在不同阶段模型在宏F1、ACC和AUC指标上均取得优异成绩。
视觉集合程序合成器
机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) ; Institute of Logic and Computation, TU Wien(维也纳技术大学逻辑与计算研究所)
AI总结 本文提出通过视觉程序合成解决复杂视觉推理问题,引入Set-VQA基准测试,显著提升回答准确性并提高透明度。
Comments 10 pages, IEEE International Conference on Multimedia and Expo 2026
Journal ref IEEE International Conference on Multimedia and Expo 2026
基于临床先验的3D CT扫描肺部疾病检测
机构 * College of Computer Science and Artificial Intelligence, Shanghai Key Laboratory of Intelligent Information Processing, Fudan University(计算机科学与人工智能学院,上海智能信息处理重点实验室,复旦大学) ; University of Oxford(牛津大学) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出一种考虑性别因素的两阶段肺部疾病分类框架,通过性别分类器和性别特异性疾病分类器提升少数类疾病识别性能,尤其在鳞状细胞癌上表现突出。
梯度原子:通过训练梯度的稀疏分解实现无监督的行为发现、归因与引导
机构 * FLAIR, University of Oxford(FLAIR,牛津大学)
AI总结 本文提出梯度原子方法,通过训练梯度的稀疏分解发现、归因和引导模型行为,无需监督即可识别可解释的任务类型行为,如拒绝、算术、二元分类等,并能有效控制模型行为变化。
融合理解与生成的交错分析-草稿思维
机构 * National University of Singapore(国立新加坡大学) ; University of Oxford(牛津大学) ; Nanyang Technological University(南洋理工大学) ; Microsoft Research(微软研究院)
AI总结 本文提出AD-Loop机制,通过交错分析与草稿操作提升视觉语言模型的理解与生成能力,实验表明其在多个基准测试中表现优异,具备良好的迁移性。
Comments 28 pages, 17 figures, 6 tables, ICLR conference
Think3D: 基于空间的思考以实现空间推理
机构 * Dalian University of Technology(大连理工大学) ; University of California San Diego(加州大学圣地亚哥分校) ; University of Oxford(牛津大学)
AI总结 Think3D通过引入交互式3D推理框架,提升多模态代理的空间推理能力,实现在BLINK Multi-view和MindCube上的7.8%性能提升,并通过Think3D-RL优化小模型性能。
关于馈送式3D重建模型中的几何理解与学习先验
机构 * University of Freiburg(弗赖堡大学) ; University of Oxford(牛津大学)
AI总结 研究探讨了馈送式3D重建模型是否基于传统多视图流程的几何原理或依赖大规模训练的学习先验,通过分析内部表示和注意力模式验证了几何理解的存在。
定义人工智能模型和人工智能系统:解决边界问题的框架
机构 * AI Governance Exchange(AI治理交流) ; University of British Columbia(不列颠哥伦比亚大学) ; Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) ; AI Standards Lab(AI标准实验室) ; Vilnius University(维尔纽斯大学) ; Oxford Martin AI Governance Initiative(牛津马丁AI治理倡议) ; Independent(独立)
AI总结 本文通过分析896篇学术论文和80多份监管文件,提出人工智能模型与系统的定义框架,解决边界问题,明确责任分配。
Comments Added paragraph in Section 5.5.2 discussing model modifications; corrected typos
HorizonMath:通过自动验证衡量AI向数学发现的进步
机构 * University of Oxford(牛津大学) ; Benchmark ; Harvard University(哈佛大学) ; Princeton University(普林斯顿大学) ; Ellison Institute of Technology(Ellison技术研究所)
AI总结 HorizonMath通过自动验证框架评估AI在数学发现中的进展,针对需要深入数学洞察但验证简单的难题,发现部分模型提出改进现有结果的解决方案。
消除与救援:残差流超连接的因果分析
机构 * Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of California, Berkeley(加州大学伯克利分校) ; Independent(独立) ; University of Oxford(牛津大学)
AI总结 本文提出首个开源mHC语言模型,通过代表层面指标和因果干预分析多流架构,揭示并行流的信息编码与利用机制,引入系统性的流消除-救援框架进行因果比较。
从随机答案到可验证推理:利用LLM生成代码的可解释决策
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Oxford(牛津大学) ; Vela Research(Vela研究公司) ; Amazon(亚马逊)
AI总结 本文提出将LLM视为代码生成器而非实例评估器,通过生成可执行决策逻辑提升决策可解释性与可重复性,在创业资本创始人筛选中实现更高精度与可验证性。
Comments 12 pages, 3 figures, 6 tables
大语言模型在双用途生物任务中的新手提升
机构 * Scale AI ; SecureBio ; University of Oxford(牛津大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 研究探讨大语言模型是否能提升新手在生物任务中的表现,通过多模型多基准测试发现LLM显著提升准确性,并指出单用途LLM可能超越辅助新手的表现。
Comments 59 pages, 33 figures
多轮预条件SGD的平均稳定性及有效维度
机构 * Department of Statistics, University of Oxford(统计系,牛津大学) ; Google DeepMind(谷歌DeepMind)
AI总结 本文研究了多轮预条件SGD的平均稳定性与有效维度的关系,提出了一种新的分析方法,揭示了预条件器选择对优化和泛化的影响,并给出了理论下界。
Comments 35 pages, 1 figure
一种适用于内在维度性的通用最近邻估计器
机构 * School of Mathematical Sciences, Queen Mary University of London(伦敦大学玛丽女王学院数学科学学院) ; Department of Statistics, Oxford University(牛津大学统计学系)
AI总结 本文提出了一种基于最近邻距离比的通用ID估计器,通过理论分析证明其在不同数据分布下均能收敛到真实ID,实验验证其在基准流形和现实数据集上的有效性。
BiasBusters: 检测和缓解大语言模型中的工具选择偏差
机构 * University of Oxford(牛津大学) ; Microsoft(微软)
AI总结 研究通过基准测试揭示LLM工具选择中的系统性偏差,并提出轻量级缓解策略以减少选择偏差。
Comments ICLR 2026 Camera Ready
MASEval: 从模型到系统的多智能体评估扩展
机构 * Parameter Lab(参数实验室) ; University of Oxford(牛津大学) ; University of Tübingen(图宾根大学) ; TU Darmstadt(德累斯顿理工大学) ; MBZUAI ; NAVER AI Lab(NAVER AI实验室) ; KAIST(韩国科学技术院)
AI总结 MASEval通过系统层面的比较揭示框架选择与模型选择同等重要,为智能体系统设计提供新途径。
可扩展的消息传递神经网络:在大规模图表示学习中无需注意力
机构 * University of Oxford(牛津大学) ; Massachusetts Institute of Technology(麻省理工学院) ; McMaster University(麦马斯特大学) ; Vector Institute(向量研究所) ; AITHYRA
AI总结 本文提出SMPNNs,通过替代注意力机制,实现高效的大规模图表示学习,克服传统GNN的过平滑问题,提升性能。
从老鼠到火车:图数据上的消 amortized 贝叶斯推断
机构 * Department of Statistics, TU Dortmund University(统计系,多特蒙德技术大学) ; School of Public Health, Imperial College London(公共卫生学院,伦敦帝国理工学院) ; Department of Biology, University of Oxford(生物学系,牛津大学) ; Department of Mechanical Engineering, Karlsruhe Institute of Technology(机械工程系,卡尔斯鲁厄理工学院)
AI总结 本文提出了一种基于生成神经网络的消 amortized 贝叶斯推断方法,用于图数据的节点、边和图层面参数推断,通过评估不同架构在合成和现实数据中的表现,解决了图参数后验估计的挑战。
多机器人制图的分布式高斯过程模型
机构 * Dyson Robotics Lab, Imperial College London(帝京大学伦敦分校戴森机器人实验室) ; Department of Computer Science, University of Oxford(牛津大学计算机科学系)
AI总结 DistGP通过分布式高斯过程实现多机器人协同制图,优于现有方法并在动态环境下表现更优。
Comments ICRA 2026, 8 pages
3DMedAgent:面向3D医学分析的统一感知-理解框架
机构 * National University of Singapore(新加坡国立大学) ; Microsoft Research(微软研究院) ; TUD Dresden University of Technology(德累斯顿技术大学) ; University of Oxford(牛津大学)
AI总结 3DMedAgent通过统一框架实现2D MLLMs在3D医学分析中的高效处理,无需3D特定微调,提升3D医学图像的感知与理解能力。
Comments 19 pages, 7 figures
通过轻量级可满足性测试验证图神经网络的鲁棒性
机构 * University of Oxford, UK(英国牛津大学) ; University of Liverpool, UK(英国利物浦大学)
AI总结 本文提出通过轻量级可满足性测试提升图神经网络在结构鲁棒性方面的性能。
变分流映射:为一步条件生成引入噪声
机构 * University of Oxford(牛津大学) ; California Institute of Technology(加州理工学院) ; University of Toronto(多伦多大学) ; NVIDIA(英伟达公司)
AI总结 变分流映射通过学习初始噪声分布,实现单步条件生成,提升逆问题求解效率和样本保真度。
分布式法律基础设施用于可信代理网络
机构 * Institute for Technoscience and Society(科技与社会研究所) ; Berkeley Center for Law & Technology(伯克利法与科技中心) ; U.C. Berkeley Law School(伯克利法学院) ; Technical University of Munich(慕尼黑技术大学) ; Università degli Studi dell’Aquila(阿奎拉大学) ; University of Oxford(牛津大学) ; Existential Risk Alliance(存在风险联盟) ; NYU Shanghai(纽约大学上海分校) ; Sun Yat-sen University(中山大学) ; Shanghai Innovation Institute(上海创新研究院) ; Norwegian University of Science and Technology(挪威科学技术大学)
AI总结 本文提出分布式法律基础设施,旨在通过可互操作的协议构建可信代理网络,实现连贯治理与合法性维持。
Evo:具有进化平衡的自回归-扩散大语言模型
机构 * University of Oxford(牛津大学) ; National University of Singapore(新加坡国立大学) ; Technical University of Munich(慕尼黑技术大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 Evo通过进化平衡机制,结合自回归和扩散模型,实现高效且高质量的语言生成。
看见它,说出它,排序:一种无需训练的迭代框架用于LVLMs中的视觉引导多模态推理
机构 * Southeast University(东南大学) ; University of Oxford(牛津大学) ; AIIA, Ministry of Education, China(教育部人工智能研究院,中国)
AI总结 本文提出无需训练的迭代框架,通过视觉证据监督推理步骤,减少多模态推理中的幻觉问题,提升推理准确性。
Comments CVPR2026 Accepted
用机器学习力场表示局部蛋白质环境
机构 * IST Austria(IST奥地利研究院) ; Technion, Israel(技术学院,以色列) ; University of Oxford, UK(牛津大学,英国) ; Princeton University(普林斯顿大学) ; Broad Institute of MIT and Harvard(哈佛大学与麻省理工学院Broad研究所)
AI总结 本文提出基于原子基础模型的局部蛋白质环境表示方法,有效捕捉结构和化学特征,实现了高精度的生物分子核磁共振化学移位预测。
衡量人工智能研发自动化
机构 * GovAI ; University of Oxford(牛津大学)
AI总结 本文提出衡量人工智能研发自动化的指标,以评估其对AI进展和监督的影响,并建议企业和政府采取行动跟踪和管理相关指标。
ContextBench: 为定向激活潜在特征修改上下文
机构 * Imperial College London(帝国理工学院伦敦校区) ; University College London(伦敦大学学院) ; University of Oxford(牛津大学) ; UK AI Security Institute(英国人工智能安全研究所)
AI总结 ContextBench通过上下文修改方法提升语言模型触发特定潜在特征的能力,结合LLM辅助和扩散模型实现最佳平衡效果。
Comments Published at ICLR 2026
Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026
LikePhys: 通过似然偏好评估视频扩散模型中的直观物理理解
机构 * University of Oxford(牛津大学) ; MBZUAI(穆斯林人工智能研究所) ; University of Chicago(芝加哥大学) ; UWE Bristol(布里斯托尔大学)
AI总结 LikePhys通过似然偏好评估视频扩散模型的直观物理理解,展示其与人类偏好一致,优于现有基线,并揭示模型设计和推理设置对物理理解的影响。
Comments 23 pages, 9 figures, Project Page: https://yuanjianhao508.github.io/LikePhys/
Journal ref ICLR 2026