VGGT-$Ω$
VGGT-Ω通过改进架构和训练方法,在静态和动态场景重建中提升精度与效率,同时减少内存消耗并利用更多数据
机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学) ; Meta AI
AI总结 VGGT-Ω通过改进架构和训练方法,在静态和动态场景重建中提升精度与效率,同时减少内存消耗并利用更多数据。
Comments CVPR 2026 (Oral)
高校专区
VGGT-Ω通过改进架构和训练方法,在静态和动态场景重建中提升精度与效率,同时减少内存消耗并利用更多数据
机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学) ; Meta AI
AI总结 VGGT-Ω通过改进架构和训练方法,在静态和动态场景重建中提升精度与效率,同时减少内存消耗并利用更多数据。
Comments CVPR 2026 (Oral)
Articraft: 一种可扩展的拟人化3D资产生成代理系统
机构 * University of Cambridge(剑桥大学) ; University of Oxford(牛津大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出Articraft代理系统,利用大语言模型生成大规模拟人化3D资产,构建了包含10000+资产的Articraft-10K数据集,应用于机器人仿真和虚拟现实等下游任务。
Comments Project page: https://articraft3d.github.io/
多机器人系统分布式控制的原型框架
机构 * Department of Engineering Science, University of Oxford, UK(牛津大学工程科学系)
AI总结 本文提出一个原型框架,用于多机器人系统分布式控制,通过SPMD范式在单台计算机上模拟分布式控制,验证分布式优化算法的理论与实践。
Comments Accepted at IFAC World Congress 2026
共识、多样性与极化指数用于同意选举
机构 * AGH University of Kraków(克拉科夫AGH大学) ; Czech Technical University in Prague(布拉格捷克技术大学) ; University of Geneva(日内瓦大学) ; University of Oxford(牛津大学)
AI总结 本文提出三种指数,用于衡量同意选举中投票者的一致性、多样性及极化程度,并通过分析这些指数来绘制选举地图并比较现实中的选举数据。
AuralSAM2:通过金字塔音频视觉特征提示实现SAM2的听觉能力
机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) ; Stanford University(斯坦福大学) ; University of Central Florida(佛罗里达中央大学) ; University of Surrey(萨里大学)
AI总结 AuralSAM2通过金字塔音频视觉特征提示整合音频,保持SAM2的可提示分割能力,引入AuralFuser融合音频和视觉特征,并通过音频引导对比损失对齐模态,提升分割精度。
Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026
SceneParser: 用于视觉语义理解的分层场景解析
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Zhongguancun Academy(中关村学院) ; Huazhong University of Science and Technology(华中科技大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; South China University of Technology(华南理工大学) ; University of Oxford(牛津大学) ; Peking University(北京大学)
AI总结 本文提出SceneParser,通过分层解析任务构建场景-对象-部件-功能的层次结构,利用结构完成伪标签和课程学习提升结构感知能力,实验表明其在复杂场景理解中表现更优。
Comments Preprint. Code, models, and dataset are provided in the manuscript
从阿谀共识到多元修复:为何AI对齐必须显现分歧
机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Institute for Ethics in AI, University of Oxford(牛津大学人工智能伦理研究所) ; Responsible Technology Institute, University of Oxford(牛津大学负责任技术研究所)
AI总结 本文提出多元对齐需通过对话机制表面价值冲突,提出多元修复评分指标,探讨部署阶段的治理层对多元主义的影响。
以行为识别LLM浏览器代理:通过UI轨迹指纹化
机构 * Oxford Internet Institute, University of Oxford(牛津互联网研究所,牛津大学) ; Department of Engineering Science, University of Oxford(工程科学系,牛津大学)
AI总结 研究通过被动JavaScript跟踪器分析LLM代理的行为和交互时间,发现可识别底层模型,F1达96%,并展示分类器在不同模型上的泛化能力及早期身份推断。
CreFlow:稀疏奖励具身视频扩散强化学习的纠正回流
机构 * Northwestern University(西北大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; University of Oxford(牛津大学)
AI总结 本文提出CreFlow框架,通过信用感知NFT损失和纠正回流损失提升高维视频生成性能,有效解决稀疏奖励下的具身任务执行问题。
核空间中凸聚类的新框架:有限样本界、一致性和性能洞察
机构 * Indian Statistical Institute, Kolkata(印度统计研究院,加尔各答) ; Electronics and Communication Sciences Unit, Indian Statistical Institute(印度统计研究院电子与通信科学单位) ; Department of Statistics, University of Oxford(牛津大学统计系) ; Department of Statistics, University of Michigan(密歇根大学统计系)
AI总结 本文提出核化凸聚类方法,通过映射数据到RKHS空间,解决线性不可分和非凸数据的聚类问题,理论分析和实验验证显示其优于现有方法。
SVAG-Bench:多实例时空视频动作定位的大规模基准
机构 * LMU Munich(慕尼黑大学) ; MCML ; Technical University of Munich(慕尼黑技术大学) ; University of Zurich(苏黎世大学) ; University of Oxford(牛津大学) ; Amazon(亚马逊) ; NVIDIA(英伟达)
AI总结 SVAG-Bench通过多实例整合任务,评估模型在复杂场景中对动作的时空定位能力,包含688个视频和19590个注释,支持细粒度评估多主体歧义消除和动作组合性。