Mixture of Frames Policy: Multi-Frame Action Denoising for Bimanual Mobile Manipulation
帧混合策略:用于双手机器人移动操作的多帧动作去噪
机构 * Stanford University(斯坦福大学)
AI总结 研究双手机器人移动操作中多帧动作去噪问题,提出帧混合策略(MoF),通过在多坐标框架同步去噪,维护规范扩散状态并融合噪声预测,在模拟和实际任务中均优于单帧基线。
高校专区
帧混合策略:用于双手机器人移动操作的多帧动作去噪
机构 * Stanford University(斯坦福大学)
AI总结 研究双手机器人移动操作中多帧动作去噪问题,提出帧混合策略(MoF),通过在多坐标框架同步去噪,维护规范扩散状态并融合噪声预测,在模拟和实际任务中均优于单帧基线。
用于语言识别的全局一致着色方案
机构 * Stanford University(斯坦福大学) ; Cornell University(康奈尔大学)
AI总结 研究对抗性语言学习所需额外信息,探讨终端着色能否替代整个颜色序列用于语言识别,证明每个字符串只需一个终端位,全局构造用超限递归,还表明有限颜色的博雷尔映射终端着色不能识别所有可数子集合。
Comments Abstract shortened to fit arxiv limit
Pix2Act:具有等变增强的图像空间操纵策略
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Brown University(布朗大学) ; Texas A&M University(德州农工大学)
AI总结 研究针对将操纵动作表示为相机平面二维轨迹带来的挑战,提出Pix2Act模仿学习方法,通过生成图像空间关键点轨迹及三角测量恢复末端执行器姿态,将三维控制转为二维预测问题,提升泛化能力与性能,优于现有基线且抗相机扰动。
Comments Project Website: https://haojhuang.github.io/pix2act_page/
VIA:用于机器人控制的视觉接口代理
机构 * Stanford University(斯坦福大学)
AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。
SETA:终端智能体的扩展环境
机构 * Imperial College London(帝国理工学院) ; University College London(伦敦大学学院) ; SambaNova(桑巴诺瓦公司) ; KAUST(阿卜杜拉国王科技大学) ; Stanford University(斯坦福大学) ; University of Oxford(牛津大学) ; University of Waterloo(滑铁卢大学) ; RadixArk(基数方舟公司)
AI总结 研究针对终端智能体训练扩展难的问题,提出SETA框架,含SETA - Synth和SETA - Evol两个管道及统一验证机制,构建了SETA - Env数据集。实验显示该数据集能为终端智能体提供优质训练环境,推动相关研究发展。
3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究
机构 * Roblox Corporation(罗布乐思公司) ; Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系) ; Computer Science Department, Stanford University(斯坦福大学计算机科学系) ; Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)
AI总结 研究基于视觉语言模型的3D缺陷检测管道评估,引入3D-DefectBench基准框架,通过平衡因子设计改变多个管道因素进行实验,发现模型选择影响最大,各因素相互作用,还得出一些协议表现及评判与人工标注对比情况等结论。
动作映射策略:通过像素分类学习3D闭环操作
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学) ; Brown University(布朗大学)
AI总结 研究针对机器人学习中动作空间的挑战,提出动作映射策略(AMP),将3D闭环操作策略学习转为图像空间分类问题,通过投影动作到图像平面,以像素为类别控制维度,实现高精度、快速推理,实验证明其优于基线。
Comments Project Website: https://haojhuang.github.io/amp_page/
多层感知器是赫布型的:为Transformer构建高效的事实存储多层感知器
机构 * Institute for Computational & Mathematical Engineering, Stanford University(斯坦福大学计算与数学工程研究所) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系) ; Department of Computer Science and Engineering, University at Buffalo(布法罗大学计算机科学与工程系)
AI总结 研究大语言模型中MLP层以最优速率存储事实知识的现象,开发首个与Transformer兼容的事实存储MLP闭式构造,具有最优存储缩放等特性,所需参数更少,还能用于事实召回任务及实现模块化事实编辑。
UniPose9D:通用的类别无关物体姿态估计
机构 * Stanford University(斯坦福大学) ; Amazon(亚马逊)
AI总结 研究针对物体姿态估计中现有方法泛化性不足的问题,提出UniPose9D模型,通过采样点对、利用特定特征预测NOCS坐标,引入改进算法及流匹配,构建训练集,实验证明该模型能匹配或超越专业方法,泛化能力强。
Detangled:一个用于创建、编辑和推理具有丰富特征的发丝的框架
机构 * Stanford University(斯坦福大学)
AI总结 该研究提出用于理解和生成丰富特征发丝的框架,构建五维参数空间,用新方法分离发丝纹理与整体方向,通过生成式AI创建符合纹理描述的新发丝,可用于造型编辑并展示了多种发型结果。
Comments 18 pages, 18 figures
FARS:一个大规模部署的全自动研究系统
机构 * Analemma ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; University College Dublin(都柏林大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; ByteDance(字节跳动) ; ShanghaiTech University(上海科技大学) ; University of Warwick(华威大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; East China Normal University(华东师范大学) ; Stanford University(斯坦福大学) ; Tencent(腾讯) ; The University of Hong Kong(香港大学) ; Shanghai Innovation Institute(上海创新研究院) ; Nex-AGI Team(Nex-AGI团队)
AI总结 提出FARS系统,通过分阶段智能体协作自动生成研究项目,在67个AI/ML主题上产出166篇论文,经282份评审验证其可产出有价值成果,同时暴露实验范围窄、方法局限和诚信问题。
PerspectiveGap: 多智能体编排提示的基准测试
机构 * University of Maryland(马里兰大学) ; The Chinese University of Hong Kong(香港中文大学) ; Stanford University(斯坦福大学)
AI总结 提出PerspectiveGap基准,评估LLM为多智能体系统编写编排提示的能力,实验显示模型平均通过率仅14.9%,表明该能力独特且未被充分评估。
层次化和整体化的开放词汇功能3D场景图用于室内空间
机构 * Tsinghua University(清华大学) ; ETH Zürich(苏黎世联邦理工学院) ; MPI for Informatics(信息研究所) ; Dalian University of Technology(大连理工大学) ; Microsoft(微软) ; Stanford University(斯坦福大学) ; University of Lugano(卢加诺大学)
AI总结 本文提出一种开放词汇管道,结合2D视觉定位和3D图优化,解决小规模密集相似实例的场景图推理问题,通过时间图优化和全局层次塑造提升室内空间的功能3D场景图生成能力。
递归多智能体系统
机构 * UIUC(伊利诺伊大学香槟分校) ; Stanford University(斯坦福大学) ; NVIDIA(英伟达) ; MIT(麻省理工学院)
AI总结 本文提出递归多智能体框架RecursiveMAS,通过递归计算提升多智能体协作效率,实验证明其在多个基准测试中准确率提升8.3%,推理速度提升1.2-2.4倍,token使用减少34.6%-75.6%。
Comments Project Website: https://recursivemas.github.io
Tool-MCoT:用于内容安全审核的工具增强多模态链式思维
机构 * Stanford University(斯坦福大学) ; Google(谷歌) ; Google DeepMind(谷歌DeepMind)
AI总结 本文提出Tool-MCoT,一种基于工具增强的多模态链式思维模型,用于提升内容安全审核的效率与准确性,通过训练小语言模型以有效利用外部工具进行推理和决策。
人们使用快速且扁平的模拟来对新游戏进行推理
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Princeton University(普林斯顿大学) ; University of Cambridge(剑桥大学) ; Stanford University(斯坦福大学) ; New York University(纽约大学) ; The Alan Turing Institute(艾伦·图灵研究所)
AI总结 研究人们对新游戏的推理,通过超千名参与者和121种新棋盘游戏的研究,发现人们玩新游戏或评估时具系统性和适应性理性,用“直观玩家”模型解释,为新问题应对及类人AI系统设计提供见解。
通过模仿学习实现自主软机器人血管内导航
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Stanford University(斯坦福大学) ; McGill University(麦吉尔大学) ; University of Maryland(马里兰大学) ; Swiss Federal Institute of Technology in Lausanne (EPFL)(日内瓦联邦理工学院(EPFL)) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 研究旨在实现自主软机器人血管内导航,开发基于变压器的模仿学习框架,通过目标条件等实现通用导航,在多种几何结构上训练并评估,策略成功率高,还进行了相关研究及扩展,提升了在未见几何结构上的成功率。
阿格斯能评判一切吗?跨领域比较视觉语言模型
机构 * Bharati Vidyapeeth(巴哈提大学) ; Macquarie University(麦考瑞大学) ; DSEU-Okhla ; Vivekananda Institute of Professional Studies(维维kananda专业研究学院) ; IIIT-Delhi(德里印度理工学院) ; Center for SDGC(SDGC中心) ; Stanford University(斯坦福大学)
AI总结 研究跨领域视觉语言模型,提出ARGUS-EVAL评估框架,通过多种指标刻画模型行为,评估多个模型在下游任务表现,发现能力与可靠性导向排名有显著差异,如Qwen-2.5VL-3B-Instruct能力强,CLIP延迟和内存占用低。
具有交互式数据收集的分布鲁棒强化学习:基本难度与近最优算法
机构 * Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) ; Center for Data Science, Peking University(北京大学数据科学中心) ; Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系)
AI总结 针对强化学习中模拟与现实的差距,提出分布鲁棒强化学习,通过交互式数据收集应对挑战。因支持转移难题,引入消失最小值假设,给出近最优算法,扩展到新公式和博弈,应用于库存控制。