Mixture of Frames Policy: Multi-Frame Action Denoising for Bimanual Mobile Manipulation
帧混合策略:用于双手机器人移动操作的多帧动作去噪
机构 * Stanford University(斯坦福大学)
AI总结 研究双手机器人移动操作中多帧动作去噪问题,提出帧混合策略(MoF),通过在多坐标框架同步去噪,维护规范扩散状态并融合噪声预测,在模拟和实际任务中均优于单帧基线。
高校专区
帧混合策略:用于双手机器人移动操作的多帧动作去噪
机构 * Stanford University(斯坦福大学)
AI总结 研究双手机器人移动操作中多帧动作去噪问题,提出帧混合策略(MoF),通过在多坐标框架同步去噪,维护规范扩散状态并融合噪声预测,在模拟和实际任务中均优于单帧基线。
用于语言识别的全局一致着色方案
机构 * Stanford University(斯坦福大学) ; Cornell University(康奈尔大学)
AI总结 研究对抗性语言学习所需额外信息,探讨终端着色能否替代整个颜色序列用于语言识别,证明每个字符串只需一个终端位,全局构造用超限递归,还表明有限颜色的博雷尔映射终端着色不能识别所有可数子集合。
Comments Abstract shortened to fit arxiv limit
Pix2Act:具有等变增强的图像空间操纵策略
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Brown University(布朗大学) ; Texas A&M University(德州农工大学)
AI总结 研究针对将操纵动作表示为相机平面二维轨迹带来的挑战,提出Pix2Act模仿学习方法,通过生成图像空间关键点轨迹及三角测量恢复末端执行器姿态,将三维控制转为二维预测问题,提升泛化能力与性能,优于现有基线且抗相机扰动。
Comments Project Website: https://haojhuang.github.io/pix2act_page/
VIA:用于机器人控制的视觉接口代理
机构 * Stanford University(斯坦福大学)
AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。
SETA:终端智能体的扩展环境
机构 * Imperial College London(帝国理工学院) ; University College London(伦敦大学学院) ; SambaNova(桑巴诺瓦公司) ; KAUST(阿卜杜拉国王科技大学) ; Stanford University(斯坦福大学) ; University of Oxford(牛津大学) ; University of Waterloo(滑铁卢大学) ; RadixArk(基数方舟公司)
AI总结 研究针对终端智能体训练扩展难的问题,提出SETA框架,含SETA - Synth和SETA - Evol两个管道及统一验证机制,构建了SETA - Env数据集。实验显示该数据集能为终端智能体提供优质训练环境,推动相关研究发展。
3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究
机构 * Roblox Corporation(罗布乐思公司) ; Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系) ; Computer Science Department, Stanford University(斯坦福大学计算机科学系) ; Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)
AI总结 研究基于视觉语言模型的3D缺陷检测管道评估,引入3D-DefectBench基准框架,通过平衡因子设计改变多个管道因素进行实验,发现模型选择影响最大,各因素相互作用,还得出一些协议表现及评判与人工标注对比情况等结论。
动作映射策略:通过像素分类学习3D闭环操作
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学) ; Brown University(布朗大学)
AI总结 研究针对机器人学习中动作空间的挑战,提出动作映射策略(AMP),将3D闭环操作策略学习转为图像空间分类问题,通过投影动作到图像平面,以像素为类别控制维度,实现高精度、快速推理,实验证明其优于基线。
Comments Project Website: https://haojhuang.github.io/amp_page/
多层感知器是赫布型的:为Transformer构建高效的事实存储多层感知器
机构 * Institute for Computational & Mathematical Engineering, Stanford University(斯坦福大学计算与数学工程研究所) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系) ; Department of Computer Science and Engineering, University at Buffalo(布法罗大学计算机科学与工程系)
AI总结 研究大语言模型中MLP层以最优速率存储事实知识的现象,开发首个与Transformer兼容的事实存储MLP闭式构造,具有最优存储缩放等特性,所需参数更少,还能用于事实召回任务及实现模块化事实编辑。
UniPose9D:通用的类别无关物体姿态估计
机构 * Stanford University(斯坦福大学) ; Amazon(亚马逊)
AI总结 研究针对物体姿态估计中现有方法泛化性不足的问题,提出UniPose9D模型,通过采样点对、利用特定特征预测NOCS坐标,引入改进算法及流匹配,构建训练集,实验证明该模型能匹配或超越专业方法,泛化能力强。
Detangled:一个用于创建、编辑和推理具有丰富特征的发丝的框架
机构 * Stanford University(斯坦福大学)
AI总结 该研究提出用于理解和生成丰富特征发丝的框架,构建五维参数空间,用新方法分离发丝纹理与整体方向,通过生成式AI创建符合纹理描述的新发丝,可用于造型编辑并展示了多种发型结果。
Comments 18 pages, 18 figures