MIDAS Hand: Modular low-Impedance Direct-drive Anthropomorphic Sensing Hand
MIDAS手:模块化低阻抗直接驱动拟人传感手
机构 * UCLA(加州大学洛杉矶分校)
AI总结 针对灵巧操作受手部硬件限制的问题,提出低成本开源的MIDAS手,有16个自由度,直接驱动且回驱扭矩低,集成触觉传感,发布完整堆栈,经多种测试分析,为触觉灵巧操作和人机数据收集提供平衡可重复平台。
高校专区
MIDAS手:模块化低阻抗直接驱动拟人传感手
机构 * UCLA(加州大学洛杉矶分校)
AI总结 针对灵巧操作受手部硬件限制的问题,提出低成本开源的MIDAS手,有16个自由度,直接驱动且回驱扭矩低,集成触觉传感,发布完整堆栈,经多种测试分析,为触觉灵巧操作和人机数据收集提供平衡可重复平台。
MonteRET:通过多粒度知识检索增强多模态大语言模型以生成胸部CT报告的人工智能代理
机构 * Weill Cornell Medicine(威尔康乃尔医学院) ; University of Western Australia(西澳大利亚大学) ; Indiana University(印第安纳大学) ; Regenstrief Institute(瑞根斯特里夫研究所) ; Yale University(耶鲁大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 研究针对自动生成胸部CT报告的挑战,提出MonteRET框架,它整合多种特征,通过知识检索和报告重写代理完善报告。经训练和评估,该框架在多方面提升了报告质量,相比其他方法有显著优势,获放射科住院医师青睐。
基于多级智能数据管理的自动硬示例合成
机构 * UCLA(加州大学洛杉矶分校) ; Google(谷歌)
AI总结 研究多模态大语言模型在内容安全审核任务中易受攻击的问题,提出自动智能红队框架,利用多智能体架构合成对抗示例,无需人工干预,提高模型鲁棒性,降低公共图像安全基准中的误报率。
Comments 23 pages; work in progress
无调整哈密顿蒙特卡罗和欠阻尼朗之万中偏差的离域化
机构 * Department of Mathematics, University of California, Los Angeles, CA 90095, USA(加州大学洛杉矶分校数学系) ; Courant Institute, New York University, NY 10012, USA(纽约大学Courant研究所)
AI总结 研究将偏差离域化现象从过阻尼朗之万算法扩展到无调整哈密顿蒙特卡罗和欠阻尼朗之万算法,表明在特定假设下控制高维分布K维边际偏差\(O(\sqrt{K})\)积分步即可,用矩阵多项式框架解决离散时间积分器技术难题。
TerraTransfer: 无需专家示范的端到端驾驶策略学习
机构 * Applied Intuition ; UCLA(加州大学洛杉矶分校) ; UC Berkeley(加州大学伯克利分校)
AI总结 提出一种无需专家示范的端到端驾驶方法,通过向量化模拟器中的自博弈预训练策略,再与预训练视觉骨干对齐,降低了数据成本并达到或超越现有方法。
稀疏-LaViDa:稀疏多模态离散扩散语言模型
机构 * Adobe(Adobe公司) ; UCLA(加州大学洛杉矶分校)
AI总结 针对掩码离散扩散模型推理速度慢的问题,提出Sparse-LaViDa框架,通过动态截断冗余掩码令牌加速采样,引入专用寄存器令牌和注意力掩码保证质量与一致性,基于LaViDa - O构建,在多任务中实现加速且保持质量。
Comments 18 pages (12 pages for the main paper and 6 pages for the appendix), 9 figures
Lavida-O:用于统一多模态理解与生成的弹性大掩码扩散模型
机构 * Adobe(Adobe公司) ; UCLA(加州大学洛杉矶分校)
AI总结 研究提出Lavida-O统一多模态MDM,采用Elastic-MoT架构,结合轻量级生成与理解分支,通过多种技术支持高效生成。该模型在多模态任务基准测试中性能领先,优于现有模型,还能加速推理,成为可扩展多模态推理和生成新范式。
Comments 31 pages, 15 figures
LaViDa:用于多模态理解的大型扩散语言模型
机构 * UCLA(加州大学洛杉矶分校) ; Panasonic AI Research(松下人工智能研究) ; Adobe Research(Adobe研究) ; Salesforce Research(Salesforce研究)
AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。
Comments 26 pages, 8 figures