arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-05-01 至 2026-05-01 共收录 9
2604.28190 2026-05-01 cs.CV

Representation Fréchet Loss for Visual Generation

用于视觉生成的表示弗雷歇损失

Jiawei Yang, Zhengyang Geng, Xuan Ju, Yonglong Tian, Yue Wang

机构 * USC(美国南加州大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) OpenAI

AI总结 本文提出FD-loss,通过分离FD估计的种群规模与梯度计算的批次规模,发现基于表示空间的FD优化能提升视觉质量,且多步生成器可转为强单步生成器,同时揭示FID可能误判视觉质量。

Comments Code and checkpoints are available at https://github.com/Jiawei-Yang/FD-loss

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28169 2026-05-01 cs.CV cs.AI cs.LG

PhyCo: Learning Controllable Physical Priors for Generative Motion

PhyCo:学习可控制的物理先验以生成运动

Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) UC San Diego(圣地亚哥大学)

AI总结 PhyCo通过整合物理可控的生成模型,实现了在视频生成中物理一致性和可控性的提升,无需模拟器或几何重建。

Comments CVPR 2026. Project Page: https://phyco-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09881 2026-05-01 cs.CL

Do What I Say: A Spoken Prompt Dataset for Instruction-Following

我说的话:用于指令跟随的语音提示数据集

Maike Züfle, Sara Papi, Fabian Retkowski, Szymon Mazurek, Marek Kasztelnik, Alexander Waibel, Luisa Bentivogli, Jan Niehues

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄理工学院,德国) Fondazione Bruno Kessler, Italy(布鲁诺·凯瑟尔基金会,意大利) ACC Cyfronet AGH, Poland(AGH计算机科学与技术学院,波兰) AGH University of Krakow, Poland(克拉科夫AGH大学,波兰) Carnegie Mellon University, U.S.(卡内基梅隆大学,美国)

AI总结 本文提出DOWIS数据集,用于评估语音指令下的SLLM性能,发现文本提示在低资源和跨语言任务中表现更优,但语音输出任务中语音提示能缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10955 2026-05-01 cs.CV

Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization

Omni-Attribute: 用于视觉概念个性化的第一款开放词汇属性编码器

Tsai-Shien Chen, Aliaksandr Siarohin, Gordon Guocheng Qian, Kuan-Chieh Jackson Wang, Egor Nemchinov, Moayed Haji-Ali, Riza Alp Guler, Willi Menapace, Ivan Skorokhodov, Anil Kag, Jun-Yan Zhu, Sergey Tulyakov

机构 * Snap Inc. UC Merced(加州大学默塞德分校) CMU(卡内基梅隆大学)

AI总结 本文提出Omni-Attribute,通过联合设计数据与模型,学习高保真属性特定表示,解决现有方法中属性混杂的问题,提升开放词汇属性检索与生成性能。

Comments CVPR 2026. Project page: https://snap-research.github.io/omni-attribute

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27667 2026-05-01 cs.RO cs.LG

Can Tabular Foundation Models Guide Exploration in Robot Policy Learning?

表基础模型能否指导机器人策略学习中的探索?

Buqing Ou, Frederike Dümbgen

机构 * Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系) Inria, Département d’informatique de l’ENS, CNRS, PSL Research University(法国国家科学研究中心(CNRS)、巴黎综合理工学院(ENS)和PSL研究大学的Inria)

AI总结 本文提出TFM-S3方法,通过结合局部和全局搜索提升机器人策略学习的全局探索效率,实验显示其在连续控制基准上加速收敛并提升性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27175 2026-05-01 cs.RO

Global Sampling-Based Trajectory Optimization for Contact-Rich Manipulation via KernelSOS

基于全局采样的轨迹优化用于接触密集操作的KernelSOS方法

Zhongqi Wei, Frederike Dümbgen

机构 * Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系) Inria, Département d’informatique de l’ENS, CNRS, PSL Research University(法国国家科学研究中心(CNRS)、巴黎高等师范学院(ENS)和PSL研究大学的Inria)

AI总结 本文提出Global-MPPI框架,结合全局探索与局部优化,解决接触密集操作中的高维、长时域问题,实验显示其收敛更快且成本更低。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27093 2026-05-01 cs.CL cs.AI

Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations

无用却安全?在多轮对话中通过用户意图澄清基准测试恢复效用

Mingqian Zheng, Malia Morgan, Liwei Jiang, Carolyn Rose, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学) Allen Institute for AI(人工智能联盟研究所) University of Washington(华盛顿大学)

AI总结 本文提出CarryOnBench,首个交互式基准测试,评估LLM在多轮对话中是否能修正用户意图并恢复效用,同时保持安全。通过398个看似有害但实际无害的查询,生成5970次对话,评估14个模型的意图对齐效用和安全性能,发现模型在意图澄清后恢复效用存在不同失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26988 2026-05-01 cs.RO

Robot Planning and Situation Handling with Active Perception

具备主动感知的机器人规划与情境处理

Austine Oloo, Zainab Altaweel, Yohei Hayamizu, Peiqi Liu, Yan Ding, Saeid Amiri, Hao Yang, Andy Kaminski, Chad Esselink, Chris Paxton, Xiaohan Zhang, Shiqi Zhang

机构 * SUNY Binghamton(纽约州立大学布法罗分校) CMU(卡内基梅隆大学) Ford Research(福特研究) Agility Robotics(敏捷机器人)

AI总结 本文提出VAP-TAMP框架,通过主动感知和情境评估提升机器人在动态环境中执行任务的能力,结合场景图进行任务与运动规划,通过仿真和移动机械臂平台验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11119 2026-05-01 stat.ML cs.LG

DDO-RM: Distribution-Level Policy Improvement after Reward Learning

DDO-RM:奖励学习后基于分布的策略改进

Tiantian Zhang, Jierui Zuo, Michael Chen, Wenping Wang

机构 * Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学) Department of Management Science and Engineering(管理科学与工程系) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 DDO-RM通过将奖励评分转化为显式目标分布,改进策略在分布层面的性能,实验显示其在准确性与边际均值上优于DPO。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏