How Well Does Agent Development Reflect Real-World Work?
代理开发是否能反映现实世界的工作?
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。
高校专区
代理开发是否能反映现实世界的工作?
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。
基于 LLM 的规划器的定位与错误修正
机构 * Language Technologies Institute, Carnegie Mellon University, Pittsburgh, US(语言技术研究所,卡内基梅隆大学,匹兹堡,美国) ; Machine Learning Department, Carnegie Mellon University, Pittsburgh, USA(机器学习系,卡内基梅隆大学,匹兹堡,美国)
AI总结 本研究提出 L-ICL 方法,通过局部上下文学习修正 LLM 规划器的错误,显著提升规划任务的有效性。
四足与人形机器人整体模型预测控制的MuJoCo实现
机构 * Department Aeronautics and Astronautics, Massachusetts Institute of Technology(航空宇航与工程力学系,麻省理工学院) ; Google DeepMind(谷歌DeepMind) ; Department of Electrical and Computer Engineering, Carnegie Mellon University(电气与计算机工程系,卡内基梅隆大学) ; Robotics Institute, Carnegie Mellon University(机器人研究所,卡内基梅隆大学)
AI总结 基于MuJoCo的iLQR算法实现了四足和人形机器人实时整体MPC,展示了仿真到现实的高效泛化能力。
Comments to appear at ICRA 2026
MOSIV:从视频中多物体系统识别
机构 * CMU(卡内基梅隆大学) ; Georgia Tech(佐治亚理工学院) ; Harvard(哈佛大学) ; ETH Zurich(苏黎世联邦理工学院) ; UIUC(伊利诺伊大学香槟分校) ; Insta360 ; UC Merced(加州大学默塞德分校)
AI总结 MOSIV通过从视频中导出的几何目标直接优化连续材料参数,提升多物体系统识别的接地准确性和模拟保真度。
Comments ICLR 2026
ExpReS-VLA: 通过经验回放和检索专门化视觉-语言-动作模型
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
AI总结 ExpReS-VLA通过经验回放和检索增强,提升VLA模型在特定任务中的适应能力与性能。
Comments 8 pages, 4 figures, 3 tables, accepted to International Conference on Robotics and Automation (ICRA) 2026
SurvHTE-Bench:生存分析中异质治疗效应估计的基准测试
机构 * Machine Learning Department & Heinz College Carnegie Mellon University(机器学习系及卡内基梅隆大学海因兹学院) ; Heinz College Carnegie Mellon University(卡内基梅隆大学海因兹学院) ; National Library of Medicine National Institutes of Health(国家医学图书馆国立卫生研究院)
AI总结 SurvHTE-Bench是一个用于生存分析中异质治疗效应估计的首个综合基准测试,通过合成、半合成和现实数据集评估不同方法在复杂条件下的性能。
Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)
基于冲突的搜索作为协议:一种多智能体运动规划协议用于异构智能体、求解器和独立任务
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Tongji University(同济大学) ; UC Berkeley(伯克利大学)
AI总结 本文提出了一种基于冲突的搜索协议,用于异构智能体的多智能体运动规划,利用多种单智能体规划算法实现无碰撞路径规划。
Comments Published at ICRA 2026, Project webpage: https://rishi-v.github.io/CBS-Protocol/
OPPO: 通过管道重叠加速基于PPO的RLHF
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 OPPO通过管道重叠技术提升基于PPO的RLHF训练效率,加速训练过程并提高GPU利用率
四旋翼导航使用强化学习与优先信息
机构 * Robotics Institute, Carnegie Mellon University(机器人研究所,卡内基梅隆大学)
AI总结 本文提出一种基于强化学习的四旋翼导航方法,利用优先信息和损失函数提高绕过大型障碍物的能力,实验表明其在复杂环境中具有更高的成功率和稳定性。
用人工智能辅助发现解决理论物理中的一个开放问题
机构 * Google Research(谷歌研究) ; School of Engineering and Applied Sciences, Harvard University(工程与应用科学学院,哈佛大学) ; School of Computer Science, Carnegie Mellon University(计算机科学学院,卡内基梅隆大学)
AI总结 本文提出了一种结合大型语言模型和树搜索框架的混合系统,通过AI辅助发现解决了理论物理中宇宙弦引力辐射功率谱的开放问题,并推导出新的解析解。
Comments 22 pages, 3 figures
潜在粒子世界模型:自监督的以对象为中心的随机动态建模
机构 * Carnegie Mellon University(卡内基梅隆大学) ; UT Austin(德克萨斯大学奥斯汀分校) ; Brown University(布朗大学) ; Lambda ; Technion(技术学院)
AI总结 LPWM通过自监督学习实现现实世界多对象数据的随机动态建模,并在决策制定中展现卓越性能。
Comments ICLR 2026 Oral. Project webpage: https://taldatech.github.io/lpwm-web
在强化学习中学习难题问题:基于参考的微调
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 ReGFT通过利用人类参考解决方案合成积极轨迹,提升RL在数学推理中的性能和训练效率。
Comments 15 pages, 5 figures
智能体学习其运行时:解释器持久性作为训练时语义
机构 * Ontocord ; Carnegie Mellon University(卡内基梅隆大学) ; MPI-IS Tübingen(图宾根MPI研究所) ; Tübingen AI Center(图宾根人工智能中心) ; ELLIS Institute Tübingen(图宾根ELLIS研究所)
AI总结 研究探讨解释器持久性对智能体学习的影响,发现其影响解决方案达成方式而非能否达成,且训练与运行时对齐可提升效率。
Comments Code: https://github.com/mrcabbage972/agents-learn-runtime
MotionStream: 通过交互式运动控制实现实时视频生成
机构 * Seoul National University(首尔国立大学) ; Adobe Research(Adobe研究) ; Carnegie Mellon University(卡内基梅隆大学) ; Morpheus AI
AI总结 MotionStream通过交互式运动控制实现实时视频生成,利用因果注意力机制和蒸馏技术,实现亚秒延迟和高效率的无限长视频流式生成。
Comments ICLR 2026, Project webpage: https://joonghyuk.com/motionstream-web/
评估代码更改对大型语言模型故障定位性的影响
机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国)
AI总结 本文通过端到端评估框架评估LLM在故障定位中的鲁棒性,发现SPMs导致78%的LLM失败于之前定位的故障,表明LLM推理依赖于语法而非语义。
Comments This paper is currently Under Review. It consists of 12 pages, 11 Figures, and 5 Tables
深度学习与机制设计的结合:关键结果与一些新应用
机构 * Department of Electronics and Communication Engineering, SRM University A.P.(电子与通信工程系,SRM大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Plaksha University(Plaksha大学) ; Department of Computer Science and Automation, Indian Institute of Science(计算机科学与自动化系,印度科学研究院)
AI总结 本文探讨了深度学习在机制设计中的应用,通过三个案例研究展示了如何利用深度学习近似满足机制设计中的关键属性。
ManipulationNet: 一个用于基于现实世界机器人操作的基准测试基础设施,包含物理技能挑战和具身多模态推理
机构 * Rice University(里士大学) ; U.S. National Institute of Standards and Technology(美国国家标准与技术研究院) ; Massachusetts Institute of Technology(麻省理工学院) ; Karlsruhe Institute of Technology(卡尔斯鲁厄技术大学) ; Autodesk Research(Autodesk研究) ; University of California, Berkeley(加州大学伯克利分校) ; KTH Royal Institute of Technology(皇家理工学院) ; Tsinghua University(清华大学) ; Columbia University(哥伦比亚大学) ; ASTM International(美国材料与试验协会) ; Carnegie Mellon University(卡内基梅隆大学) ; German Aerospace Center (DLR)(德国航空航天中心) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; NVIDIA Research(NVIDIA研究)
AI总结 ManipulationNet通过标准化硬件和统一软件客户端,为机器人操作提供现实世界基准测试,促进物理技能和具身推理能力的系统性发展。
Comments 32 pages, 8 figures
通过预测神经肌肉骨骼模拟学习髋部外骨骼控制策略
机构 * Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)
AI总结 本文提出基于物理的神经肌肉骨骼模拟方法,通过仿真训练髋部外骨骼控制策略并部署到硬件,有效减少实验负担,提升控制器的适应性和实用性。
认知到控制 - 多智能体学习用于人-仿人协作运输
机构 * Department of Electrical Engineering, the University of Texas at Arlington(电气工程系,德克萨斯大学阿灵顿分校) ; Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)
AI总结 本研究提出认知到控制框架,通过多智能体强化学习实现人-仿人协作运输中的持续推理与稳定控制。
具有自适应力分布的软半主动背支撑装置使用可变弹性作动和重量反馈
机构 * Arizona State University(亚利桑那州立大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本研究提出了一种软半主动背支撑装置,结合可变刚度被动元件和人工肌肉,通过重量反馈实现自适应力分布,减少背部肌肉活动。
Comments 17 pages, 18 figures
CONCUR: 评估LLM在并发代码生成中的基准测试
机构 * The University of Queensland(昆士兰大学) ; Texas A&M University - Kingsville(德克萨斯农工大学-国王维尔分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 CONCUR是一个专门评估LLM在并发代码生成能力的基准测试,包含115个问题,涵盖基础和变体,用于评估LLM在并发编程中的性能。
具备接触感知的机载感知与混合控制的空中操作
机构 * Department of Aerospace Engineering, Pennsylvania State University(宾夕法尼亚州立大学航空航天工程系) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
AI总结 本文提出了一种无需外部运动捕捉的机载感知与混合控制方法,实现了接触丰富任务的精准运动跟踪和稳定接触力控制。
Comments 8 pages, 7 figures. Accepted by ICRA 2026
代理数据协议:统一多样化、高效的LLM代理微调数据集
机构 * Carnegie Mellon University(卡内基梅隆大学) ; The Ohio State University(俄亥俄州立大学) ; University of Hong Kong(香港大学) ; Duke University(杜克大学) ; Fujitsu Research(富士通研究) ; All Hands AI(全手AI)
AI总结 本文提出代理数据协议(ADP),通过统一多样化代理训练数据集,提升LLM代理微调效果,实现20%的性能提升并在多个基准上达到SOTA水平。
UMA:用于原子的通用模型家族
机构 * FAIR at Meta(Meta 的 FAIR 研究组) ; Department of Chemical Engineering, Carnegie Mellon University(卡内基梅隆大学化学工程系)
AI总结 UMA模型通过大规模训练和创新架构,在原子模拟中实现高速度、高精度和广泛泛化能力,单模型可媲美专门化模型。
Comments 33 pages, 8 figures
上下文偏差用于自动语音识别中的发音-正字法不匹配
机构 * Interactive Systems Lab, Karlsruhe Institute of Technology, Karlsruhe, Germany(卡尔斯鲁厄技术大学交互系统实验室) ; Interactive Systems Lab, Carnegie Mellon University, Pittsburgh PA, USA(卡内基梅隆大学交互系统实验室)
AI总结 本文提出了一种通过修正替换错误来提高自动语音识别中发音-正字法不匹配问题的识别准确率的方法。
用于LLM-as-a-Judge偏好分析的自动化概念发现
机构 * Department of Computer Science(计算机科学系) ; Carnegie-Mellon University(卡内基梅隆大学)
AI总结 本文提出了一种自动化方法,用于发现LLM判断偏好的驱动因素,通过比较不同概念提取方法,验证了LLM在敏感请求上的偏好,并揭示了新的趋势。
LLM赋能机器人中的安全护栏
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 RoboGuard通过两阶段护栏架构,利用根信任LLM和链式推理生成上下文安全规范,有效降低LLM赋能机器人在对抗攻击下的不安全计划执行率,提升系统安全性与可靠性。
基于EEG的情感识别中的图神经网络:综述
机构 * Nanyang Technological University, Singapore(南洋理工大学) ; Xi’an Jiaotong University, Xi’an, China(西安交通大学) ; Imperial College London, London, UK(伦敦帝国理工学院) ; Amazon, Seattle, WA, USA(亚马逊) ; Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学) ; Uber Technologies, Inc., USA(Uber Technologies, Inc.) ; School of Computer Science, Central China Normal University, Wuhan, China(中央财经大学计算机学院) ; Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所)
AI总结 本文综述了基于EEG的情感识别中图神经网络的应用,分析了现有方法的共性与差异,并探讨了未来研究方向。
Comments The 30th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD 2026)
DuoMo:用于世界空间人体重建的双动差分
机构 * Meta Reality Labs ; University of Pennsylvania(宾夕法尼亚大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 DuoMo通过双扩散模型实现世界空间人体运动重建,有效处理噪声和不完整输入,提升重建精度。
Comments CVPR 2026. Project page: https://yufu-wang.github.io/duomo/
频谱调节:面向分布覆盖和上下文可引导性的后训练
机构 * University of Washington(华盛顿大学) ; Stanford University(斯坦福大学) ; Microsoft Research(微软研究院) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出Spectrum Tuning方法,通过Spectrum Suite提升模型在多样化分布下的引导能力和输出空间覆盖性。
Comments ICLR 2026