Solving Physics Olympiad via Reinforcement Learning on Physics Simulators
通过物理模拟器强化学习解决物理竞赛
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文通过物理模拟器生成合成数据,利用强化学习训练LLM,实现零样本迁移到现实物理竞赛,提升模型物理推理能力。
Comments Project Webpage - https://sim2reason.github.io/
高校专区
通过物理模拟器强化学习解决物理竞赛
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文通过物理模拟器生成合成数据,利用强化学习训练LLM,实现零样本迁移到现实物理竞赛,提升模型物理推理能力。
Comments Project Webpage - https://sim2reason.github.io/
解耦点扩散用于精确物体放置
机构 * Carnegie Mellon University(卡内基梅隆大学) ; ABB Inc.(ABB公司)
AI总结 本文提出TAX-DPD框架,通过解耦点扩散模型实现高精度物体放置,提升多模态覆盖与几何变化适应性。
透过工具看见:面向基础分割模型遮挡鲁棒性的受控基准
机构 * Stony Brook University(石溪大学) ; AIMA Research Lab(AIMA研究实验室) ; Carnegie Mellon University(卡内基梅隆大学) ; Yale University(耶鲁大学) ; Northwestern University(西北大学)
AI总结 本文提出OccSAM-Bench基准,评估分割模型在合成手术遮挡下的性能,揭示两种模型类型:遮挡意识模型和遮挡无关模型,强调临床需求驱动的模型选择。
Comments Accepted at CV4Clinic, CVPR 2026. 10 pages, 4 figures
Hodoscope:无监督监控AI误行
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出Hodoscope,通过无监督方法发现AI代理的异常行为,减少人工审查工作量,并提升LLM判断准确性。
Pando:当模型无法自我解释时,可解释性方法是否有效?
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 Pando通过引入解释轴,评估模型在不同解释情况下的表现,发现当解释可靠时,黑盒方法表现优异;当解释缺失或误导时,梯度归因和RelP方法效果更佳。
学习测试:用于动态不稳定性检测的物理信息表示
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Minnesota(明尼苏达大学)
AI总结 本文提出一种面向测试的学习框架,用于在分布偏移下评估稳定性。通过学习物理信息的潜在表示,结合神经动力学替代体和不确定性校准,实现对随机约束动态系统的不稳定性检测。
PRoID:多机器人探索与中继中的信息交付速率预测
机构 * Carnegie Mellon University Robotics Institute(卡内基梅隆大学机器人研究所) ; Ulsan National Institute of Science & Technology(蔚山科学技术院) ; Colorado School of Mines(科罗拉多矿业学院) ; University of Technology Sydney(悉尼科技大学) ; Brigham Young University(杨百翰大学)
AI总结 本文提出PRoID方法,通过学习地图预测估计机器人未来信息增益,以决定何时中继。PRoID-Safe进一步考虑机器人生存概率,提升在故障场景下的性能。
诊断LLM代理记忆中的检索与利用瓶颈
机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) ; Carnegie Mellon University(卡内基梅隆大学) ; University of North Carolina(北卡罗来纳大学)
AI总结 本文通过3x3实验分析写入策略、检索方法和记忆利用行为对性能的影响,发现检索方法是主要瓶颈,且原始分块存储在无需LLM调用时表现优异。
Comments Accepted at the MemAgents Workshop, ICLR 2026
感知归纳偏置是在对比学习之前所需的东西
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出在对比学习前引入感知归纳偏置,通过构建边界和表面表示来提升ResNet18的收敛速度和最终表示质量。
Comments CVPR 2025. Tianqin Li and Junru Zhao contributed equally to this work. Due to a formatting error during the CVPR submission, the equal contribution note was omitted in the official proceedings. This arXiv version corrects that oversight. The author order follows alphabetical order by last name. Code: https://github.com/juz031/MidVCL
WebLLM:一种高性能的浏览器内LLM推理引擎
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Shanghai Jiao Tong University(上海交通大学) ; NVIDIA(英伟达)
AI总结 WebLLM通过JavaScript框架在浏览器内实现高性能LLM推理,利用WebGPU和WebAssembly结合MLC-LLM和Apache TVM优化,实现80%的本地性能,推动隐私保护的本地化LLM应用。
WaterAdmin: 通过AI代理协调社区供水优化
机构 * University of Houston(休斯顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Riverside(加州大学河滨分校)
AI总结 本文提出WaterAdmin框架,结合LLM进行社区上下文抽象与优化控制,以实现动态环境下供水系统的可靠性和节能。
高效生成用户界面的个性化
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Purdue University(普渡大学)
AI总结 本文研究了生成用户界面个性化难题,提出基于历史设计师偏好样本的高效方法,在技术评估中优于预训练模型,并能生成更多用户偏好界面。
屏幕上的图灵测试:移动GUI代理人化的一个基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出屏幕上的图灵测试基准,通过建模检测器与代理的MinMax优化问题,评估代理在人类中心生态系统中的生存能力,并提出人化基准和检测指标,展示代理在不牺牲性能的前提下实现高模仿性。
学习协助:通过多智能体强化学习实现物理基础的人机控制
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Keio AI Research Center(庆应义塾大学人工智能研究中心) ; Keio University(庆应义塾大学)
AI总结 本文提出通过多智能体强化学习实现人与人之间力交换的交互动作模仿,解决了连续关注人类伙伴和快速适应其动态的需求,展示了多智能体RL在物理基础和社交感知人形控制中的优势。
Comments Accepted at CVPR 2026 (main). Project page: https://yutoshibata07.github.io/AssistMimic/
通过去噪过程奖励推进扩散语言模型的推理能力
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 本文提出去噪过程奖励,通过优化去噪轨迹提升扩散语言模型的推理稳定性与可解释性,实验显示在推理任务中表现更优。
基于奈奎斯特原理的隐式神经表示:FM-SIREN与FM-FINER
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Google(谷歌)
AI总结 本文提出FM-SIREN和FM-FINER,通过为周期性激活分配奈奎斯特原理指导的神经元特定频率乘数,减少隐式神经表示中的特征冗余,提升多任务信号重建性能。