arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 334
2607.01440 2026-07-03 cs.CL 新提交

FaithMed: Training LLMs For Faithful Evidence-Based Medical Reasoning

FaithMed: 训练大语言模型进行忠实于证据的医学推理

Zhiyun Zhang, Liwen Sun, Xiang Qian, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University School of Medicine(斯坦福大学医学院) Xlue

AI总结 提出FaithMed框架,通过过程级奖励和优势分组强化学习,监督LLM在医学推理中忠实评估和应用检索证据,在7个基准上平均提升9%。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01383 2026-07-03 cs.CV 新提交

MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation

MIBE:面向个性化图像生成的多主体交互基准与评估器

Zhihan Chen, Yuhuan Zhao, Yijie Zhu, Xinyu Yao, Mengcong Ren, Suwen Wang, Qiuyang Yin, Yuchen Sun, Qin Wang, Lu Xin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) DeerLab LLC(DeerLab有限责任公司) Carnegie Mellon University(卡内基梅隆大学) Clemson University(克莱姆森大学) Google(谷歌) San Jose State University(圣何塞州立大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出MIBE框架,包含多主体交互基准(MIB)和评估器(MIE),通过解耦数据体制和双头排序诊断目标,解决多主体个性化图像生成中主体遗漏、外观失配和交互错误问题,在黄金集上达到0.922成对准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01313 2026-07-03 cs.LG cs.AI cs.CL cs.CR 新提交

Black-Box Inference of LLM Architectural Properties with Restrictive API Access

受限API访问下LLM架构属性的黑盒推断

Christopher Ellis, Shreyas Chaudhari, Mei-Yu Wang, Leighton Barnes, Giulia Fanti, José M. F. Moura

机构 * Carnegie Mellon University(卡内基梅隆大学) Pittsburgh Supercomputing Center(匹兹堡超级计算中心)

AI总结 针对当前商业LLM API仅返回单logit且禁止logit偏置的限制,提出NightVision方法,通过新型公共集提示技术和首令牌时间测量,估计隐藏维度、深度和参数数量,在32个开源模型上验证了可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24564 2026-07-03 cs.CV 新提交

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments

PatternGSL: 一种用于无模板且可模拟的3D服装的结构化规范语言

Zhenyang Li, Lutao Jiang, Yizhou Zhao, Ying-Cong Chen, Xin Wang, Weikai Chen, Yifan Peng

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Carnegie Mellon University(卡内基梅隆大学) LIGHTSPEED Shenzhen(LIGHTSPEED深圳) LIGHTSPEED Los Angeles(LIGHTSPEED洛杉矶)

AI总结 提出PatternGSL,一种无模板、可学习的结构化服装表示语言,从单张图像直接预测完整缝纫图案,实现可模拟的3D服装重建。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01111 2026-07-02 cs.RO cs.AI cs.LG 新提交

FAR: Failure-Aware Retry for Test-Time Recovery and Continual Policy Improvement

FAR: 面向测试时恢复与持续策略改进的失败感知重试

Haoran Hao, Shahram Najam Syed, Jeffrey Ichnowski, Jeff Schneider

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出FAR框架,通过失败对比偏好适应和轻量动作扰动,使机器人从测试时失败中学习并自主恢复,结合成功轨迹持续改进策略,在仿真和真实任务中成功率分别提升17.6%和11.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00858 2026-07-02 cs.CV cs.LG 新提交

MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment

MoVA: 面向模块化长视频-文本对齐的非对称双投影学习

Peiyuan Zhu, Shaoan Xie, Zijian Li, Yifan Shen, Namrata Deka, Harsh Shrivastava, Guangyi Chen, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对视频-文本对比学习中时间错位和语义不对称问题,提出MoVA框架,通过非对称双投影(文本侧自适应选择帧感知子空间,视频侧解缠文本相关视觉概念)实现灵活对齐,在多个任务上超越现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00641 2026-07-02 cs.CY cs.LG 新提交

What's a Credit Worth? A Market Framework for Attribution-Aware Compensation in Generative Music

信用值多少钱?生成音乐中归因感知补偿的市场框架

Luyang Zhang, Xirui Jiang, Junwei Deng, Beibei Li, Jiaqi W. Ma, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对生成式AI音乐训练中创作者补偿问题,提出基于数据归因评分的支付框架,考虑目录级归因和信噪比,分析福利最优合同形式,实验表明噪声归因降低福利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00272 2026-07-02 cs.RO cs.AI cs.MA 新提交

ASPIRE: Agentic /Skills Discovery for Robotics

ASPIRE: 面向机器人的智能体技能发现

Runyu Lu, Yubo Wu, Ethan Kou, Letian Fu, Wenli Xiao, Ajay Mandlekar, Yinzhen Xu, Guanya Shi, Ken Goldberg, Ang Chen, Mosharaf Chowdhury, Yuke Zhu, Linxi "Jim" Fan, Guanzhi Wang

机构 * NVIDIA(英伟达) UMich(密歇根大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学)

AI总结 提出ASPIRE系统,通过闭环执行、技能库积累和进化搜索,自主编写和优化机器人控制程序,在扰动、多机器人协作和长时域任务上显著超越现有方法,并实现零样本泛化与仿真到现实的技能迁移。

Comments 43 pages, 12 figures, 9 tables. Project page: https://research.nvidia.com/labs/gear/aspire/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00174 2026-07-02 cs.CV cs.LG 新提交

Steal the Patch Size: Adversarially Manipulate Vision-Language Models

窃取补丁大小:对抗性操纵视觉-语言模型

Kai Hu, Akash Bharadwaj, Weichen Yu, Matt Fredrikson

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出一种黑盒模型窃取攻击,通过任务级侧信道推断视觉语言模型的补丁大小和预处理流程,并利用泄露信息实现预处理感知的迁移攻击和模型定向对抗操纵。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00714 2026-07-02 cs.CL cs.AI 新提交

Self-conditioned Flow Map Language Models via Fixed-point Flows

自条件流映射语言模型通过不动点流

Jaehoon Yoo, Wonjung Kim, Floor Eijkelboom, Chanhyuk Lee, Nicholas M. Boffi, Seunghoon Hong, Jinwoo Kim

机构 * KAIST(韩国科学技术院) University of Amsterdam(阿姆斯特丹大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出不动点流框架,将自条件机制解释为不动点迭代,并设计二维流模型同时压缩迭代与流过程,实现少步生成,在OpenWebText上超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00368 2026-07-02 cs.CL 新提交

Beyond Perplexity: A Behavioral Evaluation Framework for Deployment-Memory Claims in LLM Test-Time Training

超越困惑度:面向LLM测试时训练中部署记忆声称的行为评估框架

Xiangchen Song, Zhenhao Chen, Lingjing Kong, Shaoan Xie, Xinshuai Dong, Guangyi Chen, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 提出行为评估框架,通过证据阶梯和显式记忆基线校准LLM测试时训练的记忆声称,揭示代理指标与部署行为之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00083 2026-07-02 cs.CL cs.AI cs.LG 新提交

Harnessing the Latent Space: From Steering Vectors to Model Calibrators for Control and Trust

利用潜在空间:从引导向量到模型校准器以实现控制与信任

Nishant Subramani

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所)

AI总结 本文提出利用潜在空间中的引导向量控制语言模型行为,并开发基于潜在空间的模型校准器评估输出可信度,从而增强模型的可控性与可靠性。

Comments ACL 2026 (BigPicture Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31820 2026-07-01 cs.AI 新提交

Adaptive Cluster-First Route-Second Decomposition for Industrial-Scale Vehicle Routing

面向工业规模车辆路径问题的自适应先聚类后路由分解方法

Oguzhan Karaahmetoglu, Hyong Kim

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出一种自适应先聚类后路由分解系统,利用大语言模型作为高层决策者,迭代执行聚类、平衡和细化操作,实现容量感知的客户与车辆联合划分,在高达50万客户的实例上展现出竞争性性能和可扩展性。

Comments 29 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31748 2026-07-01 cs.LG 新提交

Addressing Over-Refusal in LLMs with Competing Rewards

用竞争奖励解决大语言模型中的过度拒绝问题

Taeyoun Kim, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) SynthLabs

AI总结 提出SEAR方法,通过对抗优化和过程奖励,让模型在推理中探索有害思路但最终输出安全答案,从而缓解安全训练导致的过度拒绝问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31154 2026-07-01 cs.LG cs.AI 新提交

PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

PPT-Eval: 面向PowerPoint任务的计算机使用智能体基准

Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar, Firoz Shaik, Shubhang Desai, Thong Q. Nguyen, Muhammad Taqi Raza, Vishal Chowdhary, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) UMass Amherst(马萨诸塞大学阿默斯特分校) Google(谷歌) Snowflake

AI总结 提出PPT-Eval基准,包含120个PowerPoint任务,并设计基于评分标准的评估框架,通过部分评分和自然语言反馈衡量智能体表现,发现现有最强模型仅达45%成功率。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31144 2026-07-01 cs.RO cs.AI 新提交

A Modular Vision-Language-Action Robotics Framework for Indoor Environments

面向室内环境的模块化视觉-语言-动作机器人框架

Anindya Jana, Snehasis Banerjee, Arup Sadhu, Ranjan Dasgupta

机构 * TCS Research, Tata Consultancy Services(塔塔咨询服务公司TCS研究部) CMU(卡内基梅隆大学)

AI总结 提出模块化架构,集成环境建图、问题处理和导航,通过双流并行处理(语义体素建图与语言分类)实现自然语言指令驱动的自主任务执行。

Comments IEEE IROS 2025 Workshop on Generative AI for Robotics and Smart Manufacturing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31132 2026-07-01 cs.RO 新提交

ELASTIC: Efficiently Learning to Adaptively Scale Test-Time Compute for Generative Control Policies

ELASTIC: 高效学习自适应缩放测试时计算以生成控制策略

Andrew Zou Li, Gokul Swamy, Yonatan Bisk, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出ELASTIC算法,通过元强化学习为生成控制策略学习状态依赖的测试时计算调度,在扩散策略和视觉-语言-动作模型上实现帕累托最优,减少34%延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31018 2026-07-01 cs.CV 新提交

WarpI2I: Image Warping for Image-to-Image Translation

WarpI2I:用于图像到图像翻译的图像扭曲

Shen Zheng, Anurag Ghosh, Gaurav Parmar, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出一种基于显著性的扭曲-反扭曲框架,通过重新分配空间表示至显著区域,在不增加潜在分辨率的情况下保留图像细节,适用于人体重光照、驾驶场景翻译等任务。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30949 2026-07-01 cs.AI cs.AR 新提交

AgRefactor: Self-Evolving Agentic Workflow for HLS Compatibility and Performance

AgRefactor:面向HLS兼容性与性能的自进化智能体工作流

Yang Zou, Zijian Ding, Yizhou Sun, Jason Cong

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 提出基于LLM的多智能体工作流AgRefactor,通过自进化记忆系统和自动化重构工具,将软件代码重构为HLS兼容程序,在11个基准测试中9个超越现有方法,并实现6.51x几何平均加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30801 2026-07-01 cs.CL cs.CY cs.LG cs.SI 新提交

Using AI Agents to Automate Black-Box Audits of Personalization Algorithms at Scale

使用AI代理自动化大规模黑盒审计个性化算法

Alessandro Morosini, Sarah H. Cen, Andrew Ilyas, Hedi Driss, Aleksander Mądry, Chara Podimata

机构 * Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出用生成式AI代理作为行为引擎进行黑盒审计,通过固定人设和反事实扰动解耦用户属性与行为,在X平台部署1120个代理发现算法推荐放大有毒、极化内容且效果因用户意识形态而异。

Comments 43 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30749 2026-07-01 cs.RO 新提交

From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation

从抓取到灵巧:大规模抓取预训练用于灵巧操作

Ying Yuan, Xinyu Liu, Sriram Krishna, David Held

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 本文提出一种层次化模仿学习框架,利用大规模灵巧抓取数据集预训练低级控制器,再微调于下游工具使用任务,在仿真和真实实验中显著提升成功率。

Comments Project page: https://yingyuan0414.github.io/grasp2dexterity/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25354 2026-07-01 cs.CL 新提交

Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing

通过局部分支路由实现高效且可训练的语言模型测试时扩展

Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang

机构 * Northwestern University(西北大学) Rutgers University(罗格斯大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) LMSYS Org(LMSYS组织) Tilde Research(Tilde研究) University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) University of California, San Diego(加州大学圣迭戈分校)

AI总结 提出局部分支路由(LBR)框架,通过轻量级路由器选择局部前瞻树中的深度-1子路径,实现令牌级测试时扩展,在数学推理基准上优于链式思维和软令牌分支基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28228 2026-06-29 cs.LG stat.ML 新提交

Disentangling Continuous-Time Latent Dynamics: Identifiability of Latent SDEs via Diffusion Shifts

解缠连续时间潜在动力学:通过扩散偏移实现潜在SDE的可辨识性

Yuanyuan Wang, Wenjie Wang, Haoxuan Li, Mingming Gong, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The University of Melbourne(墨尔本大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对连续时间潜在随机微分方程模型的可辨识性问题,利用环境引起的扩散协方差偏移,证明在漂移无稀疏性假设下,对角扩散机制可识别潜在坐标至置换和缩放,并估计潜在解缠与因果图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27687 2026-06-29 cs.CL cs.AI cs.DL 新提交

Mitigating LLM-based p-Hacking by Preregistering for the Next LLM

通过预注册下一个LLM来缓解基于LLM的p-hacking

Maria Thomas, Kristina Gligoric, Nihar B. Shah

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出一种协议,通过预注册实验和合格模型,并在预注册后发布的第一个合格LLM上运行,以缓解LLM研究中的p-hacking问题。实验表明该协议能有效阻止73.9%和72.7%的p-hack转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27581 2026-06-29 cs.RO cs.AI 新提交

SceneBot: Contact-Prompted General Humanoid Whole Body Tracking with Scene-Interaction

SceneBot: 接触提示的通用人形全身跟踪与环境交互

Sirui Chen, Shibo Zhao, Zhen Wu, Jiaman Li, Guanya Shi, C. Karen Liu

机构 * Stanford(斯坦福大学) Amazon FAR(亚马逊 FAR) CMU(卡内基梅隆大学)

AI总结 提出SceneBot框架,通过接触标签和事后场景重建,统一处理自由空间运动、地形穿越和全身操作,实现复杂长时任务。

Comments 15 pages 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27344 2026-06-26 cs.RO 新提交

VibeAct: Vibration to Actions for Contact-Rich Reactive Robot Dexterity

VibeAct: 振动到动作——用于接触丰富反应性机器人灵巧性的方法

Yuemin Mao, Uksang Yoo, Jean Oh, Jonathan Francis, Jeffrey Ichnowski

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for Artificial Intelligence(博世人工智能中心)

AI总结 提出VibeAct框架,通过共享接触和滑移的物理表示,桥接真实振动触觉感知与基于模拟的强化学习,在灵巧手操作任务中优于基线方法,并成功迁移到真实平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26603 2026-06-26 cs.RO 新提交

Bridging Handheld and Teleoperated Supervision for Contact-Rich Manipulation via State-Gated Experts

通过状态门控专家弥合手持与遥操作监督在接触丰富操作中的差距

Vidullan Surendran, Neehar Peri, David Watkins

机构 * RAI Institute(RAI研究所) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对接触丰富操作任务,提出BRIDGE方法,通过状态门控混合扩散策略专家,融合手持数据与少量遥操作演示,在接触敏感阶段利用期望动作,提升成功率最高36.7%。

Comments Project Page: https://nperi-rai.github.io/bridge-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26588 2026-06-26 cs.RO 新提交

Inference-Time Robot Behavior Steering through Physically-Aware Reconfiguration of Task-Structure

推理时通过物理感知的任务结构重配置实现机器人行为引导

Yiyuan Pan, Hanjiang Hu, Shangtao Li, Xusheng Luo, Changliu Liu

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 提出ReStruct方法,利用神经自动机策略将视觉运动策略分解为高层状态机骨架和低层残差控制器,通过同步乘积将用户偏好融入骨架以重配置任务结构,实现无需重训练的推理时行为引导,在仿真和真实实验中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26488 2026-06-26 cs.LG 新提交

What Survives When You Compress a Recursive Reasoner for the Edge?

当压缩边缘端递归推理器时,什么得以幸存?

Pearse Jim, Steven Kolawole, Opegbemi Matthias Busoye, Glory Bagai, Virginia Smith

机构 * ML Collective Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究递归推理模型在边缘设备压缩中的表现,发现激进压缩破坏全局推理但保留局部预测,提出每通道校准INT4和轨迹保真度指标实现无损部署。

Comments Preprint; in review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26472 2026-06-26 cs.LG cs.CL 新提交

Epiphany-Aware KV Cache Eviction Without the Attention Matrix

无需注意力矩阵的顿悟感知KV缓存淘汰

Steven Kolawole, Virginia Smith

机构 * Language Technologies Institute Carnegie Mellon University(语言技术研究所卡内基梅隆大学) Machine Learning Department Carnegie Mellon University(机器学习系卡内基梅隆大学)

AI总结 提出EpiKV方法,通过模型内部表示变化(顿悟分数)而非注意力权重来淘汰KV缓存,无需训练或自定义内核,支持FlashAttention,在MATH-500上达到72%准确率,速度提升2.8倍。

Comments Preprint; in review

详情

展开后加载摘要…

URL PDF HTML 收藏