arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2342
2602.18899 2026-04-15 eess.AS cs.CL cs.LG cs.SD

[b]=[d]-[t]+[p]: Self-supervised Speech Models Discover Phonological Vector Arithmetic

[b]=[d]-[t]+[p]:自监督语音模型发现语音向量算术

Kwanghee Choi, Eunjung Yeo, Cheol Jun Cho, David Harwath, David R. Mortensen

机构 * UT Austin(得克萨斯大学奥斯汀分校) UC Berkeley(伯克利大学) CMU(卡内基梅隆大学)

AI总结 研究通过分析96种语言的自监督语音模型表示,发现语音特征可通过线性方向和向量运算表示,揭示了语音向量算术的结构。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04705 2026-04-15 cs.CV

Label-Efficient Cross-Modality Generalization for Liver Segmentation in Multi-Phase MRI

多模态MRI肝脏分割中的高效标注方法

Quang-Khai Bui-Tran, Minh-Toan Dinh, Thanh-Huy Nguyen, Ba-Thinh Lam, Mai-Anh Vu, Ulas Bagci

机构 * Ho Chi Minh University of Science(胡志明科技大学) National Central University(国立中央大学) Carnegie Mellon University(卡内基梅隆大学) University of Houston(休斯顿大学) Northwestern University(西北大学)

AI总结 本文提出一种高效标注的分割方法,通过基础模型适应和协同伪监督,实现多模态和多厂商MRI下的肝脏分割,克服标注数据稀缺和分布不均的问题。

Comments Accepted at MICCAI 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01770 2026-04-15 math.NA cs.AI cs.DC cs.MS cs.NA math.OC

Global optimization tailored for graphics processing units: Complete and rigorous search for large-scale nonlinear minimization

面向图形处理单元的全局优化:针对大规模非线性最小化问题的完整和严谨搜索

Guanglu Zhang, Qihang Shan, Jonathan Cagan

机构 * Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系)

AI总结 本文提出一种数值方法,利用区间分析和GPU计算能力,有效寻找非线性函数在变量简单边界下的全局最小值,通过迭代排除不可行区域,确保在存在舍入误差时仍能准确包围全局最小值。

Comments 35 pages, 4 figures

Journal ref PNAS Nexus, 5(4), pp. pgag103 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10676 2026-04-15 cs.CL cs.AI cs.LG

Fine-Tuning LLMs for Report Summarization: Analysis on Supervised and Unsupervised Data

针对报告摘要的LLM微调:对监督和非监督数据的分析

Swati Rallapalli, Shannon Gallagher, Andrew O. Mellinger, Jasmine Ratchford, Anusha Sinha, Tyler Brooks, William R. Nichols, Nick Winski, Bryan Brown

机构 * Software Engineering Institute, Carnegie Mellon University(软件工程研究院,卡内基梅隆大学)

AI总结 研究LLM微调在报告摘要任务中的有效性,探讨在资源有限和本地计算环境下微调的可行性及摘要质量评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11805 2026-04-14 cs.LG cs.AI cs.CV cs.RO

Solving Physics Olympiad via Reinforcement Learning on Physics Simulators

通过物理模拟器强化学习解决物理竞赛

Mihir Prabhudesai, Aryan Satpathy, Yangmin Li, Zheyang Qin, Nikash Bhardwaj, Amir Zadeh, Chuan Li, Katerina Fragkiadaki, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过物理模拟器生成合成数据,利用强化学习训练LLM,实现零样本迁移到现实物理竞赛,提升模型物理推理能力。

Comments Project Webpage - https://sim2reason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11793 2026-04-14 cs.RO

Disentangled Point Diffusion for Precise Object Placement

解耦点扩散用于精确物体放置

Lyuxing He, Eric Cai, Shobhit Aggarwal, Jianjun Wang, David Held

机构 * Carnegie Mellon University(卡内基梅隆大学) ABB Inc.(ABB公司)

AI总结 本文提出TAX-DPD框架,通过解耦点扩散模型实现高精度物体放置,提升多模态覆盖与几何变化适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11711 2026-04-14 cs.CV

Seeing Through the Tool: A Controlled Benchmark for Occlusion Robustness in Foundation Segmentation Models

透过工具看见:面向基础分割模型遮挡鲁棒性的受控基准

Nhan Ho, Luu Le, Thanh-Huy Nguyen, Thien Nguyen, Xiaofeng Liu, Ulas Bagci

机构 * Stony Brook University(石溪大学) AIMA Research Lab(AIMA研究实验室) Carnegie Mellon University(卡内基梅隆大学) Yale University(耶鲁大学) Northwestern University(西北大学)

AI总结 本文提出OccSAM-Bench基准,评估分割模型在合成手术遮挡下的性能,揭示两种模型类型:遮挡意识模型和遮挡无关模型,强调临床需求驱动的模型选择。

Comments Accepted at CV4Clinic, CVPR 2026. 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11072 2026-04-14 cs.AI

Hodoscope: Unsupervised Monitoring for AI Misbehaviors

Hodoscope:无监督监控AI误行

Ziqian Zhong, Shashwat Saxena, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出Hodoscope,通过无监督方法发现AI代理的异常行为,减少人工审查工作量,并提升LLM判断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11061 2026-04-14 cs.LG cs.AI

Pando: Do Interpretability Methods Work When Models Won't Explain Themselves?

Pando:当模型无法自我解释时,可解释性方法是否有效?

Ziqian Zhong, Aashiq Muhamed, Mona T. Diab, Virginia Smith, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 Pando通过引入解释轴,评估模型在不同解释情况下的表现,发现当解释可靠时,黑盒方法表现优异;当解释缺失或误导时,梯度归因和RelP方法效果更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10967 2026-04-14 cs.LG

Learning to Test: Physics-Informed Representation for Dynamical Instability Detection

学习测试:用于动态不稳定性检测的物理信息表示

Minxing Zheng, Zewei Deng, Liyan Xie, Shixiang Zhu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Minnesota(明尼苏达大学)

AI总结 本文提出一种面向测试的学习框架,用于在分布偏移下评估稳定性。通过学习物理信息的潜在表示,结合神经动力学替代体和不确定性校准,实现对随机约束动态系统的不稳定性检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10433 2026-04-14 cs.RO

PRoID: Predicted Rate of Information Delivery in Multi-Robot Exploration and Relaying

PRoID:多机器人探索与中继中的信息交付速率预测

Seungchan Kim, Seungjae Baek, Micah Corah, Graeme Best, Brady Moon, Sebastian Scherer

机构 * Carnegie Mellon University Robotics Institute(卡内基梅隆大学机器人研究所) Ulsan National Institute of Science & Technology(蔚山科学技术院) Colorado School of Mines(科罗拉多矿业学院) University of Technology Sydney(悉尼科技大学) Brigham Young University(杨百翰大学)

AI总结 本文提出PRoID方法,通过学习地图预测估计机器人未来信息增益,以决定何时中继。PRoID-Safe进一步考虑机器人生存概率,提升在故障场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02473 2026-04-14 cs.AI

Diagnosing Retrieval vs. Utilization Bottlenecks in LLM Agent Memory

诊断LLM代理记忆中的检索与利用瓶颈

Boqin Yuan, Yue Su, Kun Yao

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) Carnegie Mellon University(卡内基梅隆大学) University of North Carolina(北卡罗来纳大学)

AI总结 本文通过3x3实验分析写入策略、检索方法和记忆利用行为对性能的影响,发现检索方法是主要瓶颈,且原始分块存储在无需LLM调用时表现优异。

Comments Accepted at the MemAgents Workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01201 2026-04-14 cs.CV

Perceptual Inductive Bias Is What You Need Before Contrastive Learning

感知归纳偏置是在对比学习之前所需的东西

Tianqin Li, Junru Zhao, Dunhan Jiang, Shenghao Wu, Alan Ramirez, Tai Sing Lee

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出在对比学习前引入感知归纳偏置,通过构建边界和表面表示来提升ResNet18的收敛速度和最终表示质量。

Comments CVPR 2025. Tianqin Li and Junru Zhao contributed equally to this work. Due to a formatting error during the CVPR submission, the equal contribution note was omitted in the official proceedings. This arXiv version corrects that oversight. The author order follows alphabetical order by last name. Code: https://github.com/juz031/MidVCL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15803 2026-04-14 cs.LG cs.AI

WebLLM: A High-Performance In-Browser LLM Inference Engine

WebLLM:一种高性能的浏览器内LLM推理引擎

Charlie F. Ruan, Yucheng Qin, Akaash R. Parthasarathy, Xun Zhou, Ruihang Lai, Hongyi Jin, Yixin Dong, Bohan Hou, Meng-Shiun Yu, Yiyan Zhai, Sudeep Agarwal, Hangrui Cao, Siyuan Feng, Tianqi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) NVIDIA(英伟达)

AI总结 WebLLM通过JavaScript框架在浏览器内实现高性能LLM推理,利用WebGPU和WebAssembly结合MLC-LLM和Apache TVM优化,实现80%的本地性能,推动隐私保护的本地化LLM应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10343 2026-04-14 cs.LG

WaterAdmin: Orchestrating Community Water Distribution Optimization via AI Agents

WaterAdmin: 通过AI代理协调社区供水优化

Jiaqi Wen, Pingbo Tang, Shaolei Ren, Jianyi Yang

机构 * University of Houston(休斯顿大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Riverside(加州大学河滨分校)

AI总结 本文提出WaterAdmin框架,结合LLM进行社区上下文抽象与优化控制,以实现动态环境下供水系统的可靠性和节能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09876 2026-04-14 cs.LG cs.AI cs.CV cs.HC

Efficient Personalization of Generative User Interfaces

高效生成用户界面的个性化

Yi-Hao Peng, Samarth Das, Jeffrey P. Bigham, Jason Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Purdue University(普渡大学)

AI总结 本文研究了生成用户界面个性化难题,提出基于历史设计师偏好样本的高效方法,在技术评估中优于预训练模型,并能生成更多用户偏好界面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09574 2026-04-14 cs.AI cs.LG

Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization

屏幕上的图灵测试:移动GUI代理人化的一个基准

Jiachen Zhu, Lingyu Yang, Rong Shan, Congmin Zheng, Zeyu Zheng, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出屏幕上的图灵测试基准,通过建模检测器与代理的MinMax优化问题,评估代理在人类中心生态系统中的生存能力,并提出人化基准和检测指标,展示代理在不牺牲性能的前提下实现高模仿性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11346 2026-04-14 cs.CV cs.GR cs.RO

Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning

学习协助:通过多智能体强化学习实现物理基础的人机控制

Yuto Shibata, Kashu Yamazaki, Lalit Jayanti, Yoshimitsu Aoki, Mariko Isogawa, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学)

AI总结 本文提出通过多智能体强化学习实现人与人之间力交换的交互动作模仿,解决了连续关注人类伙伴和快速适应其动态的需求,展示了多智能体RL在物理基础和社交感知人形控制中的优势。

Comments Accepted at CVPR 2026 (main). Project page: https://yutoshibata07.github.io/AssistMimic/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01544 2026-04-14 cs.AI

Advancing Reasoning in Diffusion Language Models with Denoising Process Rewards

通过去噪过程奖励推进扩散语言模型的推理能力

Shaoan Xie, Lingjing Kong, Xiangchen Song, Xinshuai Dong, Guangyi Chen, Eric P. Xing, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出去噪过程奖励,通过优化去噪轨迹提升扩散语言模型的推理稳定性与可解释性,实验显示在推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23438 2026-04-14 cs.CV

FM-SIREN & FM-FINER: Implicit Neural Representation Using Nyquist-based Orthogonality

基于奈奎斯特原理的隐式神经表示:FM-SIREN与FM-FINER

Mohammed Alsakabi, Wael Mobeirek, John M. Dolan, Ozan K. Tonguz

机构 * Carnegie Mellon University(卡内基梅隆大学) Google(谷歌)

AI总结 本文提出FM-SIREN和FM-FINER,通过为周期性激活分配奈奎斯特原理指导的神经元特定频率乘数,减少隐式神经表示中的特征冗余,提升多任务信号重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09431 2026-04-13 cs.RO

Musculoskeletal Motion Imitation for Learning Personalized Exoskeleton Control Policy in Impaired Gait

为学习个性化外骨骼控制策略的肌肉骨骼运动模仿在障碍性步态中的应用

Itak Choi, Ilseung Park, Eni Halilaj, Inseung Kang

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种结合生理学合理肌肉骨骼模拟与强化学习的框架,用于为健全和临床人群提供可扩展的个性化外骨骼辅助,减少代谢成本并提高步态对称性。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04144 2026-04-13 cs.CL cs.AI

Many Preferences, Few Policies: Towards Scalable Language Model Personalization

多种偏好,少数政策:迈向可扩展的语言模型个性化

Cheol Woo Kim, Jai Moondra, Roozbeh Nahavandi, Andrew Perrault, Milind Tambe, Swati Gupta

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) The Ohio State University(俄亥俄州立大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出PALM方法,通过多维权重向量建模用户偏好,生成小规模LLM组合以实现个性化,理论保证了规模和近似质量的平衡。

Comments Fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02598 2026-04-13 cs.HC cs.AI cs.PL

Explorable Theorems: Making Written Theorems Explorable by Grounding Them in Formal Representations

可探索的定理:通过将其基于形式化表示来使书面定理可探索

Hita Kambhamettu, Will Crichton, Sean Welleck, Harrison Goldstein, Andrew Head

机构 * University of Pennsylvania(宾夕法尼亚大学) Brown University(布朗大学) Carnegie Mellon University(卡内基梅隆大学) University at Buffalo(布法罗大学)

AI总结 本文提出可探索的定理系统,利用LLM将定理和证明转化为Lean语言,使用户能交互式地逐步验证证明并测试例子,提升数学理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05862 2026-04-13 stat.ML cs.LG math.ST stat.TH

Distribution-free two-sample testing with blurred total variation distance

无需分布的两样本检验与模糊总变差距离

Rohan Hore, Rina Foygel Barber

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Chicago(芝加哥大学)

AI总结 本文提出模糊总变差距离用于无需分布假设的两样本检验,提供理论保障并探讨其高维性质。

Comments 47 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08945 2026-04-13 cs.CV cs.RO

TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches

TouchAnything: 从稀疏机器人触碰引导的3D重建

Langzhe Gu, Hung-Jui Huang, Mohamad Qadri, Michael Kaess, Wenzhen Yuan

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出TouchAnything框架,利用预训练的2D视觉扩散模型作为语义和几何先验,从稀疏触觉测量中实现准确的3D重建,优于现有基线方法,支持开放世界中未见过的物体实例重建。

Comments Project Page: https://grange007.github.io/touchanything

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08720 2026-04-13 cs.SE cs.AI

Demystifying the Silence of Correctness Bugs in PyTorch Compiler

解析PyTorch编译器中正确性错误的沉默

Meiziniu Li, Dongze Li, Jianmeng Liu, Shing-Chi Cheung

机构 * The Hong Kong University of Science and Technology(香港科技大学) Guangzhou HKUST Fok Ying Tung Research Institute(广州香港科技大学霍英东研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文研究PyTorch编译器中正确性错误的特征,提出AlignGuard技术检测此类错误,已发现23个新错误,其中14个被标记为高优先级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08690 2026-04-13 cs.LG cs.CL

Skip-Connected Policy Optimization for Implicit Advantage

隐式优势下的跳连策略优化

Fengwei Teng, Jinyi Bai, Xinhao Yao, Demi Ruohan Wang, Jiahao Zhao, Zhijiang Guo

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Renmin University of China(中国人民大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出跳连优化方法,通过将推理分解为上游和下游阶段,利用密集奖励和蒙特卡洛采样提升性能,在数学基准和领域外任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08664 2026-04-13 cs.RO

Generative Simulation for Policy Learning in Physical Human-Robot Interaction

生成仿真在物理人机交互中政策学习中的应用

Junxiang Wang, Xinwen Xu, Tiancheng Wu, Julian Millan, Nir Pechuk, Zackory Erickson

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 本文提出零样本生成仿真框架,通过自然语言提示生成多样化的物理人机交互场景,用于自主收集合成数据并训练基于视觉的模仿学习策略,实现从仿真到现实的零样本迁移。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10603 2026-04-13 cs.LG

dnaHNet: A Scalable and Hierarchical Foundation Model for Genomic Sequence Learning

dnaHNet:一种可扩展且分层的基因组序列学习基础模型

Arnav Shah, Junzhe Li, Parsa Idehpour, Adibvafa Fallahpour, Brandon Wang, Sukjun Hwang, Bo Wang, Patrick D. Hsu, Hani Goodarzi, Albert Gu

机构 * University of Toronto(多伦多大学) University of California, San Francisco(加州大学旧金山分校) University of California, Berkeley(加州大学伯克利分校) University of Pennsylvania(宾夕法尼亚大学) Vector Institute(向量研究所) University Health Network(大学健康网络) Arc Institute(Arc研究所) Carnegie Mellon University(卡内基梅隆大学)

AI总结 dnaHNet提出一种无需分词的自回归模型,通过可微的动态分块机制压缩基因组序列,实现高效且可扩展的基因组学习,优于现有模型并在零样本任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02231 2026-04-13 cs.CV cs.AI cs.LG

See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models

看见、听见与理解:多模态大语言模型中人类语音理解基准测试

Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang, Subin An, Jeongik Lee, Yohan Ban, SeungEun Chung, Thanh-Huy Nguyen, JuWan Maeng, Soochahn Lee, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Kookmin University(国民大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出AV-SpeakerBench基准测试,通过3212道多选题评估多模态大语言模型在真实视频中对语音的细粒度理解能力,发现Gemini 2.5 Pro在音频视觉融合方面表现最佳。

Comments Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏