arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2336
2607.05364 2026-07-16 cs.CL cs.AI cs.SD 版本更新

REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing

REDDIT:基于回放的分布编辑在无遗忘条件下校正ASR的模型生成时间戳漂移

Cheng-Kang Chou, Ming-To Chuang, Ke-Han Lu, Chan-Jan Hsu, Hung-yi Lee

机构 * National Taiwan University(台湾大学) Carnegie Mellon University(卡内基梅隆大学) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立清华大学人工智能研究中心(NTU AI-CoRE))

AI总结 针对自回归ASR的非语音区间时间戳漂移问题,提出REDDIT两阶段后训练框架,仅用少量数据和参数更新校正时间戳,避免普通微调的灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18798 2026-07-16 cs.MM cs.AI 版本更新

ELF: A Family of Encoder-Free ECG-Language Models

ELF:无编码器心电图语言模型家族

William Han, Tony Chen, Chaojing Duan, Xiaoyu Song, Yihang Yao, Yuzhe Yang, Michael A. Rosenberg, Emerson Liu, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) Allegheny Health Network(阿勒格尼医疗网络) University of California Los Angeles(加州大学洛杉矶分校) University of Colorado(科罗拉多大学) Allergy and Immunology(过敏与免疫学)

AI总结 提出三种无编码器架构的ECG语言模型ELF,简化架构和训练流程,在两个数据集上达到或超越现有最优模型。

Comments 34 pages, 12 figures; Accepted to MLHC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16967 2026-07-16 cs.AI cs.IR

Empowering Medical Equipment Sustainability in Low-Resource Settings: An AI-Powered Diagnostic and Support Platform for Biomedical Technicians

赋能低资源环境下的医疗设备可持续性:一个由AI驱动的诊断与支持平台,用于生物医学技术人员

Bernes Lorier Atabonfack, Ahmed Tahiru Issah, Mohammed Hardi Abdul Baaki, Clemence Ingabire, Tolulope Olusuyi, Maruf Adewole, Udunna C. Anazodo, Timothy X Brown

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) Medical Artificial Intelligence Laboratory(医学人工智能实验室) University of Pennsylvania(宾夕法尼亚大学) McGill University(麦吉尔大学)

AI总结 本研究提出一个AI驱动的平台,帮助生物医学技术人员实时诊断和修复医疗设备,通过集成大语言模型和用户友好的界面,提高低资源环境下的医疗设备可持续性。

Comments Accepted at the MIRASOL Workshop at MICCAI 2025. To appear in Lecture Notes in Computer Science (LNCS)

Journal ref In: Anazodo U. et al. (eds) Medical Image Computing in Resource Constrained Settings. MIRASOL 2025. LNCS, Springer, Cham, pp. 217-230

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05860 2026-07-16 cs.CL 版本更新

Overcoming Language Barriers: Multilingual Analysis of the 2023 Swiss Privacy Law's Impact

克服语言障碍:对2023年瑞士隐私法影响的多语言分析

Luka Nenadic, David Rodriguez, Joseph A. Calandrino

机构 * ETH Zurich(苏黎世联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究2023年瑞士隐私法与欧盟法规对齐对瑞士网站隐私政策的影响,开发基于大语言模型的管道提取法律信息,应用于超35000个网站隐私政策,发现政策中数据主体权利披露增加,还揭示了政策生成器对披露率的影响。

Journal ref Proceedings on Privacy Enhancing Technologies 2026(4) 703-723

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13033 2026-07-15 cs.RO 新提交

DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation

DenseReward:通过失败合成进行密集奖励学习以实现机器人操作

Yu Fang, Wanxi Dong, Jiaqi Liu, Yue Yang, Mingxiao Huo, Yao Mu, Huaxiu Yao, Li Erran Li, Daniel Szafir, Mingyu Ding

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) Amazon AWS AI(亚马逊AWS人工智能)

AI总结 研究针对强化学习中缺乏可靠奖励模型的问题,提出DenseReward模型,通过自动生成失败数据合成逼真轨迹,从视觉和语言预测密集奖励分数,在模拟和现实操作中表现优异,还为下游任务提供指导并发布相关资源。

Comments Website: https://dense-reward.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12450 2026-07-15 cs.CV 新提交

Let RGB Be the Language of Vision

让 RGB 成为视觉的语言

Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu, Guoyizhe Wei, Jixuan Ying, Chen Wei, Rama Chellappa, Yuyin Zhou, Cihang Xie, Alan Yuille, Feng Wang

机构 * Johns Hopkins University(约翰·霍普金斯大学) UC Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学) Rice University(莱斯大学)

AI总结 该研究为视觉模型引入统一表述 RGB In and RGB Out(RINO),将多种视觉信息转为 RGB 图像编辑问题,共享架构参数,基于通用主干无需微调,在多视觉任务上有强大零样本性能,为统一视觉语言系统提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01311 2026-07-15 cs.CL 版本更新

Catalyst-Agent: Autonomous heterogeneous catalyst screening with an LLM Agent

Catalyst-Agent:基于LLM Agent的自主异质催化剂筛选

Achuth Chandrasekhar, Janghoon Ock, Amir Barati Farimani

机构 * Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA 15213, USA(卡内基梅隆大学机械工程系,匹兹堡,PA 15213,USA) Department of Chemical and Biomolecular Engineering, University of Nebraska--Lincoln, Lincoln, NE 68588, USA(内布拉斯加大学林肯分校化学与生物分子工程系,林肯,NE 68588,USA)

AI总结 提出Catalyst-Agent,一种基于MCP服务器和LLM的AI代理,通过OPTIMADE API探索材料数据库、利用UMA模型计算吸附能,实现闭环自主催化剂筛选,在ORR、NRR和CO2RR反应中成功率达33-41%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05995 2026-07-15 cs.RO cs.AI cs.LG 版本更新

TADPO: Reinforcement Learning Goes Off-road

TADPO:强化学习走向越野

Zhouchonghao Wu, Raymond Song, Vedant Mundheda, Luis E. Navarro-Serment, Christof Schoenborn, Jeff Schneider

机构 * Robotics Institute, School of Computer Science, Carnegie Mellon University(机器人研究所,计算机科学学院,卡内基梅隆大学)

AI总结 TADPO通过改进的策略梯度方法,首次在全规模越野平台上实现了基于强化学习的自动驾驶解决方案,能够应对复杂地形和低信号奖励环境。

Comments Accepted for Oral Presentation at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15892 2026-07-15 cs.CV cs.AI 版本更新

Egocentric Bias in Vision-Language Models

视觉语言模型中的自我中心偏差

Maijunxian Wang, Yijiang Li, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao, Emmy Liu, Hokin Deng, Dezhi Luo

机构 * Cognitive Science Program, University of California, Berkeley(加州大学伯克利分校认知科学项目) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) School of Computer Science, Georgia Institute of Technology & Emory University(佐治亚理工学院计算机科学学院及埃默里大学) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Equal Advising Department of Computer Science & Wilmer Eye Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系及威尔默眼科研究所) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Weinberg Institute for Cognitive Science, University of Michigan(密歇根大学韦恩伯格认知科学研究所)

AI总结 本文提出FlipSet基准,揭示视觉语言模型在第二级视觉视角推理中存在系统性自我中心偏差,表明模型在整合社会认知与空间操作方面存在根本性不足。

Comments Accepted at CogSci 2026 (Best Undergraduate Student Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12339 2026-07-15 cs.HC cs.AI 版本更新

SheetMind: An End-to-End LLM-Powered Multi-Agent Framework for Spreadsheet Automation

SheetMind:一个由端到端大语言模型驱动的用于电子表格自动化的多智能体框架

Xi Cheng, Ruiyan Zhu, Ke Liu, Rakesh Chowdary Machineni, Lyuhao Chen, Brian Zhu, Daniel Jin, Zheng Qi, Neeraj Parihar, Zhoutian Xu, Oliver Gao

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology (GZ)(香港科学与技术大学)

AI总结 介绍由大语言模型驱动的多智能体框架SheetMind用于电子表格自动化,其分层系统含三个智能体,经评估在SheetCopilot基准测试中执行成功率达100%、功能正确性54.8%超对手,消融研究验证配置优势,还集成到谷歌表格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11883 2026-07-14 cs.LG 新提交

Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data

顺序编码:利用自生成训练数据突破模型压缩的极限

Shikai Qiu, Marc Finzi, Yujia Zheng, Kun Zhang, Andrew Gordon Wilson

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究利用自生成训练数据的顺序编码突破模型压缩极限,教师模型从学生分布选样本,学生代码记录选择,代码长度与参数和熵无关且更短,还能揭示现象、给出泛化保证、隔离可学习信息。

Comments Code available at https://github.com/shikaiqiu/requential-coding

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11787 2026-07-14 cs.MA cs.CL cs.GT cs.HC 新提交

Forgetting Our Way to Shared Meaning: Effects of Forgetting on Conceptual Alignment in a Non-Partnership Coordination Game

忘记共享意义之路:遗忘对非合作协调博弈中概念对齐的影响

Landon Liu, Mary Kelly, Alan Tsang

机构 * Institute for Complex Social Dynamics, Carnegie Mellon University(复杂社会动态研究所,卡内基梅隆大学) Department of Computer Science, Carleton University(计算机科学系,卡尔顿大学) Department of Cognitive Science, Carleton University(认知科学系,卡尔顿大学)

AI总结 研究主体记忆特征对共享意义出现与演变的影响,将概念对齐建模为非合作博弈,通过反事实模拟发现适应性玩家实际趋同更快,非适应性玩家更早感知趋同,新信息加权方式影响共识稳定性,记忆特征至关重要。

Comments CogSci 2026 Meeting Conference Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10476 2026-07-14 cs.CL cs.LG 新提交

Hallucination Detection in Large Language Models Using Diversion Decoding

使用转移解码检测大语言模型中的幻觉

Basel Abdeen, S M Tahmid Siddiqui, Meah Tahmeed Ahmed, Anoop Singhal, Latifur Khan, Punya Parag Modi, Ehab Al-Shaer

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) National Institute of Standards and Technology(美国国家标准与技术研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究大语言模型中的幻觉检测问题,提出转移解码新方法,通过在解码阶段挑战模型响应提取特征,训练机器学习模型度量不确定性,该方法计算复杂度低,优于现有方法。

Journal ref Data and Applications Security and Privacy XXXIX. DBSec 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10287 2026-07-14 cs.CV 新提交

InterPet4D: A Multimodal 4D Human-Pet Interaction Dataset for Pet Motion Generation

InterPet4D:用于宠物运动生成的多模态4D人宠交互数据集

Yichen Peng, Jyun-Ting Song, Chen-Chieh Liao, Kris Kitani, Hideki Koike, Erwin Wu

机构 * Institute of Science Tokyo(东京科学研究所) Carnegie Mellon University(卡内基梅隆大学)

AI总结 因缺乏高质量数据集,人宠交互研究不足。本文提出InterPet4D多模态数据集及InterPetMoGen框架,通过同步多视图系统记录交互并标注,含多类型数据,所提模型FID得分11.21,优于基线,有效模拟人宠交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10161 2026-07-14 cs.RO 新提交

Millimeter Wave Radar: From Synthetic Aperture to Probabilistic Mapping

毫米波雷达:从合成孔径到概率地图

Jui-Te Huang, Ruoyang Xu, Michael Kaess

机构 * School of Computer Science, Robotics Institute, Carnegie Mellon University(卡内基梅隆大学计算机科学学院机器人研究所)

AI总结 针对毫米波雷达数据创建概率地图的挑战,建立从原始信号到概率占用地图的完整流程,含合成孔径雷达处理与概率建模,经室内验证、性能分析及参数研究,展示方法有效性与局限性,并贡献开源数据集及处理管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10113 2026-07-14 cs.AI 新提交

Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries

动态智能体技能:不断演进的技能库的生命周期调查与分类法

Yubo Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究大型语言模型智能体中技能库随时间的变化,通过分类法、生命周期架构和技能记录模式等工具组织文献,合成证据分级模式,指出相关问题并提出报告标准及开放问题。

Comments Accepted by TMLR (2026.07), OpenReview Link: https://openreview.net/forum?id=cjU3YbcRr8

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09947 2026-07-14 cs.RO 新提交

A Numerically-Robust ROS 2 Port of iG-LIO: Diagnosing and Fixing Toolchain-Induced Failures in Incremental GICP LiDAR-Inertial Odometry

iG-LIO的数值稳健ROS 2端口:诊断和修复增量GICP激光雷达惯性里程计中工具链引起的故障

Afonso E. Carvalho, David Portugal, Paulo Peixoto

机构 * Robotics Institute (RI), Carnegie Mellon University (CMU)(卡内基梅隆大学机器人研究所) Institute of Systems and Robotics (ISR), University of Coimbra (UC)(科英布拉大学系统与机器人研究所)

AI总结 研究针对iG-LIO的ROS 2端口,诊断并修复由工具链导致的数值故障。通过分析QoS不匹配等问题,采取修正点场解析、添加传感器支持等方法,在多种传感器上验证了改进后的端口,为该端口提供了可引用参考。

Comments 3 pages, 1 figure, 4 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09911 2026-07-14 cs.RO 新提交

Diffusion for Long-Horizon Multi-Robot Path Planning in Human-Shared Environments

人类共享环境中长距离多机器人路径规划的扩散方法

Vaibhav Sanjay, Yorai Shaoul, Jiaoyang Li

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 研究人类共享环境中多机器人长距离路径规划问题,提出MRRD框架,结合滚动时域、并行扩散推理及冲突搜索机制,纳入时间条件与引导项,实验证明该框架能实时扩展到15个机器人,性能优于现有基线。

Comments 8 pages, 3 figures, to be published in IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09906 2026-07-14 quant-ph cs.LG q-fin.ST 新提交

Depth-Efficient Quantum Topological Data Analysis for Regime-Specific Detection of Financial Stress

用于特定状态金融压力检测的深度高效量子拓扑数据分析

Arul Rhik Mazumder, Shreyan Ronit Mazumder

机构 * Carnegie Mellon University(卡内基梅隆大学) Cambridge Rindge and Latin School(剑桥拉丁学校)

AI总结 该研究首次将泡利相关编码用于量子拓扑数据分析,通过塔克嵌入和维托里斯 - 里普斯过滤提取数据,用浅电路编码,能在一定程度上恢复贝蒂数,但跨危机状态校准不能泛化。

Comments 12 pages, 6 figures, 5 tables, Accepted to IEEE International Conference of Quantum Computing and Engineering - QCE 2026 in the Quantum Applications (QAPP) Technical Papers track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09893 2026-07-14 quant-ph cs.LG 新提交

An End-to-End Hybrid Quantum--Classical Sampling Workflow for Discrete Markov Random Fields: A Reproducible Case Study

离散马尔可夫随机场的端到端混合量子-经典采样工作流程:一个可重现的案例研究

Arul Rhik Mazumder

机构 * School of Computer Science(计算机科学学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究离散马尔可夫随机场采样难题中,对小MRF采用幅度编码独立同分布采样,与经典MCMC比较。通过多个实例展示不同方法的ESS比率等,还进行了预处理时间、MPS缩放及VQC与MPS的比较,揭示各方法特点及差距。

Comments 9 pages, 7 figures, 9 tables, Accepted to IEEE International Conference of Quantum Computing and Engineering - QCE 2026 in the Quantum End-to-End Hybrid Case Studies (QECS) Technical Papers track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09218 2026-07-14 cs.RO cs.AI 版本更新

TACTIC: Tactile and Vision Conditioned Contact-Centric Control for Whole-Arm Manipulation

用于全臂操作的触觉和视觉条件下的以接触为中心的控制

Rishabh Madan, Angchen Xie, Samantha Saak, Andres Blanco, Dohyeok Lee, Sarah Grace Brown, Yunting Yan, Mark Zolotas, Jose Barreiros, Tapomayukh Bhattacharjee

机构 * Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学) Toyota Research Institute(丰田研究机构)

AI总结 研究全臂操作问题,提出TACTIC控制器,它采用以接触为中心的混合预测模型,结合多种传感,通过接触雅可比矩阵耦合动力学与运动学,集成到MPC规划器,在模拟和实际任务中表现出色,优于其他方法。

Comments RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31651 2026-07-14 cs.AI 版本更新

FARS: A Fully Automated Research System Deployed at Scale

FARS:一个大规模部署的全自动研究系统

Qiong Tang, Tianxiang Sun, Xiangkun Hu, Xiangyang Liu, Yiran Chen, Yunfan Shao, Bobo Li, Changze Lv, Cheng Xu, Chengsong Huang, Chunyang Li, Dizhan Xue, Hao Bai, Haodong Duan, Hengquan Guo, Hongyang He, Hongyi Chen, Hui Shen, Jiahao Yuan, Jiankai Sun, Jikang Cheng, Jinfeng Xu, Jingqi Tong, Jingye Chen, Jinxiu Liu, Jixuan Leng, Junchi Yu, Kaixun Jiang, Kun Xiang, Kunpeng Yao, Lang Feng, Liangqi Yuan, Longsen Gao, Meng Li, Qi Jia, Qiushi Sun, Shengyuan Ding, Shizhan Gong, Siru Zhong, Terry Jingchen Zhang, Tianle Gu, Tianyi Liang, Weijie Liu, Weikai Yang, Weizhi Fei, Xin Wang, Xinpeng Liu, Xuanwen Ding, Yihong Tang, Yuanli Wang, Yukun Jiang, Yuming Yang, Zhengbao He, Zhikai Chen, Zhikun Xu, Zhuang Li, Zihao Huang

机构 * Analemma National University of Singapore(新加坡国立大学) Fudan University(复旦大学) University College Dublin(都柏林大学) Washington University in St. Louis(圣路易斯华盛顿大学) The Hong Kong University of Science and Technology(香港科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ByteDance(字节跳动) ShanghaiTech University(上海科技大学) University of Warwick(华威大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) East China Normal University(华东师范大学) Stanford University(斯坦福大学) Tencent(腾讯) The University of Hong Kong(香港大学) Shanghai Innovation Institute(上海创新研究院) Nex-AGI Team(Nex-AGI团队)

AI总结 提出FARS系统,通过分阶段智能体协作自动生成研究项目,在67个AI/ML主题上产出166篇论文,经282份评审验证其可产出有价值成果,同时暴露实验范围窄、方法局限和诚信问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27537 2026-07-14 cs.CV 版本更新

MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

MemoBench: 动态变化环境中的世界建模基准测试

Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du

机构 * Harvard University(哈佛大学) MIT(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Boston University(波士顿大学) Google(谷歌) JHU(约翰霍普金斯大学) CMU(卡内基梅隆大学) Kempner Institute(肯普纳研究所)

AI总结 提出MemoBench基准,通过目标消失-重现范式评估视频生成模型在动态环境中的记忆一致性,涵盖合成与真实场景,揭示现有模型的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29042 2026-07-14 cs.CL cs.LG cs.SD eess.AS 版本更新

An Empirical Recipe for Universal Phone Recognition

一种通用电话识别的实证配方

Shikhar Bharadwaj, Chin-Jou Li, Kwanghee Choi, Eunjung Yeo, William Chen, Shinji Watanabe, David R. Mortensen

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出PhoneticXEUS模型,通过大规模多语言数据训练,在多语言和口音英语语音任务中取得最佳性能,分析了SSL表示、数据规模和损失目标的影响。

Comments Accepted at Interspeech 2026. Code: https://github.com/changelinglab/PhoneticXeus

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14046 2026-07-14 cs.CL cs.SD 版本更新

PRiSM: Benchmarking Phone Realization in Speech Models

PRiSM:语音模型中电话实现的基准测试

Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim, Kwanghee Choi, Eunjung Yeo, Ryan Soh-Eun Shim, Hanyu Zhou, Brendon Boldt, Karen Rosero Jacome, Kalvin Chang, Darsh Agrawal, Keer Xu, Chao-Han Huck Yang, Jian Zhu, Shinji Watanabe, David R. Mortensen

机构 * CMU(卡内基梅隆大学) Gwangju Institute of Science and Technology(光州科学技术院) UT Austin(得克萨斯大学奥斯汀分校) LMU Munich(慕尼黑路德维希-马克西米利安大学) UC Berkeley(伯克利加州大学) NVIDIA(英伟达) UBC(不列颠哥伦比亚大学)

AI总结 该研究针对语音模型中电话实现进行基准测试,引入PRiSM开源基准用内在和外在评估揭示语音感知盲点,标准化评估并通过探针评估下游效用,发现训练语言接触对PR性能关键,编码器-CTC模型稳定,专门PR模型优于大型音频语言模型,还发布相关资源推动多语言语音模型发展。

Comments Presented at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14129 2026-07-14 cs.SD eess.AS 版本更新

OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder

OpenBEATs:一个完全开源的通用音频编码器

Shikhar Bharadwaj, Samuele Cornell, Kwanghee Choi, Satoru Fukayama, Hye-jin Shim, Soham Deshmukh, Shinji Watanabe

机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国) National Institute of Advanced Industrial Science and Technology (AIST), Japan(国家工业科学与技术研究院(AIST),日本)

AI总结 研究旨在填补通用音频理解中掩码令牌预测应用空白,提出开源框架OpenBEATs,通过多域音频预训练扩展BEATs。经多任务、多数据集和多音频域全面评估,其在多个数据集上达最优性能,证明方法有效性并开源相关代码等。

Comments Accepted at WASPAA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01596 2026-07-14 cs.RO cs.AI

PhysORD: A Neuro-Symbolic Approach for Physics-infused Motion Prediction in Off-road Driving

PhysORD: 一种用于越野驾驶中融合物理的神经符号方法

Zhipeng Zhao, Bowen Li, Yi Du, Taimeng Fu, Chen Wang

机构 * Spatial AI & Robotics (SAIR) Lab(空间人工智能与机器人实验室) Institute for Artificial Intelligence and Data Science(人工智能与数据科学研究院) Department of Computer Science and Engineering(计算机科学与工程系) University at Buffalo(布法罗大学) Robotics Institute(机器人研究所) Carnegie Mellon University(卡内基梅隆大学)

AI总结 PhysORD是一种融合物理定律的神经符号方法,通过整合欧拉-拉格朗日方程提升越野驾驶中运动预测的准确性和泛化能力。

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09366 2026-07-13 cs.SE cs.AI cs.LO 新提交

Diversifying to Verify: When Task-Equivalent Programs Differ in Verifiability

多样化以进行验证:当任务等效程序在可验证性上存在差异时

Shirley Yu, Ruben Martins

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究任务等效程序的可验证性差异,提出基于大型语言模型的Diversify2Verify管道,通过推断契约、生成测试不同实现并修复注释来验证,构建基准测试,结果表明实现多样性有助于验证,提高了验证成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08781 2026-07-13 cs.LG cs.AI q-bio.QM 新提交

Reward Transport: Property Control in Flow Matching via Noise-Space Alignment

奖励传输:通过噪声空间对齐在流匹配中进行属性控制

Kehan Guo, Yili Shen, Yujun Zhou, Yue Huang, Chujie Gao, Shiyi Du, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究通过奖励传输在流匹配中实现属性控制,训练时用最优传输耦合将噪声空间坐标与分子奖励对齐,推理时改变坐标引导生成分布,实验表明可对logP和QED进行有效控制,且该接口与其他方法互补,明确了耦合级对齐不存在的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22332 2026-07-13 cs.RO 新提交

Tactile Genesis: Exploring Tactile Sensors at Scale for Learning Dexterous Tasks

触觉起源:大规模探索用于学习灵巧任务的触觉传感器

Trinity Chung, Kashu Yamazaki, Dhruv Patel, Alexis Duburcq, Yiling Qiao, Katerina Fragkiadaki, Aran Nayebi

机构 * Carnegie Mellon University(卡内基梅隆大学) Genesis AI

AI总结 提出Tactile Genesis,一种GPU并行触觉传感器仿真平台,支持多种触觉模态,通过大规模实验发现传感器布局比类型和分辨率更重要,力/力矩感知最有效。

Comments 24 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏