Evaluating LLM-Based Test Generation Under Software Evolution
评估基于大语言模型的测试生成在软件演化中的表现
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究评估了基于大语言模型的测试生成在软件演化中的性能,发现其在代码变化时表现下降,测试覆盖和回归检测能力不足。
Comments 10 pages, 9 figures, 2 tables
高校专区
评估基于大语言模型的测试生成在软件演化中的表现
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究评估了基于大语言模型的测试生成在软件演化中的性能,发现其在代码变化时表现下降,测试覆盖和回归检测能力不足。
Comments 10 pages, 9 figures, 2 tables
引导大语言模型实现文化本地化生成
机构 * Google DeepMind(谷歌DeepMind) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文通过机制可解释性揭示LLM中的文化表征,提出文化嵌入(CuE)方法,提升文化忠实度并引导生成长尾文化概念,为文化本地化提供可控方法。
Comments preprint
主动机器人感知用于苹果树疾病检测与制图
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Department of Plant Pathology, Virginia Polytechnic Institute and State University(弗吉尼亚理工大学植物病理学系)
AI总结 本文提出一种自主移动主动感知系统,用于在苹果树休眠期精准检测和制图疾病,通过融合多种传感技术实现疾病症状的精确定位,并评估了三种视角规划策略以提升观测精度。
Comments 8 pages, 6 figures, IROS 2026 conference
谁说了什么?通过语义和重叠感知指标评估对话语音模型的对话ASR
机构 * NTT, Inc.(日本NTT公司) ; CMU(卡内基梅隆大学) ; BUT(捷克但尼奇技术大学)
AI总结 本文通过语义和重叠感知指标评估对话ASR模型,发现基于LLM的系统在双人对话中表现良好,但随着说话人数和重叠增加而下降,而模块化流水线方法更稳健。
Comments Submitted to INTERSPEECH 2026
为人类oid机器人学习安全停止监视器
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Foundational Technologies, Siemens Corporation(西门子公司基础技术部)
AI总结 本文提出PRISM框架,通过数据驱动方法学习状态级停止能力,提高安全监控效率并支持人类oid机器人故障安全行为的可扩展认证。
Comments 8 pages, 5 figures
MSP-Conversation:一种用于自然、连续情绪识别的语料库
机构 * Erik Jonsson School of Engineering and Computer Science, University of Texas at Dallas(埃里克·乔纳森工程与计算机科学学院,德克萨斯大学达拉斯分校) ; Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) ; AT&T Labs Research(AT&T实验室研究)
AI总结 本文提出MSP-Conversation语料库,包含超过70小时的对话音频,提供连续时间的情感标注和详细说话者分隔信息,用于研究自然场景下的动态语音情绪识别。
MapForest:一种用于森林制图和入侵物种定位的模块化野外机器人系统
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
AI总结 本文提出MapForest,一种模块化机器人系统,利用多模态传感器数据生成GIS-ready的入侵物种地图,通过LiDAR-惯性制图、图像识别和地理参考制图实现精准定位,实验显示其在GNSS间断环境下具有高精度和鲁棒性。
Comments 8 pages, 9 figures. Under review
幸福是共享词汇:一种转写方法的研究
机构 * University of British Columbia, Canada(不列颠哥伦比亚大学,加拿大) ; Sungkyunkwan University, Republic of Korea(成均馆大学,韩国) ; Seoul National University, Republic of Korea(首尔国立大学,韩国) ; Electronics and Telecommunications Research Institute, Republic of Korea(电子通信研究院,韩国) ; Carnegie Mellon University, USA(卡内基梅隆大学,美国)
AI总结 本文研究了多语言模型中共享脚本、重叠词库和共享语音对性能的影响,发现罗马化在12种评估设置中显著优于其他输入类型。
Comments Accepted to EACL 2026