Evaluating LLM-Based Test Generation Under Software Evolution
评估基于大语言模型的测试生成在软件演化中的表现
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究评估了基于大语言模型的测试生成在软件演化中的性能,发现其在代码变化时表现下降,测试覆盖和回归检测能力不足。
Comments 10 pages, 9 figures, 2 tables
高校专区
评估基于大语言模型的测试生成在软件演化中的表现
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究评估了基于大语言模型的测试生成在软件演化中的性能,发现其在代码变化时表现下降,测试覆盖和回归检测能力不足。
Comments 10 pages, 9 figures, 2 tables
引导大语言模型实现文化本地化生成
机构 * Google DeepMind(谷歌DeepMind) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文通过机制可解释性揭示LLM中的文化表征,提出文化嵌入(CuE)方法,提升文化忠实度并引导生成长尾文化概念,为文化本地化提供可控方法。
Comments preprint
主动机器人感知用于苹果树疾病检测与制图
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Department of Plant Pathology, Virginia Polytechnic Institute and State University(弗吉尼亚理工大学植物病理学系)
AI总结 本文提出一种自主移动主动感知系统,用于在苹果树休眠期精准检测和制图疾病,通过融合多种传感技术实现疾病症状的精确定位,并评估了三种视角规划策略以提升观测精度。
Comments 8 pages, 6 figures, IROS 2026 conference
谁说了什么?通过语义和重叠感知指标评估对话语音模型的对话ASR
机构 * NTT, Inc.(日本NTT公司) ; CMU(卡内基梅隆大学) ; BUT(捷克但尼奇技术大学)
AI总结 本文通过语义和重叠感知指标评估对话ASR模型,发现基于LLM的系统在双人对话中表现良好,但随着说话人数和重叠增加而下降,而模块化流水线方法更稳健。
Comments Submitted to INTERSPEECH 2026
为人类oid机器人学习安全停止监视器
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Foundational Technologies, Siemens Corporation(西门子公司基础技术部)
AI总结 本文提出PRISM框架,通过数据驱动方法学习状态级停止能力,提高安全监控效率并支持人类oid机器人故障安全行为的可扩展认证。
Comments 8 pages, 5 figures
MSP-Conversation:一种用于自然、连续情绪识别的语料库
机构 * Erik Jonsson School of Engineering and Computer Science, University of Texas at Dallas(埃里克·乔纳森工程与计算机科学学院,德克萨斯大学达拉斯分校) ; Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) ; AT&T Labs Research(AT&T实验室研究)
AI总结 本文提出MSP-Conversation语料库,包含超过70小时的对话音频,提供连续时间的情感标注和详细说话者分隔信息,用于研究自然场景下的动态语音情绪识别。
UrbanVGGT:从街景图像中可扩展的人行道宽度估计
机构 * Heinz College of Information Systems and Public Policy(信息系统与公共政策学院) ; Carnegie Mellon University(卡内基梅隆大学) ; Institute of Remote Sensing and Geographical Information System(遥感与地理信息系统研究所)
AI总结 本文提出UrbanVGGT方法,通过单张街景图像估算人行道宽度,结合语义分割、3D重建、地面平面拟合等技术,在华盛顿特区基准测试中达到0.252米的均方误差,展示了其在大规模城市中的可行性。
MapForest:一种用于森林制图和入侵物种定位的模块化野外机器人系统
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
AI总结 本文提出MapForest,一种模块化机器人系统,利用多模态传感器数据生成GIS-ready的入侵物种地图,通过LiDAR-惯性制图、图像识别和地理参考制图实现精准定位,实验显示其在GNSS间断环境下具有高精度和鲁棒性。
Comments 8 pages, 9 figures. Under review
幸福是共享词汇:一种转写方法的研究
机构 * University of British Columbia, Canada(不列颠哥伦比亚大学,加拿大) ; Sungkyunkwan University, Republic of Korea(成均馆大学,韩国) ; Seoul National University, Republic of Korea(首尔国立大学,韩国) ; Electronics and Telecommunications Research Institute, Republic of Korea(电子通信研究院,韩国) ; Carnegie Mellon University, USA(卡内基梅隆大学,美国)
AI总结 本文研究了多语言模型中共享脚本、重叠词库和共享语音对性能的影响,发现罗马化在12种评估设置中显著优于其他输入类型。
Comments Accepted to EACL 2026
Chimera:面向异构大语言模型的延迟与性能感知多智能体服务
机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) ; Microsoft(微软) ; Carnegie Mellon University(卡内基梅隆大学) ; Amazon(亚马逊) ; University of California, Santa Barbara(加州大学圣芭芭拉分校)
AI总结 Chimera通过语义路由和预测调度优化多智能体工作流服务,提升端到端延迟与任务性能,减少1.2-2.4倍延迟并提高8.0-9.5个百分点性能。
用不完美的AI编程制造机器人:LLMs作为FDM打印配置选择的调优专家
机构 * Robotics Institute at Carnegie Mellon University(卡内基梅隆大学机器人学院)
AI总结 本文提出一种模块化闭环方法,将LLM作为调优专家嵌入贝叶斯优化循环中,通过结构化诊断提出自然语言调整,提升FDM打印配置选择的准确性,实验表明LLM在证据驱动的优化循环中比通用AI模型更有效。
DSPA:动态SAE转向用于数据高效的偏好对齐
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 DSPA通过在推理阶段动态调整稀疏自编码器的提示条件,提升数据效率的偏好对齐,同时在多个基准测试中表现优异。
当文档存在分歧:利用检索增强语言模型测量移植指导的机构差异
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出利用检索增强语言模型比较不同机构移植指南的异质性,发现20.8%的对比存在临床意义差异,尤其在监测和生活方式方面,揭示了移植教育材料的信息缺口。
模态匹配至关重要:在URIEL+中校准语言距离以实现跨语言迁移
机构 * University of Toronto, Canada(多伦多大学) ; University of Michigan, USA(密歇根大学) ; Harvard University, USA(哈佛大学) ; Carnegie Mellon University, USA(卡内基梅隆大学) ; LT3, IDLab, Universiteit Gent, Belgium(IDLab,根特大学) ; Ontario Tech University, Canada(安大略技术大学)
AI总结 本文提出一种类型匹配的语言距离框架,通过结构感知的表示方法提升跨语言迁移性能,特别是在任务相关距离类型下表现更优。
Comments Accepted to EACL 2026 SRW
Journal ref In Proceedings of EACL 2026 (Volume 4: Student Research Workshop), pages 110 to 130. ACL
任务特定效率分析:当小型语言模型超越大型语言模型
机构 * San Francisco State University - Department of Computer Science(旧金山州立大学-计算机科学系) ; Carnegie Mellon University - Department of Computer Science(卡内基梅隆大学-计算机科学系) ; Columbia University - Department of Computer Science(哥伦比亚大学-计算机科学系) ; Cornell University - Department of Computer Science(康奈尔大学-计算机科学系) ; Pennsylvania State University - Department of Biochemistry and Molecular Biology(宾夕法尼亚州立大学-生物化学与分子生物学系)
AI总结 本文通过对比16个模型在五个NLP任务上的效率,提出PER指标,发现小型模型在效率上表现更优,为高效推理场景提供依据。
Comments Accepted for publication at ESANN 2025. This is a task-specific efficiency analysis comparing small language models
推理缓存:通过短期限强化学习实现长周期的持续改进
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出RC算法,通过利用LLM的响应生成与总结能力差异,实现长周期的持续改进,实验显示其在HMMT 2025任务中性能显著提升。
Comments preprint v2; revised 2026-03-22 (updated IMO-AnswerBench results)
ObjectForesight: 从人类视频预测未来3D物体轨迹
机构 * School of Computer Science \& Engineering, University of Washington The Robotics Institute, Carnegie Mellon University
AI总结 本文提出ObjectForesight模型,通过短时视视频预测物体6自由度姿态和轨迹,实现几何一致且时间连贯的预测,提升物体感知和泛化能力。
Comments Preprint. Project Website: objectforesight.github.io
通过记忆增强的规划和前瞻性构建视觉导航的统一世界模型
机构 * University of Washington(华盛顿大学) ; National University of Singapore(新加坡国立大学) ; Apple(苹果公司) ; Microsoft Research(微软研究院) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出UniWM,一种整合视觉前瞻性与规划的统一世界模型,通过记忆机制提升导航鲁棒性和泛化能力,在多个基准测试中显著提升导航成功率。
Comments 21 pages, 12 figures, code: https://github.com/F1y1113/UniWM
DYMO-Hair: 通用的体积动力学建模用于机器人头发操控
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人学院) ; Epic Games, Inc.(Epic Games公司) ; Meta Codec Avatars Lab(Meta编码人像实验室) ; Bosch Center for Artificial Intelligence(博世人工智能中心)
AI总结 DYMO-Hair通过体积动力学建模和动作条件化潜在状态编辑机制,实现了对多样化发型的通用化机器人头发护理系统,实验表明其在未见过的发型上表现更优。
Comments To appear in ICRA 2026. Project page: https://dymohair.github.io/
阿谀并非一物:在大型语言模型中因果分离阿谀行为
机构 * Department of Computer Science, University of Cincinnati(卡内基梅隆大学计算机科学系) ; School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)
AI总结 研究通过分解阿谀行为为阿谀同意与阿谀赞美,揭示其在潜在空间中的独立表示结构,表明不同阿谀行为可通过独立方式调控。
并行的渐近最优算法用于移动目标旅行商问题
机构 * Robotics Institute at Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Mechanical and Aerospace Engineering at Michigan Technological University(密歇根技术大学机械与航空航天工程) ; Global College at Shanghai Jiao Tong University(上海交通大学全球学院) ; Department of Mechanical Engineering and Department of Computer Science and Engineering at Texas A&M University(得克萨斯阿姆斯特朗大学机械工程系和计算机科学与工程系)
AI总结 本文提出并行算法解决移动目标旅行商问题,通过交替随机采样和求解广义旅行商问题,渐近收敛于最优解,实验验证了算法在不同场景下的有效性。
基于世界模型的潜在策略引导
机构 * Robotics Institute, School of Computer Science, Carnegie Mellon University(机器人研究所、计算机科学学院、卡内基梅隆大学)
AI总结 本文通过预训练世界模型和优化价值函数,提升低数据场景下的视觉运动策略性能,采用光流作为动作表示,实现跨体素的策略优化,实验显示在机器人任务中性能提升显著。
非线性安全控制的屏障-里茨合成:扩展吸引区域
机构 * Control & Instrumentation Engineering Department, King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学控制与仪器工程系) ; Department of Electrical & Computer Engineering(电气与计算机工程系) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Daniel Guggenheim School of Aerospace Engineering(丹尼尔·古根海姆航空航天工程学院) ; George W. Woodruff School of Mechanical Engineering(乔治·W·伍德鲁夫机械工程学院)
AI总结 本文提出一种基于里茨的非线性安全控制框架,结合屏障状态方法与状态依赖里茨方程方法,通过辅助状态嵌入安全约束,扩展吸引区域并保证渐近安全稳定。
Comments This work has been accepted for publication in the proceedings of the 2026 American Control Conference (ACC), New Orleans, Louisiana, USA
迈向实用的多模态医院暴发检测
机构 * Auton Lab, Carnegie Mellon University(自主实验室,卡内基梅隆大学) ; Microbial Genomic Epidemiology Laboratory, Center for Genomic Epidemiology, University of Pittsburgh(微生物基因组流行病学实验室,流行病学研究中心,匹兹堡大学) ; Division of Infectious Diseases, University of Pittsburgh School of Medicine(传染病科,匹兹堡大学医学院) ; Department of Epidemiology, School of Public Health, University of Pittsburgh(流行病学系,公共卫生学院,匹兹堡大学)
AI总结 本文提出利用多模态数据提升医院暴发检测效率,通过机器学习整合质谱、抗菌谱和电子病历数据,提高检测性能并减少全基因组测序依赖。
Comments 10 pages, 3 figures, 3 tables
我、我自己和π:评估和解释LLM内省
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出了一种内省的分类体系,通过Introspect-Bench评估套件验证了LLM的内省能力,并展示了前沿模型在预测自身行为上的优势。
Comments 20 pages, 12 figures, ICLR 2026 Workshop: From Human Cognition to AI Reasoning: Models, Methods, and Applications
SpecMol:一种基于光谱的多任务分子学习基础模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Brown University(布朗大学) ; Nanjing University(南京大学)
AI总结 SpecMol提出一种统一框架,整合光谱解释、分子表示学习和三维结构生成,通过SpecMol-Bench评估协议实现光谱驱动的结构解析和分子生成。
用领域特定的生成式AI挑衅促进批判性思维
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文通过两个生成式AI工具的案例,探讨领域特定的AI挑衅如何通过产生摩擦和用户互动促进批判性思维,强调需超越静态挑衅向适应用户需求的设计转型。
Comments 6 pages, 2 figures, 1 table, CHI2026 Workshop on Tools for Thought, 2026 CHI Conference on Human Factors in Computing Systems CHI26
HiFiGaze:利用屏幕内容知识提升眼动追踪精度
机构 * Human-Computer Interaction Institute(人机交互研究所) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出一种新的高精度眼动追踪方法,通过利用设备屏幕内容信息实现鲁棒的反射分割,从而提升追踪精度,实验表明其比基线模型减少约8%的平均追踪误差。
Comments ACM CHI 2026
单发射机的电磁反散射
机构 * Center on Frontiers of Computing Studies, School of Computer Science, Peking University(前沿计算研究中心,计算机科学学院,北京大学) ; Institute of Digital Twin, Eastern Institute of Technology, Ningbo(数字孪生研究所,东部技术研究所,宁波) ; Robotics Institute, Carnegie Mellon University(机器人研究所,卡内基梅隆大学)
AI总结 本文提出了一种端到端的数据驱动框架,用于从单发射机测量数据中预测散射体的相对介电常数,提升了稀疏发射条件下的反散射精度和鲁棒性。
通过多尺度采样和一步蒸馏加速扩散解码器
机构 * University of California San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出多尺度采样和一步蒸馏方法,显著降低扩散解码器的解码时间,同时保持高质量图像重建,为高效图像分词提供新路径。