Mind the Sim2Real Gap in User Simulation for Agentic Tasks
注意用户模拟中的Sim2Real差距以实现代理任务
AI总结 研究发现基于LLM的用户模拟器在代理任务中存在Sim2Real差距,表现出过度合作和缺乏真实反馈,需通过人类验证提升模拟真实性。
Comments COLM 2026
作者
Natural Language Processing
注意用户模拟中的Sim2Real差距以实现代理任务
AI总结 研究发现基于LLM的用户模拟器在代理任务中存在Sim2Real差距,表现出过度合作和缺乏真实反馈,需通过人类验证提升模拟真实性。
Comments COLM 2026
NEMO: 通过自主编码代理实现执行感知的优化建模
机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,计算机科学学院,卡内基梅隆大学,匹兹堡,PA,美国)
AI总结 提出NEMO系统,利用自主编码代理将决策问题的自然语言描述转化为可执行的数学优化实现,通过执行感知的架构和协调模式实现最先进的性能。
Comments Accepted at ICML 2026
通过推理模型作为评估器来提升评估时的计算能力
机构 * CMU(卡内基梅隆大学) ; UIUC(伊利诺伊大学) ; KAIST AI(韩国科学技术院人工智能研究所) ; NEC Laboratories Europe(日本 NEC 欧洲实验室) ; Ss.Cyril and Methodius University of Skopje(斯科普里塞尔吉尔和梅蒂乌斯大学)
AI总结 本文探讨了通过增加评估时的计算量来提升语言模型的评估能力,利用推理模型作为评估器,分别评估响应整体和每个步骤,从而提高评估效果。
Comments ACL 2026 Findings
异步软件工程代理的有效策略
机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学,语言技术研究所)
AI总结 本文提出CAID框架,通过集中任务委派、异步执行和隔离工作区三个核心SWE原语,提升多代理协作效率,在论文复现和Python库开发任务中分别提升26.7%和14.3%的准确性。
建模网络代理中不同的人类交互
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Duke University(杜克大学)
AI总结 本文通过收集400条真实用户网络导航轨迹,识别四种人机交互模式,并训练语言模型预测用户干预时机,将干预预测准确率提升61.4%-63.4%,用户评价的代理有用性提高36.8%。
Comments Preprint
如何评估人机交互?软件代理设计案例研究
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出PULSE框架,通过用户反馈和模型预测结合评估人机交互,在15k用户实验中验证其能减少40%置信区间,并揭示基准测试与真实结果的差异。
Comments ICML 2026
FieldWorkArena:面向真实作业任务的代理AI基准测试
机构 * Fujitsu Limited(富士通株式会社) ; Fujitsu Research of America(富士通美国研究部) ; Carnegie Mellon University(卡内基梅隆大学) ; Master’s Student, The University of Tokyo(东京大学硕士研究生) ; Agent Research Collective(代理研究集体)
AI总结 本文提出FieldWorkArena,用于评估代理AI在真实制造业和零售环境中的性能,通过现场采集的数据和实地访谈设计任务,验证多模态大语言模型的评估可行性。
Comments 27 pages, 10 figures, 7 tables [ICPR 2026 Accepted] Changes from previous version: added supplemental material
大规模多语言联合分割与标注
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 针对现有神经标注模型缺乏形态边界预测导致可解释性差的问题,提出PolyGloss模型,通过联合分割与标注提升准确性和对齐度,并支持低秩适应快速迁移。
Comments 15 pages, 9 figures, accepted to ACL 2026 Long Papers