Humans are Missing from AI Coding Agent Research
AI编码智能体研究中缺失了人类
AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。
作者
Natural Language Processing
AI编码智能体研究中缺失了人类
AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。
基础的裂痕:看似微小的架构选择会影响长上下文扩展
机构 * Ai2 ; Carnegie Mellon University(卡内基梅隆大学) ; University of Washington(华盛顿大学)
AI总结 该研究发现,Olmo、Llama、Qwen等稠密模型系列的四个微小架构决策会复合降低长上下文性能,结合三个及以上选择可使性能降47%,经17万余GPU小时训练发布OlmPool,其部分模型长上下文性能优于Llama 3。
Comments 29 pages; accepted to COLM 2026
注意用户模拟中的Sim2Real差距以实现代理任务
AI总结 研究发现基于LLM的用户模拟器在代理任务中存在Sim2Real差距,表现出过度合作和缺乏真实反馈,需通过人类验证提升模拟真实性。
Comments COLM 2026
NEMO: 通过自主编码代理实现执行感知的优化建模
机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,计算机科学学院,卡内基梅隆大学,匹兹堡,PA,美国)
AI总结 提出NEMO系统,利用自主编码代理将决策问题的自然语言描述转化为可执行的数学优化实现,通过执行感知的架构和协调模式实现最先进的性能。
Comments Accepted at ICML 2026
通过推理模型作为评估器来提升评估时的计算能力
机构 * CMU(卡内基梅隆大学) ; UIUC(伊利诺伊大学) ; KAIST AI(韩国科学技术院人工智能研究所) ; NEC Laboratories Europe(日本 NEC 欧洲实验室) ; Ss.Cyril and Methodius University of Skopje(斯科普里塞尔吉尔和梅蒂乌斯大学)
AI总结 本文探讨了通过增加评估时的计算量来提升语言模型的评估能力,利用推理模型作为评估器,分别评估响应整体和每个步骤,从而提高评估效果。
Comments ACL 2026 Findings
异步软件工程代理的有效策略
机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学,语言技术研究所)
AI总结 本文提出CAID框架,通过集中任务委派、异步执行和隔离工作区三个核心SWE原语,提升多代理协作效率,在论文复现和Python库开发任务中分别提升26.7%和14.3%的准确性。
建模网络代理中不同的人类交互
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Duke University(杜克大学)
AI总结 本文通过收集400条真实用户网络导航轨迹,识别四种人机交互模式,并训练语言模型预测用户干预时机,将干预预测准确率提升61.4%-63.4%,用户评价的代理有用性提高36.8%。
Comments Preprint
PACE:智能体能力评估的代理框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Salesforce AI Research(Salesforce人工智能研究)
AI总结 提出PACE框架,通过从非智能体评测中选取原子实例构建代理基准,以低成本高精度预测智能体基准性能,在14个模型上实现MAE<4%、Spearman>0.80。
Decomposer: 学习将符号音乐反编译为程序
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出Decomposer框架,通过两阶段方法(合成数据微调+强化学习优化)将符号音乐反编译为可读、可编辑的程序,在MIDI重建保真度和代码可读性上优于基线。
Comments Project page: https://yewon-kim.com/decomposer
PPT-Eval: 面向PowerPoint任务的计算机使用智能体基准
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft(微软) ; UMass Amherst(马萨诸塞大学阿默斯特分校) ; Google(谷歌) ; Snowflake
AI总结 提出PPT-Eval基准,包含120个PowerPoint任务,并设计基于评分标准的评估框架,通过部分评分和自然语言反馈衡量智能体表现,发现现有最强模型仅达45%成功率。
Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026
离散化奖励模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Meta Superintelligence Labs(Meta超级智能实验室)
AI总结 针对奖励模型过度敏感导致策略不佳的问题,提出一种基于蒙特卡洛dropout的无训练离散化算法,在保持判别能力的同时降低过度敏感性,减少奖励黑客行为并提升策略效果。
基于LLM并行文本生成的低延迟实时音频游戏解说系统
机构 * The University of Tokyo(东京大学) ; National Institute of Advanced Industrial Science and Technology(产业技术综合研究所) ; Technical University of Munich(慕尼黑工业大学) ; Keio University(庆应义塾大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Nara Women’s University(奈良女子大学)
AI总结 提出一种并行文本生成与语音播放的低延迟实时游戏解说系统,将平均句间静默从9.6秒降至0.3秒,显著提升解说节奏。
Comments Accepted at IJCAI-ECAI 2026 (Demonstrations Track)
如何评估人机交互?软件代理设计案例研究
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出PULSE框架,通过用户反馈和模型预测结合评估人机交互,在15k用户实验中验证其能减少40%置信区间,并揭示基准测试与真实结果的差异。
Comments ICML 2026
FieldWorkArena:面向真实作业任务的代理AI基准测试
机构 * Fujitsu Limited(富士通株式会社) ; Fujitsu Research of America(富士通美国研究部) ; Carnegie Mellon University(卡内基梅隆大学) ; Master’s Student, The University of Tokyo(东京大学硕士研究生) ; Agent Research Collective(代理研究集体)
AI总结 本文提出FieldWorkArena,用于评估代理AI在真实制造业和零售环境中的性能,通过现场采集的数据和实地访谈设计任务,验证多模态大语言模型的评估可行性。
Comments 27 pages, 10 figures, 7 tables [ICPR 2026 Accepted] Changes from previous version: added supplemental material
大规模多语言联合分割与标注
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 针对现有神经标注模型缺乏形态边界预测导致可解释性差的问题,提出PolyGloss模型,通过联合分割与标注提升准确性和对齐度,并支持低秩适应快速迁移。
Comments 15 pages, 9 figures, accepted to ACL 2026 Long Papers
通过闭环内存优化增强软件工程
机构 * William & Mary(威廉玛丽学院) ; Carnegie Mellon University(卡内基梅隆大学) ; OpenHands University(OpenHands大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 提出闭环内存优化框架,通过验证下游影响来定义内存效用,作为评估基准和优化信号,显著提升软件工程代理的成功率和效率。
人工智能审稿人的局限与机遇:对Nature系列论文审稿的45位专家科学家的审查
机构 * Nature(自然)
AI总结 本文通过大规模专家标注研究,探讨了AI审稿人在科学同行评审中的能力与局限,发现AI审稿在准确性、显著性和证据充分性方面表现优异,但存在领域知识有限、上下文管理不足等弱点,表明AI审稿是人类审稿的补充而非替代。
Comments Work in progress
通过言语反馈强化人类行为模拟
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft(微软)
AI总结 本文提出DITTO模型,通过将言语反馈作为强化学习中的首要信号来提升LLM模拟人类行为的能力,并引入SOUL基准测试平台,展示了在多个任务中显著提升性能的成果。
Soohak:一个由数学家精心编订的基准,用于评估大语言模型的研究级数学能力
AI总结 本文提出Soohak基准,通过64位数学家自主编写439道问题,评估大语言模型在研究级数学问题上的能力,同时引入拒绝子集以测试模型对不恰当问题的识别能力。
Comments Under review, For questions or model-evaluation requests, contact $guijin.son@snu.ac.kr$
递归智能体优化
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon AGI Labs(亚马逊人工智能实验室)
AI总结 本文提出递归智能体优化方法,通过递归代理训练实现更高效的推理扩展和泛化能力,提升任务处理效率和泛化性能。
OpenHands软件代理SDK:一种可组合且可扩展的生产代理基础
机构 * MLSys 2026
AI总结 本文提出OpenHands SDK,提供灵活的代理实现接口、安全可靠执行及用户交互接口,整合了本地到远程执行、多LLM路由和安全分析,验证了其在生产部署中的有效性。
Comments Accepted at MLSys 2026
询问何为关键:面向软件工程任务的奖励驱动澄清
机构 * Language Technologies Institute, Carnegie Mellon University, Pittsburgh, USA(语言技术研究所,卡内基梅隆大学,匹兹堡,美国)
AI总结 本文研究软件工程任务中有效澄清问题的方法,通过量化影响任务成功的信息类型和用户能提供的信息,提出基于Shapley属性和分布比较的多阶段强化学习奖励机制,训练出CLARITI模块,在未明确问题上表现优于GPT-5,生成更少问题。
Comments 28 pages, 6 figures
语言模型学习了什么以及何时?隐式课程假说
机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) ; Department of Computer Science, Data Science and AI Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系、数据科学与人工智能研究所) ; Khoury College of Computer Science, Northeastern University(东北大学Khoury计算机科学学院) ; Department of Computer Science, University of Southern California(南加州大学计算机科学系)
AI总结 研究通过设计简单可组合任务,发现模型技能以可组合顺序出现,且在不同模型间一致,表明预训练过程具有结构性。
Gym-Anything: 将任意软件转化为智能体环境
机构 * CMU(卡内基梅隆大学)
AI总结 本文提出Gym-Anything框架,通过多智能体任务将任意软件转化为交互式计算机使用环境,生成涵盖医疗、天文、工程等领域的10K+长周期任务,提升现实场景下的智能体研究效率。
IDIOLEX:统一且连续的语用与风格变异表示
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Notre Dame(圣母大学) ; George Mason University(乔治梅森大学) ; University of Washington(华盛顿大学) ; Archimedes Research Unit(阿基米德研究单元)
AI总结 本文提出IDIOLEX框架,通过结合句子来源信息与语言特征,学习连续的风格和方言表示,用于分析和分类,并用于对齐语言模型的风格。
ZINA:多模态细粒度幻觉检测与编辑
机构 * Keio AI Research Center(庆应义塾大学人工智能研究中心) ; Keio University(庆应义塾大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出ZINA方法,用于多模态大语言模型的细粒度幻觉检测与编辑,通过构建VisionHall数据集验证了其在检测和编辑任务中的优越性。
Comments CVPR 2026 Main Conference
数学对象推理:在线奖励建模与测试时间聚合
机构 * FAIR at Meta(Meta旗下的FAIR)
AI总结 本文提出改进数学对象推理的三个贡献:构建数学对象推导的训练数据和基准Principia套件,提供强LLM判官和验证器的训练方案,展示在线训练可提升测试时计算能力。
CodeScout: 一种有效的强化学习代码搜索代理训练方法
AI总结 本文提出CodeScout,通过强化学习方法训练仅使用标准Unix终端的代码搜索代理,实验证明其在多个基准测试中优于大型语言模型。
CUBE:统一智能体基准的标准化
AI总结 本文提出CUBE标准,通过MCP和Gym构建统一协议,实现智能体基准的标准化,减少碎片化,提升研究效率。
Comments Position paper. 10 pages. Reference implementation: https://github.com/The-AI-Alliance/cube-standard
代理开发是否能反映现实世界的工作?
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。