A Rubric-Supervised Critic from Sparse Real-World Outcomes
从稀疏现实结果中学习的评分监督批评者
AI总结 本文提出了一种从稀疏现实结果中学习的评分监督批评者模型,用于提升编码代理的训练和推理性能。
作者
Natural Language Processing
从稀疏现实结果中学习的评分监督批评者
AI总结 本文提出了一种从稀疏现实结果中学习的评分监督批评者模型,用于提升编码代理的训练和推理性能。
代理数据协议:统一多样化、高效的LLM代理微调数据集
机构 * Carnegie Mellon University(卡内基梅隆大学) ; The Ohio State University(俄亥俄州立大学) ; University of Hong Kong(香港大学) ; Duke University(杜克大学) ; Fujitsu Research(富士通研究) ; All Hands AI(全手AI)
AI总结 本文提出代理数据协议(ADP),通过统一多样化代理训练数据集,提升LLM代理微调效果,实现20%的性能提升并在多个基准上达到SOTA水平。
基于多模态大语言模型的实时游戏视频解说生成:暂停感知解码方法
机构 * School of CIT, Technical University of Munich(慕尼黑技术大学计算机信息学院) ; National Institute of Advanced Industrial Science(国家工业科学与技术研究院)
AI总结 本文提出两种基于提示的解码方法,利用多模态大语言模型实现实时游戏视频解说生成,通过动态间隔调整提升时间相关性与内容准确性。
Comments Accepted at LREC2026
Go-Browse: 通过结构化探索训练网络代理
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 Go-Browse通过结构化探索方法,利用大规模网络环境数据训练代理,提升任务解决成功率。
并非仅仅的规模法则:迈向更深入理解语言模型设计决策对下游影响的探索
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Language Technologies Institute(语言技术研究所) ; Instituto Superior Técnico (Lisbon ELLIS Unit)(里斯本ELLIS单位(理工学院)) ; Instituto de Telecomunicações(电信研究所) ; NEC Laboratories Europe, Germany(德国NEC欧洲实验室) ; CAIR, Ss. Cyril and Methodius University of Skopje, North Macedonia(北马其顿斯·西里尔和方法ius大学)
AI总结 本研究通过分析92个开源预训练模型,发现结合模型大小和训练token数量以外的特征,可提升对下游性能预测能力,揭示了数据组成和架构决策对模型性能的影响。
CowPilot:自主与人机协作的网页导航框架
机构 * School of Computer Science, Carnegie Mellon University(计算机科学系,卡内基梅隆大学)
AI总结 CowPilot通过自主与人机协作机制提升网页导航效率,实现95%的任务成功率,减少人类操作步骤至15.2%
Comments Published at NAACL System Demonstration Track, 2025
Journal ref 2025.naacl-demo.17
工具十项全能:评估语言代理在多样化、真实和长周期任务执行中的基准测试
AI总结 工具十项全能提出了一种新的语言代理基准测试,通过多样化的真实任务和工具评估代理在复杂长周期任务中的表现。
Comments ICLR 2026, Website: https://toolathlon.xyz/
Ambig-SWE: 交互式代理以克服软件工程中的不充分性
机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。
Comments 22 pages, 7 figures, Accepted at ICLR 2026
Hybrid-Gym: 训练能够跨任务泛化的编码代理
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 Hybrid-Gym通过设计合成任务训练编码代理,提升其跨任务泛化能力,在多个基准测试中取得显著效果。
OpenAgentSafety: 一个全面评估现实世界AI代理安全性的框架
机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) ; Allen Institute for Artificial Intelligence(人工智能研究院)
AI总结 OpenAgentSafety提出一个全面评估AI代理安全性的框架,通过真实工具和多任务测试揭示代理在现实世界中的安全漏洞,强调需要加强安全防护。
Comments 26 pages, 10 figures, Accepted at ICLR 2026 and IASEAI 2026
中期训练连接预训练和后训练分布
机构 * Language Technologies Institute, Carnegie Mellon University, USA(语言技术研究所,卡内基梅隆大学,美国)
AI总结 中期训练通过提供更好的初始化提升模型性能,尤其在与通用预训练数据距离较远的领域表现突出,且起始时间和混合权重的相互作用影响其效果。
TOM-SWE:软件工程代理的用户心理建模
机构 * Language Technology Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)
AI总结 TOM-SWE通过双代理架构实现用户心理建模,提升软件工程代理的任务成功率和用户满意度。
翻译中获益:特权成对评判增强多语言推理
机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所) ; Carnegie Mellon University, Robotics Institute(卡内基梅隆大学机器人研究所) ; Carnegie Mellon University, Software and Societal Systems Department(卡内基梅隆大学软件与社会系统系)
AI总结 SP3F通过自我扮演和特权成对反馈提升多语言推理能力,无需目标语言数据,有效提升模型在多语言任务中的表现。
Comments Code available at https://github.com/lintangsutawika/SP3F
人人都现在剪枝:仅前向传递的LLM结构剪枝
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Google Research(谷歌研究)
AI总结 Bonsai通过仅前向传递的扰动剪枝方法,实现了无需反向传播的高效结构化剪枝,显著降低内存和计算成本,同时提升模型压缩效率和性能。
Comments 19 pages, 6 fiigures, 16 tables
在合成环境中训练多功能编码代理
机构 * Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 SWE-Playground通过从头生成项目和任务,训练多功能编码代理,能够处理更广泛的编码任务并提升性能。
在预训练、中训练和强化学习对推理语言模型的相互作用中
机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学,语言技术研究所)
AI总结 研究探讨了预训练、中训练和强化学习在推理语言模型中的相互作用,发现RL需预训练留有余地才能提升能力,中训练提升性能,过程级奖励提高推理准确性。
ClusterFusion: 嵌入引导的混合聚类与LLM适应
机构 * Adobe(Adobe公司) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 ClusterFusion通过将LLM作为聚类核心,结合嵌入引导方法,实现领域知识与用户偏好的整合,提升文本聚类在标准任务和特定领域的性能。
检查表比奖励模型更能对齐语言模型
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出基于检查表反馈的强化学习方法,通过灵活的指令特定准则提升语言模型的指令遵循能力,在多个基准测试中均取得性能提升。
Comments Presented at NeurIPS 2025
RefineBench: 通过检查表评估语言模型的细化能力
机构 * KAIST(韩国科学技术院) ; Carnegie Mellon University(卡内基梅隆大学) ; NVIDIA(英伟达) ; Independent Researcher(独立研究者)
AI总结 RefineBench通过检查表评估语言模型的细化能力,发现指导细化能显著提升响应质量,而自我细化则需进一步突破。
Comments Project website: https://passing2961.github.io/refinebench-page/
无监督发现人类活动中的长期时空周期性工作流
机构 * Fujitsu Research of America, USA(美国富士通研究机构) ; Fujitsu Limited, Japan(日本富士通有限公司) ; Carnegie Mellon University, USA(美国卡内基梅隆大学)
AI总结 本文提出首个包含长期周期性工作流的基准,通过轻量级基线实现无监督检测和异常检测,显著优于现有方法并具备实际部署优势。
Comments accepted to WACV 2026
CAIRe:通过检索增强评估进行图像文化归因
机构 * BITS Pilani(比斯·皮兰大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
AI总结 CAIRe通过检索增强评估方法,评估图像在不同文化标签下的相关性,有效衡量文化偏见,提升跨文化公平性。
Comments Preprint, under review
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术高级学院) ; Instituto de Telecomunicações(电信研究所) ; Carnegie Mellon University(卡内基梅隆大学) ; Sword Health(Sword健康) ; TransPerfect ; MICS, CentraleSupélec, Université Paris-Saclay(MICS,中央圣艾尔布里大学,巴黎萨克雷大学) ; ELLIS Unit Lisbon(里斯本ELLIS单位)
Comments 15 pages, 7 figures, submitted to arXiv October 2025. All models, datasets, and training code will be released at https://huggingface.co/collections/utter-project/towervision
Comments Preprint
机构 * Carnegie Mellon University(卡内基梅隆大学) ; OpenHands
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Language Technologies Institute(语言技术研究所)
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Washington(华盛顿大学) ; M-A-P ; The Hong Kong Polytechnic University(香港理工大学)