arXivDaily arXiv每日学术速递 周一至周五更新

作者

Graham Neubig

Natural Language Processing

共收录 396
2603.03800 2026-03-05 cs.AI cs.LG

A Rubric-Supervised Critic from Sparse Real-World Outcomes

从稀疏现实结果中学习的评分监督批评者

Xingyao Wang, Valerie Chen, Heng Ji, Graham Neubig

AI总结 本文提出了一种从稀疏现实结果中学习的评分监督批评者模型,用于提升编码代理的训练和推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24702 2026-03-05 cs.CL cs.AI

Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents

代理数据协议:统一多样化、高效的LLM代理微调数据集

Yueqi Song, Ketan Ramaneti, Zaid Sheikh, Ziru Chen, Boyu Gou, Tianbao Xie, Yiheng Xu, Danyang Zhang, Apurva Gandhi, Fan Yang, Joseph Liu, Tianyue Ou, Zhihao Yuan, Frank Xu, Shuyan Zhou, Xingyao Wang, Xiang Yue, Tao Yu, Huan Sun, Yu Su, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) The Ohio State University(俄亥俄州立大学) University of Hong Kong(香港大学) Duke University(杜克大学) Fujitsu Research(富士通研究) All Hands AI(全手AI)

AI总结 本文提出代理数据协议(ADP),通过统一多样化代理训练数据集,提升LLM代理微调效果,实现20%的性能提升并在多个基准上达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02655 2026-03-04 cs.CL cs.AI

Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches

基于多模态大语言模型的实时游戏视频解说生成:暂停感知解码方法

Anum Afzal, Yuki Saito, Hiroya Takamura, Katsuhito Sudoh, Shinnosuke Takamichi, Graham Neubig, Florian Matthes, Tatsuya Ishigaki

机构 * School of CIT, Technical University of Munich(慕尼黑技术大学计算机信息学院) National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

AI总结 本文提出两种基于提示的解码方法,利用多模态大语言模型实现实时游戏视频解说生成,通过动态间隔调整提升时间相关性与内容准确性。

Comments Accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03533 2026-03-04 cs.CL

Go-Browse: Training Web Agents with Structured Exploration

Go-Browse: 通过结构化探索训练网络代理

Apurva Gandhi, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 Go-Browse通过结构化探索方法,利用大规模网络环境数据训练代理,提升任务解决成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03862 2026-03-03 cs.CL cs.AI

Not-Just-Scaling Laws: Towards a Better Understanding of the Downstream Impact of Language Model Design Decisions

并非仅仅的规模法则:迈向更深入理解语言模型设计决策对下游影响的探索

Emmy Liu, Amanda Bertsch, Lintang Sutawika, Lindia Tjuatja, Patrick Fernandes, Lara Marinov, Michael Chen, Shreya Singhal, Carolin Lawrence, Aditi Raghunathan, Kiril Gashteovski, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Language Technologies Institute(语言技术研究所) Instituto Superior Técnico (Lisbon ELLIS Unit)(里斯本ELLIS单位(理工学院)) Instituto de Telecomunicações(电信研究所) NEC Laboratories Europe, Germany(德国NEC欧洲实验室) CAIR, Ss. Cyril and Methodius University of Skopje, North Macedonia(北马其顿斯·西里尔和方法ius大学)

AI总结 本研究通过分析92个开源预训练模型,发现结合模型大小和训练token数量以外的特征,可提升对下游性能预测能力,揭示了数据组成和架构决策对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16609 2026-03-02 cs.AI cs.CL cs.HC

CowPilot: A Framework for Autonomous and Human-Agent Collaborative Web Navigation

CowPilot:自主与人机协作的网页导航框架

Faria Huq, Zora Zhiruo Wang, Frank F. Xu, Tianyue Ou, Shuyan Zhou, Jeffrey P. Bigham, Graham Neubig

机构 * School of Computer Science, Carnegie Mellon University(计算机科学系,卡内基梅隆大学)

AI总结 CowPilot通过自主与人机协作机制提升网页导航效率,实现95%的任务成功率,减少人类操作步骤至15.2%

Comments Published at NAACL System Demonstration Track, 2025

Journal ref 2025.naacl-demo.17

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25726 2026-02-27 cs.CL cs.AI

The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

工具十项全能:评估语言代理在多样化、真实和长周期任务执行中的基准测试

Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xingyao Wang, Xiang Yue, Shuyan Zhou, Graham Neubig, Junxian He

AI总结 工具十项全能提出了一种新的语言代理基准测试,通过多样化的真实任务和工具评估代理在复杂长周期任务中的表现。

Comments ICLR 2026, Website: https://toolathlon.xyz/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13069 2026-02-24 cs.AI

Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering

Ambig-SWE: 交互式代理以克服软件工程中的不充分性

Sanidhya Vijayvargiya, Xuhui Zhou, Akhila Yerukola, Maarten Sap, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。

Comments 22 pages, 7 figures, Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16819 2026-02-20 cs.SE cs.CL cs.LG

Hybrid-Gym: Training Coding Agents to Generalize Across Tasks

Hybrid-Gym: 训练能够跨任务泛化的编码代理

Yiqing Xie, Emmy Liu, Gaokai Zhang, Nachiket Kotalwar, Shubham Gandhi, Sathwik Acharya, Xingyao Wang, Carolyn Rose, Graham Neubig, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 Hybrid-Gym通过设计合成任务训练编码代理,提升其跨任务泛化能力,在多个基准测试中取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06134 2026-02-18 cs.AI

OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety

OpenAgentSafety: 一个全面评估现实世界AI代理安全性的框架

Sanidhya Vijayvargiya, Aditya Bharat Soni, Xuhui Zhou, Zora Zhiruo Wang, Nouha Dziri, Graham Neubig, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) Allen Institute for Artificial Intelligence(人工智能研究院)

AI总结 OpenAgentSafety提出一个全面评估AI代理安全性的框架,通过真实工具和多任务测试揭示代理在现实世界中的安全漏洞,强调需要加强安全防护。

Comments 26 pages, 10 figures, Accepted at ICLR 2026 and IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14865 2026-02-03 cs.CL

Midtraining Bridges Pretraining and Posttraining Distributions

中期训练连接预训练和后训练分布

Emmy Liu, Graham Neubig, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University, USA(语言技术研究所,卡内基梅隆大学,美国)

AI总结 中期训练通过提供更好的初始化提升模型性能,尤其在与通用预训练数据距离较远的领域表现突出,且起始时间和混合权重的相互作用影响其效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21903 2026-02-02 cs.SE cs.AI

TOM-SWE: User Mental Modeling For Software Engineering Agents

TOM-SWE:软件工程代理的用户心理建模

Xuhui Zhou, Valerie Chen, Zora Zhiruo Wang, Graham Neubig, Maarten Sap, Xingyao Wang

机构 * Language Technology Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

AI总结 TOM-SWE通过双代理架构实现用户心理建模,提升软件工程代理的任务成功率和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18722 2026-01-27 cs.CL cs.LG

Gained in Translation: Privileged Pairwise Judges Enhance Multilingual Reasoning

翻译中获益:特权成对评判增强多语言推理

Lintang Sutawika, Gokul Swamy, Zhiwei Steven Wu, Graham Neubig

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所) Carnegie Mellon University, Robotics Institute(卡内基梅隆大学机器人研究所) Carnegie Mellon University, Software and Societal Systems Department(卡内基梅隆大学软件与社会系统系)

AI总结 SP3F通过自我扮演和特权成对反馈提升多语言推理能力,无需目标语言数据,有效提升模型在多语言任务中的表现。

Comments Code available at https://github.com/lintangsutawika/SP3F

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05406 2026-01-23 cs.LG cs.CL

Everybody Prune Now: Structured Pruning of LLMs with only Forward Passes

人人都现在剪枝:仅前向传递的LLM结构剪枝

Steven Kolawole, Lucio Dery, Jean-François Kagy, Virginia Smith, Graham Neubig, Ameet Talwalkar

机构 * Carnegie Mellon University(卡内基梅隆大学) Google Research(谷歌研究)

AI总结 Bonsai通过仅前向传递的扰动剪枝方法,实现了无需反向传播的高效结构化剪枝,显著降低内存和计算成本,同时提升模型压缩效率和性能。

Comments 19 pages, 6 fiigures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12216 2026-01-13 cs.SE cs.AI cs.CL

Training Versatile Coding Agents in Synthetic Environments

在合成环境中训练多功能编码代理

Yiqi Zhu, Apurva Gandhi, Graham Neubig

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 SWE-Playground通过从头生成项目和任务,训练多功能编码代理,能够处理更广泛的编码任务并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07783 2025-12-09 cs.CL

On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models

在预训练、中训练和强化学习对推理语言模型的相互作用中

Charlie Zhang, Graham Neubig, Xiang Yue

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学,语言技术研究所)

AI总结 研究探讨了预训练、中训练和强化学习在推理语言模型中的相互作用,发现RL需预训练留有余地才能提升能力,中训练提升性能,过程级奖励提高推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04350 2025-12-05 cs.CL

ClusterFusion: Hybrid Clustering with Embedding Guidance and LLM Adaptation

ClusterFusion: 嵌入引导的混合聚类与LLM适应

Yiming Xu, Yuan Yuan, Vijay Viswanathan, Graham Neubig

机构 * Adobe(Adobe公司) Carnegie Mellon University(卡内基梅隆大学)

AI总结 ClusterFusion通过将LLM作为聚类核心,结合嵌入引导方法,实现领域知识与用户偏好的整合,提升文本聚类在标准任务和特定领域的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18624 2025-12-02 cs.CL

Checklists Are Better Than Reward Models For Aligning Language Models

检查表比奖励模型更能对齐语言模型

Vijay Viswanathan, Yanchao Sun, Shuang Ma, Xiang Kong, Meng Cao, Graham Neubig, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出基于检查表反馈的强化学习方法,通过灵活的指令特定准则提升语言模型的指令遵循能力,在多个基准测试中均取得性能提升。

Comments Presented at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22173 2025-12-01 cs.CL

RefineBench: Evaluating Refinement Capability of Language Models via Checklists

RefineBench: 通过检查表评估语言模型的细化能力

Young-Jun Lee, Seungone Kim, Byung-Kwan Lee, Minkyeong Moon, Yechan Hwang, Jong Myoung Kim, Graham Neubig, Sean Welleck, Ho-Jin Choi

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达) Independent Researcher(独立研究者)

AI总结 RefineBench通过检查表评估语言模型的细化能力,发现指导细化能显著提升响应质量,而自我细化则需进一步突破。

Comments Project website: https://passing2961.github.io/refinebench-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14945 2025-11-21 cs.CV

Unsupervised Discovery of Long-Term Spatiotemporal Periodic Workflows in Human Activities

无监督发现人类活动中的长期时空周期性工作流

Fan Yang, Quanting Xie, Atsunori Moteki, Shoichi Masui, Shan Jiang, Kanji Uchino, Yonatan Bisk, Graham Neubig

机构 * Fujitsu Research of America, USA(美国富士通研究机构) Fujitsu Limited, Japan(日本富士通有限公司) Carnegie Mellon University, USA(美国卡内基梅隆大学)

AI总结 本文提出首个包含长期周期性工作流的基准,通过轻量级基线实现无监督检测和异常检测,显著优于现有方法并具备实际部署优势。

Comments accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09109 2025-11-21 cs.CV cs.CL

CAIRe: Cultural Attribution of Images by Retrieval-Augmented Evaluation

CAIRe:通过检索增强评估进行图像文化归因

Arnav Yayavaram, Siddharth Yayavaram, Simran Khanuja, Michael Saxon, Graham Neubig

机构 * BITS Pilani(比斯·皮兰大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

AI总结 CAIRe通过检索增强评估方法,评估图像在不同文化标签下的相关性,有效衡量文化偏见,提升跨文化公平性。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04486 2025-11-18 cs.SE

EDIT-Bench: Evaluating LLM Abilities to Perform Real-World Instructed Code Edits

Wayne Chi, Valerie Chen, Ryan Shar, Aditya Mittal, Jenny Liang, Wei-Lin Chiang, Anastasios Nikolas Angelopoulos, Ion Stoica, Graham Neubig, Ameet Talwalkar, Chris Donahue

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22780 2025-11-10 cs.AI cs.CL cs.HC

How Do AI Agents Do Human Work? Comparing AI and Human Workflows Across Diverse Occupations

Zora Zhiruo Wang, Yijia Shao, Omar Shaikh, Daniel Fried, Graham Neubig, Diyi Yang

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21849 2025-11-07 cs.LG cs.AI

TowerVision: Understanding and Improving Multilinguality in Vision-Language Models

André G. Viveiros, Patrick Fernandes, Saul Santos, Sonal Sannigrahi, Emmanouil Zaranis, Nuno M. Guerreiro, Amin Farajian, Pierre Colombo, Graham Neubig, André F. T. Martins

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术高级学院) Instituto de Telecomunicações(电信研究所) Carnegie Mellon University(卡内基梅隆大学) Sword Health(Sword健康) TransPerfect MICS, CentraleSupélec, Université Paris-Saclay(MICS,中央圣艾尔布里大学,巴黎萨克雷大学) ELLIS Unit Lisbon(里斯本ELLIS单位)

Comments 15 pages, 7 figures, submitted to arXiv October 2025. All models, datasets, and training code will be released at https://huggingface.co/collections/utter-project/towervision

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02817 2025-11-05 cs.CL cs.AI

Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities

Amanda Bertsch, Adithya Pratapa, Teruko Mitamura, Graham Neubig, Matthew R. Gormley

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01805 2025-11-05 cs.CL cs.AI

Accumulating Context Changes the Beliefs of Language Models

Jiayi Geng, Howard Chen, Ryan Liu, Manoel Horta Ribeiro, Robb Willer, Graham Neubig, Thomas L. Griffiths

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02208 2025-11-05 cs.AI cs.CL cs.LG

Training Proactive and Personalized LLM Agents

Weiwei Sun, Xuhui Zhou, Weihua Du, Xingyao Wang, Sean Welleck, Graham Neubig, Maarten Sap, Yiming Yang

机构 * Carnegie Mellon University(卡内基梅隆大学) OpenHands

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16932 2025-11-03 cs.CL

Prompt-MII: Meta-Learning Instruction Induction for LLMs

Emily Xiao, Yixiao Zeng, Ada Chen, Chin-Jou Li, Amanda Bertsch, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Language Technologies Institute(语言技术研究所)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04953 2025-10-31 cs.CL cs.AI

M-Prometheus: A Suite of Open Multilingual LLM Judges

José Pombal, Dongkeun Yoon, Patrick Fernandes, Ian Wu, Seungone Kim, Ricardo Rei, Graham Neubig, André F. T. Martins

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00432 2025-10-21 cs.AI cs.CL

Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning

Maggie Huan, Yuetai Li, Tuney Zheng, Xiaoyu Xu, Seungone Kim, Minxin Du, Radha Poovendran, Graham Neubig, Xiang Yue

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) University of Washington(华盛顿大学) M-A-P The Hong Kong Polytechnic University(香港理工大学)

详情

展开后加载摘要…

URL PDF HTML 收藏