arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

ServiceNow

共收录 91
2506.04390 2026-05-25 cs.CR cs.AI

Through the Stealth Lens: Attention-Aware Defenses Against Poisoning in RAG

通过隐秘视角:检索增强生成中针对投毒攻击的注意力感知防御

Sarthak Choudhary, Nils Palumbo, Ashish Hooda, Krishnamurthy Dj Dvijotham, Somesh Jha

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ServiceNow Research(ServiceNow研究)

AI总结 针对检索增强生成系统在低污染率下仍易受投毒攻击的问题,提出基于注意力权重的归一化段落注意力分数和注意力方差滤波器,实现高精度检测与防御,并揭示真正隐秘投毒的挑战。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21463 2026-05-21 cs.CL cs.AI

Mem-$π$: Adaptive Memory through Learning When and What to Generate

Mem-$π$: 通过学习何时以及生成什么来实现自适应记忆

Xiaoqiang Wang, Chao Wang, Hadi Nekoei, Christopher Pal, Alexandre Lacoste, Spandana Gella, Bang Liu, Perouz Taslakian

机构 * ServiceNow AI Research(ServiceNow AI研究院) Mila -- Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席)

AI总结 Mem-$π$ 通过学习在何时以及生成什么来实现自适应记忆,利用专门的语言或视觉-语言模型生成上下文特定的指导,从而在多种代理任务中优于基于检索和先前RL优化的记忆基线。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18607 2026-05-19 cs.CL cs.LG

Forecasting Downstream Performance of LLMs With Proxy Metrics

通过代理指标预测大语言模型的下游性能

Arkil Patel, Siva Reddy, Marius Mosbach, Dzmitry Bahdanau

机构 * Mila – Quebec AI Institute & McGill University(魁北克AI研究院与麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席) ServiceNow Research Periodic Labs(ServiceNow研究周期实验室)

AI总结 本文提出通过聚合候选模型的下一个token分布中的token级统计信息(如熵、top-k准确率和专家token排名)来构建代理指标,以更准确地预测大语言模型的下游性能,优于传统的损失和计算量基线方法。

Comments Preprint. 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16604 2026-05-19 cs.LG

R2V Agent: Teaching SLMs When to Ask for Help

R2V Agent:教SLMs何时请求帮助

Raghu Vamshi Hemadri, Humaira Firdowse Mohammed, Rishabh Maheshwary, Srivatsava Daruru, Sagar Davasam, Vikas Yadav, Srinivas Sunkara, Sai Rajeswar

机构 * New York University Tandon School of Engineering(纽约大学Tandon工程学院) University of California, San Diego(加州大学圣地亚哥分校) Stanford University(斯坦福大学) ServiceNow Research(ServiceNow研究) Mila - Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

AI总结 R2V-Agent通过风险校准的SLM-LLM路由框架提升交互代理的可靠性,结合小型语言模型策略、更强的教师LLM、轻量级过程验证器和校准的步骤路由器,在多个基准测试中显著提升性能与成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12178 2026-05-13 cs.AI cs.CL cs.LG

Do Enterprise Systems Need Learned World Models? The Importance of Context to Infer Dynamics

企业系统需要学习的世界模型吗?上下文对推断动态的重要性

Jishnu Sethumadhavan Nair, Patrice Bechard, Rishabh Maheshwary, Surajit Dasgupta, Sravan Ramachandran, Aakash Bhagat, Shruthan Radhakrishna, Pulkit Pattnaik, Johan Obando-Ceron, Shiva Krishna Reddy Malay, Sagar Davasam, Seganrasan Subramanian, Vipul Mittal, Sridhar Krishna Nemala, Christopher Pal, Srinivas Sunkara, Sai Rajeswar

机构 * ServiceNow Mila

AI总结 本文探讨了在可配置的企业环境中,代理是否仍需学习动态规则,通过实验表明运行时发现动态比离线训练更鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08031 2026-05-12 cs.SD cs.AI cs.LG eess.AS

AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs

AU-Harness:音频大语言模型的开放式工具包

Hoang Nguyen, Sidharth Surapaneni, Akshay Kalkunte, Jash Mehta, Aman Tiwari, Oluwanifemi Bamgbose, Khyati Mahajan, Jash Shah, Shruthan Radhakrishna, Sathwik Tejaswi Madhusudhan, Vikas Yadav, Sai Rajeswar

机构 * ServiceNow University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 AU-Harness通过优化处理流程和并行执行,实现151%的速度提升,提供标准化提示协议和灵活配置,促进音频大语言模型的系统性发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09364 2026-05-12 cs.LG

Multi-scale Predictive Representations for Goal-conditioned Reinforcement Learning

多尺度预测表示用于目标条件强化学习

Valliappan Chidambaram Adaikkappan, David Meger, Sai Rajeswar, Pietro Mazzaglia

机构 * Mila, McGill University(蒙特利尔大学Mila实验室) ServiceNow Research(ServiceNow研究) Qualcomm Research(高通研究)

AI总结 本文探讨了离线目标条件强化学习中鲁棒表示学习问题,提出多尺度预测监督框架Ms.PR,通过多尺度预测提升潜在空间中目标导向对齐,提升表示质量和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05432 2026-04-29 cs.AI

AInstein: Can LLMs Solve Research Problems From Parametric Memory Alone?

AInstein:LLM能否仅凭参数记忆解决研究问题?

Shambhavi Mishra, Gaurav Sahu, Marco Pedersoli, Laurent Charlin, Jose Dolz, Christopher Pal

机构 * LIVIA, ÉTS Montréal(LIVIA,蒙特利尔工程学院) Mila – Quebec AI Institute(魁北克人工智能研究所) HEC Montréal(蒙特利尔HEC学院) ServiceNow Research(ServiceNow研究) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Université de Montréal(蒙特利尔大学) Polytechnique Montréal(蒙特利尔理工学院) International Laboratory on Learning Systems (ILLS)(学习系统国际实验室)

AI总结 本文提出AInstein框架,测试LLM能否通过迭代批评循环生成和改进解决方案。研究发现LLM在70%的问题上成功,但重新发现已发表方案的比例低于19%,表明真正的解决问题能力。但LLM在跨领域类比迁移时存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19877 2026-04-23 cs.LG

Super Apriel: One Checkpoint, Many Speeds

Super Apriel:一个检查点,多种速度

SLAM Labs, :, Oleksiy Ostapenko, Raymond Li, Torsten Scholak, Alireza Mousavi-Hosseini, Aman Tiwari, Denis Kocetkov, Joel Lamy Poirier, Kelechi Ogueji, Nanda H Krishna, Rafael Pardinas, Sathwik Tejaswi Madhusudhan, Shruthan Radhakrishna, Srinivas Sunkara, Valerie Becaert

机构 * ServiceNow Research(ServiceNow研究院) University of Toronto(多伦多大学) Vector Institute(向量研究所)

AI总结 Super Apriel通过在解码器层中提供四种预训练的混合器选择,实现单检查点下的多种速度预设,提升解码吞吐量并保持质量。

Comments Models: https://huggingface.co/ServiceNow-AI/SuperApriel-15B-Base and https://huggingface.co/ServiceNow-AI/SuperApriel-15B-Instruct . Dev model: https://huggingface.co/ServiceNow-AI/SuperApriel-0.5B-Base . Training code: https://github.com/ServiceNow/Fast-LLM . Async RL: https://github.com/ServiceNow/pipeline-rl . Training logs: https://wandb.ai/servicenow-team/Super_Apriel

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14799 2026-04-17 cs.CL cs.CV

Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems

在何时不回答:评估多模态推理系统中的退避

Nishanth Madhusudhan, Vikas Yadav, Alexandre Lacoste

机构 * ServiceNow Research(ServiceNow研究院)

AI总结 本文提出MM-AQA基准,通过视觉模态依赖性和证据充分性变换生成不可回答实例,评估三种前沿VLM和两种MAS架构,发现VLM在标准提示下 rarely 退避,MAS提升退避但引入准确率-退避权衡,序列设计表现优异,表明退避意识训练比提示或更多代理更重要。

Comments 10 pages and 4 figures (excluding appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17069 2026-04-10 cs.CV cs.AI

Distilling Specialized Orders for Visual Generation

蒸馏专用顺序用于视觉生成

Rishav Pramanik, Amin Sghaier, Masih Aminbeidokhti, Juan A. Rodriguez, Antoine Poupon, David Vazquez, Christopher Pal, Zhaozheng Yin, Marco Pedersoli

机构 * Stony Brook University(石溪大学) International Laboratory on Learning Systems (ILLS)(国际学习系统实验室(ILLS)) LIVIA, ÉTS Montréal(LIVIA,蒙特利尔高等技术学院) Mila–Quebec AI Institute(米拉-魁北克人工智能研究所) ServiceNow Research(ServiceNow研究院) Université Paris-Saclay, CentraleSupélec(巴黎-萨克雷大学,中央理工-高等电力学院) Polytechnique Montréal(蒙特利尔综合理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

AI总结 本文提出OAR生成方法,通过蒸馏任意顺序AR模型,提取专用生成顺序并微调,提升生成质量并保持灵活性,实验显示在ImageNet等数据集上FID得分降低,支持零样本修复和扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02007 2026-04-07 cs.LG

Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning

阿普里尔-1.5-开放式推理机:基于强化学习的后训练通用高效推理

Rafael Pardinas, Ehsan Kamalloo, David Vazquez, Alexandre Drouin

机构 * ServiceNow

AI总结 本文提出Apriel-1.5-OpenReasoner,通过可复现的多领域强化学习后训练方法,在Apriel-Base上实现跨五个领域的通用高效推理,提升推理效率并优化不同难度问题的推理长度。

Comments 20 pages, 4 tables, 6 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01202 2026-04-06 cs.AI

Therefore I am. I Think

因此我存在。我认为

Esakkivel Esakkiraja, Sai Rajeswar, Denis Akhiyarov, Rajagopal Venkatesaramani

机构 * Mila, ServiceNow Research(米拉研究所,ServiceNow研究院) ServiceNow(ServiceNow公司)

AI总结 本文探讨了大语言推理模型在做决定时是先思考后决定还是先决定后思考的问题,通过证据表明早期编码的决策影响推理链,展示了一个简单线性探针能从预生成激活中高精度解码工具调用决策,甚至在生成首个推理标记前。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29852 2026-04-01 cs.GR cs.AI cs.CV

VectorGym: A Multitask Benchmark for SVG Code Generation, Sketching, and Editing

VectorGym:一个多任务基准用于SVG代码生成、草图和编辑

Juan Rodriguez, Haotian Zhang, Abhay Puri, Tianyang Zhang, Rishav Pramanik, Meng Lin, Xiaoqing Xie, Marco Terral, Darsh Kaushik, Aly Shariff, Perouz Taslakian, Spandana Gella, Sai Rajeswar, David Vazquez, Christopher Pal, Marco Pedersoli

机构 * ServiceNow Research(ServiceNow 研究院) Mila, Quebec AI Institute(Mila 魁北克人工智能研究所) Columbia University(哥伦比亚大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Stony Brook University(石溪大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Minzu University of China(中央民族大学) University of Waterloo(滑铁卢大学) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能讲席) Computer Vision Center(计算机视觉中心)

AI总结 VectorGym提出一个涵盖SVG生成、复杂编辑和视觉理解的多任务基准,通过专家标注解决现有基准的不足,采用多任务强化学习方法,训练出性能领先的Qwen3-VL模型,公开可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24440 2026-03-26 cs.LG cs.AI cs.CV

CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

CUA-Suite:大规模人工标注的视频演示用于计算机使用代理

Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin, Aarash Feizi, Kaixin Li, Patrice Bechard, Spandana Gella, Sai Rajeswar

机构 * ServiceNow University of Waterloo(多伦多大学) Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。

Comments Project Page: https://cua-suite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13594 2026-03-17 cs.AI cs.LG

EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings

EnterpriseOps-Gym:面向企业场景的状态ful代理规划与工具使用的环境与评估

Shiva Krishna Reddy Malay, Shravan Nayak, Jishnu Sethumadhavan Nair, Sagar Davasam, Aman Tiwari, Sathwik Tejaswi Madhusudhan, Sridhar Krishna Nemala, Srinivas Sunkara, Sai Rajeswar

机构 * ServiceNow Research(ServiceNow研究院)

AI总结 本文提出EnterpriseOps-Gym基准,用于评估企业环境中代理的规划能力。通过164个数据库表和512个功能工具模拟真实工作摩擦,评估14种前沿模型,发现状态-of-the-art模型在战略推理上存在显著不足,且代理常无法拒绝不可行任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00172 2026-03-11 cs.CL

DRBench: A Realistic Benchmark for Enterprise Deep Research

DRBench:企业深度研究的现实基准

Amirhossein Abaskohi, Tianyi Chen, Miguel Muñoz-Mármol, Curtis Fox, Amrutha Varshini Ramesh, Étienne Marcotte, Xing Han Lù, Nicolas Chapados, Spandana Gella, Peter West, Giuseppe Carenini, Christopher Pal, Alexandre Drouin, Issam H. Laradji

机构 * ServiceNow Research(ServiceNow 研究所) University of British Columbia(不列颠哥伦比亚大学) Mila – Quebec AI Institute(魁北克人工智能研究院) McGill University(麦吉尔大学) Polytechnique Montreal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

AI总结 DRBench是一个针对企业深度研究任务的现实基准,通过多步骤查询评估AI代理在复杂问题中的表现,涵盖10个领域,验证不同模型和策略的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06603 2026-03-10 cs.LG cs.AI

Scale Dependent Data Duplication

规模依赖的数据复制

Joshua Kazdan, Noam Levi, Rylan Schaeffer, Jessica Chudnovsky, Abhay Puri, Bo He, Mehmet Donmez, Sanmi Koyejo, David Donoho

机构 * Department of Statistics, Stanford University AI4Science, EPFL Department of Computer Science, Stanford University ServiceNow Research Department of XXX, University of YYY, Location, Country School of ZZZ, Institute of WWW, Location, Country École Polytechnique F\'ed\'erale de Lausanne (EPFL), CH-1015 Lausanne, Switzerland

AI总结 研究发现数据复制在不同规模下表现不同,模型能力提升导致语义相似性梯度一致,大规模下语义碰撞加速,提出明确的规模定律以提高预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21416 2026-02-26 cs.CV

WildSVG: Towards Reliable SVG Generation Under Real-Word Conditions

WildSVG:迈向真实世界条件下可靠的SVG生成

Marco Terral, Haotian Zhang, Tianyang Zhang, Meng Lin, Xiaoqing Xie, Haoran Dai, Darsh Kaushik, Pai Peng, Nicklas Scharpff, David Vazquez, Joan Rodriguez

机构 * QuiverAI Columbia University(哥伦比亚大学) Illinois Institute of Technology(伊利诺伊理工学院) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ServiceNow Research(ServiceNow研究)

AI总结 WildSVG通过引入现实世界基准测试,揭示了现有多模态模型在真实场景下生成SVG的不足,并指出了改进方向。

Comments 10 pages, 6 pages of additional material

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04373 2026-02-24 cs.AI

JEF-Hinter: Leveraging Offline Knowledge for Improving Web Agents Adaptation

利用离线知识提升网络代理适应性的JEF-Hinter

Hadi Nekoei, Aman Jaiswal, Patrice Bechard, Oleh Shliazhko, Orlando Marquez Ayala, Mathieu Reymond, Massimo Caccia, Alexandre Drouin, Sarath Chandar, Alexandre Lacoste

机构 * ServiceNow AI Research(ServiceNow AI研究机构) Chandar Research Lab(Chandar研究实验室) Mila -- Quebec AI Institute(魁北克人工智能研究院) Dalhousie University(达尔豪斯大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

AI总结 JEF-Hinter通过提炼离线轨迹生成上下文感知提示,提升网络代理在陌生领域的适应能力,实验显示其优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04103 2026-02-16 cs.AI cs.LG stat.ML

How to Train Your LLM Web Agent: A Statistical Diagnosis

如何训练你的LLM网络代理:一种统计诊断

Dheeraj Vattikonda, Santhoshi Ravichandran, Emiliano Penaloza, Hadi Nekoei, Megh Thakkar, Thibault Le Sellier de Chezelles, Nicolas Gontier, Miguel Muñoz-Mármol, Sahar Omidi Shayegan, Stefania Raimondo, Xue Liu, Alexandre Drouin, Laurent Charlin, Alexandre Piché, Alexandre Lacoste, Massimo Caccia

机构 * ServiceNow AI Research(ServiceNow人工智能研究) Mila-Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

AI总结 本文提出一种基于统计的计算分配方法,通过结合监督微调与基于策略的强化学习,有效提升LLM网络代理性能,减少计算成本,缩小与闭源模型的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07971 2026-02-16 cs.IR cs.AI cs.LG

Hierarchical Retrieval at Scale: Bridging Transparency and Efficiency

大规模层次检索:在透明性和效率之间架桥

Shubham Gupta, Zichao Li, Tianyi Chen, Cem Subakan, Siva Reddy, Perouz Taslakian, Valentina Zantedeschi

机构 * ServiceNow Research McGill University Mila -- Qu\'ebec Artificial Intelligence Institute

AI总结 Retreever通过优化树结构实现大规模高效层次检索,兼顾透明性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04301 2026-02-09 cs.LG cs.CL

Quantifying the Effect of Test Set Contamination on Generative Evaluations

量化测试集污染对生成评估的影响

Rylan Schaeffer, Joshua Kazdan, Baber Abbasi, Ken Ziyu Liu, Brando Miranda, Ahmed Ahmed, Fazl Berez, Abhay Puri, Stella Biderman, Niloofar Mireshghallah, Sanmi Koyejo

机构 * University of Oxford(牛津大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究通过语言模型生命周期量化测试集污染对生成评估的影响,发现污染可降低模型损失,进一步训练和采样温度调节影响记忆效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15658 2026-02-03 cs.CV cs.AI

GEO-Bench-2: From Performance to Capability, Rethinking Evaluation in Geospatial AI

GEO-Bench-2:从性能到能力,重新思考地理空间AI的评估

Naomi Simumba, Nils Lehmann, Paolo Fraccaro, Hamed Alemohammad, Geeth De Mel, Salman Khan, Manil Maskey, Nicolas Longepe, Xiao Xiang Zhu, Hannah Kerner, Juan Bernabe-Moreno, Alexandre Lacoste

机构 * IBM Research Europe(IBM欧洲研究院) Technical University Munich(慕尼黑技术大学) Clark University(克拉克大学) MBZUAI NASA Impact(NASA影响计划) ESA Φ \Phi -lab(欧洲航天局Φ实验室) Arizona State University(亚利桑那州立大学) ServiceNow AI Research(ServiceNow人工智能研究)

AI总结 GEO-Bench-2通过引入能力组和灵活的评估协议,重新评估地理空间AI模型,揭示任务需求和数据模态对模型选择的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06341 2026-01-13 cs.LG cs.AI cs.SE

Evaluating Robustness of Large Language Models in Enterprise Applications: Benchmarks for Perturbation Consistency Across Formats and Languages

评估大型语言模型在企业应用中的鲁棒性:跨格式和语言的扰动一致性基准测试

Tara Bogavelli, Oluwanifemi Bamgbose, Gabrielle Gauthier Melançon, Fanny Riols, Roshnee Sharma

机构 * ServiceNow

AI总结 本研究提出跨格式和语言的扰动一致性基准测试,评估大型语言模型在企业应用中的鲁棒性,发现模型大小与鲁棒性关系复杂,8B参数模型表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10769 2026-01-07 cs.AI cs.CL cs.MA

AgentArch: A Comprehensive Benchmark to Evaluate Agent Architectures in Enterprise

AgentArch: 一种全面的基准,用于评估企业中的代理架构

Tara Bogavelli, Roshnee Sharma, Hari Subramani

机构 * ServiceNow

AI总结 AgentArch提出一个企业特定的基准,评估代理架构在复杂任务中的性能,揭示模型特定的架构偏好及性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06065 2026-01-06 cs.LG cs.AI

Posets and Bounded Probabilities for Discovering Order-inducing Features in Event Knowledge Graphs

偏序集与有界概率用于事件知识图谱中诱导顺序的特征发现

Christoffer Olling Back, Jakob Grue Simonsen

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) ServiceNow Denmark Aps(ServiceNow丹麦公司) IT University of Copenhagen(哥本哈根信息技术大学)

AI总结 本文提出基于概率框架的EKG发现算法,通过统计推断自动从未经整理数据中发现事件顺序特征。

Comments 2-column IEEE format

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08697 2025-12-19 cs.SE cs.AI cs.CL

BigCodeArena: Unveiling More Reliable Human Preferences in Code Generation via Execution

BigCodeArena: 通过执行揭示更多可靠的代码生成人类偏好

Terry Yue Zhuo, Xiaolong Jin, Hange Liu, Juyong Jiang, Tianyang Liu, Chen Gong, Bhupesh Bishnoi, Vaisakhi Mishra, Marek Suppa, Noah Ziems, Saiteja Utpala, Ming Xu, Guangyu Song, Kaixin Li, Yuhan Cao, Bo Liu, Zheng Liu, Sabina Abdurakhmanova, Wenhao Yu, Mengzhao Jia, Jihan Yao, Kenneth Hamilton, Kumar Shridhar, Minh Chien Vu, Dingmin Wang, Jiawei Liu, Zijian Wang, Qian Liu, Binyuan Hui, Meg Risdal, Ahsen Khaliq, Atin Sood, Zhenchang Xing, Wasi Uddin Ahmad, John Grundy, David Lo, Banghua Zhu, Xiaoning Du, Torsten Scholak, Leandro von Werra

机构 * Monash University(墨尔本大学) CSIRO’s Data61(CSIRO的数据61) Purdue University(普渡大学) Independent(独立) HKUST (Guangzhou)(香港科技大学(广州)) UCSD(加州大学圣地亚哥分校) UVA(弗吉尼亚大学) CNRS, France(法国国家科学研究中心) IBM Cisco(思科) Comenius University in Bratislava(布拉提斯拉瓦康门纽斯大学) University of Notre Dame(Notre Dame大学) Uber Tano Labs(Tano实验室) NUS(国立大学新加坡) Institute of Automation, CAS(中国科学院自动化研究所) Tencent AI Lab(腾讯AI实验室) University of Washington(华盛顿大学) Nevsky Collective(Nevsky集体) ETH Zurich(苏黎世联邦理工学院) Detomo Inc(Detomo公司) University of Oxford(牛津大学) UIUC(伊利诺伊大学香槟分校) Google(谷歌) NVIDIA Singapore Management University(新加坡管理学院) ServiceNow Research(ServiceNow研究) Hugging Face

AI总结 BigCodeArena通过执行揭示更多可靠的代码生成人类偏好,提出自动评分基准评估LLM编码质量。

Comments Built with love by the BigCode community :)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14079 2025-12-17 cs.AI cs.CL cs.MA

Grammar Search for Multi-Agent Systems

多智能体系统的语法搜索

Mayank Singh, Vikas Yadav, Shiva Krishna Reddy Malay, Shravan Nayak, Sai Rajeswar, Sathwik Tejaswi Madhusudhan, Eduardo Blanco

机构 * University of Arizona(亚利桑那大学) ServiceNow(ServiceNow公司) Mila - Quebec AI Institute(魁北克AI研究院)

AI总结 本研究提出了一种结构化框架,通过固定组件生成多智能体系统,在数学和问答领域优于现有方法,且更经济高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15432 2025-12-12 cs.AI cs.CL cs.LG

SyGra: A Unified Graph-Based Framework for Scalable Generation, Quality Tagging, and Management of Synthetic Data

SyGra:一种统一的基于图的框架,用于可扩展的生成、质量标记和管理合成数据

Bidyapati Pradhan, Surajit Dasgupta, Amit Kumar Saha, Omkar Anustoop, Sriram Puttagunta, Vipul Mittal, Gopal Sarda

机构 * ServiceNow Inc.(ServiceNow公司)

AI总结 SyGra提出一种统一的基于图的框架,用于可扩展生成、质量标记和管理合成数据,通过模块化管道和双阶段质量标记机制提升合成对话数据的质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏