arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1095 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1095 篇

2607.18063 2026-07-21 cs.CR cs.AI cs.LG 新提交 76%

Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security

自适应对手:用于大语言模型智能体安全的多轮、多大语言模型基准测试

Devina Jain, David Hartmann, Chuan Li

机构 * Lambda

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 该研究提出针对无记忆大语言模型防御者的自适应多轮攻击的21场景基准测试,通过观察防御者响应灵活调整攻击。介绍了不同攻击轮次成功率,汇集多个前沿攻击者大语言模型的情况,还指出不同防御者弱点差异及场景排名不一致性,并发布了相关基准测试及数据集。

Comments Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07859 2026-07-10 cs.AI cs.HC cs.LG 新提交 76%

Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning

反馈操纵正则化:实现用于模仿学习的离线智能体对齐

Benjamin Poole, Minwoo Lee

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02615 2026-07-10 cs.CR cs.AI cs.SE 新提交 76%

TAG: A Lightweight Framework for Test-Driven Agentic Artifact Generation

代理创建,我们验证:用于代理工件生成的轻量级框架

Yaniv Melamed, Yoni Zukerman, Michal Shechter, Miri Weissler, Ashwin Patil, Hani Neuvirth-Telem

机构 * Microsoft(微软)

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.SE

AI总结 研究如何用大语言模型生成结构化工件并使其可靠用于生产部署。核心方法是基于“LLMs生成,我们验证”原则构建轻量级框架,贡献是提出含三关键属性的框架并在安全领域验证,还可用于其他工件生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05458 2026-07-08 cs.LG cs.AI 新提交 76%

Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning

利用离线强化学习学习控制大语言模型智能体的执行框架

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 研究提出将大语言模型智能体的执行框架视为可学习控制层,通过有限 horizon 的框架马尔可夫决策过程,利用离线强化学习训练轻量级控制器,在多领域实验中改进验证行为、提高任务质量,证明框架控制可学习且离线支持有局限。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26294 2026-06-26 cs.LG cs.AI cs.MA cs.NE 新提交 76%

The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators

红皇后哥德尔机:共同进化的智能体及其评估者

Alex Iacob, Andrej Jovanović, William F. Shen, Daniel Burkhardt, Meghdad Kurmanji, Nurbek Tastan, Lorenzo Sani, Niccolò Alberto Elia Venanzi, Ambroise Odonnat, Zeyu Cao, Bill Marino, Xinchi Qiu, Nicholas D. Lane

专题命中 Agent评测 :agent(abstract,comments);agentic(abstract);分类 cs.AI、cs.LG;multi-agent(comments)

AI总结 提出红皇后哥德尔机(RQGM),一种在非平稳效用下实现递归自我改进的进化框架,通过受控效用演化在编码、论文写作和证明任务上超越现有自我改进智能体。

Comments 13 pages main text + 21 pages appendix (38 pages total, incl. references); 11 figures (7 main text + 4 appendix); 10 tables (2 main text + 8 appendix). Preliminary preprint; work in progress. Keywords: self-improving agents, learned evaluation, multi-agent systems, auto-mated scientific discovery, controlled utility evolution, co-evolutionary search, autoresearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12246 2026-08-13 cs.CR cs.AI cs.CL cs.SE 新提交 75%

VICBench: A Multi-Language Benchmark for Code Vulnerability Detection

VICBench:一个用于代码漏洞检测的多语言基准测试集

Jin Lu, Xuening Han, Yang Zhong, Lin Tan, Kevin Luo, Andrew Gacek, Neha Rungta

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本研究构建了多语言代码漏洞检测基准VICBench,包含100个CVE对应的VIC,规模显著大于现有数据集,经评估现有漏洞检测算法性能有限,该基准可用于可靠评估漏洞检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06301 2026-08-07 cs.AI cs.CL cs.LG 新提交 75%

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

HarnessOpt-Bench:评估大型语言模型的 harness 优化能力

Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue

机构 * Scale AI

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究提出HarnessOpt-Bench基准,评估前沿LLM在高成本随机评估下的端到端harness优化能力,发现优化器模型差异大于编码harness、原生harness非始终更优,该能力具可测性与提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17136 2026-07-21 cs.SE cs.AI cs.HC cs.LG 新提交 75%

Teach it to stop, not just to click

教它停止,而不仅仅是点击

Barada Sahu, Shivesh Pandey

机构 * Cabal AI Para AI

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究智能体计算机使用强化学习中单次运行结果的误导性,通过验证器引导修复35B智能体,发现成功率受上游方差主导,修复能力分两层,框架级修复有条件,还发现自身过度断言,发布库用于k种子报告,首次进行多模态分段聚合策略内自蒸馏更新。

Comments 15 pages, 3 figures. Reliability protocol and library (cua_reliability), completion verifier, and leakage-free held-out plus bootstrap evaluation harness are open-source

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13396 2026-07-16 cs.AI cs.CL cs.SE 新提交 75%

Set-shifting Behavioral Test for Harnessed Agents

用于受约束智能体的集合转移行为测试

Ziwei Ye

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究当可靠工具在会话中悄然改变时语言模型智能体的工具选择,借鉴认知心理学的集合转移构建基准和评估框架,计算集合转移准确率,测试发现不同失败模式及集合框架对路由动态有影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07534 2026-07-09 cs.CV 新提交 75%

Infinite Worlds with Versatile Interactions

具有通用交互的无限世界

Zelin Gao, Qiuyu Wang, Jiapeng Zhu, Jingye Chen, Zichen Liu, Qingyan Bai, Jiahao Wang, Yufeng Yuan, Hanlin Wang, Yichong Lu, Ka Leong Cheng, Haojie Zhang, Jian Gao, Tianrui Feng, Yuzheng Liu, Yao Yao, Yinghao Xu, Xing Zhu, Yujun Shen, Hao Ouyang

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract)

AI总结 介绍LingBot-World 2.0的升级,包括通过因果预训练实现无界交互、提炼实时变体保证快速响应,引入多样交互元素,集成智能控制并开发共享界面,还将主模型与轻量级模型配对便于单GPU部署。

Comments Project page: https://technology.robbyant.com/lingbot-world-v2 Code: https://github.com/robbyant/lingbot-world-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02469 2026-07-03 cs.SE cs.AI cs.CL 新提交 75%

TestEvo-Bench: An Executable and Live Benchmark for Test and Code Co-Evolution

TestEvo-Bench:一个可执行且动态的测试与代码协同演化基准

Jiale Amber Wang, Kaiyuan Wang, Pengyu Nie

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 提出TestEvo-Bench基准,包含测试生成和更新两类任务,基于真实提交历史并支持执行指标,评估自动化代理在代码变更后同步调整测试的能力。

Comments TestEvo-Bench leaderboard and data explorer are hosted at https://www.testevo-bench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00920 2026-07-03 cs.CV 新提交 75%

GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images

GMO-E$^2$DIT:面向电商图像的接地多操作编辑

Zipeng Guo, Xiaoan Liu, Lichen Ma, Cheng Wang, Yu He, Xiaolong Fu, Jingling Fu, Xinyuan Shan, Shaojie Guo, Luohang Liu, Junshi Huang, Yan Li

机构 * Wuhan University(武汉大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract)

AI总结 提出GMO-E$^2$DIT框架,通过VLM代理构建区域接地编辑议程,结合掩码条件图像编辑器和反思循环,实现多操作、可审计的电商图像编辑,在指令准确性和编辑保真度上超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20002 2026-06-19 cs.LG cs.AI cs.CL 新提交 75%

Connect the Dots: Training LLMs for Long-Lifecycle Agents with Cross-Domain Generalization Via Reinforcement Learning

Connect the Dots:通过强化学习训练具备跨域泛化能力的长期生命周期智能体

Yanxi Chen, Weijie Shi, Yuexiang Xie, Boyi Hu, Yaliang Li, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出Connect the Dots框架,通过端到端强化学习训练LLM在长期任务中自我更新上下文并泛化到新领域,实验验证了跨域泛化能力。

Comments Work in progress; we will continuously update the codebase and arXiv version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17164 2026-06-17 cs.CL cs.AI cs.HC cs.PL cs.SE 新提交 75%

PromptMN: Pseudo Prompting Language

PromptMN: 伪提示语言

Enkhzol Dovdon

机构 * ICT Group(ICT集团)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出PromptMN,一种伪提示领域特定语言,通过紧凑的%前缀类型指令注释自然语言,减少上下文歧义,提升人机交互的清晰度和可审查性。

Comments 32 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12880 2026-08-14 cs.CR cs.AI 新提交 74%

Labels Are Not Endpoints: Treatment Leakage and Construct Validity in MCP Agent Security Evaluation

标签并非终点:MCP智能体安全评估中的处理泄露与构念效度

Rana Muhammad Ahmed, Sabahat Abbas

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本研究针对MCP智能体安全评估中标签与行为事实的偏差问题,通过审计留存评估活动发现处理泄露现象,提出七环节完整性链及端点完整性检查器,完成活动受限的测量审计。

Comments 24 pages, 10 figures, 4 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12814 2026-08-14 cs.CL 新提交 74%

FastThaiG2P: Lightning-fast Thai Grapheme-to-phoneme Conversion for Voice Agent Pipelines

FastThaiG2P:面向语音智能体流水线的极速泰语字素转音素转换工具

Charin Polpanumas

机构 * AWS(亚马逊云科技)

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 FastThaiG2P是一款极速泰语字素转音素转换工具,采用PyThaiNLP分词字典与归一化规则,亚毫秒级延迟,可支撑泰语TTS开发,经其处理的数据集训练出的StyleTTS 2模型合成语音清晰,实时率达0.25。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05778 2026-08-07 cs.AI 新提交 74%

When Do Prompt-Side Agent Playbooks Transfer? Accuracy, Cost, and Runtime Shift in Agent Deployment

提示侧智能体剧本何时可迁移?智能体部署中的准确性、成本与运行时偏移

Weihong Lin, Lin Sun, Xiangzheng Zhang

机构 * Beijing Qiyuan Technology Co., Ltd.(北京奇源科技有限公司)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 该研究在蒸馏-验证-迁移协议下探究提示侧智能体剧本的可迁移性,在ALFWorld、TAU2-Bench、XBench-DeepSearch等基准上测试发现其为有条件的冷启动选项,需目标侧验证相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03154 2026-08-05 cs.CL 新提交 74%

ANCHOR-RE: An Agentic Neuro-Symbolic Framework for Grounded Biomedical Relation Extraction

ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架

Shufan Ming, Yikun Han, Gibong Hong, Rui Zhang, Halil Kilicoglu

专题命中 Agent评测 :agentic(title);分类 cs.CL

AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。

Comments Submitted to Journal of Biomedical Informatics (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28317 2026-07-31 cs.AI 新提交 74%

One Human, $N$ Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence

一个人类,N个智能体:校准不当且相关置信度下LLM智能体集群的审计预算分配

Cesare Zavattari, Alessandro Tommasi, Giuseppe Prencipe

机构 * Università di Pisa(比萨大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 针对单人类需在有限审计预算下审计N个LLM智能体的问题,研究了置信度校准不当且存在相关性时的审计预算分配,发现校准阈值的变化规律,验证了部分大语言模型置信度的实用性,给出了无效监督的定量准则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22164 2026-06-23 cs.LG 新提交 74%

Drowning in Routine: Signal Dilution in Multi-Turn Agent Training

淹没在例行公事中:多轮智能体训练中的信号稀释

Yann Pernot, Vi Retault

机构 * Mila - Qu\'ebec AI Institute

专题命中 Agent评测 :agent(title);分类 cs.LG

AI总结 本文提出决策密度ρ的概念,揭示多轮智能体训练中例行轮次导致信号稀释,并推导出轨迹级信噪比与ρ^{-1/2}成比例,实验验证了该缩放关系。

Comments Accepted at the FAGEN Workshop at ICML 2026, Seoul, South Korea. 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14715 2026-06-16 cs.MA cs.AI cs.SI 新提交 74%

MiroBench: Benchmarking Realism in Agentic Simulation of Real-world Discussions

MiroBench:真实世界讨论的智能体模拟真实性基准测试

Yaoning Yu, Ye Yu, Haojing Luo, Haohan Wang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Starc.Institute(Starc研究院)

专题命中 Agent评测 :agentic(title);分类 cs.AI

AI总结 提出MiroBench基准,基于4292条真实Reddit帖子,通过统计测试评估LLM智能体模拟在重复性、叙事内容、毒性攻击和结构复杂度四个方面的分布匹配度,发现当前模拟器与真实讨论存在分布差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13926 2026-08-17 cs.AI cs.CL cs.DB 新提交 73%

Never the Number: Structural Abstention for AI Systems Whose Answers Are Consumed as Fact

绝非数字:将答案作为事实使用的AI系统的结构弃权

Zhelun (Allen)Wu

机构 * Apple Inc.(苹果公司)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 针对LLM文本转SQL系统返回错误答案且无法区分的问题,提出带生成式外壳的可信内核架构,即结构弃权,在生产案例中验证其可靠性优于两种生成式替代方案。

Comments 26 pages, 5 figures, 5 tables. Technical report. Describes architecture and design principles only; contains no code, schemas, datasets, or performance metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12593 2026-08-14 cs.AI cs.LG 新提交 73%

DiG-bench: Discovery in Games

DiG-bench:游戏中的发现

Ruairidh M. Battleday, Kai Sandbrink, Jimi Cullen-Drohan, Zihan Yan, Timothy Muller, Clare Maguire, Ales Kubicek, Fraser Greenlee-Scott, Sukrit Sumant, Tri Dao, Jürgen Schmidhuber, Michal Valko, Joshua Tenenbaum, Thomas L. Griffiths, Zeb Kurth-Nelson, James C. R. Whittington

专题命中 Agent评测 :AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本研究发布DiG-bench基准,含70个需智能体通过交互实验发现规则的游戏,设7个难度级,部分公开部分私有,用于评估智能体在目标未知环境中发现新知识的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11246 2026-08-13 cs.AI cs.LG cs.RO 新提交 73%

Towards the Harness of Embodied Agents

迈向具身智能体的管控

Qi Wang, Tianyi Wang, Chengyang Li, Shikun Ban, Yurun Chen, Yizhong Ge, Jason Qin, Chengtai Li, Wentao Zhu

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出名为Thea的具身智能体管控系统,通过场景图和退出码评估弥合物理世界与智能体的差距,实现长程任务完成。

Comments Project page: https://eit-hai.github.io/thea

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10716 2026-08-12 cs.SD cs.AI cs.CL 新提交 73%

DuplexWorld: Can voice agents help you get through the day?

DuplexWorld:语音智能体能帮你度过一天吗?

Aryan Vijay Bhosale, Harshit Rajgarhia, Akhil Pothanapalli, Asif Shaik, Abhishek Mukherji, Dinesh Manocha

机构 * Centific Global Solutions Inc.(森蒂菲克全球解决方案公司) University of Maryland(马里兰大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 DuplexWorld针对现有语音智能体评估基准的不足,构建含六大领域的156个场景开展评估,发现现有最优语音智能体在多维度仍有较大改进空间,并分析了相关性能与失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09819 2026-08-11 cs.LG cs.CL 新提交 73%

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

Macaron-V1:面向具备自我改进与LoRA混合能力的开放持续学习

Mind Lab, :, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao, Amelia Chen, Andrew Chen, Kaijie Chen, Cleon Cheng, Steven Chiang, Kaixuan Fan, Hera Feng, Huan Feng, Arthur Fu, Jun Gao, Pyke Han, Nolan Ho, Ori Hong, Hailee Hou, Piers Hua, Charles Huang, Miles Jiang, Nora Jiang, Yuyi Jiang, Qiuyu Jin, Fancy Kong, Kuss Koo, Jaron Lee, Andrew Lei, Alexy Li, Dawn Li, Lucian Li, Ray Li, Ricardo Li, Smith Li, Theo Li, Allen Lin, Elliot Lin, Fan Lin, Chen Ling, Kairus Liu, Kieran Liu, Logan Liu, Neo Liu, Xiang Liu, Yuxin Lu, Maeve Luo, Pony Ma, Verity Niu, Cole Qiao, Guian Qiu, Vince Qu, Sentry, Niko Song, Vincent Wang, Bo Wu, Rio Yang, Evelyn Ye, Fiona Ye, Ina Ye, Regis Ye, Josh Ying, Atlas Zeng, Danney Zeng, Salmon Zhan, Anya Zhang, Di Zhang, Mia Zhang, Sueky Zhang, Wei Zhao, Ada Zhou, Adrian Zhou, Yuhua Zhou, Juno Zhu, Murphy Zhuang

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出Macaron-V1开放智能体模型家族,结合MoL架构与递归自我改进机制,经多基准评估验证其有效性,为开放持续学习提供新方案。

Comments 49 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09153 2026-08-11 cs.AI cs.LG 新提交 73%

TRACE: TRajectory Attribution for Automated Context Engineering

TRACE:用于自动化上下文工程的轨迹归因

Yikai Zhao, Pradeep Kumar Misra, Saurabh Pandey

机构 * Amazon(亚马逊公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 TRACE是利用历史智能体轨迹挖掘上下文故障的自动化反馈循环,可在上下文层诊断修复超80%的生产AI智能体故障,归因率72.7%、修复有效性82%。

Comments 21 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08239 2026-08-11 cs.LG cs.CL 新提交 73%

The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World

重放差距:大语言模型智能体中模型切换的静态评估评估的是错误的世界

Ashritha Gonuguntla

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现大语言模型智能体的模型切换静态评估基于错误假设,通过分支展开实验证明模型交换会导致轨迹分歧,重放评估无法准确预测结果,发布了相关工具与轨迹。

Comments 8 pages, 3 figures. Accepted at the Conference on Language Modeling 2026. Code: https://github.com/AshrithaG/replay-gap Data: https://huggingface.co/datasets/ashritha0907/replay-gap-trajectories

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03689 2026-08-05 cs.AI cs.SE 新提交 73%

LiveEvalBench: Toward Open-World Evaluation for Web Generation

LiveEvalBench:面向网页生成的开放世界评估

Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 LiveEvalBench是将网页生成评估转为智能体驱动的自适应可扩展过程的自动化框架,经实验验证其与人类专家判断高度一致,可提供前沿模型网页生成能力的细粒度洞察

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00005 2026-08-04 cs.CL cs.AI 新提交 73%

RubricReviewer: From Direct Critique to Objective and Comprehensive Rubric-Driven Peer Review

RubricReviewer:从直接批评到客观全面的基于评分规则的同行评审

Shuyu Guo, Wenxiang Hu, Yuyue Zhao, Yougang Lyu, Xiaohui Yan

机构 * Shandong University(山东大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL

AI总结 RubricReviewer是一种基于评分规则驱动的框架,通过将评分规则生成为中间步骤,并结合Scout与Aligner模型,生成更全面、具判别性且抗攻击的评审意见。

详情

展开后加载摘要…

URL PDF HTML 收藏