arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1095 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1095 篇

2607.17044 2026-07-21 cs.SE cs.AI 新提交 82%

Where Does Agent Reliability Come From? A Cross-Benchmark Decomposition of Verification Loops, Specialist Models, and Scaffolding in a Production Enterprise Agent

智能体可靠性源自何处?生产企业智能体中验证循环、专家模型和脚手架的跨基准分解

Arunabh Dastidar

机构 * Leni Inc.(Leni公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究多步骤企业智能体任务失败问题,以生产系统Leni为研究对象,其含验证循环等。通过在三个基准测试评估,发现完整系统有提升。核心贡献是分解提升来源,指出大部分来自脚手架等,验证步骤单独贡献小但作用关键,还得出相关矩阵和模型等结论。

Comments 19 pages, 5 figures, 5 tables. Evaluations conducted March-April 2026. Run-level evaluation record and audit scripts: https://github.com/arnabdastidar/leni-agent-evals

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15225 2026-06-16 cs.LG cs.AI cs.IR 新提交 82%

Edu-Theater: A Data-Efficient Agent Framework for Scalable Learner Behavior Simulation through Staging Roll-Call

Edu-Theater: 一种通过点名排演实现可扩展学习者行为模拟的数据高效智能体框架

Weibo Gao, Qi Liu, Linan Yue, Zheng Zhang, Yichao Du, Fangzhou Yao, Ao Yu, Zhenya Huang, Shijin Wang

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Southeast University(东南大学) Alibaba Group(阿里巴巴集团) iFLYTEK Co., Ltd.(科大讯飞股份有限公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Edu-Theater框架,通过构建群体水平能力先验和少量诊断查询,利用LLM智能体模拟学习者行为,在减少数据需求的同时提高模拟精度,并增强下游自适应测试等应用。

Comments LLM Agent, Educational Data Mining, Data Synthesis, Human Simulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09068 2026-08-11 cs.SE 新提交 81%

Pseudo2CodeQA: A Benchmark for LLM-Based Structured Algorithmic Reasoning in Code Generation

Pseudo2CodeQA:面向基于大语言模型的代码生成中结构化算法推理的基准测试

Shadikur Rahman, Umme Ayman Koana, Syed Muhammad Danish

专题命中 Agent评测 :agentic(summary_cn,abstract);分类 cs.SE

AI总结 本文提出Pseudo2Code基准测试及Pseudo2Code Agentic Framework,实验表明该框架性能优于现有基线,验证了结构化伪代码对代码生成的提升作用。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27084 2026-07-30 cs.CV cs.AI 新提交 81%

SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context

SciFigQual-Bench:面向全文本上下文的科学图片质量评估基准

Zihan Deng, Chuanzhi Xu, Huiqi Liang, Haoyang Li, Xiaozhen Zhong, Lequan Yu

专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI

AI总结 本文针对现有科学图片质量评估方法的不足,构建了SciFigQual-Bench基准,设计SFQ-Agent框架实现自动化评估,实验显示其在eval1200子集上表现优于主流方案。

Comments † Equal contribution. Affiliations: 1: The University of Hong Kong 2: The University of Sydney 3: University of Electronic Science and Technology of China Corresponding authors: Zihan Deng (zhdeng@hku.hk), Chuanzhi Xu (chuanzhi.xu@sydney.edu.au) Project page: https://frankdengai.github.io/SciFigQual-Bench Source code & dataset: https://github.com/FrankDengAI/SciFigQual-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20498 2026-07-24 cs.AI 新提交 81%

AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs

AISE-Bench:用于学术知识图谱信息检索的全周期精选基准测试

Fanjin Zhang, Zhengyang Wang, Ruixuan Huang, Kefan Zhang, Amy Xin, Yuanchun Wang, Shu Zhao, Evgeny Kharlamov, Jie Tang, Juanzi Li

机构 * Renmin University of China(中国人民大学) Anhui University(安徽大学) Z-Lab Z.ai Tsinghua University(清华大学) Bosch Center for AI(博世人工智能中心) University of Oslo(奥斯陆大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);planning(abstract);workflow(abstract)

AI总结 研究针对学术知识图谱信息检索基准测试不足的问题,引入AISE-Bench,通过定制工作流程和综合评估协议构建基准测试,为多步API使用的大语言模型智能体提供新测试平台,助力评估与改进。

Comments 9 pages, accepted by KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26), August 09-13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03015 2026-07-07 cs.AI 新提交 81%

Beyond Forecasting: The Belief-to-Trade Layer in Prediction-Market Agents

超越预测:预测市场代理中的信念到交易层

Yishu Wang, Yuxuan Wang, Jiaqi Deng, Hanyang Tang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI

AI总结 以预测未来事件为通用人工智能测试平台,提出Raven-Agent这一预测市场自主交易代理,在存档决策集的控制重放中表现出色。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11434 2026-08-13 cs.AI cs.CL cs.CV 新提交 81%

Benchmarking LLM Judges for Mobile Agent Evaluation

面向移动智能体评估的LLM评判基准测试

Ziqiang Wan, Li Gu, Zhixiang Chi, Zhi Liu, Seyed Mehdi Ayyoubzadeh, Yuanhao Yu, Yang Wang

机构 * Mila – Québec AI Institute(米拉-魁北克人工智能研究所) Concordia University(康考迪亚大学) University of Toronto(多伦多大学) Shanghai University(上海大学) McMaster University(麦克马斯特大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究推出MobileJudgeBench基准,评估6种LLM评判器方法在移动智能体轨迹上的可靠性,发现简单基线评判器具竞争力、基准质量指标可预测评判器效用,且不同LLM后端故障特征相反。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10875 2026-08-12 cs.CL cs.AI 新提交 81%

VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?

VibeLifeBench:你的生命智能体能在真实生活环境中保持主动与持续性吗?

Xiaohongshu Inc

机构 * Xiaohongshu Dots Studio(小红书Dots工作室) Evolvent AI(Evolvent AI公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出VibeLifeBench基准,评估7个前沿LLM智能体在200项长周期日常生活任务中的表现,发现其主动与持续性不足,将开源相关任务、环境与评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10216 2026-08-12 cs.CL cs.AI 新提交 81%

Similarity Gates Approve Reversals: A Validity Audit of Embedding-Cosine Thresholds in Agent Systems

相似度门控认可反转:智能体系统中嵌入余弦阈值的有效性审计

Scott E. Frias

机构 * Eigenforma(艾根福马) Freemind Labs(自由思维实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究审计智能体系统中嵌入余弦阈值门控的有效性,发现其无法区分指令反转与释义、性能差且易受混杂因素影响,多数修复措施失效,仅部分配置可区分反转与释义。

Comments 11 pages, 2 figures. Artifact: https://github.com/eigenforma/polaritycheck (DOI: 10.5281/zenodo.21796531)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09254 2026-08-11 cs.AI cs.CL 新提交 81%

Business Truth, not SQL Accuracy: A Rule-Gated 7B Analytics Agent Outperforms a Direct-Prompted 32B Baseline

业务真值,而非SQL准确率:规则门控的7B分析智能体优于直接提示的32B基线

Morris Lee

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究针对LLM分析智能体的评估缺陷,提出WarehouseReliabilityBench基准,开发规则门控的7B智能体QueryProof,其业务真值率优于直接提示的32B基线,且成本显著降低,假成功比例大幅下降。

Comments 20 pages, 7 figures, 11 tables. Benchmark, code, run records, pre-registration and one-command reproduction: https://github.com/k-w-lee/query_proof

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07639 2026-08-11 cs.LG cs.AI 新提交 81%

SkillConsist: Detecting Inconsistencies in Agent Skills via Bidirectional Graph Alignment

SkillConsist:通过双向图对齐检测智能体技能中的不一致性

Chaofan Meng, Yuhang Zheng, Yingnan Zhou, Sihan Xu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 SkillConsist针对智能体技能不一致检测的挑战,通过双向图对齐等技术构建基准并取得优于基线的检测性能,提升了技能一致性检测效果。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07449 2026-08-10 cs.AI cs.CL 新提交 81%

SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent

SkillProx:基于近端文本梯度下降的自进化智能体技能

Mingxuan Zheng, Yujin Zhou, Chuxue Cao, Boqin Yin, Yuyao Zhang, Jiapeng Sun, Shuaishuai Gong, Sirui Han, Yike Guo

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 SkillProx是结合闭环诊断进化与近端优化的自进化智能体技能框架,可提升LLM智能体在分布内外基准的平均准确率3.0个百分点,且两种核心组件具有互补效果。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07371 2026-08-10 cs.LG cs.CL 新提交 81%

Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning

面向智能体强化学习的轨迹相对事后蒸馏

Haoyu Zheng, Yun Zhu, Qing Wang, Wenqiao Zhang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Tencent(腾讯)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL、cs.LG

AI总结 针对智能体强化学习中事后信号分配不清的问题,提出TRIAL框架,通过轨迹相对步分配优化监督信号,在WebShop、ALFWorld等任务上优于GRPO及多数基线方法,提升了任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06477 2026-08-10 cs.CR cs.AI cs.CL 新提交 81%

StepJack: Benchmarking Computer-Use Agent Safety Against Multi-Step Indirect Prompt Injection

StepJack:针对多步骤间接提示注入的计算机使用智能体安全基准测试

Zhuoxin Zhan, Akbar Rafiey, Avery Ma, Leila Pishdad, Layla El Asri

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出多步骤间接提示注入新型攻击,构建含480个测试样例的StepJack基准,评估六款先进CUAs,发现多步骤攻击可提升部分CUAs的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06027 2026-08-07 cs.CL cs.AI cs.HC 新提交 81%

FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India

FormBharo:为印度农村设计和评估用于对话式表单填写的语音助手

Aman Dalmia, Sanskriti Midha, Jigar Doshi

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究针对印度农村无法读写的人群开发了语音助手FormBharo,结合LLMs与规则控制完成表单填写,发布了相关基准数据集,通过端到端评估确定最优模型配置以平衡准确性、成本与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05604 2026-08-07 cs.CL cs.AI 新提交 81%

SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries

SkillZip:用于可扩展智能体技能库的保留契约的图压缩方法

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang

机构 * UNSW(新南威尔士大学) CSIRO(联邦科学与工业研究组织)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 SkillZip是一种执行感知的过程抽象框架,通过对节级图进行保留契约的压缩,解决了智能体技能库的可扩展问题,在基准测试中优于基线,实现了高压缩率和稳健检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05151 2026-08-07 cs.CL cs.AI 新提交 81%

Simulator-Grounded Large Language Models for Industrial Causal Reasoning: Tool-Use, Structured Injection, and Plant-Portable Retrieval for Wastewater Treatment Decision Support

面向工业因果推理的模拟器驱动大语言模型:用于污水处理决策支持的工具使用、结构化注入及工厂可迁移检索

Gary Simethy, Daniel Ortiz Arroyo, Petar Durdevic

机构 * Aalborg University(奥尔堡大学)

专题命中 Agent评测 :tool-use(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究对比三种适配Qwen2.5-32B-Instruct模型的方法,在污水处理因果问答任务中,DRR检索器兼具高准确率、跨工厂迁移能力及训练高效性,优于其他方法与基线。

Comments 20 pages, 2 figures, 8 tables. Preprint submitted to Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04192 2026-08-06 cs.CR cs.AI cs.CL 新提交 81%

Behavioral Skill Reconstruction: Reconstructing Hidden Functionality from LLM Agent Skills

行为技能重构:从大语言模型智能体技能中重构隐藏功能

Peichun Hua, Haoxuan Xu, Mengyuan Li

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出SkillClone黑盒攻击方法,可通过合法交互从隐藏的LLM智能体技能中重构其功能,表明仅文件保密无法确保功能保密。

Comments 20 pages, 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04077 2026-08-06 cs.AI cs.CL 新提交 81%

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

FinProBench:基于专业交付物衍生的角色基准评估金融AI智能体

Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究推出FinProBench金融AI智能体基准及RGRC角色基准构建流程,实验显示RGRC在角色专业化角色评估上优于仅提示方法,角色级复用基准可大幅减少工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03910 2026-08-05 cs.AI cs.LG cs.MA 新提交 81%

Socially Grounded Agentic AI: Coordinating Plural Perspectives through Social Theory

基于社会基础的智能体人工智能:通过社会理论协调多元视角

Matt Ratto, Abhishek Moturu, Daniel Silver

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出将社会理论用于人工智能系统设计,以解决多元对齐问题,将多元对齐重新定位为基于社会基础的协调问题,勾勒了相关系统的设计空间并指明未来研究方向。

Comments Pluralistic Alignment Workshop @ ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01918 2026-08-04 cs.LG cs.CL 新提交 81%

HarnessCompass: Guiding Automatic Harness Evolution toward Generalizable and Effective Agent Harnesses

HarnessCompass:引导自动 harness 进化以生成可泛化且有效的智能体 harness

Luan Zhang, Ruochen Zhou, Dandan Song, Zhengyu Chen, Yuhang Tian, Jun Yang, Huipeng Ma, Chenhao Li, Guangyuan Feng, Xudong Li, Yizhou Jin, Yan Xu

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 HarnessCompass 是一种自动 harness 进化框架,通过约束进化、主动反馈和组件式优化,在 SWE-bench Verified 上用 GPT-5.4 使 Pass@1 提升至 66%,且泛化能力优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00355 2026-08-04 cs.CL cs.LG 新提交 81%

CurveShift: Is Agent Progress Scalar? Separating Level from Shape

CurveShift:智能体的进展是标量吗?区分水平与形态

Hanwen Xing, Pengyun Wang, BingXu Meng, Kumail Alhamoud, Xiang Li, Jicheng Wang, Xin Yu, Xinyang Han, Xiaomin Li, Philip Torr, Yuexing Hao

机构 * University of Southern California(南加利福尼亚大学) University of Chicago(芝加哥大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) University of California, Davis(加利福尼亚大学戴维斯分校) Pennsylvania State University(宾夕法尼亚州立大学) Harvard University(哈佛大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对大型语言模型进展的标量总结问题,通过LiveCodeBench基准分离混淆,发现2024年9月后发布的模型在竞赛编程难任务上有超出预期的增益,发布了相关数据集与代码。

Comments 25 pages, 4 figures, 7 tables. Data and code: https://github.com/harvenstar/CurveShift

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27595 2026-07-31 cs.CL cs.AI cs.DL 新提交 81%

Beyond Similarity: Grounded Agentic Extraction and Expert-Adjudicated Evaluation of Intertextuality in Classical Chinese Histories

超越相似性:中国古典史书互文性的智能体式提取与专家裁决评估

Zhaoji Wang, Wanyu Si, Jun Wang

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本研究将细粒度互文性提取设为LLM智能体任务,构建专家裁决的古典史书互文基准,验证12种LLM性能,扩展至二十四史揭示引文的总体稳定与个案漂移规律并发布相关资源。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24889 2026-07-29 cs.LG cs.AI cs.CE 新提交 81%

GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

GAUGE:在没有标准答案的情况下对代理构建的金融模型进行评分

Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) University of Adelaide(阿德莱德大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Peking University(北京大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对金融模型无标准答案的问题,引入GAUGE基准,依据分析师实际做法评估代理构建的估值模型,通过多种方式验证,揭示高级、初级分析师及学生在模型评分上的差异,指出当前代理在模型构建与估值判断上的强弱情况,并发布相关资源。

Comments 35 pages, including appendices. Code, benchmark materials, and evaluation artifacts will be publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23124 2026-07-28 cs.AI cs.CL 新提交 81%

AgentOmnia: Scaling Agentic Models for Full-Scenario Applications

AgentOmnia:用于全场景应用的规模化智能体模型

Hao Jiang, Gangtao Xin, Yingdi Huang, Guojie Zhu, Jiangshan Zhang, Xinyuan Lin, Yunkun Xu, Chengyu Shen, Wenlong Fei, Jiawei Li, Yujie Fu, Sichen Kang, Tingyu Xie, Yedi Hu, Jingren Zhang, Hongcheng Gao, Jianshu Zeng, Chong Chen, Chang Guo, Chao Feng, Feng Wang, Fulin Lin, Jinchao Ma, Lang Mei, Li Huang, Liyan Liu, Qing He, Shuting Tao, Siyu Mo, Xiangnan Chen, Xiaohan Yu, Xiaoyang Li, Yanheng Hou, Yanyu Wu, Zhihan Yang, Wentao Zhang, Yang Gao, Zhao Cao

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 研究大型语言模型智能体全场景扩展问题,提出AgentOmnia框架,结合多种技术构建环境、工具和任务,通过多种方式支持训练后处理,能将多个基准测试通过率和宏平均率大幅提高,实现广泛改进并为自我进化提供证据。

Comments 69 pages, 18 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20911 2026-07-24 cs.CL cs.SE 新提交 81%

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

腾讯工作伙伴基准测试:一个具有抗污染任务构建的多领域编码智能体基准测试

Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen, Xiang Fei, Yong Mao, Zihan Xu, Zhiheng Lyu, Zhijian Shao, Yuchen Shi, Shuwen Zhang, Chaofan Qiu, Linjie Che, Xiaoxi Zhao, Feng Wu, Kai Zhang, Chaofan Zhu, Yubin Qi, Xiaoyun Liang, Peijie Dong, Yunhao Zhang, Yuanjie Zhu, Ling Jiang, Xianjun Zhang, Zhehang Chu, Anyuan Sang, Zhen Feng, Sen Nie, Shi Wu, Yuanzhen Xu, Xin Li, Ning Yang, Zhiqiang Dong, Hande Dong, Qiang Lin, Yi Liu, Yunsheng Wu, Ke Li, Xing Sun

机构 * Tencent(腾讯) Youtu Lab(腾讯优图实验室) Keen Security Lab(腾讯安全科恩实验室) Workbuddy(腾讯工作伙伴) Yunding Security Lab(腾讯云鼎实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.SE

AI总结 介绍腾讯工作伙伴基准测试这一多领域编码智能体评估套件,核心是统一评估框架,任务经反向设计防污染,数据集公开,四个子集探测工作不同方面,以统一格式和协议运行,还给出跨模型排行榜。

Comments 30 pages, 9 figures. Project page: https://workbuddybench.com/ ; code: https://github.com/Tencent/workbuddy-bench ; dataset: https://huggingface.co/datasets/tencent/workbuddy-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19266 2026-07-22 cs.LG cs.AI 新提交 81%

Toward Auditable Fraud Detection: Combining Graph Features, Model Explanations, and Agentic Case Investigation

迈向可审计的欺诈检测:结合图特征、模型解释和智能案例调查

Rahil Sharma

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究欺诈检测系统,通过分层管道结合多种方法,包括梯度提升分类器等。在PaySim数据集上实验,各组件在特定条件下起作用,如校正后图特征等未提升全测试集平均精度,但在部分子集有作用,调查代理表现不佳,还标记了其错误。

Comments 14 pages, 3 figures. Code available at https://github.com/rahil1303/auditable-fraud-investigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18566 2026-07-22 cs.CL cs.AI 新提交 81%

The Story Shapes the Agent: Narrative Priors in LLM Behavior

故事塑造智能体:大语言模型行为中的叙事先验

Yixuan Wang, James Lester, Shashank Srivastava

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究探索大语言模型行为中叙事框架的影响,通过构建游戏识别叙事先验,发现其解释行为方差能力强且与任务成功相关,还明确跨叙事角色效应源于行为锚点,框架可推广并产生改进跨叙事转移的角色选择方法。

Comments Accepted at COLM 2026. 10 pages, 3 figures, 16 tables in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16204 2026-07-21 cs.AI cs.LG 新提交 81%

Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL

掩码扩散语言模型是用于智能体强化学习的强大且可控的基于文本的世界模型

Darshan Deshpande

机构 * Patronus AI(守护神人工智能公司)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究强化学习中世界模型问题,对比自回归语言模型和掩码扩散语言模型,发现掩码扩散语言模型性能更优。引入GRPO训练框架,在三个OOD环境上零样本转移消融效果良好,还进行相关分析与评估,最后开源工作推动该领域研究。

Comments Dataset: https://huggingface.co/PatronusAI/world_model_corpus Training code: https://github.com/patronus-ai/mdlm_world_modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15545 2026-07-20 cs.MA cs.AI cs.CL 新提交 81%

CoWeaver: A Bi-directional, Learnable and Explainable Matching Engine for Mixed Human-Agent Science Collaboration

CoWeaver:用于混合人机科学协作的双向、可学习且可解释的匹配引擎

Jiayao Gu, Kexin Chu, Peidong Liu, Yue Yang, Lynn Ai, Qi Zhang, Ling Yang, Tianyu Shi

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究针对基于大语言模型的智能体在科学协作中存在的问题,提出CoWeaver算法,通过填补能力差距匹配人员,经两阶段排名筛选,结合探索与贪婪策略,在匹配质量和效率上优于基线,能促进人机科学协作。

详情

展开后加载摘要…

URL PDF HTML 收藏