arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-07 至 2026-08-07 共收录 218 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 43 篇

2608.06353 2026-08-07 cs.GT cs.AI cs.MA 新提交 83%

Resourced Authority A Mechanism-Design Model for Participatory Governance of Deployed AI Agents

资源权威:部署AI代理参与式治理的机制设计模型

Praphul Chandra, Sujit Gujar, Ganesh Ghalme

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究提出资源权威机制设计模型,用于通过计算预算使授权自我执行,实现对已部署AI代理的参与式治理,同时指出被治理代理操纵治理 electorate 是核心开放问题。

Comments 22 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16666 2026-08-07 cs.CL 版本更新 83%

Robust Native Language Identification through Agentic Decomposition

基于智能体分解的鲁棒原生语言识别

Ahmet Yavuz Uluslu, Tannon Kew, Tilia Ellendorff, Gerold Schneider, Rico Sennrich

机构 * University of Zurich(苏黎世大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文针对LLM原生语言识别易依赖表面线索的问题,提出受法医语言学启发的智能体分解流程,通过专用智能体积累分类证据、协调智能体综合预测,在基准数据集上提升了NLI的鲁棒性与性能一致性。

Comments Accepted at EMNLP* 2025

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pp. 8398-8414

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06362 2026-08-07 cs.GT cs.AI cs.CL cs.LG cs.MA 新提交 82%

AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games

AV-AIVAT:在非完全信息博弈中具备可验证的任意时间有效停止机制,成本降低74倍的智能体评估方法

Boning Li, Yu Chen, Longbo Huang

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 AV-AIVAT将AIVAT与置信序列结合,在非完全信息博弈中实现任意时间有效停止,成本降低74倍,可高效评估智能体并向第三方提供可审计的验证依据。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06027 2026-08-07 cs.CL cs.AI cs.HC 新提交 81%

FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India

FormBharo:为印度农村设计和评估用于对话式表单填写的语音助手

Aman Dalmia, Sanskriti Midha, Jigar Doshi

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究针对印度农村无法读写的人群开发了语音助手FormBharo,结合LLMs与规则控制完成表单填写,发布了相关基准数据集,通过端到端评估确定最优模型配置以平衡准确性、成本与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05604 2026-08-07 cs.CL cs.AI 新提交 81%

SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries

SkillZip:用于可扩展智能体技能库的保留契约的图压缩方法

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang

机构 * UNSW(新南威尔士大学) CSIRO(联邦科学与工业研究组织)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 SkillZip是一种执行感知的过程抽象框架,通过对节级图进行保留契约的压缩,解决了智能体技能库的可扩展问题,在基准测试中优于基线,实现了高压缩率和稳健检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05151 2026-08-07 cs.CL cs.AI 新提交 81%

Simulator-Grounded Large Language Models for Industrial Causal Reasoning: Tool-Use, Structured Injection, and Plant-Portable Retrieval for Wastewater Treatment Decision Support

面向工业因果推理的模拟器驱动大语言模型:用于污水处理决策支持的工具使用、结构化注入及工厂可迁移检索

Gary Simethy, Daniel Ortiz Arroyo, Petar Durdevic

机构 * Aalborg University(奥尔堡大学)

专题命中 Agent评测 :tool-use(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究对比三种适配Qwen2.5-32B-Instruct模型的方法,在污水处理因果问答任务中,DRR检索器兼具高准确率、跨工厂迁移能力及训练高效性,优于其他方法与基线。

Comments 20 pages, 2 figures, 8 tables. Preprint submitted to Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19380 2026-08-07 cs.SE cs.LG 版本更新 81%

ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures

AgentArmor:编码代理失败的框架、评估与缓解

Kenneth Ge, Andre Assis

机构 * Anthropic Fellows Program(Anthropic Fellow 项目) Constellation

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG、cs.SE

AI总结 提出AgentArmor框架,通过系统提示增强、命令分类器、三振政策等机制,缓解编码代理因规范不足、能力错误和工具错误导致的失败,显著提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05177 2026-08-07 cs.CY 新提交 80%

Using AI-Generated Feedback to Improve Critical Thinking and Writing Proficiency

利用AI生成的反馈提升批判性思维与写作能力

Qi Zhu, Xiaoming Zhai, Yan Zou, Chunlei Gao

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 本研究开发了WISE Agent智能体,通过对260名六年级学生的三个月干预,证实其作为认知支架可促进不同水平学生批判性思维的差异化发展,为AI辅助培养批判性思维提供了可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04884 2026-08-07 cs.CV 版本更新 80%

HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

浑元OCR-1.5:让轻量级OCR视觉语言模型更快更好

Gengluo Li, Xingyu Wan, Shangpin Peng, Weinong Wang, Hao Feng, Yongkun Du, Binghong Wu, Zheng Ruan, Zhiqiong Lu, Liang Wu, Pengyuan Lyu, Huawen Shen, Zibin Lin, Shijing Hu, Jieneng Yang, Hongbing Wen, Guanghua Yu, Hong Liu, Bochao Wang, Can Ma, Han Hu, Chengquan Zhang, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Large Language Model Department, Tencent(腾讯大语言模型部) Nankai University(南开大学)

专题命中 Agent评测 :agentic(summary_cn,abstract);agent(abstract)

AI总结 研究改进轻量级端到端OCR视觉语言模型。基于HunyuanOCR-1.0架构,用DFlash提升效率,提出Agentic Data Flow增强能力,在多任务表现出色,还将发布模型权重和代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05822 2026-08-07 cs.SE 新提交 79%

Agent-Based Test Assertion Generation via Diverse Perspective Aggregation

基于智能体的多视角聚合测试断言生成

Dong Wang, Qiaoyu Han, Lin Yang, Jianyi Zhou, Guangtai Liang, Junjie Chen

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 针对现有LLM断言生成方法的局限,提出基于智能体的AssertMate框架,通过三个组件聚合多视角,在Defects4J和EvoSuite验证中性能显著优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05797 2026-08-07 cs.LG cs.CL 新提交 79%

Predicting Task Difficulty Without Rollouts

无需展开预测任务难度

Stefan Krsteski, Charlotte Meyer

机构 * Andromede AI(安卓迈德人工智能)

专题命中 Agent评测 :agent(abstract);function calling(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对17个跨多领域的智能体基准,提出无需展开的任务难度预测方法,发现token级熵是有效预测信号,可通过难度残差暴露环境缺陷,助力校准基准与构建训练课程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06301 2026-08-07 cs.AI cs.CL cs.LG 新提交 75%

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

HarnessOpt-Bench:评估大型语言模型的 harness 优化能力

Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue

机构 * Scale AI

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究提出HarnessOpt-Bench基准,评估前沿LLM在高成本随机评估下的端到端harness优化能力,发现优化器模型差异大于编码harness、原生harness非始终更优,该能力具可测性与提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05778 2026-08-07 cs.AI 新提交 74%

When Do Prompt-Side Agent Playbooks Transfer? Accuracy, Cost, and Runtime Shift in Agent Deployment

提示侧智能体剧本何时可迁移?智能体部署中的准确性、成本与运行时偏移

Weihong Lin, Lin Sun, Xiangzheng Zhang

机构 * Beijing Qiyuan Technology Co., Ltd.(北京奇源科技有限公司)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 该研究在蒸馏-验证-迁移协议下探究提示侧智能体剧本的可迁移性,在ALFWorld、TAU2-Bench、XBench-DeepSearch等基准上测试发现其为有条件的冷启动选项,需目标侧验证相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02880 2026-08-07 cs.IR cs.LG 版本更新 74%

Field Aware Agent Skill Retrieval

领域感知智能体技能检索

Paimon Goulart, Liang Wu, Kelly Wan, Evangelos E. Papalexakis, Liangjie Hong

专题命中 Agent评测 :agent(title);分类 cs.LG

AI总结 本研究针对终身学习智能体技能检索瓶颈,提出领域感知的技能表示方法,通过保留技能的多字段结构计算相似度,在 SkillRet 和 SRA-Bench 基准上取得优于拼接基线的检索效果,且优势随技能库规模增大而提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05485 2026-08-07 cs.CV 新提交 71%

VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing

VideoArgus:基于智能体评分规则的视频生成与编辑统一评估框架

Ziyun Zeng, Zixuan Wang, Yongsheng Yu, Hang Hua, Jiebo Luo

机构 * University of Rochester(罗切斯特大学)

专题命中 Agent评测 :agentic(title)

AI总结 针对现有视频评估基准的局限,本文提出VideoArgus框架,构建含1026个实例的VideoArgus-Bench,其在与人类判断的相关性上优于基准特定评估器,且模型排名稳定。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05990 2026-08-07 cs.AI cs.CE physics.app-ph physics.optics 新提交 70%

OPERA: Operator-residual feedback for reliable autonomous optical experiments with language-model agents

OPERA:面向语言模型智能体的可靠自主光学实验的算子残差反馈

Ning Xu, Xiang Zheng, Fuqiang Zhong, Huadong Wang, Xiaolong Wu, Zhiyuan Liu, Hui Ning

机构 * Tsinghua University(清华大学) ModelBest Inc.(模贝斯特公司) Hunan University(湖南大学) Northwest Institute of Nuclear Technology(西北核技术研究所)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本研究提出面向语言模型智能体的OPERA算子残差框架,将实验动作表示为光学算子并结合物理解释残差评估,在三项光学任务中可减少无物理改进的决策占比,提升任务目标达成概率并降低实验预算。

Comments 34 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18770 2026-08-07 cs.LG cs.AI cs.CL 67%

Reward Shaping to Mitigate Reward Hacking in RLHF

奖励塑造以缓解强化学习从人类反馈中的奖励黑客

Jiayi Fu, Xuandong Zhao, Chengyuan Yao, Heng Wang, Qi Han, Yanghua Xiao

机构 * Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 PAR通过利用奖励模型中的潜在偏好信号,有效缓解RLHF中的奖励黑客问题,表现出更高的性能和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06352 2026-08-07 cs.LG cs.CL 新提交 62%

CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks

CalibForge:用于扩展可学习终端任务的对抗性求解器校准

Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun, Zhiyu Lin, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CalibForge系统,通过对抗性求解器校准合成5431个终端任务,训练的模型在多个基准测试中取得显著性能提升,验证了求解器相关可学习性的实用价值。

Comments Dataset: https://huggingface.co/datasets/AweAI-Team/CalibForge. Repository: https://github.com/AweAI-Team/CalibForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06329 2026-08-07 cs.CL cs.AI 新提交 62%

Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents

基准的基准:对话智能体的基准评估

Noam Koren, Roy Bar-Haim, Abigail Goldsteen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对对话智能体基准质量评估不足的问题,提出基于LLM评判员的无参考评估框架,可区分基准质量等级,适用于合成与人工整理的基准,验证了其有效性与实用性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05876 2026-08-07 cs.AI cs.CL 新提交 62%

Personalized Deep Research Query Refinement with Graph-Scaffolded Evidence Grounding

基于图支架证据锚定的个性化深度研究查询优化

Soojin Yoon, Dongha Lee

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出G-STEER方法,通过图支架证据锚定优化用户请求为个性化研究规范,在提升深度研究智能体报告个性化的同时,大幅减少向用户提问的数量。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05695 2026-08-07 cs.AI cs.CL cs.CR 新提交 62%

DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

DreamGuard:基于风险感知世界模型的LLM智能体高效运行时护栏

Wenhao Lin, Chenyu Yu, Xingwei Lin, Sicong Cao, Xiang Chen, Lei Xue, Le Yu, Letian Sha, Chunming Wu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对LLM智能体运行时护栏的长视野风险盲点问题,提出基于风险感知世界模型的主动式护栏DreamGuard,经实验验证其安全-效用权衡更优且延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28609 2026-08-07 cs.AI cs.CL cs.CV 版本更新 62%

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

OSReward:为跨平台计算机使用奖励模型建立标准化评估

Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究推出OSReward基准评估VLM评判者的可靠性,构建OS-Shepherd开源奖励模型缩小成本差距,为规模化可靠CUA奖励设计提供参考

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21140 2026-08-07 cs.SE cs.AI 版本更新 62%

Matching Matters: A Fair Quality-Efficiency Benchmark for Command-Line Agents

AgentMeter: 评估基于CLI的本地任务求解智能体的模型-CLI匹配

Han Chi, Jiaxin Qi, Yan Cui, Baisheng Lai, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, Chinese Academy of Sciences(中国科学院杭州高等研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出AgentMeter基准,通过成功锚定、成本感知的AMS指标评估模型与CLI的匹配,发现模型和CLI选择不可解耦,需作为部署单元评估。

Comments 13 pages, 4 figures, 12 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06144 2026-08-07 cs.AI 新提交 57%

FinEvo-Bench: A Longitudinal Benchmark for Self-Evolving Agents in Professional Financial Workflows

FinEvo-Bench:面向专业金融工作流中自进化智能体的纵向基准

Bo Deng, Kang Zhou, Lifan Guo, Chongyang Tao, Xuanren Chen, Chenggang Xie, Renzhao Liang, Feng Chen, Chi Zhang

机构 * Alibaba Cloud Computing(阿里云)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究推出面向金融工作流的FinEvo-Bench基准,对比4种自进化智能体框架,发现进化可提升性能、减少合规问题,且评分规则反馈效果优于参考答案反馈。

Comments 22 pages, 4 figures; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06022 2026-08-07 cs.CL q-bio.GN 新提交 57%

EpiBench: Can LLMs Understand Epitopes for Antibody Drug Discovery?

EpiBench:大型语言模型能否为抗体药物发现表位?

Zirui Wang, Jiaqi Wang, Qinghan Wang, Yuzhi Xu, Gang Du, Tingjun Hou, Odin Zhang

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本研究提出用于评估大型语言模型表位推理能力的基准EpiBench,发现现有通用LLMs在抗体药物发现相关表位推理上仍存局限,为改进序列感知型生物医学LLMs提供了测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06012 2026-08-07 cs.AI 新提交 57%

HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards

HERALD:检索证明奖励的反事实审计与最小修复

Zhuowen Liu, Bohan Cui, YinShang Guo, Yuting Wang, Hao Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 HERALD是一种离线审计方法,可对搜索智能体的检索证明奖励进行反事实审计与最小修复,能有效抵御引用清洗攻击,提升引用精度等指标并分离稳健评分与策略迁移。

Comments 9 pages, 3 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05245 2026-08-07 cs.AI 新提交 57%

Search2Skill: Skill Distillation Beyond Knowledge Boundaries Via Rubric-Based Reinforcement Learning

Search2Skill:基于 rubric 强化学习的、突破知识边界的技能蒸馏

Muyang Ye, Tian Lan, Feihu Jiang, Yongshi Ye, Wuyunsiqin, Bin Zhu, Qianghuai Jia, Zhao Xu, Weihua Luo, Ye Wang, Jinyang Zhang, Longyue Wang, Lingfeng Bao

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究针对现有技能构建受限于模型已有知识的问题,提出Search2Skill框架,通过基于rubric的强化学习实现外部证据蒸馏为可复用技能,在多领域实验中优于基线且技能可跨模型规模迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12369 2026-08-07 cs.CL 版本更新 57%

Can Deep Research Agents Retrieve and Organize? Evaluating the Synthesis Gap with Expert Taxonomies

深度研究代理能否检索和组织?通过专家分类法评估合成差距

Ming Zhang, Jiabao Zhuang, Wenqing Jing, Kexin Tan, Ziyu Kong, Jingyi Deng, Yujiong Shen, Yuhui Wang, Zhenghao Xiang, Qiyuan Peng, Yuhang Zhao, Ning Luo, Renzhe Zheng, Jiahui Lin, Mingqi Wu, Long Ma, Shihan Dou, Maxm Pan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Hunyuan Team, Tencent(腾讯 Hunyuan 团队)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出TaxoBench基准,评估深度研究代理在检索和组织论文方面的能力,发现两者在能力与对齐方面均存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05379 2026-08-07 econ.TH 新提交 50%

Catastrophic Attention Preferences

灾难性注意力偏好

R. Emilio Muniz-Langle

专题命中 Agent评测 :agent(abstract)

AI总结 本文为仅关注不利结果子集的灾难性思维建立了公理化的灾难性注意力偏好模型,完成了行为学刻画,参数可识别,还刻画了比较模糊厌恶,模型嵌套主观期望效用并收敛到最大最小期望效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05527 2026-08-07 stat.ME stat.AP 新提交 50%

Fast Power Evaluation under Biased-Coin Minimization: Sampling and Randomization Calibration

偏币最小化下的快速功效评估:抽样与随机化校准

Masahiro Kojima

专题命中 Agent评测 :planning(abstract)

AI总结 针对偏币最小化下设计阶段功效评估计算量大的问题,开发SIGA框架及SIGA-S、SIGA-R程序,可高效近似参考随机化检验的结果并显著降低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏