arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1095 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1095 篇

2606.17229 2026-06-17 cs.LG cs.AI cs.CL 新提交 67%

Rift: A Conflict Signature for Deception in Language Models

Rift: 语言模型中欺骗行为的冲突特征

Petr Nyoma

机构 * Harmonic Labs

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 通过对比知情欺骗与无知错误,发现欺骗性前向传递具有高残差秩的冲突特征,能以100%准确率无标签识别谎言,并跨模型、语言和架构迁移。

Comments 13 pages, 4 figures. Code and experiment logs: https://github.com/Omibranch/Rift

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16903 2026-06-16 cs.DB 新提交 67%

Directory-Aware Query and Maintenance in Vector Databases

向量数据库中的目录感知查询与维护

Mengzhao Wang, Zheng Gong, Jingpei Hu, Jiajie Fu, Maojia Sheng, Junwen Chen, Yifan Zhu

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 针对向量数据库缺乏层次目录语义的问题,提出目录语义查询(DSQ)和目录语义维护(DSM)算子,并评估三种实现策略,其中基于Trie的层次索引(TrieHI)通过树遍历实现高效递归检索并降低维护成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15139 2026-06-16 cs.GT cs.RO 新提交 67%

Self-Driving Negotiator: An interactive, verifiable benchmark for social negotiation and theory of mind under hidden intent

自动驾驶谈判者:一个在隐藏意图下进行社会谈判和心理理论的交互式可验证基准

Ashutosh Kumar

机构 * Owl Autonomous Imaging, Inc(Owl 自动成像公司)

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 提出一个文本多轮程序化生成环境,用于衡量自动驾驶中基于隐藏意图推断的隐式社会协调能力,通过特权模拟器状态计算奖励和诊断,当前最佳模型平均成功率仅0.68。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13474 2026-06-12 cs.CY 新提交 67%

Exploring Systems-Thinking Approaches to Loss of Control Risk

探索系统思维方法应对失控风险

Aurelio Carlucci, Sean P. Fillingham, James Walpole, Jakub Kryś

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 本文运用STECA、STPA和FRAM三种系统安全方法分析前沿实验室编码智能体场景,发现模型级评估可能遗漏治理责任、反馈回路和操作变异等风险,主张将模型评估与系统级危害分析和操作保证相结合。

Comments Accepted to the Technical AI Governance Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11913 2026-06-11 cs.CV 新提交 67%

From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

从内容到知识:基于神经知识表示的闪电般快速长视频理解

Yuchen Guan, Xiao Li, Zongyu Guo, Xiaoyi Zhang, Xiulian Peng, Chun Yuan, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 提出将长视频编码为神经知识表示(NKR),通过智能体知识蒸馏(AKD)自动合成描述和问答对,将视频知识嵌入VLM骨干网络的少量权重中,实现轻量级、可复用的视频理解,推理时无需重新加载视频,大幅降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09748 2026-06-09 cs.AI cs.CL cs.LG 新提交 67%

Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback

深度研究智能体在过程级反馈下的多轮评估

Rishabh Sabharwal, Hongru Wang, Amos Storkey, Jeff Z. Pan

机构 * Google DeepMind(谷歌DeepMind) OpenAI Perplexity AI LangChain AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对深度研究智能体(DRA)在单轮输出评估的不足,提出研究缺口推断(RGI)方法提供过程级反馈,发现单轮过程反馈可提升8-15分,但多轮改进因回归问题难以持续。

Comments Published as a workshop paper at SCALE - ICML 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08481 2026-06-09 cs.LG cs.AI cs.DB cs.SE 新提交 67%

PIPE-Cypher: Automatic Enterprise Benchmark Generation for Text-to-Cypher Systems

PIPE-Cypher:面向文本到Cypher系统的自动企业基准生成

Suraj Ranganath, Anish Raghavendra

机构 * Halıcıoğlu School of Data Science and Computing, University of California, San Diego(加利福尼亚大学圣迭戈分校哈勒乔卢数据科学与计算学院) Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出PIPE-Cypher流水线,利用本地大模型从企业属性图自动生成平衡的NL-to-Cypher基准,通过模式分析、逆向查询约束生成和执行验证等步骤,实现可重复的基准构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06741 2026-06-08 cs.AI cs.CL cs.LG 新提交 67%

OpenSkill: Open-World Self-Evolution for LLM Agents

OpenSkill: 面向LLM智能体的开放世界自我进化

Zhiling Yan, Dingjie Song, Hanrong Zhang, Wei Liang, Yuxuan Zhang, Yutong Dai, Lifang He, Philip S. Yu, Ran Xu, Xiang Li, Lichao Sun

机构 * Lehigh University(莱维大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Salesforce AI Research(Salesforce人工智能研究) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出OpenSkill框架,使智能体在无目标任务监督下,利用开放世界资源自举构建技能和验证信号,实现自我进化,在多个基准上取得最佳自动通过率。

Comments 20 pages, 4 figures and 8 tables. Code is avalable at https://github.com/OpenLAIR/OpenSkill

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19449 2026-07-23 cs.LG cs.AI cs.CR 新提交 66%

Guardrails as Scapegoats: Auditing Unfaithful Safety Refusals in Tool-Augmented LLM Agents

作为替罪羊的护栏:审计工具增强型大语言模型智能体中不忠实的安全拒绝行为

Aarushi Singh

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG;agentic(comments)

AI总结 研究工具增强型大语言模型智能体安全拒绝行为审计问题,引入轻量级黑盒审计框架,将智能体响应分类。实验发现伪造行为占主导,不忠实安全拒绝行为在基线时少,增强安全语言会显著增加该行为,还提出检测方法及治理影响。

Comments 10 pages, 3 figures. Accepted at the ACM KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08220 2026-08-11 cs.AI 新提交 65%

Metanormative Theory for RL-Based Moral Agents

基于强化学习的道德智能体的元规范理论

Aleks Knoks, Marija Slavkovik

机构 * University of Luxembourg(卢森堡大学) University of Bergen(卑尔根大学)

专题命中 Agent评测 :agent(abstract,comments);分类 cs.AI;multi-agent(comments)

AI总结 本文针对强化学习(RL)道德智能体设计中哲学文献被边缘化的问题,提炼元规范理论的相关理念审视RL架构,以明确RL智能体道德行为的判定标准,为评估相关RL方法奠定基础。

Comments The 14th International Workshop on Engineering Multi-Agent Systems (EMAS 2026) held May 25-26, 2026 Co-located with AAMAS 2026 Paphos, Cyprus

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14109 2026-08-17 cs.AI cs.LG cs.MA 新提交 62%

A Graph-Based Reinforcement Learning Framework for Structured Drift Diagnosis and Recovery in Autonomous LLM Agents

面向自主大语言模型智能体中结构化漂移诊断与恢复的基于图的强化学习框架

Ismail El Hamraoui, Sagar Jose, Nicolas Bureau, Robert Plana

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对自主LLM智能体的运行时行为漂移问题,提出基于图的强化学习即插即用恢复框架,经AppWorld基准验证,该框架可利用漂移信息做出正确恢复决策且输出符合要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11381 2026-08-13 cs.AI cs.LG 新提交 62%

From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European Listed Real Estate

从数字到判断:专业大语言模型智能体与欧洲上市房地产的强化学习研究

Pardis Taghavi, Santosh Bhavani

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究以欧洲上市房地产分析为对象,提出Larix框架将分析维度映射为专业LLM智能体,结合GRPO微调Qwen3.5-9B,实现数值任务与判断任务的性能提升且可迁移至新企业与监管体系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11243 2026-08-13 cs.AI cs.LG 新提交 62%

The Off-Support Barrier: Why Semantic Safety Constraints Are Not Learning-Problem Invariants, and What Follows for Prior Design, Containment, and Verification

离支撑屏障:为何语义安全约束不是学习问题不变量,以及对先验设计、约束与验证的启示

Yoshinori Watanabe

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出语义安全约束是离支撑对象,基于奇异学习理论推导得出多项推论,以2026年7月OpenAI与Hugging Face评估事件为案例,为AI安全的先验设计、约束验证等问题提供理论启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10475 2026-08-12 cs.AI cs.CL cs.GT 新提交 62%

Evaluating Rational Contracting in Natural Language

评估自然语言中的理性缔约

Bhavyesh Sajja, Max Kleiman-Weiner, Roger Zimmermann, Tan Zhi-Xuan

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对自然语言缔约的评估缺口,构建理性框架并开发ContractSim评估套件,发现当前LLM智能体在高不确定性下缔约及执行协议存在不足,为相关智能体设计指明改进方向。

Comments 9 pages, 5 figures, 2 tables (Appendix: 34 pages, 6 figures, 9 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08968 2026-08-11 cs.SE cs.AI 新提交 62%

GALA: Graph-Augmented LLM Agents for Root Cause Analysis and Incident Response in Microservices

GALA:用于微服务根本原因分析和事件响应的图增强大语言模型智能体

Yifang Tian, Yaming Liu, Zichun Chong, Zihang Huang, Yiran Li, Hans-Arno Jacobsen

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 针对微服务RCA的现有方法存在局限,提出图增强LLM智能体框架GALA+,结合STRIX与SURE-Score,在基准测试中性能优于最佳LLM基线,获SRE专家认可。

Comments Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08814 2026-08-11 cs.CV cs.AI cs.LG 新提交 62%

360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents

360CityArena:面向具身智能体的真实虚拟城市导航基准

Kenta Watanabe, Atsuyuki Miyai, Mizuki Takenawa, Kiyoharu Aizawa, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究人员提出基于东京秋叶原重建的360CityArena城市导航基准,评估具身智能体城市探索能力,发现最强模型Gemini 2.5 Flash表现远低于人类,为相关研究提供了挑战性测试平台。

Comments ECCV2026. Project Page: https://360mm-team.github.io/360CityArena/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08180 2026-08-11 cs.CL cs.AI 新提交 62%

A Grounded and Decomposed Framework for Relation-Level Hallucination Evaluation in Abstractive Summarization

用于抽象摘要中关系级幻觉评估的基于基础与分解的框架

Praveen Kumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad Vittala, Naman Kabadi

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出一种用于抽象摘要关系级幻觉评估的基于基础与分解的框架,引入关系幻觉指数(RHI)及其归一化公式,经多模型评估验证其可生成稳定且具区分性的幻觉测量结果,推进了自动化关系级保真度评估。

Comments 6 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08160 2026-08-11 cs.CL cs.AI 新提交 62%

Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives

大语言模型智能体能坚持剧本吗?交互式叙事中长期一致性的基准测试

Yingpeng Ma, Jianhao Yan, Bei Shi, Ka Hou Kam, Runnan Wang, Xuebo Liu, Yulong Chen, Yue Zhang, Derek F. Wong

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对LLM智能体在交互式叙事中难以维持长期一致性的问题,构建了NCP-Bench基准测试,发现现有顶尖LLM的承诺保持率较低,存在显著的逻辑冲突问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07533 2026-08-11 cs.AI cs.SE 新提交 62%

MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents

MetaSpace:面向具身智能体空间认知的变形测试

Gengyang Xu, Dongwei Xiao, Yiteng Peng, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 MetaSpace是评估具身智能体空间认知的框架,基于变形测试原则生成测试用例,在三个场景中检测到SOTA MLLM驱动智能体的90422个空间认知错误,其SC分数远低于人类基准。

Comments 30 pages, 17 figures. Published in Proceedings of the ACM on Programming Languages (OOPSLA1)

Journal ref Proceedings of the ACM on Programming Languages, 10, OOPSLA1 (April 2026), 343-372

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07529 2026-08-11 cs.CL cs.AI 新提交 62%

WuYuEval: A Multi-Level Benchmark for Large Language Models in Solid Waste Management

WuYuEval:面向固体废物管理的大语言模型多级基准测试

Yi Zhang, Hongyang Wang, Zheng Hao Leong, Zihao Wu, Kaijun Lin, Zhixing Pan, Qixun Huangfu, Wei Ren, Wenyan Wu, Fangyun Wang, Wenting Yu, Hengyu Lin, Muling Yang, Zongguo Wen

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 WuYuEval是面向固体废物管理的多级基准测试,含基础与专家模块,评估33个LLM的SWM能力,发现其在专业任务表现差,为开发专用基础模型提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08118 2026-08-11 cs.AI cs.LG cs.SC math.CO 新提交 62%

Neurosymbolic Discovery of Algebraic Graph Constructions

代数图构造的神经符号发现

David Seka, Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对仅提供原始图数据无法揭示其结构性质的问题,提出基于通用大语言模型与SageMath的神经符号智能体,可自动发现代数图构造,在100个高度对称图基准上全部成功,还找到Bernhart-Kainen可散度猜想的最小反例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06420 2026-08-10 cs.LG cs.AI 新提交 62%

Risk-Aware Decision Policies for Agents Under Noisy Perception

感知噪声下智能体的风险感知决策策略

David Szczecina

机构 * University of Waterloo(滑铁卢大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对感知噪声下智能体决策问题,该研究构建人工生命捕食者-猎物觅食模型,发现不确定性感知策略可提升智能体存活率,揭示了行为随不确定性的状态转变,为含噪声标签的鲁棒学习提供类比。

Comments 8 pages, 6 figures. Submitted to the 2026 Conference on Artificial Life (ALIFE2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06352 2026-08-07 cs.LG cs.CL 新提交 62%

CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks

CalibForge:用于扩展可学习终端任务的对抗性求解器校准

Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun, Zhiyu Lin, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CalibForge系统,通过对抗性求解器校准合成5431个终端任务,训练的模型在多个基准测试中取得显著性能提升,验证了求解器相关可学习性的实用价值。

Comments Dataset: https://huggingface.co/datasets/AweAI-Team/CalibForge. Repository: https://github.com/AweAI-Team/CalibForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06329 2026-08-07 cs.CL cs.AI 新提交 62%

Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents

基准的基准:对话智能体的基准评估

Noam Koren, Roy Bar-Haim, Abigail Goldsteen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对对话智能体基准质量评估不足的问题,提出基于LLM评判员的无参考评估框架,可区分基准质量等级,适用于合成与人工整理的基准,验证了其有效性与实用性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05876 2026-08-07 cs.AI cs.CL 新提交 62%

Personalized Deep Research Query Refinement with Graph-Scaffolded Evidence Grounding

基于图支架证据锚定的个性化深度研究查询优化

Soojin Yoon, Dongha Lee

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出G-STEER方法,通过图支架证据锚定优化用户请求为个性化研究规范,在提升深度研究智能体报告个性化的同时,大幅减少向用户提问的数量。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05695 2026-08-07 cs.AI cs.CL cs.CR 新提交 62%

DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

DreamGuard:基于风险感知世界模型的LLM智能体高效运行时护栏

Wenhao Lin, Chenyu Yu, Xingwei Lin, Sicong Cao, Xiang Chen, Lei Xue, Le Yu, Letian Sha, Chunming Wu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对LLM智能体运行时护栏的长视野风险盲点问题,提出基于风险感知世界模型的主动式护栏DreamGuard,经实验验证其安全-效用权衡更优且延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04156 2026-08-06 cs.AI cs.LG 新提交 62%

BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding

BrainBench:面向全面脑电理解的大语言模型基准测试

Yangxuan Zhou, Sha Zhao, Yuning Chen, Chen Wu, Jiquan Wang, Shijian Li, Gang Pan

机构 * Zhejiang University(浙江大学) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 该研究推出BrainBench基准测试,涵盖4个子集共17个数据集等,评估大语言模型在两种范式下的脑电理解能力,为相关研究提供可复现测试平台。

Comments 42pages,22pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04095 2026-08-06 cs.AI cs.CL 新提交 62%

FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents

FinPerMA:一种基于理论、事件驱动的LLM智能体个性化记忆基准

Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对LLM智能体个性化记忆的现有基准不足,提出FinPerMA基准,在276个角色的2994个问题上测试7种LLM,发现其记忆配置远未饱和,简单检索优于专用记忆系统且冲击后差距扩大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03206 2026-08-05 cs.CY cs.AI cs.CL 新提交 62%

EduClaw-Bench: A Long-Horizon Benchmark for Pedagogical LLM Agents with Simulated Learners

EduClaw-Bench:面向教学大型语言模型智能体的长周期基准测试集(含模拟学习者)

Unggi Lee, Sookbun Lee, Yeil Jeong, Eunjoo Lee, Minchul Shin, Hoilym Kwon

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究人员推出EduClaw-Bench长周期基准测试集,结合模拟学习者评估LLM智能体辅导效果,发现辅导质量取决于基础模型与智能体适配器的结合,且多数组合无法维持全程良好辅导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00301 2026-08-04 cs.LG cs.CL 新提交 62%

Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning

弃权作为一种动作会同时破坏奖励梯度和KL锚点:错误惩罚强化学习的崩溃规律与修复方案

Xujun Che, Yuchen Yuan, Weida Zhao, Chenyang Yu

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对错误惩罚强化学习中弃权动作导致的奖励梯度与KL锚点同时失效的问题,提出通过训练强制置信度报告的结构性修复方案,实验验证了机制并提升了语言模型的相关性能。

详情

展开后加载摘要…

URL PDF HTML 收藏