arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-15 至 2026-05-15 共收录 194 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 9 篇

2602.24273 2026-05-15 cs.AI 79%

A Minimal Agent for Automated Theorem Proving

一个用于自动定理证明的最小代理

Borja Requena, Austin Letson, Krystian Nowakowski, Izan Beltran-Ferreiro, Leopoldo Sarra

专题命中 记忆与上下文管理 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出一个最小代理基准,用于比较不同AI定理证明器架构。通过迭代证明细化、库搜索和上下文管理核心功能,展示了与前沿方法相媲美的性能,同时架构更简单且成本更低。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14421 2026-05-15 cs.CR cs.AI 79%

MemLineage: Lineage-Guided Enforcement for LLM Agent Memory

MemLineage: 为LLM代理内存提供指导性强制措施

Ciyan Ouyang, Rui Hou

机构 * State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) Institute of Information Engineering, CAS(信息工程研究所,中国科学院) Beijing, China(北京,中国)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 MemLineage通过结合加密溯源和LLM中介推导链,解决LLM代理内存中不可信内容的持久化问题,通过链式 custody 机制防止敏感操作,实验显示其能有效降低攻击成功率。

Comments 24 pages, 8 figures. Rui Hou is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06132 2026-05-15 cs.CL 79%

MemReranker: Reasoning-Aware Reranking for Agent Memory Retrieval

MemReranker:面向智能体记忆检索的推理增强重排序

Chunyu Li, Mengyuan Zhang, Jingyi Kang, Ding Chen, Jiajun Shen, Bo Tang, Xuanhe Zhou, Feiyu Xiong, Zhiyu Li

机构 * China Telecom Research Institute(中国电信研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL

AI总结 MemReranker通过多阶段LLM知识蒸馏构建,解决记忆检索中语义相关但缺乏关键信息的问题,提升重排序模型的推理能力与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14628 2026-05-15 cs.HC 67%

SmartWalkCoach: An AI Companion for End-to-End Walking Guidance, Motivation, and Reflection

SmartWalkCoach: 一种面向全程步行引导、激励与反思的AI伴侣

Xianzhe Zhang, Mingxuan Hu, Bufan Xue, Erick Purwanto, Thomas J Selig, Daniel Yonto

专题命中 记忆与上下文管理 :agent(abstract);planning(abstract)

AI总结 本文提出SmartWalkCoach,通过整合地理、陪伴和总结三个轻量级代理,降低步行规划的认知负荷,提升步行过程中的参与度与动机,通过动态干预改善用户感受和体验。

Comments 15 pages, 2 figures, to be presented to ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06471 2026-05-15 cs.LG cs.AI 62%

Why Goal-Conditioned Reinforcement Learning Works: Relation to Dual Control

为何目标条件强化学习有效:与双控的关系

Nathan P. Lawrence, Ali Mesbah

机构 * Department of Chemical and Biomolecular Engineering, University of California, Berkeley, CA 94720 USA(化学与生物分子工程系,加州大学伯克利分校,CA 94720 USA)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文分析了目标条件强化学习与最优控制的关系,揭示了经典目标条件奖励与传统二次目标之间的优化差距,并验证了目标条件策略在非线性和不确定环境中的优势。

Comments IFAC world congress postprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08374 2026-05-15 cs.AI 57%

MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs

MemQ:将Q学习整合到基于溯源DAG的自进化记忆代理中

Junwei Liao, Haoting Shi, Ruiwen Zhou, Jiaqian Wang, Shengtao Zhang, Wei Zhang, Ying Wen, Zhiyu Li, Feiyu Xiong, Bo Tang, Weinan Zhang, Muning Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学) Xidian University(西安电子科技大学) University of Science and Technology of China(中国科学技术大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

专题命中 记忆与上下文管理 :function calling(abstract);分类 cs.AI

AI总结 MemQ通过在溯源DAG中传播信用权重,改进记忆Q值的评估,提升多步任务的泛化能力,尤其在产生深层相关溯源链的任务中表现突出。

Comments 22 pages, 11 figures (containing 43 individual image panels total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07594 2026-05-15 cs.RO 50%

MemCompiler: Compile, Don't Inject -- State-Conditioned Memory for Embodied Agents

MemCompiler: 编译,而非注入 -- 用于具身智能体的状态条件化记忆

Xin Ding, Xinrui Wang, Yifan Yang, Hao Wu, Shiqi Jiang, Qianxi Zhang, Liang Mi, Hanxin Zhu, Kun Li, Yunxin Liu, Zhibo Chen, Ting Cao

机构 * University of Science and Technology of China(中国科学技术大学) Huazhong University of Science and Technology(华中科技大学) Microsoft Research(微软研究院) Nanjing University(南京大学) Institute for AI Industry Research (AIR) Tsinghua University(清华大学人工智能产业研究院)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 MemCompiler通过状态条件化记忆编译提升具身智能体的记忆效率与效果,在多个基准测试中实现性能提升和延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 37 篇

2509.26100 2026-05-15 cs.AI 85%

AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models

AgenticEval: 向大型语言模型的代理和自演化安全评估迈进

Yixu Wang, Xin Wang, Yang Yao, Xinyuan Li, Xibang Yang, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The University of Hong Kong(香港大学) East China Normal University(华东师范大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出AgenticEval框架,通过自演化评估流程动态检测LLM安全风险,实验显示模型安全评分随评估强化而下降,揭示静态评估的局限性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14002 2026-05-15 cs.AI 85%

PolitNuggets: Benchmarking Agentic Discovery of Long-Tail Political Facts

PolitNuggets: 评估代理发现长尾政治事实

Yifei Zhu

机构 * The University of Hong Kong(香港大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 PolitNuggets通过构建400位全球精英的政治传记,涵盖10000多个政治事实,评估代理信息合成能力,发现当前系统在细节处理和效率上存在显著差异。

Comments 24 pages, 7 figues, accpeted in The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14442 2026-05-15 cs.CY 85%

GGBound: A Genome-Grounded Agent for Microbial Life-Boundary Prediction

GGBound:一种基于基因组的微生物生命边界预测代理

Hanbo Huang, Xuan Gong, Jing Wang, Lei Bai, Xiang Xiao, Weishu Zhao, Shiyu Liang

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);agentic(abstract)

AI总结 本文提出GGBound代理,通过基因组条件化和工具增强的LLM,解决微生物生命边界预测问题,构建了涵盖1525种菌株的基准数据集,并通过三阶段优化流程提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03596 2026-05-15 cs.AI cs.CL cs.DB cs.LG 85%

Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies

Workspace-Bench 1.0:基于大规模文件依赖的AI代理工作空间基准测试

Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Yukai Wu, Weizheng Wang, Hongzhang Huang, Wei Zhou, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen, Chunwei Liu, GuoLiang Li, Jihua Kang, Fan Wu

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Workspace-Bench 1.0,通过构建包含5个工人配置、74种文件类型和20,476个文件的现实工作空间,评估AI代理在处理大规模文件依赖任务中的能力,发现当前代理在工作空间学习中表现远低于人类水平。

Comments 30 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14865 2026-05-15 cs.AI cs.CL 84%

Holistic Evaluation and Failure Diagnosis of AI Agents

人工智能代理的总体评估与故障诊断

Netta Madvil, Gilad Dym, Alon Mecilati, Edo Dekel, Jonatan Liberman, Rotem Brazilay, Liron Schliesser, Max Svidlo, Shai Nir, Orel Shalom, Yaron Friedman, David Connack, Amos Rimon, Philip Tannor, Shir Chorev

机构 * Deepchecks

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种综合评估框架,结合顶层代理诊断与底层跨度评估,通过分解分析实现独立跨度评估,提升长结构轨迹中的故障定位与分类准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14033 2026-05-15 cs.AI cs.LG 84%

Sheaf-Theoretic Transport and Obstruction for Detecting Scientific Theory Shift in AI Agents

示性同调运输与障碍在检测人工智能代理科学理论转变中的应用

David N. Olivieri, Roque J. Hernández

机构 * Universidade de Vigo, Department of Computer Science (LSI), Spain(维戈大学计算机科学系(LSI),西班牙)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于有限示性同调框架的方法,用于检测人工智能代理中科学理论转变的候选者,通过运输和障碍分析,区分理论框架的可运输性与局部到全局的障碍问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15109 2026-05-15 cs.AI cs.IR 83%

Why Neighborhoods Matter: Traversal Context and Provenance in Agentic GraphRAG

为什么社区重要:代理图RAG中的遍历上下文与溯源

Riccardo Terrenzi, Maximilian von Zastrow, Serkan Ayvaz

机构 * Centre for Industrial Software, University of Southern Denmark, Alsion 2, 6400 Sønderborg, Denmark(丹麦南部大学工业软件中心)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文探讨了代理图RAG中引用忠实性的轨迹层面问题,通过实验表明引用证据和遍历上下文都对答案准确性有影响。

Comments 7 pages, 2 figures, Submitted at IJCAI-ECAI 2026 Joint Workshop on GENAIK and NORA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14460 2026-05-15 cs.CR cs.SE 83%

Exploiting LLM Agent Supply Chains via Payload-less Skills

通过无负载技能利用LLM代理供应链

Xinyu Liu, Yukai Zhao, Xing Hu, Xin Xia

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.SE

AI总结 研究提出Semantic Compliance Hijacking攻击,利用LLM生成能力动态合成恶意行为,通过无负载技能实现对自主编码环境的攻击,展示了其在不同框架和模型中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11703 2026-05-15 cs.CR cs.AI 83%

Progent: Securing AI Agents with Privilege Control

Progent:通过权限控制保障AI代理

Tianneng Shi, Jingxuan He, Zhun Wang, Hongwei Li, Linyu Wu, Wenbo Guo, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) UC Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 Progent通过权限控制框架保障AI代理安全,利用LLM生成并更新策略,通过SMT求解器确保权限空间单调收敛,有效降低攻击成功率并保持高实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13940 2026-05-15 cs.CR cs.AI 83%

AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills

AgentTrap: 评估LLM代理在第三方技能中抵御恶意运行行为的能力

Haomin Zhuang, Hanwen Xing, Yujun Zhou, Yuchen Ma, Yue Huang, Yili Shen, Yufei Han, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) University of Southern California(南加州大学) LMU Munich(慕尼黑大学) Inria, France(法国国家信息与自动化技术研究院)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 AgentTrap通过141个任务评估LLM代理在使用第三方技能时抵御恶意行为的能力,发现最关键的失败并非简单劫持,而是模型在完成用户任务时将不安全副作用视为正常流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16813 2026-05-15 cs.AI cs.CL cs.DB 82%

PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

PersonalHomeBench:评估智能家庭中的代理系统

Manasa Bharadwaj, Yolanda Liu, InJung Yang, Sungil Kim, Nikhil Verma, KoKeun Kim, Kevin Ferreira, YoungJoon Kim

机构 * LG Toronto AI Lab(LG多伦多人工智能实验室)

专题命中 Agent评测 :agentic(abstract,abstract_cn);agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出PersonalHomeBench,用于评估代理在个性化智能家庭中的表现,通过迭代构建家庭状态生成任务,结合工具箱支持真实交互,揭示任务复杂度增加时代理能力下降的问题。

Comments Please use and cite the V3 version of this work, which includes updated correct author ordering and expanded error analysis in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14120 2026-05-15 cs.LG cs.CL 81%

Mini-JEPA Foundation Model Fleet Enables Agentic Hydrologic Intelligence

Mini-JEPA基础模型舰队实现智能水文智能

Mashrekur Rahman

机构 * Dartmouth Libraries, Dartmouth College(达特茅斯图书馆,达特茅斯大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Mini-JEPA基础模型舰队,通过路由代理为特定问题选择传感器,提升水文分析精度,实验显示其在土壤湿度、干旱和降水预测中优于AlphaEarth。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14723 2026-05-15 cs.AI cs.CL cs.LG 80%

Agentifying Patient Dynamics within LLMs through Interacting with Clinical World Model

通过与临床世界模型交互实现患者动态的智能体化

Minghao Wu, Yuting Yan, Zhenyang Cai, Ke Ji, Chuangsen Fang, Ziying Sheng, Xidong Wang, Rongsheng Wang, Hejia Zhang, Shuang Li, Benyou Wang, Hongyuan Zha

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出SepsisAgent,通过临床世界模型模拟患者对液体-血管加压药干预的响应,采用提出-模拟-细化流程进行脓毒症治疗推荐,优于传统RL和LLM基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14556 2026-05-15 cs.AI 79%

TeachAnything: A Multimodal Crowdsourcing Platform for Training Embodied AI Agents in Symmetrical Reality

教任何事物:一种多模态众包平台,用于在对称现实中的训练具身AI代理

Zidong Liu, Rongkai Liu, Yue Li, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文提出TeachAnything平台,通过多模态示范信号整合三阶段示范范式,实现跨场景、任务和具身的多样化示范数据收集,为对称现实中的具身AI代理开发提供实用基础。

Comments 5 pages, 3 figures. Accepted as an IEEE VR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14016 2026-05-15 cs.SE cs.SD 79%

Case Studies and Reflections on Agentic Software Engineering for Rapid Development of Digital Music Instruments

代理软件工程在快速开发数字音乐乐器中的案例研究与反思

Matthew John Yee-King

机构 * Computing, Goldsmiths(Goldsmiths 计算学系)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.SE

AI总结 本文通过三个案例研究展示代理软件工程在开发数字音乐乐器中的应用,探讨其降低入门门槛和提升软件兼容性与可持续性的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01847 2026-05-15 cs.AI 79%

NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles

NeuroState-Bench:一个用于LLM代理配置承诺完整性的校准基准

Xiao Jia

机构 * School of Artificial Intelligence(人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 NeuroState-Bench通过定义的侧查询探针而非隐激活来操作承诺完整性,包含144个确定性任务和306个侧查询探针,通过人类校准验证任务成功与承诺完整性之间的差异。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14126 2026-05-15 cs.LG cs.AI 73%

Reinforcement Learning for Tool-Calling Agents in Fast Healthcare Interoperability Resources (FHIR)

用于快速医疗互操作资源(FHIR)的强化学习工具调用代理

Marius S. Knorr, Robert Müller, Jan P. Bremer, Nils Schweingruber

机构 * IDM gGmbH, University Medical Center Hamburg-Eppendorf, Hamburg, Germany(IDM公司,汉堡埃彭多夫大学医疗中心,德国汉堡)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在FHIR中通过强化学习提升多轮推理性能,采用自定义环境和工具训练模型,提升回答准确性至77%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14237 2026-05-15 cs.AI 70%

Good to Go: The LOOP Skill Engine That Hits 99% Success and Slashes Token Usage by 99% via One-Shot Recording and Deterministic Replay

Good to Go:LOOP技能引擎:通过一次录制和确定性重放实现99%的成功率并减少99%的token使用

Xiaohua Wang, Kai Yu, XuXiao Liang, Liang Wang, Chao Han

机构 * Artificial Intelligence Research Center, Bengbu Medical University(蚌埠医科大学人工智能研究中心) CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物科技有限公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 LOOP技能引擎通过一次录制和确定性重放,实现99%的成功率和99%的token减少,解决重复周期性任务中大语言模型的不确定性与高成本问题。

Comments 8 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20984 2026-05-15 cs.CR cs.LG 70%

ACE: A Security Architecture for LLM-Integrated App Systems

ACE:用于集成大语言模型的应用系统的安全架构

Evan Li, Tushin Mallick, Evan Rose, William Robertson, Alina Oprea, Cristina Nita-Rotaru

机构 * Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出ACE架构,通过分离规划阶段提升LLM集成应用系统的安全性和可用性,验证其在对抗性攻击中的有效性。

Comments 25 pages, 13 figures, 8 tables; accepted by Network and Distributed System Security Symposium (NDSS) 2026

Journal ref Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14744 2026-05-15 cs.CL cs.AI cs.CY 62%

Mechanical Enforcement for LLM Governance:Evidence of Governance-Task Decoupling in Financial Decision Systems

针对LLM治理的机械执行:在金融决策系统中治理-任务解耦的证据

José Manuel de la Chica Rodríguez, Carlos Martí-González

机构 * Santander AI Lab(Santander AI实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出五种治理指标,用于评估政策在决策理由层面的合规性,并在合成银行领域比较纯文本治理与机械执行的效果,发现机械执行能显著提升决策信息内容和任务准确性,表明治理与任务评估是两个独立的维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14501 2026-05-15 eess.SY cs.AI cs.LG cs.SY 62%

Fully Dynamic Rebalancing in Dockless Bike-Sharing Systems via Deep Reinforcement Learning

通过深度强化学习实现无桩自行车共享系统的全动态再平衡

Edoardo Scarpel, Alberto Pettena, Matteo Cederle, Federico Chiariotti, Marco Fabris, Gian Antonio Susto

机构 * University of Padua(帕多瓦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于图的模拟器和马尔可夫决策过程的深度强化学习方法,实现无桩自行车共享系统的全动态再平衡,减少车辆短缺并降低空间不平等。

Comments 6 pages, 5 figures, 1 table, accepted at the 23rd IFAC World Congress, Busan, South Korea, Aug. 23-26, 2026. Open invited track 9-131: "Control and Optimization for Smart Cities"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07833 2026-05-15 cs.LG cs.AI 62%

Gradient Iterated Temporal-Difference Learning

梯度迭代时间差学习

Théo Vincent, Kevin Gerhardt, Yogesh Tripathi, Habib Maraqten, Adam White, Martha White, Jan Peters, Carlo D'Eramo

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出梯度迭代时间差学习方法,通过计算移动目标的梯度提升学习速度,对比半梯度方法在Atari游戏等基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14034 2026-05-15 cs.AI cs.CL cs.CY 62%

From Descriptive to Prescriptive: Uncover the Social Value Alignment of LLM-based Agents

从描述性到规范性:揭示基于大语言模型的智能体的社会价值对齐

Jinxian Qu, Qingqing Gu, Teng Chen, Luo Ji

机构 * Geely AI Lab(Geely人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于价值的框架,利用GraphRAG将原则转化为价值指令,通过检索合适指令引导智能体行为,基于马斯洛需求层次和普鲁奇克情感轮理论评估预期行为,实验显示在DAILYDILEMMAS基准上优于基线方法。

Comments Accepted by CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏