arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 172 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 172 篇

2604.14401 2026-08-13 cs.AI cs.DB 版本更新 70%

Credo: Declarative Control of LLM Pipelines via Beliefs and Policies

Credo:通过信念和策略实现LLM流水线的声明式控制

Duo Lu, Andrew Crotty, Uğur Çetintemel

机构 * Brown University(布朗大学) Northwestern University(西北大学)

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出Credo,通过声明式策略和信念管理LLM流水线的决策,实现可适应、可审计和可组合的执行。

Comments VLDB 2026 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11953 2026-08-10 cs.LG 版本更新 70%

When Does Reward Teach State? A Hidden-Automaton Instrument and a Group-Language Warning Signal

奖励何时能引导对状态的理解?一种隐藏自动机工具与群语言边界

James E. Allchin

专题命中 记忆与上下文管理 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 研究强化学习中高奖励与潜在状态理解的关系,通过将任务表示为隐藏自动机,利用三个可控轴(优化器强度、任务结构、观察信息量)来分别测量奖励成功和潜在状态学习,区分感知差距和规划差距,得出高奖励非任务理解证据且智能体恢复潜在状态可预测的结论。

Comments 17 pages, 3 figures, 6 tables (9-page main text). Ancillary file hidden-automata-rl-code.zip contains reproduction code and the complete per-run data behind every table and figure. v3: author name corrected, title revised, text rewritten for clarity, new robustness checks (nonlinear and off-policy probes) added; results and conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01707 2026-08-07 cs.CL cs.DB 版本更新 70%

Memory in the LLM Era: Modular Architectures and Strategies in a Unified Framework

在大语言模型时代:在统一框架下的模块化架构与策略

Yanchen Wu, Tenghui Lin, Yingli Zhou, Fangyuan Zhang, Qintian Guo, Xun Zhou, Sibo Wang, Xilin Liu, Yuchi Ma, Yixiang Fang

机构 * Huawei Cloud(华为云)

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文在统一框架下系统比较了多种记忆方法,设计出优于现有方法的新方法,并探讨了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10526 2026-07-28 cs.AI 版本更新 70%

Agents Don't Just Agree, They Remember: Benchmarking Persistent Sycophancy in Stateful Personal Agents

智能体不仅会认同,还会记忆:对有状态个人智能体中持续谄媚行为的基准测试

Xutao Mao, Liangjie Zhao, Leyao Wang, Rui Qian, Qiang Huang, Wentao Wang, Bo Han, Xiang Zheng, Cong Wang

机构 * City University of Hong Kong(香港城市大学) ByteDance(字节跳动) Yale University(耶鲁大学) Fudan University(复旦大学) Hong Kong Baptist University(香港浸会大学) Dalian University of Technology(大连理工大学)

专题命中 记忆与上下文管理 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 研究有状态个人智能体中的持续谄媚行为,引入PASB基准测试,评估真实智能体。通过特定方法隔离写入过程,发现提交边界是关键转折点,提交声明有三种模式,表明智能体谄媚行为是状态写入治理问题,PASB确定相关写入时控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04268 2026-07-27 cs.LG physics.ao-ph 版本更新 70%

Replacing Tunable Parameters in Weather and Climate Models with State-Dependent Functions using Reinforcement Learning

用强化学习替代天气和气候模型中的可调参数以状态依赖函数

Pritthijit Nath, Sebastian Schemm, Henry Moss, Peter Haynes, Emily Shuckburgh, Mark J. Webb

机构 * Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系) School of Mathematical Sciences, Lancaster University(兰卡斯特大学数学科学学院) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系) Met Office Hadley Centre(英国气象局哈德利中心)

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文通过强化学习在线学习天气和气候模型中的参数方案,展示了在简化测试环境中,强化学习在气候偏差校正、辐射-对流平衡和纬向平均能量平衡模型中的应用,证明了强化学习在改进模型性能方面的有效性。

Comments 79 pages, 24 figures

Journal ref Journal of Advances in Modeling Earth Systems (JAMES) 18 (8), e2026MS005745

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19532 2026-06-25 cs.LG 版本更新 70%

Fox in the Henhouse: Supply-Chain Backdoor Attacks Against Reinforcement Learning

狐狸进鸡窝:针对强化学习的供应链后门攻击

Shijie Liu, Andrew C. Cullen, Paul Montague, Sarah Erfani, Benjamin I. P. Rubinstein

机构 * School of Computing and Information Systems, University of Melbourne, Parkville, Australia(墨尔本大学计算机与信息系统学院,墨尔本,澳大利亚)

专题命中 记忆与上下文管理 :agent(abstract);workflow(abstract);分类 cs.LG

AI总结 提出SCAB攻击,通过污染仅3%的训练经验即可激活超过90%的触发动作,使受害者平均每轮回报降低80%,揭示了强化学习供应链中的后门攻击风险。

Comments Forty-Third International Conference on Machine Learning (ICML2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04329 2026-06-23 cs.CR cs.AI 版本更新 70%

From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents

从不可信输入到可信内存:LLM智能体中内存投毒攻击的系统研究

Pritam Dash, Tongyu Ge, Aditi Jain, Tanmay Shah, Zhiwei Shang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文系统研究了基于LLM的智能体中的内存投毒攻击,识别了四种内存写入通道和九种结构漏洞,提出了六类攻击的分类法,并设计了评估基准MPBench,发现更积极读写内存的智能体更易被利用,且现有提示注入防御无法覆盖内存投毒攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15966 2026-06-16 cs.AI 版本更新 70%

PISA: A Pragmatic Psych-Inspired Unified Memory System for Enhanced AI Agency

PISA:一种增强AI能动性的实用心理学启发统一记忆系统

Shian Jia, Ziyang Huang, Xinbo Wang, Haofei Zhang, Mingli Song

机构 * Zhejiang University(浙江大学)

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 受皮亚杰认知发展理论启发,提出PISA统一记忆系统,通过三模态适应机制(模式更新、演化、创建)和混合记忆访问架构,显著提升AI代理的适应性和长期知识保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18388 2026-06-09 cs.AI cs.MA 版本更新 70%

Reflection in the Dark: Exposing and Escaping the Black Box in Reflective Prompt Optimization

暗箱中的反射:在反射提示优化中揭示并逃离黑箱

Shiyan Liu, Qifeng Xia, Qiyun Xia, Yisheng Liu, Xinyu Yu, Rui Qu

机构 * University of California, Berkeley(加州大学伯克利分校) Huazhong University of Science and Technology(华中科技大学) Hefei University of Technology(合肥工业大学)

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出VISTA框架,通过解耦假设生成与提示重写,实现可解释的提示优化,有效解决GEPA在缺陷种子下的性能下降问题。

Comments Accepted at ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06257 2026-08-11 cs.CV cs.HC 版本更新 67%

MASS: Multiplayer World Models with Authoritative Shared State

MASS:具有权威共享状态的多人世界模型

Ziqi Cai, Siqi Yang, Yimu Wang, Zixian Gao, Yunheng Liu, Shuchen Weng, Erwin Wu, Kaipeng Zhang, Boxin Shi

机构 * Alaya Lab(Alaya实验室) Peking University(北京大学) Institute of Science Tokyo(东京科学大学)

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract)

AI总结 该研究提出MASS模型,通过将世界动态与视图渲染解耦,解决现有视频世界模型在多人环境中的缺陷,在多人Snake基准测试中实现更优状态精度,为多智能体世界模拟提供实用基础。

Comments Project Page: https://alaya-lab.github.io/MASS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01952 2026-08-11 cs.CL cs.AI cs.LG 版本更新 67%

WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks

WebChoreArena:在现实繁琐网页任务上评估网页浏览智能体

Atsuyuki Miyai, Zaiying Zhao, Kazuki Egashira, Atsuki Sato, Tatsumi Sunada, Shota Onohara, Hiromasa Yamanishi, Mashiro Toyooka, Kunato Nishina, Ryoma Maeda, Kiyoharu Aizawa, Toshihiko Yamasaki

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出WebChoreArena,作为WebArena的扩展,包含532个耗时300多小时开发的繁琐网页任务,从大规模记忆、计算、长期记忆三维度评估网页浏览智能体,实验显示其能清晰衡量LLM进展且难度高于WebArena。

Comments COLM2026. Project Page: https://webchorearena.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14516 2026-07-22 cs.DC 版本更新 67%

Efficient Multi-round LLM Inference over Disaggregated Serving

高效多轮LLM推理的解耦服务

Wenhao He, Youhe Jiang, Penghao Zhao, Quanqing Xu, Eiko Yoneki, Bin Cui, Fangcheng Fu

专题命中 记忆与上下文管理 :autonomous agent(abstract);planning(abstract)

AI总结 AMPD通过自适应协调预填充和解码工作负载,提升多轮LLM推理的服务级别目标达成率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29247 2026-06-18 cs.CL cs.AI cs.LG 版本更新 67%

MemRerank: Preference Memory for Personalized Product Reranking

MemRerank:用于个性化产品重排序的偏好记忆

Zhiyuan Peng, Xuyang Wu, Huaixiao Tou, Yi Fang, Yu Gong

机构 * Santa Clara University(圣克拉拉大学) Independent Researcher(独立研究者)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出MemRerank框架,通过强化学习将用户购买历史提炼为查询无关的偏好记忆,用于LLM购物代理的个性化重排序,在1-in-5选择任务中准确率提升高达10.61个百分点。

Comments correct author name in metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19838 2026-06-17 cs.AI cs.CL cs.LG 版本更新 67%

Branch-and-Browse: Efficient and Controllable Web Exploration with Tree-Structured Reasoning and Action Memory

Branch-and-Browse:具有树状推理与动作记忆的高效可控网页探索

Shiqi He, Yue Cui, Xinyu Ma, Yaliang Li, Bolin Ding, Mosharaf Chowdhury

机构 * University of Michigan(密歇根大学) Alibaba Group(阿里巴巴集团) McMaster University(麦马斯特大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出Branch-and-Browse框架,通过树状结构化推理、网页状态重放和页面动作记忆,实现LLM网页代理的高效可控多分支探索,在WebArena上成功率35.8%,执行时间降低40.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05895 2026-06-12 math.PR 版本更新 67%

Diffusion approximations for interacting stochastic systems with reflection and control

具有反射和控制的交互随机系统的扩散近似

Thoa Thieu, Roderick Melnik

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract)

AI总结 研究一类具有反射和控制的交互随机系统的扩散近似,通过扩散缩放建立到Ornstein-Uhlenbeck型反射随机微分方程组的分布收敛,并用数值例子展示在人群动力学和神经群体动力学中的应用。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18271 2026-06-10 cs.CL cs.AI cs.IR cs.LG 版本更新 67%

From Volume to Value: Preference-Aligned Memory Construction for On-Device RAG

从体积到价值:面向设备端RAG的偏好对齐记忆构建

Changmin Lee, Jaemin Kim, Taesik Gong

机构 * Department of Computer Science and Engineering, Ulsan National Institute of Science and Technology (UNIST), Ulsan, Republic of Korea(计算机科学与工程系,全州国立科学与技术研究所(UNIST),全州,韩国)

专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出EPIC方法,通过将用户偏好作为紧凑且稳定的个人上下文形式,整合到RAG流程中,以在有限内存下提高检索与用户偏好的对齐度,从而减少内存使用并提升准确性。

Comments Accepted to ICML 2026. Code and data are available at https://github.com/UbiquitousAILab/EPIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00238 2026-06-09 cs.CL cs.AI cs.LG 版本更新 67%

DIVERGE: Diversity-Enhanced RAG for Open-Ended Information Seeking

DIVERGE: 面向开放式信息检索的多样性增强RAG

Tianyi Hu, Niket Tandon, Akhil Arora

机构 * Aarhus University(奥胡斯大学) Microsoft Research(微软研究院)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对现有RAG系统忽略开放式信息检索中多样性需求的问题,提出Diverge框架,通过迭代反思引导的多样化视角探索和多样性感知检索支持,在保持质量的同时将多样性提升约2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15125 2026-06-08 cs.CR 版本更新 67%

From Storage to Steering: Memory Control Flow Attacks on LLM Agents

从存储到操控:针对LLM代理的内存控制流攻击

Zhenlin Xu, Xiaogang Zhu, Yu Yao, Minhui Xue, Yiliao Song

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract)

AI总结 本文研究了内存控制流攻击对LLM代理的影响,提出MEMFLOW框架以系统识别和量化此类攻击,发现超过90%的测试在严格安全约束下仍易受攻击,揭示了严重的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29668 2026-08-17 cs.AI cs.CL 版本更新 62%

GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents

GRASP: 门控回归感知技能提议器用于自我改进的LLM智能体

Johannes Moll, Jean-Philippe Corbeil, Jiazhen Pan, Martin Hadamitzky, Daniel Rueckert, Lisa Adams, Keno Bressem

机构 * Technical University of Munich and TUM University Hospital(慕尼黑技术大学及慕尼黑大学医院) Microsoft Healthcare & Life Sciences(微软医疗与生命科学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出GRASP方法,通过门控回归感知技能库编辑,在硬回归预算下确保每次技能更新带来净改进,显著提升LLM智能体在结构化环境中的操作可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09538 2026-08-14 cs.CL cs.AI 版本更新 62%

TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

TCS-BENCH:评估最先进生成式AI理论计算机科学研究能力的基准

Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland, Max Springer, Julien Canitrot-Paradis, Honghao Lin, David Woodruff, Adarsh Kumarappan, Rajesh Jayaram, Rudrajit Das, Lalit Jain, Ola Svensson, Silvio Lattanzi, Mislav Balunovic, Theophane Weber, Vahab Mirrokni

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究人员推出TCS-Bench基准,基于STOC、FOCS、SODA论文的定理证明任务评估LLMs,结合验证智能体,参考验证器在专家标注集准确率超90%,为评估生成式AI的TCS研究能力提供工具

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06793 2026-08-10 cs.LG cs.AI 版本更新 62%

Minimal Ingredients for Reward Assignment from Expert Demonstrations

从专家演示中进行奖励分配的最小要素

Zixuan Dong, Yumi Omori, Keith Ross

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎赫尔分校) Shanghai Frontiers Science Center of Artificial Intelligence and Deep Learning, NYU Shanghai(上海前沿科学中心(人工智能与深度学习))

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究探究从专家演示分配奖励的最小结构,通过32个基准测试和三种下游RL算法,发现离线场景仅需接近度,在线或多演示时需轻量级时间对应,倡导奖励设计的算法极简主义。

Comments Accepted by Reinforcement Learning Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04421 2026-08-06 cs.AI cs.LG 版本更新 62%

Trivium: Temporal Regret as a First-Class Objective for Causal-Memory Controllers

Trivium: 时间遗憾作为因果记忆控制器的一等目标

Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将长期时间遗憾作为一等目标,与结果遗憾和认知遗憾共同构成因果记忆控制器的可证伪失败分析框架,证明时间校准偏差在对结果遗憾为零时仍线性增长,而基于持久因果日志的探测复杂度为对数级。

Comments Note on version 2 (closure). This version corrects errors in v1. The use of the term "regret'' also caused confusion because the quantities defined here are not standard comparator-based online-learning regret. Subsequent work will use "liability'' or "debt'' to be clear

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25538 2026-08-04 cs.LG cs.SE 版本更新 62%

ARMOR: A Robust Self-Supervised Framework for Root Cause Analysis in Microservices under Missing Modality

面向缺失数据的多模态融合用于统一微服务故障管理

Wenzhuo Qian, Hailiang Zhao, Ziqi Wang, Zhipeng Gao, Jiayi Chen, Zhiwei Ling, Shuiguang Deng

机构 * Zhejiang University(浙江大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG、cs.SE

AI总结 本文提出ARMOR框架,通过自监督学习解决微服务故障管理中多模态数据缺失问题,提升异常检测、故障分类和根本原因定位的性能。

Comments Accepted by the Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), 2026. This is the authors' version of the work; the definitive Version of Record is forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05976 2026-08-03 cs.AI cs.CL 版本更新 62%

The Self-Correction Illusion: Role Relabeling Gates Explicit Error Flagging in Large Language Models

自我修正错觉:LLM 纠正他人但不纠正自己

Kuan-Yen Chen, Fang-Yi Su, Shih-Yen Lin, Bao Li, Jung-Hsien Chiang

机构 * National Taiwan University(国立台湾大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过保持错误声明字节一致仅改变角色标签,发现 LLM 无法自我修正并非能力缺陷,而是聊天模板角色标签的人为产物,并提出无需训练或模型修改的提示结构干预方法。

Comments 15 pages, 3 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16986 2026-07-30 cs.CL cs.AI 版本更新 62%

Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents

Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents

Jingxing Wang, Chenyu Zhou, Zhihui Fu, Jun Wang, Weiwen Liu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种在测试时自适应的技能合成方法SkillTTA,通过检索与当前任务相关的少量训练轨迹并将其合成成为任务特定的文本技能,以提高LLM代理在SpreadsheetBench、ALFWorld和BigCodeBench等任务上的性能。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22142 2026-07-29 cs.LG cs.AI 版本更新 62%

Short-Term-to-Long-Term Memory Transfer for Knowledge Graphs under Partial Observability

知识图谱下的短期到长期记忆转移:在部分可观测性下的短期到长期记忆转移

Taewoon Kim, Vincent François-Lavet, Michael Cochez

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在部分可观测性下知识图谱中的短期到长期记忆转移问题,提出了一种基于神经符号价值决策的方法,通过在长期插入前决定保留或丢弃观察到的三元组,从而提升记忆效率,并在RoomKG基准测试中优于符号和神经基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24035 2026-07-29 cs.RO cs.AI cs.LG 版本更新 62%

A context-adaptive policy framework for robust and reactive robotic manipulation via uncertainty-aware imitation learning

一种通过不确定性感知模仿学习实现鲁棒且反应式机器人操作的上下文自适应策略框架

Tim R. Winter, Leonard Klüpfel, Ashok M. Sundaram, Werner Friedl, Maximo A. Roa, Freek Stulp, João Silvério

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究如何生成适应变化的机器人操作策略,基于策略融合与不确定性量化提出上下文自适应框架,用LfD获取策略并结合MoE提升鲁棒性,在多种场景下评估该方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14593 2026-07-20 cs.HC cs.AI cs.CL 版本更新 62%

Memory-Driven Self-Disclosure and Relational Turning Points: A Longitudinal Multimodal Study of Human-AI Interaction

记忆驱动的自我表露与关系转折点:人机交互的纵向多模态研究

Ryuichi Sumida, Mao Saeki, Masaki Eguchi, Sadahiro Yoshikawa, Koji Inoue, Tatsuya Kawahara, Yoichi Matsuyama

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科) Equmenopolis, Inc.(Equmenopolis公司) Waseda University(早稻田大学) School of Informatics, Kyoto University(京都大学信息学系)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究通过纵向多模态研究,探讨对话式人工智能系统中交互如何发展为关系。核心方法是让参与者对五个关系构建要素评分,发现对话质量影响当下愉悦感,感知记忆受关系制约,关系有崩溃和激增等转折点,揭示了人机关系建立的方式。

Comments 15 pages, 3 figures. Accepted to ICMI 2026 (International Conference on Multimodal Interaction), October 5-9, 2026, Napoli, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09276 2026-07-08 cs.LG cs.AI 版本更新 62%

Learning The Minimum Action Distance

学习最小动作距离

Lorenzo Steccanella, Joshua B. Evans, Özgür Şimşek, Anders Jonsson

机构 * Department of Information and Communication Technologies, Universitat Pompeu Fabra(信息与通信技术系,庞培法华大学) Department of Computer Science, University of Bath(计算机科学系,巴斯大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于状态轨迹学习的马尔可夫决策过程状态表示框架,通过学习最小动作距离(MAD)来捕捉环境结构,有效支持目标引导强化学习和奖励塑造。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11512 2026-07-07 cs.LG cs.AI cs.IT math.IT 版本更新 62%

TERC: A Transfer Entropy Redundancy Criterion for State Variable Selection in Reinforcement Learning

TERC:一种用于强化学习状态变量选择的转移熵冗余准则

Charles Westphal, Stephen Hailes, Mirco Musolesi

机构 * UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TERC准则,用于选择强化学习中的最优状态变量,通过信息理论方法排除冗余变量,提升推理效率,适用于多种算法和环境。

Comments 47 pages, 12 figures, accepted in TMLR (https://openreview.net/forum?id=J0ad21E0vX)

详情

展开后加载摘要…

URL PDF HTML 收藏