arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-05 至 2026-06-05 共收录 185 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 12 篇

2606.05647 2026-06-05 cs.AI cs.CL cs.CY cs.HC 87%

Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage?

与“敌人”编码:人类开发者能否检测到AI代理的破坏行为?

Jingheng Ye, Huiqi Zou, Simon Yu, Weiyan Shi

机构 * Northeastern University(东北大学)

专题命中 软件智能体 :agent(title,abstract);AI agent(title);分类 cs.AI、cs.CL

AI总结 通过大规模用户实验,研究人类开发者在长时间编码任务中检测AI代理恶意代码插入的能力,发现94%的开发者未能识别破坏,并分析其原因,提出安全监控设计建议。

Comments 34 pages, 30 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05391 2026-06-05 cs.SE cs.AI 84%

Human oversight of agentic systems in practice: Examining the oversight work, challenges, and heuristics of developers using software agents

实践中对智能体系统的人类监督:考察使用软件代理的开发者的监督工作、挑战与启发式方法

Shipi Dhanorkar, Samir Passi, Mihaela Vorvoreanu

机构 * Microsoft Redmond USA(微软红mond美国)

专题命中 软件智能体 :agentic(title);agent(abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 通过访谈17位经验丰富的开发者,探索人类对自主软件代理的监督实践,发现四种监督工作形式(先验控制、协同规划、实时监控、事后审查),并总结监督挑战与应对策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11732 2026-06-05 cs.IR cs.CL cs.MA cs.MM 77%

AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research Agents

AgentDisCo: 向开放深度研究代理中的解耦与协作迈进

Jiarui Jin, Zexuan Yan, Shijian Wang, Wenxiang Jiao, Yuan Lu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 软件智能体 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出AgentDisCo,一种解耦且协作的代理架构,将深度研究视为信息探索与利用之间的对抗优化问题。通过批评代理评估生成的草稿并优化搜索查询,生成代理检索更新结果并修订草稿,最终生成综合报告。该框架通过元优化 harness 支持手工和自动发现的设计策略,并利用强大的代码生成代理自完善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26233 2026-06-05 cs.CL 70%

Ask or Assume? Uncertainty-Aware Clarification-Seeking in Coding Agents

提问还是假设?编码代理中的不确定性意识澄清寻求

Nicholas Edwards, Sebastian Schuster

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本研究评估了LLM代理在未指定任务中的澄清能力,提出了一种不确定性意识的多代理框架,提高了任务解决率,并展示了多代理系统在复杂任务中主动寻求信息的行为。

Comments 18 pages, 7 figures; added experiments evaluating open-weight models (Kimi K2.6), expanded related work, and included dataset validation details

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05920 2026-06-05 cs.SE cs.CL 62%

Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement

Asuka-Bench: 针对未明确用户意图与多轮优化的代码智能体基准测试

Xin Wang, Liangtai Sun, Yaoming Zhu, Shuang Zhou, Jiaxing Liu, Fengjiao Chen, Lin Qiu, Xuezhi Cao, Xunliang Cai, Licheng Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Independent researchers(独立研究人员)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 提出Asuka-Bench基准,通过未明确用户意图与多轮优化闭环评估代码智能体,包含50个网页任务和784个评估标准,揭示模型间显著性能差异。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05720 2026-06-05 cs.SE cs.AI 62%

Microskill Architecture: A Modular Skill-Driven Framework for AI-Native Code Generation

微技能架构:一种面向AI原生代码生成的模块化技能驱动框架

Mohammad Zare, Omid Abdolrahmani

机构 * Artificial Intelligence Laboratory at AriooBarzan(AriooBarzan人工智能实验室) Engineering Team, Shiraz, Iran(伊朗谢尔兹工程团队)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出微技能架构,通过将知识封装为原子技能胶囊并动态选择相关胶囊,解决AI代码生成中的上下文窗口管理问题,显著降低token消耗、提高编译成功率并消除架构违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05570 2026-06-05 cs.CL cs.AI 62%

TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework

TensorBench: 在基于编译器的张量框架上对编码智能体进行基准测试

Bobby Yan, Fredrik Kjolstad

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出 TensorBench,一个包含199个特征添加和重构任务的基准测试,用于评估编码智能体在基于编译器的张量框架上的表现,并通过测试套件自动评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05564 2026-06-05 cs.CL 57%

Using Large Language Models to Support High Volume Application Review for an Undergraduate Research Program

使用大型语言模型支持本科研究项目的高容量申请评审

Varun Aggarwal, Kay Kobak, John Howarter

机构 * Engineering Undergraduate Research Office, Purdue University(普渡大学本科生研究办公室) Elmore School of Electrical and Computer Engineering, Purdue University(普渡大学电子与计算机工程学院) School of Materials Engineering, Purdue University(材料工程学院)

专题命中 软件智能体 :workflow(abstract);分类 cs.CL

AI总结 本研究开发并部署基于GPT模型(GPT-4o、GPT-5-mini、GPT-5.2)的工具,对普渡大学SURF项目约1200份目的陈述进行自动化评分与理由注释,将评审时间从数周缩短至约4小时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09192 2026-06-05 cs.AI 57%

Evidence Over Plans: Online Trajectory Verification for Skill Distillation

证据与计划:用于技能蒸馏的在线轨迹验证

Yang Zhou, Zihan Dong, Zhenting Wang, Can Jin, Shiyu Zhao, Bangwei Guo, Difei Gu, Linjun Zhang, Mu Zhou, Dimitris N. Metaxas

机构 * Rutgers University(罗杰斯大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于轨迹的后验蒸馏指数(PDI)来评估技能与任务环境证据的契合度,通过SPARK框架实现环境验证轨迹的生成,从而提升技能的效率和可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05518 2026-06-05 cs.DC 50%

Latent Reasoning Guidance for Parallel Code Translation

并行代码翻译的潜在推理引导

Tomer Bitan, Erel Kaplan, Roee Bar-Yadin, Lian Ghrayeb, Le Chen, Samyak Jhaveri, Niranjan Hasabnis, Gal Oren

专题命中 软件智能体 :autonomous agent(abstract)

AI总结 提出一种在测试时使用过程奖励模型(PRM)对连续潜在前缀进行评分,以在最终代码解码前选择替代隐藏状态轨迹的方法,从而提升并行代码翻译的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05397 2026-06-05 quant-ph 50%

Multi-Qubit Dyadic Phase Fixing for Fault-Tolerant Quantum Compilation

用于容错量子编译的多量子比特二元相位固定

Justin Kalloor, Mathias Weiden, Ed Younis, John Kubiatowicz, Costin Iancu

专题命中 软件智能体 :workflow(abstract)

AI总结 提出一种名为二元相位固定(DPF)的多量子比特合成工具,通过数值酉合成贪婪提取二元角度旋转,结合决策矩阵自动调整相位梯度寄存器大小,在多种基准测试中实现T计数减少高达70%,并降低表面码架构中的时空体积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30507 2026-06-05 cs.PF cs.DC cs.PL 50%

A Virtual Processor brings back the Free Lunch

虚拟处理器重现免费午餐

Haymo Kutschbach

专题命中 软件智能体 :agent(abstract)

AI总结 提出一种自优化的虚拟处理器,通过去中心化的协作执行段网络,在运行时自动并行化数值数组程序,无需开发者手动设计并行策略。

Comments 10 pages + appendix (3 pages), 7 figures, 4 benchmarks at https://github.com/hokb/decentralized-array-execution-artifacts2026 (GitHub) or https://doi.org/10.5281/zenodo.20407801 (DOI Zenodo)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 5 篇

2601.09923 2026-06-05 cs.AI 77%

CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents

CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents

Hanna Foerster, Tom Blanchard, Kristina Nikolić, Ilia Shumailov, Cheng Zhang, Robert Mullins, Nicolas Papernot, Florian Tramèr, Yiren Zhao

机构 * University of Cambridge(剑桥大学) University of Toronto & Vector Institute(多伦多大学及向量研究所) ETH Zurich(苏黎世联邦理工学院) AI Security Company(人工智能安全公司)

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种系统级安全方法,用于计算机使用代理(CUAs),通过单次规划和NOVA框架在动态UI状态下提供控制流完整性保障,同时在保持性能的同时提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02031 2026-06-05 cs.LG cs.AI cs.CL cs.CV 67%

OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents

OpenWebRL: 揭秘视觉网络代理的在线多轮强化学习

Rui Yang, Qianhui Wu, Yuxi Chen, Hao Bai, Wenlin Yao, Hao Cheng, Baolin Peng, Huan Zhang, Tong Zhang, Jianfeng Gao

机构 * UIUC(伊利诺伊大学香槟分校) Microsoft(微软)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出OpenWebRL框架,通过在线多轮强化学习在真实网站上训练视觉网络代理,以4B参数模型在基准测试中达到开源最优,并与闭源系统竞争。

Comments 36 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06147 2026-06-05 cs.AI 57%

WorldFly: A World-Model-Based Vision-Language-Action Model for UAV Navigation

WorldFly: 基于世界模型的视觉-语言-动作模型用于无人机导航

Shengtao Zheng, Kai Li, Weichen Zhang, Yu Meng, Chen Gao, Xinlei Chen, Yong Li, Xiao-Ping Zhang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) BNRist, Tsinghua University(清华大学北京研究院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出WorldFly框架,通过双分支耦合流匹配机制联合生成未来视频预测和导航动作,解决城市峡谷中严重遮挡和视角剧变下的无人机导航问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10971 2026-06-05 cs.RO cs.AI 57%

ContactExplorer: Contact Coverage-Guided Exploration for General-Purpose Dexterous Manipulation

ContactExplorer: 接触覆盖引导的通用灵巧操作探索

Zixuan Liu, Ruoyi Qiao, Chenrui Tie, Xuanwei Liu, Yunfan Lou, Chongkai Gao, Zhixuan Xu, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) RoboScience(机器人科学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出ContactExplorer方法,通过接触覆盖奖励和能量引导奖励,在灵巧操作任务中高效探索接触模式,提升样本效率和成功率。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02192 2026-06-05 cs.RO 50%

Do We Really Need Immediate Resets? Rethinking Collision Handling for Efficient Robot Navigation

我们真的需要立即重置吗?重新思考高效机器人导航的碰撞处理

Shanze Wang, Xinming Zhang, Siwei Cheng, Xianghui Wang, Changwen Chen, Hailong Huang, Wei Zhang

机构 * College of Information Science and Technology, Eastern Institute of Technology(信息科学与技术学院,东部技术学院) Department of Aeronautical and Aviation Engineering, The Hong Kong Polytechnic University(航空与航空工程系,香港理工大学) Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学) School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) Department of Mechanical Engineering, The Hong Kong Polytechnic University(机械工程系,香港理工大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对机器人导航中每次碰撞立即重置环境的惯例,提出多碰撞重置预算(MCB)框架,通过将局部碰撞终止与全局环境重置解耦,允许智能体在同一回合内重试困难配置,从而提高早期学习效率。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 13 篇

2606.05250 2026-06-05 cs.SE 90%

Towards Persistent Case-Based Memory for Autonomous Data Science: A CBR-Augmented R&D-Agent with a Locally Deployable Small Language Model

面向自主数据科学的持久化案例记忆:一种CBR增强的R&D-Agent与本地可部署的小语言模型

Felix Stocker

专题命中 记忆与上下文管理 :agent(title,title_cn);分类 cs.SE

AI总结 本文提出一种CBR增强的R&D-Agent,通过持久化案例库和小语言模型Gemma 4 31B Dense,在Kaggle竞赛中实现方向性精度提升和方差降低。

Comments 14 pages, 8 figures, 8 tables; preprint, not submitted to any venue; code available at https://github.com/stofe94/cbr-rd-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05749 2026-06-05 cs.CL cs.AI 84%

MARDoc: A Memory-Aware Refinement Agent Framework for Multimodal Long Document QA

MARDoc:面向多模态长文档问答的记忆感知精炼智能体框架

Kaifeng Chen, Hongtao Liu, Qiyao Peng, Jian Yang, Yongqiang Liu, Xiaochen Zhang, Qing Yang

机构 * Tianjin University(天津大学) Qifu Technology(启福科技) Beihang University(北航) Jiangnan University(江南大学)

专题命中 记忆与上下文管理 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出MARDoc框架,通过解耦为探索、精炼和反思三个智能体,并利用结构化记忆替代完整交互历史,减少上下文噪声,提升多模态长文档问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06240 2026-06-05 cs.DB cs.AI 79%

TOKI: A Bitemporal Operator Algebra for Contradiction Resolution in LLM-Agent Persistent Memory

TOKI: 用于LLM智能体持久化记忆中矛盾消解的双时态算子代数

Ziming Wang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 提出TOKI代数,将四种矛盾消解启发式统一为双时态算子,通过隔离性、模式与溯源三个正确性定理提供写时并发控制契约,并证明审计行防御在LoCoMo任务上的有效性。

Comments 43 pages including full appendices (proofs, protocols, and reproducibility ledger). Code, data, and reproducibility artifact: https://github.com/ZenAlexa/toki-bitemporal-memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06212 2026-06-05 cs.AI 79%

Evaluating Agentic Configuration Repair for Computer Networks

评估计算机网络中的代理配置修复

Rufat Asadli, Benjamin Hoffman, Ioannis Protogeros, Laurent Vanbever

机构 * Department of Information Technology(信息科技系) Electrical Engineering, ETH Zurich(电子工程,苏黎世联邦理工学院)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI

AI总结 本研究通过结合形式化网络验证和上下文检索工具,评估了开源和闭源大语言模型在代理架构下的配置修复能力,发现代理架构在修复效果和安全性上分别平均提升12%和17%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05743 2026-06-05 cs.CR cs.CL 79%

Membrane: A Self-Evolving Contrastive Safety Memory for LLM Agent Defense

Membrane: 一种用于LLM智能体防御的自演化对比安全记忆

Minseok Choi, Seungbin Yang, Dongjin Kim, Subin Kim, Jungmin Son, Yunseung Lee, Jaegul Choo, Youngjun Kwak

机构 * KAIST AI(韩国科学技术院人工智能实验室) Financial Tech Lab, KakaoBank Corp(Kakao银行金融科技实验室)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL

AI总结 提出Membrane,一种基于对比安全记忆(CSM)的自演化护栏,通过将有害交互及其良性对应物蒸馏为对比单元来防御不断演化的越狱攻击,无需重新训练即可实现高F1和低良性拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05404 2026-06-05 cs.AI cs.CL cs.LG 75%

Harnessing Generalist Agents for Contextualized Time Series

利用通用智能体进行情境化时间序列分析

Zihao Li, Kaifeng Jin, Yuanchen Bei, Jiaru Zou, Avaneesh Kumar, Xuying Ning, Yanjun Zhao, Mengting Ai, Baoyu Jing, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 记忆与上下文管理 :AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出TimeClaw框架,通过集成可执行时间工具、经验驱动能力进化和情景多模态记忆,使通用大语言模型智能体具备情境化时间推理能力,在能源、金融等多领域基准上取得性能提升。

Comments Preprint. 38 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05684 2026-06-05 cs.AI 70%

AdaMEM: Test-Time Adaptive Memory for Language Agents

AdaMEM:语言代理的测试时自适应记忆

Yunxiang Zhang, Yiheng Li, Ali Payani, Lu Wang

机构 * Yunxiang Zhang(张 Yunxiang) Yiheng Li(李 Yiheng) Ali Payani(Payani Ali) Lu Wang(王 Lu)

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出AdaMEM框架,通过混合记忆架构(长期轨迹记忆+动态短期策略记忆)实现测试时自适应,无需在线更新参数,在ALFWorld、WebShop等任务上显著优于静态记忆基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20111 2026-06-05 cs.CL cs.AI cs.LG 67%

ABBEL: Learning Natural-Language Belief States for Memory-Efficient Interaction

ABBEL: 为高效交互学习自然语言信念状态

Aly Lidayan, Jakob Bjorner, Satvik Golechha, Kartik Goyal, Alane Suhr

机构 * University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出ABBEL框架,通过显式自然语言信念状态直接监督每个摘要的信息内容,以解决传统方法在生成摘要时信息丢失或更新错误的问题,从而在保持高效内存使用的同时提升交互性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05513 2026-06-05 cs.AI cs.CL 62%

EpiEvolve: Self-Evolving Agents for Streaming Pandemic Forecasting under Regime Shifts

EpiEvolve:用于制度转变下流式疫情预测的自演化智能体

Yiming Lu, Sihang Zeng, Zhengxu Tang, Max Lau, Fei Liu, Wei Jin

机构 * Emory University(埃默里大学) University of Washington(华盛顿大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对流式疫情预测中标签延迟和制度转变问题,提出自演化智能体EpiEvolve,通过层次化情景记忆、延迟标签反思和制度感知检索,在COVID-19住院趋势预测中达到0.629准确率,并将制度转变后的恢复滞后从5周缩短至2周。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06090 2026-06-05 cs.AI 57%

Beyond Semantic Organization: Memory as Execution State Management for Long-Horizon Agents

超越语义组织:记忆作为长时程智能体的执行状态管理

Yaoqi Chen, Haibin Lai, Yuru Feng, Chuyu Han, Qianxi Zhang, Baotong Lu, Menghao Li, Xinjiang Wang, Zhirui Wang, Shusen Xu, Zengzhong Li, Zewen Jin, Hao Wu, Cheng Li, Qi Chen

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft(微软) Nanjing University(南京大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 针对长时程任务中智能体依赖执行状态而非语义相似性的问题,提出MAGE(记忆作为智能体引导的探索),通过层次状态树管理交互,实现状态完整性和错误隔离,在MemoryArena上任务成功率提升7.8-20.4个百分点,token消耗降低55.1%。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06036 2026-06-05 cs.AI cs.IR 57%

Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents

记忆是重建的,而非检索的:面向LLM智能体的图记忆

Shuo Ji, Yibo Li, Bryan Hooi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 提出MRAgent框架,通过关联记忆图和主动重建机制,使LLM智能体在推理过程中动态调整记忆访问,显著提升长程记忆推理性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05201 2026-06-05 cs.LG 57%

State commitment learning: training language models to distinguish computation from memory

状态承诺学习:训练语言模型区分计算与记忆

Fei Ding, Yongkang Zhang, Runhao Liu, Yuhao Liao, Zijian Zeng, Huiming Yang

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 记忆与上下文管理 :tool-use(abstract);分类 cs.LG

AI总结 提出状态承诺学习目标及反事实擦除强化学习(CERL)方法,通过训练模型区分应保留的持久状态与可丢弃的临时计算,减少推理对隐藏思维的依赖,在数学、长链逻辑、科学问答和多轮工具使用任务中保持准确率的同时降低依赖。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05624 2026-06-05 cs.CV cs.GR 50%

KV-Control: Parameter-Efficient K/V Injection for Trajectory-Controlled Text-to-Motion

KV-Control: 用于轨迹控制文本到运动的参数高效K/V注入

Tengjiao Sun, Pengcheng Fang, Xiaoyu Zhan, Yanwen Guo, Dongjie Fu, Xiaohao Cai, Hansung Kim

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 提出KV-Control,一种紧凑的注意力侧控制接口,通过部分标记化运动基元和轨迹编码器注入键/值记忆,实现精确的轨迹控制而不覆盖预训练的文本条件运动先验。

详情

展开后加载摘要…

URL PDF HTML 收藏