arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-01 至 2026-06-01 共收录 163 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 42 篇

2605.31584 2026-06-01 cs.CL cs.AI cs.LG 82%

LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards

LongTraceRL: 基于评分奖励从搜索智能体轨迹中学习长上下文推理

Nianyi Lin, Jiajie Zhang, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LongTraceRL框架,通过知识图谱随机游走生成多跳问题并利用搜索智能体轨迹构建分层干扰物,结合基于实体链的评分奖励进行过程监督,提升大语言模型在长上下文推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31460 2026-06-01 cs.RO cs.SY eess.SY 82%

On-Device Robotic Planning: Eliminating Inference Redundancy for Efficient Decision-Making

设备端机器人规划:消除推理冗余以实现高效决策

Joonhee Lee, Hyunseung Shin, Hyunmi Kim, Pei Zhang, Jeonggil Ko

机构 * School of Integrated Technology, College of Computing, Yonsei University(延世大学整合技术学院,计算学院) Department of Hyperscale AI SoC Research Section, ETRI(ETRI超大规模AI SoC研究部) EECS - Electrical and Computer Engineering, University of Michigan(密歇根大学电气与计算机工程学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 提出REIS框架,通过场景门控、KV引导的affordance路由和审慎推理减少推理冗余,在保持语义适应性的同时加速机器人控制。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20873 2026-06-01 cs.AI cs.LG 81%

PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models

PlanningBench: 生成可扩展且可验证的规划数据以评估和训练大型语言模型

Ziliang Zhao, Zenan Xu, Shuting Wang, Hongjin Qian, Yan Lei, Minda Hu, Zhao Wang, Shihan Dou, Zhicheng Dou, Pluto Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学校) LLM Department, Hunyuan Team, Tencent(腾讯 Hunyuan 团队 LLM 部门) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出PlanningBench框架,通过约束驱动合成管道生成可扩展、多样化且可验证的规划数据,用于评估和训练LLMs,并验证其在提升规划能力上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31003 2026-06-01 cs.IR 80%

Graph-GRPO: Dependency-Aware Credit Assignment for Generative E-commerce Search Relevance

Graph-GRPO:面向生成式电商搜索相关性的依赖感知信用分配

Jiarui Che, Yifei Chen, Zhixing Tian, Chenyang Wang, Ziguang Cheng

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 提出Graph-GRPO,一种基于图结构的GRPO扩展,通过构建推理依赖图并传播结果级奖励实现细粒度信用分配,提升电商搜索相关性建模。

Comments 11 pages, 2 figures, 2 tables. Submitted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31492 2026-06-01 cs.AI 79%

LinTree: Improving LLM Reasoning with Explicitly Structured Search Histories

LinTree: 通过显式结构化搜索历史提升LLM推理能力

Liwei Kang, Yee Whye Teh, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对LLM推理中隐式搜索树导致性能不佳的问题,提出LinTree方法,通过添加父指针显式表示线性化树结构,在Blocks World、网格导航和Sokoban任务中提升了任务性能和搜索效率。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00068 2026-06-01 cs.CY cs.AI 79%

The Global Landscape of Environmental AI Regulation: From the Cost of Reasoning to a Right to Green AI

环境AI监管的全球格局:从推理成本到绿色AI权利

Kai Ebert, Boris Gamazaychikov, Philipp Hacker, Sasha Luccioni

机构 * European University Viadrina(欧洲维德林大学) Sustainable AI Group(可持续AI小组)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过实证证据、全球监管地图和政策建议,揭示了生成式AI日益增长的环境成本,并提出模型级透明度、用户选择权和国际协调的三管齐下应对方案。

Comments 23 pages, 1 table, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21470 2026-06-01 cs.LG cs.AI 76%

Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling

面向延迟优化的Web Agent规划与调度的Agent即时编译

Caleb Winston, Ron Yifeng Wang, Azalia Mirhoseini, Christos Kozyrakis

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :planning(title);分类 cs.AI、cs.LG

AI总结 提出Agent即时编译系统,通过JIT-Planner生成代码计划、JIT-Scheduler探索并行化策略及不变式工具协议,显著降低延迟并提高准确性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26612 2026-06-01 cs.RO 71%

Meta-Adaptive Beam Search Planning for Transformer-Based Reinforcement Learning Control of UAVs with Overhead Manipulators under Flight Disturbances

基于Transformer强化学习的无人机搭载顶置机械臂在飞行扰动下的元自适应波束搜索规划

Hazim Alzorgan, Sayed Pedram Haeri Boroujeni, Abolfazl Razi

专题命中 规划推理 :planning(title)

AI总结 针对无人机与顶置机械臂耦合导致的末端执行器跟踪误差问题,提出基于Transformer双深度Q网络(DDQN)的强化学习框架,通过自适应波束搜索规划器利用学习到的评论家进行前向估计,实现软件在环的短视域波束搜索,显著降低跟踪误差并提升奖励。

Comments The paper will be reworked significantly

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31073 2026-06-01 cs.CL 70%

ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails

ConsisGuard:在LLM护栏中对齐安全审议与策略执行

Yan Wang, Zhixuan Chu, Zihao Xue, Zhen Bi, Bingyu Zhu, YueFeng Chen, Zeyu Yang, Jungang Lou, Longtao Huang, Ningyu Zhang, Kui Ren, Hui Xue

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Huzhou Normal University(湖州师范学院) Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江省智能教育技术与应用重点实验室)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出ConsisGuard框架,通过策略到决策轨迹蒸馏和功能耦合对齐,解决基于推理的LLM护栏中审议与执行之间的不一致问题,提升安全检测性能并减少策略执行失败。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04393 2026-06-01 cs.AI 70%

Post-Training LLMs as Better Decision-Making Agents: A Regret-Minimization Approach

将LLM后训练为更好的决策智能体:一种遗憾最小化方法

Chanwoo Park, Ziyang Chen, Asuman Ozdaglar, Kaiqing Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Maryland, College Park(马里兰大学哥伦比亚学院)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出迭代遗憾最小化微调(Iterative RMFT),通过反复蒸馏低遗憾决策轨迹来后训练LLM,提升其在在线决策任务中的表现,无需依赖已知算法或人工模板。

Comments Camera ready version of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11683 2026-06-01 cs.LG cs.AI cs.CL 67%

Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models

边界引导策略优化:面向扩散大语言模型的内存高效强化学习

Nianyi Lin, Jiajie Zhang, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对扩散大语言模型中似然函数难以处理导致强化学习内存开销大的问题,提出边界引导策略优化(BGPO),通过构造满足线性和等价性的下界实现内存高效训练,在数学求解、代码生成和规划任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28836 2026-06-01 cs.CL cs.AI 62%

No Reader Left Behind: Multi-Agent Summaries Everyone Can Understand

不让任何读者掉队:人人能理解的多智能体摘要

Jimin Jung, MyoungJin Kim, Jaehyung Seo, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系) Department of Computer Science and Engineering, Konkuk University(konkuk大学计算机科学与工程系)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出NRLB多智能体框架,通过模拟三类读者群体并结合模板规划与迭代优化,生成既忠实又易于理解的平实语言摘要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11336 2026-06-01 cs.IR cs.AI cs.CL cs.HC 62%

Much of Geospatial Web Search Is Beyond Traditional GIS

大部分地理空间网络搜索超越了传统GIS

Ilya Ilyankou, Stefano Cavazzi, James Haworth

机构 * SpaceTimeLab(空间时间实验室) Department of Civil, Environmental, and Geomatic Engineering(土木、环境与测绘工程系) UCL(伦敦大学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过密集句子嵌入、SetFit分类器和密度聚类,在MS MARCO语料库中发现18%的查询具有地理空间性质,并构建了88类分类体系,揭示地理搜索以事务性和实用性查询为主,多数超出传统GIS和知识图谱范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16165 2026-06-01 cs.LG cs.AI 62%

HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents

HiPER: 具有显式信用分配的分层强化学习用于大型语言模型智能体

Jiangweizhi Peng, Yuanxin Liu, Ruida Zhou, Charles Fleming, Zhaoran Wang, Alfredo Garcia, Mingyi Hong

机构 * University of Minnesota Northwestern University Amazon AGI Texas A\&M University Cisco Research

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对稀疏奖励长程任务中LLM智能体信用分配困难的问题,提出HiPER分层规划-执行框架,通过分层优势估计(HAE)在规划和执行层面显式分配信用,在ALFWorld和WebShop上达到97.4%和83.3%的成功率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31365 2026-06-01 cs.AI 57%

Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration

学习适应:通过认知感知探索实现自我改进的网络智能体

Weile Chen, Bingchen Miao, Qifan Yu, Wendong Bu, Guoming Wang, Wenqiao Zhang, Shengyu Zhang, Juncheng Li, Siliang Tang

机构 * Zhejiang University(浙江大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出SCALE框架,利用选择器、预测器和评判器三个对抗角色,通过环境探索自主发现智能体局限性并扩展认知边界,结合SCALE-Hop图探索策略和SCALE-20k数据集,显著提升多模态大语言模型在多种网络环境中的性能和泛化能力。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31273 2026-06-01 cs.LG 57%

Survival Reinforcement Learning: Toward Scalable Self-Supervised RL

生存强化学习:迈向可扩展的自监督强化学习

Franki Nguimatsia-Tiofack, Fabian Schramm, Théotime Le Hellard, Justin Carpentier

机构 * Inria and École Normale Supérieure PSL Research University(Inria 和 法国国家科学研究中心巴黎大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出生存强化学习(SRL),一种基于在线分类的方法,通过最大化智能体在目标状态停留时间来解决对比强化学习中的均匀性-容忍性困境,在长时程运动任务上性能提升2至8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31224 2026-06-01 cs.CY cs.AI cs.HC 57%

Comparing LLM-Based Conversational and Graphical Interfaces for Industrial Decision Tasks: An Exploratory Mixed-Methods Study

基于LLM的对话式与图形化界面在工业决策任务中的比较:一项探索性混合方法研究

Roberto Figliè, Simone Caputo, Alan Serrano, Tommaso Turchi, Daniele Mazzei

机构 * Department of Computer Science(计算机科学系) University of Pisa(比萨大学) Department(部门) San Matteo Hospital(圣玛泰奥医院) Brunel University of London(伦敦布鲁内尔大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 通过混合方法研究,比较了基于LLM的对话式界面与图形化仪表盘在工业决策任务中的表现,发现对话式界面可减少交互努力,但仪表盘在概览和验证方面仍有价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31138 2026-06-01 cs.HC cs.AI 57%

Developing an AI-Powered UX Research Point of View for Digital Health in A Regulatory Context: An Exemplar Case from MSM and Transgender HIV Care in Nigeria

在监管背景下开发AI驱动的用户体验研究视角:以尼日利亚MSM和跨性别者HIV护理为例

Emmanuel Oluwatosin Oluokun, Festus Fatai Adedoyin, Huseyin Dogan, Nan Jiang, Melike Akca, Abiodun Adedeji, Olumuyiwa Ayorinde, Fatima Ahmad Muazu

机构 * School of Computing and Engineering, Bournemouth University(伯恩茅斯大学计算与工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种生成式AI增强的用户体验研究方法论,通过四阶段UXR流程和十张理论驱动的UXR游戏卡,指导尼日利亚男男性行为者(MSM)和跨性别者HIV护理中数字健康干预的设计,核心贡献是可复制的、关注污名和隐私的负责任GenAI使用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31131 2026-06-01 cs.HC cs.AI 57%

UXR PoV for Neuroinclusive Emotion Regulation

神经包容性情绪调节的用户体验研究观点

Melike Akca, Mona Giff, Deniz Cetinkaya, Huseyin Dogan, Stephen Giff

机构 * School of Computing and Engineering, Bournemouth University(伯恩茅斯大学计算机与工程学院) Google Redmond, Washington, USA(谷歌红mond分公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种生成式AI增强的用户体验研究方法,结合DBT、SDT和COM-B理论框架,通过四阶段流程生成十张UXR游戏卡,为ADHD成人设计神经包容性的数字情绪调节干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31111 2026-06-01 cs.LG 57%

Subspace-Decomposed JEPAs: Disentangling Progression and Content in Latent World Models

子空间分解的JEPA:解耦潜在世界模型中的进展与内容

Lucas Thil, Jesse Read, Rim Kaddah, Guillaume Doquet

机构 * LIX, École Polytechnique(巴黎高等学院LIX实验室) IRT SystemX(系统X研究院) Safran Tech(萨弗兰科技)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出SD-JEPA方法,通过将JEPA潜在空间分解为正交的进展子空间和内容子空间,利用余弦边际三元组损失和SIGReg正则化分别约束,在控制基准上优于LeWM基线,并证明进展坐标可作为场景感知的指南针。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30961 2026-06-01 cs.CL 57%

EvoGens: A Population-Based Heuristic Search Framework for Scientific Idea Generation

EvoGens:一种基于种群的启发式搜索框架用于科学思想生成

Xu Li, Hanzhe Tu, Xinyi Li, Kuncheng Zhao, Xun Han, Zhonghui Liu

机构 * Southwest Petroleum University(西南石油大学) Sichuan Police College(四川警察学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 针对现有LLM方法生成科学思想时语义趋同、多样性和新颖性不足的问题,提出EvoGens框架,通过进化搜索(变异、交叉、选择)增强思想探索,显著提升新颖性和多样性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30858 2026-06-01 cs.LG 57%

ForecastCompass: Guiding Agentic Forecasting with Adaptive Factor Memory

ForecastCompass: 自适应因子记忆引导的智能预测

Yurui Chang, Yongkang Du, Yuanpu Cao, Jinghui Chen, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 提出ForecastCompass框架,通过分层预测任务分类和双组件记忆(因子记忆与推理记忆),结合回顾分析迭代修正,提升智能体在动态环境中的概率预测准确性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30842 2026-06-01 cs.LG 57%

CoMem: Context Management with A Decoupled Long-Context Model

CoMem: 基于解耦长上下文模型的上下文管理

Yuwei Zhang, Chengyu Dong, Shuowei Jin, Changlong Yu, Hejie Cui, Hongye Jin, Xinyang Zhang, Hamed Bonab, Colin Lockard, Jianshu Chen, Zhenyu Shi, Jingbo Shang, Xian Li, Bing Yin

机构 * Halıcıoğlu Data Science Institute, University of California, San Diego(哈里卡卢斯数据科学研究所,加州大学圣地亚哥分校) Amazon(亚马逊)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 提出CoMem框架,通过将记忆管理与智能体工作流解耦并采用k步偏移异步流水线,利用奖励驱动训练策略,在SWE-Bench-Verified上实现1.4倍延迟改进且保持大部分性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30838 2026-06-01 cs.AI 57%

COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

COMPASS: 认知MCTS引导的过程对齐用于安全搜索代理

Wenkai Shen, Pengyang Zhou, Jiahe Xu, Jiaming Qian, Haozhe He, Zhihao Huang, Chaochao Chen, Xiaolin Zheng

机构 * Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出COMPASS框架,通过认知树探索和自省步骤对齐,在保持通用效用的同时实现搜索代理工作流中的鲁棒安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30824 2026-06-01 cs.AI 57%

Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward

面向深度研究的规划器中心强化学习与结构感知奖励

Mustafa Anis Hussain, Xinle Wu, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出DecomposeR框架,通过将研究计划表示为有向无环图(DAG)并采用两阶段强化学习(规划器RL和回答器RL),实现显式结构化规划与细粒度奖励分配,在长文本基准上提升5.1-8.0分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30785 2026-06-01 cs.AI 57%

Learning Agent-Compatible Context Management for Long-Horizon Tasks

面向长时任务的学习智能体兼容上下文管理

Lu Yi, Runlin Lei, Liuyi Yao, Yuexiang Xie, Yuyang Li, Wenhao Zhang, Zhewei Wei, Yaliang Li, Jian-Yun Nie

机构 * Renmin University of China(中国人民大学) Tongyi Lab, Alibaba Group(阿里云实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Université de Montréal(蒙特利尔大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出AdaCoM方法,通过外部LLM对冻结智能体进行端到端强化学习上下文管理,在长时任务中提升性能并揭示保真度-可靠性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30542 2026-06-01 cs.AI 57%

Physically Viable World Models: A Case for Query-Conditioned Embodied AI

物理可行的世界模型:面向查询条件具身AI的案例

Adam J. Thorpe, Stepan Tretiakov, Cheng-Hsi Hsiao, Su Ann Low, Xingjian Li, Hassan Iqbal, Neel P. Bhatt, Ufuk Topcu, Krishna Kumar

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 针对具身AI中现有世界模型预测未来观测但物理不可行的问题,提出应构建基于查询条件、识别最简物理抽象的世界模型,通过模块化分解确保可解释性和可验证性。

Comments 21 pages; Adam J. Thorpe and Stepan Tretiakov contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27881 2026-06-01 cs.CL 57%

Retrieval, Reward, and Training Protocols: What Matters in Training Search Agents?

检索、奖励与训练协议:训练搜索代理的关键因素是什么?

Yibo Zhao, Zichen Ding, Jiayi Wu, Zun Wang, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(东华大学数据科学与工程学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文通过控制实验,系统研究了检索语料库、奖励设计和训练协议三个维度对搜索代理训练的影响,发现纠正语料覆盖问题比算法差异更有效,简单的基于结果的奖励方法在多数设置下表现优异,并提出了实用训练指南。

Comments 18pages, 4 figures, and 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22967 2026-06-01 cs.LG 57%

Learned Relay Representations for Forward-Thinking Discrete Diffusion Models

学习的中继表示用于前向思考的离散扩散模型

Benjamin Rozonoyer, Jacopo Minniti, Dhruvesh Patel, Neil Band, Avishek Joey Bose, Tim G. J. Rudner, Andrew McCallum

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Toronto(多伦多大学) Stanford University(斯坦福大学) Imperial College London(伦敦帝国学院) Mila Vijil

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出Learned Relay Representations (Relay)方法,通过可微通道传递潜在信息,使掩码扩散模型在去噪步骤间前向思考,减少推理延迟并提升性能。

Comments 16 pages, 3 figures. Equal contribution: Benjamin Rozonoyer, Jacopo Minniti, and Dhruvesh Patel. Code: https://github.com/jacopo-minniti/relay

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11946 2026-06-01 cs.AI 57%

Counterfactual Trace Auditing of LLM Agent Skills

LLM Agent技能的反事实痕迹审计

Xiaolin Zhou, Jinbo Liu, Li Li, Ryan A. Rossi, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Adobe Research(Adobe研究)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出反事实痕迹审计(CTA)框架,通过配对有无技能的Agent轨迹并生成结构化技能影响模式(SIP)注释,揭示技能对行为的重塑效应,弥补仅通过通过率评估的不足。

Comments Code and data are available at https://github.com/WillChow66/CTA.git

详情

展开后加载摘要…

URL PDF HTML 收藏