arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-01 至 2026-06-01 共收录 42 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 42 篇

2605.31062 2026-06-01 cs.CL 84%

AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering

AdaptR1:基于强化学习的自适应交错思考在多跳问答中的应用

Yuxin Wang, Jiahao Lu, Qifeng Wu, Shicheng Fang, Chuanyuan Tan, Yining Zheng, Xuanjing Huang, Xipeng Qiu

机构 * Computer Science, Fudan University(复旦大学计算机科学系) Institute of Modern Languages and Linguistics, Fudan University(复旦大学现代语言与语言学研究院) Shanghai Innovation Institute(上海创新研究院) Soochow University(苏州大学)

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 提出AdaptR1框架,通过强化学习动态分配每步推理预算,减少多跳问答中的过度思考,在保持性能的同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30740 2026-06-01 cs.RO cs.AI 84%

GSAM: A Generalizable and Safe Robotic Framework for Articulated Object Manipulation

GSAM: 一种通用且安全的铰接物体操作机器人框架

Beichen Shao, Mengying Xie, Heng Su, Wanyi Zhang, Mingyan Li, Yan Ding, Fausto Giunchiglia, Chao Chen

机构 * College of Computer Science, Chongqing University, Chongqing, China(重庆大学计算机学院) Lumos Robotics, China(Lumos机器人中国) Xi'an Jiaotong-Liverpool University, China(西安交通大学利物浦大学) Fudan University, China(复旦大学) Department of Information Engineering and Computer Science, University of Trento, Trento, Italy(特伦托大学信息工程与计算机科学系)

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 提出GSAM框架,通过视觉感知器生成运动学参数、基于VLM的细调器进行常识推理修正、交互约束函数生成器集成障碍物避免知识,并由运动学感知规划器验证轨迹可达性,在50个铰链任务上相比最佳基线将标准差降低3.1%、操作成功率提升36.0%。

Comments Accepted by the 19th International Conference on Parallel Problem Solving from Nature (PPSN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30924 2026-06-01 cs.CL 83%

EMBGuard: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents

EMBGuard:为具身智能体安全规划构建危险感知护栏

Dongwook Choi, Taeyoon Kwon, Bogyung Jeong, Minju Kim, Yeonjun Hwang, Hyojun Kim, Byungchul Kim, Young Kyun Jang, Jinyoung Yeo

机构 * Independent Researcher(独立研究者) Department of Biomedical Engineering(生物医学工程系) the Department of Intelligent Precision Healthcare Convergence, Sungkyunkwan University(智能精准医疗融合系,全州大学) Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 提出首个基于MLLM的具身安全护栏EMBGuard,通过解耦物理风险推理与智能体策略,评估(视觉观察,动作)对来识别危险配置并提供自然语言解释,同时构建训练数据集EMBHazard和基准测试EMBGuardTest,在紧凑模型尺寸下达到与专有MLLM竞争的性能并降低误报率。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10117 2026-06-01 cs.LG cs.AI 82%

Biases in the Blind Spot: Detecting What LLMs Fail to Mention

盲点中的偏见:检测大语言模型未能提及的内容

Iván Arcuschin, David Chanin, Adrià Garriga-Alonso, Oana-Maria Camburu

机构 * Poseidon Research(Poseidon研究) University College London, United Kingdom(伦敦大学学院, 英国) Imperial College London, United Kingdom(伦敦帝国学院, 英国)

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出全自动黑盒流水线,通过统计测试和思维链分析,自动检测大语言模型在任务中未明确表述的偏见。

Comments Published at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31584 2026-06-01 cs.CL cs.AI cs.LG 82%

LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards

LongTraceRL: 基于评分奖励从搜索智能体轨迹中学习长上下文推理

Nianyi Lin, Jiajie Zhang, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LongTraceRL框架,通过知识图谱随机游走生成多跳问题并利用搜索智能体轨迹构建分层干扰物,结合基于实体链的评分奖励进行过程监督,提升大语言模型在长上下文推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31460 2026-06-01 cs.RO cs.SY eess.SY 82%

On-Device Robotic Planning: Eliminating Inference Redundancy for Efficient Decision-Making

设备端机器人规划:消除推理冗余以实现高效决策

Joonhee Lee, Hyunseung Shin, Hyunmi Kim, Pei Zhang, Jeonggil Ko

机构 * School of Integrated Technology, College of Computing, Yonsei University(延世大学整合技术学院,计算学院) Department of Hyperscale AI SoC Research Section, ETRI(ETRI超大规模AI SoC研究部) EECS - Electrical and Computer Engineering, University of Michigan(密歇根大学电气与计算机工程学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 提出REIS框架,通过场景门控、KV引导的affordance路由和审慎推理减少推理冗余,在保持语义适应性的同时加速机器人控制。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20873 2026-06-01 cs.AI cs.LG 81%

PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models

PlanningBench: 生成可扩展且可验证的规划数据以评估和训练大型语言模型

Ziliang Zhao, Zenan Xu, Shuting Wang, Hongjin Qian, Yan Lei, Minda Hu, Zhao Wang, Shihan Dou, Zhicheng Dou, Pluto Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学校) LLM Department, Hunyuan Team, Tencent(腾讯 Hunyuan 团队 LLM 部门) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出PlanningBench框架,通过约束驱动合成管道生成可扩展、多样化且可验证的规划数据,用于评估和训练LLMs,并验证其在提升规划能力上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31003 2026-06-01 cs.IR 80%

Graph-GRPO: Dependency-Aware Credit Assignment for Generative E-commerce Search Relevance

Graph-GRPO:面向生成式电商搜索相关性的依赖感知信用分配

Jiarui Che, Yifei Chen, Zhixing Tian, Chenyang Wang, Ziguang Cheng

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 提出Graph-GRPO,一种基于图结构的GRPO扩展,通过构建推理依赖图并传播结果级奖励实现细粒度信用分配,提升电商搜索相关性建模。

Comments 11 pages, 2 figures, 2 tables. Submitted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31492 2026-06-01 cs.AI 79%

LinTree: Improving LLM Reasoning with Explicitly Structured Search Histories

LinTree: 通过显式结构化搜索历史提升LLM推理能力

Liwei Kang, Yee Whye Teh, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对LLM推理中隐式搜索树导致性能不佳的问题,提出LinTree方法,通过添加父指针显式表示线性化树结构,在Blocks World、网格导航和Sokoban任务中提升了任务性能和搜索效率。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00068 2026-06-01 cs.CY cs.AI 79%

The Global Landscape of Environmental AI Regulation: From the Cost of Reasoning to a Right to Green AI

环境AI监管的全球格局:从推理成本到绿色AI权利

Kai Ebert, Boris Gamazaychikov, Philipp Hacker, Sasha Luccioni

机构 * European University Viadrina(欧洲维德林大学) Sustainable AI Group(可持续AI小组)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过实证证据、全球监管地图和政策建议,揭示了生成式AI日益增长的环境成本,并提出模型级透明度、用户选择权和国际协调的三管齐下应对方案。

Comments 23 pages, 1 table, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21470 2026-06-01 cs.LG cs.AI 76%

Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling

面向延迟优化的Web Agent规划与调度的Agent即时编译

Caleb Winston, Ron Yifeng Wang, Azalia Mirhoseini, Christos Kozyrakis

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :planning(title);分类 cs.AI、cs.LG

AI总结 提出Agent即时编译系统,通过JIT-Planner生成代码计划、JIT-Scheduler探索并行化策略及不变式工具协议,显著降低延迟并提高准确性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26612 2026-06-01 cs.RO 71%

Meta-Adaptive Beam Search Planning for Transformer-Based Reinforcement Learning Control of UAVs with Overhead Manipulators under Flight Disturbances

基于Transformer强化学习的无人机搭载顶置机械臂在飞行扰动下的元自适应波束搜索规划

Hazim Alzorgan, Sayed Pedram Haeri Boroujeni, Abolfazl Razi

专题命中 规划推理 :planning(title)

AI总结 针对无人机与顶置机械臂耦合导致的末端执行器跟踪误差问题,提出基于Transformer双深度Q网络(DDQN)的强化学习框架,通过自适应波束搜索规划器利用学习到的评论家进行前向估计,实现软件在环的短视域波束搜索,显著降低跟踪误差并提升奖励。

Comments The paper will be reworked significantly

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31073 2026-06-01 cs.CL 70%

ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails

ConsisGuard:在LLM护栏中对齐安全审议与策略执行

Yan Wang, Zhixuan Chu, Zihao Xue, Zhen Bi, Bingyu Zhu, YueFeng Chen, Zeyu Yang, Jungang Lou, Longtao Huang, Ningyu Zhang, Kui Ren, Hui Xue

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Huzhou Normal University(湖州师范学院) Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江省智能教育技术与应用重点实验室)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出ConsisGuard框架,通过策略到决策轨迹蒸馏和功能耦合对齐,解决基于推理的LLM护栏中审议与执行之间的不一致问题,提升安全检测性能并减少策略执行失败。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04393 2026-06-01 cs.AI 70%

Post-Training LLMs as Better Decision-Making Agents: A Regret-Minimization Approach

将LLM后训练为更好的决策智能体:一种遗憾最小化方法

Chanwoo Park, Ziyang Chen, Asuman Ozdaglar, Kaiqing Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Maryland, College Park(马里兰大学哥伦比亚学院)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出迭代遗憾最小化微调(Iterative RMFT),通过反复蒸馏低遗憾决策轨迹来后训练LLM,提升其在在线决策任务中的表现,无需依赖已知算法或人工模板。

Comments Camera ready version of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11683 2026-06-01 cs.LG cs.AI cs.CL 67%

Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models

边界引导策略优化:面向扩散大语言模型的内存高效强化学习

Nianyi Lin, Jiajie Zhang, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对扩散大语言模型中似然函数难以处理导致强化学习内存开销大的问题,提出边界引导策略优化(BGPO),通过构造满足线性和等价性的下界实现内存高效训练,在数学求解、代码生成和规划任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28836 2026-06-01 cs.CL cs.AI 62%

No Reader Left Behind: Multi-Agent Summaries Everyone Can Understand

不让任何读者掉队:人人能理解的多智能体摘要

Jimin Jung, MyoungJin Kim, Jaehyung Seo, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系) Department of Computer Science and Engineering, Konkuk University(konkuk大学计算机科学与工程系)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出NRLB多智能体框架,通过模拟三类读者群体并结合模板规划与迭代优化,生成既忠实又易于理解的平实语言摘要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11336 2026-06-01 cs.IR cs.AI cs.CL cs.HC 62%

Much of Geospatial Web Search Is Beyond Traditional GIS

大部分地理空间网络搜索超越了传统GIS

Ilya Ilyankou, Stefano Cavazzi, James Haworth

机构 * SpaceTimeLab(空间时间实验室) Department of Civil, Environmental, and Geomatic Engineering(土木、环境与测绘工程系) UCL(伦敦大学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过密集句子嵌入、SetFit分类器和密度聚类,在MS MARCO语料库中发现18%的查询具有地理空间性质,并构建了88类分类体系,揭示地理搜索以事务性和实用性查询为主,多数超出传统GIS和知识图谱范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16165 2026-06-01 cs.LG cs.AI 62%

HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents

HiPER: 具有显式信用分配的分层强化学习用于大型语言模型智能体

Jiangweizhi Peng, Yuanxin Liu, Ruida Zhou, Charles Fleming, Zhaoran Wang, Alfredo Garcia, Mingyi Hong

机构 * University of Minnesota Northwestern University Amazon AGI Texas A\&M University Cisco Research

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对稀疏奖励长程任务中LLM智能体信用分配困难的问题,提出HiPER分层规划-执行框架,通过分层优势估计(HAE)在规划和执行层面显式分配信用,在ALFWorld和WebShop上达到97.4%和83.3%的成功率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31365 2026-06-01 cs.AI 57%

Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration

学习适应:通过认知感知探索实现自我改进的网络智能体

Weile Chen, Bingchen Miao, Qifan Yu, Wendong Bu, Guoming Wang, Wenqiao Zhang, Shengyu Zhang, Juncheng Li, Siliang Tang

机构 * Zhejiang University(浙江大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出SCALE框架,利用选择器、预测器和评判器三个对抗角色,通过环境探索自主发现智能体局限性并扩展认知边界,结合SCALE-Hop图探索策略和SCALE-20k数据集,显著提升多模态大语言模型在多种网络环境中的性能和泛化能力。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31273 2026-06-01 cs.LG 57%

Survival Reinforcement Learning: Toward Scalable Self-Supervised RL

生存强化学习:迈向可扩展的自监督强化学习

Franki Nguimatsia-Tiofack, Fabian Schramm, Théotime Le Hellard, Justin Carpentier

机构 * Inria and École Normale Supérieure PSL Research University(Inria 和 法国国家科学研究中心巴黎大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出生存强化学习(SRL),一种基于在线分类的方法,通过最大化智能体在目标状态停留时间来解决对比强化学习中的均匀性-容忍性困境,在长时程运动任务上性能提升2至8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31224 2026-06-01 cs.CY cs.AI cs.HC 57%

Comparing LLM-Based Conversational and Graphical Interfaces for Industrial Decision Tasks: An Exploratory Mixed-Methods Study

基于LLM的对话式与图形化界面在工业决策任务中的比较:一项探索性混合方法研究

Roberto Figliè, Simone Caputo, Alan Serrano, Tommaso Turchi, Daniele Mazzei

机构 * Department of Computer Science(计算机科学系) University of Pisa(比萨大学) Department(部门) San Matteo Hospital(圣玛泰奥医院) Brunel University of London(伦敦布鲁内尔大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 通过混合方法研究,比较了基于LLM的对话式界面与图形化仪表盘在工业决策任务中的表现,发现对话式界面可减少交互努力,但仪表盘在概览和验证方面仍有价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31138 2026-06-01 cs.HC cs.AI 57%

Developing an AI-Powered UX Research Point of View for Digital Health in A Regulatory Context: An Exemplar Case from MSM and Transgender HIV Care in Nigeria

在监管背景下开发AI驱动的用户体验研究视角:以尼日利亚MSM和跨性别者HIV护理为例

Emmanuel Oluwatosin Oluokun, Festus Fatai Adedoyin, Huseyin Dogan, Nan Jiang, Melike Akca, Abiodun Adedeji, Olumuyiwa Ayorinde, Fatima Ahmad Muazu

机构 * School of Computing and Engineering, Bournemouth University(伯恩茅斯大学计算与工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种生成式AI增强的用户体验研究方法论,通过四阶段UXR流程和十张理论驱动的UXR游戏卡,指导尼日利亚男男性行为者(MSM)和跨性别者HIV护理中数字健康干预的设计,核心贡献是可复制的、关注污名和隐私的负责任GenAI使用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31131 2026-06-01 cs.HC cs.AI 57%

UXR PoV for Neuroinclusive Emotion Regulation

神经包容性情绪调节的用户体验研究观点

Melike Akca, Mona Giff, Deniz Cetinkaya, Huseyin Dogan, Stephen Giff

机构 * School of Computing and Engineering, Bournemouth University(伯恩茅斯大学计算机与工程学院) Google Redmond, Washington, USA(谷歌红mond分公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种生成式AI增强的用户体验研究方法,结合DBT、SDT和COM-B理论框架,通过四阶段流程生成十张UXR游戏卡,为ADHD成人设计神经包容性的数字情绪调节干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31111 2026-06-01 cs.LG 57%

Subspace-Decomposed JEPAs: Disentangling Progression and Content in Latent World Models

子空间分解的JEPA:解耦潜在世界模型中的进展与内容

Lucas Thil, Jesse Read, Rim Kaddah, Guillaume Doquet

机构 * LIX, École Polytechnique(巴黎高等学院LIX实验室) IRT SystemX(系统X研究院) Safran Tech(萨弗兰科技)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出SD-JEPA方法,通过将JEPA潜在空间分解为正交的进展子空间和内容子空间,利用余弦边际三元组损失和SIGReg正则化分别约束,在控制基准上优于LeWM基线,并证明进展坐标可作为场景感知的指南针。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30961 2026-06-01 cs.CL 57%

EvoGens: A Population-Based Heuristic Search Framework for Scientific Idea Generation

EvoGens:一种基于种群的启发式搜索框架用于科学思想生成

Xu Li, Hanzhe Tu, Xinyi Li, Kuncheng Zhao, Xun Han, Zhonghui Liu

机构 * Southwest Petroleum University(西南石油大学) Sichuan Police College(四川警察学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 针对现有LLM方法生成科学思想时语义趋同、多样性和新颖性不足的问题,提出EvoGens框架,通过进化搜索(变异、交叉、选择)增强思想探索,显著提升新颖性和多样性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30858 2026-06-01 cs.LG 57%

ForecastCompass: Guiding Agentic Forecasting with Adaptive Factor Memory

ForecastCompass: 自适应因子记忆引导的智能预测

Yurui Chang, Yongkang Du, Yuanpu Cao, Jinghui Chen, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 提出ForecastCompass框架,通过分层预测任务分类和双组件记忆(因子记忆与推理记忆),结合回顾分析迭代修正,提升智能体在动态环境中的概率预测准确性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30842 2026-06-01 cs.LG 57%

CoMem: Context Management with A Decoupled Long-Context Model

CoMem: 基于解耦长上下文模型的上下文管理

Yuwei Zhang, Chengyu Dong, Shuowei Jin, Changlong Yu, Hejie Cui, Hongye Jin, Xinyang Zhang, Hamed Bonab, Colin Lockard, Jianshu Chen, Zhenyu Shi, Jingbo Shang, Xian Li, Bing Yin

机构 * Halıcıoğlu Data Science Institute, University of California, San Diego(哈里卡卢斯数据科学研究所,加州大学圣地亚哥分校) Amazon(亚马逊)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 提出CoMem框架,通过将记忆管理与智能体工作流解耦并采用k步偏移异步流水线,利用奖励驱动训练策略,在SWE-Bench-Verified上实现1.4倍延迟改进且保持大部分性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30838 2026-06-01 cs.AI 57%

COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

COMPASS: 认知MCTS引导的过程对齐用于安全搜索代理

Wenkai Shen, Pengyang Zhou, Jiahe Xu, Jiaming Qian, Haozhe He, Zhihao Huang, Chaochao Chen, Xiaolin Zheng

机构 * Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出COMPASS框架,通过认知树探索和自省步骤对齐,在保持通用效用的同时实现搜索代理工作流中的鲁棒安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30824 2026-06-01 cs.AI 57%

Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward

面向深度研究的规划器中心强化学习与结构感知奖励

Mustafa Anis Hussain, Xinle Wu, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出DecomposeR框架,通过将研究计划表示为有向无环图(DAG)并采用两阶段强化学习(规划器RL和回答器RL),实现显式结构化规划与细粒度奖励分配,在长文本基准上提升5.1-8.0分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30785 2026-06-01 cs.AI 57%

Learning Agent-Compatible Context Management for Long-Horizon Tasks

面向长时任务的学习智能体兼容上下文管理

Lu Yi, Runlin Lei, Liuyi Yao, Yuexiang Xie, Yuyang Li, Wenhao Zhang, Zhewei Wei, Yaliang Li, Jian-Yun Nie

机构 * Renmin University of China(中国人民大学) Tongyi Lab, Alibaba Group(阿里云实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Université de Montréal(蒙特利尔大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出AdaCoM方法,通过外部LLM对冻结智能体进行端到端强化学习上下文管理,在长时任务中提升性能并揭示保真度-可靠性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏