arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-28 至 2026-05-28 共收录 234 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 69 篇

2605.27721 2026-05-28 cs.CL cs.AI 81%

UserHarness: Harnessing User Minds for Stronger Agent Theory-of-Mind

UserHarness:利用用户心智增强智能体心理理论

Cheng Qian, Jiayu Liu, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出UserHarness框架,通过显式重建用户心智状态(信念、意图等)进行心理理论推理,在五个基准上达到95.94%的宏准确率,相对提升超15%。

Comments 19 Pages, 4 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27697 2026-05-28 cs.RO cs.AI cs.LG 81%

Simulation-Informed Diffusion for Decentralized Multi-robot Motion Planning

仿真引导的扩散方法用于去中心化多机器人运动规划

Jinhao Liang, Sven Koenig, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学) University of California, Irvine(加州大学伊文斯顿分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于约束感知扩散模型的去中心化框架SID,通过仿真邻居未来轨迹并利用安全约束规划自身轨迹,在密集场景下实现高效协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10138 2026-05-28 cs.LG cs.AI 81%

Path Channels and Plan Extension Kernels: a Mechanistic Description of Planning in a Sokoban RNN

路径通道与计划扩展核:Sokoban RNN中规划的机制描述

Mohammad Taufeeque, Aaron David Tucker, Adam Gleave, Adrià Garriga-Alonso

机构 * FAR.AI Berkeley(FAR.AI伯克利)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过逆向工程分析无模型强化学习训练的卷积循环神经网络,发现其通过路径通道存储未来动作计划,并利用卷积核实现双向传播与回溯规划。

Comments Published as a conference paper at ICLR 2026. 34 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28454 2026-05-28 cs.AI 79%

GONDOR to the Rescue: Satisficing Planning with Low Memory

GONDOR 救援:低内存下的满意规划

Yonatan Vernik, Alexander Tuisov, Alexander Shleyfman

机构 * Computer Science Department, Bar-Ilan University(巴伊兰大学计算机科学系) Independent Researcher(独立研究员)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出 GONDOR 算法,通过周期压缩搜索树并保留稀疏锚点状态,在严格内存限制下扩展 GBFS,实现低内存预算下的满意规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27873 2026-05-28 cs.AI 79%

AIBuildAI-2: A Knowledge-Enhanced Agent for Automatically Building AI Models

AIBuildAI-2:一种用于自动构建AI模型的知识增强智能体

Ruiyi Zhang, Peijia Qin, Qi Cao, Li Zhang, Pengtao Xie

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Medicine, University of California San Diego(加州大学圣地亚哥分校医学系)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 针对现有自动构建AI模型的智能体因依赖大语言模型静态参数知识而性能受限的问题,提出AIBuildAI-2,通过引入分层、可进化的外部知识系统,动态加载相关上下文,实现设计决策的专家知识支撑,在MLE-Bench上取得70.7%奖牌率并在心脏病预测竞赛中排名前6.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27724 2026-05-28 cs.RO cs.AI 79%

HumanoidMimicGen: Data Generation for Loco-Manipulation via Whole-Body Planning

HumanoidMimicGen: 通过全身规划生成行走操作数据

Kevin Lin, Ajay Mandlekar, Caelan Reed Garrett, Nikita Chernyadev, Yu Fang, Runyu Ding, Yuqi Xie, Justin Tran, Linxi Fan, Yuke Zhu

机构 * NVIDIA The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出HumanoidMimicGen方法,通过全身规划自动生成人形机器人行走操作演示数据,在模拟基准上使联合训练的策略性能提升20%。

Comments website: https://humanoidmimicgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27703 2026-05-28 cs.AI 79%

Hierarchical Prompt-Domain Control and Learning for Resource-Constrained Agentic Language Models

面向资源受限智能体语言模型的分层提示域控制与学习

Joan Vendrell Gallart, Russell Bent, Michael Grosskopf

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 提出分层控制与学习框架,通过蒸馏学习输出模式、在线监控与提示域控制,解决资源受限下智能体语言模型的可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27375 2026-05-28 cs.CL 79%

LCO: LLM-based Constraint Optimization for Safer Agentic LLMs in Real-world Tasks

LCO:基于LLM的约束优化,用于现实任务中更安全的智能体LLM

Jiayong Wan, Jiawei Chen, Zhaoxia Yin, Liu Shuyuan, Hang Su

机构 * East China Normal University(东华大学) Beijing Zhongguancun Academy(北京中关村学院) Tsinghua University(清华大学)

专题命中 规划决策 :agentic(title);autonomous agent(abstract);分类 cs.CL

AI总结 提出LCO框架,通过自思考模块和进化采样模块约束LLM行为,在不微调模型的情况下减少上下文奖励黑客行为,实验表明在输出优化和策略优化场景中显著提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10325 2026-05-28 cs.AI 79%

Verifiable Process Rewards for Agentic Reasoning

可验证过程奖励用于智能体推理

Huining Yuan, Zelai Xu, Huaijie Wang, Xiangmin Yi, Jiaxuan Gao, Xiao-Ping Zhang, Yu Wang, Chao Yu, Yi Wu

机构 * Tsinghua University(清华大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 提出可验证过程奖励(VPR)框架,通过符号或算法预言机将密集的中间步骤验证转化为强化学习的逐轮监督信号,解决长程智能体推理中的信用分配问题,并在搜索、约束和后验验证三种场景中验证其有效性。

Comments Corrected minor typos and LLM-assisted data extraction errors. The main conclusions are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17737 2026-05-28 cs.CV cs.AI 79%

The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation

脚本即一切:一个用于长程对话到电影视频生成的智能体框架

Chenyu Mu, Xin He, Qu Yang, Wanshun Chen, Jiadi Yao, Huang Liu, Zihao Yi, Bo Zhao, Xingyu Chen, Ruotian Ma, Fanghua Ye, Erkun Yang, Cheng Deng, Zhaopeng Tu, Xiaolong Li, Linus

机构 * Tencent(腾讯)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 提出一个端到端智能体框架,通过训练ScripterAgent将对话转化为精细脚本,并利用DirectorAgent跨场景连续生成策略,实现长程对话到电影视频的连贯生成,显著提升脚本忠实度和时间保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07683 2026-05-28 cs.CY 79%

A Multi-Level Agent-Based Architecture for Climate Governance Integrating Cognitive and Institutional Dynamics

一种整合认知与制度动态的气候治理多层级智能体架构

Ivan Puga-Gonzalez, Önder Gürcan, Vanja Falck, Christopher Frantz, F. LeRon Shults, David Herbert, Larissa Lopes Lima, Markus Grendstad Rousseau

专题命中 规划决策 :agent(title,abstract);autonomous agent(comments)

AI总结 提出一种模块化多层级智能体架构,整合基于动机的认知决策模型与制度行为,用于模拟气候治理中公民、NGO、媒体和政治决策者的复杂互动。

Comments 9 pages, 1 figure, The 7th International Workshop on Agents for Societal Impact (ASI 2026) held in conjunction with the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28362 2026-05-28 cs.RO 78%

Accelerating Robot Path Planning via Connectivity-Preserving Region Proposal Network

加速机器人路径规划的连通性保持区域提议网络

Zhanzheng Ma, Cancan Zhao, Shuai Zhang, Bo Ouyang

机构 * School of Management, Hefei University of Technology(合肥工业大学管理学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出连通性保持区域提议网络(CP-RPN),通过分割模型预测紧凑且拓扑连通的候选区域,压缩搜索空间,结合Voronoi图与局部A*回退机制实现低延迟高成功率路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28356 2026-05-28 math.OC 78%

Machine Learning for Exact Time Series Aggregation in Generation Expansion Planning with Energy Storage

机器学习用于含储能的发电扩展规划中的精确时间序列聚合

Jakub Rybka, Luca Santosuosso, Thomas Klatzer, Sonja Wogrin

专题命中 规划决策 :planning(title,abstract)

AI总结 针对含可再生能源、火电和储能的发电扩展规划问题,提出一种基于机器学习估计边际成本的迭代时间序列聚合方法,实现精确聚合并保持最优性间隙可评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27972 2026-05-28 cs.RO 78%

Simultaneous Contact Selection and Planning for Contact-Rich Manipulation with Cascaded Optimization

基于级联优化的接触丰富操作中同时接触选择与规划

Zhe Zhang, Xingrong Diao, Haoxiang Liang, Han Yang, Bi-Ke Zhu, Dandan Zhang, Jiankun Wang

机构 * IEEE

专题命中 规划决策 :planning(title,abstract)

AI总结 提出一种级联优化框架SCSP,通过接触选择优化和接触规划优化实现接触丰富操作中的主动接触位置选择与轨迹规划。

Comments 20 pages, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05198 2026-05-28 cs.RO 78%

Informative Path Planning with Guaranteed Estimation Uncertainty

具有保证估计不确定性的信息性路径规划

Kalvik Jakkala, Saurav Agarwal, Jason O'Kane, Srinivas Akella

机构 * Texas A&M University(德克萨斯大学) Indian Institute of Technology Bombay(孟买印度理工学院) University of North Carolina at Charlotte(夏洛特北卡罗来纳大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出一种三阶段方法,通过高斯过程模型将不确定性约束转化为覆盖图,并规划近最短路径,在复杂环境中实现具有保证估计不确定性的信息性路径规划。

Comments 15 pages, 11 figures, RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28807 2026-05-28 cs.AI 77%

Calibrating Conservatism for Scalable Oversight

校准保守主义以实现可扩展监督

William Overman, Mohsen Bayati

机构 * Stanford Graduate School of Business(斯坦福商学院)

专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 提出校准集体监督(CCO)方法,通过在线校准保守主义,在无分布假设下确保不良结果低于用户指定阈值,并在SWE-bench和MACHIAVELLI实验中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28775 2026-05-28 cs.LG cs.AI cs.CL 75%

Learn from Weaknesses: Automated Domain Specialization for Small Computer-Use Agents

从弱点中学习:小型计算机使用代理的自动化领域专业化

Suji Kim, Kangsan Kim, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) Samsung Electronics(三星电子)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出LearnWeak框架,通过更强的参考代理识别学生代理在目标领域的弱点,自动合成针对性任务和监督信号,并引入误差感知专业化目标,显著提升小型计算机使用代理在多个领域的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06970 2026-05-28 eess.SY cs.LG cs.SY 74%

Falsification-driven reinforcement learning for maritime motion planning

基于证伪驱动的强化学习用于海上运动规划

Marlon Müller, Florian Finkeldei, Hanna Krasowski, Murat Arcak, Matthias Althoff

机构 * Technical University of Munich(慕尼黑技术大学) University of California, Berkeley(加州大学伯克利分校) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 规划决策 :planning(title);分类 cs.LG

AI总结 提出一种证伪驱动的强化学习方法,通过生成对抗性训练场景(违反信号时态逻辑规范的海上交通规则)来提升自主船舶的规则遵守能力,实验表明该方法能提供更相关的训练场景并实现更一致的规则遵守。

Comments 11 pages, 9 figures. Code available at https://fdrl-maritime.github.io

Journal ref Ocean Engineering 361 (2026) 125579

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06426 2026-05-28 cs.AI cs.SY eess.SY math.OC 74%

Planning a Community Approach to Diabetes Care in Low- and Middle-Income Countries Using Optimization

使用优化规划中低收入国家糖尿病护理的社区方法

Katherine B. Adams, Justin J. Boutilier, Sarang Deo, Yonatan Mintz

机构 * Department of Operations and Analytics, University of Texas at San Antonio(运营管理与分析系,德克萨斯大学圣安东尼奥分校) Telfer School of Management, University of Ottawa(奥多恩大学泰弗管理学院) Max Institute of Healthcare Management, Indian School of Business(印度商学院医疗管理研究所) Department of Industrial and Systems Engineering, University of Wisconsin-Madison(工业与系统工程系,威斯康星大学麦迪逊分校)

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 提出一个优化框架,通过个性化社区卫生工作者访视计划,在社区层面最大化血糖控制,并平衡筛查新患者与管理已登记患者的资源分配。

Comments 50 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28699 2026-05-28 cs.AI 70%

TRACER: Turn-level Regret Matching with Inner Reinforcement Credit for Cooperative Multi-LLM Reasoning

TRACER: 基于内部强化信用与轮次级遗憾匹配的多LLM协作推理

Chusen Li, Zhou Liu, Shuigeng Zhou, Wentao Zhang

机构 * Fudan University(复旦大学) Zhongguancun Academy(中关村学院) Academy for Advanced Interdisciplinary Studies, Peking University(北京大学先进交叉学科研究院)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出TRACER框架,通过控制器-遗憾层和生成-信用层分别学习发言时机与内容,解决多智能体强化学习中的稀疏奖励、搭便车和固定协议振荡问题,实现数学收敛的协作推理。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27999 2026-05-28 cs.HC cs.AI 70%

Learning to Assign Prediction Tasks to Agents with Capacity Constraints

学习将预测任务分配给具有容量限制的智能体

Shang Wu, Saatvik Kher, Padhraic Smyth

机构 * Department of Computer Science(计算机科学系) University of California, Irvine(加州大学欧文分校)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 针对容量受限的多个智能体(人类或AI),提出一种序贯探索-利用策略学习框架,以最大化整体预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28083 2026-05-28 cs.CV 67%

VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking

VLA-Hijack: 通过视觉本体感觉劫持实现针对视觉-语言-动作模型的可迁移补丁攻击

Jiyuan Fu, Kaixun Jiang, Jingkai Jia, Zhaoyu Chen, Xueyao Chen, Lingyi Hong, Shuyong Gao, Chenzhi Tan, Dingkang Yang, Wenqiang Zhang

机构 * Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 提出VLA-Hijack框架,通过注意力引导的本体感觉抑制和多模态本体感觉注入攻击视觉自定位过程,实现跨架构黑盒迁移攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27817 2026-05-28 cs.RO cs.AI cs.CV cs.LG 62%

Turning Video Models into Generalist Robot Policies

将视频模型转化为通用机器人策略

Sizhe Lester Li, Evan Kim, Xingjian Bai, Tong Zhao, Tao Pang, Max Simchowitz, Vincent Sitzmann

机构 * MIT(麻省理工学院) CMU(卡内基梅隆大学) Amazon FAR(亚马逊公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种解耦的视频到动作策略VERA,利用无动作视频世界模型和基于机器人雅可比矩阵的逆动力学模型,实现跨本体的零样本机器人控制。

Comments project page: https://vera.csail.mit.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27765 2026-05-28 cs.LG cs.AI 62%

Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning

恢复甜蜜点:用于LLM推理的通过率加权自蒸馏

Zehao Liu, Yuanpu Cao, Jinghui Chen, Vasant G. Honavar

机构 * College of Information Sciences and Technology(信息科学与技术学院)

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 提出SC-SDPO方法,通过问题通过率加权自蒸馏损失,动态调整训练难度,提升LLM推理性能。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27644 2026-05-28 cs.RO cs.AI cs.LG 62%

Trinity: Unifying Class-Agnostic Terrain and Semantic Segmentation for Unstructured Outdoor Environments by Leveraging Synthetic Data

Trinity:通过利用合成数据统一非结构化户外环境中的类无关地形与语义分割

Marcus G Müller, Wout Boerdijk, Maximilian Durner, Riccardo Giubilato, Abel Gawel, Wolfgang Stürzl, Roland Siegwart, Rudolph Triebel

机构 * Institute of Robotics and Mechatronics, German Aerospace Center (DLR)(机器人与机电系统研究所,德国航空航天中心(DLR)) Federal Institute of Technology Zurich (ETH Zurich)(苏黎世联邦理工学院(ETH Zurich)) Robotics and AI Institute (RAI)(机器人与人工智能研究所(RAI))

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出基于Transformer的统一网络Trinity,联合执行类特定语义分割和类无关地形分割,利用合成数据集RUGDSynth和真实数据集EXTerra实现机器人无关的地形先验学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27605 2026-05-28 cs.AI cs.SE 62%

Laguna M.1/XS.2 Technical Report

Laguna M.1/XS.2 技术报告

Julien Abadji, Marah Abdin, Connor Adams, Eric Alcaide, Mustafa Altun, Michele Artoni, Junze Bao, Uday Barar, Vassilis Bekiaris, Arkadii Bessonov, Benjamin Bütikofer, Jonathan Chang, Yen-Chun Chen, Dmitry Chernenkov, Yang Chi, Filippos Christianos, Fenia Christopoulou, Razvan-Andrei Ciocoiu, Tzachi Cohen, Yohann Coppel, Dmitrii Emelianenko, Brandon Fergerson, Brian Fitzgerald, Matthias Gallé, Alex Golonzovskyi, George Grigorev, Yiyang Hao, Christian Hensel, Jan Huenermann, Ye Ji, Sarthak Joshi, Eiso Kant, Kabir Khandpur, Seonghyeon Kim, Vladimir Kirichenko, Umut Kocasarac, Ilya Kochik, Ivan Komarov, Chaerin Kong, Anurag Koul, François-Joseph Lacroix, Sergei Laktionov, Waren Long, Quentin Malartic, Vadim Markovtsev, Afonso Marques, Robert McHardy, Carlos Mocholí, Dmitry Monakhov, Adam Morris, Martin Muller, Christian Mürtz, Robin Nabel, Thien Nguyen, Rok Novosel, Szymon Ozog, Aalhad Patankar, Aleksei Petrov, Alexandre Piché, Arthur Pignet, Teodor Poncu, Phil Potter, Alexander Rakowski, Pierre-Yves Ritschard, Jay Roberts, Joe Rowell, Piotr Sarna, Pierre-André Savalle, Uladzislau Sazanovich, Nikita Shapovalov, Arsenii Shevchenko, Mikhail Shilkov, Andrei Sokol, Mohamed Soliman, Jack Stephenson, Victor Storchan, Dragos-Constantin Tantaru, Artem Tyurin, Adrian Wälchli, Pengming Wang, Jianxiao Yang, Renat Zayashnikov, Alexander Zelenka Martin, Nikolay Zinov, Caroline Bercier, José Caldeira, Margarida Garcia, Tom George, Kabeer Gharzai, Glenn Hitchcock, Carson Klingenberg, Ivo Pinto, Varun Randery, Noah Smith, Arina Sugako, Jason Warner

机构 * Poolside Team(Poolside团队)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文介绍了两个用于长周期自主编码的混合专家基础模型 Laguna M.1 和 XS.2,通过端到端训练和模型工厂系统,在软件工程基准测试中达到先进水平。

Comments Technical report to models released here: https://poolside.ai/blog/introducing-laguna-xs2-m1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27567 2026-05-28 cs.AI cs.CL 62%

Why LLMs Fail at Causal Discovery and How Interventional Agents Escape

为什么LLM在因果发现中失败以及干预代理如何逃脱

Amartya Roy, Sonali Parbhoo

机构 * SIRE, IIT Delhi(IIT德里智能研究机构) Robert Bosch GmbH(罗伯特·博世有限公司) Imperial College London(伦敦帝国理工学院)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文证明大型语言模型在因果发现中存在根本性失败,并提出一种基于干预代理的因果贝叶斯优化方法(A-CBO),通过外部贝叶斯循环在无需模型微调的情况下实现可证明的收敛。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27385 2026-05-28 cs.LG cs.AI 62%

Personalized Observation Normalization for Federated Reinforcement Learning in Simulation Environments with Heterogeneity

异构仿真环境中联邦强化学习的个性化观测归一化

Yiran Pang, Zhen Ni, Xiangnan Zhong

机构 * Department of Electrical Engineering \& Computer Science Florida Atlantic University Boca Raton, FL, USA

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对联邦强化学习在异构环境中状态转移动力学差异导致输入分布不一致和参数更新不平衡的问题,提出个性化观测归一化方法,通过各智能体本地维护运行均值和方差对原始状态输入进行归一化,加速训练并提升性能。

Comments Accepted at the International Joint Conference on Neural Networks (IJCNN) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16565 2026-05-28 cs.LG cs.AI 62%

Reasoning on the Manifold: Bidirectional Consistency for Self-Verification in Diffusion Language Models

流形上的推理:扩散语言模型中用于自我验证的双向一致性

Jiaoyang Ruan, Xin Gao, Yinda Chen, Hengyu Zeng, Liang Du, Guanghao Li, Jie Fu, Jian Pu

机构 * Institute of Science and Technology for Brain-Inspired Intelligence(脑启发智能科学与技术研究院) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) IEG, Tencent Inc.(腾讯IEG)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出双向流形一致性(BMC),一种无训练、无监督的度量方法,通过前向掩码和后向重建循环量化生成序列的稳定性,用于扩散语言模型的诊断、推理和对齐。

Comments 31 pages, 7 figures. Accepted to the 43rd International Conference on Machine Learning (ICML 2026). Camera-ready version

Journal ref Proceedings of the 43rd International Conference on Machine Learning, PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10567 2026-05-28 cs.CL cs.AI 62%

Early Decisions Matter: Proximity Bias and Initial Trajectory Shaping in Non-Autoregressive Diffusion Language Models

早期决策至关重要:非自回归扩散语言模型中的邻近偏差与初始轨迹塑造

Jiyeon Kim, Sungik Choi, Yongrae Jo, Moontae Lee, Minjoon Seo

机构 * LG AI Research(LG人工智能研究)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文通过分析非自回归扩散语言模型的推理动态,发现其存在邻近偏差导致的错误传播问题,并提出一种轻量级规划器和序列结束温度退火方法来引导早期令牌选择,从而显著提升推理与规划任务的性能。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏