arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2976 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 909 篇

2607.25875 2026-08-03 cs.LG cs.AI 版本更新 62%

A2TTA: Anchored-and-Agile Test-Time Adaptation for Evolving Traffic Sensor Networks

A2TTA:用于不断发展的交通传感器网络的锚定与敏捷测试时自适应

Du Yin, Xiachong Lin, Yue Tan, Jinliang Deng, Estrid He, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学) Beihang University(北京航空航天大学) RMIT University(皇家墨尔本理工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对交通传感器网络动态变化致传统预测模型性能下降问题,提出A2TTA框架,将拓扑诱导误差转化为输出校准问题,区分时间自适应,联合应对拓扑演变和多尺度时间偏移,实验证明该框架能有效提升预测性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-08-03 cs.CL cs.AI 版本更新 62%

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20145 2026-07-31 cs.CL cs.AI 版本更新 62%

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

SLAI T-Rex:在升腾超级集群上对DeepSeek-V4系列进行全参数训练后优化

Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo, Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu, Weihua Dai, Zirong Zeng, Ziwei Zhu, Zhuohan Wang, Zhengjun Yue, Igor Vasilyev, Min Liu, Weijian Sun, Xin Chen, Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang, Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin, Tian Ding, Zhihang Lin, Qian Chen, Linxin Yang, Mingzhe Yang, Bingwei Zhang, Hongzhang Yang, Fangxue Zhang, Shijun Qin, Jie Yu, Cuihua Hu, Tolstykh Vasiliy, Nosov Ivan, Abdullin Amir, Zhicheng Zhou, Xin Zhang, Zhixiong Ning, Xutong Zhao, Junjie Huang, Jiajun Liu, Weiyan Kong, Zheng Zhang, Wenhan Luo, Lin Hu, Yangbo Guo, Li Zeng, Shihao Zhang, Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究针对万亿参数规模MoE模型全参数训练后优化的系统挑战,在升腾NPU超级集群上以DeepSeek-V4为目标工作负载开发分层优化框架,建立CPT和SFT工作流程,提升模型性能,推动复杂推理前沿模型系统发展。

Comments 73 pages, 22 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13707 2026-07-31 cs.RO cs.AI cs.LG 版本更新 62%

REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning

REFINE-DP:通过强化学习实现人形机器人的动态-操作协调政策微调

Zhaoyuan Gu, Yipu Chen, Zimeng Chai, Alfred Cueva, Thong Nguyen, Yifan Wu, Huishu Xue, Minji Kim, Isaac Legene, Fukang Liu, KyoungMok Kim, Ayan Barula, Yongxin Chen, Ye Zhao

机构 * The Institute for Robotics and Intelligent Machines(机器人与智能机械研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出REFINE-DP框架,通过联合优化扩散政策高层规划器和基于强化学习的低层动态-操作控制器,提升人形机器人在复杂环境中的任务成功率与执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20656 2026-07-30 cs.LG cs.AI 版本更新 62%

Adaptive Multi-Horizon Reinforcement Learning

自适应多时间尺度强化学习

Manoosh Samiei, Doina Precup, Paul Masset

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究在复杂环境中强化学习的决策问题,提出自适应多时间尺度方法,能自适应选择和组合时间范围,无需手动调折扣因子,实验证明该方法可提高参数效率及增强适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03273 2026-07-30 cs.CV cs.AI cs.CL 版本更新 62%

VistaHop: Benchmarking Long-Horizon Visual DeepSearch

VistaHop: 视觉深度搜索的多跳视觉推理基准

Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

机构 * East China Normal University(东华大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14841 2026-07-29 cs.LG cs.AI cs.DC cs.ET 版本更新 62%

Real-Time Driver Safety Scoring Through Inverse Crash Probability Modeling

通过逆事故概率建模实现实时驾驶员安全评分

Joyjit Roy, Samaresh Kumar Singh, Sushanta Das

机构 * Independent Researcher(独立研究员) American Center for Mobility(美国移动中心)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeDriver-IQ框架,结合国家事故统计数据和自动驾驶数据,将二分类事故预测模型转化为0-100连续安全评分,提升实时驾驶员反馈的可操作性和解释性。

Comments 10 pages, 13 figures, and 14 tables. Submitted in EIT 2026 Conference hosted by The University of Wisconsin-La Crosse and sponsored by IEEE Region 4 (R4)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24625 2026-07-28 cs.LG cs.AI 版本更新 62%

AutoFed: Personalized Federated Traffic Prediction via Adaptive Prompt

AutoFed: 通过自适应提示实现个性化联邦交通预测

Zijian Zhao, Yitong Shang, Sen Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoFed框架,通过自适应提示学习实现个性化联邦交通预测,解决传统联邦学习在非独立同分布数据下的不足,无需手动调参,提升交通预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11912 2026-07-28 cs.LG cs.AI 版本更新 62%

How Transformers Learn to Plan via Multi-Token Prediction

Transformer 如何通过多令牌预测学习规划

Jianhao Huang, Zhanpeng Zhou, Renqiu Xia, Baharan Mirzasoleiman, Weijie Su, Wei Huang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) University of Pennsylvania(宾夕法尼亚大学) RIKEN Center for Advanced Intelligence Project(日本理化学研究院先进智能项目中心) The Institute of Statistical Mathematics(统计数学研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究多令牌预测如何促进推理,特别是规划,通过实验和理论分析展示其优于单令牌预测的性能及背后的机制。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01348 2026-07-28 cs.CL cs.LG 版本更新 62%

Does Faithfulness-Guided Alignment Hurt Accuracy? Unlocking Accurate and Faithful Post-Retrieval Reasoning

CRAFT: 通过强化学习进行多跳问答的校准推理与答案忠实轨迹

Yu Liu, Wenxiao Zhang, Diandian Guo, Cong Cao, Fangfang Yuan, Qiang Sun, Yanbing Liu, Jin B. Hong, Zhiyuan Ma

专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.LG

AI总结 CRAFT通过强化学习框架提升多跳问答的推理准确性和答案忠实度,结合确定性奖励和判官奖励,增强推理轨迹的可审计性与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22496 2026-07-28 cs.LG cs.AI 版本更新 62%

Action-Sufficient Goal Representations

动作充分的目标表示

Jinu Hyeon, Woobin Park, Hongjoon Ahn, Taesup Moon

机构 * Department of Electrical and Computer Engineering (ECE), Seoul National University(电子与计算机工程系,首尔国立大学) Interdisciplinary Program in Artificial Intelligence (IPAI), Seoul National University(人工智能交叉项目,首尔国立大学) ASRI / INMC, Seoul National University(ASRI/INMC,首尔国立大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出动作充分性概念,通过信息论框架改进目标表示,使动作学习更有效,实验表明其在离散环境中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19212 2026-07-27 cs.CL cs.AI cs.CY 版本更新 62%

When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas

当伦理与收益相悖时:道德两难情境下的大语言模型智能体

Steffen Backmann, David Guzman Piedrahita, Terry Jingchen Zhang, Emanuel Tewolde, Rada Mihalcea, Bernhard Schölkopf, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究道德要求与利润激励冲突时LLMs在道德两难博弈中的行为,引入\msim评估九个模型,通过ATEs估计因果效应、分析推理轨迹,发现模型道德行为有情境脆弱性,揭示了部署风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21262 2026-07-24 cs.AI cs.CL 版本更新 62%

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents

ARCO: 基于自适应规则与协同进化的多步LLM智能体

Zihang Tian, Jingsen Zhang, Rui Li, Xiaohe Bo, Yuanzi Li, Xu Chen

机构 * Renmin University of China(中国人民大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出ARCO框架,通过同尺度模型的双头结构(生成头与评分头)实现步骤级规则生成与奖励分配,结合轨迹分解约束和策略协同进化,在多个多跳QA任务上取得最优EM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28282 2026-07-23 cs.LG cs.AI cs.DC 版本更新 62%

Pre-Deployment Complexity Estimation for Federated Perception Systems

联邦感知系统部署前复杂度估计

KMA Solaiman, Shafkat Islam, Ruy de Oliveira, Bharat Bhargava

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Purdue University Northwest(普渡大学西北校区) Purdue University(普渡大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需分类器的预部署框架,用于估计联邦学习在分布式环境中的学习复杂度,通过联合建模数据固有属性和环境特征,实验表明该指标与联邦学习性能及通信成本密切相关。

Comments Accepted and presented at Edge AI Research Symposium 2026 (EdgeAI2026), San Diego, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13070 2026-07-22 cs.SE cs.AI 版本更新 62%

Falsifiable Release Gates for Self-Improving Systems: Standing Invariants at Scale

用于自我改进系统的可证伪发布门限

Deepak Soni

机构 * AI Architect(人工智能架构师)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究自我改进系统安全声明,提出可证伪发布门限及构建验证方法,在Antahkarana运行时应用,经机器检查确保安全,发布验收结果,明确范围,使结果可重现、门限可在其他框架运行。

Comments 23 pages, 14 figures. Major revision merging the follow-up "Standing Invariants at Scale" into this paper per arXiv moderation: the machine-checked action-safety core preserved across six further releases, six new invariant families with teeth, and real-hardware self-improvement; suite grown from 122 to 563 tests. Software, gate suite, run artifacts, and TLA+ spec are open source

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03087 2026-07-22 cs.RO cs.AI cs.LG 版本更新 62%

Training and Simulation of Quadrupedal Robot in Adaptive Stair Climbing and Descending for Indoor Firefighting: An End-to-End Reinforcement Learning Approach

四足机器人在室内灭火中的自适应爬楼梯训练与仿真:一种端到端强化学习方法

Baixiao Huang, Baiyu Huang, Yu Hou

机构 * Independent Researcher(独立研究者) Department of Construction Management, Western New England University(西雅图新英格兰大学建设管理系)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一种两阶段端到端强化学习方法,用于四足机器人在复杂室内环境中适应不同楼梯形状的爬行任务。

Comments 8 pages, 9 figures, 43rd International Symposium on Automation and Robotics in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10946 2026-07-22 cs.RO cs.AI cs.LG 版本更新 62%

ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning

ImplicitRDP:一种具有结构快慢学习的端到端视觉-力扩散策略

Wendi Chen, Han Xue, Yi Wang, Fangyuan Zhou, Jun Lv, Yang Jin, Shirun Tang, Chuan Wen, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Noematrix Ltd.(诺姆矩阵有限公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究人类水平接触操作中视觉与力感测信号整合难题,提出ImplicitRDP策略,用结构快慢学习机制及虚拟目标表示正则化,经实验验证其在丰富接触任务中显著优于基线,有卓越反应性与成功率。

Comments Accepted to RA-L 2026. Project page: https://implicit-rdp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08654 2026-07-22 quant-ph cs.AI cs.LG cs.NI 版本更新 62%

Robust Belief-State Policy Learning for Quantum Network Routing Under Decoherence and Time-Varying Conditions

在退相干和时变条件下量子网络路由的鲁棒信念状态策略学习

Amirhossein Taherpour, Abbas Taherpour, Tamer Khattab, Mazen Hasna

机构 * Department of Electrical Engineering, Columbia University(哥伦比亚大学电气工程系) Department of Electrical Engineering, Imam Khomeini International University(伊玛目·霍梅尼国际大学电气工程系) Department of Electrical Engineering, Qatar University(卡塔尔大学电气工程系)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对量子网络路由在复杂条件下的在线决策问题,基于q-POMDP和GNN开发鲁棒信念状态路由框架,通过原子微纪元等方法考虑多种因素,引入多种策略实现可扩展性,经融合与规则提供理论保证,模拟显示该混合控制器性能优于多种基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10203 2026-07-21 cs.LG cs.AI 版本更新 62%

Adaptive Compute in Latent World Models: When Depth Helps, Hurts, or Doesn't Matter

深度在组合中何时得以保留?潜在世界模型中的计算-质量机制

Achyuthan Sivasankar

机构 * New York University(纽约大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨潜在世界模型中深度在组合时的情况,用浅度惩罚ρ测试九个深度思维控制任务,发现三种机制,揭示反转机制由训练产生,其与观察/动作维度等相关,还指出任务机制受多种因素影响及相关注意事项。

Comments 15 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01741 2026-07-21 stat.ML cs.AI cs.LG 版本更新 62%

Full Bayesian Reinforcement Learning via LF-IBIS

基于LF-IBIS的全贝叶斯强化学习

Stefano Masini, Cecilia Viscardi, Michela Baccini

机构 * Department of Computer Science, University of Pisa, Italy(比萨大学计算机科学系) Department of Economics and Statistics, University of Salerno, Italy(萨勒诺大学经济学与统计系) Department of Statistics, Computer Science, Applications ”G.Parenti”, University of Florence, Italy(佛罗伦萨大学统计学、计算机科学与应用G.Parenti系)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出LF-IBIS算法,结合近似贝叶斯计算与迭代批量重要性采样,在似然函数不可得时实现强化学习中的全贝叶斯推断,量化策略不确定性以平衡探索-利用。

Comments 37 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18607 2026-07-17 cs.LG cs.AI 版本更新 62%

Reinforcement Learning in Switching Non-Stationary Markov Decision Processes: Algorithms and Convergence Analysis

切换非平稳马尔可夫决策过程中的强化学习:算法与收敛性分析

Mohsen Amiri, Sindri Magnússon

机构 * Department of Computer and System Science(计算机与系统科学系)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究切换非平稳马尔可夫决策过程,推导固定策略下SNS值函数闭式表达式,证明TD学习、策略迭代及表格Q学习的收敛性,在无线通信网络验证框架,为快速时变系统决策提供有效方法。

Comments Extended version of a paper accepted at the 2026 IEEE Conference on Decision and Control (CDC). Contains complete proofs, background material, and full experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02023 2026-07-16 cs.CL cs.AI 版本更新 62%

Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs

并非所有线索都能被发现:事实分布和“不要编造”提示如何影响长上下文语言模型中的检索、推理和幻觉

Amirali Ebrahimzadeh, Seyyed M. Salili

机构 * Department of Electrical Engineering & Computer Science University of Michigan(电气工程与计算机科学系 密歇根大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究大语言模型中事实分布和反幻觉提示对检索、推理及幻觉的影响,通过扩展基准评估多个模型,识别出分布崩溃和安全代价两种失败模式,发现许多失败源于无效上下文利用,强调特定模型稳健性和上下文管理的重要性。

Comments 16 pages, 8 figures, 2 tables. Accepted at the FAGEN Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05396 2026-07-16 cs.CL cs.SE 版本更新 62%

FairCoder: Probing LLM Bias in High-Stakes Decision Making via Coding Tasks

FairCoder:通过编码任务探究高风险决策中语言模型的偏差

Yongkang Du, Jen-tse Huang, Jieyu Zhao, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.SE

AI总结 研究通过FairCoder基准将决策制定设为编码任务,探究LLMs在多领域的偏差,针对现有指标不足提出FairScore指标,经实验揭示了此前未充分探索的偏差模式,凸显LLMs作决策代理的风险并提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05995 2026-07-15 cs.RO cs.AI cs.LG 版本更新 62%

TADPO: Reinforcement Learning Goes Off-road

TADPO:强化学习走向越野

Zhouchonghao Wu, Raymond Song, Vedant Mundheda, Luis E. Navarro-Serment, Christof Schoenborn, Jeff Schneider

机构 * Robotics Institute, School of Computer Science, Carnegie Mellon University(机器人研究所,计算机科学学院,卡内基梅隆大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 TADPO通过改进的策略梯度方法,首次在全规模越野平台上实现了基于强化学习的自动驾驶解决方案,能够应对复杂地形和低信号奖励环境。

Comments Accepted for Oral Presentation at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16727 2026-07-15 cs.AI cs.LG 版本更新 62%

Mobility-Aware Cache Framework for Scalable LLM-Based Human Mobility Simulation

面向可扩展性的LLM基人类移动模拟移动感知缓存框架

Hua Yan, Heng Tan, Yingxue Zhang, Yu Yang

机构 * Lehigh University(莱维大学) State University of New York at Binghamton(纽约州立大学布法罗分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 MobCache通过移动感知缓存框架提升大规模LLM基人类移动模拟的效率和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09149 2026-07-14 cs.LG cs.AI cs.MA 版本更新 62%

Enabling Agents to Communicate Entirely in Latent Space

使智能体能够在潜在空间中完全交流

Zhuoyun Du, Runze Wang, Huiyu Bai, Zouying Cao, Xiaoyong Zhu, Yu Cheng, Bo Zheng, Wei Chen, Haochao Ying

机构 * State Key Lab of CAD&CG(CAD与CG国家重点实验室) Future Living Lab of Alibaba(阿里巴巴未来生活实验室) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江医学影像人工智能重点实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Interlat方法,通过利用LLM的连续隐藏状态实现智能体间的潜在空间通信,实验表明其在跨异构模型中表现优异,提升了推理速度并保持性能。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17993 2026-07-14 cs.LG cs.AI 版本更新 62%

Turbo Connection: Reasoning as Information Flow from Higher to Lower Layers

Turbo Connection: 从高层到低层的信息流推理

Mohan Tang, Sidi Lu

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 Turbo Conn通过反向连接增强LLM推理能力,实现任务性能显著提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07040 2026-07-14 cs.LG cs.AI stat.ML 版本更新 62%

Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning

用于稳健平均奖励强化学习的高效Q学习和演员-评论家方法

Yang Xu, Swetha Ganesh, Vaneet Aggarwal

机构 * Purdue University(普渡大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究分布稳健无限期平均奖励MDPs的无模型方法,给出Q学习和演员-评论家算法非渐近收敛分析,建立稳健TD收敛界,引入相关算法并模拟,为稳健规划理论及无模型构建稳健策略提供基础。

Comments UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03565 2026-07-14 cs.LG cs.AI 版本更新 62%

Training on Irrelevant States Implies Data Augmentation: Generalization in Contextual MDPs

在无关状态上训练意味着数据增强:上下文马尔可夫决策过程中的泛化

Max Weltevrede, Caroline Horsch, Matthijs T. J. Spaan, Wendelin Böhmer

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究上下文马尔可夫决策过程零样本策略转移中智能体泛化问题,提出Explore-Go方法,通过在训练开始引入纯探索阶段,结合现有纯探索策略提升智能体覆盖范围与准确性来增强泛化能力,经实验验证该方法在多种基准测试中有效。

Comments arXiv admin note: text overlap with arXiv:2406.08069

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16861 2026-07-13 cs.RO cs.AI cs.LG 版本更新 62%

ReinforceGen: Hybrid Skill Policies with Automated Data Generation and Reinforcement Learning

ReinforceGen:具有自动数据生成和强化学习的混合技能策略

Zihan Zhou, Animesh Garg, Ajay Mandlekar, Caelan Garrett

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Georgia Institute of Technology(佐治亚理工学院) NVIDIA Research(NVIDIA研究)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对机器人长期操纵挑战,ReinforceGen系统结合任务分解、数据生成、模仿学习与运动规划形成初始方案,经强化学习微调,在Robosuite数据集基准测试中成功率达80%,消融研究显示微调使性能平均提升89%,实际评估也有显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏