arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 946 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 946 篇

2605.20173 2026-08-12 cs.AI cs.SE 版本更新 66%

A Methodology for Selecting and Composing Runtime Architecture Patterns for Production LLM Agents

为生产大语言模型代理选择和组合运行时架构模式的方法

Vasundra Srinivasan

机构 * AI Architect, Independent Researcher(人工智能架构师,独立研究员) Stanford School of Engineering(斯坦福大学工程学院)

专题命中 规划决策 :agent(abstract,comments);分类 cs.AI、cs.SE

AI总结 本文提出了一种方法,用于选择和组合运行时架构模式,以定义大语言模型代理的随机-确定性边界,并探讨其在不同代理类型中的应用及可靠性分解。

Comments 26 pages, 2 figures, 6 tables. Companion repo at https://github.com/vasundras/agent-runtime-patterns

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27000 2026-07-09 cs.CL cs.AI 版本更新 66%

Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning

撒更宽的网:面向代码推理的协调 Pass@K 策略优化

Yilong Li, Suman Banerjee, Tong Che

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA Research(英伟达研究)

专题命中 规划决策 :planning(abstract,comments);分类 cs.AI、cs.CL

AI总结 提出协调 Pass@K 策略优化 (CPPO),通过规划器生成多种策略并协调求解器尝试,以解决代码生成中重复采样导致冗余推理路径的问题,在多个基准上显著提升 pass@4。

Comments Code reasoning; pass@K optimization; coordinated planning; verifiable rewards; strategy diversity

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12627 2026-08-18 cs.CV cs.AI cs.CL cs.HC 版本更新 62%

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

EgoCITE:面向长时程自我中心记忆的上下文增强索引与时序感知检索

Le Zhang, Ke Sun

机构 * University of Michigan(密歇根大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对长时程自我中心记忆系统的索引不可靠、忽略时序意图的问题,提出EgoCITE框架,经多数据集评估,其准确率优于基线且成本显著低于长上下文LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14344 2026-08-18 cs.LG cs.AI 版本更新 62%

Zero-Shot Instruction Following in RL via Structured LTL Representations

通过结构化LTL表示在强化学习中实现零样本指令跟随

Mathias Jackermeier, Mattia Giuri, Jacques Cloete, Alessandro Abate

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于结构化LTL表示的强化学习方法,通过分层神经网络和注意力机制提升智能体在未见过任务中的指令跟随能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09761 2026-08-18 cs.LG cs.AI 版本更新 62%

Grounding LTL Tasks in Sub-Symbolic RL Environments for Zero-Shot Generalization

在子符号强化学习环境中将LTL任务接地以实现零样本泛化

Matteo Pannacci, Andrea Fanti, Elena Umili, Roberto Capobianco

机构 * Sapienza University of Rome(萨皮恩扎大学罗马分校) Sony AI(索尼人工智能)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出在子符号强化学习环境中通过联合训练多任务策略和符号接地器,实现LTL任务的零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16316 2026-08-17 cs.IR cs.AI cs.LG 版本更新 62%

RL-Index: Reinforcement Learning for Retrieval Index Reasoning

RL-Index:用于检索索引推理的强化学习

Yongjia Lei, Nedim Lipka, Zhisheng Qi, Utkarsh Sahu, Yuchen Zhuang, Wenqi Shi, Koustava Goswami, Franck Dernoncourt, Ryan A. Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) Adobe Research(Adobe研究)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出RL-Index框架,将检索索引推理转化为强化学习问题,通过LLM生成理由增强文档,使用GRPO优化,提升检索和问答性能并降低在线延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14732 2026-08-17 cs.LG cs.AI cs.CV eess.IV 版本更新 62%

INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT

INFORM-CT:整合LLM和VLM用于腹部CT的偶发发现管理

Idan Tankel, Nir Mazor, Rafi Brada, Christina LeBedis, Guy ben-Yosef

机构 * GE Healthcare Technology and Innovation Center(GE医疗技术与创新中心) Boston Medical Center(波士顿医疗中心)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于LLM和VLM的计划-执行框架,用于提高腹部CT偶发发现的检测、分类和报告效率与精度,通过自动化流程提升临床应用效果。

Comments Spotlight presentation at the 9th International Conference on Medical Imaging with Deep Learning (MIDL) 2026 Additional code and implementation details available at https://idan-tankel.github.io/InformCT_ProjectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06746 2026-08-17 cs.AI cs.LG 版本更新 62%

Semantically Labelled Automata for Multi-Task Reinforcement Learning with LTL Instructions

语义标注的自动机用于带有LTL指令的多任务强化学习

Alessandro Abate, Giuseppe De Giacomo, Mathias Jackermeier, Jan Kretínský, Maximilian Prokop, Christoph Weinhuber

机构 * University of Oxford(牛津大学) Technical University of Munich(慕尼黑技术大学) Masaryk University Brno(布拉格马萨里克大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于语义标注自动机的多任务强化学习方法,利用LTL指令实现高效任务嵌入和泛化能力,实验表明其在复杂规范下的优越性能。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12236 2026-08-13 cs.RO cs.AI cs.LG 版本更新 62%

TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

TMRL: 差分时间步调节预训练实现高效策略微调的探索

Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Amazon FAR(亚马逊FAR)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TMRL框架,通过结合行为克隆预训练与强化学习微调,解决预训练中动作分布狭窄的问题,提升机器人策略微调的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17468 2026-08-13 cs.LG cs.AI 版本更新 62%

Deep Activity Model: A Generative Approach for Human Mobility Pattern Synthesis

深度活动模型:一种用于人类移动模式合成的生成式方法

Xishun Liao, Qinhua Jiang, Brian Yueshuai He, Yifan Liu, Chenchen Kuai, Jiaqi Ma

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对现有人类移动模型的局限,提出生成式Transformer模型,结合社会人口统计与家庭属性合成活动链,经数据训练微调后,在多区域模拟中表现良好,为城市规划提供实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07968 2026-08-12 cs.CL cs.AI 版本更新 62%

Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions

努力而非明智:推理模型无法在不同问题间合理分配测试时计算资源

Chenrui Fan, Yize Cheng, Ming Li, Yongyuan Liang, Tianyi Zhou, Soheil Feizi

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出考试式评估框架发现推理模型无法在不同难度分值的问题间合理分配共享测试时计算预算,明确规划提示可使分配更均匀但仍不敏感于分值难度,全局预算分配是现有模型未掌握的独特能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06690 2026-08-12 cs.CR cs.AI cs.LG 版本更新 62%

Policy-Masked Private Experts: Auditable and Reversible Capability Access Control in Sparse MoE Models

策略掩码私有专家:稀疏混合专家(MoE)模型中的可审计可逆能力访问控制

Zhuoheng Huang, Mukesh Singh

专题命中 规划决策 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Policy-Masked Private Experts方法,在稀疏MoE模型中实现可审计可逆的能力访问控制,经Qwen、DeepSeek等实验验证其能严格限制未授权访问并保留私有分支效用。

Comments 14 pages, 1 figure, 8 tables. Corrected the DeepSeek decoding and evaluation results and updated the corresponding analysis; corrected the mathematical statement of the frozen-parameter guarantee; clarified paired statistical inference; expanded related work and corrected references

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15142 2026-08-11 cs.AI cs.LG 版本更新 62%

Concept-Guided Spatial Regularization for World Models in Atari Pong

《雅达利乒乓球游戏中用于世界模型的概念引导空间正则化》

Yukuan Lu, Zaishuo Xia, Weyl Lu, Yubei Chen

机构 * UC Davis(加州大学戴维斯分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究雅达利乒乓球游戏中五个视觉世界模型智能体,发现其存在诸多问题。提出概念引导空间正则化(CGSReg),实验表明该方法在部分模型中改善了闭环展开和像素空间零样本MBRL,但不能解决所有世界模型瓶颈。

Comments Revised manuscript with updated presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08793 2026-08-11 stat.ML cs.AI cs.LG cs.SY eess.SY math.OC 版本更新 62%

EHR-MPC: Inference-Time Control for Sepsis Treatment with Generative Patient Digital Twins

EHR-MPC:利用生成式患者数字孪生进行脓毒症治疗的推理时间控制

Joshua Pickard, Wei Qi, Na Li, Ann Woolley, Lisa Cosimi, Roy Kishony, Deborah Hung

机构 * Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所) Harvard University(哈佛大学) Brigham and Women’s Hospital(布莱根妇女医院) Technion–Israel Institute of Technology(技术学院-以色列理工学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对脓毒症治疗策略有争议且现有强化学习方法适应性不足的问题,提出EHR-MPC框架,通过训练生成式电子健康记录模型形式的患者数字孪生解耦学习与治疗优化,经模拟评估性能优于强化学习基线,建立了决策通用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04713 2026-08-11 cs.LG cs.AI 版本更新 62%

RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents

RSPO:用于多轮语言模型智能体的奖励交换策略优化

Qiang Liu, Taian Guo, Ruizhi Qiao, Xing Sun

机构 * Tencent YouTu Lab(腾讯优图实验室)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究多轮语言模型智能体训练问题,针对稀疏结果奖励训练收敛慢等问题,提出奖励交换策略优化方法,利用密集过程奖励信息,确保轨迹多样性和目标与真实奖励一致性,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26502 2026-08-11 cs.AI cs.CL 版本更新 62%

Humans Disengage, Reasoning Models Persist: Separating Difficulty Registration from Deliberation Allocation

人类放弃,推理模型坚持:将难度登记与深思分配分离

Han-yu Wang

机构 * The University of Hong Kong(香港大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过分离难度登记与深思分配,发现人类与大型推理模型(LRM)在问题解决中的时间/令牌分配模式相反:人类在错误问题上用时更少,而LRM在错误问题上使用更多令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05164 2026-08-11 cs.LG cs.AI 版本更新 62%

Not All Turns Are Equally Hard: Adaptive Thinking Budgets For Efficient Multi-Turn Reasoning in Agents

并非所有转折都同样困难:为高效多轮推理的自适应思维预算

Neharika Jali, Anupam Nayak, Gauri Joshi

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TAB方法,通过自适应预算分配提升多轮推理效率,在数学推理基准中实现更高的准确率与token节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09125 2026-08-11 cs.CL cs.LG 版本更新 62%

LogicIF: Towards Complex Logic Instruction Following

复杂逻辑指令生成

Mian Zhang, Shujian Liu, Sixun Dong, Ming Yin, Yebowen Hu, Xun Wang, Simin Ma, Song Wang, Sathish Reddy Indurthi, Haoyun Deng, Zhiyu Zoey Chen, Kaiqiang Song

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Independent Researcher(独立研究者) Duke University(杜克大学) University of Central Florida(佛罗里达大学中央分校)

专题命中 规划决策 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LogicIFGen和LogicIFEval,用于生成和评估复杂逻辑指令,揭示了当前LLMs在复杂指令跟随上的不足。

Comments COLM 2026 Acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24653 2026-08-10 cs.CL cs.LG 版本更新 62%

Kimi K3: Open Frontier Intelligence

Kimi K3:开放前沿智能

Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, M. C., Jianfeng Cai, Xinyuan Cai, Peizhou Cao, Yuxuan Cao, Ziwei Chai, Y. Charles, H. S. Che, Guanduo Chen, Guangyu Chen, Guanzheng Chen, Huarong Chen, Jia Chen, Jianlong Chen, Jun Chen, Kexin Chen, Peng Chen, Ruijue Chen, Wentao Chen, Xin Chen, Yang Chen, Yanru Chen, Yifei Chen, Yingjiang Chen, Yuankun Chen, Yujie Chen, Yutian Chen, Zhirong Chen, Dazhi Cheng, Yean Cheng, Jialei Cui, Jingbing Cui, Anqi Dai, Jiaqi Deng, Hao Ding, Rui Ding, Shaofeng Ding, Mengfan Dong, Mengnan Dong, Yuhao Dong, Yuxin Dong, Angang Du, Chenzhuang Du, Dikang Du, Jusen Du, Yulun Du, Yu Fan, Jing Feng, Qiulin Feng, Yichen Feng, Kelin Fu, Qiang Fu, Fuxuan Gao, Hongcheng Gao, Jingyue Gao, Tong Gao, Weijia Gao, Shangyi Geng, Jie Gong, Linhu Gong, Shengao Gong, Xiaochen Gong, Qizheng Gu, Yicheng Gu, Shuhao Guan, Haiqing Guo, Shiqi Guo, Xiang Guo, Zhengyan Guo, Beixi Hao, Wenxin Hao, Xiaoru Hao, Dailan He, Haotian He, Lehan He, Qi He, Weiran He, Xinran He, Xinyi He, Yibo He, Yunjia He, Chao Hong, Tiange Hong, Hao Hu, Jiaxi Hu, Ruikun Hu, Weiming Hu, Yangyang Hu, Zhenxing Hu, Liang Hua, Jinbin Huang, Ke Huang, Ruiyuan Huang, Siying Huang, Weixiao Huang, Yan Huang, Zhengjie Huang, Zhiqi Huang, Yulong Hui, Chaobo Jia, Yutong Jiang, Zhejun Jiang, Zuoyou Jiang, Wenyi Jin, Xinyi Jin, Yu Jing, Huanjun Kong, Guokun Lai, Aidi Li, Cheng Li, Chengyuan Li, Cong Li, Fang Li, Guanyu Li, Haoyang Li, Jia Li, Junxiong Li, Lei Li, Letian Li, Lincan Li, Weihong Li, Wentao Li, Xintong Li, Yang Li, Yishen Li, Yiwei Li, Yuxiao Li, Zhaowei Li, Zhaoxi Li, Zheming Li, Zhengxiao Li, Zhiyuan Li, Jiawei Lin, Xiaohan Lin, Yibo Lin, Zichao Lin, Ziyan Lin, Bill Liu, Boxiao Liu, Chuan Liu, Liang Liu, Shaowei Liu, Shudong Liu, Shuran Liu, Tianwei Liu, Weizhou Liu, Yangyang Liu, Yanming Liu, Yibo Liu, Yipeng Liu, Zhengying Liu, Zhiheng Liu, Enzhe Lu, Haoyu Lu, Linqiang Lu, Tingzhan Lu, Zhiyuan Lu, Aotian Luo, G. Luo, Junyu Luo, Yifan Luo, B. Lyu, Wenzhou Lyu, Shaoguang Mao, Yuan Mei, Xin Men, Minqing Ni, Yixuan Niu, Siyuan Pan, Shujun Peng, Zhangyang Qi, Ruoyu Qin, ZeChao Qin, Zeyu Qin, Haiquan Qiu, Jianxin Qiu, Jiezhong Qiu, Bowen Qu, Yuhao Qu, Zeyu Shang, Youbo Shao, Han Shen, Jincheng Shi, Juanfeng Shi, Lidong Shi, Shengyuan Shi, Wingchun Siu, Pengwei Song, Xiaoxi Song, Jianlin Su, Yunfeng Su, Zhaochen Su, Lin Sui, Jingsong Sun, Junyao Sun, Shaoning Sun, Shuzhe Sun, Tongyu Sun, Yujun Sun, Yunpeng Tai, Chuning Tang, Heyi Tang, Sirui Tang, Zecheng Tang, Chaoran Tian, Rongpeng Tian, Yu Tian, Wei Tu, Chensi Wang, Chuang Wang, Chunjie Wang, Dinglu Wang, Feng Wang, Hailong Wang, Haiming Wang, Hao Wang, Hao Wang, Huaqing Wang, Hui Wang, Jiayi Wang, Jinglong Wang, Jinhong Wang, Jiuzheng Wang, Linian Wang, Shaobo Wang, Shenzhi Wang, Shuyi Wang, Si Wang, Siyuan Wang, Tianfu Wang, Wenjue Wang, Xingran Wang, Xinmei Wang, Xinyuan Wang, Xusheng Wang, Yalin Wang, Yangkun Wang, Yao Wang, Yaoyu Wang, Yejie Wang, Yiqin Wang, Yucheng Wang, Yuzhi Wang, Zhaoji Wang, Zhaowei Wang, Zhengtao Wang, Zhenhao Wang, Zhongsheng Wang, Zifan Wang, Chu Wei, Ming Wei, Shouxin Wei, Zichen Wen, Fan Wu, Haoning Wu, Rucong Wu, Wenhao Wu, Xiaoxue Wu, Yingcong Wu, Yongqi Wu, Yuxin Wu, Zijian Wu, Xinglang Xian, Chenxuan Xiang, Yuye Xiang, Bocheng Xiao, Chenjun Xiao, Xin Xiao, Jin Xie, Xiaotong Xie, Yifeng Xie, Zhe Xie, Bowei Xing, Yiming Xiong, Baosheng Xu, Boyu Xu, Jiale Xu, Jianfan Xu, Jing Xu, Jinjing Xu, L. H. Xu, Qingtao Xu, Shuyao Xu, Suting Xu, Tiantian Xu, Tianxiang Xu, Weixin Xu, Xinran Xu, Yangchuan Xu, Ye Xu, Yueni Xu, Ziyao Xu, Haonan Xue, Junjie Yan, Yaoyao Yan, Fan Yang, Guangyao Yang, Hao Yang, Junwei Yang, Ruoyu Yang, Wenjie Yang, Xiaofei Yang, Xinyu Yang, Yi Yang, Yiling Yang, Ying Yang, Yuchen Yang, Zhen Yang, Zhilin Yang, Zian Yang, Zuhao Yang, Haotian Yao, Dan Ye, Haoran Ye, Wenjie Ye, Zhanbo Ye, Bohong Yin, Haoxiang Yin, Xietong Yin, Chengzhen Yu, Haozhen Yu, Longhui Yu, Shengnan Yu, Shuying Yu, Tianxiang Yu, Enming Yuan, Mengjie Yuan, Tongtian Yue, Wei Yue, Yang Yue, Dunyuan Zha, Haobing Zhan, B. H. Zhang, Dehao Zhang, Fei Zhang, Hao Zhang, Haoyuan Zhang, Huanyu Zhang, Jiapei Zhang, Jiaxuan Zhang, Jin Zhang, Kaiyi Zhang, Miaozhen Zhang, Puqi Zhang, Qinglei Zhang, Rong Zhang, Rui Zhang, Shaoshuai Zhang, Shiyi Zhang, Xiaobin Zhang, Xiaoyun Zhang, Y. Zhang, Yangkun Zhang, Ye Zhang, Yichi Zhang, Yikun Zhang, Yizhi Zhang, Yongting Zhang, Yu Zhang, Yutao Zhang, Yutong Zhang, Zheng Zhang, Zijing Zhang, Bin Zhao, Chenguang Zhao, Feifan Zhao, Jinglun Zhao, Jinxiang Zhao, Shuai Zhao, Wenshuo Zhao, Xiangyu Zhao, Xuanle Zhao, Yikai Zhao, Zijia Zhao, Haozhi Zheng, Huabin Zheng, Ruihan Zheng, Shaojie Zheng, Tengyang Zheng, Haofeng Zhong, Lei Zhong, Longguang Zhong, M. Zhou, Qiankang Zhou, Runjie Zhou, Ruozhang Zhou, Xinyu Zhou, Yiqiao Zhou, Zaida Zhou, Jinguo Zhu, Liya Zhu, Xinhao Zhu, Yangjunfeng Zhu, Yuxuan Zhu, Zhen Zhu, Chen Zhuang, Weiyu Zhuang, Xinxing Zu

专题命中 规划决策 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 介绍Kimi K3这一2.8T参数的专家混合模型,基于Kimi Delta Attention等构建,结合多种方法使缩放效率提升约2.5倍。经训练后在多领域强化学习表现出色,虽整体性能略逊最强专有模型,但在多项任务中达前沿水平且优于其他模型,还发布模型权重助力研究。

Comments K3 tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16999 2026-08-10 cs.LG cs.AI 版本更新 62%

Counterfactual Shapley Credit Assignment

反事实沙普利信用分配

Mingxuan Li, Kai-Zhan Lee, Elias Bareinboim

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究信用分配问题,提出基于因果理论的反事实沙普利信用分配框架,通过反事实沙普利值分配功劳责任,推导有效估计器实现$\phi$-PPO方法,结合优先轨迹重放,在复杂环境中有卓越样本效率,能精确对齐奖励真实原因。

Comments Reinforcement Learning Journal 2026 (Also RLC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04568 2026-08-07 cs.LG cs.AI cs.RO 版本更新 62%

Dream-MPC: Gradient-Based Model Predictive Control with Latent Imagination

Dream-MPC:基于梯度与潜在想象的模型预测控制

Jonathan Spieler, Sven Behnke

机构 * Autonomous Intelligent Systems, Computer Science Institute VI - Intelligent Systems(自主智能系统,计算机科学研究所VI - 智能系统) Robotics, Center for Robotics(机器人学,机器人中心) the Lamarr Institute for Machine Learning(拉马尔机器学习研究所) Artificial Intelligence, University of Bonn, Germany(人工智能,波恩大学,德国)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出Dream-MPC方法,通过从展开策略生成少量候选轨迹,并利用学习的世界模型进行梯度上升优化,结合不确定性正则化和时间上的优化迭代摊销,显著提升了底层策略性能,在24个连续控制任务上优于无梯度MPC和现有基线。

Comments Accepted for International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16839 2026-08-07 cs.LG cs.AI 版本更新 62%

Trajectory-guided discharge stratification for heart failure using short-context electronic health record sequence modeling

利用序列建模预测心力衰竭患者一年临床不稳定性和死亡率

Falk Dippel, Yinan Yu, Annika Rosengren, Martin Lindgren, Christina E. Lundberg, Erik Aerts, Martin Adiels, Helen Sjöland

机构 * Sahlgrenska University Hospital(斯德哥尔摩大学医院) Department of Computer Science and Engineering, Chalmers University of Technology and University of Gothenburg(计算机科学与工程系,查尔姆斯理工大学和乌普萨拉大学) Department of Molecular and Clinical Medicine, Sahlgrenska Academy, University of Gothenburg(分子与临床医学系,斯德哥尔摩学院,乌普萨拉大学) Department of Medicine, Geriatrics and Emergency Medicine, Sahlgrenska University Hospital(医学、老年医学和急诊医学系,斯德哥尔摩大学医院) Department of Food and Nutrition, and Sport Science, Faculty of Education, University of Gothenburg(营养学与体育科学系,教育学院,乌普萨拉大学) School of Public Health and Community Medicine, Institute of Medicine, University of Gothenburg(公共卫生与社区医学系,医学院,乌普萨拉大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过序列模型预测心力衰竭患者一年内的临床不稳定性和死亡风险,发现Llama模型在有限数据下表现优异,为出院后风险分层提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14407 2026-08-06 cs.IT cs.AI cs.LG math.IT 版本更新 62%

Decision Making Needs Uncertainty Quantification [Lecture Notes]

决策需要不确定性量化[讲义笔记]

Osvaldo Simeone

机构 * Institute for Intelligent Networked Systems, Northeastern University London(智能网络系统研究所,伦敦大学东北学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究决策中不确定性量化问题,从基本原理出发,在已知和未知环境分布下,探讨风险中性与厌恶型智能体所需不确定性表示形式,确定解决认知不确定性的三种互补方法,强调可靠决策需匹配不确定性表示及效用保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13028 2026-08-06 cs.LG cs.AI cs.RO 版本更新 62%

TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at Scale

TerraZero:用于大规模零演示自博弈的过程式驾驶模拟

Zhouchonghao Wu, Akshay Rangesh, Weixin Li, Wei-Jer Chang, Zachary Lee, Saeed Bonab, Tim Wang, Wei Zhan

机构 * Applied Intuition(应用直觉)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在训练强大自动驾驶智能体,提出TerraZero过程式驾驶模拟器和自博弈训练堆栈,其速度快、逼真且多样。通过特定方式填充地图生成无限场景,智能体仅靠强化学习训练,能零样本泛化,在多个基准测试中表现出色。

Comments Technical Report from Applied Intuition Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17218 2026-08-04 cs.LG cs.AI 版本更新 62%

Learning Graph-Indexed Trajectory Patterns for Stochastic On-Time Arrival Routing

基于历史感知决策变换器的通用策略梯度用于图信号上的可靠路由

Yuanhang Wang, Xing Wei, Duoxiang Zhao, Zezhou Zhang, Hao Qin, Yuqi Ouyang

机构 * Sichuan University-Pittsburgh Institute(四川大学匹兹堡研究院) Sichuan University(四川大学) College of Computer Science(计算机科学学院) University College Dublin(都柏林大学) School of Electrical and Electronic Engineering(电子与电气工程学院) School of Electronics and Information Engineering(电子与信息工程学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GPG-HT框架,通过整合决策变换器和通用策略梯度优化,解决随机交通网络中考虑不确定和相关旅行时间的问题,提升可靠路由性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11671 2026-08-04 cs.CR cs.AI cs.SE 版本更新 62%

Cochise: A Reference Harness for Autonomous Penetration Testing

Cochise:自主渗透测试的参考框架

Andreas Happe, Jürgen Cito

机构 * TU Wien(维也纳技术大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.SE

AI总结 Cochise提供了一个简洁的自主渗透测试框架,支持通过SSH连接LLM代理与Linux主机,并通过分离的规划-执行架构实现可控环境,同时提供重放和分析工具以支持研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07725 2026-08-04 cs.CL cs.AI 版本更新 62%

SOD: Step-wise On-policy Distillation for Small Language Model Agents

SOD:分步式在线蒸馏用于小型语言模型代理

Qiyong Zhong, Mao Zheng, Mingyang Song, Xin Lin, Jie Sun, Houcheng Jiang, Xiang Wang, Junfeng Fang

机构 * Zhejiang University(浙江大学) Large Language Model Department, Tencent(腾讯大语言模型部门) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 针对小型语言模型中工具集成推理的稳定性问题,提出SOD分步式在线蒸馏框架,通过动态调整蒸馏强度缓解教师信号误导,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25875 2026-08-03 cs.LG cs.AI 版本更新 62%

A2TTA: Anchored-and-Agile Test-Time Adaptation for Evolving Traffic Sensor Networks

A2TTA:用于不断发展的交通传感器网络的锚定与敏捷测试时自适应

Du Yin, Xiachong Lin, Yue Tan, Jinliang Deng, Estrid He, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学) Beihang University(北京航空航天大学) RMIT University(皇家墨尔本理工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对交通传感器网络动态变化致传统预测模型性能下降问题,提出A2TTA框架,将拓扑诱导误差转化为输出校准问题,区分时间自适应,联合应对拓扑演变和多尺度时间偏移,实验证明该框架能有效提升预测性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-08-03 cs.CL cs.AI 版本更新 62%

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20145 2026-07-31 cs.CL cs.AI 版本更新 62%

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

SLAI T-Rex:在升腾超级集群上对DeepSeek-V4系列进行全参数训练后优化

Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo, Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu, Weihua Dai, Zirong Zeng, Ziwei Zhu, Zhuohan Wang, Zhengjun Yue, Igor Vasilyev, Min Liu, Weijian Sun, Xin Chen, Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang, Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin, Tian Ding, Zhihang Lin, Qian Chen, Linxin Yang, Mingzhe Yang, Bingwei Zhang, Hongzhang Yang, Fangxue Zhang, Shijun Qin, Jie Yu, Cuihua Hu, Tolstykh Vasiliy, Nosov Ivan, Abdullin Amir, Zhicheng Zhou, Xin Zhang, Zhixiong Ning, Xutong Zhao, Junjie Huang, Jiajun Liu, Weiyan Kong, Zheng Zhang, Wenhan Luo, Lin Hu, Yangbo Guo, Li Zeng, Shihao Zhang, Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究针对万亿参数规模MoE模型全参数训练后优化的系统挑战,在升腾NPU超级集群上以DeepSeek-V4为目标工作负载开发分层优化框架,建立CPT和SFT工作流程,提升模型性能,推动复杂推理前沿模型系统发展。

Comments 73 pages, 22 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏