arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2976 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 909 篇

2507.05169 2026-06-19 cs.LG cs.AI cs.CL cs.CV cs.RO 版本更新 67%

Critique of World Model

世界模型批判:一种用于世界建模的生成式潜在预测架构

Eric Xing, Mingkai Deng, Jinyu Hou

机构 * Institute of Foundation Models(基础模型研究院) Mohamed bin Zayed University of Artificial Intelligence(莫莫德 bin Zayed 人工智能大学) School of Computer Science Carnegie Mellon University(计算机科学学院卡内基梅隆大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文从心理学“假设性思维”出发,提出世界模型的核心目标是模拟真实世界的所有可行动可能性,并设计了一种基于状态化、分层、多级、混合连续/离散表示的生成式潜在预测(GLP)架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28076 2026-06-18 cs.CL cs.AI cs.LG 版本更新 67%

TopBench: A Benchmark for Implicit Predictive Reasoning in Tabular Question Answering

TopBench:表格问答中隐式预测推理的基准

An-Yang Ji, Jun-Peng Jiang, De-Chuan Zhan, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出TopBench基准,包含779个样本和四个子任务,评估大语言模型在表格问答中识别隐式预测意图并进行可靠推理的能力,发现当前模型在意图识别上存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21577 2026-06-16 cs.CL cs.AI cs.LG stat.ML 版本更新 67%

A Unified Definition of Hallucination: It's The World Model, Stupid!

幻觉的统一定义:是世界模型的问题,笨蛋!

Emmy Liu, Varun Gangal, Chelsea Zou, Michael Yu, Xiaoqi Huang, Alex Chang, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出幻觉的统一定义,即用户可观察到的错误内部世界建模,并连接至HalluWorld基准测试,以区分真实幻觉与规划或奖励错误。

Comments ICML 2026. HalluWorld benchmark at https://github.com/DegenAI-Labs/HalluWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05972 2026-06-12 cs.DC 版本更新 67%

DWM-RO: Decentralized World Models with Reasoning Offloading for SWIPT-enabled Satellite-Terrestrial HetNets

DWM-RO:面向支持SWIPT的卫星-地面异构网络的去中心化世界模型与推理卸载

Guangyuan Liu, Yinqiu Liu, Ruichen Zhang, Nan Ma, Jiawen Kang, Sumei Sun, Abbas Jamalipour, Ping Zhang

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 针对SWIPT卫星-地面异构网络中多智能体强化学习样本效率低和协调性差的问题,提出去中心化世界模型与推理卸载框架,通过想象策略训练和边缘协调机制实现快速收敛、高谱效和低约束违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17947 2026-06-09 cs.CR cs.AI cs.CL cs.LG cs.MA 版本更新 67%

PLAGUE: Plug-and-play framework for Lifelong Adaptive Generation of Multi-turn Exploits

PLAGUE:面向多轮利用的终身自适应生成的即插即用框架

Neeladri Bhuiya, Madhav Aggarwal, Diptanshu Purwar

机构 * A10 Networks, Inc.(A10网络公司) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出PLAGUE框架,通过终身学习启发的三阶段设计(Primer、Planner、Finisher)实现高效多轮越狱攻击,在o3和Opus 4.1等强安全模型上ASR提升超30%。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12591 2026-06-09 q-fin.TR math.OC math.PR 版本更新 67%

Optimal Rebate Design: Incentives, Competition and Efficiency in Auction Markets

最优返利设计:拍卖市场中的激励、竞争与效率

Thibaut Mastrolia, Tianrui Xu

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 研究拍卖市场中交易所通过返利政策激励做市商、缩小清算价与资产价值价差以提升市场效率的最优设计问题,采用主从博弈框架和深度BSDE方法求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20173 2026-08-12 cs.AI cs.SE 版本更新 66%

A Methodology for Selecting and Composing Runtime Architecture Patterns for Production LLM Agents

为生产大语言模型代理选择和组合运行时架构模式的方法

Vasundra Srinivasan

机构 * AI Architect, Independent Researcher(人工智能架构师,独立研究员) Stanford School of Engineering(斯坦福大学工程学院)

专题命中 规划决策 :agent(abstract,comments);分类 cs.AI、cs.SE

AI总结 本文提出了一种方法,用于选择和组合运行时架构模式,以定义大语言模型代理的随机-确定性边界,并探讨其在不同代理类型中的应用及可靠性分解。

Comments 26 pages, 2 figures, 6 tables. Companion repo at https://github.com/vasundras/agent-runtime-patterns

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27000 2026-07-09 cs.CL cs.AI 版本更新 66%

Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning

撒更宽的网:面向代码推理的协调 Pass@K 策略优化

Yilong Li, Suman Banerjee, Tong Che

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA Research(英伟达研究)

专题命中 规划决策 :planning(abstract,comments);分类 cs.AI、cs.CL

AI总结 提出协调 Pass@K 策略优化 (CPPO),通过规划器生成多种策略并协调求解器尝试,以解决代码生成中重复采样导致冗余推理路径的问题,在多个基准上显著提升 pass@4。

Comments Code reasoning; pass@K optimization; coordinated planning; verifiable rewards; strategy diversity

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16316 2026-08-17 cs.IR cs.AI cs.LG 版本更新 62%

RL-Index: Reinforcement Learning for Retrieval Index Reasoning

RL-Index:用于检索索引推理的强化学习

Yongjia Lei, Nedim Lipka, Zhisheng Qi, Utkarsh Sahu, Yuchen Zhuang, Wenqi Shi, Koustava Goswami, Franck Dernoncourt, Ryan A. Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) Adobe Research(Adobe研究)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出RL-Index框架,将检索索引推理转化为强化学习问题,通过LLM生成理由增强文档,使用GRPO优化,提升检索和问答性能并降低在线延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14732 2026-08-17 cs.LG cs.AI cs.CV eess.IV 版本更新 62%

INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT

INFORM-CT:整合LLM和VLM用于腹部CT的偶发发现管理

Idan Tankel, Nir Mazor, Rafi Brada, Christina LeBedis, Guy ben-Yosef

机构 * GE Healthcare Technology and Innovation Center(GE医疗技术与创新中心) Boston Medical Center(波士顿医疗中心)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于LLM和VLM的计划-执行框架,用于提高腹部CT偶发发现的检测、分类和报告效率与精度,通过自动化流程提升临床应用效果。

Comments Spotlight presentation at the 9th International Conference on Medical Imaging with Deep Learning (MIDL) 2026 Additional code and implementation details available at this https URL (https://idan-tankel.github.io/InformCT_ProjectPage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06746 2026-08-17 cs.AI cs.LG 版本更新 62%

Semantically Labelled Automata for Multi-Task Reinforcement Learning with LTL Instructions

语义标注的自动机用于带有LTL指令的多任务强化学习

Alessandro Abate, Giuseppe De Giacomo, Mathias Jackermeier, Jan Kretínský, Maximilian Prokop, Christoph Weinhuber

机构 * University of Oxford(牛津大学) Technical University of Munich(慕尼黑技术大学) Masaryk University Brno(布拉格马萨里克大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于语义标注自动机的多任务强化学习方法,利用LTL指令实现高效任务嵌入和泛化能力,实验表明其在复杂规范下的优越性能。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12236 2026-08-13 cs.RO cs.AI cs.LG 版本更新 62%

TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

TMRL: 差分时间步调节预训练实现高效策略微调的探索

Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Amazon FAR(亚马逊FAR)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TMRL框架,通过结合行为克隆预训练与强化学习微调,解决预训练中动作分布狭窄的问题,提升机器人策略微调的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17468 2026-08-13 cs.LG cs.AI 版本更新 62%

Deep Activity Model: A Generative Approach for Human Mobility Pattern Synthesis

深度活动模型:一种用于人类移动模式合成的生成式方法

Xishun Liao, Qinhua Jiang, Brian Yueshuai He, Yifan Liu, Chenchen Kuai, Jiaqi Ma

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对现有人类移动模型的局限,提出生成式Transformer模型,结合社会人口统计与家庭属性合成活动链,经数据训练微调后,在多区域模拟中表现良好,为城市规划提供实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07968 2026-08-12 cs.CL cs.AI 版本更新 62%

Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions

努力而非明智:推理模型无法在不同问题间合理分配测试时计算资源

Chenrui Fan, Yize Cheng, Ming Li, Yongyuan Liang, Tianyi Zhou, Soheil Feizi

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出考试式评估框架发现推理模型无法在不同难度分值的问题间合理分配共享测试时计算预算,明确规划提示可使分配更均匀但仍不敏感于分值难度,全局预算分配是现有模型未掌握的独特能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06690 2026-08-12 cs.CR cs.AI cs.LG 版本更新 62%

Policy-Masked Private Experts: Auditable and Reversible Capability Access Control in Sparse MoE Models

策略掩码私有专家:稀疏混合专家(MoE)模型中的可审计可逆能力访问控制

Zhuoheng Huang, Mukesh Singh

专题命中 规划决策 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Policy-Masked Private Experts方法,在稀疏MoE模型中实现可审计可逆的能力访问控制,经Qwen、DeepSeek等实验验证其能严格限制未授权访问并保留私有分支效用。

Comments 14 pages, 1 figure, 8 tables. Corrected the DeepSeek decoding and evaluation results and updated the corresponding analysis; corrected the mathematical statement of the frozen-parameter guarantee; clarified paired statistical inference; expanded related work and corrected references

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15142 2026-08-11 cs.AI cs.LG 版本更新 62%

Concept-Guided Spatial Regularization for World Models in Atari Pong

《雅达利乒乓球游戏中用于世界模型的概念引导空间正则化》

Yukuan Lu, Zaishuo Xia, Weyl Lu, Yubei Chen

机构 * UC Davis(加州大学戴维斯分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究雅达利乒乓球游戏中五个视觉世界模型智能体,发现其存在诸多问题。提出概念引导空间正则化(CGSReg),实验表明该方法在部分模型中改善了闭环展开和像素空间零样本MBRL,但不能解决所有世界模型瓶颈。

Comments Revised manuscript with updated presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08793 2026-08-11 stat.ML cs.AI cs.LG cs.SY eess.SY math.OC 版本更新 62%

EHR-MPC: Inference-Time Control for Sepsis Treatment with Generative Patient Digital Twins

EHR-MPC:利用生成式患者数字孪生进行脓毒症治疗的推理时间控制

Joshua Pickard, Wei Qi, Na Li, Ann Woolley, Lisa Cosimi, Roy Kishony, Deborah Hung

机构 * Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所) Harvard University(哈佛大学) Brigham and Women’s Hospital(布莱根妇女医院) Technion–Israel Institute of Technology(技术学院-以色列理工学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对脓毒症治疗策略有争议且现有强化学习方法适应性不足的问题,提出EHR-MPC框架,通过训练生成式电子健康记录模型形式的患者数字孪生解耦学习与治疗优化,经模拟评估性能优于强化学习基线,建立了决策通用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04713 2026-08-11 cs.LG cs.AI 版本更新 62%

RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents

RSPO:用于多轮语言模型智能体的奖励交换策略优化

Qiang Liu, Taian Guo, Ruizhi Qiao, Xing Sun

机构 * Tencent YouTu Lab(腾讯优图实验室)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究多轮语言模型智能体训练问题,针对稀疏结果奖励训练收敛慢等问题,提出奖励交换策略优化方法,利用密集过程奖励信息,确保轨迹多样性和目标与真实奖励一致性,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26502 2026-08-11 cs.AI cs.CL 版本更新 62%

Humans Disengage, Reasoning Models Persist: Separating Difficulty Registration from Deliberation Allocation

人类放弃,推理模型坚持:将难度登记与深思分配分离

Han-yu Wang

机构 * The University of Hong Kong(香港大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过分离难度登记与深思分配,发现人类与大型推理模型(LRM)在问题解决中的时间/令牌分配模式相反:人类在错误问题上用时更少,而LRM在错误问题上使用更多令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05164 2026-08-11 cs.LG cs.AI 版本更新 62%

Not All Turns Are Equally Hard: Adaptive Thinking Budgets For Efficient Multi-Turn Reasoning in Agents

并非所有转折都同样困难:为高效多轮推理的自适应思维预算

Neharika Jali, Anupam Nayak, Gauri Joshi

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TAB方法,通过自适应预算分配提升多轮推理效率,在数学推理基准中实现更高的准确率与token节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09125 2026-08-11 cs.CL cs.LG 版本更新 62%

LogicIF: Towards Complex Logic Instruction Following

复杂逻辑指令生成

Mian Zhang, Shujian Liu, Sixun Dong, Ming Yin, Yebowen Hu, Xun Wang, Simin Ma, Song Wang, Sathish Reddy Indurthi, Haoyun Deng, Zhiyu Zoey Chen, Kaiqiang Song

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Independent Researcher(独立研究者) Duke University(杜克大学) University of Central Florida(佛罗里达大学中央分校)

专题命中 规划决策 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LogicIFGen和LogicIFEval,用于生成和评估复杂逻辑指令,揭示了当前LLMs在复杂指令跟随上的不足。

Comments COLM 2026 Acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24653 2026-08-10 cs.CL cs.LG 版本更新 62%

Kimi K3: Open Frontier Intelligence

Kimi K3:开放前沿智能

Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, M. C., Jianfeng Cai, Xinyuan Cai, Peizhou Cao, Yuxuan Cao, Ziwei Chai, Y. Charles, H. S. Che, Guanduo Chen, Guangyu Chen, Guanzheng Chen, Huarong Chen, Jia Chen, Jianlong Chen, Jun Chen, Kexin Chen, Peng Chen, Ruijue Chen, Wentao Chen, Xin Chen, Yang Chen, Yanru Chen, Yifei Chen, Yingjiang Chen, Yuankun Chen, Yujie Chen, Yutian Chen, Zhirong Chen, Dazhi Cheng, Yean Cheng, Jialei Cui, Jingbing Cui, Anqi Dai, Jiaqi Deng, Hao Ding, Rui Ding, Shaofeng Ding, Mengfan Dong, Mengnan Dong, Yuhao Dong, Yuxin Dong, Angang Du, Chenzhuang Du, Dikang Du, Jusen Du, Yulun Du, Yu Fan, Jing Feng, Qiulin Feng, Yichen Feng, Kelin Fu, Qiang Fu, Fuxuan Gao, Hongcheng Gao, Jingyue Gao, Tong Gao, Weijia Gao, Shangyi Geng, Jie Gong, Linhu Gong, Shengao Gong, Xiaochen Gong, Qizheng Gu, Yicheng Gu, Shuhao Guan, Haiqing Guo, Shiqi Guo, Xiang Guo, Zhengyan Guo, Beixi Hao, Wenxin Hao, Xiaoru Hao, Dailan He, Haotian He, Lehan He, Qi He, Weiran He, Xinran He, Xinyi He, Yibo He, Yunjia He, Chao Hong, Tiange Hong, Hao Hu, Jiaxi Hu, Ruikun Hu, Weiming Hu, Yangyang Hu, Zhenxing Hu, Liang Hua, Jinbin Huang, Ke Huang, Ruiyuan Huang, Siying Huang, Weixiao Huang, Yan Huang, Zhengjie Huang, Zhiqi Huang, Yulong Hui, Chaobo Jia, Yutong Jiang, Zhejun Jiang, Zuoyou Jiang, Wenyi Jin, Xinyi Jin, Yu Jing, Huanjun Kong, Guokun Lai, Aidi Li, Cheng Li, Chengyuan Li, Cong Li, Fang Li, Guanyu Li, Haoyang Li, Jia Li, Junxiong Li, Lei Li, Letian Li, Lincan Li, Weihong Li, Wentao Li, Xintong Li, Yang Li, Yishen Li, Yiwei Li, Yuxiao Li, Zhaowei Li, Zhaoxi Li, Zheming Li, Zhengxiao Li, Zhiyuan Li, Jiawei Lin, Xiaohan Lin, Yibo Lin, Zichao Lin, Ziyan Lin, Bill Liu, Boxiao Liu, Chuan Liu, Liang Liu, Shaowei Liu, Shudong Liu, Shuran Liu, Tianwei Liu, Weizhou Liu, Yangyang Liu, Yanming Liu, Yibo Liu, Yipeng Liu, Zhengying Liu, Zhiheng Liu, Enzhe Lu, Haoyu Lu, Linqiang Lu, Tingzhan Lu, Zhiyuan Lu, Aotian Luo, G. Luo, Junyu Luo, Yifan Luo, B. Lyu, Wenzhou Lyu, Shaoguang Mao, Yuan Mei, Xin Men, Minqing Ni, Yixuan Niu, Siyuan Pan, Shujun Peng, Zhangyang Qi, Ruoyu Qin, ZeChao Qin, Zeyu Qin, Haiquan Qiu, Jianxin Qiu, Jiezhong Qiu, Bowen Qu, Yuhao Qu, Zeyu Shang, Youbo Shao, Han Shen, Jincheng Shi, Juanfeng Shi, Lidong Shi, Shengyuan Shi, Wingchun Siu, Pengwei Song, Xiaoxi Song, Jianlin Su, Yunfeng Su, Zhaochen Su, Lin Sui, Jingsong Sun, Junyao Sun, Shaoning Sun, Shuzhe Sun, Tongyu Sun, Yujun Sun, Yunpeng Tai, Chuning Tang, Heyi Tang, Sirui Tang, Zecheng Tang, Chaoran Tian, Rongpeng Tian, Yu Tian, Wei Tu, Chensi Wang, Chuang Wang, Chunjie Wang, Dinglu Wang, Feng Wang, Hailong Wang, Haiming Wang, Hao Wang, Hao Wang, Huaqing Wang, Hui Wang, Jiayi Wang, Jinglong Wang, Jinhong Wang, Jiuzheng Wang, Linian Wang, Shaobo Wang, Shenzhi Wang, Shuyi Wang, Si Wang, Siyuan Wang, Tianfu Wang, Wenjue Wang, Xingran Wang, Xinmei Wang, Xinyuan Wang, Xusheng Wang, Yalin Wang, Yangkun Wang, Yao Wang, Yaoyu Wang, Yejie Wang, Yiqin Wang, Yucheng Wang, Yuzhi Wang, Zhaoji Wang, Zhaowei Wang, Zhengtao Wang, Zhenhao Wang, Zhongsheng Wang, Zifan Wang, Chu Wei, Ming Wei, Shouxin Wei, Zichen Wen, Fan Wu, Haoning Wu, Rucong Wu, Wenhao Wu, Xiaoxue Wu, Yingcong Wu, Yongqi Wu, Yuxin Wu, Zijian Wu, Xinglang Xian, Chenxuan Xiang, Yuye Xiang, Bocheng Xiao, Chenjun Xiao, Xin Xiao, Jin Xie, Xiaotong Xie, Yifeng Xie, Zhe Xie, Bowei Xing, Yiming Xiong, Baosheng Xu, Boyu Xu, Jiale Xu, Jianfan Xu, Jing Xu, Jinjing Xu, L. H. Xu, Qingtao Xu, Shuyao Xu, Suting Xu, Tiantian Xu, Tianxiang Xu, Weixin Xu, Xinran Xu, Yangchuan Xu, Ye Xu, Yueni Xu, Ziyao Xu, Haonan Xue, Junjie Yan, Yaoyao Yan, Fan Yang, Guangyao Yang, Hao Yang, Junwei Yang, Ruoyu Yang, Wenjie Yang, Xiaofei Yang, Xinyu Yang, Yi Yang, Yiling Yang, Ying Yang, Yuchen Yang, Zhen Yang, Zhilin Yang, Zian Yang, Zuhao Yang, Haotian Yao, Dan Ye, Haoran Ye, Wenjie Ye, Zhanbo Ye, Bohong Yin, Haoxiang Yin, Xietong Yin, Chengzhen Yu, Haozhen Yu, Longhui Yu, Shengnan Yu, Shuying Yu, Tianxiang Yu, Enming Yuan, Mengjie Yuan, Tongtian Yue, Wei Yue, Yang Yue, Dunyuan Zha, Haobing Zhan, B. H. Zhang, Dehao Zhang, Fei Zhang, Hao Zhang, Haoyuan Zhang, Huanyu Zhang, Jiapei Zhang, Jiaxuan Zhang, Jin Zhang, Kaiyi Zhang, Miaozhen Zhang, Puqi Zhang, Qinglei Zhang, Rong Zhang, Rui Zhang, Shaoshuai Zhang, Shiyi Zhang, Xiaobin Zhang, Xiaoyun Zhang, Y. Zhang, Yangkun Zhang, Ye Zhang, Yichi Zhang, Yikun Zhang, Yizhi Zhang, Yongting Zhang, Yu Zhang, Yutao Zhang, Yutong Zhang, Zheng Zhang, Zijing Zhang, Bin Zhao, Chenguang Zhao, Feifan Zhao, Jinglun Zhao, Jinxiang Zhao, Shuai Zhao, Wenshuo Zhao, Xiangyu Zhao, Xuanle Zhao, Yikai Zhao, Zijia Zhao, Haozhi Zheng, Huabin Zheng, Ruihan Zheng, Shaojie Zheng, Tengyang Zheng, Haofeng Zhong, Lei Zhong, Longguang Zhong, M. Zhou, Qiankang Zhou, Runjie Zhou, Ruozhang Zhou, Xinyu Zhou, Yiqiao Zhou, Zaida Zhou, Jinguo Zhu, Liya Zhu, Xinhao Zhu, Yangjunfeng Zhu, Yuxuan Zhu, Zhen Zhu, Chen Zhuang, Weiyu Zhuang, Xinxing Zu

专题命中 规划决策 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 介绍Kimi K3这一2.8T参数的专家混合模型,基于Kimi Delta Attention等构建,结合多种方法使缩放效率提升约2.5倍。经训练后在多领域强化学习表现出色,虽整体性能略逊最强专有模型,但在多项任务中达前沿水平且优于其他模型,还发布模型权重助力研究。

Comments K3 tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16999 2026-08-10 cs.LG cs.AI 版本更新 62%

Counterfactual Shapley Credit Assignment

反事实沙普利信用分配

Mingxuan Li, Kai-Zhan Lee, Elias Bareinboim

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究信用分配问题,提出基于因果理论的反事实沙普利信用分配框架,通过反事实沙普利值分配功劳责任,推导有效估计器实现$\phi$-PPO方法,结合优先轨迹重放,在复杂环境中有卓越样本效率,能精确对齐奖励真实原因。

Comments Reinforcement Learning Journal 2026 (Also RLC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04568 2026-08-07 cs.LG cs.AI cs.RO 版本更新 62%

Dream-MPC: Gradient-Based Model Predictive Control with Latent Imagination

Dream-MPC:基于梯度与潜在想象的模型预测控制

Jonathan Spieler, Sven Behnke

机构 * Autonomous Intelligent Systems, Computer Science Institute VI - Intelligent Systems(自主智能系统,计算机科学研究所VI - 智能系统) Robotics, Center for Robotics(机器人学,机器人中心) the Lamarr Institute for Machine Learning(拉马尔机器学习研究所) Artificial Intelligence, University of Bonn, Germany(人工智能,波恩大学,德国)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出Dream-MPC方法,通过从展开策略生成少量候选轨迹,并利用学习的世界模型进行梯度上升优化,结合不确定性正则化和时间上的优化迭代摊销,显著提升了底层策略性能,在24个连续控制任务上优于无梯度MPC和现有基线。

Comments Accepted for International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16839 2026-08-07 cs.LG cs.AI 版本更新 62%

Trajectory-guided discharge stratification for heart failure using short-context electronic health record sequence modeling

利用序列建模预测心力衰竭患者一年临床不稳定性和死亡率

Falk Dippel, Yinan Yu, Annika Rosengren, Martin Lindgren, Christina E. Lundberg, Erik Aerts, Martin Adiels, Helen Sjöland

机构 * Sahlgrenska University Hospital(斯德哥尔摩大学医院) Department of Computer Science and Engineering, Chalmers University of Technology and University of Gothenburg(计算机科学与工程系,查尔姆斯理工大学和乌普萨拉大学) Department of Molecular and Clinical Medicine, Sahlgrenska Academy, University of Gothenburg(分子与临床医学系,斯德哥尔摩学院,乌普萨拉大学) Department of Medicine, Geriatrics and Emergency Medicine, Sahlgrenska University Hospital(医学、老年医学和急诊医学系,斯德哥尔摩大学医院) Department of Food and Nutrition, and Sport Science, Faculty of Education, University of Gothenburg(营养学与体育科学系,教育学院,乌普萨拉大学) School of Public Health and Community Medicine, Institute of Medicine, University of Gothenburg(公共卫生与社区医学系,医学院,乌普萨拉大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过序列模型预测心力衰竭患者一年内的临床不稳定性和死亡风险,发现Llama模型在有限数据下表现优异,为出院后风险分层提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14407 2026-08-06 cs.IT cs.AI cs.LG math.IT 版本更新 62%

Decision Making Needs Uncertainty Quantification [Lecture Notes]

决策需要不确定性量化[讲义笔记]

Osvaldo Simeone

机构 * Institute for Intelligent Networked Systems, Northeastern University London(智能网络系统研究所,伦敦大学东北学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究决策中不确定性量化问题,从基本原理出发,在已知和未知环境分布下,探讨风险中性与厌恶型智能体所需不确定性表示形式,确定解决认知不确定性的三种互补方法,强调可靠决策需匹配不确定性表示及效用保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13028 2026-08-06 cs.LG cs.AI cs.RO 版本更新 62%

TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at Scale

TerraZero:用于大规模零演示自博弈的过程式驾驶模拟

Zhouchonghao Wu, Akshay Rangesh, Weixin Li, Wei-Jer Chang, Zachary Lee, Saeed Bonab, Tim Wang, Wei Zhan

机构 * Applied Intuition(应用直觉)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在训练强大自动驾驶智能体,提出TerraZero过程式驾驶模拟器和自博弈训练堆栈,其速度快、逼真且多样。通过特定方式填充地图生成无限场景,智能体仅靠强化学习训练,能零样本泛化,在多个基准测试中表现出色。

Comments Technical Report from Applied Intuition Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17218 2026-08-04 cs.LG cs.AI 版本更新 62%

Learning Graph-Indexed Trajectory Patterns for Stochastic On-Time Arrival Routing

基于历史感知决策变换器的通用策略梯度用于图信号上的可靠路由

Yuanhang Wang, Xing Wei, Duoxiang Zhao, Zezhou Zhang, Hao Qin, Yuqi Ouyang

机构 * Sichuan University-Pittsburgh Institute(四川大学匹兹堡研究院) Sichuan University(四川大学) College of Computer Science(计算机科学学院) University College Dublin(都柏林大学) School of Electrical and Electronic Engineering(电子与电气工程学院) School of Electronics and Information Engineering(电子与信息工程学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GPG-HT框架,通过整合决策变换器和通用策略梯度优化,解决随机交通网络中考虑不确定和相关旅行时间的问题,提升可靠路由性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11671 2026-08-04 cs.CR cs.AI cs.SE 版本更新 62%

Cochise: A Reference Harness for Autonomous Penetration Testing

Cochise:自主渗透测试的参考框架

Andreas Happe, Jürgen Cito

机构 * TU Wien(维也纳技术大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.SE

AI总结 Cochise提供了一个简洁的自主渗透测试框架,支持通过SSH连接LLM代理与Linux主机,并通过分离的规划-执行架构实现可控环境,同时提供重放和分析工具以支持研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07725 2026-08-04 cs.CL cs.AI 版本更新 62%

SOD: Step-wise On-policy Distillation for Small Language Model Agents

SOD:分步式在线蒸馏用于小型语言模型代理

Qiyong Zhong, Mao Zheng, Mingyang Song, Xin Lin, Jie Sun, Houcheng Jiang, Xiang Wang, Junfeng Fang

机构 * Zhejiang University(浙江大学) Large Language Model Department, Tencent(腾讯大语言模型部门) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 针对小型语言模型中工具集成推理的稳定性问题,提出SOD分步式在线蒸馏框架,通过动态调整蒸馏强度缓解教师信号误导,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏