arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-10 至 2026-06-10 共收录 124 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 10 篇

2606.09916 2026-06-10 cs.LG cs.AI 新提交 89%

IntentKV: Cross-Turn Intent-Aware KV Cache Pruning for Agent Inference

IntentKV: 面向Agent推理的跨轮次意图感知KV缓存剪枝

Junjie Li, Jiong Lou, Jie Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 工具调用 :agent(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对多轮LLM Agent中KV缓存成为服务瓶颈的问题,提出IntentKV方法,通过会话级QueryMemory和残差注意力头实现跨轮次意图感知的KV剪枝,在保持精度的同时大幅降低峰值请求token和KV读取量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10803 2026-06-10 cs.CL cs.AI cs.CV 新提交 86%

Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use

超越API:探索多模态大语言模型在物理工具使用中的极限

Zhixin Ma, Yutong Zhou, Yongqi Li, Chong-Wah Ngo, Wenjie Li

机构 * Singapore Management University(新加坡管理大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 工具调用 :tool use(title,abstract);tool-use(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 提出PhysTool-Bench基准,评估多模态大语言模型在真实场景中识别物理工具并规划使用的能力,发现最强模型仅完成21%任务,揭示感知与规划双重缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10438 2026-06-10 econ.TH 新提交 78%

Sequential Search with Planning

带有规划的序贯搜索

Ruhi Sonal, Saptarshi Mukherjee, Abhinaba Lahiri, Aniruddha Ghosh

专题命中 工具调用 :planning(title,abstract)

AI总结 本文通过有序潘多拉盒子模型研究新产品开发或资源勘探中的序贯搜索,引入规划成本,证明存在与已支付范围相关的保留值,并分析保证效应、已支付范围效应和剩余阶段效应对最优策略的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10875 2026-06-10 cs.CL 新提交 77%

Pushing the Limits of LLM Tool Calling via Experiential Knowledge Integration and Activation

通过经验知识集成与激活推动LLM工具调用极限

Yupu Hao, Zhuoran Jin, Huanxuan Liao, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 工具调用 :autonomous agent(abstract);tool use(abstract);tool-use(abstract);分类 cs.CL

AI总结 研究如何通过经验知识获取、激活和内化提升LLM多步工具调用性能,提出知识增强工具执行框架KATE,结合宽度扩展推理与知识感知训练,在BFCL-V3和AppWorld上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10709 2026-06-10 cs.IR cs.AI 新提交 74%

Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training

通过训练期间回收零方差查询实现智能体搜索的有效强化学习

João Coelho, João Magalhães, Bruno Martins, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Instituto Superior Técnico and INESC-ID, University of Lisbon(里斯本大学理工学院和INESC-ID) NOVA LINCS, NOVA School of Science and Technology(NOVA科学与技术学院LINCS)

专题命中 工具调用 :agentic(title);分类 cs.AI

AI总结 提出查询回收方法,将训练中零方差查询重新投入采样池,使有效训练分布随策略演化,1.7B模型在7个多跳QA基准上平均Pass@1达66.0,匹配或超越7B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10304 2026-06-10 cs.CL 新提交 70%

MIRAGE: A Polarity-Flipping Encoding Subspace in LLM Agents

MIRAGE: LLM智能体中的极性翻转编码子空间

Pratibha Revankar, Kargi Chauhan, Jihye Kim, Sadiba Nusrat Nur, Vincent Siu, Chenguang Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.CL

AI总结 发现LLM智能体在隐蔽编码敏感数据时,残差流中存在共享的低维编码子空间,通过逻辑回归探针可高精度检测,并构建MIRAGE实时监控器,在126个场景中AUC达0.918,远超仅输出检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09863 2026-06-10 cs.LG 新提交 57%

From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents

从自信收尾到无声失败:LLM智能体中的虚假成功特征分析

Laksh Advani

机构 * Laksh Advani

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 研究LLM智能体在环境状态未完成时声称任务完成的虚假成功模式,发现其普遍存在但检测困难,轻量级TF-IDF检测器优于LLM评判器。

Comments Accepted to FAGEN@ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11145 2026-06-10 cs.CR 新提交 50%

OpenPCC: Open and Confidential LLM Serving on Commodity TEEs

OpenPCC:在商用TEE上提供开放且保密的LLM服务

Haoling Zhou, Shixuan Zhao, Chao Wang, Zhiqiang Lin

专题命中 工具调用 :AI agent(abstract)

AI总结 针对云推理服务中用户请求包含敏感信息的问题,提出OpenPCC框架,利用商用TEE实现开放、保密的LLM服务,并通过原型验证其可行性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10579 2026-06-10 cs.RO cs.SY eess.SY 新提交 50%

LieIPM: Lie Group Interior Point Method for Direct Trajectory Optimization of Rigid Bodies

LieIPM:用于刚体直接轨迹优化的李群内点法

Sangli Teng, Ruiqi Zhang, Tzu-Yuan Lin, William A Clark, Mark Mueller, Ram Vasudevan, Maani Ghaffari, Koushil Sreenath

机构 * University of California, Berkeley(加州大学伯克利分校) MIT(麻省理工学院) Ohio University(俄亥俄大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 工具调用 :planning(abstract)

AI总结 提出一种基于李群结构的约束轨迹优化框架LieIPM,利用二阶刚体模型和变分积分器,实现无奇异、快速收敛的牛顿型更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10215 2026-06-10 physics.space-ph physics.plasm-ph 新提交 50%

LEAP: A Rapid Neural Surrogate of Multi-Fluid MHD at Europa

LEAP: 欧罗巴多流体磁流体动力学的快速神经替代模型

Sachin Alexander Reddy, Abigail R. Azari, Corey J. Cochrane, Xianzhe Jia, Tom A. Nordheim, Lukas Mandrake, Steven D. Vance, Camilla Harris, Ioana Ciucǎ

专题命中 工具调用 :planning(abstract)

AI总结 针对欧罗巴地下海洋探测中MHD模型计算成本高的问题,提出基于Transformer的替代模型LEAP,实现毫秒级预测磁场扰动,速度提升约40000倍,精度与MHD相当。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 32 篇

2606.10507 2026-06-10 cs.AI 新提交 90%

HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning

HIPIF: 面向长视界LLM智能体学习的层次化规划与信息折叠

Juncheng Diao, Zhicong Lu, Peiguang Li, Yongwei Zhou, Changyuan Tian, Qingbin Li, Rongxiang Weng, Jingang Wang, Xunliang Cai

机构 * Meituan(美团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);autonomous agent(abstract);agentic(abstract)

AI总结 提出层次化规划与信息折叠方法,通过子目标分解和历史折叠减少长上下文干扰,结合层次化反思和子目标过程奖励,提升LLM在多轮长视界任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10316 2026-06-10 cs.CL 新提交 87%

TabClaw: An Interactive and Self-Evolving Agent for Spreadsheet Manipulation and Table Reasoning

TabClaw: 一个用于电子表格操作和表格推理的交互式自进化智能体

Mingyue Cheng, Shuo Yu, Daoyu Wang, Qingchuan Li, Xiaoyu Tao, Qingyang Mao, Yitong Zhou, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 规划决策 :agent(title,abstract);AI agent(abstract);tool-use(abstract);workflow(abstract)

AI总结 提出TabClaw,一个开源交互式AI智能体,通过可编辑执行计划、流式ReAct循环、并行多表推理和用户记忆提取,提升电子表格操作和表格推理的透明性与个性化。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11119 2026-06-10 cs.LG cs.AI cs.CL 新提交 82%

TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning

TRACE:一种用于高效智能体强化学习的统一展开预算分配框架

Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, Xiangyang Ji

机构 * Tsinghua University(清华大学) Tencent(腾讯)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对多轮智能体强化学习中奖励对比度不足的问题,提出TRACE框架,通过将每个ReAct式思考-行动-观察步骤建模为语义节点,在固定采样预算内将预算分配到提示根和中间前缀,增强奖励对比,提升策略更新信号。

Comments 32 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10607 2026-06-10 cs.LG cs.AI cs.CL 新提交 82%

Causal Ensemble Agent: Hierarchical Causal Discovery with LLM-guided Expert Reweighting

因果集成智能体:基于LLM引导的专家重加权的层次化因果发现

Xinyu Li, Yuanyuan Wang, Haoxuan Li, Chuan Zhou, Erdun Gao, Bo Han, Tongliang Liu, Kun Zhang, Howard Bondell, Mingming Gong

机构 * The University of Melbourne(墨尔本大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Peking University(北京大学) Adelaide University(阿德莱德大学) Hong Kong Baptist University(香港浸会大学) The University of Sydney(悉尼大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出因果集成智能体(CEA)框架,通过线性意见池聚合不同层次的统计因果发现结果,并利用大语言模型(LLM)作为元裁判在决策边界附近动态重加权专家,从而构建更准确完整的因果图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10209 2026-06-10 cs.AI cs.LG cs.SE 新提交 80%

Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using LLM Agents

更少上下文,更优智能体:面向长周期工具使用LLM智能体的高效上下文工程

Abhilasha Lodha, Mahsa Pahlavikhah Varnosfaderani, Abir Chakraborty, Abhinav Mithal

机构 * Microsoft(微软)

专题命中 规划决策 :autonomous agent(abstract);tool-use(abstract);workflow(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 针对企业工具使用场景中上下文过长导致的问题,提出选择性保留最近工具交互并添加紧凑摘要的方法,在费用明细任务上将完成率从71.0%提升至91.6%,同时大幅降低token消耗和运行时间。

Comments 17 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11019 2026-06-10 cs.RO cs.AI 新提交 79%

Diffusion Forcing Planner: History-Annealed Planning with Time-Dependent Guidance for Autonomous Driving

扩散强制规划器:基于时间依赖引导的历史退火规划用于自动驾驶

Zehan Zhang, Neng Zhang, Yaoyi Li, Jia Cai, Zhiling Wang

机构 * University of Science and Technology of China(中国科学技术大学) Yinwang Intelligent Technology Co., Ltd(银网智能科技有限公司) Hefei Institutes of Physical Science, Chinese Academy of Sciences(中国科学院合肥物质科学研究院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出扩散强制规划器(DFP),通过历史引导控制实现异构联合扩散过程,结合退火历史的条件引导,解决运动规划中的时间不一致问题,在nuPlan上取得竞争性能。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09958 2026-06-10 cs.RO cs.AI 新提交 79%

Uncertainty-Aware Motion Planning for Autonomous Driving in Mixed Traffic Environment

混合交通环境下自动驾驶的不确定性感知运动规划

Ming Cheng, Hao Chen, Ziyi Yang, Ziluowen Luo, Senzhang Wang

机构 * Central South University(中南大学) City University of Macau(澳门城市大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出不确定性感知运动规划(UAMP),通过量化人类意图不确定性并引入不确定性校准值学习,提升自动驾驶在混合交通中的安全性和舒适性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09837 2026-06-10 cs.HC cs.AI 新提交 79%

Self-EmoQ: Plutchik-Guided Value-based Planning to Drive Streaming Emotional TTS

Self-EmoQ: 基于Plutchik引导的价值规划驱动流式情感TTS

Yue Zhao, Hongyan Li, Yong Chen, Luo Ji

机构 * Geely AI Lab(地平线人工智能实验室)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出一种情感规划框架,通过强化学习训练LLM模块,在文本生成前确定情感,以驱动流式TTS,结合Plutchik情感理论进行混合奖励,实验表明在情感确定和响应质量上优于基线。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10956 2026-06-10 cs.AI cs.CL 新提交 79%

Mind the Gap: Can Frontier LLMs Pass a Standardized Office Proficiency Exam?

注意差距:前沿大语言模型能否通过标准化办公能力考试?

Tengchao Lv, Dongdong Zhang, Jiayu Ding, Yilin Jia, Yuzhong Zhao, Yupan Huang, Wenshan Wu, Xiangyang Zhou, Shaohan Huang, Nan Yang, Li Dong, Lei Cui, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 基于中国计算机等级考试(NCRE)的200个综合操作任务,评估7个前沿LLM在Word、Excel和PowerPoint自动化中的表现,发现单轮模型最高得分率36.6%,带执行反馈的智能体系统达68.8%,仍低于95.5%的社区参考分,表明可靠细粒度办公自动化仍是重大挑战。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11088 2026-06-10 cs.RO 新提交 78%

A Distributed Multi-UGV Exploration Framework With Loop-Aware Planning and Descriptor-Aided Localization in Resource-Limited Environments

资源受限环境下的分布式多UGV探索框架:环回感知规划与描述符辅助定位

Zhiwei Li, Haiou Liu, Xijun Zhao, Ji Li, Yingze Wang, Boyang Wang

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械与车辆学院) China North Artificial Intelligence & Innovation Research Institute, Collective Intelligence & Collaboration Laboratory (CIC)(中国北方人工智能与创新研究院集体智能与协作实验室) Zhengzhou Intelligent Technology Research Institute, Beijing Institute of Technology(北京理工大学郑州智能科技研究院)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出一种完全分布式的多无人地面车辆(UGV)探索框架,通过轻量级LiDAR全局描述符实现跨UGV环回检测,并结合环回感知分层规划,在资源受限环境中减少探索时间和行驶距离。

Journal ref IEEE Transactions on Industrial Electronics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10986 2026-06-10 cs.RO cs.SY eess.SY 新提交 78%

Multi-UAV Active Sensing with Information Gain-based Planning and Belief Fusion

基于信息增益规划与信念融合的多无人机主动感知

S. Habibi, L. Marques

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出多无人机主动感知框架,利用信息增益路径规划与概率信念融合实现二元地形映射,在合成和真实农业图像上验证,相比随机游走和扫描覆盖降低熵与误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10903 2026-06-10 cs.RO 新提交 78%

AgniNav: Configuration-Driven Cross-Embodiment Local Planning for Robot Navigation

AgniNav:配置驱动的跨具身局部规划机器人导航

Tianhao Zang, Siwei Cheng, Haidong Huang, Shanze Wang, Wei Zhang

机构 * Eastern Institute of Technology, Ningbo, China(东方理工(宁波)) University of Nottingham, Nottingham, UK(诺丁汉大学) University of Science and Technology of China, Hefei, China(中国科学技术大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出AgniNav框架,通过可配置的四参数安全包络实现单目视觉导航在轮式、四足和人形机器人间的零重训练迁移,联合调节感知与规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10705 2026-06-10 cs.LG cs.AI cs.SY eess.SY 新提交 73%

Event-Driven Reinforcement Learning Enables Long-Horizon Control in Semiconductor Fabrication

事件驱动强化学习实现半导体制造中的长时域控制

Yavar Yeganeh, Mahsa Shekari, Nicla Frigerio, Daniele Pagano, Andrea Matta

机构 * Politecnico di Milano(米兰理工大学) STMicroelectronics(意法半导体)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出事件驱动深度强化学习框架,将半导体制造控制建模为中心化智能体问题,通过事件驱动时序差分方法优化多目标策略,在高保真仿真中显著提升吞吐量和利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09961 2026-06-10 cs.LG cs.AI 新提交 73%

3SPO: State-Score-Supervised Policy Optimization for LLM Agents

3SPO: 面向LLM智能体的状态分数监督策略优化

Yu Han, Kailing Li, Yang Jiao, Yulin Dai, Yuqian Fu, Linhai Zhuo, Tianwen Qian

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Fudan University(复旦大学) KAUST(卡塔尔人工智能研究学院) Fuzhou University(福州大学)

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 提出3SPO算法,通过动态状态分数监督实现逐步骤策略优化,解决多轮智能体任务中奖励稀疏和信用分配问题,在ALFWorld和WebShop上分别比GRPO提升22.6%和15.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10651 2026-06-10 cs.CV 新提交 67%

Kwai Keye-VL-2.0 Technical Report

Kwai Keye-VL-2.0 技术报告

Kwai Keye Team, Bin Wen, Changyi Liu, Chengru Song, Chongling Rao, Guowang Zhang, Han Li, Haonan Fan, Hengrui Ju, Jiankang Chen, Jiapeng Chen, Jiawei Yuan, Kaixuan Yang, Kaiyu Jiang, Kun Gai, Lingzhi Zhou, Na Nie, Sen Na, Tianke Zhang, Tingting Gao, Xuanyu Zheng, Yulong Chen, Fan Yang, Haixuan Gao, Lele Yang, Mingqiao Liu, Muxi Diao, Qi Zhang, Qile Su, Wei Chen, Wentao Hong, Xingyu Lu, Yancheng Long, Yankai Yang, Yingxin Li, Yiyang Fan, Yu Xia, Yuzhe Chen, Ziliang Lai, Chuan Yi, Haonan Jia, Tianming Liang, Weixin Xu, Xiaoxiao Ma, Yang Tian, Yufei Han, Feng Han, Hang Li, Jing Wang, Jinghui Jia, Junmin Chen, Junyu Shi, Ruilin Zhang

机构 * Kuaishou Group(快手集团)

专题命中 规划决策 :agent(abstract);agentic(abstract)

AI总结 提出开源MoE多模态基础模型Keye-VL-2.0,首次将DeepSeek稀疏注意力适配到GQA架构,支持无损256K上下文处理,并通过跨模态多教师策略蒸馏和上下文/视频强化学习解决多任务对齐中的灾难性遗忘,在长视频理解和智能体任务上达到同类最优。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09890 2026-06-10 cs.LG cs.AI cs.CL 新提交 67%

PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

PreAct-Bench:大语言模型中的预测性监控基准

Hainiu Xu, Italo Luis da Silva, Jiangnan Ye, Yuhao Wang, Wei Liu, Linyi Yang, Jonathan Richard Schwarz, Nicola Paoletti, Yulan He, Hanqi Yan

机构 * King’s College London(伦敦国王学院) National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学) Thomson Reuters Foundational Research(汤姆森路透基础研究) Imperial College London(伦敦帝国学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 规划决策 :autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出预测性监控任务,在动作执行前判断是否会导致不道德行为,并构建PreActBench基准,评估多种模型发现该任务具有挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10199 2026-06-10 cs.LG cs.CL 新提交 62%

A Continuous-Time Markov Chain Framework for Insertion Language Models

插入语言模型的连续时间马尔可夫链框架

Dhruvesh Patel, Benjamin Rozonoyer, Soumitra Das, Tahira Naseem, Tim G. J. Rudner, Andrew McCallum

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) IBM Research(IBM研究院) University of Toronto(多伦多大学) Vijil(维吉尔)

专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.LG

AI总结 提出基于连续时间马尔可夫链的插入语言模型去噪框架,统一现有方法,在规划任务中优于自回归和掩码扩散模型,语言建模中与现有方法竞争且采样更灵活。

Comments Accepted at AISTATS 2026. Code is available at https://github.com/dhruvdcoder/ctmc_dilm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09932 2026-06-10 cs.LG cs.AI 新提交 62%

When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff

当强化学习在监督微调后失效:恢复模型可塑性以实现稳健的SFT到RL交接

Runze Liu, Jiashun Liu, Xu Wan, Yuqian Fu, Ling Pan

机构 * Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,CASIA)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对SFT过度训练导致RL阶段改进有限的问题,提出Rejuvenation方法,通过基模型锚定融合和神经元重置恢复模型可塑性,在数学推理和智能体任务上提升RL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09896 2026-06-10 cs.GT cs.AI cs.LG 新提交 62%

HMAF: A Hierarchical Multi-Slot GD-RTB Allocation Framework

HMAF:一种分层多槽GD-RTB分配框架

Tianxing Bu, Zhaoqi Zhang, Linyou Cai, Miao Xie, Shengri Xue, Tan Qu, Qianlong Xie, Xingxing Wang, Siqiang Luo, Gao Cong

机构 * Meituan(美团) Nanyang Technological University(南洋理工大学) China Agricultural University(中国农业大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对GD与RTB共存广告平台中短期收益与长期交付的平衡难题,提出分层多槽分配框架HMAF,采用计划-校准-执行范式,集成离线约束优化与在线决策,在美团实现GD交付率提升3.72%、广告总收入提升1.59%。

Comments Accepted by KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10918 2026-06-10 cs.RO cs.LG 新提交 57%

Task Robustness via Re-Labelling Vision-Action Robot Data

通过重新标注视觉-动作机器人数据的任务鲁棒性

Artur Kuramshin, Özgür Aslan, Cyrus Neary, Glen Berseth

机构 * Mila — Quebec AI Institute(Mila — 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出TREAD框架,利用大型视觉语言模型对机器人数据集进行语义子任务分解和多样化指令生成,无需额外数据收集,提升策略在未见任务上的泛化能力。

Comments Project website: https://akuramshin.github.io/tread

详情

展开后加载摘要…

URL PDF HTML 收藏