IH-Challenge: A Training Dataset to Improve Instruction Hierarchy on Frontier LLMs
IH-Challenge: 一个改进前沿大语言模型指令层级的训练数据集
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 IH-Challenge通过强化学习训练数据集提升前沿大语言模型在指令冲突中的鲁棒性,减少不安全行为并提高帮助性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
IH-Challenge: 一个改进前沿大语言模型指令层级的训练数据集
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 IH-Challenge通过强化学习训练数据集提升前沿大语言模型在指令冲突中的鲁棒性,减少不安全行为并提高帮助性。
学习强化学习无法做到的:用于最难问题的交错在线微调
机构 * Peking University(北京大学) ; Zhongguancun Academy(中关村学院) ; Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) ; Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京软件与硬件协同人工智能系统重点实验室)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 ReLIFT通过结合强化学习和在线微调,提升模型在复杂问题上的推理能力,实现超过5.2分的性能提升。
Comments 12 pages, 5 figures
Journal ref ICLR 2026
动态预测采样用于主动强化学习微调大推理模型
机构 * Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 DPS通过动态预测方法减少回放成本,提升大推理模型的强化学习微调效率与性能。
Comments Accepted to ICLR 2026
符合性权衡:超越覆盖的操作配置文件
机构 * Center for Advanced Mathematics in Energy Research Applications(能源研究应用高级数学中心) ; Synchrotron Infrared Structural Biology Program(同步辐射红外结构生物学计划) ; Molecular Biophysics and Integrated Bioimaging Division(分子生物物理与整合生物成像部)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SSBC方法,通过校准与审计机制,在有限样本下实现精确覆盖语义,并通过诱导划分揭示制度边界和权衡问题。
通过定向技能图和选择性适应在动作RPG中学习可转移的技能
机构 * Sharif University of Technology(沙斐大学)
专题命中 规划决策 :agent(abstract,journal_ref);分类 cs.AI
AI总结 本文提出通过定向技能图和选择性适应方法,在动作RPG中实现技能的可转移学习,提高样本效率和适应性。
Comments 5 pages
Journal ref Lifelong Agent Workshop at ICLR 2026
强化学习中的遍历性
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 本文探讨了非遍历奖励过程对强化学习的影响,分析了遍历性与马尔可夫链的关系,并提出优化长期性能的方法。
Comments Accepted article to appear in Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences
推理中的模拟(SiR):面向自主交通系统经验导向AI的概念框架
专题命中 规划决策 :workflow(abstract);分类 cs.AI
AI总结 SiR通过将领域模拟器嵌入LLM推理循环,为自主交通系统提供经验导向的AI框架,提升策略验证与优化能力。
机器人超声使CBCT活起来
机构 * Chair for Computer-Aided Medical Procedures and Augmented Reality, Technical University of Munich(计算机辅助医学程序与增强现实 chair,慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; The University of Hong Kong(香港大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 利用机器人超声实现动态CBCT更新,通过实时估计组织变形提升手术导航精度
Comments 10 pages, 4 figures
Delta-K: 通过交叉注意力增强提升多实例生成
机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院) ; Nanjing University(南京大学) ; College of Management and Economics, Tianjin University(天津大学管理学院)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 Delta-K通过在交叉注意力键空间中直接操作,解决扩散模型在多实例生成中的概念遗漏问题,提升生成质量且无需额外训练或架构修改。
美国人口普查去噪:简洁的块层次回归
机构 * Google Research(谷歌研究)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本研究提出BlueDown方法,通过简洁的层次回归技术提升人口普查数据的准确性与一致性,满足隐私和结构约束,显著改善县和普查区层面的评估指标。
混合还是合并:为大语言模型的多领域强化学习而努力
机构 * Samsung Research(三星研究院) ; Peking University(北京大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 本研究提出M2RL框架,通过混合多任务训练或模型合并策略,提升大语言模型在多领域任务中的推理能力。
能识别不确定性的世界模型 - 可控视频生成中的校准不确定性
机构 * Princeton University(普林斯顿大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 提出C3方法,通过校准不确定性量化提升可控视频生成的可靠性与可信度。
eLasmobranc 数据集:用于软骨鱼类物种识别和生物多样性监测的图像数据集
机构 * University of Alicante(阿利坎特大学) ; Department of Computer Science and Technology (DTIC)(计算机科学与技术系) ; Marine Research Center of Santa Pola (CIMAR)(圣波拉海洋研究中心)
专题命中 规划决策 :planning(abstract)
AI总结 eLasmobranc数据集通过提供高质量软骨鱼类图像,支持物种识别和生物多样性监测,填补细粒度识别空白。
Comments 9 pages, 6 figures, 5 tables. A future extended version of this work will be submitted to Scientific Data
AdaClearGrasp: 学习自适应清除以实现零样本鲁棒灵巧抓取在密集障碍环境中
机构 * Nanjing University(南京大学) ; Nanjing University of Posts and Telecommunications(南京邮电大学) ; National University of Singapore(新加坡国立大学)
专题命中 规划决策 :planning(abstract)
AI总结 AdaClearGrasp通过自适应清除与零样本灵巧抓取技术,提升机器人在密集障碍环境中的抓取成功率。
Comments 12 pages. Under review
SUBTA:一种支持用户引导的双臂远程操作框架用于结构化装配
机构 * Honda Research Institute USA(本田美国研究院) ; Honda Research Institute Europe GmbH(本田欧洲研究院)
专题命中 规划决策 :planning(abstract)
AI总结 SUBTA通过结合意图估计、任务规划和上下文相关的运动辅助,提高了双臂远程操作在结构化装配中的精度和用户体验。
Comments 8 pages, 7 figures, accepted at ICRA 2026
自适应操控潜力与触觉估计用于工具中介交互
机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) ; Imperial College of Science, Technology and Medicine(帝国理工学院科学、技术与医学学院)
专题命中 规划决策 :planning(abstract)
AI总结 本文提出了一种基于参数化平衡流形的闭环框架,通过自适应操控潜力和触觉SLAM实现工具中介交互中的触觉估计与自适应刚度控制。
自由飞行-思考:将链式推理对齐连续无人机导航
机构 * SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院) ; Shanghai Jiao Tong University(上海交通大学) ; Tongji University(同济大学)
专题命中 规划决策 :agent(abstract)
AI总结 FreeFly-thinking是一种端到端的无人机视觉-语言导航框架,通过链式推理提升导航性能,实现了在复杂户外环境中的高效导航。
Comments 10 pages, 5 figures, ECCV review
通过强化学习实现轻量化空中机械臂的全局末端姿态控制
机构 * Department of Cognitive Robotics (CoR), Faculty of Mechanical Engineering, Delft University of Technology(认知机器人系(CoR),机械工程学院,代尔夫特理工大学)
专题命中 规划决策 :agent(abstract)
AI总结 本文通过强化学习实现轻量化空中机械臂的六自由度末端姿态控制,实验展示了厘米级精度和鲁棒性。
Comments 8 pages, 6 figures, accepted by IEEE ICRA 2026
一种用于低压配电网控制的预测灵活性聚合方法
专题命中 规划决策 :planning(abstract)
AI总结 本文提出一种预测灵活性聚合方法,结合集中优化实现低压配电网实时控制,通过多参数优化和操作规划问题生成灵活性图,提升系统效率与经济性。
Comments 10 pages, 10 figures
Shiksha Copilot:教师与AI协作在低资源学校中编纂和定制课程计划
专题命中 规划决策 :planning(abstract)
AI总结 Shiksha Copilot通过教师与AI协作,帮助低资源学校更高效地定制课程计划,同时减轻教师负担并促进基于活动的教学法。
自动驾驶新兴技术概述
专题命中 规划决策 :planning(abstract)
AI总结 本文概述了自动驾驶新兴技术,重点探讨了数据闭环框架下的关键技术和开放性问题。
社交教学:在信息性与正确性之间选择在顺序决策中的考量
专题命中 规划决策 :agent(abstract)
AI总结 本文研究了在顺序决策中,初始信念的准确性对最终决策的影响,发现不准确的初始信念可提升最终决策性能,并揭示了早期代理在正确性与信息性之间的权衡。
Journal ref Proc. IEEE Int. Symp. Information Theory 2013
保密选票:在通过投票进行团队二元决策中的社会学习无用性
专题命中 规划决策 :agent(abstract)
AI总结 本文研究了在团队二元决策中通过投票进行的社会学习无用性,发现忽略先前决策可获得最优团队性能,秘密选票优于社会学习。
Journal ref Proc. IEEE Int. Conf. Acoustics, Speech and Signal Processing 2013
代码空间响应预言机:利用大语言模型生成可解释的多智能体策略
机构 * Google(谷歌) ; DeepMind(深度思维)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG;autonomous agent(comments)
AI总结 本文提出代码空间响应预言机,利用大语言模型生成可解释的多智能体策略,通过代码生成任务提升策略的可解释性和复杂策略发现能力。
Comments Accepted as an Extended Abstract at the Twenty-Fifth International Conference on Autonomous Agents and Multiagent Systems (AAMAS)
无人机多智能体强化学习:用于时间敏感和动态医疗物资配送
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于多智能体强化学习的无人机协调框架,用于在动态医疗物资配送中实现高效任务优先和资源分配。
Comments 7 pages, 4 figures, 2 tables, conference
KernelSkill:一种用于GPU内核优化的多智能体框架
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
AI总结 KernelSkill通过多智能体框架和双层记忆架构,实现高效GPU内核优化,取得显著速度提升。
BrandFusion: 一种多智能体框架,用于文本到视频生成中的无缝品牌整合
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; State University of New York at Buffalo(纽约州立大学布法罗分校) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI
AI总结 BrandFusion通过多智能体框架实现文本到视频生成中的无缝品牌整合,提升品牌辨识度和内容自然度,推动T2V的可持续商业化应用。
LaTeXTrans: 带多智能体协调的结构化LaTeX翻译
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) ; NiuTrans Research, Shenyang, China(牛译研究院,中国沈阳)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL
AI总结 LaTeXTrans通过多智能体协作实现结构化LaTeX文档的准确翻译,提升格式保留和术语一致性。
LLMGreenRec: 基于大语言模型的多智能体推荐系统用于可持续电子商务
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)
AI总结 LLMGreenRec通过大语言模型和多智能体框架,提升电子商务中可持续产品推荐的准确性和环保性。
Comments Accepted to the Proceedings of the Conference on Digital Economy and Fintech Innovation (DEFI 2025). To appear in IEEE Xplore
终端即一切:人机协同中的设计属性
专题命中 多智能体 :agent(title,abstract);AI agent(title,abstract)
AI总结 本文提出终端作为人机协同设计的典范,强调其在表示兼容性、行为透明性和低参与门槛三方面的核心属性。
Comments 8 pages (6 content + 2 references), 6 figures. Accepted as poster at the CHI 2026 Workshop on Human-AI-UI Interactions Across Modalities (CUCHI'26), April 14, 2026, Barcelona, Spain