arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2976 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 909 篇

2602.18600 2026-07-30 cs.LG 版本更新 57%

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs

MapTab: MLLMs 是否已准备好在异构图中进行多标准路线规划?

Ziqiao Shang, Ling-Yue Ge, Zian Xu, Zi-Jian Cheng, Shi-Yu Tian, Zhenyu Huang, Wenbo Fu, Weiming Wu, Yang Chen, Xiangwen Zhang, Yulan Hu, Bin Liu, Lan-Zhe Guo

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) AMAP, Alibaba Group(阿里集团AMAP) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出MapTab基准测试,用于评估多模态大语言模型在多标准路线规划任务中的综合推理能力,发现当前模型在多模态推理方面存在显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13422 2026-07-29 quant-ph cs.LG physics.flu-dyn 版本更新 57%

Practical Quantum Advantage before Fault Tolerance via Quantum-Informed Machine Learning

量子信息机器学习预测混沌的实用量子优势基础

Maida Wang, Xiao Xue, Minh Chung, Peter V. Coveney

机构 * Centre for Computational Science, University College London(大学学院伦敦计算科学中心) Leibniz Supercomputing Centre of the Bavarian Academy of Sciences and Humanities(巴伐利亚科学院和人文科学莱比锡超算中心) Centre for Advanced Research Computing, University College London(大学学院伦敦先进研究计算中心)

专题命中 规划决策 :workflow(abstract);分类 cs.LG

AI总结 提出基于高阶量子统计先验的量子优势机制,通过两阶段优势(表示与提取)证明量子-经典复制测量复杂度分离,并在湍流和天气预报中验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22430 2026-07-28 cs.LG 版本更新 57%

On the Identifiability of Controlled World Models

关于受控世界模型的可识别性

Xiangteng Zhang, Yang Guan, Bo Zhang, Hongyang Li, Ya-Qin Zhang, Shengbo Eben Li

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究受控世界模型的可识别性问题,建立在状态依赖高斯行为策略下的联合可识别性理论,识别出两个条件,证明满足条件时JEPA目标的全局极小值可识别潜在状态和受控转移,推导定量界限并通过实验验证理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21340 2026-07-28 cs.CL 版本更新 57%

Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable

资本市场大语言模型可靠性评分(CM-LRS):从似是而非到可信赖

Prerit Ahuja

专题命中 规划决策 :workflow(abstract);分类 cs.CL

AI总结 研究资本市场大语言模型输出的可信赖问题,提出CM-LRS从七个维度评估工作流程输出,通过五个工作流程对四个模型与四位评判者评分,发现前沿闭源模型聚类近,差距集中在检索合成,决策有用性离散度大且评判者一致性高。

Comments 23 pages. Rubrics, prompts, and demonstration tasks are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14561 2026-07-28 cs.CL 版本更新 57%

MARS: Multi-hop Adaptive Retrieval and SPARQL Generation for KGQA

MARS:用于知识图谱问答的多跳自适应检索与SPARQL生成

Nikit Srivastava, Daniel Vollmers, René Speck, Nikolaos Karalis, Hamada M. Zahera, Axel-Cyrille Ngonga Ngomo

机构 * Heinz Nixdorf Institute, Paderborn University(海因茨·尼克斯多夫研究所,帕德博恩大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 研究针对大型语言模型在知识密集型任务中可靠性受限的问题,提出MARS方法,通过结构化检索过程链接问题实体与知识图谱,迭代获取信息并决定检索深度或生成SPARQL查询,在多个基准测试中性能有竞争力且高效可扩展。

Comments EKAW 2026 (accepted-posters-and-demos" target="_blank" rel="noopener">https://ekaw2026.di.unito.it/accepted-posters-and-demos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30694 2026-07-28 cs.LG 版本更新 57%

Universal Decision Learners

通用决策学习器

Sridhar Mahadevan

机构 * Adobe Research(Adobe研究院) University of Massachusetts(马萨诸塞大学) Amherst(阿默斯特)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出通用决策学习器(UDL)的范畴论框架,通过左Kan扩展和右Kan扩展将局部决策行为规范地扩展到全局一致行为,统一了规划、强化学习、因果干预、在线学习和博弈均衡等多种决策形式。

Comments Revised the central construction to use type-correct staged left/right Kan extensions; corrected the semantic quotient theorem; added an explicit discounted-MDP/Bellman derivation; and expanded the non-RL decision examples and limitations. A detailed change log appears in the supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25897 2026-07-28 cs.RO cs.LG cs.SY eess.SY 版本更新 57%

Variational Neural Belief Parameterizations for Robust Dexterous Grasping under Multimodal Uncertainty

变分神经信念参数化用于多模态不确定性下的鲁棒灵巧抓取

Clinton Enwerem, Shreya Kalyanaraman, John S. Baras, Calin Belta

机构 * Department of Electrical & Computer Engineering and Institute for Systems Research, University of Maryland, College Park, MD, USA(电气与计算机工程系和系统研究所,马里兰大学,College Park, MD, USA) Maryland Applied Graduate Engineering, A. James Clark School of Engineering, University of Maryland, College Park, MD, USA(马里兰应用研究生工程学院,A. James Clark工程学院,马里兰大学,College Park, MD, USA)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出变分推理方法,通过可微高斯混合模型表示信念,利用Gumbel-Softmax和位置-尺度重参数化实现平滑采样,提升抓取鲁棒性并减少规划时间。

Comments 11 pages, 10 figures. Accepted for publication at IROS 2026. Code, simulation assets, and dataset at https://github.com/coenwerem/vnb-grasp

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16275 2026-07-28 cs.CV cs.AI 版本更新 57%

GFLAN: Generative Functional Layouts

GFLAN:生成功能布局

Mohamed Abouagour, Eleftherios Garyfallidis

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 GFLAN通过两阶段分解生成功能布局,结合拓扑规划与几何实现,提升建筑生成的准确性与合理性。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14514 2026-07-27 cs.CV cs.AI 版本更新 57%

VTM-Nav: Harnessing Cross-Episode Experience for Object-Goal Navigation with Hierarchical Visual-Topological Memory

VTM-Nav:用于跨情节对象目标导航的分层视觉拓扑记忆

Xiaoran Xu, Yupeng Wu, Tianyu Xue, Yifan Xu, Xuanran Dong, Xiaoshan Yang, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉科学学院) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究跨情节对象目标导航问题,提出无训练的VLM导航框架\method,其带有分层视觉拓扑记忆,通过粗到细匹配检索经验,在三个基准测试中性能最佳,证明跨数据集结构化视觉拓扑经验复用有效且鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20064 2026-07-24 cs.AI 版本更新 57%

PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning

PRO-LONG:程序化内存实现长程推理

Alexis Fox, Junlin Wang, Paul Rosu, Bhuwan Dhingra

机构 * Duke University(杜克大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 针对长程任务中LLM智能体的挑战,提出PRO-LONG框架,通过程序化内存管理上下文,保留交互日志并利用编码智能体进展高效搜索历史,在ARC-AGI-3上有显著提升,减少令牌使用并达到高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14675 2026-07-24 cs.RO cs.AI 版本更新 57%

An Intelligent-Cloud Edge Multimodal Interaction System for Robots

一种用于机器人的智能云边缘多模态交互系统

Zihan Guo, Xiaoqi Li

机构 * Hainan University(海南大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对复杂环境下资源受限机器人的交互问题,提出云边缘多模态交互框架,集成增强YOLO手势检测器与LLM、VLM智能体,改进手势检测方法,经实验验证该系统在手势检测精度、任务成功率及用户满意度方面表现良好,证明了方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16947 2026-07-24 cs.RO cs.AI 版本更新 57%

Drive As You Like: Multi-Head Diffusion with Reinforcement Learning for Personalized Driving

随心所欲驾驶:基于强化学习的多头部扩散个性化驾驶

Fan Ding, Xuewen Luo, Fucai Ke, Hwa Hui Tew, Susilawati Susilawati, Vishnu Monn Baskaran, Junn Yong Loo

机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) Southwest University, China(西南大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究旨在解决自动驾驶规划器忽视人类驾驶行为多样性及难以理解用户意图的问题。提出基于强化学习的多策略框架,集成多头部扩散规划器与语义理解,采用两阶段训练范式。实验表明该方法在nuPlan基准测试中性能良好,能满足实时规划并对齐用户意图。

Comments Has been submitted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18034 2026-07-23 cs.AI 版本更新 57%

AdaHome: An Adaptive Smart Home Assistant using Local Small Language Models

AdaHome:一种使用本地小语言模型的自适应智能家居助手

Eu Jin Lim, Zhaoxing Li, Sebastian Stein

机构 * University of Southampton(南安普顿大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究旨在解决智能家居助手问题,提出AdaHome,通过意图感知规划框架、草稿链策略及偏好适应机制,在本地小语言模型上实现高效决策与个性化,实验显示其在命令准确性、延迟及多轮场景中有良好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12527 2026-07-22 cs.AI 版本更新 57%

Evidence-Grounded AI for Musculoskeletal Care

用于肌肉骨骼护理的基于证据的人工智能

Wenjie Li, Yujie Zhang, Fanrui Zhang, Haoran Sun, Renhao Yang, Junjun He, Weiran Huang, Yuanfeng Ji, Chenrun Wang, Kailing Wang, Hongcheng Gao, Kaipeng Zhang, Hanyu Wang, Angela Lin Wang, Xingqi He, Yilin Huang, Shiyi Yao, Lilong Wang, Yankai Jiang, Yirong Chen, Chenglong Ma, Jiyao Liu, Ming Hu, Gen Li, Yidong Xu, Chengyu Zhuang, Jiawei Liu, Yin Zhang, Lequan Yu, Lu Chen, Yinpeng Dong, Lei Liu, Carlos Gutierrez Sanroman, Yu Qiao, Weijie Ma, Xiaosong Wang, Lei Wang

机构 * Ruijin Hospital, College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院,健康科学技术学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学脑启发智能感知与认知教育部重点实验室) School of Basic Medical Sciences, Intelligent Medicine Institute, Fudan University(复旦大学基础医学院智能医学研究院) Department of Radiation Oncology, Stanford University School of Medicine(斯坦福大学医学院放射肿瘤学系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究针对肌肉骨骼护理中证据分散问题,提出基于大语言模型的OrthoPilot系统,整合多源数据进行持续管理。该系统在诊断推理等方面超越专家,优于其他智能系统,还提升了管理成功率和病床病例数等,推动临床人工智能实现纵向管理。

Comments All co-authors have now consented to the submission and approved the authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06936 2026-07-22 cs.AR cs.AI cs.MA 版本更新 57%

Bridging the Last Mile of Circuit Design: PostEDA-Bench, a Hierarchical Benchmark for PPA Convergence and DRC Fixing

跨越电路设计的最后一英里:PostEDA-Bench,一个用于PPA收敛和DRC修复的分层基准

Pengju Liu, Nuo Xu, Jinwei Tang, Yu Cao, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出PostEDA-Bench分层基准,包含145个任务,覆盖DRC修复和PPA优化,实验发现现有LLM代理在复杂DRC推理和多目标PPA优化上表现不佳,视觉增强可提升DRC性能,权衡推理是PPA多目标瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08216 2026-07-22 eess.IV cs.CV cs.LG 版本更新 57%

Tumor-anchored deep feature random forests for out-of-distribution detection in lung cancer segmentation

基于肿瘤锚定的深度特征随机森林用于肺癌分割中的分布外检测

Aneesh Rangnekar, Harini Veeraraghavan

机构 * Memorial Sloan Kettering Cancer Center(纪念斯隆凯特林癌症中心)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出RF-Deep框架,利用深度特征提升CT扫描的分布外检测性能,通过少量标注数据改进分割管道的安全性。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026. Code available at: https://github.com/aneesh3108/RF-Deep

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17787 2026-07-22 cs.RO cs.AI 版本更新 57%

AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models

AnchorRefine:基于轨迹锚点和残差细化的轨迹-锚点与残差细化的视觉-语言-动作模型

Tingzheng Jia, Kan Guo, Lanping Qian, Yongli Hu, Daxin Tian, Guixian Qu, Chunmian Lin, Baocai Yin, Jiapu Wang

机构 * Beijing University of Technology(北京理工大学) Beihang University(北航) Nanjing University of Science and Technology(南京理工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出AnchorRefine框架,通过分解视觉-语言-动作动作建模为轨迹锚点和残差细化,提升几何和接触精度,实验表明在模拟和现实任务中均取得显著提升。

Comments The authors have decided to withdraw this manuscript because the work requires substantial revision and further experimental validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22442 2026-07-22 cs.CR cs.SE 版本更新 57%

Architecture-Derived CBOMs for Cryptographic Migration: A Security-Aware Architecture Tradeoff Method

基于架构的CBOMs用于密码迁移:一种安全感知的架构权衡方法

Eduard Hirsch, Kristina Raab

专题命中 规划决策 :planning(abstract);分类 cs.SE

AI总结 本文提出SATAM方法,通过整合ATAM、arc42等方法,生成包含安全意图和迁移关键元数据的架构基础CBOM,提升密码迁移规划的信息可用性。

Comments Accepted at the International Workshop on Migration and Agility in Cryptographic Systems (MAgiCS 2026). This version matches the open-access conference paper published by Springer

Journal ref CCIS, vol. 3002, pp. 20-39 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04843 2026-07-22 cs.AI 版本更新 57%

Fluid Reasoning Representations

推理模型中的流体表示

Dmitrii Kharlapenko, Terry Jingchen Zhang, Arth Singh, Alessandro Stolfo, Arthur Conmy, Mrinmaya Sachan, Zhijing Jin

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究揭示了推理模型通过上下文细化令牌表示提升抽象问题解决能力的机制,提出流体推理表示概念。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17049 2026-07-22 cs.SE cs.RO 版本更新 57%

Evaluating Uncertainty and Quality of Visual Language Action-enabled Robots

评估具有视觉语言动作能力的机器人的不确定性和质量

Pablo Valle, Chengjie Lu, Shaukat Ali, Aitor Arrieta

机构 * Mondragon University(蒙dragon大学) Simula Research Laboratory(Simula研究实验室)

专题命中 规划决策 :planning(abstract);分类 cs.SE

AI总结 研究针对具有视觉语言动作能力的机器人,采用八个不确定性指标和五个质量指标,通过大规模实证研究评估其有效性,发现部分指标与人类评估有相关性且能区分任务执行质量,挑战了仅依赖成功率的评估做法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10645 2026-07-21 cs.CL cs.MA cs.SI 版本更新 57%

MafiaScope: Non-Invasive, Time-Resolved Belief Probing for LLM Agents in Social Deduction Games

MafiaScope:社交推理游戏中对大语言模型智能体的非侵入性、时间分辨信念探测

Ilia Karpov

机构 * HSE University(俄罗斯高等经济研究大学)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 研究社交推理游戏中LLM智能体信念探测问题,提出MafiaScope测试平台,通过结构化问题让智能体私下作答并自动评分,可视化呈现信念轨迹,以DeepSeek为例进行研究,得出相关校准误差等结果并开源相关内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26548 2026-07-21 cs.CR cs.LG 版本更新 57%

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

SEC-bench Pro:语言模型能解决长周期软件安全任务吗?

Hwiwon Lee, Jiawei Liu, Dongjun Kim, Wubing Xia, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出SEC-bench Pro基准,通过三阶段流程构建包含V8和SpiderMonkey共183个已验证漏洞的测试集,评估前沿语言模型在长周期漏洞狩猎任务中的表现,发现最高成功率仅48.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29007 2026-07-21 cs.CL 版本更新 57%

Taxonomy-Targeted Error Generation for Quantitative Reasoning

错误作为透镜:通过合成误解生成探究LLM推理

Xinming Yang, Jun Li

机构 * CUNY Graduate Center(纽约大学研究生中心) CUNY Queens College(纽约市立大学皇后学院)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 提出一个框架,通过生成针对Bloom分类学五类错误的合成误解,以诊断LLM推理能力,并发现目标错误生成比自由形式错误生成更难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25739 2026-07-21 cs.LG cs.GT stat.ML 版本更新 57%

The Behavioral Credibility Trilemma: When Calibrated Autonomy Becomes Impossible

行为可信度三难困境:当校准自主性变得不可能

Lauri Lovén, Nam Do, Hassan Mehmood, Dinesh Kumar Sah, Sasu Tarkoma

机构 * Future Computing Group University of Oulu(奥卢大学未来计算组) Department of Computer Science University of Helsinki(赫尔辛基大学计算机科学系)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文证明,在理性监督下,当某些任务超出智能体的可靠能力时,任何具有置信门控自主性的强化学习策略都无法同时实现最大帮助性、最优校准和完全自主性,即行为可信度三难困境。

Comments 49 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12111 2026-07-21 cs.AI cs.DS 版本更新 57%

Adaptive Multi-Round Allocation with Stochastic Arrivals

自适应多轮分配与随机到达

Yuqi Pan, Davin Choo, Haichuan Wang, Milind Tambe, Alastair van Heerden, Cheryl Johnson

机构 * Harvard University(哈佛大学) University of Witwatersrand(沃特沙兰大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究了受适应性网络招募启发的序列资源分配问题,提出基于截断概率生成函数的动态规划算法,实现多项式复杂度的多轮分配方案,并分析了模型误差下的鲁棒性。

Comments Accepted into ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06009 2026-07-21 cs.LG 版本更新 57%

Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments

通过扩展到100万个并行环境防止PPO学习停滞

Michael Beukman, Khimya Khetarpal, Zeyu Zheng, Will Dabney, Jakob Foerster, Michael Dennis, Clare Lyle

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 通过扩展PPO到100万个并行环境,有效解决学习停滞问题,实现性能持续提升。

Comments Accepted to RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19244 2026-07-21 cs.LG 版本更新 57%

Interpret Policies in Deep Reinforcement Learning using SILVER with RL-Guided Labeling: A Model-level Approach to High-dimensional and Multi-action Environments

使用带强化学习引导标记的SILVER解释深度强化学习中的策略:一种针对高维多动作环境的模型级方法

Yiyu Qian, Su Nguyen, Chao Chen, Qinyue Zhou, Liyuan Zhao

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 研究针对深度强化学习缺乏可解释性问题展开,提出带强化学习引导标记的SILVER,通过提取特征、进行归因、生成数据集及训练代理模型来解释策略,在雅达利环境评估并经人体研究验证,提升透明度与人类理解,推进可解释强化学习发展。

Comments Some co-authors do not agree with uploading this paper to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03066 2026-07-21 cs.LG stat.ML 版本更新 57%

Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function

Sign-SZPO:具有未知链接函数的基于可证明偏好的强化学习

Qining Zhang, Lei Ying

机构 * University of Michigan(密歇根大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 研究具有未知链接函数的基于偏好的强化学习问题,提出Sign-SZPO零阶策略优化算法,该算法仅估计价值函数差的符号来构建更新方向,可证明收敛到平稳策略,实证显示其在链接函数错误指定下具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18447 2026-07-21 cs.LG 版本更新 57%

Supervised Reward Inference

监督奖励推理

Will Schwarzer, Jordan Schneider, Philip S. Thomas, Scott Niekum

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究人类通过多样行为表明目标时的奖励推理问题,提出监督奖励推理(SRI)方法,证明其理论上渐近贝叶斯最优,实证上在相关基准和机器人任务中表现出色,还展示了框架对动作和目标预测的通用性。

Comments 35 pages, 8 figures. Updated with public code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08423 2026-07-20 cs.AI 版本更新 57%

OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice

OmniFood-Bench:评估用于营养推理和个性化健康建议的视觉语言模型

Qian Jiang, Zhecheng Shi, Jingpu Yang, Zirui Song, Miao Fang

专题命中 规划决策 :autonomous agent(abstract);分类 cs.AI

AI总结 介绍OmniFood-Bench基准评估用于营养推理和个性化健康建议的VLMs,基于MM-Food-100K数据集,评估其三种能力,实验发现模型在菜品命名与质量估计等方面存在“语义-物理差距”,为公共卫生自主智能体建立可信度标准。

详情

展开后加载摘要…

URL PDF HTML 收藏