arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6571 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1893 篇

2607.03065 2026-07-07 cs.LG cs.AI 新提交 62%

Spectral Rewiring for Exploration, Purification, and Model Merging

用于探索、提纯和模型合并的频谱重布线

Zhilong Zhang, Hongli Yu, Huan-ang Gao, Hanlin Wu, Yuxuan Song, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

机构 * SIA-Lab of Tsinghua AIR(清华-字节跳动联合研究中心SIA实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究强化学习中参数更新瓶颈,提出子空间对齐重布线方法,保留频谱核心去除正交分量,可提纯训练更新、实现模型合并,提升推理和跨域性能,是无训练机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02944 2026-07-07 cs.LG cs.AI 新提交 62%

A Precedent-Guided Co-Scientist for Side-Effect-Aware Drug Redesign

一种用于副作用感知药物重新设计的先例引导协同科学家

Yujin Kim, Charmgil Hong

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出PRECEDE用于副作用感知药物重新设计,将重新设计视为基于证据的推理,由LLM编排,定位为人监督的科学工作流,可审核、证伪且受先前药理学限制。

Comments Accepted at the ICML 2026 Workshop on AI for Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09348 2026-07-07 cs.LG cs.CL 新提交 62%

PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment

PBSD: 特权贝叶斯自蒸馏用于长程信用分配

Yang Tian, Rui Wang, Xumeng Wen, Junjie Li, Shizhao Sun, Lei Song, Jiang Bian, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) XYZ AI Lab(XYZ AI实验室)

专题命中 规划决策 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 提出PBSD方法,通过贝叶斯校准的自蒸馏将稀疏最终奖励转化为细粒度步骤级信用信号,解决长程智能体任务中的信用分配问题,实验表明其提升领域内外性能并促进泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02504 2026-07-03 cs.CL cs.AI cs.CV 新提交 62%

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

推理大模型提升长篇电视剧中的说话人识别

Yuxuan Li, Lingxi Xie, Xinyue Huo, Jihao Qiu, Jiacheng Shao, Pengfei Chen, Jiannan Ge, Kaiwen Duan, Qi Tian

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 提出DramaSR-532K大规模基准和基于推理大模型的DramaSR-LRM方法,通过多模态工具使用聚合上下文证据,显著提升长篇电视剧中说话人识别准确率,尤其对短话语效果显著。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02255 2026-07-03 cs.AI cs.CL 新提交 62%

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

AgenticSTS: 一种用于长周期LLM智能体的有界记忆测试平台

Xiangchen Cheng, Yunwei Jiang, Jianwen Sun, Zizhen Li, Chuanhao Li, Xiangcheng Cao, Yihao Liu, Fanrui Zhang, Li Jin, Kaipeng Zhang

机构 * Alaya Lab(Alaya实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种有界记忆契约,通过类型化检索组装用户消息,避免原始跨决策转录,在《杀戮尖塔2》中实现并验证,揭示了战略技能层对胜率的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01595 2026-07-03 cs.AI cs.CL 新提交 62%

Safe and Adaptive Cloud Healing: Verifying LLM-Generated Recovery Plans with a Neural-Symbolic World Model

安全且自适应的云修复:使用神经符号世界模型验证LLM生成的恢复计划

Junyan Tan, Haoran Lin, Siyuan Guo, Yichen Fang, Xinyue Luo, Tianyu Shen, Zeyu Qiao

机构 * Zhejiang University(浙江大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 提出PASE框架,将LLM作为规划引擎生成恢复计划,通过神经符号世界模型验证可行性,并利用DRL优化提示,实现动态自适应修复,显著降低恢复时间并提高未知故障检测精度。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01232 2026-07-03 cs.LG cs.CL 新提交 62%

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

一层就够了吗?训练单个Transformer层可以匹配全参数RL训练

Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Peking University(北京大学) Amazon(亚马逊)

专题命中 规划决策 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 发现RL训练收益高度集中在少数Transformer层,仅训练单层即可恢复大部分全参数RL收益,且高贡献层集中在模型中部。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00917 2026-07-02 cs.LG cs.AI 新提交 62%

Valdi: Value Diffusion World Models

Valdi: 价值扩散世界模型

Christopher Lindenberg, Kashyap Chitta

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出Valdi框架,结合端到端在线训练与潜在扩散动力学模型,在CarRacing环境中使用单步扩散达到与确定性MLP基线相当的性能,揭示了预测多模态与控制性能之间的权衡。

Comments RLC 2026 WMW

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00392 2026-07-02 cs.LG cs.AI 新提交 62%

Learning Generalizable Skill Policy with Data-Efficient Unsupervised RL

学习具有数据高效的无监督RL的通用技能策略

Jongchan Park, Seungjun Oh, Seungho Baek, Yusung Kim

机构 * Department of Computer Science and Engineering, Sungkyunkwan University(成均馆大学计算机科学与工程系)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出GenDa框架,通过技能重标定缓解非平稳性,并引入互补信息瓶颈增强泛化性,实现数据高效且鲁棒的无监督强化学习预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01203 2026-07-02 eess.SY cs.AI cs.LG cs.RO cs.SY math.OC 新提交 62%

GPU-Parallel Linearization Error Bounds for Real-Time Robust Optimal Control of Nonlinear and Neural Network Dynamics

GPU并行线性化误差界用于非线性和神经网络动力学的实时鲁棒最优控制

Jeffrey Fang, Keyi Shen, Anutam Srinivasan, Glen Chou

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出GPU并行线性化误差界(LEBs),结合系统级综合与鲁棒控制求解器,实现非线性与神经网络动力学实时鲁棒最优控制,在168维状态上达到67 Hz求解速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32026 2026-07-01 cs.LG cs.AI 新提交 62%

AdaJEPA: An Adaptive Latent World Model

AdaJEPA:一种自适应潜在世界模型

Ying Wang, Oumayma Bounou, Yann LeCun, Mengye Ren

机构 * New York University(纽约大学) AMI Labs(AMI实验室)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出AdaJEPA,一种在模型预测控制闭环中进行测试时自适应的潜在世界模型,通过自监督信号持续校准模型,显著提升规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31048 2026-07-01 cs.LG cs.AI 新提交 62%

Knowledge Distillation from Large Reasoning Models to Compact Student Models: A Case Study on the John O Bryan Mathematics Competition

从大型推理模型到紧凑学生模型的知识蒸馏:以约翰·O·布莱恩数学竞赛为例

Gaurab Baral, Aaditya Khanal, Yangyang Tao, Junxiu Zhou

机构 * Northern Kentucky University(北肯塔基大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究从大型推理模型DeepSeek-R1向紧凑学生模型Qwen2.5-7B的知识蒸馏,通过构建思维链训练语料库微调,使学生在竞赛数据集上准确率提升4.76个百分点,并发现响应长度对数学推理质量至关重要。

Comments 15 pages, 3 figures, 7 tables. Code and data available at https://github.com/TempGaurab/Distillation.John-O-Bryan

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27926 2026-06-29 cs.AI cs.CL cs.CV 新提交 62%

Verifiable Geometry Problem Solving: Solver-Driven Autoformalization and Theorem Proposing

可验证几何问题求解:求解器驱动的自动形式化与定理提出

Can Li, Ting Zhang, Junbo Zhao, Hua Huang

机构 * Beijing Normal University(北京师范大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出SD-GPS框架,通过求解器驱动的自动形式化和可验证定理提出,解决几何问题求解中神经符号方法的瓶颈,在Geometry3K和PGPS9K上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27579 2026-06-29 cs.CV cs.AI cs.LG q-bio.TO 新提交 62%

Distribution-based deep multiple instance learning for tumor proportion scoring in NSCLC

基于分布的多实例深度学习在非小细胞肺癌肿瘤比例评分中的应用

Krzysztof Pysz, Artur Bartczak, Jarosław Kwiecień, Piotr Krajewski, Witold Dyrka

机构 * Politechnika Wrocławska, Wydział Podstawowych Problemów Techniki, Katedra Inżynierii Biomedycznej(弗罗茨瓦夫理工大学,基础技术问题学院,生物医学工程系) Specjalistyczny Szpital Chorób Płuc w Zakopanem, Zakład Patomorfologii(扎科帕内专科肺病医院,病理形态学科) Narodowy Instytut Onkologii im. Marii Skłodowskiej-Curie, Oddział Kraków, Zakład Patomorfologii Nowotworów(玛丽·居里国家肿瘤研究所,克拉科夫分院,肿瘤病理形态学科)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对非小细胞肺癌肿瘤比例评分(TPS)中标注繁琐和专家稀缺的问题,提出嵌入提取与多分类网络结合多实例学习(MIL)的分布预测框架,通过零膨胀贝塔分布建模提升预测精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13544 2026-06-29 eess.AS cs.AI cs.CL 新提交 62%

Adaptive Turn-Taking for Real-time Multi-Party Voice Agents

自适应轮流发言:面向实时多方语音代理

Soumyajit Mitra, Prabhat Pandey, Abhinav Jain, Shanmukha Sahith, K V Vijay Girish

机构 * Amazon AGI(亚马逊人工智能研究院) IIT Kharagpur, India(印度克里ш格布尔理工学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出ModeratorLM,一种基于角色条件的语音大模型,通过分块流式处理和链式推理,在多方对话中实现自适应轮流发言,显著提升轮流精度和召回率。

Comments Accepted for publication at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26397 2026-06-26 cs.LG cs.AI 新提交 62%

Deterministic Pareto-Optimal Policy Synthesis for Multi-Objective Reinforcement Learning

多目标强化学习的确定性帕累托最优策略综合

Aniruddha Joshi, Niklas Lauffer, Sanjit Seshia

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于切比雪夫标量化的偏好条件贝尔曼算子,用于计算多目标马尔可夫决策过程中的确定性帕累托最优策略,并证明其单调收敛到帕累托前沿的覆盖集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26080 2026-06-25 cs.LG cs.AI 新提交 62%

Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents

被忽视的免费午餐:后训练中的进展优势用于LLM智能体

Changdae Oh, Wendi Li, Seongheon Park, Samuel Yeh, Tanwi Mallick, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Argonne National Laboratory(阿贡国家实验室)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出进展优势概念,利用强化学习后训练中的隐式优势函数作为无标注、领域无关的步骤级评分,在测试时扩展、不确定性量化和失败归因中超越专用奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25606 2026-06-25 cs.CV cs.AI cs.LG 新提交 62%

Expresso-AI: Explainable Video-Based Deep Learning Models for Depression Diagnosis

Expresso-AI: 基于可解释视频的深度学习模型用于抑郁症诊断

Felipe Moreno, Sharifa Alghowinem, Hae Won Park, Cynthia Breazeal

机构 * Media Lab MIT Cambridge, USA(媒体实验室 MIT 摄影实验室 美国剑桥)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种可解释的深度学习框架,通过微调动作识别预训练的DCNN,分析面部视频中的时空特征,生成显著性图以解释模型决策,同时提升抑郁症严重程度预测性能。

Comments 8 pages. Accepted at the 2023 11th International Conference on Affective Computing and Intelligent Interaction (ACII). Code: https://github.com/felmoreno1726/Expresso-AI

Journal ref 2023 11th International Conference on Affective Computing and Intelligent Interaction (ACII), 2023, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25206 2026-06-25 cs.RO cs.AI cs.CL 新提交 62%

RAVEN: Long-Horizon Reasoning & Navigation with a Visuo-Spatio-Temporal Memory

RAVEN: 基于视觉-空间-时间记忆的长期推理与导航

Yixun Hu, Zhicheng Zheng, Lihan Zha, Chunwei Xing, Rajdeep Singh, Omar Hossain, Antonio Loquercio, Dhruv Shah

机构 * Princeton University(普林斯顿大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出RAVEN记忆系统,通过存储视觉嵌入与位姿时间信息,实现长期机器人问答与导航,在多个基准上超越字幕记忆系统,以10倍更低检索成本匹配前沿VLM。

Comments Project website: https://ravenmem.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25068 2026-06-25 cs.LG cs.AI 新提交 62%

Adapt Only When It Pays: Budgeted Decision-Loss Priority for Delayed Online Time-Series Adaptation

仅在有利可图时适应:延迟在线时间序列自适应的预算决策损失优先级

Xibai Wang

机构 * Xibai Wang(王希拜)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出ADOWIP框架,通过决策损失优先级门控在反馈到达时选择性更新,在有限预算下降低决策损失,并在公共数据集上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23745 2026-06-24 q-bio.BM cs.AI cs.LG 新提交 62%

JEDEL: Zero-Shot DNA-Encoded Library Design for Early-Stage Drug Discovery

JEDEL:用于早期药物发现的零样本DNA编码库设计

Zygimantas Jocys, Zhanxing Zhu, Henriette M. G. Willems, Katayoun Farrahi

机构 * The ALBORADA Drug Discovery Institute, University of Cambridge(剑桥大学ALBORADA药物发现研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出JEDEL框架,直接从活性配体的三维药效团表示生成可合成的DNA编码库,无需目标特异性再训练,在18个蛋白靶点上优于随机和多样性基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24047 2026-06-24 cs.AI cs.LG 新提交 62%

Ensemble Feature Selection and Harris Hawks Optimization for Explainable Mental Health Risk Prediction in Female Sex Workers

集成特征选择与哈里斯鹰优化用于女性性工作者可解释心理健康风险预测

Ahnaf Atef Choudhury, Md. Parvej Hoque Palash, Shahriar Siddique Ayon, Ramkrishna Saha, Abdullah Al Mamun

机构 * Department of Information Sciences and Technology(信息科学与技术系) George Mason University(乔治·马歇尔大学) Department of Computer Science and Engineering(计算机科学与工程系) Jahangirnagar University(贾汗吉尔纳加尔大学) AIUB The University of Texas at Dallas(德克萨斯大学达拉斯分校) Dhaka University of Engineering and Technology(达卡工程与技术大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出集成ANOVA和互信息的特征选择与哈里斯鹰优化逻辑回归的混合模型,在3005名女性性工作者中实现95.78%准确率,识别创伤后应激、客户暴力和职业因素为抑郁主要贡献因素。

Comments Accepted and presented at the 2026 8th IEEE Symposium on Computers & Informatics (ISCI 2026). To appear in IEEE conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23995 2026-06-24 cs.LG cs.AI cs.GT cs.MA 新提交 62%

EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games

EMAgnet:大规模博弈中策略梯度自我博弈的参数空间EMA正则化

Tristan Maidment, JB Lanier, Chase McDonald, Nathan Tsang, Eugene Vinitsky, Roy Fox, Albert Wang, Wesley N. Kerr

机构 * Riot Games(拳头游戏) University of California, Irvine(加州大学尔湾分校) New York University(纽约大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出EMAgnet,通过指数移动平均(EMA)对策略参数进行自适应正则化,替代均匀分布正则化,在两人零和博弈中降低可剥削性。

Comments Accepted at NExT-Game 2026: New Frontiers in Game-Theoretic Learning (ICML 2026 Workshop). 13 pages, 2 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23938 2026-06-24 cs.AI cs.CL 新提交 62%

Neuro-Symbolic Drive: Rule-Grounded Faithful Reasoning for Driving VLAs

神经符号驱动:基于规则忠实推理的驾驶VLA

Xiangbo Gao, Xiukun Huang, Boyu Lu, Junge Zhang, Mengjie Mao, Jiachen Li, Wei Xiong, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学) Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学) University of California, Riverside(加利福尼亚大学河滨分校) University of Pittsburgh(匹兹堡大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 提出神经符号驱动框架,利用规则规划器的决策轨迹监督驾驶VLA,实现推理与运动生成的因果耦合,显著降低轨迹误差和碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23537 2026-06-23 cs.DB cs.AI cs.LG 新提交 62%

SQLConductor: Search-to-Policy Learning for Step-wise Text-to-SQL Orchestration

SQLConductor:面向逐步文本到SQL编排的搜索到策略学习

Yizhang Zhu, Zhangyang Peng, Boyan Li, Yuyu Luo

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出SQLConductor框架,通过搜索到策略学习将文本到SQL任务分解为动作序列,用蒙特卡洛树搜索探索工作流并训练策略模型逐步编排,在BIRD-Dev上达73.2%执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23404 2026-06-23 cs.CL cs.AI 新提交 62%

ReasoningLens: Hierarchical Visualization and Diagnostic Auditing for Large Reasoning Models

ReasoningLens:大型推理模型的分层可视化与诊断审计

Jun Zhang, Jiasheng Zheng, Boxi Cao, Yaojie Lu, Hongyu Lin, Jia Zheng, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory(中国信息处理实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出ReasoningLens框架,通过分层结构、智能审计和系统分析,将长思维链转化为可操作洞察,用于解释、调试和优化大型推理模型。

Comments Our project is available at https://github.com/icip-cas/ReasoningLens

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22350 2026-06-23 cs.LG cs.AI 新提交 62%

Select-to-Act: Hierarchical Reinforcement Learning via Adaptive Language Guidance

Select-to-Act: 通过自适应语言指导的分层强化学习

Hanping Zhang, Adam Koziak, Yuhong Guo

机构 * School of Computer Science, Carleton University(卡尔顿大学计算机科学学院) Canada CIFAR AI Chair, Amii(加拿大CIFAR人工智能主席,阿米(人工智能研究所))

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出分层强化学习框架HRLLI,将自然语言指令分解为可动态选择的语义指导,通过高层策略选择当前最相关的指令片段指导低层决策,显著提升样本效率和任务性能。

Comments ECML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22277 2026-06-23 eess.SY cs.AI cs.LG cs.SY 新提交 62%

Active Sensing and Deferred-Decision Trajectory Optimization for Robust Target Identification

主动感知与延迟决策轨迹优化用于鲁棒目标识别

Farbod Siahkali, Mengxue Hou, Vijay Gupta

机构 * Department of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程系) Department of Electrical Engineering, University of Notre Dame(诺丁汉大学电气工程系)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出主动感知延迟决策轨迹优化(AS-DDTO)框架,通过引入轨迹依赖的信息获取项,在保持可达性的同时偏向早期识别区域,实现资源约束下的目标识别。

Comments Published in IEEE Control Systems Letters (L-CSS), 2026. 6 pages

Journal ref IEEE Control Systems Letters, vol. 10, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21777 2026-06-23 cs.CL cs.AI 新提交 62%

CalVerT: Augmenting Agents with Calibrated Verifier Telemetry Improves Action and Learning in Knowledge-Intensive Tasks

CalVerT: 通过校准验证器遥测增强智能体在知识密集型任务中的行动与学习

Ashwin Vinod, Ying Ding, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出CalVerT方法,通过向智能体状态添加校准的自信心分数和基础验证器分数,减少过度依赖参数知识或冗余检索,提升知识密集型问答的准确性和效率。

Comments Code: https://github.com/ashwinn-v/CalVerT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21173 2026-06-23 cs.LG cs.AI 新提交 62%

Inverting the Bellman Equation: From $Q$-Values to World Models

逆推贝尔曼方程:从 $Q$ 值到世界模型

Alistair Letcher, Mattie Fellows, Alexander D. Goldie, Jonathan Richens, Jakob N. Foerster, Oliver Richardson

机构 * FLAIR, University of Oxford(FLAIR,牛津大学) Google DeepMind(谷歌DeepMind) Mila, University of Montreal(Mila,蒙特利尔大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文证明基于值的智能体在丰富奖励函数上训练时隐式编码世界模型,提出 $P$-learning 从 $Q$ 值提取模型,并给出编码真实转移核的充分条件,实验验证了隐式模型的准确性和泛化能力。

Comments 48 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏