arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2976 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 909 篇

2406.11868 2026-08-11 cs.CY cs.AI 版本更新 57%

Ethical Framework for Responsible Foundational Models in Medical Imaging

医学影像领域负责任基础模型的伦理框架

Debesh Jha, Gorkem Durak, Abhijit Das, Jasmer Sanjotra, Onkar Susladkar, Suramyaa Sarkar, Ashish Rauniyar, Nikhil Kumar Tomar, Linkai Peng, Sirui Li, Koushik Biswas, Ertugrul Aktas, Elif Keles, Matthew Antalek, Zheyuan Zhang, Bin Wang, Xin Zhu, Hongyi Pan, Deniz Seyithanoglu, Alpay Medetalibeyoglu, Vanshali Sharma, Vedat Cicek, Amir A. Rahsepar, Rutger Hendrix, A. Enis Cetin, Bulent Aydogan, Mohamed Abazeed, Frank H. Miller, Rajesh N. Keswani, Hatice Savas, Sachin Jambawalikar, Daniela P. Ladner, Amir A. Borhani, Concetto Spampinato, Michael B. Wallace, Ulas Bagci

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本研究针对医学影像领域基础模型整合临床实践时的隐私、偏差、可解释性等伦理挑战,提出含隐私保护、偏差应对、人类监督的伦理框架,以平衡创新与医学伦理原则。

Journal ref https://www.frontiersin.org/journals/medicine/articles/10.3389/fmed.2025.1544501/full

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05242 2026-08-10 cs.LG cs.CV 版本更新 57%

Disentangling 3D Modeling from Spatial Reasoning

将3D建模与空间推理解耦

Haoze Sun, Jiequan Cui, Qingshan Xu, Richang Hong

专题命中 规划决策 :tool-use(abstract);分类 cs.LG

AI总结 该研究提出解耦空间推理器(DiSR)框架,将3D感知与LLM推理解耦,在空间推理基准上取得竞争力性能,兼具可解释性、模块化性与计算效率,为空间智能提供替代范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27924 2026-08-10 cs.LG cs.CV cs.RO 版本更新 57%

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

ODEWorld:一种基于物理时间流的连续预测架构

Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang, Sangli Teng, Koushil Sreenath, Xianyuan Zhan

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Berkeley Artificial Intelligence Research (BAIR), University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究院(BAIR))

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究针对现有世界建模机器学习范式局限于离散时间预测的问题,提出基于PT-Flow的连续时间潜在世界模型ODEWorld,解决表示崩溃问题,在视频生成和机器人控制任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06054 2026-08-10 cs.CV cs.AI 版本更新 57%

Probing Visual Concepts in Lightweight Vision-Language Models for Automated Driving

探测轻量视觉语言模型中视觉概念以用于自动驾驶

Nikos Theodoridis, Reenu Mohandas, Ganesh Sistu, Anthony Scanlan, Ciarán Eising, Tim Brophy

机构 * University of Limerick(利默里克大学) Valeo Vision Systems, Ireland(爱尔兰瓦莱欧视觉系统) Department of Electronic and Computer Engineering(电子与计算机工程系)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本研究探讨了轻量视觉语言模型在自动驾驶中的视觉概念编码问题,发现某些概念显式编码而其他隐式编码,并识别出感知和认知两种失败模式。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00559 2026-08-10 cs.AI 版本更新 57%

Social World Models

社交世界模型

Xuhui Zhou, Jiarui Liu, Akhila Yerukola, Hyunwoo Kim, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学语言技术研究所) NVIDIA, Santa Clara, CA, USA(英伟达)

专题命中 规划决策 :AI agent(abstract);分类 cs.AI

AI总结 本文提出社交世界模型(SWMs)及结构化社交世界表示形式(S3AP),通过显式建模隐藏心理状态提升AI在社交推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04023 2026-08-07 econ.GN cs.LG q-fin.EC 版本更新 57%

Monsoon Mayhem to Market Waves: Forecasting Fisheries Resilience in Sri Lanka

季风混乱到市场波动:斯里兰卡渔业韧性预测

Ruzaini Ahmed, Yohan Jayasinghe, Tharumini Gamage, Ifaz Ikram, Hasini Lawanya, Nirasha Munasinghe, Patalee Narasinghe, Nisansa de Silva, Sandareka Wickramanayake

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本研究开发框架结合STL分解、ITS回归等方法,分析斯里兰卡渔业受气候与重大事件的影响,发现海洋与内陆渔业的差异,成果可支撑渔业规划与决策。

Comments Accepted to MERCon 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21155 2026-08-07 cs.CL 版本更新 57%

Who Checks the Citations? Benchmarking Legal Hallucination Detection

谁在检查引用?法律幻觉检测的基准测试

Patty Liu, Dominik Stammbach, Peter Henderson

机构 * Princeton University(普林斯顿大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 针对AI生成法律文件中频繁出现虚假引用的问题,本研究提出法律引用幻觉分类法,构建包含1300条注入错误的摘要数据集,并基准测试五种模型,发现即使最先进的GPT-5在代理框架下召回率82.8%、F1分数60.5%,仍难以处理细微错误类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26352 2026-08-07 cs.CL 版本更新 57%

RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents

RICE-PO:将检索交互转化为推理智能体的信用信号

Mingchen Li, Hansi Zeng, Zhuo Qian, Jiatan Huang, Sunjae Kwon, Hamed Zamani, Hong Yu

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) Texas Tech University(得克萨斯科技大学) University of Connecticut(康涅狄格大学)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 提出RICE-PO框架,通过将检索交互转化为局部学习信号,解决推理型检索智能体在训练中推理步骤的信用分配问题,在BRIGHT和BEIR上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06277 2026-08-07 cs.CV cs.LG 版本更新 57%

Dynamic Object Masks as Goal Representations for Visual Goal-Conditioned Reinforcement Learning

动态目标掩码作为视觉目标条件强化学习的目标表示

Fahim Shahriar, Cheryl Wang, Alireza Azimi, Gautham Vasan, Hany Hamed, Abhishek Naik, A. Rupam Mahmood, Colin Bellinger

机构 * University of Alberta(阿尔伯塔大学) McGill University(麦吉尔大学) University of Ottawa(渥太华大学) AMII CIFAR Canada AI Chair(CIFAR加拿大人工智能主席) Vector Institute(向量研究所)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 该研究针对视觉目标条件强化学习,提出动态目标掩码作为目标表示,结合Detic等预训练检测器生成掩码,在机械臂和仿真导航任务中实现高成功率与高效学习,支持仿真到现实迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07736 2026-08-06 cs.AI 版本更新 57%

Online Goal Recognition using Path Signature and Dynamic Time Warping

基于路径签名和动态时间规整的在线目标识别

Douglas Tesch, Nathan Gavenski, Leonardo Amado, Odinaldo Rodrigues, Felipe Meneguzzi

机构 * Pontifícia Universidade Católica do Rio Grande do Sul(圣保罗天主教大学里约格兰德杜斯乌尔古斯分校) King’s College London(伦敦国王学院) University of Aberdeen(阿伯丁大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出一种基于路径签名和动态时间规整的在线目标识别方法,通过高效编码轨迹和有效比较轨迹,提升预测准确性和在线规划效率。

Comments Accepted as part of the 35th International Joint Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20985 2026-08-06 cs.LG 版本更新 57%

Distributional Active Inference

分布式主动推断

Abdullah Akgül, Gulcin Baykal, Manuel Haußmann, Mustafa Mert Çelikok, Melih Kandemir

机构 * University of Southern Denmark(丹麦南部大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出了一种将主动推断整合到分布式强化学习框架中的形式抽象,以提升复杂环境机器人系统最优控制的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18056 2026-08-06 cs.CL 版本更新 57%

Neurocomputational Mechanisms of Syntactic Transfer in Bilingual Sentence Production

双语句子生成中语法转移的神经计算机制

Ahmet Yavuz Uluslu, Elliot Murphy

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 本文提出ROSE模型能解释双语生成中语法转移的神经机制,通过振荡失败模式揭示跨语言影响的神经计算基础。

Journal ref Uluslu, A. Y., & Murphy, E. (2026). Neurocomputational mechanisms of syntactic transfer. Journal of Neurolinguistics, 80, Article 101363

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21644 2026-08-05 cs.LG cs.SY eess.SY 版本更新 57%

Toward Goal-Agnostic Joint-Embedding Predictive Control of Partial Differential Equations

迈向偏微分方程的目标无关联合嵌入预测控制

Jonathan Gallagher, Roberto Guglielmi

机构 * University of Waterloo(滑铁卢大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究针对偏微分方程提出目标无关控制框架,基于联合嵌入预测架构,通过离线训练小型二维ViT编码器等,经模型预测路径积分控制器复用。在相关基准测试中,KE探测器规划提升奖励、降低误差,验证了潜在动力学与目标无关及校准可观测量用于状态控制的优势。

Comments Associated code will be open sourced alongside a later, updated submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21273 2026-08-05 cs.LG 版本更新 57%

The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and The Channel, Not the Content, Decides What Works

奖励通道中的暗室:密集预测奖励使GRPO训练的大语言模型智能体崩溃——以及实际有效的方法

Yu Wang

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 研究发现密集预测奖励在GRPO训练下会使大语言模型智能体崩溃,通过单因素消融定位原因,提出方差分布标准,还通过受控信号传递矩阵对比奖励通道和辅助损失通道,表明奖励通道至多中性,辅助损失通道有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15065 2026-08-05 cs.RO cs.CV cs.LG 版本更新 57%

DriftWorld: Fast World Modeling through Drifting

DriftWorld:通过漂移实现快速世界建模

Susie Lu, Haonan Chen, Weirui Ye, Yilun Du

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究针对预测性世界模型生成展开慢的问题,提出基于漂移生成模型的DriftWorld,训练时学习动作条件漂移以快速生成未来帧,在机器人操作基准测试中实现快速准确决策,还能作离线模拟器,性能优于基于扩散的基线。

Comments Website at https://susie-lu.github.io/driftworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20771 2026-08-05 q-bio.PE cs.LG 版本更新 57%

Cross-Country Learning for National Infectious Disease Forecasting Using European Data

基于欧洲数据的国家传染病预测的跨国家学习

Zacharias Komodromos, Kleanthis Malialis, Artemis Kontou, Panayiotis Kolios

机构 * KIOS Research and Innovation Center of Excellence(KIOS研究与创新中心)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出了一种基于欧洲多国数据的传染病预测方法,通过跨国家学习提升预测性能,尤其在数据有限时效果显著。

Comments 7 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12953 2026-08-05 cs.CV cs.AI cs.IR cs.MM 版本更新 57%

Epistemic-aware Vision-Language Foundation Model for Fetal Ultrasound Interpretation

具备知识意识的视觉-语言基础模型用于胎儿超声解读

Xiao He, Huangxuan Zhao, Guojia Wan, Jiancheng Pan, Yanxing Liu, Yong Luo, Juhua Liu, Yongchao Xu, Wei Zhou, Dacheng Tao, Bo Du

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程技术研究中心,武汉大学计算机学院) College of Computing and Data Science, Nanyang Technological University(computing and Data Science学院,南洋理工大学)

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 FetalMind通过Salient Epistemic Disentanglement方法,提升胎儿超声解读的准确性和效率,实现多视图图像推理和疾病诊断的高效处理。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22186 2026-08-04 cs.AI 版本更新 57%

Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning

解构离策略比率:用于异步强化学习的熵缩放信任区域

Guanqun Zhao, Zijun Xie, Binbin Zheng, Enlei Gong, Jiafeng Lu, Yehan Yang, Aoqi Hu, Zeyu Chen

机构 * Baidu(百度)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 研究异步强化学习中离策略数据问题,提出熵缩放信任区域(ESTR)方法,通过令牌局部熵缩放离策略偏差,无需辅助前向传递等,在多任务和基准测试中优于现有异步方法,提升训练-推理一致性与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09806 2026-08-04 cs.DL cond-mat.mtrl-sci cs.AI 版本更新 57%

An Autonomous Scientific Knowledge Generation Framework for AI-Driven Scientific Discovery

一种用于人工智能驱动科学发现的自主科学知识生成框架

Dibakar Datta

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 该研究提出自主科学知识生成框架,整合多种技术将科学出版物转化为适用于人工智能的知识库,以电光材料为例进行验证,实现从文献到知识库的转变,为人工智能驱动的科学发现提供了可扩展、领域独立的基础。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05238 2026-08-04 cs.AI 版本更新 57%

Branch-JEPA: Finite-Support Predictive Distributions for JEPA World Models

MoP-JEPA:用于随机JEPA世界模型的硬分配预测器混合架构

Zhi Song, Ximing Xing, Zhenchao Tang, hanbo Huang, Jiehui Huang, Weilong Yan, Tianxu Lv, Minghao Yang, Zhongzheng Niu, Bing He, Lusheng Wang, Jianhua Yao

机构 * City University of Hong Kong, China(香港城市大学) Tencent, China(腾讯)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对传统JEPA在随机环境下的状态坍缩问题,提出硬分配预测器混合的MoP-JEPA,可收敛到转移分布量化器,在OGBench测试中规划性能远超基线方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08340 2026-08-04 cs.CV cs.AI 版本更新 57%

Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time

PokeGym: 一种以视觉驱动的长周期基准用于视觉-语言模型

Ruizhi Zhang, Ye Huang, Yuangang Pan, Chuanfu Shen, Zhilin Liu, Ting Xie, Haijun Lei, Lixin Duan

机构 * SIAS, UESTC(电子科技大学深圳高等研究院) CFAR/IHPC A*STAR(新加坡科技研究局高性能计算研究所)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 PokeGym通过复杂的3D开放世界游戏评估视觉-语言模型在长周期任务中的表现,揭示了物理死锁恢复是当前模型的主要瓶颈,并发现高级模型存在元认知分歧。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03541 2026-08-04 cs.AI econ.TH 版本更新 57%

Group Selection as a Safeguard Against AI Substitution

群体选择作为对抗人工智能替代的保障

Qiankun Zhong, Thomas F. Eisenmann, Julian Garcia, Iyad Rahwan

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文研究了人工智能使用对文化多样性的影响,发现替代型AI使用在个体层面占优,而补充型AI使用在群体选择下更具优势,为政策制定提供参考。

Comments 19 pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23532 2026-08-03 cs.CR cs.AI cs.LO cs.RO 版本更新 57%

Mission-Level Runtime Assurance for LLM-Assisted ISR Swarms over a Verification-Aware Fabric

基于验证感知架构的大语言模型辅助情报、监视与侦察集群任务级运行时保障

Nikolaos Kekatos, Panagiotis Katsaros, Alexios Lekidis, Theodoros Nestoridis, Tom Nianios

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究大语言模型辅助的ISR集群任务级运行时保障问题,提出三层组合式运行时验证框架,将任务策略分解,通过验证感知架构聚合判定并融合代数,能检测个体合规但集群违规情况,模拟任务验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28276 2026-08-03 cs.LG 版本更新 57%

Commit to the Bit: Reactive Reinforcement Learning Done Right

Commit to the Bit: Reactive Reinforcement Learning Done Right

Onno Eberhard, Claire Vernade, Michael Muehlebach

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tübingen(图宾根大学) University of Technology Nuremberg(纽伦堡技术大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 针对确定性观测的有限环境,提出Committed Q-learning算法,在弱于$q_\star$-可实现性的rewire-鲁棒性假设下,证明其几乎必然收敛到最优反应策略。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21846 2026-08-03 cs.AI cs.HC 版本更新 57%

Shaping Scientific Explanations to Expert Perspectives with Persona-Conditioned Reinforcement Learning

基于知识图谱的自适应科学解释的代理人设

Susana Nunes, Tiago Guerreiro, Catia Pesquita

机构 * LASIGE, Faculdade de Ciências da Universidade de Lisboa, Portugal(里斯本大学科学学院LASIGE,葡萄牙)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 本文提出一种基于强化学习的科学解释生成方法,通过代理人设引导解释代理器适应专家认知策略,提升解释的适应性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17192 2026-08-03 cs.AI 版本更新 57%

Shall We Play a Game? Language Models for Open-ended Wargames

我们要玩一场游戏吗?用于开放式兵棋推演的语言模型

Glenn Matlin, Isaac Song, Yixiong Hao, Parv Mahajan, Evan Montoya, Ryan Bard, Stuart R. Topp, Anthony Wen-Ming Zang, Mohammed Rehan Parwani, Soham Shetty, Mark Riedl

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 该研究通过对223篇相关论文的范围综述,明确了兵棋推演中语言模型的控制角色现状,指出需关注模型对行动与后果的控制程度以保障模拟保真度。

Comments 49 pages (9-page body), 3 figures. Published at the Social Sim'26 Workshop at COLM 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28421 2026-07-31 cs.AI 版本更新 57%

DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes

DenoiseRL:引导推理模型从噪声前缀中恢复

Caijun Xu, Changyi Xiao, Zhongyuan Peng, Yixin Cao

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 提出DenoiseRL框架,通过强化学习从弱模型的错误推理中学习,无需外部监督或强教师模型,提升推理性能和训练效率。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15297 2026-07-31 cs.CL 版本更新 57%

AfriEconQA: A Benchmark for Quantitative and Temporal Reasoning over World Bank Economic Reports

AfriEconQA:基于世界银行报告的非洲经济分析基准数据集

Edward Ajayi, Mustapha Alaba, David Stephen

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 AfriEconQA是一个基于世界银行报告的非洲经济分析基准数据集,旨在测试信息检索和RAG系统在处理复杂经济查询时的性能。

Comments Dataset Explorer: https://afrieconqa.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25337 2026-07-30 cs.CL cs.RO 版本更新 57%

Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control

时间距离联合嵌入预测架构:用于潜在世界模型预测控制的计划感知表示学习

Jiaxin Bai, Jiaxuan Xiong

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 研究提出时间距离联合嵌入预测架构(TD-JEPA),保留LeWM编码器-预测器主干,从无奖励轨迹挖掘有向时间成本。该方法缩小JEPA世界模型规划器训练-规划差距,在多个环境中表现优于LeWM及其他基线,通过挖掘成本提升成功率和分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25132 2026-07-30 cs.LG 版本更新 57%

Interpretable GOHR Agents via Sparse Autoencoders

通过稀疏自编码器实现可解释的隐藏规则游戏智能体

Shiwei Tan, Yusong Zhao, Weiyi Qin, Wentian Wang, Jacob Feldman, Lazaros K. Gallos, Paul B. Kantor, Vladimir Menkov, Hao Wang

机构 * Rutgers University(罗格斯大学) The University of Hong Kong(香港大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 研究针对隐藏规则游戏中Transformer智能体的可解释性,通过在其决策令牌嵌入上训练稀疏自编码器,在双规则任务中恢复结构,单个维度对应可解释策略,为解释智能体行为提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏