arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4066 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 880 篇

2608.07037 2026-08-10 cs.LG cs.AI 新提交 62%

Accounting Graph Transformer for Short-History Multi-KPI Forecasting in Small Businesses

用于小企业短历史多KPI预测的会计图变换器

Shrutendra Harsola, Vignesh Subrahmaniam

机构 * Foresight-AI, Intuit(富睿特远见人工智能实验室,Intuit公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出Accounting Graph Transformer模型,针对小企业短历史数据完成13项财务KPI的12个月联合预测,在多组测试集上均优于LightGBM等基准模型,为企业财务分析提供集成预测层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05872 2026-08-07 cs.CL cs.AI 新提交 62%

MACRO: Markov Chain Routing of Transformer Layers

MACRO:Transformer层的马尔可夫链路由

Paweł Batorski, Abtin Pourhadi, Akylgali Aitaza, Przemysław Spurek, Paul Swoboda

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无需修改底层参数的MACRO框架,将Transformer层路由建模为马尔可夫策略,在多基准上实现优于基线及Dr. LLM的性能,同时大幅缩短路由搜索时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05375 2026-08-07 cs.AI cs.LG cs.MA 新提交 62%

DoctorAgents: an agentic framework to iteratively refine AutoML pipeline for small clinical temporal data

DoctorAgents:用于针对小型临床时序数据迭代优化自动机器学习流水线的智能体框架

Ruilin Wang, Bo-Hong Wang, Elizabeth Kourbatski, Jun Bai, Hegang Chen, Ziyang Song, Gilles Boire, Marie Hudson, Yue Li

机构 * McGill University(麦吉尔大学) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) CIUSSSE-CHUS(谢布鲁克大学医学中心综合大学健康和社会服务中心) University of Sherbrooke(谢布鲁克大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DoctorAgents是一种用于小型临床时序数据的智能体框架,通过LLM智能体以推理驱动方式迭代优化AutoML流水线,在多种临床任务上性能优于现有AutoML基线且可解释性更强。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05326 2026-08-07 cs.LG cs.CL 新提交 62%

QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding

QEvict:面向注意力漂移鲁棒长上下文解码的可恢复量化键值缓存驱逐机制

Ayushman Garg, Akshita Gupta, Shaswata Bhattacharya, Abhishek Gupta, Sandeep Kumar, Manoj Kumar

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 QEvict是一种三层KV缓存管理方案,通过可恢复量化驱逐解决长上下文解码中的注意力漂移问题,在固定内存预算下提升了长上下文任务的信息保留效果。

Comments 24 pages, 6 figures. The first four authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04170 2026-08-06 cs.CL cs.AI 新提交 62%

Visualizing Graph-to-Answer Mechanism Recovery in Materials-Science Hypothesis Generation

材料科学假说生成中从图到答案的机制恢复可视化

Shashwat Sourav, Subhadeep Pal, Markus J. Buehler, Sanjay Das, Fiona Y. Wang, Dominik Soos, Tirthankar Ghosal

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Oak Ridge National Laboratory(橡树岭国家实验室) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) UniverseTBD Massachusetts Institute of Technology(麻省理工学院) Old Dominion University(奥多明尼昂大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对适配的 Qwen3-8B 模型 Graph-PRefLexOR-8B,构建可视化诊断工作流以追踪材料科学假说生成的图到答案机制,发现机制恢复集中于后期合成及答案起始层,可助力相关人员识别假说的机制支持变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04037 2026-08-06 cs.CL cs.AI cs.GR cs.HC 新提交 62%

Reconstructing Persistent Worlds from Narratives for Narrative-Grounded Interactive Experiences

从叙事中重建持久世界以实现基于叙事的交互体验

Yi-Chun Chen

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出从叙事中重建显式持久世界的核心方法,开发原型实现可游玩环境,为AI辅助游戏创作等提供语义基础,验证了其可行性与应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03868 2026-08-05 cs.LG cs.AI 新提交 62%

GENESIS: Towards Explainable Causal Discovery

GENESIS:迈向可解释的因果发现

Abhinav Thorat, Ravi Kumar Kolla, Vishak K Bhat, Harsh Vardhan Singh Chauhan, Niranjan Pedanekar

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出可解释混合因果发现框架GENESIS,实现100%决策可追溯性,在多数基准数据集上性能优于纯统计方法,可与先进LLM辅助方法媲美。

Comments 13 pages, 2 figures, 13 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03263 2026-08-05 cs.LG cs.AI 新提交 62%

The Ignition Is Real, and It Lives at the Readout: Latent composition, difficulty-clocked ignition, and the interface-constituted commit in a recurrent-depth reasoner

激活是真实存在的,且存在于读出层:循环深度推理器中的潜在组成、难度驱动的激活以及由界面构成的提交

Simon Lam-Muir

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究验证潜在推理模型的“组成激活”为真实计算,复现30M参数循环深度推理器,发现激活存在于读出层,决策时边际跃升,隐藏状态方向突变后冻结,撤回早期速度低谷声明。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29241 2026-08-03 cs.IR cs.AI cs.CL 新提交 62%

RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems

RecHarness:用于自进化推荐系统的多臂老虎机路由智能体框架

Haoran Ling, Yuecheng Li, Zeyu Song, Jing Yao, Shuwen Kang, Chi Lu, Wenjin Wu, Peng Jiang

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RecHarness是一种多臂老虎机路由智能体框架,用于自动化优化推荐系统模型,通过分离方向选择与假设生成、引入跳盆机制提升稳定性,在多任务测试及在线A/B测试中均实现性能提升。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28648 2026-08-03 cs.HC cs.AI cs.CL 新提交 62%

Why It Hurts: Identifying the Drivers of Negative Thoughts in Emotional Support Conversations

为何会痛苦:识别情感支持对话中消极想法的驱动因素

Hainiu Xu, Zhaoyue Sun, Hanqi Yan, Jinhua Du, Caroline Catmur, Yulan He

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM情感支持任务中认知评估维度显著性被忽视的问题,推出AppraiSal基准并提出基于贝叶斯逆规划的多智能体概率框架PRISM,提升了LLMs识别情境特定显著评估维度的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28488 2026-07-31 cs.AI cs.LG 新提交 62%

SCOPE: Supply-Chain Operations through Coupled Policies for End-to-End Coordination

SCOPE:基于耦合策略的端到端协调供应链运营

Yunhao Liang, Xianqi Cao, Pujun Zhang, Yuan Qu, Yongzhi Qi, Ningxuan Kang, Max Z. J. Shen

机构 * Dingdong(叮咚)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 SCOPE是将供应链实体建模为token的复合策略模型,在生鲜零售补货数据上验证了其比分阶段优化及传统基线更优的端到端供应链决策效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28397 2026-07-31 cs.AI cs.CL cs.IR 新提交 62%

GLM-RAG: Graph Language Models for Graph-Based Retrieval-Augmented Generation

GLM-RAG:面向基于图的检索增强生成的图语言模型

Maya Arseven, Anette Frank, Beni Egressy, Johann Higl, Moritz Plenz

机构 * Institute of Computational Linguistics, Heidelberg University(海德堡大学计算语言学研究所) Aleph Alpha Research(Aleph Alpha 研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出GLM-RAG的GLM基检索器,对比三类检索器性能,发现微调GLM检索器跨域泛化更优且在多跳基准达SOTA,GNN与向量搜索各有优势。

Comments 10 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25728 2026-07-29 cs.RO cs.AI cs.LG 新提交 62%

Shared Voxel-Map-Based Cooperative Indoor UAV Guidance with a Multi-Agent Soft Actor-Critic Controller

基于共享体素地图的多智能体软演员-评论家控制器协同室内无人机导航

Thomas Hickling, Dylan Wynne, Yu Su, Nabil Aouf

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究室内无人机协同导航问题,提出结合共享体素地图与多智能体软演员-评论家控制器的框架,多无人机融合LiDAR观测构建地图并提供给各智能体,模拟中控制器成功率达90.3%,经微调后在现实实验中实现稳定协同操作,证明该地图表示有效且可扩展。

Comments 11 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24892 2026-07-29 cs.LG cs.AI 新提交 62%

LLM as Forecasting Planner: Training-Free Text Conditioning for Time-Series Foundation Models

大语言模型作为预测规划器:时间序列基础模型的免训练文本条件设定

Huu Hiep Nguyen, Dung Nguyen, Minh Hoang Nguyen, Dai Do, Hung Le

机构 * Deakin University(迪肯大学) Applied Artificial Intelligence Initiative(应用人工智能倡议)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究文本条件时间序列预测问题,核心方法是将预测设为TSFM生成轨迹上的规划问题,以冻结TSFM为模拟器、LLM为策略和价值函数,实例化\rc{}框架,主要贡献是通过实验证明该框架能带来持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24791 2026-07-29 cs.IR cs.AI cs.CL 新提交 62%

From Naive RAG to Deep Agentic Retrieval: An Evolving Context Engineering Pipeline for Regulatory Compliance

从朴素检索增强生成到深度智能检索:用于合规监管的不断演进的上下文工程管道

Mishca de Costa, Muhammad Saleh Anwar, Dave Mercier, Issam Hammad

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对RAG朴素实现的局限,追溯安大略发电公司检索管道演变,历经多阶段形成PEA-CAE架构,表明上下文工程对监管语料库更具优势,深度智能检索进展反映经典思想,迭代证据获取等渐成企业问答基础。

Comments Accepted at the 2026 IEEE the 14th International Conference on Smart Energy Grid Engineering (SEGE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24779 2026-07-29 cs.AI cs.LG 新提交 62%

HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising

HOBA:用于自适应在线广告的分层策略性投标代理

Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

机构 * Kuaishou Technology(快手科技)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对在线广告投标系统问题,提出 HOBA 分层强化学习框架,在三个时间尺度解耦相关环节,通过实验验证其优于现有基线,大规模在线部署实现目标成本提升 3.6%,证明该范式有效。

Comments 10pages,accepted by KDD 2026 ads track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24765 2026-07-29 cs.CL cs.AI cs.HC 新提交 62%

Measuring and Improving Behavioral Consistency in Large Language Models through Fact-Heuristic-Emotion State Enforcement

通过事实-启发式-情感状态强制来测量和提高大语言模型中的行为一致性

Gi-Hun Lee, Joong Yull Park

机构 * School of Mechanical Engineering, Chung-Ang University(韩国中央大学机械工程学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型行为一致性,通过认知内核模型CKM强制模型在决策前区分事实、假设和评估信号,经多实验评估发现其可降低输出变异性、减少决策翻转率,证明行为一致性可测且能部分改善。

Comments 40 pages, 6 figures; 54-page supplementary material included as an ancillary file. Code, prompts, and data: https://github.com/TeenyToolSoftware/cogos-behavioral-consistency

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23368 2026-07-28 cs.CV cs.AI cs.CL 新提交 62%

Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing

用基于树图解析支持的加权班扎夫交互解释生物医学CLIP

Jakub Rymarski, Adam Rempała, Bartłomiej Sobieski, Przemysław Biecek

机构 * University of Warsaw(华沙大学) Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对视觉语言模型在医学任务中解释难的问题,引入ParseFIxLIP方法,将树图解析融入班扎夫交互博弈,通过smart_depth分组策略减轻概念碎片化,提升跨模态交互可解释性,为VLM决策提供医学领域相关见解。

Comments 12 pages, 13 figures. Accepted at EXPLIMED 2026 (Third Workshop on Explainable Artificial Intelligence for the medical domain), IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22711 2026-07-28 cs.LG cs.AI cs.SE 新提交 62%

CORVUS: Context Optimization and Reduction Via Underlying Synchronization for LLM Coding Agents

CORVUS:通过底层同步实现大语言模型编码代理的上下文优化与缩减

Mingwei Zheng, David OBrien, Siwei Cui, Pardis Pashakhanloo, Rajdeep Mukherjee, Myeongsoo Kim, Sachit Kuhar

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型编码代理传统轨迹架构问题,提出CORVUS架构解耦文件读取与观察,通过维护同步注册表注入当前内容,经实验评估,该架构能减少输入令牌、缩短提示并减少推理周期,保持通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21613 2026-07-27 cs.AI cs.CL 新提交 62%

The Hard Decision Layer: Evidence for Committed Inference in Transformers

硬决策层:Transformer中确定推理的证据

Ashwath Vaithinathan Aravindan, Mayank Kejriwal

机构 * University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究基于Transformer的语言模型在多选型问答中做预测的位置与方式,识别出硬决策层,经多模型和数据集验证其在无学习路由策略时一致出现且对微调不变,HDL处准确率显著提升,为Transformer推理提供见解与机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20507 2026-07-24 cs.AI cs.LG 新提交 62%

MiniCache: Reusable Program Caching with Small Model Interfaces for Efficient LLM Inference

MiniCache:用于高效大语言模型推理的具有小模型接口的可重复使用程序缓存

Jingquan Chen, Jinghua Piao, Jie Feng, Shaogang Hu, Yong Li

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理成本高的问题,提出MiniCache框架,将PoT程序转换为参数化缓存对象,通过重用小模型进行语义变量提取和推测性起草,减少目标大语言模型调用,实验证明其能提升推理性能,平衡延迟、缓存重用和准确性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19974 2026-07-23 cs.LG cs.AI 新提交 62%

Time Series Network Utilization KPI Forecasting Using Advanced AI/ML Models

使用先进人工智能/机器学习模型的时间序列网络利用率关键绩效指标预测

Niraj Gadhe, Kirti Bhardwaj, Moulik Jain, Shubhi Sharma, Vinay Saini

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对数据密集型应用等导致的网络性能问题,通过评估季节性分解等多种模型,利用通用接口数据集在MAPE等指标上进行基准测试,给出模型准确性与计算效率权衡的见解,助相关人员选最佳预测模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19635 2026-07-23 cs.LG cs.AI 新提交 62%

Anatomy of a Sound Neural Reasoner: One-Shot Amortization, First-Pass Poisoning, and Search Inertness in Clue-Rich Completion

一个合理的神经推理器剖析:在富含线索的填数问题中的一次性摊销、首次通过中毒和搜索惰性

Aleksey Komissarov

机构 * Neapolis University, Pafos(帕福斯新帕福斯大学)

专题命中 规划推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究富含线索填数问题中神经推理器的表现,发现LDT存在首次通过中毒等问题,添加CoLT可减少无效推导,还给出两种干预措施提升准确率,指出类似LDT系统是一次性摊销预测器,搜索主要消除计算浪费。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15552 2026-07-20 cs.LG cs.AI 新提交 62%

From Feasibility to Desirability: Plan, Learn, Adapt (PLA) Framework for Personalized On-Device Itinerary Generation

从可行性到合意性:用于个性化设备端行程生成的计划、学习、适应(PLA)框架

Himel Dev, Tanmoy Sen, Madhusudan Basak, Bashima Islam

机构 * Tech LLC(529科技有限责任公司) University of Virginia(弗吉尼亚大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对个性化设备端行程生成问题,提出PLA框架,分计划、学习、适应三阶段,通过构建规划器集合、拟合奖励模型及进行局部优化来生成行程,实验表明该框架在可行性和胜率上表现出色,还提升了生产部署中的行程完成率并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14494 2026-07-17 cs.AI cs.IR cs.LG 新提交 62%

SAGA: Schema-Aware Grounding for Agentic Text-to-SPARQL Generation

SAGA:用于智能文本到SPARQL生成的模式感知基础

Yiming Zhang, Koji Tsuda

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究复杂知识库问答中语义解析范式,针对现有智能体类型盲基础问题,提出无训练框架SAGA,通过模式约束基础操作,维护类型状态,过滤候选属性,以紧凑格式呈现图模式,在多基准设置上取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14145 2026-07-17 cs.AI cs.CV cs.LG 新提交 62%

ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability

ToolAnchor:锚定反事实上下文以提升智能体工具使用能力

Weiting Liu, Jieyi Bi, Wanqi Zhou, Jianfeng Feng, Yining Ma, Ai Han, Wenlian Lu

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学) MIT(麻省理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对工具增强大语言模型智能体在工具集扩展时的问题,提出ToolAnchor框架,通过在关键决策点注入反事实锚定上下文打破行为惯性,经教师模型假设、学生展开验证及智能体后训练,提升其在扩展工具集下的性能,为智能体强化学习开辟新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10720 2026-07-14 cs.AI cs.LG cs.MA 新提交 62%

WattCouncil: Context-Aware Household Energy Scenario Generation With Governed LLMs

瓦特委员会:基于受治理大语言模型的情境感知家庭能源情景生成

Mohannad Takrouri, Nicolas M. Cuadrado A., Martin Takáč

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对智能电网因数据受限发展受阻的问题,提出瓦特委员会框架,利用基于大语言模型的代理,在文化、时间和物理等约束下生成家庭能源情景,经实验评估及消融研究验证了其有效性和一致性。

Comments 11 pages, 5 figures

Journal ref The 13th ACM International Conference on Systems for Energy-Efficient Buildings, Cities, and Transportation (BuildSys 26), June 22-25, 2026, Banff, AB, Canada. ACM, New York, NY, USA, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10588 2026-07-14 cs.AI cs.CL 新提交 62%

Constraint-Aware Hierarchical Search for Regulation-Driven Fine-Grained Classification

用于规则驱动的细粒度分类的约束感知层次搜索

Siyu Wang, Wei Tan, Lulu Chen

机构 * Gusu Laboratory of Materials(姑苏材料实验室) Chongqing Institute of Engineering(重庆工程学院) Suzhou Digital China Wuxin Intelligent Technology Co., Ltd.(苏州神州数码五新智能科技有限公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对规则驱动的细粒度分类任务,现有方法存在不足。本文构建基准数据集,提出约束感知层次搜索框架,将监管文件转换为可搜索树,只检索有效局部候选节点,实验证明该方法准确率高且能提供可解释决策路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10555 2026-07-14 cs.IR cs.AI cs.CL 新提交 62%

Tool-Adaptive LLM Reranker

工具自适应语言模型重排器

Zichuan Liu, Ruijin Hua

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对生成式大语言模型在复杂查询时的事实幻觉及重排延迟问题,提出TALRanker框架,将相关性评分形式化为马尔可夫决策过程,经两阶段训练优化,在检索基准上性能领先,兼顾吞吐量与准确性。

Comments 12 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09298 2026-07-13 cs.LG cs.AI 新提交 62%

Risk-Aware General-Utility Markov Decision Processes

风险感知通用效用马尔可夫决策过程

Pedro P. Santos, Fábio Vital, Alberto Sardinha, Francisco S. Melo

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究风险感知通用效用马尔可夫决策过程,聚焦熵风险度量,提出基于蒙特卡洛树搜索的方法,可解决该过程并达任意精度,实验表明此方法在多种任务的GUMDPs中优化风险感知行为时成功。

详情

展开后加载摘要…

URL PDF HTML 收藏