arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 531 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 531 篇

2605.15850 2026-08-12 cs.CY cs.AI cs.HC 版本更新 57%

Access Timing as Scaffolding: A Reinforcement Learning Approach to GenAI in Education

访问时机作为脚手架:一种强化学习方法在生成式AI教育中的应用

Janne Rotter, Pau Benazet i Montobbio, Davinia Hernández-Leo

机构 * Universitat Pompeu Fabra(庞培法华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究通过强化学习智能体控制生成式AI的访问时机,基于元认知理论、认知负荷理论和生产性失败设计奖励函数,实验证明策略性定时访问相比无限制和完全限制使用能提高学习效果和元认知准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11533 2026-08-12 cs.CL cs.CV 版本更新 57%

Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation

Checkup2Action:面向患者行动的多模态临床检查报告数据集

Sike Xiang, Shuang Chen, Kevin Qinghong Lin, Jialin Yu, Yijia Sun, Philip Torr, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学) University of Oxford(牛津大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文提出Checkup2Action数据集,用于生成结构化的行动卡,通过多模态检查报告生成患者导向的行动建议,评估行动的准确性、优先级和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05624 2026-08-12 cs.MA cs.LG 版本更新 57%

Behavioral Inference at Scale: The Fundamental Asymmetry Between Motivations and Belief Systems

大规模行为推断:动机与信念系统之间的根本不对称性

Jason Starace, Terence Soule

机构 * Department of Computer Science University of Idaho(计算机科学系 俄克拉荷马州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究通过大规模实验揭示动机与信念系统在行为推断中的根本不对称性,发现动机推断效率远超信念系统,且信念系统推断的瓶颈在于信息理论限制。

Comments Published in Transactions on Machine Learning Research (2026). OpenReview: https://openreview.net/forum?id=aDMDqtw63H

Journal ref Transactions on Machine Learning Research, ISSN 2835-8856 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09898 2026-08-11 cs.LG cs.MA q-bio.QM 版本更新 57%

TRAPS: Treatment-Assignment Prediction via Pathway-informed Stratification

TRAPS: 基于通路信息分层的治疗反应分析

Sujoy Banik, Sayantan Chakraborty, Boishakhi Das Toma, Zainab Ghafoor, Ushashi Bhattacharjee, Koushik Howlader, Tirtho Roy

机构 * Rajshahi University of Engineering \& Technology Bangladesh University of Dhaka Bangladesh American International University of Bangladesh Bangladesh Sonoma State University United States Iowa State University United States Rajshahi University of Engineering \& Technology University of Dhaka American International University of Bangladesh Sonoma State University Iowa State University

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 提出首个统一基准,评估三种通路引导的深度学习模型在联合预测癌症治疗反应和生存率上的表现,发现不同模型在不同任务上各有优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08251 2026-08-11 cs.CY cs.AI 版本更新 57%

Contemporary AI lacks the imagination to diverge or negate in science

当代人工智能缺乏在科学中发散或否定的想象力

Honglin Bao, Siyang Wu, Xiao Liu, Sida Li, Shiyun Cao, James A. Evans

机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) Knowledge Lab, University of Chicago(芝加哥大学知识实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过大规模科学家评估,发现当前AI在科学假设生成中缺乏多样性,无法自发提出零假设,且自动评估与专家判断一致性低,但微调奖励模型可缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15645 2026-08-11 cs.LG physics.comp-ph quant-ph 版本更新 57%

Hybrid Quantum-Classical PINNs for Scientific Computing: A Multi-GPU Open-Source Framework

PINNACLE:一种用于经典和量子PINN的开源计算框架

Ziv Chen, Hemanth Chandravamsi, Shimon Pisnoy, Aaron Goldgewert, Gal Shaviner, Boris Shragner, Steven H. Frankel

机构 * Faculty of Mechanical Engineering, Technion Israel Institute of Technology, Haifa, Israel(技术学院机械工程系,以色列技术学院,海法,以色列) Andrew and Erna Viterbi Faculty of Electrical & Computer Engineering, Technion Israel Institute of Technology, Haifa, Israel(安德鲁和伊尔纳·维特比电气与计算机工程学院,技术学院,海法,以色列) Helen Diller Quantum Center, Technion Israel Institute of Technology, Haifa, Israel(海伦·迪尔量子中心,技术学院,海法,以色列) Faculty of Electrical and Computer Engineering, Cornell University, Ithaca, NY, USA(电气与计算机工程学院,康奈尔大学,纽约州伊萨克,美国)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 PINNACLE框架整合了现代训练策略和混合量子经典架构,通过统一模块化工作流系统评估PINN在不同基准问题中的性能,支持多种增强方法并提供全面的基准研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04465 2026-08-11 cs.HC cs.AI cs.CR 版本更新 57%

Autonomy Reshapes How Personalization Affects Privacy Concerns and Trust in LLM Agents

自主性重塑个性化对隐私担忧和对LLM代理信任的影响

Zhiping Zhang, Yi Evie Zhang, Freda Shi, Tianshi Li

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了LLM代理自主性如何影响个性化对用户隐私担忧和信任的影响,发现风险驱动的自主性可缓解个性化带来的负面影响。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03159 2026-08-11 cs.DL cs.CL 版本更新 57%

BibTeX Citation Errors in Scientific Publishing Agents: Evaluation and Mitigation

科学出版代理中的BibTeX引用幻觉:评估与缓解

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文评估并缓解了科学出版代理中BibTeX引用的字段级错误,通过构建包含931篇论文的基准测试,发现模型依赖参数记忆,提出clibib工具提升准确性。

Comments 35 pages; COLM 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29139 2026-08-11 cs.AI cs.GR cs.HC 版本更新 57%

SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents

SciVisAgentBench:用于评估科学数据分析和可视化代理的基准测试

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Nathaniel Gorski, Jianxin Sun, Guoxi Liu, Helgi I. Ingolfsson, David Lenz, Hanqi Guo, Hongfeng Yu, Teja Leburu, Michael Molash, Bei Wang, Tom Peterka, Chaoli Wang, Shusen Liu

机构 * University of Notre Dame(圣母大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Utah(犹他大学) University of Nebraska–Lincoln(内布拉斯加大学林肯分校) The Ohio State University(俄亥俄州立大学) Argonne National Laboratory(阿贡国家实验室) Anthropic PBC

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出SciVisAgentBench,一个用于评估科学数据可视化代理的基准测试,涵盖四个维度,包含108个案例,结合LLM和确定性评估器进行多模态评估,揭示代理能力差距。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24084 2026-08-11 cs.AI 版本更新 57%

Bridging the Evaluation Gap: Standardized Benchmarks for Multi-Objective Search

弥合评估差距:多目标搜索的标准化基准

Hadar Peer, Carlos Hernandez, Sven Koenig, Ariel Felner, Oren Salzman

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出首个标准化多目标搜索基准,涵盖四个结构各异的领域,通过固定实例和标准查询确保评估的鲁棒性和全面性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22130 2026-08-11 cs.LG 版本更新 57%

Benchmarking In-context Experiential Learning Through Repeated Product Recommendations

通过重复产品推荐评估上下文经验学习

Gilbert Yang, Yaqin Chen, Thomson Yen, Hongseok Namkoong

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 本文提出BELA基准,通过重复产品推荐场景评估智能体在动态环境中的经验学习与主动探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08531 2026-08-10 cs.AI 版本更新 57%

ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents

VESTA: 一种全自动的LLM智能体场景生成与安全评估框架

Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng

机构 * BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Long-term AI(长期人工智能)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出VESTA框架,基于五个风险维度自动生成1072个可执行场景,评估12个LLM智能体在任务执行中的行为安全风险,平均攻击成功率达47.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06108 2026-08-10 cs.CG cs.LG 版本更新 57%

Using Reinforcement Learning to Optimize the Global and Local Crossing Number

使用强化学习优化全局和局部交叉数

Timo Brand, Henry Förster, Stephen Kobourov, Daniel Kohrt, Robin Schukrafft, Markus Wallinger, Johannes Zink

机构 * Technical University of Munich, Heilbronn, Germany(慕尼黑技术大学(海因斯贝格)) John Cabot University, Rome, Italy(约翰·卡博特大学) Technical University of Munich, Garching, Germany(慕尼黑技术大学(戈林根))

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 将图绘制视为单玩家优化游戏,利用强化学习通过移动顶点减少边交叉,提出一种优化全局或局部交叉数的策略,在局部交叉数最小化上具有竞争力。

Comments Appears in the Proceedings of the 34th International Symposium on Graph Drawing and Network Visualization (GD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12369 2026-08-07 cs.CL 版本更新 57%

Can Deep Research Agents Retrieve and Organize? Evaluating the Synthesis Gap with Expert Taxonomies

深度研究代理能否检索和组织?通过专家分类法评估合成差距

Ming Zhang, Jiabao Zhuang, Wenqing Jing, Kexin Tan, Ziyu Kong, Jingyi Deng, Yujiong Shen, Yuhui Wang, Zhenghao Xiang, Qiyuan Peng, Yuhang Zhao, Ning Luo, Renzhe Zheng, Jiahui Lin, Mingqi Wu, Long Ma, Shihan Dou, Maxm Pan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Hunyuan Team, Tencent(腾讯 Hunyuan 团队)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出TaxoBench基准,评估深度研究代理在检索和组织论文方面的能力,发现两者在能力与对齐方面均存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28881 2026-08-06 cs.AI 版本更新 57%

Fragility of Value under Imperfect Alignment

不完美对齐下价值的脆弱性

Winter Cross

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文针对AI系统与人类价值对齐问题,建立模型明确人类价值函数与代理条件准确度的相关条件,凸显过度优化风险,提出采用quantilizers等限制优化压力的AI设计方案。

Comments 24 pages, 7 figures Added acknowledgement of funding

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25186 2026-08-06 cs.CL 版本更新 57%

CardioBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios

MyoCardBench:用于评估临床真实心血管护理场景中大型语言模型的真实世界数据基准

Xiao Li, Mouxiao Bian, Zhaodi Wu, Sijie Ren, Juechen Chen, Lu Lu, Jingru Ding, Yun Zhong, Jie Xu, Yixiu Liang, Junbo Ge

机构 * Shanghai Institute of Cardiovascular Diseases(上海市心血管病研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Minhang Hospital, Fudan University(复旦大学附属闵行医院)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 该研究开发MyoCardBench真实世界基准评估大语言模型在心血管护理场景的性能,涵盖多任务数据集,经专家注释审核。7个模型在零样本设置下输出,GPT-5.4表现最佳。此基准为评估模型提供框架,助于发现优势与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11745 2026-08-06 cs.AI 版本更新 57%

Text2GraphQuery-Bench: A Text to Graph Query Benchmark

Text2GQL-Bench: 一个文本到图查询语言基准 [实验、分析与基准]

Songlin Lyu, Lujie Ban, Zihang Wu, Tianqi Luo, Jirong Liu, Ayoub Moussaid, Oskar van Rest, Heng Lin, Chenhao Ma, Nan Tang, Shipeng Qi, Yongchao Liu, Zhan Qiu, Juelu Zhang, Jiajun Zheng

机构 * Ant Group(蚂蚁集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xi'an Polytechnic University(西安理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 Text2GQL-Bench是一个统一的文本到图查询语言基准,通过多领域数据集和评估方法,揭示了ISO-GQL生成中的方言差距,并展示了通过充足示例提升模型性能的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28048 2026-08-05 cs.AI 版本更新 57%

SKILL-KD: Contrastive Skill Distillation for LLM Agents

SKILL-KD:面向大语言模型智能体的对比式技能蒸馏

Qiming Shi, Yibo Dou, Jiawen Zhu, Yulong Tao, Linbo Jin, Zhaolu Kang, Yunfan Zhou, Di Weng

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 SKILL-KD是面向LLM智能体的对比式技能蒸馏框架,通过将师生智能体的可操作差异蒸馏为技能补丁并迭代优化,结合感知漂移的技能整合,在五个智能体基准上提升了冻结学生智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23690 2026-08-05 cs.CV cs.CL 版本更新 57%

HomeSafeBench: Benchmarking Embodied Vision-Language Models in Free-Exploration Home Safety Inspection

HomeSafeBench:面向自由探索式家庭安全检查的具身视觉-语言模型基准

Jiashu Yao, Haoyu Wen, Siyuan Gao, Yuhang Guo, Zeming Liu, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究针对家庭安全隐患检查需求构建HomeSafeBench基准,提出CueBack数据构建方法,微调4B规模VLM使分布外测试集F1值显著提升,缩小了与人类检查员的性能差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28894 2026-08-04 cs.AI stat.ML 版本更新 57%

Identifying Informative Environments for Cognition Parameter Inference via Bayesian Experimental Design

基于贝叶斯实验设计识别认知参数推断的有效环境

Manisha Dubey, Rimvydas Rubavicius, N. Siddharth, Subramanian Ramamoorthy

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 该研究针对认知参数推断的环境选择问题,将认知规划实验建模为贝叶斯实验设计问题,提出摊销贝叶斯实验设计框架,经Mouselab-MDP实验验证其高效性,揭示了环境选择的权衡关系。

Comments 14 pages, 16 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11439 2026-08-04 cs.LG 版本更新 57%

Multi-Level Strategic Classification: Incentivizing Improvement through Promotion and Relegation Dynamics

多层级策略分类:通过晋升与降级动态激励改进

Ziyuan Huang, Lina Alkarmi, Mingyan Liu

机构 * Electrical and Computer Engineering Department, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学电气与计算机工程系,安阿伯,MI 48109,美国)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种多层级晋升-降级框架,通过设计分类器阈值和难度递进来激励代理人诚实努力,并证明在温和条件下代理人可通过真实改进达到任意高水平。

Comments 9 pages, 4 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23590 2026-08-04 cs.AI 版本更新 57%

Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents

Co-ReAct:作为ReAct智能体逐步协作者的评分准则

Jiazheng Kang, Bowen Zhang, Zixin Song, Jiangwang Chen, Xiao Yang, Da Zhu, Guanjun Jiang

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴文勤应用业务组) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Co-ReAct框架,通过训练专用评分准则生成器,在推理时逐步指导ReAct智能体的行动选择,显著提升搜索密集型多步推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14322 2026-08-04 cs.AI 版本更新 57%

TeachArena: Are Language Agents Ready for Realistic Teaching Work?

代理是否准备好教学?一个多阶段基准用于现实世界教学工作流程

Zixin Chen, Peng Liu, Rui Sheng, Haobo Li, Jianhong Tu, Xiaodong Deng, Kashun Shum, Dayiheng Liu, Huamin Qu

机构 * Hong Kong University of Science and Technology(香港科技大学) Qwen Team, Alibaba Group(阿里集团通义实验室)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出EduAgentBench基准,用于评估教学代理的全面能力,发现当前模型在教学任务中的表现有限,但仍为开发未来教学代理提供了测量基础。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27269 2026-08-04 cs.AI 版本更新 57%

Unifying biomedical knowledge in a modern multimodal graph

OptimusKG:统一生物医学知识的现代多模态图

Lucas Vittor, Ayush Noori, Iñaki Arango, Joaquín Polonuer, Sam Rodriques, Andrew White, David A. Clifton, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Edison Scientific Inc.(Edison科学公司) Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏格兰研究中心) Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) Harvard Data Science Initiative(哈佛大学数据科学计划)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 OptimusKG通过整合结构化和半结构化资源,构建了多模态生物医学标记属性图,统一了分子、解剖、临床和环境领域的知识,验证了其在生物医学领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20487 2026-08-04 cs.AI cs.GT cs.HC econ.GN q-fin.EC 版本更新 57%

Bounded Normative Equivalence in Human-AI Cooperation: Group Behaviour, Not Partner Labels, Predicts Cooperation under Anonymous Aggregate Feedback

人机协作中的规范等价性:行为,而非身份,驱动混合代理群体中的合作

Nico Mutzner, Taha Yasseri, Heiko Rauhut

机构 * Department of Sociology, University of Zurich(苏黎世大学社会学系) Centre for Sociology of Humans and Machines (SOHAM), Trinity College Dublin & Technological University Dublin(人类与机器社会学中心(SOHAM))

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究发现,混合人机群体中的合作依赖于群体行为而非身份,规范机制在不同条件下表现一致,支持规范等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23332 2026-08-03 cs.LG 版本更新 57%

AllocBench: Measuring Online Tool Allocation Capability in LLM Agents

AlloBench:测量大语言模型智能体中的在线工具分配能力

Daniel Wang, Andrew Xu

机构 * Sea12 Technologies(Sea12科技公司) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究测试大语言模型智能体在固定预算下的在线工具分配能力,通过配对基准测试发现前沿模型在抽象框架中表现近乎最优,但在脚本编写中失败,确定了各模型失败模式,还表明开源Qwen模型在抽象分配上有推广,在线工具分配是重要能力边界。

Comments 24 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29495 2026-08-03 cs.AI 版本更新 57%

Cognitive World Model for Progressive BDI/E Trajectory Evaluation of Conversational Agents

用于过程级社会影响力评估的认知世界模型

Minghui Ma, Bin Guo, Hao Wang, Han Wang, Mengqi Chen, Jingqi Liu, Yan Liu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出认知世界模型(CogWM),通过联合预测BDI/E认知状态和用户话语,实现从终端判断到过程跟踪的社会影响力对话评估,在四个场景中达到77.6%情感准确率。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04521 2026-08-03 math.OC cs.LG q-fin.CP 版本更新 57%

Unified continuous-time q-learning for mean-field game and mean-field control problems

面向平均场博弈与平均场控制问题的统一连续时间Q学习方法

Xiaoli Wei, Xiang Yu, Fengyi Yuan

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文针对环境模拟器无法直接获取群体分布的场景,提出解耦Iq函数,设计统一参数化Q学习算法,验证其在MFG与MFC学习任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14953 2026-07-31 cs.LG 版本更新 57%

Efficient Online Conformal Selection with Limited Feedback

高效有限反馈下的在线符合选择

Sreenivas Gollapudi, Kostas Kollias, Kamesh Munagala, Ali Sinop

机构 * Google Research(谷歌研究) Department of Computer Science, Duke University(杜克大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种在有限反馈下高效实现在线符合选择的方法,通过适应性符合推断更新规则,在保证目标概率下实现亚线性效率 regret,适用于带隙和半带隙反馈场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04697 2026-07-31 math.OC cs.LG q-fin.CP 版本更新 57%

Continuous-time reinforcement learning for optimal switching over multiple regimes

连续时间强化学习用于多 regime 最优化切换

Yijie Huang, Mengge Li, Xiang Yu, Zhou Zhou

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学) School of Mathematics and Statistics, University of Sydney(数学与统计学学院,悉尼大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于连续时间强化学习的多 regime 最优化切换方法,通过熵正则化和马尔可夫链生成矩阵实现策略优化,并利用神经网络验证了算法有效性。

Comments Keywords: Optimal regime switching, continuous-time reinforcement learning, system of HJB equations, policy improvement, policy iteration convergence, financial applications

详情

展开后加载摘要…

URL PDF HTML 收藏