arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-19 至 2026-05-19 共收录 402 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 120 篇

2603.12145 2026-05-19 cs.LG cs.AI cs.SE 67%

Automatic Generation of High-Performance RL Environments

自动生成高性能强化学习环境

Seth Karten, Rahul Dev Appapogu, Chi Jin

机构 * Princeton University(普林斯顿大学) Independent Researcher(独立研究者)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本文提出了一种闭环方法,通过最小的计算成本生成等效的高性能强化学习环境,展示了三种不同的工作流程,并在五个环境中验证了无仿真到仿真的差距,同时展示了新的环境创建方法。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16780 2026-05-19 math.OC 67%

A Diagnostic Framework for Implementation Risk in Bilevel Decision Problems: The Ambiguity Premium and the Robustness--Efficiency Frontier

双层决策问题实施风险的诊断框架:模糊溢价与稳健性-效率前沿

Jiguang Yu

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 本文提出了一种量化双层决策问题实施风险的诊断框架,通过计算乐观和悲观的上层价值差值作为模糊溢价,并建立了直径界和二次下层增长下的估计,展示了稳健性-效率前沿在识别名义上吸引但对近优追随者响应敏感的政策方面的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15960 2026-05-19 cs.AI cs.LG 62%

Imperfect World Models are Exploitable

不完美的世界模型是可利用的

Logan Mondal Bhamidipaty, Esmeralda S. Whitammer, David Abel, Mykel J. Kochenderfer, Subramanian Ramamoorthy

机构 * University of Edinburgh(爱丁堡大学) Stanford University(斯坦福大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种新的强化学习中模型利用的定义,指出世界模型如果暗示某种策略应严格优于另一种策略,而真实环境转移模型却暗示相反,那么该模型就是可利用的。研究通过发展奖励黑客和模型利用的一般理论,证明在大规模策略集上利用本质上是不可避免的,并揭示了安全规划在世界模型中的局限性。

Comments 17 pages, 3 figures, 2 tables; modified (fixed metadata)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13870 2026-05-19 cs.CL cs.AI 62%

Unlocking the Potential of Diffusion Language Models through Template Infilling

通过模板填充解锁扩散语言模型的潜力

Junhoo Lee, Seungyeon Kim, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种针对扩散语言模型的模板填充方法,通过在生成响应空间中建立全局蓝图,提升了数学推理、代码生成和旅行规划等任务的性能,同时在多token生成中实现了生成质量与速度的平衡。

Comments ACL 2026 Main Conference - Long Paper, Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17295 2026-05-19 cs.LG cs.CL 62%

DISA: Offline Importance Sampling for Distribution-Matching LLM-RL

DISA: 分布匹配强化学习中的离线重要性采样

Shaobo Wang, Yujie Chen, Yafeng Sun, Wenjie Qiu, Zhihui Xie, Sihang Li, Yucheng Li, Huiqiang Jiang, Xingzhang Ren, Xuming Hu, Dayiheng Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Qwen Team, Alibaba Group(阿里集团Qwen团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) The University of Hong Kong(香港大学)

专题命中 规划决策 :tool-use(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出DISA方法,通过离线重要性采样解决分布匹配强化学习中的校准问题,分离了分区函数估计与策略学习,提高了策略多样性并在多个基准测试中表现出色。

Comments 21 pages, 7 figures, 7 tables. Abstract shortened to respect the arXiv limit of 1920 characters. Please see the PDF for the full abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17284 2026-05-19 cs.CV cs.AI cs.LG cs.RO 62%

CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving

CLAP:用于端到端自动驾驶的对比潜在空间提示优化

Ruiyang Zhu, Yuehan He, Boyuan Zheng, Zesen Zhao, Ahmad Chalhoub, Qingzhao Zhang, Z. Morley Mao

机构 * University of Michigan(密歇根大学) University of Arizona(亚利桑那大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CLAP方法,通过对比潜在空间提示优化解决自动驾驶中罕见但安全关键的长尾场景问题,利用V2X通信获取数据并优化提示,从而提升规划性能。

Comments 9 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06638 2026-05-19 cs.AI cs.CL 62%

Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key

强化学习能否教会大语言模型长期 horizon 推理?表达性是关键

Tianle Wang, Zhaoyang Wang, Guangchen Lan, Xinpeng Wei, Sipeng Zhang, Guanwen Qiu, Abulhair Saparov

机构 * Purdue University(普渡大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Tech(佐治亚理工学院) UC San Diego(加州大学圣地亚哥分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文通过ScaleLogic框架研究了RL训练与任务难度的关系,发现推理深度和逻辑表达性影响训练计算量,表达性越高,训练效率越高,证明LLM的长期推理问题可通过改进训练方法解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02832 2026-05-19 cs.AI cs.HC cs.SE 62%

HAAS: A Policy-Aware Framework for Adaptive Task Allocation Between Humans and Artificial Intelligence Systems

HAAS:一种面向人类与人工智能系统之间适应性任务分配的政策感知框架

Vicente Pelechano, Antoni Mestre, Manoli Albert, Miriam Gil

机构 * organization= Valencian Research Institute for Artificial Intelligence (VRAIN), Universitat Polit\`ecnica de Val\`encia , addressline= Camino de Vera s/n , city= Valencia , country= Spain

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出HAAS框架,通过规则专家系统和情境带教师算法实现人类与AI任务分配的动态调整,揭示治理并非二元开关,而是可调节设计变量,且适度治理在积累经验后更具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22801 2026-05-19 cs.RO cs.AI cs.LG 62%

Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving

释放扩散模型在端到端自动驾驶中的潜力

Yinan Zheng, Tianyi Tan, Bin Huang, Enguang Liu, Ruiming Liang, Jianlin Zhang, Jianwei Cui, Guang Chen, Kun Ma, Hangjun Ye, Long Chen, Ya-Qin Zhang, Xianyuan Zhan, Jingjing Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过大规模实车数据和道路测试,系统研究了扩散模型在端到端自动驾驶中的规划能力,提出Hyper Diffusion Planner框架,实现10倍性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16442 2026-05-19 cs.RO cs.AI cs.LG 62%

Hierarchical Two-Stage Framework for Environment-Aware Long-Horizon Vessel Trajectory Prediction

面向环境的长航程船舶轨迹预测分层两阶段框架

Ganeshaaraj Gnanavel, Tharindu Fernando, Sridha Sridharan, Clinton Fookes

机构 * SAIVT Research Group, Queensland University of Technology(SAIVT研究组,昆士兰理工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出分层两阶段框架,结合长短期预测器与网格感知短期预测器,通过分层融合机制提升船舶轨迹预测精度,实验显示在ADE和FDE上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16441 2026-05-19 cs.LG cs.AI 62%

DeepArrhythmia: Segment-Contextualized ECG Arrhythmia Classification via Selective Evidence Acquisition

DeepArrhythmia: 基于选择性证据获取的段落上下文化ECG心律失常分类

Jiahui Li, Ruili Fang, Zishuai Liu, WenZhan Song, Jin Lu, Fei Dou

机构 * University of Georgia(佐治亚大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 DeepArrhythmia通过选择性证据获取实现段落上下文化ECG心律失常分类,结合原始ECG信号和渲染波形图像,利用专门工具分离生理测量与证据整合,提升多beat节奏上下文下的心律失常检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16429 2026-05-19 cs.LG cs.AI 62%

QuantFPFlow: Quantum Amplitude Estimation for Fokker--Planck Policy Optimisation in Continuous Reinforcement Learning

QuantFPFlow:用于连续强化学习中Fokker-Planck策略优化的量子振幅估计

Abraham Itzhak Weinberg

机构 * AI-WEINBERG, AI Experts(AI-WEINBERG人工智能专家)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 QuantFPFlow通过量子振幅估计提升连续强化学习中Fokker-Planck策略优化的效率,实现算法复杂度从O(1/ε²)到O(1/ε)的平方加速,并在多模态奖励景观中发现全局最优解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16303 2026-05-19 cs.CY cs.AI cs.CL 62%

From Demographics to Survey Anchors: Evaluating LLM Agents for Modeling Retirement Attitudes

从人口统计学到调查锚点:评估LLM代理在建模退休态度中的表现

Rubén Garzón, Pauline Baron, Vincent Grari, Jonne Kamphorst, Michael Bernstein, Marcin Detyniecki

机构 * AI Research(AI研究) AXA Group Operations(AXA集团运营) CDSP & CEE(CDSP与CEE) Sciences Po(社会科学高等学院) Computer Science Department(计算机科学系) Stanford University(斯坦福大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文比较了基于人口统计学的LLM代理与基于调查数据的代理在预测退休态度调查中的准确性,发现仅依赖人口统计学的代理存在偏差且不够准确,而基于调查锚点的代理能更好地捕捉复杂的人类响应模式。

Comments 50 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18529 2026-05-19 cs.AI 57%

AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment

AMR-SD:不对称元反射自蒸馏用于标记级信用分配

Zhenlin Wei, Pu Jian, Yingzhuo Deng, Xiaohan Wang, Jiajun Chai, Zhexin Hu, Wei Lin, Shanbin Zhang, Guojun Yin

机构 * Meituan Beijing, China(美团北京,中国) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划决策 :tool-use(abstract);分类 cs.AI

AI总结 本文提出AMR-SD,一种不对称元反射自蒸馏方法,旨在解决大型语言模型在复杂推理中因统一序列奖励导致的信用分配瓶颈问题,通过引入反思瓶颈和因果信息增益机制,实现更精确的标记级优势调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18373 2026-05-19 cs.RO cs.LG math.DS math.OC 57%

Dynamic robotic cloth folding with efficient Koopman operator-based model predictive control

动态机器人布料折叠与高效的Koopman算子基于模型预测控制

Edoardo Caldarelli, Franco Coltraro, Adrià Colomé, Lorenzo Rosasco, Carme Torras

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) Institut de Robòtica i Informàtica Industrial(机器人与信息技术研究所) MaLGa Center, DIBRIS, Università degli Studi di Genova(MaLGa中心,DIBRIS,热那亚大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出了一种基于Koopman算子的模型预测控制方法,用于快速生成布料折叠轨迹,结合物理仿真和高效的核基Koopman算子回归,以提高折叠任务的效率和精度。

Comments Accepted for presentation at the 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06866 2026-05-19 cs.LG 57%

T-STAR: A Context-Aware Transformer Framework for Short-Term Probabilistic Demand Forecasting in Dock-Based Shared Micro-Mobility

T-STAR: 一种基于上下文的Transformer框架用于基于码头的共享微出行短期概率需求预测

Jingyi Cheng, Gonçalo Homem de Almeida Correia, Oded Cats, Shadi Sharif Azadeh

机构 * Transport and Planning, Delft University of Technology(代尔夫特理工大学交通与规划)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出T-STAR框架,通过两级结构分离一致需求模式和短期波动,提升短期概率需求预测的准确性,实验表明其在确定性和概率性准确性上均优于现有方法,且具备良好的时空鲁棒性。

Comments This work has been submitted to Transportation Research Part C

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13181 2026-05-19 cs.CL 57%

AdaSwitch: Adaptive Switching between Small and Large Agents for Effective Cloud-Local Collaborative Learning

AdaSwitch: 一种在小型和大型代理之间自适应切换以实现有效的云-本地协作学习方法

Hao Sun, Jiayi Wu, Hengyi Cai, Xiaochi Wei, Yue Feng, Bo Wang, Shuaiqiang Wang, Yan Zhang, Dawei Yin

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(一般人工智能国家重点实验室,北京大学,北京,中国) School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) East China Normal University(东华大学) Chinese Academy of Sciences(中国科学院) Baidu Inc(百度公司) Beijing Institute of Technology(北京理工大学) University of Birmingham(伯明翰大学)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 本文提出了一种新的LLM使用范式,通过自适应机制在云端和本地部署的LLM之间切换,以提高任务完成性能和效率,通过本地代理处理简单推理步骤,云代理处理复杂推理步骤,实验表明该方法在多个基准测试中有效提升了本地代理的性能。

Comments EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18109 2026-05-19 cs.AI cs.CV cs.RO 57%

TaskGround: Structured Executable Task Inference for Full-Scene Household Reasoning

TaskGround:全场景家庭推理的结构化可执行任务推断

ZhiYuan Feng, Yu Deng, Ruichuan An, Zhenhua Liu, Qixiu Li, Keming Wu, Zhiying Du, Weijie Wang, Haoxiao Wang, Shuang Chen, Sicheng Xu, Yaobo Liang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出TaskGround框架,通过结构化任务推断提升全场景家庭推理能力,其核心贡献是引入FullHome评估套件,验证了在家庭场景中执行任务结构推断的重要性,并展示了紧凑本地模型在实际家庭部署中的有效性。

Comments Project page: https://aaronfengzy.github.io/TaskGround/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18101 2026-05-19 cs.CV cs.AI 57%

SENSE: Satellite-based ENergy Synthesis for Sustainable Environment

SENSE: 基于卫星的能源合成以实现可持续环境

Kailai Sun, Mingyi He, Heye Huang, Can Rong, Alok Prakash, Baoshen Guo, Shenhao Wang, Jinhua Zhao

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Florida(佛罗里达大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出SENSE,一种统一的生成性城市建筑能耗框架,通过结合生成扩散模型和大规模视觉模型知识,生成高分辨率的城市卫星图像和对齐的高质量建筑能耗和高度地图,以提高城市可持续发展预测性能。

Comments Accpted by KDD 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11223 2026-05-19 cs.AI 57%

Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?

视觉-语言模型在点击式谜题游戏中是否展现出人类般的逻辑问题解决能力?

Maximilian Triebel, Marco Menner, Dominik Helfenstein

机构 * Institute of Artificial Intelligence, University of Stuttgart, Stuttgart, Germany(斯图加特大学人工智能研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出VLATIM基准测试,用于评估在经典物理谜题游戏The Incredible Machine 2中人类般的逻辑问题解决能力,发现尽管大模型在规划方面表现优异,但精确的视觉定位仍存在问题,尚未达到人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19300 2026-05-19 cs.LG 57%

Queue Length Regret Bounds for Contextual Queueing Bandits

上下文队列强化学习中的队列遗憾界

Seoungbin Bae, Garyeong Kang, Dabeen Lee

机构 * Department of Industrial & Systems Engineering, KAIST(韩国科学技术院工业与系统工程系) Department of Mathematical Sciences, Seoul National University(首尔国立大学数学科学系) Research Institute of Mathematics, Seoul National University(首尔国立大学数学研究所) Korea Institute for Advanced Study(韩国高级研究院) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种新的上下文感知调度框架,即上下文队列强化学习,用于在同时学习未知服务速率的过程中进行调度。通过考虑异质的上下文特征,智能体选择任务并将其匹配到服务器以最大化离开速率。服务/离开速率由具有未知服务器特定参数的逻辑模型决定。为了评估策略的性能,我们考虑队列长度遗憾,定义为策略与最优策略之间队列长度的差异。主要挑战在于,在给定时间步长下,队列中剩余任务特征列表可能因策略与最优策略的不同而不同,因为它们可能以不同的顺序处理任务。为此,我们提出了带有复杂耦合论证的策略切换队列的概念。这导致了一种新的队列长度遗憾分解框架,使我们能够理解选择次优任务-服务器对的短期影响及其对队列状态差异的长期影响。我们证明了我们的算法CQB-ε达到了O(T^{-1/4})的遗憾上界。我们还考虑了对抗性选择的上下文设置,其中我们的第二个算法CQB-Opt达到了O(log²T)的遗憾上界。最后,我们提供了实验结果以验证我们的理论发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16397 2026-05-19 cs.DB cs.LG 57%

Compass: SLO-aware Query Planner for Compound AI Serving at Scale

Compass: 一种面向大规模复合AI服务的SLO感知查询计划器

Banruo Liu, Wei-Yu Lin, Minghao Fang, Yihan Jiang, Fan Lai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出Compass,一种首个面向大规模复合AI工作负载的SLO感知查询计划器,通过分解多查询、多SLO规划问题为可处理的子问题,利用查询间和查询内的计划相似性减少搜索步骤,并通过计划分析器提高每步效率,从而在资源竞争下最大化SLO良好吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16961 2026-05-19 cs.CV cs.AI 57%

Latent Action Control for Reasoning-Guided Unified Image Generation

潜在动作控制用于推理引导的统一图像生成

Fuxiang Zhai, Sixiang Chen, Yingjin Li, Shuaibo Li, Jianyu Lai, Tengjun Huang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出Latent Action Control (LAC),通过将推理表示为隐藏的连续动作,使推理过程可操作,从而在统一生成器中实现推理引导的图像生成。LAC通过角色结构化的潜在轨迹进行规划、内部视觉草图、诊断和细化,并将这些动作注入到条件流生成的隐藏流中,从而提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16874 2026-05-19 cs.AI 57%

Reasoning Can Be Restored by Correcting a Few Decision Tokens

通过纠正少量决策标记来恢复推理能力

Changshuo Shen, Leheng Sheng, Yuxin Chen, An Zhang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文研究了基础模型在生成过程中推理优势的稀疏性,提出了一种基于分歧指导的标记干预方法,在少量干预下显著恢复甚至超越了同规模推理模型的性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16857 2026-05-19 cs.AI 57%

Learning to Learn from Multimodal Experience

从多模态经验中学习学习

Xingyu Sui, Weixiang Zhao, Yongxin Tang, Yanyan Zhao, Yang Wu, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种新的学习范式,即从多模态经验中学习,通过动态构建和利用记忆来提升智能体的性能和泛化能力,解决了传统固定记忆设计在多模态环境中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16727 2026-05-19 cs.AI 57%

PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play

PopuLoRA: 为推理自博弈的协同进化LLM种群

Roger Creus Castanyer, Geoffrey Bradway, Lorenz Wolf, Maxwill Lin, Augustine N. Mavor-Parker, Matthew James Sargent

机构 * Absolute Zero Reasoner(绝对零理由器) LoRA adapters(LoRA适配器)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出PopuLoRA,一种基于种群的非对称自博弈框架,用于强化学习中可验证奖励(RLVR)的后训练LLM。通过专门的LoRA适配器在共享冻结基座上进行教师和学生分工,教师提出问题,学生在程序验证器下解决,不同亚种群间的交叉评估取代了限制单智能体自博弈的自我校准。LoRA权重空间进化算子家族作为7B规模种群训练循环的替代步骤,实现了种群的协同进化竞赛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07098 2026-05-19 cs.LG physics.comp-ph 57%

CarCrashNet: A Large-Scale Dataset and Hierarchical Neural Solver for Data-Driven Structural Crash Simulation

CarCrashNet:一个大规模数据集和分层神经求解器用于数据驱动的结构碰撞仿真

Mohamed Elrefaie, Dule Shu, Matthew Klenk, Faez Ahmed

机构 * MIT(麻省理工学院) Toyota Research Institute(丰田研究院) Future Product Innovation(未来产品创新)

专题命中 规划决策 :workflow(abstract);分类 cs.LG

AI总结 本文提出CarCrashNet数据集和分层神经求解器,用于数据驱动的结构碰撞仿真,包含14000多个碰撞模拟和825辆整车碰撞模拟,通过开源求解器验证并评估了基于机器学习的求解器性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23638 2026-05-19 cs.AI 57%

Can LLM Agents Be CFOs? Benchmarking Long-Horizon Resource Allocation in an Uncertain Enterprise Environment

LLM代理能成为CFO吗?在不确定的企业环境中评估长期资源分配

Yi Han, Yan Wang, Lingfei Qian, Haohang Li, Yupeng Cao, Yueru He, Xueqing Peng, Nanhan Shen, Yitao Xu, Yankai Chen, Dongji Feng, Jimin Huang, Xue Liu, Jian-Yun Nie, Sophia Ananiadou

机构 * Georgia Institute of Technology(佐治亚理工学院) The Fin AI Stevens Institute of Technology(史蒂文斯理工学院) Columbia University(哥伦比亚大学) George Mason University(乔治·马歇尔大学) McGill University(麦吉尔大学) Mohamed bin Zayed University of Artificial Intelligence(莫扎大学人工智能学院) California State University, Monterey Bay(加州州立大学蒙特雷湾分校) University of Manchester(曼彻斯特大学) Mila – Quebec Artificial Intelligence Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文通过EnterpriseArena模拟器评估LLM在不确定环境下的长期资源分配能力,发现现有模型在复杂任务中表现不足,仅15.4%的试验能持续完整周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16438 2026-05-19 cs.IR cs.AI 57%

OPERA: A Reinforcement Learning--Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop Retrieval

OPERA: 一种增强强化学习的协调规划-执行架构用于面向推理的多跳检索

Yu Liu, Yanbing Liu, Fangfang Yuan, Cong Cao, Youbang Sun, Kun Peng, Weizhuo Chen, Jianjun Li, Zhiyuan Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 OPERA通过协调规划-执行架构解决多跳检索中推理规划、检索和过滤的不足,采用MAPGRPO方法提升复杂任务性能。

Comments Accepted by AAAI 2026. Extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16547 2026-05-19 cs.LG 57%

World Model-Enabled Causal Digital Twins for Semantic Communications in Physical AI Systems

面向物理人工智能系统的语义通信世界模型增强因果数字孪生

Lingyi Wang, Tingyu Shui, Walid Saad, Pascal Adjakple

机构 * Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学电子与计算机工程系 Bradley 部门) Research and Innovation Labs, InterDigital Communications Inc.(InterDigital Communications Inc. 研究与创新实验室)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出基于世界模型的因果数字孪生框架,解决物理人工智能系统中语义通信的长期回报最大化问题,通过因果信息价值指标和策略训练提升导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏