arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2976 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 909 篇

2512.08029 2026-07-07 cs.LG cs.CV 版本更新 57%

CLARITY: Medical World Model for Guiding Treatment Decisions by Modeling Context-Aware Disease Trajectories in Latent Space

CLARITY:用于通过在潜在空间中建模情境感知疾病轨迹来指导治疗决策的医学世界模型

Tianxingjian Ding, Yuanhao Zou, Chen Chen, Mubarak Shah, Yu Tian

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 CLARITY通过在潜在空间中建模时间间隔和患者特定数据,预测疾病演变轨迹,生成个性化治疗方案,并在医学领域实现最先进的治疗规划性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22730 2026-07-07 cs.CL cs.CY 版本更新 57%

How Utilitarian Are OpenAI's Models Really? Replicating and Reinterpreting Pfeffer, Krügel, and Uhl (2025)

OpenAI模型真的那么功利主义吗?复制并重新解读Pfeffer、Krügel和Uhl(2025)

Johannes Himmelreich

机构 * OpenAI

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 研究通过复制和扩展实验,发现OpenAI模型在不同提示下表现出功利主义倾向,但存在提示偏差影响结果,强调需多提示测试以验证LLM道德推理的可靠性。

Comments 20 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14750 2026-07-07 cs.CY cs.LG 版本更新 57%

Engineering Carbon Credits Towards A Responsible FinTech Era: The Practices, Implications, and Future

迈向负责任金融科技时代的工程碳信用:实践、影响与未来

Qingwen Zeng, Hanlin Xu, Nanjun Xu, Zhenghao Zhao, Joakim Westerholm, Flora Salim, Junbin Gao, Huaming Chen

机构 * School of Electrical and Computer Engineering(电气与计算机工程学院) The University of Sydney(悉尼大学) Adelaide Business School(阿德莱德商学院) The University of Adelaide(阿德莱德大学) School of Computer Science and Engineering(计算机科学与工程学院) University of New South Wales Sydney(新南威尔士大学悉尼分校) The University of Sydney Business School(悉尼大学商学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 探讨通过工程实践和金融科技解决方案加强碳排放管理,回顾碳排放不披露负面影响,分析碳价影响因素与预测算法,研究企业碳排放预测模型,提出整合碳价与排放预测的研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19277 2026-07-07 cs.LG 版本更新 57%

Closing Gaps in Emissions Monitoring with Climate TRACE

利用气候追踪填补排放监测的差距

Brittany V. Lancellotti, Jordan M. Malof, Aaron Davitt, Gavin McCormick, Shelby Anderson, Pol Carbó-Mestre, Gary Collins, Verity Crane, Zoheyr Doctor, George Ebri, Kevin Foster, Trey M. Gowdy, Michael Guzzardi, John Heal, Heather Hunter, David Kroodsma, Khandekar Mahammad Galib, Paul J. Markakis, Gavin McDonald, Daniel P. Moore, Eric D. Nguyen, Sabina Parvu, Michael Pekala, Christine D. Piatko, Amy Piscopo, Mark Powell, Krsna Raniga, Elizabeth P. Reilly, Michael Robinette, Ishan Saraswat, Patrick Sicurello, Isabella Söldner-Rembold, Raymond Song, Charlotte Underwood, Kyle Bradbury

机构 * Nicholas Institute for Energy Environment & Sustainability(能源环境与可持续性研究所) Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) WattTime(WattTime公司) Johns Hopkins Applied Physics Laboratory(约翰霍普金斯应用物理实验室) Marine Science Institute(海洋科学研究所) TransitionZero(TransitionZero公司) Duke University(杜克大学) Global Fishing Watch(全球渔业监测) CTrees(CTrees公司)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 通过评估现有排放数据集,发现可提升排放数据实用性的机会,基于此提出气候追踪框架及数据集,综合现有数据并填补空白,为排放监测和缓解规划提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07447 2026-07-07 cs.PF cs.AI 版本更新 57%

Saving GPU Hours in LLM Inference System Development and Online Workloads with Simulation and DBMS-Inspired Cache Replacement Policies

通过模拟和受数据库管理系统启发的缓存替换策略在大语言模型推理系统开发和在线工作负载中节省GPU时间

Kyoungmin Kim, Jiacheng Li, Kijae Hong, Qunyou Liu, Darong Huang, Anastasia Ailamaki

机构 * EPFL, Switzerland(苏黎世联邦理工学院) NUS, Singapore(新加坡国立大学) POSTECH, South Korea(POSTECH大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 研究大语言模型推理系统,通过模拟和受数据库管理系统启发的缓存替换策略,节省GPU时间,提出新缓存替换策略并证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00412 2026-07-03 cs.AI cs.RO 版本更新 57%

Physically Native World Models: A Hamiltonian Perspective on Generative World Modeling

物理原生世界模型:生成式世界建模的哈密顿视角

Sen Cui, Jingheng Ma

机构 * Tsinghua University(清华大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出哈密顿世界模型,通过结构化潜相空间和哈密顿动力学演化实现物理可靠、动作可控且长期稳定的未来预测,用于具身决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05999 2026-07-03 cs.LG 版本更新 57%

On the Role of Computation in Reinforcement Learning

论计算在强化学习中的作用

Raj Ghugare, Michał Bortkiewicz, Alicja Ziarko, Benjamin Eysenbach

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文形式化计算受限策略,证明使用更多计算的策略能解决更复杂问题并泛化到更长视野任务,提出可变计算量架构,实验表明仅通过增加计算量即可提升性能。

Comments ICML 2026, Website: https://rajghugare19.github.io/computation-rl/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06323 2026-07-03 eess.SP cs.LG cs.SY eess.SY 版本更新 57%

Composite Reward Design in PPO-Driven Adaptive Filtering

基于PPO的自适应滤波器复合奖励设计

Abdullah Burkan Bereketoglu

机构 * Middle East Technical University (METU)(中东技术大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出基于PPO的自适应滤波框架,通过复合奖励平衡信噪比提升、均方误差降低和残差平滑度,实验显示其在动态非稳态环境中优于传统滤波器。

Comments 8 pages, 4 figures, 2 table, 26th International Conference on Computational Science - Workshops (MLDADS-26) ,Keywords: Reinforcement learning, Adaptive filtering, Noise reduction, PPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16993 2026-07-02 cs.AI cs.CV cs.RO 版本更新 57%

Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification

规则导向的视觉语言导航:通过语义推理和几何校正弥合感知与合规性

Jiawen Wen, Penglei Sun, Wenjie Zhang, Suixuan Qiu, Weisheng Xu, Xiaofei Yang, Xiaowen Chu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Beijing Normal University(北京师范大学) Guangzhou University(广州大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出Rule-VLN,首个大规模城市规则合规导航基准,通过语义推理和几何校正模块提升导航安全性,实验表明该模块显著提升导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03082 2026-07-02 cs.LG cs.SY eess.SY math.OC 版本更新 57%

Geometry-Preserving Neural Architectures on Manifolds with Boundary

保持几何结构的边界流形神经架构

Karthik Elamvazhuthi, Shiba Biswal, Kian Rosenblum, Arushi Katyal, Tianli Qu, Grady Ma, Rishi Sonthalia

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) Boston College(波士顿学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出统一框架分类几何保持神经架构,针对prox-regular约束集(含边界光滑流形)证明投影神经ODE、中间增强和最终增强架构的逼近定理,实验表明最终增强架构更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03741 2026-07-01 cs.AI 版本更新 57%

When to Re-Plan: Subgoal Persistence in Hierarchical Latent Reasoning

何时重新规划:分层潜在推理中的子目标持久性

Ayushi Chadha

机构 * Independent Researcher(独立研究者)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究分层潜在推理中稳定性与适应性的权衡,通过封建式管理-工人接口控制子目标持久周期,发现中等周期(3-6步)最优,内在对齐权重存在窄最优值(约0.05)。

Comments Accepted at the Workshop on Compositional Learning: Safety, Interpretability, and Agents (CompLearn), ICML 2026. 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09204 2026-07-01 cs.RO cs.LG 版本更新 57%

Flow-Opt: Scalable Centralized Multi-Robot Trajectory Optimization with Flow Matching and Differentiable Optimization

Flow-Opt: 用于多机器人轨迹优化的可扩展集中式方法,结合流匹配与可微优化

Simon Idoko, Prajyot Jadhav, Arun Kumar Singh

机构 * University of Tartu(塔尔图大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出Flow-Opt,通过生成模型与可微优化提升集中式多机器人轨迹优化的计算效率,实现快速生成数十机器人在复杂环境中的平滑轨迹,并支持批量处理与多样化路径生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01070 2026-07-01 cs.CL 版本更新 57%

What If We Allocate Test-Time Compute Adaptively?

如果我们在测试时动态分配计算资源呢?

Ahsan Bilal, Ahmed Mohsin, Muhammad Umer, Ali Subhan, Hassan Rizwan, Ayesha Mohsin, Dean Hougen

机构 * Stanford University(斯坦福大学) University of Oklahoma(俄克拉荷马大学) University of California Riverside(加州大学河滨分校) National University of Sciences and Technology(国立科技大学)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 本文提出了一种基于验证器的自适应框架,通过迭代轨迹生成与选择提升推理效率,在多个数据集上优于传统测试时缩放方法。

Comments International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04138 2026-07-01 cs.RO cs.AI 版本更新 57%

Learning Dexterous Grasping from Sparse Taxonomy Guidance

从稀疏分类学指导中学习灵巧抓取

Juhan Park, Taerim Yoon, Seungmin Kim, Joong-Gil Kim, Wontae Ye, Jeongeun Park, Yoonbyung Chai, Geonwoo Cho, Geunwoo Cho, Dohyeong Kim, Kyungjae Lee, Yong-Jae Kim, Sungjoon Choi

机构 * Korea University(高丽大学) Korea University of Technology and Education(韩国技术教育大学) Naver AI Lab(Naver AI 实验室) Seoul National University(首尔大学) WIRobotics RLWRLD

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 GRIT框架通过稀疏分类学指导学习灵巧抓取,提升对新物体的泛化能力,实现87.9%的成功率,并通过高阶分类学选择实现抓取策略的可控性。

Comments IROS 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02655 2026-07-01 cs.AI 版本更新 57%

A Concept of Possibility for Real-World Events

现实世界事件的可能性概念

Daniel G. Schwartz

机构 * Florida State University(佛罗里达州立大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出一种基于事件前提与约束概率计算可能性的新概念,用于规划问题中评估计划可行性,并以车辆路径规划为例说明。

Comments Submitted to Journal of Artificial Intelligence Research (JAIR), June 25, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18606 2026-07-01 quant-ph cs.LG 版本更新 57%

Quantum Bayesian Networks Can Speed up Reinforcement Learning in Partially Observable Environments

量子贝叶斯网络可以加速部分可观察环境中的强化学习

Gilberto Cunha, Alexandra Ramôa, André Sequeira, Michael de Oliveira, Luís Barbosa

机构 * High-Assurance Software Laboratory (HASLab), INESC TEC, Portugal(高可信软件实验室(HASLab),INESC TEC,葡萄牙) Department of Computer Science, University of Minho, Portugal(米尼奥大学计算机科学系,葡萄牙) International Iberian Nanotechnology Laboratory (INL), Portugal(国际伊比利亚纳米技术实验室(INL),葡萄牙)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出量子贝叶斯强化学习(QBRL),利用量子拒绝采样和幅度放大加速稀疏贝叶斯网络上的推理,实现部分可观察环境中基于模型的强化学习,在稀疏动力学环境下获得亚二次加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29072 2026-06-29 cs.LG cs.NA math.NA 版本更新 57%

Diffusion Model-Based Data Assimilation for Real-World Energy Consumption Forecasting

集成得分滤波用于真实数据能耗预测修正

Ruoyu Hu, Dahai Yu, Feng Bao, Guang Wang, Guannan Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 针对真实能耗数据的高维数据同化问题,采用集成得分滤波器(EnSF)结合预训练黑箱时空预测模型,通过基于得分的扩散模型和闭式得分表示修正预测轨迹,实验表明EnSF优于开环传播和集成卡尔曼滤波。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04574 2026-06-26 cs.LG cs.NE q-fin.ST q-fin.TR stat.ML 版本更新 57%

Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning

基于深度强化学习的加密货币市场动态多对交易策略

Damian Lebiedź, Robert Ślepaczuk

机构 * Politechnika Śląska(波兰斯拉维亚理工大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本研究提出一种结合深度强化学习执行覆盖层的层次化“过滤-排序”配对选择方法和“固定风险、自适应均值”执行模型,在加密货币市场实现优于启发式基准的统计套利表现。

Comments 61 pages, 37 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07407 2026-06-26 cs.CL 版本更新 57%

Training Language Models to Use Prolog as a Tool

训练语言模型以使用Prolog作为工具

Niklas Mellgren, Peter Schneider-Kamp, Lukas Galke Poech

机构 * University of Southern Denmark(南丹麦大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 本文探讨通过强化学习训练语言模型使用Prolog进行符号推理,发现正确性与可审计性之间存在权衡,影响模型性能与可解释性。

Comments ACL 2026 Findings (change from last version: corrected year in this comment)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22284 2026-06-26 cs.LG 版本更新 57%

BrepCoder: A Unified Multimodal Large Language Model for Multi-task B-rep Reasoning

BrepCoder: 用于多任务B-rep推理的统一多模态大语言模型

Mingi Kim, Yongjun Kim, Jungwoo Kang, Hyungki Kim

机构 * Chungnam National University(全南国立大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出BrepCoder,一种统一的多模态大语言模型,通过将CAD建模序列转换为类Python代码并与B-rep对齐,采用两阶段训练策略,实现从B-rep输入执行多种CAD任务,包括补全、纠错和问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18966 2026-06-26 cs.LG 版本更新 57%

Bayesian Optimization for General Reaction Conditions

通用反应条件的贝叶斯优化

Stefan P. Schmid, Ella Miray Rajaonson, Cher Tian Ser, Mohammad Haddadnia, Shi Xuan Leong, Alán Aspuru-Guzik, Agustinus Kristiadi, Kjell Jorner, Felix Strieth-Kalthoff

机构 * Institute of Chemical and Bioengineering, Department of Chemistry and Applied Biosciences, ETH Zurich(苏黎世联邦理工学院化学与生物工程学院,化学与应用生物科学系) NCCR Catalysis, Switzerland(瑞士催化联合体) Department of Chemistry, University of Toronto(多伦多大学化学系) Vector Institute, Toronto, Canada(多伦多向量研究所) Department of Biological Chemistry & Molecular Pharmacology, Harvard Medical School(哈佛医学院生物化学与分子药理学系) Dana-Farber Cancer Institute, Boston, MA, USA(波士顿马萨诸塞州 Dana-Farber 癌症研究所) School of Chemistry, Chemical Engineering and Biotechnology, Nanyang Technological University(南洋理工大学化学系、化工与生物技术学院) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Chemical Engineering and Applied Chemistry, University of Toronto(多伦多大学化学工程与应用化学系) Department of Materials Science and Engineering, University of Toronto(多伦多大学材料科学与工程系) Acceleration Consortium, University of Toronto(多伦多大学加速联盟) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究研究院) Institute of Medical Science, Medical Sciences Building, Toronto, Canada(多伦多大学医学科学研究院,医学科学大楼) NVIDIA, Toronto, Canada(多伦多NVIDIA) Department of Computer Science, Western University(温哥华大学计算机科学系)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出CurryBO框架,通过curried函数的贝叶斯优化实现通用反应条件的高效搜索,在多个基准上显著提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17059 2026-06-25 cs.LG 版本更新 57%

Consistent Zero-Shot Imitation with Contrastive Goal Inference

基于对比目标推理的零样本模仿一致性方法

Kathryn Wantlin, Chongyi Zheng, Benjamin Eysenbach

机构 * Department of Computer Science, Princeton University, Princeton, NJ, USA(普林斯顿大学计算机科学系)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出对比逆强化学习(CIRL),通过将多任务逆RL转化为目标推理问题,利用对比RL、自动目标提议和变分推断实现零样本模仿,理论证明其能一致恢复演示者意图,实验优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02230 2026-06-23 cs.CV cs.LG 版本更新 57%

InfiltrNet: Dual-Branch CNN-Transformer Architecture for Brain Tumor Infiltration Risk Prediction

InfiltrNet: 用于脑肿瘤浸润风险预测的双分支CNN-Transformer架构

S M Asif Hossain, Shruti Kshirsagar

机构 * School of Computing, Wichita State University(维斯科萨大学计算学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出InfiltrNet,结合CNN和Swin Transformer编码器及交叉注意力融合模块,从多模态MRI预测三区浸润风险图,利用距离变换生成标签,在BraTS数据集上优于五个基线模型。

Comments This work will be extended for a future journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13236 2026-06-23 cs.CL 版本更新 57%

IfcLLM: Natural Language Querying of IFC Models through Complementary Relational and Graph Representations

一种融合关系和图表示的IFC模型自然语言查询混合框架

Rabindra Lamsal, Sisi Zlatanova, Haowen Xu, Yafei Sun, Johnson Xuesong Shen

机构 * GRID Lab, School of Built Environment, The University of New South Wales(建筑环境学院,新南威尔士大学GRID实验室) School of Civil and Environmental Engineering, The University of New South Wales(土木与环境工程学院,新南威尔士大学)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 本文提出IfcLLM混合框架,通过关系和图表示结合迭代推理,提升非专家用户对IFC模型的自然语言查询能力,并支持常规BIM分析任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02849 2026-06-23 cs.RO cs.LG 版本更新 57%

Learned Controllers for Agile Quadrotors in Pursuit-Evasion Games

用于追逃博弈中敏捷四旋翼的学习控制器

Alejandro Sanchez Roncero, Yixi Cai, Olov Andersson, Petter Ogren

机构 * Robotics, Perception and Learning Lab., School of Electrical Engineering and Computer Science, Royal Institute of Technology (KTH)(机器人感知与学习实验室,电气工程与计算机科学学院,皇家理工学院(KTH))

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 针对四旋翼追逃博弈中的非平稳性、灾难性遗忘和策略循环问题,提出异步多阶段种群训练与Hedge采样方法,通过策略空间响应或acles与PPO训练,实现新策略发现与旧策略保持,并验证了硬件上的零样本迁移。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20448 2026-06-19 cs.CV cs.LG 版本更新 57%

Do Vision-Language Models Understand 3D Scenes or Just Catalogue Objects?

视觉-语言模型是理解3D场景还是仅仅 catalogue 物体?

Animesh Maheshwari, Divyansh Sahu, Nishit Verma

机构 * Deccan AI(德克南人工智能)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文通过一个包含3034个样本的人工整理基准,探讨了视觉-语言模型对空间理解的深度有序遮挡、光学几何推断和体积重新安排规划能力,发现模型在重新安排可见布局时表现优异,但在遮挡和反射推断上表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09420 2026-06-19 cs.CV cs.AI cs.RO 版本更新 57%

Class-Incremental Motion Forecasting

类别增量运动预测

Nicolas Schischka, Nikhil Gosala, B Ravi Kiran, Senthil Yogamani, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg, Germany(弗赖堡大学计算机科学系) Qualcomm SARL France(法国.qualcomm SARL) Automated Driving, Qualcomm Technologies, Inc.(qualcomm Technologies, Inc. 自动驾驶部门)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出类别增量运动预测新任务,通过端到端框架结合伪标签与开放词汇分割,利用3D-2D投票机制和查询特征方差重放策略,缓解灾难性遗忘并适应新类别。

Comments V3: Change title. Add further experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18201 2026-06-19 cs.RO cs.LG 版本更新 57%

Reinforcement Twinning for Hybrid Control of Flapping-Wing Drones

强化孪生用于扑翼无人机的混合控制

Romain Poletti, Lorenzo Schena, Lilla Koloszar, Joris Degroote, Miguel Alfonso Mendez

机构 * Environmental and Applied Fluid Dynamics, von Karman Institute for Fluid Dynamics(环境与应用流体动力学,冯·卡门流体动力学研究所) Department of Mechanical Engineering, Vrije Universiteit Brussel(机械工程系,自由大学布鲁塞尔) Department of Electromechanical, Systems and Metal Engineering, Ghent University(机电系统与金属工程系,根特大学) Aero-Thermo-Mechanics Laboratory, École Polytechnique de Bruxelles, Université Libre de Bruxelles(航空热力学力学实验室,布鲁塞尔理工学院,自由大学布鲁塞尔) Experimental Aerodynamics and Propulsion Lab, Universidad Carlos III de Madrid(实验空气动力学与推进实验室,马德里卡洛斯三世大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出一种混合无模型/基于模型的扑翼无人机控制方法,通过强化孪生算法结合强化学习与自适应数字孪生,利用迁移学习和策略裁判提升样本效率与控制鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11417 2026-06-18 cs.CV cs.LG 版本更新 57%

Zero-Shot Cross-City Generalization in End-to-End Autonomous Driving: Self-Supervised versus Supervised Representations

端到端自动驾驶中的零样本跨城市泛化:自监督与监督表示

Fatemeh Naeinian, Ali Hamza, Haoran Zhu, Anna Choromanska

机构 * Department of Electrical and Computer Engineering, NYU Tandon School of Engineering(电气工程系,纽约大学Tandon工程学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究端到端自动驾驶模型在跨城市零样本迁移中的泛化能力,发现自监督预训练(如I-JEPA、DINOv2、MAE)相比监督预训练能显著减少位移和碰撞退化,提升闭环评估中的分布外PDMS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00656 2026-06-18 cs.AI 版本更新 57%

InfoPO: Information-Driven Policy Optimization for User-Centric Agents

InfoPO:面向用户智能体的信息驱动策略优化

Fanqi Kong, Jiayi Zhang, Mingyi Deng, Chenglin Wu, Yuyu Luo, Bang Liu

机构 * Peking University(北京大学) The Hong Kong University of Science(香港科学大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 针对多轮交互中信用分配和优势信号不足的问题,提出信息增益奖励与自适应方差门控融合的InfoPO方法,在意图澄清、协作编码等任务上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏