arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1893 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1893 篇

2607.09787 2026-07-14 cs.CV cs.LG 新提交 57%

Adversarially Guided Diffusion for LiDAR Range Image Synthesis

用于激光雷达距离图像合成的对抗引导扩散

Stavros Bouras, Antonios Makris, Alexandros Gkillas, Aris S. Lalos, Konstantinos Tserpes

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(雅典国立技术大学电气与计算机工程学院) Industrial Systems Institute, Athena Research Center(雅典娜研究中心工业系统研究所)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究针对二维距离图像分割的无限制对抗攻击,提出基于扩散并利用分割损失对抗引导的方法,在SemanticKITTI数据集实验,能跨架构转移,相比基线在有效性与现实性间有独特权衡,实现可控退化。

Comments Accepted at the 1st Workshop on Secure and Trustworthy AI (STAI 2026), co-located with the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09741 2026-07-14 cs.RO cs.AI cs.MA 新提交 57%

SWIFT: A Small-World Interaction Framework for Flow-Aware Trajectory Prediction in Autonomous Driving

SWIFT:用于自动驾驶中流量感知轨迹预测的小世界交互框架

Chengyue Wang, Bin Rao, Haicheng Liao, Bonan Wang, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学智慧城市物联网国家重点实验室) Department of Civil and Environmental Engineering, University of Macau(澳门大学土木与环境工程系)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究自动驾驶中轨迹预测问题,提出SWIFT框架,结合小世界网络与交通流理论,通过特定网络和模块引入结构偏差与增强推理,实验证明其在多方面优于基线,展现出结构感知设计的有效性。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09712 2026-07-14 cs.LG 新提交 57%

ERP Data Provisioning Financial Control Testing

ERP数据供应财务控制测试

Anitha Samudrala

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究针对财务控制测试依赖ERP数据但直接复制有风险的问题,提出SEQ-FCT框架,结合多种技术,用合成数据集评估,与多种基线对比,在对账、欺诈触发召回率、控制失败等方面取得较好结果,表明综合评估更可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10201 2026-07-14 eess.SY cs.AI cs.SY math.OC 新提交 57%

Comparing Socially-Equitable Renewable Energy Budget Allocation MDP Policies in Mature and Emerging Economies

比较成熟和新兴经济体中社会公平的可再生能源预算分配马尔可夫决策过程政策

Riya Kinnarkar, Mansur M. Arief, Yan Pratama Akhra, Dino Arla

机构 * Management \& Technology University of Pennsylvania Philadelphia, PA, USA Systems Engineering Institute Technology of Sepuluh Nopember (ITS) Surabaya, Indonesia Systems Engineering King Fahd University of Petroleum

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究成熟与新兴经济体中社会公平的可再生能源预算分配问题,将其建模为马尔可夫决策过程,用单一求解器接口比较政策,结果显示滚动时域值迭代政策占优,还揭示简单启发式方法在不同经济体效果不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11349 2026-07-14 math.OC cs.LG 新提交 57%

Inter-Stop Energy Prediction and Causal Driver Quantification for Dual-Source Trolleybuses via a Time-Aware Tabular Deep Learning Architecture

基于时间感知表格深度学习架构的双源无轨电车站点间能量预测及因果驱动因素量化

Wentao Zeng, Zijian Huang, Yiming Bie, Jiabin Wu, Jun Gong

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究双源无轨电车站点间能量预测及因果驱动因素量化问题,提出时间感知表格深度学习框架,集成周期性时间编码并结合贝叶斯优化调参,通过三层因果解释管道分析,实验表现优异,确定了关键因素并提供规划阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09402 2026-07-13 cs.LG 新提交 57%

Data-Efficient Deep Learning: Empirical Guidelines for Training Set Size Estimation in Inertial Sensor Classification

数据高效深度学习:惯性传感器分类中训练集大小估计的实证指南

Ofir Kruzel, Itzik Klien

机构 * The Autonomous Navigation and Sensor Fusion Lab, the Hatter Department of Marine Technologies, University of Haifa(海法大学自主导航与传感器融合实验室,海洋技术哈特学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究针对深度学习在惯性传感器分类任务中依赖大规模数据集的瓶颈,通过系统实证评估学习曲线收敛率,提出统一框架和经验公式,引入定量稳定点指标,提供可推广框架,优化数据效率,为惯性传感应用记录活动规划提供指南。

Comments 1 pages, 17 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08925 2026-07-13 cs.LG 新提交 57%

SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions

SafeExplorer:一种用于带有恢复干预的强化学习的无偏策略梯度算法

Elham Daneshmand, Majid Khadiv, Glen Berseth, Hsiu-Chin Lin

机构 * McGill University(麦吉尔大学) Mila(米拉) Technical University of Munich(慕尼黑工业大学) Université de Montréal(蒙特利尔大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 研究在物理机器人上训练强化学习智能体减少跌倒问题,提出对PPO改进的SafeExplorer算法,核心是无偏策略梯度估计器,还添加加速学习组件,实验表明该算法大幅减少训练时间跌倒且奖励表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08971 2026-07-13 cs.LG math.ST stat.ML stat.TH 新提交 57%

Stochastic Linear Bandits with Partially Observed Actions

具有部分观测动作的随机线性博弈

Gautam Dasarathy, Vineet Gattani, Lalit Jain

机构 * Arizona State University(亚利桑那州立大学) GE Vernova(通用电气 Vernova) Google(谷歌)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 研究具有部分观测动作的随机线性博弈问题,提出TOFU-POV算法,通过估计潜在动作子空间等操作,使遗憾为$\sqrt{T}$且与内在维度相关,还设计了秩自适应算法,实验证明该算法能改进自然基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03198 2026-07-13 cs.LG math-ph math.MP 新提交 57%

Reduced-Order Models: The Mother of World Models

降阶模型:世界模型之母

Rajat Ghosh

机构 * Independent Researcher(独立研究员)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 探讨世界模型的功能结构早于现代自监督学习,在模型降阶和控制文献中就已独立发展。追溯其在三个领域的发展,对比传统降阶模型与学习型世界模型的优缺点,指出在关键系统中部署世界模型的障碍及统一两者的研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08703 2026-07-10 cs.LG 新提交 57%

MPFlow: Learning Budgeted Max-Flow Optimization on the Lightning Network with Deep Graph Reinforcement Learning

MPFlow:基于深度图强化学习的比特币闪电网络预算最大流优化学习

Harrison Rush, Vincent Davis, Simone Antonelli, Vikash Singh, Jesse Shrader, Emanuele Rossi

机构 * Amboss Technologies(Amboss技术公司) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Stillmark(Stillmark公司) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 研究比特币闪电网络中给定预算下节点如何打开通道最大化路由容量的问题,采用图强化学习方法,结合消息传递策略网络、PPO和动作掩码,在真实网络快照实验中表现优于启发式基线,还用于生产中的对等推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08602 2026-07-10 cs.AI 新提交 57%

Towards Precision Therapy in Hepatocellular Carcinoma: A Clinical-Reasoning LLM for Risk Stratification and Treatment Guidance

迈向肝细胞癌的精准治疗:用于风险分层和治疗指导的临床推理大语言模型

Peng Cui, Jitao Wang, Siyan Xue, Yao Huang, Haoming Xia, Dong Li, Dengxiang Liu, Weilin Wang, Liping Liu, Leida Zhang, Yunfu Cui, Tao Peng, Daolin Ji, Haitao Zhao, Wei Zhang, Xiaojuan Wang, Weijie Ma, Zongren Ding, Jinlong Li, Yuan Ding, Jiajing Zhao, Zhiyu Chen, Chengkun Yang, Ziyue Huang, Jiaqi Liu, Fusheng Liu, Yang Zhou, Xiaojuan Wang, Zhongquan Sun, Shiyun Bao, Xiaojun Wang, Ming Yang, Guangxin Li, Bin Shu, Yong Liao, Hongxuan Li, Yao Tang, Shizhong Yang, Yongyi Zeng, Yufeng Yuan, Yinpeng Dong, Jihui Hao, Jun Zhu, Jiahong Dong

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 研究针对肝细胞癌治疗问题,提出HCC-STAR临床推理大语言模型。通过处理电子病历叙述输出风险分层、治疗方案等。经多中心队列验证,性能领先,能助医生决策,是可靠的肝细胞癌风险分层和精准治疗决策支持系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08554 2026-07-10 cs.AI 新提交 57%

CommuniWave:A Machine Learning Model for Quantifying the Degree of Temporary Informal Behavior in Urban Communities

CommuniWave:一种用于量化城市社区临时非正式行为程度的机器学习模型

Hongye Yang, Shien Liu, Zhihao Xie

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究针对城市社区规划缺乏量化居民非正式行为指标的问题,引入CommuniWave模型,它整合BCN、YLX和BEM,通过生成DIB波动图实现动态监测,助力城市管理者提升社区整体韧性。

Comments 17 pages, 4 figures. Presented at ASCAAD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08449 2026-07-10 cs.CV cs.LG 新提交 57%

Predicting Viticulture Potential through an Ensemble of U-Net and a Geospatial Foundation Model

通过U-Net和地理空间基础模型的集成预测葡萄种植潜力

Jorge Ignacio Perez, Hwaai Kang Kee, Lucas Rassbach

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 针对ImageCLEF AI4Agri 2026法国南部葡萄种植潜力预测子任务,DS@GT ARC团队采用U-Net和地理空间基础模型集成方法,其最佳模型准确率达68.32,在7个团队中排第二,且实现已公开。

Comments To be published in CLEF 2026 Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08443 2026-07-10 cs.NI cs.AI 新提交 57%

ADORN: Adaptive Drift handling for Open RAN using Reinforcement Learning

ADORN:使用强化学习的开放式RAN自适应漂移处理

Ashit Kumar Subudhi, Bhargav Chirumamilla, Shubham Vaishnav, Mduduzi C. Hlophe, Praveen Kumar Donta, Andrea Fumagalli, Venkateswarlu Gudepu, Koteswararao Kondepu

机构 * Indian Institute of Technology Dharwad, Karnataka, India(印度理工学院达拉德分校) University of Pretoria, Pretoria, South Africa(南非彼得里亚大学) Johns Hopkins University, USA(约翰霍普金斯大学) Stockholm University, Sweden(斯德哥尔摩大学) Open Networking Advanced Research (OpNeAR) Lab, The University of Texas at Dallas, TX, USA(开放网络高级研究实验室,德克萨斯大学达拉斯分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 针对开放式无线接入网络中因动态流量变化导致的模型性能下降问题,提出基于Q学习的自适应重新训练方法,通过将决策制定为马尔可夫决策过程,结合多专家长短期记忆集成,有效降低重新训练开销并维持系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08436 2026-07-10 cs.RO cs.AI 新提交 57%

EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data

EgoWAM:利用野外自我中心人类数据超越像素的世界行动模型

Baoyu Li, Xinchen Yin, Mengying Lin, Yixin Zhang, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究利用野外自我中心人类数据训练机器人操纵模型,引入EgoWAM框架,固定部分设置仅改变世界预测目标,比较不同方法。结果表明WAM协同训练更有效,DINO和3D流提升显著,为机器人操纵提供新训练思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08357 2026-07-10 cs.AI 新提交 57%

MobiDiff: Semantic-Aware Multi-Channel Discrete Diffusion for Human Mobility Data Generation

MobiDiff:用于人类移动性数据生成的语义感知多通道离散扩散

Rongchao Xu, Lin Jiang, Dahai Yu, Ximiao Li, Taichi Liu, Desheng Zhang, Yuan Tian, Guang Wang

机构 * Florida State University(佛罗里达州立大学) Rutgers University(罗格斯大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究旨在解决人类移动性数据生成难题,提出MobiDiff框架,通过直接对多通道语义骨架去噪生成数据,避免复杂管道。该框架能分解事件通道并采用掩码捕获移动模式与依赖性,实验证明其在保真度、隐私保护和效率上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07763 2026-07-10 cs.LG 新提交 57%

Unlocking Temporal Generalization in Hamiltonian Video Dynamics Models

解锁哈密顿视频动力学模型中的时间泛化

Eli Laird, Corey Clark

机构 * Department of Computer Science, Southern Methodist University(南卫理公会大学计算机科学系)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究世界模型在可变时间分辨率下预测动力学的问题,利用哈密顿生成网络(HGN),指出其在非保守环境中时间泛化失效的问题及原因,通过针对性修复实现稳定动力学预测,推荐连续时间视频生成中时间泛化的策略。

Comments To appear in the 1st Workshop on Physics-Aware Video Generation and Restoration at the 28th International Conference on Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07761 2026-07-10 cs.AI 新提交 57%

Aligning Clinical Needs and AI Capabilities: A Survey on LLMs for Medical Reasoning

对齐临床需求与人工智能能力:医学推理大语言模型综述

Qi Peng, Jiatong Li, Sirui Huang, Yiyang Jiang, Kaisong Gong, Ronger Ding, Shijie Ye, Changmeng Zheng, Yi Cai, Xiaobo Yang, Jin Huang, Xiao-Yong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Hong Kong University(香港大学) South China University of Technology(华南理工大学) University of Toronto(多伦多大学) Peking Union Medical College Hospital(北京地坛医院) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 综述医学大语言模型在医疗领域的进展,提出双视角方法,连接临床实践与计算方法,建立五级能力方案并关联推理模式与医学任务,引入基准数据集并报告模型结果,讨论进展与挑战及未来方向。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07292 2026-07-09 cs.CV cs.AI 新提交 57%

CarbonCLIP: Enhance Carbon Prediction from Satellite Imagery via Integrated Street-View Semantics and Temporal Context Training

CarbonCLIP:通过集成街景语义和时间上下文训练增强卫星图像的碳排放预测

Zeru Yang, Fang-Ying Gong, Steve H. L. Yim, Chau Yuen

机构 * Energy Research Institute at NTU(国立理工学院能源研究所) Interdisciplinary Graduate Programme(跨学科研究生项目) School of Electrical and Electronic Engineering(电气电子工程学院) School of Public Administration and Policy(公共管理与政策学院) Asian School of the Environment(亚洲环境学院) Center for Climate Change and Environmental Health(气候变化与环境健康中心)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对城市碳排放预测难题,CarbonCLIP提出多模态蒸馏框架,通过双分支对比学习,利用街景语义和时间上下文训练增强卫星图像碳排放预测,实验证明该方法优于基线,为卫星碳建模提供有力支持。

Comments Accepted by IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing. 21 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07252 2026-07-09 cs.LG cs.RO 新提交 57%

Safe Reinforcement Learning using Ideas from Model Predictive Control

利用模型预测控制思想的安全强化学习

Georg Schäfer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

机构 * Salzburg University of Applied Sciences(萨尔茨堡应用科学大学) Paris Lodron University of Salzburg(萨尔茨堡巴黎洛德伦大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 针对强化学习在安全约束方面的挑战,提出结合深度强化学习与模型预测控制的通用框架,利用系统动力学模型定义可行状态 - 动作空间,经安全过滤器投影动作,在实验室试验台验证该方法可成功探索并稳定收敛。

Comments Accepted at Eurocast 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06820 2026-07-09 cs.AI 新提交 57%

Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics

评估用于计算和实验数学的SageMath增强型大语言模型智能体

Pavel Snopov, German Magai

机构 * The Sage Developers(Sage开发者团队)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 研究聚焦AI在数学领域进展,提出结合大语言模型推理与SageMath反馈的智能体设置,改进RealMath基准。实验表明该设置能提升模型性能,缩小模型差距,CAS增强型智能体在计算探索上有潜力,朝自动猜想发现迈进。

Comments 37 pages, 16 figures, accepted to 3rd AI for Math Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06642 2026-07-09 cs.LG 新提交 57%

The Approximation Ratio for the Risk of Myopic Bayesian Active Learning for Linear Regression

线性回归中近视贝叶斯主动学习风险的近似率

Stephen Mussmann

机构 * School of Computer Science(计算机科学学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究线性回归中近视贝叶斯主动学习风险的近似率,核心方法是证明贪心算法风险的近似率,主要贡献是得出该近似率在最大初始杠杆得分上线性相关,并通过数值模拟说明结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06622 2026-07-09 eess.SY cs.LG cs.SY 新提交 57%

Creating Power Distribution Network Layouts Using Generative Adversarial Networks and Image-Based Representations

使用生成对抗网络和基于图像的表示创建配电网布局

Juan Manuel Garcia-Perez, Carlos Mateo

机构 * School of Engineering (ICAI), Comillas Pontifical University(工程学院(ICAI),卡利斯大学) Institute for Research in Technology (IIT), School of Engineering (ICAI), Comillas Pontifical University(技术研究所(IIT),工程学院(ICAI),卡利斯大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究提出基于生成对抗网络的框架,用基于图像的表示创建配电网布局,通过GIS数据集准备、GAN架构设计等进行训练,能再现馈线拓扑并与地理结构对齐,构成现有方法的数据驱动补充,为新区域电气化布局提供思路。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06619 2026-07-09 cs.AR cs.LG 新提交 57%

HiFuzz: Hierarchical Reinforcement Learning for Semantic-Aware and Adaptive CPU Fuzzing

HiFuzz:用于语义感知和自适应CPU模糊测试的分层强化学习

Ya Wang, Hanwei Fan, Zhenguo Liu, Xiaofeng Zhou, Yangdi Lyu, Jiang Xu, Wei Zhang

机构 * Hong Kong University of Science and Technology (HKUST), Hong Kong(香港科技大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 针对传统变异模糊测试在处理器验证中效率低的问题,提出HiFuzz框架,采用分层强化学习及结构化生成过程,集成自适应机制与编码器,经实验验证,该框架在覆盖率和漏洞检测上显著优于现有工具。

Comments Accepted by the 2026 IEEE International Test Conference (ITC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06522 2026-07-08 cs.AI cs.CV 新提交 57%

Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment

通过视觉动作结果推理对齐实现物理推理与任务泛化的桥梁

Han-Jun Ko, Jr-Jen Chen, Haobo Yuan, Hsin-Ying Lee, Tiancheng Shen, Ming-Hsuan Yang, Yu-Chiang Frank Wang

机构 * National Taiwan University(国立台湾大学) The University of California, Merced(加州大学默塞德分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究针对视觉语言模型在物理推理中难以泛化的问题,提出VAORA奖励设计,包括视觉对齐奖励和视觉-动作对齐奖励,通过预训练专家估计概率实现平滑密集奖励,经实验验证可有效提升模型在新任务和未见环境中的物理推理性能。

Comments ICML'26 Workshop RLxF: Reinforcement Learning from World Feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06223 2026-07-08 cs.AI 新提交 57%

Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents

基于信息增益的展开策略优化:一种用于多轮语言模型智能体的自适应树结构展开方法

Yijun Zhang, Fan Xu, Jiaxin Ding, Yule Xie, Shiqing Gao, Xin Ding, Haoxiang Zhang, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究针对LLM智能体长期搜索任务中展开预算分配不合理问题,提出基于信息增益的展开策略优化(IGRPO),通过按节点信息性分配预算进行树结构展开,并利用诱导教师分布指导策略优化,实验验证该方法在相同预算下优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06004 2026-07-08 cs.SE 新提交 57%

Large Language Models Have Unreliable Understanding of Software Engineering Terminology

大语言模型对软件工程术语的理解不可靠

Huzaifa Ejaz, Fabian C. Peña, Steffen Herbold

专题命中 规划决策 :agentic(abstract);分类 cs.SE

AI总结 研究大语言模型对软件工程术语的理解程度,通过用正确及伪造定义提示,测量分类准确率与推理令牌合理性,发现多数模型虽能检测伪造定义,但存在拒绝正确定义的偏差,明确推理未持续改善结果,揭示了LLMs在术语理解上的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05722 2026-07-08 cs.CL 新提交 57%

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

Nemotron-Labs-Diffusion:一种统一自回归、扩散和自推测解码的三模式语言模型

Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 介绍了统一AR、扩散和自推测解码的三模式语言模型Nemotron-Labs-Diffusion,通过联合目标训练,能切换模式。研究表明其目标互补,自推测模式表现优,有长期潜力,该模型家族在精度和速度上优于现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06017 2026-07-08 cs.LG math.OC 新提交 57%

Learning When to Automate: Queue Control in Human-AI Service Systems

学习何时自动化:人机服务系统中的队列控制

Giovanni Montanari, Marco Scarsini, Vianney Perchet

机构 * Inria(法国国家信息与自动化研究所) CREST(法国国立统计与经济管理学院) ENSAE(法国国立统计与经济管理学院) Institut Polytechnique de Paris(巴黎综合理工学院) Luiss University(罗马路易斯大学) Criteo AI Lab(Criteo人工智能实验室)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 研究人机服务系统中任务处理的资源分配问题,提出UCB - DPP策略,结合上置信界与漂移加惩罚控制学习未知参数并做队列感知决策,实现\(\widetilde{\mathcal{O}}(K\sqrt{T})\)遗憾值,保证人工服务队列平均速率稳定性,优于自然基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05758 2026-07-08 cond-mat.mtrl-sci cs.LG 新提交 57%

From Closed-Loop Optimization to Open Decision Making: Coupled Digital Twins for Predictive and Autonomous Microscopy

从闭环优化到开放决策:用于预测性和自主性显微镜的耦合数字孪生

Yu Liu, Boris Slautin, Ian Mercer, Jon-Paul Maria, Sergei V. Kalinin

机构 * Department of Materials Science and Engineering, University of Tennessee, Knoxville, Tennessee, 37996, USA(田纳西大学材料科学与工程系) Materials Science and Engineering Department, Materials Research Institute, the Pennsylvania State University, University Park, Pennsylvania, 16802, USA(宾夕法尼亚州立大学材料研究学院材料科学与工程系)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究从闭环优化到开放决策的自动化实验,提出耦合数字孪生框架,通过样本孪生和仪器孪生分别编码材料状态与信号等,用于预测显微镜操作等,以力 - 距离曲线编码器等实现框架,为预测性操作和自主实验规划奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏