arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-31 至 2026-07-31 共收录 199 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 53 篇

2607.27283 2026-07-31 cs.LG cs.AI cs.SE 新提交 67%

Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance

评估残差:长时序评估在匹配短任务性能之外的补充作用

Chao Peng, Zhiheng Lyu, Peijie Dong, Hande Dong, Qiang Lin

机构 * Tencent(腾讯)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 该论文提出时序残差概念,指出长时序基准需将全任务成功与短阶段基线预测比较,以解释长任务失败的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18124 2026-07-31 physics.ao-ph 版本更新 67%

Long-range near-surface wake signatures of offshore wind farm clusters revealed by satellite observations

卫星观测揭示海上风电场集群的远距离近地面尾流特征

Rui Li, Jincheng Zhang, Xiaowei Zhao

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 该研究利用7122幅Sentinel-1A/B SAR图像,揭示海上风电场近地面尾流可超100公里、平均降速0.990 m/s,还观测到跨国界尾流相互作用,为尾流特征提供大规模观测表征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28488 2026-07-31 cs.AI cs.LG 新提交 62%

SCOPE: Supply-Chain Operations through Coupled Policies for End-to-End Coordination

SCOPE:基于耦合策略的端到端协调供应链运营

Yunhao Liang, Xianqi Cao, Pujun Zhang, Yuan Qu, Yongzhi Qi, Ningxuan Kang, Max Z. J. Shen

机构 * Dingdong(叮咚)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 SCOPE是将供应链实体建模为token的复合策略模型,在生鲜零售补货数据上验证了其比分阶段优化及传统基线更优的端到端供应链决策效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28415 2026-07-31 cs.LG cs.AI cs.CV cs.MM cs.RO 新提交 62%

QQWorld: Quantile-Quantile Matching for World Model Regularization

QQWorld:用于世界模型正则化的分位数-分位数匹配

Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对潜在世界模型正则化中EP目标函数对尾部样本校正梯度不足的问题,提出QQWorld方法,通过分位数-分位数匹配目标函数及跨批次QQ技术,提升了LeWM在四个控制环境中的规划成功率与高斯对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27973 2026-07-31 cs.LG cs.AI 新提交 62%

TAPO: Transition-Aware Policy Optimization for LLM Agents

TAPO:面向大语言模型智能体的过渡感知策略优化

Cong Li, Peixi Peng, Yisen Zhao, Xinyu Hu, Shudong Liu, Zhan Su, Zhuojian Li

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Pengcheng Laboratory(鹏城实验室)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TAPO框架,通过策略优化与过渡监督交替训练,增强LLM智能体对环境过渡的敏感性,作为轻量即插即用模块,在WebShop和ALFWorld实验中提升任务性能。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28408 2026-07-31 cs.LG cs.AI math.ST stat.ML stat.TH 新提交 62%

On-Policy and Off-Policy Learning for Large Action Spaces

面向大动作空间的在线策略与离线策略学习

Imad Aouali

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本论文针对大动作空间交互式系统的策略学习挑战,提出meTS、dTS、sDM等结构化贝叶斯方法,解决在线与离线策略学习的关键问题并提供理论保证。

Comments PhD Thesis, 241 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20145 2026-07-31 cs.CL cs.AI 版本更新 62%

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

SLAI T-Rex:在升腾超级集群上对DeepSeek-V4系列进行全参数训练后优化

Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo, Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu, Weihua Dai, Zirong Zeng, Ziwei Zhu, Zhuohan Wang, Zhengjun Yue, Igor Vasilyev, Min Liu, Weijian Sun, Xin Chen, Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang, Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin, Tian Ding, Zhihang Lin, Qian Chen, Linxin Yang, Mingzhe Yang, Bingwei Zhang, Hongzhang Yang, Fangxue Zhang, Shijun Qin, Jie Yu, Cuihua Hu, Tolstykh Vasiliy, Nosov Ivan, Abdullin Amir, Zhicheng Zhou, Xin Zhang, Zhixiong Ning, Xutong Zhao, Junjie Huang, Jiajun Liu, Weiyan Kong, Zheng Zhang, Wenhan Luo, Lin Hu, Yangbo Guo, Li Zeng, Shihao Zhang, Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究针对万亿参数规模MoE模型全参数训练后优化的系统挑战,在升腾NPU超级集群上以DeepSeek-V4为目标工作负载开发分层优化框架,建立CPT和SFT工作流程,提升模型性能,推动复杂推理前沿模型系统发展。

Comments 73 pages, 22 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13707 2026-07-31 cs.RO cs.AI cs.LG 版本更新 62%

REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning

REFINE-DP:通过强化学习实现人形机器人的动态-操作协调政策微调

Zhaoyuan Gu, Yipu Chen, Zimeng Chai, Alfred Cueva, Thong Nguyen, Yifan Wu, Huishu Xue, Minji Kim, Isaac Legene, Fukang Liu, KyoungMok Kim, Ayan Barula, Yongxin Chen, Ye Zhao

机构 * The Institute for Robotics and Intelligent Machines(机器人与智能机械研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出REFINE-DP框架,通过联合优化扩散政策高层规划器和基于强化学习的低层动态-操作控制器,提升人形机器人在复杂环境中的任务成功率与执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28451 2026-07-31 cs.RO cs.AI 新提交 57%

Machines that know they are aging: a framework for hardware-aware autonomous intelligence

感知自身老化的机器:面向硬件感知自主智能的框架

Cheng Siong Chin, Jianhua Zhang, Mohan Venkateshkumar

机构 * Newcastle University Singapore(新加坡纽卡斯尔大学) Qingdao University of Technology(青岛理工大学) Amrita Vishwa Vidyapeetham(阿姆里塔维什瓦维迪亚皮塔姆大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对自主系统硬件老化引发的任务失败问题,提出将硬件健康融入决策的 AAAI 框架,通过三大支柱实现系统自适应,提升弹性并延长寿命,适用于太空、医疗等关键环境。

Comments 1 figure, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28410 2026-07-31 cs.CE cs.CL q-fin.TR 新提交 57%

Can Large Language Models Execute Parent Orders?

大型语言模型能否执行父订单?

Zane Shen, Xinli Xu, Guangyi Zhang, Jialong Chen, Jinsong Zhou, Cong Chen, Guibao Shen, Dongyu Yan, Luozhou Wang, Zhen Yang

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 该研究针对算法交易的父订单执行问题,提出分层框架PACE,基于深交所数据验证其性能优于现有方法,表明LLMs可辅助人类交易者执行决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28109 2026-07-31 cs.AI 新提交 57%

Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training

超越改写:书籍级组织提升训练中合成教科书数据的质量

Jiawen Tao, Miao Peng, Yaoming Li, Xiaokun Yuan, Mengzhou Wu, Wenhan Yu, Guoan Wang, Nuo Chen, Tong Yang, Maxm Pan

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本研究提出可扩展的合成教科书数据流程,发现书籍级组织可提升语言模型训练中期的下游性能,在Llama3-8B上也验证了该设计维度的有效性。

Comments 31 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28026 2026-07-31 cs.LG 新提交 57%

Contrastive Reinforced Policy Optimization via Privileged Self-Distillation

基于特权自蒸馏的对比强化策略优化

Xingjian Wu, Junlin Liu, Xingchen Liu, Xuhang Zhu, Jianing Wang, Linsen Guo, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

专题命中 规划决策 :agentic(abstract);分类 cs.LG

AI总结 该研究针对在线策略自蒸馏的暴露偏差问题,提出CRPO方法,通过对比学习与分组对比保留优化信号,在13个推理基准上提升了训练稳定性与泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27881 2026-07-31 cs.RO cs.AI 新提交 57%

RoboBRIDGE: A Modular Framework for Bridging Policies to Robust Real-World Robotic Agents

RoboBRIDGE:一种将策略桥接至鲁棒现实世界机器人智能体的模块化框架

Sihyung Yoon, Minjong Yoo, Sanghyun Ahn, Seojeong Choi, Honguk Woo

机构 * Sungkyunkwan University(成均馆大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 该研究针对视觉-语言-动作模型部署为机器人智能体的缺陷,提出 RoboBRIDGE 模块化框架,通过五大协同模块结合预训练 VLAs 构建鲁棒智能体,在多基准和现实场景中性能优于现有方案。

Comments Accepted to IROS 2026. 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27835 2026-07-31 cs.CV cs.AI 新提交 57%

SAFViT: Spatial Attention Fusion Gating for Vision Transformer-Based Nucleus Segmentation and Classification

SAFViT:用于基于视觉Transformer的细胞核分割与分类的空间注意力融合门控

Harshit Mittal, Arash Rabbani

机构 * School of Computer Science, University of Leeds(利兹大学计算机学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本研究针对数字病理学中细胞分割与分类的冗余信息问题,提出SAF门控模块替换CellViT的传统跳跃连接,在PanNuke和MoNuSeg数据集上使mPQ达0.471,死亡类F1分数提升14.5个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27627 2026-07-31 cs.RO cs.AI 新提交 57%

Arm2Air: Cross-Embodiment Skeleton Transfer for 3D Relay Formation

Arm2Air:用于三维中继组网的跨 embodiments 骨架迁移

Dohun Lee, Kyeonghyun Yoo, Seokmin Kim, Byongho Lee, Seungjoo Oh, Hwangnam Kim

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 Arm2Air 实现跨 embodiments 骨架迁移,高效优化无人机中继部署,在规划速度、中继性能及数据效率上均优于基线方法,为异构 embodied 任务结构先验迁移提供新方案。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27610 2026-07-31 cs.LG 新提交 57%

Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning

卡尔曼与课程学习结合:面向自适应RL微调的高效动态提示选择

Haodong Zhu, Yangyang Ren, Yanjing Li, Sheng Xu, Haiguang Liu, Linlin Yang, Baochang Zhang

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Communication University of China(中国传媒大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出KGPS方法,将提示选择转化为动态状态估计问题,适配RL训练动态,在多推理基准和RL算法上较基线提升准确率与rollout效率,在在线提示选择中达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27422 2026-07-31 cs.LG 新提交 57%

Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search

好的排序器,差的目标:表达性策略搜索下的双线性对比评判器

Ayushman Singh, Siddharth Aphale

机构 * Stanford University(斯坦福大学) Sesame AI(芝麻AI公司)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究发现双线性对比评判器的排序能力与其优化安全性不匹配,其存在范数漂移等问题,在多任务中无法可靠排序动作,需结合价值校准标量用于动作选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28421 2026-07-31 cs.AI 版本更新 57%

DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes

DenoiseRL:引导推理模型从噪声前缀中恢复

Caijun Xu, Changyi Xiao, Zhongyuan Peng, Yixin Cao

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 提出DenoiseRL框架,通过强化学习从弱模型的错误推理中学习,无需外部监督或强教师模型,提升推理性能和训练效率。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15297 2026-07-31 cs.CL 版本更新 57%

AfriEconQA: A Benchmark for Quantitative and Temporal Reasoning over World Bank Economic Reports

AfriEconQA:基于世界银行报告的非洲经济分析基准数据集

Edward Ajayi, Mustapha Alaba, David Stephen

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 AfriEconQA是一个基于世界银行报告的非洲经济分析基准数据集,旨在测试信息检索和RAG系统在处理复杂经济查询时的性能。

Comments Dataset Explorer: https://afrieconqa.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28601 2026-07-31 cs.MA q-bio.NC 新提交 50%

Using Theory of Mind to Arbitrate between Social and Non-social Learning

运用心智理论在社会学习与非社会学习之间进行仲裁

Lance Ying, Ryan Truong, Joshua B. Tenenbaum, Samuel J. Gershman

专题命中 规划决策 :agent(abstract)

AI总结 该研究提出理性心智化模型,通过推理智能体目标与行动信息性权衡社会、非社会学习的效用,用新游戏验证其可定量捕捉人类学习策略的权衡,揭示选择性社会学习受心智理论指导以实现效用最大化。

Comments 35 pages, includes supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27789 2026-07-31 cs.IR 新提交 50%

From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation

从理解到行动:面向生成式推荐的反馈驱动策略发现

Zhi Chen, Minmao Wang, Xingchen Liu, Haoqiang Liang, Huihuang Lin, Likang Wu, Hongke Zhao, Yulong Wang, Shijie Yi, Fei Pan, Peng Jiang

专题命中 规划决策 :agent(abstract)

AI总结 该研究针对生成式推荐的“理解-行动差距”,提出反馈驱动智能体框架,经蒸馏迁移至轻量模型实现无LLM在线推理,在基准测试与在线A/B测试中均取得推荐效果提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27899 2026-07-31 math.OC 新提交 50%

Branching out: Prognostics-Based Replacement Policies for Series Systems

分支扩展:面向串联系统的基于 prognostics 的更换策略

Daniel Koutas, Daniel Straub

专题命中 规划决策 :planning(abstract)

AI总结 该研究提出一种混合规划方法,用于推导串联系统的基于 prognostics 的预测性维护策略,该策略参数少、效率高且抗过拟合能力强,在预防性更换和订购场景中性能可媲美优化基准策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28494 2026-07-31 physics.soc-ph 新提交 50%

Predictability of Human Movements across Industry Sectors using Multilayer Networks

基于多层网络的跨行业人类运动可预测性研究

Maisha Islam Sejunti, Melissa Butler, Yingjie Hu, Dane Taylor

专题命中 规划决策 :planning(abstract)

AI总结 本研究基于多层网络,用10种模型探究跨行业人类运动可预测性,明确关键特征,发现非线性模型表现最优、周度运动更易预测,为人类运动建模提供实用进展。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26774 2026-07-31 stat.ME stat.AP 版本更新 50%

End-to-end probabilistic hierarchical forecasting of large hierarchies via probabilistic top-down

大规模层次结构端到端概率层次预测:基于概率自上而下方法

Lorenzo Zambon, Dario Azzimonti, Giorgio Corani

专题命中 规划决策 :planning(abstract)

AI总结 提出e2eTD方法,仅预测少量聚合序列,通过概率自上而下采样传播到底层,实现大规模层次时间序列的快速、可扩展概率一致预测,在M5和Favorita数据集上取得最优加权缩放分位数损失。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19846 2026-07-31 econ.GN q-fin.EC 版本更新 50%

What Capital After Labor? Forecasting the Talent ROI Transition in the Human-AI Era

劳动力之后是什么资本?预测人机时代的人才ROI转型

Kwan Soo Shin

专题命中 规划决策 :planning(abstract)

AI总结 针对AI增强打破劳动时间与贡献的会计关联,本文构建从时间到产出的人才ROI预测框架,核心定理为ROI反转,并利用韩国52小时工作制案例验证了前期压力信号,预测产出型企业在2032年TFP增长领先1.5-2.0个百分点。

Comments 86 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22078 2026-07-31 cs.RO 版本更新 50%

Do World Action Models Generalize Better than VLAs? A Robustness Study

世界动作模型是否比视觉语言动作模型表现更好?一项鲁棒性研究

Zhanguang Zhang, Zhiyuan Li, Behnam Rahmati, Rui Heng Yang, Yintao Ma, Amir Rasouli, Sajjad Pakdamansavoji, Yangzheng Wu, Lingfeng Zhang, Tongtong Cao, Feng Wen, Xinyu Wang, Xingyue Quan, Yingxue Zhang

机构 * Huawei Technologies(华为技术有限公司) University of Toronto(多伦多大学)

专题命中 规划决策 :planning(abstract)

AI总结 本文比较了最新状态的VLA策略和最近发布的WAMs,在不同视觉和语言扰动下评估其性能,发现WAMs在鲁棒性上表现更强,而VLA需要大量训练数据和多样化学习目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19956 2026-07-31 econ.EM q-fin.TR 版本更新 50%

Intraday Gas Fee Heterogeneity on Ethereum: Evidence from Operational Firms

链上削峰

Irene Aldridge, Gavhar Annaeva, Leyla Beriker, Zhiheng Cai, Samyak Choudhary, Camila Godoy, Kaicheng Gong, Zitao Huang, Jonah Ji, Hetvi Kharvasiya, Heng Li, Yuxuan Li, Tianchi Ma, Qingcheng Meng, Ruiyang Shi, Ananya Shrivastava, Jiaqi Wang, Yifan Wang, Zihua Wu, Jiayang Xu, Yuheng Yan, Zijun Zeng, Bowen Zhang, Francesco Zhang

专题命中 规划决策 :planning(abstract)

AI总结 研究链上削峰策略,通过调度交易至低拥堵时段以降低Gas费用,揭示交易可延迟性和Gas强度对费用管理的影响。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14584 2026-07-31 cs.RO 版本更新 50%

A Robust Placeability Metric for Model-Free Unified Pick-and-Place Reasoning

一种针对无模型统一抓取放置推理的鲁棒放置性度量

Benno Wingender, Nils Dengler, Rohit Menon, Sicong Pan, Maren Bennewitz

机构 * Anonymous Authors(匿名作者) Benno Wingender(伯恩诺·温格德尔) Nils Dengler(尼尔·登格尔) Rohit Menon(罗希特·梅农) Sicong Pan(斯冰·潘) Maren Bennewitz(马伦·本内维茨)

专题命中 规划决策 :planning(abstract)

AI总结 本文提出一种鲁棒的概率放置性度量,通过联合评估稳定性、抓取性和空隙,实现无模型的统一抓取放置推理,并在仿真和真实机器人实验中验证其有效性。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03687 2026-07-31 cs.GT cs.MA 版本更新 50%

Fair and Efficient Investment in Public Transportation

多代理公共交通模型中的高效投资

Martin Bullinger, Edith Elkind, Kassian Köck

专题命中 规划决策 :agent(abstract)

AI总结 本文研究了多代理公共交通模型中的资源投资问题,发现近似最优解计算为NP完全,并提出多项式时间算法解决部分情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03085 2026-07-31 econ.TH 版本更新 50%

Optimal Taxation under Imperfect Trust

不完全信任下的最优税收

Emin Ablyatifov, Georgy Lukyanov

专题命中 规划决策 :agent(abstract)

AI总结 该研究在拉姆齐框架中引入公民对政府的信任因素,发现信任阈值决定最优税收政策,低信任时最优为零税收,高信任时按信任调整公共资金边际价值确定税率,为低信任环境的税收设计提供思路。

Comments This paper has been incorporated into and superseded by the substantially revised and expanded paper "Government Reputation and Fiscal Capacity," arXiv:2509.03087

详情

展开后加载摘要…

URL PDF HTML 收藏