arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-04 至 2026-08-04 共收录 388 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 112 篇

2608.02343 2026-08-04 cs.AI cs.LG 新提交 62%

Hard Constraints, Smooth Gradients: Learning Feasible Inventory Policies via Differentiable Projection

硬约束、平滑梯度:通过可微投影学习可行库存策略

Patrick Helm, Jan-Niklas Doerr, Joren Gijsbrechts, Stefan Minner

机构 * TUM School of Management, Technical University of Munich(慕尼黑工业大学TUM管理学院) Esade, Ramon Llull University(拉蒙·柳利大学ESADE商学院) Munich Data Science Institute (MDSI), Technical University of Munich(慕尼黑工业大学慕尼黑数据科学研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出嵌入可微凸优化模块的DRL策略,以处理序列决策中的硬约束,在库存规划等场景中实现了优于基准方法的成本降低与最优性表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02267 2026-08-04 cs.AI cs.LG 新提交 62%

Self-Certification of Representation Adequacy: Sequential Certification at Minimum Task Loss

表示充分性的自认证:最小任务损失下的序列认证

Zijie Huang

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文针对智能体历史压缩表示的混叠风险,提出四层自认证理论,构建序列认证策略并证明其成本渐近匹配下界,为表示充分性的认证提供了理论框架。

Comments 108 pages, 3 figures. Full proofs and appendices included. Independent researcher

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01604 2026-08-04 cs.AI cs.SE 新提交 62%

Post-Training on Office Work Improves Software Engineering: A Behavioral Account of Cross-Domain Transfer

在办公工作上进行后训练可提升软件工程能力:跨域迁移的行为视角

Logan Ritchie, Sushant Mehta, Liudas Panavas, Edwin Chen

机构 * Surge AI

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究通过在办公工作流程的长程多工具智能体任务上后训练Qwen3.5-122B-A10B,发现模型在无相关训练的软件工程基准SWE-Bench Pro上性能提升,证实长程后训练可跨域强化目标导向执行行为。

Comments 20 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01328 2026-08-04 cs.CL cs.AI cs.CV 新提交 62%

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准

Ziyan Xiao, Yinghao Zhu, Wenting Zhang, Heaju Kim, Lequan Yu

机构 * The University of Hong Kong(香港大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00175 2026-08-04 cs.LG cs.AI 新提交 62%

Inference-Time Policy Alignment for Fair Reinforcement Learning

用于公平强化学习的推理时策略对齐

Umer Siddique, Peilang Li, Conor Wallace, Yongcan Cao

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出乘法策略塑造框架,在不更新预训练RL策略参数的情况下,于推理时提升公平性,同时保留核心任务性能,适用于各类深度RL智能体。

Comments Accepted at the Reinforcement Learning Conference (RLC) 2026. 13 pages main + appendix, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17218 2026-08-04 cs.LG cs.AI 版本更新 62%

Learning Graph-Indexed Trajectory Patterns for Stochastic On-Time Arrival Routing

基于历史感知决策变换器的通用策略梯度用于图信号上的可靠路由

Yuanhang Wang, Xing Wei, Duoxiang Zhao, Zezhou Zhang, Hao Qin, Yuqi Ouyang

机构 * Sichuan University-Pittsburgh Institute(四川大学匹兹堡研究院) Sichuan University(四川大学) College of Computer Science(计算机科学学院) University College Dublin(都柏林大学) School of Electrical and Electronic Engineering(电子与电气工程学院) School of Electronics and Information Engineering(电子与信息工程学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GPG-HT框架,通过整合决策变换器和通用策略梯度优化,解决随机交通网络中考虑不确定和相关旅行时间的问题,提升可靠路由性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11671 2026-08-04 cs.CR cs.AI cs.SE 版本更新 62%

Cochise: A Reference Harness for Autonomous Penetration Testing

Cochise:自主渗透测试的参考框架

Andreas Happe, Jürgen Cito

机构 * TU Wien(维也纳技术大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.SE

AI总结 Cochise提供了一个简洁的自主渗透测试框架,支持通过SSH连接LLM代理与Linux主机,并通过分离的规划-执行架构实现可控环境,同时提供重放和分析工具以支持研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07725 2026-08-04 cs.CL cs.AI 版本更新 62%

SOD: Step-wise On-policy Distillation for Small Language Model Agents

SOD:分步式在线蒸馏用于小型语言模型代理

Qiyong Zhong, Mao Zheng, Mingyang Song, Xin Lin, Jie Sun, Houcheng Jiang, Xiang Wang, Junfeng Fang

机构 * Zhejiang University(浙江大学) Large Language Model Department, Tencent(腾讯大语言模型部门) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 针对小型语言模型中工具集成推理的稳定性问题,提出SOD分步式在线蒸馏框架,通过动态调整蒸馏强度缓解教师信号误导,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00195 2026-08-04 eess.IV cs.CV cs.LG 新提交 57%

MedSAM2-Anatomy: Training-Free Inference-Time Optimization for Musculoskeletal Segmentation

MedSAM2-Anatomy:面向肌肉骨骼分割的无训练推理时优化方法

John Garcia Henao, Nicholas Bünger, Benedikt Herzog, Cindy Guerrero Toro, Benjamin Vella, Matthias Biner, Rico Brütsch, Carmen Castroviejo Fernandez, Felix Öttl, Norman Juchler, Armando Hoch, Bettina Hochreiter, Sven Hirsch, Sebastiano Caprara

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 MedSAM2-Anatomy是一种无训练的推理时优化框架,通过融合专家模型生成的自动解剖提示,提升冻结分割模型的髋部、肩部肌肉骨骼分割性能,无需人工提示或模型重训。

Comments Original research manuscript (13 pages, 4 figures, 2 tables). No prior publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02595 2026-08-04 cs.LG 新提交 57%

onepot-Bench 0: towards lab-aware in silico chemistry benchmarks

onepot-Bench 0:面向实验室实际场景的计算机化学基准测试

Brandon Wang, Andrei S. Tyrin, Daniil A. Boiko

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本研究推出专有基准测试onepot-Bench 0,通过三个互补评估衡量语言模型在湿实验室合成化学场景下的基础能力、可靠性等,弥补现有评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02454 2026-08-04 cs.AI cs.FL cs.LO 新提交 57%

Infinite Trace Objectives with Finite Trace Techniques: Translating LTL to LTLf+

采用有限迹技术的无限迹目标:将LTL转换为LTLf+

Christoph Weinhuber, Maximilian Prokop, Giuseppe De Giacomo, Moshe Y. Vardi

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本研究提出首个从LTL到LTLf+的线性转换方法,将LTL归一化为Manna-Pnueli层次的反应片段,保留LTLf+的优势且无渐近代价,可将LTLf+技术应用于更多AI问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02379 2026-08-04 cs.AI 新提交 57%

Chess on Ice: Curling Tactical Decision-Making via Backward Induction and Deep Reinforcement Learning

冰上国际象棋:基于反向归纳与深度强化学习的冰壶战术决策

Patrick Oberlin, Matteo Cederle, Aren Karapetyan, Saverio Bolognani, Gian Antonio Susto, Florian Dörfler

机构 * ETH Zurich(苏黎世联邦理工学院) Belimo Automation AG(贝利莫自动化股份公司) University of Padova(帕多瓦大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 该研究针对冰壶战术决策的建模挑战,采用适配有限时间范围结构的DDPG算法,通过自监督学习获得的智能体在简化四石冰壶中可匹敌专家启发式策略,其评论家还能提供连续动作空间的价值估计以支持战术分析。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02295 2026-08-04 cs.AI cs.LO 新提交 57%

MechGeo: Autoformalizing and Proving Euclidean Geometry in Lean 4

MechGeo:在Lean 4中自动形式化与证明欧几里得几何

Hao Shen, Junyu Guo, Tian Cui, Yuxuan Xiao, Lihong Zhi

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 MechGeo是基于Mathlib的智能体框架,可在Lean 4中自动形式化欧几里得几何问题并构造认证证明,在43道IMO几何题及Lean-IMO-Bbench上取得显著成果,为可信形式几何提供实用基础。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02289 2026-08-04 cs.CV cs.LG 新提交 57%

Extended Field of View Analysis for VideoGAN-based Trajectory Generation

基于VideoGAN的轨迹生成的扩展视场分析

Annajoyce Mariani, Kira Maag, Hanno Gottschalk

机构 * Technical University of Berlin(柏林工业大学) Heinrich Heine University Düsseldorf(杜塞尔多夫海因里希·海涅大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究扩展了VideoGAN框架,改进语义表示与轨迹提取方式,系统研究大视场,引入评估框架,实现高效逼真轨迹生成,适配自动驾驶下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02100 2026-08-04 cs.HC cs.LG 新提交 57%

From Information to Delegation: Mapping Human-AI Financial Decision Making

从信息到授权:人机金融决策的映射

Iman Munire Bilal, Yingcan Carol Wang, Ajan Raj, Filippo Giovagnini, Pranav Tewari, Yuwei Zhang, Mei-Chen Zoe Liou, Qamar Zaman

专题命中 规划决策 :agentic(abstract);分类 cs.LG

AI总结 该研究提出结合意图与委托决策权的行为测量框架,分析美印6304名用户的150万次ChatGPT和Gemini交互,发现金融服务是AI重要场景,消费者多使用AI获取信息,委托执行罕见,为代理性AI过渡建立行为基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02026 2026-08-04 cs.AI 新提交 57%

HPFA: Hypergraph-Based Paired Failure Attribution for LLM Reasoning

HPFA:基于超图的大语言模型推理配对失败归因

Runchuan Zhu, Hongbin Lai, Bowen Jiang, Junrui Zhang, Zhangheng LI, Ostap Kilbasovych, Junyuan Hong

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 本研究针对LLM推理的失败归因缺陷,提出HPFA框架,通过超图配对分析高效定位根本原因,提升归因准确率与效率,训练的归因器可改善推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01926 2026-08-04 cs.AI 新提交 57%

ProWorld: Progress-Aware Hyperbolic World Models for Long-Horizon Visual Goal Reaching

ProWorld:用于长程视觉目标到达的感知进展双曲世界模型

Zihan Liu, Yuzhe Zhuang, Yuanzu Li, Wanshuang Gou, Jiahong Liu, Min Zhou, Menglin Yang

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文针对长程视觉目标到达任务中视觉世界模型的进展感知与轨迹区分难题,提出双曲视觉世界模型ProWorld,经实验相较LeWM实现9.67的平均绝对成功率提升。

Comments 24 pages, 14 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01827 2026-08-04 cs.CV cs.AI 新提交 57%

DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents

DeepVoyager-VL:为长视野多模态智能体激励视觉在环搜索

Huanyao Zhang, Jiepeng Zhou, Runhao Zhao, Yanzhe Shan, Jiaoyang Chen, Bowen Zhou, Bo Li, Fang Wang, Jialong Wu, Zhengwei Tao, Lang Mei, Xiaohan Yu, Liyan Liu, Chong Chen, Wentao Zhang

机构 * PKU(北京大学) HKUST(GZ)(香港科技大学(广州)) NUDT(中国人民解放军国防科技大学) OUC(中国海洋大学) HITSZ(哈尔滨工业大学(深圳)) Huawei Cloud BU(华为云业务部)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 针对现有多模态深度搜索忽视视觉中间推理作用的局限,提出DeepVoyager-VL框架,构建多模态事件图合成数据,设计智能体框架实现主动视觉获取,经10个基准实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01753 2026-08-04 cs.CV cs.AI 新提交 57%

Can Urban Blight Be Accessed with Vision-language Models: A Case Study in Detroit

能否用视觉-语言模型评估城市衰败:以底特律为例

Xiaohao Yang, Aohua Tian, Derek Van Berkel, Xu Qiang, Mark Lindquist

机构 * School for Environment and Sustainability(环境与可持续发展学院) School of Information(信息学院) University of Michigan(密歇根大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本研究以底特律为案例,提出基于开源大视觉-语言模型的多视角住宅衰败评估框架,经实验验证该框架可低成本跟踪住房状况,为传统调查提供补充。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01667 2026-08-04 cs.AI 新提交 57%

TCPO: Turn-Level Credit Policy Optimization

TCPO:回合级信用策略优化

Sicong Liao, Zhi Chen, Yaohua Tang

机构 * Moore Threads AI(摩尔线程人工智能)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 该研究针对验证器引导多回合强化学习的信用分配问题,提出TCPO方法,在多类任务和模型上提升了LLM的多回合推理与智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01178 2026-08-04 cs.CV cs.AI 新提交 57%

DynActiveGS: Active Gaussian Splatting for Dynamic Scene Reconstruction

DynActiveGS:面向动态场景重建的主动高斯溅射方法

Hongbo Duan, Pengting Luo, Chengzhi Zhao, Yuanhao Chiang, Fangming Liu, Xueqian Wang

机构 * Tsinghua University, Shenzhen International Graduate School(清华大学深圳国际研究生院) Huawei Technologies Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 DynActiveGS是基于3DGS的动态感知主动重建框架,通过分解不确定性实现动态场景的鲁棒主动重建,在多指标上优于现有基线。

Comments Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00886 2026-08-04 cs.SE econ.GN math.OC q-fin.EC 新提交 57%

Joint Optimization of Human Headcount and Stochastic AI Resource Capacity

人力资源配置与随机AI资源容量的联合优化

Marco Montes de Oca

专题命中 规划决策 :planning(abstract);分类 cs.SE

AI总结 本文针对生成式AI工具带来的成本压力,构建联合分配模型优化人力资源与AI令牌容量,得出相关最优解及替代关系反转的实证检验条件。

Comments 16 pages, 4 figures. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02375 2026-08-04 math.OC cs.LG cs.SY eess.SY 新提交 57%

A Spectral Filtering Approach to Regret Analysis of Distributed Online Control for Linear Dynamical Systems

Ting-Jui Chang

专题命中 规划决策 :agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01864 2026-08-04 stat.AP cs.LG physics.ao-ph 新提交 57%

Probabilistic Deep Learning for Drought Forecasting: Role of Internal Climate Variability

用于干旱预测的概率深度学习:内部气候变率的作用

Henri Funk, Cornelia Gruber, Göran Kauermann, Helmut Küchenhoff, Magdalena Mittermeier

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究提出结合大型气候模式集合内部变率的概率深度学习干旱预测框架,构建更优的风险感知干旱边界,提升干旱风险评估的准确性与参考价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00831 2026-08-04 physics.med-ph cs.AI 新提交 57%

Anticipatory Digital Twins for Online Head-and-Neck Adaptive Proton Therapy via Foundation-Model Registration

基于 foundation-model 配准的头颈在线自适应质子治疗的 anticipatory 数字孪生技术

Yizhou Wu, Yuheng Li, Xiaofeng Yang, Chih-Wei Chang

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本研究提出基于 foundation-model 配准的数字孪生框架,通过跨患者迁移解剖变化合成预测CT,可提升头颈自适应质子治疗的匹配度,无需重复成像。

Comments Accepted for publication in the Proceedings of the 29th International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI 2026), Workshop on Digital Twins for Healthcare (DT4H)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01183 2026-08-04 cs.AI cs.GT cs.MA math.DS nlin.AO 新提交 57%

Co-evolution of social reward and punishment under institutional interventions

制度干预下社会奖惩的协同演化

Van An Nguyen, Vuong Khang Huynh, Hoai Thuong Nguyen, Duc Tin Duong, An Nguyen Gia, Tat Kien Nguyen, Huu Loi Bui, My Nguyen Tra, Ho Nam Duong, Ba Thanh Phan, Thanh Vo, Dinh Anh Trung Hoang, Adeela Bashir, Zhao Song, Manh Hong Duong, Le Hong Trang, The Anh Han

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 该研究在社会困境中结合同伴与制度激励,通过理论分析与模拟揭示:同伴惩罚促合作、同伴奖励增福利,制度性奖励同伴激励策略效果显著,惩罚同伴激励策略则损害社会收益,为制度设计提供了原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27508 2026-08-04 cs.RO cs.AI 交叉投稿 57%

Corrigible Assistance in One Round: Pragmatic-Pedagogic Best Response

单轮可纠正辅助:实用-教学最佳响应

Elle Lazarski, Jaime Fernández Fisac

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文针对信息不对称下的人机辅助博弈,提出实用-教学最佳响应方法,可单轮解决目标不确定性,克服逆最优控制的推理上限,通过协作积木搭建示例验证了方法有效性。

Comments World Symposium on the Algorithmic Foundations of Robotics (WAFR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22186 2026-08-04 cs.AI 版本更新 57%

Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning

解构离策略比率:用于异步强化学习的熵缩放信任区域

Guanqun Zhao, Zijun Xie, Binbin Zheng, Enlei Gong, Jiafeng Lu, Yehan Yang, Aoqi Hu, Zeyu Chen

机构 * Baidu(百度)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 研究异步强化学习中离策略数据问题,提出熵缩放信任区域(ESTR)方法,通过令牌局部熵缩放离策略偏差,无需辅助前向传递等,在多任务和基准测试中优于现有异步方法,提升训练-推理一致性与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09806 2026-08-04 cs.DL cond-mat.mtrl-sci cs.AI 版本更新 57%

An Autonomous Scientific Knowledge Generation Framework for AI-Driven Scientific Discovery

一种用于人工智能驱动科学发现的自主科学知识生成框架

Dibakar Datta

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 该研究提出自主科学知识生成框架,整合多种技术将科学出版物转化为适用于人工智能的知识库,以电光材料为例进行验证,实现从文献到知识库的转变,为人工智能驱动的科学发现提供了可扩展、领域独立的基础。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05238 2026-08-04 cs.AI 版本更新 57%

Branch-JEPA: Finite-Support Predictive Distributions for JEPA World Models

MoP-JEPA:用于随机JEPA世界模型的硬分配预测器混合架构

Zhi Song, Ximing Xing, Zhenchao Tang, hanbo Huang, Jiehui Huang, Weilong Yan, Tianxu Lv, Minghao Yang, Zhongzheng Niu, Bing He, Lusheng Wang, Jianhua Yao

机构 * City University of Hong Kong, China(香港城市大学) Tencent, China(腾讯)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对传统JEPA在随机环境下的状态坍缩问题,提出硬分配预测器混合的MoP-JEPA,可收敛到转移分布量化器,在OGBench测试中规划性能远超基线方案。

详情

展开后加载摘要…

URL PDF HTML 收藏