arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-21 至 2026-07-21 共收录 340 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 103 篇

2607.10645 2026-07-21 cs.CL cs.MA cs.SI 版本更新 57%

MafiaScope: Non-Invasive, Time-Resolved Belief Probing for LLM Agents in Social Deduction Games

MafiaScope:社交推理游戏中对大语言模型智能体的非侵入性、时间分辨信念探测

Ilia Karpov

机构 * HSE University(俄罗斯高等经济研究大学)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 研究社交推理游戏中LLM智能体信念探测问题,提出MafiaScope测试平台,通过结构化问题让智能体私下作答并自动评分,可视化呈现信念轨迹,以DeepSeek为例进行研究,得出相关校准误差等结果并开源相关内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26548 2026-07-21 cs.CR cs.LG 版本更新 57%

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

SEC-bench Pro:语言模型能解决长周期软件安全任务吗?

Hwiwon Lee, Jiawei Liu, Dongjun Kim, Wubing Xia, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出SEC-bench Pro基准,通过三阶段流程构建包含V8和SpiderMonkey共183个已验证漏洞的测试集,评估前沿语言模型在长周期漏洞狩猎任务中的表现,发现最高成功率仅48.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29007 2026-07-21 cs.CL 版本更新 57%

Taxonomy-Targeted Error Generation for Quantitative Reasoning

错误作为透镜:通过合成误解生成探究LLM推理

Xinming Yang, Jun Li

机构 * CUNY Graduate Center(纽约大学研究生中心) CUNY Queens College(纽约市立大学皇后学院)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 提出一个框架,通过生成针对Bloom分类学五类错误的合成误解,以诊断LLM推理能力,并发现目标错误生成比自由形式错误生成更难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25739 2026-07-21 cs.LG cs.GT stat.ML 版本更新 57%

The Behavioral Credibility Trilemma: When Calibrated Autonomy Becomes Impossible

行为可信度三难困境:当校准自主性变得不可能

Lauri Lovén, Nam Do, Hassan Mehmood, Dinesh Kumar Sah, Sasu Tarkoma

机构 * Future Computing Group University of Oulu(奥卢大学未来计算组) Department of Computer Science University of Helsinki(赫尔辛基大学计算机科学系)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文证明,在理性监督下,当某些任务超出智能体的可靠能力时,任何具有置信门控自主性的强化学习策略都无法同时实现最大帮助性、最优校准和完全自主性,即行为可信度三难困境。

Comments 49 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12111 2026-07-21 cs.AI cs.DS 版本更新 57%

Adaptive Multi-Round Allocation with Stochastic Arrivals

自适应多轮分配与随机到达

Yuqi Pan, Davin Choo, Haichuan Wang, Milind Tambe, Alastair van Heerden, Cheryl Johnson

机构 * Harvard University(哈佛大学) University of Witwatersrand(沃特沙兰大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究了受适应性网络招募启发的序列资源分配问题,提出基于截断概率生成函数的动态规划算法,实现多项式复杂度的多轮分配方案,并分析了模型误差下的鲁棒性。

Comments Accepted into ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15783 2026-07-21 cs.LG 57%

Similarity-Based Bike Station Expansion via Hybrid Denoising Autoencoders

基于相似性的自行车站点扩展:混合去噪自编码器

Oluwaleke Yusuf, M. Tsaqif Wismadi, Adil Rasheed

机构 * Department of Engineering Cybernetics Norwegian University of Science(工程 cybernetics 系 Norwegian 科学大学) Department of Architecture(建筑系) Planning Norwegian University of Science(规划 Norwegian 科学大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出利用现有站点模式指导扩展决策的方法,通过混合去噪自编码器学习潜在表示,提升空间聚类和分配效果,验证了在数据受限环境下扩展选址的鲁棒性。

Comments 10 pages, 9 figures. Code available at https://github.com/Outsiders17711/TCB-SimilarityAE-Expansion

Journal ref Proc. Cognitive Models and Artificial Intelligence Conference (AICCONF 2026) 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06009 2026-07-21 cs.LG 版本更新 57%

Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments

通过扩展到100万个并行环境防止PPO学习停滞

Michael Beukman, Khimya Khetarpal, Zeyu Zheng, Will Dabney, Jakob Foerster, Michael Dennis, Clare Lyle

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 通过扩展PPO到100万个并行环境,有效解决学习停滞问题,实现性能持续提升。

Comments Accepted to RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19244 2026-07-21 cs.LG 版本更新 57%

Interpret Policies in Deep Reinforcement Learning using SILVER with RL-Guided Labeling: A Model-level Approach to High-dimensional and Multi-action Environments

使用带强化学习引导标记的SILVER解释深度强化学习中的策略:一种针对高维多动作环境的模型级方法

Yiyu Qian, Su Nguyen, Chao Chen, Qinyue Zhou, Liyuan Zhao

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 研究针对深度强化学习缺乏可解释性问题展开,提出带强化学习引导标记的SILVER,通过提取特征、进行归因、生成数据集及训练代理模型来解释策略,在雅达利环境评估并经人体研究验证,提升透明度与人类理解,推进可解释强化学习发展。

Comments Some co-authors do not agree with uploading this paper to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17680 2026-07-21 cs.AI cs.CY 57%

Simulating multiple human perspectives in socio-ecological systems using large language models

利用大语言模型模拟社会-生态系统的多重人类视角

Yongchao Zeng, Calum Brown, Ioannis Kyriakou, Ronja Hotz, Mark Rounsevell

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出HoPeS框架,利用大语言模型模拟社会-生态系统的多重视角,通过智能体角色转换实现不同利益相关者视角的探索与整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03066 2026-07-21 cs.LG stat.ML 版本更新 57%

Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function

Sign-SZPO:具有未知链接函数的基于可证明偏好的强化学习

Qining Zhang, Lei Ying

机构 * University of Michigan(密歇根大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 研究具有未知链接函数的基于偏好的强化学习问题,提出Sign-SZPO零阶策略优化算法,该算法仅估计价值函数差的符号来构建更新方向,可证明收敛到平稳策略,实证显示其在链接函数错误指定下具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18447 2026-07-21 cs.LG 版本更新 57%

Supervised Reward Inference

监督奖励推理

Will Schwarzer, Jordan Schneider, Philip S. Thomas, Scott Niekum

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究人类通过多样行为表明目标时的奖励推理问题,提出监督奖励推理(SRI)方法,证明其理论上渐近贝叶斯最优,实证上在相关基准和机器人任务中表现出色,还展示了框架对动作和目标预测的通用性。

Comments 35 pages, 8 figures. Updated with public code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16343 2026-07-21 econ.TH 新提交 50%

When Pricing Agents Meet Buying Agents: Personalized Pricing and Verifiable Trust

当定价代理遇到采购代理:个性化定价与可验证信任

Chupeng Xie

专题命中 规划决策 :agent(abstract)

AI总结 研究卖家和买家委托不同代理时的个性化定价,解决相关子博弈,探讨信号与执行证明的影响,指出验证在不同情况下的作用及对交易和关系资本的影响,将AI测量等联系起来,不把信任等简单化处理。

Comments 67 pages, 4 figures, 1 table. Includes the main paper and online appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17649 2026-07-21 econ.GN q-fin.EC 新提交 50%

Ageing in which place? Spatial analytical framework for evaluating ageing-in-place practices

老龄化发生在哪里?评估就地养老实践的空间分析框架

Yong Tu, Yaopei Wang, Yumeng Yang, Yi Fan

专题命中 规划决策 :planning(abstract)

AI总结 研究通过比较美、日、新三地的就地养老模式,提出空间分析框架来评估新加坡养老政策有效性,并证明其模式可推广至全球城市,为老年友好型城市规划提供见解。

Journal ref Health & Place, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18075 2026-07-21 cs.RO 新提交 50%

Technical Design Review of Duke Robotics Club's Oogway & Crush: AUVs for RoboSub 2026

杜克机器人俱乐部的Oogway和Crush:用于2026年RoboSub的自主水下航行器技术设计回顾

Patrick Zheng, Saagar Arya, Hung Le, Mathew Chu, Nathanael Ren, Niko Weaver, Isabella Chen, Jill Wang, Raine Cheng, Siddharth Kini, Avrick Altmann, Srinath Iyer, Ivan Chen, Ian Suh, Parker Jones, Pierson Jones, Sebastian deSouza, Suhaani Sriram, Suvas Aggarwal

机构 * Duke Robotics Club(杜克大学机器人俱乐部)

专题命中 规划决策 :planning(abstract)

AI总结 杜克机器人俱乐部为2026年RoboSub设计的自主水下航行器Oogway和Crush,通过对机械、电气、软件子系统的改进及测试设施投资,扩展策略覆盖RoboSub四个设计目标,实现更广泛任务尝试并保持可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17646 2026-07-21 cs.RO 新提交 50%

Configuration-Induced Passive Self-Rotation for Perception-Enhanced Autonomous Flight

用于感知增强自主飞行的构型诱导被动自旋转

Xurui Liu, Miao Wang, Tianyu He, Linrui Yang, Xiaobin Zhou

机构 * School of Robotics and Automation, Nanjing University(南京大学机器人与自动化学院)

专题命中 规划决策 :planning(abstract)

AI总结 研究受限杂乱环境中自主飞行因传感器视野受限的问题,提出构型诱导被动自旋转三旋翼飞行器,利用后臂构型参数调节工作点,开发分层自主框架,经大量实验验证该方法对感知增强自主飞行有效。

Comments 9 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17476 2026-07-21 cs.RO 新提交 50%

Disturbance-Aware Flight for Aerial Robots in Narrow Space

狭窄空间中无人机的干扰感知飞行

Lei Qiang, Tianyu He, Chenyang Sun, Xurui Liu, Miao Wang, Xiaobin Zhou

机构 * School of Robotics and Automation, Nanjing University(南京大学机器人与自动化学院)

专题命中 规划决策 :planning(abstract)

AI总结 针对无人机在狭窄空间自主飞行因干扰和空间受限面临的挑战,提出干扰感知规划与控制框架DAPCF,通过双环观测器估计干扰、引入干扰风险函数及设计MDNMPC,使四旋翼能穿越狭窄隧道,性能优于人类飞行员。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17143 2026-07-21 cs.DC 新提交 50%

EdgeCoInfer: Hierarchical Collaborative Inference for On-Device Multimodal Large Models

EdgeCoInfer:用于设备端多模态大模型的分层协作推理

Lin Tan, Songtao Guo, Mingyan Li, David K. Y. Yau

专题命中 规划决策 :agent(abstract)

AI总结 针对边缘环境中多模态大模型面临的挑战,提出EdgeCoInfer框架,通过模型间功能模块共享和模型内细粒度划分实现粒度自适应部署,采用混合进化分层强化学习解决问题,实验表明该框架能提高任务完成率并降低系统成本和内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16787 2026-07-21 cs.CV 新提交 50%

HTT-Net: Hierarchical Text-guided Transition Modeling for Surgical Video Phase Recognition

HTT-Net:用于手术视频阶段识别的分层文本引导过渡建模

Kunjie Deng, Jinghui Zhang, Weidong Chen, Ganbin Li, Xiangjun Lyu, Zhendong Mao, Yingchi Yang

机构 * School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) Department of General Surgery, Beijing Friendship Hospital, Capital Medical University(首都医科大学附属北京友谊医院普通外科) Chinese PLA General Hospital(中国人民解放军总医院)

专题命中 规划决策 :workflow(abstract)

AI总结 针对手术视频阶段识别难题,提出HTT-Net,通过构建分层手术语义记忆,利用过渡感知片段构建和校准方法,引入结构化手术语义知识,实验验证其能有效实现手术视频的稳健阶段识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16508 2026-07-21 cs.RO cs.SY eess.SY 新提交 50%

Differentiable Reinforcement Learning for Path Tracking by an Agile Fish-Like Robot

用于敏捷类鱼机器人路径跟踪的可微强化学习

Prashanth Chivkula, Kartik Loya, Venkata Ravindhra Reddy Varikuti, Phanindra Tallapragada

机构 * Clemson University(克莱姆森大学)

专题命中 规划决策 :planning(abstract)

AI总结 研究类鱼机器人控制和运动规划难题。开发高效模拟平台,用PID控制结合时间反向传播和课程训练学习增益,实现运动控制与路径跟踪,策略应用于物理平台效果良好。

Comments Accepted to IROS 2026, 9 pages, 12 Images, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16492 2026-07-21 cs.CV 新提交 50%

WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding

WeedExpert-R1:通过强化学习激励多模态大语言模型进行精准杂草定位的植物推理

Zonglin Yang, Wei-Zhen Liang, Nevin Lawrence, Xin Qiao, Benjamin Riggan, Chi-En Chiang, Fuchen Li

机构 * University of Nebraska-Lincoln(内布拉斯加大学林肯分校) Panhandle Research and Extension Center(狭长地带研究与推广中心)

专题命中 规划决策 :workflow(abstract)

AI总结 研究针对精准杂草控制问题,提出通过可验证奖励学习视觉基础植物推理的WeedExpert-R1模型,利用特定合成管道生成数据微调,经群体相对策略优化训练。该模型在多种杂草测试中表现优异,优于同类模型,展现开放词汇能力和跨区域部署潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16219 2026-07-21 cs.CY 新提交 50%

MDAF: A Multi-Dimensional Annotation Framework for Automated Foreign Policy Analysis

MDAF:一种用于自动外交政策分析的多维注释框架

Songruowen Ma, Songting Ding, Fangyin Zhou, Jörg Friedrichs

专题命中 规划决策 :workflow(abstract)

AI总结 研究针对政府网站外交政策文本未被充分利用的问题,提出MDAF框架,集成大语言模型工作流程,应用于五眼联盟国家与中国相关文本,实现文本识别、信息提取和事件分类自动化,支持跨国比较等,为外交政策分析等做贡献。

Comments 32 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17174 2026-07-21 quant-ph math.LO 新提交 50%

QBism Logic

QB主义逻辑

Kenji Tokuo

专题命中 规划决策 :agent(abstract)

AI总结 研究基于QB主义对量子理论的解释进行逻辑形式化,通过引入相关语言和证明定理,将无动态算子片段转化为一阶公式,归约有效性,还表明有限维量子理论可通过SIC等实现框架并满足相关条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16668 2026-07-21 physics.soc-ph 新提交 50%

Nonuniform and inequitable healthcare accessibility losses during flooding-amplified congestion across US cities

美国城市洪灾加剧拥堵期间医疗可及性的非均匀和不公平损失

Raviraj Dave, Danish Mansoor Tantary, Dongqin Zhou, Udit Bhatia, Auroop R. Ganguly

专题命中 规划决策 :planning(abstract)

AI总结 研究美国30个人口最多城市洪灾加剧拥堵时医疗可及性损失,发现其受多种因素影响,损失程度不一,还加剧空间不平等,针对性防洪方法比通用策略更有效,能助城市从类似地区学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00261 2026-07-21 cs.RO 版本更新 50%

Task-Conditioned Uncertainty Costmaps for Legged Locomotion

任务条件不确定性成本图用于腿部运动

Kartikeya Singh, Christo Aluckal, Romeo Orsolino, Karthik Dantu

机构 * DRONES Lab, University at Buffalo, NY, USA(无人机实验室,布法罗大学,纽约州,美国) Ocado Technology, UK(Ocado技术公司,英国)

专题命中 规划决策 :planning(abstract)

AI总结 本文提出基于任务条件不确定性的成本图方法,用于腿部运动中的动态可行性保持,通过不确定性检测提升路径规划的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26884 2026-07-21 stat.AP 版本更新 50%

Improving Bias Correction Methods for Daily Rainfall Using a Markov Chain Approach

利用马尔可夫链方法改进每日降雨的偏倚校正方法

Danny Parsons, David Stern, Mouhamadou Bamba Sylla, James Musyoka, John Bagiliko, Lily Clements, John Mupuro, Denis Ndanguza

专题命中 规划决策 :planning(abstract)

AI总结 本文提出通过马尔可夫链改进降雨偏倚校正方法,以提升降雨时间结构的准确性,通过两种新方法MC LOCI和MC QM在赞比亚数据中验证了其在降雨持续性、起始和湿润干燥时段特征上的改进。

Comments 44 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10497 2026-07-21 cs.ET quant-ph 版本更新 50%

Entangled happily ever after: Wedding reception seating mapped to classical and quantum optimizers

纠缠的幸福结局:婚礼接待座位安排映射到经典和量子优化器

Karie A. Nicholas, Vikram Khipple Mulligan

专题命中 规划决策 :planning(abstract)

AI总结 本文将婚礼座位安排问题映射到成本函数网络,用经典和量子优化算法解决,发现经典方法在某些情况下更优,提供基准集和代码用于性能评估。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14553 2026-07-21 physics.flu-dyn physics.comp-ph 版本更新 50%

Learning to traverse convective flows at moderate to high Rayleigh numbers

在中等至高雷诺数下学习穿越对流流动

Ao Xu, Hua-Lin Wu, Ben-Rui Xu, Heng-Dong Xi

专题命中 规划决策 :agent(abstract)

AI总结 研究了在Prandtl数Pr=0.71和单元长宽比Γ=4的Rayleigh-Bénard对流中,自驱动惯性颗粒的导航问题,通过强化学习控制器选择推进加速度,发现随着雷诺数Ra增加,成功率变化趋势由急剧转向渐进,同时推进能量需求降低,POD分析揭示了流体重组的影响。

Comments 37 pages, 21 figures

Journal ref Journal of Fluid Mechanics 2026, 1039, A18

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02172 2026-07-21 physics.soc-ph 50%

Unveiling Urban Mobility Patterns: A Data-Driven Analysis of Public Transit

揭示城市出行模式:基于数据的公共交通分析

Oluwaleke Yusuf, Adil Rasheed, Frank Lindseth

专题命中 规划决策 :planning(abstract)

AI总结 本文通过分析详尽的历史公共交通数据,结合时间与地理空间元数据,利用机器学习方法提升交通数字孪生的动态预测能力,以提高城市交通系统的效率与可持续性。

Journal ref Proc. International Conference on Control, Automation and Diagnosis (ICCAD 2024) 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05280 2026-07-21 cs.CY math.OC physics.soc-ph 50%

Exploring near-optimal energy systems with stakeholders: a novel approach for participatory modelling

探索接近最优的能量系统与利益相关者:一种参与建模的新方法

Oskar Vågerö, Koen van Greevenbroek, Aleksander Grochowicz, Maximilian Roithner

专题命中 规划决策 :planning(abstract)

AI总结 本文提出一种参与式建模新方法,通过互动界面让利益相关者参与能量系统设计,探讨其在北极偏远定居点的应用及决策复杂性。

Comments 24 pages, 6 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17576 2026-07-21 cs.CV 版本更新 50%

LoGSAM: Parameter-Efficient Cross-Modal Grounding for MRI Segmentation

LoGSAM: 用于MRI分割的参数高效跨模态接地

Mohammad Robaitul Islam Bhuiyan, Sheethal Bhat, Melika Qahqaie, Andreas Maier, Tri-Thien Nguyen, Paula Andrea Pérez-Toro, Tomás Arias-Vergara

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität, Erlangen, Germany(德国埃朗根-纽伦堡大学模式识别实验室) Siemens Healthineers, Erlangen, Germany(德国埃朗根西门子医疗)

专题命中 规划决策 :planning(abstract)

AI总结 LoGSAM通过将放射科医生的语音转录为文本提示,利用预训练基础模型实现MRI肿瘤的高效分割,采用LoRA微调提升领域适应性,达到80.32%的Dice分数。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏