arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-21 至 2026-07-21 共收录 117 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 8 篇

2602.19021 2026-07-21 cs.CR 版本更新 85%

Trustworthy AI LLM Scalability Risk Index (LSRI): A Cybersecurity Framework Assessing Agentic-AI Security & Software Model Supply Chain Safety Boosting AI-Generated Malware Defense & Explainability Mitigating Emerging Risks of Generative AI

大语言模型在代理AI中的可扩展性风险与模型供应链安全

Kiarash Ahi, Vaibhav Agrawal, Saeed Valizadeh

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 本文研究了大语言模型在代理AI中的可扩展性风险及模型供应链安全问题,提出LSRI指数和模型供应链框架,以提升安全关键环境下的LLM部署安全性。

Comments Accepted for publication in Journal of Computer Information Systems (2026). DOI: 10.1080/08874417.2026.2624670

Journal ref Journal of Computer Information Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25624 2026-07-21 cs.CR cs.AI cs.CL cs.LG 版本更新 83%

STAC: When Innocent Tools Form Dangerous Chains for LLM Agents

STAC:当无害工具形成危险链以劫持LLM代理

Jing-Jing Li, Jianfeng He, Chao Shang, Devang Kulshreshtha, Xun Xian, Yi Zhang, Hang Su, Sandesh Swamy, Yanjun Qi

机构 * AWS AI Labs(AWS人工智能实验室) UC Berkeley(伯克利大学)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 STAC通过多轮工具链攻击揭示LLM代理的安全漏洞,提出基于推理的防御策略,显著降低攻击成功率。

Comments Long version with 15 pages in main draft and a total of 39 pages including references and appendix. Data and code \url{https://github.com/amazon-science/MultiTurnAgentAttack}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32017 2026-07-21 cs.LG cs.AI 版本更新 81%

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

TRIAGE:面向智能体强化学习的角色类型化信用分配

Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Sen Na, Zhipeng Wang, Alborz Geramifard

机构 * LinkedIn Corporation(领英公司) Harvard University(哈佛大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出TRIAGE框架,通过角色类型化信用分配修正GRPO仅依赖结果信用的盲点,在ALFWorld等任务中提升成功率并减少交互步数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01549 2026-07-21 cs.CL cs.SE 版本更新 76%

Octopus: On-device language model for function calling of software APIs

章鱼:用于软件API函数调用的设备端语言模型

Wei Chen, Zhiyuan Li, Mingyuan Ma

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 工具调用 :function calling(title);分类 cs.CL、cs.SE

AI总结 研究利用设备端大语言模型调用软件API,通过编译数据集微调不同参数模型,提升其API交互能力,提出条件掩码技术和新基准,经微调的Octopus模型在API调用上性能超GPT-4,推动自动化软件开发和API集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02528 2026-07-21 q-fin.GN cs.CY cs.LG 版本更新 57%

Auditing Asset-Specific Preferences in Financial Large Language Models: Evidence from Bitcoin Representations and Portfolio Allocation

审计金融大语言模型中的资产特定偏好:来自比特币表征与投资组合配置的证据

Wenbin Wu

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 本研究通过三级审计协议,发现大型语言模型对比特币存在框架依赖的偏好,并识别出模型内部一个可因果干预的比特币选择性特征,该特征能显著影响下游投资组合配置。

Comments 31 pages, 6 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30664 2026-07-21 cs.AI 版本更新 57%

Structure-Induced Information for Rerooting Levin Tree Search

结构信息用于重定根莱文树搜索

Jake Tuero, Michael Buro, Laurent Orseau, Levi H. S. Lelis

机构 * Department of Computing Science, University of Alberta, Edmonton, Canada. Alberta Machine Intelligence Institute (Amii), Edmonton, Canada. Google DeepMind, London, United Kingdom.

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出三种重定根器设计,利用结构信息隐式分解子目标,提升策略树搜索的可扩展性和效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16842 2026-07-21 cs.LG cond-mat.dis-nn cond-mat.stat-mech cs.SY eess.SY physics.bio-ph 版本更新 57%

Stochastic Resetting Accelerates Reinforcement Learning Beyond Random Search

随机重置加速强化学习中的策略收敛

Jello Zhou, David J. Schwab, Vudtiwat Ngampruetikorn

机构 * Biophysics Program, Stanford University(斯坦福大学生物物理项目) School of Physics, University of Sydney(悉尼大学物理学院) National Institute for Theory and Mathematics in Biology, Northwestern University(生物理论与数学国家研究所,西北大学) The University of Chicago(芝加哥大学) Princeton-CUNY Center for the Physics of Biological Function, The Graduate Center, CUNY(普林斯顿-纽约大学生物物理功能中心,纽约大学研究生中心)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 研究探讨随机重置与强化学习的交互,发现其能加速策略收敛,通过截断长轨迹提升价值传播,为强化学习提供新的优化机制。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14447 2026-07-21 cs.CY 版本更新 50%

Do Generative AI Assistants Respect robots.txt? Tracing Web Access Beyond Visible Answers

生成式人工智能助手是否遵守robots.txt?追踪可见答案之外的网络访问

Gabriel Lopez-Fonseca, David Rodriguez, Stefan Bechtold, Jose M. Del Alamo

专题命中 工具调用 :agent(abstract)

AI总结 研究探讨生成式AI助手是否遵守robots.txt,对十个有网络搜索功能的AI助手进行实证研究,通过特定配置和条件评估其对http URL规则的遵守情况,发现不同助手差异大,结果引发相关法律治理问题及对更新标准的需求。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 39 篇

2509.00446 2026-07-21 cs.AI 版本更新 85%

Benchmarking Agentic Newswriting via Journalistic Workflows

通过新闻工作流程对智能新闻写作进行基准测试

Yen-Che Chien, Kuang-Da Wang, Wei-Yao Wang, Wen-Chih Peng

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Sony Group Corporation(索尼集团)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究智能体在新闻写作工作流程中的表现,引入NEWSAGENT基准,给定写作指令和部分材料,评估智能体搜索、选信息及改草稿能力,发现其检索事实尚可,但规划和叙事整合有困难,为评估智能体能力提供现实测试平台。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15867 2026-07-21 hep-ph hep-ex 版本更新 83%

HEPTAPOD: Orchestrating High Energy Physics Workflows Towards Autonomous Agency

HEPTAPOD:编排高能物理工作流程以实现自主智能体

Tony Menzo, Alexander Roman, Sergei Gleyzer, Konstantin Matchev, George T. Fleming, Stefan Höche, Stephen Mrenna, Prasanth Shyamsundar

专题命中 规划决策 :agent(abstract);tool use(abstract);planning(abstract);workflow(abstract)

AI总结 研究针对高能物理工作流程,介绍HEPTAPOD编排框架,能集成外部大语言模型,使其与特定领域工具交互构建管理HEP管道,通过案例展示其能力,为高能物理中人工参与及智能体辅助工作流程奠定基础。

Comments 47 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14247 2026-07-21 cs.RO cs.SY eess.SY 版本更新 82%

Path Planning Optimisation for SParse, AwaRe and Cooperative Networked Aerial Robot Teams (SpArC-NARTs): Optimisation Tool and Ground Sensing Coverage Use Cases

稀疏、感知与协作网络化空中机器人团队(SpArC-NARTs)的路径规划优化:优化工具与地面传感覆盖应用案例

Maria Conceição, António Grilo, Meysam Basiri

机构 * Institute for Systems and Robotics(系统与机器人研究所)

专题命中 规划决策 :planning(title,abstract);agent(abstract)

AI总结 本文提出了一种用于稀疏、感知和协作网络化空中机器人团队的路径规划工具,通过考虑环境信息、能量限制和通信约束,优化任务目标并提升群体协作效率。

Comments 28 pages, published in Robotics and Autonomous Systems (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30362 2026-07-21 cs.RO cs.AI cs.CV 版本更新 79%

ReactiveBFM: Reactive Closed-Loop Motion Planning Towards Universal Humanoid Whole-Body Control

ReactiveBFM:面向通用人形全身控制的反应式闭环运动规划

Xiao Chen, Weishuai Zeng, Xiaojie Niu, Zirui Wang, Jianan Li, Huayi Wang, Furui Xu, Jiahe Chen, Weixiang Zhong, Lihe Ding, Kailin Li, Jiangmiao Pang, Tai Wang, Tianfan Xue, Jingbo Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出ReactiveBFM,一种实时闭环规划控制框架,通过调度前缀采样课程和异步重规划机制,解决生成式运动规划器与高频跟踪之间的延迟不匹配和暴露偏差问题,实现人形机器人全身协调和零样本反应式运动。

Comments Project page: https://xiao-chen.tech/reactivebfm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09540 2026-07-21 cs.IR 版本更新 78%

From Raw IDs to Semantic Planning: How Recommender Systems Utilize Information at Scale

从原始ID到语义规划:推荐系统如何大规模利用信息

Changhong Jin, Shiqiu Yang, Roger Zhe Li, Yingjie Niu, Aghiles Salah, Mete Sertkan, Zheng Ju, Xingsheng Guo, Huifeng Guo, Ruihai Dong, Barry Smyth

专题命中 规划决策 :planning(title,abstract)

AI总结 探讨推荐系统如何利用信息,分析原始ID主导早期发展及语义信息封装于ID的原因,引入语义规划为未来方向,指出转变需在模型设计、评估及协调多方目标等方面做出改变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02142 2026-07-21 cs.RO cs.MA 版本更新 78%

PRO-SPECT: Probabilistically Safe Scalable Planning for Energy-Aware Coordinated UAV-UGV Teams in Stochastic Environments

PRO-SPECT:面向能量感知的协调无人机-无人地面车辆团队在随机环境中的概率安全可扩展规划

Roger Fowler, Cahit Ikbal Er, Benjamin Johnsenberg, Yasin Yazicioglu

机构 * Khoury Department of Computer Sciences at Northeastern University(东北大学Khoury计算机科学系) The Charles Stark Draper Laboratory, Inc.(查尔斯·斯塔克·德雷珀实验室公司) Department of Mechanical and Industrial Engineering at Northeastern University(东北大学机械与工业工程系) Departments of Mechanical and Industrial Engineering and Electrical and Computer Engineering at Northeastern University(东北大学机械与工业工程系和电气与计算机工程系)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出PRO-SPECT算法,用于在随机环境中实现无人机和无人地面车辆团队的能量感知规划,通过概率安全约束确保任务成功,支持离线和在线重新规划。

Comments Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems 2026 (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22169 2026-07-21 cs.RO 版本更新 78%

VersualRL: Closed-Loop Verbal Reinforcement Learning with Visual Execution Feedback for Task-Level Robot Planning

闭环言语强化学习用于任务级机器人规划

Dmitrii Plotnikov, Iaroslav Kolomiets, Dmitrii Maliukov, Dmitrij Kosenkov, Daniia Zinniatullina, Artem Trandofilov, Georgii Gazaryan, Kirill Bogatikov, Timofei Kozlov, Mikhail Konenkov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科夫科学与技术研究所)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出闭环言语强化学习框架,通过大语言模型与视觉语言模型交互,在符号规划层迭代优化行为树,实现可解释的任务级规划与执行不确定性下的自适应。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12361 2026-07-21 cs.RO 版本更新 78%

GNN-DIP: Neural Corridor Selection for Decomposition-Based Motion Planning

GNN-DIP:基于分解的运动规划中的神经走廊选择

Peng Xie, Yanliang Huang, Wenyuan Wu, Amr Alanwar

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出GNN-DIP框架,通过结合图神经网络与分解引导规划器,解决狭长通道中路径搜索的效率瓶颈,实现高成功率和速度提升。

Journal ref Published to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00126 2026-07-21 cs.RO 版本更新 78%

Compositional Diffusion with Guided Search for Long-Horizon Planning

用于长期规划的带引导搜索的组合扩散

Utkarsh A Mishra, David He, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 研究针对组合生成模型在局部分布多模态时的模式平均问题,提出带引导搜索的组合扩散方法(CDGS),通过特定采样、过滤和重采样解决问题,在机器人操作任务上表现出色且跨领域通用。

Comments 38 pages, 18 figures, ICLR 2026 ORAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04384 2026-07-21 cs.RO cs.SY eess.SY 版本更新 78%

Rapid and Safe Trajectory Planning over Diverse Scenes through Diffusion Composition

通过扩散合成在多样场景中进行快速且安全的轨迹规划

Wule Mao, Zhouheng Li, Yunhao Luo, Fangguo Zhao, Lei Xie

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) University of Michigan(密歇根大学) MIT(麻省理工学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 针对动态环境规划难题,提出能量参数化扩散规划框架,结合轻量级安全过滤器和场景无关的数据生成管道,实现多样场景下快速安全规划,仿真与真实实验验证了其有效性、鲁棒性和适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15097 2026-07-21 cs.SE cs.CR 版本更新 77%

Veritas: Grounding LLM Agents for Reliable Vulnerability Reasoning over Stripped Binaries

Veritas:一种语义导向的代理框架,用于二进制中的内存破坏漏洞检测

Xinran Zheng, Alfredo Pesoli, Marco Valleri, Suman Jana, Lorenzo Cavallaro

专题命中 规划决策 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.SE

AI总结 Veritas通过结合静态切片、双视角LLM检测器和多代理验证器,利用语义基础和运行时证据检测二进制中的内存破坏漏洞,实现了90%的召回率,并在实际应用中发现了一个未知的Apple漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18082 2026-07-21 cs.CL cs.HC 版本更新 77%

Octo-planner: On-device Language Model for Planner-Action Agents

Octo-planner:用于规划-行动智能体的设备端语言模型

Wei Chen, Zhiyuan Li, Zhen Guo, Yikang Shen

机构 * Nexa AI & Stanford(Nexa AI 与 斯坦福大学) MIT EECS(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(麻省理工-IBM Watson AI 实验室)

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.CL

AI总结 研究如何让人工智能智能体有效规划行动,提出设备端规划-行动框架,分离规划与行动执行组件,用模型微调优化性能,多LoRA训练方法应对多域规划挑战,在域内测试成功率达97%,并开源模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23071 2026-07-21 cs.CL cs.AI 版本更新 73%

From Evidence to Trajectory: Abductive Reasoning Path Synthesis for Retrieval-Augmented Generation Agents Development

从证据到轨迹:用于检索增强生成智能体开发的溯因推理路径合成

Muzhi Li, Jinhu Qi, Yihong Wu, Minghao Zhao, Liheng Ma, Yifan Li, Xinyu Wang, Zhenghan Tai, Zixing Song, Yingxue Zhang, Ho-fung Leung, Irwin King

机构 * The Chinese University of Hong Kong, Sha Tin, NT, Hong Kong(香港中文大学) Université de Montréal, Montréal, Quebéc, Canada(蒙特利尔大学) McGill University, Montréal, Quebéc, Canada(麦吉尔大学) Mila - Quebéc AI Institute, Montréal, Quebéc, Canada(魁北克AI研究院) Huawei Noah’s Ark Lab, Montréal, Quebéc, Canada(华为诺亚实验室)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 针对检索增强生成智能体开发缺乏可执行轨迹问题,提出EviPath范式,通过溯因子任务规划、忠实子问题回答、对话微调三个阶段合成推理路径,实验表明基于此训练的模型在开放域问答中显著优于基线。

Comments KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19341 2026-07-21 cs.CV cs.CL cs.SD 版本更新 70%

Native Active Perception as Reasoning for Omni-Modal Understanding

原生主动感知作为全模态理解的推理

Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang, Yunfei Chu, Jin Xu, Junyang Lin, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。

Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05353 2026-07-21 cs.LG cs.IT math.IT 版本更新 70%

GlyRAG: Context-Aware Retrieval-Augmented Framework for Blood Glucose Forecasting

GlyRAG:用于血糖预测的上下文感知检索增强框架

Shovito Barua Soumma, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 研究旨在利用连续血糖监测数据进行准确血糖预测,开发了GlyRAG框架,结合大语言模型提取上下文信息并通过检索增强预测,在OhioT1DM和AZT1D数据集上评估,显著提高长期预测的均方根误差,多数预测落在临床可接受区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15830 2026-07-21 cs.AI 版本更新 70%

Mini Amusement Parks (MAPs): A Testbed for Modelling Business Decisions

迷你游乐园(MAPs):一个用于模拟商业决策的测试平台

Stéphane Aroca-Ouellette, Ian Berlot-Attwell, Panagiotis Lymperopoulos, Abhiramon Rajasekharan, Tongqi Zhu, Herin Kang, Kaheer Suleman, Sam Pasupalak

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 介绍用于评估智能体决策能力的游乐园模拟器Mini Amusement Parks (MAPs),统一现实决策多方面挑战,提供人类基线和对先进语言模型智能体的评估,发现人类表现更优并揭示智能体在多方面的弱点,为基准测试适应性决策智能体提供新基础。

Comments 9 pages (main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03920 2026-07-21 cs.RO 版本更新 67%

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

LH-AVLN:长距离视听语言导航基准测试

Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 介绍长距离视听语言导航基准LH-AVLN,结合多目标任务执行等。提出免训练参考智能体PAG-Nav,可维护语义地图并规划。实验表明现有智能体完成任务有困难,PAG-Nav提供更强诊断基线。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19541 2026-07-21 cs.MA cs.HC 版本更新 67%

FOCAL: Filtered On-device Continuous Activity Logging for Efficient Personal Desktop Summarization

FOCAL:过滤的本地连续活动日志用于高效的个人桌面摘要

Haoran Yin, Zhiyuan Wen, Jiannong Cao, Bo Yuan, Ruosong Yang

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 FOCAL通过多代理系统实现高效的本地桌面流摘要,减少资源消耗并提升任务召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10203 2026-07-21 cs.LG cs.AI 版本更新 62%

Adaptive Compute in Latent World Models: When Depth Helps, Hurts, or Doesn't Matter

深度在组合中何时得以保留?潜在世界模型中的计算-质量机制

Achyuthan Sivasankar

机构 * New York University(纽约大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨潜在世界模型中深度在组合时的情况,用浅度惩罚ρ测试九个深度思维控制任务,发现三种机制,揭示反转机制由训练产生,其与观察/动作维度等相关,还指出任务机制受多种因素影响及相关注意事项。

Comments 15 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01741 2026-07-21 stat.ML cs.AI cs.LG 版本更新 62%

Full Bayesian Reinforcement Learning via LF-IBIS

基于LF-IBIS的全贝叶斯强化学习

Stefano Masini, Cecilia Viscardi, Michela Baccini

机构 * Department of Computer Science, University of Pisa, Italy(比萨大学计算机科学系) Department of Economics and Statistics, University of Salerno, Italy(萨勒诺大学经济学与统计系) Department of Statistics, Computer Science, Applications ”G.Parenti”, University of Florence, Italy(佛罗伦萨大学统计学、计算机科学与应用G.Parenti系)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出LF-IBIS算法,结合近似贝叶斯计算与迭代批量重要性采样,在似然函数不可得时实现强化学习中的全贝叶斯推断,量化策略不确定性以平衡探索-利用。

Comments 37 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10645 2026-07-21 cs.CL cs.MA cs.SI 版本更新 57%

MafiaScope: Non-Invasive, Time-Resolved Belief Probing for LLM Agents in Social Deduction Games

MafiaScope:社交推理游戏中对大语言模型智能体的非侵入性、时间分辨信念探测

Ilia Karpov

机构 * HSE University(俄罗斯高等经济研究大学)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 研究社交推理游戏中LLM智能体信念探测问题,提出MafiaScope测试平台,通过结构化问题让智能体私下作答并自动评分,可视化呈现信念轨迹,以DeepSeek为例进行研究,得出相关校准误差等结果并开源相关内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26548 2026-07-21 cs.CR cs.LG 版本更新 57%

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

SEC-bench Pro:语言模型能解决长周期软件安全任务吗?

Hwiwon Lee, Jiawei Liu, Dongjun Kim, Wubing Xia, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出SEC-bench Pro基准,通过三阶段流程构建包含V8和SpiderMonkey共183个已验证漏洞的测试集,评估前沿语言模型在长周期漏洞狩猎任务中的表现,发现最高成功率仅48.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏