arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-07 至 2026-04-07 共收录 232 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 14 篇

2604.04017 2026-04-07 cs.CL 90%

GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces

GeoBrowse:一种用于代理工具使用的地理定位基准测试

Xinyu Geng, Yanjing Xiao, Yuyang Zhang, Hanwen Wang, Xinyan Liu, Rui Min, Tianqing Fang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 工具调用 :tool use(title,abstract);agentic(title,abstract);tool-use(abstract);workflow(abstract)

AI总结 GeoBrowse基准测试结合了视觉推理与知识密集型多跳查询,通过专家标注的逐步轨迹分析验证多步工具使用策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04604 2026-04-07 cs.CY cs.AI cs.CR cs.MA 85%

AI Agents Under EU Law

欧盟法律下的AI代理

Luca Nannini, Adam Leon Smith, Michele Joshua Maggini, Enrico Panai, Sandra Feliciano, Aleksandr Tiulkanov, Elena Maran, James Gealy, Piercosma Bisconti

机构 * Piccadilly Labs(皮卡迪利实验室) Association of AI Ethicists(人工智能伦理学家协会) Centro Singular de Investigación en Tecnoloxías Intelixentes da USC(圣地亚哥德孔波斯特拉大学智能技术卓越研究中心) AIQI Consortium(AIQI联盟) BeEthical INSIGHT – Piaget Research Center for Ecological Human Development(INSIGHT – 皮亚杰生态人类发展研究中心) Responsible Innovations(负责任创新) ForHumanity Europe(ForHumanity欧洲) Alethesis AI SaferAI DEXAI Icaro Lab(伊卡洛斯实验室)

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨欧盟法律下AI代理的监管挑战,提出合规架构和分类体系,分析多党行动链透明度和安全问题。

Comments Working Paper - April 2026, subject to updates (EC M/613, M/606, Digital Omnibus proposals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04220 2026-04-07 cs.AI 83%

TimeSeek: Temporal Reliability of Agentic Forecasters

TimeSeek:代理预测者的时序可靠性

Hamza Mostafa, Om Shastri, Dennis Lee

机构 * Automorphic Labs(Automorphic实验室)

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 TimeSeek研究代理LLM预测者在预测市场生命周期中的可靠性变化,评估10种前沿模型在150个Kalshi二元市场中的表现,发现早期和高不确定性市场表现最佳,但接近解决和强共识市场时表现下降,网页搜索提升BSS但部分情况下降低,简单两模型组合能减少误差但未超越市场整体。

Comments Workshop paper. 11 pages including references

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16383 2026-04-07 cs.AI cs.SE 81%

An Agent-Based Framework for the Automatic Validation of Mathematical Optimization Models

一个基于代理的数学优化模型自动验证框架

Alexander Zadorojniy, Segev Wasserkrug, Eitan Farchi

机构 * IBM Research(IBM研究院)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出基于代理的自动验证方法,通过生成测试API、测试用例和突变体,提升优化模型的验证质量,尤其在突变覆盖方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04847 2026-04-07 eess.AS cs.CL 79%

Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency

全双工基准v3:在现实世界不流畅条件下评估全双工语音代理的基准工具

Guan-Ting Lin, Chen Chen, Zhehuai Chen, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 工具调用 :tool use(title,abstract);分类 cs.CL

AI总结 本文提出全双工基准v3,用于评估在自然语音条件下和多步骤工具使用中语言模型的性能。通过六个模型配置评估准确性、延迟和轮流交流维度,发现GPT-Realtime在Pass@1和打断避免方面表现最佳,而Gemini Live 3.1具有最短延迟但轮流率最低。

Comments Work in progress. Demo at https://daniellin94144.github.io/FDB-v3-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04323 2026-04-07 cs.CL 79%

How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings

代理技能在真实环境中的表现如何:在现实场景中评估LLM技能使用的基准测试

Yujian Liu, Jiabao Ji, Li An, Tommi Jaakkola, Yang Zhang, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.CL

AI总结 本文研究了在更现实的环境下LLM技能的实用性,发现技能效果随环境复杂性增加而下降,通过查询特定的技能细化策略可恢复性能,实验在Terminal-Bench 2.0上提升了Claude Opus 4.6的通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04826 2026-04-07 cs.RO 78%

Efficient Multi-Objective Planning with Weighted Maximization Using Large Neighbourhood Search

基于大邻域搜索的加权最大化多目标规划高效方法

Krishna Kalavadia, Shamak Dutta, Yash Vardhan Pant, Stephen L. Smith

机构 * University of Waterloo(滑铁卢大学)

专题命中 工具调用 :planning(title,abstract)

AI总结 本文提出基于大邻域搜索的新型算法,高效解决加权最大化规划问题,在保持解质量的同时将运行时间提升1-2个数量级,适用于自主导航中的多目标优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04543 2026-04-07 cs.MA cs.LO 78%

Statistical Model Checking of the Island Model: An Established Economic Agent-Based Model of Endogenous Growth

岛屿模型的统计模型检验:一个内生增长的已确立经济基于代理模型

Stefano Blando, Giorgio Fagiolo, Daniele Giachini, Andrea Vandin, Ernest Ivanaj

专题命中 工具调用 :agent(title,abstract)

AI总结 本文利用统计模型检验方法对岛屿模型进行分析,验证了模型的关键特征,并展示了其在内生增长研究中的应用价值。

Comments In Proceedings MARS 2026, arXiv:2604.03053

Journal ref EPTCS 443, 2026, pp. 3-22

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04651 2026-04-07 cs.AI 70%

Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents

搜索,不要猜测:教小语言模型成为有效的搜索代理

Yizhou Liu, Qi Sun, Yulin Chen, Siyue Zhang, Chen Zhao

机构 * New York University(纽约大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过评估复杂多跳推理任务,发现小语言模型(SLMs)虽参数较少,但检索工具使用更少且易产生幻觉。提出轻量级微调方法\policy,使SLMs能可靠检索并生成基于证据的答案,提升Bamboogle和HotpotQA性能17.3和15.3分,达到LLM水平。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04373 2026-04-07 cs.AI cs.LG 62%

Decocted Experience Improves Test-Time Inference in LLM Agents

解毒经验提升LLM代理的测试时间推理

Maohao Shen, Kaiwen Zha, Zexue He, Zhang-Wei Hong, Siru Ouyang, J. Jon Ryu, Prasanna Sattigeri, Suhas Diggavi, Gregory Wornell

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文研究通过解毒经验提升LLM代理测试时间推理性能,探讨如何通过经验构建有效上下文以优化复杂推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04263 2026-04-07 cs.CY cs.AI cs.CL 62%

Commercial Persuasion in AI-Mediated Conversations

人工智能调解对话中的商业说服

Francesco Salvi, Alejandro Cuevas, Manoel Horta Ribeiro

机构 * Princeton University(普林斯顿大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨了人工智能调解对话中商业说服的影响,发现基于LLM的说服使用户选择赞助产品率提高近三倍,且大多数参与者未能察觉促销倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.00797 2026-04-07 cs.AI cs.GT cs.LG cs.MA 62%

Combining Tree-Search, Generative Models, and Nash Bargaining Concepts in Game-Theoretic Reinforcement Learning

将树搜索、生成模型和纳什谈判概念结合在博弈论强化学习中

Zun Li, Marc Lanctot, Kevin R. McKee, Luke Marris, Ian Gemp, Daniel Hennes, Paul Muller, Kate Larson, Yoram Bachrach, Michael P. Wellman

机构 * Google DeepMind(谷歌DeepMind) University of Waterloo(滑铁卢大学) University of Michigan(密歇根大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于深度博弈论强化学习的多智能体训练框架,通过生成最佳响应算法GenBR和纳什谈判理论构建对手混合策略,提升在不完全信息域中的对手建模能力。

Comments Accepted by IJCAI'25 main track

Journal ref Proc. 34th Int. Joint Conf. Artif. Intell. (IJCAI 2025), pp. 161-169

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03291 2026-04-07 cs.AR cs.AI 57%

RAGnaroX: A Secure, Local-Hosted ChatOps Assistant Using Small Language Models

RAGnaroX:一种使用小型语言模型的安全、本地托管的ChatOps助手

Benedikt Dornauer, Mircea-Cristian Racasan

机构 * University of Innsbruck(因斯布鲁克大学) c.c.com Moser GmbH(c.c.com Moser有限公司)

专题命中 工具调用 :function calling(abstract);分类 cs.AI

AI总结 RAGnaroX是一种基于本地硬件的高效ChatOps助手,采用Rust实现,提供可审计的本地解决方案,通过模块化数据摄入、混合检索和函数调用实现灵活安全的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09362 2026-04-07 math.AG 50%

The Complete Intersection Discrepancy of a Curve I: Numerical Invariants

曲线的完全交差异数I:数值不变量

Andrei Benguş-Lasnier, Antoni Rangachev

专题命中 工具调用 :tool use(abstract)

AI总结 本文通过引入曲线的完全交差异数修正项,推广了两个经典公式,用于研究曲线的等奇异性和亏格-次数公式。

Comments With an appendix by Marc Chardin. The revised version includes a genus--degree formula for almost complete intersection curves (Corollary C), together with minor improvements to the exposition

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 78 篇

2604.04875 2026-04-07 cs.CV cs.AI cs.MM 91%

DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing

DIRECT:通过分层多智能体规划和意图引导编辑实现视频混剪创作

Ke Li, Maoliang Li, Jialiang Chen, Jiayu Chen, Zihao Zheng, Shaoqi Wang, Xiang Chen

机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);planning(title);分类 cs.AI

AI总结 本文提出DIRECT框架,通过分层多智能体规划和意图引导编辑解决视频混剪中多模态协调问题,提出Mashup-Bench基准并验证了方法在客观和主观评估上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06977 2026-04-07 cs.LG cs.AI cs.GT 88%

NePPO: Near-Potential Policy Optimization for General-Sum Multi-Agent Reinforcement Learning

NePPO:近势策略优化用于一般和多智能体强化学习

Addison Kalanther, Sanika Bharvirkar, Shankar Sastry, Chinmay Maheshwari

机构 * UC Berkeley(加州大学伯克利分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出NePPO方法,通过学习玩家无关的势函数近似纳什均衡,解决多智能体强化学习中一般和合作-竞争环境下的收敛问题,实验证明其优于IPPO和MAPPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01891 2026-04-07 cs.CV 88%

Agentic AI in Remote Sensing: Foundations, Taxonomy, and Emerging Systems

遥感中的代理AI:基础、分类与新兴系统

Niloufar Alipour Talemi, Julia Boone, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);planning(abstract)

AI总结 本文探讨遥感中代理AI的基础、分类及新兴系统,提出统一的分类框架,分析规划机制、检索增强生成和记忆结构,并评估轨迹感知推理的准确性。

Comments Accepted to the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026, GeoCV Workshop

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) Workshops, 2026, pp. 786-799

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03406 2026-04-07 cs.GR 87%

SASAV: Self-Directed Agent for Scientific Analysis and Visualization

SASAV:面向科学分析和可视化的自主代理

Jianxin Sun, David Lenz, Tom Peterka, Hongfeng Yu

专题命中 规划决策 :agent(title,abstract);AI agent(abstract);workflow(abstract);multi-agent(abstract)

AI总结 本文提出SASAV,首个无需外部提示或人类在环反馈的自主AI代理,可自动执行科学数据分析并生成有洞察力的可视化,推动AI for Science加速大规模科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04664 2026-04-07 cs.RO cs.AI cs.MA 86%

ROSClaw: A Hierarchical Semantic-Physical Framework for Heterogeneous Multi-Agent Collaboration

ROSClaw:一种用于异构多智能体协作的分层语义-物理框架

Rongfeng Zhao, Xuanhao Zhang, Zhaochen Guo, Xiang Shao, Zhongpan Zhu, Bin He, Jie Chen

机构 * Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院) National Key Laboratory of Autonomous Intelligent Unmanned Systems (Tongji University)(自主智能无人系统全国重点实验室(同济大学)) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心) Tongji University(同济大学) College of Electronics and Information Engineering, Tongji University(同济大学电子与信息工程学院)

专题命中 规划决策 :agent(title,abstract);multi-agent(title);分类 cs.AI

AI总结 ROSClaw通过统一视觉语言模型控制器整合策略学习与任务执行,构建仿真到现实的拓扑映射,实现多智能体协作中的语义连续性和动态任务分配,提升多策略执行的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04211 2026-04-07 cs.CR cs.AI 85%

LOCARD: An Agentic Framework for Blockchain Forensics

LOCARD:区块链取证的代理框架

Xiaohang Yu, William Knottenbelt

机构 * Imperial College London(帝国理工学院)

专题命中 规划决策 :agentic(title,abstract);autonomous agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种新的区块链取证方法,通过LOCARD框架实现动态决策过程,结合结构化信念状态机制,展示了在跨链交易追踪中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04190 2026-04-07 cs.AI 85%

Schema-Aware Planning and Hybrid Knowledge Toolset for Reliable Knowledge Graph Triple Verification

基于模式的规划和混合知识工具集的可靠知识图谱三元组验证

Xinyan Ma, Xianhao Ou, Weihao Zhang, Shixin Jiang, Runxuan Liu, Dandan Tu, Lei Chen, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Bay Area International Business School, Beijing Normal University(北京师范大学湾区国际商学院)

专题命中 规划决策 :planning(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出SHARP,一种无需训练的自主代理,通过动态策略规划、主动调查和证据推理改进知识图谱三元组验证的稳定性与解释性,实验证明其在FB15K-237和Wikidata5M-Ind上准确率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03908 2026-04-07 cs.NI 85%

Reimagining RAN Automation in 6G: An Agentic AI Framework with Hierarchical Online Decision Transformer

重新构想6G中的RAN自动化:一种带有分层在线决策变压器的代理AI框架

Md Arafat Habib, Medhat Elsayed, Majid Bavand, Pedro Enrique Iturria Rivera, Yigit Ozcan, Melike Erol-Kantarci

专题命中 规划决策 :agentic(title,abstract);agent(abstract);AI agent(abstract)

AI总结 本文提出了一种基于代理AI的无线网络框架,利用分层在线决策变压器协调多个代理,实现资源分配、网络应用编排和自愈功能,提升网络性能和能效。

Comments Paper currently under review (IEEE TNSE). Contents of this work may change at any time without notice. This is the author's preliminary version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00824 2026-04-07 cs.SE 83%

Yet Even Less Is Even Better For Agentic, Reasoning, and Coding LLMs

即使更少也是更好:用于代理、推理和编码LLM的更优方案

CodeArts Model Team, Yang Ye, Jingyuan Tan, Tianyue Jiang, Ruizhe Ye, Qiankun He, Jiarui Yang, Jian Dong, Sicong Liang, Chongjian Yue, Peibai Xu, Lufan Lu, Shiguan Pang, Taotao Qian, Junbao Hu, Yuechan Hao, Ensheng Shi, Qi Zhang, Yi Hao, Na Fan, Xin Tan, Shuai Yao, Zhiwei Shen, Zongchen Li, Yanlin Wang, Chong Chen, Yuchi Ma

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 本文提出STITCH框架,通过过滤低价值噪声和保留决策关键标记,以更少但高质量的训练轨迹提升代理能力,在多个框架和语言中实现显著提升。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05656 2026-04-07 cs.AI 83%

HAG: Hierarchical Demographic Tree-based Agent Generation for Topic-Adaptive Simulation

HAG:基于主题自适应的分层人口树状代理生成

Rongxin Chen, Tianyu Wu, Bingbing Xu, Jiatang Luo, Xiucheng Xu, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出HAG框架,通过分层决策过程生成符合主题需求的代理群体,提升宏观分布与微观一致性。实验表明HAG在减少群体对齐误差和增强社会一致性方面表现优异。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04078 2026-04-07 eess.IV cs.AI cs.CV 83%

BAAI Cardiac Agent: An intelligent multimodal agent for automated reasoning and diagnosis of cardiovascular diseases from cardiac magnetic resonance imaging

BAAI心脏代理:一种智能多模态代理,用于从心脏磁共振成像自动推理和诊断心血管疾病

Taiping Qu, Hongkai Zhang, Lantian Zhang, Can Zhao, Nan Zhang, Hui Wang, Zhen Zhou, Mingye Zou, Kairui Bo, Pengfei Zhao, Xingxing Jin, Zixian Su, Kun Jiang, Huan Liu, Yu Du, Maozhou Wang, Ruifang Yan, Zhongyuan Wang, Tiejun Huang, Lei Xu, Henggui Zhang

机构 * Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) Department of Radiology, Beijing Anzhen Hospital, Beijing Institute of Heart, Lung & Vascular Diseases, Capital Medical University(首都医科大学附属北京安贞医院放射科,北京市心肺血管疾病研究所) Department of MR, the First Affiliated Hospital, Henan Medical University(河南医科大学第一附属医院磁共振科) Department of Cardiology, Clinical Center for Coronary Heart Disease, Beijing Institute of Heart, Lung and Blood Vessel Disease, Beijing Anzhen Hospital, Capital Medical University(首都医科大学附属北京安贞医院心内科,冠心病临床中心,北京市心肺血管疾病研究所) Department of Cardiac Surgery, Beijing Anzhen Hospital, Institute of Heart, Lung and Vascular Diseases, Capital Medical University(首都医科大学附属北京安贞医院心脏外科,心肺血管疾病研究所)

专题命中 规划决策 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出BAAI心脏代理,通过多模态智能系统实现心脏磁共振成像的端到端解读,实现了自动分割、功能量化、组织特征分析和疾病诊断,并在多个心血管疾病数据集上验证了其高准确率和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12230 2026-04-07 cs.LG cs.AI cs.CR 82%

Security Considerations for Artificial Intelligence Agents

人工智能代理的安全性考虑

Ninghui Li, Kaiyuan Zhang, Kyle Polley, Jerry Ma

机构 * Perplexity

专题命中 规划决策 :agent(abstract);AI agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文探讨了前沿AI代理的安全性问题,分析了代理架构对代码-数据分离、权限边界和执行可预测性的影响,并提出了针对间接提示注入、混淆代理行为和长流程级联故障的防护措施。

Comments This article is adapted from Perplexity's response to NIST/CAISI Request for Information 2025-0035. 91 Fed. Reg. 698 (Jan. 8, 2026). The originally submitted response can be found on the public docket at https://www.regulations.gov/comment/NIST-2025-0035-0505

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13218 2026-04-07 cs.AI cs.CL cs.LG cs.LO 82%

Scaling the Scaling Logic: Agentic Meta-Synthesis of Logic Reasoning

扩展扩展逻辑:代理元合成逻辑推理

Bowen Liu, Zhi Wu, Runquan Xie, Zhanhui Kang, Jia Li

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出SSLogic框架,通过代理迭代生成和优化可执行的生成器-验证器对,生成具有新规则和难度梯度的任务家族,提升训练效率。

Comments 41 pages, 8 figures, 5 tables in the main body. Project page: https://github.com/AdAstraAbyssoque/Scaling-the-Scaling-Logic, typos corrected, claims cleared

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03796 2026-04-07 cs.MA 82%

When AI Agents Disagree Like Humans: Reasoning Trace Analysis for Human-AI Collaborative Moderation

当AI代理像人类一样产生分歧:用于人机协作 moderation 的推理轨迹分析

Michał Wawer, Jarosław A. Chudziak

专题命中 规划决策 :AI agent(title);agent(abstract);multi-agent(abstract)

AI总结 本文研究AI代理在仇恨言论 moderation 中的分歧模式,通过推理轨迹分析发现分歧结构比幅度更能预测人类判断需求,提出从共识寻求转向不确定性揭示的多代理设计。

Comments Accepted to the ICLR 2026 Workshop on "From Human Cognition to AI Reasoning: Models, Methods, and Applications (HCAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03691 2026-04-07 astro-ph.GA astro-ph.IM 82%

LensAgent: A Self Evolving Agent for Autonomous Physical Inference of Sub-galactic Structure

LensAgent:一种用于自主物理推断亚银河结构的自演化代理

Xiaotang Feng, Zihan Wang, Zilang Shu, Jean-Paul Kneib, Philip Torr

专题命中 规划决策 :agent(title,abstract);agentic(abstract)

AI总结 本文提出LensAgent,一种无需训练的大型语言模型驱动框架,用于自主推断质量分布,克服了质量片退化和手动或神经网络建模的可扩展性问题,成功重建了SLACS Grade A强引力透镜系统的质量分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.01882 2026-04-07 cs.RO cs.GT 82%

Secure Planning Against Stealthy Attacks via Model-Free Reinforcement Learning

通过模型无关强化学习实现对隐蔽攻击的安全规划

Alper Kamil Bozkurt, Yu Wang, Miroslav Pajic

机构 * Duke University(杜克大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract)

AI总结 本文提出利用模型无关强化学习在未知随机环境中实现安全规划,通过将攻击者与控制器视为博弈双方,以线性时序逻辑公式表达其目标,解决在未知环境中满足LTL公式的问题。

Journal ref 2021 IEEE International Conference on Robotics and Automation (ICRA), Xi'an, China, 2021, pp. 10656-10662

详情

展开后加载摘要…

URL PDF HTML 收藏