arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-14 至 2026-07-14 共收录 91 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 10 篇

2604.00137 2026-07-14 cs.AI cs.SE 版本更新 86%

Open, Reliable, and Collective: A Community-Driven Framework for Tool-Using AI Agents

开放、可靠且集体:一个由社区驱动的工具使用AI代理框架

Hy Dang, Quang Dao, Meng Jiang

机构 * University of Notre Dame(圣母大学) Rose-Hulman Institute of Technology(罗斯-霍曼理工学院)

专题命中 工具调用 :AI agent(title);agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 本文提出OpenTools框架,通过标准化工具方案、提供轻量级插件式封装及自动化测试套件,提升工具使用可靠性,实验表明社区贡献的高质量工具在多个架构上提升了6%-22%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29116 2026-07-14 cs.AI 版本更新 83%

Characterizing Large Language Model Agentic Workflows: A Study on N8n Ecosystem

表征大语言模型智能体工作流:基于N8n生态系统的研究

Yutian Tang, Yuming Zhou, Huaming Chen

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);分类 cs.AI

AI总结 通过分析6000多个n8n工作流,揭示LLM在低代码平台中嵌入控制逻辑、外部工具和人工审核等结构,但可靠性机制不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18576 2026-07-14 cs.AI 版本更新 83%

Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs

基于序列贝叶斯更新的语义信念的代理预测

Kevin Murphy

机构 * Department of Computer Science(计算机科学系) University of British Columbia(不列颠哥伦比亚大学)

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 BLF系统通过语义信念状态、层级多试聚合和层级校准方法,在预测基准上超越了现有方法,同时具备低泄露率的回测框架。

Comments v4 adds 2 new appendices: app J evaluates a "generative" Bayesian alternative to BLF (which does worse than the "discriminative" approached used by BLF), and app K sketches how to do value of information computation to decide when to stop searching (although this idea has not been tried). v4 also adds a few more recent references

Journal ref v3 was published in ICML AI Forecasting workshop 2026 (https://forecasting-workshop.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17848 2026-07-14 cs.CR cs.SE 版本更新 79%

RISKTAGGER: Evidence-Guided LLM Agent for Post-Incident Forensic Analysis of Money Laundering in Web3

RISKTAGGER:用于Web3中洗钱事件后法医分析的证据引导大语言模型智能体

Dan Lin, Yanli Ding, Weipeng Zou, Jiajing Wu, Zhiyin Wu, Jiachi Chen, Xiapu Luo, Zibin Zheng

专题命中 工具调用 :agent(title,abstract);分类 cs.SE

AI总结 针对Web3加密货币洗钱法医分析面临的挑战,提出RISKTAGGER,将大语言模型作为证据约束决策组件,从公共事件材料提取线索,递归扩展资金流图并生成报告。经多案例评估,能恢复资金路径、识别风险账户,组织证据成可验证报告。

Comments 11 pages(main text), 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01143 2026-07-14 cs.AI 版本更新 77%

A Low-Latency Fraud Detection Layer for Detecting Adversarial Interaction Patterns in LLM-Powered Agents

面向LLM代理的低延迟欺诈检测层:用于检测对抗性交互模式

Sheldon Yu, Yingcheng Sun, Hanqing Guo, Qianqian Tong

机构 * University of California, San Diego(加州大学圣地亚哥分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 工具调用 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出一种低延迟欺诈检测机制,通过交互轨迹的结构化运行时特征检测对抗性交互模式,采用轻量模型实现实时部署,实验表明交互层面行为检测应成为LLM代理部署时的核心防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07820 2026-07-14 cs.CL 版本更新 70%

DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment

深度搜索世界:可验证环境中深度搜索智能体的自蒸馏

Xinyu Geng, Xuanhua He, Sixiang Chen, Yanjing Xiao, Fan Zhang, Shijue Huang, Haitao Mi, Zhenwen Liang, Tianqing Fang, Yi R. Fung

专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.CL

AI总结 研究训练工具使用智能体从自身经验改进的难题,提出基于深度搜索世界的自蒸馏框架深度搜索进化,通过迭代操作训练智能体,该框架无需更强大模型蒸馏,性能有竞争力,还将发布相关资源促进后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23525 2026-07-14 cs.CL 版本更新 70%

Self-Compacting Language Model Agents

自压缩语言模型智能体

Tianjian Li, Jingyu Zhang, William Jurayj, Xi Wang, Chuanyang Jin, Mehrdad Farajtabar, Eric Nalisnick, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学) Apple(苹果公司)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出SelfCompact框架,让语言模型自主决定何时及如何压缩上下文,通过调用压缩工具和轻量级规则实现自适应压缩,无需微调或外部监督,在多个基准上以更低成本匹配或超越固定间隔压缩。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24283 2026-07-14 quant-ph 版本更新 67%

AutoQResearch: LLM-Guided Closed-Loop Policy Search for Adaptive Variational Quantum Optimization

AutoQResearch:基于LLM的闭环策略搜索用于自适应变分量子优化

Monit Sharma, Hoong Chuin Lau

专题命中 工具调用 :agent(abstract);workflow(abstract)

AI总结 本文提出AutoQResearch,通过LLM引导的闭环实验框架,实现变分量子优化中求解器的自适应配置,通过阶段确认和低成本评估避免过拟合,展示在最大独立集和车辆路径问题上的有效性。

Comments Accepted at the 2026 IEEE International Conference on Quantum Computing and Engineering (QCE 2026), Quantum-GenAI Co-Design & Co-Discovery (QGDD) Technical Papers Track. QCE26 Technical Paper 238

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14499 2026-07-14 cs.AI cs.LG 版本更新 62%

Measuring AI Ability to Complete Long Software Tasks

衡量AI完成长期软件任务的能力

Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney Von Arx, Ryan Bloom, Thomas Broadley, Haoxing Du, Brian Goodrich, Nikola Jurkovic, Luke Harold Miles, Seraphina Nix, Tao Lin, Chris Painter, Neev Parikh, David Rein, Lucas Jun Koba Sato, Hjalmar Wijk, Daniel M. Ziegler, Elizabeth Barnes, Lawrence Chan

机构 * Model Evaluation & Threat Research (METR)(模型评估与威胁研究(METR)) Ohm Chip Anthropic

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 本文提出50%任务完成时间跨度指标,用于衡量AI在完成长期软件任务方面的能力,结果显示AI模型的时间跨度呈指数增长,预计5年后将能自动化许多人类月度完成的软件任务。

Comments v4: added Chris Painter as listed author, consistent with listing in the pdf

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00972 2026-07-14 physics.data-an cs.AI cs.CV cs.IR 版本更新 57%

Toward a Scientific Discovery Engine for Weather and Climate Data: A Visual Analytics Workbench for Embedding-Based Exploration

迈向面向天气和气候数据的科学发现引擎:一种用于基于嵌入探索的可视化分析工作台

Nihanth W. Cherukuru, Matt Rehme, Kirsten J. Mayer, David John Gagne, John Schreck, John Clyne, Charlie Becker

机构 * NSF National Center for Atmospheric Research(国家大气研究中心)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 本文提出了一种开源可视化分析工作台,用于探索基于嵌入的天气和气候数据,通过链接嵌入实验与源数据、元数据、空间上下文和模型配置,使潜在空间结果可追溯到物理过程,支持科学发现流程。

Comments 7 pages, 5 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 23 篇

2602.21255 2026-07-14 cs.GT cs.AI math.OC 版本更新 91%

A General Equilibrium Theory of Orchestrated AI Agent Systems

一个 orchestrated AI agent 系统的一般均衡理论

Jean-Philippe Garnier

专题命中 规划决策 :agent(title,title_cn);AI agent(title,title_cn);分类 cs.AI

AI总结 本文提出了一种基于一般均衡理论的AI代理系统模型,通过集中编排实现系统福利最大化,并证明了均衡存在性和收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30616 2026-07-14 cs.CL 版本更新 83%

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent

扩展视野而非参数:以35B智能体达到万亿参数性能

Lei Bai, Zongsheng Cao, Yang Chen, Zhiyao Cui, Shangheng Du, Yue Fan, Shiyang Feng, Zijie Guo, Haonan He, Liang He, Xiaohan He, Shuyue Hu, Yusong Hu, Songtao Huang, Yichen Jiang, Hao Li, Xin Li, Dahua Lin, Weihao Lin, Fenghua Ling, Dongrui Liu, Zhuo Liu, Wenjie Lou, Runmin Ma, Chunjiang Mu, Haoyang Peng, Tianshuo Peng, Jinxin Shi, Luohe Shi, Boyuan Sun, Zelin Tan, Shengji Tang, Yan Teng, Qianyi Wang, Xiaosong Wang, Yiming Wu, Yi Xie, Xiangchao Yan, Jingqi Ye, Peng Ye, Fangchen Yu, Jiakang Yuan, Bihao Zhan, Bo Zhang, Chen Zhang, Shufei Zhang, Shuaiyu Zhang, Wenlong Zhang, Yiqun Zhang, Junpeng Zhao, Zhijie Zhong, Bowen Zhou, Yuhao Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 提出35B混合专家智能体模型Agents-A1,通过扩展智能体视野(长程轨迹与异构能力)达到万亿参数级别性能,采用三阶段训练(全领域微调、领域教师模型、多教师领域路由策略蒸馏)在多个长程基准上取得领先或竞争力结果。

Comments The model checkpoints and evaluation codebase are available at https://huggingface.co/collections/InternScience/agents-a1 and https://github.com/InternScience/Agents-A1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03024 2026-07-14 cs.CR cs.SE 版本更新 79%

SkillGuard: A Permission-Centric Framework for Agent Skill Security

SkillGuard:一种面向智能体技能的权限框架

Shidong Pan, Xiaoyu Sun, Tianyi Zhang, Dianshu Liao, Kaiwen Yang, Zhenchang Xing

专题命中 规划决策 :agent(title,abstract);分类 cs.SE

AI总结 提出SkillGuard权限框架,通过双平面治理模型联合管控上下文影响和动作副作用,以缩小技能声明意图与运行时行为之间的安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03987 2026-07-14 cs.RO 版本更新 78%

Fast Asymptotically Optimal Kinodynamic Planning via Vectorization

通过向量化实现快速渐近最优运动动力学规划

Yitian Gao, Andrew Lu, Zachary Kingston

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系)

专题命中 规划决策 :planning(title,abstract)

AI总结 研究复杂运动动力学系统的规划问题,提出基于JAX和XLA编译器的并行渐近最优运动动力学RRT规划器,结合AO - x元算法实现渐近最优,经理论分析和实验验证其性能优势。

Comments 8 pages, 5 figures, 4 tables. Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17527 2026-07-14 cs.RO 版本更新 78%

Safer Trajectory Planning with CBF-guided Diffusion Model for Unmanned Aerial Vehicles

基于CBF引导扩散模型的无人机安全轨迹规划

Peiwen Yang, Shiyu Bai, Weisong Wen, Yixin Gao, Jiahao Hu

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出AeroTrajGen框架,通过CBF引导采样提升扩散模型在无人机轨迹生成中的安全性与敏捷性,减少碰撞率94.7%。

Comments Some equations need to be checked

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17343 2026-07-14 cs.CV 版本更新 78%

EvoGuard: An Extensible Agentic RL-based Framework for Practical and Evolving AI-Generated Image Detection

EvoGuard: 一种基于代理强化学习的可扩展框架,用于实际和演化的AI生成图像检测

Chenyang Zhu, Maorong Wang, Jun Liu, Ching-Chun Chang, Isao Echizen

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国家信息研究所)

专题命中 规划决策 :agentic(title,abstract)

AI总结 本文提出EvoGuard框架,利用多模态大语言模型和非MLLM检测器,通过能力感知的动态编排机制实现高效AIGI检测,优化后无需细粒度标注,实验表明其在准确性和可扩展性上均达最优。

Comments Template changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10407 2026-07-14 cs.RO 版本更新 78%

Rethinking Gaussian Trajectory Predictors: Calibrated Uncertainty for Safe Planning

重新思考高斯轨迹预测器:为安全规划校准不确定性

Fatemeh Cheraghi Pouria, Mahsa Golchoubian, Katherine Driggs-Campbell

机构 * Department of Electrical and Computer Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系) Department of Mathematical and Computational Sciences, University of Toronto(多伦多大学数学与计算科学系)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种新的损失函数,通过核密度估计校准高斯轨迹预测器的不确定性,以提高安全规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08964 2026-07-14 cs.AI 版本更新 77%

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

长视野终端基准测试:使用基于密集奖励的评分方式测试智能体在长视野终端任务中的极限

Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, Leowei Liang

机构 * Tencent(腾讯) University of Maryland, College Park(马里兰大学帕克分校) University of Georgia(佐治亚大学) University of Minnesota, Twin Cities(明尼苏达大学双城分校) Indiana University(印第安纳大学) Lehigh University(里海大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对现有终端基准测试局限,引入长视野终端基准测试(Long-Horizon-Terminal-Bench),含46个长视野任务。通过分解为分级子任务提供密集中间奖励,评估15个前沿模型,揭示改进空间,分析失败模式,发布该基准测试助力长视野终端智能体发展。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16395 2026-07-14 cs.AI cs.SE 版本更新 73%

LLM-Driven Collaborative Model for Untangling Commits via Explicit and Implicit Dependency Reasoning

基于显式和隐式依赖推理的大语言模型驱动的提交解缠协作模型

Bo Hou, Xin Tan, Kai Zheng, Fang Liu, Yinghao Zhu, Li Zhang

机构 * State Key Laboratory of Complex \& Critical Software Environment (SKLCCSE), School of Computer Science Engineering, Beihang University Beijing China SKLCCSE, School of Computer Science School of Computing Data Science, The University of Hong Kong Hong Kong SAR China Engineering, Beihang University Data Science, The University of Hong Kong

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 针对开发者常产生的缠结提交问题,提出ColaUntangle协作框架,集成大语言模型驱动智能体,构建显式和隐式上下文捕捉信息,经实验验证,该框架在提交解缠任务中性能优于基线,凸显基于大语言模型协作框架的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05933 2026-07-14 eess.AS 版本更新 71%

Speech World Model: Causal State-Action Planning with Explicit Reasoning for Speech

语音世界模型:基于显式推理的语音因果状态-动作规划

Xuanru Zhou, Jiachen Lian, Henry Hong, Xinyi Yang, Gopala Anumanchipalli

专题命中 规划决策 :planning(title)

AI总结 研究旨在改进语音语言模型推理弱的问题,采用模块化视角和世界模型观点,将语音理解分解为四个模块通过因果图通信,建立认知状态搜索空间,实现显式推理,让语音理解更透明可控。

Comments Accepted to 2026 ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09322 2026-07-14 cs.AI 版本更新 70%

LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making

LongMedBench:用于长期临床决策的医疗智能体基准测试

Zihan Xu, Yanzhen Chen, Xiaocheng Zhang, Zhiting Fan, Weiqi Zhai, Hongxia Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Transvascular Implantation Devices Research Institute(血管内植入装置研究所)

专题命中 规划决策 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 介绍基于EHR的LongMedBench基准,用于长期临床决策。构建含多患者多事件数据集,提出评估分类法。实验表明大语言模型在隐式时间推理有挑战,RAG和智能体记忆系统对信息检索有帮助,决策任务性能依赖模型即时上下文。

Comments Submitted manuscript prior to peer review in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11678 2026-07-14 cs.CL 版本更新 70%

Can AI Reason Like an Urban Planner? Benchmarking Large Language Models Against Professional Judgment

AI能像城市规划师一样推理吗?基于专业判断的大语言模型基准测试

Yijie Deng, He Zhu, Wen Wang, Junyou Su, Minxin Chen, Wenjia Zhang

机构 * School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院) Shenzhen Key Laboratory of Urban Spatial Information and Intelligent Modeling(深圳市城市空间信息与智能建模重点实验室) Department of Urban Planning and Design, The University of Hong Kong(香港大学城市规划与设计系)

专题命中 规划决策 :planning(abstract,abstract_cn);分类 cs.CL

AI总结 提出UPBench框架,通过4×5知识支柱与认知水平矩阵评估25个LLM,发现模型在分析任务上优于事实回忆和综合判断,揭示了规划知识的制度依赖性。

Comments This paper has been withdrawn by the authors because the current version requires substantial revision and further validation before it can be considered a reliable representation of the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09149 2026-07-14 cs.LG cs.AI cs.MA 版本更新 62%

Enabling Agents to Communicate Entirely in Latent Space

使智能体能够在潜在空间中完全交流

Zhuoyun Du, Runze Wang, Huiyu Bai, Zouying Cao, Xiaoyong Zhu, Yu Cheng, Bo Zheng, Wei Chen, Haochao Ying

机构 * State Key Lab of CAD&CG(CAD与CG国家重点实验室) Future Living Lab of Alibaba(阿里巴巴未来生活实验室) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江医学影像人工智能重点实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Interlat方法,通过利用LLM的连续隐藏状态实现智能体间的潜在空间通信,实验表明其在跨异构模型中表现优异,提升了推理速度并保持性能。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17993 2026-07-14 cs.LG cs.AI 版本更新 62%

Turbo Connection: Reasoning as Information Flow from Higher to Lower Layers

Turbo Connection: 从高层到低层的信息流推理

Mohan Tang, Sidi Lu

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 Turbo Conn通过反向连接增强LLM推理能力,实现任务性能显著提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07040 2026-07-14 cs.LG cs.AI stat.ML 版本更新 62%

Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning

用于稳健平均奖励强化学习的高效Q学习和演员-评论家方法

Yang Xu, Swetha Ganesh, Vaneet Aggarwal

机构 * Purdue University(普渡大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究分布稳健无限期平均奖励MDPs的无模型方法,给出Q学习和演员-评论家算法非渐近收敛分析,建立稳健TD收敛界,引入相关算法并模拟,为稳健规划理论及无模型构建稳健策略提供基础。

Comments UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03565 2026-07-14 cs.LG cs.AI 版本更新 62%

Training on Irrelevant States Implies Data Augmentation: Generalization in Contextual MDPs

在无关状态上训练意味着数据增强:上下文马尔可夫决策过程中的泛化

Max Weltevrede, Caroline Horsch, Matthijs T. J. Spaan, Wendelin Böhmer

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究上下文马尔可夫决策过程零样本策略转移中智能体泛化问题,提出Explore-Go方法,通过在训练开始引入纯探索阶段,结合现有纯探索策略提升智能体覆盖范围与准确性来增强泛化能力,经实验验证该方法在多种基准测试中有效。

Comments arXiv admin note: text overlap with arXiv:2406.08069

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07405 2026-07-14 cs.AI cs.CR 版本更新 57%

Reason Less, Verify More: Deterministic Gates Recover a Silent Policy-Violation Failure Mode in Tool-Using LLM Agents

少些推理,多些验证:确定性门控在使用工具的语言模型智能体中恢复了一种无声的违反策略失败模式

Vikas Reddy, Sumanth Reddy Challaram, Abhishek Basu

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格布尔分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究使用工具的语言模型智能体违反策略问题,提出用确定性预执行门控干预,在τ²基准航空公司领域评估,该方法能提高成功率,防止无声违反策略写入,虽不保证任务成功,但有可靠性成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31651 2026-07-14 cs.AI 版本更新 57%

FARS: A Fully Automated Research System Deployed at Scale

FARS:一个大规模部署的全自动研究系统

Qiong Tang, Tianxiang Sun, Xiangkun Hu, Xiangyang Liu, Yiran Chen, Yunfan Shao, Bobo Li, Changze Lv, Cheng Xu, Chengsong Huang, Chunyang Li, Dizhan Xue, Hao Bai, Haodong Duan, Hengquan Guo, Hongyang He, Hongyi Chen, Hui Shen, Jiahao Yuan, Jiankai Sun, Jikang Cheng, Jinfeng Xu, Jingqi Tong, Jingye Chen, Jinxiu Liu, Jixuan Leng, Junchi Yu, Kaixun Jiang, Kun Xiang, Kunpeng Yao, Lang Feng, Liangqi Yuan, Longsen Gao, Meng Li, Qi Jia, Qiushi Sun, Shengyuan Ding, Shizhan Gong, Siru Zhong, Terry Jingchen Zhang, Tianle Gu, Tianyi Liang, Weijie Liu, Weikai Yang, Weizhi Fei, Xin Wang, Xinpeng Liu, Xuanwen Ding, Yihong Tang, Yuanli Wang, Yukun Jiang, Yuming Yang, Zhengbao He, Zhikai Chen, Zhikun Xu, Zhuang Li, Zihao Huang

机构 * Analemma National University of Singapore(新加坡国立大学) Fudan University(复旦大学) University College Dublin(都柏林大学) Washington University in St. Louis(圣路易斯华盛顿大学) The Hong Kong University of Science and Technology(香港科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ByteDance(字节跳动) ShanghaiTech University(上海科技大学) University of Warwick(华威大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) East China Normal University(华东师范大学) Stanford University(斯坦福大学) Tencent(腾讯) The University of Hong Kong(香港大学) Shanghai Innovation Institute(上海创新研究院) Nex-AGI Team(Nex-AGI团队)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出FARS系统,通过分阶段智能体协作自动生成研究项目,在67个AI/ML主题上产出166篇论文,经282份评审验证其可产出有价值成果,同时暴露实验范围窄、方法局限和诚信问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04690 2026-07-14 cs.RO cs.AI 版本更新 57%

Pickalo: Leveraging 6D Pose Estimation for Low-Cost Industrial Bin Picking

Pickalo:利用6D位姿估计实现低成本工业装箱拾取

Alessandro Tarsi, Matteo Mastrogiuseppe, Saverio Taliani, Simone Cortinovis, Ugo Pattacini

机构 * MESH Facility (formerly iCub Tech), Istituto Italiano di Tecnologia(意大利技术研究院MESH设施(原iCub Tech)) AMI laboratory, Istituto Italiano di Tecnologia(意大利技术研究院AMI实验室) Institut des Systèmes Intelligents et de Robotique (ISIR)(智能系统与机器人研究所(ISIR)) Generative Bionics(Generative Bionics公司) Camozzi Automation SpA(Camozzi自动化股份公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 Pickalo通过低成本硬件实现6D位姿估计,结合深度估计和姿态缓冲模块,在工业环境中实现高效率的装箱拾取,达到每小时600次拾取,成功率达96-99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11503 2026-07-14 q-bio.NC cs.AI cs.GT 版本更新 57%

People use fast and flat simulation to reason about new games

人们使用快速且扁平的模拟来对新游戏进行推理

Katherine M. Collins, Cedegao E. Zhang, Lionel Wong, Mauricio Barba da Costa, Graham Todd, Adrian Weller, Samuel J. Cheyette, Thomas L. Griffiths, Joshua B. Tenenbaum

机构 * Massachusetts Institute of Technology(麻省理工学院) Princeton University(普林斯顿大学) University of Cambridge(剑桥大学) Stanford University(斯坦福大学) New York University(纽约大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究人们对新游戏的推理,通过超千名参与者和121种新棋盘游戏的研究,发现人们玩新游戏或评估时具系统性和适应性理性,用“直观玩家”模型解释,为新问题应对及类人AI系统设计提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏