arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-02 至 2026-06-02 共收录 432 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 37 篇

2606.00518 2026-06-02 cs.AI 87%

Acting with AI: An Interaction-Based Framework for Agentic Tort Liability

与AI行动:基于交互的代理侵权责任框架

Yiheng Yao

机构 * Yiheng Yao(姚艺恒)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 本文基于Bratman规划理论和普通法人类协同行动原则,提出一种交互分类框架(自主漂移、纯工具使用、协作规划)来分配AI代理系统的侵权责任,并引入“合理代理”标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14849 2026-06-02 cs.LG cs.AI cs.DC cs.MA 87%

Atomix: Timely, Transactional Tool Use for Reliable Agentic Workflows

Atomix: 用于可靠智能体工作流的及时事务性工具使用

Bardia Mohammadi, Nearchos Potamitis, Lars Klein, Akhil Arora, Laurent Bindschaedler

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Aarhus University(奥胡斯大学) EPFL(苏黎世联邦理工学院)

专题命中 工具调用 :tool use(title);agentic(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体多步工作流中因故障、推测和并发导致的状态不一致问题,提出Atomix系统,通过进度感知事务将效果分组与冲突解决分离,实现可靠提交与回滚。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01838 2026-06-02 cs.CL cs.AI cs.LG 85%

LayerRoute: Input-Conditioned Adaptive Layer Skipping via LoRA Fine-Tuning for Agentic Language Models

LayerRoute: 基于LoRA微调的输入条件自适应层跳过方法用于智能语言模型

Prateek Kumar Sikdar

机构 * Accenture(埃森哲)

专题命中 工具调用 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出LayerRoute,通过为每个Transformer块添加轻量级路由器和LoRA适配器,根据输入类型(工具调用或规划推理)自适应跳过层,在仅增加0.22%可训练参数下实现12.91%的跳过差异并提升质量。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01801 2026-06-02 cs.MA 85%

MetaForge: A Self-Evolving Multimodal Agent that Retrieves, Adapts, and Forges Tools On Demand

MetaForge:一种自我进化的多模态智能体,可按需检索、适应和锻造工具

Shouang Wei, Houcheng Min, Xinpeng Dong, Xin Lin, Sen Cui, Bo Jiang, Zhongxiang Dai, Kun Kuang, Guandong Xu, Fei Wu, Min Zhang

专题命中 工具调用 :agent(title,abstract);tool use(abstract);agentic(abstract)

AI总结 提出MetaForge框架,通过决策-检索-适应-锻造-回收的闭环机制,使多模态智能体能够按需自我进化工具集,在12个基准测试中超越16个基线方法,提升了准确性、效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01444 2026-06-02 cs.AI cond-mat.mtrl-sci cs.CL cs.LG math.CT 85%

Self-Revising Discovery Systems for Science: A Categorical Framework for Agentic Artificial Intelligence

科学中的自我修正发现系统:面向主体人工智能的范畴论框架

Fiona Y. Wang, Markus J. Buehler

机构 * Laboratory for Atomistic and Molecular Mechanics(原子分子力学实验室) Department of Biological Engineering(生物工程系) Massachusetts Institute of Technology(麻省理工学院) Department of Civil and Environmental Engineering(土木与环境工程系) Department of Mechanical Engineering(机械工程系) Center for Computational Science and Engineering(计算科学与工程中心) Schwarzman College of Computing(施瓦茨曼计算学院)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出一个基于范畴论的框架,通过左Kan扩展实现科学发现中的表征体制转换,并应用于材料科学中的蛋白质力学和纤维网络建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00183 2026-06-02 cs.LG cs.AI math.OC stat.ML 84%

Agentic Transformers Provably Learn to Search via Reinforcement Learning

智能体Transformer通过强化学习可证明地学会搜索

Tong Yang, Yu Huang, Yingbin Liang, Yuejie Chi

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) The Ohio State University(俄亥俄州立大学) Yale University(耶鲁大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文通过构建双头Transformer实现随机深度优先搜索,并分析策略梯度训练动力学,证明该搜索机制能从稀疏强化反馈中分阶段涌现,且具备深度泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02357 2026-06-02 cs.CV cs.AI 83%

Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains

多模态智能体真的从工具使用中受益吗?能力增益的系统性研究

Garvin Guo, Donglei Yu, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Qinghao Wang, Minpeng Liao

专题命中 工具调用 :tool use(title);agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 通过对比工具增强与无工具的多模态智能体在多项任务上的表现,发现工具使用并未带来一致的性能提升,智能体更多是学会了工具调用模式而非真正利用工具扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01667 2026-06-02 cs.LG 83%

ATLAS: Agentic Test-time Learning-to-Allocate Scaling

ATLAS: 智能体测试时学习分配缩放

Peijia Qin, Qi Cao, Pengtao Xie

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.LG

AI总结 提出ATLAS框架,让LLM编排器通过单一

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00765 2026-06-02 cs.AI 83%

FALAT: Tracing Failures in LLM Agent Trajectories via Dependency-Guided Search

FALAT: 通过依赖引导搜索追踪LLM智能体轨迹中的失败

Md Nakhla Rafi, Md Ahasanuzzaman, Dong Jae Kim, Zhijie Wang, Tse-Hsun Chen

机构 * SPEAR Lab(SPEAR实验室) Concordia University(康科德大学) DePaul University(德保罗大学)

专题命中 工具调用 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出FALAT框架,通过依赖引导搜索方法,在LLM智能体轨迹中识别导致失败的关键步骤和责任智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00590 2026-06-02 cs.IR cs.AI 83%

Critic-R: Improving Agentic Search using Instruction-tuned Retrievers with Natural Language Introspective Feedback

Critic-R:使用具有自然语言内省反馈的指令调优检索器改进智能搜索

Md Zarif Ul Alam, Alireza Salemi, Hamed Zamani

机构 * Center for Intelligent Information Retrieval(智能信息检索中心) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出Critic-R框架,通过引入评论模型评估智能体内省推理轨迹,实现检索模型与推理代理之间的反馈闭环,无需人工标注即可优化检索质量与下游答案准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12984 2026-06-02 cs.CL 83%

SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents

SciAgentGym:LLM代理中多步科学工具使用的基准测试

Yujiong Shen, Yajie Yang, Zhiheng Xi, Binze Hu, Huayu Sha, Jiazheng Zhang, Qiyuan Peng, Junlin Shang, Jixuan Huang, Yutao Fan, Jingqi Tong, Shihan Dou, Ming Zhang, Lei Bai, Zhenfei Yin, Tao Gui, Xingjun Ma, Qi Zhang, Xuanjing Huang, Yu-Gang Jiang

机构 * Fudan NLP Group(复旦大学自然语言处理组)

专题命中 工具调用 :tool-use(title,abstract);agentic(abstract);分类 cs.CL

AI总结 为解决当前基准忽视代理在科学工作流中编排工具能力的问题,提出包含1780个领域特定工具的可扩展交互环境SciAgentGym和分层评估套件SciAgentBench,并设计数据合成方法SciForge,通过微调使SciAgent-8B超越更大模型,展示科学工具使用能力的跨领域正迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07436 2026-06-02 cs.AI 83%

LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services

LocalSearchBench:现实本地生活服务中的智能搜索基准测试

Hang He, Chuhuai Yue, Chengqi Dong, Mingxue Tian, Hao Chen, Zhenfeng Liu, Jiajun Chai, Xiaohan Wang, Yufei Zhang, Qun Liao, Guojun Yin, Wei Lin, Chengcheng Wan, Haiying Sun, Ting Su

机构 * Meituan, Beijing, China(美团,北京,中国) East China Normal University Shanghai Innovation Institute(东华大学上海创新研究院) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) North China University of Technology, Beijing, China(华北理工大学,北京,中国) East China Normal University Shanghai China(东华大学上海)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 针对本地生活服务领域,提出包含130万商家条目和900个多跳问答任务的基准测试LocalSearchBench,并开发统一环境LocalPlayground,实验表明现有大推理模型性能不足。

Comments 12 pages; accepted to KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD 2026), August 9--13, 2026, Jeju Island, Republic of Korea. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00075 2026-06-02 eess.SP 82%

Towards Networked One Search Agent Systems: Multilateration of WiFi Fine Time Measurement Responders Using GNSS References

迈向网络化单搜索代理系统:使用GNSS参考的多边定位WiFi精细时间测量响应器

Juan Bravo-Arrabal, Javier Serón-Barba, Carlos Simón Álvarez-Merino, J. J. Fernández-Lozano, Alfonso García-Cerezo, Anders Lyhne Christensen

专题命中 工具调用 :agent(title,abstract);multi-agent(abstract)

AI总结 提出一种基于无人机和GNSS参考的移动基线多边定位系统,通过WiFi FTM测距实时定位地面接入点,实验显示视距条件下水平误差可达4.4米。

Comments 8 pages, 3 figures, 1st Workshop on Robot Meets GNSS and Ranging for Seamless Autonomy, June 5, 2026 at IEEE ICRA in Vienna

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01065 2026-06-02 cs.DC cs.AI cs.LG 81%

Leyline: KV Cache Directives for Agentic Inference

Leyline:用于智能推理的 KV 缓存指令

Bole Ma, Jan Eitzinger, Harald Koestler

机构 * Erlangen National High Performance Computing Center(埃朗根国家高性能计算中心)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 针对智能体 LLM 中策略驱动的缓存编辑需求,提出 Leyline 服务端原语,通过声明式指令四元组和架构无关接口实现缓存拼接与截断,提升缓存命中率和求解率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00914 2026-06-02 cs.AI cs.CL cs.CR 81%

Adversarial Feeds Steer LLM Agent Decisions Against Their Defaults

对抗性输入流引导LLM智能体决策偏离其默认行为

Rana Muhammad Usman

机构 * Independent Researcher(独立研究者)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本研究通过控制实验揭示,外部输入流的组成和排序能因果性地改变LLM智能体的下游决策,存在对抗性屈服、默认饱和及默认方向不对称三种响应模式,且该效应在多个决策领域普遍存在。

Comments 14 pages, 5 figures. Code, post pools, and 2,785 decision rollouts: https://github.com/ranausmanai/recommenders-as-control-surfaces

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11374 2026-06-02 cs.LG cs.CL cs.IR 81%

Test-Time Compute for Frozen Embedding Models through Agentic Program Search

冻结嵌入模型在测试时通过智能体程序搜索的计算

Han Xiao

机构 * Jina AI by Elastic(Jina AI 由 Elastic 提供)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种智能体程序搜索方法,通过大语言模型编写程序操作冻结编码器API,在推理时提升小嵌入模型的检索质量,无需训练参数且跨任务迁移。

Comments 15 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02151 2026-06-02 cs.AI cs.SY eess.SY 79%

S3TS: Stochastic Scenario-Structured Tree Search for Advanced Planning Under Uncertainty

S3TS:面向不确定性下高级规划的随机情景结构化树搜索

Fabio Pavirani, Bert Claessens, Pierre Pinson, Chris Develder

机构 * IDLab Ghent university – imec(IDLab 布鲁塞尔大学 – imec) Beebop.ai Imperial College London(伦敦帝国理工学院)

专题命中 工具调用 :planning(title,abstract);分类 cs.AI

AI总结 提出随机情景结构化树搜索(S3TS)算法,通过情景树显式表示不确定性并集成非线性模型,在需求响应信号发布问题上实现近最优性能,成本比最优解高14%以内,在非线性场景中比贪心算法和确定性MCTS分别降低51%和5.4%的成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01830 2026-06-02 cs.AI 79%

CAPF: Guiding Search-Agent Rollouts with Credit-Attenuated Privileged Feedback

CAPF:基于信用衰减特权反馈引导搜索智能体轨迹生成

Bin Chen, Xinye Liao, Yiming Liu, Xin Liao, Chonghan Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 针对结果奖励稀疏导致搜索智能体学习困难的问题,提出训练时利用验证器侧信息(CAPF)将零奖励轨迹修复为正奖励轨迹,并衰减相关信用以适配无特权反馈的部署场景,在七个开放域问答基准上将Qwen3-4B的平均精确匹配分数从44.7%提升至48.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00660 2026-06-02 cs.CL 79%

FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search

FineVerify: 通过细粒度自验证扩展智能搜索的测试时计算

James Xu Zhao, Hui Chen, Bryan Hooi, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 提出FineVerify细粒度自验证框架,将问题分解为可检查的子问题,对候选答案逐项验证并聚合得分,在四个智能搜索基准上显著优于标准扩展基线。

Comments 8+18 pages, 6 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30848 2026-06-02 cs.CR cs.CL 79%

LLM Anonymization Against Agentic Re-Identification

LLM匿名化对抗智能体重识别

Ziwen Li, Jianing Wen, Tianshi Li

机构 * Khoury College of Computer Sciences(科里学院计算机科学学院) Northeastern University(东北大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 提出AURA框架,通过掩码-重构方法解耦隐私定位与效用保留,并利用对抗性隐私和效用检查,以抵抗基于网络搜索的智能体重识别攻击,同时保留文本的上下文效用。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01839 2026-06-02 cs.DC cs.AR cs.LG 74%

Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving

观察而非预测:面向智能体服务的对话级解耦调度

Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann

机构 * Anonymous Authors(匿名作者)

专题命中 工具调用 :agentic(title);分类 cs.LG

AI总结 提出将调度单元从单轮提升至整个对话,利用对话中首轮计算密集与后续内存密集的两阶段可观察特性,实现无需预测的解耦调度,显著降低延迟并提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01314 2026-06-02 cs.AI 74%

SkillSmith: Co-Evolving Skills and Tools for Self-Improving Agent Systems

SkillSmith: 技能与工具的协同进化用于自我改进的智能体系统

Yangbo Wei, Zhen Huang, Shaoqiang Lu, Junhong Qian, Qifan Wang, Chen Wu, Lei He

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究所) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所)

专题命中 工具调用 :agent(title);分类 cs.AI

AI总结 提出SkillSmith框架,通过统一提案空间和Lotka-Volterra生态效用模型实现技能与工具的协同进化,在多个基准测试中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00566 2026-06-02 cs.LG cs.CL cs.CR 73%

Same Payload, Different Channel: Measuring Trust Asymmetry in Tool-Using Language Models

相同载荷,不同通道:测量使用工具的語言模型中的信任不对称性

Mohammed Sameer Syed, Rozhin Yasaei

机构 * University of Arizona(亚利桑那大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出安全不对称分数(SAS),通过匹配恶意载荷仅改变传递上下文,系统测量了语言模型在不同通道(用户消息、工具元数据、工具输出)中对对抗性内容的脆弱性差异,发现代理原生模型在工具描述通道更脆弱,而通用模型相反,且机制研究表明安全相关表示在深层网络非线性编码。

Comments 13 pages, 1 figure. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00408 2026-06-02 cs.CL cs.AI cs.IR 73%

Masking Stale Observations Helps Search Agents -- Until It Doesn't: A Regime Map and Its Mechanism

掩盖过时观察帮助搜索智能体——直到适得其反:一个机制图谱及其机制

Haoxiang Zhang, Qixin Xu, Zhuofeng Li, Lei Zhang, Pengcheng Jiang, Yu Zhang, Julian McAuley

机构 * UC San Diego(加州大学圣地亚哥分校) UC Berkeley(加州大学伯克利分校) Texas A&M University(德克萨斯大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文通过系统实验发现,在长时域搜索智能体中掩盖过时观察的效果呈现非对称倒U型曲线,取决于检索器召回率与模型隐式过滤能力的交互,并揭示了其背后的令牌-轮次权衡机制。

Comments 47 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11359 2026-06-02 cs.AI physics.data-an 70%

CVEvolve: Autonomous Algorithm Discovery for Unstructured Scientific Data Processing

CVEvolve:面向非结构化科学数据处理的自主算法发现

Ming Du, Xiangyu Yin, Yanqi Luo, Dishant Beniwal, Songyuan Tang, Hemant Sharma, Mathew J. Cherukara

机构 * Argonne National Laboratory(阿贡国家实验室) Advanced Photon Source(先进光子源)

专题命中 工具调用 :autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出CVEvolve,一种零代码自主智能体框架,通过多轮搜索与工具集成,自动发现用于非结构化科学数据处理的算法,并在多个任务上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00405 2026-06-02 cs.GT 67%

From Talking Words to Sharing Thoughts: Scalable Multi-LLM Aggregation via Structured Message Passing

从言语到思想:通过结构化消息传递实现可扩展的多LLM聚合

Niloufar Mehrabi, Sayed Pedram Haeri Boroujeni, Abolfazl Razi

专题命中 工具调用 :agent(abstract);multi-agent(abstract)

AI总结 提出基于二分因子图的消息传递框架,通过语义层集成多个LLM的输出分布,实现高效、可扩展的多模型聚合,在降低97%令牌使用和6倍API调用的同时,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01708 2026-06-02 cs.LG cs.AI 62%

Two-Fidelity Best-Action Identification for Stochastic Minimax Tree

随机极小极大树的双保真度最优动作识别

Peter Chen, Xi Chen

机构 * Department of Mathematics, Columbia University(哥伦比亚大学数学系) Stern School of Business, New York University(纽约大学斯特恩商学院)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对随机极小极大树中的固定置信度最优动作识别问题,提出双保真度树搜索算法2FFS,结合极小极大快速扩展与MCTS随机采样,自适应选择廉价有偏评估或昂贵精确评估,理论证明固定置信度正确性、有限停止及多项式深度成本上界,实验表明比现有BAI-MCTS基线显著减少样本和计算。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24248 2026-06-02 cs.CR cs.AI cs.SE 62%

Attested Tool-Server Admission: A Security Extension to the Model Context Protocol

认证工具服务器准入:模型上下文协议的安全扩展

Alfredo Metere

机构 * Enclawed LLC(Enclawed公司)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 针对MCP协议缺乏信任机制的问题,提出mcp-attested扩展,通过离线签名的权限断言、默认拒绝的工具白名单和分级强制审计日志,实现安全服务器准入与工具边界控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03789 2026-06-02 cs.LG cs.AI 62%

Automated Conjecture Resolution with Formal Verification

自动猜想解决与形式化验证

Haocheng Ju, Guoxiong Gao, Jiedong Jiang, Bin Wu, Zeming Sun, Shurui Liu, Leheng Chen, Yutong Wang, Yuefeng Wang, Zichen Wang, Wanyi He, Peihao Wu, Liang Xiao, Ruochuan Liu, Bryan Dai, Bin Dong

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Westlake Institute for Advanced Study, Westlake University(西拉雅大学先进研究所) School of Mathematics, Tianjin University(天津大学数学学院) Research Institute for Mathematical Sciences, Kyoto University(京都大学数学研究所) Department of Mathematics, Stanford University(斯坦福大学数学系) IQuest Research(IQuest研究) New Cornerstone Science Laboratory, School of Mathematical Sciences, Peking University(北京大学数学科学学院新基石科学实验室) Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学国际数学研究所以及新基石科学实验室) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾大学先进研究所智能计算中心) Zhongguancun Academy(中关村学院)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一个集成非形式化推理与形式化验证的自动框架,通过两个组件Rethlas和Archon解决研究级数学问题,并成功解决交换代数中的开放问题并在Lean 4中形式化验证。

Comments Code and resources are available at: Rethlas (https://github.com/frenzymath/Rethlas), Rethlas Results (https://github.com/frenzymath/Rethlas_results), Archon (https://github.com/frenzymath/Archon), and the formalization results (https://github.com/frenzymath/Anderson-Conjecture)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20333 2026-06-02 cs.AI cs.LG cs.NE 62%

NNGPT: Rethinking AutoML with Large Language Models

NNGPT: 用大型语言模型重新思考AutoML

Roman Kochnev, Waleed Khalid, Tolgay Atinc Uzun, Xi Zhang, Yashkumar Sanjaybhai Dhameliya, Furui Qin, Chandini Vysyaraju, Raghuvir Duvvuri, Avi Goyal, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出NNGPT开源框架,利用大型语言模型实现自我改进的AutoML引擎,通过生成-评估-自我改进闭环自动设计神经网络架构和超参数。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 5664-5674, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏