arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-27 至 2026-07-27 共收录 43 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 3 篇

2607.20491 2026-07-27 cs.AI cs.CL cs.LG 版本更新 87%

DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making

DFAH-Bench:金融决策中可观测智能体不稳定性的基准测试

Raffi Khatchadourian

专题命中 工具调用 :agent(title,abstract);AI agent(abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究金融决策中智能体行为稳定性,引入DFAH-Bench基准,通过多渠道衡量。发现仅结果一致性不能完全反映稳定性,前沿模型存在决策与工具路径一致性差距,识别出三种行为模式,并开源相关代码和数据。

Comments 15 pages, 3 figures. Code, sanitized replay logs, one-command reproduction (make reproduce-paper), and an interactive results explorer: https://github.com/ibm-client-engineering/output-drift-financial-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21461 2026-07-27 cs.AI 版本更新 85%

AREX: Towards a Recursively Self-Improving Agent for Deep Research

AREX:迈向深度研究的递归自我改进智能体

Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Lei Xiong, Jiahao Wang, Sen Wang, Xiyan Jiang, Wanli Li, Yuyang Hu, Hongjin Qian, Bingyu Yan, Jianlyu Chen, Ziyi Xia, Yingxia Shao, Kang Liu, Zhicheng Dou, Di He, Chaozhuo Li, Qiwei Ye, Zhongyuan Wang, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京通用人工智能研究院)

专题命中 工具调用 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究针对深度研究中发现与验证答案的不对称性,提出递归自我改进智能体AREX。它通过内部研究与外部自我改进循环交替工作,学习自主上下文更新工具,经训练后在多个基准测试中显著优于同等规模基线,与参数更多模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24668 2026-07-27 cs.CL cs.AI 版本更新 62%

InteractComp: Evaluating Search Agents With Ambiguous Queries

InteractComp:使用模糊查询评估搜索代理

Mingyi Deng, Lijun Huang, Yani Fan, Fanqi Kong, Jiayi Zhang, Fashen Ren, Jinyi Bai, Fuzhen Yang, Dayi Miao, Zhaoyang Yu, Yifan Wu, Yanfei Zhang, Fengwei Teng, Yingjia Wan, Song Hu, Yude Li, Xin Jin, Conghao Hu, Haoyu Li, Qirui Fu, Tai Zhong, Xinyu Wang, Xiangru Tang, Nan Tang, Chenglin Wu, Yuyu Luo

机构 * DeepWisdom(深智科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) University of California, Los Angeles(加州大学洛杉矶分校) Agent Universe(智能体宇宙) McGill University(麦吉尔大学) Yale University(耶鲁大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对搜索代理缺乏处理模糊查询及交互能力的问题,引入InteractComp基准,通过目标-干扰物方法构建问题评估17个模型,发现模型存在过度自信问题,强制交互有提升,揭示交互能力停滞,该基准对评估和训练搜索代理交互能力有重要价值。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 11 篇

2606.24416 2026-07-27 cs.AI 版本更新 90%

Agentic AI for Bilevel Long-Term Optimization of Policy-Driven Physical Layer Systems

策略驱动的物理层系统的双层长期优化的代理人工智能

Bingnan Xiao, Chenhao Yang, Wei Ni, Xin Wang, Tony Q. S. Quek

机构 * Key Laboratory of EMW Information (MoE), College of Future Information Technology, Fudan University(复旦大学未来信息技术学院电磁波信息科学教育部重点实验室) James Watt School of Engineering, University of Glasgow(格拉斯哥大学詹姆斯·瓦特工程学院) School of Engineering, Edith Cowan University(埃迪斯科文大学工程学院) Information Systems Technology and Design Pillar, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计系)

专题命中 规划决策 :agentic(title,summary_cn);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出Agentic-LTPO框架,利用代理AI生成上层配置,下层求解实时物理层问题,在无小区MIMO波束成形中实现57.2%的长期性能提升。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02024 2026-07-27 cs.AI 版本更新 85%

From Mind to Machine: The Rise of Manus AI as a Fully Autonomous Digital Agent

从心智到机器:Manus AI作为完全自主数字代理的崛起

Minjie Shen, Yanshu Li, Lulu Chen, Zhichao Fan, Yanhang Li, Qikai Yang, Haochen Yang

机构 * Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工学院电气与计算机工程系) Department of Computer Science, Brown University(布朗大学计算机科学系) Department of Computer Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Khoury College of Computer Sciences, Northeastern University(东北大学科里尔计算机科学学院)

专题命中 规划决策 :agent(title,abstract);AI agent(abstract);planning(abstract);分类 cs.AI

AI总结 Manus AI是一款通用人工智能代理,结合大语言模型的推理与规划能力,执行复杂任务并产生实际成果,本文全面介绍了其技术架构、跨行业应用及未来潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19214 2026-07-27 cs.DC 版本更新 82%

Keeping the Cache Warm Pays: Keepalive Economics for Agentic Workloads

保持缓存热度是值得的:智能工作负载的保活经济学

Maxim Khailo

专题命中 规划决策 :agentic(title,abstract);agent(abstract)

AI总结 研究智能工作负载中缓存前缀易被逐出致成本增加的问题,提出客户端保活方法,通过定时器重放前缀保持缓存热度,降低请求成本,还探讨了ping频率及保活策略的经济性,推导了运营商策略。

Comments 5 pages, 1 figure, 3 tables. Measurement data and harness: https://github.com/mempko/pi (scripts/cache-research)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17981 2026-07-27 cs.SE 版本更新 79%

Planning to Hammer: Difficulty-Aware Decomposition for Automating Rocq Proofs

规划锤击:面向自动化Rocq证明的难度感知分解

Ning Zhang, Nongyu Di, Zenan Li, Yuan Yao, Xiaoxing Ma

专题命中 规划决策 :planning(title,abstract);分类 cs.SE

AI总结 提出Quarry框架,通过LLM规划证明分解并利用难度模型排序子目标,结合CoqHammer自动证明,在Rocq基准测试中成功率提升7%-13%。

Comments 26 pages, 8 figures; submitted to OOPSLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10554 2026-07-27 cs.CV 版本更新 78%

DeepUrban: Interaction-Aware Trajectory Prediction and Planning for Automated Driving by Aerial Imagery

DeepUrban: 基于无人机影像的自动驾驶交互感知轨迹预测与规划

Constantin Selzer, Fabian B. Flohr

机构 * Department of Electrical Engineering and Information Technology, Intelligent Vehicles Lab (IVL), Munich University of Applied Science(电气工程与信息学院,智能车辆实验室(IVL),慕尼黑应用技术大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 DeepUrban通过无人机影像提供密集城市环境下的轨迹预测与规划数据集,提升自动驾驶系统在复杂交互场景中的预测精度。

Journal ref 2024 IEEE 27th International Conference on Intelligent Transportation Systems (ITSC), Edmonton, AB, Canada, 2024, pp. 221-227

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13219 2026-07-27 cs.RO cs.MS 版本更新 78%

A Unified Framework for Automated Assembly Sequence and Production Line Planning using Graph-based Optimization

基于图优化的自动化装配序列与生产线规划统一框架

Christoph Hartmann, Marios Demetriades, Kevin Prüfer, Zichen Zhang, Klaus Spindler, Stefan Weltge

机构 * Technical University of Munich, Chair of Metal Forming(慕尼黑技术大学金属成形与铸造系) Faurecia Emissions Control Technologies, Germany GmbH(德国法乌里亚排放控制技术公司) Technical University of Munich, Professorship for Discrete Mathematics(慕尼黑技术大学离散数学教授职位)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出PyCAALP框架,通过图优化方法实现自动化装配序列与生产线规划,结合启发式算法和混合整数规划,提升复杂装配规划效率。

Comments Code available at https://github.com/TUM-utg/PyCAALP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12311 2026-07-27 cs.NI cs.CR cs.HC cs.LG 版本更新 70%

Cross-reality location privacy protection in 6G-enabled vehicular metaverses: an LLM-enhanced hybrid generative diffusion model-based approach

6G赋能车联网元宇宙中的跨现实位置隐私保护:一种基于LLM增强混合生成扩散模型的方法

Xiaofeng Luo, Jiayi He, Jiawen Kang, Ruichen Zhang, Zhaoshui He, Ekram Hossain, Dong In Kim

机构 * School of Automation, Guangdong University of Technology(自动化学院,广东技术大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) Department of Electrical and Computer Engineering, University of Manitoba(电气与计算机工程系,曼尼托巴大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(电气与计算机工程系,成均馆大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于LLM增强混合生成扩散模型的方法,用于6G赋能车联网元宇宙中的跨现实位置隐私保护,通过混合动作优化平衡隐私保护、延迟降低和服务质量维护。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15591 2026-07-27 cs.IR 版本更新 67%

RecGPT-V3 Technical Report

RecGPT-V3技术报告

Bowen Zheng, Chao Yi, Dian Chen, Gaoyang Guo, Han Zhu, Jiakai Tang, Jian Wu, Mao Zhang, Wen Chen, Yifan Lu, Yujie Luo, Yuning Jiang, Zhujin Gao, Bo Zheng, Chenchi Zhang, Dixuan Wang, Hao Fang, Jiancai Liu, Jing Yu, Junjun Zheng, Ke Chen, Kewei Zhu, Mengyan Li, Mingke Xu, Wenjun Yang, Xiangheng Kong, Xinming Zhang, Xunke Xi, Zile Zhou

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19212 2026-07-27 cs.CL cs.AI cs.CY 版本更新 62%

When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas

当伦理与收益相悖时:道德两难情境下的大语言模型智能体

Steffen Backmann, David Guzman Piedrahita, Terry Jingchen Zhang, Emanuel Tewolde, Rada Mihalcea, Bernhard Schölkopf, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究道德要求与利润激励冲突时LLMs在道德两难博弈中的行为,引入\msim评估九个模型,通过ATEs估计因果效应、分析推理轨迹,发现模型道德行为有情境脆弱性,揭示了部署风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14514 2026-07-27 cs.CV cs.AI 版本更新 57%

VTM-Nav: Harnessing Cross-Episode Experience for Object-Goal Navigation with Hierarchical Visual-Topological Memory

VTM-Nav:用于跨情节对象目标导航的分层视觉拓扑记忆

Xiaoran Xu, Yupeng Wu, Tianyu Xue, Yifan Xu, Xuanran Dong, Xiaoshan Yang, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉科学学院) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究跨情节对象目标导航问题,提出无训练的VLM导航框架\method,其带有分层视觉拓扑记忆,通过粗到细匹配检索经验,在三个基准测试中性能最佳,证明跨数据集结构化视觉拓扑经验复用有效且鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00368 2026-07-27 cs.DC 版本更新 50%

TENT: A Declarative Slice Spraying Engine for Performant and Resilient Data Movement in Disaggregated LLM Serving

TENT:一种用于高性能和容错数据移动的声明式切片喷射引擎

Feng Ren, Ruoyu Qin, Teng Ma, Shangming Cai, Zheng Liu, Chao Lei, Dejiang Zhu, Ke Yang, Zheming Li, Jialei Cui, Weixiao Huang, Yikai Zhao, Yineng Zhang, Hao Wu, Xiang Gao, Yuhao Fu, Jinlei Jiang, Yongwei Wu, Mingxing Zhang

专题命中 规划决策 :agentic(abstract)

AI总结 TENT通过解耦传输意图与物理执行,统一异构互连技术为动态资源池,实现高效、容错的数据传输,提升LLM推理和RL流水线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多智能体 9 篇

2601.17303 2026-07-27 cs.LG cs.AI cs.DC cs.ET 版本更新 90%

Decentralized Multi-Agent Swarms for Autonomous Grid Security in Industrial IoT: A Consensus-based Approach

去中心化多智能体群组用于工业物联网自主网络安全:基于共识的方法

Samaresh Kumar Singh, Joyjit Roy, Chirag Agrawal

机构 * st Samaresh Kumar Singh(第一作者) nd Joyjit Roy(第二作者)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于共识的去中心化多智能体群组架构,用于提升工业物联网网络安全,实现快速响应和高准确率检测恶意活动。

Comments 9 pages, 8 figures, and Submitted to IEEE SoutheastCon 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15781 2026-07-27 cs.AI cs.ET cs.MA 版本更新 89%

AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets

AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架

Ming Chen, Pranav Pai

机构 * The University of Melbourne(墨尔本大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01647 2026-07-27 cs.AI 版本更新 89%

Exploring Robust Multi-Agent Workflows for Environmental Data Management

探索环境数据管理的鲁棒多智能体工作流

Boyuan Guan, Jason Liu, Yanzhao Wu, Kiavash Bahreini

机构 * Florida International University(佛罗里达国际大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出EnviSmart系统,通过知识架构和角色分离的多智能体设计提升环境数据管理的可靠性和效率,验证了多智能体工作流在处理复杂环境数据任务中的优势。

Comments Accepted at PEARC 2026. 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17454 2026-07-27 cs.MA cs.AI cs.LG 版本更新 88%

Embodiment-Induced Coordination Regimes in Tabular Multi-Agent Q-Learning

体感诱导的表格多智能体Q学习协调模式

Muhammad Ahmed Atif, Nehal Naeem Haji, Mohammad Shahid Shaikh, Muhammad Ebad Atif

机构 * Dhanani School of Science and Engineering(丹尼尼科学与工程学院)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究通过表格化网格世界验证集中价值学习在多智能体Q学习中的协调效果,发现其在不同运动模式和角色下效果不一,协调性可能因体感限制而成为负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05789 2026-07-27 cs.MA cs.GT cs.LG 版本更新 88%

The Coordination Gap: Multi-Agent Alternation Metrics for Temporal Fairness in Repeated Games

协调差距:多智能体交替度量在重复游戏中的时间公平性

Nikolaos Al. Papadopoulos, Ismael Tito Freire, Marti Sanchez-Fibla, Konstantinos E. Psannis

机构 * Department of Applied Informatics, University of Macedonia, Egnatia 156, Thessaloniki 54636, Greece(马其顿大学应用信息学院,Egnatia 156,希腊塞萨洛尼基 54636)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出Perfect Alternation作为参考协调模式,设计了六种交替度量指标,揭示传统度量在时间结构敏感性上的不足,表明高总体收益可能伴随差的协调性。

Comments 15 pages, 5 figures, 4 tables, 1 supplementary pdf. Submitted to Complexity

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10558 2026-07-27 cs.MA cs.SY eess.SY 版本更新 88%

Effect of Graph Gluing on Consensus in Networked Multi-Agent Systems

图粘合对网络多智能体系统共识的影响

Rohollah Moghadam, Santosh Kandel

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 研究图粘合操作对多智能体网络系统性能的影响,分析连接策略与代数连通性之间的关系,通过仿真验证理论成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17063 2026-07-27 cs.AI 版本更新 70%

When LLMs Over-Answer: Measuring and Mitigating Quality Issues in LLM-Based Hardware Description Language Question Answering

当大语言模型过度回答时:测量和缓解基于大语言模型的硬件描述语言问答中的质量问题

Ziteng Hu, Jiachi Chen, Wenhao Lv, Huan Zhang, Yingjie Xia

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究基于大语言模型的硬件描述语言问答质量问题,收集相关问答帖子构建数据集并开展用户研究,发现LLMs存在过度回答倾向。据此提出多智能体框架,用特定指标评估答案质量,该框架有效提升了主流LLMs的回答质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19785 2026-07-27 cs.MA 版本更新 67%

Not Birds of a Feather: Personality-Based Partner Selection in LLM Agents

并非一丘之貉:基于大语言模型代理的个性伙伴选择

Tao Wang, Hsiang-Ling Chiu, Chihang Wei, Zhonghao Hou, Yang Xiu

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 研究大语言模型代理中基于个性的伙伴选择,在能力不变时,通过实验发现选择遵循任务刻板印象映射,非同类相吸且与人类团队绩效证据校准错误,揭示了个性选择的特点及对代理市场偏差审计的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09050 2026-07-27 quant-ph 版本更新 67%

Bridging Theory and Practice in Quantum Game Theory: Optimized Implementation of the Battle of the Sexes with Error Mitigation on NISQ Hardware

量子博弈论中的理论与实践桥梁:在NISQ硬件上通过误差缓解实现性别之战的优化实现

Germán Díaz Agreda, Carlos Andres Duran Paredes, Mateo Buenaventura Samboni, Jhon Alejandro Andrade, Sebastián Andrés Cajas Ordoñez

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 该研究在IBM Quantum的超导处理器上实验实现性别之战游戏,评估四种量子策略,引入GCM方法减轻噪声和变异性,分析模型预测收益提升,实验结果在一定误差内符合预期,证明NISQ条件下量子优势可助力量子博弈论实际应用。

Comments Accepted at "II Taller Latinoamericano en Ingenieria y Software Cuantico" (TLISC), held within CHILECON 2025, October 28-30, 2025, Valparaiso, Chile. Published version: DOI 10.1109/CHILECON66915.2025.11476221

Journal ref 2025 IEEE CHILEAN Conference on Electrical, Electronics Engineering, Information and Communication Technologies (CHILECON), Valparaiso, Chile, 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 工作流自动化 7 篇

2607.19190 2026-07-27 cs.RO cs.AI 版本更新 83%

Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

智能体真实到模拟:使用视觉语言智能体进行基于物理的世界建模

Guanxiong Chen, Qianjun Xia, Jiawei Peng, Heng Zhang, Bole Ma, Justin Qian, Ziyi Jiao, Bingyang Zhou, Luoxin Ye, Kaifeng Zhang, Kunyi Wang, Weijia Zeng, Yunuo Chen, Pengzhi Yang, Ziqiu Zeng, Siyuan Luo, Huamin Wang, Chao Liu, Alan Yuille, Fan Shi, Changxi Zheng, Yunzhu Li, Chenfanfu Jiang, Peter Yichen Chen

机构 * University of British Columbia(英属哥伦比亚大学) Johns Hopkins University(约翰·霍普金斯大学) National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Style3D(无合适对应中文名)

专题命中 工作流自动化 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 研究针对机器人与物体交互的真实到模拟转换难题,提出智能体真实到模拟框架,利用视觉语言智能体进行广义物理世界建模,能转换真实记录为可模拟孪生体,在多场景评估效果良好,成本低,可用于下游机器人任务。

Comments Authorship change

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14186 2026-07-27 cs.SE cs.AI cs.LG 版本更新 82%

NexForge: Scaling Agent Capabilities through Requirement-Driven Task Synthesis for LLMs

NexForge:通过需求优先合成扩展可执行智能体任务

Jiarong Zhao, Zhikai Lei, Zhiheng Xi, Rui Zheng, Hang Yan, Jie Zhou, Qin Chen, Liang He

专题命中 工作流自动化 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究针对可执行智能体训练数据扩展瓶颈,提出需求优先框架NexForge,通过需求发现、任务编译等步骤生成训练数据,提升了模型在多个基准测试中的性能,助力Nex-N2模型达到开源先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04624 2026-07-27 cs.AI cs.SE 版本更新 81%

AuditRepairBench: A Paired-Execution Trace Corpus for Evaluator-Channel Ranking Instability in Agent Repair

AuditRepairBench:用于评估智能体修复中评估器通道排名不稳定性的配对执行跟踪语料库

Yuelin Hu, Zhenbo Yu, Zhengxue Cheng, Wei Liu, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Maritime University(上海 Maritime University)

专题命中 工作流自动化 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究智能体修复排行榜因评估器重新配置而重新排序的问题,通过AuditRepairBench语料库及模块化筛选架构实现评估器通道阻塞排名不稳定性评估,经多种验证和实验,证明筛选引导盲补丁能有效减少排名位移。

Comments The authors have identified substantial issues in the experimental design and evaluation that affect the validity of the main conclusions. Therefore, the authors have decided to withdraw this manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25582 2026-07-27 cs.LG 版本更新 57%

Safe In-Context Reinforcement Learning

安全的上下文强化学习

Amir Moeini, Minjae Kwon, Alper Kamil Bozkurt, Yuichi Motai, Rohan Chandra, Lu Feng, Shangtong Zhang

机构 * University of Virginia(弗吉尼亚大学) Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学)

专题命中 工作流自动化 :agent(abstract);分类 cs.LG

AI总结 提出SCARED方法,在无参数更新的上下文强化学习适应过程中,通过精确惩罚对偶法在约束马尔可夫决策过程框架下保证安全,实现奖励最大化与成本约束。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20593 2026-07-27 cond-mat.mtrl-sci 版本更新 50%

Predicting co-segregation in alloys with solute-solute interactions

利用溶质-溶质相互作用预测多组分合金中的共富集

Zuoyong Zhang, Chuang Deng

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出扩展双溶质模型,通过机器学习预测溶质-溶质相互作用,用于多组分合金中溶质共富集行为的定量预测,结合分子动力学和蒙特卡罗模拟验证了方法的有效性。

Comments main text: 39 pages, 8 figures; Supplementary Materials (i): 11 pages, 10 figures; Supplementary Materials (ii): 20 pages, spectral dataset for 55 ternary systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11839 2026-07-27 quant-ph physics.atom-ph physics.chem-ph physics.optics 版本更新 50%

Molecular Quantum Control Algorithm Design by Reinforcement Learning

通过强化学习设计分子量子控制算法

Anastasia Pipi, Xuecheng Tao, Arianna Wu, Prineha Narang, David R. Leibrandt

专题命中 工作流自动化 :agent(abstract)

AI总结 本文提出基于强化学习的量子逻辑光谱学方法,用于制备分子离子的单纯量子态,通过优化脉冲序列和概率操控实现量子系统坍缩,验证了其在H3O+和CaH+分子中的应用效果。

Journal ref Phys. Rev. Research, 8, 033103 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10247 2026-07-27 cond-mat.mtrl-sci physics.ins-det 版本更新 50%

Practical Crystallography with a Transmission Electron Microscope

用透射电子显微镜进行实用晶体学研究

Benjamin L. Weare, Kayleigh L. Y. Fung, Ian Cardillo-Zallo, William J. Cull, Michael W. Fay, Stephen P. Argent, Paul D. Brown

专题命中 工作流自动化 :workflow(abstract)

AI总结 研究针对三维电子衍射(3DED)应用受限问题,提出GiveMeED软件用于可控数据采集,结合多种技术描述晶体与成分,经案例证明其准确性和有效性,还免费提供该软件以推动3DED更广泛应用。

Comments Published version: http://doi.org/10.1111/jmi.70151 This version: submitted manuscript (Journal of Microscopy). Associated raw data: http://doi.org/10.17639/nott.7567 Associated GitHub: https://github.com/benweare/GiveMeED

详情

展开后加载摘要…

URL PDF HTML 收藏