arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-14 至 2026-07-14 共收录 311 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 19 篇

2607.09673 2026-07-14 cs.CY 新提交 67%

Critsly: An Artefact-Aware AI Critique Teammate for Design Education and Project-Based Learning

Critsly:用于设计教育和基于项目学习的人工制品感知人工智能批判队友

Nizam Kadir, Juan David Salazar Rodriguez, Sumaiyya Al

专题命中 记忆与上下文管理 :planning(abstract);workflow(abstract)

AI总结 研究针对设计教育和基于项目学习中高质量批判稀缺等问题,提出Critsly这一人工制品感知的人工智能批判工作区,结合多种功能,将AI变为批判队友,为学习者和教育者提供更优批判实例。

Comments 3 pages, Accepted submission to the 27th International Conference on Artificial Intelligence in Education Interactive Events Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11607 2026-07-14 cs.AI cs.LG stat.ML 新提交 62%

Auditing the Risk Claims of Distributional Reinforcement Learning

审核分布强化学习的风险声明

Hari Prasad

机构 * Hari Prasad

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究分布强化学习智能体风险声明真实性,结合决策指标与统计工具审核,发现多数声明被驳斥,风险反映训练假象,阳性对照证实部分真实声明,训练和集成无法消除问题,重新校准仅否定声明,还记录审核陷阱。

Comments 25 pages, 8 figures, 3 tables (main text); includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11530 2026-07-14 cs.AI cs.LG 新提交 62%

Learning Residual Kinematic Corrections for Continuous Neural Decoding via Reinforcement Learning

通过强化学习学习连续神经解码的残余运动学校正

Jiamian Li, Niall McShane, Attila Korik, Naomi du Bois, Karl McCreadie, Leen Jabban, Benjamin Metcalfe, Özgür Şimşek, Damien Coyle

机构 * University of Bath(巴斯大学) University of Ulster(阿尔斯特大学) Bath Institute for the Augmented Human(巴斯增强人类研究所)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对基于EEG的BCI连续3D运动想象解码难题,提出CNN-LSTM-RL两阶段框架,用强化学习对解码器输出校正残余运动学误差,实验表明该框架有效提升解码性能,推动相关领域发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11272 2026-07-14 stat.ML cs.LG 新提交 57%

Long-Memory Reservoir Computing for Data-Scarce Dengue Forecasting

用于数据稀缺的登革热预测的长记忆回声状态网络计算

Rahul Goswami, Shinjini Paul, Palash Ghosh, Tanujit Chakraborty

机构 * Indian Institute of Technology Guwahati(印度理工学院古瓦哈蒂分校) Sorbonne University Abu Dhabi(阿布扎赫大学索邦大学) Leiden University(莱顿大学) Sorbonne University(索邦大学)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.LG

AI总结 针对登革热预测中数据稀缺、序列复杂的问题,提出长记忆回声状态网络计算框架,包含fESN和wESN两个变体,能有效编码长期依赖性,优于统计和深度学习基线,结合共形预测可提供不确定性区间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09714 2026-07-14 cs.AI cs.MA 新提交 57%

Feedback-Coupled Memory Systems in Continuous Time

连续时间中的反馈耦合记忆系统

Stefano Grassi

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究反馈耦合记忆系统,通过基于机制的智能和耦合记忆图过程分别定义未明确的代理更新算子和环境更新算子,推广了离散FCMS稳定性条件等,实现连续时间FCMS实例的李雅普诺夫全局耗散性,数值模拟和验证证实相关结论。

Comments 19 pages, 4 figures. Extends arXiv:2603.11560 to continuous time. Code: github.com/stevefatz95/fcms-continuous

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01063 2026-07-14 cs.AI 版本更新 57%

MindClaw: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention

MindClaw: 用于精确干预的闭环具身心理状态推理

Ruoxuan Zhang, Qiaoqiao Wan, Zhengguang Wang, Chenghao Yu, Hongxia Xie, Jianlong Fu, Wen-Huang Cheng

机构 * Jilin University(吉林大学) Microsoft Asia(微软亚洲) National Taiwan University(国立台湾大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 提出MindClaw框架,通过闭环具身心理状态推理实现精确干预,结合多源输入、信念记忆、认知触发技能和动作生成,在动态环境中优化干预时机。

Comments Extended version of the CVPR 2026 paper *MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents*. This work is in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10332 2026-07-14 cs.AI 版本更新 57%

EmbodiSkill: Skill-Aware Reflection for Self-Evolving Embodied Agents

EmbodiSkill:基于技能的反思以实现自我进化的具身智能体

Ruofei Ju, Xinrui Wang, Xin Ding, Yifan Yang, Hao Wu, Shiqi Jiang, Qianxi Zhang, Hao Wen, Xiangyu Li, Weijun Wang, Kun Li, Yunxin Liu, Haipeng Dai, Wei Wang, Ting Cao

机构 * Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR) Tsinghua University(清华大学人工智能产业研究院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出EmbodiSkill,一种无需训练的具身技能自我进化框架,通过技能感知反思和针对性修订提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05002 2026-07-14 cs.LG 版本更新 57%

Randomized Confidence Bounds for Stochastic Partial Monitoring

随机部分监测的随机置信界

Maxime Heuillet, Ola Ahmad, Audrey Durand

机构 * Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Mila - Québec AI Institute(魁北克人工智能研究所) Thales Digital Solutions (cortAIx lab)(泰勒斯数字解决方案(cortAIx实验室))

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 研究随机结果下的上下文和非上下文部分监测设置,基于确定性置信界随机化引入新策略,扩展遗憾保证,实验表明新策略在多个PM博弈中性能良好,还设计了监测分类系统错误率的用例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11136 2026-07-14 cs.DC 新提交 50%

Xema: Efficient Diffusion Serving through Fine-Grained Memory Management and Auto-Configuration

Xema:通过细粒度内存管理和自动配置实现高效扩散服务

Xueze Kang, Guangyu Xiang, Suyi Li, Yuxin Wang, Shaohuai Shi, Lin Zhang, Xiaowen Chu

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 研究针对扩散模型服务受GPU内存限制问题,提出Xema系统,通过细粒度内存管理和自动配置,利用可预测张量生命周期优化内存,引入离线规划器联合选择参数,实现高效扩散服务,相比现有配置提升SLO达成率并降低规划成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10262 2026-07-14 quant-ph cs.ET 新提交 50%

HSF-S: Speed-Optimized Compilation and Acceleration for Hybrid Schrodinger-Feynman Quantum Circuit Emulation

HSF-S:用于混合薛定谔 - 费曼量子电路仿真的速度优化编译与加速

Sechan Park, Kyeongwon Lee, Mundo Jeong, Chaebin Jung, Woojoo Lee

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 研究针对混合薛定谔 - 费曼量子电路仿真实际运行时间受跨边界双量子比特门指数级路径增长主导的问题,提出HSF-S框架,通过特定方法抑制跨边界相互作用,降低路径成本,在基准电路上大幅提高可处理性并实现加速。

Comments 11 pages, 8 figures, 2 tables. This paper is accepted for ICCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11755 2026-07-14 cond-mat.stat-mech physics.soc-ph 新提交 50%

A Fokker-Planck approach to a stochastic multiplicative wealth model with taxation and redistribution

一种用于具有税收和再分配的随机乘法财富模型的福克 - 普朗克方法

Iago Nascimento Barros, Marcelo Lobato Martins, Celia Anteneodo

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究具有税收和再分配的随机乘法财富模型,采用福克 - 普朗克方法,扩展原始公式涵盖多种再分配协议,推导平稳财富分布表达式,经模拟验证,用基尼指数量化,揭示特定再分配方案可减轻财富差距。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10381 2026-07-14 cond-mat.stat-mech nlin.AO 新提交 50%

Revisiting the non-equilibrium phase transitions of the continuous-trait Axelrod model

重新审视连续性状阿克塞尔罗德模型的非平衡相变

Sandro M. Reia, Paulo R. A. Campos, José F. Fontanari

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究连续性状阿克塞尔罗德模型的非平衡相变,通过分析中位数缩放和概率分布揭示其相变特征,发现\(F = 2\)时为混合转变,\(F = 3\)时为非混合一阶转变,还应用于离散泊松变体建立统一表征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01299 2026-07-14 cs.DC 版本更新 50%

HYPIC: Accelerating Hybrid-Attention LLM Serving with Position-Independent Caching

HYPIC: 利用位置无关缓存加速混合注意力LLM服务

Yifei Liu, Juntong Wu, Yang Liu, Junhao Hu, Minghao Li, Xiaoxu Chen, Weihang Chen

专题命中 记忆与上下文管理 :agentic(abstract)

AI总结 提出Hypic系统,通过段累积转移算子和边界重计算,实现混合注意力LLM的位置无关缓存,显著降低首令牌延迟并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 56 篇

2607.10768 2026-07-14 cs.AI 新提交 90%

Opti-Agent-Bench: Benchmarking End-to-End Optimization R&D Agents on Real-World Business Problems

Opti-Agent-Bench:在实际业务问题上对端到端优化研发智能体进行基准测试

Yongchang Fu, Xinjie Huang, Chengjun Dai, Chengzhe Feng, Junshao Zhang, Hong Zhu

机构 * Ding Talk, Alibaba Group(钉钉,阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI

AI总结 研究针对大语言模型解决优化问题的现有不足,引入Opti-Agent-Bench基准测试,通过业务语义真实性、模块化评估、ORAC双层有效性框架,在多工业规模任务中揭示当前模型关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11399 2026-07-14 cs.CL cs.AI 新提交 86%

Agentic Routing: The Harness-Native Data Flywheel

智能体路由:原生执行框架的数据飞轮

Xinchen Liu, Hang Zhou, Yingjie Zong, Yuchuan Tian, Liuyang Song, Shuo Zhang, Yulong Li, Wei He, Mengyu Zheng, Runke Liu, Siyang Cheng, Xiang Kuang, Hailin Hu, Kai Han, Yunhe Wang

机构 * TokenRhythm Technologies(TokenRhythm科技公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 研究大型语言模型智能体中模型选择问题,提出原生执行框架智能体路由范式,依执行框架状态选模型,其决策产生的数据记录形成数据飞轮,经实例化验证,表明该路由不仅控成本,更是智能体训练的数据引擎。

Comments Code: https://github.com/opensquilla/opensquilla

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11503 2026-07-14 cs.CL 新提交 85%

GEIS: A Generation-Evaluation-Improvement Loop of Agent Skills for Long-Form Article Generation

GEIS:用于长篇文章生成的智能体技能生成-评估-改进循环

Jiale Zhang, Juntao Hu, Zhijian Ou

机构 * Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能实验室) TasiTech Co., Ltd., China(泰赛科技有限公司)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);multi-agent(abstract);分类 cs.CL

AI总结 针对长篇文章生成难题,提出GEIS循环,通过在Tasi Harness中实现文章写作、证据图像收集等技能,经核心写作、成对评估及改进技能,在20个主题实验中提升了PDF质量得分,证明可将其转变为可改进循环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11423 2026-07-14 cs.CL 新提交 85%

ToFu: A White-Box, Token-Efficient Agent Harness for Researchers

ToFu:面向研究人员的白盒、令牌高效代理工具包

Junhao Ruan, Yuan Ge, Bei Li, Yongjing Yin, Yuchun Fan, Xin Chen, Jingang Wang, Chenglong Wang, Jingbo Zhu, Tong Xiao

机构 * Northeastern University(东北大学) LongCat RSI, Meituan(美团龙猫RSI) NiuTrans Research(小牛翻译研究院)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.CL

AI总结 研究提出ToFu这一代理工具包,作为研究助手,以高令牌效率等支持实际研究流程,且能本地部署;作为研究对象,提供白盒工具包供研究人员检查、修改和评估,兼具强大性能与用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10286 2026-07-14 cs.AI cs.MA 新提交 85%

Can Agentic Trading Systems Pay for Their Own Intelligence?

智能交易系统能否为自身智能付费?

Qiqi Duan, Changlun Li, Chen Wang, Fan Zhang, Mengxiang Wang, Dayi Miao, Peixian Ma, Jiangpeng Yan, Liyuan Chen, Shuoling Liu, Preslav Nakov, Yuyu Luo, Nan Tang

机构 * HKUST(GZ)(香港科技大学(广州)) Paradoox AI(悖论人工智能公司) E Fund Management Co., Ltd(易方达基金管理有限公司) MBZUAI(Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)) The University of Tokyo(东京大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 研究基于LLM的交易系统中智能体能否为自身智能付费的问题,引入TradeLens工具包进行评估,通过多方面分析发现可行性取决于智能到利润的转化,不同模型有不同失败模式,重构了此类交易智能体的评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11141 2026-07-14 cs.AI 新提交 83%

NextFund: A Unified Performance Tracking Platform for Agentic Portfolio Management

NextFund:用于智能投资组合管理的统一绩效跟踪平台

Changlun Li, Peixian Ma, Qiqi Duan, Zhenyu Lin, Peineng Wu

机构 * Paradoox AI Research(帕拉多克斯人工智能研究)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究基于大语言模型智能体参与投资组合管理的评估问题,提出NextFund平台,通过时间一致的市场准入等实现智能体行为可观察,能跨市场比较模型等,在多地股票上展示其可实现更公平基准测试和可行诊断的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11504 2026-07-14 cs.LG cs.CR 版本更新 83%

CTFusion: A CTF-based Benchmark for LLM Agent Evaluation

CTFusion: 一种基于CTF的LLM代理评估基准

Dongjun Lee, Ga-eun Bae, Insu Yun

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出CTFusion,一种基于CTF的评估框架,通过减少竞争影响和数据污染,提升对LLM代理的评估可靠性。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD), ICML 2026. Revised to match the camera-ready version. OpenReview: https://openreview.net/forum?id=aUSUvS4dPL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02905 2026-07-14 cs.AI 版本更新 83%

FIRE-Bench: Evaluating AI Agents on the Rediscovery of Scientific Insights

FIRE-Bench:评估人工智能代理在科学见解重新发现方面的表现

Zhen Wang, Fan Bai, Zhongyan Luo, Jinyan Su, Kaiser Sun, Xinle Yu, Jieyuan Liu, Kun Zhou, Claire Cardie, Mark Dredze, Zhiting Hu, Eric P. Xing

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究旨在评估大语言模型驱动的人工智能代理在科学见解重新发现上的能力。核心方法是引入FIRE-Bench基准,让代理基于高层次研究问题进行全周期探索。主要贡献是为衡量代理驱动的科学发现进展提供了严格诊断框架,揭示当前代理系统在全周期科研上的挑战。

Comments 34 pages, 3 figures, 16 tables; ICML 2026 Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09908 2026-07-14 cs.CL cs.IR 新提交 80%

RouteRec: Strict Evaluation of Recommender-Agent Selection and Aggregation

RouteRec:推荐代理选择与聚合的严格评估

Kaiji Zhou, Vladimir Kalmykov, Yue Feng

机构 * University of Birmingham(伯明翰大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL;AI agent(comments)

AI总结 研究在推荐系统异构代理选择中,RouteRec框架在成本约束下比较请求级硬选与项目级学习聚合,发现在MovieLens-1M数据集上,请求级选择粗糙,项目级聚合更有前景,不同聚合方式有不同效果。

Comments 8 pages, 7 figures. Accepted at AgentSearch 2026 (The First Workshop on Indexing, Retrieval, and Ranking of AI Agents), co-located with SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09770 2026-07-14 cs.AI cs.MA cs.SY eess.SY 新提交 79%

Verification of Adaptive Agentic Controllers through Finite Rule Revision

通过有限规则修订验证自适应智能体控制器

Roberto Garrone

机构 * Open University of Cyprus(塞浦路斯开放大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 研究自适应智能体控制器在特定条件下的验证问题,提出以有限规则等表示的有界验证协议,将故障映射到规则编辑,经实验得出三种结果,贡献是提供了可测试控制器故障相关特性的模拟兼容程序。

Comments 28 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09762 2026-07-14 cs.AI cs.DB 新提交 79%

BatteryLake: Agentic, Physics-Grounded Curation of Heterogeneous Battery Aging Data and Benchmarking

BatteryLake:基于物理原理的异构电池老化数据智能管理与基准测试

Tianwen Zhu, Hao Wang, Yonggang Wen

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 针对公共电池老化数据集应用受限问题,BatteryLake通过大语言模型智能体、人在回路机制等,将原始数据转化为可用于基准测试的资产,还发布了含多种任务和协议的开放基准测试。

Comments The platform, benchmark, and curation protocol are publicly available at https://tianwen1209.github.io/batterylake/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09711 2026-07-14 cs.LG cs.SE 新提交 73%

EvoClawBench: Can Agents Learn Reusable Skills from Their Own Runs?

EvoClawBench:智能体能否从自身运行中学习可复用技能?

Zhiyuan Peng, Xin Yin, Chenhao Ying, Zhe Cui, Zixiang Ding, Zhenhua Liu, Jiang Wu, Yuan Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Hithink Research(同花顺研究院)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.LG、cs.SE

AI总结 研究智能体能否从自身运行学可复用技能,引入EvoClawBench基准测试,涵盖多任务多子问题并支持多运行时。实验对比不同方式,发现直接基线性能依赖运行时,自我创作技能效果各异,表明学习可复用技能有选择性且成本敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09706 2026-07-14 cs.AI cs.GT cs.LG 新提交 73%

YUKTI: From Natural-Language Situations to Robust, Verifiable Decisions An Uncertainty-Typed Proposition IR, Assumption-Robust Pareto Frontiers, and a Regret Certificate

YUKTI:从自然语言情境到稳健、可验证的决策——一种不确定性类型的命题IR、假设稳健帕累托前沿和遗憾证书

Suyash Mishra

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究从自然语言情境生成稳健决策,核心方法是用类型命题图表示,经多求解器及分布帕累托交接耦合,并引入ARPF等。主要贡献是证明rho与决策遗憾关系,增加可追溯性,合成数据基础,通过多种验证方式展示方法有效性。

Comments 19 Pages , 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10960 2026-07-14 cs.LG q-fin.CP stat.ML 新提交 70%

Reinforcement Learning for Execution under Dynamic Fees in a Closed-Loop DEX Simulator

在闭环去中心化交易所模拟器中基于动态费用的执行强化学习

Wen-Ting Wang

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 研究在闭环去中心化交易所模拟器中,针对动态费用下的执行问题,采用构建最小闭环模拟器及小深度Q网络的方法,得出该方法能减少执行缺口,且优势集中在动态费用环境中的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10059 2026-07-14 cs.AI 新提交 70%

AgentAbstain: Do LLM Agents Know When Not to Act?

AgentAbstain:基于大语言模型的智能体知道何时不行动吗?

Xun Liu, Yi Evie Zhang, Vira Kasprova, Parisa Rabbani, Pardis Sadat Zahraei, Tianyu Zhang, Ali Ebrahimpour-Boroojeny, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究基于大语言模型的智能体何时应弃权的问题,提出AgentAbstain评估框架及AbstainGen全自动管道,通过配对任务基准测试多种前沿LLMs,发现弃权能力与任务解决能力无关,并识别出失败模式,代码和数据集开源。

Comments 56 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09789 2026-07-14 cs.AI cond-mat.mtrl-sci 新提交 70%

PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language

PHITSBench:用于使用自然语言生成人工智能辅助的PHITS辐射传输输入的执行评分基准

Xianglin Ji, Svetlana V. Boriskina

机构 * MIT(麻省理工学院)

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 介绍用于PHITS辐射传输输入生成的PHITSBench基准,涵盖三类任务。评估五种基于GPT - 5.4的配置,无特定知识时模型在编辑和修复任务表现好,Reproduce任务差。知识目录和智能体执行可提升成功率,结果显示建模进展依赖多方面因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13443 2026-07-14 cs.AI cs.DC cs.MA econ.GN q-fin.EC 70%

Trust, but verify

信任,但验证

Michael J. Yuan, Carlos Lospoy, Sydney Lai, James Snewin, Ju Long

机构 * ByteTrade Labs(ByteTrade实验室) Nolais & Co/Labs(Nolais与公司实验室) Gaia Foundation(Gaia基金会) Eigen Labs(Eigen实验室) McCoy College of Business(McCoy商学院) Texas State University(德克萨斯州立大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文探讨了通过社交共识检测非法或错误LLM节点的方法,提出基于EigenLayer AVS的验证系统以激励诚实行为。

Journal ref IEEE Computer ( Volume: 59, Issue: 2, February 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏