arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1095 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1095 篇

2607.19409 2026-07-23 cs.AI 新提交 83%

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance

FORCE-Bench:企业金融中智能代理人工智能的基准测试、数据集和评估工具

Wolfgang M. Pauli, Sarah Panda, Kidus Admassu, Said Bleik, Ademola Okerinde, Jeremy Reynolds

机构 * Microsoft Corporation(微软公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究针对智能代理在企业金融领域应用,提出FORCE-Bench基准测试,含251个专家注释查询,从八个维度评估三种任务类型,在特定设置下评估通用和专用代理,结果显示专用代理更可靠,相关资源开源助力企业金融环境应用。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19262 2026-07-22 cs.AI 新提交 83%

BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance

生物安全基准测试 - 监测:病原体基因组监测中人工智能代理的可验证基准

Harmon Bhasin, Kevin Flyangolts, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Amanda Darling, Joshua Stallings, David Stern, Shawn Higdon, Claire Duvallet, Bryan Tegomoh, Kenny Workman

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究针对病原体基因组监测瓶颈从数据生成转向分析的问题,提出BioSecBench-Surveillance基准测试,含100项评估,通过提供人类分析师的数据和背景来测试AI代理,给出不同模型配置的测试结果,为衡量AI代理能否胜任基因组监测提供标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18826 2026-07-22 cs.CR cs.AI 新提交 83%

Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents

跨智能体活动归因:关联大语言模型智能体间的异步攻击

SangJin Park, Myungsub Choi, Jineok Kim, Minseung Kang

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 研究跨大语言模型智能体的异步攻击归因问题,提出异步归因指纹向量($A^2FV$)协议,构建SCD-v1基准,实验表明$A^2FV$在活动关联上表现良好,确立跨智能体活动归因作为保护大语言模型智能体的独特评估层。

Comments 22 pages, 5 figures. Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17951 2026-07-21 cs.CR cs.AI cs.RO cs.SY eess.SY 新提交 83%

RT-SHCUA: Real-Time Self-Hosted Computer-Use Agent for UAV Control

RT-SHCUA:用于无人机控制的实时自托管计算机使用代理

Di Lu, Bo Zhang, Xiyuan Li, Yongzhi Liao, Xuewen Dong, Yulong Shen, Zhiquan Liu, Jianfeng Ma

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Shaanxi Key Laboratory of Network and System Security(陕西省网络与系统安全重点实验室) College of Cyber Security, Jinan University(广州大学网络安全学院) School of Cyber Engineering, Shaanxi Key Lab of Network and System Security(陕西省网络与系统安全重点实验室)

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 研究针对将SHCUA用于无人机控制的结构不匹配问题,提出实时安全导向的重组方法,把SHCUA输出转换为合同约束的无人机技能调用,设计分离架构,原型评估显示RT-SHCUA能保持响应能力并支持相关特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16920 2026-07-21 cs.RO cs.SE 新提交 83%

A BIM-enabled, Agent-based Discrete-event Simulation Platform for Robotic Studies: A Method based on Graph Theory

一种用于机器人研究的基于BIM和智能体的离散事件模拟平台:一种基于图论的方法

Ping Xu, Xinghua Gao

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.SE

AI总结 研究针对室内机器人复杂任务中建筑信息利用不足问题,提出基于BIM和智能体的模拟平台,将室内环境映射为图,用图论算法规划导航路径,经模拟验证其有效性,为BIM智能机器人系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16610 2026-07-21 cs.AI 新提交 83%

Just A Rather Very Intelligent Spoken Agent

只是一个相当非常智能的语音代理

Chen Chen, Zhehuai Chen

机构 * NVIDIA(英伟达)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 研究长期人工智能代理与用户交互薄弱问题,引入JarvisBench基准测试,含代理协作和用户交互两轨道,用模块化原型评估,结果显示贾维斯式调解可提升任务性能,其有效性取决于调解器语言模型大脑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16249 2026-07-21 physics.geo-ph cs.AI 新提交 83%

An Agentic Interface for End-to-End Probabilistic Seismic Hazard and Risk Analysis

用于端到端概率地震危险性和风险分析的智能体接口

Sreenath Vemula, Pierre Jehel, Fabrice Cotton, Filippo Gatti

机构 * Université Paris-Saclay, CentraleSupélec, ENS Paris-Saclay, CNRS, LMPS — Laboratoire de Mécanique Paris-Saclay(巴黎-萨克莱大学、中央超导学院、巴黎-萨克莱高等师范学院、国家科学研究中心、LMPS——巴黎-萨克莱力学实验室) GFZ Helmholtz Centre for Geosciences(德国地球科学霍普夫兹中心) University of Potsdam, Institute of Geosciences(波茨坦大学、地球科学学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究针对概率地震危险性和风险分析专家化问题,提出通过开源服务器及MCP构建智能体接口,利用LLM与OpenQuake引擎等协作计算,实现多功能分析,结果与官方值匹配度高且计算快,还能接受自定义GMM并添加新功能,设计层可拓展。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15901 2026-07-20 cs.AI 新提交 83%

DSWorld: A Data Science World Model for Efficient Autonomous Agents

DSWorld:用于高效自主智能体的数据科学世界模型

Zherui Yang, Fan Liu, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 Agent评测 :autonomous agent(title);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 研究自主数据科学智能体依赖试错流程效率低的问题,提出数据科学世界模型概念及DSWorld框架,含多种技术。构建数据集并引入优化策略,实验显示其加速智能体训练和推理,在转换预测任务上超基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12068 2026-07-15 cs.SE 新提交 83%

Beyond Test Presence: Assessing the Quality and Robustness of Agent-Generated Tests in Open-Source Projects

超越测试存在:评估开源项目中代理生成测试的质量和稳健性

Preet Jhanglani, Zeel Kaushal Desai, Vidhi Kansara, Eman Abdullah AlOmar

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.SE

AI总结 研究开源项目中代理生成测试的质量和稳健性,通过对大量测试工件进行实证比较,用“白盒”静态分析框架评估质量维度,发现代理在边缘情况覆盖率上优于人类,但生成测试更易脆弱,揭示其缺乏编写稳定测试的“环境意识”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11141 2026-07-14 cs.AI 新提交 83%

NextFund: A Unified Performance Tracking Platform for Agentic Portfolio Management

NextFund:用于智能投资组合管理的统一绩效跟踪平台

Changlun Li, Peixian Ma, Qiqi Duan, Zhenyu Lin, Peineng Wu

机构 * Paradoox AI Research(帕拉多克斯人工智能研究)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究基于大语言模型智能体参与投资组合管理的评估问题,提出NextFund平台,通过时间一致的市场准入等实现智能体行为可观察,能跨市场比较模型等,在多地股票上展示其可实现更公平基准测试和可行诊断的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08177 2026-07-10 cs.AI cs.MA 新提交 83%

ASMR: Agentic Schema Generation for Ship Maintenance Report Writing

ASMR:用于船舶维护报告撰写的智能模式生成

Sohrab Namazi Nia, Amogh Dalal, Ning Sa, Peter Ly, Marti Zentmaier, Tomek Strzalkowski, Jay Miller, Rishi Singh, Senjuti Basu Roy

机构 * New Jersey Institute of Technology(新泽西理工学院) Rensselaer Polytechnic Institute(伦斯勒理工学院) Boston Fusion Corporation(波士顿融合公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究船舶维护报告自动模式生成问题,提出ASMR框架,由字段生成智能体和结构优化智能体组成,可生成紧凑且信息丰富的模式,指导撰写更优报告,展现该方法前景及相关交叉领域挑战。

Comments Accepted at the DASHSys 2026 workshop (Systems for Data-centric Agents with Human-in-the-loop), co-located with VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06957 2026-07-09 cs.RO cs.LG 新提交 83%

Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation

Flow-ERD:用于多样化交通模拟的基于熵正则化蒸馏的智能体类型感知流匹配

Seulbin Hwang, Kiyoung Om, Daejung Kim, Jinhan Lee

机构 * NAVER LABS Corp.(NAVER实验室公司)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.LG

AI总结 为解决交通模拟中多样性未被充分探索的问题,提出Flow-ERD模拟器,其核心方法是智能体类型感知流匹配与熵正则化蒸馏,能联合追求现实性和多样性,在测试基准中排名第一,主导帕累托前沿。

Comments 8 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05202 2026-07-07 cs.AI 新提交 83%

EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer

EvoAgentBench:通过能力迁移评测智能体自进化的基准平台

Xingze Gao, Chuanrui Hu, Hongda Chen, Pengfei Yao, Zhao Wang, Yi Bai, Zhengwei Wu, Yunyun Han, Xiaofeng Cong, Jie Gui, Yafeng Deng, Teng Li

机构 * Anhui University(安徽大学) EverMind, Shanda Group(盛趣游戏灵眸智能科技) Southeast University(东南大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 针对现有评测无法分离大语言模型智能体程序性经验迁移的问题,提出跨四领域的EvoAgentBench基准,可将自进化评测转为对经验编码、路由与吸收的细粒度诊断。

Comments 15 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03821 2026-07-07 cs.CR cs.AI 新提交 83%

DualView: Preventing Indirect Prompt Injection in Personal AI Agents

双视图:防止个人人工智能代理中的间接提示注入

Juhee Kim, Woohyuk Choi, Taehyun Kang, Youngmin Kim, Byoungyoung Lee

机构 * Seoul National University(首尔国立大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究个人人工智能代理面临的间接提示注入攻击问题,提出双视图方法,通过扩展不可信数据跟踪到用户环境,部署为插件,有效阻止攻击并保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03233 2026-07-07 cs.CR cs.AI cs.IR cs.SI 新提交 83%

Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions

用于开源情报和网络调查的智能与生成式人工智能:分类法、评估、挑战及未来方向

Eduardo Almeida Palmieri, Mohamed Chahine Ghanem, Dipo Dunsin, Zubair Baig, Ed de Quincey, Kim-Kwang Raymond Choo

机构 * School of Computer Science and Mathematics, Keele University(基尔大学计算机科学与数学学院) Cybersecurity Institute, University of Liverpool(利物浦大学网络安全研究所) Department of Applied Computing IICL, University of Wales Trinity Saint David(威尔士特里尼达大学应用计算系) Deakin Cyber Research and Innovation Hub, Deakin University(德金大学网络安全研究与创新中心) Department of Information Systems and Cyber Security, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系与网络安全系)

专题命中 Agent评测 :agentic(title,abstract);tool use(abstract);分类 cs.AI

AI总结 研究指出公开数字信息增长使人工开源情报分析不足,大语言模型等成解决方案但评估框架滞后。通过综述74项研究,明确智能人工智能类别,找出幻觉验证差距,映射研究到情报生命周期并给出研究议程。

Comments 36 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30970 2026-07-03 cs.AI 新提交 83%

Behavioral Governance for Autonomous AI Agents: The AgentBound Framework

AgentBound: 自主AI智能体的可验证行为治理

Anuj Kaul, Qianlong Lan, Pranay Gupta

机构 * eBay Inc.(eBay公司)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出AgentBound框架,通过委托授权、行为宪法和站点行动合同三权独立评估,结合形式化决策模型实现AI智能体行为的可验证治理,并生成加密可验证的治理收据以支持独立重放验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00345 2026-07-02 cs.SE 新提交 83%

Registry-Governed Agent Lifecycle:Completing EDDOps with Evaluation-DrivenRegistration, Promotion, and Retirement on AWS AgentCore

注册表治理的智能体生命周期:通过评估驱动的注册、晋升和退役在 AWS AgentCore 上完善 EDDOps

Richard Kang, Vincent Wang

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 提出 EDDOps 在 AWS Bedrock AgentCore 上的实践实例,通过成本-性能框架和注册表治理,将模型选择从基准排名转化为受治理的经济决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31041 2026-07-01 cs.CL 新提交 83%

A Semantic-Layer-Mediated Agent for Natural Language to SQL over Heterogeneous Enterprise Databases

一种语义层中介的智能体,用于异构企业数据库的自然语言到SQL转换

Ha Jeong Kim, Saksonita Khoeurn, Ye Ji Yoon

机构 * DAQUV Corp.(DAQUV公司) Chungbuk National University(忠北大学) BigDataLabs, Co., Ltd.(BigDataLabs有限公司)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.CL

AI总结 提出一种通过语义层中介的NL2SQL智能体,利用语义模型查询(SMQ)解耦语义与物理SQL,在Spider2-snow基准上达到94.15%执行准确率,排名第三。

Comments Submitted to FITAT 2026 for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26552 2026-06-26 cs.CV cs.AI 新提交 83%

Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection

感知、判断与进化:基于事后洞察的自优化取证智能体用于AI生成图像检测

Yangjun Wu, Keyu Yan, Yu Liu, Jingren Zhou, Fei Huang, Rong Zhang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 提出ForeAgent框架,采用感知-判断架构融合多视图线索,并引入事后洞察驱动的自优化策略,通过采样-反思-进化范式持续提升检测能力,在多个基准上达到最优性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23416 2026-06-23 cs.CR cs.AI 新提交 83%

Detecting Malicious Agent Skills in the Wild using Attention

利用注意力机制检测野外恶意智能体技能

Bacem Etteib, Daniele Lunghi, Tégawendé F. Bissyandé

机构 * University of Luxembourg(卢森堡大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 针对LLM技能市场中的恶意技能注入攻击,提出Locate-and-Judge两阶段检测器,通过注意力定位和审查实现高效全市场扫描,大幅降低成本并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20235 2026-06-19 cs.IR cs.AI 新提交 83%

ScholarQuest: A Taxonomy-Guided Benchmark for Agentic Academic Paper Search in Open Literature Environments

ScholarQuest:开放文献环境中智能学术论文搜索的基于分类法的基准测试

Tingyue Pan, Mingyue Cheng, Daoyu Wang, Yitong Zhou, Jie Ouyang, Qi Liu, Enhong Chen

机构 * State Key Lab of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出ScholarQuest基准,基于1000多个计算机科学主题和四种研究意图,构建可扩展的答案和共享检索后端,评估LLM智能体在开放文献环境中的学术论文搜索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08867 2026-06-16 cs.CL 新提交 83%

Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework

构建面向1亿用户规模的客户支持AI代理:一种评估驱动的框架

Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

机构 * Nubank

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.CL

AI总结 提出一个统一框架,通过评估驱动开发、上下文工程、人工循环提示迭代和LLM评判一致性优化,在Nubank的100M+用户规模下实现客户支持AI代理的离线开发与在线效果桥接,并在五个生产部署中验证了离线指标与在线结果的高度相关性。

Comments 12 pages. Accepted to KDD '26 (32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14219 2026-06-15 cs.RO cs.AI 新提交 83%

Selective Agentic Recovery for UAV Autonomy with a Persistent Mission Runtime

面向无人机自主性的选择性代理恢复与持久任务运行时

Taewoo Park, Kyeonghyun Yoo, Seunghyun Yoo, Hwangnam Kim

机构 * Department of Electrical and Electronic Engineering, Korea University(高丽大学电气与电子工程系)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出持久任务运行时(PMR)框架,通过选择性调用外部代理推理器实现无人机恢复,引入学习型调用认知价值(learned-CVI)门控机制,在Gazebo/PX4基准测试中将硬/模糊场景成功率从5.0%提升至95.0%,同时减少16.7%的远程调用和29.2%的令牌消耗。

Comments 17 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11830 2026-06-11 cs.AI 新提交 83%

Skill-Augmented AI Agents for Medical Research Analysis: An Exploratory Multi-Model Human Evaluation in an NSCLC Transcriptomic Biomarker Task

面向医学研究分析的技能增强型AI代理:一项NSCLC转录组生物标志物任务中的探索性多模型人类评估

Qianyu Yao, Fei Sun, Bocheng Huang, Wei Chen, Jiarui Jiang, Shu Quan, Yifei Chen, Wenjie Xu, Bo li, Liping Su, Ruoqiong Wu, Huhai Hong, Huimei Wang

机构 * AIPOCH PTE. LTD.

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究通过非小细胞肺癌免疫治疗生物标志物任务,评估技能增强型AI代理相比原生AI在转录组研究分析输出质量上的提升,发现质量信号方向性但未达统计显著性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11435 2026-06-11 cs.CL 新提交 83%

Agent Skill Evaluation and Evolution: Frameworks and Benchmarks

智能体技能评估与进化:框架与基准

Kexin Ding, Yang Zhou, Can Jin, Feng Tong, Mu Zhou, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 本文系统综述了智能体技能从孤立创建到自动化评估驱动进化的范式转变,分类了四种进化范式并分析了六个技能基准类别,指出了覆盖缺口和开放方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11079 2026-06-10 cs.CL 新提交 83%

VISTA: A Versatile Interactive User Simulation Toolkit for Agent Evaluation

VISTA:用于智能体评估的多功能交互式用户模拟工具包

Yunan Lu, Ryan Shea, Yusen Zhang, Zhou Yu

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Arklex.ai

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 提出VISTA工具包,通过六项指标和混合用户模拟器(UI+API)提升智能体评估的真实性与全面性,在电商和教育场景中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10806 2026-06-10 cs.AI math.FA 新提交 83%

Moonshine: An Autonomous Mathematical Research Agent Centered on Conjecture Generation

Moonshine:一个以猜想生成为中心的自主数学研究智能体

Xiaoyang Chen, Xiang Jiang

机构 * School of Mathematical Science, Tongji University(同济大学数学科学学院)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出自主智能体Moonshine,通过提取经典问题结构、提炼新概念并生成数学猜想,以Jacobian猜想为例,将其转化为神经Jacobian猜想并证明部分情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08552 2026-06-09 cs.AI cs.MA cs.NE physics.data-an 新提交 83%

Quantitative Promise Theory: Intentionality and Inference in Autonomous Agents

定量承诺理论:自主智能体中的意向性与推理

Mark Burgess

机构 * ChiTek-i AS

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出将贝叶斯概率与信息论优化(包括主动推理)融入承诺语义,以解决概率计算中的非局部协调、校准和归一化问题,并利用边界条件作为承诺约束状态与决策阈值,实现可扩展的意图定义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08285 2026-06-09 cs.AI cs.CE q-fin.CP q-fin.TR 新提交 83%

Beyond Agent Architecture: Execution Assumptions and Reproducibility in LLM-Based Trading Systems

超越智能体架构:基于LLM的交易系统中的执行假设与可复现性

Junyi Yao, Zihao Zheng

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过审计30项相关研究,发现LLM交易研究中执行假设报告不足,导致结果难以比较,提出需建立执行现实性、可复现性和评估可比性的报告标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07995 2026-06-09 cs.CL 新提交 83%

Customer-Agent: Overcoming Context Limitations in Ultra-Long Shopping Trajectories via Tool-Augmented Agents and RLVR

客户代理:通过工具增强代理和RLVR克服超长购物轨迹中的上下文限制

Hongye Liu, Rongmei Lin, Anurag Kashyap, Hejie Cui, Ricardo Henao, Besnik Fetahu, Bing Yin

机构 * Amazon(亚马逊) Duke University(杜克大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 提出ShopTrajQA基准和客户代理框架,利用RLVR训练代理通过代码解释器自主检索解析外部轨迹文件,突破LLM上下文窗口限制,在超长购物轨迹推理中取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏