arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-04 至 2026-08-04 共收录 388 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 61 篇

2608.02505 2026-08-04 cs.AI cs.CV cs.IR 新提交 57%

Abduction Without a Body? Representational Grounding and the Abduction Loop for Scientific Hypothesis Generation

无实体的溯因推理?科学假说生成的表征奠基与溯因循环

Michael Farmer

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出无需实体的科学溯因推理,构建含弃权机制的溯因循环架构,以惯例空间解决跨领域检索难题,通过案例抽象架构并提出DAB-30基准作为评估方案。

Comments 20 pages, 4 figures. DAB-30 execution reported in companion paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02412 2026-08-04 cs.LG 新提交 57%

Why Large Language Models Fail at Tabular Prediction

为什么大型语言模型在表格预测任务中表现不佳

Marta Garnelo, Wojciech M. Czarnecki

机构 * Fundamental Technologies(基础技术) Voylab

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 该研究探究通用大型语言模型(LLM)在表格预测任务中表现不佳的原因,通过控制实验排除了数据噪声、CSV格式等因素,发现维度是关键,LLM准确率随维度增长下降,而经典基线方法不受影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02372 2026-08-04 cs.CL 新提交 57%

PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise

PredAct-Bench:可控工具噪声下的工具增强对话基准

Abdulrahman AlRabah, Xiaocheng Yang, Dilek Hakkani-Tür, Abdussalam Alawini

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 该研究推出PredAct-Bench基准,以教育为测试平台评估带噪声工具的对话智能体,扩展信任校准指标并评估13种LLMs,发现当前模型无法在工具噪声下为教师提供足够可见性,助力构建更优AI决策支持系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02287 2026-08-04 cs.AI 新提交 57%

SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation

SKT:通过经过验证的合成数据生成实现规模化的技能使用训练

Zelin Tan, Yiqun Zhang, Hao Li, Zhiyao Cui, Hejia Geng, Shao Zhang, Hangfan Zhang, Yang Chen, Xiaosong Wang, Lilong Wang, Zhenfei Yin, Shuyue Hu, Chen Zhang, Lei Bai

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出SKT这一经过验证的规模化技能使用训练合成数据生成流程,构建SkillEval基准,实验证实其生成轨迹的监督微调可提升多模型技能使用性能,验证了方法的有效性与可扩展性。

Comments 24 pages,8 figures, Version 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01451 2026-08-04 cs.SE 新提交 57%

Doc2CI: A Multi-Service Study of CI Configuration Generation Using Large Language Models

Doc2CI:基于大语言模型的CI配置生成多服务研究

Taher A. Ghaleb

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 本文通过构建DOC2CI基准评估LLM生成CI配置的能力,发现其结构有效性不足,提出无需训练的模式引导修复方法提升有效性,为相关工具开发提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00817 2026-08-04 cs.AI cs.HC stat.AP 新提交 57%

Large language models improve physician accuracy but lead to false reliance

大型语言模型可提高医师准确率,但会导致错误依赖

Tirtha Chanda, Christoph Wies, Franziska Schramm, Carina Nogueira Garcia, Nicolas B. Merl, Martin J. Hetz, Jochen S. Utikal, Phillip Tschandl, Cristian Navarrete-Dechent, Alexander Thiem, Jakob N. Kather, Consortium, Titus J. Brinker

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本研究开发智能体式检索增强型LLM CORA,发现其可将46名医师的诊断准确率从70.8%提升至82.6%,但存在错误答案获引用支持时医师抵抗大幅下降的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00610 2026-08-04 cs.AI 新提交 57%

Slides2MindMap: Reconstructing Cognitively Efficient Knowledge Hierarchies from Lecture Slides

Slides2MindMap:从课程幻灯片重建认知高效的知识层次结构

Yuzhi Wang, Rongjun Ye, Shengyuan Chen, Huachi Zhou, Jiaqi Bai, Chuang Zhou, Zhicong Hong, Xiao Huang

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本研究提出Slides2MindMap任务,引入含12774张幻灯片的S2M-Bench基准,提出AutoMindMap智能体框架,实验证明其在基准上优于基线且鲁棒性强,具备教学应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00018 2026-08-04 cs.DB cs.AI 新提交 57%

CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs

CITBench:面向大语言模型的交互式表格数据处理综合基准

Zihan Nan, Yang Gu, Wei Liu, Xi Yan, Zhou Liu, Hao Liang, Wentao Zhang

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出 CITBench 交互式表格数据处理基准,评估发现现有 LLM 在简单表格任务表现良好,但在复杂多轮交互场景下的理解、规划与表格结构感知仍存在显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28894 2026-08-04 cs.AI stat.ML 版本更新 57%

Identifying Informative Environments for Cognition Parameter Inference via Bayesian Experimental Design

基于贝叶斯实验设计识别认知参数推断的有效环境

Manisha Dubey, Rimvydas Rubavicius, N. Siddharth, Subramanian Ramamoorthy

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 该研究针对认知参数推断的环境选择问题,将认知规划实验建模为贝叶斯实验设计问题,提出摊销贝叶斯实验设计框架,经Mouselab-MDP实验验证其高效性,揭示了环境选择的权衡关系。

Comments 14 pages, 16 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11439 2026-08-04 cs.LG 版本更新 57%

Multi-Level Strategic Classification: Incentivizing Improvement through Promotion and Relegation Dynamics

多层级策略分类:通过晋升与降级动态激励改进

Ziyuan Huang, Lina Alkarmi, Mingyan Liu

机构 * Electrical and Computer Engineering Department, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学电气与计算机工程系,安阿伯,MI 48109,美国)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种多层级晋升-降级框架,通过设计分类器阈值和难度递进来激励代理人诚实努力,并证明在温和条件下代理人可通过真实改进达到任意高水平。

Comments 9 pages, 4 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07078 2026-08-04 q-fin.TR cs.AI cs.CE 57%

Can LLM-based Financial Investing Strategies Outperform the Market in Long Run?

基于LLM的金融投资策略能否长期跑赢市场?

Weixian Waylon Li, Hyeonjun Kim, Mihai Cucuringu, Tiejun Ma

机构 * AIAI, School of Informatics The University of Edinburgh Edinburgh United Kingdom Global Finance Research Center Sungkyunkwan University Seoul Republic of Korea Dept. of Statistics \& OMI University of California, Los Angeles University of Oxford United States The University of Edinburgh Sungkyunkwan University University of California, Los Angeles University of Oxford

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 提出FINSABER回测框架,在更长时间和更大股票池上评估基于LLM的择时策略,发现其优势在长期和广泛截面下显著下降,且在牛熊市中表现不佳。

Comments KDD 2026, Datasets & Benchmarks Track (Oral) Corrected the FinAgent results and added FinAgent (GPT-4o-mini) in Table 2; conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23590 2026-08-04 cs.AI 版本更新 57%

Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents

Co-ReAct:作为ReAct智能体逐步协作者的评分准则

Jiazheng Kang, Bowen Zhang, Zixin Song, Jiangwang Chen, Xiao Yang, Da Zhu, Guanjun Jiang

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴文勤应用业务组) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Co-ReAct框架,通过训练专用评分准则生成器,在推理时逐步指导ReAct智能体的行动选择,显著提升搜索密集型多步推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14322 2026-08-04 cs.AI 版本更新 57%

TeachArena: Are Language Agents Ready for Realistic Teaching Work?

代理是否准备好教学?一个多阶段基准用于现实世界教学工作流程

Zixin Chen, Peng Liu, Rui Sheng, Haobo Li, Jianhong Tu, Xiaodong Deng, Kashun Shum, Dayiheng Liu, Huamin Qu

机构 * Hong Kong University of Science and Technology(香港科技大学) Qwen Team, Alibaba Group(阿里集团通义实验室)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出EduAgentBench基准,用于评估教学代理的全面能力,发现当前模型在教学任务中的表现有限,但仍为开发未来教学代理提供了测量基础。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27269 2026-08-04 cs.AI 版本更新 57%

Unifying biomedical knowledge in a modern multimodal graph

OptimusKG:统一生物医学知识的现代多模态图

Lucas Vittor, Ayush Noori, Iñaki Arango, Joaquín Polonuer, Sam Rodriques, Andrew White, David A. Clifton, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Edison Scientific Inc.(Edison科学公司) Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏格兰研究中心) Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) Harvard Data Science Initiative(哈佛大学数据科学计划)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 OptimusKG通过整合结构化和半结构化资源,构建了多模态生物医学标记属性图,统一了分子、解剖、临床和环境领域的知识,验证了其在生物医学领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20487 2026-08-04 cs.AI cs.GT cs.HC econ.GN q-fin.EC 版本更新 57%

Bounded Normative Equivalence in Human-AI Cooperation: Group Behaviour, Not Partner Labels, Predicts Cooperation under Anonymous Aggregate Feedback

人机协作中的规范等价性:行为,而非身份,驱动混合代理群体中的合作

Nico Mutzner, Taha Yasseri, Heiko Rauhut

机构 * Department of Sociology, University of Zurich(苏黎世大学社会学系) Centre for Sociology of Humans and Machines (SOHAM), Trinity College Dublin & Technological University Dublin(人类与机器社会学中心(SOHAM))

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究发现,混合人机群体中的合作依赖于群体行为而非身份,规范机制在不同条件下表现一致,支持规范等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00647 2026-08-04 q-fin.TR q-fin.CP q-fin.RM 新提交 56%

Axient: On-Chain Credit and Loss Allocation for Leveraged Event Markets: A Venue-Agnostic Protocol for Traders, Credit Providers, Market Makers, and Liquidation Backstops

Axient:杠杆事件市场的链上信用与损失分配——面向交易者、信用提供者、做市商及清算后援的场所无关协议

Maksym Nechepurenko

专题命中 Agent评测 :agent(abstract,comments)

AI总结 Axient是面向多角色的场所无关链上信用协议,通过形式化架构与内生模型实现损失分配等机制,实验验证其分层保护等特性,为杠杆事件市场提供解决方案。

Comments 90 pages, 17 figures. Formal protocol design and fixed-seed synthetic agent-based validation; no live Axient or venue data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00517 2026-08-04 econ.TH 新提交 50%

Exact Budget Balance via Payment-Rule Ambiguity: Incentive Preservation, Transfer Capacity, and Participation

通过支付规则模糊性实现精确预算平衡:激励保持、转移能力与参与度

Hiroaki Odahara

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究通过支付规则模糊性修复激励相容机制的支付侧以实现精确预算平衡,探讨了不同信息条件下的可行性、转移能力及参与度等问题。

Comments 54 pages, 1 figure; includes appendices and ancillary verification code

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01494 2026-08-04 q-fin.PM q-fin.RM 新提交 50%

Conformal Kelly: Conformal Prediction Intervals as the Scale in Fractional Kelly Position Sizing

共形凯利:将共形预测区间用作分数凯利头寸规模的尺度

Robert Jacob Ryan

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出将共形预测区间与分数凯利结合用于投资组合头寸规模确定,经6年测试表现优于被动基准,还引入风险控制优化回撤,相关配置经预注册和LLM智能体搜索验证。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00917 2026-08-04 q-fin.MF 新提交 50%

Pro-rata mechanisms in groundwater markets

地下水市场中的按比例分配机制

Igor Cialenco, Michael Ludkovski, Gael Dimitri Tekam Fongouo

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对地下水市场供需失衡问题,扩展已有价格形成模型提出按比例配给机制,结合外生限制、主从博弈场景展开理论分析与数值验证,还与多种非对称配给方案对比,为市场监管提供了工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01895 2026-08-04 cs.HC 新提交 50%

Emotional Expression in Persuasion by Quadruped Virtual Agents: Toward Cross-Species Design Patterns

四足虚拟智能体说服过程中的情感表达:迈向跨物种设计模式

Kaoru Sumi, Souki Osawa

专题命中 Agent评测 :agent(abstract)

AI总结 该研究开发了虚拟狗、猫、马智能体,对比不同行为条件后发现,四足虚拟智能体的说服效果更依赖情感表达等功能性线索,而非物种特有动作,为跨物种设计模式提供了依据。

Comments Preprint. 68 pages, 4 figures, 8 tables. Submitted to Frontiers in AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01693 2026-08-04 cs.GT 新提交 50%

Optimal Prior-Free Mechanisms for Consumer Surplus

无先验约束下的消费者剩余最优机制

Tomer Ezra

专题命中 Agent评测 :agent(abstract)

AI总结 该研究解决多维机制设计中剩余剩余最大化的最坏情况可近似性问题,提出普遍真实且事后个体理性的机制,得到最优最坏情况保证,解决相关开放问题并改进现有结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01157 2026-08-04 cs.CV 新提交 50%

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos

InteracVid:基于直播聊天视频构建真实交互式视听响应数据集

Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 Agent评测 :planning(abstract)

AI总结 该研究提出首个开源大规模交互式视听数据集InteracVid,解决现有生成模型监督信号缺失问题,实验证实其可提升多模态助手的交互规划与响应生成性能,为交互式多模态生成提供关键基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00327 2026-08-04 math.OC 新提交 50%

Persistent Mean Tracking in Client--Server Open Networks

客户端-服务器开放网络中的持久均值跟踪

Amit Dutta, Fat-Hy Omar Rajab, Marcos M. Vasconcelos, Olugbenga M. Anubi

专题命中 Agent评测 :agent(abstract)

AI总结 针对开放客户端-服务器网络中瞬态智能体污染导致朴素平均法无法恢复持久均值的问题,提出两阶段估计框架,通过双层窗口识别与平滑滤波实现均值跟踪,经数值模拟验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00934 2026-08-04 gr-qc astro-ph.HE 新提交 50%

Unified remnant models for aligned-spin, precessing, and eccentric binary black hole mergers

非进动自旋、进动及偏心双黑洞并合的统一残余模型

Tousif Islam, Digvijay Wadekar, Gaurav Khanna

专题命中 Agent评测 :agent(abstract)

AI总结 该研究利用数值相对论等模拟数据,构建了适用于非进动、进动及偏心双黑洞并合残余性质的统一解析模型,精度优于现有模型,可通过gwModels包公开供相关领域应用。

Comments Models are available through https://github.com/tousifislam/gwModels/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28415 2026-08-04 gr-qc 版本更新 50%

Long-lived quasinormal frequencies for regular black hole supported by the Einasto profile in the presence of the magnetic field

具有Einasto密度分布的正则黑洞在磁场作用下的长寿命拟正常频率

Milena Skvortsova

专题命中 Agent评测 :agent(abstract)

AI总结 研究磁场影响下基于Einasto密度分布的正则黑洞中标量场的拟正常模式、灰体因子及吸收截面,通过高阶WKB展开和Padé求和计算拟正常频率,并展示有效质量和Einasto参数变化对阻尼率的抑制作用。

Comments 12 pages, 7 figures, the mistakes have been corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06945 2026-08-04 cs.CV 版本更新 50%

Direct and Adaptable Mesh-Gaussian Scene Reconstruction from Multi-View Images

从多视图图像进行直接且可自适应的网格-高斯场景重建

Ancheng Lin, Tianqing Su, Zuo Yuan, Quanke Su, Samuel S. Mao, Yusheng Xiang

机构 * School of Computer Science, Australian Artificial Intelligence Institute (AAII)(计算机科学学院,澳大利亚人工智能研究所) University of Technology Sydney(悉尼技术大学) School of Automobile(汽车学院) Chang’an University(长安大学)

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对现有方法分离几何与外观建模的问题,提出端到端网格-高斯场景表示,实现直接联合学习,提升重建效率与质量,可高效适配局部场景修改,支撑具身智能相关环境维护。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2608.02588 2026-08-04 cs.DS cs.LG 新提交 57%

The Condition-Number Barrier in Sparse Least Squares

稀疏最小二乘中的条件数障碍

Honghao Lin, Vahab Mirrokni, David P. Woodruff

专题命中 其他Agent :agentic(abstract);分类 cs.LG

AI总结 该研究基于特定假设建立了稀疏最小二乘中受限条件数线性依赖的下界,证明不存在满足相关条件的随机多项式时间算法,且证明由Gemini智能体系统完成并经作者验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28360 2026-08-04 cs.AI 版本更新 57%

Prompt Codebooks: Discrete Compositional Optimization for Language Model Instruction Refinement

提示码本:面向语言模型指令精炼的离散组合优化

Jyotirmoy Nath, Neeraj Kumar, Brejesh Lall

机构 * IIT Delhi(印度德里理工学院)

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 提出Prompt Codebooks (PCO)框架,将自动提示优化重构为离散组合学习,通过可重用的自然语言本能单元实现实例级路由和结构化反馈,在多个基准上提升性能并压缩提示长度。

详情

展开后加载摘要…

URL PDF HTML 收藏