arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-25 至 2026-06-25 共收录 24 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 24 篇

2606.25656 2026-06-25 cs.CL cs.AI cs.IR 新提交 90%

Is GraphRAG Needed? From Basic RAG to Graph-/Agentic Solutions with Context Optimization

是否需要GraphRAG?从基础RAG到基于图/智能体的上下文优化解决方案

Long Chen, Ryan Razkenari, Yuxuan Zhou, Yuan Tian, Rahul Ghosh, Venkatesh Pappakrishnan, Disha Ahuja, Vidya Sagar Ravipati

机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(亚马逊云科技(AWS)生成式AI创新中心) Cisco Systems, Inc.(思科系统公司)

专题命中 Agent评测 :agentic(title,summary_cn);agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一个框架,比较常规RAG、GraphRAG、Modular RAG和Agentic RAG在9种标准化场景下的性能,并引入上下文工程方法减少19%-53%的token使用,同时发现检索-生成差距,表明扩展检索未成比例提升生成质量。

Comments Accepted to ACL 2026 GEM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25139 2026-06-25 eess.SY cs.SY 新提交 85%

Buildrix: An Open Platform for Sharing and Benchmarking Agentic AI Skills in Building Engineering

Buildrix:建筑工程中共享和基准测试代理式AI技能的开源平台

Zixin Jiang, Bing Dong

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract)

AI总结 提出Buildrix开源平台,通过标准化技能包、Web中心与本地代理框架,支持建筑工程的代理式AI技能开发、共享与可重复基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25207 2026-06-25 cs.LG cs.AI cs.CL 新提交 82%

ASAP: Agent-System Co-Design for Wall-Clock-Centered Auto HPO Research for ML Experiments

ASAP: 面向ML实验的以挂钟时间为中心的自动HPO研究的智能体-系统协同设计

Taicheng Guo, Haomin Zhuang, Kehan Guo, Yujun Zhou, Nitesh V. Chawla, Olaf Wiest, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出ASAP框架,通过智能体集成多种优化器并利用系统级优化(前缀稳定提示、推测并行、自适应调优)减少端到端挂钟时间,在多样HPO任务中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00585 2026-06-25 cs.AI 版本更新 79%

Exploring Information Seeking Agent Consolidation

探索信息寻求智能体整合

Guochen Yan, Jialong Wu, Zhengwei Tao, Bo Li, Qintong Zhang, Jiahao Xu, Haitao Mi, Yuejian Fang, Qingni Shen, Wentao Zhang, Zhonghai Wu

机构 * Peking University(北京大学) Tencent(腾讯)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 通过系统实证研究,比较数据级混合与参数级合并两种范式,发现参数级合并能以更低成本达到数据混合的性能,并保留跨域能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26074 2026-06-25 cs.GT 新提交 78%

Strategyproof Facility Location and Committee Selection with Mixed Max and Sum Agent Types

混合最大和求和代理类型的策略性设施选址与委员会选择

Yue Gruszecki, Elliot Anshelevich

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对代理具有最大型或求和型成本函数的策略性设施选址问题,设计确定性策略证明机制,并证明在代理类型私有但位置已知时近似比为(3-2/k),在位置私有且位于直线度量时近似比为3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23993 2026-06-25 cs.LG cs.AI hep-ex 新提交 62%

Learning to Trigger: Reinforcement Learning at the Large Hadron Collider

学习触发:大型强子对撞机的强化学习

Zixin Ding, Shaghayegh Emami, Giovanna Salvi, Cecilia Tosciri, Abhijith Gandrakota, Jennifer Ngadiuba, Nhan Tran, Christian Herwig, David W. Miller, Yuxin Chen

机构 * University of Chicago(芝加哥大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Fermi National Accelerator Laboratory(费米国家加速器实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对大型强子对撞机实时触发系统在带宽、延迟和存储约束下的阈值调优问题,提出基于强化学习的在线阈值控制方法,在模拟和真实数据上分别提升48%和56%的容忍时间比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04718 2026-06-25 cs.CL cs.AI 62%

AI-Assisted Moot Courts: Simulating Justice-Specific Questioning in Oral Arguments

AI辅助模拟法庭:模拟特定司法机关的口头辩论提问

Kylie Zhang, Nimra Nadeem, Lucia Zheng, Dominik Stammbach, Peter Henderson

机构 * Princeton University(普林斯顿大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文研究AI能否有效模拟特定司法机关的提问以辅助模拟法庭训练,提出双层评估框架,发现模拟问题被人类标注者认为真实且能识别法律问题,但存在提问类型单一和奉承等问题。

Comments Accepted at CS & Law 2026

Journal ref CSLAW '26: Symposium on Computer Science and Law, March 3-5, 2026, Berkeley, CA, USA, ACM, pp. 136-172

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25170 2026-06-25 stat.ML cs.LG 新提交 57%

Minimax PAC Bounds for Learning in Exogenous Contextual MDPs

外生上下文马尔可夫决策过程中学习的极小极大PAC界

Corentin Pla, Hugo Richard, Marc Abeille, Vianney Perchet

机构 * CREST, ENSAE(CREST与ENSAE) Criteo AI Lab(Criteo人工智能实验室) FairPlay Joint Team(FairPlay联合团队)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对外生上下文表格折扣MDP,提出方差缩减算法实现策略评估、最优值估计和最优策略提取,样本复杂度与上下文空间大小无关且达到极小极大最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25193 2026-06-25 cs.SE 新提交 57%

LLM4MTLs: Automated Generation and Empirical Evaluation of Model Transformation Languages

LLM4MTLs:模型转换语言的自动生成与实证评估

Bowen Jiang, Nathan Hagel, Haowei Cheng, Benedikt Jutz, Arne Lange, Weixing Zhang, Rahul Sharma, Ralf Reussner, Anne Koziolek

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 提出LLM4MTLs工作流,通过少样本提示、语法提示和辅助方法组合,自动生成并评估LLM编写的模型转换代码,发现少样本提示能提升语法质量但语义改进有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25012 2026-06-25 cs.LG 新提交 57%

Bias-Controlled Primal-Dual Natural Actor-Critic: Optimal Rates for Constrained Multi-Objective Average-Reward RL

偏置控制的原对偶自然演员-评论家:约束多目标平均奖励强化学习的最优速率

Ankur Naskar, Swetha Ganesh, Vaneet Aggarwal

机构 * Indian Institute of Science, Bengaluru, India(印度科学研究所,班加罗尔,印度) Purdue University, USA(普渡大学,美国)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对平均奖励设置下的约束多目标强化学习,提出基于MLMC的原对偶自然演员-评论家算法,控制标量化目标、约束评估和演员-评论家估计中的偏置,实现最优全局收敛和约束违反率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18936 2026-06-25 cs.AI cs.CY 新提交 57%

SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

SciRisk-Bench:面向AI4Science安全的风险维度感知基准

Linghao Feng, Yinqian Sun, Dongqi Liang, Sicheng Shen, Chenfei Yan, Yuxuan Peng, Yilin Zhao, Haibo Tong, Kai Li, FeiFei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive Intelligence Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知智能实验室,自动化研究所,中国科学院,北京,中国) School of Future Technology, University of Chinese Academy of Sciences, China(未来技术学院,中国科学院大学,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(人工智能学院,中国科学院大学,中国) Zhongguancun Academy, China(中关村学院,中国) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Gaoling School of AI, Renmin University of China(甘露人工智能学院,中国人民大学) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院(北京-AISI)) School of Humanities, University of Chinese Academy of Sciences, China(人文学院,中国科学院大学,中国)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 提出SciRisk-Bench基准,从显式风险维度和科学学科两个角度评估AI4Science安全,覆盖7个学科、31个子学科和10个风险维度,实验揭示主流及科学大模型的安全薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18266 2026-06-25 cs.LG 版本更新 57%

A Probabilistic Framework for LLM-Based Model Discovery

基于LLM的模型发现的概率框架

Stefan Wahl, Raphaela Schenk, Ali Farnoud, Jakob H. Macke, Daniel Gedon

机构 * Machine Learning in Science, University of Tübingen, Tübingen, Germany(图宾根大学机器学习科学系,图宾根,德国) Tübingen AI Center, Tübingen, Germany(图宾根人工智能中心,图宾根,德国) Department Empirical Inference, Max Planck Institute for Intelligent Systems, Tübingen, Germany(经验推断部门,智能系统马克斯·普朗克研究所,图宾根,德国)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 将模型发现重新定义为概率推理问题,提出基于序贯蒙特卡洛采样的ModelSMC算法,利用LLM迭代提出和优化候选模型,并通过似然加权选择,在真实科学系统中发现可解释机制并改进后验预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05252 2026-06-25 cs.LG cs.GT cs.MA 57%

Conservative classifiers do consistently well with improving agents: characterizing statistical and online learning

保守分类器在改进的智能体中表现一致:刻画统计和在线学习

Dravyansh Sharma, Alec Sun

机构 * Northwestern University(西北大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Alphabetical order(字母顺序) University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了改进智能体对分类器的影响,提出了一种非对称的最小一致概念类,并在可实现设置中精确刻画了带改进的proper学习。通过欧几里得球改进集,解决了开放性问题,降低了泛化误差并改进了在线学习界限。

Comments 26 pages

Journal ref Advances in Neural Information Processing Systems (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25899 2026-06-25 cs.MA 新提交 50%

Manipulation Is Task-Dependent: A Multi-Axis, Multi-Environment Evaluation of Frontier LLMs

操纵行为依赖于任务:前沿语言模型的多轴、多环境评估

Adeeb Zaman, Erik Nordby, Fred Heiding

专题命中 Agent评测 :agentic(abstract)

AI总结 通过六种环境、三个轴(框架、激励结构、任务难度)评估六个前沿语言模型的操纵行为,发现操纵倾向在不同任务间相关性低,且不同环境下驱动因素不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25880 2026-06-25 cs.CV 新提交 50%

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习

Yuchen Xie, Xinyu Zhou, Kuangji Zuo, Yanshuo Lu, Fengrui Huang, Boyu Ma, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25728 2026-06-25 cs.IR 新提交 50%

A Stochastic Epidemiological Model of Latent Tuberculosis in a Radiation Exposed Mars Colony

辐射暴露火星殖民地中潜伏结核的随机流行病学模型

Teddy Lazebnik

专题命中 Agent评测 :agent(abstract)

AI总结 针对火星殖民地慢性辐射、免疫改变等环境,建立潜伏结核再激活的随机宿主-辐射-病原体-栖息地模型,并采用近端策略优化进行自适应控制,发现结核可内源性暴发,风险对潜伏库大小、辐射-免疫耦合和再激活敏感性最敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-06-25 cs.CE 新提交 50%

Retrieval-Grounded Multilingual LLM Assistance for Island Smallholder Farmers

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 Agent评测 :agent(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25535 2026-06-25 cs.CV 新提交 50%

Spatio-Temporal Mixture-of-Modality-Experts Diffusion for Quantitative DCE-MRI Synthesis from Incomplete MR Sequences

时空模态专家混合扩散:从不完整MR序列合成定量DCE-MRI

Junhyeok Lee, Kyu Sung Choi

机构 * Interdisciplinary Program in Cancer Biology, Seoul National University College of Medicine(首尔大学医学院癌症生物学跨学科项目) Department of Radiology, Seoul National University Hospital(首尔大学医院放射科) Department of Radiology, Seoul National University College of Medicine(首尔大学医学院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔大学医院医疗人工智能研究所)

专题命中 Agent评测 :agent(abstract)

AI总结 提出时空模态专家混合(ST-MoME)条件扩散框架,通过时空门控网络融合多模态专家特征,从任意子集合成3D DCE参数图,在386例脑肿瘤数据上16种缺失场景下取得最优NMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25918 2026-06-25 physics.bio-ph 新提交 50%

Density-dependent growth emerges from Bayesian adaptation of phenotype

密度依赖性增长源于表型的贝叶斯适应

Manish Kumar Gupta, Arnab Barua, Haralampos Hatzikirou

专题命中 Agent评测 :agent(abstract)

AI总结 通过贝叶斯自适应模型,将细胞感知不匹配与密度依赖性增殖联系起来,解释了肿瘤生长中的Allee效应、中间生长最优和有限容量等现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25282 2026-06-25 physics.chem-ph 新提交 50%

Sustainable photocatalytic CO2 conversion using microalgae as a carbon-negative scavenger

利用微藻作为碳负性清除剂实现可持续的光催化CO2转化

Ho Truong Nam Hai, Augusto Ducati Luchessi, Makoto Arita, Qixin Guo, Kaveh Edalati

专题命中 Agent评测 :agent(abstract)

AI总结 提出利用微藻作为牺牲剂增强光催化CO2还原为CO和CH4的策略,设计双多晶型高熵氧化物(HEO)催化剂,CO和CH4产率分别提高10倍和4倍。

Journal ref Journal of Materials Chemistry A, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25076 2026-06-25 physics.ao-ph cs.CY 新提交 50%

Machine learning is revolutionizing weather forecasting -- the next step is a change in how we work

机器学习正在革新天气预报——下一步是改变我们的工作方式

Peter Dueben, Peter Bauer, Oliver Fuhrer, Nikolay Koldunov, Jørn Kristiansen

专题命中 Agent评测 :agentic(abstract)

AI总结 本文探讨机器学习如何重塑天气预报价值链,包括模型开发、数据利用、验证和服务创建,并讨论相关技术变革及机构适应需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25294 2026-06-25 astro-ph.EP astro-ph.IM 新提交 50%

A study on station-keeping over irregularly shaped asteroids with different sized solar sails

不同尺寸太阳帆在不规则形状小行星上的站位保持研究

Lucas Meireles, Othon Winter, Antônio Prado

专题命中 Agent评测 :agent(abstract)

AI总结 研究利用不同尺寸太阳帆在不同大小不规则小行星上实现航天器站位保持,通过基于决策树算法的直接优化策略计算帆的定向,发现小帆在小行星上更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20183 2026-06-25 cs.CV 版本更新 50%

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

MSAVBench:面向多镜头音频-视频生成的全面可靠评估

Yujie Wei, Yujin Han, Zhekai Chen, Yongming Li, Kaixun Jiang, Zhihang Liu, Quanhao Li, Zhiwu Qing, Xiang Wang, Zhen Xing, Ruihang Chu, Lingyi Hong, Yefei He, Junjie Zhou, Junqiu Yu, Yang Shi, Difan Zou, Kai Zhu, Shiwei Zhang, Yingya Zhang, Yu Liu, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 Agent评测 :agentic(abstract)

AI总结 提出首个多镜头音频-视频生成基准MSAVBench,通过自适应混合评估框架在四个维度上系统评估19个模型,发现当前系统在导演级控制和细粒度音视频同步上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14826 2026-06-25 physics.soc-ph cs.GT 50%

We both think you did wrong -- How agreement shapes and is shaped by indirect reciprocity

我们都认为你做错了——共识如何塑造并被间接互惠所塑造

Marcus Krellner, The Anh Han

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨了共识如何影响并被间接互惠塑造,揭示了道德判断系统如何在个体独立评估时产生高共识,并分析了其对合作行为的影响。

Comments 4 figures, 8 more figures in supplementary informations

Journal ref Applied Mathematical Modelling 2026

详情

展开后加载摘要…

URL PDF HTML 收藏