arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-30 至 2026-06-30 共收录 293 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 46 篇

2605.09708 2026-06-30 cs.LG cs.AI cs.DC 62%

Metal-Sci: A Scientific Compute Benchmark for Evolutionary LLM Kernel Search on Apple Silicon

Metal-Sci: 一个用于苹果硅芯片上进化式LLM内核搜索的科学计算基准

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Metal-Sci基准通过10个科学任务和六个优化领域,评估LLM在自动内核搜索中的性能,展示了不同模型在不同任务上的加速效果及结构化评估方法的可靠性。

Comments Published at the Fifth Workshop on Deep Learning for Code (DL4C) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10109 2026-06-30 cs.AI cs.HC cs.LG 62%

LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals

基于自我报告的LLM代理能够实现通用个体模拟

Joon Sung Park, Carolyn Q. Zou, Jonne Kamphorst, Niles Egan, Aaron Shaw, Benjamin Mako Hill, Carrie Cai, Meredith Ringel Morris, Percy Liang, Robb Willer, Michael S. Bernstein

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) Department of Communication Studies, Northwestern University(西北大学传播学系) Department of Communication, University of Washington(华盛顿大学传播学系) Google DeepMind(谷歌DeepMind) Department of Sociology, Stanford University(斯坦福大学社会学系) Sciences Po(巴黎政治学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了基于自我报告数据的LLM代理在模拟个体行为方面的有效性,通过不同数据源构建代理并验证其在多种任务中的准确性和跨群体公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03915 2026-06-30 cs.CL cs.AI 62%

Rethinking Role-Playing Evaluation: Anonymous Benchmarking and a Systematic Study of Personality Effects

重新思考角色扮演评估:匿名基准测试与对性格效应的系统研究

Ji-Lun Peng, Yun-Nung Chen

机构 * National Taiwan University(国立台湾大学) Academia Sinica(中央研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出匿名基准测试方法,揭示角色扮演能力与角色识别的关联,通过性格增强方法提升匿名场景下的角色扮演性能。

Comments SIGdial 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30561 2026-06-30 cs.AI cs.CV cs.HC 57%

The Human Creativity Benchmark

人类创造力基准

Aspen Hopkins, Allison Nulty, Alexandria Minetti, Anoop Pakki, Angad Singh

机构 * Massachusetts Institute of Technology(麻省理工学院) Contra

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 提出人类创造力基准(HCB),通过收集领域专家的成对偏好、标量评分和定性理由,分离收敛(共享最佳实践)和发散(个体品味差异)信号,评估创意AI。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30185 2026-06-30 cs.AI 57%

Dynamo: Dynamic Skill-Tool Evolution for Vision-Language Agents

Dynamo: 视觉-语言代理的动态技能-工具演化

Yutao Sun, Yanting Miao, Hao-Xuan Ma, Mengyu Zhou, Mingshuai Chen, Tiancheng Zhao, Dexin Wang, Lei Lv, Li Xu, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Alibaba Zhejiang University(阿里巴巴浙江大学) University of Waterloo(多伦多大学) Vector Institute(向量研究所) Nanjing University(南京大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Dynamo,一种无需训练、无需权重更新的框架,通过让冻结的VLM在少量标注数据上自我检查并演化可复用的推理技能和可执行的视觉工具,提升视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29871 2026-06-30 cs.AI 57%

AI Training Manager: Bounded Closed-Loop Control of Adaptive Training Recipes

AI训练管理器:自适应训练配方的有界闭环控制

Anjali Rao, Nikhil Kamalkumar Advani

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一种基于LLM的有界监督控制器,通过结构化遥测和约束动作空间,动态调整学习率、正则化等超参数,解决训练中的过拟合、损失不平衡等问题,在语言建模和强化学习任务中提升性能。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29533 2026-06-30 cs.GT cs.LG 57%

Improved Multi-Dimensional Forecasting for Swap Regret

改进的多维预测以实现交换遗憾

Joey Rivkin, Ramiro N. Deo-Campo Vuong, Robert Kleinberg, Chido Onyeze, Erald Sinanaj, Eva Tardos

机构 * Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对未知目标的多个下游代理,提出一种预测器,同时保证所有代理的次线性交换遗憾,在二维空间中实现多项式时间算法,遗憾界为$\tilde{O}(\sqrt{kT})$,并推广到低维和高维环境。

Comments Accepted for presentation at the ACM Conference on Economics and Computation (EC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29511 2026-06-30 cs.LG 57%

Reinforcement Learning in Super Mario Bros: Curriculum, Pedagogy, and Optimal Level Design in World 1-1

超级马里奥兄弟中的强化学习:世界1-1的课程、教学法与最优关卡设计

Jesse Ponnock, Lucas Ho

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 通过强化学习算法验证超级马里奥兄弟世界1-1的关卡设计具有教学结构,蒙特卡洛方法表现最佳,且规范顺序学习效率最高。

Comments 13 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28856 2026-06-30 q-bio.OT cs.AI 57%

Building AI-Ready Data Systems for Space Life Sciences, Aerospace Medicine, and Deep Space Exploration

构建面向空间生命科学、航空航天医学和深空探测的AI就绪数据系统

Sylvain V. Costes, Sergio Garcia Busto, Ryan T. Scott, James A. Casaletto, Gautier Bardi de Fourtou, Brian M. Evarts, Amanda M. Saravia-Butler, Xavier-Lewis Palmer, Rodrigo Coutinho de Almeida, Laetitia Frost, Jelena Tešić, Afshin Beheshti, Christopher E. Mason, Peter W. Rose, Sergio E. Baranzini, Lauren M. Sanders, Stefania Giacomello, Pedro Madrigal

机构 * Blue Marble Space Computational and Systems Biology(计算与系统生物学) Trivedi Institute for Space and Global Biomedicine(Trivedi空间与全球医学研究所) Wellcome Sanger Institute(Wellcome桑格研究所) University of Cambridge(剑桥大学) Department of Systems Biology, Harvard Medical School(哈佛医学院系统生物学系) Amentum, Space Biosciences Division, NASA Ames Research Center(Amentum空间生物学 division, NASA Ames研究中心) Massachusetts Institute of Technology(麻省理工学院) Crown Point Technologies, Inc(Crown Point Technologies公司) BiosView Labs Directorate of Human and Robotic Exploration, European Space Agency(欧洲航天局人类和机器人探索部门) Texas State University(德克萨斯州立大学) McGowan Institute for Regenerative Medicine, Department of Surgery, University of Pittsburgh School of Medicine(McGowan再生医学研究所,匹兹堡大学医学院外科系) Center for Space Biomedicine, Trivedi Institute for Space and Global Biomedicine(空间生物医学中心,Trivedi空间与全球医学研究所) Department of Bioengineering, University of Pittsburgh(匹兹堡大学生物工程系) Stanley Center for Psychiatric Research, Broad Institute of MIT and Harvard(Stanley精神医学研究中心,MIT和哈佛Broad研究所) Department of Systems and Computational Biomedicine and WorldQuant Initiative, Weill Cornell Medicine(系统与计算生物医学系及WorldQuant计划,Weill Cornell医学院) San Diego Supercomputer Center, University of California San Diego(圣地亚哥超级计算机中心,加州大学圣地亚哥分校) Weill Institute for Neurosciences, Department of Neurology, University of California San Francisco(Weill神经科学研究所,加州大学旧金山分校神经病学系) Science for Life Laboratory, Department of Gene Technology, KTH Royal Institute of Technology(Science for Life实验室,基因技术系,皇家理工学院) European Molecular Biology Laboratory, European Bioinformatics Institute (EMBL-EBI)(欧洲分子生物学实验室,欧洲生物信息研究所(EMBL-EBI))

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对空间生物学数据异构性阻碍AI应用的问题,提出从FAIR到AI就绪再到空间就绪的三层数据架构,并建议建立国际协调机构以支持深空生物学研究。

Comments 26 pages, 3 figures, 1 table, 1 supplementary table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28655 2026-06-30 quant-ph cs.LG q-bio.BM 57%

Exploring the Effects of Entanglement on Quantum Machine Learning of Pathogen Epitope-Receptor Binding

探索纠缠对病原体表位-受体结合量子机器学习的影响

Aspen Erlandsson Brisebois, Luis Pablo Gonzalez Dominguez, Shivansi Prajapati, Zahed Khatooni, Heather L. Wilson, Connor Burbridge, Brook Byrns, Sureesh Tikoo, Christophe Pere, Steven Rayan, Gordon Broderick

机构 * Vaccine and Infectious Disease Organization (VIDO)(疫苗与传染病组织) University of Saskatchewan(萨斯喀彻温大学) Faculty of Applied Science, University of Toronto(多伦多应用科学学院) Department of Mathematics and Statistics, University of Saskatchewan(萨斯喀彻温大学数学与统计学系) Centre for Quantum Topology and Its Applications (quanTA)(量子拓扑及其应用中心) Department of Computer Science, University of Saskatchewan(萨斯喀彻温大学计算机科学系) Advanced Research Computing, University of Saskatchewan(萨斯喀彻温大学高级研究计算中心) Vaccinology and Immunotherapeutics Program, School of Public Health, University of Saskatchewan(疫苗学与免疫治疗计划,公共卫生学院,萨斯喀彻温大学) Nord quantique(北量子)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 研究特征映射阶段两量子比特纠缠门的数量和拓扑结构如何影响混合量子神经网络在猪繁殖与呼吸综合征疫苗设计中表位-受体结合分类的性能,发现高纠缠ZZ特征映射能减少训练过拟合。

Comments 15 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28433 2026-06-30 cs.LG 57%

Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy

立场:强化学习研究者需要区分解决模拟器和将模拟器作为代理使用

Matthew Vandergrift, Esraa Elelimy, Martha White

机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算科学系) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文主张强化学习研究者应明确区分两种模拟器使用场景:解决模拟器本身与将模拟器作为部署学习的代理,并分析两者在约束、算法和评估指标上的差异,避免误导性结论。

Comments This work has been accepted at the ICML 2026 position paper track. The peer reviewed reference is provided in the public OpenReview page at https://openreview.net/forum?id=KIobEIpCkp Additionally the publication can be seen at this link : https://icml.cc/virtual/2026/poster/67184

Journal ref ICML, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28383 2026-06-30 cs.CV cs.LG 57%

Zero-Label Driving Scenario Complexity Detection via Joint Embedding Predictive Architecture

零标签驾驶场景复杂度检测基于联合嵌入预测架构

Santosh Jaiswal

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出无监督方法,利用联合嵌入预测架构(JEPA)在无标签数据上通过时间预测误差作为零样本复杂度指标,有效区分复杂与简单驾驶场景。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28370 2026-06-30 cs.IR cs.AI 57%

Conversational Query Engine for Mixed-Modality Heterogeneous Enterprise Data Sources

面向混合模态异构企业数据源的对话式查询引擎

Darshita Rathore, Vineet Kumar, Vaibhav Singal, Ankur Vivek Singh, Anindya Moitra

机构 * PayPal Artificial Intelligence(PayPal人工智能)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出COGNI系统,通过四层架构(索引、路由、检索、缓存)统一处理结构化与非结构化数据,实现高精度、低成本的混合模态查询。

Comments Accepted at Agent4IR @ KDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28356 2026-06-30 cs.IR cs.AI 57%

SafeGEO: Understanding Generative Engine Optimization Risks in Recommendation Agents

SafeGEO:理解推荐代理中的生成引擎优化风险

Qianfeng Wen, Yifan Simon Liu, Xin Liu, Difan Jiao, Blair Yang, Junda Wu, Zhenwei Tang

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Mechanical & Industrial Engineering, University of Toronto(多伦多大学机械与工业工程系) Faculty of Information, University of Toronto(多伦多大学信息学院) University of California, San Diego(圣地亚哥大学) ZBot Technology(ZBot技术) Coolwei AI Lab(Coolwei人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究GEO攻击如何使推荐代理推广有缺陷产品,提出SafeGEO评估套件,发现攻击使缺陷产品入选率提升83.2%,简单防御可降低39.2%但无法完全消除风险。

Comments 41 pages,23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00616 2026-06-30 cs.CV cs.AI 57%

Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion

暂停与思考:面向视频基础辅助动作建议的数据集与基准

Shivam Singh, Saptarshi Majumder, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 提出 pause-and-think-T 数据集和 pause-and-think-B 基准,通过推理监督训练紧凑模型,在视频场景理解与目标规划任务中达到与大型模型相当的性能。

Comments Accepted in IROS 2026 (IEEE/RSJ International Conference on Intelligent Robots and Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30031 2026-06-30 eess.SP 50%

Joint Outage Detection and Compensation for Self-Healing 5G RAN via Deep Reinforcement Learning

基于深度强化学习的自愈5G RAN联合中断检测与补偿

Sajjad Hussain

专题命中 Agent评测 :agent(abstract)

AI总结 提出一种结合三分类小区中断检测和深度Q网络强化学习的端到端框架,联合控制功率和天线倾角实现中断补偿,覆盖率达99.1%,完全恢复率54%,能耗低于启发式方法。

Comments Submitted to IEEE Wireless Communication Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30001 2026-06-30 cs.CV cs.GR cs.HC cs.SD 50%

SICAGE: Speaker-Independent Culture-Aware Gesture Generation using TED4C-L Dataset

SICAGE: 使用TED4C-L数据集的说话人无关文化感知手势生成

Ariel Gjaci, Antonio Sgorbissa, Vittorio Murino

机构 * Italian Institute of Technology(意大利理工学院) University of Genoa(热那亚大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出SICAGE框架,通过域泛化学习说话人无关的文化表征,结合ALaDiT扩散模型生成文化适切手势,在TED4C-L数据集上验证了运动真实性、多样性和文化一致性提升。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28382 2026-06-30 cs.MA 50%

Formation of Circular Directed Networks with Shared Link Costs

具有共享链路成本的有向循环网络的形成

Juan M. C. Larrosa, Fernando Tohmé

专题命中 Agent评测 :agent(abstract)

AI总结 本文建立了一个非合作有向网络形成模型,其中代理通过创建链接访问有价值信息并共享路径成本,证明了严格纳什均衡必须形成循环有向网络,且此类网络在最小链接数下实现信息全访问,同时帕累托最优且总福利高效。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27424 2026-06-30 quant-ph 50%

Agreement and Compatibility in Wigner's Friend Paradox

维格纳朋友悖论中的一致性与兼容性

Julio C. F. Silva, B. F. Rizzuti, Cristhiano Duarte

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过贝叶斯视角重新审视维格纳朋友悖论,论证维格纳与朋友的描述在经典和量子层面均无矛盾,并揭示兼容性与一致性是理解该悖论的关键。

Comments 26 pages, no figures, typos corrected, references added

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17969 2026-06-30 cs.CV 50%

E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes

E3VS-Bench:一个用于3D高斯散射场景中视角依赖主动感知的基准

Koya Sakamoto, Taiki Miyanishi, Daichi Azuma, Shuhei Kurita, Shu Morikuni, Naoya Chiba, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo, Japan(东京大学) National Institute of Informatics, Japan(日本信息处理学会) The University of Osaka, Japan(大阪大学) Advanced Telecommunications Research Institute International, Japan(国际先进电信研究机构)

专题命中 Agent评测 :planning(abstract)

AI总结 E3VS-Bench通过5自由度视角控制,评估在真实3D环境中视角依赖现象的主动感知能力,测试模型在多视角探索中的表现。

Comments Project page: https://k0uya.github.io/e3vs-proj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02701 2026-06-30 econ.EM 50%

Identification and Estimation of Continuous-Time Dynamic Discrete Choice Games

连续时间动态离散选择游戏的识别与估计

Jason R. Blevins

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究连续时间动态离散选择游戏的理论、计算和计量特性,探讨了移动到达率的识别问题及异质移动到达率的广义模型,通过蒙特卡洛实验和实证例子分析了估计器的计算和统计性质。

Journal ref Quantitative Economics 17 (2026), 254-296

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2606.30015 2026-06-30 cs.CL 57%

Parametric Skills

参数化技能

Xuan Zhao, Haonan He, Qingyu Yang, Minglei Li, Jingqi Ye, Zelin Tan, Bo Wan, Peng Ye

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) KTH Royal Institute of Technology(皇家理工学院) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他Agent :agentic(abstract);分类 cs.CL

AI总结 提出ParametricSkills框架,将文本技能在测试时转换为LoRA参数,解决长上下文下技能指令难以遵循的问题,在软件工程任务中平均提升6.44分。

Comments Preprint, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29389 2026-06-30 cs.CR cs.LG 57%

Exploring the Cryptographic Limits of Transformer Networks

探索Transformer网络的密码学极限

Stefan Domunco, Andis Draguns, Philip Torr, Isaac Robinson, Christian Schroeder de Witt

专题命中 其他Agent :AI agent(abstract);分类 cs.LG

AI总结 研究Transformer能否实现密码学函数,通过将Keccak、Merkle-Damgård和Merkle树构造映射为阈值电路,并进一步映射到Transformer架构,推导出宽度和深度的缩放律,建立Transformer计算能力结构性上限。

详情

展开后加载摘要…

URL PDF HTML 收藏