arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 531 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 531 篇

2605.27905 2026-07-14 cs.CL 版本更新 57%

AI Research Agents Narrow Scientific Exploration

AI研究代理缩小科学探索范围

Yixuan Tang, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究通过四个AI研究代理框架和六个大语言模型生成37,802个科学想法,发现AI生成的想法比人类论文更集中、更接近起始文献,且与低引用论文相似,表明当前AI代理更适合局部细化而非拓宽科学探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07066 2026-07-14 cs.AI 版本更新 57%

2.5-D Decomposition for LLM-Based Spatial Construction

基于2.5-D分解的LLM空间构建

Paul Whitten, Li-Jen Chen, Sharath Baddam

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于2.5-D分解的神经符号管道,通过让LLM在二维水平面上规划,同时确定性执行器计算垂直放置,从而消除一类错误,提升了空间构建的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23242 2026-07-14 cs.AI 版本更新 57%

A Model-Free Universal AI

无模型通用人工智能

Yegon Kim, Juho Lee

机构 * Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出首个在通用强化学习中证明渐近ε最优的无模型智能体AIQI,通过分布动作值函数的通用归纳实现,并扩展了Self-AIXI的渐近最优性证明。

Comments 42nd Conference on Uncertainty in Artificial Intelligence (UAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04277 2026-07-14 cs.RO cs.AI 版本更新 57%

VehAnchor: Metadata-Free Metric Scale Recovery from Vehicle Cues in Aerial Imagery

VANGUARD:用于GPS受限环境下的无人机车辆锚定地面采样距离估计

Yifei Chen, Chenqian Le, Jiayi Cheng, Xupeng Chen

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Tandon School of Engineering, New York University(纽约大学工学院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 VANGUARD通过利用车辆锚点和核密度估计,为无人机在GPS受限环境中提供可靠地面采样距离估计,降低空间推理中的误差和失败率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03953 2026-07-14 cs.RO cs.AI cs.CV 版本更新 57%

RVN-Bench: A Benchmark for Reactive Visual Navigation

RVN-Bench: 一种用于反应式视觉导航的基准测试

Jaewon Lee, Jaeseok Heo, Gunmin Lee, Howoong Jun, Jeongwoo Oh, Songhwai Oh

机构 * Department of Electrical and Computer Engineering, Seoul National University (SNU) and Automation and Systems Research Institute (ASRI) and Sequor Robotics Inc.(电气与计算机工程系,首尔国立大学(SNU)和自动化与系统研究所(ASRI)以及Sequor机器人公司) Department of Electrical and Computer Engineering, Seoul National University (SNU) and Automation and Systems Research Institute (ASRI)(电气与计算机工程系,首尔国立大学(SNU)和自动化与系统研究所(ASRI)) Interdisciplinary Program in Artificial Intelligence, Seoul National University (SNU) and Automation and Systems Research Institute (ASRI) and Sequor Robotics Inc.(人工智能跨学科项目,首尔国立大学(SNU)和自动化与系统研究所(ASRI)以及Sequor机器人公司) Sequor Robotics Inc.(Sequor机器人公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 RVN-Bench是一种针对室内移动机器人安全视觉导航的碰撞感知基准测试,通过高保真度场景和标准化工具,支持在线和离线学习,提升导航任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11007 2026-07-14 cs.LG cs.DC 版本更新 57%

Device-Cloud Collaborative LLM Inference with Multi-Modal, Multi-Task, Multi-Turn Conversations

具有多模态、多任务、多轮对话的设备-云协作大语言模型推理

Liangqi Yuan, Dong-Jun Han, Shiqiang Wang, Christopher G. Brinton

机构 * School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) Department of Computer Science and Engineering, Yonsei University(延世大学计算机科学与工程系) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究大语言模型部署挑战,设计TMO设备-云推理系统,结合轻量级设备LLM和大规模云LLM,开发资源受限强化学习策略优化推理,贡献M4A1数据集,实验证明TMO在延迟、成本和响应质量方面效果显著。

Comments ACM MobiHoc 2025 (Best Paper Runner-Up) -> IEEE/ACM Transactions on Networking (extended journal version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21431 2026-07-14 stat.ML cs.LG 版本更新 57%

Oracle-Efficient Combinatorial Semi-Bandits

神谕高效组合半带式赌博机

Jung-hun Kim, Milan Vojnović, Min-hwan Oh

机构 * CREST, ENSAE, IP Paris(CREST、ENSAE、IP巴黎) FairPlay joint team(FairPlay联合团队) London School of Economics(伦敦经济学院) Seoul National University(首尔国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究组合半带式赌博机问题,提出神谕高效框架,减少神谕调用次数,在最坏情况线性奖励设置下,算法用较少神谕查询达低遗憾值,还有协方差自适应算法及扩展到非线性奖励,降低神谕使用时间并获理论保证。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08921 2026-07-14 cs.LG 版本更新 57%

Neural Active Learning Meets the Partial Monitoring Framework

神经主动学习与部分监测框架相遇

Maxime Heuillet, Ola Ahmad, Audrey Durand

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究在线主动学习设置,基于部分监测为OAL任务提出新基础,表明相关任务是部分监测实例,引入成本敏感型任务扩展潜力,提出NeuralCBP策略,实验显示其在多类OAL任务上性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02871 2026-07-10 cs.AI 版本更新 57%

SimRPD: Optimizing Recruitment Proactive Dialogue Agents through Simulator-Based Data Evaluation and Selection

SimRPD:通过基于模拟器的数据评估和选择优化招聘主动对话代理

Zhiyong Cao, Dunqiang Liu, Qi Dai, Haojun Xu, Huai Yuen Khor, Hao Wang, Huan He, Yafei Liu, Ke Ma, Ruqian Shi, Sicheng Zhou, Sijia Yao

机构 * Zhaopin Limited(智聘有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Automation,Beijing Institute of Technology(北京理工大学自动化学院) Central University of Finance and Economics(中央财经大学) Beihang University(北航) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对招聘主动对话代理训练数据稀缺问题,提出SimRPD框架。通过高保真用户模拟器合成数据,基于意图链的评估框架选数据,在所选数据集上训练代理。实验证明该框架优于现有策略,有工业部署价值和其他场景适用性。

Comments Published in the ACL 2026 Industry Track. Oral presentation

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track), 2026, pp. 1359-1377

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04203 2026-07-10 cs.LG cs.CV 版本更新 57%

Computation, Condensation, and the Incompleteness Between Them: A Coupled Foundation of Intelligence

计算、凝聚及其之间的不完备性:智能的耦合基础

Xin Li

机构 * Department of Computer Science, University at Albany, SUNY(计算机科学系,阿尔巴尼大学,SUNY)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究探讨计算理论与智能所回答问题的差异,指出智能需计算与记忆两个算子耦合,证明单独算子不完备,确定耦合代价是关键操作不可判定且有误差下限,认为耦合是普遍法则并给出其可证伪核心与范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02704 2026-07-10 cs.GT cs.LG 版本更新 57%

Calibrated Stackelberg Games: Learning Optimal Commitments Against Calibrated Agents

校准的斯塔克尔伯格博弈:学习针对校准代理的最优承诺

Nika Haghtalab, Chara Podimata, Kunhe Yang

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究校准斯塔克尔伯格博弈,将标准框架推广,其中代理依校准预测行动。虽信息减少,但委托人最优效用有界。针对校准挑战,开发新校准概念及算法,包括基于最佳响应区域的松弛,及代理自适应校准算法,助委托人更快收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21556 2026-07-09 cs.AI cs.GT 版本更新 57%

Power and Limitations of Aggregation in Compound AI Systems

复合人工智能系统中聚合的力量与局限性

Nivasini Ananthakrishnan, Meena Jagadeesan

机构 * UC Berkeley(伯克利大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究复合人工智能系统中聚合的力量与局限性,在委托 - 代理框架内揭示可行性扩展等三种机制,证明其对引出能力扩展的作用,通过玩具任务实证说明结果,朝表征系统克服相关局限迈进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05088 2026-07-09 cs.AI 版本更新 57%

AI Chatbot Suicide Risk Detection and Response: Human Validation Study of the Open-Source VERA-MH Safety Evaluation

人工智能聊天机器人自杀风险检测与应对:开源VERA-MH安全评估的人工验证研究

Kate H. Bentley, Luca Belli, Adam M. Chekroud, Emily J. Ward, Emily R. Dworkin, Emily Van Ark, Kelly M. Johnston, Will Alexander, Millard Brown, Matt Hawrilenko

机构 * Spring Health Harvard Medical School(哈佛医学院) UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对人工智能聊天机器人用于心理支持时的安全性评估问题,以VERA-MH为基准,模拟用户与聊天机器人对话,通过持牌临床医生和基于LLM的评估器评级,验证了VERA-MH在检测自杀风险方面的可靠性,为后续研究指明方向。

Journal ref JMIR AI. 2026;5

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14271 2026-07-09 cs.AI 版本更新 57%

Neutral Substrates: A Design Constraint for Shared Records Under Persistent Interpretive Disagreement

中性基底:持续解释分歧下共享记录的设计约束

Denise M. Case

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在因果等解释有分歧时共享记录的中立性问题,提出中性基底概念,其基础层受限以保证中立性,借助具体化等机制,给出共享记录基础层可检查条件及相关假设与边界条件,确保问责又不偏向一方解释。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08630 2026-07-09 cs.AI cs.RO 版本更新 57%

Shared Modular Recurrence in Contextual MDPs for Universal Morphology Control

上下文马尔可夫决策过程中用于通用形态控制的共享模块化递归

Laurens Engwegen, Max Weltevrede, Caroline Horsch, Daan Brinks, Wendelin Böhmer

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究旨在解决多机器人形态差异大时的控制难题,提出利用模块化交互恢复上下文特征,实现更好的多机器人控制及泛化。通过基于变压器且具共享模块化递归的架构在MuJoCo机器人上评估,显著提升了零样本泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00476 2026-07-08 cs.AI 版本更新 57%

Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents

做他们所说的,而不是他们所推理的:定位LLM智能体中的忠实性差距

Yufeng Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过将忠实性差距分解为推理-结论和结论-行动两个步骤,在可控的德克萨斯扑克模拟器中研究LLM智能体是否按照其陈述的推理行动。

Comments submitted to COLM social simulation with LLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09426 2026-07-07 cs.AI 版本更新 57%

WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces

WeaveBench: 面向混合接口的长期、真实世界计算机使用代理基准

Wanli Li, Bowen Zhou, Yunyao Yu, Zhou Xu, Yifan Yang, Dongsheng Li, Caihua Shan

机构 * Zhejiang University(浙江大学) Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出WeaveBench基准,包含114个跨8个真实工作领域的长期混合接口任务,要求代理结合GUI和CLI/代码操作,最佳PassRate仅41.2%,揭示现有评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08678 2026-07-07 cs.LG 版本更新 57%

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI

MLS-Bench:对构建更好AI的AI系统的全面且严格评估

Bohan Lyu, Yucheng Yang, Siqiao Huang, Jiaru Zhang, Qixin Xu, Xinghan Li, Xinyang Han, Yicheng Zhang, Huaqing Zhang, Runhan Huang, Kaicheng Yang, Zitao Chen, Wentao Guo, Junlin Yang, Xinyue Ai, Wenhao Chai, Yadi Cao, Ziran Yang, Kun Wang, Dapeng Jiang, Huan-ang Gao, Shange Tang, Chengshuai Shi, Simon S. Du, Max Simchowitz, Jiantao Jiao, Dawn Song, Chi Jin

机构 * UC Berkeley(伯克利大学) Princeton University(普林斯顿大学) Tsinghua University(清华大学) University of Washington(华盛顿大学) Purdue University(Purdue 大学) Harvard University(哈佛大学) University of Pennsylvania(宾夕法尼亚大学) Shanghai Jiao Tong University(上海交通大学) UC San Diego(圣地亚哥大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出MLS-Bench基准,包含12个领域140个任务,评估AI系统能否发明通用且可扩展的机器学习方法,发现当前智能体在方法发明上仍远逊于人类,瓶颈在于科学洞察而非单纯搜索或计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20677 2026-07-07 cs.CR cs.CL 版本更新 57%

Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

基于学习的自动化对抗红队测试用于大型语言模型的鲁棒性评估

Zhang Wei, Hanxuan Chen, Peilu Hu, Zhenyuan Wei, Chenwei Liang, Jiayi Gu, Wenqian Weng, Jacqueline Pang, Hao Yan, Li Mei, Shengning Lang, Kuan Lu, Xi Xiao, Zhimo Han, Yijin Wang, Yichao Zhang, Chen Yang, Zhenyu Yu, Riyang Bao, Xinyuan Song, Junfeng Hao, Mu-Jiang-Shan Wang

机构 * Independent Researcher(独立研究者) Hunan University(湖南大学) Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳凯鸿数字产业开发有限公司) Central University of Finance and Economics(中央财经大学) Chongqing University(重庆大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Stevens Institute of Technology(斯蒂文斯理工学院) Cornell University(康奈尔大学) Oak Ridge National Laboratory(橡树岭国家实验室) Zhengzhou University of Light Industry(郑州轻工业大学) Xidian University(西安电子科技大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) AI Safety Research Lab, Institute of Advanced Computing(高级计算研究所人工智能安全研究实验室) University of Malaya(马来亚大学) Emory University(埃默里大学) Department of Nephrology, Affiliated Hospital of Guangdong Medical University(广东医学院附属医院肾内科)

专题命中 Agent评测 :tool use(abstract);分类 cs.CL

AI总结 本文提出一种学习驱动的自动化红队测试框架,用于高效发现大型语言模型的漏洞,通过元提示引导的对抗性提示生成和分层执行检测流程,在六个威胁类别中实现标准化评估,实验发现47个漏洞,包括21个高严重性失败和12种新攻击模式。

Comments ACL ARR minor revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17673 2026-07-07 cs.CR cs.AI 版本更新 57%

Towards Reliable Local Security Agents: Verifiable Post-Training for Linux Privilege Escalation

在Linux提权中使用可验证奖励进行训练后的本地LLM代理

Philipp Normann, Andreas Happe, Jürgen Cito, Daniel Arp

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种两阶段训练流程,通过监督微调和强化学习提升Linux提权任务的性能,实现高成功率和低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20203 2026-07-07 cs.AI 版本更新 57%

Shutdownable Agents through POST-Agency

通过后代理实现可关闭的智能体

Elliott Thornley

机构 * OpenAI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出后代理建议,训练智能体满足仅在等长轨迹间的偏好,证明此与其他条件蕴含中立性+,使智能体可关闭且有用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19186 2026-07-07 cs.CL 版本更新 57%

When Users Are Happy but Agents Are Wrong: Multi-Dimensional Evaluation of Tool-Augmented Dialogue

当用户满意但智能体出错:工具增强对话的多维度评估

Tanya Shourya, Yingfan Wang, Zhaoyi Joey Hou, Shamik Roy, Vinayshekhar Bannihatti Kumar, Rashmi Gangadharaiah

机构 * AWS AI Labs(AWS人工智能实验室) University of Pittsburgh(匹兹堡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 针对工具增强对话系统中用户满意但智能体错误的问题,提出TRACE基准,通过系统合成多样错误案例,评估现有框架发现性能远未理想。

Comments The Fifth Generation, Evaluation & Metrics Workshop (GEM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16663 2026-07-07 cs.RO cs.CV cs.LG cs.SY eess.SY 版本更新 57%

Mitigating Covariate Shift in Imitation Learning for Autonomous Vehicles Using Latent Space Generative World Models

使用潜在空间生成世界模型减轻自动驾驶模仿学习中的协变量转移

Alexander Popov, Alperen Degirmenci, David Wehr, Shashank Hegde, Ryan Oldja, Alexey Kamenev, Bertrand Douillard, David Nistér, Urs Muller, Ruchi Bhargava, Stan Birchfield, Nikolai Smolyanskiy

机构 * NVIDIA

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出用潜在空间生成世界模型解决自动驾驶协变量转移问题,训练时利用世界模型减轻该问题,无需大量训练数据,还引入新感知编码器,实验显示相比之前有显著改进。

Comments 8 pages, 6 figures, original September 2024, accepted at ICRA 2025 Workshop "Robots in the Wild", for associated video file, see https://youtu.be/7m3bXzlVQvU

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28565 2026-07-03 cs.PF cs.AI cs.AR 版本更新 57%

KernelSight-LM: A Kernel-Level LLM Inference Simulator

KernelSight-LM: 一种内核级LLM推理模拟器

Xiteng Yao, Taeho Kim, Hengzhi Pei, Xinle Liu, Kyle Ulrich, Leonard Lausen, Ashish Khetan, Xiang Song, George Karypis, Martin Herbordt

机构 * Amazon Web Services(亚马逊网络服务) Boston University(波士顿大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 提出KernelSight-LM,一种细粒度推理模拟器,通过分解服务步骤为屋顶线内核模型、通信模型和主机开销模型,并集成前缀缓存和连续批处理,实现跨GPU代际或少量目标数据下的精确延迟预测,支持硬件/软件协同设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28906 2026-07-03 cs.AI 版本更新 57%

Working Paper: Towards a Category-theoretic Comparative Framework for Artificial General Intelligence

预印本:迈向人工通用智能的范畴论比较框架

Pablo de los Riscos, Fernando J. Corbacho, Michael A. Arbib

机构 * Cognodata R+D & Universidad Autonoma de Madrid(Cognodata研发与马德里自治大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文旨在构建一个通用的范畴论框架,用于描述、比较和分析不同的人工通用智能架构,揭示其共同点与差异,并指导未来研究。

Comments 37 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03042 2026-07-03 cs.CV cs.AI 版本更新 57%

PPTArena: A Benchmark for PowerPoint Editing

PPTArena: 一个用于PowerPoint编辑的基准测试

Michael Ofengenden, Yunze Man, Ziqi Pang, Liang-Yan Gui, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出PPTArena基准,包含2125张幻灯片的1300+人工编辑任务,并设计PPTPilot智能体通过结构感知的规划-编辑-验证循环,在复合、布局敏感和跨幻灯片编辑上超越强基线10个百分点以上。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18266 2026-06-25 cs.LG 版本更新 57%

A Probabilistic Framework for LLM-Based Model Discovery

基于LLM的模型发现的概率框架

Stefan Wahl, Raphaela Schenk, Ali Farnoud, Jakob H. Macke, Daniel Gedon

机构 * Machine Learning in Science, University of Tübingen, Tübingen, Germany(图宾根大学机器学习科学系,图宾根,德国) Tübingen AI Center, Tübingen, Germany(图宾根人工智能中心,图宾根,德国) Department Empirical Inference, Max Planck Institute for Intelligent Systems, Tübingen, Germany(经验推断部门,智能系统马克斯·普朗克研究所,图宾根,德国)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 将模型发现重新定义为概率推理问题,提出基于序贯蒙特卡洛采样的ModelSMC算法,利用LLM迭代提出和优化候选模型,并通过似然加权选择,在真实科学系统中发现可解释机制并改进后验预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06177 2026-06-24 cs.AI 版本更新 57%

BioMedArena: An Open-source Toolkit for Building and Evaluating Biomedical Deep Research Agents

BioMedArena:构建和评估生物医学深度研究代理的开源工具包

Jinge Wu, Hongjian Zhou, Mingde Zeng, Jiayuan Zhu, Junde Wu, Jiazhen Pan, Ayush Noori, Sean Wu, Honghan Wu, Fenglin Liu, David A. Clifton

机构 * University of Oxford(牛津大学) University College London(伦敦大学学院) Technical University of Munich(慕尼黑技术大学) Oxford-Suzhou Centre for Advanced Research, China(牛津-苏州先进研究中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 BioMedArena通过解耦六个评估层,提供公平比较不同基础模型的平台,显著提升生物医学基准的性能,实现8个代表性基准的SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11957 2026-06-24 cs.CL 版本更新 57%

PEARL: Self-Evolving Assistant for Time Management with Reinforcement Learning

PEARL: 基于强化学习的自我进化时间管理助手

Bingxuan Li, Jeonghwan Kim, Cheng Qian, Xiusi Chen, Eitan Anzenberg, Niran Kundapur, Heng Ji

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Viven

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 针对日历冲突解决任务,提出PEARL框架,通过外部偏好记忆和逐轮奖励优化,显著降低LLM代理的错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03509 2026-06-24 cs.AI cs.NE 版本更新 57%

Evolving Programmatic Skill Networks

演化式程序化技能网络

Haochen Shi, Xingdi Yuan, Bang Liu

机构 * DIRO & Institut Courtois, Université de Montréal(DIRO与Courtois研究所,蒙特利尔大学) Mila – Québec AI Institute(魁北克人工智能研究所) Microsoft Research(微软研究院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出程序化技能网络(PSN),通过大语言模型驱动的故障定位、渐进优化和结构重构,实现开放环境中技能库的持续构建与复用。

详情

展开后加载摘要…

URL PDF HTML 收藏