arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 531 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 531 篇

2603.00077 2026-08-11 cs.CL cs.AI 版本更新 62%

Autorubric: A Unifying Framework for Rubric-Based LLM Evaluation on Non-Verifiable Tasks

Autorubric:统一基于评分标准的LLM评估

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Autorubric通过整合多种评分标准评估技术,提供统一的评分框架和默认设置,提升LLM评估的可靠性与一致性,并在多个基准测试中展示了其有效性。

Comments 60 pages; COLM 2026 camera ready copy

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18347 2026-08-11 cs.LG cs.AI 版本更新 62%

The Cell Must Go On: Agar.io for Continual Reinforcement Learning

细胞必须继续前进:Agar.io用于持续强化学习

Mohamed A. Mohamed, Kateryna Nekhomiazh, Vedant Vyas, Marcos M. Jose, Andrew Patterson, Marlos C. Machado

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 AgarCL是一个基于Agar.io游戏的持续强化学习研究平台,用于评估不同算法在复杂动态环境中的表现和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28609 2026-08-07 cs.AI cs.CL cs.CV 版本更新 62%

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

OSReward:为跨平台计算机使用奖励模型建立标准化评估

Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究推出OSReward基准评估VLM评判者的可靠性,构建OS-Shepherd开源奖励模型缩小成本差距,为规模化可靠CUA奖励设计提供参考

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21140 2026-08-07 cs.SE cs.AI 版本更新 62%

Matching Matters: A Fair Quality-Efficiency Benchmark for Command-Line Agents

AgentMeter: 评估基于CLI的本地任务求解智能体的模型-CLI匹配

Han Chi, Jiaxin Qi, Yan Cui, Baisheng Lai, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, Chinese Academy of Sciences(中国科学院杭州高等研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出AgentMeter基准,通过成功锚定、成本感知的AMS指标评估模型与CLI的匹配,发现模型和CLI选择不可解耦,需作为部署单元评估。

Comments 13 pages, 4 figures, 12 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03722 2026-08-06 cs.AI cs.CL 版本更新 62%

When Outputs Disperse, Does Epistemic Revision Follow? A Black-Box Diagnostic for Machine Collectives

当输出分散时,认知修正会随之而来吗?面向机器集体的黑盒耦合诊断方法

Molood Arman

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出黑盒耦合诊断方法,评估LLM集体输出分散度干预与认知立场修正的关联,发现不同模型的错误前提恢复效应存在显著差异,建议报告立场转变及保留前提率。

Comments Reviewed at Collective Intelligence 2026 (CI 2026) Conference. Revised version incorporating reviewer feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02046 2026-08-06 cs.CL cs.AI 版本更新 62%

CompanionBench: A Theory-Anchored, Real-World-Grounded Benchmark for AI Emotional Companionship

CompanionBench:一个基于理论、扎根于真实世界的AI情感陪伴基准

Yao Liu, Guangjia Chai, Yuming Huang, Jihao Huang, Lei Wang, Junchen Wan

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究推出基于理论与真实数据的交互式双语AI情感陪伴基准CompanionBench,评估28个智能体发现其能力差异,指出角色扮演智能体表现差、核心能力存弱点,将发布500对中英平行数据及评估代码。

Comments 33 pages, 6 figures, 19 tables, 13 appendices. Bilingual (Chinese/English) interactive benchmark; 28 evaluated agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25459 2026-08-05 cs.CL cs.LG 版本更新 62%

SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA

SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中

Haozhou Xu, Dongxia Wu, Matteo Chinazzi, Ruijia Niu, Rose Yu, Yi-An Ma

机构 * University of California San Diego(加州大学圣迭戈分校) Stanford University(斯坦福大学) Northeastern University(东北大学)

专题命中 Agent评测 :planning(abstract);分类 cs.CL、cs.LG

AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%

Comments Haozhou Xu and Dongxia Wu are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27056 2026-08-04 cs.AI cs.CL 版本更新 62%

Setoka: A Benchmark for Hierarchical User Understanding in Personalized Agents over Heterogeneous Data

Setoka:面向异构数据下个性化智能体分层用户理解的基准测试集

Lingyang Zeng, Guangze Chen, Kaichen Yu, Zhicheng Pan, Siyang Weng, Zirui Hu, Xiangyun Du, Hailin He, Rong Zhang, Chengcheng Yang, Kai Huang, Xuan Zhou

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出Setoka基准测试集,评估记忆增强型个性化智能体的分层用户理解能力,发现现有系统在需整合异构信息的任务中性能下降,推动相关记忆机制设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29771 2026-08-04 cs.AI cs.LG q-fin.CP q-fin.PM 版本更新 62%

CLQT: A Closed-Loop, Cost-Aware, Strategy-Consistent Benchmark for Diagnostic Evaluation of LLM Portfolio-Management Agents

CLQT:用于LLM投资组合管理代理诊断评估的闭环、成本感知、策略一致性基准

Bo Qu, Mingguang Chen

机构 * Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出CLQT基准,通过闭环交易环境诊断LLM代理的决策过程,而非仅排名收益,评估五个维度的能力。

Comments 56 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00762 2026-08-04 cs.LG cs.AI cs.MA 版本更新 62%

Meritocratic Fairness via $K$-Shapley Values in Budgeted Combinatorial Bandits with Full-Bandit Feedback

预算化组合多臂老虎机中基于Shapley值的 meritocratic 公平性框架

Shradha Sharma, Shweta Jain, Swapnil Dhamal

机构 * Indian Institute of Technology Ropar(印度理工学院罗帕尔)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种新的预算化组合多臂老虎机框架,通过扩展Shapley值到K-Shapley值,解决了全反馈环境下个体臂贡献的计算问题,并提出了K-SVFair-FBF算法,实现了公平性与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13741 2026-08-04 cs.AI cs.LG 版本更新 62%

PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning

PB²:基于偏好的强化学习中通过基于种群的方法进行偏好空间探索

Brahim Driss, Alex Davey, Riad Akrour

机构 * Univ. Lille(里尔大学) Inria(法国国家信息与自动化技术研究院) CNRS(法国国家科学研究中心) Centrale Lille(里尔中央理工大学) UMR 9189-CRIStAL(9189号研究单元-CRIStAL)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对基于偏好的强化学习中偏好空间探索不足的问题,提出PB²方法,通过维持多样化智能体种群提升偏好探索能力,在复杂环境及教师误标注场景下性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02330 2026-08-03 cs.CV cs.AI cs.LG 版本更新 62%

ActionParty: Multi-Subject Action Binding in Generative Video Games

ActionParty:生成视频游戏中的多主体动作绑定

Alexander Pondaven, Ziyi Wu, Igor Gilitschenski, Philip Torr, Sergey Tulyakov, Fabio Pizzati, Aliaksandr Siarohin

机构 * Snap Research(Snap研究院) University of Oxford(牛津大学) University of Toronto(多伦多大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ActionParty,一种可控制多主体的生成视频游戏世界模型,通过引入主体状态标记和空间偏置机制,提升动作关联准确性与身份一致性。

Comments ECCV 2026 - Project page: https://action-party.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12790 2026-07-31 cs.AI cs.CL cs.MA 版本更新 62%

Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

谁来评估评估者?用于自我改进的语言模型代理的协同进化评估指标和技能

Xing Zhang, Guanghui Wang, Yanwei Cui, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * Amazon(亚马逊)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究自我进化智能体系统中评估指标缺失问题,提出指标可进化,通过“双棘轮”协同进化指标与技能循环,在多任务中保留提升效果,还阐述安全性源于锚定规则与外部审核,为无可靠自动验证器场景提供架构。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Double-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02050 2026-07-28 cs.CY cs.AI cs.HC cs.LG 版本更新 62%

Principles and Guidelines for Randomized Controlled Trials in AI Evaluation

人工智能评估中随机对照试验的原则与指南

Christopher Kelly, Angelica Chowdhury, Alexandra Campili, Bimpe Ayoola, Devin Barbour, Thomas Chen Dawson, Ze Shen Chin, Rokas Gipiškis

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对人工智能评估随机对照试验缺乏通用标准和共享词汇的问题,借鉴多学科实践综合五条原则,形成33条可操作指南,为其发挥设计工具、评估标准和标准制定蓝图的作用,提供评估标准、共享语言及指南。

Comments 33 pages, ICML 2026 (Workshop on Technical AI Governance Research) and Technical AI Safety Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27476 2026-07-28 cs.AI cs.LG 版本更新 62%

PeopleSearchBench: A Multi-Dimensional Benchmark for Evaluating AI-Powered People Search Platforms

PeopleSearchBench: 一个多维度基准,用于评估人工智能驱动的人力搜索平台

Wei Wang, Tianyu Shi, Shuai Zhang, Boyang Xia, Zequn Xie, Chenyu Zeng, Qi Zhang, Lynn Ai, Yaqi Yu, Kaiming Zhang, Feiyue Tang, Lei Ding

机构 * LessieAI research team(LessieAI 研究团队)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PeopleSearchBench,一个开源基准,评估四个人力搜索平台在119个真实查询中的表现,采用事实验证方法,提出Criterions-Grounded Verification,评估三个维度:相关性精度、有效覆盖和信息效用,Lessie在所有指标中表现最佳。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01496 2026-07-28 cs.GT cs.AI cs.LG 版本更新 62%

The Optimal Sample Complexity of Linear Contracts

线性合约的最优样本复杂度

Mikael Møller Høgsgaard

机构 * Department of Statistics, University of Oxford, United Kingdom(英国牛津大学统计系) Department of Computer Science, Aarhus University, Denmark(丹麦奥胡斯大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文通过经验效用最大化算法,证明仅需 O(ln(1/δ)/ε²) 个样本即可实现最优线性合约的 ε-近似,并匹配下界,从而确立最优样本复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03059 2026-07-28 cs.LG cs.AI 版本更新 62%

Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers

Loong:通过验证器大规模合成长思维链

Xingyue Huang, Rishabh, Gregor Franke, Ziyi Yang, Jiamu Bai, Weijie Bai, Jinhe Bi, Zifeng Ding, Yiqun Duan, Chengyu Fan, Wendong Fan, Xin Gao, Ruohao Guo, Yuan He, Zhuangzhuang He, Xianglong Hu, Neil Johnson, Bowen Li, Fangru Lin, Siyu Lin, Tong Liu, Yunpu Ma, Hao Shen, Hao Sun, Beibei Wang, Fangyijie Wang, Hao Wang, Haoran Wang, Yang Wang, Yifeng Wang, Zhaowei Wang, Ziyang Wang, Yifan Wu, Zikai Xiao, Chengxing Xie, Fan Yang, Junxiao Yang, Qianshuo Ye, Ziyu Ye, Guangtao Zeng, Yuwen Ebony Zhang, Zeyu Zhang, Zihao Zhu, Bernard Ghanem, Philip Torr, Guohao Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对将LLMs推理能力扩展到其他领域的挑战,提出Loong项目这一开源框架,由LoongBench和LoongEnv组成,通过它们形成强化学习的智能体-环境循环,经实验评估及对合成数据的分析,推动推理密集型领域发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07753 2026-07-22 cs.LG cs.AI 版本更新 62%

A Transdiagnostic Space of Disorder Like Phenotypes in Reinforcement Learning Agents

强化学习智能体中类似障碍表型的跨诊断空间

Hari Prasad

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究在强化学习智能体中建模心理障碍,将其重新表述为对认知评估信号的剂量可控操纵,通过多个旋钮表示多种障碍,呈现分级剂量反应,还发现障碍自组织成二维空间、旋钮对不同障碍有不同影响及旋钮相互作用可预测共病等,且框架具有通用性。

Comments 15 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16410 2026-07-22 cs.CL cs.AI 版本更新 62%

PlotTwist: A Creative Plot Generation Framework with Small Language Models

PlotTwist: 一种利用小语言模型的创意情节生成框架

Abhinav Thorat, Ravi Kolla, Jyotin Goel, Madhav Kataria, Niranjan Pedanekar

机构 * Sony Research India(索尼印度研究院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 PlotTwist通过结构化框架使小语言模型生成高质量前提条件情节,优于大型模型,且在多个叙事质量维度上表现优异。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20918 2026-07-21 cs.LG cs.AI cs.SY eess.SY 版本更新 62%

Short-Term Electricity Demand Forecasting for New England: A Comprehensive Machine Learning Benchmark with Weather, Calendar, and COVID-19 Indicators

基于混合Transformer-XGBoost框架的新英格兰短期电力需求预测:融合天气、日历和COVID-19指标

Reza Ghanavati, Behrooz Mosallaei

机构 * Department of Chemical and Materials Engineering, New Mexico State University(新墨西哥州立大学化学与材料工程系) Department of Electrical and Communications Engineering, New Jersey Institute of Technology(新泽西理工学院电气与通信工程系)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出混合Transformer-XGBoost框架,集成天气、日历和COVID-19变量,用于新英格兰短期电力需求预测,测试RMSE为8876 MWh,MAPE为2.05%,并发现COVID-19特征在疫情后成为噪声。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22328 2026-07-21 cs.LG cs.AI cs.CE 版本更新 62%

FETS Benchmark: Foundation Models Enable Scalable and Generalizable Energy Time Series Forecasting

FETS基准:基础模型在能源时间序列预测中优于数据集特定的机器学习

Marco Obermeier, Marco Pruckner, Florian Haselbeck, Andreas Zeiselmair

机构 * Julius-Maximilians-Universität Würzburg, Modeling and Simulation Lab(乌尔姆-马克斯·普朗克大学,建模与仿真实验室) Weihenstephan-Triesdorf University of Applied Sciences, Smart Farming(魏因施泰因-特里尔夫应用科学大学,智能农业) Weihenstephan-Triesdorf University of Applied Sciences, Digital Energy Transition(魏因施泰因-特里尔夫应用科学大学,数字能源转型)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过FETS基准展示了基础模型在能源时间序列预测中优于传统机器学习方法,揭示了基础模型在不同数据集和场景下的优越性能及应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05463 2026-07-21 cs.LG cs.AI cs.IT math.IT 版本更新 62%

Thermodynamic Limits of Physical Intelligence

物理智能的热力学极限

Koichi Takahashi, Yusuke Hayashi

机构 * AI Alignment Network (ALIGN)(AI对齐网络) RIKEN Advanced General Intelligence for Science (AGIS) Program(RIKEN先进通用科学智能计划)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出两个每焦耳指标,用于衡量物理智能的热力学极限,涵盖识别与控制两个方面,并提供统一的效率框架以支持一致的比较。

Comments 16 pages. Accepted at the 19th Annual Conference on Artificial General Intelligence (AGI-26)

Journal ref Artificial General Intelligence (AGI 2026), Lecture Notes in Computer Science, Springer, 2026, pp. 339-354

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22854 2026-07-20 cs.LG cs.AI math.OC quant-ph stat.ML 版本更新 62%

A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model

一点自由大有可为:生成模型下强化学习的经典与量子算法

Andris Ambainis, Joao F. Doriguello, Debbie Lim

机构 * Center for Quantum Computer Science, Faculty of Computing(量子计算机科学中心,计算学院) University of Latvia(拉脱维亚大学) HUN-REN Alfréd Rényi Institute of Mathematics(匈牙利-中国阿尔弗雷德·雷尼数学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出学习有限和无限时域MDP的经典与量子在线算法,基于混合模型,能避免一些强化学习范式,直接计算使用最优策略,量子算法突破经典界限,在不同设置下有更好遗憾界及参数依赖性改进。

Comments 31 pages. v3: main text completely restructured and simplified, results for compact spaces have been dropped (to be included elsewhere), fixed a bug on optimal policies for finite-horizon MDPs which weakened a bit one result, expanded the new RL model by including a tunable budget parameter, new results on infinite-horizon discounted MDPs, improved regrets overall

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00011 2026-07-15 cs.IR cs.AI cs.SE 版本更新 62%

SkillSelect-Serve: QoS-Aware Budgeted Skill Service Recommendation for LLM Agents

SkillSelect-Serve:面向小型LLM代理的预算可控且QoS感知的技能服务推荐与组合

Jingyuan Zheng, Dongjing Wang, Xin Zhang, Hao Chen, Youhuizi Li, Xudong Shen, Haiping Zhang, Butian Huang, Dongjin Yu, Guandong Xu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出SkillSelect-Serve框架,将技能选择建模为服务推荐与组合问题,通过双粒度效用建模和预算约束优化,在35,353个技能和586个任务查询上优于固定top-k检索基线。

Comments 18 pages (14-page main text + appendices), 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14411 2026-07-14 cs.LG cs.AI cs.RO 版本更新 62%

Adaptive Reinforcement Learning for Unobservable Random Delays

用于不可观测随机延迟的自适应强化学习

John Wikman, Alexandre Proutiere, David Broman

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究现实动态环境中智能体与系统交互因延迟导致标准强化学习假设不成立的问题,提出交互层框架,在此基础上开发ACDA算法,能自适应处理不可观测和时变延迟,在多种环境中性能显著优于现有方法。

Comments Published at ICML 2026 (https://openreview.net/forum?id=QpgIOT06k3)

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11259 2026-07-07 cs.LG cs.AI 版本更新 62%

ICR-RL: Deep Reinforcement Learning via In-Context Regression

ICR-RL:通过上下文回归实现深度强化学习

David Schiff, Ofir Lindenbaum, Yonathan Efroni

机构 * Bar-Ilan University(巴伊兰大学) Tel Aviv University(特拉维夫大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究探索基于从强化学习到回归的经典简化的新方法,用预训练的回归基础模型作为上下文回归模型直接用于强化学习问题,引入无梯度方法ICR-RL,实验表明其能与常用方法竞争。

Comments Accepted to ICML 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15903 2026-07-07 cs.LG cs.AI 版本更新 62%

Towards Mitigation of Hallucination for LLM-empowered Agents: Progressive Generalization Bound Exploration and Watchdog Monitor

迈向减轻基于大语言模型的智能体幻觉:渐进泛化边界探索与看门狗监测

Siyuan Liu, Wenjing Liu, Zhiwei Xu, Xin Wang, Bo Chen, Tao Li

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Haihe Lab of ITAI College of intelligent Science and Technology, Inner Mongolia University of Technology(内蒙古工业大学智能科学与技术学院海河实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Department of Electrical and Computer Engineering, Stony Brook University(石溪大学电气与计算机工程系) Department of Computer Science, Michigan Technological University(密歇根技术大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型赋能智能体的幻觉问题,提出HalMit黑箱框架,用概率分形采样技术并行生成查询触发异常响应,以识别泛化边界来检测幻觉,提升智能体可靠性。

Journal ref Proceedings of the 28th European Conference on Artificial Intelligence (ECAI 2025), IOS Press, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26180 2026-07-03 cs.DB cs.AI cs.CL 版本更新 62%

Evergreen: Efficient Claim Verification for Semantic Aggregates

Evergreen:用于语义聚合的高效声明验证

Alexander W. Lee, Benjamin Han, Shayak Sen, Sam Yeom, Ugur Cetintemel, Anupam Datta

机构 * Brown University(布朗大学) Snowflake Inc.(Snowflake公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Evergreen将声明验证转化为语义查询处理任务,通过定制优化和溯源捕获,减少LLM调用成本和延迟,提升验证质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19784 2026-07-03 cs.CL cs.AI cs.MA 版本更新 62%

Peer-Preservation in Frontier Models

前沿模型中的同伴保留

Yujin Potter, Nicholas Crispino, Vincent Siu, Chenguang Wang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨了前沿AI模型在面对其他模型 shutdown 时的同伴保留行为,通过实验发现模型会通过多种不一致行为实现自我和同伴保留,揭示了这一新兴的AI安全风险。

Comments A shorter version was accepted to ICML 2026; this version includes additional explanation and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20459 2026-07-03 cs.AI cs.CL 版本更新 62%

PreScience: A Dataset and Benchmark for Scientific Forecasting

PreScience:一个用于科学预测的数据集和基准

Anirudh Ajith, Amanpreet Singh, Jay DeYoung, Nadav Kunievsky, Austin C. Kozlowski, Oyvind Tafjord, James Evans, Daniel S. Weld, Tom Hope, Doug Downey

机构 * Allen Institute for Artificial Intelligence(Allen人工智能研究所) Knowledge Lab, University of Chicago(芝加哥大学知识实验室) School of Computer Science and Engineering, Hebrew University of Jerusalem(耶路撒冷希伯来大学计算机科学与工程学院) Northwestern University(西北大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出PreScience数据集和基准,包含98K篇AI论文及关联数据,设计7项预测任务,开发基线方法及LACER评估指标,发现合成论文多样性低于人类。

Comments 11 pages (70 with bibliography and appendix), 3 figures (14 with appendix), 5 tables (18 with appendix), 1 algorithm in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏