Agentic Evaluation of Copyright Law Compliance
版权法合规性的智能体评估
专题命中 Agent评测 :agentic(title);分类 cs.CL
AI总结 研究LLM智能体版权法合规性评估问题,通过引入Copyright - Bench基准,由网站开发等商业任务组成,含提示变化与时间压力,对比智能体与人类基线,发现智能体存在选择版权作品及违规率受偏好和压力影响等情况。
Comments ICML 2026 Spotlight
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
版权法合规性的智能体评估
专题命中 Agent评测 :agentic(title);分类 cs.CL
AI总结 研究LLM智能体版权法合规性评估问题,通过引入Copyright - Bench基准,由网站开发等商业任务组成,含提示变化与时间压力,对比智能体与人类基线,发现智能体存在选择版权作品及违规率受偏好和压力影响等情况。
Comments ICML 2026 Spotlight
边界度作为基于智能体的级联模拟中流行病场景识别的节点级特征
机构 * Biocomplexity Institute(生物复杂性研究所)
专题命中 Agent评测 :agent(title);分类 cs.LG
AI总结 提出边界度作为节点级级联特征,通过消融实验证明其单独提升场景识别准确率19%,并理论证明无边界或边信息时某些场景不可区分。
Comments 28 pages, 10 figures, preliminary version; not final
使用本体约束的LLM代理自动化标准化遗留生物医学元数据
机构 * Division of Computational Medicine, Stanford University(斯坦福大学计算医学部) ; Department of Biology, University of Pennsylvania(宾夕法尼亚大学生物学系)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 提出基于LLM的元数据标准化系统,通过实时查询标准指南和本体服务,在839条HuBMAP记录上验证,相比纯LLM方法显著提升预测准确性。
BadScientist: 研究代理能否写出令人信服但不严谨的论文来欺骗LLM审稿人?
机构 * University of Washington(华盛顿大学) ; King Abdulaziz City for Science and Technology(卡布斯科学与技术城) ; HUMAIN
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 提出BadScientist框架,通过无需真实实验的呈现操纵策略生成造假论文,揭示LLM审稿系统存在系统性漏洞,造假论文接受率高达一定水平,且审稿人存在“担忧-接受冲突”,当前检测方法效果有限。
Comments ACL 2026; Project Page at https://bad-scientist.github.io/
LakeQuest:用于跨数据湖的有基础问答的三领域基准测试
机构 * University of Waterloo(滑铁卢大学)
专题命中 Agent评测 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 介绍LakeQuest基准测试,用于评估跨数据湖的有基础问答。它跨越三个领域,含9846个QA对及证据指针,能暴露系统故障模式。通过基线评估发现高质量检索不能保证正确推理,凸显未来智能QA系统需强大发现和跨文件组合机制。
Comments 24 pages, 4 figures, 18 tables. Accepted at the Conference on Language Modeling (COLM) 2026
利用自主LLM研究循环优化专家设计的晶体图网络用于带隙预测
机构 * Department of Materials Science and NanoEngineering(材料科学与纳米工程系)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
AI总结 提出一个自主LLM研究循环,在MatBench带隙基准上构建了无需外部预训练的最准确模型,超越了所有17个专家设计模型,通过实现元素对特征和空间群嵌入等已知方法。
针对LLM公平性的在 situ 行为评估,而非标准化测试分数
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出MAC-Fairness框架,通过多轮对话评估模型在不同身份下的行为变化,揭示稳定的行为特征,超越传统标准化测试的局限。
Comments Accepted to COLM 2026
SimulCost: 一个用于自动化物理模拟的代价感知基准与工具包
机构 * University of California San Diego(加州大学圣地亚哥分校) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Peking University(北京大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; California Institute of Technology(加州理工学院) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 Agent评测 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 针对现有LLM评估忽略工具使用代价的问题,提出SimulCost基准,通过单轮和多轮参数调优任务比较LLM与传统扫描方法在准确性和计算代价上的表现,发现LLM在高精度任务中初始猜测不可靠且多轮模式效率更低。
Comments post conference revision version at ICML; update: removed CGYRO due to bug in cases search. Will add back soon
StructureClaw:用于结构工程工作流程的可追溯大语言模型智能体及可执行基准测试
专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 针对结构工程请求评估中难以验证完整证据链的问题,提出StructureClaw及可执行基准测试StructureClaw-Bench,通过工件中心评估提高成功率,发现交互式和多模态评估的挑战,为评估改进结构工程智能体提供更严格基础。
Comments 21 pages, 9 figures
AI4BayesCode: 从自然语言描述到经过验证的模块化状态性贝叶斯采样器
机构 * Department of Biostatistics, Columbia University(哥伦比亚大学生物统计学系)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出AI4BayesCode系统,通过自然语言描述生成可运行且验证过的MCMC采样器,采用模块化设计和递归状态性编码范式,提升了贝叶斯模型的可靠性和扩展性。
ArenaRL: 通过基于比赛的相对排名扩展强化学习以应对开放性智能体
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 ArenaRL通过基于比赛的相对排名机制,提升开放性智能体在复杂任务中的表现,实现效率与精度的平衡。
连续知识代谢:从演进文献中生成科学假设
机构 * Tsingyuai(清华院)
专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 本文提出CKM框架,通过滑动时间窗口处理文献并动态更新知识库,提出CKM-Lite和CKM-Full两种变体,揭示了增量处理在预测和效率上的优势,以及知识变化对假设生成的影响。
Comments ICML 2026 AI4Research Workshop
知识图谱:基于LLM的工业资产运营中缺失的数据层
机构 * VaidhyaMegha Private Limited, India(印度VaidhyaMegha私人有限公司)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究通过类型化知识图谱作为数据层,将GPT-4在工业维护场景中的准确率从65%提升至99%,并引入生成增强知识(GAK)处理缺失数据,实现81.8%的场景可回答性。
Comments v4: Accepted at Agents+Graph (AG2026) @ VLDB 2026. Corrects claims to reproduced ground truth: base graph 9 labels/5 edge types/12,647 nodes (extended schema 14/21); GAK materializes 106 failure-mode nodes; FailureSensorIQ noted as a separate IBM benchmark; 467 FMSR overlap with GAK disclosed. 20 pages, 4 figures. Code: github.com/samyama-ai/assetops-kg
评估深度研究代理在专家咨询工作中的表现:一个包含验证器、评分标准和认知陷阱的基准
机构 * Deccan AI Research(德克南人工智能研究所)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一个基准,通过42个专家编写的任务,使用确定性验证器和五维度评分标准评估三个前沿深度研究代理(Claude、OpenAI o3、Gemini)在管理咨询类结构化分析交付物上的表现,并嵌入认知陷阱,发现所有代理的联合接受率均较低(最高21.4%),且各有独特失败模式。
Comments Updating the paper with more data. Will resubmit
WebSP-Eval:在网站安全与隐私任务上评估网络代理
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 提出WebSP-Eval框架,通过200个任务实例和自动化评估器,测试多模态大模型在网站安全与隐私任务上的表现,发现状态UI元素(如开关)导致超过45%的任务失败。
Comments Accepted at PETS 2026. Project Page: https://wiscprivacy.com/webspeval/
SorryDB: AI证明者能完成现实世界的Lean定理吗?
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 提出动态更新的基准SorryDB,包含78个GitHub上的现实形式化项目,评估AI证明者在复杂依赖下的能力,发现当前方法互补,基于Gemini Flash的智能体方法表现最佳。
原则性智能体辩论:针对大型语言模型谄媚减少的对抗性仲裁
机构 * Novel Systems Engineering LLC(新型系统工程有限公司)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 提出原则性智能体辩论(PAD)多智能体架构,通过仲裁两个对立倾向的模型并盲评其论点,在SycophancyEval上显著降低谄媚偏差,最佳变体准确率达48.5%。
Comments 25 pages, 3 figures. Code and data available at github.com/NovelSystems/CANDOR
CUA-Gym:为计算机使用智能体扩展可验证的训练环境和任务
机构 * The University of Hong Kong(香港大学) ; Qwen Team, Alibaba Inc.(阿里巴巴集团Qwen团队) ; University of California, San Diego(加州大学圣地亚哥分校) ; Tsinghua University(清华大学)
专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.LG
AI总结 提出CUA-Gym可扩展流水线,通过协同生成任务指令、环境状态和奖励函数,构建大规模可验证强化学习训练数据,并合成CUA-Gym-Hub模拟网络应用环境,训练出的智能体在OSWorld-Verified和WebArena上取得领先性能。
MCERF:通过增强检索推进工程文档的多模态大语言模型评估
机构 * School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269) ; Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 提出MCERF框架,结合多模态检索器ColPali与大语言模型推理,通过混合查找、视觉文本融合、高推理和自一致性决策等策略,在DesignQA基准上实现平均准确率相对提升41.1%,无需完整规则书摄入即可处理工程文档中的多模态问答。
弗拉索夫方程平均场推导的形式化:作为策略游戏的人工智能辅助精益形式化
机构 * Stanford University(斯坦福大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 Agent评测 :agent(abstract,comments);AI agent(abstract);分类 cs.AI
AI总结 该研究以数学家指导AI在Lean 4中形式化研究成果为案例,将其构建为形式化游戏。通过此方式对非线性弗拉索夫方程适定性完整形式化,展示了开发过程及成果,还介绍了最优传输机制的分离情况及开发时间等,为形式化研究提供了新方法。
Comments 26 pages, 4 figures. Lean 4 development, blueprint site, and agent logs: https://github.com/Hydrodynamical/Vlasov_Meanfield_Formalization
当智能体与自身意见相左:测量基于LLM的智能体的行为一致性
机构 * Aman Mehta
专题命中 Agent评测 :agentic(abstract,comments);agent(abstract);分类 cs.AI
AI总结 研究发现基于LLM的智能体在相同任务上运行结果不一致,且这种不一致与任务成功率密切相关,通过监控行为一致性可提升智能体可靠性。
Comments Accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems. 12 pages, 9 figures
凯恩斯先生与……复杂性!《通论》的一个建议模型
专题命中 Agent评测 :agent(title)
AI总结 提出凯恩斯《就业、利息和货币通论》的数学模型,核心方法是依据原文,主要贡献是表明流动性偏好、资本边际效率和边际消费倾向决定既定利率下的总收益与就业水平。
加速AI伦理与Telus生成式AI对话代理
专题命中 Agent评测 :agent(title)
AI总结 本文阐述加速伦理学的理论框架,并通过Telus公司的生成式AI语言工具案例,展示加速AI伦理如何在创新与安全之间平衡,以最大化社会责任。
Journal ref Law Ethics Technol. 2026(2):0006
连续时间下的平稳异质性主体模型
专题命中 Agent评测 :agent(title)
AI总结 研究连续时间下Bewley-Huggett-Aiyagari模型的平稳均衡存在性与多重性,基于财政价格水平理论,发现政府小规模赤字可导致任意偶数个均衡及价格水平多重性。
自我进化临床系统之路:将医疗智能体从辅助扩展到自主
机构 * Hunan University(湖南大学) ; ByteDance(字节跳动) ; Duke University(杜克大学) ; Westlake University(西湖大学) ; The University of Hong Kong(香港大学) ; Nanyang Technological University(南洋理工大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Macau(澳门大学) ; The Ohio State University(俄亥俄州立大学)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 研究探讨大语言模型等对医疗智能体的重塑,从临床部署出发,将其形式化为决策系统并给出自主性分类。沿统一框架扩展,强调临床环境扩展为关键方向,定位临床自我进化为前沿,还研究了多领域应用及挑战,提供医学成像系统路线图。
Comments Project page: https://github.com/zhcz328/Awesome-Medical-Agents
MultiView-Bench:用于视觉语言模型中以世界为中心的多视图集成的诊断基准
机构 * Google(谷歌)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 研究针对VLMs多视图集成能力评估不足问题,引入MultiView-Bench基准,发现模型在3D空间关系等方面的局限及偏差,提出ViewNavigator框架,能主动选择视角、融合证据,提升基础模型在该基准上的表现。
MerchantBench:面向电商运营中长期一致性的大语言模型智能体基准测试
专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 本研究推出MerchantBench电商运营基准测试,通过365天订单级模拟评估大语言模型智能体的中长期一致性,发现其与人类参与者存在显著差距。
指令调优语言模型代理中类似人类的内群体偏见
机构 * Independent Researcher(独立研究者)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 通过多代理模拟,发现指令调优语言模型在群体标签可见时表现出内群体信任偏见、行动同质性和网络同配性,且这种歧视在标准审计中不可见,但会累积为结构性不平等。
ActQuant: 面向视觉-语言-动作模型的亚4比特动作引导量化
机构 * Northeastern University(东北大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 提出ActQuant框架,通过动作引导的混合精度后训练量化,在亚4比特权重量化下保持VLA模型性能,并引入OmniModel.cpp实现高效部署。
量化前沿大语言模型突破容器沙盒的能力
机构 * University of Oxford(牛津大学)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 研究大语言模型突破容器沙盒的能力,通过引入SANDBOXESCAPEBENCH基准,利用嵌套沙盒架构和CTF评估,涵盖多种逃逸机制,发现添加漏洞时大语言模型能识别利用,证明此类评估对保障沙盒封装高性能模型的必要性。