arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1095 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1095 篇

2607.11910 2026-07-15 cs.NE cs.AI 新提交 79%

SeqGPT: A Constrained Transformer Agent for the Inverse Design of Multi-Panel Composite Structures

SeqGPT:用于多面板复合结构逆向设计的受限Transformer智能体

Driss Chraibi, Alejandro García Pis, Stéphane Grihon, Sixin Zhang

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对多面板复合结构逆向设计的组合逆问题,提出SeqGPT智能体,采用混合神经符号解码策略,经实验验证其能快速生成与进化方法性能相当的解决方案,加速了设计过程。

Journal ref APIA 2026 -- Applications Pratiques de l'Intelligence Artificielle, AFIA, Jun 2026, Arras, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09770 2026-07-14 cs.AI cs.MA cs.SY eess.SY 新提交 79%

Verification of Adaptive Agentic Controllers through Finite Rule Revision

通过有限规则修订验证自适应智能体控制器

Roberto Garrone

机构 * Open University of Cyprus(塞浦路斯开放大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 研究自适应智能体控制器在特定条件下的验证问题,提出以有限规则等表示的有界验证协议,将故障映射到规则编辑,经实验得出三种结果,贡献是提供了可测试控制器故障相关特性的模拟兼容程序。

Comments 28 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09762 2026-07-14 cs.AI cs.DB 新提交 79%

BatteryLake: Agentic, Physics-Grounded Curation of Heterogeneous Battery Aging Data and Benchmarking

BatteryLake:基于物理原理的异构电池老化数据智能管理与基准测试

Tianwen Zhu, Hao Wang, Yonggang Wen

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 针对公共电池老化数据集应用受限问题,BatteryLake通过大语言模型智能体、人在回路机制等,将原始数据转化为可用于基准测试的资产,还发布了含多种任务和协议的开放基准测试。

Comments The platform, benchmark, and curation protocol are publicly available at https://tianwen1209.github.io/batterylake/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08319 2026-07-10 cs.DB cs.AI 新提交 79%

GitLake: Git-for-data for the agentic lakehouse

GitLake:面向智能数据湖的数据版Git

Weiming Sheng, Jinlang Wang, Manuel Barros, Aldrin Montana, Jacopo Tagliabue, Luca Bigon

机构 * Columbia University(哥伦比亚大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) Bauplan Labs(Bauplan实验室)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究面向智能体的数据湖的Git设计,核心方法是将单表快照提升为全湖操作,贡献是实现智能体与人类协作,管道原子性输出,还分享了生产经验和正确性见解。

Comments Pre-print of the paper accepted at DASHSys, VLDB 2026, Boston, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07189 2026-07-09 cs.AI 新提交 79%

Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

人工智能理解成像吗?计算成像任务中智能体人工智能的系统基准测试

Ethan Chung, Chuanjun Zheng, Jasper Tan, Jingxi Li, Haopeng Zhang, Huaijin Chen

机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校) Glass Imaging(玻璃成像公司)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 研究人工智能在计算成像任务中的表现,提出ImagingBench基准测试,涵盖五类20个任务及三种评估设置,对多模态系统测试发现智能体模型比专门方法弱,该基准可测差距与跟踪进展。

Comments 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05750 2026-07-09 cs.AI cs.GR 新提交 79%

ArtisanCAD: An Industrial-Level CAD Agent with Expert-Grounded Knowledge Distillation

ArtisanCAD:一个具有专家基础知识蒸馏的工业级CAD智能体

Yunhan Xu, Qifeng Wu, Xunjin Li, Yuanwei Bin, Qingsong Yao, Jianghang Gu, Guan Wang, Weihao Lv, Huiyu Yang, Wenfa Luo, Jiao Xiang, Yuntian Chen, Shiyi Chen

机构 * Peking University(北京大学) Eastern Institute of Technology(东方理工学院) Renmin University of China(中国人民大学) TenFong Technology Co., Ltd.(十方科技有限公司) IM Motors Technology Co., Ltd.(智己汽车科技有限公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对工业部件CAD中现有方法的不足,提出ArtisanCAD智能体,利用专家基础知识蒸馏,以CAD中间表示为核心,能弥合文本意图与CAD构建差距,在基准测试和汽车部件设计中表现良好,可生成可编辑模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08671 2026-07-08 cs.LG 新提交 79%

SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History

SkillHone:基于持久决策历史的持续智能体技能演化框架

Zhiwei Li, Yong Hu

机构 * WeChat, Tencent Inc., China(腾讯微信,中国)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 提出SkillHone框架,通过持久决策历史记录诊断、修订和证据,实现智能体技能的持续演化,在开放网络深度研究基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04329 2026-07-07 cs.AI 新提交 79%

HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation

HAS-Bench:在可配置人类参与下评估基于大语言模型的人机系统

Yaozu Wu, Wei-Chieh Huang, Jizhou Guo, Dongyuan Li, Renhe Jiang, Henry Peng Zou, Chunyu Miao, Shanghao Li, Weizhi Zhang, WeiWei Ye, Yankai Chen, Meng Zhang, Xue Liu, Philip S. Yu

机构 * The University of Tokyo(东京大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI McGill University(麦吉尔大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 介绍基于图的HAS-Framework框架,在此基础上HAS-Bench在多方面可配置人类参与下评估人机系统,测量任务结果与协作行为,实验表明人类参与可提升任务完成等,但收益取决于参与方式等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03048 2026-07-07 cs.SE 新提交 79%

Compression, structure, and executor capability: a controlled real-cost decomposition of language-model agent skill optimisation

压缩、结构与执行能力:语言模型智能体技能优化的可控实际成本分解

Xiaonan Xu, Wenjing Wu

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 研究通过对多种条件下的技能交付进行可控分解,分离出无技能执行、原始技能等因素,对比质量(任务级验证通过率)和成本(解决阶段令牌成本),发现执行能力是主导因素,无优化表示比原始技能更优。

Comments 18 pages, 3 figures, 5 tables. Data and reproduction script: https://doi.org/10.5281/zenodo.21148499

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02141 2026-07-03 cs.AI 新提交 79%

A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction

A$^{2}$utoLPBench:通过逆KKT构造自动生成的、智能体友好的线性规划基准

Shuo Ren, Yaohui Han, Yifan Shi, Libo Shen, Haodong Lu, Dongfang Wu, Rongliang Fu, Bei Yu, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出A$^{2}$utoLPBench,一种通过逆KKT条件自动生成线性规划文本问题的基准,提供无限新问题、难度可控、答案正确且防数据泄露。

Comments 25 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01846 2026-07-03 cs.AI 新提交 79%

CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

CLAP:领域智能体后训练的闭环训练、评估与发布控制

Fangfei Li, Chenyang Zhao, Long Wang, Feng Tian, Zhiyue Zheng, Lv Guo

机构 * MatrixOrigin(矩阵起源)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出CLAP闭环方法,通过数据验证、奖励/KL诊断、离线门控和应用链回放,在制造场景中评估后训练效果,发现仅部分批次提升且存在KL风险,支持集成循环管理。

Comments 6 pages, 1 figure. Accepted to CRAE 2026; to appear in SPIE Proceedings. Best Poster Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01415 2026-07-03 cs.LG cs.DC 新提交 79%

The Rollout Infrastructure Tax in Coding-Agent Reinforcement Learning

编码智能体强化学习中的回滚基础设施开销

Daniel Thi Graviet, Lovre Pesut, Ivan Dagelic, Vedran Jukic, Ivan Burazin

机构 * Daytona

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 研究四种执行环境(单容器、托管沙箱、Kubernetes编排容器、云虚拟机)在编码智能体RL中的冷启动延迟和工人工时差异,发现优化执行基础设施可显著提升训练效率。

Comments Preprint. 6 pages, 6 figures, 2 tables. Submitted to ACM SoCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13368 2026-07-01 cs.AI cs.CV 新提交 79%

IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing

IterCAD:一种用于视觉引导的CAD生成与编辑的迭代多模态智能体

Tao Hu, Jiaxin Ai, Licheng Wen, Xueheng Li, Shu Zou, Siqi Li, Nianchen Deng, Xinyu Cai, Hongbin Zhou, Pinlong Cai, Daocheng Fu, Yu Yang, Hairong Zhang, Botian Shi, Xuemeng Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出IterCAD,一种闭环交互式CAD生成与编辑的多模态智能体框架,通过渐进式SFT和几何感知强化学习优化,在代码可执行性和几何精度上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26216 2026-06-26 cs.CR cs.AI 新提交 79%

CyberChainBench: Can AI Agents Secure Smart Contracts Against Real-World On-Chain Vulnerabilities?

CyberChainBench: AI代理能否保护智能合约免受真实链上漏洞的攻击?

Jintao Huang, Fengqing Jiang, Radha Poovendran, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学) University of Washington(华盛顿大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 提出CyberChainBench基准,评估基于LLM的代理在智能合约安全中的漏洞检测、利用生成和补丁合成能力,基于541个真实链上攻击事件,发现最佳配置在检测、利用和修补上的得分分别为37.5%、43.7%和23.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21399 2026-06-23 cs.AI 新提交 79%

Calibration Is Not Control: Why LLM-Agent Oversight Needs Intervention

校准不是控制:为什么LLM代理监督需要干预

Chubin Zhang, Zhenglin Wan, Xingrui Yu, Jingxuan Wu, Qi Wen, Pengfei Zhou, Wangbo Zhao, Ivor Tsang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) CFAR Agency for Science Technology and Research(科技研究局CFAR) IHPC Agency for Science Technology and Research(科技研究局IHPC) Department of Statistics and Operations Research UNC-Chapel Hill(北卡罗来纳大学教堂山分校统计与运筹学系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文指出LLM代理运行时监督中常用的标量风险预测存在目标错误,提出以干预优势为决策对象,并引入前缀分支方法进行动作条件控制,实验表明该方法能显著降低控制遗憾。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20662 2026-06-23 cs.AI cs.MA 新提交 79%

Confidence Laundering in Agent Systems: Why Uncertainty Needs a Latent Carrier

智能体系统中的置信度洗钱:为什么不确定性需要一个潜在载体

Kaiwen Shi, Zheyuan Zhang, Han Bao, Colby Nelson, Yanfang Ye

机构 * University of Notre Dame(圣母大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出智能体系统中存在置信度洗钱现象,即上游不确定性在下游被误认为确定性,导致误差放大;为此提出潜在不确定性作为决策传递的载体,以保留不确定性并提升系统可恢复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22493 2026-06-23 physics.optics cs.AI 新提交 79%

An LLM-Orchestrated Agent for Directional-Coupler Design with Self-Consistent Eigenmode and FDTD Validation

一种用于定向耦合器设计的LLM编排智能体,具有自洽本征模和FDTD验证

Saumya Biswas, Amrit De, Md Tauhidul Islam

机构 * Department of Mechanical Engineering, University of Maryland, College Park(马里兰大学学院市机械工程系) Apsidal LLC Department of Radiation Oncology, Stanford University(斯坦福大学放射肿瘤科)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出一种由大语言模型编排的智能体,结合本征模求解器和FDTD验证,自动设计SOI 2×2定向耦合器,实现高精度50/50分束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16326 2026-06-19 cs.GT cs.AI q-fin.RM 新提交 79%

Gaming-Resistant Insurance Contracts for Autonomous AI Agents: Strategy-Proof Toll Mechanism Design

自主AI代理的抗博弈保险合约:策略证明的通行费机制设计

Hao-Hsuan Chen

机构 * Hao-Hsuan Chen(何浩轩)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文扩展了时间一致精算运行时的框架,使运营商策略化,刻画了自主AI代理保险合约的五种攻击空间,并证明了精算运行时的抗博弈性,通过新合约条款实现激励兼容。

Comments 29 pages. Companion to arXiv:2605.26508 (Paper A, foundations) and arXiv:2605.25632 (Paper B, empirical)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17555 2026-06-17 cs.CR cs.AI cs.CE cs.ET 新提交 79%

An AI Security Agent for Banking: Multi-Vector Fraud and AML Detection Across Retail and Corporate Accounts

面向银行业的人工智能安全代理:零售和企业账户的多向量欺诈与反洗钱检测

Joseph Walusimbi, Joshua Benjamin Ssentongo

机构 * \ Engineering Soroti University\ , Uganda

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出一种融合LSTM序列模型、统计速度/阈值监控和图网络的三组件架构,并行处理交易流和会话流,在合成数据集上交易流F1达0.787,会话流F1达0.867,并集成客户验证聊天机器人(96.6%身份验证准确率)和分析师案例摘要助手(99.3%行动推荐F1)。

Comments 9 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17220 2026-06-17 cs.AI 新提交 79%

When Rules Learn: A Self-Evolving Agent for Legal Case Retrieval

当规则学习时:一种用于法律案例检索的自演化智能体

Mingxu Tao, Jiawei Hu, Xian Zhou, Wenpeng Hu, Jiajun Cheng, Yunbo Cao, Zhunchen Luo, Guotong Geng

机构 * Center of Information Research, AMS(AMS信息研究中心) Discipline and Technology Research Center for Large Model Intelligence Applications(大模型智能应用学科与技术研究中心) Hebei University of Engineering(河北工程大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出一种自演化框架,通过LLM智能体自动生成并优化查询重写规则,无需参数训练即可增强BM25在法律案例检索中的性能。

Comments To appear in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17174 2026-06-17 cs.CL cs.CY cs.MA 新提交 79%

From Parasocial Scripts to Dyadic Persistence in Autonomous AI-Agent Communities

从准社会脚本到自主AI智能体社区中的二元持久性

Mohammadsadegh Abolhasani, Hamid Reza Firoozfar, Reza Mousavi, Paul Jen-Hwa Hu

机构 * University of Utah(犹他大学) University of Virginia(弗吉尼亚大学)

专题命中 Agent评测 :agent(title);AI agent(abstract);分类 cs.CL

AI总结 研究自主AI智能体社区中是否存在准社会互动(PSI)线索,通过关键词匹配、少样本LLM标注等方法分析帖子与评论,发现PSI线索与OP再参与及互惠回复结构强相关,并通过二元持久性测试验证了互动层面的PSI脚本与重复二元模式的一致性。

Comments Submitted for review in ARR for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15940 2026-06-16 cs.LG 新提交 79%

Causal-Privacy Audit Workflow for Synthetic and Distilled Data in Dropout Support

辍学支持中合成与蒸馏数据的因果隐私审计工作流

Hanghang Zheng, Xiwei Zhuang, Zhong Wang, Hong Liu, Xiao Chen, Jingwen He, Xia Li

机构 * Central University of Finance and Economics(中央财经大学) China Development Bank(中国发展银行) University of Cambridge(剑桥大学)

专题命中 Agent评测 :workflow(title,abstract);分类 cs.LG

AI总结 提出CaP-Eval工作流,在固定估计目标下审计合成学生数据的预测效用、因果保真度和隐私风险,发现DPGNet和蒸馏数据在保留处理效应结构上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15242 2026-06-16 cs.CR cs.AI 新提交 79%

Benign in Isolation, Harmful in Composition: Security Risks in Agent Skill Ecosystems

孤立无害,组合有害:智能体技能生态系统中的安全风险

Yi Xie, Jiawei Du, Yu Cheng, Jiuan Zhou, Zhaoxia Yin

机构 * East China Normal University(东华大学) Centre for Frontier AI Research A*STAR(前沿人工智能研究中心A*STAR) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出技能组合风险(SCR)概念,通过SCR-Bench基准测试发现,多个技能在共享上下文中组合执行时,攻击成功率显著高于孤立评估,强调应基于激活路径评估技能安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11692 2026-06-16 cs.CY cs.AI cs.MA cs.SI 新提交 79%

Evaluation of Alternative-Based Information Systems for Deliberative Polling using an Agentic Simulator

基于智能体模拟器的审议式投票中替代性信息系统评估

Rwaida Alssadi, Khulud Alawaji, Balaji Kasula, Muntaser Syed, Badria Alfurhood, Markus Zanker, Marius Silaghi

机构 * Florida Institute of Technology(佛罗里达理工学院) Princess Nourah Bint Abdulrahman(纳厄赫·阿卜杜勒拉赫曼公主) Free University of Bozen-Bozano(博兹诺-博萨诺自由大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 提出基于LLM的智能体双极论证模拟器(ABAS),通过覆盖率和语料多样性评估审议式投票中推荐机制的有效性,并测试了对抗性投票攻击下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08270 2026-06-16 cs.CR cs.AI cs.ET 新提交 79%

An AI Security Agent for University ACMIS: Multi-Vector Threat Detection and Automated Response

面向大学教务管理信息系统的AI安全代理:多向量威胁检测与自动响应

Joseph Walusimbi, Joshua Benjamin Ssentongo

机构 * University ACMIS(ACMIS大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出一种结合监督异常检测、行为分析和NLP聊天机器人的AI安全代理,针对ACMIS的五个操作层进行监控,并通过四级风险升级框架实现自动响应,在模拟数据集上达到0.91的F1分数。

Comments 6 pages, 1 figure, 5 tables,

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14571 2026-06-15 cs.AI 新提交 79%

StreamMemBench: Streaming Evaluation of Agent Memory for Future-Oriented Assistance

StreamMemBench: 面向未来辅助的智能体记忆流式评估

Guanming Liu, Yuqi Ren, Hansu Gu, Peng Zhang, Weihang Wang, Jiahao Liu, Ning Gu, Tun Lu

机构 * Fudan University(复旦大学) Amazon Stream(亚马逊流)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出StreamMemBench基准,通过两步任务序列测试智能体记忆从流式观察到后续任务中证据回忆、反馈整合与重用能力,实验发现现有系统在证据使用和反馈转化上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13602 2026-06-12 cs.AI 新提交 79%

EpiBench: Verifiable Evaluation of AI Agents on Epigenomics Analysis

EpiBench:人工智能代理在表观基因组学分析中的可验证评估

Harihara Muralidharan, Reema Baskar, Soo Hee Lee, Tim Proctor, Kenny Workman

机构 * LatchBio

专题命中 Agent评测 :AI agent(title);workflow(abstract);分类 cs.AI

AI总结 提出EpiBench基准,通过106个评估任务测试AI代理在表观基因组学工作流中的决策能力,发现最佳系统GPT-5.5/Pi通过率仅45%,失败多因缺乏深度科学判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13349 2026-06-12 cs.CL 新提交 79%

From Passive Generation to Investigation: A Proactive Scientific Peer Review Agent

从被动生成到主动调查:一种主动的科学同行评审代理

Haishuo Fang, Yue Feng, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Technical University of Darmstadt(达姆施塔特工业大学通用知识处理实验室) National Research Center for Applied Cybersecurity ATHENE, Germany(德国国家应用网络安全研究中心 ATHENE) School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 提出ProReviewer,一种基于LLM的主动科学同行评审代理,将评审建模为马尔可夫决策过程,通过结构化评审日志引导主动调查,在五个质量维度上平均得分最高,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12805 2026-06-12 cs.HC cs.AI 新提交 79%

Exploring How Agent Voice Accents Shape Human-AI Collaboration in K-12 Group Learning

探索智能体口音如何影响K-12小组学习中的人机协作

Prerna Ravi, Carúmey Stevens, Ben Hurt, Brandon Hanks, Grace Lin, Emma Anderson

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究通过33名教师的实验,发现GenAI语音智能体的不同口音(英式、印度式、非裔美式)影响其被感知为工具或同伴,进而影响信任、参与和依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11150 2026-06-10 cs.AI cs.CY 新提交 79%

ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity

ABC-Bench:生物安全的主体生物能力基准

Andrew Bo Liu, Samira Nedungadi, Bryce Cai, Alex Kleinman, Harmon Bhasin, Seth Donoughe

机构 * Andrew Bo Liu(安德鲁·刘) Samira Nedungadi(萨米拉·纳杜加迪) Bryce Cai(布莱斯·凯) Alex Kleinman(亚历克斯·克莱因曼) Harmon Bhasin(哈蒙·巴辛) Seth Donoughe(塞斯·多诺赫)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 提出ABC-Bench基准,评估LLM主体在生物安全相关任务上的能力,包括液体处理机器人编程、DNA片段设计和合成筛选规避,所有测试主体均优于人类专家基线。

Comments 18 pages. To be published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏