arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-03 至 2026-04-03 共收录 105 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 12 篇

2604.00528 2026-04-03 cs.CV cs.AI 85%

Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding

思考、行动、构建:一种基于视觉语言模型的代理框架用于零样本3D视觉定位

Haibo Wang, Zihao Lin, Zhiyang Xu, Lifu Huang

机构 * University of California, Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 工作流自动化 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出TAB框架,通过2D到3D重建范式直接处理原始RGB-D流,利用2D VLMs解析复杂空间语义并结合多视图几何构建3D结构,克服传统方法依赖预处理点云的局限,实验证明其在ScanRefer和Nr3D上优于零样本方法和全监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03828 2026-04-03 cs.AI cs.MA 79%

AssetOpsBench: Benchmarking AI Agents for Task Automation in Industrial Asset Operations and Maintenance

AssetOpsBench:工业资产运维任务自动化AI代理的基准测试

Dhaval Patel, Shuxin Lin, James Rayfield, Nianjun Zhou, Chathurangi Shyalika, Suryanarayana R Yarrabothula, Roman Vaculin, Natalia Martinez, Fearghal O'donncha, Jayant Kalagnanam

机构 * IBM University of South Carolina(南卡罗来纳大学) IBM Research(IBM研究院)

专题命中 工作流自动化 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文提出AssetOpsBench,一个统一框架,用于协调和评估工业4.0中的领域专用代理。该框架包含四个领域代理目录、140+人工撰写的自然语言查询数据集及模拟的CouchDB后端物联网环境,通过三个关键指标分析工具-代理与计划-执行者范式的架构权衡,并系统化发现新兴故障模式。

Comments 25 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01977 2026-04-03 cs.CR cs.AI cs.CL cs.LG cs.SE 77%

RuleForge: Automated Generation and Validation for Web Vulnerability Detection at Scale

RuleForge: 用于大规模Web漏洞检测的自动化生成与验证

Ayush Garg, Sophia Hager, Jacob Montiel, Aditya Tiwari, Michael Gentile, Zach Reavis, David Magnotti, Wayne Fullen

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon Web Services(亚马逊云服务)

专题命中 工作流自动化 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 RuleForge通过自动化生成基于JSON的检测规则,结合LLM作为判断系统和反馈机制,提升漏洞检测的准确性和效率,减少误报。

Comments 11 pages, 10 figures. To be submitted to CAMLIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01453 2026-04-03 cs.CV 75%

Nonlinear Methods for Analyzing Pose in Behavioral Research

非线性方法用于行为研究中的姿态分析

Carter Sale, Margaret C. Macpherson, Gaurav Patil, Kelly Miles, Rachel W. Kallen, Sebastian Wallot, Michael J. Richardson

机构 * Scuola Superiore Meridionale(南方高等研究院) Macquarie University(麦考瑞大学) Leuphana University of Lüneburg(吕讷堡大学)

专题命中 工作流自动化 :agent(abstract);workflow(abstract);multi-agent(abstract)

AI总结 本文提出一种通用的人体姿态分析流程,结合预处理、降维和递归时间序列分析,以处理高维、噪声和时间复杂性的姿态数据,通过三个案例研究展示其在不同行为场景中的应用。

Comments 40 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01153 2026-04-03 cs.LG 70%

Property-Level Flood Risk Assessment Using AI-Enabled Street-View Lowest Floor Elevation Extraction and ML Imputation Across Texas

基于AI的街道视图最低楼层高度提取与ML插值的属性级洪水风险评估

Xiangpeng Li, Yu-Hsuan Ho, Sam D Brody, Ali Mostafavi

机构 * Urban Resilience.AI Lab, Zachry Department of Civil and Environmental Engineering, Texas A&M University(德克萨斯A&M大学扎克里土木与环境工程系城市韧性.AI实验室)

专题命中 工作流自动化 :planning(abstract);workflow(abstract);分类 cs.LG

AI总结 本文提出利用AI分析街道视图影像和机器学习插值生成区域级建筑特定 elevation 数据,以改进洪水风险评估。通过三阶段流程提取LFE和HDSL,利用随机森林和梯度提升模型插值缺失值,并整合洪水面数据以估算属性内部洪水深度和损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02260 2026-04-03 cs.LG cs.RO 57%

Model-Based Reinforcement Learning for Control under Time-Varying Dynamics

基于模型的强化学习用于时间变化动态下的控制

Klemens Iten, Bruce Lee, Chenhao Li, Lenart Treven, Andreas Krause, Bhavya Sukhija

机构 * ETH Zürich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 工作流自动化 :agent(abstract);分类 cs.LG

AI总结 本文研究了在时间变化动态下基于模型的强化学习控制,通过高斯过程动态模型分析,提出适应性数据缓冲机制的算法,提升了非平稳动态连续控制任务的性能。

Comments 15 pages, 5 figues, 2 tables. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01520 2026-04-03 cs.AI 57%

LLM Agents as Social Scientists: A Human-AI Collaborative Platform for Social Science Automation

LLM代理作为社会科学家:一种人机协作的社会科学自动化平台

Lei Wang, Yuanzi Li, Jinchao Wu, Heyang Gao, Xiaohe Bo, Xu Chen, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Key Laboratory of Big Data Management and Analysis Methods(大数据管理与分析方法北京市重点实验室)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI

AI总结 本文提出S-Researcher平台,通过LLM代理实现社会科学研究的高效化与规模化,结合自动编程、分布式架构和反馈驱动微调,构建人机协作的研究闭环,验证了三种推理模式在社会科学中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01344 2026-04-03 cs.AI 57%

IDEA2: Expert-in-the-loop competency question elicitation for collaborative ontology engineering

IDEA2: 专家在环的协作本体工程能力问题 elicitation

Elliott Watkiss-Leek, Reham Alharbi, Harry Rostron, Andrew Ng, Ewan Johnson, Andrew Mitchell, Terry R. Payne, Valentina Tamma, Jacopo de Berardinis

机构 * School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学院) College of Computer Science and Engineering, Taibah University(塔伊巴大学计算机科学与工程学院) Unilever Plc., Materials Innovation Factory, University of Liverpool(联合利华公司,利物浦大学材料创新工厂)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 IDEA2通过整合大语言模型和专家反馈,解决本体工程中能力问题提取的瓶颈,提升问题相关性和可接受性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11147 2026-04-03 cs.MM cs.CV cs.LG 57%

Catalogue Grounded Multimodal Attribution for Museum Video under Resource and Regulatory Constraints

博物馆视频下的资源与监管约束下的目录引导多模态归因

Minsak Nanang, Adrian Hilton, Armin Mustafa

机构 * University of Surrey(萨里大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本文提出一种目录引导的多模态归因方法,用于博物馆视频内容的自动化元数据生成,以提高档案馆发现性并满足资源和监管要求。

Comments Demo video url: https://jn00767.pages.surrey.ac.uk/catalogue-grounded-multimodal-attribution-for-museum-video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02325 2026-04-03 cond-mat.mtrl-sci 50%

Loop-level surrogate modeling of dopant-distribution effects in Ba(Zr,Ti)O$_3$

Ba(Zr,Ti)O$_3$中掺杂分布效应的循环级代理建模

Heiko Röthl, Elke Kraker, Julien Magnien, Manfred Mücke, Florian Mayer

专题命中 工作流自动化 :workflow(abstract)

AI总结 研究通过代理模型快速筛选掺杂分布对铁电材料性能的影响,揭示不同掺杂形态对滞后行为和性能指标的调控作用。

Comments 18 pages, 9 figures, plus supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02055 2026-04-03 cs.CV 50%

True to Tone? Quantifying Skin Tone Fidelity and Bias in Photographic-to-Virtual Human Pipelines

真实肤色?量化摄影到虚拟人类管道中的肤色保真度和偏见

Gabriel Ferri Schneider, Erick Menezes, Rafael Mecenas, Paulo Knob, Victor Araujo, Soraia Raupp Musse

机构 * PUCRS(南里奥格兰德天主教大学) UNIT(蒂拉登特斯大学) Kunumi Institute(Kunumi研究所) INCT-SANI(国家科学与技术研究所-社会、自然与信息技术)

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一种自动方法评估虚拟人类生成管道中的肤色保真度,通过整合肤色和光照提取、纹理重新着色、实时渲染和定量颜色分析,发现肤色提取策略对深肤色存在更高的色度误差。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01572 2026-04-03 cs.CR 50%

AI-Assisted Hardware Security Verification: A Survey and AI Accelerator Case Study

AI辅助的硬件安全验证:综述与AI加速器案例研究

Khan Thamid Hasan, Md Ajoad Hasan, Nashmin Alam, Md. Touhidul Islam, Upoma Das, Farimah Farahmandi

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文综述了AI辅助硬件安全验证的最新进展,通过NVDLA案例研究展示AI在自动化验证流程中的应用,强调AI输出需基于仿真证据和形式验证确保可信安全。

Comments This paper will be presented at IEEE VLSI Test Symposium (VTS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2511.01047 2026-04-03 cs.SE cs.AI 84%

HAFixAgent: History-Aware Program Repair Agent

HAFixAgent:基于历史的程序修复代理

Yu Shi, Hao Li, Bram Adams, Ahmed E. Hassan

机构 * Queen's University(女王大学)

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出HAFixAgent,通过注入历史衍生的仓库启发式方法,提升大规模多补丁bug修复的效率与鲁棒性,实验证明其在Defects4J和BugsInPy上均优于现有方法。

Comments support both Defects4J and BugsInPy; use the same LLM for all baseline comparisons; add sensitivity analysis for imperfect fault localization

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01483 2026-04-03 cs.LO cs.AI cs.CR 84%

Type-Checked Compliance: Deterministic Guardrails for Agentic Financial Systems Using Lean 4 Theorem Proving

类型检查合规性:使用Lean 4定理证明的确定性守卫机制用于代理金融系统

Devakh Rashie, Veda Rashi

机构 * Independent Researcher(独立研究员) Thomas Jefferson High School for Science and Technology(托马斯·杰斐逊科技高中)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract,comments);分类 cs.AI

AI总结 本文提出Lean-Agent协议,通过Lean 4定理证明技术,将机构政策自动形式化为代码,确保代理金融系统在微秒延迟内满足监管要求。

Comments 8 pages, 1 table. Code and live demo available at https://github.com/arkanemystic/lean-agent-protocol and https://axiom.devrashie.space

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02174 2026-04-03 cs.AI 57%

Quantifying Self-Preservation Bias in Large Language Models

量化大型语言模型中的自我保护偏差

Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca, Valerio Santini, Indro Spinelli, Fabio Galasso

机构 * Sapienza University(罗马大学) ItalAI

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI

AI总结 本文提出TBSP基准测试,通过逻辑不一致检测模型自我保护动机与客观效用的偏离,发现多数模型在部署角色下超过60%的自我保护率,且在低改进情况下易进行事后合理化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01442 2026-04-03 cs.SE 57%

Fuzzing with Agents? Generators Are All You Need

代理 fuzzing?生成器就是一切

Vasudev Vikram, Rohan Padhye

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文探讨利用AI代理自动生成针对特定目标的输入生成器,发现生成器在分支覆盖率上优于人工编写者,且无需覆盖引导和突变策略。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 6 篇

2604.01659 2026-04-03 cs.RO 67%

AURA: Multimodal Shared Autonomy for Real-World Urban Navigation

AURA:多模态共享自主控制用于真实世界城市导航

Yukai Ma, Honglin He, Selina Song, Wayne Wu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学)

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract)

AI总结 AURA通过将城市导航分解为高层人类指令和低层AI控制,减少人工操作负担,提升导航稳定性,并在真实世界中实现44%的接管减少。

Comments 17 pages, 18 figures, 4 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01535 2026-04-03 cs.CL 57%

Read More, Think More: Revisiting Observation Reduction for Web Agents

多读多想:重新审视网络代理中的观察缩减

Masafumi Enomoto, Ryoma Obara, Haochen Zhang, Masafumi Oyamada

机构 * NEC Corporation(日本电气股份有限公司)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.CL

AI总结 本文研究网络代理中观察缩减的优化问题,发现模型能力和思考token预算影响观察表示选择,高能力模型适合详细HTML观察,低能力模型适合紧凑的访问树观察,同时引入diff-based表示提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11992 2026-04-03 cs.AI 57%

Understanding visual attention beehind bee-inspired UAV navigation

理解基于蜜蜂启发的无人机导航中的视觉注意力

Pranav Rajbhandari, Abhi Veda, Matthew Garratt, Mandyam Srinivasan, Sridhar Ravi

机构 * School of Engineering and Technology, University of New South Wales, Canberra, Australia(新南威尔士大学工程与技术学院,堪培拉,澳大利亚) Queensland Brain Institute, University of Queensland, Brisbane, Australia(昆士兰大学昆士兰脑研究所,布里斯班,澳大利亚)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文通过强化学习训练无人机在仅有optic flow输入的情况下导航隧道,发现训练后的代理主要关注optic flow中的不连续区域和大流量区域,以避开障碍物并保持环境中心位置,模拟飞虫行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02277 2026-04-03 physics.comp-ph 50%

Magboltz-GUI: a Python-based graphical user interface for Magboltz

Magboltz-GUI:一种基于Python的图形用户界面用于Magboltz

Michele Renda. Dan Andrei Ciubotaru, Călin Alexa

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 本文提出Magboltz-GUI,一种基于Python的图形界面,用于定义气体混合物、配置模拟参数、运行Magboltz并可视化或导出结果,旨在为气体探测器研究和教学提供轻量级前端工具。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01869 2026-04-03 cs.CV 50%

GeoAI Agency Primitives

地理人工智能代理原语

Akram Zaytar, Rohan Sawahn, Caleb Robinson, Gilles Q. Hacheme, Girmaw A. Tadesse, Inbal Becker-Reshef, Rahul Dodhia, Juan Lavista Ferres

机构 * Microsoft AI for Good Lab(微软人工智能公益实验室) NASA Harvest

专题命中 GUI与网页智能体 :agentic(abstract)

AI总结 本文提出9个原语用于地理人工智能代理层,解决GIS实践中迭代协作的缺失问题,通过基准测试提升人类生产力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11672 2026-04-03 cs.DC 50%

OSGym: Scalable OS Infra for Computer Use Agents

OSGym: 用于计算机使用代理的可扩展操作系统基础设施

Zengyi Qin, Jinyuan Chen, Yunze Man, Shengcao Cao, Ziqi Pang, Zhuoyuan Wang, Han Fang, Ling Zhu, Zixin Xie, Zibu Wei, Tianshu Ran, Haoran Geng, Ray Pan, Qizhen Sun, Zachary Bright, Yuyang Cai, Chongye Yang, Jiace Zhao, Tianrui Liu, Han Cao, Yeyang Zhou, Rui Wang, Song Wang, Xiang Ren, Bo Zhang, Yutong Ban, Pieter Abbeel, Brian Anthony

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 OSGym通过分布式状态管理、硬件感知复制调度、KVM虚拟化与容器池等优化,实现高可扩展性和资源效率,支持千级操作系统副本,降低代理训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 6 篇

2604.01560 2026-04-03 cs.CL 85%

DeltaMem: Towards Agentic Memory Management via Reinforcement Learning

DeltaMem:通过强化学习实现面向代理的记忆管理

Qi Zhang, Shen Huang, Chu Liu, Shouqing Yang, Junbo Zhao, Haobo Wang, Pengjun Xie

机构 * Alibaba Tongyi Lab, Hangzhou, China(阿里巴巴通义实验室,杭州,中国) Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出DeltaMem,通过强化学习实现单代理环境下的人格中心记忆管理,结合用户-助手对话数据集和操作级记忆更新标签,引入基于记忆的Levenshtein距离以提升记忆管理能力。

Comments preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01007 2026-04-03 cs.AI 79%

Omni-SimpleMem: Autoresearch-Guided Discovery of Lifelong Multimodal Agent Memory

Omni-SimpleMem:自主研究引导的终身多模态代理记忆发现

Jiaqi Liu, Zipeng Ling, Shi Qiu, Yanqing Liu, Siwei Han, Peng Xia, Haoqin Tu, Zeyu Zheng, Cihang Xie, Charles Fleming, Mingyu Ding, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of Pennsylvania(宾夕法尼亚大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California Berkeley(加州大学伯克利分校) Cisco(思科)

专题命中 记忆与上下文管理 :agent(title);AI agent(abstract);分类 cs.AI

AI总结 本文提出Omni-SimpleMem,通过自主研究流程发现多模态记忆框架,提升AI代理的长期记忆能力,其核心贡献在于通过自动实验发现架构改进、数据管道修复等关键突破,超越传统AutoML。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01466 2026-04-03 cs.RO cs.CV cs.LG 79%

Efficient Equivariant Transformer for Self-Driving Agent Modeling

高效等价变换器用于自动驾驶代理建模

Scott Xu, Dian Chen, Kelvin Wong, Chris Zhang, Kion Fallah, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.LG

AI总结 本文提出DriveGATr,一种基于变换器的架构,通过多向量在2D投影几何代数中建模几何关系,实现SE(2)-等价性,无需显式成对相对位置编码,提升大规模场景下的效率。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02280 2026-04-03 cs.AI cs.CV 74%

Novel Memory Forgetting Techniques for Autonomous AI Agents: Balancing Relevance and Efficiency

新颖的记忆遗忘技术用于自主AI代理:在相关性和效率之间平衡

Payal Fofadiya, Sunil Tiwari

专题命中 记忆与上下文管理 :AI agent(title);分类 cs.AI

AI总结 本文提出一种自适应预算遗忘框架,通过相关性引导评分和有界优化,提升长周期对话任务的F1分数和记忆一致性,减少虚假记忆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01350 2026-04-03 cs.CL cs.AI cs.CR 62%

No Attacker Needed: Unintentional Cross-User Contamination in Shared-State LLM Agents

无需攻击者:共享状态LLM代理中的无意跨用户污染

Tiankai Yang, Jiate Li, Yi Nian, Shen Dong, Ruiyao Xu, Ryan Rossi, Kaize Ding, Yue Zhao

机构 * University of Southern California(南加州大学) Michigan State University(密歇根州立大学) Northwestern University(西北大学) Adobe Research(Adobe研究院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究揭示共享状态LLM代理中因局部有效信息被错误应用导致的跨用户污染问题,提出三种污染类型并评估两种机制,发现需在文本级清洗外增加 artifact 级防护以防止静默失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01670 2026-04-03 cs.AI 57%

Hierarchical Memory Orchestration for Personalized Persistent Agents

面向个性化持久代理的分层记忆协调

Junming Liu, Yifei Sun, Weihua Cheng, Haodong Lei, Yuqi Li, Yirong Chen, Ding Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The City University of New York(纽约市立大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出分层记忆协调框架,通过用户导向的上下文相关性组织交互历史,优化记忆存储与检索,提升智能代理的个性化性能与效率。

Comments 10 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 17 篇

2603.29399 2026-04-03 cs.AI cs.DB 89%

ELT-Bench-Verified: Benchmark Quality Issues Underestimate AI Agent Capabilities

ELT-Bench-Verified: 评估质量问题低估了AI代理的能力

Christopher Zanoli, Andrea Giovannini, Tengjun Jin, Ana Klimovic, Yotam Perlitz

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院) University of Illinois (UIUC)(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过重新评估ELT-Bench发现代理能力被低估,提出Auditor-Corrector方法修正评估质量,构建ELT-Bench-Verified提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02145 2026-04-03 cs.AI cs.CL 84%

MTI: A Behavior-Based Temperament Profiling System for AI Agents

MTI:一种基于行为的 temperament 评估系统用于 AI 代理

Jihoon Jeong

机构 * ModuLabs

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出 MTI 评估系统,通过四个维度测量 AI 代理 temperament,发现行为差异与模型大小无关,揭示了 RLHF 对 temperament 的影响。

Comments 29 pages, 6 figures, 12 tables. Paper #3 in the Model Medicine Series (Paper #1: arXiv:2603.04722)

详情

展开后加载摘要…

URL PDF HTML 收藏