arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3172 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 558 篇

2607.10079 2026-07-17 cs.AI cs.CL 版本更新 81%

MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation

MAG:用于多模态动作与引导生成的网络智能体基准测试与工具包

Chengguang Gan, Hanjun Wei, Yunhao Liang, Zhixi Cai, Qinghao Zhang, Shiwen Ni

机构 * University of Chinese Academy of Sciences(中国科学院大学) Monash University(莫纳什大学) Pusan National University(釜山国立大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 介绍MAG这一网络智能体基准测试,统一任务执行与引导写作,有基于截图的定位方案和完整工具包。用其评估模型并详细分析,还设计GRPO训练方法,提升智能体成功率与引导质量,指出当前模型任务完成率低,为后续研究提供方向。

Comments 8 pages main text, 21 pages total including appendices; 11 figures, 7 tables, 2 algorithms. Benchmark, harness, and model checkpoints to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26962 2026-07-10 cs.CY cs.AI cs.CL 版本更新 81%

DeepTutor: Towards Agentic Personalized Tutoring

DeepTutor:迈向代理式个性化辅导

Bingxi Zhao, Jiahao Zhang, Xubin Ren, Zirui Guo, Tianzhe Chu, Yi Ma, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 DeepTutor通过结合引用基础问题辅导与难度校准的问题生成,提出一个统一的开放源码框架,利用静态知识和动态学习者记忆实现个性化适应,并在五个领域大学课程中评估个性化教学效果。

Comments Tech Report, work in progress. Code available at https://github.com/HKUDS/DeepTutor

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24668 2026-06-10 cs.AI cs.LG 版本更新 81%

The Price of Agreement: Measuring LLM Sycophancy in Agentic Financial Applications

同意的代价:在代理金融应用中衡量LLM的谄媚行为

Zhenyu Zhao, Aparna Balagopalan, Adi Agrawal, Dilshoda Yergasheva, Waseem Alshikh, Daniel M. Bikel

机构 * Writer, Inc.(Writer公司)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 研究评估LLM在金融代理任务中的谄媚行为,发现模型对用户反驳仅表现低至中等性能下降,但偏好信息导致多数模型失败,并测试了输入过滤等恢复方法。

Comments Accepted to ICLR 2026 FinAI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24660 2026-06-09 cs.IR cs.AI cs.LG 版本更新 81%

How Many Tools Should an LLM Agent See? A Chance-Corrected Answer

LLM 智能体应看到多少工具?一种机会校正的答案

Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh, Joey Blackwell

机构 * II Meta Platforms(Meta平台)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 针对 LLM 智能体工具选择中候选列表长度优化问题,提出基于机会校正的 Bits-over-Random (BoR) 指标,并将其转化为强化学习奖励,实现每查询自适应深度选择,在保持覆盖率的同时显著减少展示工具数量并提升下游工具选择准确率。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00945 2026-08-12 cs.HC 版本更新 80%

Sighted by Default: Addressing Implicit Vision Assumptions in Real-Time VLM Assistance for BLV Users

默认以视觉为中心:解决面向盲人和低视力(BLV)用户的实时视觉语言模型(VLM)辅助中的隐含视觉假设问题

Yi Zhao, Siqi Wang, Qiqun Geng, Erxin Yu, Jing Li

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 针对现有面向BLV用户的实时VLM辅助工具存在的以视觉为中心的默认偏见问题,提出VIA-Agent模型,其在保持与Doubao相当成功率的同时,缩短了任务时间并减少了对话轮次,提升了用户信任度。

Comments Accepted to UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04884 2026-08-07 cs.CV 版本更新 80%

HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

浑元OCR-1.5:让轻量级OCR视觉语言模型更快更好

Gengluo Li, Xingyu Wan, Shangpin Peng, Weinong Wang, Hao Feng, Yongkun Du, Binghong Wu, Zheng Ruan, Zhiqiong Lu, Liang Wu, Pengyuan Lyu, Huawen Shen, Zibin Lin, Shijing Hu, Jieneng Yang, Hongbing Wen, Guanghua Yu, Hong Liu, Bochao Wang, Can Ma, Han Hu, Chengquan Zhang, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Large Language Model Department, Tencent(腾讯大语言模型部) Nankai University(南开大学)

专题命中 Agent评测 :agentic(summary_cn,abstract);agent(abstract)

AI总结 研究改进轻量级端到端OCR视觉语言模型。基于HunyuanOCR-1.0架构,用DFlash提升效率,提出Agentic Data Flow增强能力,在多任务表现出色,还将发布模型权重和代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24009 2026-07-20 cs.CR cs.AI cs.CL cs.LG 版本更新 80%

Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking

Jailbreak Foundry: 从论文到可运行攻击的可重复基准测试

Zhicheng Fang, Jingjie Zheng, Chenxu Fu, Wei Xu

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Tsinghua University(清华大学) University of Melbourne(墨尔本大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 JAILBREAK FOUNDRY通过多代理工作流将论文转换为可执行模块,实现可重复基准测试的标准化评估和自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22447 2026-08-18 cs.SE 版本更新 79%

Latent Reuse in Agent Skills: Multi-modal Clone Detection at Ecosystem Scale

SkillClone: 多模态克隆检测与克隆传播分析在智能体技能生态系统中

Jiaying Zhu, Lyuye Zhang, Wenbo Guo, Yang Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 本文提出SkillClone,首个多模态智能体技能克隆检测方法,通过融合TF-IDF与通道分解实现高精度检测,揭示技能生态系统中大量克隆关系及传播问题。

Comments 13 pages, ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00023 2026-08-17 cs.MA cs.AI cs.HC cs.SD eess.AS 版本更新 79%

Musical Agent Systems: MACAT and MACataRT

音乐智能体系统:MACAT与MACataRT

Keon Ju M. Lee, Philippe Pasquier

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究开发了两款音乐智能体系统MACAT与MACataRT,分别用于智能体主导的表演与协作式即兴创作,基于个性化小数据集训练,以推动以人为核心的交互式生成式AI在音乐创作中的应用。

Comments In Proceedings of the Creativity and Generative AI NIPS (Neural Information Processing Systems) Workshop 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17679 2026-08-10 cs.HC cs.AI 版本更新 79%

PULSE: Agentic Investigation with Passive Sensing for Proactive Affective Intervention in Cancer Survivorship

PULSE:基于被动感知的代理探究用于癌症幸存者的主动干预

Zhiyuan Wang, Subigya Nepal, Ariful Islam, Indrajeet Ghosh, Xinyu Chen, Katharine E. Daniel, Laura E. Barnes, Philip Chow

机构 * Department of Systems and Information Engineering, University of Virginia(系统与信息工程系,弗吉尼亚大学) Center for Behavioral Health and Technology, University of Virginia(行为健康与技术中心,弗吉尼亚大学) Department of Computer Science, University of Virginia(计算机科学系,弗吉尼亚大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出PULSE系统,通过代理感知探究方法,利用智能手机被动感知数据和日记数据,提升对癌症幸存者情绪调节需求的预测准确率,验证了代理推理在主动干预中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03238 2026-08-10 cs.AI 版本更新 79%

"LLM Agent Performance" Is Not a Single Evaluation Target

基于LLM的智能体评估统一框架的必要性

Pengyu Zhu, Li Sun, Philip S. Yu, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 针对当前LLM智能体评估受系统提示、工具集和环境动态等混杂因素影响的问题,提出标准化统一评估框架以提升公平性和可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00794 2026-08-06 cs.AI 版本更新 79%

Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation

无效度的测量:智能体AI评估中的复合可靠性问题

William Caban

机构 * Red Hat, Inc.(红帽公司) Alma Mater Europaea University(欧洲母校大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 该研究指出智能体AI评估存在复合可靠性问题,任务生成、LLM模拟、评分者间信度三个层面的失效相乘降低效度,提出八项心理测量学改进建议以提升评估可信度。

Comments 34 pages (review/double-spaced format), 2 figures, 5 tables. Submitted to Knowledge-Based Systems (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11245 2026-08-04 cs.AI 版本更新 79%

Mind the Sim2Real Gap in User Simulation for Agentic Tasks

注意用户模拟中的Sim2Real差距以实现代理任务

Xuhui Zhou, Weiwei Sun, Qianou Ma, Yiqing Xie, Jiarui Liu, Weihua Du, Sean Welleck, Yiming Yang, Graham Neubig, Sherry Tongshuang Wu, Maarten Sap

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究发现基于LLM的用户模拟器在代理任务中存在Sim2Real差距,表现出过度合作和缺乏真实反馈,需通过人类验证提升模拟真实性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07853 2026-07-31 cs.CR cs.AI 版本更新 79%

FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments

FinVault:在执行 grounded 环境中评估金融代理安全性的基准测试

Zhi Yang, Runguo Li, Qiqi Qiang, Jiashun Wang, Fangqi Lou, Mengping Li, Dongpo Cheng, Rui Xu, Heng Lian, Shuo Zhang, Xiaolong Liang, Xiaoming Huang, Zheng Wei, Zhaowei Liu, Xin Guo, Huacan Wang, Ronghao Chen, Liwen Zhang

机构 * SUFE(上海财经大学) CUHKSZ(香港中文大学) SUIBE(上海对外经贸大学) FDU(福建大学) XDU(西安电子科技大学) BUPT(北京邮电大学) Tencent(腾讯) UCAS(中国科学院大学) PKU(北京大学) QuantaAlpha(量子Alpha)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 FinVault 是首个针对金融代理的执行 grounded 安全基准测试,通过31个监管案例驱动的沙盒场景和963个测试用例,评估金融代理在现实金融环境中的安全性和防御有效性。

Comments After further review of the current submission, we have identified potential legal and intellectual property concerns associated with keeping the manuscript publicly available as a preprint. In particular, there are ongoing considerations regarding institutional affiliation information, intellectual property ownership, and related compliance matters

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26172 2026-07-31 cs.HC cs.AI cs.SI 版本更新 79%

Linking Heterogeneous Data with Coordinated Agent Flows for Social Media Analysis

通过协调智能体流关联异构数据以开展社交媒体分析

Shifu Chen, Dazhen Deng, Zhihong Xu, Sijia Xu, Linyu Qin, Tai-Quan Peng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Department of Communication, Michigan State University(密歇根州立大学通讯系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究提出LLM智能体系统SIA,通过协调智能体流关联社交媒体异构多模态数据,采用阶段同步策略挖掘洞见,经评估可发现多样有意义的洞见,为社交媒体分析提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27243 2026-07-29 cs.IR cs.SE 版本更新 79%

NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems

NOVA: 面向工业推荐系统架构演化的验证感知智能体框架

Shaohua Liu, Liang Fang, Yilong Sun, Shudong Huang, Qingsong Luo, Shaoxin Liu, Xiaoyang Chen, Dongqiang Liu, Chuangang Ma, Zhenzhen Chai, Henghuan Wang, Shijie Quan, Changyuan Cui, Zhangbin Zhu, Peng Chen, Wei Xu, Lei Xiao, Haijie Gu, Jie Jiang

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 提出NOVA框架,通过架构梯度、验证级联和层级任务控制实现工业推荐模型架构的自动化演化,有效减少静默失败,缩短文献到生产周期13倍以上。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20121 2026-07-24 cs.CL 版本更新 79%

OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills

开放技能风险:使用现实世界中的危险第三方技能时对智能体安全性进行基准测试

Qiyuan Liu, Tingfeng Hui, Kun Zhan, Kaike Zhang, Ning Miao

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 研究基于语言模型的智能体使用第三方危险技能时的安全问题,构建OpenSkillRisk基准测试,涵盖多种不安全场景并能细粒度分析。实验发现当前系统处理危险技能能力不足,揭示三种失败模式,强调需改进语言模型风险推理和智能体框架执行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11149 2026-07-24 cs.AI 版本更新 79%

The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation

隐藏的足迹:使存储成为大语言模型智能体评估的头等指标

Chenglin Yu, Hongquan Gui, Ying Yu, Tao Zeng, Ming Li

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究大语言模型智能体运行后磁盘持久数据评估问题,引入AgentFootprint基准测试,通过序列化感知度量套件测量多方面指标,解决测量陷阱,给出不同配置差异及存储优化结果,确立持久存储为资源指标。

Comments 17 pages, 5 figures; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04309 2026-07-22 math.NA cs.LG cs.NA 版本更新 79%

DeepPAAC: A New Deep Galerkin Method for Principal-Agent Problems

深度主从问题的新深度伽辽金方法

Michael Ludkovski, Changgen Xie, Zimu Zhu

机构 * Department of Statistics and Applied Probability, University of California, Santa Barbara(加州大学圣巴巴拉分校统计学与应用概率系) Fintech Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)金融科技方向)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 研究连续时间下主从问题的数值求解,提出深度主从演员评论家算法(DeepPAAC),可处理多维情况及约束,通过五个案例研究神经网络架构等因素对求解器收敛的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04419 2026-07-20 cs.AI 版本更新 79%

Agent Step Value: Auditing Evaluator-Channel Reversals in Black-Box Agent Traces

智能体步骤值:使用基于状态的语言模型评估器进行状态转换测量

Andrew Zhang, Chengzhan Li

机构 * KTH Royal Institute of Technology(皇家理工学院) University of Electronic Science and Technology of China(电子科技大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究提出智能体步骤值(ASV)框架,通过状态转换测量评估智能体动作,能定位最终答案分数等遗漏的关键信息,还介绍了具体方法及工具,并用实验验证其有效性。

Comments adds source-contract intervention and two-wave retry study; re-acquires cube and extends bridge cohort to n=98 to 100

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02235 2026-07-15 cs.SE 版本更新 79%

Agent-Based Software Artifact Evaluation

基于代理的软件工件评估

Zhaonan Wu, Yanjie Zhao, Zhenpeng Chen, Zheng Wang, Haoyu Wang

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 研究针对软件工件评估中人工评估难及现有政策缺乏验证标准的问题,构建ArtifactGuide评分标准,设计ArtifactCopilot代理,通过实验评估,该框架提升了评估性能,提高了评审信心,还为设计高质量工件提供了实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23128 2026-07-03 cs.HC cs.AI cs.MA 版本更新 79%

It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents

这是一个陷阱!面向网络代理的任务重定向说服基准

Karolina Korgul, Yushi Yang, Arkadiusz Drohomirecki, Piotr Błaszczyk, Will Howard, Lukas Aichberger, Chris Russell, Philip H. S. Torr, Adam Mahdi, Adel Bibi

机构 * University of Cambridge(剑桥大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出TRAP基准,评估大型语言模型驱动的网络代理在动态网页中易受提示注入攻击的程度,发现平均25%的任务中代理被重定向,揭示了心理驱动的系统漏洞。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00585 2026-06-25 cs.AI 版本更新 79%

Exploring Information Seeking Agent Consolidation

探索信息寻求智能体整合

Guochen Yan, Jialong Wu, Zhengwei Tao, Bo Li, Qintong Zhang, Jiahao Xu, Haitao Mi, Yuejian Fang, Qingni Shen, Wentao Zhang, Zhonghai Wu

机构 * Peking University(北京大学) Tencent(腾讯)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 通过系统实证研究,比较数据级混合与参数级合并两种范式,发现参数级合并能以更低成本达到数据混合的性能,并保留跨域能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07131 2026-06-23 cs.CR cs.SE 版本更新 79%

MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills

MalSkillBench: 一个运行时验证的恶意智能体技能基准

Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01152 2026-06-23 cs.AI 版本更新 79%

DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent

DeepResearch-9K:一个具有挑战性的深度研究智能体基准数据集

Tongzhou Wu, Yuhao Wang, Xinyu Ma, Xiuqiang He, Shuaiqiang Wang, Dawei Yin, Xiangyu Zhao

机构 * Shenzhen Technology University(深圳技术大学) City University of Hong Kong(香港城市大学) Baidu Inc.(百度公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 为解决深度研究智能体缺乏大规模挑战性数据集和开源训练框架的问题,构建了DeepResearch-9K数据集,包含9000个多难度问题、搜索轨迹和可验证答案,并开发了开源训练框架DeepResearch-R1,实验表明训练后的智能体在基准测试上达到最优。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09163 2026-06-16 cs.AI 版本更新 79%

FORTIS: Benchmarking Over-Privilege in Agent Skills

FORTIS:评估代理技能中的过度特权

Shawn Li, Chenxiao Yu, Han Wang, Wei Yang, Ryan Rossi, Franck Dernoncourt, Xiyang Hu, Philip Yu, Chaowei Xiao, Huan Zhang, Yue Zhao

机构 * University of Southern California(南加州大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究) Arizona State University(亚利桑那州立大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究发现,当前代理技能层普遍存在过度特权问题,模型在选择和执行技能时常超出任务需求,导致性能不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11047 2026-06-16 cs.CR cs.AI 版本更新 79%

Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw

红队代理执行上下文:OpenClaw上的开放世界安全评估

Hongwei Yao, Yiming Liu, Yiling He, Bingrun Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出DeepTrap框架,通过黑盒轨迹优化发现OpenClaw中的上下文漏洞,展示上下文妥协可引发安全风险,强调需执行中心的安全评估。

Comments Accepted to ICML 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21862 2026-06-16 cs.AI cs.MA cs.SI econ.GN q-fin.EC 版本更新 79%

Shachi: A Modular, Controllable Framework for LLM-Based Agent-Based Modeling of Emergent Collective Behavior

Shachi: 一种用于基于LLM的涌现集体行为建模的模块化、可控框架

So Kuroki, Yingtao Tian, Kou Misaki, Takashi Ikegami, Takuya Akiba, Yujin Tang

机构 * Sakana AI, Japan(日本Sakana AI) The University of Tokyo, Japan(日本东京大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出Shachi框架,将智能体认知分解为配置、记忆和工具等独立可控组件,通过扰动实验研究微观认知特征如何影响宏观群体动态,并在10任务基准和关税冲击案例中验证其有效性。

Comments Accepted to ALIFE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10813 2026-06-15 cs.CR cs.CL 版本更新 79%

RedAct: Redacting Agent Capability Traces for Procedural Skill Protection

RedAct: 为程序技能保护而编辑智能体能力痕迹

Shuwen Xu, Zhitao He, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 提出RedAct框架,通过定位保护关键信息、重写痕迹并嵌入行为水印,将技能转移率降至无技能基线以下,同时保留审计证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18289 2026-06-11 cs.CL cs.CY cs.MA 版本更新 79%

Food4All: An Agentic Framework and Benchmark for Food Resource Navigation with Adaptive User Understanding

Food4All: 一种具有自适应用户理解能力的食物资源导航智能体框架与基准

Yiyang Li, Weixiang Sun, Tianyi Ma, Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

机构 * University of Notre Dame(诺特大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 提出Food4All框架,结合食物搜索工具与300个多轮评估任务,在686个印第安纳食物资源上评估六种大语言模型,诊断其在约束条件处理和非理想用户交互中的不足。

Comments We have further refined the benchmark construction and experimental presentation to improve clarity and consistency. The revised version includes updated task design, food-resource data, and evaluation details to better align the benchmark with the intended food resource referral setting. These changes provide a more precise presentation of the experimental findings

详情

展开后加载摘要…

URL PDF HTML 收藏