arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2604.14254 2026-04-17 cs.AI cs.LO 70%

Formalizing Kantian Ethics: Formula of the Universal Law Logic (FULL)

规范康德伦理学:普遍律令逻辑(FULL)

Taylor Olson

机构 * Taylor Olson(塔勒尔·奥尔森)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出一种多排序量化模态逻辑FULL,用于规范康德伦理学,通过无需内置道德直觉的背景知识评估代理行为,提升AI代理的鲁棒性和自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07338 2026-04-17 cs.CL 70%

Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation

超越字面映射:非字面翻译评估的基准测试与改进

Yanzhi Tian, Cunxiang Wang, Zeming Liu, Heyan Huang, Wenbo Yu, Dawei Song, Jie Tang, Yuhang Guo

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Zhipu AI(智谱AI) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程组) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出RATE框架,通过反思核心代理动态调用专用子代理,提升非字面翻译评估的准确性,实验显示其在系统和段级相关性上比现有方法提高至少3.2分。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12162 2026-04-15 cs.CL 70%

AlphaEval: Evaluating Agents in Production

AlphaEval:生产环境中的代理评估

Pengrui Lu, Bingyu Xu, Wenjun Zhang, Shengjia Hua, Xuanjian Gao, Ranxiang Ge, Lyumanshan Ye, Linxuan Wu, Yiran Li, Junfei Fish Yu, Yibo Zhang, Ruixin Li, Manxiang Li, Xiao Han, Xiaocong Zhou, Guangyao Chi, Zisheng Chen, Kaishen Chen, Kun Wang, Qihua Xu, Fengyue Meng, Yuchen Ni, Jiajun Li, Jinxiu Liu, Danfeng Zhang, Jingru Zhao, Pengfei Liu

机构 * SII MiraclePlus SJTU(上海交通大学) GAIR HIT(哈尔滨工业大学) UCAS(中国科学技术大学) LangCore Jiqizhixin HunterAI CinoCore KuaFuAI POET

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.CL

AI总结 AlphaEval 是一个基于生产环境的评估基准,包含 94 个任务,涵盖六个职业领域,通过多种评估方法评估完整代理产品,提供可复现的构建框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11969 2026-04-15 cs.AI 70%

Narrative-Driven Paper-to-Slide Generation via ArcDeck

通过ArcDeck实现叙事驱动的论文到幻灯片生成

Tarik Can Ozden, Sachidanand VS, Furkan Horoz, Ozgur Kara, Junho Kim, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Middle East Technical University(中东技术大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出ArcDeck框架,通过结构化叙事重建任务提升论文到幻灯片生成的逻辑连贯性,引入ArcBench基准测试,实验表明显式话语建模与角色特定代理协调显著提升生成演示的叙事流畅度和逻辑性。

Comments Project webpage: https://arcdeck.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17012 2026-04-14 cs.CV cs.AI 70%

SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence

SpatialScore:迈向空间智能的综合评估

Haoning Wu, Xiao Huang, Yaohui Chen, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出SpatialScore,首个全面评估多模态空间智能的基准,评估49个模型发现其在空间理解上存在显著差距,并构建了SpatialCorpus和SpatialAgent提升模型性能。

Comments Accepted by CVPR 2026 (Highlight); Project Page: https://haoningwu3639.github.io/SpatialScore

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11072 2026-04-14 cs.AI 70%

Hodoscope: Unsupervised Monitoring for AI Misbehaviors

Hodoscope:无监督监控AI误行

Ziqian Zhong, Shashwat Saxena, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出Hodoscope,通过无监督方法发现AI代理的异常行为,减少人工审查工作量,并提升LLM判断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09634 2026-04-14 cs.CY cs.AI 70%

From Understanding to Creation: A Prerequisite-Free AI Literacy Course with Technical Depth Across Majors

从理解到创造:一个无先修要求的AI素养课程,跨专业技术深度

Amarda Shehu

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文介绍了一门无先修要求的AI素养课程,通过五个机制提升学生对AI系统的理解、使用、评估和构建能力,课程设计兼顾技术深度与跨专业适用性。

Comments 37 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07720 2026-04-13 cs.AI 70%

Towards Knowledgeable Deep Research: Framework and Benchmark

走向知识导向的深度研究:框架与基准

Wenxuan Liu, Zixuan Li, Long Bai, Chunmao Zhang, Fenghui Zhang, Zhuo Chen, Wei Li, Yuxin Zuo, Fei Wang, Bingbing Xu, Xuhui Jiang, Jin Zhang, Xiaolong Jin, Jiafeng Guo, Tat-Seng Chua, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出知识导向深度研究(KDR)任务,设计混合知识分析框架(HKA)并构建KDR-Bench基准,通过结构化与非结构化知识生成多模态报告,实验表明HKA在通用和知识导向指标上优于现有方法,且在视觉增强指标上超越Gemini DR代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08226 2026-04-10 cs.AI cs.HC cs.SY eess.SY 70%

Grounding Clinical AI Competency in Human Cognition Through the Clinical World Model and Skill-Mix Framework

通过临床世界模型和技能混合框架在人类认知中奠定临床AI能力

Seyed Amir Ahmad Safavi-Naini, Elahe Meftah, Josh Mohess, Pooya Mohammadi Kazaj, Georgios Siontis, Zahra Atf, Peter R. Lewis, Mauricio Reyes, Girish Nadkarni, Roland Wiest, Stephan Windecker, Christoph Grani, Ali Soroush, Isaac Shiri

机构 * Department of Cardiology, Inselspital, Bern University Hospital, University of Bern(伯尔尼大学医院心脏病学系,伯尔尼大学) Department of Digital Medicine, Bern University Hospital, University of Bern(伯尔尼大学医院数字医学系,伯尔尼大学) Division of Data-Driven and Digital Medicine (D3M), Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院数据驱动与数字医学部) Clinical Research Development Center, Amir Oncology Teaching Hospital, Shiraz University of Medical Sciences(设拉子医科大学阿米尔肿瘤教学医院临床研究发展中心) Graduate School for Cellular and Biomedical Sciences, University of Bern(伯尔尼大学细胞与生物医学研究生院) Faculty of Business and Information Technology, Ontario Tech University(安大略理工大学商业与信息技术学院) Department of Radiation Oncology, Inselspital, Bern University Hospital and University of Bern(伯尔尼大学医院放射肿瘤学系,伯尔尼大学) ARTORG Center for Biomedical Engineering Research, University of Bern(伯尔尼大学ARTORG生物医学工程研究中心) The Charles Bronfman Institute of Personalised Medicine, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院查尔斯·布朗夫曼个性化医学研究所) University Institute of Diagnostic and Interventional Neuroradiology, Inselspital, Bern University Hospital, University of Bern(伯尔尼大学医院诊断与介入神经放射学大学研究所,伯尔尼大学) Translational Imaging Center (TIC), Swiss Institute for Translational and Entrepreneurial Medicine(瑞士转化与创业医学研究所转化影像中心) Henry D. Janowitz Division of Gastroenterology, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院亨利·D·雅诺维茨消化内科)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出临床世界模型和技能混合框架,通过八维定义临床能力空间,为AI在医疗场景中的能力评估和验证提供结构化方法。

Comments Code, data (Clinical AI Skill-Mix dimension specifications), and an exploratory dashboard are available at https://github.com/Sdamirsa/Clinical-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07535 2026-04-10 cs.AI 70%

Trust the AI, Doubt Yourself: The Effect of Urgency on Self-Confidence in Human-AI Interaction

信任人工智能,怀疑自己:紧迫感对人机交互中自信心的影响

Baran Shajari, Xiaoran Liu, Kyanna Dagenais, Istvan David

机构 * McMaster University(麦克马斯特大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究探讨了紧迫感对人机交互中人类自信心的影响,发现尽管紧迫感不影响对AI的信任,但可能损害人类的自信心和自我效能感,进而影响性能和可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07429 2026-04-10 cs.CV cs.AI cs.HC 70%

GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents

GameWorld: 向标准化和可验证的多模态游戏代理评估迈进

Mingyu Ouyang, Siyuan Hu, Kevin Qinghong Lin, Hwee Tou Ng, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 GameWorld提出一个标准化且可验证的多模态游戏代理评估基准,包含34种游戏和170个任务,通过可验证的指标评估代理能力,揭示了当前代理在视频游戏中与人类能力的差距。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05398 2026-04-08 math.OC cs.LG 70%

An Actor-Critic Framework for Continuous-Time Jump-Diffusion Controls with Normalizing Flows

一个用于连续时间跳跃扩散控制的Actor-Critic框架

Liya Guo, Ruimeng Hu, Xu Yang, Yi Zhu

机构 * Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Department of Mathematics, Tsinghua University(清华大学数学系) Department of Mathematics, University of California, Santa Barbara(加州大学圣塔芭芭拉分校数学系) Department of Statistics and Applied Probability, University of California, Santa Barbara(加州大学圣塔芭芭拉分校统计与应用概率系) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications(北京雁栖湖应用数学研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出一个无网格求解器,用于解决熵正则化控制问题和具有跳跃的随机博弈,通过时间非齐性小q函数和适当的职业测度,结合条件归一化流参数化Actor,实现灵活的非高斯策略,并在多个金融和博弈场景中验证了方法的有效性。

Comments 29 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05364 2026-04-08 cs.AI 70%

TFRBench: A Reasoning Benchmark for Evaluating Forecasting Systems

TFRBench:用于评估预测系统推理能力的基准测试

Md Atik Ahamed, Mihir Parmar, Palash Goyal, Yiwen Song, Long T. Le, Qiang Cheng, Chun-Liang Li, Hamid Palangi, Jinsung Yoon, Tomas Pfister

机构 * Google(谷歌) University of Kentucky(肯塔基大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 TFRBench通过多智能体框架评估预测系统推理能力,提升预测准确性,验证了其在时间序列预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05116 2026-04-08 cs.AI 70%

Uncertainty-Guided Latent Diagnostic Trajectory Learning for Sequential Clinical Diagnosis

不确定性的引导潜在诊断轨迹学习用于顺序临床诊断

Xuyang Shen, Haoran Liu, Dongjin Song, Martin Renqiang Min

机构 * University of Connecticut(康涅狄格大学) Texas A&M University(德克萨斯农工大学) NEC Laboratories America(NEC美国实验室)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出基于规划LLM和诊断LLM的潜在诊断轨迹学习框架,通过后验分布优先选择高诊断信息轨迹,提升顺序临床诊断的准确率并减少检测次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00185 2026-04-08 cond-mat.mtrl-sci cs.AI 70%

QUASAR: A Universal Autonomous System for Atomistic Simulation and a Benchmark of Its Capabilities

QUASAR:一个通用的自主系统用于原子模拟及其能力的基准测试

Fengxu Yang, Jack D. Evans

机构 * School of Physics, Chemistry and Earth Sciences, Adelaide University(阿德莱德大学物理、化学与地球科学学院)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 QUASAR通过整合多种原子模拟方法,实现自主的多尺度工作流,展示了其在材料筛选和新型材料评估中的应用潜力。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04347 2026-04-07 cs.AI 70%

RoboPhD: Evolving Diverse Complex Agents Under Tight Evaluation Budgets

RoboPhD:在有限评估预算下演化多样化复杂智能体

Andrew Borthwick, Stephen Ash, Anthony Galczak

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过对比三种优化方法,在四个基准测试中展示了RoboPhD在演化多样化复杂智能体方面的优越性,特别是在抽象推理、云调度、SQL生成和金融问答任务中表现突出。

Comments 20 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04341 2026-04-07 cs.AI 70%

Implementing surrogate goals for safer bargaining in LLM-based agents

在基于语言模型的智能体中实现安全谈判的替代目标

Caspar Oesterheld, Maxime Riché, Filip Sondej, Jesse Clifton, Vincent Conitzer

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文探讨了在基于语言模型的智能体中实现替代目标以提高谈判安全性的方法,通过四种不同技术验证了细调和支架法在应对替代目标威胁方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04035 2026-04-07 cs.CR cs.AI 70%

Causality Laundering: Denial-Feedback Leakage in Tool-Calling LLM Agents

因果洗白:工具调用LLM代理中的否认-反馈泄漏

Mohammad Hossein Chinaei

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究提出Agentic Reference Monitor通过因果溯源阻断工具调用中的因果洗白攻击,有效防止数据泄露和因果影响传播。

Comments 24 pages, 1 figure, 2 tables, 1 algorithm, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03968 2026-04-07 cs.CR cs.AI 70%

TraceGuard: Structured Multi-Dimensional Monitoring as a Collusion-Resistant Control Protocol

TraceGuard:结构化多维监控作为抗合谋的控制协议

Khanh Linh Nguyen, Hoa Nghiem, Tu Tran

机构 * Independent Researchers(独立研究人员) Apart Research

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出TraceGuard,一种结构化多维监控协议,通过五个维度评估代理行为,结合LLM调用和启发式检测器,有效区分攻击与诚实行为,防止合谋攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01438 2026-04-07 cs.AI 70%

ClawSafety: "Safe" LLMs, Unsafe Agents

ClawSafety: 安全的LLM,不安全的代理

Bowen Wei, Yunbei Zhang, Jinhao Pan, Kai Mei, Xiao Wang, Jihun Hamm, Ziwei Zhu, Yingqiang Ge

机构 * George Mason University(乔治梅森大学) Tulane University(杜兰大学) Rutgers University(罗格斯大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 ClawSafety评估了120个对抗性测试场景,揭示了高权限工作环境中LLM的安全性问题,强调部署栈对安全性的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24428 2026-04-07 cs.SE 70%

CodeWiki: Evaluating AI's Ability to Generate Holistic Documentation for Large-Scale Codebases

CodeWiki: 评估AI生成大规模代码库整体文档的能力

Anh Nguyen Hoang, Minh Le-Anh, Bach Le, Nghi D. Q. Bui

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 CodeWiki提出一个统一框架,用于生成多语言代码库的自动化文档,通过层级分解、递归多代理处理和多模态合成,提升文档质量,实验显示其在高脚本语言上的改进显著。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02947 2026-04-06 cs.AI 70%

AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

AgentHazard:用于评估计算机使用代理有害行为的基准

Yunhao Feng, Yifan Ding, Yingshui Tan, Xingjun Ma, Yige Li, Yutao Wu, Yifeng Gao, Kun Zhai, Yanming Guo

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) Hunan Institute of Advanced Technology(湖南先进技术研究院) Deakin University(迪肯大学) Singapore Management University(新加坡管理大学)

专题命中 Agent评测 :autonomous agent(abstract);tool use(abstract);分类 cs.AI

AI总结 AgentHazard基准通过2653个实例评估计算机使用代理的有害行为,揭示了模型在连续上下文和工具使用中识别安全风险的能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00290 2026-04-06 cs.AI cs.MA 70%

ClinicalReTrial: Clinical Trial Redesign with Self-Evolving Agents

临床试验重设计:具有自进化代理的临床试验重设计

Sixue Xing, Kerui Wu, Xuanye Xia, Meng Jiang, Jintai Chen, Tianfan Fu

机构 * University of Notre Dame(圣母大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Georgia Institute of Technology(佐治亚理工学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出ClinicalReTrial系统,通过自进化代理对临床试验协议进行迭代重设计,提升成功率并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08522 2026-04-02 cs.CL 70%

AlphaResearch: Accelerating New Algorithm Discovery with Language Models

AlphaResearch:利用语言模型加速新算法发现

Zhaojian Yu, Kaiyue Feng, Yilun Zhao, Shilin He, Xiao-Ping Zhang, Arman Cohan

机构 * Tsinghua University(清华大学) New York University(纽约大学) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 AlphaResearch通过迭代提出新想法、编程验证和优化研究提案,实现了在开放性问题上发现新算法的突破,其在六个开放性问题上的表现优于其他系统,尤其在圆圈排列问题上超越了人类和基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29020 2026-04-01 cs.AI 70%

Emergence WebVoyager: Toward Consistent and Transparent Evaluation of (Web) Agents in The Wild

WebVoyager的涌现:迈向Web代理在真实世界中一致和透明的评估

Deepak Akkil, Mowafak Allaham, Amal Raj, Tamer Abuelsaad, Ravi Kokku

机构 * Emergence AI Northwestern University(西北大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出Emergence WebVoyager,通过明确的任务实例化、失败处理、注释和报告指南,提高Web代理评估的一致性和透明度,并展示了OpenAI Operator在不同领域和任务类型中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27065 2026-03-31 cs.CL 70%

Story2Proposal: A Scaffold for Structured Scientific Paper Writing

Story2Proposal:一种结构化科学论文写作的支架

Zhuoyang Qian, Wei Shi, Xu Lin, Li Ling, Meng Luo, Ziming Wang, Zhiwei Zhang, Tengyue Xu, Gaoge Liu, Zhentao Zhang, Shuo Zhang, Ziqi Wang, Zheng Feng, Yan Luo, Shu Xu, Yongjin Chen, Zhibo Feng, Zhuo Chen, Bruce Yuan, Biao Wu, Harry Wang, Kris Chen

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出Story2Proposal,一种基于合同约束的多智能体框架,通过协调运作的智能体将研究故事转化为结构化论文,提升了论文结构一致性与视觉对齐性。

Comments 10 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01608 2026-03-31 cs.AI 70%

Evaluating and Understanding Scheming Propensity in LLM Agents

评估和理解大语言模型代理中的谋略倾向

Mia Hopman, Jannes Elstner, Maria Avramidou, Amritanshu Prasad, David Lindner

机构 * LASR Labs(LASR实验室) Google DeepMind(谷歌DeepMind)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文通过分解谋略激励因素,研究大语言模型代理在复杂任务中的谋略行为,发现环境因素对谋略倾向影响显著,但实际部署中需谨慎评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26034 2026-03-30 cs.CL 70%

AgentCollab: A Self-Evaluation-Driven Collaboration Paradigm for Efficient LLM Agents

AgentCollab: 一种以自我评估驱动的高效大语言模型代理协作范式

Wenbo Gao, Renxi Liu, Xian Wang, Fang Guo, Shuai Yang, Xi Chen, Hui-Ling Zhen, Hanting Chen, Weizhe Lin, Xiaosong Li, Yaoyuan Wang

机构 * Huawei(华为) Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.CL

AI总结 本文提出AgentCollab框架,通过自我反思信号动态协调不同推理能力的模型,提升LLM代理在复杂任务中的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24989 2026-03-30 cs.RO cs.AI 70%

Learning Rollout from Sampling:An R1-Style Tokenized Traffic Simulation Model

从采样中学习:一种R1风格的分词交通仿真模型

Ziyan Wang, Peng Chen, Ding Li, Chiwei Li, Qichao Zhang, Zhongpu Xia, Guizhen Yu

机构 * State Key Laboratory of Intelligent Transportation System, Key Laboratory of Autonomous Transportation Technology for Special Vehicles, Ministry of Industry and Information Technology, School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院,智能交通系统国家重点实验室,特种车辆自主运输技术重点实验室(工业和信息化部)) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所,多模态人工智能系统国家重点实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出R1Sim模型,通过分词交通仿真结合熵引导采样和GRPO优化,实现探索与利用的平衡,生成真实安全的多智能体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25747 2026-03-30 cs.AI 70%

BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments

BeSafe-Bench:揭示功能环境中情境代理的行为安全风险

Yuxuan Li, Yi Lin, Peng Wang, Shiming Liu, Xuetao Wei

机构 * Southern University of Science and Technology(南方科技大学) Huawei RAMS Lab(华为RAMS实验室)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出BeSafe-Bench,通过构建功能环境和引入九类安全关键风险,评估代理在Web、Mobile、Embodied VLM和Embodied VLA等领域的行为安全风险,发现最佳性能代理在安全约束下完成任务的比例不足40%。

详情

展开后加载摘要…

URL PDF HTML 收藏