arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-11 至 2026-05-11 共收录 30 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 30 篇

2508.16571 2026-05-11 cs.AI cs.IR cs.MA 90%

LLM-Based Agents for Competitive Landscape Mapping in Drug Asset Due Diligence

基于大语言模型的竞品映射 agent 在药物资产尽调中的应用

Vlad Vinogradov, Alisa Vinogradova, Dmitrii Radkevich, Ilya Yasny, Dmitry Kobyzev, Ivan Izmailov, Katsiaryna Yanchanka, Roman Doronin, Andrey Doronichev

机构 * LanceBio Ventures AI Expert

专题命中 Agent评测 :agent(title_cn,summary_cn);AI agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的竞品发现 agent,通过结构化数据处理提升药物资产尽调效率,实现竞品检索与属性标准化,实验结果显示其召回率优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06978 2026-05-11 cs.CL cs.AI 81%

Group of Skills: Group-Structured Skill Retrieval for Agent Skill Libraries

技能组:面向智能体技能库的分组结构技能检索

Kun Zeng, Yu Huo, Siyu Zhang, Zi Ye, Yuecheng Zhuo, Haoyue Liu, Yuquan Lu, Junhao Wen, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Sun Yat-sen University(孙中山大学) University of California, San Diego(加州大学圣地亚哥分校) Taiyuan University of Technology(太原理工大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出GoSkills,一种分组结构技能检索方法,通过构建基于类型技能图的锚点中心技能组,提升智能体在有限技能预算下对可见需求的覆盖能力,改进了传统技能检索方法的性能。

Comments 30 pages, 4 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07313 2026-05-11 cs.AI 79%

When Stored Evidence Stops Being Usable: Scale-Conditioned Evaluation of Agent Memory

当存储的证据不再可用:基于规模的代理记忆评估

Jiaqi Shao, Yiyi Lu, Yunzhen Zhang, Bing Luo

机构 * Hong Kong University of Science and Technology(香港科技大学) Duke Kunshan University(杜克昆山大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于规模的代理记忆评估方法,用于评估记忆在无关会话积累时的可靠性变化,展示了不同记忆系统在不同规模下的表现差异。

Comments 19 pages, 11 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07180 2026-05-11 cs.CL 79%

Learning Agent Routing From Early Experience

从早期经验学习代理路由

Yimin Wang, Jiahao Qiu, Xuan Qi, Xinzhe Juan, Jingzhe Shi, Zelin Zhao, Hongru Wang, Shilong Liu, Mengdi Wang

机构 * AI Lab, Princeton University(普林斯顿大学人工智能实验室) University of Michigan(密歇根大学) Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(清华大学交叉信息学院) Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学) King’s College London(伦敦国王学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文研究在冷启动条件下如何在轻量级LLM推理与完整代理执行间进行路由,提出无需训练的BoundaryRouter框架,通过早期行为经验和指导性推理决定是否直接使用LLM还是升级至代理,实验显示其在降低推理时间与提升性能方面优于其他方法。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07073 2026-05-11 cs.AI 79%

TeamBench: Evaluating Agent Coordination under Enforced Role Separation

TeamBench: 在强制角色分离下评估代理协调

Yubin Kim, Chanwoo Park, Taehan Kim, Eugene Park, Samuel Schmidgall, Salman Rahman, Chunjong Park, Cynthia Breazeal, Xin Liu, Hamid Palangi, Hae Won Park, Daniel McDuff

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 TeamBench通过851个任务模板和931个预设实例,评估在操作系统强制角色分离下代理协调的能力,发现提示仅和沙盒强制团队的通过率无显著差异,但提示仅团队更易出现验证者篡改执行者代码的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07011 2026-05-11 cs.LG 79%

Dual-Agent Co-Training for Health Coaching via Implicit Adversarial Preference Optimization

双代理协同训练用于健康教练的隐式对抗偏好优化

Da Long, Lingyi Fu, Diya Michelle Rao, Jasmine Ruales Carrera, Yang Bai, Shandian Zhe

机构 * Kahlert School of Computing University of Utah(Utah大学计算学院Kahlert学院) Department of Health and Kinesiology University of Utah(健康与运动科学系Utah大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出双代理框架,通过隐式对抗偏好优化提升健康教练质量,改进对话和模拟器训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02934 2026-05-11 cs.SE 79%

AgenticSZZ: Temporal Knowledge Graph-Guided Agentic Bug-Inducing Commit Identification

AgenticSZZ: 基于时间知识图谱的代理式Bug引发提交识别

Yu Shi, Hao Li, Bram Adams, Ahmed E. Hassan

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.SE

AI总结 本文提出AgenticSZZ,利用时间知识图谱改进Bug引发提交识别,通过构建包含时间与结构关系的知识图谱,并结合LLM代理进行图搜索,提升识别精度与效果。

Comments Add RQ3 with open-source LLMs evaluation, such as DeepSeek-V4-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07062 2026-05-11 cs.SE cs.AI 79%

From Assistance to Agency: Rethinking Autonomy and Control in CI/CD Pipelines

从协助到自主:重新思考CI/CD流水线中的自主性与控制

Marcus Emmanuel Barnes, Taher A. Ghaleb, Safwat Hassan

机构 * Faculty of Information University of Toronto Toronto Ontario Canada(信息学院多伦多大学多伦多安大略加拿大) Department of Computer Science Trent University Peterborough Ontario Canada(计算机科学系特伦特大学彼得伯格安大略加拿大) University of Toronto(多伦多大学) Trent University(特伦特大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨CI/CD流水线中自主性与控制的重新定义,提出授权转移的设计挑战,分析当前系统在数据平面的操作限制,并提出控制平面安全与治理机制的研究方向。

Comments Accepted to the 3rd ACM International Conference on AI-Powered Software (AIware 2026), Main Track, Montreal, Canada, July 6-7, 2026. 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24661 2026-05-11 cs.RO 78%

Agent-Centric Observation Adaptation for Robust Visual Control under Dynamic Perturbations

以代理为中心的观测适应用于动态扰动下的鲁棒视觉控制

Zhengru Fang, Yu Guo, Fei Liu, Yuang Zhang, Yihang Tao, Senkang Hu, Wenbo Ding, Yuguang Fang

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出ACO-MoE方法,通过结合路由的修复专家和前景掩码分支,解决动态扰动下的视觉控制问题,提升下游任务性能。

Comments Source code is available at https://github.com/fangzr/aco-moe-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21582 2026-05-11 cs.CL cs.AI cs.HC 73%

VIDEE: Visual and Interactive Decomposition, Execution, and Evaluation of Text Analytics with Intelligent Agents

VIDEE:基于智能代理的文本分析可视化、交互式分解、执行与评估系统

Sam Yu-Te Lee, Chenyang Ji, Shicheng Wen, Lifu Huang, Dongyu Liu, Kwan-Liu Ma

机构 * Department of Computer Science, University of California at Davis(加州大学戴维斯分校计算机科学系)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 VIDEE通过人机协作流程帮助初级分析师进行高级文本分析,包含分解、执行和评估三个阶段,结合人类反馈和LLM评估,验证了系统在非专家用户中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07830 2026-05-11 cs.CR cs.AI 70%

CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios

CyBiasBench:用于网络攻击场景的LLM代理偏见基准测试

Taein Lim, Seongyong Ju, Munhyeok Kim, Hyunjun Kim, Hoki Kim

机构 * Chung-Ang University(Chung-Ang大学) Myongji University(Myongji大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出CyBiasBench,通过630次会话评估五个代理在三种目标和四种提示条件下的攻击偏见,揭示代理在攻击家族分配上的差异及偏见动量效应。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07247 2026-05-11 cs.AI 70%

EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation

EnvSimBench:一个评估和改进基于LLM的环境模拟的基准

Yi Liu, TingFeng Hui, Wei Zhang, Li Sun, Ningxin Su, Jian Wang, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Hong Kong University of Science and Technology(香港科技大学) Chongqing University(重庆大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出EnvSimBench,通过400个样本覆盖167种多样环境的严格基准,揭示了LLM在环境模拟中的关键能力缺口,并设计了约束驱动的模拟流程以提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19254 2026-05-11 cs.CL 70%

FinReasoning: A Hierarchical Benchmark for Reliable Financial Research Reporting

FinReasoning:一种用于可靠金融研究报告的分层基准

Yiyun Zhu, Yidong Jiang, Ziwen Xu, Yinsheng Yao, Dawei Cheng, Jinru Ding, Jie Xu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出FinReasoning分层基准,用于评估金融研究中的核心能力,区分模型在基础阶段如审计和修正中的表现,揭示模型能力分层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07630 2026-05-11 cs.CL cs.AI cs.LG 67%

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

安全,还是仅仅无能?重新思考手机使用代理的安全性评估

Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen, Zhengyao Fang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

机构 * Tencent Hunyuan(腾讯文言) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出PhoneSafety基准,通过700个关键安全时刻评估手机使用代理的安全性,发现更强的通用能力不等于更安全的选择,且无能行为更像是能力信号而非安全信号。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07447 2026-05-11 cs.CV cs.AI cs.CL cs.LG 67%

Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs

稀疏自编码器作为视觉语言模型中对抗攻击检测的即插即用防火墙

Hao Wang, Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh, Daisuke Kawahara

机构 * Magellan Technology Research Institute (MTRI)(马杰伦技术研究 institute) Waseda University(早稻田大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出基于稀疏自编码器的轻量级对抗攻击检测框架SAEgis,通过插入预训练VLM中的稀疏自编码模块,利用学习到的稀疏潜在特征检测对抗扰动输入,实验显示其在跨领域和跨攻击设置中表现优异,且无需额外对抗训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18991 2026-05-11 q-fin.TR cs.GT econ.GN q-fin.EC 67%

Who Restores the Peg? A Mean-Field Game Approach to Model Stablecoin Market Dynamics

谁恢复了锚定物?一种用于稳定币市场动态的均场博弈方法

Hardhik Mohanty, Bhaskar Krishnamachari

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 本文通过均场博弈框架研究稳定币脱锚事件中市场参与者行为,揭示了 arbitrage 和 retail traders 在恢复锚定物中的作用,并通过历史案例验证了主市场 arbitrage 对系统性压力的缓解作用。

Comments 9 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07840 2026-05-11 cs.LG 57%

RelAgent: LLM Agents as Data Scientists for Relational Learning

RelAgent:基于LLM的数据科学家用于关系学习

Xingyue Huang, Louis Tichelman, Jinwoo Kim, Krzysztof Olejniczak, İsmail İlkan Ceylan

机构 * University of Oxford(牛津大学) TU Wien(维也纳技术大学) AITHYRA(AITHYRA研究所) KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 RelAgent是一种基于LLM的关系学习自主数据科学家,通过两阶段流程构建SQL特征程序并选择预测模型,最终通过SQL查询和经典模型实现快速、确定性和可解释的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07823 2026-05-11 cs.CL 57%

SCENE: Recognizing Social Norms and Sanctioning in Group Chats

SCENE:识别社交规范并实施制裁在群聊中

Mateusz Jacniacki, Maksymilian Bilski

机构 * HumaLike

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 SCENE旨在通过多角色聊天场景识别隐性社交规范并实施制裁,评估LLM在动态社交互动中的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04712 2026-05-11 cs.LG 57%

SPHERE: Mitigating the Loss of Spectral Plasticity in Mixture-of-Experts for Deep Reinforcement Learning

SPHERE: 缓解混合专家在深度强化学习中的频谱可塑性损失

Lirui Luo, Guoxi Zhang, Hongming Xu, Cong Fang, Qing Li

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出SPHERE,通过引入Parseval惩罚来缓解混合专家策略在持续学习中的频谱可塑性损失,提升了MetaWorld和HumanoidBench的持续强化学习性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05777 2026-05-11 cs.AI 57%

Emergent social transmission of model-based representations without inference

涌现的社会传递模型基于表示而无需推理

Silja Keßler, Miriam Bautista-Salinero, Claudio Tennie, Charley M. Wu

机构 * University of Tübingen(图宾根大学) Technical University Darmstadt(达姆施塔特技术大学) Hessian AI(黑森人工智能)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了在有限认知能力下,人们如何通过他人获取丰富灵活的知识,发现通过简单社会线索而非推理可实现高级表示的间接传递。

Comments Code available at https://github.com/skessler01/social-transmission-rl.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09652 2026-05-11 cs.AI 57%

MiniAppBench: Evaluating the Shift from Text to Interactive HTML Responses in LLM-Powered Assistants

MiniAppBench:评估从文本到交互式HTML响应的转变

Zuhao Zhang, Chengyue Yu, Yuante Li, Chenyi Zhuang, Linjian Mo, Shuai Li

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出MiniAppBench,首个评估原理驱动交互应用生成能力的基准,通过10M+生成数据提炼500个任务,结合MiniAppEval框架评估意图、静态和动态维度,揭示LLM在生成高质量交互应用上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01333 2026-05-11 cs.CL 57%

OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

OralMLLM-Bench: 评估多模态大语言模型在牙科实践中的认知能力

Rongyang Wang, Shuang Zhou, Jiashuo Wang, Wenya Xie, Xiaoxia Che

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文提出OralMLLM-Bench,通过27个临床任务评估多模态大语言模型在牙科影像分析中的认知能力,揭示模型与牙科医生的性能差异及改进方向。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21858 2026-05-11 cs.AI 57%

ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence on Mobile Devices

ProactiveMobile: 一个全面的基准,用于提升移动设备上的主动智能

Dezhi Kong, Zhengzhao Feng, Qiliang Liang, Hao Wang, Haofei Sun, Changpeng Yang, Yang Li, Peng Zhou, Shuai Nie, Hongzhen Wang, Linfeng Zhou, Hao Jia, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(小米公司HyperAI团队) Zhejiang University(浙江大学) Peking University(北京大学) Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出ProactiveMobile基准,通过多模态大语言模型在移动代理中实现主动智能,通过63个API生成可执行函数序列,实验表明Qwen2.5-VL-7B-Instruct在主动智能任务中表现优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02382 2026-05-11 eess.IV cs.AI cs.CV 57%

Benchmark of Segmentation Techniques for Pelvic Fracture in CT and X-ray: Summary of the PENGWIN 2024 Challenge

CT和X射线中骨盆骨折分割技术的基准测试:PENGWIN 2024挑战总结

Yudi Sang, Yanzhen Liu, Sutuke Yibulayimu, Yunning Wang, Benjamin D. Killeen, Mingxu Liu, Ping-Cheng Ku, Ole Johannsen, Karol Gotkowski, Maximilian Zenk, Klaus Maier-Hein, Fabian Isensee, Peiyan Yue, Yi Wang, Haidong Yu, Zhaohong Pan, Yutong He, Xiaokun Liang, Daiqi Liu, Fuxin Fan, Artur Jurgas, Andrzej Skalski, Yuxi Ma, Jing Yang, Szymon Płotka, Rafał Litka, Gang Zhu, Yingchun Song, Mathias Unberath, Mehran Armand, Dan Ruan, S. Kevin Zhou, Qiyong Cao, Chunpeng Zhao, Xinbao Wu, Yu Wang

机构 * Beijing Rossum Robot Technology Co., Ltd.(北京罗素机器人科技有限公司) Key Laboratory of Biomechanics and Mechanobiology, Ministry of Education, Beijing Advanced Innovation Center for Biomedical Engineering, School of Biological Science and Medical Engineering, Beihang University(生物力学与机械生物学重点实验室,教育部,北京生物医学创新中心,生物科学与医学工程学院,北航) Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Division of Medical Image Computing, German Cancer Research Center (DKFZ)(医学影像计算部,德国癌症研究中心(DKFZ)) Helmholtz Imaging, Heidelberg(海德堡大学医院影像中心) Smart Medical Imaging, Learning and Engineering (SMILE) Lab, Medical UltraSound Image Computing(智能医学影像、学习与工程(SMILE)实验室,医学超声影像计算)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文通过PENGWIN 2024挑战评估了CT和X射线中骨盆骨折分割技术,发现CT分割准确率较高,但X射线分割仍需进一步改进,揭示了分割方法的多样性及片段定义的不确定性。

Comments PENGWIN 2024 Challenge Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07851 2026-05-11 cs.HC 50%

A Roadmap of Mixed Reality Body Doubling for Adults with ADHD

混合现实身体双人技术在ADHD成人中的应用路线图

Valerie Tan, Kimberly Hegemann, Jens Gerken

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出混合现实身体双人技术的十二维度框架,旨在揭示ADHD成人自我管理中的研究空白与未来发展方向。

Comments 9 pages, 2 figures, accepted short paper submission to a CHI 2026 conference workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26509 2026-05-11 cs.RO cs.CV 50%

3D Generation for Embodied AI and Robotic Simulation: A Survey

用于具身AI和机器人模拟的3D生成:综述

Tianwei Ye, Yifan Mao, Minwen Liao, Jian Liu, Chunchao Guo, Dazhao Du, Quanxin Shou, Fangqi Zhu, Song Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Wuhan University(武汉大学) Harbin Institute of Technology(哈尔滨工业大学) Xinjiang University(新疆大学) Tencent(腾讯)

专题命中 Agent评测 :agentic(abstract)

AI总结 本文综述了用于具身AI的3D生成,探讨了其在数据生成、模拟环境构建和Sim2Real桥梁中的作用,指出领域正从视觉真实转向交互准备,并识别了物理标注有限、几何质量与物理有效性差距等主要瓶颈。

Comments 27 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06746 2026-05-11 cs.NE 50%

The Causally Emergent Alignment Hypothesis: Causal Emergence Aligns with and Predicts Final Reward in Reinforcement Learning Agents

因果涌现对齐假说:因果涌现与强化学习代理最终奖励对齐并预测

Federico Pigozzi, Michael Levin

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨因果涌现与强化学习代理奖励之间的关系,发现因果涌现能预测最终奖励并促进表示动态与奖励提升对齐。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08194 2026-05-11 cs.HC 50%

From Fixed to Flexible: Shaping AI Personality in Context-Sensitive Interaction

从固定到灵活:在情境敏感交互中塑造AI个性

Shakyani Jayasiriwardene, Hongyu Zhou, Weiwei Jiang, Benjamin Tag, Nicholas Koemel, Matthew Ahmadi, Jorge Goncalves, Emmanuel Stamatakis, Anusha Withana, Zhanna Sarsenbayeva

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨用户期望如何在动态调整AI个性时形成和演变,通过混合方法研究发现,情境敏感性影响个性配置轨迹,提升用户信任和拟人化感知。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08989 2026-05-11 math.OC math.PR 50%

Agency Problems and Adversarial Bilevel Optimization under Uncertainty and Cyber Threats

代理问题与不确定性和网络威胁下的对抗双层优化

Thibaut Mastrolia, Haoze Yan

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在不确定性和网络威胁下,领导者设计最优激励方案以提高高风险项目的价值,通过双层随机优化问题,结合跳跃第二类BSDE和积分-偏Hamilton-Jacobi-Bellman-Isaacs方程,提出鲁棒随机控制方法以应对网络攻击带来的不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12221 2026-05-11 math.OC 50%

Multiple Approximate-Response Agents (MARA): Fast Near-Optimal Primal Recovery for Distributed Optimization

多重近似响应代理(MARA):分布式优化中的快速近优对偶恢复

Tetiana Parshakova, Yicheng Bai, Garrett van Ryzin, Stephen Boyd

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出MARA方法,通过并行生成多个近优 primal 响应,快速减少对偶不可行性,提升分布式优化的收敛速度与解的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏