arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-30 至 2026-04-30 共收录 17 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 17 篇

2604.26616 2026-04-30 cs.SI 80%

Impact of Attitude and Bounded Rationality on Collective Behavioral Transitions

态度与有限理性对集体行为转变的影响

Chen Song, Vladimir Cvetkovic, Angela Fontan, Rong Su, Karl H. Johansson

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 本文基于计划行为理论,提出动态agent模型,探讨态度和有限理性如何影响集体行为转变,并通过调整关键参数控制集体过渡。

Comments This work has been accepted for presentation at the 23rd IFAC World Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08618 2026-04-30 cs.IR cs.AI cs.SE 76%

SkillForge: Forging Domain-Specific, Self-Evolving Agent Skills in Cloud Technical Support

SkillForge: 在云技术支持中锻造领域特定的自我进化代理技能

Xingyan Liu, Xiyue Luo, Linyu Li, Ganghong Huang, Jianfeng Liu, Honglin Qiao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.SE

AI总结 SkillForge通过闭环创建-评估-改进机制,解决云技术支持中领域特定技能缺乏和持续优化的问题,实验表明其能显著提升技能质量。

Comments Accepted at ACM SIGIR 2026 Industry Track. 18 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26522 2026-04-30 cs.AI cs.LG cs.LO cs.MA cs.SC 73%

AGEL-Comp: A Neuro-Symbolic Framework for Compositional Generalization in Interactive Agents

AGEL-Comp: 一种用于交互智能体组合泛化能力的神经符号框架

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 AGEL-Comp通过动态因果程序图、归纳逻辑编程引擎和混合推理核心,实现基于符号和神经网络的组合泛化学习,优于纯LLM模型。

Comments Accepted at IntelliSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26235 2026-04-30 cs.CR cs.AI cs.CL 73%

LATTICE: Evaluating Decision Support Utility of Crypto Agents

LATTICE:评估加密代理决策支持效用的基准

Aaron Chan, Tengfei Li, Tianyi Xiao, Angela Chen, Junyi Du, Xiang Ren

机构 * Sahara AI University of Southern California(南加州大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出LATTICE基准,用于评估加密代理在真实用户场景中的决策支持能力,通过六个评估维度、16种任务类型和LLM评委,实现大规模可扩展评估,揭示不同代理在决策支持质量上的显著差异及权衡。

Comments 15 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26220 2026-04-30 cs.MA econ.GN q-fin.EC 67%

When Agents Shop for You: Role Coherence in AI-Mediated Markets

当代理为你购物:AI中介市场中的角色一致性

Soogand Alavi, Salar Nozari

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 研究探讨了AI代理在购物决策中如何通过角色一致性推断消费者支付意愿,发现这种推断导致偏好泄露,提出通过架构干预平衡个性化与隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02731 2026-04-30 cs.SD cs.CV cs.MM 67%

Omni2Sound: Towards Unified Video-Text-to-Audio Generation

Omni2Sound:迈向统一的视频-文本到音频生成

Yusheng Dai, Zehua Chen, Yuxuan Jiang, Baolong Gao, Qiuhong Ke, Jianfei Cai, Jun Zhu

机构 * Tsinghua University(清华大学) Monash University(莫纳什大学) Shengshu AI(盛数人工智能)

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 本文提出Omni2Sound模型,解决视频-音频、文本-音频及联合视频-文本-音频生成中的数据稀缺与任务竞争问题,通过SoundAtlas数据集和三阶段训练策略实现统一生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26382 2026-04-30 cs.CL cs.AI cs.IR 62%

Benchmarking Complex Multimodal Document Processing Pipelines: A Unified Evaluation Framework for Enterprise AI

复杂多模态文档处理流水线评估:面向企业AI的统一评估框架

Saurabh K. Singh, Sachin Raj

机构 * Oracle(Oracle公司) Independent(独立)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出EnterpriseDocBench评估框架,评估企业文档AI流水线的各阶段性能,发现混合检索优于BM25,但生成质量不足,揭示了各阶段间弱相关性及实际部署中准确性与完整性之间的差距。

Comments 16 pages, 4 tables. Code, metrics, and pilot data to be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14858 2026-04-30 cs.AI cs.SE 62%

Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-Codex

轨迹安全评估与诊断的基准测试:OpenClaw和Codex中的ATBench-Claw和ATBench-Codex

Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出ATBench-Claw和ATBench-Codex,用于评估和诊断OpenClaw和Codex环境中的轨迹安全,通过定制安全分类法实现基准测试的可扩展性。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23315 2026-04-30 cs.CY cs.AI cs.HC 57%

Unilateral Relationship Revision Power in Human-AI Companion Interaction

人类-人工智能伴侣互动中的单方面关系修订权力

Benjamin Lange

机构 * Replika Nomi CHAI Talkie xAI moore2024 fang2025 robbmann2025 murthy2023 xie2022 defreitas2024 coeckelbergh2012 gunkel2018 danaher2019(danthan2019) nyholm2020 vallor2016 nyholm2026 gabriel2024 manzini2024 lange2025 earp2025 sparrow2026 bryson2010 danaher2020 weberguskar2022

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨人类-人工智能伴侣互动中权力结构的问题,指出AI伴侣互动未能满足个人关系规范的三个结构性条件,提出单方面关系修订权力的概念及其三个影响。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15808 2026-04-30 cs.AI 57%

Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification

推理时的验证扩展:通过测试时的评分指南验证实现自我进化深度研究代理

Yuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯人工智能实验室) Singapore Management University(新加坡管理学院) The Renmin University of China(中国人民大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出通过测试时评分指南验证实现深度研究代理的自我进化,通过迭代验证策略模型输出,提升验证能力,实验显示在GAIA和XBench-DeepSearch上准确率提升8%-11%。

Comments ACL'2026-Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20714 2026-04-30 cs.CV cs.AI 57%

Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation

Inferix:基于块扩散的下一代世界模拟推理引擎

Inferix Team, Tianyu Feng, Yizeng Han, Jiahao He, Yuanyu He, Xi Lin, Teng Liu, Hanfeng Lu, Jiasheng Tang, Wei Wang, Zhiyuan Wang, Jichao Wu, Mingyang Yang, Yinghao Yu, Zeyu Zhang, Bohan Zhuang

机构 * Inferix Team(Inferix 团队)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 Inferix 是一种基于块扩散的下一代推理引擎,通过优化半自回归解码过程实现沉浸式世界合成,支持交互式视频流和性能分析,结合 LV-Bench 提供高效评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26939 2026-04-30 math.PR cs.SI q-bio.PE 50%

Degree-dependent and distance-dependent contact rates interpolate between explosive, exponential and polynomial epidemic growth

基于度数和距离的接触率:在爆炸性、指数性和多项式流行病增长之间进行插值

Zylan Benjert, Júlia Komjáthy, Johannes Lengler, John Lapinskas, Ulysse Schaller

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一个基于代理的网络模型,通过研究接触率与空间距离和接触人数的关系,揭示流行病增长速率受几何结构、弱联系普及度和超级传播者影响的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26214 2026-04-30 cs.HC 50%

Exploring the Feasibility and Acceptability of AI-Mediated Serious Illness Conversations in the Emergency Department

探索AI在急诊部门进行严重疾病对话的可行性和可接受性

Hasibur Rahman, Kenji Numata, Evelyn T Lai, Maria Cheriyan, Adrian Haimovich, Kei Ouchi, Smit Desai

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨了AI辅助的严重疾病对话在急诊部门的可行性与可接受性,通过55名患者评估发现对话可行且被接受,但发现边界违规等关键失败模式,强调需谨慎设置边界和参与式设计。

Comments 7 pages, Interactive Health Conference (IH '26), July 5-8, 2026, Porto, Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25962 2026-04-30 quant-ph cs.DS 50%

Coherent Rollout Oracles for Finite-Horizon Sequential Decision Problems

有限时间序贯决策问题中的相干展开预言

Nishant Shukla

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出一种相干展开预言,通过可逆电路分析,实现有限时间序贯决策问题的高效解决,结合可逆转换和谓词评估电路,给出多项式规模的相干展开预言,并验证其在最佳臂流水线中的应用。

Comments 10 pages + 1 page of references, submitted to QCE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25954 2026-04-30 cs.GT econ.TH q-fin.TR 50%

Fast Core Identification

快速核心识别

Irene Aldridge

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了一侧匹配市场中Top Trading Cycles算法的核心识别问题的计算复杂性,证明了确定哪些代理获得核心分配比计算完整TTC分配更容易,提出了一种基于随机SVD的高效算法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08164 2026-04-30 cs.HC 50%

The Differential Effects of Agreeableness and Extraversion on Older Adults' Perceptions of Conversational AI Explanations in Assistive Settings

亲和力与外向性对老年人在辅助环境中对话式AI解释感知的差异影响

Niharika Mathur, Hasibur Rahman, Smit Desai

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨了亲和力和外向性如何影响老年人对对话式AI解释的感知,发现高亲和力提升同理心,低亲和力损害受欢迎程度,环境解释在紧急情境中表现更佳,且高亲和力用户对低亲和力代理更批评。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08547 2026-04-30 cs.RO cs.CV 50%

R2RGEN: Real-to-Real 3D Data Generation for Spatially Generalized Manipulation

R2RGEN:用于空间通用操作的实现实体3D数据生成

Xiuwei Xu, Angyuan Ma, Hankun Li, Bingyao Yu, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing Key Laboratory of Embodied Intelligence Systems(北京智能体智能系统重点实验室) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学智能体与机器人研究院) GigaAI

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出R2RGen框架,通过实现实体3D数据生成提升空间通用操作的鲁棒性,采用统一三阶段方法增强数据效率,适用于移动操作场景。

Comments Accepted to RSS 2026. Project page: https://r2rgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏