arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-15 至 2026-05-15 共收录 194 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 37 篇

2605.14779 2026-05-15 cs.LG 57%

Peng's Q($λ$) for Conservative Value Estimation in Offline Reinforcement Learning

彭的Q(λ)在离线强化学习中的保守价值估计

Byeongchan Kim, Min-hwan Oh

机构 * Seoul National University(首尔国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于离线多步强化学习的算法CPQL,通过保守价值估计替代贝尔曼算子,实现了更优的性能保证和鲁棒性改进。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14542 2026-05-15 cs.AI 57%

VerbalValue: A Socially Intelligent Virtual Host for Sales-Driven Live Commerce

VerbalValue:面向销售驱动直播电商的社会智能虚拟主持人

Yuyan Chen

机构 * Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出VerbalValue,一种以销售转化为导向的虚拟主持人,通过构建产品知识库和销售术语词典,结合大语言模型微调,提升直播电商中的信息传达和说服力。

Comments Accepted to the CVPR 2026 HiGen Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14350 2026-05-15 cs.LG 57%

Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling

通过自适应任务采样实现分布鲁棒多任务强化学习

Nicholas E. Corrado, Wenyuan Huang, Josiah P. Hanna

机构 * Computer Sciences Department(计算机科学系) University of Wisconsin – Madison(威斯康星大学麦迪逊分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出DRATS算法,通过自适应优先采样未被解决的任务,提升多任务强化学习的数据效率和最差任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14261 2026-05-15 cs.AI cs.GT 57%

Heuristic Pathologies and Further Variance Reduction via Uncertainty Propagation in the AIVAT Family of Techniques

启发式病态及通过不确定性传播进一步方差缩减在AIVAT技术家族中

Juho Kim, Tuomas Sandholm

机构 * CMU Strategic Machine, Inc.(CMU战略机器公司) Strategy Robot, Inc.(策略机器人公司) Optimized Markets, Inc.(优化市场公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了AIVAT技术中启发式价值函数的潜在漏洞,并通过不确定性传播进一步减少方差,实验显示可减少43%的样本需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15620 2026-05-15 cs.LG 57%

Closing the Gap on the Sample Complexity of 1-Identification

缩小1-识别问题样本复杂度的差距

Zitian Li, Wang Chi Cheung

机构 * Department of Industrial Systems Engineering & Management(工业系统工程与管理系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了多臂老虎机中的1-识别问题,提出新的下界和算法,统一界内匹配至多项式对数因子,补充了多合格臂情况下的样本复杂度分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14067 2026-05-15 cs.LG 57%

Comparative Evaluation of Machine Learning Approaches for Minority-Class Financial Distress Prediction Under Class Imbalance Constraints

机器学习方法在类不平衡约束下对少数类财务困境预测的比较评估

Karan Sehgal, Khawar Naveed Bhatti

机构 * Kent Business School(肯特商学院) University of Kent(肯特大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文比较了统计方法、集成学习和神经网络模型在类不平衡数据下的少数类财务困境预测效果,验证了梯度提升方法在严重不平衡情况下的优越性。

Comments 16 pages, 4 figures, preprint under review. Applied machine learning evaluation involving imbalance-aware financial distress prediction, ensemble learning, SMOTE, and SHAP explainability analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13849 2026-05-15 cs.AI 57%

Mixed Integer Goal Programming for Personalized Meal Optimization with User-Defined Serving Granularity

带有用户定义服务粒度的混合整数目标规划用于个性化餐优化

Francisco Aguilera Moreno

机构 * March 2026(2026年3月)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出混合整数目标规划(MIGP)解决个性化餐优化中的服务粒度和营养约束问题,通过整数变量和目标规划偏差实现更灵活的营养目标,且在多数情况下优于传统方法。

Comments 34 pages, 6 figures, open-source implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15033 2026-05-15 cs.SI cs.CC 50%

On the Limits of PAC Learning of Networks from Opinion Dynamics

关于从意见动态中学习网络的极限

Dmitry Chistikov, Luisa Estrada, Mike Paterson, Paolo Turrini

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨了在意见动态下学习网络结构的限制,提出在阈值规则下存在高效的PAC学习算法,而在多数规则下证明不存在高效算法,并提出有效的启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14485 2026-05-15 econ.TH 50%

Efficient liability assignment under shock propagation

高效冲击传播下的责任分配

Jens Gudmundsson, Jens Leth Hougaard, Kohmei Makihara, Alexandros Rigos

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究冲击沿网络中代理选择的路径传播,分析代理取消出边导致系统性成本,并提出基于路径的权重分配方法,该方法与路径计数合作游戏的Shapley值一致,可高效计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14339 2026-05-15 cs.NI 50%

Sub-Band Full Duplex Resource Allocation: A Predictive Deep Reinforcement Learning Approach

子带全双工资源分配:一种预测深度强化学习方法

Abhiram D, Aiswarya Rajan, Arin Shemeem, Vipindev Adat Vasudevan, Abdulla P

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种预测深度学习框架,用于子带全双工系统中的动态子带分配,通过结合双向长短期记忆网络与双深度Q网络,实现实时资源分配,提升频谱利用率并减少队列堆积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18216 2026-05-15 cs.GT cs.DS 50%

A Counterexample to EFX $n \ge 3$ Agents, $m \ge n + 5$ Items, Submodular Valuations via SAT-Solving

对EFX分配存在性的反例:n≥3个代理,m≥n+5个物品,单调估值 via SAT求解

Hannaneh Akrami, Alexander Mayorov, Kurt Mehlhorn, Shreyas Srinivas, Christoph Weidenbach

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过SAT求解证明了当n≥3且m≥n+5时,EFX分配不一定存在,同时为三个代理和七件物品证明了EFX分配的存在性,并给出了三个代理的公平分配正向保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10299 2026-05-15 cs.CR 50%

The Role of Learning in Attacking ML-based Network Intrusion Detection

对抗学习在基于机器学习的网络入侵检测中的作用

Kyle Domico, Jean-Charles Noirot Ferrand, Patrick McDaniel

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出轻量级对抗代理,利用强化学习评估ML入侵检测模型鲁棒性,通过离线学习生成可重用策略,提升攻击效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22051 2026-05-15 econ.TH cs.GT 50%

Centralization and Stability in Formal Constitutions

形式宪法中的集中化与稳定性

Yotam Gafni

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了形式宪法中自我维持SCF对集中化的影响,通过不同信念假设和规则,证明了在特定条件下只有独裁者能维持自身,其他SCF最终会导向独裁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13016 2026-05-15 cs.CV 50%

SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding

SVAG-Bench:多实例时空视频动作定位的大规模基准

Tanveer Hannan, Shuaicong Wu, Mark Weber, Suprosanna Shit, Jindong Gu, Rajat Koner, Aljoša Ošep, Laura Leal-Taixé, Thomas Seidl

机构 * LMU Munich(慕尼黑大学) MCML Technical University of Munich(慕尼黑技术大学) University of Zurich(苏黎世大学) University of Oxford(牛津大学) Amazon(亚马逊) NVIDIA(英伟达)

专题命中 Agent评测 :planning(abstract)

AI总结 SVAG-Bench通过多实例整合任务,评估模型在复杂场景中对动作的时空定位能力,包含688个视频和19590个注释,支持细粒度评估多主体歧义消除和动作组合性。

详情

展开后加载摘要…

URL PDF HTML 收藏