arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1135 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1135 篇

2606.16493 2026-06-16 q-fin.MF 新提交 50%

Forward Hedging Reshapes Incentive Provision

远期套期保值重塑激励提供

René Aïd, Nizar Touzi, Stéphane Villeneuve

专题命中 Agent评测 :agent(abstract)

AI总结 研究在道德风险下,风险厌恶的委托人通过远期市场套期保值对代理人的激励影响,发现委托代理与外部套期保值部分替代,且委托代理下套期保值需求降低,推高均衡远期价格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16380 2026-06-16 econ.TH 新提交 50%

Informative Consumption

信息性消费

Xuehan Jiang, Xi Zhi Lim

专题命中 Agent评测 :agent(abstract)

AI总结 本文公理化地刻画了风险消费中的消费-信息权衡,通过分离客观风险与主观风险,将确定性等价分解为标准风险溢价和信息溢价,并引入可参数化模型以捕捉风险厌恶与信息激励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14887 2026-06-16 econ.EM econ.GN q-fin.EC 新提交 50%

Estimating Sloppy Directions via KDE: The Case of Kirman's Ants

通过KDE估计松散方向:以Kirman蚂蚁模型为例

Karl Naumann-Woleske

专题命中 Agent评测 :agent(abstract)

AI总结 本文使用核密度估计(KDE)从模拟数据中估计Fisher信息矩阵,以识别随机非线性模型中的松散方向,并以Kirman蚂蚁模型为例验证了KDE方法在有限模拟预算下的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14819 2026-06-16 cs.MA physics.soc-ph 新提交 50%

Selective Control under Noisy Perception: Governance Failures Hidden by Aggregate Metrics in Modular Networks

噪声感知下的选择性控制:模块化网络中聚合指标隐藏的治理失败

Igor Itkin

专题命中 Agent评测 :agent(abstract)

AI总结 通过智能体模型揭示,内容审核系统在标准准确率指标上表现良好,但错误集中在连接不同社区的桥梁用户上,导致治理损失倍增,而聚合指标无法反映这种伤害。

Comments 39 pages, 7 figures. Code and data: https://github.com/YehudaItkin/noisy-perception-governance

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14091 2026-06-15 eess.AS 新提交 50%

Who Spoke When in Multi-Conversation: Target Speaker Tagging Task and Benchmark

多对话中谁在何时发言:目标说话人标记任务与基准

Minjae Lee, Hee-Soo Heo, Youngki Kwon, Han-Gyu Kim, You Jin Kim, Bong-Jin Lee

专题命中 Agent评测 :workflow(abstract)

AI总结 提出目标说话人标记任务,整合说话人日志、验证和识别,构建大规模合成基准TST-Bench,实验表明该任务具有独特挑战,专用系统设计优于现有方案。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14201 2026-06-15 cs.DB 新提交 50%

TACO: A Benchmark for Open-Domain Text-to-SQL with Ambiguous and Cross-Database Queries

TACO:面向开放域、含歧义和跨数据库查询的文本到SQL基准

Chao Deng, Ju Fan, Yuyu Luo, Qinliang Xue, Meihao Fan, Yuxin Zhang, Min Zhang, Xiaofeng Jia, Jing Zhang, Xiaoyong Du

专题命中 Agent评测 :planning(abstract)

AI总结 提出TACO基准,包含1500个真实和13000个合成示例,覆盖开放域、歧义和跨数据库查询,通过基线TACO-SQL揭示现有方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13980 2026-06-15 cs.GT cs.CC 新提交 50%

On Cutting Cakes and Crossing Curves

论切蛋糕与穿越曲线

Alexandros Hollender, Gilbert Maystre, Kilian Risse

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过揭示蛋糕切割与Jordan曲线问题的新联系,证明了三名代理人情况下无嫉妒蛋糕切割问题的计算复杂性,并首次给出了Jordan曲线问题的查询下界和UEOPL难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13640 2026-06-12 cs.SD 新提交 50%

The Moving Drone: Negotiating Agency Between the Voice and the Virtual

移动的无人机:在声音与虚拟之间协商能动性

Nithya Shikarpur, Victor Arul, Anna Huang

机构 * Massachusettes Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract)

AI总结 基于印度斯坦音乐,通过Max/MSP循环器和生成式AI模型GaMaDHaNi,将传统静态无人机变为动态、主动的虚拟音乐代理,探讨人机协作中的能动性。

Comments Published in NIME music track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13332 2026-06-12 cs.CV 新提交 50%

OR-Action: Multi-Role Video Understanding with Fine-Grained Actions

OR-Action: 细粒度动作的多角色视频理解

Felix Tristram, Ege Özsoy, Christian Benz, Marcel Walch, Ghazal Ghazaei, Nassir Navab

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Carl Zeiss AG(卡尔蔡司股份公司)

专题命中 Agent评测 :workflow(abstract)

AI总结 针对手术室活动理解中场景图方法缺乏时间建模的问题,提出基于公开数据集的细粒度多角色动作基准,并引入纯视觉时序模型,显著优于图方法,同时提出多视角到单视角特征对齐策略提升单视角性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13057 2026-06-12 cs.GT 新提交 50%

Approximate Maximin Share with Subjective Divisibility: Beating the 1/2 Barrier

主观可分割性下的近似最大最小份额:突破1/2障碍

Xiaohui Bei, Ke Ding, Bo Li, Fangxiao Wang

专题命中 Agent评测 :agent(abstract)

AI总结 针对主观可分割性下的公平分配问题,本文证明一元估值下最优近似比为2/3,并设计算法将一般情形的近似保证从1/2提升至5/9,对至多四个智能体给出紧的2/3近似。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13431 2026-06-12 physics.soc-ph q-fin.RM 新提交 50%

Adaptive rerouting reshapes impacts of maritime chokepoint disruptions

自适应重新路由重塑海上咽喉点中断的影响

Mitja Devetak, Jasper Verschuur, Peter Klimek

专题命中 Agent评测 :agent(abstract)

AI总结 通过全球商船队基于主体的模型,量化自适应重新路由在咽喉点关闭下对到达损失的影响,揭示损失动态取决于路由、时间和区域暴露,而非静态网络拓扑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12341 2026-06-11 cs.CR 新提交 50%

OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents

OCELOT:面向隐私保护LLM代理的推理泄露预算

Jin Xie, Songze Li

专题命中 Agent评测 :agent(abstract)

AI总结 提出OCELOT运行时中介,通过后验风险控制和证人验证降级机制,在代理轨迹中预算对手信念更新,平衡任务效用与隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11980 2026-06-11 cs.HC 新提交 50%

Somewhere Over the Desktop: A Research Agenda for Ubiquitous Analytics

超越桌面:无处不在分析的研究议程

Niklas Elmqvist, Panagiotis D. Ritsos, Peter W. S. Butcher

专题命中 Agent评测 :agentic(abstract)

AI总结 空间计算、生成式AI与开放网络标准融合,催生无处不在分析(UA)新机遇,通过梳理认知、上下文、交互等七大领域交叉,提出42个未来研究挑战。

Comments 15 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11397 2026-06-11 cs.GT econ.TH 新提交 50%

Invariant Price of Anarchy and Multiplicative Smoothness

无政府价格不变性与乘法平滑性

Ilia Shilov, Heinrich H. Nax, Saverio Bolognani

专题命中 Agent评测 :agent(abstract)

AI总结 针对基数不可比框架,提出乘法平滑性条件,推导无政府价格的不变性界,并扩展到粗相关均衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11231 2026-06-11 cs.CV 新提交 50%

CFCamo: A Counterfactual Detect-or-Abstain Framework for Camouflaged Object Detection

CFCamo:一种用于伪装目标检测的反事实检测或放弃框架

Suhang Li, Osamu Yoshie, Yuya Ieiri

机构 * Graduate School of Information, Production and Systems, Waseda University(早稻田大学信息生产系统研究生院)

专题命中 Agent评测 :agent(abstract)

AI总结 提出CFCamo框架,通过反事实配对训练和策略优化,使COD模型在检测到目标时输出结果,在无目标时放弃检测,解决了正样本训练导致的过度检测偏差。

Comments 10 pages, 7 figures, 5 tables. Code and data: https://github.com/suhang2000/CFCamo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11494 2026-06-11 math.OC econ.TH 新提交 50%

Epistemic fair division of independence structures

独立性结构的认知公平分配

Marcin Anholcer, Maciej Bartkowiak, Bartłomiej Bosek, Jarosław Grytczuk

专题命中 Agent评测 :agent(abstract)

AI总结 研究在独立性结构约束下(如网络中的无环边集)的公平分配问题,证明了当代理人数至少为图的树性时,存在至多一个物品嫉妒(EF1)的分配,并进一步对任意加性估值证明了认知EF1分配的存在性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11053 2026-06-10 econ.TH 新提交 50%

Revealing information -- or not -- in a social network of traders

揭示信息——或不揭示——在交易者社交网络中

Patrick Allmis, Paolo Pin, Fernando Vega Redondo

专题命中 Agent评测 :agent(abstract)

AI总结 基于Kyle(1985)的资产交易微观基础模型,研究知情交易者为何可能主动分享信息,并发现均衡中信息部分揭示,导致价格不完全反映资产回报,影响社会剩余分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10681 2026-06-10 econ.TH 新提交 50%

Limited belief propagation and contingent thinking

有限信念传播与权变思维

Andrew Ellis, Ran Spiegler

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过有向无环图上的有限推理步骤,刻画了观察后信念更新的非贝叶斯特征,解释了相关忽视和迭代期望违背,并应用于公共品供给和社会学习博弈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10330 2026-06-10 cs.GT cs.CY stat.AP 新提交 50%

The Power of Altruism in Sticker Economics: Generosity Minimizes Collective Costs and Overprotective Norms Fuel Inefficiency

利他主义在贴纸经济学中的力量:慷慨最小化集体成本,过度保护规范导致低效率

Luana Ferraz Alvarenga, Caetano Alvarenga Costa, César Rennó-Costa

专题命中 Agent评测 :agent(abstract)

AI总结 通过基于智能体的建模和蒙特卡洛模拟,研究社区规范如何影响FIFA世界杯贴纸收集的集体效率,发现过度保护策略增加成本,而慷慨策略优化网络流动性并显著减少不良运气的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10261 2026-06-10 cs.GT 新提交 50%

Leveraging Machine-Learned Advice in Strategic Interactions with No-Regret Learners

利用机器学习建议与无悔学习者的策略互动

Tinashe Handina, Tongxin Li, Kishan Panaganti, Eric Mazumdar, Adam Wierman

专题命中 Agent评测 :agent(abstract)

AI总结 研究在与无悔学习者博弈时,如何有效利用可能不完美的建议,通过引入伪度量量化建议有用性,并展示其在模拟器和收益矩阵预测中的应用,证明好建议能降低计算近似Stackelberg策略的交互复杂度。

Comments AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10599 2026-06-10 math.NA cs.NA 新提交 50%

Nonlocal modeling of opinion alignment and environmental feedback: Spatial aggregation and non-consensus patterns

意见对齐与环境反馈的非局部建模:空间聚集与非共识模式

Rui Wang, Yunfeng Xiong, Zhengru Zhang, Xiaofei Zhao

专题命中 Agent评测 :agent(abstract)

AI总结 提出一个注意力介导反馈的空间意见动力学模型,通过非局部对齐与注意力场耦合,推导出非局部对流-交叉扩散系统,分析显示注意力反馈扩大非共识聚类参数区间,促进空间异质性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10081 2026-06-10 math.OC 新提交 50%

Branch and Price for Railway Crew Scheduling: Benchmark Instances and Computational Study

铁路乘务调度的分支定价法:基准实例与计算研究

Bart van Rossum

专题命中 Agent评测 :planning(abstract)

AI总结 提出一种先进的分支定价算法,并构建75个基准实例,通过计算实验表明原始启发式方法有效将最优性差距降至1%以下,而分支和降价固定贡献有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09176 2026-06-09 cs.MA cs.IT math.IT 新提交 50%

Performance Evaluation of Social Learning

社会学习的性能评估

Felice Scala, Marco Carpentiero, Vincenzo Matta, Ali H. Sayed

专题命中 Agent评测 :agent(abstract)

AI总结 针对社会学习中错误信念消失率作为性能指标的悖论,提出错误概率作为替代度量,并在二元高斯问题中推导出分散与集中错误概率之间的不可约差距。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08568 2026-06-09 cs.CY 新提交 50%

Regulating the AI Tutor: Intentions, Help-Seeking, and Self-Regulated Learning in Adolescent GenAI Use

调控AI导师:青少年使用生成式AI时的意图、求助行为与自我调节学习

Rania Abdelghani, Peter Kaiser, Kou Murayama

专题命中 Agent评测 :agentic(abstract)

AI总结 研究通过98名九年级学生的对话数据,分析青少年使用生成式AI学习时的自我调节学习和求助行为,发现学生主要进行工具性请求而缺乏监控评估,且后测成绩显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06968 2026-06-08 cs.CR 新提交 50%

HAVE: Host Active Verification Engine for Closing the Contextual Reality Gap in Security Digital Twins

HAVE:用于弥合安全数字孪生中上下文现实差距的主机主动验证引擎

Vincenzo Sammartino, Marco Pasquini

专题命中 Agent评测 :agent(abstract)

AI总结 提出HAVE引擎,通过安全约束主机代理进行最大似然估计,测量经验妥协概率,利用Wilson区间置信权重和贝叶斯混合规则修正CVSS评分导致的上下文现实差距,实验显示在误报和漏报场景中分别降低38.2%和提升132.4%的到达概率。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏