arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1135 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1135 篇

2608.12292 2026-08-13 cs.CY 新提交 50%

Teaching a Large Language Model Tutor to Withhold the Answer: A Supervisor Architecture and an Evidence-Driven Method for Tuning Socratic Behavior

训练大型语言模型助教以保留答案:一种用于调整苏格拉底式行为的监督架构与证据驱动方法

Yusuf Pisan

专题命中 Agent评测 :agent(abstract)

AI总结 本研究提出一种监督架构与证据驱动方法,训练LLM助教执行答案保留,通过自动评估调整苏格拉底式行为,使其在全部四个接受标准上达到完全合规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10478 2026-08-12 econ.TH 新提交 50%

Optimal Sequential Assignment with Capacity Constrained Verification

带容量约束验证的最优序贯分配

Vilok Taori

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究带容量约束验证的最优序贯分配问题,刻画了最优机制类别,发现剩余物品数超可用验证次数时最优机制可含概率性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10711 2026-08-12 q-fin.PR 新提交 50%

Optimal Pricing and Hedging of SOFR Derivatives

SOFR衍生品的最优定价与对冲

Teemu Pennanen, Waleed Taoum

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对流动性不足且不完备的SOFR衍生品市场,构建了与多类因素一致的无差异定价模型,通过CME衍生品数值验证,可快速为场外SOFR衍生品定价对冲,最优组合稀疏且对冲效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10796 2026-08-12 cs.CV 新提交 50%

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准

Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10572 2026-08-12 cs.GT 新提交 50%

Non-Existence of EFX Chore Allocations for Monotone Cost Functions with Binary Marginals

具有二元边际的单调成本函数下,EFX chore分配不存在性

Zehan Lin, Shengxin Liu, Biaoshuai Tao, Shengwei Zhou

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对具有二元边际的单调成本函数,构造18智能体、53个chore的反例,证实不可分割chore的EFX分配不存在,并在Lean 4中形式化验证结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10397 2026-08-12 cs.GT 新提交 50%

To EFX OR to MMS, That is the Question

是选择EFX还是MMS,这是个问题

Hadi Hosseini, Payas Khurana, Shraddha Pathak, Rohit Vaish

专题命中 Agent评测 :agent(abstract)

AI总结 该研究探讨了不可分割物品的EFX与MMS公平性概念的智能体层面析取,构造了相关不可能性反例,证明了特定条件下的存在性结果并明确了其与组成部分的区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09981 2026-08-12 cs.CE 新提交 50%

Optimizing Parameterized Physics-Informed Neural Networks to Solve Multilayered Static Linear Elastic PDEs

优化参数化物理信息神经网络以求解多层静态线性弹性偏微分方程

Joseph Lim, Hanbo Song, Zhen Zhang

专题命中 Agent评测 :workflow(abstract)

AI总结 该研究针对传统FEM计算成本高的问题,提出P2INNs框架求解多层静态线性弹性PDE,其误差满足设计需求,可替代传统FEM并加速防护结构层状架构的逆向优化。

Comments * These authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10968 2026-08-12 physics.soc-ph 新提交 50%

Cross-Cutting Exposure as an Engine of Radicalization: Platform Design, Attention, and Geography in a Stochastic Multiplex Model of Opinion Dynamics

交叉接触激进化引擎:观点动力学随机复合模型中的平台设计、注意力与地理因素

Ruben E. Araújo

专题命中 Agent评测 :agent(abstract)

AI总结 该研究构建随机复合观点动力学模型,分析社交媒体平台设计、注意力与地理因素对激进化的影响,发现算法同质性可悖论性抑制极端主义,未策划接触是激进化饱和水平的决定因素。

Comments 14 pages, 11 figures. Submitted to Phys. Rev. E

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10844 2026-08-12 physics.bio-ph 新提交 50%

Impact of Higher-Order Interactions on Collective Motion

高阶相互作用对集体运动的影响

Maryam Masoumi, Amir Kargaran, Reza Jafari

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出含高阶对齐相互作用的广义Vicsek模型,发现其会引发不连续相变,需更高粒子密度维持集体有序,为理解活性物质相变及生物、合成系统集体行为提供了新参数。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09987 2026-08-12 physics.soc-ph 新提交 50%

The Impact of Cut-ins on Mixed-Autonomy Traffic Flow: Bridging Microscopic Game-Theoretic Model and Macroscopic Flow Analysis

切入行为对混合自动驾驶交通流的影响:弥合微观博弈论模型与宏观流量分析

Yu Song

专题命中 Agent评测 :agent(abstract)

AI总结 本研究将博弈论摩擦项整合入宏观运动波框架,建模切入为斯塔克尔伯格博弈,发现中等CAV渗透率(约45%)时交通流稳定性最差,早期防御性CAV会降低混合交通流稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09409 2026-08-11 econ.TH 新提交 50%

Information for nothing and authority for free

无成本信息与免费权威

Deniz Kattwinkel, Alexander Winter

专题命中 Agent评测 :agent(abstract)

AI总结 针对无货币转移、代理人未完全内化成本的委托代理项目决策问题,研究提出委托人最优机制无需代理人报告,可选择忽略代理人或赋予其免费信息与完全决策权威。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07635 2026-08-11 stat.AP 新提交 50%

SurroPilot: An LLM-Assisted Platform for Heterogeneous Surrogate Endpoint Evaluation in Clinical Trials

SurroPilot:用于临床试验中异质性替代终点评估的大语言模型辅助平台

Xingyu Li, Peng Wei

专题命中 Agent评测 :workflow(abstract)

AI总结 SurroPilot是集成LLM与异质性中介框架的辅助平台,可通过自然语言交互完成临床试验异质性替代终点评估全流程,降低了相关方法的应用技术门槛。

Comments Submitted for journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09842 2026-08-11 cs.CV 新提交 50%

From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing

从诊断到修正:真实世界表格解析的基准测试与改进

Jutao Xiao, Yuan Qu, Dongsheng Ma, Fan Wu, Tianyao He, Weihong Li, Jie Yang, Yu Qiao, Bin Wang, Conghui He

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 Agent评测 :agentic(abstract)

AI总结 本文针对真实世界表格解析的缺陷,构建诊断基准TableParseMap,提出DEC框架,无需重训即可提升冻结解析器性能,在TableParseMap上TEDS获显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09724 2026-08-11 eess.SY cs.SI cs.SY 新提交 50%

Analysis and Consensus Control of Emergent Dynamic Polarization in Minimally-Nonlinear Opinion Dynamics

最小非线性观点动力学中涌现动态极化的分析与共识控制

Rajul Kumar, Ningshi Yao

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出M-NOD框架解析社交网络观点演化产生的动态极化,证明其稳定性条件,开发局部控制策略仅锚定单个智能体即可消除振荡分歧、恢复共识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09061 2026-08-11 cs.GT 新提交 50%

Breaking the 4-Approximation Barrier in Strategyproof Two-Facility Location

策略proof双设施选址问题中突破4近似比障碍

Mengfan Ma, Bo Peng

专题命中 Agent评测 :agent(abstract)

AI总结 该研究在Ptolemaic度量空间中提出随机策略proof双设施选址机制,将最优近似比从4降至约3.667,同时将最优下界从1.045提升至约1.207,突破了此前的4近似比障碍。

Comments 23 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08299 2026-08-11 math.PR math.OC q-fin.MF 新提交 50%

Non-linear optimal stopping with Bermudan strategies: the infinite horizon case

基于百慕大策略的非线性最优停止:无限时域情形

Miryana Grigorova, Ohood Aldalbahi

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对无限时域下带非线性评估的最优停止问题,基于百慕大策略证明动态规划原理、ε-最优停时与最优停时的存在性,给出Doob型收敛结果并提供BSDEs相关示例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09545 2026-08-11 physics.optics 新提交 50%

Direct Laser Interference Patterning of Functional Metal Surfaces: From Written Geometry to Functional Interfaces

功能金属表面的直接激光干涉图案化:从写入几何到功能界面

Petr Hauschwitz

专题命中 Agent评测 :agent(abstract)

AI总结 本综述以DLIP为模型系统,指出仅靠几何无法预测金属表面功能,需分离写入几何与形成的界面,明确跨领域变量可转移性,为DLIP表面工程提供预测框架。

Comments Review article, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06900 2026-08-10 cs.SD eess.AS 新提交 50%

MMAG: A Multi-Control Mixed Audio Generation Benchmark

MMAG:多控制混合音频生成基准

Zihao Zheng, Xuenan Xu, Jiahao Mei, Yixuan Li, Minghao Lv, Wen Wu, Chao Zhang, Mengyue Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 Agent评测 :agentic(abstract)

AI总结 本研究针对现有音频生成基准的不足,推出MMAG混合音频生成基准,构建含4000个标注音频的数据集,提出系统评估协议,测试发现各类模型在多控制能力间存在性能权衡,为该领域提供综合基准。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07011 2026-08-10 cs.CE econ.GN math.OC q-fin.EC 新提交 50%

Linguistic Pattern Based Optimization of Economic and Spatial Uniformity Criteria in Facility Layout Problems

设施布局问题中基于语言模式的经济与空间均匀性准则优化

Jerzy Grobelny, Rafał Michalski

专题命中 Agent评测 :agent(abstract)

AI总结 本文扩展LP Alinks框架,引入NCS空间均匀性准则,通过实验揭示结构与语言参数对布局的影响,推导参数选择矩阵,对比显示其在成本与均匀性权衡上表现更优。

Comments 28 pages, 14 figures

Journal ref Grobelny, J., Michalski, R. Linguistic pattern based optimization of economic and spatial uniformity criteria in facility layout problems. Cent Eur J Oper Res 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06998 2026-08-10 q-bio.MN physics.bio-ph 新提交 50%

Simulating is not always understanding: When model complexity obscures biology

模拟并不总是意味着理解:当模型复杂性掩盖生物学本质时

Lendert Gelens, Alejandro Fábregas-Tejeda, Grant Ramsey, Sylvia Wenmackers, Bart Smeets

专题命中 Agent评测 :agent(abstract)

AI总结 该研究指出细胞生物学模型的理解关键是自由参数与实验约束的比率而非复杂性,建议减少参数、开展与简单模型的系统比较以追踪细胞行为的涌现机制。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05379 2026-08-07 econ.TH 新提交 50%

Catastrophic Attention Preferences

灾难性注意力偏好

R. Emilio Muniz-Langle

专题命中 Agent评测 :agent(abstract)

AI总结 本文为仅关注不利结果子集的灾难性思维建立了公理化的灾难性注意力偏好模型,完成了行为学刻画,参数可识别,还刻画了比较模糊厌恶,模型嵌套主观期望效用并收敛到最大最小期望效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05527 2026-08-07 stat.ME stat.AP 新提交 50%

Fast Power Evaluation under Biased-Coin Minimization: Sampling and Randomization Calibration

偏币最小化下的快速功效评估:抽样与随机化校准

Masahiro Kojima

专题命中 Agent评测 :planning(abstract)

AI总结 针对偏币最小化下设计阶段功效评估计算量大的问题,开发SIGA框架及SIGA-S、SIGA-R程序,可高效近似参考随机化检验的结果并显著降低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05539 2026-08-07 cs.CV 新提交 50%

OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction

OmniMech:面向3D重建的全合一多模态机械基准

Taiting Lu, Runze Liu, Ziwei Dong, Sisong Bei, Jingying Zeng, Mingjia Wang, Zhenghao Li, Kaiyuan Lin, Yi-Shan Wu, Yangshoudu Zheng, Hongxing Pan, Kai Zhang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Sung-Liang Chen, Yi-Chao Chen, Yincheng Jin, Mahanth Gowda

专题命中 Agent评测 :agentic(abstract)

AI总结 研究人员提出OmniMech——首个百万级多模态机械基准,针对工业制造数据的可执行CAD生成任务,含四类任务,实验发现现有模型在相关任务中存在不足,将发布资源支持后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04774 2026-08-06 cs.CY cs.SI 新提交 50%

Decentralization of Agenda-Setting Power and Domain-Selective Bridging: Algorithm Design Beyond the Echo Chamber Debate

议程设置权力的去中心化与领域选择性桥接:超越回音室辩论的算法设计

Masahiro Fujita

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出议程民主化指数与社会信息健康模型,设计领域选择性桥接算法,经智能体模拟验证,该算法能在集体决策相关领域改善信息共享,同时维持爱好与生活方式领域用户体验,将回音室辩论转化为工程设计问题。

Comments 34 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04536 2026-08-06 cs.DB 新提交 50%

From Research Questions to Columns: Operationalization-Aware Data Discovery

从研究问题到列:感知操作化的数据发现

Houming Chen, H. V. Jagadish

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出感知操作化的数据发现(OADD)任务,构建基准OADD-Bench,评估多种方法后发现OADD仍是未解决问题,其中OADD定向智能体表现最佳。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04042 2026-08-06 cs.RO 新提交 50%

Kitchen Robotic Manipulation utilizing Foundation Models

基于基础模型的厨房机器人操作

Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim

机构 * Kumoh National Institute of Technology(金乌国立技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :planning(abstract)

AI总结 本研究提出一种整合多种基础模型的模块化厨房机器人感知流水线,经评估优化后可在杂乱遮挡场景下实现89.12%的ADI,无需环境重训练即可完成餐具处理等家庭操作任务。

Comments Intelligent Service Robotics (ISR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03783 2026-08-05 eess.SP 新提交 50%

New Mid-Band (FR3, 6-24 GHz) XL-MIMO for 6G: Channel Modeling, Algorithm Evaluation, and Field Trials

面向6G的新型中频段(FR3,6-24 GHz)超大規模多输入多输出(XL-MIMO):信道建模、算法评估与现场试验

Haiyang Miao, Jianhua Zhang, Feifei Gao, Pan Tang, Qi Zhen, Mengxue Li, Ping Zhao, Shihao Zhang, Liang Xia, Guangyi Liu

专题命中 Agent评测 :planning(abstract)

AI总结 本文针对6G的新型中频段XL-MIMO,综述其频谱规划、信道建模、算法进展,比较不同规模XL-MIMO系统性能,结合U6GHz频段现场试验,明确目标信噪比是影响XL-MIMO性能的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03971 2026-08-05 cs.CV 新提交 50%

UniWorld-Design: From Pixel Generation to Layer-Native Design

UniWorld-Design:从像素生成到层原生设计

Zongjian Li, Zhiyuan Yan, Chenxu Bai, Chen Chen, Haoxiang Sun, Shaodong Wang, Feize Wu, Shenghai Yuan, Bin Lin, Zheyuan Liu, Yuwei Niu, Li Yuan

专题命中 Agent评测 :agentic(abstract)

AI总结 UniWorld-Design是一种以语义RGBA层为原子单元的图像生成框架,含T2RGBA和I2L两个模型,在Crello基准测试中I2L和T2RGBA均优于现有相关模型。

Comments Project page: https://rabbitvis.rabbitpre.com/blog

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03445 2026-08-05 cs.SI 新提交 50%

A Note on Reinforcement Learning to Develop Self-defined Agents' Behavior

关于强化学习开发智能体自定义行为的注记

Matteo Morini, Pietro Terna

专题命中 Agent评测 :agent(abstract)

AI总结 本研究基于有限理性假设,采用无监督学习为主的技术,通过Cross Targets(交叉目标)方法训练人工智能体,实现行为内部一致性,成功让随机游走智能体解决图节点分类问题。

Journal ref M. Morini, and P. Terna (2021). A note on reinforcement learning to develop self-defined agents' behavior. Carlo Alberto Notebooks, No. 638, January 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03078 2026-08-05 cs.CV 新提交 50%

LDU-Bench: Multimodal LLM Evaluation for Lithography Defect Understanding under Layout-Varying Circuit Backgrounds

LDU-Bench:面向不同布局电路背景下光刻缺陷理解的多模态大语言模型评估基准

Huanglong Ji, Botong Zhao, Shujing Lv, Yue Lv

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出LDU-Bench这一多模态基准,将光刻审查工作流程分解为四项任务,评估发现现有多模态大语言模型的缺陷分类能力无法稳定迁移至下游审查阶段,为工业MLLM评估提供了统一平台。

Comments 12 pages, 3 figures, and 5 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏