arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1095 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1095 篇

2606.09878 2026-06-10 cs.LG 新提交 57%

FailureScope: Cross-Regime Behavioral Diagnosis of Language Model Weaknesses

FailureScope: 语言模型弱点的跨机制行为诊断

Nicholas Saban

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出FailureScope方法,通过跨模型通过/失败模式聚类评估探针,在单轮基准、多轮对话和对抗性代理攻击三种机制下稳定生成可解释的失败分类,实现高效任务采样和跨模型失败预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09038 2026-06-09 cs.AI 新提交 57%

Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs

个性化与安全的交汇:个性化大语言模型中的机制、风险与缓解措施

Yanyan Luo, Xue Han, Ruiqiao Bai, Xin Huang, Yitong Wang, Qian Hu, Qing Wang, Chunxu Zhao, Jie Liu, Cong Geng, Lehao Xing, Pengwei Hu, Junlan Feng

机构 * China Mobile Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九天人工智能技术(北京)有限公司) Chinese Academy of Sciences(中国科学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文首次对个性化大语言模型进行安全导向的综述,从用户表征、个性化范式和评估三个维度组织,提出统一的安全风险分类,并分析各范式下的脆弱性及缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08849 2026-06-09 cs.AI 新提交 57%

A Resilience-as-a-Service assessment framework for coordinated disruption response in interdependent urban transit systems

面向城市交通系统协同中断响应的弹性即服务评估框架

Sara Jaber, S. M. Hassan Mahdavi, Neila Bhouri, Mostafa Ameli

机构 * Univ. Gustave Eiffel, COSYS, GRETTIA, Paris, France(古斯塔夫·埃菲尔大学,交通系统、网络与安全实验室,交通工程与智能交通系统研究组,法国巴黎) VEDECOM, mobiLAB, Department of Human factors and Economics of Sustainable Mobility, Versailles, France(VEDECOM研究所,移动出行实验室,可持续出行人因与经济系,法国凡尔赛)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一个基于KPI的时间索引框架,结合优化模型与智能体仿真,从脆弱性、适应性、鲁棒性等多维度评估城市交通中断响应方案的弹性,并通过巴黎RER B线案例验证了协同策略的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08542 2026-06-09 cs.RO cs.AI cs.CV 新提交 57%

When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA

当视频误读:面向探索性操作痕迹问答的阅读启发式闭环蒸馏

Haizhou Ge, Yufei Jia, Yue Li, Zhixing Chen, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

机构 * Tsinghua University(清华大学) DISCOVER Robotics

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对探索性操作中机器人误读视频痕迹的问题,提出闭环痕迹蒸馏方法,通过任务编码代理提取单行自然语言启发式提示,使冻结VLM准确预测最小成功动作链,在模拟和真实机器人任务上提升准确率0.38-0.47。

Comments 16 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08168 2026-06-09 cs.CR cs.AI 新提交 57%

Closing the Sim-to-Real Gap: An Evaluation Framework for Autonomous Cyber Defense Configuration of Commercial EDR

弥合模拟到现实的差距:商业EDR自主网络防御配置评估框架

Kerri Prinos, Lilianne Brush

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出首个针对商业EDR自主防御智能体的评估框架,通过GOAD实验室与微软Defender XDR的实例化测试,揭示模拟和开源评估无法发现的三个关键差距。

Comments 12 pages including references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08106 2026-06-09 cs.AI cs.MA 新提交 57%

PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents

PACE: 自演化智能体的任意有效接受测试

Zayx Shawn

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出PACE方法,将自演化智能体的变更接受问题转化为序贯假设检验,通过配对任意有效提交评估控制错误提交概率,在多个基准上显著减少虚假提交并降低评估成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07229 2026-06-08 cs.SD cs.CL cs.MM 新提交 57%

MMAE: A Massive Multitask Audio Editing Benchmark

MMAE:大规模多任务音频编辑基准

Ziyang Ma, Ruiqi Yan, Ruiyang Xu, Jie Fang, Zhikang Niu, Yi-Wen Chao, Wenming Tu, Tianrui Wang, Auden, Qi Chen, Wenxi Chen, Jiaying Chi, Yanru Huo, Zixuan Jiang, Xiquan Li, Yalin Li, Junxi Liu, Minghao Liu, Binghao Qiang, Yijia Shan, Zheshu Song, Tian Tan, Zixiang Wang, Zeyu Xie, Zhifei Xie, Xiaoyu Xing, Qixiang Xu, Chen Yang, Guanrou Yang, Shan Yang, Yifan Yang, Steve Yves, Haotian Zhang, Haina Zhu, Kai Yu, Liefeng Bo, Eng-Siong Chng, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Nanyang Technological University(南洋理工大学) Hunyuan Team, Tencent(腾讯 Hunyuan 团队) Tianjin University(天津大学) Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出首个面向通用指令音频编辑的综合评估基准MMAE,涵盖7种音频模态、6级任务复杂度和8种操作类型,通过2000个样本和基于评分标准的评估框架揭示当前模型在精确执行和结构鲁棒性上的严重不足。

Comments Open-Source at https://github.com/ddlBoJack/MMAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06559 2026-06-08 cs.SD cs.AI eess.AS 新提交 57%

IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems

IRAF:面向噪声鲁棒的端到端全双工口语对话系统的抗干扰自适应融合

Tao Zhong, Jiajun Deng, Nikita Kuzmin, Yinke Zhu, Tianxiang Cao, Tristan Tsoi, Zhili Tan, Simon Lui, Xunying Liu

机构 * The Chinese University of Hong Kong(香港中文大学) AudioLab Hong Kong, Huawei Leibniz Research Center(香港AudioLab,华为Leibniz研究中心) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出IRAF模块,通过逐帧预测可靠性门控来调节用户音频对LLM的贡献,提升全双工对话系统在干扰说话人环境下的响应质量和交互稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00647 2026-08-04 q-fin.TR q-fin.CP q-fin.RM 新提交 56%

Axient: On-Chain Credit and Loss Allocation for Leveraged Event Markets: A Venue-Agnostic Protocol for Traders, Credit Providers, Market Makers, and Liquidation Backstops

Axient:杠杆事件市场的链上信用与损失分配——面向交易者、信用提供者、做市商及清算后援的场所无关协议

Maksym Nechepurenko

专题命中 Agent评测 :agent(abstract,comments)

AI总结 Axient是面向多角色的场所无关链上信用协议,通过形式化架构与内生模型实现损失分配等机制,实验验证其分层保护等特性,为杠杆事件市场提供解决方案。

Comments 90 pages, 17 figures. Formal protocol design and fixed-seed synthetic agent-based validation; no live Axient or venue data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15613 2026-07-20 cs.GT 新提交 56%

Fair Allocation of Divisible Goods under Non-Linear Valuations

非线性估值下可分物品的公平分配

Haris Aziz, Zixu He, Xinhang Lu, Kaiyang Zhou

专题命中 Agent评测 :agent(abstract);autonomous agent(comments)

AI总结 研究非线性估值下可分物品的公平分配问题,针对最大最小份额保证设计算法,给出\(\frac{1}{2n - 1}\)-MMS分配,证明对MMS的近似比例几乎是紧的;还研究无嫉妒性,证明其检查存在性对\(n\)个主体和至少三种物品是NP难的,对单个物品给出多项式时间算法。

Comments Appears in the 24th International Conference on Autonomous Agents and Multiagent Systems (AAMAS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14548 2026-08-17 cs.GT 新提交 50%

Forging Self-Funded Marketplaces among Strategic Agents

在策略智能体间构建自筹资金的市场

Yuan Deng, Vasilis Gkatzelis, Xizhi Tan, Grigoris Velegkas, Song Zuo

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对策略智能体,提出自筹资金市场的机制设计问题,证明现有 truthful auction 近似性能上限,给出序贯 auction 实现对数级近似,还设计 auction 实现最大最小份额基准的常数级近似。

Comments Extended Abstract accepted 27th ACM Conference on Economics and Computation (ACM EC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14499 2026-08-17 cs.GT 新提交 50%

Ex-ante versus Ex-post: Egalitarian Facility Location Mechanism Design

事前与事后:平等主义设施选址机制设计

Zohar Barak, Inbal Talgam-Cohen

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对欧氏空间的设施选址问题,对比事前与事后评估,在低维中设计出打破确定性壁垒的机制,高维中则证明随机旋转中位数机制为最优平等主义机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14462 2026-08-17 cs.RO 新提交 50%

THRIVE: Therapeutic Humanoid Robot In Virtual Environment

THRIVE:虚拟环境中的治疗性人形机器人

Jin Xu, Yu-Ping Chen, Ayanna Howard

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了家用康复平台THRIVE,集成VR上肢康复游戏、摄像头运动追踪与机器人治疗师,采用模块化设计,为上肢运动障碍儿童提供持续且具吸引力的上肢治疗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14134 2026-08-17 quant-ph q-fin.PM 新提交 50%

Photonic Quantum Computing vs. Classical Solvers in Constrained Factor Portfolio Optimization

受限因子投资组合优化中的光子量子计算与经典求解器对比

Nirvik Sahoo, Chyng Wen Tee, Paul Robert Griffin

专题命中 Agent评测 :agent(abstract)

AI总结 该研究对比光子量子计算、Gurobi、SAC三种优化范式在因子投资组合优化中的表现,发现光子硬件在窄范围有优势,经典混合整数规划在严格尾部风险控制场景更优,还揭示了强化学习分配器的失效模式并给出应用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14101 2026-08-17 astro-ph.GA 新提交 50%

A Reproducible Two-Boundary Kinematic Correction for Baryonic Rotation-Curve Reconstruction in an 84-Galaxy SPARC Benchmark

84个星系SPARC基准中重子旋转曲线重建的可复现双边界运动学校正

David C. Flynn

专题命中 Agent评测 :workflow(abstract)

AI总结 本研究针对Flynn等人提出的omega运动学校正,基于84星系SPARC基准开展可复现验证,通过双边界系数校正将平均偏差降至30.15 km/s,明确了算法流程与结果,为天文数据变换提供可复现基准。

Comments 22 Pages 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12818 2026-08-14 econ.TH 新提交 50%

Schedule equilibria

日程均衡

Harry Kleyer

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究一般均衡下的不完全竞争,推导家庭与企业最优条件,建立均衡存在性与颤抖手精炼,将框架应用于多场景,发现内生价格反应会改变相关标准结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13085 2026-08-14 cs.GT 新提交 50%

Representation in Peer Selection: A Liquid Democracy Perspective

同行选择中的代表性:一种液体民主视角

Davide Grossi, Grzegorz Lisowski, Georgios Papasotiropoulos

专题命中 Agent评测 :agent(abstract)

AI总结 该研究从液体民主视角研究同行选择问题,引入液体概貌,分析比例公理在该域的表现及相关投票规则,发现可实现强比例保障,具现实应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12996 2026-08-14 cs.CR 新提交 50%

ATOBench: Tracing How Autonomous Penetration-Testing Agents Verify Vulnerabilities When Target Evidence Lies

ATOBench:当目标证据存在时,追踪自主渗透测试代理如何验证漏洞

Qiyang Chen, Yixi Li, Fengwei Zhang, Junlin Liu

专题命中 Agent评测 :agent(abstract)

AI总结 研究人员提出ATOBench框架,通过注入响应转换实现自主渗透测试代理验证过程的可观测性,经450回合评估发现,活动增加会掩盖断裂的验证链,成功恢复依赖于找到并保留可用证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12683 2026-08-14 cs.RO cs.CV 新提交 50%

FUSE: Active Functional Affordance Grounding through Adaptive Semantic-Geometric Evidence Acquisition

FUSE:通过自适应语义-几何证据获取实现主动功能可供性接地

Zhou Chen, Sathyanarayanan N. Aakur

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出主动功能可供性接地任务,构建FUSE框架结合不确定性驱动探索与摊销规划器,基于Habitat基准验证其在非神示接地中性能最优且计算量降低1.33倍。

Comments Under review. 15 Pages. 9 tables, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12635 2026-08-14 cs.AR 新提交 50%

GateTruth: Auditing the Rigor of RTL Design Benchmarks via Mutation Testing

GateTruth:通过变异测试审计RTL设计基准的严谨性

Meet Bhadra

专题命中 Agent评测 :agentic(abstract)

AI总结 GateTruth是用于审计RTL基准测试平台严谨性的变异测试引擎,实验显示多数RTLLM v2.0基准测试平台未达95%变异体杀伤阈值,4096-token输出上限会影响模型排名,其成果推动将变异体杀伤认证设为RTL基准的标准要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12292 2026-08-13 cs.CY 新提交 50%

Teaching a Large Language Model Tutor to Withhold the Answer: A Supervisor Architecture and an Evidence-Driven Method for Tuning Socratic Behavior

训练大型语言模型助教以保留答案:一种用于调整苏格拉底式行为的监督架构与证据驱动方法

Yusuf Pisan

专题命中 Agent评测 :agent(abstract)

AI总结 本研究提出一种监督架构与证据驱动方法,训练LLM助教执行答案保留,通过自动评估调整苏格拉底式行为,使其在全部四个接受标准上达到完全合规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10478 2026-08-12 econ.TH 新提交 50%

Optimal Sequential Assignment with Capacity Constrained Verification

带容量约束验证的最优序贯分配

Vilok Taori

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究带容量约束验证的最优序贯分配问题,刻画了最优机制类别,发现剩余物品数超可用验证次数时最优机制可含概率性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10711 2026-08-12 q-fin.PR 新提交 50%

Optimal Pricing and Hedging of SOFR Derivatives

SOFR衍生品的最优定价与对冲

Teemu Pennanen, Waleed Taoum

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对流动性不足且不完备的SOFR衍生品市场,构建了与多类因素一致的无差异定价模型,通过CME衍生品数值验证,可快速为场外SOFR衍生品定价对冲,最优组合稀疏且对冲效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10796 2026-08-12 cs.CV 新提交 50%

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准

Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10572 2026-08-12 cs.GT 新提交 50%

Non-Existence of EFX Chore Allocations for Monotone Cost Functions with Binary Marginals

具有二元边际的单调成本函数下,EFX chore分配不存在性

Zehan Lin, Shengxin Liu, Biaoshuai Tao, Shengwei Zhou

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对具有二元边际的单调成本函数,构造18智能体、53个chore的反例,证实不可分割chore的EFX分配不存在,并在Lean 4中形式化验证结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10397 2026-08-12 cs.GT 新提交 50%

To EFX OR to MMS, That is the Question

是选择EFX还是MMS,这是个问题

Hadi Hosseini, Payas Khurana, Shraddha Pathak, Rohit Vaish

专题命中 Agent评测 :agent(abstract)

AI总结 该研究探讨了不可分割物品的EFX与MMS公平性概念的智能体层面析取,构造了相关不可能性反例,证明了特定条件下的存在性结果并明确了其与组成部分的区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09981 2026-08-12 cs.CE 新提交 50%

Optimizing Parameterized Physics-Informed Neural Networks to Solve Multilayered Static Linear Elastic PDEs

优化参数化物理信息神经网络以求解多层静态线性弹性偏微分方程

Joseph Lim, Hanbo Song, Zhen Zhang

专题命中 Agent评测 :workflow(abstract)

AI总结 该研究针对传统FEM计算成本高的问题,提出P2INNs框架求解多层静态线性弹性PDE,其误差满足设计需求,可替代传统FEM并加速防护结构层状架构的逆向优化。

Comments * These authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10968 2026-08-12 physics.soc-ph 新提交 50%

Cross-Cutting Exposure as an Engine of Radicalization: Platform Design, Attention, and Geography in a Stochastic Multiplex Model of Opinion Dynamics

交叉接触激进化引擎:观点动力学随机复合模型中的平台设计、注意力与地理因素

Ruben E. Araújo

专题命中 Agent评测 :agent(abstract)

AI总结 该研究构建随机复合观点动力学模型,分析社交媒体平台设计、注意力与地理因素对激进化的影响,发现算法同质性可悖论性抑制极端主义,未策划接触是激进化饱和水平的决定因素。

Comments 14 pages, 11 figures. Submitted to Phys. Rev. E

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10844 2026-08-12 physics.bio-ph 新提交 50%

Impact of Higher-Order Interactions on Collective Motion

高阶相互作用对集体运动的影响

Maryam Masoumi, Amir Kargaran, Reza Jafari

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出含高阶对齐相互作用的广义Vicsek模型,发现其会引发不连续相变,需更高粒子密度维持集体有序,为理解活性物质相变及生物、合成系统集体行为提供了新参数。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09987 2026-08-12 physics.soc-ph 新提交 50%

The Impact of Cut-ins on Mixed-Autonomy Traffic Flow: Bridging Microscopic Game-Theoretic Model and Macroscopic Flow Analysis

切入行为对混合自动驾驶交通流的影响:弥合微观博弈论模型与宏观流量分析

Yu Song

专题命中 Agent评测 :agent(abstract)

AI总结 本研究将博弈论摩擦项整合入宏观运动波框架,建模切入为斯塔克尔伯格博弈,发现中等CAV渗透率(约45%)时交通流稳定性最差,早期防御性CAV会降低混合交通流稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏