arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1135 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1135 篇

2606.08849 2026-06-09 cs.AI 新提交 57%

A Resilience-as-a-Service assessment framework for coordinated disruption response in interdependent urban transit systems

面向城市交通系统协同中断响应的弹性即服务评估框架

Sara Jaber, S. M. Hassan Mahdavi, Neila Bhouri, Mostafa Ameli

机构 * Univ. Gustave Eiffel, COSYS, GRETTIA, Paris, France(古斯塔夫·埃菲尔大学,交通系统、网络与安全实验室,交通工程与智能交通系统研究组,法国巴黎) VEDECOM, mobiLAB, Department of Human factors and Economics of Sustainable Mobility, Versailles, France(VEDECOM研究所,移动出行实验室,可持续出行人因与经济系,法国凡尔赛)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一个基于KPI的时间索引框架,结合优化模型与智能体仿真,从脆弱性、适应性、鲁棒性等多维度评估城市交通中断响应方案的弹性,并通过巴黎RER B线案例验证了协同策略的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08542 2026-06-09 cs.RO cs.AI cs.CV 新提交 57%

When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA

当视频误读:面向探索性操作痕迹问答的阅读启发式闭环蒸馏

Haizhou Ge, Yufei Jia, Yue Li, Zhixing Chen, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

机构 * Tsinghua University(清华大学) DISCOVER Robotics

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对探索性操作中机器人误读视频痕迹的问题,提出闭环痕迹蒸馏方法,通过任务编码代理提取单行自然语言启发式提示,使冻结VLM准确预测最小成功动作链,在模拟和真实机器人任务上提升准确率0.38-0.47。

Comments 16 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08168 2026-06-09 cs.CR cs.AI 新提交 57%

Closing the Sim-to-Real Gap: An Evaluation Framework for Autonomous Cyber Defense Configuration of Commercial EDR

弥合模拟到现实的差距:商业EDR自主网络防御配置评估框架

Kerri Prinos, Lilianne Brush

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出首个针对商业EDR自主防御智能体的评估框架,通过GOAD实验室与微软Defender XDR的实例化测试,揭示模拟和开源评估无法发现的三个关键差距。

Comments 12 pages including references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08106 2026-06-09 cs.AI cs.MA 新提交 57%

PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents

PACE: 自演化智能体的任意有效接受测试

Zayx Shawn

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出PACE方法,将自演化智能体的变更接受问题转化为序贯假设检验,通过配对任意有效提交评估控制错误提交概率,在多个基准上显著减少虚假提交并降低评估成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07229 2026-06-08 cs.SD cs.CL cs.MM 新提交 57%

MMAE: A Massive Multitask Audio Editing Benchmark

MMAE:大规模多任务音频编辑基准

Ziyang Ma, Ruiqi Yan, Ruiyang Xu, Jie Fang, Zhikang Niu, Yi-Wen Chao, Wenming Tu, Tianrui Wang, Auden, Qi Chen, Wenxi Chen, Jiaying Chi, Yanru Huo, Zixuan Jiang, Xiquan Li, Yalin Li, Junxi Liu, Minghao Liu, Binghao Qiang, Yijia Shan, Zheshu Song, Tian Tan, Zixiang Wang, Zeyu Xie, Zhifei Xie, Xiaoyu Xing, Qixiang Xu, Chen Yang, Guanrou Yang, Shan Yang, Yifan Yang, Steve Yves, Haotian Zhang, Haina Zhu, Kai Yu, Liefeng Bo, Eng-Siong Chng, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Nanyang Technological University(南洋理工大学) Hunyuan Team, Tencent(腾讯 Hunyuan 团队) Tianjin University(天津大学) Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出首个面向通用指令音频编辑的综合评估基准MMAE,涵盖7种音频模态、6级任务复杂度和8种操作类型,通过2000个样本和基于评分标准的评估框架揭示当前模型在精确执行和结构鲁棒性上的严重不足。

Comments Open-Source at https://github.com/ddlBoJack/MMAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06559 2026-06-08 cs.SD cs.AI eess.AS 新提交 57%

IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems

IRAF:面向噪声鲁棒的端到端全双工口语对话系统的抗干扰自适应融合

Tao Zhong, Jiajun Deng, Nikita Kuzmin, Yinke Zhu, Tianxiang Cao, Tristan Tsoi, Zhili Tan, Simon Lui, Xunying Liu

机构 * The Chinese University of Hong Kong(香港中文大学) AudioLab Hong Kong, Huawei Leibniz Research Center(香港AudioLab,华为Leibniz研究中心) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出IRAF模块,通过逐帧预测可靠性门控来调节用户音频对LLM的贡献,提升全双工对话系统在干扰说话人环境下的响应质量和交互稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00647 2026-08-04 q-fin.TR q-fin.CP q-fin.RM 新提交 56%

Axient: On-Chain Credit and Loss Allocation for Leveraged Event Markets: A Venue-Agnostic Protocol for Traders, Credit Providers, Market Makers, and Liquidation Backstops

Axient:杠杆事件市场的链上信用与损失分配——面向交易者、信用提供者、做市商及清算后援的场所无关协议

Maksym Nechepurenko

专题命中 Agent评测 :agent(abstract,comments)

AI总结 Axient是面向多角色的场所无关链上信用协议,通过形式化架构与内生模型实现损失分配等机制,实验验证其分层保护等特性,为杠杆事件市场提供解决方案。

Comments 90 pages, 17 figures. Formal protocol design and fixed-seed synthetic agent-based validation; no live Axient or venue data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15613 2026-07-20 cs.GT 新提交 56%

Fair Allocation of Divisible Goods under Non-Linear Valuations

非线性估值下可分物品的公平分配

Haris Aziz, Zixu He, Xinhang Lu, Kaiyang Zhou

专题命中 Agent评测 :agent(abstract);autonomous agent(comments)

AI总结 研究非线性估值下可分物品的公平分配问题,针对最大最小份额保证设计算法,给出\(\frac{1}{2n - 1}\)-MMS分配,证明对MMS的近似比例几乎是紧的;还研究无嫉妒性,证明其检查存在性对\(n\)个主体和至少三种物品是NP难的,对单个物品给出多项式时间算法。

Comments Appears in the 24th International Conference on Autonomous Agents and Multiagent Systems (AAMAS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16601 2026-08-18 cs.SI cs.CY cs.MA 新提交 50%

"If It Looks Like a User": Measuring Real-Time Moderation Effects via Social Media Simulation

“看起来像用户”:通过社交媒体模拟测量实时审核效果

Enrico Verdolotti, Gianluca Nogara, Luca Luceri, Silvia Giordano

专题命中 Agent评测 :agent(abstract)

AI总结 该研究开发了校准后的SimSoM社交媒体模拟器,通过实验验证后发现静态审核会高估用户封禁效果,实时审核时补偿性转发会削弱低质量内容减少效果,为内容审核政策评估提供了基于模拟的框架。

Comments 15 pages, 4 figures, 2 tables. Accepted for presentation at the Social Simulation Conference (SSC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16550 2026-08-18 cs.GT 新提交 50%

Anchoring for Truthfulness: The Random-Anchor Volume Mechanism for Multi-Facility Location

锚定求真:多设施选址的随机锚点体积机制

Haris Aziz, Simon Mackenzie, Mashbat Suzuki

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对多设施选址问题,提出随机锚点体积机制,证明其在k=1、2、3时为期望防策略机制,k≥4时可被操纵,k=3时期望社会成本最多为8OPT₃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16422 2026-08-18 cs.CR 新提交 50%

Proving the Utility of Large Language Models in Cybersecurity Simulations: A Comprehensive Examination

证明大型语言模型在网络安全模拟中的效用:一项综合研究

Stylianos Kampakis, Fabio Rovai, Marcos Charalambides, Theodosis Mourouzis, Chris Hicks

专题命中 Agent评测 :agent(abstract)

AI总结 该研究通过对比实验证明,大型语言模型(LLMs)驱动的网络安全模拟方法,相比经典强化学习方法,在网络攻击模拟中效率更高、适应性更强,且速度提升达25000至50000倍,为构建智能网络防御系统提供了新路径。

Comments 13 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16252 2026-08-18 cs.GT 新提交 50%

Group-Fair Metric Distortion of Facility Assignment Problems

设施分配问题的群体公平度量失真

Alexandros A. Voudouris

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究受群体公平约束的设施分配问题的度量失真,提出全信息与有序信息算法,推导最大和、和最大社会目标的失真上下界,且下界与上界匹配,覆盖单向匹配与聚类问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16130 2026-08-18 cs.GT 新提交 50%

On the Incompatibility of Weighted PROPX and Pareto Optimality for Indivisible Chores

不可分割家务分配中加权PROPX与帕累托最优的不相容性

Haris Aziz, Bo Li

专题命中 Agent评测 :agent(abstract)

AI总结 研究不可分割家务分配中,加权PROPX与帕累托最优的不相容性,给出2主体4家务、n主体n+1家务的反例,且该不相容性在物品数不超主体数时不成立,与EF1的兼容性结果形成对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16019 2026-08-18 cs.GT 新提交 50%

Maximum-Cost Strategic Facility Location: The Limits of Randomization

Jabari Hastings, Misha Ivkov

专题命中 Agent评测 :agent(abstract)

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15822 2026-08-18 cs.GT cs.DS 新提交 50%

Exact MMS Allocations under Personalized Bivalued Valuations: Goods and Chores

个性化双值估值下的精确最大最小份额(MMS)分配:物品与劳务

Yuhao Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 针对个性化双值估值下不可分物品与劳务的精确最大最小份额(MMS)分配这一开放问题,研究人员通过结合配额重新表述等方法,证明该分配始终存在且可在多项式时间内计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15709 2026-08-18 cs.DB 新提交 50%

Logos: Certified Order-Sensitive SQL Rewrites with Mechanized Semantics and LLM Guidance

Logos:结合机械化语义与LLM指导的可验证顺序敏感型SQL重写

Jingyu Ke, Jingyang Li, Guoqiang Li

专题命中 Agent评测 :agent(abstract)

AI总结 Logos是一款结合Rocq机械化语义与LLM指导的SQL重写验证工具,解决了现有工具的不足,在389个查询对的评估中解决率达86.9%,优于基线工具SQLSolver。

Comments 13 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15631 2026-08-18 cs.GT econ.TH 新提交 50%

Non-obvious Manipulability with Groups in Shapley-Scarf Housing Markets

沙普利-斯卡夫住房市场中基于群体的非明显可操纵性

Louise Demoor, Martí Jané-Ballarín, Pierre Nunn, Subhajit Pramanik, Antoine Prévotat, Makoto Yokoo

专题命中 Agent评测 :agent(abstract)

AI总结 该研究在沙普利-斯卡夫住房市场中,将策略完备性替换为基于群体的非明显可操纵性,定义了超群体下的顶端交易循环机制类,并证明此类机制的结果具有一致性。

Comments 14 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14967 2026-08-18 cs.DC cs.NI 新提交 50%

When Does Distributed AI Inference Need More Wide-Area Bandwidth? A Co-Design Evaluation of Optical, Packet, and Software Levers

分布式AI推理何时需要更多广域网带宽?光学、分组与软件杠杆的协同设计评估

Prasanna C

专题命中 Agent评测 :agentic(abstract)

AI总结 本文对比了分布式AI推理中,跨站点迁移推理状态与KV重计算等方案的优劣,推导了70B多头注意力模型的带宽交叉点,分析了敏感性因素及经济性,提出了测试计划。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14753 2026-08-18 cs.CR stat.ME 新提交 50%

SynthGuard-ReleaseBench: Locked-Audit Evidence for Synthetic Tabular Data Releases

SynthGuard-ReleaseBench:合成表格数据发布的锁定审计证据

Jeffery Opoku, David Banahene

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出SynthGuard-ReleaseBench审计框架,通过锁定审计要素对比工作流,在多类数据上验证其可复现性与区分性,为合成表格数据发布提供特定用途的审计证据。

Comments 45 pages, 20 figures, 11 tables. Software and evidence archive with locked configurations, tests, and a fail-closed release-gate validator archived at Zenodo, DOI https://doi.org/10.5281/zenodo.21909680

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15515 2026-08-18 math.PR 新提交 50%

Weak-Type Bounds for Convolution on the Boolean Hypercube

Junwei Lu, Shengtao Guo, Ethan X. Fang

专题命中 Agent评测 :agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15010 2026-08-18 cond-mat.soft physics.bio-ph 新提交 50%

Shear effects in active models of normal and cancer cells

正常细胞与癌细胞主动模型中的剪切效应

Souvik Sadhukhan, Rajsekhar Das, Lin Zhao, Wolfgang Losert, D. Thirumalai

专题命中 Agent评测 :agent(abstract)

AI总结 本研究通过三维智能体模型结合GMM与平均场理论,探究正常及癌细胞组织在剪切下的力学响应,揭示刚度与活性异质性决定其非仿射运动的规律,与实验结果吻合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14548 2026-08-17 cs.GT 新提交 50%

Forging Self-Funded Marketplaces among Strategic Agents

在策略智能体间构建自筹资金的市场

Yuan Deng, Vasilis Gkatzelis, Xizhi Tan, Grigoris Velegkas, Song Zuo

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对策略智能体,提出自筹资金市场的机制设计问题,证明现有 truthful auction 近似性能上限,给出序贯 auction 实现对数级近似,还设计 auction 实现最大最小份额基准的常数级近似。

Comments Extended Abstract accepted 27th ACM Conference on Economics and Computation (ACM EC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14499 2026-08-17 cs.GT 新提交 50%

Ex-ante versus Ex-post: Egalitarian Facility Location Mechanism Design

事前与事后:平等主义设施选址机制设计

Zohar Barak, Inbal Talgam-Cohen

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对欧氏空间的设施选址问题,对比事前与事后评估,在低维中设计出打破确定性壁垒的机制,高维中则证明随机旋转中位数机制为最优平等主义机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14462 2026-08-17 cs.RO 新提交 50%

THRIVE: Therapeutic Humanoid Robot In Virtual Environment

THRIVE:虚拟环境中的治疗性人形机器人

Jin Xu, Yu-Ping Chen, Ayanna Howard

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了家用康复平台THRIVE,集成VR上肢康复游戏、摄像头运动追踪与机器人治疗师,采用模块化设计,为上肢运动障碍儿童提供持续且具吸引力的上肢治疗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14134 2026-08-17 quant-ph q-fin.PM 新提交 50%

Photonic Quantum Computing vs. Classical Solvers in Constrained Factor Portfolio Optimization

受限因子投资组合优化中的光子量子计算与经典求解器对比

Nirvik Sahoo, Chyng Wen Tee, Paul Robert Griffin

专题命中 Agent评测 :agent(abstract)

AI总结 该研究对比光子量子计算、Gurobi、SAC三种优化范式在因子投资组合优化中的表现,发现光子硬件在窄范围有优势,经典混合整数规划在严格尾部风险控制场景更优,还揭示了强化学习分配器的失效模式并给出应用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14101 2026-08-17 astro-ph.GA 新提交 50%

A Reproducible Two-Boundary Kinematic Correction for Baryonic Rotation-Curve Reconstruction in an 84-Galaxy SPARC Benchmark

84个星系SPARC基准中重子旋转曲线重建的可复现双边界运动学校正

David C. Flynn

专题命中 Agent评测 :workflow(abstract)

AI总结 本研究针对Flynn等人提出的omega运动学校正,基于84星系SPARC基准开展可复现验证,通过双边界系数校正将平均偏差降至30.15 km/s,明确了算法流程与结果,为天文数据变换提供可复现基准。

Comments 22 Pages 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13085 2026-08-14 cs.GT 新提交 50%

Representation in Peer Selection: A Liquid Democracy Perspective

同行选择中的代表性:一种液体民主视角

Davide Grossi, Grzegorz Lisowski, Georgios Papasotiropoulos

专题命中 Agent评测 :agent(abstract)

AI总结 该研究从液体民主视角研究同行选择问题,引入液体概貌,分析比例公理在该域的表现及相关投票规则,发现可实现强比例保障,具现实应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12996 2026-08-14 cs.CR 新提交 50%

ATOBench: Tracing How Autonomous Penetration-Testing Agents Verify Vulnerabilities When Target Evidence Lies

ATOBench:当目标证据存在时,追踪自主渗透测试代理如何验证漏洞

Qiyang Chen, Yixi Li, Fengwei Zhang, Junlin Liu

专题命中 Agent评测 :agent(abstract)

AI总结 研究人员提出ATOBench框架,通过注入响应转换实现自主渗透测试代理验证过程的可观测性,经450回合评估发现,活动增加会掩盖断裂的验证链,成功恢复依赖于找到并保留可用证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12683 2026-08-14 cs.RO cs.CV 新提交 50%

FUSE: Active Functional Affordance Grounding through Adaptive Semantic-Geometric Evidence Acquisition

FUSE:通过自适应语义-几何证据获取实现主动功能可供性接地

Zhou Chen, Sathyanarayanan N. Aakur

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出主动功能可供性接地任务,构建FUSE框架结合不确定性驱动探索与摊销规划器,基于Habitat基准验证其在非神示接地中性能最优且计算量降低1.33倍。

Comments Under review. 15 Pages. 9 tables, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12635 2026-08-14 cs.AR 新提交 50%

GateTruth: Auditing the Rigor of RTL Design Benchmarks via Mutation Testing

GateTruth:通过变异测试审计RTL设计基准的严谨性

Meet Bhadra

专题命中 Agent评测 :agentic(abstract)

AI总结 GateTruth是用于审计RTL基准测试平台严谨性的变异测试引擎,实验显示多数RTLLM v2.0基准测试平台未达95%变异体杀伤阈值,4096-token输出上限会影响模型排名,其成果推动将变异体杀伤认证设为RTL基准的标准要求。

详情

展开后加载摘要…

URL PDF HTML 收藏