arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 531 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 531 篇

2404.04843 2026-07-14 econ.TH 版本更新 50%

Revealed preference with optimal transport: money pumps, bounded rationality, and preference recovery

基于最优运输的显示偏好:货币泵、有限理性与偏好恢复

Joshua Lanier, Matthew Polisson, John K. -H. Quah

专题命中 Agent评测 :agent(abstract)

AI总结 探讨消费者非理性的两种概念联系,证明套利者可抽取货币量与消费者多支付及效用浪费最小量相等,在特定假设下提出恢复真实效用函数的方法,还表明其可解释为误判价格的效用最大化消费者,借助显示偏好与最优运输联系得证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21858 2026-07-10 math.OC 版本更新 50%

When to Match: A Cost-Balancing Principle for Dynamic Markets

何时匹配:动态市场的成本平衡原则

Jie Liu, Hailun Zhang, Jiheng Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 研究动态市场中平台何时匹配的问题,提出成本平衡(CB)规则,在无需预测的情况下,能根据等待成本与当前匹配成本比例决定匹配时机,相比行业标准有成本和延迟优势,是简单高效且最坏情况最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06581 2026-07-09 cs.GT 版本更新 50%

Constant Weighted Maximin Share Approximations for Chores

任务的恒定加权最大最小份额近似值

Bo Li, Fangxiao Wang, Shiji Xing

专题命中 Agent评测 :agent(abstract)

AI总结 研究非对称权重主体间不可分割任务的公平分配,提出首个WMMS恒定因子近似算法,设计保证12近似分配的算法,给出改进下限并刻画两主体最优近似比率曲线,推进了WMMS近似问题研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01683 2026-07-09 cs.CV 版本更新 50%

ROAD-Waymo: A Large-Scale Action Awareness Dataset for Autonomous Driving

ROAD-Waymo:一个用于自动驾驶的大规模动作感知数据集

Salman Khan, Izzeddin Teeti, Reza Javanmard Alitappeh, Mihaela C. Stoian, Eleonora Giunchiglia, Gurkirt Singh, Andrew Bradley, Fabio Cuzzolin

机构 * Oxford Brookes University(奥克斯福德布鲁克斯大学) MAZUST University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出ROAD-Waymo数据集,用于道路场景中代理、动作等检测技术开发与基准测试,比现有数据集更大更具挑战性,含大量标注数据,通过新注释管道增强完整性,还能解决不同国家道路场景的域适应问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11692 2026-07-08 physics.soc-ph 版本更新 50%

Topology-dependent criticality in triplet majority-rule dynamics with collective reversal on quenched networks

三元多数规则动力学中拓扑依赖的临界性

Roni Muslim

专题命中 Agent评测 :agent(abstract)

AI总结 研究三元多数规则意见动力学模型中拓扑对临界点的影响,揭示网络结构如何改变临界点位置及临界指数。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14668 2026-07-08 cs.GT 版本更新 50%

Near-Optimal Best-of-Both-Worlds Fairness for Few Agents

少数代理的近似最优两全其美公平性

Moshe Babaioff, Gefen Frosh

专题命中 Agent评测 :agent(abstract)

AI总结 研究少数代理不可分商品公平分配问题,设计多项式时间BoBW算法,为三个代理实现近似最优公平性,给出两个代理最优结果,包括分配比例、EFX准则及FPTAS等,匹配多项式时间内最强保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08317 2026-07-08 math.OC 版本更新 50%

Stationary Mean-Field Games of Singular Control under Knightian Uncertainty

奈特不确定性下奇异控制的平稳平均场博弈

Giorgio Ferrari, Ioannis Tzouanas

专题命中 Agent评测 :agent(abstract)

AI总结 研究奈特不确定性下奇异控制的平稳平均场博弈,主体通过单边奇异随机控制调整动力学以最大化奖励,利用构造性方法证明平稳平均场均衡的存在唯一性,并给出数值基准及分析不确定性对均衡的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01348 2026-07-07 cs.CV 版本更新 50%

ChartArena: Benchmarking Chart Parsing across Languages, Scenarios, and Formats

ChartArena: 跨语言、场景和格式的图表解析基准测试

Shangpin Peng, Gengluo Li, Xingyu Wan, Chengquan Zhang, Hao Feng, Binghong Wu, Huawen Shen, Weinong Wang, Ziyi Cai, Zhuotao Tian, Han Hu, Can Ma, Yu Zhou

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Shenzhen Loop Area Institute(深圳河套学院) Nankai University(南开大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出ChartArena,一个覆盖8种图表族、3种视觉场景的双语基准,通过人机协作标注和格式无关评估协议,系统评估26个多模态大模型的图表解析能力,揭示前沿模型差距与挑战。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19822 2026-07-07 cs.CV 版本更新 50%

HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks

HUGE-Bench: 面向高级无人机视觉-语言-动作任务的基准测试

Jingyu Guo, Ziye Chen, Ziwen Li, Zhengqing Gao, Jiaxin Huang, Hanlue Zhang, Fengming Huang, Yu Yao, Tongliang Liu, Mingming Gong

机构 * The University of Melbourne(墨尔本大学) Melsy Tech(Melsy科技) MBZUAI Navlyn The University of Sydney(悉尼大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出HUGE-Bench基准,通过4个数字孪生场景和8个高级任务,评估无人机在简洁语言指令下执行安全、过程导向的复杂轨迹能力,并引入过程导向和碰撞感知指标,揭示现有VLA模型在高级语义完成和安全执行上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17496 2026-07-07 q-bio.QM 版本更新 50%

Moo-ving mountains: grazing agents drive terracette formation on steep hillslopes

移动山脉:食草动物驱动陡坡上的梯状地貌形成

Benjamin Seleb, Louis Gonzalez, Atanu Chatterjee, Saad Bhamla

专题命中 Agent评测 :agent(abstract)

AI总结 研究梯状地貌形成原因,用主动行走模型,将有蹄类动物视为在可侵蚀斜坡上移动的随机觅食者,揭示局部觅食规则和底物反馈可自组织成大规模地形模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14006 2026-07-07 physics.soc-ph cond-mat.stat-mech 版本更新 50%

Stochastic Thermodynamics of Social Imitation beyond Energetics

超越能量学的社会模仿随机热力学

Luis Irisarri, Lucas Trigal, Raúl Toral, Gonzalo Manzano

专题命中 Agent评测 :agent(abstract)

AI总结 研究旨在为社会系统推导‘第二定律’,通过建立框架约束主体属性变化及信息熵,以基于主体的社会模仿模型为例,展示相关定理自然出现,揭示权衡并提供参数推断工具。

Comments 16 pages + 10 pages of appendices, 9 figures; comments welcomed. v2: Improved presentation and framing, new section with generalizations of the framework discussed explicitly (accepted in Nat. Comm.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19098 2026-07-07 cs.GT cs.CY 版本更新 50%

Desirable Effort Fairness and Optimality Trade-offs in Strategic Learning

战略学习中理想的努力公平性与最优性权衡

Valia Efthymiou, Ekaterina Fedorova, Chara Podimata

专题命中 Agent评测 :agent(abstract)

AI总结 研究战略学习中决策规则与策略性适应特征的主体间的互动,将问题构建为约束优化问题,给出理论保证并通过实验展示准确性与理想努力公平性间的权衡。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18133 2026-07-07 cs.CY 版本更新 50%

Aggregated Individual Reporting for Post-Deployment Evaluation

部署后评估的聚合个体报告

Jessica Dai, Inioluwa Deborah Raji, Benjamin Recht, Irene Y. Chen

专题命中 Agent评测 :workflow(abstract)

AI总结 针对部署后模型评估需求,提出聚合个体报告机制,依靠公众个体报告来评估系统,探讨个体经验在评估中的作用及实施流程等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28208 2026-07-03 cs.AR cs.ET 版本更新 50%

FCDC: Nonvolatile Charge-Domain Attention with HZO Ferroelectric Capacitors

基于HZO铁电电容的非易失性电荷域注意力机制:从器件到系统的仿真评估

Fares Abouagor

专题命中 Agent评测 :agent(abstract)

AI总结 提出铁电电荷域计算单元(FCDC),利用HZO忆电容器实现非易失性模拟存储和电荷域向量矩阵乘法,用于Transformer注意力机制,通过器件到系统仿真评估两种部署模式,在多种大语言模型上验证了低功耗和精度保持。

Comments 28 pages, 7 figures. Code: https://github.com/faris-agour/FCDC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20358 2026-07-03 cs.GT 版本更新 50%

Efficient Interview Scheduling for Stable Matching

高效面试调度实现稳定匹配

Moshe Babaioff, Rotem Gil, Assaf Romm

专题命中 Agent评测 :agent(abstract)

AI总结 针对偏好不确定且需通过面试揭示的市场,提出两种自适应算法(顺序和混合)以最小化面试次数和轮数,实现临时稳定匹配,并证明每代理平均2次面试的必要性。

Comments 55 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11214 2026-07-02 cs.GT 版本更新 50%

Algorithmic Fair Contracts

算法公平合同

Matteo Castiglioni, Junjie Chen, Yingkai Li

专题命中 Agent评测 :agent(abstract)

AI总结 研究委托-代理中公平合同的设计,证明无嫉妒合同存在但优化收入是NP难的,并给出常数任务或常数代理下的可计算情形及公平代价分析。

Comments some improvements

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01897 2026-07-01 cs.SD eess.AS 版本更新 50%

FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection

FastTurn:统一声学和流式语义线索以实现低延迟和鲁棒的轮换检测

Chengyou Wang, Hongfei Xue, Mingchen Shao, Chunjiang He, Jingbin Hu, Shuiyuan Wang, Bo Wu, Yuyu Ji, Jimeng Zheng, Ruofei Chen, Zhou Zhu, Lei Xie

机构 * Audio, Speech and Language Processing Group(语音与语言处理组) Shengwang(盛王) QualiaLabs

专题命中 Agent评测 :agent(abstract)

AI总结 FastTurn通过结合流式CTC解码与声学特征,实现低延迟和鲁棒的轮换检测,同时释放基于真实人类对话的测试集,提升实际全双工对话系统的性能。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14647 2026-07-01 cs.LO math.LO 版本更新 50%

A Semantics for Belief in Simplicial Complexes

单纯复形中信念的语义

Adam Bjorndahl, Philip Sink

专题命中 Agent评测 :agent(abstract)

AI总结 提出一种基于单纯复形的信念语义,满足KD45公理和“知识蕴含信念”,并通过与关系模型的保真对应给出简单公理化。

Comments In Proceedings AiML 2026, arXiv:2606.29444

Journal ref EPTCS 447, 2026, pp. 173-188

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02376 2026-07-01 cs.HC 版本更新 50%

Talking Surveys: How Photorealistic Embodied Conversational Agents Shape Response Quality, Engagement, and Satisfaction

对话式调查:逼真的具身对话代理如何影响回答质量、参与度和满意度

Matus Krajcovic, Peter Demcak, Eduard Kuric

专题命中 Agent评测 :agent(abstract)

AI总结 研究提出一种集成AI驱动视频生成、语音识别和大语言模型的虚拟化身对话调查工具,实验表明具身代理能显著提升回答信息量和详细度,提高参与效率,但对满意度无显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18879 2026-06-29 econ.TH 版本更新 50%

Motivating Innovation with a Misspecified Roadmap

用错误指定的路线图激励创新

Florian Mudekereza

专题命中 Agent评测 :agent(abstract)

AI总结 研究委托人用路线图指导代理人创新时,路线图错误指定导致代理人陷入突破陷阱,无法持续创新,并得到创新频率上界随错误程度增加而收紧的结论。

Comments Cleaner results and the static framework is now removed

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09152 2026-06-26 econ.TH 版本更新 50%

Egalitarian-equivalent and strategy-proof mechanisms in homogeneous multi-object allocation problems

同质多物品分配问题中的平等等价与策略证明机制

Hinata Kurashita, Ryosuke Sakai

专题命中 Agent评测 :agent(abstract)

AI总结 研究带货币的同质不可分物品分配问题,刻画满足平等等价、策略证明、个体理性和无补贴的机制类,发现平等等价与效率存在冲突;用非明显可操纵性替代策略证明后,可设计同时满足平等等价和效率的机制,并识别出福利最优机制。

Comments This version generalizes the model and corrects errors in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00853 2026-06-26 math.OC cs.SY eess.SY q-fin.MF 版本更新 50%

Ranking Quantilized Mean-Field Games with an Application to Early-Stage Venture Investments

排序量化平均场博弈及其在早期风险投资中的应用

Rinel Foguen Tchuendom, Dena Firoozi, Michèle Breton

专题命中 Agent评测 :agent(abstract)

AI总结 研究一类基于总体α-分位数的排序量化平均场博弈,提出目标型和阈值型两种模型,并应用于早期风险投资中筛选顶尖初创企业。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05353 2026-06-26 cs.GT 版本更新 50%

Weighted Envy-Freeness Revisited: Indivisible Resource and House Allocations

加权无嫉妒性再探讨:不可分资源与房屋分配

Yuxi Liu, Mingyu Xiao

专题命中 Agent评测 :agent(abstract)

AI总结 提出SumAvg-无嫉妒性概念,显著提高公平分配的存在性,并系统研究新旧加权公平概念在不可分资源分配和房屋分配中的计算复杂性。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-60679-7}

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20183 2026-06-25 cs.CV 版本更新 50%

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

MSAVBench:面向多镜头音频-视频生成的全面可靠评估

Yujie Wei, Yujin Han, Zhekai Chen, Yongming Li, Kaixun Jiang, Zhihang Liu, Quanhao Li, Zhiwu Qing, Xiang Wang, Zhen Xing, Ruihang Chu, Lingyi Hong, Yefei He, Junjie Zhou, Junqiu Yu, Yang Shi, Difan Zou, Kai Zhu, Shiwei Zhang, Yingya Zhang, Yu Liu, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 Agent评测 :agentic(abstract)

AI总结 提出首个多镜头音频-视频生成基准MSAVBench,通过自适应混合评估框架在四个维度上系统评估19个模型,发现当前系统在导演级控制和细粒度音视频同步上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22249 2026-06-24 cs.CV 版本更新 50%

D3Seg: Dependency-Aware Diffusion for Brain Tumor Segmentation with Missing Modalities

D3Seg: 依赖感知的扩散模型用于缺失模态的脑肿瘤分割

Danish Ali, Ajmal Mian, Naveed Akhtar, Ghulam Mubashar Hassan

机构 * The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学)

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出D3Seg模型,通过多跳模态图融合、轻量扩散插补机制和概率空间决策细化,解决缺失MRI模态下的脑肿瘤分割问题,提升分割性能并保持计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00690 2026-06-23 eess.SY cs.SY 版本更新 50%

The Potential Welfare Gains from Curtailment Trading Under Non-Firm Interconnection

非固定互联下削减交易潜在福利收益

Richard Mahuze, Charlotte Gressel, Ali Amadeh, K. Max Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 提出网络约束的削减信用市场(CCM),通过双边信用流机制实现最优削减分配,在三个测试系统中总服务负荷价值提升1.41至1.83倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14944 2026-06-23 cs.RO cs.CV 版本更新 50%

HRDexDB: A Paired Human-Robot Dataset for Cross-Embodiment Dexterous Grasping

HRDexDB:用于跨本体灵巧抓取的配对人机数据集

Jongbin Lim, Taeyun Ha, Mingi Choi, Jisoo Kim, Byungjun Kim, Subin Jeon, Hanbyul Joo

机构 * Seoul National University(首尔国立大学) RLWRLD(RLWRLD实验室)

专题命中 Agent评测 :agent(abstract)

AI总结 提出HRDexDB,一个包含人类和多种机器人手的高保真灵巧抓取轨迹配对数据集,涵盖100种物体,提供高精度时空3D真值,作为跨本体灵巧操作的基础基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11061 2026-06-23 cs.CV 版本更新 50%

VDAWorld: World Modelling via VLM-Directed Abstraction and Simulation

VDAWorld: 通过VLM导向的抽象与模拟进行世界建模

Felix O'Mahony, Roberto Cipolla, Ayush Tewari

机构 * University of Cambridge(剑桥大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出VDAWorld框架,利用视觉语言模型自主构建场景表示并选择物理模拟器,通过抽象与自适应模拟实现高质量世界建模,在交互控制、反事实生成和物理逻辑推理任务上取得最优结果。

Comments Website: https://felixomahony.github.io/vdaworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10705 2026-06-23 eess.IV cs.CV 版本更新 50%

3D Vessel Reconstruction from Sparse-View Dynamic DSA Images via Vessel Probability Guided Attenuation Learning

基于血管概率引导衰减学习的稀疏视角动态DSA图像三维血管重建

Zhentao Liu, Huangxuan Zhao, Wenhui Qin, Zhenghong Zhou, Xinggang Wang, Wenping Wang, Xiaochun Lai, Chuansheng Zheng, Dinggang Shen, Zhiming Cui

机构 * School of Biomedical Engineering \& State Key Laboratory of Advanced Medical Materials Devices, ShanghaiTech University, Shanghai, China National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University, Wuhan, China School of Electronic Information Communications, Huazhong University of Science Department of Computer Science \& Engineering, Texas A\&M University, USA

专题命中 Agent评测 :agent(abstract)

AI总结 提出血管概率引导衰减学习框架,通过静态与动态衰减场互补加权实现稀疏视角DSA重建,降低辐射剂量,并采用渐进训练和时间扰动损失提升质量。

Comments Accepted by Medical Image Analysis (MedIA), 2026; code: https://github.com/ShanghaiTech-IMPACT/VPAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06754 2026-06-23 physics.med-ph 版本更新 50%

Fully three-dimensional sound speed-corrected multi-wavelength photoacoustic breast tomography

全三维声速校正多波长光声乳腺断层成像

M. Dantuma, F. Lucka, S. C. Kruitwagen, A. Javaherian, L. Alink, R. P. Pompe van Meerdervoort, M. Nanninga, T. J. P. M. Op 't Root, B. De Santi, J. Budisky, G. Bordovsky, E. Coffy, M. Wilm, T. Kasponas, S. H. Aarnink, L. F. de Geus-Oei, F. Brochin, T. Martinez, A. Michailovas, W. Muller Kobold, J. Jaros, J. Veltman, B. Cox, S. Manohar

专题命中 Agent评测 :agent(abstract)

AI总结 提出混合光声与超声传输断层成像系统PAM3,首次实现三维多波长光声成像并利用三维声速图校正不均匀性,达到48mm最深成像深度和各向同性空间分辨率。

Comments 33 pages Main Body, 9 pages Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏