arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-07 至 2026-07-07 共收录 442 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 91 篇

2607.02533 2026-07-07 eess.SP cs.SY eess.SY 新提交 50%

Centralized PPO-Based DRL for Multi-UAV-BS Positioning and Trajectory Optimization in Disaster Response Networks

基于集中式近端策略优化的深度强化学习用于灾害响应网络中的多无人机基站定位与轨迹优化

Azim Akhtarshenas, Mario Rico Ibanez, Matteo Bernabe, David Lopez-Perez, Merouane Debbah

专题命中 Agent评测 :agent(abstract)

AI总结 针对灾害场景中多无人机基站定位与轨迹优化问题,扩展集中学习框架,将其建模为马尔可夫决策过程,用近端策略优化的深度强化学习求解,能协调多无人机基站并适应异构用户移动模式。

Comments Submitted to IEEE Transactions on Machine Learning in Communications and Networking (TMLCN). Dataset available at https://doi.org/10.5281/zenodo.20720697 and code available at https://github.com/aakhtarshenas/centralized-ppo-multi-uav-bs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05164 2026-07-07 cs.DS 新提交 50%

Approximation Algorithms for the Traveling Thief Problem

旅行小偷问题的近似算法

Jan Eube, Kelin Luo, Heiko Röglin, Sarah Sturm

专题命中 Agent评测 :agent(abstract)

AI总结 研究旅行小偷问题,它融合了旅行商问题与背包问题。核心方法是设计算法。主要贡献是给出多项式时间计算(9 + ε,9 + ε)近似帕累托集的算法,还为加权旅行商问题给出(2e + ε)近似算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04451 2026-07-07 cs.CV 新提交 50%

CCFM: Collision-Constrained Flow Matching for Safety-Critical Scenario Generation

CCFM:用于安全关键场景生成的碰撞约束流匹配

Ke Li, Kaidi Liang, Yuxin Ding, Debojyoti Biswas, Xianbiao Hu, Ruwen Qin

机构 * Stony Brook University(纽约州立大学石溪分校) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 Agent评测 :agent(abstract)

AI总结 研究自动驾驶车辆规划器在安全关键闭环仿真中的评估,提出CCFM框架,通过硬物理约束保证精确碰撞控制,含碰撞选择器、硬约束和碰撞约束流匹配采样器,性能超基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03646 2026-07-07 cs.CE econ.GN q-fin.EC 新提交 50%

Crypto-Microeconomics: The Distribution of Bitcoin Wealth Among Diverse Economic Agents

加密微观经济学:比特币财富在不同经济主体间的分布

Syed Azhar Hussain, Kashif Ahmad, Mubashir Husain Rehmani

专题命中 Agent评测 :agent(abstract)

AI总结 提出“加密微观经济可观测性框架”,通过描述性、不平等和纵向集中度指标,研究五个标签主体类别的比特币财富微观差异,揭示财富高度集中及各主体内不平等情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03494 2026-07-07 cs.CV cs.MM eess.IV 新提交 50%

Towards Standardized Light Field Quality Assessment: Hybrid Subjective Benchmarking and Objective Metric Evaluation

迈向标准化光场质量评估:混合主观基准测试与客观指标评估

Saeed Mahmoudpour, Mylene C. Q. Farias, Gi-Mun Um, Myllena A. Prado, Ismael Seidel, Leonardo de Sousa Marques, Leonardo Andrade, Shengyang Zhao, Carla L Pagliari

机构 * Electronics and Telecommunications Research Institute(电子和电信研究所) Dept. of Electronics and Informatics, Vrije Universiteit Brussel(布鲁塞尔自由大学电子与信息系) IMEC(imec公司) Department of Computer Science, Texas State University(德克萨斯州立大学计算机科学系) Embedded Computing Lab., Dept. of Computer Science and Statistics, Federal University of Santa Catarina(圣卡塔琳娜联邦大学计算机科学与统计系嵌入式计算实验室) Licks Attorneys(利克斯律师事务所) Federal University of Rio de Janeiro (UFRJ)(里约热内卢联邦大学) Ningbo Institute of Digital Twin, Eastern Institute of Technology(东理工大学宁波数字孪生研究院) Instituto Militar de Engenharia-IME, PGEE/PGED(军事工程学院-IME,PGEE/PGED)

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出光场质量评估标准化工作流程,用于JPEG Pleno标准化活动。设计涵盖多种失真的基准,采用混合主观方法及客观指标分析,验证主观评分可靠性,评估指标性能,指出关键局限并提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03463 2026-07-07 cs.GT 新提交 50%

Random Serial Dictatorship is $\sqrt{2}$-Envy-Free

随机串行独裁机制是$\sqrt{2}$-无嫉妒的

Frank Connor, Max Dupré la Tour, Louis-Roy Langevin, Vishnu V. Narayan, Ndiamé Ndiaye, Neil Rahman, Adrian Vetta

专题命中 Agent评测 :agent(abstract)

AI总结 研究房屋分配问题中随机串行独裁机制(RSD)的公平性,通过嫉妒率量化其与无嫉妒的偏差,给出RSD是$\sqrt{2}$-无嫉妒的匹配上界,并分析其扩展机制在不同估值类下情况。

Comments 32 pages; EC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02972 2026-07-07 cs.CY 新提交 50%

A Scalable Approach to Evaluating Moral Sensitivity in LLMs

一种评估大语言模型道德敏感性的可扩展方法

Daniel Kilov, Secil Yanik Guyot, Caroline Hendy, Sichao Li, Seth Lazar

专题命中 Agent评测 :agent(abstract)

AI总结 研究如何评估大语言模型道德敏感性,提出新方法解决AI对齐研究中行为评估的问题,引入MORPH-1K基准测试并应用于八个模型,证明相关特征语义内容稳定。

Comments 9 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02835 2026-07-07 cs.GT 新提交 50%

A Tractable Continuous-Time Model for Designing Interventions for Time-Inconsistent Agents

一种用于为时间不一致代理设计干预措施的可处理连续时间模型

Yasunori Akagi, Hideaki Kim, Daichi Fushihara, Ryosuke Nakahama, Hiroyasu Miyazaki, Takeshi Kurashima

专题命中 Agent评测 :agent(abstract)

AI总结 研究为时间不一致代理在有期限约束的基于进度的任务中设计干预措施,提出可处理连续时间模型,分析代理行为并研究最优目标设定与奖励调度问题,给出结果及与离散时间模型的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04308 2026-07-07 math.OC econ.TH 新提交 50%

Markov Information Processes

马尔可夫信息过程

Furkan Sezer

专题命中 Agent评测 :agent(abstract)

AI总结 研究有承诺的设计者塑造有策略互动、有远见的智能体信息的信息设计,引入马尔可夫贝叶斯相关均衡,给出设计者问题求解算法,通过例子和数值研究阐述理论。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03167 2026-07-07 math.CO 新提交 50%

Euler Constraints and the Cubic Criticality of Complete Bipartite Preference Structures

欧拉约束与完全二分偏好结构的三次临界性

Yoshiteru Ishida

专题命中 Agent评测 :agent(abstract)

AI总结 研究完全二分偏好结构的多面体可实现性问题,通过碰撞强边要求、二分平面图边界和多面体图最小度约束证明欧拉型临界性定理,区分弱实现并指出欧拉区间未完全可实现,在立方体情形给出偏好理论表现。

Comments 8 pages; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04495 2026-07-07 physics.flu-dyn physics.geo-ph 新提交 50%

U3DWind: A Low Altitude Wind Field Dataset and Benchmark for Urban Air Mobility

U3DWind:用于城市空中交通的低空风场数据集及基准

Shixiong Zhou, Huanxia Wei, Chao Xia, Yingying Xing, Changmin Jiang, Hai Yang, Shuai Jia

专题命中 Agent评测 :planning(abstract)

AI总结 研究针对城市空中交通低空风害评估数据资源不足问题,用GPU加速框架生成U3DWind数据集,涵盖中国五座大城市,定义五项基线任务,为低空交通风影响评估及城市空域管理等提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02784 2026-07-07 physics.chem-ph physics.bio-ph 新提交 50%

Auditing Haldane Consistency in Reversible Enzyme Kinetics: A Curated Two-Sided Backbone and a Labeled Fold-Error Benchmark

审核可逆酶动力学中的霍尔丹一致性:精心策划的双边主干和标记的折叠误差基准

Megan Simons, Jonathan Washburn

专题命中 Agent评测 :workflow(abstract)

AI总结 研究通过霍尔丹关系审核可逆酶动力学常数,用互易成本作为校准对称报告尺度,应用于示范集并构建双边主干,还通过半合成基准量化可检测性,贡献包括生化整理、可重复工作流程及折叠误差校准。

Comments 50 pages, 8 figures, supplementary material and reproducibility code/data included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03151 2026-07-07 cond-mat.mes-hall cond-mat.mtrl-sci 新提交 50%

Comparative Evaluation of Encapsulation Methods for Endohedral Doping of Single-Wall Carbon Nanotubes

单壁碳纳米管内掺杂封装方法的比较评估

Cristian M. Borja-Peña, Martin Magg, Hussein Slim, Yamaldi M. Bakary, Cedric Desroches, Denys Kurylo, Kazuhiro Yanagi, Benjamin S. Flavel, Salomé Forel, Wim Wenseleers, Sofie Cambré

专题命中 Agent评测 :workflow(abstract)

AI总结 研究单壁碳纳米管内掺杂封装电荷转移分子的方法,比较熔体填充、溶液回流、真空相升华等填充方式;通过多种手段评估封装效率与电子改性,还介绍一种无需大量溶剂洗涤的真空相法提高封装系统清洁度。

Comments 53 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00874 2026-07-07 cs.RO cs.MA 新提交 50%

Beyond Line of Sight: Hybrid Validation of V2X Collective Perception in Complex Scenarios

超越视线:复杂场景中V2X集体感知的混合验证

Markos Antonopoulos, Anastasia Bolovinou, Bill Roungas, Elena Daskalaki, Angelos Amditis

机构 * European Union(欧盟)

专题命中 Agent评测 :agent(abstract)

AI总结 提出一种概率框架和混合验证方法,通过贝叶斯融合算法扩展感知范围,在环形交叉口场景中实现视场覆盖增加260%,占用单元召回率从0.82提升至0.94。

Comments 6 pages, 4 figures, to be presented in ITS World 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20723 2026-07-07 cs.CV 新提交 50%

Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

医学视觉语言模型 HuluMed 和 MedGemma 以及通用聊天机器人 Gemma 3、ChatGPT Plus 和 Claude Pro 在真实未见伤口图像上的评估

Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse, Justin W. Ady, Usman Roshan

机构 * Department of Computer Science, New Jersey Institute of Technology(新泽西理工学院计算机科学系) Vascular and Endovascular Surgery, Robert Wood Johnson Hospital(罗伯特·伍德·约翰逊医院血管外科) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系)

专题命中 Agent评测 :planning(abstract)

AI总结 本研究评估了六种视觉语言模型在慢性伤口分析任务上的表现,发现通用模型 ChatGPT 和 Claude 显著优于医学专用模型,表明广泛的多模态推理能力比领域知识更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01348 2026-07-07 cs.CV 版本更新 50%

ChartArena: Benchmarking Chart Parsing across Languages, Scenarios, and Formats

ChartArena: 跨语言、场景和格式的图表解析基准测试

Shangpin Peng, Gengluo Li, Xingyu Wan, Chengquan Zhang, Hao Feng, Binghong Wu, Huawen Shen, Weinong Wang, Ziyi Cai, Zhuotao Tian, Han Hu, Can Ma, Yu Zhou

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Shenzhen Loop Area Institute(深圳河套学院) Nankai University(南开大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出ChartArena,一个覆盖8种图表族、3种视觉场景的双语基准,通过人机协作标注和格式无关评估协议,系统评估26个多模态大模型的图表解析能力,揭示前沿模型差距与挑战。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19822 2026-07-07 cs.CV 版本更新 50%

HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks

HUGE-Bench: 面向高级无人机视觉-语言-动作任务的基准测试

Jingyu Guo, Ziye Chen, Ziwen Li, Zhengqing Gao, Jiaxin Huang, Hanlue Zhang, Fengming Huang, Yu Yao, Tongliang Liu, Mingming Gong

机构 * The University of Melbourne(墨尔本大学) Melsy Tech(Melsy科技) MBZUAI Navlyn The University of Sydney(悉尼大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出HUGE-Bench基准,通过4个数字孪生场景和8个高级任务,评估无人机在简洁语言指令下执行安全、过程导向的复杂轨迹能力,并引入过程导向和碰撞感知指标,揭示现有VLA模型在高级语义完成和安全执行上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17496 2026-07-07 q-bio.QM 版本更新 50%

Moo-ving mountains: grazing agents drive terracette formation on steep hillslopes

移动山脉:食草动物驱动陡坡上的梯状地貌形成

Benjamin Seleb, Louis Gonzalez, Atanu Chatterjee, Saad Bhamla

专题命中 Agent评测 :agent(abstract)

AI总结 研究梯状地貌形成原因,用主动行走模型,将有蹄类动物视为在可侵蚀斜坡上移动的随机觅食者,揭示局部觅食规则和底物反馈可自组织成大规模地形模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14006 2026-07-07 physics.soc-ph cond-mat.stat-mech 版本更新 50%

Stochastic Thermodynamics of Social Imitation beyond Energetics

超越能量学的社会模仿随机热力学

Luis Irisarri, Lucas Trigal, Raúl Toral, Gonzalo Manzano

专题命中 Agent评测 :agent(abstract)

AI总结 研究旨在为社会系统推导‘第二定律’,通过建立框架约束主体属性变化及信息熵,以基于主体的社会模仿模型为例,展示相关定理自然出现,揭示权衡并提供参数推断工具。

Comments 16 pages + 10 pages of appendices, 9 figures; comments welcomed. v2: Improved presentation and framing, new section with generalizations of the framework discussed explicitly (accepted in Nat. Comm.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19098 2026-07-07 cs.GT cs.CY 版本更新 50%

Desirable Effort Fairness and Optimality Trade-offs in Strategic Learning

战略学习中理想的努力公平性与最优性权衡

Valia Efthymiou, Ekaterina Fedorova, Chara Podimata

专题命中 Agent评测 :agent(abstract)

AI总结 研究战略学习中决策规则与策略性适应特征的主体间的互动,将问题构建为约束优化问题,给出理论保证并通过实验展示准确性与理想努力公平性间的权衡。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18133 2026-07-07 cs.CY 版本更新 50%

Aggregated Individual Reporting for Post-Deployment Evaluation

部署后评估的聚合个体报告

Jessica Dai, Inioluwa Deborah Raji, Benjamin Recht, Irene Y. Chen

专题命中 Agent评测 :workflow(abstract)

AI总结 针对部署后模型评估需求,提出聚合个体报告机制,依靠公众个体报告来评估系统,探讨个体经验在评估中的作用及实施流程等。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2606.30543 2026-07-07 cs.CL cs.AI 版本更新 62%

TRACE: Temporal Relationship-Aware Conversational Entrainment Detection in Dyadic Speech

TRACE: 双人语音中基于时间关系的对话韵律同步检测

Sathvik Manikantan Napa Ugandhar, Hao Zhang, Alison Gunzler, Yuzhe Wang, Thomas Thebaud, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velázquez

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系) Amazon Research(亚马逊研究院) Amazon(亚马逊)

专题命中 其他Agent :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 提出TRACE框架,通过窗口级声学嵌入建模双人交互的时间序列,结合对话上下文和关系信息,在DyadEE数据集上实现97.01%的情感韵律同步检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏