arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1135 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1135 篇

2607.07602 2026-07-09 astro-ph.CO gr-qc hep-th 新提交 50%

When the Environment Speaks: Quantum Signatures in Non-Attractor Inflation

当环境发声时:非吸引子暴胀中的量子特征

Mattia Cielo, Simone Scarlatella, Gianpiero Mangano, Ofelia Pisanti

专题命中 Agent评测 :agent(abstract)

AI总结 研究暴胀中绝热曲率微扰与熵标量环境相互作用的开放量子动力学,用精确输运方程方法追踪系统协方差矩阵演化,发现环境作用使原初标量功率谱有可观测印记,二阶时还影响引力波背景,为宇宙学观测提供独特光谱特征。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07373 2026-07-09 cs.NE 新提交 50%

Dynamic neural manifolds for flexible closed-loop control on neuromorphic hardware

用于神经形态硬件上灵活闭环控制的动态神经流形

Oskar von Seeler, Christian Tetzlaff, Andrew Lehr

专题命中 Agent评测 :agent(abstract)

AI总结 研究如何将动态神经流形框架扩展到神经形态工程用于实时闭环控制,通过在SpiNNaker 2芯片上实现,允许感官输入调制相关电流来驱动子空间旋转,经机器人模拟验证,为可解释神经形态架构提供可行方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07160 2026-07-09 cs.GT 新提交 50%

Stable Matchings with Minimum Utility Gap

具有最小效用差距的稳定匹配

Yao Sheng, Yu Yokoi

专题命中 Agent评测 :agent(abstract)

AI总结 研究具有最小效用差距的稳定匹配问题,通过旋转偏序集表示稳定匹配集,给出针对最大最小效用差和比率两种情况的多项式时间算法,阐明与现有框架关系并确定特殊情况。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06126 2026-07-08 stat.AP 新提交 50%

Causal Inference with Video Features as Treatments

以视频特征为处理因素的因果推断

Kentaro Nakamura, Adam Breuer, Michael H. Crespin, Bryce J. Dietrich, Kosuke Imai

专题命中 Agent评测 :AI agent(abstract)

AI总结 研究以视频特征为处理因素的因果推断问题,核心方法是用深度生成模型及纵向神经网络架构,主要贡献为开发新统计方法,可探究视频视觉特征对观众反应的影响并用于方法基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06440 2026-07-08 cs.CV 新提交 50%

PIPBench: A Profile-Inclusive Framework for Personalized Image Generation Evaluation

PIPBench:用于个性化图像生成评估的包含个人资料的框架

Yuhang Wu, Shuxiang Zhang, Wee Hian Ching, Chi Zhang, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 Agent评测 :agent(abstract)

AI总结 研究个性化图像生成问题,引入PIPBench基准及新数据构建管道,利用心理和人口统计学资料维度收集数据,全面评估代表性方法,揭示现有方法局限,为个性化文本到图像合成带来新挑战与机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06000 2026-07-08 cs.CR 新提交 50%

Context-to-Execution Integrity for LLM Agents

语言模型代理的上下文到执行完整性

Igor Santos-Grueiro

专题命中 Agent评测 :agent(abstract)

AI总结 研究语言模型代理执行中的上下文到执行完整性问题,提出CXI系统,通过策略标记、类型化释放等机制保障安全执行,经多方面评估,在AgentDojo和代码代理基准测试等中取得良好效果,确保权限绑定才允许执行。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04414 2026-07-07 eess.SP 新提交 50%

Non-invasive Blood Glucose Estimation from Wearable Physiological Signals

从可穿戴生理信号中进行无创血糖估计

Zexing Zhang, Jichao Li, Yilong Wang, Kewei Yang, Tianyang Lei

专题命中 Agent评测 :agent(abstract)

AI总结 研究从可穿戴生理信号无创估计血糖难题,提出深度学习动态增量学习框架,含动态聚类模块与代理梯度桥接代理,还建纵向基准数据集,该方法在验证中效果良好,为后续研究提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02533 2026-07-07 eess.SP cs.SY eess.SY 新提交 50%

Centralized PPO-Based DRL for Multi-UAV-BS Positioning and Trajectory Optimization in Disaster Response Networks

基于集中式近端策略优化的深度强化学习用于灾害响应网络中的多无人机基站定位与轨迹优化

Azim Akhtarshenas, Mario Rico Ibanez, Matteo Bernabe, David Lopez-Perez, Merouane Debbah

专题命中 Agent评测 :agent(abstract)

AI总结 针对灾害场景中多无人机基站定位与轨迹优化问题,扩展集中学习框架,将其建模为马尔可夫决策过程,用近端策略优化的深度强化学习求解,能协调多无人机基站并适应异构用户移动模式。

Comments Submitted to IEEE Transactions on Machine Learning in Communications and Networking (TMLCN). Dataset available at https://doi.org/10.5281/zenodo.20720697 and code available at https://github.com/aakhtarshenas/centralized-ppo-multi-uav-bs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05164 2026-07-07 cs.DS 新提交 50%

Approximation Algorithms for the Traveling Thief Problem

旅行小偷问题的近似算法

Jan Eube, Kelin Luo, Heiko Röglin, Sarah Sturm

专题命中 Agent评测 :agent(abstract)

AI总结 研究旅行小偷问题,它融合了旅行商问题与背包问题。核心方法是设计算法。主要贡献是给出多项式时间计算(9 + ε,9 + ε)近似帕累托集的算法,还为加权旅行商问题给出(2e + ε)近似算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04451 2026-07-07 cs.CV 新提交 50%

CCFM: Collision-Constrained Flow Matching for Safety-Critical Scenario Generation

CCFM:用于安全关键场景生成的碰撞约束流匹配

Ke Li, Kaidi Liang, Yuxin Ding, Debojyoti Biswas, Xianbiao Hu, Ruwen Qin

机构 * Stony Brook University(纽约州立大学石溪分校) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 Agent评测 :agent(abstract)

AI总结 研究自动驾驶车辆规划器在安全关键闭环仿真中的评估,提出CCFM框架,通过硬物理约束保证精确碰撞控制,含碰撞选择器、硬约束和碰撞约束流匹配采样器,性能超基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03646 2026-07-07 cs.CE econ.GN q-fin.EC 新提交 50%

Crypto-Microeconomics: The Distribution of Bitcoin Wealth Among Diverse Economic Agents

加密微观经济学:比特币财富在不同经济主体间的分布

Syed Azhar Hussain, Kashif Ahmad, Mubashir Husain Rehmani

专题命中 Agent评测 :agent(abstract)

AI总结 提出“加密微观经济可观测性框架”,通过描述性、不平等和纵向集中度指标,研究五个标签主体类别的比特币财富微观差异,揭示财富高度集中及各主体内不平等情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03494 2026-07-07 cs.CV cs.MM eess.IV 新提交 50%

Towards Standardized Light Field Quality Assessment: Hybrid Subjective Benchmarking and Objective Metric Evaluation

迈向标准化光场质量评估:混合主观基准测试与客观指标评估

Saeed Mahmoudpour, Mylene C. Q. Farias, Gi-Mun Um, Myllena A. Prado, Ismael Seidel, Leonardo de Sousa Marques, Leonardo Andrade, Shengyang Zhao, Carla L Pagliari

机构 * Electronics and Telecommunications Research Institute(电子和电信研究所) Dept. of Electronics and Informatics, Vrije Universiteit Brussel(布鲁塞尔自由大学电子与信息系) IMEC(imec公司) Department of Computer Science, Texas State University(德克萨斯州立大学计算机科学系) Embedded Computing Lab., Dept. of Computer Science and Statistics, Federal University of Santa Catarina(圣卡塔琳娜联邦大学计算机科学与统计系嵌入式计算实验室) Licks Attorneys(利克斯律师事务所) Federal University of Rio de Janeiro (UFRJ)(里约热内卢联邦大学) Ningbo Institute of Digital Twin, Eastern Institute of Technology(东理工大学宁波数字孪生研究院) Instituto Militar de Engenharia-IME, PGEE/PGED(军事工程学院-IME,PGEE/PGED)

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出光场质量评估标准化工作流程,用于JPEG Pleno标准化活动。设计涵盖多种失真的基准,采用混合主观方法及客观指标分析,验证主观评分可靠性,评估指标性能,指出关键局限并提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03463 2026-07-07 cs.GT 新提交 50%

Random Serial Dictatorship is $\sqrt{2}$-Envy-Free

随机串行独裁机制是$\sqrt{2}$-无嫉妒的

Frank Connor, Max Dupré la Tour, Louis-Roy Langevin, Vishnu V. Narayan, Ndiamé Ndiaye, Neil Rahman, Adrian Vetta

专题命中 Agent评测 :agent(abstract)

AI总结 研究房屋分配问题中随机串行独裁机制(RSD)的公平性,通过嫉妒率量化其与无嫉妒的偏差,给出RSD是$\sqrt{2}$-无嫉妒的匹配上界,并分析其扩展机制在不同估值类下情况。

Comments 32 pages; EC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02972 2026-07-07 cs.CY 新提交 50%

A Scalable Approach to Evaluating Moral Sensitivity in LLMs

一种评估大语言模型道德敏感性的可扩展方法

Daniel Kilov, Secil Yanik Guyot, Caroline Hendy, Sichao Li, Seth Lazar

专题命中 Agent评测 :agent(abstract)

AI总结 研究如何评估大语言模型道德敏感性,提出新方法解决AI对齐研究中行为评估的问题,引入MORPH-1K基准测试并应用于八个模型,证明相关特征语义内容稳定。

Comments 9 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02835 2026-07-07 cs.GT 新提交 50%

A Tractable Continuous-Time Model for Designing Interventions for Time-Inconsistent Agents

一种用于为时间不一致代理设计干预措施的可处理连续时间模型

Yasunori Akagi, Hideaki Kim, Daichi Fushihara, Ryosuke Nakahama, Hiroyasu Miyazaki, Takeshi Kurashima

专题命中 Agent评测 :agent(abstract)

AI总结 研究为时间不一致代理在有期限约束的基于进度的任务中设计干预措施,提出可处理连续时间模型,分析代理行为并研究最优目标设定与奖励调度问题,给出结果及与离散时间模型的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04308 2026-07-07 math.OC econ.TH 新提交 50%

Markov Information Processes

马尔可夫信息过程

Furkan Sezer

专题命中 Agent评测 :agent(abstract)

AI总结 研究有承诺的设计者塑造有策略互动、有远见的智能体信息的信息设计,引入马尔可夫贝叶斯相关均衡,给出设计者问题求解算法,通过例子和数值研究阐述理论。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03167 2026-07-07 math.CO 新提交 50%

Euler Constraints and the Cubic Criticality of Complete Bipartite Preference Structures

欧拉约束与完全二分偏好结构的三次临界性

Yoshiteru Ishida

专题命中 Agent评测 :agent(abstract)

AI总结 研究完全二分偏好结构的多面体可实现性问题,通过碰撞强边要求、二分平面图边界和多面体图最小度约束证明欧拉型临界性定理,区分弱实现并指出欧拉区间未完全可实现,在立方体情形给出偏好理论表现。

Comments 8 pages; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04495 2026-07-07 physics.flu-dyn physics.geo-ph 新提交 50%

U3DWind: A Low Altitude Wind Field Dataset and Benchmark for Urban Air Mobility

U3DWind:用于城市空中交通的低空风场数据集及基准

Shixiong Zhou, Huanxia Wei, Chao Xia, Yingying Xing, Changmin Jiang, Hai Yang, Shuai Jia

专题命中 Agent评测 :planning(abstract)

AI总结 研究针对城市空中交通低空风害评估数据资源不足问题,用GPU加速框架生成U3DWind数据集,涵盖中国五座大城市,定义五项基线任务,为低空交通风影响评估及城市空域管理等提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02784 2026-07-07 physics.chem-ph physics.bio-ph 新提交 50%

Auditing Haldane Consistency in Reversible Enzyme Kinetics: A Curated Two-Sided Backbone and a Labeled Fold-Error Benchmark

审核可逆酶动力学中的霍尔丹一致性:精心策划的双边主干和标记的折叠误差基准

Megan Simons, Jonathan Washburn

专题命中 Agent评测 :workflow(abstract)

AI总结 研究通过霍尔丹关系审核可逆酶动力学常数,用互易成本作为校准对称报告尺度,应用于示范集并构建双边主干,还通过半合成基准量化可检测性,贡献包括生化整理、可重复工作流程及折叠误差校准。

Comments 50 pages, 8 figures, supplementary material and reproducibility code/data included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03151 2026-07-07 cond-mat.mes-hall cond-mat.mtrl-sci 新提交 50%

Comparative Evaluation of Encapsulation Methods for Endohedral Doping of Single-Wall Carbon Nanotubes

单壁碳纳米管内掺杂封装方法的比较评估

Cristian M. Borja-Peña, Martin Magg, Hussein Slim, Yamaldi M. Bakary, Cedric Desroches, Denys Kurylo, Kazuhiro Yanagi, Benjamin S. Flavel, Salomé Forel, Wim Wenseleers, Sofie Cambré

专题命中 Agent评测 :workflow(abstract)

AI总结 研究单壁碳纳米管内掺杂封装电荷转移分子的方法,比较熔体填充、溶液回流、真空相升华等填充方式;通过多种手段评估封装效率与电子改性,还介绍一种无需大量溶剂洗涤的真空相法提高封装系统清洁度。

Comments 53 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00874 2026-07-07 cs.RO cs.MA 新提交 50%

Beyond Line of Sight: Hybrid Validation of V2X Collective Perception in Complex Scenarios

超越视线:复杂场景中V2X集体感知的混合验证

Markos Antonopoulos, Anastasia Bolovinou, Bill Roungas, Elena Daskalaki, Angelos Amditis

机构 * European Union(欧盟)

专题命中 Agent评测 :agent(abstract)

AI总结 提出一种概率框架和混合验证方法,通过贝叶斯融合算法扩展感知范围,在环形交叉口场景中实现视场覆盖增加260%,占用单元召回率从0.82提升至0.94。

Comments 6 pages, 4 figures, to be presented in ITS World 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20723 2026-07-07 cs.CV 新提交 50%

Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

医学视觉语言模型 HuluMed 和 MedGemma 以及通用聊天机器人 Gemma 3、ChatGPT Plus 和 Claude Pro 在真实未见伤口图像上的评估

Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse, Justin W. Ady, Usman Roshan

机构 * Department of Computer Science, New Jersey Institute of Technology(新泽西理工学院计算机科学系) Vascular and Endovascular Surgery, Robert Wood Johnson Hospital(罗伯特·伍德·约翰逊医院血管外科) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系)

专题命中 Agent评测 :planning(abstract)

AI总结 本研究评估了六种视觉语言模型在慢性伤口分析任务上的表现,发现通用模型 ChatGPT 和 Claude 显著优于医学专用模型,表明广泛的多模态推理能力比领域知识更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02330 2026-07-03 cs.GT 新提交 50%

Facility Location Game with Envy Ratio

带有嫉妒比率的设施选址博弈

Yuan Ding, Wenjing Liu, Xin Chen, Qizhi Fang, Qingqin Nong

专题命中 Agent评测 :agent(abstract)

AI总结 研究实数线上以嫉妒比率为目标的一设施选址博弈,提出策略证明或群体策略证明机制以最小化嫉妒比率,并在两种场景下获得最优解和最佳确定性机制。

Journal ref Computers & Industrial Engineering (2020) 106710

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02315 2026-07-03 cs.NE 新提交 50%

Hybridizing a Grouping Metaheuristic with Reinforcement Learning for the One-Dimensional Bin Packing Problem

结合分组元启发式与强化学习的一维装箱问题求解

Zitouni Rania, Mostefai Mounir Sofiane, Tati Youcef, Badaoui Ikram, Bousdjira Nadine, Hasnaoui Sarah

专题命中 Agent评测 :agent(abstract)

AI总结 提出RL-HGGA混合算法,将分组遗传算法与Q学习结合,通过动态选择八种宏动作,在标准测试集上达到0.95%平均最优性差距,计算时间从64.22秒降至1.29秒(50倍加速)。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02314 2026-07-03 cs.GT 新提交 50%

Constrained Distributed Heterogeneous Two-Facility Location Problems with Max-Variant Cost

约束分布式异构双设施选址问题与最大变体成本

Xinru Xu, Wenjing Liu, Qizhi Fang, Alexandros A. Voudouris

专题命中 Agent评测 :agent(abstract)

AI总结 研究在最大变体成本模型下,受限于候选位置且每个位置最多设一个设施,设计策略证明的分布式机制,以近似四种社会目标,并给出常数下界与上界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01556 2026-07-03 cs.CV 新提交 50%

Mind the Gap: Standard 3DGS Evaluation Primarily Measures Near-Trajectory Interpolation

注意差距:标准 3DGS 评估主要衡量近轨迹插值

Gaoxiang Jia, Vikram Appia

机构 * Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 Agent评测 :planning(abstract)

AI总结 标准 3DGS 评估采用隔帧留出法,实际衡量近轨迹插值而非空间泛化。本文提出匹配计数协议,发现插值与外推之间存在 3~12dB 的稳定差距,该差距跨表示族存在,主要由几何代理分量主导,并建议采用空间留出基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00483 2026-07-03 cs.RO 新提交 50%

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

VLM-AR3L:用于强化学习中绝对和相对奖励的视觉-语言模型

Kuan-Chen Chen, Winston Chen, Wei-Fang Sun, Min-Chun Hu

机构 * National Tsing Hua University(国立清华大学) NVIDIA AI Technology Center (NVAITC)(英伟达AI技术中心)

专题命中 Agent评测 :agent(abstract)

AI总结 提出VLM-AR3L框架,利用视觉-语言模型从偏好标签中学习绝对和相对奖励,结合状态评估与比较监督,在多种基准任务中优于先前方法。

Comments Accepted at IJCAI 2026. Project website: https://vlm-ar3l.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26297 2026-07-03 cs.DC cs.CE 新提交 50%

A Distributed Quantum Approximate Optimization Algorithm Simulator for Engineering Design Optimization

面向工程设计优化的分布式量子近似优化算法模拟器

Ali Rajabi, Milad Hasanzadeh, Amin Kargarian

专题命中 Agent评测 :workflow(abstract)

AI总结 提出一个兼容Qiskit的分布式量子近似优化算法模拟器,用于解决工程设计中的QUBO问题,支持单QPU和分布式多QPU执行模式,并包含运行时优化和图形界面。

Comments 37 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17793 2026-07-03 cs.HC cs.DB 新提交 50%

Evaluating Social Engineering Risks in AI-based Interaction using Biometrics and a Gaming Setup

ARES: 一种用于人类-人工智能游戏中基于角色的社会工程风险自适应评估平台

Roberto Daza, Javier Irigoyen, Ivan Lopez, Raquel Rodriguez-Carvajal, Laura Gomez-Carbajo, Julian Fierrez, Ruben Tolosana, Aythami Morales

专题命中 Agent评测 :agent(abstract)

AI总结 提出ARES平台,通过可控社交游戏审计LLM中介的社会决策中的自适应社会工程风险,支持人-人、人-AI和AI-AI设置,并收集多模态数据集以评估风险。

Comments 6 pages, 2 figures. Accepted at the IEEE International Carnahan Conference on Security Technology (ICCST 2026), October 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01159 2026-07-02 cs.GT cs.DM cs.DS 新提交 50%

Online Fair Division Meets Reordering Buffers

在线公平分配遇上重排序缓冲区

Georgios Amanatidis, Giulio Giaconi, Evangelos Markakis, Nicos Protopapas

专题命中 Agent评测 :agent(abstract)

AI总结 研究在线公平分配不可分割混合物品问题,通过引入有限大小的缓冲区,在个性化k-值实例中实现每个时间步EF1且大多数时间步EF的分配。

详情

展开后加载摘要…

URL PDF HTML 收藏