arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-15 至 2026-07-15 共收录 152 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 11 篇

2607.12267 2026-07-15 cs.LG cs.AI 新提交 73%

Track, Rank, Crack: Epistemic Working Memory Scales Multi-Hop Reasoning in Language Agents

追踪、排序、决断:认知工作记忆对语言智能体中的多跳推理进行衡量

Ning Liu

专题命中 记忆与上下文管理 :agent(abstract);tool use(abstract);分类 cs.AI、cs.LG

AI总结 研究语言智能体多跳推理链变长性能下降问题,提出SLEUTH方法通过结构化认知工作记忆提升推理,经实验优势随难度增加,还发现证据充分性问题及解决办法,表明组织推理方式是扩展多跳推理关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12385 2026-07-15 cs.AI 新提交 70%

PM-Bench: Evaluating Prospective Memory in LLM Agents

PM-Bench:评估大语言模型智能体中的前瞻记忆

Genglin Liu, Saadia Gabriel

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究针对智能体人工智能中的前瞻记忆挑战,引入PM-Bench基准,受认知科学启发评估大语言模型智能体相关能力。在模拟一周内比较八个先进模型,发现各模型在此基准测试中均具挑战性,且无单一改善策略占优,还发布该基准用于诊断与干预。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12236 2026-07-15 cs.LG cs.CL 新提交 62%

Speculate with Memory: Lossless Acceleration for LLM Agents

用记忆进行推测:大语言模型智能体的无损加速

Yu Li, Qinyuan Ye, Prafulla Kumar Choubey, Jiaxin Zhang, Chien-Sheng Wu

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL、cs.LG

AI总结 研究旨在加速大语言模型智能体,提出为推测器配备三个在线记忆系统,通过从智能体过去轨迹学习提升预测质量。经六个基准测试,记忆增强推测在动作和观察预测上有显著提升,且无损并能跨模型推广。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12397 2026-07-15 cs.AI 新提交 57%

Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents

评论家经验库:大语言模型智能体的自进化步骤级置信度估计

Yaopei Zeng, Congchao Wang, JianHang Chen, Nan Wang, Yurui Chang, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Virginia Tech(弗吉尼亚理工大学) Purdue University(普渡大学) Amazon AGI(亚马逊通用人工智能)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究大语言模型智能体的步骤级置信度估计问题,提出自进化评论家框架CEB,其通过积累自身过去判断及后果证据来估计置信度,无需训练和真实步骤标签,在多个基准和主干上校准和排名表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11939 2026-07-15 cs.CV 新提交 50%

TSCA-Net: Temporal-Spatial Clique Attention for Interpretable Multimodal Pedestrian Trajectory Prediction

TSCA-Net:用于可解释多模态行人轨迹预测的时空团块注意力

Md Mustafizur Rahman, Guangchao Yang, A F M Abdun Noor, Md Imam Ahasan, Md Mahfuzur Rahman, Md Ariful Islam

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 针对拥挤环境中行人轨迹预测难题,提出TSCA-Net框架,含时空团块注意力、跨行人团块势、自适应KAN网格细化三个模块,经实验验证其性能最优,消融研究证实模块互补作用。

Comments 10 pages, 4 figures, 4 tables. Submitted to the IEEE International Conference on Data Mining (ICDM) 2026, Applied Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11960 2026-07-15 nlin.AO cond-mat.soft cs.MA physics.bio-ph 新提交 50%

Self-Healing Coordination in Cognitive Swarm Agents with Bloch-Type Perceptual Memory

具有布洛赫型感知记忆的认知群体智能体中的自愈协调

Jyotiranjan Beuria

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究认知群体智能体中自愈协调,基于非马尔可夫集体运动模型,用布洛赫型快慢架构,每个智能体有感知寄存器与慢调节状态耦合,通过多种子消融实验评估,结果显示该架构对自愈有主要功能影响。

Comments Under review at IEEE Transactions on Cognitive and Developmental Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20318 2026-07-15 cs.DB 版本更新 50%

AgenticDB: Self-Evolving Reconfiguration Framework for Database Workloads

AgenticDB: 面向数据库工作负载的代理式性能重配置

Xinyue Yang, Chaozheng Wang, Chen Zheng, Heng Zhang, Yanjun Wu

专题命中 记忆与上下文管理 :agentic(abstract)

AI总结 提出AgenticDB框架,通过运行时交互实现数据库系统级和操作系统级重配置,诊断瓶颈并积累经验,在MySQL和PostgreSQL上平均性能提升118.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07417 2026-07-15 cs.DC 版本更新 50%

LA-IMR: Latency-Aware, Predictive In-Memory Routing and Proactive Autoscaling for Tail-Latency-Sensitive Cloud Robotics

LA-IMR:面向尾延迟敏感的云机器人的延迟感知、预测性内存路由与主动自动缩放

Eunil Seo, Chanh Nguyen, Erik Elmroth

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 针对混合云边基础设施中突发请求导致的尾延迟问题,提出LA-IMR控制层,通过利用率驱动的延迟模型、事件调度、副本自动缩放和边到云卸载,将P99延迟降低高达20.7%。

Comments v3: Revised manuscript with a citation-context correction and improved reference metadata. All references were reverified against authoritative sources; the confirmed page ranges for the ECO and C3 papers were retained

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19598 2026-07-15 nlin.AO math-ph math.MP physics.bio-ph physics.soc-ph 50%

Topological Flux on a Context Manifold Generates Nonreciprocal Collective Dynamics

拓扑流在上下文流形上生成非 reciprocal 集体动力学

Jyotiranjan Beuria, Venkatesh H. Chembrolu

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究通过拓扑流在上下文流形上产生非互易集体动力学,揭示了陈-西蒙斯规范场作为方向影响和非互易集体行为的最小通用来源。

Comments 11 pages, 4 figures

Journal ref Physical Review E 113.6 (2026): 065401

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05317 2026-07-15 math.OC q-fin.MF 版本更新 50%

On a Merton Problem with Irreversible Healthcare Investment

关于具有不可逆医疗保健投资的默顿问题

Giorgio Ferrari, Shihao Zhu

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究具有不可逆医疗保健投资的最优消费、投资组合选择问题,基于默顿问题构建模型,转化为对偶二维最优停止问题,推导正则性、刻画自由边界并数值计算,给出最优策略示例及金融含义。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 21 篇

2607.12068 2026-07-15 cs.SE 新提交 83%

Beyond Test Presence: Assessing the Quality and Robustness of Agent-Generated Tests in Open-Source Projects

超越测试存在:评估开源项目中代理生成测试的质量和稳健性

Preet Jhanglani, Zeel Kaushal Desai, Vidhi Kansara, Eman Abdullah AlOmar

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.SE

AI总结 研究开源项目中代理生成测试的质量和稳健性,通过对大量测试工件进行实证比较,用“白盒”静态分析框架评估质量维度,发现代理在边缘情况覆盖率上优于人类,但生成测试更易脆弱,揭示其缺乏编写稳定测试的“环境意识”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06624 2026-07-15 cs.AI cs.LG cs.SE 版本更新 82%

AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

AgentLens:用于编码智能体评估的生产评估轨迹审查

Andrey Podivilov, Vadim Lomshakov, Sergey Savin, Matvei Startsev, Roman Pozharskiy, Maksim Parshin, Sergey Nikolenko

机构 * Explyt St. Petersburg Department of the Steklov Institute of Mathematics(圣彼得堡斯捷克洛夫数学研究所圣彼得堡分部) St. Petersburg State University(圣彼得堡国立大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 介绍用于编码智能体评估的AgentLens基准,结合形式验证、大语言模型编写的轨迹审查和并排比较来评估智能体整个轨迹,不仅能排名,还可用于诊断模型行为、比较智能体版本及发现产品回归问题,且已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12469 2026-07-15 cs.SE cs.AI 新提交 81%

Agent-Safety Evaluations as Load-Bearing Evidence: A Vendor-Neutral, Cross-Harness Reconstructability Metric

作为承重证据的智能体安全评估:一种供应商中立的跨线束可重构性度量

Oleg Solozobov

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究智能体安全评估结果缺乏承重证据问题,引入属性级可重构性度量及跨线束适配器,通过特定协议和方法定义相关指标,在公共和捆绑轨迹上验证,为安全评估提供可重构性度量及相关验证方法。

Comments 36 pages, 3 tables. Reproducibility package (scorer, fixtures, Evidence Sufficiency Cards): https://doi.org/10.5281/zenodo.21055696

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12338 2026-07-15 cs.AI 新提交 80%

How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks

多少任务足以做出智能体基准决策?对公共大语言模型智能体基准的重放分析

Wei-Jung Huang

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI;agentic(comments)

AI总结 研究智能体基准测试中多少任务足以做决策,通过重放公共任务级记录,提出部分预算需满足支持完整基准决策、覆盖任务组及控制未解决比较比例等条件,还指出部分评估报告应包含的内容。

Comments KDD 2026 Workshop Agentic AI Evaluation and Trustworthiness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11910 2026-07-15 cs.NE cs.AI 新提交 79%

SeqGPT: A Constrained Transformer Agent for the Inverse Design of Multi-Panel Composite Structures

SeqGPT:用于多面板复合结构逆向设计的受限Transformer智能体

Driss Chraibi, Alejandro García Pis, Stéphane Grihon, Sixin Zhang

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对多面板复合结构逆向设计的组合逆问题,提出SeqGPT智能体,采用混合神经符号解码策略,经实验验证其能快速生成与进化方法性能相当的解决方案,加速了设计过程。

Journal ref APIA 2026 -- Applications Pratiques de l'Intelligence Artificielle, AFIA, Jun 2026, Arras, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02235 2026-07-15 cs.SE 版本更新 79%

Agent-Based Software Artifact Evaluation

基于代理的软件工件评估

Zhaonan Wu, Yanjie Zhao, Zhenpeng Chen, Zheng Wang, Haoyu Wang

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 研究针对软件工件评估中人工评估难及现有政策缺乏验证标准的问题,构建ArtifactGuide评分标准,设计ArtifactCopilot代理,通过实验评估,该框架提升了评估性能,提高了评审信心,还为设计高质量工件提供了实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11019 2026-07-15 cs.AI 版本更新 77%

QwenPaw-Data: Bridging Facts, Methodology, and Execution for Autonomous Enterprise Data Analytics

QwenPaw-数据:为自主企业数据分析搭建事实、方法与执行的桥梁

Tianjing Zeng, Yuntao Hong, Zhongjun Ding, Dandan Liu, Yinan Mei, Yunxiang Su, Yiming Wang, Xiaojian Zhang, Jingyu Zhu, Junhao Zhu, Zhuowen Liang, Jiazhen Peng, Lianggui Weng, Zhihao Ding, Kerui Yi, Qifeng Wang, Rong Zhu, Bolin Ding, Liyu Mou, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究针对企业数据分析在开放环境的特性,提出QwenPaw-Data系统,通过整合异构资产、转化自然语言请求为工作流,架构含三个协作子系统,实验证明该系统提升了数据访问和分析质量,为企业数据智能体提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06486 2026-07-15 cs.AI 版本更新 70%

JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks

JADE:面向开放式专业任务的专家基础动态评估

Lanbo Lin, Jiayao Liu, Tianyuan Yang, Li Cai, Yuanwu Xu, Lei Wei, Sicong Xie, Guannan Zhang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出JADE双层评估框架,结合专家知识与动态声明级评估,解决开放式专业任务中严格性与灵活性的矛盾,在BizBench等基准上提升稳定性并揭示关键失败模式。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01241 2026-07-15 cs.CY cs.AI 版本更新 70%

First, do NOHARM: a medical safety benchmark and randomized study of physician and AI teaming on clinical consultations

首先,不伤害:迈向临床安全的大语言模型

David Wu, Fateme Nateghi Haredasht, Saloni Kumar Maharaj, Priyank Jain, Jessica Tran, Matthew Gwiazdon, Arjun Rustagi, Jenelle Jindal, Jacob M. Koshy, Vinay Kadiyala, Anup Agarwal, Bassman Tappuni, Brianna French, Sirus Jesudasen, Christopher V. Cosgriff, Rebanta Chakraborty, Jillian Caldwell, Susan Ziolkowski, David J. Iberri, Robert Diep, Rahul S. Dalal, Kira L. Newman, Kristin Galetta, J. Carl Pallais, Nancy Wei, Kathleen M. Buchheit, David I. Hong, Vartan Pahalyants, Ernest Y. Lee, Allen Shih, Tamara B. Kaplan, Vishnu Ravi, Sarita Khemani, Thomas A. Buckley, April S. Liang, Daniel Shirvani, Advait Patil, Nicholas Marshall, Kanav Chopra, Joel Koh, Adi Badhwar, Anastasia Perez, Austin J. Schoeffler, Mahbuba Tusty, Chase M. Walton, Liam G. McCoy, David J. H. Wu, Yingjie Weng, Sumant Ranji, Kevin Schulman, Nigam H. Shah, Jason Hom, Arnold Milstein, Arjun K. Manrai, Adam Rodman, Jonathan H. Chen, Ethan Goh

机构 * Harvard Combined Dermatology Program(哈佛联合皮肤科项目) Department of Dermatology, Mass General Brigham(麻省总医院皮肤科) Harvard Medical School(哈佛医学院) Stanford Center for Biomedical Informatics Research(斯坦福生物医学信息学研究中心) Stanford University(斯坦福大学) Division of Hospital Medicine, Department of Medicine, Stanford University School of Medicine(斯坦福大学医学院医院医学科) Department of Medicine, Cambridge Health Alliance(剑桥健康联盟医学科) Beth Israel Deaconess Hospital–Plymouth(贝塞斯达德acons医院-普利茅斯) Department of Medicine, University of California, San Francisco(加州大学旧金山分校医学科) Department of Neurology, Stanford University School of Medicine(斯坦福大学医学院神经科) Department of Medicine, Beth Israel Deaconess Medical Center(贝塞斯达德acons医学中心医学科) Division of Cardiology, Department of Medicine, Cambridge Health Alliance(剑桥健康联盟心脏病科) Department of Cardiovascular Medicine, Summa Health System(Summa健康系统心血管医学科) Division of Allergy, Pulmonary, and Critical Care Medicine, Department of Medicine, University of Wisconsin-Madison(威斯康星大学麦迪逊分校医学科过敏、呼吸科和危重医学科) Division of Pulmonary and Critical Care Medicine, Department of Medicine, Massachusetts General Hospital(麻省总医院呼吸科和危重医学科) Center for Immunology and Inflammatory Diseases, Department of Medicine, Massachusetts General Hospital(麻省总医院免疫和炎症疾病中心) Broad Institute of MIT and Harvard(MIT和哈佛Broad研究所) Division of Pulmonary, Critical Care, and Sleep Medicine, Cambridge Health Alliance(剑桥健康联盟呼吸科、危重医学科和睡眠医学科)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出NOHARM基准,包含1100个初级到专科咨询案例,评估28个LLM的医疗建议安全性,发现高达22.6%的案例存在严重危害风险,其中遗漏错误占80%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12523 2026-07-15 cs.LG cs.AI 新提交 62%

OOD-RL-Bench: A Benchmark Framework for Out-of-Distribution Detection in Reinforcement Learning

OOD-RL-Bench:强化学习中分布外检测的基准框架

Emil Mittag, Richard Dazeley, Peter Vamplew

机构 * Deakin University(迪肯大学) Federation University Australia(澳大利亚联邦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对强化学习中分布外检测问题,提出OOD-RL-Bench框架,通过共享接口集成检测器与异常注入器,在LunarLander-v3环境评估其效用,揭示不同异常类型性能差异,还公开相关成果以便重现。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00011 2026-07-15 cs.IR cs.AI cs.SE 版本更新 62%

SkillSelect-Serve: QoS-Aware Budgeted Skill Service Recommendation for LLM Agents

SkillSelect-Serve:面向小型LLM代理的预算可控且QoS感知的技能服务推荐与组合

Jingyuan Zheng, Dongjing Wang, Xin Zhang, Hao Chen, Youhuizi Li, Xudong Shen, Haiping Zhang, Butian Huang, Dongjin Yu, Guandong Xu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出SkillSelect-Serve框架,将技能选择建模为服务推荐与组合问题,通过双粒度效用建模和预算约束优化,在35,353个技能和586个任务查询上优于固定top-k检索基线。

Comments 18 pages (14-page main text + appendices), 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11920 2026-07-15 econ.EM cs.AI stat.ME 新提交 57%

Sensitivity to Subjective Expected Utility Maximization: A Methodological Study, with an Illustrative Application to LLM Decision-Making

对主观预期效用最大化的敏感性:一项方法学研究,并应用于大语言模型决策

Jeff Helzner

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在标记结果稀缺等情况下评估不确定性决策的难题,通过含敏感性参数α的softmax选择模型得出相关可识别性结果,应用于大语言模型决策,检测到结构化比较α效应。

Comments 64 pages, 5 figures. Code and data archived at Zenodo: https://doi.org/10.5281/zenodo.21250951

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12739 2026-07-15 cs.CL 新提交 57%

Epistemic Stance Flexibility Probing: Measuring Prompt-Conditioned Register Shift in Large Language Models

认知立场灵活性探测:测量大语言模型中提示条件下的语域转换

Binwen Liu, Yilin Ren

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究大语言模型在不同归因提示下的认知立场灵活性,引入ESFP基准,涵盖多类别多模板项目,从四个维度评估模型响应,发现认知灵活性与模型能力正交,立场内容密度信号最强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12340 2026-07-15 cs.SE cs.CR 新提交 57%

Skills That Don't Exist: A Large-Scale Study of Hallucinated Skill Recommendation in LLM Agents

不存在的技能:对大语言模型代理中幻觉技能推荐的大规模研究

Weifeng Yuan, Wenbo Guo, Feng Dong, Haoyu Wang, Yang Liu

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 研究大语言模型代理中技能名称幻觉漏洞,通过大规模测量发现各配置均有此问题,系统生成众多幻觉名称且非随机,测试的模型级防御存在安全与可用性冲突,修复需全生态系统结构改变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12227 2026-07-15 cs.AI 新提交 57%

Rethinking the Evaluation of Harness Evolution for Agents

重新思考智能体的 harness 进化评估

Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen, Shakti Senthil, Hannaneh Hajishirzi, Yulia Tsvetkov, Pradeep Dasigi, Teng Xiao

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 研究重新审视大语言模型智能体的自动 harness 进化评估,通过在可比条件下与基线比较及在保留任务上测试,发现其不总优于简单方法且泛化有限,对其有效性提出质疑,强调需更公平评估协议和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11906 2026-07-15 cs.AI 新提交 57%

In-Context Reinforcement Learning under Non-Stationarity: A Survey

非平稳性下的上下文强化学习:一项综述

A Run, Ziluo Ding

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该综述围绕非平稳性下的上下文强化学习展开,探讨预训练或微调决策模型在交互中推断规则改善行为的能力。将其定义为策略固定时通过上下文适应问题,关联多种相关技术,并从变化内容、展开方式及智能体可观察性三方面组织文献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15892 2026-07-15 cs.CV cs.AI 版本更新 57%

Egocentric Bias in Vision-Language Models

视觉语言模型中的自我中心偏差

Maijunxian Wang, Yijiang Li, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao, Emmy Liu, Hokin Deng, Dezhi Luo

机构 * Cognitive Science Program, University of California, Berkeley(加州大学伯克利分校认知科学项目) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) School of Computer Science, Georgia Institute of Technology & Emory University(佐治亚理工学院计算机科学学院及埃默里大学) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Equal Advising Department of Computer Science & Wilmer Eye Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系及威尔默眼科研究所) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Weinberg Institute for Cognitive Science, University of Michigan(密歇根大学韦恩伯格认知科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出FlipSet基准,揭示视觉语言模型在第二级视觉视角推理中存在系统性自我中心偏差,表明模型在整合社会认知与空间操作方面存在根本性不足。

Comments Accepted at CogSci 2026 (Best Undergraduate Student Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25431 2026-07-15 cs.GT 版本更新 50%

Strict Fairness at What Cost? Envy-Free Contracts with Subsidies

带有补贴的无嫉妒合同

Matteo Castiglioni, Junjie Chen, Yingkai Li

专题命中 Agent评测 :agent(abstract)

AI总结 提出带有补贴的无嫉妒合同(EFS)方案,通过额外提供代理人特定补贴,在恢复严格公平性的同时,将公平性代价从无界降低到紧的$n^{\Theta(n)}$界,并证明一般情况下的NP难解性和任务数恒定时的多项式时间算法。

Comments some improvements

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19201 2026-07-15 math.OC math.PR 版本更新 50%

Mean-field optimal control with stochastic leaders

具有随机领导者的平均场最优控制

Sebastian Zimper, Ana Djurdjevac, Carsten Hartmann, Christof Schütte, Nataša Djurdjevac Conrad

专题命中 Agent评测 :agent(abstract)

AI总结 研究大量随机代理受少量随机主导代理影响的系统,在追随者数量趋于无穷时的部分平均场极限。证明有限代理系统最优控制收敛到极限系统最优控制,还提出随机梯度下降算法近似平均场控制,以舆论动态模型为例说明理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20704 2026-07-15 cs.GT math.PR 50%

Asymptotic Fair Division: Chores Are Easier Than Goods

渐进公平分配:家务比物品更容易分配

Pasin Manurangsi, Warut Suksompong

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了家务分配的渐进公平性问题,证明在 m ≥ 2n 时存在无嫉妒分配,且 m 至少为 n + Θ(n) 才能保证存在性,同时比例分配在 m = ω(1) 时很可能存在。

Comments Appears in the 34th International Joint Conference on Artificial Intelligence (IJCAI), 2025

Journal ref SIAM Journal on Discrete Mathematics, 40(3):1048-1065 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏