How Well Does Agent Development Reflect Real-World Work?
代理开发是否能反映现实世界的工作?
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。
作者
Natural Language Processing
代理开发是否能反映现实世界的工作?
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。
从人机交互中学习下一步动作预测器
机构 * Stanford University(斯坦福大学) ; Hasso Plattner Institute(哈索普拉特纳研究所) ; New York University(纽约大学)
AI总结 本文提出LongNAP模型,通过结合参数化和上下文学习,从用户行为的完整上下文中预测下一步动作,显著优于传统方法。
Comments 32 pages, 10 figures, see https://generalusermodels.github.io/nap
即时目标:一种专门化人工智能交互的一般方法
机构 * Stanford University(斯坦福大学) ; University of Washington(华盛顿大学)
AI总结 本文提出即时目标方法,通过动态目标诱导提升AI交互的专门化性能,实验表明其在任务处理和质量评估上优于常规LLM。
Comments Accepted at CHI 2026
HumanLM: 通过状态对齐模拟用户优于响应模仿
机构 * Stanford University(斯坦福大学) ; New York University(纽约大学)
AI总结 HumanLM通过状态对齐模拟用户,优于响应模仿,显著提升对齐分数和真实用户相似性。
Comments 27 pages, 17 figures, 9 tables
上下文化隐私防御用于大语言模型代理
机构 * Tsinghua University(清华大学) ; Stanford University(斯坦福大学) ; Microsoft(微软)
AI总结 本文提出上下文化防御指导(CDI),通过强化学习优化框架,在大语言模型代理执行中主动塑造隐私保护与有用性之间的平衡。
Comments 25 pages
GEM:代理大语言模型的训练环境
机构 * Sea AI Lab(海智实验室) ; NUS(国立大学新加坡) ; Oxford(牛津大学) ; SMU(南卫理安大学) ; Stanford(斯坦福大学) ; Northeastern(东北大学) ; OpenRLHF(开放强化学习基金会) ; ROLL ; RL2 ; absolute AI(绝对人工智能)
AI总结 GEM是一个为代理LLM设计的开源训练环境,提供标准化接口、多样化环境和基准测试功能,用于促进基于经验的学习和强化学习算法的评估。
SparkMe: 适应性半结构化访谈用于定性洞察发现
AI总结 SparkMe通过多智能体LLM实现适应性半结构化访谈,提升访谈效用并挖掘更丰富的职业特定洞察。
通过交错语义、音频和文本标记扩展开放离散音频基础模型
机构 * Stanford University(斯坦福大学) ; University of Southern California(南加州大学) ; University of Cambridge(剑桥大学)
AI总结 本文提出SODA模型,通过交错语义、音频和文本标记扩展开放离散音频基础模型,实现通用音频生成和跨模态能力。
Optimas: 通过全局对齐的局部奖励优化复合AI系统
机构 * Stanford University(斯坦福大学) ; Amazon(亚马逊) ; Jožef Stefan Institute(乔泽夫·斯蒂芬研究所) ; Rutgers University(罗格斯大学)
AI总结 Optimas通过全局对齐的局部奖励优化复合AI系统,有效提升复合系统的性能。
Comments Accepted to ICLR 2026. 22 pages
DECEPTICON:暗模式如何操纵网络代理
机构 * Stanford University(斯坦福大学)
AI总结 DECEPTICON研究揭示暗模式通过引导代理轨迹对网络代理构成重大风险,表明需加强防御措施以应对操纵性设计。
人工智能代理的未来工作:跨美国劳动力市场的自动化与增强潜力审计
机构 * Stanford University(斯坦福大学)
AI总结 本文提出一种审计框架,评估职业任务中人工智能代理的自动化与增强潜力,揭示人类自主性需求与技术能力的匹配情况,为AI代理发展提供关键洞察。
Comments Preprint, data available at https://futureofwork.saltlab.stanford.edu/
CooperBench:为何编码代理还不能成为你的队友
机构 * Stanford University(斯坦福大学) ; SAP Labs US(SAP美国实验室)
AI总结 CooperBench通过大规模协作编码任务测试,发现AI代理在团队协作中表现不佳,揭示了沟通障碍、承诺偏离和期望错误等关键问题,呼吁发展社交智能。
Comments https://cooperbench.com First two authors contribute equally. The 3th - 6th authors contribute equally
面向执行导向的自动化AI研究
机构 * Stanford University(斯坦福大学)
AI总结 本研究提出自动化执行器,通过执行反馈学习改进LLM预训练和后训练方法,验证了进化搜索在样本效率上的优势,但强化学习存在模式崩溃问题。
大语言模型的相对扩展定律
机构 * Stanford University(斯坦福大学) ; OpenAthena(开放阿塔纳) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本研究提出相对扩展定律,通过分析不同测试分布在规模变化下的性能差异,揭示大语言模型在扩展过程中并非普遍均衡器,强调了鲁棒性挑战的重要性。
AI伴侣的崛起:人类与聊天机器人关系如何影响幸福感
AI总结 研究探讨了AI伴侣对幸福感的影响,发现依赖聊天机器人寻求陪伴的人群幸福感较低,尤其在高互动和高自我披露情况下,且无法完全替代人类社交。
AutoMetrics: 通过自动生成评估器进行近似人类判断
AI总结 AutoMetrics通过自动生成评估器,在低数据条件下提升与人类评分的相关性,提高Kendall相关性达33.4%,并提供可解释的自动指标工具。
ReplicationBench: 人工智能代理能否复制天体物理学研究论文?
机构 * Stanford University(斯坦福大学) ; University of Toronto(多伦多大学)
AI总结 ReplicationBench旨在评估人工智能代理复制天体物理学研究论文的能力,通过测试代理在实验设置、推导、数据分析和代码库等任务上的表现,揭示代理在科学研究中的可靠性及挑战。
机构 * stanford(斯坦福大学)
Comments ICML 2025
机构 * Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Stanford University(斯坦福大学)
Comments 30 pages
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
Comments EMNLP 2025
机构 * Stanford University(斯坦福大学) ; University of Toronto(多伦多大学) ; University of Pennsylvania(宾夕法尼亚大学)
机构 * Stanford University(斯坦福大学)
机构 * XLANG Lab, The University of Hong Kong(香港大学XLANG实验室) ; Moonshot AI ; Stanford University(斯坦福大学) ; University of Waterloo(滑铁卢大学) ; Carnegie Mellon University(卡内基梅隆大学)
Comments Updata author list, modify first page format, correct typos
机构 * Kellogg School of Management(凯洛格管理学院) ; Northwestern University(西北大学) ; Northwestern Institute for Complex Systems(西北复杂系统研究所) ; Stanford University(斯坦福大学) ; Pennsylvania State University(宾夕法尼亚州立大学)
机构 * Department of Management Science and Engineering, Stanford University(管理科学与工程系,斯坦福大学) ; Department of Electrical Engineering, Stanford University(电气工程系,斯坦福大学) ; Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)
机构 * NYU Shanghai, New York University(纽约大学上海研究院,纽约大学) ; MBZUAI(穆桑大学人工智能研究所) ; Microsoft(微软公司) ; University of Michigan(密歇根大学) ; Apple(苹果公司) ; Google(谷歌公司) ; Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学) ; Google DeepMind(谷歌DeepMind)
Comments NeurIPS 2025 Position Paper
机构 * Stanford University(斯坦福大学) ; Microsoft Research(微软研究院)
Comments 23 pages, 6 figures, 2 tables; see https://generalusermodels.github.io/
机构 * Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; Google(谷歌) ; Nanjing University(南京大学) ; Intel(英特尔)
Comments 21 pages, 8 figures, 7 tables; see https://stanfordhci.github.io/knoll/
Journal ref UIST 2025