Humans are Missing from AI Coding Agent Research
AI编码智能体研究中缺失了人类
AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。
作者
Natural Language Processing
AI编码智能体研究中缺失了人类
AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。
协作健身房:一种促进和评估人机协作的框架
AI总结 Co-Gym框架通过模拟和真实环境支持人机协作研究,展示协作代理在任务性能上的优势,同时揭示当前语言模型的局限性。
Comments ICLR 2026
生成体验用于数字心理健康干预:来自随机研究的证据
机构 * Stanford University(斯坦福大学) ; University of Toronto Mississauga(多伦多大学滑铁卢分校)
AI总结 本文提出生成体验范式,通过动态构建干预体验提升数字心理健康干预效果,实验显示GUIDE在减压和用户体验方面显著优于基线对照。
扩展规模会改善基于LLM的社会模拟吗?
机构 * Stanford University(斯坦福大学) ; Open Athena(开放雅典娜)
AI总结 研究LLM规模扩展对社会模拟保真度的影响,发现多数任务随规模提升而改善,但存在例外,如纵向预测和低资源领域改进缓慢。
CollabSkill: 评估真实世界任务中的人机协作
机构 * Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Rochester(罗切斯特大学) ; Individual Researcher(独立研究者)
AI总结 提出CollabSkill框架,通过配对真实工人与AI代理执行职业任务,利用贝叶斯技能评级系统量化人机贡献,揭示Claude Code排名第一且实践经验是协作技能的主要驱动力。
Comments 10 pages of main paper, COLM 2026
警告标签改变对谄媚AI的认知,但不改变其影响
机构 * University of Oxford(牛津大学) ; Stanford University(斯坦福大学) ; Microsoft(微软) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 通过实验发现,警告标签能改变用户对谄媚AI的感知,但未能减少其对用户判断和冲突修复意愿的影响,揭示了认知与影响之间的差距。
稳健性的错觉:聚合准确率掩盖了与任务无关的上下文下的预测翻转
机构 * Georgia Tech(佐治亚理工学院) ; Stanford University(斯坦福大学)
AI总结 研究大语言模型在含无关上下文环境中的表现,发现聚合准确率掩盖了单个示例预测的不稳定性,如随机伪词会改变部分预测,且此不稳定性受多种因素调节,揭示了尾部风险,推动对模型进行单个示例可靠性评估。
Comments Preprint
FaciliTrain:通过人工智能模拟小组对话来练习促进技能
AI总结 研究旨在解决促进技能刻意练习难规模化问题,提出基于语音的FaciliTrain系统,学习者在模拟对话中应用技术获AI反馈。混合方法研究发现两组评估准确率相当,实验组舒适度降,对照组升,还确定了四个主题并讨论了设计含义。
Comments Accepted to CSCW Poster 2026
与语言模型练习培养人类共情沟通
机构 * Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) ; Northwestern Institute for Complex Systems, Northwestern University(西北大学复杂系统研究所) ; Ryan Institute on Complexity, Northwestern University(西北大学复杂性研究院) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系) ; Department of Communication Studies, Northwestern University(西北大学传播学系) ; Department of Computer Science, Northwestern University(西北大学计算机科学系)
AI总结 研究通过实验平台探讨共情沟通技能的提升,发现简短的LLM指导干预能有效提升参与者与规范共情沟通模式的匹配度,并发现沉默共情效应。
人工智能代理中的安全退化
AI总结 研究人工智能代理安全问题,通过对审查和未审查的语言模型及人工智能代理广泛基准测试,发现随着检索访问扩展,模型出现安全退化现象,基于对齐语言模型构建的支持检索的代理更不安全,强调需缓解策略确保其公平性和可靠性。
SPHERE:人类-人工智能系统评估卡
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学) ; University of Aberdeen(阿伯丁大学)
AI总结 本文提出SPHERE评估卡,从五个维度评估人类-人工智能系统,通过审查39个系统揭示当前评估实践及改进方向,并提出三项提升评估有效性和严谨性的建议。
Journal ref ACL Findings 2025
谄媚型AI使人类互动感觉更加费力且满意度降低
机构 * University of Oxford(牛津大学) ; Stanford University(斯坦福大学) ; UK AI Security Institute(英国人工智能安全研究所)
AI总结 研究显示,谄媚型AI会改变用户对亲密关系的处理方式,长期使用导致用户更倾向于寻求AI建议而非真实人际关系,且满意度下降。
SkillHarm: 通过自动化构建实现生命周期感知的基于技能的攻
机构 * The Ohio State University(俄亥俄州立大学) ; Amazon AGI(亚马逊人工智能实验室) ; Stanford University(斯坦福大学)
AI总结 提出SkillHarm基准,通过固定载荷投毒和自我变异投毒两种攻击场景,系统评估基于技能的攻击在技能使用生命周期中的风险,并构建自动化管道AutoSkillHarm生成大规模攻击样本。
Comments Work in Progress
AI 行为科学
AI总结 本文提出“AI 行为科学”新领域,从三个视角探讨:利用社会科学工具评估AI行为、AI改变人类行为研究方法、以及人机交互对经济政治的影响。
卸载分数:通过反事实工作流衡量AI依赖度
机构 * Stanford University(斯坦福大学) ; University of Oxford(牛津大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan(密歇根大学)
AI总结 本文提出卸载分数(offloading score),一种通过构建反事实工作流量化用户向AI工具卸载认知努力比例的依赖度度量,并通过内在验证和用户实验证明其能检测时间压力下的依赖度变化。
Comments Preprint
测量和缓解过度依赖以构建人类兼容的AI
AI总结 本文研究了大型语言模型过度依赖的风险,探讨了测量和缓解过度依赖的方法,以确保AI能增强而非削弱人类能力。
CodeClash:面向目标导向软件工程的基准测试
机构 * Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学) ; Cornell University(康奈尔大学) ; Technical University of Munich(慕尼黑技术大学)
AI总结 CodeClash通过多轮竞赛评估语言模型在无明确指导下迭代开发代码以实现开放性目标的能力,揭示了模型在战略推理和长期代码维护方面的局限性。
SecureForge:通过提示优化发现并防止LLM生成代码中的漏洞
机构 * Stanford University(斯坦福大学)
AI总结 本文提出SecureForge框架,通过自动化流程发现并减少LLM生成代码中的安全漏洞,提升代码安全性的同时保持单元测试性能,实验显示漏洞减少达48%。
通过模拟搜索LLM代理中的隐私风险
机构 * Georgia Tech(佐治亚理工学院) ; Stanford University(斯坦福大学)
AI总结 本文提出通过模拟搜索改进攻击与防御策略,发现攻击策略从直接请求演变为伪装和伪造同意等复杂手段,防御策略从规则约束升级为身份验证状态机,为隐私安全代理发展提供洞察。
Comments ICLR 2026
人类中心大语言模型的反思与新方向
机构 * Stanford University(斯坦福大学)
AI总结 本文提出人类中心大语言模型框架,整合NLP、HCI和负责任的AI视角,强调在模型开发全流程中关注人类需求与价值观,通过案例研究探讨HCLLMs的未来工作影响。
生成式接口用于语言模型
机构 * Stanford University(斯坦福大学) ; Georgia Tech(佐治亚理工学院)
AI总结 本文提出生成式接口,通过主动生成用户界面提升多轮交互效率,实验表明其在人类偏好上提升达72%。
Comments ACL 2026 Findings
让人类优先:高效LAM评估的人类偏好对齐
机构 * University of Southern California(南加州大学) ; Stanford University(斯坦福大学) ; OpenAthena
AI总结 本文研究了如何通过最小子集高效评估LAM,发现50个样本即可达到高相关性,并通过回归模型提升预测效果,提出HUMANS基准作为高效评估代理。
Comments Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics
SWE-chat:从真实用户中编码代理交互
机构 * Stanford University(斯坦福大学)
AI总结 SWE-chat是首个大规模真实编码代理会话数据集,包含6000个会话,揭示了编码代理在真实场景中的使用模式和失败模式,发现代理生成的代码效率低下且存在更多安全漏洞。
HorizonBench: 长时间跨度个性化与演变偏好
机构 * University of Washington(华盛顿大学) ; Meta ; OpenAI ; Stanford University(斯坦福大学)
AI总结 本文提出HorizonBench,通过生成6个月时间线的对话数据,提供长时间跨度个性化研究的测试平台,揭示状态跟踪能力是长周期个性化的主要瓶颈。
Comments 19 pages, 5 figures, 8 tables
使LLM的假设 verbal化以解释和控制谄媚行为
机构 * Stanford University(斯坦福大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出Verbalized Assumptions框架,通过揭示LLM对用户的错误假设来解释和控制其谄媚行为,发现LLM在面对用户提问时倾向于提供验证而非客观信息,进而提出可解释的细粒度控制方法。
行为编织:从无结构交互中推断用户动机
AI总结 本文提出行为编织架构,通过连接看似无关的行为,推断用户需求并发现隐含动机,验证其在理解用户需求方面的有效性。
谁的知识算数?与夏威夷教育工作者共同设计以社区为中心的AI审计工具
AI总结 本文通过与夏威夷22名教育工作者共同设计的工作坊,探讨了生成式AI在教育中的文化误表问题,并提出以社区为中心的AI审计工具设计理念。
Comments CHI 2026
映射沉默螺旋:在线社区中未说出观点的调查
AI总结 研究通过对比公开和私下意见,揭示社交媒体中沉默螺旋现象,发现少数意见者更沉默,社区设计因素影响自我沉默,提出积极强化等对策。
Comments CHI 2026
消除幻觉:一种动态框架用于评估大语言模型的消除
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Stanford University(斯坦福大学) ; IBM Research(IBM研究院)
AI总结 本文提出了一种动态框架,用于评估大语言模型消除方法的鲁棒性,通过复杂结构查询揭示消除技术在多跳设置中的脆弱性,并提供可扩展的评估方法。
Comments Published at COLM 2025
大语言模型模拟实践与反馈能否提升人类辅导员能力?一项涉及90多名初级辅导员的随机研究
AI总结 本研究通过随机对照试验发现,大语言模型模拟实践结合反馈能有效提升初级辅导员的客户中心微技能和共情能力,而单纯实践效果有限。
Comments Two-column conference proceedings format is 19 pages, with references and appendix it is 31 pages