TUX: Measuring Human--AI Tacit Understanding
TUX:衡量人机默契理解
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; New York University(纽约大学)
AI总结 通过光谱放置任务和TUX指数,量化人类与LLM之间的默契理解,发现人格特征影响对齐程度。
高校专区
TUX:衡量人机默契理解
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; New York University(纽约大学)
AI总结 通过光谱放置任务和TUX指数,量化人类与LLM之间的默契理解,发现人格特征影响对齐程度。
有毒幻觉:扰动提示与追踪LLM电路
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Nimblemind
AI总结 研究有毒语言扰动对LLM事实可靠性的影响,发现有毒词汇降低准确率并增加不确定性,通过归因图分析揭示内部机制。
Sophrosyne: 关系数据系统的智能体探索需要适度
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 针对LLM驱动的Text2SQL智能体在探索数据系统时过度探索的问题,提出Sophrosyne环境,通过增强API响应中的指令来引导探索,减少过度探索并提升SQL生成准确性。
语言模型中性别化与性别中立生成的神经元级干预
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
AI总结 提出神经元级干预方法,通过识别与女性、男性和性别中立相关的特定神经元,实现对语言模型生成文本的性别控制,并发现性别神经元主要集中在前几层。
ExpGraph: 面向LLM智能体的模型无关经验学习与图结构记忆
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Nanyang Technological University(南洋理工大学) ; Meta Monetization AI(Meta 营收人工智能)
AI总结 提出ExpGraph框架,通过图结构记忆和强化学习实现冻结LLM执行器的外部经验复用,在问答、数学推理、代码生成和多步智能体任务上显著提升性能并减少交互步骤。
ElasticMem: 将潜在记忆作为LLM智能体的可学习资源
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Nanyang Technological University(南洋理工大学)
AI总结 提出ElasticMem框架,通过可学习的弹性潜在记忆分配策略,在记忆密集型问答和具身智能体控制任务中显著提升准确率并降低token开销。
利用更新并非利用收益:解构自演化LLM智能体中的演化能力
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; UC Santa Cruz(加州大学圣克鲁兹分校) ; Amazon(亚马逊) ; Emory University(埃默里大学) ; UIUC(伊利诺伊大学香槟分校) ; Northeastern University(东北大学)
AI总结 本文通过分析LLM智能体在外部框架(提示、技能、记忆和工具)上的自演化能力,发现框架更新能力与基础能力无关,而框架收益能力与基础能力呈非单调关系,中等能力模型受益最大。
Comments 24 pages, 9 figures, 12 tables
Crafter: 面向多样化输入的可编辑科学图表生成的多智能体框架
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学) ; Peking University(北京大学)
AI总结 提出Crafter多智能体框架,通过结构化组合离散语义组件,实现跨图表类型和输入条件的可编辑科学图表生成,并引入CraftEditor将栅格输出转换为可编辑SVG,在CraftBench基准上显著优于现有方法。
Comments 24 pages, 11 figures
测量、定位和消融LLMs中的对齐特征
机构 * University of Chicago(芝加哥大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)
AI总结 研究通过对比人类文本、基模型和对齐模型生成,发现对齐训练引入AI风格特征,并提出PASTA方法通过消融对齐方向来降低AI检测率。
当英语重写地方知识:大语言模型中的全球叙事主导
机构 * University of Toronto(多伦多大学) ; BUET(巴特利特大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本研究通过构建孟加拉语文化数据集CulturalNB,评估大语言模型在低资源文化背景下的跨语言知识一致性,发现英语提问会系统性地增加全球替代和制度框架,减少地方视角覆盖,表明文化失败不仅是知识缺失,更是根基和叙事优先级问题。
Comments Submitted to ARR
推进大型多模态模型中的创造性物理智能
机构 * UIUC(伊利诺伊大学香槟分校) ; Amazon(亚马逊)
AI总结 针对大型多模态模型在开放式环境中缺乏基于视觉的创造性工具使用能力的问题,提出MM-CreativityBench基准和基于偏好学习的具身对齐方法,显著提升实体选择并减少幻觉。
Comments 51 Pages, 9 Figures, 7 Tables, Previous Work CreativityBench: arXiv:2605.02910
谁获得功劳或责备?在现代AI系统中分配责任
机构 * Harvard University, Cambridge, MA, USA(哈佛大学) ; University of California, Los Angeles, Los Angeles, CA, USA(加州大学洛杉矶分校) ; University of Illinois Urbana-Champaign, Urbana-Champaign, IL, USA(伊利诺伊大学厄巴纳-香槟分校)
AI总结 提出一个归因框架,通过反事实问题量化模型开发各阶段(预训练、微调等)对最终行为的影响,并设计无需重训练的估计器,成功识别并移除多阶段任务中的虚假关联。
MatchFixAgent: 语言无关的自主仓库级代码翻译验证与修复
机构 * Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign, Urbana, IL, USA(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院) ; Amazon, Arlington, VA, USA(亚马逊公司,阿灵顿,弗吉尼亚州,美国) ; University of Oxford, Oxford, UK(牛津大学,牛津,英国)
AI总结 提出基于大语言模型的多智能体框架MatchFixAgent,实现语言无关的仓库级代码翻译等价性验证与修复,在验证覆盖率和修复成功率上显著优于现有方法。
Comments Published in ICML 2026
学习零阶优化器以微调大语言模型
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 提出一种基于学习的零阶优化器ZO-Finetuner,通过紧凑且内存高效的设计自动学习高效扰动策略,实现大语言模型微调时避免反向传播并降低内存开销,在4个LLM和7个数据集上82.1%的任务-模型组合中优于现有零阶基线方法。
Comments ICML 2026