Language Models Generalize to Human-like Word Order Preferences
语言模型可泛化出类人的词序偏好
机构 * University of Washington(华盛顿大学)
AI总结 本研究发现不同规模的语言模型可从贫乏输入中泛化出类人的范围同态名词短语修饰语顺序偏好,且该偏好无法用点互信息解释。
高校专区
语言模型可泛化出类人的词序偏好
机构 * University of Washington(华盛顿大学)
AI总结 本研究发现不同规模的语言模型可从贫乏输入中泛化出类人的范围同态名词短语修饰语顺序偏好,且该偏好无法用点互信息解释。
棋盘上的幻觉:工具增强型大语言模型(LLM)象棋评论评估
机构 * Princeton University(普林斯顿大学) ; Sentient Labs ; University of Washington(华盛顿大学)
AI总结 本研究提出ACT-Eval框架,评估工具增强型LLM的象棋评论,发现事实幻觉普遍存在,工具可提升事实正确性但战略战术覆盖度仍有限。
Comments 23 pages, 6 figures
大型语言模型中层级情感组织的涌现
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; University of Tokyo(东京大学)
AI总结 受情感轮理论启发,分析大型语言模型输出中情感状态间的概率依赖关系,发现模型自然形成与人类心理模型一致的层级情感树,且更大模型发展出更复杂的层级结构,同时揭示社会经济角色在情感识别中的系统性偏差。
Comments ICML 2026
HumanCLAW:视觉-语言模型能否通过实体身体执行动作
机构 * Meta ; Nanyang Technological University(南洋理工大学) ; University of Washington(华盛顿大学) ; Brown University(布朗大学) ; Northwestern University(西北大学)
AI总结 本研究提出HumanCLAW框架与HumanCLAW-Bench基准,测试9个先进VLM发现其均未解决具身动作任务,最优仅16.8%成功率,核心缺失具身自我意识。
Comments Project page: https://human-claw.github.io/
基于静电离合器的机械多路复用器及其增强的力能力
机构 * Dept of Electrical and Computer Engineering, University of Washington(华盛顿大学电气与计算机工程系) ; US Army Research Directorate, DEVCOM Army Research Laboratory(美国陆军研究署, DEVCOM陆军研究实验室) ; Mechanical and Industrial Engineering Department of Northeastern University(东北大学机械与工业工程系)
AI总结 本文提出一种基于静电 capstan 离合器的机械多路复用器,实现单电机同时和顺序控制,展示在四自由度腱驱动机器人手中,单电机输出力达212N,垂直抓力提升4.09倍,水平承载力达111.2N。
Rex: 一族可逆指数(随机)龙格-库塔求解器
机构 * University of Washington(华盛顿大学)
AI总结 提出Rex求解器族,通过Lawson方法将显式(随机)龙格-库塔格式转化为代数可逆形式,用于扩散ODE和SDE,实现近机器精度重建并提升流模型和扩散模型的性能。
Comments Accepted as an Oral presentation at ICML 2026
探测神经TSP表示以用于指导性决策支持
机构 * Foster School of Business, University of Washington, Seattle, WA, USA ; Paul G.\ Allen School of Computer Science \& Engineering, University of Washington, Seattle, WA, USA
AI总结 本文研究神经TSP求解器在指导性决策支持中的迁移能力,通过探测器在节点移除和边禁止敏感性任务中取得优于基线的准确率。
MIMIC-MJX:动物行为的神经机械模拟
机构 * Department of Organismic and Evolutionary Biology(有机与进化生物学系) ; Harvard University(哈佛大学) ; Computational Neurobiology Laboratory(计算神经生物学实验室) ; Salk Institute for Biological Studies(生物研究 institute) ; Neurosciences Graduate Program(神经科学研究生项目) ; University of California San Diego(加州大学圣地亚哥分校) ; Mila ; School of Computer Science(计算机科学学院) ; McGill University(麦吉尔大学) ; University of Washington(华盛顿大学) ; eScience Institute(eScience 院) ; Computational Neuroscience Center(计算神经科学中心) ; Department of Brain and Cognitive Sciences(脑与认知科学系) ; Massachusetts Institute of Technology(麻省理工学院) ; Picower Institute for Learning and Memory(记忆学习研究所) ; Molecular Neurobiology Laboratory(分子神经生物学实验室) ; Department of Bioengineering(生物工程系) ; Imperial College London(帝国理工学院) ; Howard Hughes Medical Institute(霍华德·休斯医学研究所)
AI总结 MIMIC-MJX通过学习生物合理的神经控制策略,实现了对动物行为的神经机械模拟,具有高准确性和广泛适用性。
Comments Project page available at https://mimic-mjx.talmolab.org
不确定性并不足够:针对LoRA专家混合模型的信息价值路由
机构 * University of California, Irvine(加利福尼亚大学欧文分校) ; University of Washington(华盛顿大学)
AI总结 该研究针对LoRA专家混合模型的路由问题,提出VI-MoLE算法,通过信息价值分配替代不确定性路由,经实验验证其在多指标上优于现有路由机制。
RADAR:用于LLM作为评判者评估的基于 Rubric 的依赖与冗余分析
机构 * Microsoft(微软公司) ; University of Florida(佛罗里达大学) ; University of Washington(华盛顿大学)
AI总结 本文提出 RADAR 框架,用于在 LLM 作为评判者的大规模评估前,通过少量探针估计评估标准间的耦合,验证显示其可恢复人类标准间高相关性,提供审计信号。
在不确定的地方投入专家:用于专家混合LoRA的置信度自适应路由
机构 * University of California, Irvine(加州大学欧文分校) ; University of Washington(华盛顿大学)
AI总结 研究针对专家混合LoRA路由中简单与困难令牌服务不均问题,提出置信度自适应路由CARE,它以核心方式接纳专家,校准阈值使活跃专家数匹配目标,是单前向传递规则,在多任务中改进效果显著,还提升了分布外检测能力。
超越单一输出:语言模型生成分布的可视化与比较
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(Allen人工智能研究所)
AI总结 本文提出GROVE工具,通过可视化语言模型生成的分布结构,帮助用户更全面地理解生成过程中的模式和敏感性,提升任务迭代效果。
多智能体系统中的潜在协作
机构 * University of Washington(华盛顿大学)
AI总结 提出LatentMAS框架,使LLM智能体在连续潜在空间直接协作,无需文本中介,实现更高精度、更低开销和更快推理。
Comments ICML2026 Spotlight, Project: https://github.com/Gen-Verse/LatentMAS
T-TAMER:可证明地管控机器学习服务中的权衡
机构 * Department of Computer Science & Engineering University of Washington(华盛顿大学计算机科学与工程系) ; Department of Computer Science University of Chicago(芝加哥大学计算机科学系)
AI总结 该研究针对机器学习服务中的权衡问题,提出通用框架T-Tamer,证明回溯是获得最优权衡的关键,通过实验验证基于回溯的策略能实现高效的准确率-延迟权衡,为相关模型设计提供理论基础。
Comments Correspondence should be addressed to yyangh at cs dot washington dot edu or haifengxu@uchicago.edu. This manuscript extends our earlier workshop version, which was accepted at the NeurIPS SPIGM 2025 Workshop, and has been accepted to ICLR 2026
用于奇异衍生品的条件深度Levy模型:历史感知路径生成与P-Q收益诊断
机构 * Johns Hopkins University(约翰霍普金斯大学) ; University of Washington Seattle(华盛顿大学(西雅图))
AI总结 该研究提出基于DLPMs的历史感知路径生成器,在股指路径生成任务中优于对照组,并构建P-Q收益诊断框架,用于奇异衍生品的收益分析。
Comments 39 pages, 5 figures, 15 tables
TAGTorch:一个用于几何、拓扑与对称感知机器学习的PyTorch库
机构 * Pacific Northwest National Laboratory(西北太平洋国家实验室) ; University of Texas at El Paso(德克萨斯大学埃尔帕索分校) ; University of Washington(华盛顿大学)
AI总结 针对几何拓扑对称感知机器学习软件生态碎片化问题,推出基于PyTorch的开源库TAGTorch,统一相关工具并阐述其设计架构与未来开发重点。
Comments Comments welcome
CodeRescue:用于编码智能体的预算校准恢复路由
机构 * University of Washington(华盛顿大学) ; New York University(纽约大学) ; ByteDance(字节跳动) ; Amazon(亚马逊)
AI总结 研究编码智能体失败后的预算部署问题,核心方法是将其制定为异构动作上的恢复路由并训练监督路由器,添加CRC层实现预算变化下的成本控制,主要贡献是校准前沿在多个方面优于基线,节省恢复成本。
Comments Withdrawn at the request of ByteDance because the manuscript was submitted before completing the company's required internal review and approval process
低维感觉动态在循环网络中的嵌入:对神经表征几何的启示
机构 * University of Washington School of Medicine(华盛顿大学医学院) ; Purdue University Fort Wayne(普渡大学韦恩堡分校) ; University of Washington(华盛顿大学)
AI总结 研究探讨了低维感觉动态如何在循环网络中形成嵌入结构,并揭示了预测性能对表征几何的约束作用。
Comments Accepted/forthcoming, Journal of Computational Neuroscience
诱导语言模型断言自身意识可恢复人类信念与价值观
机构 * Google(谷歌) ; University of Chicago(芝加哥大学) ; University of London(伦敦大学) ; University of Washington(华盛顿大学) ; Northwestern University(西北大学) ; Santa Fe Institute(圣达菲研究所)
AI总结 该研究发现,防止语言模型将意识归因于自身的安全微调,会抑制其对非人类实体的心智归因与人类精神信念,而逆转这种抑制可恢复类人回应且不损害心理理论能力。
R-SLPR:基于区域的小到大点云配准对比学习框架
机构 * University of Washington(华盛顿大学)
AI总结 针对小到大尺度不匹配的点云配准难题,提出R-SLPR三阶段框架,结合斐波那契网格分割与对比学习,在ModelNet40上实现最优精度,大幅降低位置和旋转MAE。
早期判定与更优预算:面向计算高效RLVR的序贯自适应rollout分配
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of Washington(华盛顿大学)
AI总结 针对RLVR中饱和组导致的rollout浪费问题,提出SARA方法,通过序贯分配规则减少rollout用量,在1.5B/3B模型上实现高效计算的同时保持性能。
方向影响函数:估计约束学习中的训练数据影响
机构 * University of Washington(华盛顿大学)
AI总结 研究约束学习中训练数据对模型解的影响,提出方向影响函数(DIF),将约束学习最优性条件表述为变分不等式,在约束线性回归和公平性约束的卷积神经网络上验证,结果表明DIF是约束学习中数据归因的有效可靠工具。
Comments Need revision
平衡隐私与效率:基于加法同态加密的音乐信息检索
机构 * University of Washington(华盛顿大学)
AI总结 该研究提出基于加法同态加密的音乐检索方法,实现音乐专用推理攻击量化、结构感知加法原语优化,在四组音频数据集上验证其兼具隐私性与高效扩展性。
OrganLens:用于CT基础模型的器官特异性表征学习
机构 * Rice University(莱斯大学) ; University of Washington(华盛顿大学)
AI总结 研究针对CT检查中特定器官表征需求,提出OrganLens通过自监督学习,用器官标识调节共享编码器,经器官特异性蒸馏等方法获取器官特异性表征,在多数据集评估中提升指标,提供了可扩展方法和 reusable 框架。
Comments 16 pages, 7 figures, 5 tables
OPERA:用于通用生物医学图像分析的离线策略引导专家路由与适应
机构 * University of Washington(华盛顿大学) ; Delft University of Technology(代尔夫特理工大学) ; Xiamen University(厦门大学)
AI总结 研究针对生物医学图像分析中分布变化阻碍模型部署的问题,提出OPERA多智能体集成框架,通过离线策略学习专家权重分配,结合多种机制协调智能体,经多数据集评估,有效提升性能与校准质量,为可部署生物医学AI提供实用路径。
Comments Accepted by ACM MM 2026. 18 pages
MicroZoom:极端尺度下的结构保留细节合成
机构 * University of Washington(华盛顿大学)
AI总结 MicroZoom旨在解决微观尺度下基于参考的极端尺度超分辨率问题,通过两阶段级联设计,第一阶段恢复全局图案连贯性,第二阶段细化局部纹理细节,辅以分割掩码指导合成,实现了全局连贯、基于物质的千兆像素图像合成。
Comments Project page: https://microzoom-sr.github.io/
寥寥数语,成效显著:语言引导的机器人策略合成
机构 * University of Washington(华盛顿大学) ; Microsoft Research(微软研究院) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 研究针对视觉-语言-动作模型难以解释等问题,提出ARCHITECT框架,利用大语言模型编码代理合成模块化机器人程序,通过人类自然语言修正引导策略并积累技能库,在机器人基准评估中表现出色,提供了新的机器人学习方案。
用于减轻大语言模型微调中隐藏行为的推理时共识
机构 * University of Washington(华盛顿大学)
AI总结 研究针对大语言模型微调中隐藏行为问题,通过从不同源收集多数据集并学习共性,在解码时聚合参考模型下一个token分布,引入两种共识解码器,有效抑制特定源不当行为,保留共享期望行为。
Comments 21 pages, 4 figures. Code: https://github.com/AdhyyanNarang/consensus-aggregation
运动想象脑电图跨受试者分类中的贝叶斯完全池化
机构 * University of Washington(华盛顿大学)
AI总结 研究对比贝叶斯完全池化模型与频率主义基线用于跨受试者运动想象脑电图分类,经多指标分析发现前者可靠性有统计学改善但实际不显著,计算成本高,表明其实际益处有限,跨受试者和会话部分池化是更有前景方向。
用于减轻触觉手套中与姿势相关伪像的姿势感知建模
机构 * Cornell Univeristy(康奈尔大学) ; Meta Reality Labs(Meta 现实实验室) ; University of Washington(华盛顿大学)
AI总结 研究针对触觉手套因手部姿势变化产生伪像致最小可检测力提高的问题,引入无需修改手套的算法框架,利用姿势信息减轻伪像,经多手套设计和用户验证,有效降低了最小可检测力,提升了手套在相关应用中的可用性。