Solve the Loop: Attractor Models for Language and Reasoning
循环求解:语言和推理的吸引子模型
机构 * University of Southern California(南加州大学)
AI总结 本文提出吸引子模型,通过固定点求解实现循环优化,提升语言模型和推理性能,在大规模预训练和小模型推理中均优于现有模型。
高校专区
循环求解:语言和推理的吸引子模型
机构 * University of Southern California(南加州大学)
AI总结 本文提出吸引子模型,通过固定点求解实现循环优化,提升语言模型和推理性能,在大规模预训练和小模型推理中均优于现有模型。
PrivacySIM: 评估LLM对用户隐私行为的模拟
机构 * University of Southern California(南加州大学)
AI总结 本文提出PrivacySIM评估框架,通过对比1000名用户的真实响应,评估LLM在模拟用户隐私行为方面的表现,发现隐私人格特征对模拟质量有提升作用,但最佳模型仅达到40.4%的准确率。
当模拟欺骗时:一个仿真到现实的基准和领域随机化的强化学习配方用于工具使用智能体
机构 * Arizona State University(亚利桑那州立大学) ; University of Southern California(南加州大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Adobe Research(Adobe研究)
AI总结 本文研究了工具使用POMDP中的仿真到现实差距,提出了一种领域随机化的强化学习方法,通过扰动增强轨迹提升鲁棒性,缩小了工具使用智能体在现实部署中的性能差距。
Comments Dataset, code, and benchmark leaderboard are available at https://github.com/WillChow66/robustbench-tc-release.git and https://huggingface.co/spaces/willchow66/robustbench-tc-leaderboard
超越向量范数的梯度裁剪:一种用于矩阵值参数的谱方法
机构 * MBZUAI(穆罕默德·本·拉什德智能技术研究院) ; University of Southern California(南加州大学)
AI总结 本文提出基于谱方法的梯度裁剪,通过裁剪超过阈值的奇异值来稳定训练,适用于现代架构的矩阵结构,分析了重尾噪声下的收敛性,并提出层适应性阈值和高效实现方法。
鲁棒策略优化以防止灾难性遗忘
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Southern California(南加州大学)
AI总结 本文提出FRPO框架,通过优化当前策略及下游适应可达的KL限制邻域内策略,提升鲁棒性,减少安全性能退化,同时保持下游任务表现。
驯服极端令牌:具有高斯核优势重加权的协方差感知GRPO
机构 * National University of Singapore(新加坡国立大学) ; University of California, Davis(加州大学戴维斯分校) ; University of Southern California(美国南加州大学)
AI总结 本文提出一种协方差感知的GRPO方法,通过高斯核动态降低极端令牌更新权重,以平衡探索与利用,提升大语言模型推理性能并稳定熵。
Comments ACL 2026
通过折扣存活公式评估操纵策略的离线策略评估
机构 * University of Southern California(南加州大学) ; Stanford University(斯坦福大学)
AI总结 本文提出基于存活Bellman算子的离线策略评估框架,解决稀疏奖励下任务完成问题,通过保守固定点值函数降低截断偏差,实验证明在折叠任务中优于传统基线方法。
Comments Published at RSS 2026
能否通过图帮助视觉状态空间模型看得更好?
机构 * USC(美国南加州大学) ; UT Austin(德克萨斯大学奥斯汀分校) ; DEVCOM ARL Army Research Office, USA(美国陆军战争学院研发办公室)
AI总结 本文提出GraphScan,通过图诱导动态扫描操作提升视觉状态空间模型性能,通过语义路由替代坐标条件插值,在分类、检测等任务中取得最佳效果。
Comments Technical Report
可解释性可以是可操作的
机构 * Kempner Institute at Harvard University(哈佛大学凯默纳研究所) ; University of Southern California(美国南加州大学) ; Mila – Quebec AI Institute(魁北克AI研究所) ; McGill University(麦吉尔大学) ; Google DeepMind(谷歌DeepMind) ; Tel Aviv University(特拉维夫大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Maryland(马里兰大学) ; University of Oxford(牛津大学) ; Northeastern University(东北大学) ; Boston University(波士顿大学)
AI总结 本文探讨了可解释性研究的核心问题,提出应以可操作性作为评价标准,通过具体性和验证性两个维度分析阻碍实际应用的障碍,并提出五个领域和评估框架。
Comments Accepted to ICML 2026
采样更多,得到更少:校准是大语言模型中的多样性瓶颈
机构 * University of Southern California(南加州大学)
AI总结 研究揭示了大语言模型中多样性崩溃的原因,提出有效性-多样性框架,分析了顺序校准和形状校准两种误校准形式,发现局部失败会累积导致序列层面多样性损失。
StyleVAR:通过视觉自回归建模实现可控的图像风格迁移
机构 * Duke University(杜克大学) ; University of Southern California(南加州大学) ; Xidian University(西安电子科技大学)
AI总结 本文提出StyleVAR,基于视觉自回归建模框架,通过条件离散序列建模实现风格迁移,在学习的潜在空间中建模目标token的分布。引入混合交叉注意力机制,通过风格和内容特征决定强调历史的哪些方面,从而在保持自回归连续性的同时对齐内容结构和风格纹理。