arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

2026-05-13 至 2026-05-13 共收录 11
2605.12466 2026-05-13 cs.LG cs.AI cs.CL cs.NE

Solve the Loop: Attractor Models for Language and Reasoning

循环求解:语言和推理的吸引子模型

Jacob Fein-Ashley, Paria Rashidinejad

机构 * University of Southern California(南加州大学)

AI总结 本文提出吸引子模型,通过固定点求解实现循环优化,提升语言模型和推理性能,在大规模预训练和小模型推理中均优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12147 2026-05-13 cs.CR cs.LG

PrivacySIM: Evaluating LLM Simulation of User Privacy Behavior

PrivacySIM: 评估LLM对用户隐私行为的模拟

James Flemings, Murali Annavaram

机构 * University of Southern California(南加州大学)

AI总结 本文提出PrivacySIM评估框架,通过对比1000名用户的真实响应,评估LLM在模拟用户隐私行为方面的表现,发现隐私人格特征对模拟质量有提升作用,但最佳模型仅达到40.4%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11928 2026-05-13 cs.AI

When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents

当模拟欺骗时:一个仿真到现实的基准和领域随机化的强化学习配方用于工具使用智能体

Xiaolin Zhou, Aojie Yuan, Zheng Luo, Zipeng Ling, Xixiao Pan, Yicheng Gao, Haiyue Zhang, Jiate Li, Shuli Jiang, Prince Zizhuang Wang, Zixuan Zhu, Jinbo Liu, Ryan A. Rossi, Hua Wei, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) Adobe Research(Adobe研究)

AI总结 本文研究了工具使用POMDP中的仿真到现实差距,提出了一种领域随机化的强化学习方法,通过扰动增强轨迹提升鲁棒性,缩小了工具使用智能体在现实部署中的性能差距。

Comments Dataset, code, and benchmark leaderboard are available at https://github.com/WillChow66/robustbench-tc-release.git and https://huggingface.co/spaces/willchow66/robustbench-tc-leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11838 2026-05-13 cs.LG math.OC

Gradient Clipping Beyond Vector Norms: A Spectral Approach for Matrix-Valued Parameters

超越向量范数的梯度裁剪:一种用于矩阵值参数的谱方法

Alexander Yukhimchuk, Mladen Kolar, Martin Takáč, Sayantan Choudhury

机构 * MBZUAI(穆罕默德·本·拉什德智能技术研究院) University of Southern California(南加州大学)

AI总结 本文提出基于谱方法的梯度裁剪,通过裁剪超过阈值的奇异值来稳定训练,适用于现代架构的矩阵结构,分析了重尾噪声下的收敛性,并提出层适应性阈值和高效实现方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08813 2026-05-13 cs.LG

Robust Policy Optimization to Prevent Catastrophic Forgetting

鲁棒策略优化以防止灾难性遗忘

Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学)

AI总结 本文提出FRPO框架,通过优化当前策略及下游适应可达的KL限制邻域内策略,提升鲁棒性,减少安全性能退化,同时保持下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11538 2026-05-13 cs.CL cs.AI cs.LG

Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting

驯服极端令牌:具有高斯核优势重加权的协方差感知GRPO

Cheng Wang, Qin Liu, Wenxuan Zhou, Muhao Chen

机构 * National University of Singapore(新加坡国立大学) University of California, Davis(加州大学戴维斯分校) University of Southern California(美国南加州大学)

AI总结 本文提出一种协方差感知的GRPO方法,通过高斯核动态降低极端令牌更新权重,以平衡探索与利用,提升大语言模型推理性能并稳定熵。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11479 2026-05-13 cs.RO cs.AI

Offline Policy Evaluation for Manipulation Policies via Discounted Liveness Formulation

通过折扣存活公式评估操纵策略的离线策略评估

Hao Wang, Joshua Bowden, Colton Crosby, Somil Bansal

机构 * University of Southern California(南加州大学) Stanford University(斯坦福大学)

AI总结 本文提出基于存活Bellman算子的离线策略评估框架,解决稀疏奖励下任务完成问题,通过保守固定点值函数降低截断偏差,实验证明在折叠任务中优于传统基线方法。

Comments Published at RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11300 2026-05-13 cs.CV

Can Graphs Help Vision SSMs See Better?

能否通过图帮助视觉状态空间模型看得更好?

Dhruv Parikh, Anvitha Ramachandran, Haoyang Fan, Mustafa Munir, Rajgopal Kannan, Viktor Prasanna

机构 * USC(美国南加州大学) UT Austin(德克萨斯大学奥斯汀分校) DEVCOM ARL Army Research Office, USA(美国陆军战争学院研发办公室)

AI总结 本文提出GraphScan,通过图诱导动态扫描操作提升视觉状态空间模型性能,通过语义路由替代坐标条件插值,在分类、检测等任务中取得最佳效果。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11161 2026-05-13 cs.LG cs.AI

Interpretability Can Be Actionable

可解释性可以是可操作的

Hadas Orgad, Fazl Barez, Tal Haklay, Isabelle Lee, Marius Mosbach, Anja Reusch, Naomi Saphra, Byron Wallace, Sarah Wiegreffe, Eric Wong, Ian Tenney, Mor Geva

机构 * Kempner Institute at Harvard University(哈佛大学凯默纳研究所) University of Southern California(美国南加州大学) Mila – Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) Google DeepMind(谷歌DeepMind) Tel Aviv University(特拉维夫大学) University of Pennsylvania(宾夕法尼亚大学) University of Maryland(马里兰大学) University of Oxford(牛津大学) Northeastern University(东北大学) Boston University(波士顿大学)

AI总结 本文探讨了可解释性研究的核心问题,提出应以可操作性作为评价标准,通过具体性和验证性两个维度分析阻碍实际应用的障碍,并提出五个领域和评估框架。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11128 2026-05-13 cs.CL

Sampling More, Getting Less: Calibration is the Diversity Bottleneck in LLMs

采样更多,得到更少:校准是大语言模型中的多样性瓶颈

Amin Banayeeanzade, Qingchuan Yang, Dhruv Tarsadiya, Fatemeh Bahrani, Leonardo Blas, Alfy Samuel, Robin Jia, Meisam Razaviyayn, Sai Praneeth Karimireddy

机构 * University of Southern California(南加州大学)

AI总结 研究揭示了大语言模型中多样性崩溃的原因,提出有效性-多样性框架,分析了顺序校准和形状校准两种误校准形式,发现局部失败会累积导致序列层面多样性损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21052 2026-05-13 cs.CV cs.AI

StyleVAR: Controllable Image Style Transfer via Visual Autoregressive Modeling

StyleVAR:通过视觉自回归建模实现可控的图像风格迁移

Liqi Jing, Dingming Zhang, Peinian Li, Lichen Zhu, Yang Xu, Hanyu Xing

机构 * Duke University(杜克大学) University of Southern California(南加州大学) Xidian University(西安电子科技大学)

AI总结 本文提出StyleVAR,基于视觉自回归建模框架,通过条件离散序列建模实现风格迁移,在学习的潜在空间中建模目标token的分布。引入混合交叉注意力机制,通过风格和内容特征决定强调历史的哪些方面,从而在保持自回归连续性的同时对齐内容结构和风格纹理。

详情

展开后加载摘要…

URL PDF HTML 收藏