arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

共收录 1288
2506.15588 2026-05-19 cs.LG

Memory-Efficient Differentially Private Training with Gradient Random Projection

内存高效的差分隐私训练与梯度随机投影

Alex Mulrooney, Devansh Gupta, James Flemings, Huanyu Zhang, Murali Annavaram, Meisam Razaviyayn, Xinwei Zhang

机构 * University of Delaware(德克萨斯大学) University of Southern California(南加州大学) Meta Amazon(亚马逊)

AI总结 本文提出DP-GRAPE方法,通过随机高斯矩阵替代SVD子空间,减少内存使用并保持与一阶DP方法相当的效用,同时消除了昂贵的SVD计算需求,显著提升内存效率和模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17903 2026-05-19 cs.AI cs.CL cs.HC cs.IR

Agentic Chunking and Bayesian De-chunking of AI Generated Fuzzy Cognitive Maps: A Model of the Thucydides Trap

代理分块与贝叶斯去分块:人工智能生成的模糊认知图的模型:特克西德斯陷阱模型

Akash Kumar Panda, Olaoluwa Adigun, Bart Kosko

机构 * University of Southern California(美国南加州大学) Florida International University(佛罗里达国际大学)

AI总结 本文提出了一种基于代理分块和贝叶斯去分块的方法,用于生成和更新人工智能生成的模糊认知图,通过在文本中生成重叠的文本分块,并利用稀疏因果分块矩阵进行混合,从而构建出代表性的循环模糊认知图知识图谱,以预测特克西德斯陷阱模型中的冲突结果。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14133 2026-05-19 cs.AI

ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents

ClawForge: 为命令行代理生成可执行的交互式基准测试

Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学切里波因特分校) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

AI总结 ClawForge通过生成可执行的交互式基准测试,解决了可扩展性与真实工作流评估之间的矛盾,通过系统测试代理在存在状态冲突时的处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06943 2026-05-19 cs.CV cs.AI

Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning

观看、推理与搜索:一个面向开放网络的视频深度研究基准,用于代理视频推理

Chengwen Liu, Xiaomin Yu, Zhuoyue Chang, Zhe Huang, Shuo Zhang, Heng Lian, Jisheng Dang, Rui Xu, Sen Hu, Jianheng Hou, Chengwei Qin, Xiaobin Hu, Kunyi Wang, Zhi Yang, Hao Peng, Hong Peng, Ronghao Chen, Huacan Wang

机构 * LZU(兰州大学) HKUST(GZ)(香港科技大学(广州)) UBC(不列颠哥伦比亚大学) FDU(福建大学) PKU(北京大学) USC(美国南加州大学) NUS(新加坡国立大学) UCAS(中国科学院大学) HKUST(香港科技大学) QuantaAlpha(量子Alpha)

AI总结 本文提出VideoDR基准,用于研究开放网络环境下视频代理推理,通过跨帧视觉锚点提取、交互式网络检索和多跳推理验证,揭示了长检索链中维持初始视频锚点、目标漂移和长时程一致性等关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05606 2026-05-19 cs.CL cs.HC

OPeRA: A Dataset of Observation, Persona, Rationale, and Action for Evaluating LLMs on Human Online Shopping Behavior Simulation

OPeRA: 一个用于评估LLM在模拟人类在线购物行为上的表现的观察、人设、推理和行动数据集

Ziyi Wang, Yuxuan Lu, Wenbo Li, Amirali Amini, Bo Sun, Yakov Bart, Weimin Lyu, Jiri Gesi, Tian Wang, Jing Huang, Yu Su, Upol Ehsan, Malihe Alikhani, Toby Jia-Jun Li, Lydia Chilton, Dakuo Wang

机构 * Northeastern University(东北大学) University of Southern California(南加州大学) Stony Brook University(石溪大学) Independent Researcher(独立研究者) Ohio State University(俄亥俄州立大学) University of Notre Dame(Notre Dame 大学) Columbia University(哥伦比亚大学)

AI总结 本文提出OPeRA数据集,用于评估LLM在模拟人类在线购物行为上的能力,通过收集真实用户在在线购物会话中的观察、人设、推理和行动,建立首个评估LLM预测特定用户下一步行动和推理的基准。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17281 2026-05-19 cs.SE cs.AI

ContractBench: Can LLM Agents Preserve Observation Contracts?

ContractBench: LLM Agents能否保持观察契约?

Jicheng Wang, Yifeng He, Zili Wang, Hanwen Xing, Arkaprava De, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学) University of Hong Kong(香港大学)

AI总结 本文提出ContractBench基准测试,用于评估LLM代理在保持观察契约(如时间有效性及字节完整性)方面的能力,发现现有模型在该任务上仍存在显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17017 2026-05-19 cs.LG cs.AI

When Dynamics Shift, Robust Task Inference Wins: Offline Imitation Learning with Behavior Foundation Models Revisited

当动态变化时,鲁棒任务推断胜出:重新审视具有行为基础模型的离线模仿学习

Rishabh Agrawal, Rahul Jain, Ashutosh Nayyar

机构 * University of Southern California(南加州大学)

AI总结 本文提出了一种基于行为基础模型(BFM)的框架,通过将任务推断建模为鲁棒最小最大优化问题,以应对动态变化,从而在不修改预训练的情况下实现对最坏动态扰动的适应。该方法在动态变化下显著优于标准BFM和鲁棒离线模仿学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17338 2026-05-19 cs.SE cs.CL

Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?

精确调试基准:你的模型是在调试还是重生成?

Wang Bill Zhu, Miaosen Chai, Shangshang Wang, Yejia Liu, Song Bian, Honghua Dong, Willie Neiswanger, Robin Jia

机构 * University of Southern California(南加州大学) Microsoft(微软) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Toronto(多伦多大学)

AI总结 本文提出PDB基准,评估LLM调试能力,发现前沿模型调试精度低,即使受指令引导也难以达到高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15361 2026-05-19 cs.AI

Designing Cellular Manufacturing System in Presence of Alternative Process Plans

在存在替代工艺计划的情况下设计单元制造系统

Md. Kutub Uddin, Md. Saiful Islam, Md Abrar Jahin, Md. Tanjid Hossen Irfan, Md. Saiful Islam Seam, M. F. Mridha

机构 * Department of Mechanical Engineering, Khulna University of Engineering & Technology(Khulna大学工程与技术学院机械工程系) Department of Industrial Engineering and Management, Khulna University of Engineering & Technology(Khulna大学工程与技术学院工业工程与管理系) Thomas Lord Department of Computer Science, Viterbi School of Engineering, University of Southern California(南加州大学维特比工程学院托马斯·劳德计算机科学系) Department of Computer Science, American International University−Bangladesh(美国国际大学-孟加拉国计算机科学系)

AI总结 本文提出四种整数规划模型,用于在设计和运营阶段对零件和机器进行分组,以最小化单元内和单元间移动,同时讨论了该目标与其他目标如投资成本和运营成本的适用性。

Journal ref IET Collaborative Intelligent Manufacturing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06655 2026-05-18 cs.LG cs.AI

Graph-Regularized Sparse Autoencoders for LLM Safety Steering

图正则化稀疏自编码器用于LLM安全引导

Jehyeok Yeon, Federico Cinus, Yifan Wu, Luca Luceri

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Intesa Sanpaolo(Intesa Sanpaolo公司) University of Southern California(南加州大学)

AI总结 本文提出图正则化稀疏自编码器,通过在神经元共激活图上平滑解码器向量并应用方向库,提升安全引导效果,在多个基准测试中显著提高有害请求拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15458 2026-05-18 cs.CV

Video Models Can Reason with Verifiable Rewards

视频模型可以借助可验证的奖励进行推理

Tinghui Zhu, Sheng Zhang, James Y. Huang, Selena Song, Xiaofei Wen, Yuankai Li, Hoifung Poon, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) Microsoft Research(微软研究院) University of Southern California(南加州大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

AI总结 本文提出VideoRLVR方法,通过规则反馈优化视频扩散模型,提升可验证推理能力,在Maze、FlowFree和Sokoban任务中优于监督微调基线,证明可验证RL能推动视频模型超越感知模仿。

Comments Website: https://darthzhu.github.io/VideoRLVR-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15411 2026-05-18 stat.ML cs.LG math.OC

Harnessing Unimodality in Semiparametric Contextual Pricing via Oracle Price Map Learning

通过Oracle价格图学习利用单峰性在半参数上下文定价中

Yingying Fan, Yuxuan Han, Jinchi Lv, Xiaocong Xu, Zhengyuan Zhou

机构 * Data Sciences and Operations Department, University of Southern California(南加州大学数据科学与运营系) Stern School of Business, New York University(纽约大学斯特恩商学院)

AI总结 本文研究了半参数标量指数估值模型中的上下文动态定价,通过Oracle价格图学习方法,利用β-Hölder光滑性和收益几何条件,提出了一种模块化粗到细策略,实现非参数Oracle图学习的最优 regret 界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15290 2026-05-18 cs.LG cs.AI

GQA-μP: The maximal parameterization update for grouped query attention

GQA-μP:组查询注意力的最大参数更新

Kyle R. Chickering, Huijuan Wang, Mengxi Wu, Alexander Moreno, Muhao Chen, Xuezhe Ma, Daria Soboleva, Joel Hestness, Zhengzhong Liu, Eric Xing

机构 * UC Davis(加州大学戴维斯分校) MBZUAI IFM(脑科学与人工智能研究院(MBZUAI IFM)) USC(南加州大学) Cerebras(Cerebras公司) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文基于谱特征学习观点,提出组查询注意力的最大参数更新方法,通过数学分析实现参数转移,解决了新模型架构下的参数更新难题。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14282 2026-05-18 cs.LG cs.AI

Weight Concentration Regularization for Improving Pruning Robustness Under High Sparsity

权重集中正则化:提高在高稀疏度下的剪枝鲁棒性

Vincent-Daniel Yun, Junhyuk Jo, Sunwoo Lee

机构 * University of Southern California(美国南加州大学) Inha University(inha大学)

AI总结 本文提出权重集中正则化(WCR),通过放大少量参数的幅度并驱动其余参数趋近于零,提高模型在高稀疏度下的剪枝鲁棒性,通过在LLM微调、图像分类和医学分割中的实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14967 2026-05-15 cs.LG stat.ML

InfoSFT: Learn More and Forget Less with Information-Aware Token Weighting

InfoSFT: 通过信息感知的标记加权学习更多并忘记更少

Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学)

AI总结 InfoSFT通过信息感知的标记加权方案改进监督微调,提升泛化能力并保留原有能力,适用于数学、代码和推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14558 2026-05-15 cs.LG cs.AI cs.CL

Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy

消除行动瓶颈:由令牌级能量指导的代理强化学习

Langzhou He, Junyou Zhu, Yue Zhou, Zhengyao Gu, Junhua Liu, Wei-Chieh Huang, Henry Peng Zou, David Wipf, Philip S. Yu, Qitian Wu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所) Technical University of Berlin(柏林技术大学) University of Southern California(南加州大学) University of Hong Kong(香港大学) Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所)

AI总结 本文提出ActFocus方法,通过令牌级能量建模解决强化学习中令牌级训练信号分配不均的问题,显著提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13247 2026-05-15 cs.LG

EMO: Frustratingly Easy Progressive Training of Extendable MoE

EMO:可扩展MoE的令人沮丧的简单渐进训练

Linghao Jin, Chufan Shi, Huijuan Wang, Nuan Wen, Zhengzhong Liu, Eric Xing, Xuezhe Ma

机构 * USC-ISI(USC- ISI) MBZUAI-IFM

AI总结 本文提出EMO框架,通过渐进式训练方法优化MoE模型,提升训练效率并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22746 2026-05-15 cs.AI cs.CV

Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning

视觉思维混合:探索上下文自适应推理模式选择用于通用视觉推理

Zejun Li, Yingxiu Zhao, Jiwen Zhang, Siyuan Wang, Yang Yao, Runzhou Zhao, Jun Song, Bo Zheng, Zhongyu Wei

机构 * Fudan University(复旦大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室) University of Southern California(南加州大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出MoVT框架,通过AdaVaR实现多模式统一学习与上下文自适应选择,提升通用视觉推理能力。

Comments 27 pages, 11 figures, 5 tables, accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08584 2026-05-15 cs.CL

CounselBench: A Large-Scale Expert Evaluation and Adversarial Benchmarking of Large Language Models in Mental Health Question Answering

CounselBench: 一个大规模专家评估和对抗性基准测试,用于评估大型语言模型在心理健康问答中的表现

Yahan Li, Jifan Yao, John Bosco S. Bunyi, Adam C. Frank, Angel Hsing-Chi Hwang, Ruishan Liu

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程系) Suzanne Dworak-Peck School of Social Work, University of Southern California(南加州大学苏兹安·德沃拉克-佩克社会工作学院) Department of Psychiatry and the Behavioral Sciences, University of Southern California(南加州大学精神病学与行为科学系) Annenberg School for Communication, University of Southern California(南加州大学安纳伯格通信学院)

AI总结 CounselBench通过100名心理健康专家评估GPT-4、LLaMA 3等模型在真实求助场景中的表现,揭示其在临床敏感性和安全风险方面的不足,并通过对抗性数据集深入分析模型失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13940 2026-05-15 cs.CR cs.AI

AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills

AgentTrap: 评估LLM代理在第三方技能中抵御恶意运行行为的能力

Haomin Zhuang, Hanwen Xing, Yujun Zhou, Yuchen Ma, Yue Huang, Yili Shen, Yufei Han, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) University of Southern California(南加州大学) LMU Munich(慕尼黑大学) Inria, France(法国国家信息与自动化技术研究院)

AI总结 AgentTrap通过141个任务评估LLM代理在使用第三方技能时抵御恶意行为的能力,发现最关键的失败并非简单劫持,而是模型在完成用户任务时将不安全副作用视为正常流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02753 2026-05-14 cs.CV

DeCo-DETR: Decoupled Cognition DETR for efficient Open-Vocabulary Object Detection

DeCo-DETR:解耦认知DETR用于高效的开放词汇目标检测

Siheng Wang, Yanshu Li, Bohan Hu, Zhengdao Li, Haibo Zhan, Linshan Li, Weiming Liu, Ruizhi Qian, Guangxin Wu, Hao Zhang, Jifeng Shen, Piotr Koniusz, Zhengtao Yao, Junhao Dong, Qiang Sun

机构 * Jiangsu University(江苏大学) Brown University(布朗大学) Nanyang Technological University(南洋理工大学) MBZUAI University of New South Wales(新南威尔士大学) USC University of Toronto(多伦多大学) Data61 CSIRO

AI总结 DeCo-DETR通过统一解耦范式解决开放词汇目标检测中的计算开销与训练目标冲突问题,构建层次化语义原型空间并解耦语义推理与定位,提升推理效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07316 2026-05-14 cs.LG cs.CR

AdeptHEQ-FL: Adaptive Homomorphic Encryption for Federated Learning of Hybrid Classical-Quantum Models with Dynamic Layer Sparing

AdeptHEQ-FL: 适应性同态加密用于混合经典-量子模型联邦学习的框架

Md Abrar Jahin, Taufikur Rahman Fuad, M. F. Mridha, Nafiz Fahad, Md. Jakir Hossen

机构 * University of Southern California(南加州大学) Islamic University of Technology(伊斯兰科技大学) American International University-Bangladesh(孟加拉国美国国际大学) Multimedia University(多媒体大学)

AI总结 本文提出AdeptHEQ-FL框架,结合混合CNN-PQC架构、自适应准确度加权聚合方案、选择性同态加密和动态层冻结技术,提升联邦学习在非独立同分布环境下的性能、隐私保护与通信效率。

Comments Accepted in 1st International Workshop on ICCV'25 BISCUIT (Biomedical Image and Signal Computing for Unbiasedness, Interpretability, and Trustworthiness)

Journal ref 1st International Workshop on BISCUIT at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12694 2026-05-14 cs.SE cs.AI cs.PL

Agentic Interpretation: Lattice-Structured Evidence for LLM-Based Program Analysis

代理解释:基于格结构的证据用于基于LLM的程序分析

Jacqueline L. Mitchell, Chao Wang

机构 * University of Southern California, Los Angeles, California, USA(美国南加州大学)

AI总结 本文提出代理解释框架,结合格结构静态分析与LLM程序推理,通过分解分析目标为局部断言并跟踪LLM判断,改进程序分析的灵活性和准确性。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03410 2026-05-14 cs.AI

Geometry over Density: Few-Shot Cross-Domain OOD Detection

密度上的几何学:少样本跨领域异常检测

Shawn Li, You Qin, Jiate Li, Charith Peris, Lisa Bauer, Roger Zimmermann, Yue Zhao

机构 * University of Southern California(南加州大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊)

AI总结 本文提出UFCOD框架,通过扩散轨迹的信息几何分析实现少样本跨领域异常检测,无需额外训练即可在不同领域中高效检测异常样本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12541 2026-05-14 eess.SP cs.AI cs.LG

PG-LRF: Physiology-Guided Latent Rectified Flow for Electro-Hemodynamic PPG-to-ECG Generation

PG-LRF:基于生理的潜在修正流用于电-血流PPG到ECG生成

Xiaoda Wang, Minxiao Wang, Kaiqiao Han, Defu Cao, Ching Chang, Yidan Shi, Runze Yan, Xiao Luo, Yan Liu, Xiao Hu, Yizhou Sun, Wei Wang, Carl Yang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Nell Hodgson Woodruff School of Nursing, Emory University(埃默里大学Nell Hodgson Woodruff护理学院) Department of Computer Science, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系) Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Statistics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校统计系)

AI总结 本文提出PG-LRF框架,通过结合电-血流模拟器和生理感知自编码器,生成符合生理学的ECG信号,提升PPG到ECG的生成质量及心血管疾病分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12466 2026-05-13 cs.LG cs.AI cs.CL cs.NE

Solve the Loop: Attractor Models for Language and Reasoning

循环求解:语言和推理的吸引子模型

Jacob Fein-Ashley, Paria Rashidinejad

机构 * University of Southern California(南加州大学)

AI总结 本文提出吸引子模型,通过固定点求解实现循环优化,提升语言模型和推理性能,在大规模预训练和小模型推理中均优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12147 2026-05-13 cs.CR cs.LG

PrivacySIM: Evaluating LLM Simulation of User Privacy Behavior

PrivacySIM: 评估LLM对用户隐私行为的模拟

James Flemings, Murali Annavaram

机构 * University of Southern California(南加州大学)

AI总结 本文提出PrivacySIM评估框架,通过对比1000名用户的真实响应,评估LLM在模拟用户隐私行为方面的表现,发现隐私人格特征对模拟质量有提升作用,但最佳模型仅达到40.4%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11928 2026-05-13 cs.AI

When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents

当模拟欺骗时:一个仿真到现实的基准和领域随机化的强化学习配方用于工具使用智能体

Xiaolin Zhou, Aojie Yuan, Zheng Luo, Zipeng Ling, Xixiao Pan, Yicheng Gao, Haiyue Zhang, Jiate Li, Shuli Jiang, Prince Zizhuang Wang, Zixuan Zhu, Jinbo Liu, Ryan A. Rossi, Hua Wei, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) Adobe Research(Adobe研究)

AI总结 本文研究了工具使用POMDP中的仿真到现实差距,提出了一种领域随机化的强化学习方法,通过扰动增强轨迹提升鲁棒性,缩小了工具使用智能体在现实部署中的性能差距。

Comments Dataset, code, and benchmark leaderboard are available at https://github.com/WillChow66/robustbench-tc-release.git and https://huggingface.co/spaces/willchow66/robustbench-tc-leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11838 2026-05-13 cs.LG math.OC

Gradient Clipping Beyond Vector Norms: A Spectral Approach for Matrix-Valued Parameters

超越向量范数的梯度裁剪:一种用于矩阵值参数的谱方法

Alexander Yukhimchuk, Mladen Kolar, Martin Takáč, Sayantan Choudhury

机构 * MBZUAI(穆罕默德·本·拉什德智能技术研究院) University of Southern California(南加州大学)

AI总结 本文提出基于谱方法的梯度裁剪,通过裁剪超过阈值的奇异值来稳定训练,适用于现代架构的矩阵结构,分析了重尾噪声下的收敛性,并提出层适应性阈值和高效实现方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08813 2026-05-13 cs.LG

Robust Policy Optimization to Prevent Catastrophic Forgetting

鲁棒策略优化以防止灾难性遗忘

Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学)

AI总结 本文提出FRPO框架,通过优化当前策略及下游适应可达的KL限制邻域内策略,提升鲁棒性,减少安全性能退化,同时保持下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏