InfoSFT: Learn More and Forget Less with Information-Aware Token Weighting
InfoSFT: 通过信息感知的标记加权学习更多并忘记更少
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Southern California(南加州大学)
AI总结 InfoSFT通过信息感知的标记加权方案改进监督微调,提升泛化能力并保留原有能力,适用于数学、代码和推理任务。
高校专区
InfoSFT: 通过信息感知的标记加权学习更多并忘记更少
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Southern California(南加州大学)
AI总结 InfoSFT通过信息感知的标记加权方案改进监督微调,提升泛化能力并保留原有能力,适用于数学、代码和推理任务。
消除行动瓶颈:由令牌级能量指导的代理强化学习
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所) ; Technical University of Berlin(柏林技术大学) ; University of Southern California(南加州大学) ; University of Hong Kong(香港大学) ; Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所)
AI总结 本文提出ActFocus方法,通过令牌级能量建模解决强化学习中令牌级训练信号分配不均的问题,显著提升性能。
Comments Preprint
EMO:可扩展MoE的令人沮丧的简单渐进训练
机构 * USC-ISI(USC- ISI) ; MBZUAI-IFM
AI总结 本文提出EMO框架,通过渐进式训练方法优化MoE模型,提升训练效率并减少计算成本。
视觉思维混合:探索上下文自适应推理模式选择用于通用视觉推理
机构 * Fudan University(复旦大学) ; Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) ; Future Living Lab of Alibaba(阿里巴巴未来生活实验室) ; University of Southern California(南加州大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 本文提出MoVT框架,通过AdaVaR实现多模式统一学习与上下文自适应选择,提升通用视觉推理能力。
Comments 27 pages, 11 figures, 5 tables, accepted by ICLR 2026
CounselBench: 一个大规模专家评估和对抗性基准测试,用于评估大型语言模型在心理健康问答中的表现
机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) ; Department of Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程系) ; Suzanne Dworak-Peck School of Social Work, University of Southern California(南加州大学苏兹安·德沃拉克-佩克社会工作学院) ; Department of Psychiatry and the Behavioral Sciences, University of Southern California(南加州大学精神病学与行为科学系) ; Annenberg School for Communication, University of Southern California(南加州大学安纳伯格通信学院)
AI总结 CounselBench通过100名心理健康专家评估GPT-4、LLaMA 3等模型在真实求助场景中的表现,揭示其在临床敏感性和安全风险方面的不足,并通过对抗性数据集深入分析模型失败模式。
AgentTrap: 评估LLM代理在第三方技能中抵御恶意运行行为的能力
机构 * University of Notre Dame(诺丁汉大学) ; University of Southern California(南加州大学) ; LMU Munich(慕尼黑大学) ; Inria, France(法国国家信息与自动化技术研究院)
AI总结 AgentTrap通过141个任务评估LLM代理在使用第三方技能时抵御恶意行为的能力,发现最关键的失败并非简单劫持,而是模型在完成用户任务时将不安全副作用视为正常流程。