arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

2026-05-15 至 2026-05-15 共收录 6
2605.14967 2026-05-15 cs.LG stat.ML

InfoSFT: Learn More and Forget Less with Information-Aware Token Weighting

InfoSFT: 通过信息感知的标记加权学习更多并忘记更少

Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学)

AI总结 InfoSFT通过信息感知的标记加权方案改进监督微调,提升泛化能力并保留原有能力,适用于数学、代码和推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14558 2026-05-15 cs.LG cs.AI cs.CL

Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy

消除行动瓶颈:由令牌级能量指导的代理强化学习

Langzhou He, Junyou Zhu, Yue Zhou, Zhengyao Gu, Junhua Liu, Wei-Chieh Huang, Henry Peng Zou, David Wipf, Philip S. Yu, Qitian Wu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所) Technical University of Berlin(柏林技术大学) University of Southern California(南加州大学) University of Hong Kong(香港大学) Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所)

AI总结 本文提出ActFocus方法,通过令牌级能量建模解决强化学习中令牌级训练信号分配不均的问题,显著提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13247 2026-05-15 cs.LG

EMO: Frustratingly Easy Progressive Training of Extendable MoE

EMO:可扩展MoE的令人沮丧的简单渐进训练

Linghao Jin, Chufan Shi, Huijuan Wang, Nuan Wen, Zhengzhong Liu, Eric Xing, Xuezhe Ma

机构 * USC-ISI(USC- ISI) MBZUAI-IFM

AI总结 本文提出EMO框架,通过渐进式训练方法优化MoE模型,提升训练效率并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22746 2026-05-15 cs.AI cs.CV

Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning

视觉思维混合:探索上下文自适应推理模式选择用于通用视觉推理

Zejun Li, Yingxiu Zhao, Jiwen Zhang, Siyuan Wang, Yang Yao, Runzhou Zhao, Jun Song, Bo Zheng, Zhongyu Wei

机构 * Fudan University(复旦大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室) University of Southern California(南加州大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出MoVT框架,通过AdaVaR实现多模式统一学习与上下文自适应选择,提升通用视觉推理能力。

Comments 27 pages, 11 figures, 5 tables, accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08584 2026-05-15 cs.CL

CounselBench: A Large-Scale Expert Evaluation and Adversarial Benchmarking of Large Language Models in Mental Health Question Answering

CounselBench: 一个大规模专家评估和对抗性基准测试,用于评估大型语言模型在心理健康问答中的表现

Yahan Li, Jifan Yao, John Bosco S. Bunyi, Adam C. Frank, Angel Hsing-Chi Hwang, Ruishan Liu

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程系) Suzanne Dworak-Peck School of Social Work, University of Southern California(南加州大学苏兹安·德沃拉克-佩克社会工作学院) Department of Psychiatry and the Behavioral Sciences, University of Southern California(南加州大学精神病学与行为科学系) Annenberg School for Communication, University of Southern California(南加州大学安纳伯格通信学院)

AI总结 CounselBench通过100名心理健康专家评估GPT-4、LLaMA 3等模型在真实求助场景中的表现,揭示其在临床敏感性和安全风险方面的不足,并通过对抗性数据集深入分析模型失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13940 2026-05-15 cs.CR cs.AI

AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills

AgentTrap: 评估LLM代理在第三方技能中抵御恶意运行行为的能力

Haomin Zhuang, Hanwen Xing, Yujun Zhou, Yuchen Ma, Yue Huang, Yili Shen, Yufei Han, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) University of Southern California(南加州大学) LMU Munich(慕尼黑大学) Inria, France(法国国家信息与自动化技术研究院)

AI总结 AgentTrap通过141个任务评估LLM代理在使用第三方技能时抵御恶意行为的能力,发现最关键的失败并非简单劫持,而是模型在完成用户任务时将不安全副作用视为正常流程。

详情

展开后加载摘要…

URL PDF HTML 收藏