arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Southern California(南加州大学)

2026-03-11 至 2026-03-11 共收录 5
2603.09206 2026-03-11 cs.CV cs.LG

MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data

MM-Zero: 从零数据自我进化多模型视觉语言模型

Zongxia Li, Hongyang Du, Chengsong Huang, Xiyang Wu, Lantao Yu, Yicheng He, Jing Xie, Xiaomin Wu, Zhichao Liu, Jiarui Zhang, Fuxiao Liu

机构 * University of Maryland(马里兰大学) Brown University(布朗大学) Washington University in St. Louis(圣路易斯华盛顿大学) Adobe University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Southern California(南加州大学) NVIDIA

AI总结 MM-Zero通过多角色框架实现VLM零数据自我进化,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11790 2026-03-11 cs.LG cs.CR

JULI: Jailbreak Large Language Models by Self-Introspection

通过自我反思 jailbreak 大型语言模型:JULI

Jesson Wang, Zhanhao Hu, David Wagner

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 JULI 通过操纵令牌日志概率,利用微小插件块 BiasNet 实现对 API 调用 LLMs 的 jailbreak,无需模型权重或生成过程权限,且在黑盒环境下有效。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09034 2026-03-11 eess.AS cs.SD

Trade-offs Between Capacity and Robustness in Neural Audio Codecs for Adversarially Robust Speech Recognition

神经音频编解码器中容量与鲁棒性之间的权衡

Jordan Prescott, Thanathai Lertpetchpun, Shrikanth Narayanan

机构 * Signal Analysis and Interpretation Laboratory, University of Southern California, USA(南加州大学信号分析与解释实验室)

AI总结 本文研究了神经音频编解码器中容量与鲁棒性之间的权衡,发现中间深度量化能平衡对抗扰动与语音内容质量,从而最小化转录错误。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09011 2026-03-11 cs.RO cs.AI cs.HC

Improving through Interaction: Searching Behavioral Representation Spaces with CMA-ES-IG

通过交互改进:利用CMA-ES-IG搜索行为表示空间

Nathaniel Dennler, Zhonghao Shi, Yiran Tao, Andreea Bobu, Stefanos Nikolaidis, Maja Matarić

机构 * CSAIL/AeroAstro, Massachusetts Institute of Technology(CSAIL/AeroAstro,麻省理工学院) Department of Computer Science, University of Southern California(计算机科学系,南加州大学)

AI总结 本文提出CMA-ES-IG算法,通过整合用户体验考虑,提升机器人行为偏好学习的效率和鲁棒性。

Comments Under submission to IJRR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08936 2026-03-11 cs.SD cs.AI cs.CL cs.MM eess.AS

VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs

VoxEmo:基于语音大语言模型的语音情感识别基准测试

Hezhao Zhang, Huang-Cheng Chou, Shrikanth Narayanan, Thomas Hain

机构 * Department of Computer Science, University of Sheffield, United Kingdom(英国谢菲尔德大学计算机科学系) Signal Analysis and Interpretation Laboratory (SAIL), Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California, Los Angeles, CA 90089, USA(美国南加州大学电气与计算机工程系信号分析与解释实验室(SAIL))

AI总结 VoxEmo是一个基于语音大语言模型的语音情感识别基准测试,通过提供多样化的提示复杂度和分布感知的软标签协议,评估模型在真实世界中的情感识别能力。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏