arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

共收录 127
2606.20990 2026-06-23 cs.RO 新提交

Duet: Dual-Robot Understanding via Efficient Teaching

Duet: 通过高效教学实现双机器人理解

Yiqi Zhao, Ruohai Ge, Celina Shiyu Wang, Junjie Ye, Muchen Xu, Minhao Li, Sergey Zakharov, Basile Van Hoorick, Vitor Campagnolo Guizilini, Leonidas Guibas, Gaurav S. Sukhatme, Jyotirmoy V. Deshmukh, Yue Wang

机构 * University of Southern California(南加州大学) Toyota Research Institute(丰田研究所) Stanford University(斯坦福大学)

AI总结 提出DUET框架,利用VR遥操作和人类协作先验,通过预训练与微调结合,实现双机器人移动操作的高效学习,显著降低数据采集成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19797 2026-06-19 eess.AS cs.AI cs.SD eess.SP 新提交

Improving End-to-End Speech Recognition for Dysarthric Speech through In-Domain Data Augmentation

通过域内数据增强改进构音障碍语音的端到端语音识别

Paban Sapkota, Hemant Kumar Kathania, Sudarsana Reddy Kadiri, Shrikanth Narayanan

机构 * Department of Electronics and Communication Engineering, National Institute of Technology Sikkim, India(电子与通信工程系,印度尼特拉特技术学院Sikkim分校) Signal Analysis and Interpretation Laboratory (SAIL), University of Southern California, Los Angeles, USA(信号分析与解释实验室(SAIL),美国南加州大学洛杉矶分校)

AI总结 针对构音障碍语音识别中数据稀缺和严重程度差异的问题,本文探索了四种数据增强方法(SRM、PM、FM、VTLP)对预训练Wav2Vec2模型进行微调,在不同严重程度上实现了显著的字错误率降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19793 2026-06-19 eess.AS cs.AI cs.LG cs.SD eess.SP 新提交

Systematic Study of Dysarthric Speech Recognition: Spectral Features and Acoustic Models

构音障碍语音识别的系统研究:频谱特征与声学模型

Paban Sapkota, Hemant Kumar Kathania, Mikko Kurimo, Sudarsana Reddy Kadiri, Shrikanth Narayanan

机构 * Department of Electronics and Communication Engineering, National Institute of Technology Sikkim, India(电子与通信工程系,印度尼特技术学院锡金分校) Department of Information and Communications Engineering, Aalto University, Finland(信息与通信工程系,阿尔托大学,芬兰) Signal Analysis and Interpretation Laboratory (SAIL), University of Southern California, Los Angeles, USA(信号分析与解释实验室(SAIL),美国南加州大学洛杉矶分校)

AI总结 本文系统研究不同频谱特征与声学模型的组合,通过引入音高特征和优化训练帧重叠数,在F-TDNN模型上实现孤立词和句子识别相对提升4.65%和4.63%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19828 2026-06-19 cs.CV 新提交

3D-PLOT-LLM: Part-Level Object Tokens for 3D Large Language Models

3D-PLOT-LLM: 用于三维大语言模型的部件级对象标记

Jintang Xue, Xinyu Wang, Yixing Wu, Jingwen Chen, C. -C. Jay Kuo

机构 * University of Southern California(南加州大学) Ohio State University(俄亥俄州立大学)

AI总结 提出3D-PLOT-LLM,通过重组输入标记流使部件可直接通过LLM词汇寻址,无需分割解码器或边界框,在部件级基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18527 2026-06-18 stat.ML cs.LG 新提交

Toward Simultaneously Optimal Regret in U-Calibration

面向同时最优遗憾的U-校准

Rafael Frongillo, Haipeng Luo, Nishant A. Mehta, Jon Schneider

机构 * University of Colorado Boulder(科罗拉多大学波德穆尔分校) University of Southern California(南加州大学) Google Research(谷歌研究)

AI总结 提出一种基于自和谐噪声的FTPL变体,实现对所有有界适当损失的最优$\tilde O(\sqrt{T})$遗憾和对光滑损失的对数遗憾。

Comments 30 pages; to appear at COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18861 2026-06-18 cs.CV cs.AI 新提交

URDF Synthesis from RGB-D Sequences via Differentiable Joint Inference and Energy-Consistent Verification

基于可微联合推理与能量一致性验证的RGB-D序列URDF合成

Xinze Zhang

机构 * University of Southern California(南加州大学)

AI总结 提出KinemaForge管道,通过可微关节推理和能量一致性验证,从RGB-D序列联合估计部件形状、关节拓扑和参数,显著降低关节轴误差和仿真漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18425 2026-06-18 cs.SE cs.AI cs.DC 新提交

From Specification to Execution: AI Assisted Scientific Workflow Management

从规范到执行:AI辅助的科学工作流管理

Komal Thareja, Hamza Safri, Rajiv Mayani, Anirban Mandal, Ewa Deelman

机构 * RENCI, University of North Carolina at Chapel Hill, NC, USA(RENCI,北卡罗来纳大学教堂山分校) Information Sciences Institute, University of Southern California, Marina del Rey, CA, USA(信息科学研究所,南加州大学马里纳德尔雷耶斯分校)

AI总结 提出一种AI辅助方法,通过规范驱动的工作流生成、自动化调试和分布式执行,结合Pegasus与MCP层,实现从自然语言到大规模科学工作流的端到端管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18287 2026-06-18 cs.LG 新提交

Artemis: Anatomy-Resolved inTervention for Eliminating Multimodal NeuroImage confounderS

Artemis: 解剖分辨的干预方法用于消除多模态神经影像混杂因素

Siyuan Dai, Yang Du, Kun Zhao, Zhusuyi Chen, Heng Huang, Paul Thompson, Chao Shi, Haoteng Tang, Liang Zhan

机构 * University of Pittsburgh(匹兹堡大学) University of Maryland(马里兰大学) University of Southern California(南加州大学) Binghamton University(宾汉姆顿大学) University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德河谷分校)

AI总结 提出Artemis框架,通过区域级因果干预学习特定脑区的混杂因素表示,消除fMRI和DTI多模态神经影像中人口统计学混杂因素对GNN的影响,在三个基准上提升性能。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16276 2026-06-18 cs.AI 新提交

SpecAlign: Efficient Specification-Grounded Alignment of Large Language Models via Synthetic Data

SpecAlign: 通过合成数据实现高效的大语言模型规范对齐

Wenjie Wang, Yue Huang, Zhengqing Yuan, Han Bao, Shiyi Du, Yuchen Ma, Yue Zhao, Yanfang Ye, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) Carnegie Mellon University(卡内基梅隆大学) LMU Munich(慕尼黑大学) University of Southern California(南加州大学)

AI总结 提出规范对齐新范式,通过从规范文档合成数据(SpecAlign框架),结合结构化规则标注、可控规范实例化和多智能体对抗数据合成,生成细粒度偏好对,提升规则遵守度且不损害通用能力。

Comments 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17259 2026-06-17 eess.AS cs.SD 新提交

Intelligibility of Speech in Noise: Investigating Contribution of Magnitude and Phase Spectra

噪声中语音的可懂度:幅度谱和相位谱贡献的研究

Bhanu Teja Nellore, Sudarsana Reddy Kadiri, Rohit Kumar, Karan Nathwani, Suryakanth V Gangashetty

机构 * Signal Analysis and Interpretation Laboratory, University of Southern California, Los Angeles, USA(美国南加州大学信号分析与解释实验室) National Institute of Technology, Patna, India(印度帕坦国家理工学院) Indian Institute of Technology, Jammu, India(印度朱默尔理工学院) Koneru Lakshmaiah Education Foundation, Vaddeswaram, Guntur District, Andhra Pradesh, India(安得拉邦戈塔瓦德区瓦达萨瓦拉姆康纳鲁拉克希玛伊教育基金会)

AI总结 通过三个实验评估幅度谱和相位谱对噪声中辅音可懂度的贡献,发现幅度谱在干净条件下贡献更大,而相位谱在噪声条件下更鲁棒,且鼻音比擦音和近音更易受噪声影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17196 2026-06-17 stat.ML cs.LG stat.ME 新提交

Another Look at Log-PCA for Probability Measures: A Dynamical Formulation and Statistical Convergence

再探概率测度的Log-PCA:一种动力学公式与统计收敛性

Peng Xu, Changbo Zhu, Young-Heon Kim, Xiaohui Chen

机构 * Department of Statistics University of Illinois Urbana-Champaign(统计学系伊利诺伊大学厄巴纳-香槟分校) Department of ACMS University of Notre Dame(ACMS系诺丁汉大学) Department of Mathematics University of British Columbia(数学系不列颠哥伦比亚大学) Department of Mathematics Thomas Lord Department of Computer Science University of Southern California(数学系托马斯·劳德计算机科学系南加州大学)

AI总结 本文在Wasserstein几何下提出一种动力学公式解释log-PCA,称为Wasserstein切向PCA(WT-PCA),并推导了经验WT-PCA相对于总体测度的统计收敛速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17410 2026-06-17 cs.CV 新提交

Attention Alignment Between Humans and Vision-Language Models

人类与视觉语言模型之间的注意力对齐

Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld, Declan Campbell, Samuel Nastase, Taylor Webb, Michael Graziano

机构 * Princeton Neuroscience Institute, Princeton University(普林斯顿大学普林斯顿神经科学研究所) Department of Psychology, Princeton University(普林斯顿大学心理学系) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) Department of Psychology and Center for Computational Language Sciences, University of Southern California(南加州大学心理学系与计算语言科学中心) Department of Psychology, Université de Montréal(蒙特利尔大学心理学系)

AI总结 本研究比较了六种视觉语言模型的空间注意力图与人类注视热图,发现解码器架构(LSTM vs Transformer)主导对齐程度,LSTM解码器对齐度更高但空间分散且任务区分度低,而Transformer解码器注意力更集中且任务区分度强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17354 2026-06-17 cs.CL cs.AI 新提交

Translating the Untranslatable: An Operationalizable Ontology for Untranslatability

翻译不可译:一个可操作化的不可译性本体论

Jacob Bremerman, Brihi Joshi, Hirona Arai, Xiang Ren, Jonathan May

机构 * University of Southern California Information Sciences Institute(南加州大学信息科学研究所)

AI总结 提出一个结构化的不可译性本体论和补偿策略分类法,构建多语言数据集,通过人类偏好研究发现注释补偿策略最受青睐,为策略感知机器翻译奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16990 2026-06-16 cs.LG math.AT 新提交

Analytic Torsion and Spectral Gap Capture Persistent-Laplacian Performance

解析挠率和谱间隙捕捉持久拉普拉斯算子的性能

Jernej Grlj, Aaron D. Lauda

机构 * University of Southern California(南加州大学)

AI总结 提出用贝蒂数、谱间隙和解析挠率三个不变量的紧凑谱表示替代全谱,在多个数据集上实现同等或更优性能,显著降低计算开销并避免高频噪声。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16461 2026-06-16 cs.LG 新提交

Privacy from Symmetry: Orthogonally Equivariant Transformers for LLM Inference

对称性带来的隐私:用于大语言模型推理的正交等变Transformer

Alexander Yukhimchuk, Andrey Shulga, Mladen Kolar, Martin Takáč

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Southern California(南加州大学)

AI总结 针对拆分推理中隐藏表示易被近邻搜索恢复的问题,提出正交混淆方法,并设计ConjFormer架构实现O(d)-等变性,在不加噪声或重加密下将令牌恢复率从35%降至1.3%,困惑度仅增0.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16257 2026-06-16 cs.LG cs.AI 新提交

Variance Reduction for Non-Log-Concave Sampling with Applications to Inverse Problems

非对数凹采样的方差缩减及其在逆问题中的应用

M. Berk Sahin, Ahmet Ege Tanriverdi, Behzad Sharif, Abolfazl Hashemi

机构 * School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) School of Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程学院) School of Biomedical Engineering, Purdue University(普渡大学生物医学工程学院)

AI总结 针对非对数凹分布采样中随机梯度高方差问题,提出统一分析动量、STORM和PAGE等方差缩减方法,证明其在相对Fisher信息和非平方总变差距离下的改进收敛率,并扩展至基于得分的生成先验逆问题求解。

Comments Accepted to Uncertainty in Artificial Intelligence (UAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16023 2026-06-16 cs.LG 新提交

IBAD: Interpretable Behavioral Anomaly Detection on Human Mobility Data

IBAD:人类移动数据上的可解释行为异常检测

Bita Azarijoo, John Krumm, Cyrus Shahabi

机构 * University of Southern California(南加州大学)

AI总结 提出IBAD框架,利用LDA学习可解释的日常移动模板,通过层次自监督模型检测个体行为异常,在真实和合成数据集上验证了模板的可迁移性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15055 2026-06-16 cs.CV cs.AI 新提交

Bridging Geographic Bias in Urban Streetscape Inference via Lifelong Learning with Visual-Semantic Pivoting

通过视觉-语义枢轴终身学习弥合城市街景推理中的地理偏差

Xinze Zhang

机构 * University of Southern California(南加州大学)

AI总结 提出HVSP-LL终身学习框架,通过分层视觉-语义枢轴模块和公平感知重放机制,在跨城市街景推理中减少地理偏差,实现城市间感知差距缩小38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14909 2026-06-16 stat.ML cs.LG 新提交

Audited Conformal Prediction for Classification under Unknown Distribution Shift

未知分布漂移下分类问题的审计共形预测

Yanfei Zhou, Rizal Fathony, Nam H. Nguyen, Matteo Sesia

机构 * Department of Data Sciences and Operations, University of Southern California(数据科学与运营系,南加州大学) AI Foundations, Capital One(Capital One人工智能基础) Department of Data Sciences and Operations, Thomas Lord Department of Computer Science, University of Southern California(数据科学与运营系,托马斯·劳德计算机科学系,南加州大学)

AI总结 提出审计共形预测方法,利用目标群体小标注数据训练审计模型识别旧模型可能失败的输入,结合共形预测框架在保证边际覆盖的同时提高条件覆盖,并提供理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14724 2026-06-16 cs.CV cs.AI 新提交

VigilFormer: Deformable Attention for Video Anomaly Detection with Causal Risk Inference

VigilFormer: 用于视频异常检测的可变形注意力与因果风险推理

Xinze Zhang

机构 * University of Southern California(南加州大学)

AI总结 提出VigilFormer框架,结合可变形时空注意力与因果时序建模,通过稀疏注意力、对比多实例学习和自适应帧跳过,在保持高精度的同时实现实时异常检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10495 2026-06-16 cs.RO 新提交

Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models

Act on What You See: 在视觉-语言-动作模型中解锁安全社交导航

Qingzi Wang, Xiyang Wu, Guangyao Shi, Dianwei Chen, Xianfeng Yang, Dinesh Manocha

机构 * University of Maryland(马里兰大学) University of Southern California(南加州大学)

AI总结 提出SALSA框架,通过两阶段无标注后训练(社交行为对齐和时间安全对齐),使预训练VLA模型利用已有表征实现安全社交导航,减少86.4%的近距离碰撞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07678 2026-06-16 cs.LG cs.AI 新提交

DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment

DOG-DPO:几何中的动态优化用于安全对齐

Yi Nian, Tiankai Yang, Yudi Zhang, Qi Pan, Zelong Xu, Shenzhe Zhu, Qingqing Luan, Yue Huang, Xiangliang Zhang, Yue Zhao

机构 * University of Southern California(南加州大学) Iowa State University(爱荷华州立大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) UT Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员) University of Notre Dame(圣母大学)

AI总结 提出DOG-DPO框架,将偏好对表示为模型表示空间中的方向,通过几何分解和多样性覆盖选择子集,仅用11%数据即可恢复大部分安全增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14240 2026-06-15 cs.AI 新提交

AFFORDANCE20Q: Evaluating Affordance Reasoning from Physical Properties

AFFORDANCE20Q:从物理属性评估可承担性推理

Yifan Jiang, Meige Yang, Zitong Li, Jay Pujara

机构 * Information Sciences Institute, University of Southern California(南加州大学信息科学研究所) University of Southern California(南加州大学)

AI总结 提出Affordance20Q基准,通过20个问题游戏评估模型从物理属性推理物体可承担性的能力,发现LLM与人类差距约20分,并开发KARI方法提升开源模型达15.2分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13934 2026-06-15 cs.AI 新提交

Adversarial Concept Search: Predicting Compositional Errors From Feature Geometry

对抗性概念搜索:从特征几何预测组合错误

Jennifer Meng Lu, Ruochen Zhang, Isabelle Lee, David Alvarez-Melis, Ellie Pavlick, Naomi Saphra

机构 * Brown University(布朗大学) University of Southern California(南加州大学) Harvard University(哈佛大学) Boston University(波士顿大学)

AI总结 利用LLM的表征几何预测其组合失败模式,发现概念编码近正交时可靠组合,编码接近时因干扰导致失败,无需评估具体输入即可预测错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12430 2026-06-15 cs.CY cs.AI 新提交

Will AI Agents Free Us From Meaningless Work? A Human-Centered Analysis

AI代理能否让我们摆脱无意义的工作?一项以人为中心的分析

Davide Ghia, Jaspreet Ranjit, Tania Cerquitelli, Daniele Quercia

机构 * Politecnico di Torino(都灵理工大学) University of Southern California(南加州大学) Nokia Bell Labs(诺基亚贝尔实验室)

AI总结 基于Graeber的“狗屁工作”理论,通过任务级分析发现,工人感知的任务无意义程度强烈预测其对AI委托的意愿,且此类任务被认为需要较少人工监督。

Comments Improved overall writing; add details about task filtering and participants screening; add comments in the discussion about the subjective and context-specific nature of the scale introduced;

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11489 2026-06-11 cs.RO 新提交

Steering Multirobot Behavior via Closed-Loop Affine Activation Editing

通过闭环仿射激活编辑引导多机器人行为

Satyajeet Das, Darren Chiu, Shashank Hegde, Gaurav S. Sukhatme

机构 * University of Southern California(南加州大学)

AI总结 提出CLAE框架,在推理时通过编辑冻结策略的中间激活来引导多机器人行为,无需微调或重训练,并在多四旋翼导航任务中验证了速度控制、编队保持和规避监控等新行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11480 2026-06-11 cs.LG 新提交

Accurate and Resource-Efficient Federated Continual Learning

准确且资源高效的联邦持续学习

Jebacyril Arockiaraj, Dhruv Parikh, Jayashree Adivarahan, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM Army Research Office(DEVCOM陆军研究办公室)

AI总结 提出FedRAN框架,通过紧凑随机特征统计替代梯度更新,利用截断SVD降低通信开销,结合原型伪标签处理标签稀缺,在多个数据集上提升准确率并大幅降低资源消耗。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11382 2026-06-11 cs.LG q-bio.BM 新提交

GLACIER: A Multimodal Student-Teacher Foundation Model for Molecular Property Prediction

GLACIER:用于分子性质预测的多模态师生基础模型

Emily Nguyen, Yongchan Hong, Harsh Toshniwal, Yan Liu, Andreas Luttens

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Quantitative and Computational Biology, University of Southern California(南加州大学定量与计算生物学系) Amazon(亚马逊) Department of Medical Biochemistry and Biophysics, Science for Life Laboratory, Karolinska Institutet(卡罗林斯卡学院医学生物化学与生物物理系,生命科学实验室)

AI总结 提出GLACIER师生框架,通过融合分子图、SMILES和物理化学描述符三种模态,并利用大模型蒸馏,实现高效准确的分子性质预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10233 2026-06-10 eess.AS cs.LG cs.SD 新提交

ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling

ANCHOR: 自回归非侵入式分块有序细化用于联合多分辨率语音质量建模

Zhuoyan Tao, Jiatong Shi, Hye-jin Shim, Shinji Watanabe

机构 * University of Southern California, USA(美国南加州大学) Carnegie Mellon University, USA(美国卡内基梅隆大学)

AI总结 提出ANCHOR模型,将增量语音质量评估重构为多分辨率自回归任务,通过双分辨率令牌和分辨率感知层次实现分块到整句的粗到细细化,在部分输入下显著降低误差,并揭示感知质量的时域积累机制。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09966 2026-06-10 cs.SD 新提交

RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification

RespiraMFM:一种用于呼吸道疾病识别的对比音频-语言对齐多模态基础模型

Shakhrul Iman Siam, Tiantian Feng, Jiankun Zhang, Shrikanth Narayanan, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) University of Southern California(南加州大学) University of Chicago(芝加哥大学)

AI总结 提出RespiraMFM多模态基础模型,通过对比音频-文本对齐策略整合呼吸音与临床信息,在监督和零样本任务中分别提升AUROC 9.15%和20.98%。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏