arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-06-03 至 2026-06-03 共收录 34
2601.22599 2026-06-03 cs.SD cs.HC

A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation

用于数据高效查询式通用声音分离的语义一致数据集

Kai Li, Jintao Cheng, Chang Zeng, Zijun Yan, Helin Wang, Zixiong Su, Bo Zheng, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究所,BNRist,清华大学,北京,中国) Shanda AI Research Tokyo(莎莎人工智能研究东京) IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing, China(IDG/麦戈文脑研究 institute,清华大学,北京,中国) Johns Hopkins University(约翰霍普金斯大学) Chinese Institute for Brain Research (CIBR), Beijing, China(中国脑研究 institute(CIBR),北京,中国)

AI总结 提出自动管道通过语义一致合成协议消除事件共现,构建高质量合成数据集Hive,使模型在数据量极小的情况下达到与大规模训练模型相当的分离精度和泛化能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10055 2026-06-03 cs.CV

Physical Plausibility Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance

通过 HCM-GRPO 实现物理合理性推理:赋能紧凑模型以获得卓越性能

Zhiyuan Hu, Zheng Sun, Yi Wei, Long Yu

机构 * Tsinghua University(清华大学) Alibaba Health Information Technology Limited(阿里巴巴健康信息技术有限公司)

AI总结 针对多模态大语言模型在物理合理性推理中数据缺乏和推理能力弱的问题,提出包含大规模数据集和 HCM-GRPO 方法的完整解决方案,以紧凑模型超越大规模开源和闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19305 2026-06-03 cs.LG cs.AI eess.SP

Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning

小波傅里叶扩散器:用于强化学习的频率感知扩散模型

Yifu Luo, Yongzhe Chang, Xueqian Wang

机构 * Tsinghua University China(清华大学中国)

AI总结 针对现有扩散模型在离线强化学习中忽略频域特征导致频率偏移的问题,提出WFDiffuser,通过离散小波变换分解轨迹并利用短时傅里叶变换和交叉注意力增强频域建模,在D4RL基准上有效缓解频率偏移,提升轨迹稳定性和决策性能。

Comments IJCNN 2025

Journal ref IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14636 2026-06-03 cs.RO

BEV-ODOM2: Enhanced BEV-based Monocular Visual Odometry with PV-BEV Fusion and Dense Flow Supervision for Ground Robots

BEV-ODOM2: 基于PV-BEV融合与密集光流监督的增强型BEV单目视觉里程计用于地面机器人

Yufei Wei, Chenxiao Hu, Wangtao Lu, Sha Lu, Yuxiang Cui, Fuzhang Han, Rong Xiong, Yue Wang

机构 * Tsinghua University(清华大学)

AI总结 针对现有BEV方法中位姿训练稀疏监督和透视投影信息丢失的问题,提出BEV-ODOM2框架,通过密集BEV光流监督和PV-BEV融合,在四个数据集上实现40%的RTE提升,并支持边缘实时部署。

详情

展开后加载摘要…

URL PDF HTML 收藏