arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-03-12 至 2026-03-12 共收录 9
2603.10921 2026-03-12 cs.SD

Training-Free Multi-Step Inference for Target Speaker Extraction

无需训练的多步推理用于目标说话人提取

Zhenghai You, Ying Shi, Lantian Li, Dong Wang

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学,中国) Center for Speech and Language Technologies, BNRist, Tsinghua University, China(语音与语言技术中心,北京理工大学,中国)

AI总结 本文提出无需训练的多步推理方法,用于目标说话人提取,通过联合度量优化平衡不同评估目标,提升实际应用中的提取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10887 2026-03-12 cs.LG cs.AI

Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models

动态预测采样用于主动强化学习微调大推理模型

Yixiu Mao, Yun Qu, Qi Wang, Heming Zou, Xiangyang Ji

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 DPS通过动态预测方法减少回放成本,提升大推理模型的强化学习微调效率与性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10125 2026-03-12 cs.CV

4DEquine: Disentangling Motion and Appearance for 4D Equine Reconstruction from Monocular Video

4DEquine:从单目视频中解耦运动与外观进行4D马类重建

Jin Lyu, Liang An, Pujin Cheng, Yebin Liu, Xiaoying Tang

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

AI总结 4DEquine通过解耦运动与外观重建,提出新框架实现高效4D马类重建,展示在真实数据集上的优越性能。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02873 2026-03-12 cs.CL

LaTeX Compilation: Challenges in the Era of LLMs

LaTeX编译:在大语言模型时代面临的挑战

Tianyou Liu, Ziqiang Li, Xurui Liu, Yu Wu, Yansong Li

机构 * Southern University of Science and Technology(南方科技大学) Alibaba(阿里巴巴) Tsinghua University(清华大学) Rutgers University(罗格斯大学) Liii Network(Liii网络)

AI总结 本文提出Mogan STEM作为替代TeX的结构编辑器,通过高效的数据结构和按需插件加载,在编译效率、生成语义和工具生态系统等方面优于TeX,并展示了其在LLM微调中的优势。

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19442 2026-03-12 cs.CV

UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment

UrbanAlign: 域内任务中VLM与人类偏好对齐的后处理语义校准

Yecheng Zhang, Rong Zhao, Zhizhou Sha, Yong Li, Lei Wang, Ce Hou, Wen Ji, Hao Huang, Yunshan Wan, Jian Yu, Junhao Xia, Yuru Zhang, Chunlei Shi

机构 * Tsinghua University(清华大学) University College London(伦敦大学学院) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学) Zhejiang University(浙江大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Renmin University of China(中国人民大学) Southeast University(东南大学)

AI总结 UrbanAlign通过后处理方法实现VLM与人类偏好的对齐,无需修改模型权重,提升领域任务的准确性和可解释性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13043 2026-03-12 cs.CV cs.AI

GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training

GTR-Turbo:合并的检查点实际上是为代理VLM训练提供免费的教师

Tong Wei, Yijun Yang, Changhao Zhang, Junliang Xing, Yuanchun Shi, Zongqing Lu, Deheng Ye

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文生) Peking University(北京大学)

AI总结 GTR-Turbo通过合并检查点作为免费教师,提升了多模态代理训练的效率和效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23610 2026-03-12 cs.SD cs.CV

Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention

高效音频-视觉语音分离与离散唇语语义及多尺度全局-局部注意力

Kai Li, Kejun Gao, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist,清华大学,北京) IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing(IDG/麦克戈文脑研究 institute,清华大学,北京) Chinese Institute for Brain Research (CIBR), Beijing(中国脑科学研究院(CIBR),北京)

AI总结 Dolphin通过离散唇语语义和多尺度全局-局部注意力实现高效音频-视觉语音分离,提升分离质量和效率。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14373 2026-03-12 cs.GR cs.CV

SEGA: Drivable 3D Gaussian Head Avatar from a Single Image

SEGA: 从单张图像生成可驾驶的3D高斯头人偶

Chen Guo, Zhuo Su, Liao Wang, Jian Wang, Shuang Li, Xu Chang, Zhaohu Li, Yang Zhao, Guidong Wang, Yebin Liu, Ruqi Huang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ByteDance(字节跳动) Pengcheng Lab(鹏城实验室) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 SEGA通过结合通用先验模型与层次UV空间高斯散点框架,实现从单张图像生成可驾驶的3D高斯头人偶,提升泛化能力和实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00819 2026-03-12 cs.LG cs.AI cs.CL

Large Language Models for Travel Behavior Prediction

基于大语言模型的出行行为预测

Baichuan Mo, Hanyong Xu, Ruoyun Ma, Jung-Hoon Cho, Dingyi Zhuang, Xiaotong Guo, Jinhua Zhao

机构 * Department of Civil Engineering, Tsinghua University, Beijing, China(清华大学土木工程系) Department of Civil and Environmental Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139(麻省理工学院土木与环境工程系) Department of Urban Studies and Planning, Massachusetts Institute of Technology, Cambridge, MA 20139(麻省理工学院城市研究与规划系) Department of Management Science and Engineering, Stanford University, Stanford, CA 94305(斯坦福大学管理科学与工程系)

AI总结 本文提出利用大语言模型进行出行行为预测,通过零样本提示和文本嵌入两种方法,实现了与传统模型相当的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏