arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-04-01 至 2026-04-01 共收录 11
2603.30038 2026-04-01 cs.CV

Benchmarking PhD-Level Coding in 3D Geometric Computer Vision

在3D几何计算机视觉中评估博士级别的编程能力

Wenyi Li, Renkai Luo, Yue Yu, Huan-ang Gao, Mingju Gao, Li Yuan, Chaoyou Fu, Hao Zhao

机构 * AIR, Tsinghua University(清华大学智能产业研究院) Qiuzhen College, Tsinghua University(清华大学求真书院) BAAI(北京智源人工智能研究院) Peking University(北京大学) Nanjing University(南京大学) University of Toronto(多伦多大学)

AI总结 本文提出GeoCodeBench基准,用于评估3D视觉编程能力。通过精选论文中的任务,生成多样化的测试用例,评估八种模型的性能,揭示当前模型在可靠3D科学编程方面的差距。

Comments Accepted by CVPR 2026; Project page: https://geocodebench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29723 2026-04-01 cs.AI

Reinforced Reasoning for End-to-End Retrosynthetic Planning

强化推理用于端到端的逆合成规划

Chenyang Zuo, Siqi Fan, Yizhen Luo, Zaiqing Nie

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) PharMolix Inc(PharMolix公司)

AI总结 本文提出ReTriP框架,通过端到端生成方法将逆合成规划转化为连续推理任务,采用路径一致的分子表示和渐进训练课程,提升长周期规划的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28460 2026-04-01 cs.CV cs.LG

$R_\text{dm}$: Re-conceptualizing Distribution Matching as a Reward for Diffusion Distillation

$R_\ ext{dm}$:重新概念化分布匹配作为扩散蒸馏的奖励

Linqian Fan, Peiqin Sun, Tiancheng Wen, Shun Lu, Chengru Song

机构 * KlingAI Research(KlingAI 研究院) Tsinghua University(清华大学)

AI总结 本文提出将分布匹配重新概念化为奖励以提升扩散蒸馏性能,通过引入GNDM提升优化稳定性,实现无缝奖励整合和改进采样效率,实验表明其在生成质量与保真度上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21507 2026-04-01 cs.CV

SVBench: Evaluation of Video Generation Models on Social Reasoning

SVBench:视频生成模型在社会推理中的评估

Wenshuo Peng, Gongxuan Wang, Tianmeng Yang, Chuanhao Li, Xiaojie Xu, Hui He, Kaipeng Zhang

机构 * Tsinghua University(清华大学) Shanda AI Research Tokyo(盛大人工智能研究院东京) Shanghai AI Lab(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

AI总结 本文提出SVBench基准,用于评估视频生成模型在社会推理能力上的不足,通过七大核心维度和免训练流程,评估七种先进模型,揭示表面合理性与深层社会推理能力间的差距。

Comments 10pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29332 2026-04-01 cs.RO cs.AI

Scaling Whole-Body Human Musculoskeletal Behavior Emulation for Specificity and Diversity

为特定性和多样性扩展全身人体肌肉骨骼行为模拟

Yunyue Wei, Chenhui Zuo, Shanning Zhuang, Haixin Gong, Yaming Liu, Yanan Sui

机构 * Tsinghua University(清华大学)

AI总结 本文提出一种大规模并行肌肉骨骼计算框架,用于基于生物力学的全身运动再现,通过整合GPU模拟与对抗性奖励聚合,实现了高维强化学习在肌肉骨骼控制中的优化,准确再现了700多块肌肉驱动的广泛运动 repertoire。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29318 2026-04-01 cs.AI

PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent

PSPA-Bench:面向智能手机GUI代理的个性化基准

Hongyi Nie, Xunyuan Liu, Yudong Bai, Yaqing Wang, Yang Liu, Quanming Yao, Zhen Wang

机构 * Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Peking University(北京大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院)

AI总结 本文提出PSPA-Bench,用于评估智能手机GUI代理的个性化能力,通过12855条个性化指令和22款移动应用,揭示现有方法在个性化场景下的不足,并提出改进方向。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29217 2026-04-01 eess.AS cs.CL cs.SD

Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition

推进基于大语言模型的音素到字母转换以实现多语言语音识别

Lukuang Dong, Ziwei Li, Saierdaer Yusuyin, Xianyu Zhao, Zhijian Ou

机构 * TasiTech Co., Ltd., China(塔斯科技股份有限公司,中国) Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能(SPMI)实验室,中国) School of Computer Science and Technology, Xinjiang University, China(新疆大学计算机科学与技术学院,中国)

AI总结 本文研究了基于大语言模型的多语言音素到字母转换,通过鲁棒训练和低资源过采样将平均识别错误率从10.56%降至7.66%。

Comments Update after INTERSPEECH2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29182 2026-04-01 cs.LG cs.CR

Dummy-Aware Weighted Attack (DAWA): Breaking the Safe Sink in Dummy Class Defenses

伪类感知加权攻击(DAWA):打破伪类防御中的安全汇合

Yunrui Yu, Xuxiang Feng, Pengda Qin, Pengyang Wang, Kafeng Wang, Cheng-zhong Xu, Hang Su, Jun Zhu

机构 * Tsinghua University(清华大学) University of Macau(澳门大学) Tencent(腾讯)

AI总结 本文提出DAWA,一种新的评估方法,通过自适应加权同时攻击真实标签和伪标签,有效突破伪类防御机制,降低其鲁棒性评估值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29163 2026-04-01 cs.CV

SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving

SparseDriveV2:仅需评分即可实现端到端自动驾驶

Wenchao Sun, Xuewu Lin, Keyu Chen, Zixiang Pei, Xiang Li, Yining Shi, Sifa Zheng

机构 * Tsinghua University(清华大学) Horizon Continental Technology(地平线大陆科技) Horizon(地平线)

AI总结 本文提出SparseDriveV2,通过可扩展的词汇表示和评分策略提升端到端自动驾驶性能,实现在NAVSIM和Bench2Drive上的高评分和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13266 2026-04-01 cs.CL cs.AI

QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation

QuestA: 通过问题增强扩展大语言模型的推理能力

Jiazheng Li, Hongzhou Lin, Hong Lu, Kaiyue Wen, Zaiwen Yang, Jiaxuan Gao, Yi Wu, Jingzhao Zhang

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Amazon(亚马逊) Stanford University(斯坦福大学)

AI总结 QuestA通过问题增强策略在训练中引入部分解以降低问题难度,提升大语言模型在数学推理任务中的推理能力,取得新的SOTA结果。

Comments 25 pages, 18 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11539 2026-04-01 cs.CV cs.AI cs.LG

Streaming 4D Visual Geometry Transformer

流式4D视觉几何变换器

Dong Zhuo, Wenzhao Zheng, Jiahe Guo, Yuqi Wu, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

AI总结 本文提出一种流式视觉几何变换器,通过因果变换器架构实现低延迟的4D视觉几何重建,结合知识蒸馏和高效注意力机制,提升在线场景下的推理速度与重建质量。

Comments Code is available at: https://github.com/wzzheng/StreamVGGT

详情

展开后加载摘要…

URL PDF HTML 收藏