arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-07-14 至 2026-07-14 共收录 19
2607.11644 2026-07-14 cs.CV 新提交

Motion4Motion: Motion Transfer Across Subjects at Inference

Motion4Motion:推理时跨主体的运动转移

Ling-Hao Chen, Zixin Yin, Duomin Wang, Xianfang Zeng, Gang Yu

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究视频间运动转移,此前方法依赖骨骼结构有局限。提出免训练的Motion4Motion框架,对角色运动流建模,突破跨物种运动转移难题,实验结果显示该方法优于基线。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11560 2026-07-14 cs.CV cs.AI 新提交

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11508 2026-07-14 cs.LG cs.AI stat.ML 新提交

CDFM: Towards a General-Purpose Causal Discovery Foundation Model

CDFM:迈向通用因果发现基础模型

Jie Qiao, Ruichu Cai, Zijian Li, Weilin Chen, Pengfei Hua, Boyan Xu, Zhengming Chen, Zhifeng Hao, Peng Cui

机构 * School of Computer Science, Guangdong University of Technology, Guangzhou, China(广东技术大学计算机科学学院) College of Mathematics and Computer, Shantou University, Shantou, China(汕头大学数学与计算机学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

AI总结 研究针对因果发现中特定数据集方法的局限,提出通用框架CDFM,通过研究因果可识别性理论边界构建变分框架,将未知因果机制视为潜在变量,经大量合成模型预训练,性能优于传统算法,推动因果发现范式转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11503 2026-07-14 cs.CL 新提交

GEIS: A Generation-Evaluation-Improvement Loop of Agent Skills for Long-Form Article Generation

GEIS:用于长篇文章生成的智能体技能生成-评估-改进循环

Jiale Zhang, Juntao Hu, Zhijian Ou

机构 * Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能实验室) TasiTech Co., Ltd., China(泰赛科技有限公司)

AI总结 针对长篇文章生成难题,提出GEIS循环,通过在Tasi Harness中实现文章写作、证据图像收集等技能,经核心写作、成对评估及改进技能,在20个主题实验中提升了PDF质量得分,证明可将其转变为可改进循环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11481 2026-07-14 cs.RO 新提交

Towards Human-level Dexterous Teleoperation

迈向人类水平的灵巧遥操作

Puhao Li, Zeyuan Chen, Yingying Wu, Pengkun Wei, Yuyang Li, Tianyu Wang, Jiaxiao Shi, Mingrui Yu, Baoxiong Jia, Song-chun Zhu, Tengyu Liu, Siyuan Huang

机构 * Tsinghua University(清华大学) State Key Lab of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司) Peking University(北京大学)

AI总结 研究如何通过遥操作赋予机器人手内灵巧性,提出TeleDexter手 - 物体协同跟踪控制器,利用混合奖励训练,经单阶段强化学习及随机化处理可零样本迁移到真实机器人,在多项任务上取得高成功率并能训练自主策略。

Comments Project Website: https://bigai-dex.github.io/blog/teledexter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11433 2026-07-14 cs.AI 新提交

Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA

全决策:一种用于全模态问答的渐进式证据状态智能体系统

Ming Ma, Yi Zhu, Yiran Zhong, Feida Zhu, Weigao Sun, Junhan Shi, Lingrui Mei, Tianming Yang, Steven Hoi

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) University of Chinese Academy of Sciences(中国科学院大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University(清华大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 研究全模态问答中证据分散问题,提出全决策系统,将问答转化为证据闭合过程,维护结构化证据状态,通过确定性状态更新处理异构观察,提升了准确率,验证了证据状态控制在多步证据寻求中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11374 2026-07-14 cs.LG 新提交

Surprisingly Simple and Effective Multi-Domain Graph Foundation Model through Graph-to-Table Alignment

通过图到表对齐实现惊人简单且有效的多域图基础模型

Chunyu Hu, Tianyin Liao, Ge Lan, Xingxuan Zhang, Jianxin Li, Peng Cui, Ziwei Zhang

机构 * Nankai University(南开大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

AI总结 研究如何让表格基础模型有效捕获图结构信息,提出GTAlign框架,先预训练图编码器捕获图表示,通过社区引导持续预训练弥合差距,应用于目标域推理,实验表明该框架在节点和图分类上显著优于基线,提供简单无文本的图基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11312 2026-07-14 cs.CV 新提交

SLVMBench: Skill Learning from Video Memory

SLVMBench:从视频记忆中学习技能

Yudong Yang, Guangzhi Sun, Yixuan Li, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学)

AI总结 SLVMBench是首个用于评估视频大语言模型从长视频记忆学习技能并应用于实时任务能力的基准测试,通过特定视频流和人工标注进行测试,发现现有视频LLMs在此方面有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11185 2026-07-14 cs.AI 新提交

SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL

SCALECUA:通过可验证任务合成和高效在线强化学习扩展计算机使用代理

Bowen Lv, Xiao Liu, Yanyu Ren, Hanyu Lai, Bohao Jing, Hanchen Zhang, Yanxiao Zhao, Shuntian Yao, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学)

AI总结 研究针对计算机使用代理扩展能力受限问题,提出ScaleCUA框架,通过可验证任务合成及高效训练实现。包括设计VeriGen生成任务、前沿采样提高效率、视觉上下文分割加速训练,在相关平台取得新的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11163 2026-07-14 cs.CL cs.SD eess.AS 新提交

Unified Gradient Projection: Language-Balanced Continual Learning for Multilingual Low-Resource ASR

统一梯度投影:用于多语言低资源语音识别的语言平衡持续学习

Ziang Ren, Guodong Lin, Yuchen Ai, Kaize Tan, Wei-Qiang Zhang

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 针对多语言低资源语音识别中微调导致灾难性遗忘及跨任务干扰问题,提出统一梯度投影(UGP)方法,通过语言平衡重放的参考梯度约束参数更新,结合梯度级与数据级重放,有效减轻遗忘,实现有效适应。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11109 2026-07-14 cs.IR cs.CL 新提交

Generative Chinese Statute Retrieval

生成式中文法规检索

Yiteng Tu, Zitao Su, Weihang Su, Xuanyi Chen, Yueyue Wu, Yiqun Liu, Min Zhang, Qingyao Ai

机构 * Tsinghua University(清华大学) Quancheng Laboratory(清华实验室) Renmin University of China(中国人民大学)

AI总结 针对法规检索中口语化查询与正式法规语言的差距问题,提出GCSR生成式法规检索框架,通过多粒度结构化文档ID和多任务训练策略,将其转化为序列生成问题,实验证明该框架优于基线,凸显其在法律信息检索及推理任务中的有效性与潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11096 2026-07-14 cs.CV cs.SD stat.ML 新提交

Difference-Driven Gating: Adaptive Feature Fusion for U-Net Decoder

差异驱动门控:U-Net 解码器的自适应特征融合

Kai Li, Xuechao Zou, Jiashen Fu, Zijun Yan, Xintong Wang, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for Artificial Intelligence, BNRist, IDG/McGovern Institute for Brain Research, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院、北京信息科学与技术国家研究中心、IDG/麦戈文脑科学研究院) Chinese Institute for Brain Research (CIBR)(中国脑科学研究院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机与信息技术学院)

AI总结 研究 U-Net 风格模型中多尺度特征融合问题,提出基于特征差异和熵差异的门控方法,通过从两特征流差异导出注意力权重生成耦合门控映射,实验表明该方法优于现有方法,为特征融合提供新范式。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11083 2026-07-14 cs.SD 新提交

The SonicAGI System for the REAL-TSE Challenge

用于 REAL-TSE 挑战赛的 SonicAGI 系统

Kai Li, Wendi Sang, Jintao Cheng, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系、人工智能研究所、BNRist、清华大学) IDG/McGovern Institute for Brain Research, Tsinghua University(IDG/麦戈文脑科学研究所、清华大学) Chinese Institute for Brain Research (CIBR)(中国脑科学研究所)

AI总结 本文介绍 SonicAGI 参加 REAL-TSE 挑战赛的情况,采用以数据为中心的方法,在线引入 SwiftNet-Lookahead 控制延迟,离线用 USEF-TFGridNet 权衡质量与保真度,在官方评估中取得较好成绩,证明相关训练和建模对对话式 TSE 有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10815 2026-07-14 cs.RO 新提交

Learning Roller-Skating Motions of Humanoid Robots Based on Adversarial Motion Priors

基于对抗运动先验的仿人机器人轮滑运动学习

Yunkang Cheng, Yutong Wu, Menghan Li, Shihe Zhou, Mingguo Zhao

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing Key Laboratory of Embodied Intelligence Systems(北京具身智能系统重点实验室) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所)

AI总结 研究仿人机器人轮滑运动,提出基于对抗运动先验的强化学习框架,用于泵式滑行和推式滑行两种步态。通过动作捕捉收集数据并处理成参考运动状态,用独立管道学习步态,经模拟实验评估步态相关指标。

Comments 12 pages. Submitted preprint version. Accepted for oral presentation at CLAWAR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10784 2026-07-14 cs.LG cs.AI 新提交

LSTrans: Efficient Knowledge Transfer for Lightweight and Automated ECG Classification

LSTrans:用于轻量级和自动心电图分类的高效知识转移

Yi Zhao, Jiajun Gao, Chenyang Xu, Yuxi Zhou, Hao Wang

机构 * School of Mechano-Electronic Engineering Xidian University Xi'an, China(机械电子工程学院 西安电子科技大学 西安中国) School of Cyber Engineering Xidian University Xi'an, China(网络工程学院 西安电子科技大学 西安中国) DCST, BNRist, RIIT, Institute of Internet Industry Tsinghua University Beijing, China(DCST、BNRist、RIIT、互联网产业研究院 清华大学 北京中国)

AI总结 针对可穿戴设备上心电图分类计算成本高的问题,提出轻量级混合模型LSTrans,它结合一维卷积主干、Transformer编码器及知识蒸馏,在多基准数据集实验中实现诊断灵敏度与资源效率的平衡,减少内存占用和训练延迟。

Comments Submitted to BIBM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10336 2026-07-14 cs.RO cs.CV 新提交

PrismAD: Decoupled Planning via Semantic Mixture-of-Planners for End-to-End Autonomous Driving

PrismAD:通过语义规划器混合实现端到端自动驾驶的解耦规划

Kang Ding, Zhigui Lin, Hongsong Wang, Jie Gui, Qi Liu, Zhe Wang, Luqi Tang, Lei He

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与出行国家重点实验室) School of Cyberspace Security, Southeast University(东南大学网络空间安全学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Automotive Engineering, Wuhan University of Technology(武汉理工大学汽车工程学院) SAIC GM Wuling Automobile Co., Ltd.(上汽通用五菱汽车股份有限公司)

AI总结 研究针对自动驾驶规划器耦合问题,提出PrismAD框架,将场景令牌分组,用独立规划专家学习专门表示,语义感知路由器聚合预测,引入稀疏top-$K$激活,实验证明该框架性能具竞争力。

Comments 8 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10210 2026-07-14 cs.CR cs.CL 新提交

Toward Stronger Code Watermarking: A Grammar-Driven Approach to Optimizing the Trade-off Between Quality and Detectability

迈向更强的代码水印:一种语法驱动的方法来优化质量与可检测性之间的权衡

Licheng Yu, Aiwei Liu, Songze Li

机构 * Southeast University(东南大学) Tsinghua University(清华大学)

AI总结 针对大语言模型代码生成中质量与可检测性权衡难题,提出语法驱动水印方法(GDW),通过语法引导机制和角色感知调制注入水印,设计加权检测统计量,实验表明其在多方面优于现有方法且具鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10191 2026-07-14 cs.SD cs.AI 新提交

Breaking the Quality--Intelligibility Trade-off in Streaming Target Speaker Extraction via Deep-Feature-Anchored Preference Optimization

通过深度特征锚定偏好优化打破流式目标说话人提取中的质量-可懂度权衡

Shuhai Peng, Jinjiang Liu, Hui Lu, Liyang Chen, Guiping Zhong, Jiakui Li, Shiyin Kang, Zhiyong Wu

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) SenseTime(商汤科技)

AI总结 研究流式目标说话人提取中的质量-可懂度权衡问题,提出扩大Conformer卷积核及基于WavLM的DPO微调策略,实现了相对可懂度10.9%的提升,同时音频质量和说话人相似度也有改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10004 2026-07-14 cs.CV 新提交

Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning

模型指导绘图:用于统一多模态推理的自适应视觉门控

Wenxi Gao, Guanxi Lu, Didi Zhu, Hao Mark Chen, Quan Deng, Zhican Wang, Jiankang Deng, Hongxiang Fan

机构 * Imperial College London(伦敦帝国理工学院) Tsinghua University(清华大学)

AI总结 针对统一多模态模型在视觉推理中存在的问题,提出基于生成意图和视觉保真度两个内部信号的AdaViG方法,可动态评估视觉步骤,避免误导性视觉证据进入推理过程,提升了准确率并降低计算量和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏