arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-07-28 至 2026-07-28 共收录 13
2607.20033 2026-07-28 cs.RO 版本更新

Robots Acquire Manipulation Skills in Seconds from a Single Human Video

机器人从单个人类视频中在数秒内获取操作技能

Guangyan Chen, Meiling Wang, Te Cui, Zichen Zhou, Qi Shao, Shalfun Li, Hang Su, Roy Gan, Hao Wang, Mengyin Fu, Yi Yang, Yufeng Yue

机构 * Beijing Institute of Technology(北京理工大学) X SQUARE ROBOT(X方块机器人) Tsinghua University(清华大学)

AI总结 研究提出HOST框架,通过自定位预测,使机器人能从单个人类视频数秒内获取操作技能,保留先前技能,相比零样本基线及任务50次机器人示范微调的基线,在示范次数和获取速度上优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16692 2026-07-28 cs.SE cs.CL 版本更新

Dependency-Guided Code Generation: Structured Matrix Decomposition and Consistency-Guided Refinement

依赖引导的代码生成:结构化矩阵分解与一致性引导的细化

Mingqiao Mo, Yangchen Zeng, Zikai Xiao, Xin Xiao, Wenhua Nie, Zhaolu Kang, Guangyuan Dong, Kai Shu, Hao Zhang, Xiaodong Fan

机构 * University of the Chinese Academy of Sciences(中国科学院大学) ByteDance Inc.(字节跳动公司) Zhejiang University(浙江大学) National Taiwan University(台湾国立大学) Peking University(北京大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Liaoning Technical University(辽宁技术大学)

AI总结 针对现有代码生成方法无法充分捕捉代码实体依赖关系的问题,提出依赖感知代码生成框架,通过结构化矩阵分解和一致性引导细化生成代码,经实验验证该方法能生成语义对齐和结构保真度更高的代码。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09133 2026-07-28 cs.CV cs.AI 版本更新

IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation

IB-Flow:用于少步文本到图像生成的信息瓶颈引导的CFG蒸馏

Yiting Wang, Jingyi Zhang, Wenhu Zhang, Ke Chao, Yves Liang, Kun Cheng, Kang Zhao

机构 * Tsinghua University(清华大学) Wan Team, Alibaba Group(万团队,阿里巴巴集团) HKUST(香港科技大学) Beijing Normal University(北京师范大学)

AI总结 研究针对少步文本到图像生成中推理延迟问题,通过信息论将蒸馏建模为信息瓶颈引导的动态互信息博弈,提出双轨自适应框架,消除过度条件化伪影,在2步配置下实现SOTA生成保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04498 2026-07-28 cs.CV cs.SD 版本更新

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

UniSkip-Mamba:用于视听时间伪造定位的频率感知状态空间模型

Cangjin Yu, Quan Zhang, Dan Jiang, Ke Zhang

机构 * Soochow University(苏州大学) Tsinghua University(清华大学)

AI总结 针对视听时间伪造定位,通过频域分析发现伪造特征集中在低中频,提出融合多模态序列与新颖扫描机制的UniSkip-Mamba框架,实现性能提升和推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28828 2026-07-28 cs.CV 版本更新

Ground4D: Consistency-Aware 4D Reconstruction from Monocular Video

Ground4D: 从单目视频进行一致性感知的四维重建

Qing Zhao, Weijian Deng, Pengxu Wei, Liang Lin

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)

AI总结 提出Ground4D框架,结合3D基础模型进行几何初始化与动态高斯泼溅进行一致性优化,实现从单目视频的高保真4D重建与新视角渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24118 2026-07-28 cs.CV 版本更新

An LMM for Precisely Grounding Elements in Documents

一种用于精确文档元素定位的大型多模态模型

Yijian Lu, Chuangxin Zhao, Kai Sun, Lei Hou, Ji Qi, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 提出PreciseDoc,一种通过合成数据与强化学习联合训练实现文档元素精确定位的大型多模态模型,显著提升文档理解与视觉定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22876 2026-07-28 cs.LG 版本更新

WeCon: An Efficient Weight-Conditioned Neural Solver for Multi-Objective Combinatorial Optimization Problems

WeCon: 一种高效的权重条件神经求解器用于多目标组合优化问题

Xuan Wu, Jinbiao Chen, Yang Li, Lijie Wen, Chunguo Wu, Yuanshu Li, Yubin Xiao, Chunyan Miao, You Zhou, Di Wang

机构 * Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) College of Software, Jilin University(吉林大学软件学院) School of Software, Tsinghua University(清华大学软件学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院 computing and information systems 系)

AI总结 提出一种权重条件神经求解器WeCon,通过编码器中的门控残差融合和解码器中的残差融合模块增强权重-特征交互,并采用高效偏好优化构建高质量解对,在多个多目标组合优化问题上达到与最先进方法相当的HV值并减少40%推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16008 2026-07-28 cs.LG 版本更新

Corner Reflector Array Jamming Discrimination Using Multi-Dimensional Micro-Motion Features with Frequency Agile Radar

利用多维微运动特征的频率敏捷雷达角反射阵干扰鉴别

Jie Yuan, Lei Wang, Yanhao Wang, Yimin Liu

机构 * Department of Electronic Engineering, Tsinghua University Beijing, China(电子工程系,清华大学北京,中国)

AI总结 本文提出一种鲁棒的鉴别方法,通过多维微运动特征区分真实船舶目标与非刚性诱饵,结合手工特征与深度学习特征提升识别性能。

Comments Submition at the 2026 CIE International Conference on Radar

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14896 2026-07-28 cs.CL 版本更新

Language-Coupled Reinforcement Learning for Multilingual Retrieval-Augmented Generation

多语言耦合强化学习用于多语言检索增强生成

Rui Qi, Fengran Mo, Yufeng Chen, Xue Zhang, Shuo Wang, Hongliang Li, Jinan Xu, Jian-Yun Nie, Kaiyu Huang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) University of Montreal(蒙特利尔大学) Tsinghua University(清华大学) University of Notre Dame(Notre Dame 大学)

AI总结 本文提出LcRL框架,通过语言耦合组相对策略优化减少知识偏差和冲突,提升多语言检索增强生成的性能,适用于受限训练数据和多语言大规模集合的场景。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04266 2026-07-28 eess.SP cs.LG 版本更新

Aortic Valve Disease Screening from PPG via Physiology-Guided Self-Supervised Learning

通过生理引导的自监督学习检测PPG中的主动脉瓣疾病

Jiaze Wang, Qinghao Zhao, Zizheng Chen, Zhejun Sun, Deyun Zhang, Yuxi Zhou, Shenda Hong

机构 * Department of Computer Science, Tianjin University of Technology(天津理工大学计算机科学系) National Institute of Health Data Science, Peking University(北京大学国家健康数据科学研究院) Department of Cardiology, Peking University People’s Hospital(北京大学人民医院心内科) HeartVoice Medical Technology(心声医疗科技) DCST, BNRist, RIIT, Institute of Internet Industry, Tsinghua University(清华大学计算机科学与技术系、北京人工智能研究所、互联网产业研究所) Institute of Medical Technology, Peking University Health Science Center(北京大学健康科学中心医学技术研究所) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究所) State Key Laboratory of Vascular Homeostasis and Remodeling, NHC Key Laboratory of Cardiovascular Molecular Biology and Regulatory Peptides, Peking University(北京大学血管稳态与重塑国家重点实验室、国家心血管分子生物学与调节肽重点实验室)

AI总结 本文提出基于生理引导的自监督学习方法,利用大量未标记PPG数据高效筛查主动脉狭窄和反流,实现优于传统监督学习的检测性能。

Comments 33 pages, 8 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01856 2026-07-28 cs.CV 版本更新

GCR: Geometry-Consistent Routing for Task-Agnostic Continual Anomaly Detection

GCR:面向任务无关持续异常检测的几何一致性路由

Joongwon Chae, Lihui Luo, Yang Liu, Runming Wang, Dongmei Yu, Zeming Liang, Xi Yuan, Dayan Zhang, Zhenglin Chen, Peiwu Qin, Ilmoon Chae

机构 * Tsinghua University Shenzhen International Graduate School(清华大学深圳国际研究生院) Ratel Soft Affiliated Fifth Hospital, Wenzhou Medical University(温州医学院附属第五医院) Chinese Medicine Guangdong Laboratory(广东中医药实验室)

AI总结 GCR通过几何一致性路由提升持续异常检测的稳定性,减少遗忘并保持检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01031 2026-07-28 cs.RO cs.AI cs.LG 版本更新

VLASH: Real-Time VLAs via Future-State-Aware Asynchronous Inference

VLASH: 通过未来状态感知的异步推断实现实时VLAs

Jiaming Tang, Yufei Sun, Yilong Zhao, Shang Yang, Yujun Lin, Zhuoyang Zhang, James Hou, Yao Lu, Zhijian Liu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达) Tsinghua University(清华大学) UC Berkeley(加州大学伯克利分校) UCSD(加州大学圣地亚哥分校) Caltech(加州理工学院)

AI总结 VLASH通过未来状态感知的异步推断框架,实现高效、准确的实时VLAs控制,显著提升反应速度和任务执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16909 2026-07-28 cs.CV cs.RO 版本更新

SLAM-Former: Putting SLAM into One Transformer

SLAM-Former:将同步定位与地图构建集成于一个Transformer

Yijun Yuan, Zhuoguang Chen, Kenan Li, Weibang Wang, Minghui Qin, Zhijian Fang, Weicheng Zheng, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学智能系统研究所)

AI总结 研究将SLAM功能集成于单个Transformer的方法,核心是SLAM-Former由协同的前后端组成,前端实时处理单目图像用于增量映射和跟踪,后端全局优化,实验证明该方法相比现有密集SLAM方法性能优越。

Comments Published on ECCV 2026, Project Page:https://tsinghua-mars-lab.github.io/SLAM-Former

详情

展开后加载摘要…

URL PDF HTML 收藏