arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-03-20 至 2026-03-20 共收录 17
2603.19228 2026-03-20 cs.CV

SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing

SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐

Xinyao Zhang, Wenkai Dong, Yuxin Song, Bo Fang, Qi Zhang, Jing Wang, Fan Chen, Hui Zhang, Haocheng Feng, Yu Lu, Hang Zhou, Chun Yuan, Jingdong Wang

机构 * Baidu(百度) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19219 2026-03-20 cs.CV cs.LG

DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding

DriveTok: 3D驾驶场景分词用于统一多视角重建与理解

Dong Zhuo, Wenzhao Zheng, Sicheng Zuo, Siming Yan, Lu Hou, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司)

AI总结 DriveTok通过3D变形交叉注意力实现高效多视角重建与理解,整合语义、几何与纹理信息,提升多视角分词效率与一致性。

Comments Project Page: https://paryi555.github.io/DriveTok/ Code: https://github.com/paryi555/DriveTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19145 2026-03-20 cs.LG

Enhancing Pretrained Model-based Continual Representation Learning via Guided Random Projection

通过引导随机投影增强基于预训练模型的持续表示学习

Ruilin Li, Heming Zou, Xiufeng Yan, Zheming Liang, Jie Yang, Chenliang Li, Xue Yang

机构 * Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) China University of Mining and Technology(中国矿业大学)

AI总结 本文提出SCL-MGSM方法,通过数据引导机制构建投影层,提升预训练模型在持续学习中的表现和数值稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19029 2026-03-20 cs.RO

ATG-MoE: Autoregressive trajectory generation with mixture-of-experts for assembly skill learning

ATG-MoE:基于混合专家的自主轨迹生成用于装配技能学习

Weihang Huang, Chaoran Zhang, Xiaoxin Deng, Hao Zhou, Zhaobo Xu, Shubo Cui, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Faculty of Engineering, Imperial College London(伦敦帝国理工学院工程学院)

AI总结 本文提出ATG-MoE,通过混合专家架构实现多技能整合,解决传统方法在多阶段设计和多技能整合能力上的不足,实验显示其在模拟和实际应用中均表现优异。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18979 2026-03-20 cs.RO cs.AI

PRIOR: Perceptive Learning for Humanoid Locomotion with Reference Gait Priors

PRIOR:基于参考步态先验的人形机器人感知学习

Chenxi Han, Shilu He, Yi Cheng, Linqi Ye, Houde Liu

机构 * Tsinghua University(清华大学) ZERITH Robotics(ZERITH机器人公司) Shanghai University(上海大学)

AI总结 PRIOR通过参数化步态生成器、GRU状态估计器和自适应足部奖励机制,实现了人形机器人在复杂地形中稳健行走,展示了高效且可复现的框架。

Comments https://prior-iros2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18891 2026-03-20 cs.CV cs.LG

PromptHub: Enhancing Multi-Prompt Visual In-Context Learning with Locality-Aware Fusion, Concentration and Alignment

PromptHub: 通过局部感知融合、集中和对齐增强多提示视觉上下文学习

Tianci Luo, Jinpeng Wang, Shiyu Qin, Niu Lian, Yan Feng, Bin Chen, Chun Yuan, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Meituan, Beijing(美团,北京)

AI总结 PromptHub通过局部感知融合、集中和对齐方法提升多提示视觉上下文学习性能,验证了其在多种视觉任务中的优越性及泛化能力。

Comments Accepted to ICLR 2026. 17 pages, 11 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18742 2026-03-20 cs.CV

6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models

6Bit-Diffusion:视频扩散模型推理时的混合精度量化

Rundong Su, Jintao Zhang, Zhihang Yuan, Haojie Duanmu, Jianfei Chen, Jun Zhu

机构 * Fudan University(复旦大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出了一种推理时的混合精度量化框架,通过动态分配NVFP4和INT8精度,提升视频扩散模型的效率与质量,实验显示在推理速度和内存占用上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18688 2026-03-20 cs.LG cs.CL

STEP: Scientific Time-Series Encoder Pretraining via Cross-Domain Distillation

STEP: 通过跨领域知识蒸馏实现科学时间序列的编码器预训练

Chen Zhang, Liwei Liu, Jun Tao, Xiaoyu Yang, Xuenan Xu, Kai Chen, Bowen Zhou, Wen Wu, Chao Zhang

机构 * Shanghai Aritificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Sichuan University(四川大学) University of Cambridge(剑桥大学)

AI总结 本文提出STEP框架,通过跨领域知识蒸馏整合多领域基础模型,构建统一的科学时间序列编码器,提升科学时间序列的表示学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18645 2026-03-20 cs.CV

MeInTime: Bridging Age Gap in Identity-Preserving Face Restoration

MeInTime:弥合年龄差距的恒定身份面部修复

Teer Song, Yue Zhang, Yu Tian, Ziyang Wang, Xianlin Zhang, Guixuan Zhang, Xuan Liu, Xueming Li, Yasen Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Department of Computer Science and Technology, Institute for AI, Tsinghua University(清华大学计算机科学与技术系,人工智能研究院) Minzu University of China(民族大学) Xiaomi Corporation(小米公司)

AI总结 MeInTime提出一种基于扩散的面部修复方法,通过引入年龄提示和新的注意力机制,实现跨年龄的恒定身份修复,提升了身份保真度和年龄一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18571 2026-03-20 cs.AI cs.CE q-bio.QM

CAPSUL: A Comprehensive Human Protein Benchmark for Subcellular Localization

CAPSUL:一个全面的人类蛋白质基准用于亚细胞定位

Yicheng Hu, Xinyu Lin, Shulin Li, Wenjie Wang, Fengbin Zhu, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 CAPSUL基准通过整合多样化3D结构表示和精细亚细胞定位注释,推动结构基模型在亚细胞定位任务中的应用,展示了结构特征的重要性,并通过高尔基体案例研究揭示了α-螺旋在定位中的关键作用。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18118 2026-03-20 cs.CV cs.AI cs.LG

Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

Insight-V++: 向多模态大语言模型实现高级长链视觉推理迈进

Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

机构 * S-Lab(S实验室) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文言) Tsinghua University(清华大学)

AI总结 本文提出Insight-V++框架,通过多代理视觉推理系统提升多模态大语言模型的长链视觉推理能力,采用ST-GRPO和J-GRPO算法增强空间时间推理和评估鲁棒性,实验显示在图像和视频推理任务中性能显著提升。

Comments arXiv admin note: text overlap with arXiv:2411.14432

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18114 2026-03-20 stat.ME cs.LG

Transfer Learning for Contextual Joint Assortment-Pricing under Cross-Market Heterogeneity

基于多市场异质性的上下文联合 assortment-定价转移学习

Elynn Chen, Xi Chen, Yi Zhang

机构 * New York University, Stern School of Business(纽约大学, Stern 商学院) Tsinghua University, School of Economics and Management(清华大学, 经济管理学院)

AI总结 本文研究了在多努利Logit选择模型下,利用带反馈的转移学习进行上下文联合 assortment-定价问题。通过结构化效用转移模型,提出TJAP框架,结合聚合后去偏估计与UCB策略,建立最小最大遗憾界,证明转移加速学习的同时需承担异质性适应成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18091 2026-03-20 cs.CV cs.RO

Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model

动作草稿与验证:一种用于视觉-语言-动作模型的自验证框架

Chen Zhao, Zhuoran Wang, Haoyang Li, Shifeng Bao, Guanlin Li, Youhe Feng, Yang Li, Jie Tang, Jing Zhang

机构 * Key Laboratory of Data Engineering(数据工程与知识工程重点实验室) Tsinghua University(清华大学) Beijing University of Posts(北京邮电大学) School of Information, Renmin University of China(中国人民大学信息学院)

AI总结 本文提出Action-Draft-and-Verify框架,结合扩散动作专家和VLM,通过单次前向传递选择最优动作片段,提升模拟和现实场景中的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17497 2026-03-20 cs.RO cs.SY eess.SY

From Optimizable to Interactable: Mixed Digital Twin-Empowered Testing of Vehicle-Infrastructure Cooperation Systems

从可优化到可交互:混合数字孪生赋能的车辆-基础设施协作系统测试

Jianghong Dong, Chunying Yang, Mengchi Cai, Chaoyi Chen, Qing Xu, Jianqiang Wang, Keqiang Li

机构 * School of Vehicle and Mobility, Tsinghua University, 100084 Beijing, China(车辆与移动技术学院,清华大学,北京,100084)

AI总结 本文提出L5级VICS测试框架IMPACT,通过引入人类交互生成高质量corner case,提升车辆-基础设施协作系统测试效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17024 2026-03-20 cs.CV cs.AI cs.CL

HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning

HopChain: 多跳数据合成用于通用视觉语言推理

Shenzhi Wang, Shixuan Liu, Jing Zhou, Chang Gao, Xiong-Hui Chen, Binghai Wang, An Yang, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司) LeapLab, Tsinghua University(清华大学跃迁实验室)

AI总结 本文提出HopChain框架,通过多跳视觉语言推理数据合成提升VLMs的通用推理能力,实验表明其在多个基准测试中显著提升性能。

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11101 2026-03-20 cs.RO cs.AI cs.DC

Thousand-GPU Large-Scale Training and Optimization Recipe for AI-Native Cloud Embodied Intelligence Infrastructure

千GPU大规模训练与优化方案用于AI原生云具身智能基础设施

Yongjian Guo, Yunxuan Ma, Haoran Sun, Zhong Guan, Shuai Di, Jing Long, Wanting Xu, Xiaodong Bai, Wen Huang, Yucheng Guo, Chen Zhou, Qiming Yang, Mingxi Luo, Tianyun Zhao, Hedan Yang, Song Wang, Xiaomeng Tian, Xiaolong Xiang, Zhen Sun, Yu Wei, Luqiao Wang, Yuzhen Li, Chenfeng Gu, Junwu Xiong, Yicheng Gong

机构 * AI Infra Team at JDT(JDT人工智能基础设施团队) Tsinghua University(清华大学) Peking University(北京大学) Tianjin University(天津大学) Beihang University(北洋大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出一种基于LeRobot框架的千GPU分布式训练平台,通过优化数据流程、训练效率和基础设施,实现具身智能模型训练速度提升40倍,推动下一代自主智能机器人发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17869 2026-03-20 cs.LG

Modeling Inverse Ellipsometry Problem via Flow Matching with a Large-Scale Dataset

通过大规模数据集进行逆椭圆度测量问题的建模:流匹配

Yiming Ma, Jianzhi Teng, Xinjie Li, Xin Sun, Zhiyong Wang, Yuzhou Song, Lionel Z. Wang, Bin Chen

机构 * Chongqing Research Institute of Harbin Institute of Technology(哈尔滨工业大学重庆研究院) The Hong Kong Polytechnic University(香港理工大学) The Pennsylvania State University(宾夕法尼亚州立大学) Tianjin University(天津大学) Tsinghua University(清华大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出EllipBench数据集和Decoupled Conditional Flow Matching框架,解决逆椭圆度测量问题中光常数和膜厚重建的物理不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏