arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-03-25 至 2026-03-25 共收录 22
2603.23497 2026-03-25 cs.CV

WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG

WildWorld: 一个大规模动态世界建模数据集,包含动作和显式状态,面向生成式ARPG

Zhen Li, Zian Meng, Shuwei Shi, Wenshuo Peng, Yuwei Wu, Bo Zheng, Chuanhao Li, Kaipeng Zhang

机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,Shanda AI东京研究院) Beijing Institute of Technology(北京理工大学) Shanghai Innovation Institute(上海创新研究院) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Tsinghua University(清华大学)

AI总结 本文提出WildWorld数据集,通过AAA动作角色扮演游戏Monster Hunter: Wilds自动收集,包含1.08亿帧视频和450多种动作,包含骨骼、世界状态、相机姿态和深度图标注,用于评估动作跟随和状态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16740 2026-03-25 cs.CV

Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation

面向任务的数据合成与控制-校正采样用于遥感语义分割

Yunkai Yang, Yudong Zhang, Kunquan Zhang, Jinxiao Zhang, Xinying Chen, Haohuan Fu, Runmin Dong

机构 * Sun Yat-Sen University(中山大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出TODSynth框架,结合多模态扩散变换器和任务反馈驱动的采样策略,提升遥感语义分割数据合成效果,尤其在少样本和复杂场景中表现优异。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23246 2026-03-25 cs.CV

GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models

GO-Renderer: 基于3D感知的可控视频扩散模型生成物体渲染

Zekai Gu, Shuoxuan Feng, Yansong Wang, Hanzhuo Huang, Zhongshuo Du, Chengfeng Zhao, Chengwei Ren, Peng Wang, Yuan Liu

机构 * HKUST(香港科技大学) VAST(中国航空无线电电子研究所) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) ShanghaiTech University(上海交通大学)

AI总结 本文提出GO-Renderer框架,结合重建的3D模型引导视频生成模型,实现高质物体在任意视角和光照下的渲染,无需显式建模复杂材质和光照。

Comments Project page: https://igl-hkust.github.io/GO-Renderer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22915 2026-03-25 cs.CV

When AVSR Meets Video Conferencing: Dataset, Degradation, and the Hidden Mechanism Behind Performance Collapse

当AVSR遇见视频会议:数据集、退化及性能崩溃的隐藏机制

Yihuan Huang, Jun Xue, Liu Jiajun, Daixian Li, Tong Zhang, Zhuolin Yi, Yanzhen Ren, Kai Li

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education(航空航天信息安全部与可信计算教育部重点实验室) School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全科学与工程学院) Tsinghua University(清华大学)

AI总结 本文系统评估了主流视频会议平台上的最新AVSR模型,发现传输失真和人类超表达导致性能退化,通过构建MLD-VC数据集揭示语音增强算法引起分布偏移,细调模型可降低17.5%的CER。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22874 2026-03-25 cs.CV

Template-Based Feature Aggregation Network for Industrial Anomaly Detection

基于模板的特征聚合网络用于工业异常检测

Wei Luo, Haiming Yao, Wenyong Yu

机构 * State Key Laboratory of Precision Measurement Technology and Instruments(精密测量技术与仪器国家重点实验室) Tsinghua University(清华大学) State Key Laboratory of Digital Manufacturing Equipment and Technology(数字制造装备与技术国家重点实验室) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出TFA-Net,通过模板特征聚合过滤异常特征,提升工业异常检测性能,实现高效率和实时性。

Comments Accepted by Engineering Applications of Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22861 2026-03-25 cs.CV

A Feature Shuffling and Restoration Strategy for Universal Unsupervised Anomaly Detection

一种用于通用无监督异常检测的特征洗牌与恢复策略

Wei Luo, Haiming Yao, Zhenfeng Qiang, Xiaotian Zhang, Weihang Zhang

机构 * State Key Laboratory of Precision Measurement Technology and Instruments(精密测量技术与仪器国家重点实验室) Tsinghua University(清华大学) School of Medical Technology(医学技术学院) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出FSR框架,通过多尺度特征洗牌与恢复缓解相同捷径问题,提升模型在不同场景下的通用性和效率。

Comments Accepted by Knowledge-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22840 2026-03-25 cs.CV cs.AI

URA-Net: Uncertainty-Integrated Anomaly Perception and Restoration Attention Network for Unsupervised Anomaly Detection

URA-Net:一种集成不确定性异常感知与恢复注意力网络用于无监督异常检测

Wei Luo, Peng Xing, Yunkang Cao, Haiming Yao, Weiming Shen, Zechao Li

机构 * State Key Laboratory of Precision Measurement Technology and Instruments, Department of Precision Instrument, Tsinghua University(精密测量技术与仪器国家重点实验室,清华大学精密仪器系) State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(智能制造装备与技术国家重点实验室,华中科技大学) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

AI总结 URA-Net通过引入不确定性集成的异常感知模块和恢复注意力机制,有效解决传统方法在异常检测中的过泛化问题,提升检测性能。

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22796 2026-03-25 cs.CV cs.AI cs.RO

PhotoAgent: A Robotic Photographer with Spatial and Aesthetic Understanding

PhotoAgent:一种具有空间与审美理解的机器人摄影师

Lirong Che, Zhenfeng Gan, Yanbo Chen, Junbo Tan, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学)

AI总结 PhotoAgent通过整合大多模态模型与新型控制范式,将主观审美目标转化为几何约束,利用内部视觉模拟实现快速收敛于高质量图像结果。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22728 2026-03-25 cs.SD eess.AS

The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models

2026年国际语音处理大会大型音频语言模型音频编码能力挑战

Heinrich Dinkel, Jiahao Zhou, Guanbo Wang, Yadong Niu, Junbo Zhang, Yufeng Hao, Ying Liu, Ke Li, Wenwu Wang, Zhiyong Wu, Jian Luan

机构 * MiLM Plus, Xiaomi Inc., Beijing, China(小米公司,北京) DataoceanAI Inc., USA(DataoceanAI公司,美国) Centre for Vision Speech and Signal Processing, University of Surrey, Guildford, UK(视觉语音与信号处理中心, Surrey大学, Guildford,英国) Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(深圳国际研究生院,清华大学,深圳,中国)

AI总结 本文提出Interspeech 2026音频编码能力挑战,旨在评估和提升预训练音频编码器在大型音频语言模型中的性能,通过统一的生成评估框架XARES-LLM,评估编码器在多种下游任务中的表现。

Comments Interspeech 2026 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22701 2026-03-25 cs.CV

TimeWeaver: Age-Consistent Reference-Based Face Restoration with Identity Preservation

TimeWeaver: 基于参考的年龄一致面部修复与身份保持

Teer Song, Yue Zhang, Yu Tian, Ziyang Wang, Xianlin Zhang, Guixuan Zhang, Xuan Liu, Xueming Li, Yasen Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Minzu University of China(民族大学) Xiaomi Corporation(小米公司)

AI总结 TimeWeaver通过分离身份与年龄条件,在训练和推理中实现年龄一致的面部修复,支持跨年龄参考,提升视觉质量与身份保持性。

Comments This is an improved version based on arXiv:2603.18645

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21289 2026-03-25 cs.CV cs.AI

When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning

当模型自我评判:多模态推理的无监督自进化

Zhengxian Wu, Kai Shi, Chuanrui Zhang, Zirui Liao, Jun Yang, Ni Yang, Qiuying Peng, Luyuan Zhang, Hangrui Xu, Tianhuang Su, Zhenyu Yang, Haonan Lu, Haoqian Wang

机构 * OPPO AI Center(OPPO人工智能中心) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Hefei University of Technology(合肥工业大学)

AI总结 本文提出一种无监督自进化框架,通过自一致性信号和动态调节机制,在无需人工标注或外部奖励模型的情况下提升多模态推理性能。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08174 2026-03-25 cs.CV

MERLIN: Building Low-SNR Robust Multimodal LLMs for Electromagnetic Signals

MERLIN:构建低信噪比鲁棒的多模态大语言模型以电磁信号

Junyu Shen, Zhendong She, Chenghanyu Zhang, Yuchuang Sun, Luqing Luo, Dingwei Tan, Zonghao Guo, Bo Guo, Zehua Han, Wupeng Xie, Yaxin Mu, Peng Zhang, Peipei Li, Fengxiang Wang, Yangang Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所) HKUST (Guangzhou)(香港科技大学(广州)) National University of Defense Technology(国防科技大学) Beihang University(北航) Beijing Information Science and Technology University(北京信息科技大学) Artificial Intelligence Institute of China Electronics Technology Group Corporation(中国电子科技集团人工智能研究院)

AI总结 本文提出MERLIN框架,通过构建EM-100k数据集和EM-Bench基准,解决电磁信号多模态大语言模型在低信噪比环境下的鲁棒性问题,验证了方法在EM-Bench上的领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04951 2026-03-25 cs.AI

Retrieval-Augmented Generation with Covariate Time Series

增强检索生成与协变量时间序列

Kenny Ye Liang, Zhongyi Pei, Huan Zhang, Yuhui Liu, Shaoxu Song, Jianmin Wang

机构 * Tsinghua University(清华大学)

AI总结 本文提出RAG4CTS框架,解决时间序列基础模型在数据稀缺、短暂序列和协变量耦合动态下的预测问题,通过层级时间序列知识库和双阶段加权检索机制提升预测精度。

Comments 12 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01976 2026-03-25 cs.LG cs.AI cs.CV

FlyPrompt: Brain-Inspired Random-Expanded Routing with Temporal-Ensemble Experts for General Continual Learning

FlyPrompt: 基于大脑启发的随机扩展路由与时间-集成专家的通用持续学习

Hongwei Yan, Guanglong Sun, Kanglei Zhou, Qian Li, Liyuan Wang, Yi Zhong

机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research, Tsinghua University(生命科学学院,IDG/麦克格雷文脑科学研究院,清华大学) Department of Psychological and Cognitive Sciences, Tsinghua University(心理学与认知科学系,清华大学) School of Medicine, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区医学学院)

AI总结 FlyPrompt通过分解通用持续学习为专家路由和专家能力提升两个子问题,提出了一种脑启发框架,利用随机扩展分析路由器和时间集成输出头,提升持续学习性能,实验显示在CIFAR-100、ImageNet-R和CUB-200上分别取得11.23%、12.43%和7.62%的提升。

Comments 34 pages. Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25066 2026-03-25 cs.CV

From Inpainting to Editing: Unlocking Robust Mask-Free Visual Dubbing via Generative Bootstrapping

从修复到编辑:通过生成性自举解锁鲁棒的无掩膜视觉配音

Xu He, Haoxian Zhang, Hejia Chen, Changyuan Zheng, Liyang Chen, Songlin Tang, Jiehui Huang, Xiaoqiang Liu, Pengfei Wan, Zhiyong Wu

机构 * Tsinghua University(清华大学) Hong Kong University of Science(香港科学大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出X-Dub框架,通过生成性自举实现无掩膜视觉配音,解决传统掩膜修复方法在时空上下文破坏和鲁棒性差的问题,提升唇形同步和视觉质量。

Comments Project Page: https://github.com/KlingAIResearch/X-Dub

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19703 2026-03-25 eess.AS cs.IR cs.LG cs.MM cs.SD

ASK: Adaptive Self-improving Knowledge Framework for Audio Text Retrieval

ASK:适应性自改进知识框架用于音频文本检索

Siyuan Fu, Xuchen Guo, Mingjun Liu, Hongxiang Li, Boyin Tan, Gongxi Zhu, Xianwei Zhuang, Jinghan Ru, Yuxin Xie, Yuguo Yin

机构 * University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 ASK框架通过多粒度知识注入和动态精修策略解决音频文本检索中的梯度局部瓶颈和表示漂移不匹配问题,提升稀有长尾概念学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18933 2026-03-25 cs.CV cs.RO

Point What You Mean: Visually Grounded Instruction Policy

指出你的意图:基于视觉的指令策略

Hang Yu, Juntu Zhao, Yufeng Liu, Kaiyu Li, Cheng Ma, Di Zhang, Yingdong Hu, Guang Chen, Junyuan Xie, Junliang Guo, Junqiao Zhao, Yang Gao

机构 * Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Spirit AI Tsinghua University(清华大学)

AI总结 本文提出Point-VLA,通过结合视觉提示提升物体指称能力,在复杂场景中实现更精准的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22815 2026-03-25 cs.CV

Captain Safari: A World Engine with Pose-Aligned 3D Memory

Captain Safari: 一种具有姿态对齐3D记忆的世界引擎

Yu-Cheng Chou, Xingrui Wang, Yitong Li, Jiahao Wang, Hanting Liu, Cihang Xie, Alan Yuille, Junfei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Tsinghua University(清华大学) UC Santa Cruz(加州大学圣克ruz分校)

AI总结 本文提出Captain Safari,一种基于姿态条件的世界引擎,通过持久化世界记忆生成视频,提升了复杂场景下的3D一致性与轨迹跟踪能力,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16105 2026-03-25 cs.LG

Data-Efficient and Robust Trajectory Generation through Pathlet Dictionary Learning

通过路径片段字典学习实现高效且鲁棒的轨迹生成

Yuanbo Tang, Yan Tang, Zixuan Zhang, Zihui Zhao, Yang Li

机构 * Tsinghua University International Campus Phase I(清华大学国际校区第一期) College of Software, Northeastern University(东北大学软件学院)

AI总结 本文提出基于路径片段表示的深度生成模型,通过学习轨迹片段字典提升轨迹生成的鲁棒性和可解释性,实验显示在噪声数据下效果优于基线模型,且在效率上具有显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03334 2026-03-25 cs.CV

UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

UniAVGen:基于非对称跨模态交互的统一音频视频生成

Guozhen Zhang, Zixiang Zhou, Teng Hu, Ziqiao Peng, Youliang Zhang, Yi Chen, Yuan Zhou, Qinglin Lu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Tencent Hunyuan(腾讯文英) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 UniAVGen通过非对称跨模态交互机制和双分支联合合成架构,实现了音频视频的统一生成,提升同步精度和语义一致性,实验表明其在较少训练样本下表现更优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05656 2026-03-25 cs.RO cs.MA

Small-Scale Testbeds for Connected and Automated Vehicles and Robot Swarms: Challenges and a Roadmap

连接与自动化车辆及机器人群的小规模测试平台:挑战与路线图

Jianye Xu, Johannes Betz, Armin Mokhtarian, Archak Mittal, Mengchi Cai, Rahul Mangharam, Omar M. Shehata, Catherine M. Elias, Jan-Nico Zaech, Patrick Scheffe, Felix Jahncke, Sangeet Sankaramangalam Ulhas, Kaj Munhoz Arfvidsson, Bassam Alrifaee

机构 * RWTH Aachen University(亚琛工业大学) Indian Institute of Technology Bombay(印度班加罗尔理工学院) Tsinghua University(清华大学) the German University in Cairo(埃及亚历山大大学) INSAIT KTH Royal Institute of Technology(皇家理工学院) KU Leuven(鲁汶大学)

AI总结 本文提出了一条路线图,以解决连接与自动化车辆及机器人群小规模测试平台当前的挑战,涵盖提升可及性与多样性、共享最佳实践及通过抽象层连接测试平台。

Comments Published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19843 2026-03-25 eess.SY cs.LG cs.SY

Artificial intelligence for partial differential equations in computational mechanics: A review

计算力学中的偏微分方程人工智能:综述

Yizheng Wang, Jinshuai Bai, Zhongya Lin, Qimin Wang, Cosmin Anitescu, Jia Sun, Mohammad Sadegh Eshaghi, Yuantong Gu, Xi-Qiao Feng, Xiaoying Zhuang, Timon Rabczuk, Yinghua Liu

机构 * Department of Engineering Mechanics, Tsinghua University, Beijing 100084, China(清华大学工程力学系) Simulation Technology, Institute of Photonics, Leibniz University Hannover, Hannover 30167, Germany(汉诺威莱布尼茨大学光子研究所仿真技术部) Drilling Mechanical Department, CNPC Engineering Technology RD Company Limited, Beijing 102206, China(中石油工程科技研发有限公司钻探机械部) School of Mechanical, Medical and Process Engineering, Queensland University of Technology, Brisbane, QLD 4000, Australia(昆士兰科技大学机械、医疗与加工工程学院) ARC Industrial Transformation Training Centre—Joint Biomechanics, Queensland University of Technology, Brisbane, QLD 4000, Australia(昆士兰科技大学 ARC 工业转型培训中心—联合生物力学)

AI总结 本文综述了人工智能求解偏微分方程在计算力学中的应用,包括固体力学、流体力学和生物力学,总结了基于物理信息神经网络、深度能量方法等算法及理论贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏