arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-03-24 至 2026-03-24 共收录 23
2603.22264 2026-03-24 cs.RO

UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos

UniDex:一种机器人基础套件,用于从第一人称人类视频中实现通用灵巧手控制

Gu Zhang, Qicheng Xu, Haozhe Zhang, Jianhan Ma, Long He, Yiming Bao, Zeyu Ping, Zhecheng Yuan, Chenhao Lu, Chengbo Yuan, Tianhai Liang, Xiaoyu Tian, Maanping Shao, Feihong Zhang, Mingyu Ding, Yang Gao, Hao Zhao, Hang Zhao, Huazhe Xu

机构 * Tsinghua University(清华大学) Shanghai Qizhi Institute(上海启智研究院) Sun Yat-sen University(中山大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出UniDex,通过机器人中心数据集、统一视觉-语言-动作策略和实用人类数据采集设置,实现通用灵巧手控制。UniDex-VLA在两项不同手的挑战性工具使用任务中达到81%的平均任务进度,优于现有VLA基线。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21925 2026-03-24 cs.AI

Guideline-grounded retrieval-augmented generation for ophthalmic clinical decision support

基于指南的检索增强生成用于眼科临床决策支持

Shuying Chen, Sen Cui, Zhong Cao

机构 * University of International Business and Economics(国际商务经济大学) Tsinghua University(清华大学) Heidelberg Institute of Global Health(海德堡全球健康研究院)

AI总结 本文提出Oph-Guid-RAG系统,通过多模态视觉RAG方法提升眼科临床问答与决策支持,通过可控检索框架和多模态推理提升证据基础和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21669 2026-03-24 cs.RO cs.CV

PRM-as-a-Judge: A Dense Evaluation Paradigm for Fine-Grained Robotic Auditing

PRM-as-a-Judge:细粒度机器人审计的密集评估范式

Yuheng Ji, Yuyang Liu, Huajie Tan, Xuchuan Huang, Fanding Huang, Yijie Xu, Cheng Chi, Yuting Zhao, Huaihai Lyu, Peterson Co, Mingyu Cao, Qiongyu Zhang, Zhe Li, Enshen Zhou, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang, Xiaolong Zheng

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学系,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) University of Sydney(悉尼大学) Beihang University(北航大学)

AI总结 本文提出PRM-as-a-Judge方法,通过过程奖励模型对轨迹视频进行密集评估,引入OPD指标系统,验证了宏一致性与微分辨率特性,揭示了主流策略在长周期任务中的行为特征与失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21577 2026-03-24 cs.AI

Mind over Space: Can Multimodal Large Language Models Mentally Navigate?

心灵超越空间:多模态大语言模型能否进行心理导航?

Qihui Zhu, Shouwei Ruan, Xiao Yang, Hao Jiang, Yao Huang, Shiji Zhao, Hanwei Fan, Hang Su, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学计算机科学与技术系) School of Automation Science and Electrical Engineering , Beihang University(北京航空航天大学自动化科学与电气工程学院) college of AI, Tsinghua University(清华大学人工智能学院) Department of Computer Science and Technology , Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出Video2Mental基准测试,评估多模态大语言模型的空间导航能力,发现标准预训练模型无法自然生成空间表示,NavMind通过显式认知地图提升导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21574 2026-03-24 cs.AI

Adaptive Robust Estimator for Multi-Agent Reinforcement Learning

自适应稳健估计器用于多智能体强化学习

Zhongyi Li, Wan Tian, Jingyu Chen, Kangyao Huang, Huiming Zhang, Hui Yang, Tao Ren, Jinyang Jiang, Yijie Peng, Yikun Ban, Fuzhen Zhuang

机构 * Beihang University(北京理工大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

AI总结 本文提出自适应稳健估计器和双智能体回答-批判-重写框架,解决多智能体协作中的信用分配和奖励噪声问题,提升训练稳定性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16666 2026-03-24 cs.CV cs.AI

Fast-WAM: Do World Action Models Need Test-time Future Imagination?

Fast-WAM: 世界动作模型是否需要测试时的未来想象?

Tianyuan Yuan, Zibin Dong, Yicheng Liu, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学智能技术学院) Galaxea AI

AI总结 本文探讨了世界动作模型是否需要在测试时进行显式未来想象,通过提出Fast-WAM架构,发现训练时的视频共训练对性能影响更大,且Fast-WAM在模拟和现实任务中表现出色,实现实时运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19735 2026-03-24 cs.LG

Improving Fairness of Large Language Model-Based ICU Mortality Prediction via Case-Based Prompting

通过基于案例的提示提升基于大语言模型的ICU死亡预测公平性

Gangxiong Zhang, Yongchao Long, Yuxi Zhou, Yong Zhang, Shenda Hong

机构 * School of Computer Science and Engineering, Tianjin University of Technology, Tianjin, China(天津理工大学计算机科学与工程学院) Institute for Artificial Intelligence, Peking University, Beijing, China(北京大学人工智能研究院) DCST, BNRist, RIIT, Institute of Internet Industry, Tsinghua University, Beijing, China(清华大学信息产业研究院) National Institute of Health Data Science, Peking University, Beijing, China(北京大学健康数据科学国家研究院)

AI总结 本文提出一种临床适应性提示框架,通过整合去偏策略和历史误判案例,提升ICU死亡预测的公平性和性能,实验显示AUROC和AUPRC显著提升,预测差异大幅减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16523 2026-03-24 cs.CV cs.AI

TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models

TTP: 视觉-语言模型上的对抗检测与鲁棒适应的测试时填充

Zhiwei Li, Yitian Pang, Weining Wang, Zhenan Sun, Qi Li

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(神经网络与模式识别实验室及自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出TTP框架,通过测试时填充实现对抗检测与鲁棒适应,提升视觉-语言模型在对抗攻击下的鲁棒性而不影响清洁准确性。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05905 2026-03-24 cs.CV

SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations

SCAIL:通过上下文学习3D一致姿态表示实现工作室级角色动画

Wenhao Yan, Sheng Ye, Zhuoyi Yang, Jiayan Teng, ZhenHui Dong, Kairui Wen, Xiaotao Gu, Yong-Jin Liu, Jie Tang

机构 * Tsinghua University(清华大学)

AI总结 SCAIL通过创新的3D姿态表示和全上下文姿态注入机制,提升角色动画的结构保真度和时间一致性,实现工作室级控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09935 2026-03-24 cs.CV

LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning

LEO-VL:面向可扩展3D视觉-语言学习的高效场景表示

Jiangyong Huang, Xiaojian Ma, Xiongkun Linghu, Junchao He, Qing Li, Song-Chun Zhu, Yixin Chen, Baoxiong Jia, Siyuan Huang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出LEO-VL,一种基于高效场景表示CFG的3D视觉-语言模型,通过改进训练数据和引入SceneDPO提升鲁棒性,在多个3D-VL基准测试中取得最佳性能。

Comments Project page: https://leo-vl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23667 2026-03-24 cs.AI

Formula-R1: Incentivizing LLM Reasoning over Complex Tables with Numerical Computation via Formula-Driven Reinforcement Learning

Formula-R1:通过公式驱动强化学习激励LLM对复杂表格进行数值计算的推理

Lang Cao, Jingxian Xu, Hanbing Liu, Jinyu Wang, Mengyu Zhou, Haoyu Dong, Shi Han, Dongmei Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nankai University(南开大学) Tsinghua University(清华大学) Shandong University(山东大学) Microsoft Research(微软研究院)

AI总结 本文提出Formula-R1,通过公式驱动强化学习框架提升LLM对复杂表格的推理能力,尤其在多步数值计算任务中表现优异,且优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21299 2026-03-24 cs.CV

Identity-Consistent Video Generation under Large Facial-Angle Variations

在大面部角度变化下实现身份一致的视频生成

Bin Hu, Zipeng Qi, Guoxi Huang, Zunnan Xu, Ruicheng Zhang, Chongjie Ye, Jun Zhou, Xiu Li, Jingdong Wang

机构 * Tsinghua University(清华大学) Baidu Inc., China(百度公司) University of Bristol(布里斯托大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出Mv²ID框架,通过区域遮蔽训练策略和参考解耦RoPE机制,解决大角度变化下的身份一致性与自然运动平衡问题,并构建大规模数据集和评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21104 2026-03-24 cs.RO cs.CV

CounterScene: Counterfactual Causal Reasoning in Generative World Models for Safety-Critical Closed-Loop Evaluation

CounterScene: 生成世界模型中的反事实因果推理用于安全关键闭环评估

Bowen Jing, Ruiyang Hao, Weitao Zhou, Haibao Yu

机构 * Tuojing Intelligence(途京智能) King's College London(伦敦大学国王学院) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

AI总结 CounterScene通过结构化反事实推理生成安全关键驾驶场景,通过因果对抗代理识别和冲突感知交互世界模型,提升长周期碰撞率并保持轨迹真实性。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20842 2026-03-24 cs.LG

A Knowledge-Informed Pretrained Model for Causal Discovery

基于知识的因果发现预训练模型

Wenbo Xu, Yue He, Yunhai Wang, Xingxuan Zhang, Kun Kuang, Yueguo Chen, Peng Cui

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Zhejiang University(浙江大学)

AI总结 本文提出一种整合弱先验知识的因果发现预训练模型,通过双源编码器-解码器架构和多样预训练数据集,提升模型在不同先验强度下的适应能力,实验显示在分布内、分布外及现实数据集上均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20611 2026-03-24 cs.CV

GaussianPile: A Unified Sparse Gaussian Splatting Framework for Slice-based Volumetric Reconstruction

GaussianPile:一种统一的稀疏高斯散射框架用于基于切片的体积分离重建

Di Kong, Yikai Wang, Wenjie Guo, Yifan Bu, Boya Zhang, Yuexin Duan, Xiawei Yue, Wenbiao Du, Yiman Zhong, Yuwen Chen, Cheng Ma

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Beijing Normal University(北京师范大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Beihang University(北航)

AI总结 本文提出GaussianPile框架,结合3D高斯散射与成像系统感知的聚焦模型,通过切片感知堆叠策略、可微投影算子和紧凑编码优化流程,实现高效体积分离重建,提升压缩效率与诊断精度。

Comments Accepted by IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11721 2026-03-24 cs.AI

When OpenClaw Meets Hospital: Toward an Agentic Operating System for Dynamic Clinical Workflows

当OpenClaw遇见医院:迈向动态临床工作流的智能操作系统

Wenxian Yang, Hanzheng Qiu, Bangqun Zhang, Chengquan Li, Zhiyong Huang, Xiaobin Feng, Rongshan Yu, Jiahong Dong

机构 * Independent Researcher(独立研究者) National Institute for Data Science in Health and Medicine, Xiamen University, Xiamen, China(健康医学数据科学国家研究院,厦门大学,厦门,中国) Yue’erwan Internet Hospital Co., Ltd.(悦尔湾互联网医院有限公司) School of Biomedical Engineering, Tsinghua University, Beijing, China(生物医学工程学院,清华大学,北京,中国) National University of Singapore, Singapore(新加坡国立大学) Yttrium-90 Precision Interventional Radiotherapy Center of Liver Cancer, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝癌钇-90精准介入放射治疗中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国) Hepatobiliary and Pancreatic Centre, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝胆胰中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国)

AI总结 本文提出一种适应医院环境的LLM代理架构,通过受限执行环境、文档导向交互模型、分页索引内存架构和可组合医疗技能库,实现临床工作流的协调,保障安全、透明和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10679 2026-03-24 cs.AI cs.LG

Are Your Reasoning Models Reasoning or Guessing? A Mechanistic Analysis of Hierarchical Reasoning Models

您的推理模型是推理还是猜测?对分层推理模型的机理分析

Zirui Ren, Ziming Liu

机构 * Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院) Department of Physics, Tsinghua University, Beijing, China(清华大学物理系) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院)

AI总结 研究揭示分层推理模型在简单谜题中易失效,存在猜测动态和多固定点问题,提出数据增强、输入扰动和模型自举策略提升Sudoku-Extreme准确率至96.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24845 2026-03-24 cs.RO

ArtiSG: Functional 3D Scene Graph Construction via Human-demonstrated Articulated Objects Manipulation

ArtiSG: 通过人类示范的可动物体操作构建功能3D场景图

Qiuyi Gu, Yuze Sheng, Jincheng Yu, Jiahao Tang, Xiaolong Shan, Zhaoyang Shen, Tinghao Yi, Xiaodan Liang, Xinlei Chen, Yu Wang

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Openmind Pengcheng Laboratory(鹏城实验室)

AI总结 ArtiSG通过编码人类示范到结构化机器人记忆中,构建功能3D场景图,解决现有方法在可动物体操作信息获取上的不足,提升机器人在真实环境中的任务执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16474 2026-03-24 cs.CV

Foresight Diffusion: Improving Sampling Consistency in Predictive Diffusion Models

前瞻性扩散:改进预测扩散模型中的采样一致性

Yu Zhang, Xingzhuo Guo, Haoran Xu, Jialong Wu, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院,BNRist,清华大学)

AI总结 本文提出Foresight Diffusion,通过解耦条件理解和目标去噪提升预测扩散模型的采样一致性,实验显示其在机器人视频预测和科学时空预测中表现优异。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15340 2026-03-24 cs.LG

SSR: Speculative Parallel Scaling Reasoning in Test-time

SSR:测试时的推测并行扩展推理

Yuanlin Chu, Bo Wang, Xiang Liu, Hong Chen, Aiwei Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tsinghua University(清华大学)

AI总结 SSR提出一种无需训练的框架,通过引入分步推测解码加速推理而不牺牲正确性,提升数学推理任务的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11289 2026-03-24 cs.CV cs.MM

UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer

UniAnimate-DiT:基于大规模视频扩散变换器的人像图像动画

Xiang Wang, Shiwei Zhang, Longxiang Tang, Yingya Zhang, Changxin Gao, Yuehuan Wang, Nong Sang

机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学图像处理与智能控制重点实验室,人工智能与自动化学院) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

AI总结 本文提出UniAnimate-DiT,利用Wan2.1模型实现一致的人像动画,通过LoRA技术优化参数,设计轻量姿态编码器并整合参考外观,实验表明其能生成高质量且时间一致的动画,支持从480p到720P的超分辨率。

Comments The training and inference code (based on Wan2.1) is available at https://github.com/ali-vilab/UniAnimate-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13859 2026-03-24 cs.CV

Accurate Quantization for Gait Representation Learning

精确的量化方法用于姿态表示学习

S. Tian, H. Gao, G. Hong, S. Wang, J. Wang, X. Yu, S. Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) Tsinghua University(清华大学) The University of Queensland(昆士兰大学) Beijing Jiaotong University(北京交通大学)

AI总结 本文提出了一种可微的软量化器以提升姿态表示学习的精度,通过两阶段训练策略和类间距离引导校准策略,有效解决了二值化输入下的收敛问题,实验验证了方法的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20310 2026-03-24 cs.CV cs.GR

GraphiContact: Pose-aware Human-Scene Robust Contact Perception for Interactive Systems

GraphiContact: 人体-场景鲁棒接触感知用于交互系统

Xiaojian Lin, Yaomin Shen, Junyuan Ma, Yujie Sun, Chengqing Bu, Wenxin Zhang, Zongzheng Zhang, Hao Fei, Lei Jin, Hao Zhao

机构 * Tsinghua University, China(清华大学, 中国) XR System Application Research Center, Nanchang Research Institute, Zhejiang University, China(浙江大学南昌研究院XR系统应用研究中心, 中国) Beijing University of Posts and Telecommunications, China(北京邮电大学, 中国) University of Chinese Academy of Sciences, China(中国科学院大学, 中国) National University of Singapore, Singapore(新加坡国立大学, 新加坡)

AI总结 本文提出GraphiContact框架,结合单图像3D人体网格重建,利用重建的体几何结构进行接触推理,通过引入SIMU训练策略提升鲁棒性,在五个基准数据集上实现了接触预测和3D人体重建的提升。

Comments 15 pages, 9 figures, Accepted at ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏