arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4536
2605.14772 2026-05-15 cs.CV cs.GR cs.LG

BioHuman: Learning Biomechanical Human Representations from Video

BioHuman: 从视频中学习生物力学人体表示

Yujun Huo, He Zhang, Chentao Song, Honglin Song, Zongyu Zuo, Tao Yu

机构 * Beihang University(北航) Tsinghua University(清华大学)

AI总结 本文提出BioHuman模型,通过视频输入联合预测人体运动和肌肉激活,建立视觉观测与内部生物力学状态的联系,展示了在多样化的主体和动作上准确重建运动和肌肉活动的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14750 2026-05-15 cs.CR cs.AI

EVA: Editing for Versatile Alignment against Jailbreaks

EVA:针对对抗性攻击的多功能对齐编辑

Yi Wang, Hongye Qiu, Yue Xu, Sibei Yang, Zhan Qin, Minlie Huang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) Sun Yat-sen University(中山大学) State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Tsinghua University(清华大学)

AI总结 本文提出EVA框架,通过直接模型编辑提升安全对齐,有效中和有害行为,实验显示其在LLMs和VLMs中对抗攻击效果优于现有方法。

Comments IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14733 2026-05-15 cs.CV

Video-Zero: Self-Evolution Video Understanding

Video-Zero: 自主进化视频理解

Ruixu Zhang, Deyi Ji, Lanyun Zhu, Xuanyi Liu, Yuxin Meng, Ruihang Chu, Yujiu Yang

机构 * Tsinghua University(清华大学) Tencent(腾讯) Tongji University(同济大学) Peking University(北京大学)

AI总结 本文提出Video-Zero框架,通过无标注的Questioner-Solver共进化机制,聚焦时间局部证据,提升视频理解的自进化能力,验证了证据中心自进化方法的有效性与迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14685 2026-05-15 cs.LG cond-mat.stat-mech cs.AI

Spontaneous symmetry breaking and Goldstone modes for deep information propagation

自发对称破缺与深度信息传播中的Goldstone模式

Nabil Iqbal, T. Anderson Keller, Yue Song, Takeru Miyato, Max Welling

机构 * Dept. of Mathematical Sciences, Durham University(杜伦大学数学科学系) Kempner Institute, Harvard University(哈佛大学凯普纳研究所) AMLab, University of Amsterdam(阿姆斯特丹大学AMLab) College of AI, Tsinghua University(清华大学人工智能学院) University of Tübingen, Tübingen(图宾根大学) AI Center(人工智能中心) CuspAI

AI总结 研究深度神经网络中因连续对称自发破缺而产生的Goldstone-like自由度,证明其能实现稳定信息传播,提升训练效率和长期记忆性能。

Comments 28 pages. Code at https://github.com/nabiliqbal/ssb-goldstone-deep-info-prop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14632 2026-05-15 cs.LG stat.AP

DRL-STAF: A Deep Reinforcement Learning Framework for State-Aware Forecasting of Complex Multivariate Hidden Markov Processes

DRL-STAF:一种用于复杂多变量隐马尔可夫过程状态感知预测的深度强化学习框架

Manrui Jiang, Jingru Huang, Yong Chen, Chen Zhang

机构 * Department of Industrial Engineering, Tsinghua University, Beijing 100084, China(清华大学工业工程系) Department of Industrial and Systems Engineering, University of Iowa, Iowa City, IA 52242, USA(爱荷华大学工业与系统工程系)

AI总结 本文提出DRL-STAF框架,通过深度强化学习联合预测下一步观测并估计对应的隐状态,解决多变量隐马尔可夫过程中的非线性和非平稳性问题,优于HMM变体和深度学习模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14621 2026-05-15 cs.CV cs.AI cs.CL

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

我们真的需要外部工具来缓解幻觉吗?SIRA:共享前缀内部重构归因

Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

机构 * Tsinghua University(清华大学) The University of Sydney(悉尼大学) Stanford University(斯坦福大学) Baichuan AI(百川AI)

AI总结 SIRA通过内部构建对比参考减少视觉语言模型的幻觉,无需外部工具或额外计算,保持描述覆盖并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14571 2026-05-15 cs.RO cs.LG

Let Robots Feel Your Touch: Visuo-Tactile Cortical Alignment for Embodied Mirror Resonance

让机器人感受你的触摸:用于具身镜像共振的视觉-触觉皮层对齐

Tianfang Zhu, Ning An, Rui Wang, Jiasi Gao, Qingming Luo, Anan Li, Guyue Zhou

机构 * Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Key Laboratory of Biomedical Engineering of Hainan Province, School of Biomedical Engineering, Hainan University(海南省生物医学工程重点实验室,海南大学生物医学工程学院) School of New Media Art and Design, Beihang University(北航艺术与设计学院) MoE Key Laboratory for Biomedical Photonics, Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(教育部生物医学光子学重点实验室,武汉光电研究所,华中科技大学)

AI总结 本文提出镜像触觉网络,通过多级约束实现视觉与触觉表征的语义、分布和几何对齐,使机器人能从RGB图像预测毫米级触觉信号,为具身镜像共振提供可解释的机器人感知路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14546 2026-05-15 cs.LG

Discovering Physical Directions in Weight Space: Composing Neural PDE Experts

在权重空间中发现物理方向:组合神经PDE专家

Pengkai Wang, Pengwei Liu, Yuanyi Wang, Guanyu Chen, Xingyu Ren, Xiaolong Li, Zhongkai Hao, Yuting Kong, Qixin Zhang, Dong Ni

机构 * The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

AI总结 本文研究了神经PDE专家在连续物理家族中多模式微调后的权重空间更新性质,提出CCM方法通过物理方向整合专家模型,提升跨物理域的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14525 2026-05-15 cs.CV

From Sparse to Dense: Spatio-Temporal Fusion for Multi-View 3D Human Pose Estimation with DenseWarper

从稀疏到密集:多视角3D人体姿态估计中的时空融合与DenseWarper

Ling Li, Changjie Chen, Yuyan Wang, Jiaqing Lyu, Kenglun Chang, Yiyun Chen, Zhidong Deng

机构 * Department of Computer Science, THUAI, BNRist, Tsinghua University, Beijing, China(清华大学北京研究院,清华大学计算机科学系,北京,中国) Dalian University of Technology, Dalian, China(大连理工大学,大连,中国) Apple, Beijing, China(苹果公司,北京,中国) Hong Kong University of Science and Technology (Guang Zhou), Guang Zhou, China(香港科技大学(广州),广州,中国) University of Manchester, Manchester, UK(曼彻斯特大学,曼彻斯特,英国)

AI总结 本文提出稀疏交错输入方法,通过利用不同视角在不同时间点的图像,提升3D人体姿态估计的时空信息,实现性能提升并突破单视角帧率限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14524 2026-05-15 stat.ML cs.LG

Large Dimensional Kernel Ridge Regression: Extending to Product Kernels

高维核岭回归:扩展到乘积核

Yang Zhou, Yicheng Li, Yuqian Cheng, Qian Lin

机构 * Department of Statistics and Data Science(统计与数据科学系) Tsinghua University(清华大学) Department of Mathematical Science(数学科学系)

AI总结 本文研究了高维核岭回归中乘积核的收敛性,揭示了在不同源条件下的最优性、饱和效应及多 descent 行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14423 2026-05-15 cs.LG cs.AI

Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic

协同 yet 个性化策略训练:单时间尺度联邦Actor-Critic

Leo Muxing Wang, Pengkun Yang, Lili Su

机构 * Northeastern University(东北大学) Tsinghua University(清华大学)

AI总结 本文提出一种联邦Actor-Critic框架,在保持个性化局部策略的同时共享公共线性子空间表示,并通过新颖的联合线性近似框架证明了有限时间收敛性,展示了线性加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14333 2026-05-15 cs.CV

InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation

InsightTok: 提高离散分词中文本和面部保真度以用于自回归图像生成

Yang Yue, Fangyun Wei, Tianyu He, Jinjing Zhao, Zanlin Ni, Zeyu Liu, Jiayi Guo, Lei Shi, Yue Dong, Li Chen, Ji Li, Gao Huang, Dong Chen

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院)

AI总结 InsightTok通过局部内容感知损失提升文本和面部保真度,在不牺牲通用重建质量的情况下优于现有分词器,从而推动离散图像生成的发展。

Comments Code and checkpoints are available at https://github.com/LeapLabTHU/InsightTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14278 2026-05-15 cs.CV

KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration

KVPO: ODE-Native GRPO用于通过KV语义探索实现自回归视频对齐

Ruicheng Zhang, Kaixi Cong, Jun Zhou, Zhizhou Zhong, Zunnan Xu, Shuiyang Mao, Wei Liu, Xiu Li

机构 * Tsinghua University(清华大学) HKUST(香港科技大学) Video Rebirth Project(视频重生项目)

AI总结 KVPO通过引入因果-语义探索范式和基于轨迹速度能量的替代策略,解决自回归视频生成器与人类偏好对齐的挑战,提升视频质量与文本对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13276 2026-05-15 cs.AI cs.RO

D-VLA: A High-Concurrency Distributed Asynchronous Reinforcement Learning Framework for Vision-Language-Action Models

D-VLA:一种面向视觉-语言-动作模型的高并发分布式异步强化学习框架

Yucheng Guo, Yongjian Guo, Zhong Guan, Wen Huang, Haoran Sun, Haodong Yue, Xiaolong Xiang, Shuai Di, Zhen Sun, Luqiao Wang, Junwu Xiong, Yicheng Gong

机构 * Tsinghua University(清华大学) Peking University(北京大学) Tianjin University(天津大学) Beihang University(北航) JDT AI Infra(京东AI基础设施)

AI总结 本文提出D-VLA框架,通过平面解耦和四线异步流水线提升大规模视觉-语言-动作模型的并发性和效率,实验显示其在吞吐量和采样效率上优于主流框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11459 2026-05-15 cs.RO cs.AI cs.CV cs.LG

Overcoming Dynamics-Blindness: Training-Free Pace-and-Path Correction for VLA Models

克服动态盲区:为VLA模型提供无训练的节奏与路径修正

Yanyan Zhang, Chaoda Song, Vikash Singh, Xinpeng Li, Kai Ye, Zhe Hu, Zhongzhu Pu, Yu Yin, Vipin Chaudhary

机构 * Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) InspireOmni AI

AI总结 本文提出一种无训练的节奏与路径修正方法,解决VLA模型在非稳态场景下的性能问题,通过统一解法提升动态环境中的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07594 2026-05-15 cs.RO

MemCompiler: Compile, Don't Inject -- State-Conditioned Memory for Embodied Agents

MemCompiler: 编译,而非注入 -- 用于具身智能体的状态条件化记忆

Xin Ding, Xinrui Wang, Yifan Yang, Hao Wu, Shiqi Jiang, Qianxi Zhang, Liang Mi, Hanxin Zhu, Kun Li, Yunxin Liu, Zhibo Chen, Ting Cao

机构 * University of Science and Technology of China(中国科学技术大学) Huazhong University of Science and Technology(华中科技大学) Microsoft Research(微软研究院) Nanjing University(南京大学) Institute for AI Industry Research (AIR) Tsinghua University(清华大学人工智能产业研究院)

AI总结 MemCompiler通过状态条件化记忆编译提升具身智能体的记忆效率与效果,在多个基准测试中实现性能提升和延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04554 2026-05-15 cs.CV

InterMesh: Explicit Interaction-Aware End-to-End Multi-Person Human Mesh Recovery

InterMesh:显式交互感知的端到端多人体网格恢复

Kaili Zheng, Kaiwen Wang, Xun Zhu, Chenyi Guo, Ji Wu

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) College of AI, Tsinghua University(清华大学人工智能学院) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

AI总结 本文提出InterMesh框架,通过显式融入人与环境交互信息提升多人体网格恢复的准确性,实验表明在复杂交互场景下效果显著,MPJPE降低9.9%。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19092 2026-05-15 cs.RO cs.AI

RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation

RoboWM-Bench:用于评估机器人操作中世界模型的基准

Feng Jiang, Yang Chen, Kyle Xu, Yuchen Liu, Haifeng Wang, Zhenhao Shen, Jasper Lu, Shengze Huang, Yuanfei Wang, Chen Xie, Ruihai Wu

机构 * Peking University(北京大学) Tsinghua University(清华大学) Lightwheel

AI总结 本文提出RoboWM-Bench,用于评估视频世界模型在机器人操作中的执行能力,发现视觉合理性与实际执行性不一致,并分析了影响执行性能的因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21250 2026-05-15 cs.AI

Graph of States: Solving Abductive Tasks with Large Language Models

状态图:利用大语言模型解决假设推理任务

Yu Luo, Rongchen Gao, Lu Teng, Xidao Wen, Jiamin Jiang, Qingliang Zhang, Yongqian Sun, Shenglin Zhang, Jiasong Feng, Tong Liu, Wenjie Zhang, Dan Pei

机构 * Nankai University(南开大学) Wenzhou Medical University(温州医科大学) Alibaba Cloud(阿里云) Tsinghua University(清华大学)

AI总结 本文提出状态图框架,通过结构化信念状态和因果图实现逻辑依赖编码,解决假设推理中的证据伪造等问题,实验证明其在复杂任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16659 2026-05-15 cs.AI econ.GN q-fin.EC

LLMs learn scientific taste from institutional traces across the social sciences

大语言模型通过社会科学研究中的机构痕迹学习科学品味

Ziqin Gong, Ning Li, Huaikang Zhou

机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院)

AI总结 本文探讨机构痕迹作为训练信号,帮助AI在低可验证性领域进行评估判断,通过八个社会科学学科的四层研究提案基准测试,验证了微调LLM在不同领域的准确率,最高达85.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06718 2026-05-15 cs.CR cs.AI

GhostCite: A Large-Scale Analysis of Citation Validity in the Age of Large Language Models

GhostCite: 对大规模语言模型时代引用有效性的大规模分析

Zuyao Xu, Yuqi Qiu, Lu Sun, Fasheng Miao, Fubin Wu, Xiang Li, Xinyi Wang, Haozhe Lu, Zhengze Zhang, Yuxin Hu, Jialu Li, Luo Jin, Feng Zhang, Rui Luo, Xinran Liu, Yingxian Li, Jiaji Liu

机构 * Nankai University(南开大学) Tsinghua University(清华大学)

AI总结 研究通过三个实验分析LLM时代引用有效性,发现13个模型在引用生成任务中存在14.23%-94.93%的伪造引用率,2025年无效引用率上升80.9%,并揭示87.2%的研究人员使用AI工具,76.7%的审稿人未彻底检查参考文献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04265 2026-05-15 cs.LG cs.AI

Boosting LLM Reasoning via Human-Inspired Reward Shaping

通过人类启发的奖励塑造提升大语言模型推理能力

Wenze Lin, Zhen Yang, Xitai Jiang, Xiaoteng Ma, Gao Huang

机构 * Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Mind Lab

AI总结 本文提出T2T动态奖励框架,通过区分掌握与未掌握问题的不同学习策略,提升LLM推理性能,实验显示其在数学基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03417 2026-05-15 cs.CL

FactNet: A Billion-Scale Knowledge Graph for Multilingual Factual Grounding

FactNet:一个十亿级的知识图谱用于多语言事实 grounding

Yingli Shen, Wen Lai, Jie Zhou, Xueren Zhang, Yudong Wang, Kangyang Luo, Shuo Wang, Ge Gao, Alexander Fraser, Maosong Sun

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) ModelBest Inc.(ModelBest公司) Minzu University of China(民族大学)

AI总结 FactNet通过结合17亿条维基数据语句和301亿条证据指针,构建了一个十亿级多语言知识图谱,提供事实 grounding 的评估框架,并验证了跨语言结构的知识迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18903 2026-05-15 cs.LG cs.AI cs.CL

How Learning Rate Decay Wastes Your Best Data in Curriculum-Based LLM Pretraining

学习率衰减如何浪费你在基于课程的学习中的最佳数据

Kairong Luo, Zhenbo Sun, Haodong Wen, Xinyu Shi, Jiarui Cui, Chenyi Dang, Kaifeng Lyu, Wenguang Chen

机构 * Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文指出学习率衰减与课程式预训练数据排序的不兼容性限制了预训练效果,通过调整衰减策略和模型平均可提升1.64%的基准表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14232 2026-05-15 cs.CV

GenExam: A Multidisciplinary Text-to-Image Exam

GenExam:多学科文本到图像考试

Zhaokai Wang, Penghao Yin, Xiangyu Zhao, Changyao Tian, Yu Qiao, Wenhai Wang, Jifeng Dai, Gen Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 GenExam是首个多学科文本到图像考试基准,包含10个学科1000个样本,通过四级分类评估模型的综合能力,揭示开源模型与闭源模型间的显著差距。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06202 2026-05-15 cs.CV cs.AI

LoRA in LoRA: Towards Parameter-Efficient Architecture Expansion for Continual Visual Instruction Tuning

LoRA in LoRA: 朝着参数高效架构扩展的方向:持续视觉指令微调

Chang Che, Ziqi Wang, Pengwan Yang, Qi Wang, Hui Ma, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) University of Amsterdam(阿姆斯特丹大学) Tsinghua University(清华大学)

AI总结 本文提出LiLoRA,一种高效的持续视觉指令微调架构扩展方法,通过共享LoRA矩阵A、低秩分解矩阵B以及余弦正则化损失,提升参数效率和任务学习性能。

Comments AAAI 2026 Oral Presentation. 9 pages

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(24):19978--19986, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13988 2026-05-15 cs.LG quant-ph

Neural Fields for NV-Center Inverse Sensing

神经场用于NV中心反向传感

Zhixuan Zhao, Tao Zhong, Yixun Hu, Nathalie P. de Leon, Christine Allen-Blanchette

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学)

AI总结 本文研究了基于钻石中氮-空位中心的噪声传感反向问题,提出NeTMY神经场方法,通过改进的正则化和优化策略提升反向传感性能。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07805 2026-05-15 cs.LG cs.AI cs.CL

Group Representational Position Encoding

群表示位置编码

Yifan Zhang, Zixiang Chen, Yifeng Liu, Zhen Qin, Huizhuo Yuan, Kangping Xu, Yang Yuan, Quanquan Gu, Andrew Chi-Chih Yao

机构 * Princeton University(普林斯顿大学) University of California, Los Angeles(加州大学洛杉矶分校) IIIS, Tsinghua University(清华大学人工智能研究院)

AI总结 GRAPE提出了一种基于群作用的位置编码框架,结合乘法旋转和加法logit偏置机制,扩展了RoPE和ALiBi的应用范围,适用于长上下文模型的位置几何设计。

Comments Published in ICLR 2026. Project Page: https://github.com/model-architectures/GRAPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13821 2026-05-14 cs.AI cs.LG

Harnessing Agentic Evolution

利用代理进化

Jiayi Zhang, Yongfeng Gu, Jianhao Ruan, Maojia Song, Yiran Peng, Zhiguang Han, Jinyu Xiang, Zhitao Wang, Caiyin Yang, Yixi Ouyang, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepWisdom Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Université de Montréal & Mila(蒙特利尔大学及Mila)

AI总结 本文提出AEvo框架,通过统一接口整合程序和代理进化,提升长周期搜索性能,在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13448 2026-05-14 stat.ML cs.LG math.PR

On the Limits of Latent Reuse in Diffusion Models

扩散模型中潜在重用的极限

Yifeng Yu, Lu Yu

机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

AI总结 研究扩散模型在分布偏移下潜在重用的可靠性,分析源-目标子空间主角偏差与环境噪声对目标域得分误差的影响,提出混合源-目标训练方法以确定共享潜在维度的依赖关系。

详情

展开后加载摘要…

URL PDF HTML 收藏