BioHuman: Learning Biomechanical Human Representations from Video
BioHuman: 从视频中学习生物力学人体表示
机构 * Beihang University(北航) ; Tsinghua University(清华大学)
AI总结 本文提出BioHuman模型,通过视频输入联合预测人体运动和肌肉激活,建立视觉观测与内部生物力学状态的联系,展示了在多样化的主体和动作上准确重建运动和肌肉活动的能力。
高校专区
BioHuman: 从视频中学习生物力学人体表示
机构 * Beihang University(北航) ; Tsinghua University(清华大学)
AI总结 本文提出BioHuman模型,通过视频输入联合预测人体运动和肌肉激活,建立视觉观测与内部生物力学状态的联系,展示了在多样化的主体和动作上准确重建运动和肌肉活动的能力。
EVA:针对对抗性攻击的多功能对齐编辑
机构 * ShanghaiTech University(上海科技大学) ; Sun Yat-sen University(中山大学) ; State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) ; Tsinghua University(清华大学)
AI总结 本文提出EVA框架,通过直接模型编辑提升安全对齐,有效中和有害行为,实验显示其在LLMs和VLMs中对抗攻击效果优于现有方法。
Comments IEEE TPAMI 2026
Video-Zero: 自主进化视频理解
机构 * Tsinghua University(清华大学) ; Tencent(腾讯) ; Tongji University(同济大学) ; Peking University(北京大学)
AI总结 本文提出Video-Zero框架,通过无标注的Questioner-Solver共进化机制,聚焦时间局部证据,提升视频理解的自进化能力,验证了证据中心自进化方法的有效性与迁移性。
自发对称破缺与深度信息传播中的Goldstone模式
机构 * Dept. of Mathematical Sciences, Durham University(杜伦大学数学科学系) ; Kempner Institute, Harvard University(哈佛大学凯普纳研究所) ; AMLab, University of Amsterdam(阿姆斯特丹大学AMLab) ; College of AI, Tsinghua University(清华大学人工智能学院) ; University of Tübingen, Tübingen(图宾根大学) ; AI Center(人工智能中心) ; CuspAI
AI总结 研究深度神经网络中因连续对称自发破缺而产生的Goldstone-like自由度,证明其能实现稳定信息传播,提升训练效率和长期记忆性能。
Comments 28 pages. Code at https://github.com/nabiliqbal/ssb-goldstone-deep-info-prop
DRL-STAF:一种用于复杂多变量隐马尔可夫过程状态感知预测的深度强化学习框架
机构 * Department of Industrial Engineering, Tsinghua University, Beijing 100084, China(清华大学工业工程系) ; Department of Industrial and Systems Engineering, University of Iowa, Iowa City, IA 52242, USA(爱荷华大学工业与系统工程系)
AI总结 本文提出DRL-STAF框架,通过深度强化学习联合预测下一步观测并估计对应的隐状态,解决多变量隐马尔可夫过程中的非线性和非平稳性问题,优于HMM变体和深度学习模型。
我们真的需要外部工具来缓解幻觉吗?SIRA:共享前缀内部重构归因
机构 * Tsinghua University(清华大学) ; The University of Sydney(悉尼大学) ; Stanford University(斯坦福大学) ; Baichuan AI(百川AI)
AI总结 SIRA通过内部构建对比参考减少视觉语言模型的幻觉,无需外部工具或额外计算,保持描述覆盖并降低开销。
让机器人感受你的触摸:用于具身镜像共振的视觉-触觉皮层对齐
机构 * Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) ; Key Laboratory of Biomedical Engineering of Hainan Province, School of Biomedical Engineering, Hainan University(海南省生物医学工程重点实验室,海南大学生物医学工程学院) ; School of New Media Art and Design, Beihang University(北航艺术与设计学院) ; MoE Key Laboratory for Biomedical Photonics, Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(教育部生物医学光子学重点实验室,武汉光电研究所,华中科技大学)
AI总结 本文提出镜像触觉网络,通过多级约束实现视觉与触觉表征的语义、分布和几何对齐,使机器人能从RGB图像预测毫米级触觉信号,为具身镜像共振提供可解释的机器人感知路径。
在权重空间中发现物理方向:组合神经PDE专家
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文研究了神经PDE专家在连续物理家族中多模式微调后的权重空间更新性质,提出CCM方法通过物理方向整合专家模型,提升跨物理域的预测性能。
从稀疏到密集:多视角3D人体姿态估计中的时空融合与DenseWarper
机构 * Department of Computer Science, THUAI, BNRist, Tsinghua University, Beijing, China(清华大学北京研究院,清华大学计算机科学系,北京,中国) ; Dalian University of Technology, Dalian, China(大连理工大学,大连,中国) ; Apple, Beijing, China(苹果公司,北京,中国) ; Hong Kong University of Science and Technology (Guang Zhou), Guang Zhou, China(香港科技大学(广州),广州,中国) ; University of Manchester, Manchester, UK(曼彻斯特大学,曼彻斯特,英国)
AI总结 本文提出稀疏交错输入方法,通过利用不同视角在不同时间点的图像,提升3D人体姿态估计的时空信息,实现性能提升并突破单视角帧率限制。
高维核岭回归:扩展到乘积核
机构 * Department of Statistics and Data Science(统计与数据科学系) ; Tsinghua University(清华大学) ; Department of Mathematical Science(数学科学系)
AI总结 本文研究了高维核岭回归中乘积核的收敛性,揭示了在不同源条件下的最优性、饱和效应及多 descent 行为。
协同 yet 个性化策略训练:单时间尺度联邦Actor-Critic
机构 * Northeastern University(东北大学) ; Tsinghua University(清华大学)
AI总结 本文提出一种联邦Actor-Critic框架,在保持个性化局部策略的同时共享公共线性子空间表示,并通过新颖的联合线性近似框架证明了有限时间收敛性,展示了线性加速效果。
InsightTok: 提高离散分词中文本和面部保真度以用于自回归图像生成
机构 * Tsinghua University(清华大学) ; Microsoft Research(微软研究院)
AI总结 InsightTok通过局部内容感知损失提升文本和面部保真度,在不牺牲通用重建质量的情况下优于现有分词器,从而推动离散图像生成的发展。
Comments Code and checkpoints are available at https://github.com/LeapLabTHU/InsightTok
KVPO: ODE-Native GRPO用于通过KV语义探索实现自回归视频对齐
机构 * Tsinghua University(清华大学) ; HKUST(香港科技大学) ; Video Rebirth Project(视频重生项目)
AI总结 KVPO通过引入因果-语义探索范式和基于轨迹速度能量的替代策略,解决自回归视频生成器与人类偏好对齐的挑战,提升视频质量与文本对齐效果。
D-VLA:一种面向视觉-语言-动作模型的高并发分布式异步强化学习框架
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Tianjin University(天津大学) ; Beihang University(北航) ; JDT AI Infra(京东AI基础设施)
AI总结 本文提出D-VLA框架,通过平面解耦和四线异步流水线提升大规模视觉-语言-动作模型的并发性和效率,实验显示其在吞吐量和采样效率上优于主流框架。
克服动态盲区:为VLA模型提供无训练的节奏与路径修正
机构 * Case Western Reserve University(凯斯西储大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Tsinghua University(清华大学) ; InspireOmni AI
AI总结 本文提出一种无训练的节奏与路径修正方法,解决VLA模型在非稳态场景下的性能问题,通过统一解法提升动态环境中的成功率。
MemCompiler: 编译,而非注入 -- 用于具身智能体的状态条件化记忆
机构 * University of Science and Technology of China(中国科学技术大学) ; Huazhong University of Science and Technology(华中科技大学) ; Microsoft Research(微软研究院) ; Nanjing University(南京大学) ; Institute for AI Industry Research (AIR) Tsinghua University(清华大学人工智能产业研究院)
AI总结 MemCompiler通过状态条件化记忆编译提升具身智能体的记忆效率与效果,在多个基准测试中实现性能提升和延迟降低。
InterMesh:显式交互感知的端到端多人体网格恢复
机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; College of AI, Tsinghua University(清华大学人工智能学院) ; Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)
AI总结 本文提出InterMesh框架,通过显式融入人与环境交互信息提升多人体网格恢复的准确性,实验表明在复杂交互场景下效果显著,MPJPE降低9.9%。
Comments 13 pages, 10 figures
RoboWM-Bench:用于评估机器人操作中世界模型的基准
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; Lightwheel
AI总结 本文提出RoboWM-Bench,用于评估视频世界模型在机器人操作中的执行能力,发现视觉合理性与实际执行性不一致,并分析了影响执行性能的因素。
状态图:利用大语言模型解决假设推理任务
机构 * Nankai University(南开大学) ; Wenzhou Medical University(温州医科大学) ; Alibaba Cloud(阿里云) ; Tsinghua University(清华大学)
AI总结 本文提出状态图框架,通过结构化信念状态和因果图实现逻辑依赖编码,解决假设推理中的证据伪造等问题,实验证明其在复杂任务中的优越性。
大语言模型通过社会科学研究中的机构痕迹学习科学品味
机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院)
AI总结 本文探讨机构痕迹作为训练信号,帮助AI在低可验证性领域进行评估判断,通过八个社会科学学科的四层研究提案基准测试,验证了微调LLM在不同领域的准确率,最高达85.5%。
GhostCite: 对大规模语言模型时代引用有效性的大规模分析
机构 * Nankai University(南开大学) ; Tsinghua University(清华大学)
AI总结 研究通过三个实验分析LLM时代引用有效性,发现13个模型在引用生成任务中存在14.23%-94.93%的伪造引用率,2025年无效引用率上升80.9%,并揭示87.2%的研究人员使用AI工具,76.7%的审稿人未彻底检查参考文献。
通过人类启发的奖励塑造提升大语言模型推理能力
机构 * Tsinghua University(清华大学) ; Southern University of Science and Technology(南方科技大学) ; Mind Lab
AI总结 本文提出T2T动态奖励框架,通过区分掌握与未掌握问题的不同学习策略,提升LLM推理性能,实验显示其在数学基准测试中优于现有方法。
FactNet:一个十亿级的知识图谱用于多语言事实 grounding
机构 * Tsinghua University(清华大学) ; Technical University of Munich(慕尼黑技术大学) ; ModelBest Inc.(ModelBest公司) ; Minzu University of China(民族大学)
AI总结 FactNet通过结合17亿条维基数据语句和301亿条证据指针,构建了一个十亿级多语言知识图谱,提供事实 grounding 的评估框架,并验证了跨语言结构的知识迁移能力。
学习率衰减如何浪费你在基于课程的学习中的最佳数据
机构 * Tsinghua University(清华大学) ; Peng Cheng Laboratory(鹏城实验室)
AI总结 本文指出学习率衰减与课程式预训练数据排序的不兼容性限制了预训练效果,通过调整衰减策略和模型平均可提升1.64%的基准表现。
GenExam:多学科文本到图像考试
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 GenExam是首个多学科文本到图像考试基准,包含10个学科1000个样本,通过四级分类评估模型的综合能力,揭示开源模型与闭源模型间的显著差距。
Comments Accepted by ICML 2026
LoRA in LoRA: 朝着参数高效架构扩展的方向:持续视觉指令微调
机构 * Hefei University of Technology(合肥工业大学) ; University of Amsterdam(阿姆斯特丹大学) ; Tsinghua University(清华大学)
AI总结 本文提出LiLoRA,一种高效的持续视觉指令微调架构扩展方法,通过共享LoRA矩阵A、低秩分解矩阵B以及余弦正则化损失,提升参数效率和任务学习性能。
Comments AAAI 2026 Oral Presentation. 9 pages
Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(24):19978--19986, 2026
神经场用于NV中心反向传感
机构 * Princeton University(普林斯顿大学) ; Tsinghua University(清华大学)
AI总结 本文研究了基于钻石中氮-空位中心的噪声传感反向问题,提出NeTMY神经场方法,通过改进的正则化和优化策略提升反向传感性能。
Comments 33 pages, 16 figures
群表示位置编码
机构 * Princeton University(普林斯顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; IIIS, Tsinghua University(清华大学人工智能研究院)
AI总结 GRAPE提出了一种基于群作用的位置编码框架,结合乘法旋转和加法logit偏置机制,扩展了RoPE和ALiBi的应用范围,适用于长上下文模型的位置几何设计。
Comments Published in ICLR 2026. Project Page: https://github.com/model-architectures/GRAPE
利用代理进化
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; DeepWisdom ; Singapore University of Technology and Design(新加坡科技设计大学) ; Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Université de Montréal & Mila(蒙特利尔大学及Mila)
AI总结 本文提出AEvo框架,通过统一接口整合程序和代理进化,提升长周期搜索性能,在多个基准测试中优于现有方法。
扩散模型中潜在重用的极限
机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) ; Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)
AI总结 研究扩散模型在分布偏移下潜在重用的可靠性,分析源-目标子空间主角偏差与环境噪声对目标域得分误差的影响,提出混合源-目标训练方法以确定共享潜在维度的依赖关系。