DANTE-W: Diffuse Albedo Neural Texturing in the Wild
DANTE-W:野外场景的漫反射反照率神经纹理化
机构 * Tsinghua University(清华大学)
AI总结 提出DANTE-W神经纹理框架,利用神经表示融合生成式先验,通过物理神经渲染恢复高保真漫反射反照率纹理,提升重光照保真度。
高校专区
DANTE-W:野外场景的漫反射反照率神经纹理化
机构 * Tsinghua University(清华大学)
AI总结 提出DANTE-W神经纹理框架,利用神经表示融合生成式先验,通过物理神经渲染恢复高保真漫反射反照率纹理,提升重光照保真度。
基于竞争优化的多源数据集联合发现偏微分方程
机构 * Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin, Eastern Institute of Technology(浙江工业智能与数字孪生重点实验室,东方理工高等研究院) ; Department of Electrical Engineering, Tsinghua University(清华大学电机工程系) ; Ningbo Institute of Digital Twin, Eastern Institute of Technology(东方理工高等研究院宁波数字孪生研究院)
AI总结 提出MCO-PDE框架,通过软竞争权重机制融合多源数据集,联合发现共享偏微分方程的结构和参数,在稀疏观测下高精度恢复经典方程。
PerceptionRubrics:将多模态评估校准至人类感知
机构 * Johns Hopkins University(约翰霍普金斯大学) ; StepFun ; Tsinghua University(清华大学) ; Independent Researcher(独立研究者)
AI总结 提出基于准则的评估框架PerceptionRubrics,通过双流准则和门控评分机制,解决基准分数饱和而实际脆弱性问题,揭示可靠性差距、开源与闭源感知差异,并实现与人类感知的高度对齐。
Comments ICML 2026. Project page: https://weiyana.github.io/PerceptionRubrics
Reflect-R1:长视频理解中基于证据驱动的自纠正反思
机构 * Tsinghua University(清华大学) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Shenzhen University(深圳大学) ; University of California(加利福尼亚大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出Reflect-R1框架,通过直觉、验证、仲裁三阶段管道动态检索客观视觉证据,并设计阶段解耦强化学习算法SD-GRPO解决策略耦合,在长视频理解基准上达到最优性能。
Comments 2026 ECCV
ViQ: 任意分辨率下的文本对齐视觉量化表示
机构 * Tencent HY Vision Team(腾讯HY视觉团队) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; Chinese Academy of Sciences(中国科学院)
AI总结 提出ViQ框架,通过文本对齐预训练和特征离散化两阶段量化学习,平衡离散表示中的语义与细节,支持原生分辨率输入,在多模态任务中取得与连续高维特征编码器相当的性能,并实现20%-70%的训练加速。
Comments Accepted to ECCV 2026
REDI-Match: 旋转等变蒸馏实现高效鲁棒密集匹配
机构 * Tsinghua University(清华大学) ; Southern University of Science and Technology(南方科技大学) ; Beihang University(北京航空航天大学) ; Zhejiang University(浙江大学)
AI总结 提出REDI-Match框架,通过旋转等变蒸馏将视觉基础模型的语义知识注入轻量等变编码器,结合熵驱动空间对齐模块,在密集匹配中实现高效鲁棒的旋转不变性,在SatAst数据集上提升13.89%姿态精度且速度提升1.9倍。
小波策略:基于世界先验记忆的尺度域模仿学习
机构 * Zhejiang University(浙江大学) ; Tsinghua University, DISCOVER Robotics(清华大学,DISCOVER机器人实验室) ; Hangzhou TaiWeave Robotics Co., Ltd.(杭州太 weave 机器人有限公司)
AI总结 本文提出小波策略,结合世界先验记忆与小波多尺度动作建模,通过编码静态背景图像中的持久物理场景结构,提升长周期机器人操作的效率与效果。
RPG: 为人类oid战斗中平滑多技能过渡的鲁棒策略门控
机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Northwestern Polytechnical University(西北工业大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出RPG框架,通过动作过渡随机化和时间随机化训练统一策略,实现人类oid多技能平滑稳定过渡,并设计控制管道整合步行/跑步与战斗技能,实验证明其有效性与鲁棒性。
学习失重:在人形机器人上模仿非自稳定动作
机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University, China(人工智能与机器人中心,深圳国际研究生院,清华大学,中国) ; Shanghai AI Laboratory(上海人工智能实验室) ; Northwestern Polytechnical University(西北工业大学) ; University of Science and Technology of China(中国科学技术大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
AI总结 本文提出了一种基于生物机制的失重机制,用于在人形机器人上实现非自稳定动作的模仿与环境交互,通过动态确定放松关节及程度,提升环境适应性与动作稳定性。
MetricHMSR:基于单目图像的度量人体网格与场景恢复框架
机构 * Tsinghua University(清华大学) ; Beijing Normal University(北京师范大学) ; Beihang University(北京航空航天大学)
AI总结 本文提出MetricHMSR框架,通过引入bounding camera ray map和HumanMoE模型,实现人体网格和场景的度量恢复,提升单目深度估计的准确性。
工业检测场景安全评估的多模态基准
机构 * Department of Automation, Tsinghua University(清华大学自动化系) ; Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) ; TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; School of Automation, Southeast University(东南大学自动化学院)
AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。
Comments 14 pages, 6 figures, Accepted by Scientific Data
少样本合成图像溯源:有限样本下识别未见生成器
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Peking University(北京大学)
AI总结 提出少样本合成图像溯源新范式,构建含45个生成器、117万图像的OmniFake数据集,并设计OmniDFA基线,实现少样本下识别未见生成器,在AIGI检测中达到最优泛化性能。
Comments ECCV 2026
PSHuman: 使用跨尺度多视图扩散和显式重网格化的逼真单图像三维人体重建
机构 * HKUST(香港科技大学) ; Southeast University(东南大学) ; Tsinghua University(清华大学) ; VAST
AI总结 提出PSHuman框架,通过跨尺度多视图扩散和SMPL-X条件生成,解决单视图人体重建中的几何失真和自遮挡问题,实现高保真几何与纹理重建。
Comments CVPR2025, Project page: https://penghtyx.github.io/PSHuman
LeVo 2:通过层次表示建模和渐进式后训练实现稳定悦耳的歌曲生成
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Tencent(腾讯) ; Wuhan University(武汉大学) ; Hong Kong Polytechnic University(香港理工大学)
AI总结 提出LeVo 2混合LLM-Diffusion框架,通过层次化建模(先预测混合令牌进行语义规划,再并行预测人声和伴奏令牌)解决全曲生成中协调性与细节保真度的权衡,并引入美学引导训练策略,在主观和客观指标上超越开源基线,接近商业系统。
在线模仿学习何时有助于LLM后训练?(非)可实现性超越视界的作用
机构 * Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学) ; UC Berkeley(加州大学伯克利分校) ; Harvard University(哈佛大学)
AI总结 本文挑战误差累积是在线模仿学习优势主要来源的观点,证明在线交互的收益关键取决于设置是否可实现,并在非可实现情况下提出奖励相关的结构特征,使在线学习仍能取得高性能。
FutureNav: 面向视觉与语言导航的统一世界-动作建模
机构 * Tsinghua University(清华大学) ; Pengcheng Laboratory(鹏城实验室) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Xiaomi EV(小米电动车) ; National University of Singapore(新加坡国立大学)
AI总结 提出FutureNav,一种基于VLM的统一世界-动作建模框架,通过联合优化动作策略、逆/前向动力学和未来状态预测四个目标,在4B规模骨干上实现多VLN基准的最优性能。
UniGP:驯服扩散Transformer以实现先验保留的统一生成与感知
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; DAMO Academy, Alibaba Group(阿里云达摩院) ; Hupan Lab(虎扑实验室) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; Zeekr Automobile R&D Co., Ltd.(小鹏汽车研发有限公司)
AI总结 提出UniGP框架,基于MMDiT通过简单联合训练统一可控生成与密集预测,无需复杂任务设计,保留骨干先验,在多个任务上超越先前统一方法并与专用方法持平。
SciIR:面向科学图像推理生成的大规模训练数据集与基准
机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, China(华中科技大学计算机科学与技术学院,中国) ; School of Airspace Science and Engineering, Shandong University, China(山东大学航空航天科学与工程学院,中国) ; Department of Electronic Engineering, Tsinghua University, China(清华大学电子工程系,中国)
AI总结 为解决文本到图像模型在科学图像生成中语义对齐与逻辑推理不足的问题,构建了包含8万+高质量科学图像-文本对的SciIR-82k数据集,并提出三层次科学推理框架及可验证评估基准SciIR-Bench,微调模型Qwen-Image-SciIR在基准上得分从35%提升至43%。
Comments Accepted to ECCV 2026
通过两阶段蒸馏构建多任务智能体LLM
机构 * Tsinghua University(清华大学) ; Ant Group(蚂蚁集团)
AI总结 提出两阶段蒸馏方法(先离策略后在线策略)解决多任务蒸馏中前向KL的模式覆盖问题,使单个模型在多任务上达到专家性能。
IBRSteG: 学习一种面向3D高斯泼溅的可泛化隐写框架
机构 * Department of Automation, Tsinghua University(自动化系,清华大学)
AI总结 提出IBRSteG,一种可泛化的3DGS隐写框架,通过GAS网络学习场景无关的嵌入函数,将秘密3D高斯属性注入覆盖场景,无需逐场景微调即可重构隐写场景,实现高视觉质量、大容量和安全性。
Comments Accepted by IEEE Transactions on Multimedia (TMM)
OmniDance: 基于大规模互联网数据的多模态驱动舞蹈视频生成
机构 * Renmin University of China(中国人民大学) ; AMAP, Alibaba Group(AMAP,阿里巴巴集团) ; Tsinghua University(清华大学) ; Wuhan University(武汉大学) ; Malou Tech Inc(Malou科技公司)
AI总结 提出CIPE-Dance大规模舞蹈视频数据集和OmniDance框架,通过深度感知架构、课程学习和条件引导策略,实现文本、音乐及多模态驱动的舞蹈视频生成,达到最优性能。
Comments Accepted by ECCV 2026
壳监督高斯溅射用于城市真实到仿真重建
机构 * Hong Kong Center for Construction Robotics(香港建设机器人中心) ; Tsinghua University(清华大学)
AI总结 提出壳监督高斯溅射框架,利用外部立面结构壳作为几何监督,通过掩码门控损失优化高斯重建,提升城市立面几何一致性。
Comments 10 pages main paper, 2 pages supplementary material
GeoEdit: 基于几何感知的双分支去噪对象编辑
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Pengcheng Laboratory(鹏城实验室) ; Sun Yat-sen University(中山大学) ; Peking University(北京大学) ; HKUST(香港科技大学) ; University of Tübingen(图宾根大学)
AI总结 提出GeoEdit,一种无需训练的三阶段管道,通过3D解耦、点对应对齐和双分支去噪,实现单张照片中对象的刚性几何变换(平移、旋转、缩放),同时保持背景自然和身份一致性。
Comments Accepted to ECCV 2026
利用流溅射从单目视频学习高效4D高斯表示
机构 * Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学)
AI总结 提出Flow Splatting方法,通过构建速度场并扩展溅射技术渲染光流,从单目视频中高效学习4D高斯表示,实现高质量动态场景重建。
STEAM: 面向真实世界机器人学习的自监督时间集成优势建模
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Tsinghua University(清华大学) ; Striding AI ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Zhongguancun Academy(中关村学院) ; Pengcheng Laboratory(鹏城实验室) ; Harbin Institute of Technology(哈尔滨工业大学) ; Beijing Institute of Technology(北京理工大学) ; Zhejiang University(浙江大学) ; Peking University(北京大学) ; Infinigence AI
AI总结 提出自监督时间集成优势建模(STEAM),利用专家轨迹中帧对的时间偏移作为自监督信号,学习帧级优势以区分进展与失败,结合CFGRL在多种真实任务中提升策略成功率。
双流强化学习与状态感知探索
机构 * State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(智能绿色车辆与移动国家重点实验室,清华大学) ; Tsinghua University-Toyota Joint Center(清华大学-丰田联合中心) ; Tsinghua University–SAIC GM Wuling Joint Research Center(清华大学-上汽通用五菱联合研究中心)
AI总结 提出Dual-Flow RL框架,利用条件流匹配联合建模回报分布和多模态策略,并引入熵-协方差探索调节器实现状态感知探索,在连续控制任务中达到最优性能。
Comments 12 pages, 6 figures, 1 table. This work has been submitted to the IEEE for possible publication
GUICrafter: 利用海量无标注截图的弱监督GUI智能体
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan(腾讯文脉)
AI总结 提出GUICrafter,一种利用海量无标注截图通过课程学习框架训练GUI智能体的弱监督方法,显著降低对人工标注的依赖,在极少量标注数据下性能超越UI-TARS等先进系统。
SPACE: 用于自适应碰撞感知探索的群体信息素场
机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)
AI总结 针对大规模地面机器人群体在拥挤环境中探索时的安全-效率权衡问题,提出SPACE方法,通过维护吸引前沿信息素、排斥探索信息素和快速机器人密度场实现去中心化协调,在真实建筑平面图上将碰撞率降低4-17倍,覆盖时间仅增加约2%。
HiReFF: 从未校准稀疏视角视频的高分辨率前馈式人体重建
机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(北京航空航天大学虚拟现实技术与系统国家重点实验室) ; Tsinghua University, Beijing, China(清华大学) ; College of Computer Science, Beijing Information Science and Technology University, Beijing, China(北京信息科技大学计算机学院) ; Zhongguancun Laboratory, Beijing, China(中关村实验室)
AI总结 提出HiReFF,一种从四视角未校准视频前馈式重建2K分辨率360度人体视频的方法,通过尺度同步相机校准和高斯前景掩码实现干净前景重建,并利用高分辨率侧调优在保持骨干网络0.5K分辨率下实现2K渲染。
过程优势信号塑形:用于LLM推理器过程监督强化学习的范式无关中间件
机构 * Tsinghua University(清华大学) ; WeChat, Tencent(微信、腾讯)
AI总结 提出PASS中间件,通过优势融合、按值分块和长度分割解决GRPO在过程监督强化学习中的通道污染、分辨率不匹配和累积陷阱问题,在数学推理和多跳问答任务上持续提升pass@1。
Comments 19 pages, 3 figures