arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4556
2603.19219 2026-03-20 cs.CV cs.LG

DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding

DriveTok: 3D驾驶场景分词用于统一多视角重建与理解

Dong Zhuo, Wenzhao Zheng, Sicheng Zuo, Siming Yan, Lu Hou, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司)

AI总结 DriveTok通过3D变形交叉注意力实现高效多视角重建与理解,整合语义、几何与纹理信息,提升多视角分词效率与一致性。

Comments Project Page: https://paryi555.github.io/DriveTok/ Code: https://github.com/paryi555/DriveTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19145 2026-03-20 cs.LG

Enhancing Pretrained Model-based Continual Representation Learning via Guided Random Projection

通过引导随机投影增强基于预训练模型的持续表示学习

Ruilin Li, Heming Zou, Xiufeng Yan, Zheming Liang, Jie Yang, Chenliang Li, Xue Yang

机构 * Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) China University of Mining and Technology(中国矿业大学)

AI总结 本文提出SCL-MGSM方法,通过数据引导机制构建投影层,提升预训练模型在持续学习中的表现和数值稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19029 2026-03-20 cs.RO

ATG-MoE: Autoregressive trajectory generation with mixture-of-experts for assembly skill learning

ATG-MoE:基于混合专家的自主轨迹生成用于装配技能学习

Weihang Huang, Chaoran Zhang, Xiaoxin Deng, Hao Zhou, Zhaobo Xu, Shubo Cui, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Faculty of Engineering, Imperial College London(伦敦帝国理工学院工程学院)

AI总结 本文提出ATG-MoE,通过混合专家架构实现多技能整合,解决传统方法在多阶段设计和多技能整合能力上的不足,实验显示其在模拟和实际应用中均表现优异。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18979 2026-03-20 cs.RO cs.AI

PRIOR: Perceptive Learning for Humanoid Locomotion with Reference Gait Priors

PRIOR:基于参考步态先验的人形机器人感知学习

Chenxi Han, Shilu He, Yi Cheng, Linqi Ye, Houde Liu

机构 * Tsinghua University(清华大学) ZERITH Robotics(ZERITH机器人公司) Shanghai University(上海大学)

AI总结 PRIOR通过参数化步态生成器、GRU状态估计器和自适应足部奖励机制,实现了人形机器人在复杂地形中稳健行走,展示了高效且可复现的框架。

Comments https://prior-iros2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18891 2026-03-20 cs.CV cs.LG

PromptHub: Enhancing Multi-Prompt Visual In-Context Learning with Locality-Aware Fusion, Concentration and Alignment

PromptHub: 通过局部感知融合、集中和对齐增强多提示视觉上下文学习

Tianci Luo, Jinpeng Wang, Shiyu Qin, Niu Lian, Yan Feng, Bin Chen, Chun Yuan, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Meituan, Beijing(美团,北京)

AI总结 PromptHub通过局部感知融合、集中和对齐方法提升多提示视觉上下文学习性能,验证了其在多种视觉任务中的优越性及泛化能力。

Comments Accepted to ICLR 2026. 17 pages, 11 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18742 2026-03-20 cs.CV

6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models

6Bit-Diffusion:视频扩散模型推理时的混合精度量化

Rundong Su, Jintao Zhang, Zhihang Yuan, Haojie Duanmu, Jianfei Chen, Jun Zhu

机构 * Fudan University(复旦大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出了一种推理时的混合精度量化框架,通过动态分配NVFP4和INT8精度,提升视频扩散模型的效率与质量,实验显示在推理速度和内存占用上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18688 2026-03-20 cs.LG cs.CL

STEP: Scientific Time-Series Encoder Pretraining via Cross-Domain Distillation

STEP: 通过跨领域知识蒸馏实现科学时间序列的编码器预训练

Chen Zhang, Liwei Liu, Jun Tao, Xiaoyu Yang, Xuenan Xu, Kai Chen, Bowen Zhou, Wen Wu, Chao Zhang

机构 * Shanghai Aritificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Sichuan University(四川大学) University of Cambridge(剑桥大学)

AI总结 本文提出STEP框架,通过跨领域知识蒸馏整合多领域基础模型,构建统一的科学时间序列编码器,提升科学时间序列的表示学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18645 2026-03-20 cs.CV

MeInTime: Bridging Age Gap in Identity-Preserving Face Restoration

MeInTime:弥合年龄差距的恒定身份面部修复

Teer Song, Yue Zhang, Yu Tian, Ziyang Wang, Xianlin Zhang, Guixuan Zhang, Xuan Liu, Xueming Li, Yasen Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Department of Computer Science and Technology, Institute for AI, Tsinghua University(清华大学计算机科学与技术系,人工智能研究院) Minzu University of China(民族大学) Xiaomi Corporation(小米公司)

AI总结 MeInTime提出一种基于扩散的面部修复方法,通过引入年龄提示和新的注意力机制,实现跨年龄的恒定身份修复,提升了身份保真度和年龄一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18571 2026-03-20 cs.AI cs.CE q-bio.QM

CAPSUL: A Comprehensive Human Protein Benchmark for Subcellular Localization

CAPSUL:一个全面的人类蛋白质基准用于亚细胞定位

Yicheng Hu, Xinyu Lin, Shulin Li, Wenjie Wang, Fengbin Zhu, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 CAPSUL基准通过整合多样化3D结构表示和精细亚细胞定位注释,推动结构基模型在亚细胞定位任务中的应用,展示了结构特征的重要性,并通过高尔基体案例研究揭示了α-螺旋在定位中的关键作用。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18118 2026-03-20 cs.CV cs.AI cs.LG

Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

Insight-V++: 向多模态大语言模型实现高级长链视觉推理迈进

Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

机构 * S-Lab(S实验室) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文言) Tsinghua University(清华大学)

AI总结 本文提出Insight-V++框架,通过多代理视觉推理系统提升多模态大语言模型的长链视觉推理能力,采用ST-GRPO和J-GRPO算法增强空间时间推理和评估鲁棒性,实验显示在图像和视频推理任务中性能显著提升。

Comments arXiv admin note: text overlap with arXiv:2411.14432

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18114 2026-03-20 stat.ME cs.LG

Transfer Learning for Contextual Joint Assortment-Pricing under Cross-Market Heterogeneity

基于多市场异质性的上下文联合 assortment-定价转移学习

Elynn Chen, Xi Chen, Yi Zhang

机构 * New York University, Stern School of Business(纽约大学, Stern 商学院) Tsinghua University, School of Economics and Management(清华大学, 经济管理学院)

AI总结 本文研究了在多努利Logit选择模型下,利用带反馈的转移学习进行上下文联合 assortment-定价问题。通过结构化效用转移模型,提出TJAP框架,结合聚合后去偏估计与UCB策略,建立最小最大遗憾界,证明转移加速学习的同时需承担异质性适应成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18091 2026-03-20 cs.CV cs.RO

Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model

动作草稿与验证:一种用于视觉-语言-动作模型的自验证框架

Chen Zhao, Zhuoran Wang, Haoyang Li, Shifeng Bao, Guanlin Li, Youhe Feng, Yang Li, Jie Tang, Jing Zhang

机构 * Key Laboratory of Data Engineering(数据工程与知识工程重点实验室) Tsinghua University(清华大学) Beijing University of Posts(北京邮电大学) School of Information, Renmin University of China(中国人民大学信息学院)

AI总结 本文提出Action-Draft-and-Verify框架,结合扩散动作专家和VLM,通过单次前向传递选择最优动作片段,提升模拟和现实场景中的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17497 2026-03-20 cs.RO cs.SY eess.SY

From Optimizable to Interactable: Mixed Digital Twin-Empowered Testing of Vehicle-Infrastructure Cooperation Systems

从可优化到可交互:混合数字孪生赋能的车辆-基础设施协作系统测试

Jianghong Dong, Chunying Yang, Mengchi Cai, Chaoyi Chen, Qing Xu, Jianqiang Wang, Keqiang Li

机构 * School of Vehicle and Mobility, Tsinghua University, 100084 Beijing, China(车辆与移动技术学院,清华大学,北京,100084)

AI总结 本文提出L5级VICS测试框架IMPACT,通过引入人类交互生成高质量corner case,提升车辆-基础设施协作系统测试效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17024 2026-03-20 cs.CV cs.AI cs.CL

HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning

HopChain: 多跳数据合成用于通用视觉语言推理

Shenzhi Wang, Shixuan Liu, Jing Zhou, Chang Gao, Xiong-Hui Chen, Binghai Wang, An Yang, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司) LeapLab, Tsinghua University(清华大学跃迁实验室)

AI总结 本文提出HopChain框架,通过多跳视觉语言推理数据合成提升VLMs的通用推理能力,实验表明其在多个基准测试中显著提升性能。

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11101 2026-03-20 cs.RO cs.AI cs.DC

Thousand-GPU Large-Scale Training and Optimization Recipe for AI-Native Cloud Embodied Intelligence Infrastructure

千GPU大规模训练与优化方案用于AI原生云具身智能基础设施

Yongjian Guo, Yunxuan Ma, Haoran Sun, Zhong Guan, Shuai Di, Jing Long, Wanting Xu, Xiaodong Bai, Wen Huang, Yucheng Guo, Chen Zhou, Qiming Yang, Mingxi Luo, Tianyun Zhao, Hedan Yang, Song Wang, Xiaomeng Tian, Xiaolong Xiang, Zhen Sun, Yu Wei, Luqiao Wang, Yuzhen Li, Chenfeng Gu, Junwu Xiong, Yicheng Gong

机构 * AI Infra Team at JDT(JDT人工智能基础设施团队) Tsinghua University(清华大学) Peking University(北京大学) Tianjin University(天津大学) Beihang University(北洋大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出一种基于LeRobot框架的千GPU分布式训练平台,通过优化数据流程、训练效率和基础设施,实现具身智能模型训练速度提升40倍,推动下一代自主智能机器人发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17869 2026-03-20 cs.LG

Modeling Inverse Ellipsometry Problem via Flow Matching with a Large-Scale Dataset

通过大规模数据集进行逆椭圆度测量问题的建模:流匹配

Yiming Ma, Jianzhi Teng, Xinjie Li, Xin Sun, Zhiyong Wang, Yuzhou Song, Lionel Z. Wang, Bin Chen

机构 * Chongqing Research Institute of Harbin Institute of Technology(哈尔滨工业大学重庆研究院) The Hong Kong Polytechnic University(香港理工大学) The Pennsylvania State University(宾夕法尼亚州立大学) Tianjin University(天津大学) Tsinghua University(清华大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出EllipBench数据集和Decoupled Conditional Flow Matching框架,解决逆椭圆度测量问题中光常数和膜厚重建的物理不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17771 2026-03-19 cs.LG cs.AI

Attention Sinks Induce Gradient Sinks

注意力沉底引发梯度沉底

Yihong Chen, Quanming Yao

机构 * Tsinghua University(清华大学) Peking University(北京大学)

AI总结 研究从反向传播角度探讨注意力沉底与梯度沉底的关系,发现因果掩码下注意力沉底会引发梯度集中,且在预归一化架构中,大规模激活是训练时对梯度压力的适应性响应。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17705 2026-03-19 cs.CV

Parameter-Efficient Modality-Balanced Symmetric Fusion for Multimodal Remote Sensing Semantic Segmentation

参数高效模态平衡对称融合用于多模态遥感语义分割

Haocheng Li, Juepeng Zheng, Shuangxi Miao, Ruibo Lu, Guosheng Cai, Haohuan Fu, Jianxi Huang

机构 * College of Land Science and Technology, China Agricultural University(中国农业大学土地科学与技术学院) Key Laboratory of Remote Sensing for Agri-Hazards, Ministry of Agriculture and Rural Affairs(农业农村部农业灾害遥感重点实验室) Faculty of Geosciences and Engineering, Southwest Jiaotong University(西南交通大学地质科学与工程学院) School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) Henan Polytechnic University(河南理工大学) Key Laboratory of Spatio-Temporal Information and Ecological Restoration of Mines, Ministry of Natural Resources of the People’s Republic of China(矿产资源时空信息与生态修复重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) National Supercomputing Center in Shenzhen, Shenzhen, China(深圳国家超算中心) Ministry of Education Key Laboratory for Earth System Modeling and the Department of Earth System Science, Tsinghua University(地球系统模拟教育部重点实验室和清华大学地球系统科学系)

AI总结 本文提出MoBaNet,通过参数高效和模态平衡的对称融合框架,在减少可训练参数的同时提升多模态遥感语义分割的鲁棒性和平衡性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17704 2026-03-19 cs.GR cs.CV cs.HC

DancingBox: A Lightweight MoCap System for Character Animation from Physical Proxies

DancingBox:一种轻量级的基于物理代理的字符动画系统

Haocheng Yuan, Adrien Bousseau, Hao Pan, Lei Zhong, Changjian Li

机构 * University of Edinburgh 10 Crichton Street Edinburgh United Kingdom Inria, Universit\' e C\ o te d'Azur 2004 route des lucioles Valbonne France Tsinghua University No. 30 Shuangqing Road, Haidian District Beijing China University of Edinburgh Inria, Universit\' e C\ o te d'Azur Tsinghua University

AI总结 DancingBox通过将运动捕捉过程转化为数字提线木偶,利用日常物体的粗略运动生成逼真动画,降低了新手动画师的进入门槛。

Comments Accepted to CHI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17693 2026-03-19 cs.CV

Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos

通过合成视频学习可迁移的时间原语以实现视频推理

Songtao Jiang, Sibo Song, Chenyi Zhou, Yuan Wang, Ruizhe Chen, Tongkun Guan, Ruilin Luo, Yan Zhang, Zhihang Tang, Yuchong Sun, Hang Zhang, Zhibo Yang, Shuai Bai, Junyang Lin, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 本文提出SynRL框架,通过合成视频训练模型的时间原语,提升视频推理能力,在15个基准测试中取得显著成效,合成数据在复杂场景中表现优于真实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17613 2026-03-19 cs.CL cs.PL

VeriAgent: A Tool-Integrated Multi-Agent System with Evolving Memory for PPA-Aware RTL Code Generation

VeriAgent:一种集成工具的多智能体系统,具有进化记忆,用于PPA感知的RTL代码生成

Yaoxiang Wang, Qi Shi, ShangZhan Li, Qingguo Hu, Xinyu Yin, Bo Guo, Xu Han, Maosong Sun, Jinsong Su

机构 * Xiamen University(厦门大学) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出一种集成EDA工具的多智能体框架,用于高质量Verilog代码生成,通过进化记忆机制实现功能正确性和PPA指标的联合优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17441 2026-03-19 cs.CV cs.AI

AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement

AdaZoom-GUI: 基于自适应缩放的GUI定位与指令细化

Siqi Pei, Liang Tang, Tiaonan Duan, Long Chen, Shuxian Li, Kaer Huang, Yanzhe Jing, Yiqiang Yan, Bo Zhang, Chenghao Jiang, Borui Zhang, Jiwen Lu

机构 * Lenovo Research(联想研究院) Tsinghua University(清华大学)

AI总结 本文提出AdaZoom-GUI框架,通过指令细化模块和条件缩放策略提升GUI定位精度与指令理解,构建高质量数据集并采用GRPO训练模型,实现在高分辨率GUI理解中的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17416 2026-03-19 cs.RO cs.SY eess.SY

Physics-informed Deep Mixture-of-Koopmans Vehicle Dynamics Model with Dual-branch Encoder for Distributed Electric-drive Trucks

具有双分支编码器的物理信息深度混合Koopman车辆动力学模型用于分布式电动卡车

Jinyu Miao, Pu Zhang, Rujun Yan, Yifei He, Bowei Zhang, Zheng Fu, Ke Wang, Qi Song, Kun Jiang, Mengmeng Yang, Diange Yang

机构 * School of Vehicle and Mobility, and State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University, Beijing, China(车辆与移动系统学院和智能绿色车辆与移动系统国家重点实验室,清华大学,北京,中国) KargoBot Inc., Beijing, China(KargoBot公司,北京,中国)

AI总结 本文提出了一种基于Koopman算子理论的全数据驱动方法,用于复杂分布式电动卡车的动力学建模,通过双分支编码器和物理信息监督机制提升建模精度和兼容性。

Comments 13 pages, 8 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17354 2026-03-19 cs.LG cs.CL

Beyond Outliers: A Data-Free Layer-wise Mixed-Precision Quantization Approach Driven by Numerical and Structural Dual-Sensitivity

超越异常值:一种无需数据的分层混合精度量化方法,由数值和结构双敏感性驱动

Hengyuan Zhang, Xinrong Chen, Zunhai Su, Xiao Liang, Jing Xiong, Wendong Xu, He Xiao, Chaofan Tao, Wei Zhang, Ruobing Xie, Lei Jiang, Hayden Kwok-Hay So, Ngai Wong

机构 * The University of Hong Kong(香港大学) Peking University(北京大学) Tsinghua University(清华大学) University of California, Los Angeles(加州大学洛杉矶分校) Tencent(腾讯)

AI总结 本文提出NSDS方法,通过数值和结构双敏感性驱动分层混合精度量化,无需校准数据,在不同模型和任务中均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17312 2026-03-19 cs.CV cs.AI

Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress

基于视觉语言模型的递归推理用于估计长周期具身任务进度

Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

AI总结 本文提出R²VLM模型,通过递归推理框架处理局部视频片段,维护全局上下文,实现复杂时间依赖推理,提升长周期任务进度估计性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16270 2026-03-19 cs.RO

MG-Grasp: Metric-Scale Geometric 6-DoF Grasping Framework with Sparse RGB Observations

MG-Grasp:基于稀疏RGB观测的度量尺度几何6自由度抓取框架

Kangxu Wang, Siang Chen, Chenxing Jiang, Shaojie Shen, Yixiang Dai, Guijin Wang

机构 * The Department of Electronic Engineering, Tsinghua University, Beijing 100084, China(清华大学电子工程系,北京100084,中国) The Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(香港科学与技术大学电子与计算机工程系,香港,中国)

AI总结 本文提出MG-Grasp框架,利用双视角3D基础模型实现高精度6自由度抓取,通过稀疏RGB图像重建密集点云并生成稳定抓取方案,实验证明其在RGB基抓取方法中达到SOTA水平。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15797 2026-03-19 cs.LG cs.AI

OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning

OMNIFLOW:一种基于物理的多模态代理用于通用科学推理

Hao Wu, Yongheng Zhang, Yuan Gao, Fan Xu, Fan Zhang, Ruobing Xie, Ruijian Gou, Yuxuan Liang, Xiaomeng Huang, Xian Wu

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shenzhen Loop Area Institute(深圳河套学院) Ocean University of China(海洋大学) HKUST (Guangzhou)(香港科技大学(广州))

AI总结 OMNIFLOW通过引入语义-符号对齐机制和物理引导的推理流程,实现了多模态模型在物理定律下的科学推理,显著提升了零样本泛化和少样本适应能力,提供透明且物理一致的推理报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14331 2026-03-19 cs.CV

AvatarForcing: One-Step Streaming Talking Avatars via Local-Future Sliding-Window Denoising

AvatarForcing:通过局部-未来滑动窗口去噪实现一步流式谈话 avatars

Liyuan Cui, Wentao Hu, Wenyuan Zhang, Zesong Yang, Fan Shi, Xiaoqiang Liu

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Tsinghua University(清华大学)

AI总结 本文提出AvatarForcing,一种一步流式扩散框架,通过局部-未来滑动窗口去噪实现高实时性谈话 avatars,实验证明其在34ms/帧下具备高质量视觉和唇同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09513 2026-03-19 cs.RO

Beyond Short-Horizon: VQ-Memory for Robust Long-Horizon Manipulation in Non-Markovian Simulation Benchmarks

超越短时间 horizon:VQ-记忆用于非马尔可夫仿真基准中的鲁棒长时间 manipulation

Honghui Wang, Zhi Jing, Jicong Ao, Shiji Song, Xuelong Li, Gao Huang, Chenjia Bai

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))

AI总结 本文提出 RuleSafe 基准,通过 LLM 辅助仿真框架构建非马尔可夫任务,引入 VQ-Memory 以提升长时间规划和泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23728 2026-03-19 cs.CV cs.AI

M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generation

M3DLayout:一个多源的3D室内布局及结构描述数据集用于3D生成

Yiheng Zhang, Zhuojiang Cai, Mingdao Wang, Meitong Guo, Tianxiao Li, Li Lin, Yuwang Wang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Migu Beijing Research Institute(咪咕北京研究院)

AI总结 本文提出M3DLayout数据集,包含21367个布局和433k个物体实例,整合真实扫描、专业CAD设计和程序生成场景,为3D生成模型提供多样化的空间和语义学习基础。

Comments CVPR 2026; Project Page: https://graphic-kiliani.github.io/M3DLayout/

详情

展开后加载摘要…

URL PDF HTML 收藏