arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4556
2512.19735 2026-03-24 cs.LG

Improving Fairness of Large Language Model-Based ICU Mortality Prediction via Case-Based Prompting

通过基于案例的提示提升基于大语言模型的ICU死亡预测公平性

Gangxiong Zhang, Yongchao Long, Yuxi Zhou, Yong Zhang, Shenda Hong

机构 * School of Computer Science and Engineering, Tianjin University of Technology, Tianjin, China(天津理工大学计算机科学与工程学院) Institute for Artificial Intelligence, Peking University, Beijing, China(北京大学人工智能研究院) DCST, BNRist, RIIT, Institute of Internet Industry, Tsinghua University, Beijing, China(清华大学信息产业研究院) National Institute of Health Data Science, Peking University, Beijing, China(北京大学健康数据科学国家研究院)

AI总结 本文提出一种临床适应性提示框架,通过整合去偏策略和历史误判案例,提升ICU死亡预测的公平性和性能,实验显示AUROC和AUPRC显著提升,预测差异大幅减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16523 2026-03-24 cs.CV cs.AI

TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models

TTP: 视觉-语言模型上的对抗检测与鲁棒适应的测试时填充

Zhiwei Li, Yitian Pang, Weining Wang, Zhenan Sun, Qi Li

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(神经网络与模式识别实验室及自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出TTP框架,通过测试时填充实现对抗检测与鲁棒适应,提升视觉-语言模型在对抗攻击下的鲁棒性而不影响清洁准确性。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05905 2026-03-24 cs.CV

SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations

SCAIL:通过上下文学习3D一致姿态表示实现工作室级角色动画

Wenhao Yan, Sheng Ye, Zhuoyi Yang, Jiayan Teng, ZhenHui Dong, Kairui Wen, Xiaotao Gu, Yong-Jin Liu, Jie Tang

机构 * Tsinghua University(清华大学)

AI总结 SCAIL通过创新的3D姿态表示和全上下文姿态注入机制,提升角色动画的结构保真度和时间一致性,实现工作室级控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09935 2026-03-24 cs.CV

LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning

LEO-VL:面向可扩展3D视觉-语言学习的高效场景表示

Jiangyong Huang, Xiaojian Ma, Xiongkun Linghu, Junchao He, Qing Li, Song-Chun Zhu, Yixin Chen, Baoxiong Jia, Siyuan Huang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出LEO-VL,一种基于高效场景表示CFG的3D视觉-语言模型,通过改进训练数据和引入SceneDPO提升鲁棒性,在多个3D-VL基准测试中取得最佳性能。

Comments Project page: https://leo-vl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23667 2026-03-24 cs.AI

Formula-R1: Incentivizing LLM Reasoning over Complex Tables with Numerical Computation via Formula-Driven Reinforcement Learning

Formula-R1:通过公式驱动强化学习激励LLM对复杂表格进行数值计算的推理

Lang Cao, Jingxian Xu, Hanbing Liu, Jinyu Wang, Mengyu Zhou, Haoyu Dong, Shi Han, Dongmei Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nankai University(南开大学) Tsinghua University(清华大学) Shandong University(山东大学) Microsoft Research(微软研究院)

AI总结 本文提出Formula-R1,通过公式驱动强化学习框架提升LLM对复杂表格的推理能力,尤其在多步数值计算任务中表现优异,且优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21299 2026-03-24 cs.CV

Identity-Consistent Video Generation under Large Facial-Angle Variations

在大面部角度变化下实现身份一致的视频生成

Bin Hu, Zipeng Qi, Guoxi Huang, Zunnan Xu, Ruicheng Zhang, Chongjie Ye, Jun Zhou, Xiu Li, Jingdong Wang

机构 * Tsinghua University(清华大学) Baidu Inc., China(百度公司) University of Bristol(布里斯托大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出Mv²ID框架,通过区域遮蔽训练策略和参考解耦RoPE机制,解决大角度变化下的身份一致性与自然运动平衡问题,并构建大规模数据集和评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21104 2026-03-24 cs.RO cs.CV

CounterScene: Counterfactual Causal Reasoning in Generative World Models for Safety-Critical Closed-Loop Evaluation

CounterScene: 生成世界模型中的反事实因果推理用于安全关键闭环评估

Bowen Jing, Ruiyang Hao, Weitao Zhou, Haibao Yu

机构 * Tuojing Intelligence(途京智能) King's College London(伦敦大学国王学院) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

AI总结 CounterScene通过结构化反事实推理生成安全关键驾驶场景,通过因果对抗代理识别和冲突感知交互世界模型,提升长周期碰撞率并保持轨迹真实性。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20842 2026-03-24 cs.LG

A Knowledge-Informed Pretrained Model for Causal Discovery

基于知识的因果发现预训练模型

Wenbo Xu, Yue He, Yunhai Wang, Xingxuan Zhang, Kun Kuang, Yueguo Chen, Peng Cui

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Zhejiang University(浙江大学)

AI总结 本文提出一种整合弱先验知识的因果发现预训练模型,通过双源编码器-解码器架构和多样预训练数据集,提升模型在不同先验强度下的适应能力,实验显示在分布内、分布外及现实数据集上均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20611 2026-03-24 cs.CV

GaussianPile: A Unified Sparse Gaussian Splatting Framework for Slice-based Volumetric Reconstruction

GaussianPile:一种统一的稀疏高斯散射框架用于基于切片的体积分离重建

Di Kong, Yikai Wang, Wenjie Guo, Yifan Bu, Boya Zhang, Yuexin Duan, Xiawei Yue, Wenbiao Du, Yiman Zhong, Yuwen Chen, Cheng Ma

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Beijing Normal University(北京师范大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Beihang University(北航)

AI总结 本文提出GaussianPile框架,结合3D高斯散射与成像系统感知的聚焦模型,通过切片感知堆叠策略、可微投影算子和紧凑编码优化流程,实现高效体积分离重建,提升压缩效率与诊断精度。

Comments Accepted by IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11721 2026-03-24 cs.AI

When OpenClaw Meets Hospital: Toward an Agentic Operating System for Dynamic Clinical Workflows

当OpenClaw遇见医院:迈向动态临床工作流的智能操作系统

Wenxian Yang, Hanzheng Qiu, Bangqun Zhang, Chengquan Li, Zhiyong Huang, Xiaobin Feng, Rongshan Yu, Jiahong Dong

机构 * Independent Researcher(独立研究者) National Institute for Data Science in Health and Medicine, Xiamen University, Xiamen, China(健康医学数据科学国家研究院,厦门大学,厦门,中国) Yue’erwan Internet Hospital Co., Ltd.(悦尔湾互联网医院有限公司) School of Biomedical Engineering, Tsinghua University, Beijing, China(生物医学工程学院,清华大学,北京,中国) National University of Singapore, Singapore(新加坡国立大学) Yttrium-90 Precision Interventional Radiotherapy Center of Liver Cancer, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝癌钇-90精准介入放射治疗中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国) Hepatobiliary and Pancreatic Centre, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝胆胰中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国)

AI总结 本文提出一种适应医院环境的LLM代理架构,通过受限执行环境、文档导向交互模型、分页索引内存架构和可组合医疗技能库,实现临床工作流的协调,保障安全、透明和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10679 2026-03-24 cs.AI cs.LG

Are Your Reasoning Models Reasoning or Guessing? A Mechanistic Analysis of Hierarchical Reasoning Models

您的推理模型是推理还是猜测?对分层推理模型的机理分析

Zirui Ren, Ziming Liu

机构 * Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院) Department of Physics, Tsinghua University, Beijing, China(清华大学物理系) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院)

AI总结 研究揭示分层推理模型在简单谜题中易失效,存在猜测动态和多固定点问题,提出数据增强、输入扰动和模型自举策略提升Sudoku-Extreme准确率至96.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24845 2026-03-24 cs.RO

ArtiSG: Functional 3D Scene Graph Construction via Human-demonstrated Articulated Objects Manipulation

ArtiSG: 通过人类示范的可动物体操作构建功能3D场景图

Qiuyi Gu, Yuze Sheng, Jincheng Yu, Jiahao Tang, Xiaolong Shan, Zhaoyang Shen, Tinghao Yi, Xiaodan Liang, Xinlei Chen, Yu Wang

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Openmind Pengcheng Laboratory(鹏城实验室)

AI总结 ArtiSG通过编码人类示范到结构化机器人记忆中,构建功能3D场景图,解决现有方法在可动物体操作信息获取上的不足,提升机器人在真实环境中的任务执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16474 2026-03-24 cs.CV

Foresight Diffusion: Improving Sampling Consistency in Predictive Diffusion Models

前瞻性扩散:改进预测扩散模型中的采样一致性

Yu Zhang, Xingzhuo Guo, Haoran Xu, Jialong Wu, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院,BNRist,清华大学)

AI总结 本文提出Foresight Diffusion,通过解耦条件理解和目标去噪提升预测扩散模型的采样一致性,实验显示其在机器人视频预测和科学时空预测中表现优异。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15340 2026-03-24 cs.LG

SSR: Speculative Parallel Scaling Reasoning in Test-time

SSR:测试时的推测并行扩展推理

Yuanlin Chu, Bo Wang, Xiang Liu, Hong Chen, Aiwei Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tsinghua University(清华大学)

AI总结 SSR提出一种无需训练的框架,通过引入分步推测解码加速推理而不牺牲正确性,提升数学推理任务的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11289 2026-03-24 cs.CV cs.MM

UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer

UniAnimate-DiT:基于大规模视频扩散变换器的人像图像动画

Xiang Wang, Shiwei Zhang, Longxiang Tang, Yingya Zhang, Changxin Gao, Yuehuan Wang, Nong Sang

机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学图像处理与智能控制重点实验室,人工智能与自动化学院) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

AI总结 本文提出UniAnimate-DiT,利用Wan2.1模型实现一致的人像动画,通过LoRA技术优化参数,设计轻量姿态编码器并整合参考外观,实验表明其能生成高质量且时间一致的动画,支持从480p到720P的超分辨率。

Comments The training and inference code (based on Wan2.1) is available at https://github.com/ali-vilab/UniAnimate-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13859 2026-03-24 cs.CV

Accurate Quantization for Gait Representation Learning

精确的量化方法用于姿态表示学习

S. Tian, H. Gao, G. Hong, S. Wang, J. Wang, X. Yu, S. Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) Tsinghua University(清华大学) The University of Queensland(昆士兰大学) Beijing Jiaotong University(北京交通大学)

AI总结 本文提出了一种可微的软量化器以提升姿态表示学习的精度,通过两阶段训练策略和类间距离引导校准策略,有效解决了二值化输入下的收敛问题,实验验证了方法的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20310 2026-03-24 cs.CV cs.GR

GraphiContact: Pose-aware Human-Scene Robust Contact Perception for Interactive Systems

GraphiContact: 人体-场景鲁棒接触感知用于交互系统

Xiaojian Lin, Yaomin Shen, Junyuan Ma, Yujie Sun, Chengqing Bu, Wenxin Zhang, Zongzheng Zhang, Hao Fei, Lei Jin, Hao Zhao

机构 * Tsinghua University, China(清华大学, 中国) XR System Application Research Center, Nanchang Research Institute, Zhejiang University, China(浙江大学南昌研究院XR系统应用研究中心, 中国) Beijing University of Posts and Telecommunications, China(北京邮电大学, 中国) University of Chinese Academy of Sciences, China(中国科学院大学, 中国) National University of Singapore, Singapore(新加坡国立大学, 新加坡)

AI总结 本文提出GraphiContact框架,结合单图像3D人体网格重建,利用重建的体几何结构进行接触推理,通过引入SIMU训练策略提升鲁棒性,在五个基准数据集上实现了接触预测和3D人体重建的提升。

Comments 15 pages, 9 figures, Accepted at ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19926 2026-03-23 cs.CV

SegVGGT: Joint 3D Reconstruction and Instance Segmentation from Multi-View Images

SegVGGT:从多视角图像联合进行3D重建和实例分割

Jinyuan Qu, Hongyang Li, Lei Zhang

机构 * Tsinghua University(清华大学) South China University of Technology(华南理工大学) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))

AI总结 SegVGGT通过端到端框架联合完成多视角图像的3D重建和实例分割,引入对象查询与多级几何特征交互,解决注意力分散问题,实验显示在ScanNetv2和ScanNet200上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19733 2026-03-23 cs.CL

PoC: Performance-oriented Context Compression for Large Language Models via Performance Prediction

PoC:通过性能预测实现面向性能的上下文压缩

Runsong Zhao, Shilei Liu, Jiwei Tang, Langming Liu, Haibin Chen, Weidong Zhang, Yujin Yuan, Tong Xiao, Jingbo Zhu, Wenbo Su, Bo Zheng

机构 * Northeastern University, China(东北大学,中国) Tsinghua University(清华大学) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

AI总结 本文提出PoC方法,通过设定性能底线而非压缩比来优化大语言模型的上下文压缩,设计两种预测器并验证其在问答和摘要任务中的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19714 2026-03-23 cs.CL

LoopRPT: Reinforcement Pre-Training for Looped Language Models

LoopRPT: 用于循环语言模型的强化预训练

Guo Tang, Shixin Jiang, Heng Chang, Nuo Chen, Yuhan Li, Huiming Fan, Jia Li, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) Tsinghua University, Beijing, China(清华大学) The Hong Kong University of Science and Technology, Guangzhou, China(香港科学与技术大学)

AI总结 本文提出LoopRPT框架,通过将下一步预测转化为推理任务,利用EMA教师参考和噪声潜在轨迹直接优化循环语言模型的中间表示,提升表示质量并实现准确度与计算量的帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19688 2026-03-23 cs.CL

DataProphet: Demystifying Supervision Data Generalization in Multimodal LLMs

DataProphet:解开多模态大语言模型监督数据泛化之谜

Xuan Qi, Luxi He, Dan Roth, Xingyu Fu

机构 * University of Pennsylvania(宾夕法尼亚大学) Tsinghua University(清华大学) Princeton University(普林斯顿大学)

AI总结 本文提出DataProphet,一种无需训练的指标,通过结合多模态困惑度、相似性和数据多样性,有效评估监督数据对目标基准的影响,实现更优的数据选择。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19635 2026-03-23 cs.CL

BEAVER: A Training-Free Hierarchical Prompt Compression Method via Structure-Aware Page Selection

BEAVER:一种通过结构感知页面选择的免训练层次提示压缩方法

Zhengpei Hu, Kai Li, Dapeng Fu, Chang Zeng, Yue Li, Yuanhao Tang, Jianqiang Huang

机构 * School of Computer Technology and Application, Qinghai University(青海大学计算机技术与应用学院) Tsinghua University(清华大学) Ant Group Security and Intelligence Laboratory (SIL)(蚂蚁集团安全与智能实验室)

AI总结 BEAVER通过结构感知的层次提示压缩方法,在不依赖训练的情况下提升长文档理解的效率与效果,实验证明其在多个基准测试中性能优异且效率显著提升。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07451 2026-03-23 cs.CL

DLLM Agent: See Farther, Run Faster

DLLM Agent: 看得更远,跑得更快

Huiling Zhen, Weizhe Lin, Renxi Liu, Kai Han, Yiming Li, Yuchuan Tian, Hanting Chen, Xiaoguang Li, Xiaosong Li, Chen Chen, Xianzhi Yu, Mingxuan Yuan, Youliang Yan, Peifeng Qin, Jun Wang, Yu Wang, Dacheng Tao, Yunhe Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) UCL(伦敦大学学院) Tsinghua University(清华大学) NTU(国立新加坡大学) Peking University(北京大学)

AI总结 本文研究了扩散大语言模型(DLLM)在代理多步决策中的表现,发现其在准确率相当的情况下,整体效率比自回归模型(AR)高30%以上,并提出部署扩散骨架的两个实用考虑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05786 2026-03-23 cs.CV cs.AI

How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM

如何使LLM具备3D能力?LLM中空间推理的综述

Jirong Zha, Yuxuan Fan, Xiao Yang, Chen Gao, Xinlei Chen

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guang Zhou)(香港科学与技术大学(广州))

AI总结 本文综述了将LLM与3D空间理解结合的方法,提出分类体系,涵盖图像、点云和混合模态方法,并讨论了当前限制与未来研究方向。

Comments 9 pages, 5 figures

Journal ref IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10318 2026-03-23 cs.CV

SRGS: Super-Resolution 3D Gaussian Splatting

SRGS:超分辨率3D高斯溅射

Xiang Feng, Yongbo He, Linxi Chen, Yan Yang, Chengkai Wang, Yifei Chen, Yixuan Zhong, Zhenzhong Kuang, Jiajun ding, Xufei Yin, Yanming Zhu

机构 * Hangzhou Dianzi University(杭州电子科技大学) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Xiangtan University(湘潭大学) Griffith University(格里菲斯大学)

AI总结 本文提出统一的模块化框架,将3DGS超分辨率分解为先验注入和跨视图正则化,分析了多种方法的改进来源,并通过实验验证了方法的鲁棒性。

Comments The first to focus on the HRNVS of 3DGS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19564 2026-03-23 cs.LG

Wearable Foundation Models Should Go Beyond Static Encoders

可穿戴基础模型应超越静态编码器

Yu Yvonne Wu, Yuwei Zhang, Hyungjun Yoon, Ting Dang, Dimitris Spathis, Tong Xia, Qiang Yang, Jing Han, Dong Ma, Sung-Ju Lee, Cecilia Mascolo

机构 * Dartmouth College, USA(达特茅斯学院) University of Cambridge, UK(剑桥大学) The University of Melbourne, Australia(墨尔本大学) Google Research, UK(谷歌研究) Tsinghua University, China(清华大学)

AI总结 本文提出可穿戴基础模型需超越静态编码器,通过结构丰富数据、纵向感知多模态建模和代理推理系统实现连续性健康支持。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02435 2026-03-23 cs.LG

Efficient Cross-Domain Offline Reinforcement Learning with Dynamics- and Value-Aligned Data Filtering

高效跨领域离线强化学习中的动态与价值对齐数据筛选

Zhongjian Qiao, Rui Yang, Jiafei Lyu, Chenjia Bai, Xiu Li, Siyang Gao, Shuang Qiu

机构 * City University of Hong Kong University of Illinois Urbana-Champaign Tencent Institute of Artificial Intelligence, China Telecom (TeleAI) Tsinghua University. Corresponding Author

AI总结 本文提出DVDF方法,通过动态和价值对齐筛选源域样本,提升跨领域离线强化学习性能,实验表明其在多种任务和数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03992 2026-03-23 cs.CV

Camera-Aware Cross-View Alignment for Referring 3D Gaussian Splatting Segmentation

面向相机的跨视角对齐用于指称3D高斯点云分割

Yuwen Tao, Kanglei Zhou, Xin Tan, Yuan Xie

机构 * East China Normal University(东华师范大学) Tsinghua University(清华大学)

AI总结 本文提出CaRF框架,通过引入CAM和GCLA模块,实现3D高斯点云中跨视角指称的一致性对齐,提升分割性能。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19080 2026-03-23 cs.RO cs.AI

World4RL: Diffusion World Models for Policy Refinement with Reinforcement Learning for Robotic Manipulation

World4RL: 基于扩散世界模型的强化学习政策精修框架用于机器人操作

Zhennan Jiang, Kai Liu, Yuxin Qin, Shuai Tian, Yupeng Zheng, Mingcai Zhou, Chao Yu, Haoran Li, Dongbin Zhao

机构 * The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院) Beijing Zhongke Huiling Robot Technology Co(北京中科创联机器人技术有限公司) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 World4RL通过扩散世界模型提升机器人操作政策的精修效果,采用高保真模拟环境进行端到端政策优化,优于模仿学习及其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19228 2026-03-20 cs.CV

SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing

SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐

Xinyao Zhang, Wenkai Dong, Yuxin Song, Bo Fang, Qi Zhang, Jing Wang, Fan Chen, Hui Zhang, Haocheng Feng, Yu Lu, Hang Zhou, Chun Yuan, Jingdong Wang

机构 * Baidu(百度) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏