arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4517
2606.30677 2026-07-01 cs.GR cs.CV 新提交

DANTE-W: Diffuse Albedo Neural Texturing in the Wild

DANTE-W:野外场景的漫反射反照率神经纹理化

Guangyu Wang, Tianheng Lu, Ruqi Huang, Lu Fang

机构 * Tsinghua University(清华大学)

AI总结 提出DANTE-W神经纹理框架,利用神经表示融合生成式先验,通过物理神经渲染恢复高保真漫反射反照率纹理,提升重光照保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30699 2026-07-01 cs.LG physics.comp-ph 新提交

Joint discovery of governing partial differential equations from multi-source datasets by competitive optimization

基于竞争优化的多源数据集联合发现偏微分方程

Hao Xu, Siyu Lou, Yuntian Chen, Dongxiao Zhang

机构 * Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin, Eastern Institute of Technology(浙江工业智能与数字孪生重点实验室,东方理工高等研究院) Department of Electrical Engineering, Tsinghua University(清华大学电机工程系) Ningbo Institute of Digital Twin, Eastern Institute of Technology(东方理工高等研究院宁波数字孪生研究院)

AI总结 提出MCO-PDE框架,通过软竞争权重机制融合多源数据集,联合发现共享偏微分方程的结构和参数,在稀疏观测下高精度恢复经典方程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28322 2026-07-01 cs.CV 新提交

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

PerceptionRubrics:将多模态评估校准至人类感知

Yana Wei, Hongbo Peng, Yanlin Lai, Liang Zhao, Kangheng Lin, En Yu, Keyu Lv, Han Zhou, Yin Tang, Haodong Li, Mitt Huang, Hangyu Guo, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) StepFun Tsinghua University(清华大学) Independent Researcher(独立研究者)

AI总结 提出基于准则的评估框架PerceptionRubrics,通过双流准则和门控评分机制,解决基准分数饱和而实际脆弱性问题,揭示可靠性差距、开源与闭源感知差异,并实现与人类感知的高度对齐。

Comments ICML 2026. Project page: https://weiyana.github.io/PerceptionRubrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27922 2026-07-01 cs.CV cs.AI 新提交

Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding

Reflect-R1:长视频理解中基于证据驱动的自纠正反思

Shuimu Chen, Yuteng Chen, Yuanshen Guan, Zebang Cheng, Zeyu Zhang, Shengqian Qin, Bin Xia, Jiaran Li, Wenming Yang, Fei Ma

机构 * Tsinghua University(清华大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) University of California(加利福尼亚大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出Reflect-R1框架,通过直觉、验证、仲裁三阶段管道动态检索客观视觉证据,并设计阶段解耦强化学习算法SD-GRPO解决策略耦合,在长视频理解基准上达到最优性能。

Comments 2026 ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27313 2026-07-01 cs.CV 新提交

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

ViQ: 任意分辨率下的文本对齐视觉量化表示

Xumin Yu, Zuyan Liu, Zhenyu Yang, Yuhao Dong, Shengsheng Qian, Jiwen Lu, Han Hu, Yongming Rao

机构 * Tencent HY Vision Team(腾讯HY视觉团队) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Chinese Academy of Sciences(中国科学院)

AI总结 提出ViQ框架,通过文本对齐预训练和特征离散化两阶段量化学习,平衡离散表示中的语义与细节,支持原生分辨率输入,在多模态任务中取得与连续高维特征编码器相当的性能,并实现20%-70%的训练加速。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24330 2026-07-01 cs.CV 新提交

REDI-Match: Rotation-Equivariant Distillation for Efficient and Robust Dense Matching

REDI-Match: 旋转等变蒸馏实现高效鲁棒密集匹配

Yinji Ge, Guixu Zheng, Wulong Guo, Qian Feng, Xu Wu, Kai Zhou, Xinyuan Liu, Fei Xing

机构 * Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Beihang University(北京航空航天大学) Zhejiang University(浙江大学)

AI总结 提出REDI-Match框架,通过旋转等变蒸馏将视觉基础模型的语义知识注入轻量等变编码器,结合熵驱动空间对齐模块,在密集匹配中实现高效鲁棒的旋转不变性,在SatAst数据集上提升13.89%姿态精度且速度提升1.9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04991 2026-07-01 cs.RO 版本更新

Wavelet Policy: Imitation Learning in the Scale Domain with World Prior Memory

小波策略:基于世界先验记忆的尺度域模仿学习

Changchuan Yang, Haoxuan Xu, Yuhang Dong, Guanzhong Tian, Haizhou Ge, Hongrui Zhu

机构 * Zhejiang University(浙江大学) Tsinghua University, DISCOVER Robotics(清华大学,DISCOVER机器人实验室) Hangzhou TaiWeave Robotics Co., Ltd.(杭州太 weave 机器人有限公司)

AI总结 本文提出小波策略,结合世界先验记忆与小波多尺度动作建模,通过编码静态背景图像中的持久物理场景结构,提升长周期机器人操作的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21355 2026-07-01 cs.RO 版本更新

RPG: Robust Policy Gating for Smooth Multi-Skill Transitions in Humanoid Fighting

RPG: 为人类oid战斗中平滑多技能过渡的鲁棒策略门控

Yucheng Xin, Jiacheng Bao, Yubo Dong, Xueqian Wang, Bin Zhao, Xuelong Li, Junbo Tan, Dong Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学) Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出RPG框架,通过动作过渡随机化和时间随机化训练统一策略,实现人类oid多技能平滑稳定过渡,并设计控制管道整合步行/跑步与战斗技能,实验证明其有效性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21351 2026-07-01 cs.RO 版本更新

Learn Weightlessness: Imitate Non-Self-Stabilizing Motions on Humanoid Robot

学习失重:在人形机器人上模仿非自稳定动作

Yucheng Xin, Jiacheng Bao, Haoran Yang, Wenqiang Que, Dong Wang, Junbo Tan, Xueqian Wang, Bin Zhao, Xuelong Li

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University, China(人工智能与机器人中心,深圳国际研究生院,清华大学,中国) Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 本文提出了一种基于生物机制的失重机制,用于在人形机器人上实现非自稳定动作的模仿与环境交互,通过动态确定放松关节及程度,提升环境适应性与动作稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09919 2026-07-01 cs.CV 版本更新

MetricHMSR:Metric Human Mesh and Scene Recovery from Monocular Images

MetricHMSR:基于单目图像的度量人体网格与场景恢复框架

Chentao Song, He Zhang, Haolei Yuan, Haozhe Lin, Jianhua Tao, Hongwen Zhang, Tao Yu

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) Beihang University(北京航空航天大学)

AI总结 本文提出MetricHMSR框架,通过引入bounding camera ray map和HumanMoE模型,实现人体网格和场景的度量恢复,提升单目深度估计的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21173 2026-07-01 cs.RO cs.CV 版本更新

Multimodal Benchmark for Safety Assessment in Industrial Inspection Scenarios

工业检测场景安全评估的多模态基准

Zeyi Liu, Shuang Liu, Jihai Min, Zhaoheng Zhang, Jun Cen, Pengyu Han, Songqiao Hu, Zihan Meng, Xiao He, Donghua Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) DAMO Academy, Alibaba Group(阿里巴巴达摩院) School of Automation, Southeast University(东南大学自动化学院)

AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。

Comments 14 pages, 6 figures, Accepted by Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25682 2026-07-01 cs.CV 版本更新

Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples

少样本合成图像溯源:有限样本下识别未见生成器

Shiyu Wu, Shuyan Li, Jing Li, Jing Liu, Yequan Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peking University(北京大学)

AI总结 提出少样本合成图像溯源新范式,构建含45个生成器、117万图像的OmniFake数据集,并设计OmniDFA基线,实现少样本下识别未见生成器,在AIGI检测中达到最优泛化性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10141 2026-07-01 cs.CV 版本更新

PSHuman: Photorealistic Single-image 3D Human Reconstruction using Cross-Scale Multiview Diffusion and Explicit Remeshing

PSHuman: 使用跨尺度多视图扩散和显式重网格化的逼真单图像三维人体重建

Peng Li, Wangguandong Zheng, Yuan Liu, Tao Yu, Yangguang Li, Xingqun Qi, Xiaowei Chi, Siyu Xia, Yan-Pei Cao, Wei Xue, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Southeast University(东南大学) Tsinghua University(清华大学) VAST

AI总结 提出PSHuman框架,通过跨尺度多视图扩散和SMPL-X条件生成,解决单视图人体重建中的几何失真和自遮挡问题,实现高保真几何与纹理重建。

Comments CVPR2025, Project page: https://penghtyx.github.io/PSHuman

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30642 2026-06-30 cs.SD cs.AI

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

LeVo 2:通过层次表示建模和渐进式后训练实现稳定悦耳的歌曲生成

Shun Lei, Huaicheng Zhang, Dapeng Wu, Yaoxun Xu, Lishi Zuo, Wei Tan, Hangting Chen, Guangzheng Li, Jianwei Yu, Zhiyong Wu, Dong Yu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent(腾讯) Wuhan University(武汉大学) Hong Kong Polytechnic University(香港理工大学)

AI总结 提出LeVo 2混合LLM-Diffusion框架,通过层次化建模(先预测混合令牌进行语义规划,再并行预测人声和伴奏令牌)解决全曲生成中协调性与细节保真度的权衡,并引入美学引导训练策略,在主观和客观指标上超越开源基线,接近商业系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30445 2026-06-30 cs.LG

When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon

在线模仿学习何时有助于LLM后训练?(非)可实现性超越视界的作用

Huaqing Zhang, Jingchu Gai, Juno Kim, Bingbin Liu, Andrej Risteski

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校) Harvard University(哈佛大学)

AI总结 本文挑战误差累积是在线模仿学习优势主要来源的观点,证明在线交互的收益关键取决于设置是否可实现,并在非可实现情况下提出奖励相关的结构特征,使在线学习仍能取得高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30367 2026-06-30 cs.RO

FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation

FutureNav: 面向视觉与语言导航的统一世界-动作建模

Lingfeng Zhang, Zeying Gong, Xiaoshuai Hao, Haoxiang Fu, Qiang Zhang, Mingliang Zhou, Hangjun Ye, Xiaojun Liang, Junwei Liang, Wenbo Ding

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xiaomi EV(小米电动车) National University of Singapore(新加坡国立大学)

AI总结 提出FutureNav,一种基于VLM的统一世界-动作建模框架,通过联合优化动作策略、逆/前向动力学和未来状态预测四个目标,在4B规模骨干上实现多VLN基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30332 2026-06-30 cs.CV

UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception

UniGP:驯服扩散Transformer以实现先验保留的统一生成与感知

Qin Guo, Hao Luo, Dongxu Yue, Weixuan Jin, Xiao Fu, Fan Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Zeekr Automobile R&D Co., Ltd.(小鹏汽车研发有限公司)

AI总结 提出UniGP框架,基于MMDiT通过简单联合训练统一可控生成与密集预测,无需复杂任务设计,保留骨干先验,在多个任务上超越先前统一方法并与专用方法持平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30124 2026-06-30 cs.CV

SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

SciIR:面向科学图像推理生成的大规模训练数据集与基准

Zhiyuan Ma, Zhengfeng Shi, Yuning An, Peize Li, Jiabao Wei, Ruijie Li, Junhao Xiao, Jianjun Li, Bowen Zhou

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, China(华中科技大学计算机科学与技术学院,中国) School of Airspace Science and Engineering, Shandong University, China(山东大学航空航天科学与工程学院,中国) Department of Electronic Engineering, Tsinghua University, China(清华大学电子工程系,中国)

AI总结 为解决文本到图像模型在科学图像生成中语义对齐与逻辑推理不足的问题,构建了包含8万+高质量科学图像-文本对的SciIR-82k数据集,并提出三层次科学推理框架及可验证评估基准SciIR-Bench,微调模型Qwen-Image-SciIR在基准上得分从35%提升至43%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30044 2026-06-30 cs.LG

Building Multi-Task Agentic LLMs via Two-Phase Distillation

通过两阶段蒸馏构建多任务智能体LLM

Huaijie Wang, Shusheng Xu, Yi Wu, Kaifeng Lyu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团)

AI总结 提出两阶段蒸馏方法(先离策略后在线策略)解决多任务蒸馏中前向KL的模式覆盖问题,使单个模型在多任务上达到专家性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30024 2026-06-30 cs.CV cs.AI

IBRSteG: Learning a Generalizable Steganography Framework for 3D Gaussian Splatting

IBRSteG: 学习一种面向3D高斯泼溅的可泛化隐写框架

Fanye Kong, Hongyu Xia, Yu Zheng, Boyang Gong, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

AI总结 提出IBRSteG,一种可泛化的3DGS隐写框架,通过GAS网络学习场景无关的嵌入函数,将秘密3D高斯属性注入覆盖场景,无需逐场景微调即可重构隐写场景,实现高视觉质量、大容量和安全性。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30019 2026-06-30 cs.CV

OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data

OmniDance: 基于大规模互联网数据的多模态驱动舞蹈视频生成

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Chubin Chen, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

机构 * Renmin University of China(中国人民大学) AMAP, Alibaba Group(AMAP,阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Malou Tech Inc(Malou科技公司)

AI总结 提出CIPE-Dance大规模舞蹈视频数据集和OmniDance框架,通过深度感知架构、课程学习和条件引导策略,实现文本、音乐及多模态驱动的舞蹈视频生成,达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30014 2026-06-30 cs.CV

Shell-Supervised Gaussian Splatting for Urban Real-to-Sim Reconstruction

壳监督高斯溅射用于城市真实到仿真重建

Yuan Yang, Peijun Lu, Fangzhou Lu, Sai Fan, Siqi Yan, Chenyuan Zhang, Haobo Liang, Yichen Wang

机构 * Hong Kong Center for Construction Robotics(香港建设机器人中心) Tsinghua University(清华大学)

AI总结 提出壳监督高斯溅射框架,利用外部立面结构壳作为几何监督,通过掩码门控损失优化高斯重建,提升城市立面几何一致性。

Comments 10 pages main paper, 2 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30003 2026-06-30 cs.CV

GeoEdit: Geometry-Aware Object Editing via Dual-Branch Denoising

GeoEdit: 基于几何感知的双分支去噪对象编辑

Yi He, Jiangming Wang, Xinyu Wang, Mark Fong, Songchun Zhang, Yuxuan Xue, Hai-Tao Zheng, Yue Ma

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学) Peking University(北京大学) HKUST(香港科技大学) University of Tübingen(图宾根大学)

AI总结 提出GeoEdit,一种无需训练的三阶段管道,通过3D解耦、点对应对齐和双分支去噪,实现单张照片中对象的刚性几何变换(平移、旋转、缩放),同时保持背景自然和身份一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29976 2026-06-30 cs.CV

Learning Efficient 4D Gaussian Representations from Monocular Videos with Flow Splatting

利用流溅射从单目视频学习高效4D高斯表示

Shengjun Zhang, Jinzhao Li, Xin Fei, Yueqi Duan

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

AI总结 提出Flow Splatting方法,通过构建速度场并扩展溅射技术渲染光流,从单目视频中高效学习4D高斯表示,实现高质量动态场景重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29834 2026-06-30 cs.RO

STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning

STEAM: 面向真实世界机器人学习的自监督时间集成优势建模

Zhihao Liu, Qiuyi Gu, Yitao Wang, Dongming Qiao, Yixian Zhang, Shuaihang Chen, Liangzhi Shi, Tianxing Zhou, Zefang Huang, Kang Chen, Zhen Guo, Quanlu Zhang, Jincheng Yu, Xiaodan Liang, Guoliang Fan, Yu Wang, Feng Gao, Xinlei Chen, Chao Yu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Striding AI School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院) Pengcheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学) Peking University(北京大学) Infinigence AI

AI总结 提出自监督时间集成优势建模(STEAM),利用专家轨迹中帧对的时间偏移作为自监督信号,学习帧级优势以区分进展与失败,结合CFGRL在多种真实任务中提升策略成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29820 2026-06-30 cs.LG cs.AI

Dual-Flow Reinforcement Learning with State-Aware Exploration

双流强化学习与状态感知探索

Qijun Li, Zheng Fu, Qi Song, Yifei He, Weitao Zhou, Kun Jiang, Diange Yang

机构 * State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(智能绿色车辆与移动国家重点实验室,清华大学) Tsinghua University-Toyota Joint Center(清华大学-丰田联合中心) Tsinghua University–SAIC GM Wuling Joint Research Center(清华大学-上汽通用五菱联合研究中心)

AI总结 提出Dual-Flow RL框架,利用条件流匹配联合建模回报分布和多模态策略,并引入熵-协方差探索调节器实现状态感知探索,在连续控制任务中达到最优性能。

Comments 12 pages, 6 figures, 1 table. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29705 2026-06-30 cs.AI cs.CL cs.CV

GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots

GUICrafter: 利用海量无标注截图的弱监督GUI智能体

Sunqi Fan, Lingshan Chen, Runqi Yin, Qingle Liu, Yongming Rao, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文脉)

AI总结 提出GUICrafter,一种利用海量无标注截图通过课程学习框架训练GUI智能体的弱监督方法,显著降低对人工标注的依赖,在极少量标注数据下性能超越UI-TARS等先进系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29372 2026-06-30 cs.RO

SPACE: Swarm Pheromone Fields for Adaptive Collision-Aware Exploration

SPACE: 用于自适应碰撞感知探索的群体信息素场

Haohua Que, Haojia Gao, Mingkai Liu, Qian Zhang, Jiajun Sun, Fei Qiao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

AI总结 针对大规模地面机器人群体在拥挤环境中探索时的安全-效率权衡问题,提出SPACE方法,通过维护吸引前沿信息素、排斥探索信息素和快速机器人密度场实现去中心化协调,在真实建筑平面图上将碰撞率降低4-17倍,覆盖时间仅增加约2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29333 2026-06-30 cs.CV

HiReFF: High-Resolution Feedforward Human Reconstruction from Uncalibrated Sparse-View Video

HiReFF: 从未校准稀疏视角视频的高分辨率前馈式人体重建

Yiming Jiang, Hanzhang Tu, Wenfeng Song, Siyou Lin, Liang An, Shuai Li, Aimin Hao, Yebin Liu

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(北京航空航天大学虚拟现实技术与系统国家重点实验室) Tsinghua University, Beijing, China(清华大学) College of Computer Science, Beijing Information Science and Technology University, Beijing, China(北京信息科技大学计算机学院) Zhongguancun Laboratory, Beijing, China(中关村实验室)

AI总结 提出HiReFF,一种从四视角未校准视频前馈式重建2K分辨率360度人体视频的方法,通过尺度同步相机校准和高斯前景掩码实现干净前景重建,并利用高分辨率侧调优在保持骨干网络0.5K分辨率下实现2K渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29296 2026-06-30 cs.AI

Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners

过程优势信号塑形:用于LLM推理器过程监督强化学习的范式无关中间件

Chao Wang, Hongtao Tian, Tao Yang, Yunsheng Shi, Ting Yao, Wenbo Ding

机构 * Tsinghua University(清华大学) WeChat, Tencent(微信、腾讯)

AI总结 提出PASS中间件,通过优势融合、按值分块和长度分割解决GRPO在过程监督强化学习中的通道污染、分辨率不匹配和累积陷阱问题,在数学推理和多跳问答任务上持续提升pass@1。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏