arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 614
2607.03847 2026-07-07 cs.LG 新提交

NeSy-CSA: A Neuro-Symbolic Framework for Open-Ended Critical Scenario Attribution

NeSy-CSA:一种用于开放式关键场景归因的神经符号框架

Qitong Chu, Xunjie He, Chen Deng, Huaxin Pei, Yufeng Yue

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 研究如何理解场景测试中关键场景的成因,提出神经符号框架NeSy-CSA,通过选择相关因素缩小归因空间,经证据图使推理可追溯,结合符号与神经推理,提升关键场景归因有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03784 2026-07-07 cs.CV cs.AI 新提交

Rethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware Perspective

重新思考视觉Transformer的深度剪枝:一种异构感知视角

Zhenfeng Su, Kang Zhao, Han Bao, Tao Yuan, Zhongzhe Hu, Xianzhi Yu, Wenxuan Wang

机构 * Tsinghua University, Beijing, China(清华大学,北京)

AI总结 研究指出现有深度剪枝方法因忽视层间异构性而失败,提出异构感知深度剪枝方法HetDPT,避免维度不匹配,实验验证其有效性,与宽度剪枝结合创极端剪枝新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03771 2026-07-07 cs.CV 新提交

City-Level 3D Surface Reconstruction with Viewpoint Orientation Partitioning and Scene Completion

基于视点方向划分和场景补全的城市级三维表面重建

Liang Han, Wenyuan Zhang, Junsheng Zhou, Yu-Shen Liu, Zhizhong Han

机构 * School of Software, Tsinghua University(清华大学软件学院) Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)

AI总结 针对多视图三维表面重建难题,提出基于视点方向的场景划分方法,确保相似方向视图共同参与以精确估计深度,并行计算更均衡,还提出检测修复点云缺失区域策略,提升大规模场景重建质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03765 2026-07-07 cs.CV 新提交

Sparse-View Surface Reconstruction using Gaussian Splatting through High-Confidence Depth Propagation with Normal Priors

通过具有法线先验的高置信度深度传播,使用高斯点云进行稀疏视图曲面重建

Liang Han, Bangcai Wei, Junsheng Zhou, Yu-Shen Liu, Zhizhong Han

机构 * School of Software, Tsinghua University(清华大学软件学院) China Telecom(中国电信) Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)

AI总结 研究稀疏视图的3D重建难题,提出基于3D高斯点云的方法,用法线引导深度传播扩展深度信息,引入异常深度边缘感知正则化处理深度不连续,实验表明该方法优于现有技术。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03748 2026-07-07 cs.AI 新提交

Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

将交错多模态推理作为统一决策过程进行衔接

Zican Hu, Xuyang Hu, Yiming Liu, Zuwei Long, Wei Liu, Yunzhuo Hao, Jiawei Gu, Linjie Li, Yu Cheng, Zhenhong Sun, Weibo Gu, Xing Sun, Zhi Wang

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Washington(华盛顿大学) The Chinese University of Hong Kong(香港中文大学) Australian National University(澳大利亚国立大学)

AI总结 研究统一多模态模型中强化学习优化多轮生成的问题,提出BRAID框架,将文本-图像-文本推理视为统一马尔可夫决策过程,通过单一强化学习目标联合优化文本和视觉生成,实验表明该框架性能优于基线。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03696 2026-07-07 cs.CV 新提交

IPDiff: Diffusion-driven ORSI Salient Object Detection with Information Reconstruction and Multi-Prior Guidance

IPDiff:基于信息重构和多先验引导的扩散驱动光学遥感图像显著目标检测

Gongyang Li, Zhen Bai, Runmin Cong, Dan Zeng, Weisi Lin, Xiao-Ping Zhang

机构 * School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) Department of Medical Equipment, the First Affiliated Hospital of Zhengzhou University(郑州大学第一附属医院医学装备部) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院深圳泛在数据赋能重点实验室)

AI总结 提出IPDiff,一种基于独特动态优化策略的扩散驱动光学遥感图像显著目标检测方法,通过提取多先验信息,在去噪网络中迭代去噪生成显著图,并经混合损失函数监督训练,性能优于46种先进方法。

Comments 22 pages, 8 figures, accepted by IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03580 2026-07-07 cs.LG cs.CV 新提交

When Geometry Aligns: Dihedral Hidden-State Transformations in UNet, ViT, and DiT Architectures

当几何对齐时:UNet、ViT和DiT架构中的二面体隐藏状态变换

Mojtaba Faramarzi, Alex Lamb, Irina Rish

机构 * University of Montreal(蒙特利尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Tsinghua University(清华大学)

AI总结 研究通过将二面体群基于反射的元素应用于中间隐藏状态作为受控内部干预,对比几何一致和不一致变体,分析特征稳定性和几何漂移,发现一致变换可提高稳定性,为稳定隐藏状态干预确立关键原则。

Comments Accepted at the Conference on Lifelong Learning Agents (CoLLAs), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03524 2026-07-07 cs.CV 新提交

Perceptual Flow Matching for Few-Step Generative Modeling

用于少步生成建模的感知流匹配

Chuyang Zhao, Yifei Song, Hongfa Wang, Jianlong Yuan, Yuan Zhang, Siming Fu, Zhineng Chen, Huilin Deng, Haoyang Huang, Nan Duan

机构 * Joy Future Academy(京东探索研究院) Fudan University(复旦大学) Tsinghua University(清华大学) USTC(中国科学技术大学)

AI总结 提出感知流匹配框架,在感知特征空间监督流匹配,改进少步生成能力,减少采样步骤,无需教师模型和辅助分数网络,实验表明其能产生高质量结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03333 2026-07-07 cs.DC cs.AI cs.LG 新提交

SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference

SPORK:自我推测性分叉以加速智能体大语言模型推理

Huajun Bai, Weiwei Lv, Huichuan Zheng, Youyou Lu, Jiwu Shu

机构 * Tsinghua University(清华大学) Meituan(美团)

AI总结 研究LLM智能体推理中串行循环耗时问题,提出SPORK方法,利用模型自身预测提前调度推测工具调用,通过成本模型等组件优化,大幅提升推理效率且不影响任务准确性。

Comments 16 pages, 15 figures. Code: https://github.com/baihuajun24/spork

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03329 2026-07-07 cs.LG stat.ME 新提交

Statistically Meaningful Geometry (SMG) Beyond the Euclidean Paradigm, with Application to Generative AI

超越欧几里得范式的统计有意义几何(SMG)及其在生成式人工智能中的应用

Bing Cheng, Yi-Shuai Niu, Howell Tong, Shing-Tung Yau

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) AMSS Center for Forecasting Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院预测科学研究中心) Beijing Institute of Mathematical Sciences and Applications (BIMSA)(北京国际数学研究中心) Department of Statistics, London School of Economics and Political Science(伦敦政治经济学院统计系) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) Paula and Gregory Chow Institute for the Studies in Economics, Xiamen University(厦门大学经济研究所(保拉和格雷戈里·周研究所)) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心)

AI总结 研究大规模过参数化模型问题,引入SMG框架,将确定性参数模型提升到无限维非参数Orlicz统计流形,建立双重推理范式,证明可抑制生成幻觉并消除灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03283 2026-07-07 cs.AI 新提交

Embodied Operators and Benchmarking: Toward Reusable and Deployable Embodied Intelligence Systems

具身算子与基准测试:迈向可复用和可部署的具身智能系统

Junwu Xiong, Jiaxuan Gao, Wei Chai, Renxing Chen, Yuzhen Li, Yu Guo, Yucheng Guo, Mingxi Luo, Wenyang Ma, Yiyun Mou, Yifei Zhang, Chen Zhou, Yongjian Guo

机构 * JDT Tsinghua University(清华大学) Tianjin University(天津大学) Beihang University(北京航空航天大学)

AI总结 研究具身智能系统中可复用功能模块即具身算子,明确其定义边界、构建分类法,提出多维度基准框架,探讨加速及挑战,为具身智能系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03213 2026-07-07 cs.CV cs.AI cs.CL cs.HC 新提交

OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual Assistance

OpenGlass:用于本地MLLM驱动的实时视觉辅助的传感-计算分离架构

Mengzhang Li, Yuan Yao

机构 * Shanghai Qizhi Institute(上海期智研究院) College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 针对视障和低视力用户,OpenGlass以传感-计算分离解决云MLLM辅助需上传数据、有网络延迟,以及可穿戴眼镜计算和电量受限问题,在本地设备实现低延迟多模态视觉辅助,并给出评估结果。

Comments Accepted to ACL 2026 System Demonstrations. 11 pages, 5 figures, 8 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations), pages 829-839, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03182 2026-07-07 cs.RO cs.AI 新提交

AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning

AnchorVLA:为视觉-语言-动作规划连接离散决策与连续轨迹

Qi Liu, Yabei Li, Hongsong Wang, Heng Zhang, Lei He

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与交通国家重点实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Meituan Inc.(美团公司) Dongfeng Motor Corporation(东风汽车公司)

AI总结 自动驾驶规划需将多种信息转化为连续轨迹,现有视觉-语言-动作(VLA)规划器有局限。提出AnchorVLA框架,用轨迹模式锚连接高层VLA推理与连续轨迹执行,提升效率、语义动作对齐和生成灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03093 2026-07-07 cs.CL cs.AI 新提交

Don't Wait to Reply: Towards Responsive yet Thoughtful Dialogue through Proactive Thinking

不要等待回复:通过主动思考实现响应迅速且深思熟虑的对话

Ante Wang, Jiaqi Fu, Xuanyi Chen, Ruotian Ma, Zhaopeng Tu, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Tencent(腾讯)

AI总结 研究针对大语言模型被动思考导致对话延迟问题,提出主动思考框架,介绍无训练基线,通过模拟实时对话流基准测试,证明该方法提升交互效率且不损性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03065 2026-07-07 cs.LG cs.AI 新提交

Spectral Rewiring for Exploration, Purification, and Model Merging

用于探索、提纯和模型合并的频谱重布线

Zhilong Zhang, Hongli Yu, Huan-ang Gao, Hanlin Wu, Yuxuan Song, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

机构 * SIA-Lab of Tsinghua AIR(清华-字节跳动联合研究中心SIA实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

AI总结 研究强化学习中参数更新瓶颈,提出子空间对齐重布线方法,保留频谱核心去除正交分量,可提纯训练更新、实现模型合并,提升推理和跨域性能,是无训练机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02872 2026-07-07 cs.LG 新提交

Poisson-Gamma Modeling of Inter-Relational Dependencies in Dynamic Knowledge Graphs

动态知识图谱中关系间依赖的泊松-伽马建模

Nan Fang, Yijun Wang, Hao Liao, Sikun Yang

机构 * Tsinghua University(清华大学) Guangdong Provincial Key Laboratory of Mathematical and Neural Dynamical Systems(广东省数学与神经动力学系统重点实验室)

AI总结 针对动态知识图谱的时间和关系依赖建模难题,提出PGRE模型,用泊松-伯努利公式表示多关系时间链接,引入伽马分布潜变量,通过伽马马尔可夫过程建模潜变量时间演化,实验表明该模型在链接预测上性能良好。

Comments Accepted at the 42nd Conference on Uncertainty in Artificial Intelligence (UAI 2026). 20 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02642 2026-07-07 cs.RO 新提交

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

GigaWorld-1:构建用于机器人策略评估的世界模型路线图

GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

机构 * GigaAI(巨元人工智能) Tsinghua University(清华大学)

AI总结 研究机器人策略评估中世界模型,介绍WMBench基准,通过分析多种模型、方案及大量模拟策略展开,得出评估器质量受长期动作忠实性影响等核心见解,推导出设计路线图并实现GigaWorld-1。

Comments Project page: https://open-gigaai.github.io/giga-world-1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02607 2026-07-07 cs.CV cs.CL 新提交

Latent Visual Cache for Video Reasoning

用于视频推理的潜在视觉缓存

Yongheng Zhang, Zhipeng Xu, Hao Wu, Yinghui Li, Di Yin, Xing Sun, Philip S. Yu

机构 * Tencent Youtu Lab(腾讯优图实验室) Tsinghua University(清华大学) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

AI总结 研究视频推理中视觉锚定衰减问题,提出潜在视频缓存Latent-VC插入解码器,通过监督对比缓存对齐等训练,在多视频基准测试中表现优于基线,能保留视觉证据提升推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02604 2026-07-07 cs.CV cs.RO 新提交

DynaWM: A Base-VLA-Guided World Foundation Model for Moving-Object Manipulation

DynaWM:用于移动物体操纵的基于基础VLA的世界基础模型

Chongkei Chang, Zhidong Deng

机构 * Department of Computer Science and Technology, THUAI, Tsinghua University, Beijing 100084, China(计算机科学与技术系,THUAI,清华大学,北京100084,中国)

AI总结 针对移动物体操纵挑战,提出DynaWM模型,用多种编码器提取特征,联合条件流匹配DiT生成动作轨迹,构建数据集评估,相比其他模型有性能提升,消融实验验证各部分作用。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01290 2026-07-07 cs.CV 新提交

AnchorSplat: Fast and Structure Consistent Detail Synthesis for Gaussian Splatting

AnchorSplat:用于高斯泼溅的快速且结构一致的细节合成

Dexu Zhu, Jiangnan Shao, Xiaofeng Wang, Junxian Duan, Jie Cao, Zheng Zhu, Huaibo Huang

机构 * MAIS&NLPR, CASIA(中国科学院自动化研究所模式识别国家重点实验室) GigaAI ShanghaiTech University(上海科技大学) Tsinghua University(清华大学)

AI总结 提出AnchorSplat,一种端到端3D原生深度网络,通过点锚机制实现几何一致性,无需原始多视图图像,在3DGS-SR基准上实现比优化方法快10^5倍的细节合成。

Comments Accepted by ECCV2026. Code: https://github.com/zhude233/AnchorSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31672 2026-07-07 cs.CV cs.AI 新提交

WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models

WorldRoamBench:交互式世界模型长时稳定性的开放世界基准

Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jiang, Mu Xu, Qi Fan, Yang Gao, Yong Li, Baoquan Chen

机构 * AMAP CV Lab, Alibaba Group(阿里巴巴集团AMAP CV实验室) Nanjing University(南京大学) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 提出WorldRoamBench基准,从动作、视觉、物理和记忆四维度评估交互式世界模型的长时稳定性,包含600+测试用例,揭示现有模型在所有维度均不理想。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24633 2026-07-07 cs.RO 新提交

Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation

超越单调进展:面向机器人模仿的重试监督值学习

Xinyao Qin, Junjie Lu, Kaixin Wang, Chuheng Zhang, Sinjae Kang, Kimin Lee, Min Xu, Bin Liang, Jun Yang, Li Zhao

机构 * Tsinghua University(清华大学) University of Technology Sydney(技术科技大学) Microsoft Research Asia(微软亚洲研究院) KAIST(韩国科学技术院)

AI总结 针对机器人模仿学习中演示数据包含错误与修正行为的问题,提出ReTVL框架,利用重试事件作为稀疏监督学习对错误敏感的值函数,通过全局进度校准与局部偏好学习捕捉错误-恢复结构,优化下游行为克隆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24530 2026-07-07 cs.CL 新提交

NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

NatureBench: 编码智能体能达到Nature系列论文已发表SOTA水平吗?

Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng Huang, Kai Tian, Zhenzhao Yuan, Jincheng Zhong, Weizhi Wang, Ning Ding, Bowen Zhou, Kaiyan Zhang

机构 * Horizon Research(地平线研究) Tsinghua University(清华大学)

AI总结 提出跨学科基准NatureBench,包含90个来自Nature系列论文的任务,评估AI编码智能体在真实科学问题上的发现能力。最强模型仅在17.8%任务上超越SOTA,失败主因是方法选择错误和计算预算不足。

Comments Add results of GLM-5.2 and MinMax-M3

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12555 2026-07-07 cs.SD cs.CV cs.MM 新提交

AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

AudioX-Turbo:高效任意到音频生成的统一框架

Zeyue Tian, Lei Ke, Zhaoyang Liu, Ruibin Yuan, Liumeng Xue, Yujiu Yang, Weijia Chen, Xu Tan, Qifeng Chen, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Noiz AI Independent Researcher(独立研究员)

AI总结 提出AudioX-Turbo,基于教师-学生范式的统一高效框架,通过多模态扩散Transformer和分布匹配蒸馏实现文本、视频、音频到音频的生成,仅需4步采样,NFE减少约25倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10522 2026-07-07 cs.CV 新提交

GUI-AC: Enhancing Continual Learning in GUI Agents

GUI-AC:增强GUI代理的持续学习能力

Can Lin, Tao Feng, Hangjie Yuan, Dan Zhang, Yifan Zhu, Zhonghong Ou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 针对GUI代理在持续学习中的分布漂移和强化微调不稳定性问题,提出GUI-AC方法,通过自适应优势和动态裁剪机制提升性能,超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02440 2026-07-03 cs.AI cs.CL 新提交

EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

EvoPolicyGym:评估交互环境中的自主策略进化

Zhilin Wang, Han Song, Runzhe Zhan, Jusen Du, Jiacheng Chen, Tianle Li, Qingyu Yin, Yulun Wu, Zhennan Shen, Tong Zhu, Yanshu Li, Guanjie Chen, Derek F. Wong, Yafu Li, Yu Cheng, Yang Yang

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) University of Macau(澳门大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Soochow University(苏州大学) Brown University(布朗大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出自主策略进化评估框架,通过EvoPolicyGym基准测试代理在固定交互预算下迭代改进策略的能力,GPT-5.5在16个环境中表现最优,并揭示预算分配与反馈转化机制。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02431 2026-07-03 cs.RO cs.AI 新提交

WorldSample: Closed-loop Real-robot RL with World Modelling

WorldSample:基于世界建模的闭环真实机器人强化学习

Yuquan Xue, Le Xu, Zeyi Liu, Zhenyu Wu, Zhengyi Gu, Xinyang Song, Bofang Jia, Ziwei Wang

机构 * PINE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电气与电子工程学院PINE实验室) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) School of Automation, Central South University, Changsha, China(中南大学自动化学院) School of Automation, Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学自动化学院)

AI总结 提出WorldSample框架,通过物理 rollout、世界模型生成与策略改进的闭环,结合策略节奏学习(PPL)调节训练,在接触性精密操作任务中成功率提升28%,训练步数减少59%。

Comments 16 pages, 9 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02332 2026-07-03 cs.RO 新提交

HEFT: Heavy-Payload Full-size Humanoid Teleoperation with Privileged Motion Guidance and Windowed Payload Curriculum

HEFT:具有特权运动引导和窗口化负载课程的重载全尺寸人形遥操作

Chenxin Liu, Qingzhou Lu, Guangxiao Yang, Xuanyang Shi, Chenghan Yang, Yanjiang Guo, Jianyu Chen

机构 * Tsinghua University(清华大学) RobotEra Shanghai Qizhi Institute(上海启智研究院)

AI总结 提出HEFT框架,通过特权运动引导和窗口化负载课程,实现全尺寸人形机器人在重载下的鲁棒运动跟踪与遥操作,并在L7人形机器人上验证了高达24kg负载下的多种动作。

Comments Project Page: https://heft.axell.top/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02262 2026-07-03 cs.CL 新提交

CheckRLM: Effective Knowledge-Thought Coherence Checking in Retrieval-Augmented Reasoning

CheckRLM: 检索增强推理中的有效知识-思维连贯性检查

Dingling Xu, Ruobing Wang, Qingfei Zhao, Yukun Yan, Zhichun Wang, Daren Zha, Shi Yu, Zhenghao Liu, Shuo Wang, Xu Han, Maosong Sun

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education(北京人工智能教育重点实验室) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University(清华大学人工智能研究院计算机科学与技术系) Northeastern University(东北大学)

AI总结 提出CheckRLM框架,通过检索增强生成及时检查和纠正推理链中的事实错误,确保推理与知识一致,降低长程推理错误累积成本。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02015 2026-07-03 cs.CV cs.AI 新提交

Mirror Illusion Art

镜像错觉艺术

Xiaopei Zhu, Zeyuan Li, Jun Zhu, Xiaolin Hu

机构 * Department of Computer Science and Technology, BNRist, Tsinghua University(清华大学计算机科学与技术系,北京信息科学与技术国家研究中心) Huazhong University of Science and Technology(华中科技大学) IDG/McGovern Institute for Brain Research, Tsinghua University(清华大学IDG/麦戈文脑科学研究院) Chinese Institute for Brain Research (CIBR)(北京脑科学与类脑研究中心)

AI总结 提出AutoMIA自动设计管道,联合优化形状与颜色,通过四种机制稳定优化并抑制伪影,实现从两张目标图像到可打印3D物体的镜像错觉艺术生成。

Comments CVPR 2026 Highlight, also got an Efficient CVPR award

详情

展开后加载摘要…

URL PDF HTML 收藏