arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-08-07 至 2026-08-07 共收录 20
2608.06346 2026-08-07 cs.AI 新提交

TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories

TRAJDEBUG:追踪错误生命周期以识别长视野智能体轨迹中的关键失败

Yunjia Qi, Zehua Yin, Xintong Shi, Hao Peng, Songyuanyi Lu, Yixian Liu, Richeng Xuan, Yuhong Liu, Zhichao Hu, Xiaozhi Wang, Lei Hou, Bin Xu, Juanzi Li

机构 * Tsinghua University(清华大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent Hunyuan(腾讯混元)

AI总结 针对长视野智能体轨迹调试的级联错误与关键错误定位难题,提出TrajDebug框架,构建含486条轨迹的TrajErrBench基准,实验显示其性能优于现有基线,可提供改进智能体的可操作反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06332 2026-08-07 cs.RO 新提交

GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions

GeniWorld:一种用于机器人操作的可泛化交互式世界模型

Chenghao Gu, Hanyang Yu, Jingbo Zhang, Haitao Lin, Wenyao Zhang, Jinghe Wang, Hanglei Jin, Shuzhao Xie, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent Robotics X(腾讯Robotics X实验室) The Hong Kong University of Science and Technology(香港科技大学) Shenzhen Technology University(深圳技术大学)

AI总结 针对通用机器人策略在复杂环境中鲁棒性不足的问题,提出GeniWorld交互式世界模型,通过解耦本体与环境动态、构建自回归视频预测模型实现泛化,可用于策略评估并提升下游操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05987 2026-08-07 cs.AI cs.LG 新提交

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

AgentOPSD:面向智能体强化学习的递归自蒸馏方法

Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Jie Wu, Zhengzhou Cai, Yueqing Sun, Ziang Ye, Linji Hao, Qi Gu, Xunliang Cai, Yongliang Shen, Yujiu Yang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Meituan(美团)

AI总结 提出 AgentOPSD 这一无 critic 的递归自蒸馏方法,用于智能体强化学习的轮次级 credit 分配,在 ALFWorld 等数据集上优于 GRPO 等基线,在 Qwen2.5-7B 模型上实现 ALFWorld 89.1% 的成功率。

Comments Code: https://github.com/ZethWang/AgentOPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05970 2026-08-07 cs.RO cs.AI 新提交

SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

SkillMemo:用于组合式具身操纵的专家引导技能记忆框架

Changyuan Wang, Chubin Zhang, Zhenyu Wu, Runhao Li, Angyuan Ma, Ke Chao, Yinan Liang, Xiuwei Xu, Ziwei Wang, Yansong Tang, Jiwen Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Automation, Tsinghua University(清华大学自动化系) Nanyang Technological University(南洋理工大学) Beijing Normal University(北京师范大学)

AI总结 SkillMemo是一种专家引导的技能记忆框架,通过分解轨迹为技能基元并结合动态记忆库,提升了DP和VLA模型的组合泛化能力,在基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05964 2026-08-07 cs.CV 新提交

Topology-Aware Neighborhood Learning for Source-Free Cross-Scene Hyperspectral Image Classification

面向无源域跨场景高光谱图像分类的拓扑感知邻域学习

Qingmei Li, Juepeng Zheng, Jiarui Zhang, Jianxi Huang, Haohuan Fu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) Faculty of Geosciences and Engineering, Southwest Jiaotong University(西南交通大学地球科学与环境工程学院) College of Land Science and Technology, China Agricultural University(中国农业大学土地科学与技术学院) National Supercomputing Center in Shenzhen(国家超级计算深圳中心)

AI总结 本文针对无源域跨场景高光谱图像分类问题,提出拓扑感知无源学习框架,通过EMP优化伪标签、CNT编码特征空间几何结构,实验表明其性能优于当前最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05742 2026-08-07 cs.LG cs.AI 新提交

Multivariate Time Series Forecasting needs Cross Variable Loss

多变量时间序列预测需要跨变量损失

Kuiye Ding, Yifan Hu, Hanchen Wang, Hao Xue

机构 * University of Technology Sydney(悉尼科技大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对直接预测范式未显式约束跨变量结构的问题,提出跨变量损失CvLoss作为结构正则化项,可提升多变量时间序列预测模型性能,适配多种骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05723 2026-08-07 cs.RO 新提交

ATP: Anatomical Torque with Passivity-based Control Framework for Safe Upper-Limb Exoskeleton Assistance

ATP:基于无源控制框架的解剖学力矩用于安全上肢外骨骼辅助

Yu Chen, Gong Chen, Xiang Li

机构 * Tsinghua University(清华大学) Shenzhen MileBot Robotics Co., Ltd(深圳迈宝机器人有限公司)

AI总结 该研究提出ATP无源控制框架,通过仿真训练的强化学习控制器等实现上肢外骨骼安全辅助,可降低目标肌肉活动最高达48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05716 2026-08-07 cs.AI 新提交

BlockPython: A Process-Aware Agent-Supported Platform for the Transition from Block-Based to Python Programming

BlockPython:一种支持从积木式编程向Python编程过渡的进程感知智能体平台

Jesse Yusuf Chan, Haoming Wang, Mingwei Xu, Xianlong Xu

机构 * East China Normal University(华东师范大学) Tsinghua University(清华大学) University of Washington(华盛顿大学)

AI总结 BlockPython是支持从积木式编程向Python过渡的平台,以双向转换为核心,通过四阶段引导学习者,利用进程证据诊断困难,为相关系统设计提供参考。

Comments AIED 2026 Interactive Event Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05597 2026-08-07 cs.CV 新提交

Uncertainty-Aware World Model for Aerial Image-Goal Navigation

面向航拍图像目标导航的不确定性感知世界模型

Deyi Zhu, Haoyu Fan, Yinan Zhu, Weichen Zhang, Shilin Ma, Xinlei Chen, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 针对航拍图像目标导航中现有世界模型的未来状态预测不足问题,提出UA-NWM模型,将轨迹评分建模为条件分布外检测,仅用不可解释残差评分,实验验证其性能与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05254 2026-08-07 cs.CL cs.SC 新提交

Constraint-First Reasoning: A Training-Free Protocol for Exploiting Answer-Space Constraints in Mathematical Problem Solving

约束优先推理:一种在数学问题求解中利用答案空间约束的无训练协议

Hongbo Ma, Bangji Yang, Yunqian Selina Cheng, Jiajun Fan, Hanwen Zhang, Ge Liu

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 该研究针对大型语言模型解数学题易违反约束的问题,提出无训练的两阶段提示协议CFR,经多数据集及多维度实验验证可提升性能,是针对性的测试时干预措施。

Comments 53 pages, 5 figures, 36 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05207 2026-08-07 cs.LG 新提交

When Do Corrective Features Help? An Agent for Corrective Feature Discovery on Black-Box Forecasters

纠正特征何时有用?面向黑盒预测器的纠正特征发现智能体

Fangxin Wang, Ziyi Zhang, Diyi Zhuang, Langzhou He, Shiyu Wang, Baichuan Mo, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Texas A&M University(德克萨斯农工大学) Massachusetts Institute of Technology(麻省理工学院) Tsinghua University(清华大学)

AI总结 本文提出CRAFTER智能体,挖掘黑盒冻结预测器的残差以生成纠正特征,在6个数据集和6个主干上优于现有系统,使改进翻倍、误差降27%,可归因特征来源。

Comments 23 pages, 14 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05156 2026-08-07 cs.CL 新提交

Scaffold-Mediated Post-Training: Co-Evolving Model Parameters and Procedural Scaffold Graphs

支架介导的后训练:协同演化模型参数与程序性支架图

Fei Ding, Yongkang Zhang, Runhao Liu, Yuhao Liao, Zijian Zeng, Huiming Yang

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

AI总结 该研究针对大型语言模型后训练中参数与推理支架脱节的问题,提出支架介导的后训练范式,通过协同演化实现技能提升,在FeatureBench上较标准SFT取得显著性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05152 2026-08-07 cs.CL cs.AI 新提交

Mean-Field Dynamics of Chain-of-Thought Reasoning in Large Language Models

大型语言模型中思维链推理的平均场动力学

Hao Ai

机构 * Tsinghua University(清华大学)

AI总结 本研究提出框架,将LLM推理建模为线索图引导式发现过程,用平均场近似推导线索占比的常微分方程,实验验证所得统计规律可复现且能被该方程拟合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05990 2026-08-07 cs.AI cs.CE physics.app-ph physics.optics 新提交

OPERA: Operator-residual feedback for reliable autonomous optical experiments with language-model agents

OPERA:面向语言模型智能体的可靠自主光学实验的算子残差反馈

Ning Xu, Xiang Zheng, Fuqiang Zhong, Huadong Wang, Xiaolong Wu, Zhiyuan Liu, Hui Ning

机构 * Tsinghua University(清华大学) ModelBest Inc.(模贝斯特公司) Hunan University(湖南大学) Northwest Institute of Nuclear Technology(西北核技术研究所)

AI总结 本研究提出面向语言模型智能体的OPERA算子残差框架,将实验动作表示为光学算子并结合物理解释残差评估,在三项光学任务中可减少无物理改进的决策占比,提升任务目标达成概率并降低实验预算。

Comments 34 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04657 2026-08-07 cs.CV 版本更新

MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight

MobileWAM:用前瞻链将世界动作模型(WAM)与移动操作任务对接

Zehua Fan, Junjie He, Wenxuan Song, Xi Wang, Wenqi Lyu, Linge Zhao, Fuhao Li, Zihan You, Yifei Yang, Kaiming Xu, Qi Jiang, Yue Jiang, Haoang Li, Cheng Chi, Feng Gao, Bailin Li, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) AIR Wuxi Innovation Center, Tsinghua University(清华大学AIR无锡创新中心) The University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Southeast University(东南大学) Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Li Auto(理想汽车) School of Information, Renmin University of China(中国人民大学信息学院)

AI总结 MobileWAM是一种混合Transformer架构,通过前瞻链(CoF)解决移动操作的异质动态问题,在ManiSkill-HAB上超越SOTA策略,可微调至真实移动操作机器人且泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14299 2026-08-07 cs.CV cs.LG 版本更新

What Drives Test-Time Adaptation for CLIP? A Controlled Empirical Study from an Update Perspective

什么驱动了CLIP的测试时适应?从更新视角进行的受控实证研究

Jiazhen Huang, Xiao Chen, Zhiming Liu, Yaru Sun, Jingyan Jiang, Zhi Wang

机构 * Tsinghua University(清华大学) Shenzhen Technology University(深圳技术大学)

AI总结 本文通过受控实证研究,从更新视角分析了CLIP测试时适应方法的驱动因素,揭示了适应增益主要来自测试时证据和可靠代理,而非繁重优化,并指出无单一范式普遍最优。

Comments Benchmark and codes are available at https://github.com/walawalagoose/TTABC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03750 2026-08-07 cs.CR cs.AI cs.CL 版本更新

CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering

CREBench:评估大语言模型在密码二进制逆向工程中的能力

Baicheng Chen, Yu Wang, Ziheng Zhou, Xiangru Liu, Juanru Li, Yilei Chen, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Institute of Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Xiongan AI Institute(雄安人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学)

AI总结 本文提出CREBench基准,通过432个基于密码算法的挑战评估大语言模型在密码二进制逆向工程中的性能,发现GPT-5.4在该任务中表现优异,人类专家仍具优势。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19477 2026-08-07 eess.SP cs.AI

Hybrid Bit and Semantic Communications

Kaiwen Yu, Renhe Fan, Gang Wu, Zhijin Qin

机构 * National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China(电子科技大学无线通信国家重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

Journal ref Sci. China Inf. Sci. 69, 119301 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12226 2026-08-07 cs.CV 版本更新

Ultrasound Tomography of Musculoskeletal Tissues with Generative Neural Physics

生成式神经物理实现组织力学的定量体积超声成像

Zhijun Zeng, Youjia Zheng, Chang Su, Qianhang Wu, Hao Hu, Zeyuan Dong, Yang Lv, Ligang Cui, Zhiyong Hou, Weijun Lin, Zuoqiang Shi, Yubing Li, He Sun

机构 * College of Future Technology, Peking University(未来技术学院,北京大学) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心) Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) School of Physical Sciences, University of Chinese Academy of Sciences(中国科学院大学物理科学学院) School of EECE, University of Chinese Academy of Sciences(中国科学院大学电子工程与计算机科学学院) Department of Orthopedics, Peking University Third Hospital(北京大学第三医院骨科部) Department of Ultrasound, Peking University Third Hospital(北京大学第三医院超声科) Department of Orthopaedic Surgery, The Third Hospital of Hebei Medical University(河北医科大学第三医院骨科部) Yau Mathematical Sciences Center, Tsinghua University(清华大学姚期智数学科学中心) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications(北京燕琦湖数学科学与应用研究院)

AI总结 该研究提出生成式神经物理框架,结合生成网络与物理信息神经模拟,实现了快速高保真三维超声断层成像,可在十分钟内重建组织参数三维图谱,分辨率媲美MRI,推动定量超声断层成像用于肌肉骨骼成像的临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03556 2026-08-07 cs.CV cs.RO 版本更新

Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation

Afford-X:面向任务型操作的通用且轻量化的可供性推理模型

Xiaomeng Zhu, Yuyang Li, Leiyao Cui, Pengfei Li, Huan-ang Gao, Yixin Zhu, Hao Zhao

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science, Tsinghua University(清华大学计算机科学系)

AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。

详情

展开后加载摘要…

URL PDF HTML 收藏