arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-06-10 至 2026-06-10 共收录 27
2606.11164 2026-06-10 cs.AI 新提交

ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models

ReasonAlloc: 推理模型的分层解码时KV缓存预算分配

Wenhao Liu, Hao Shi, Yunhe Li, Weizhi Fei, Xiangyuan Wang, Mengzhe Ruan, Hanxu Hou, Peisong Wang, Linqi Song, Shuang Qiu

机构 * Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) Shenzhen University of Advanced Technology(深圳理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 针对长链式推理中KV缓存快速增长导致的推理瓶颈,提出ReasonAlloc框架,通过离线层预分配和在线头重分配的分层预算分配策略,在不增加训练开销下显著提升小预算下的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11119 2026-06-10 cs.LG cs.AI cs.CL 新提交

TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning

TRACE:一种用于高效智能体强化学习的统一展开预算分配框架

Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, Xiangyang Ji

机构 * Tsinghua University(清华大学) Tencent(腾讯)

AI总结 针对多轮智能体强化学习中奖励对比度不足的问题,提出TRACE框架,通过将每个ReAct式思考-行动-观察步骤建模为语义节点,在固定采样预算内将预算分配到提示根和中间前缀,增强奖励对比,提升策略更新信号。

Comments 32 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11052 2026-06-10 cs.CL 新提交

Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It

混合LLM中的注意力遗忘:当CoT微调破坏长程记忆时,如何修复

Xinyu Zhou, Boyu Zhu, Yi Xu, Zhiwei Li, Yingfa Chen, Huiming Wang, Zhijiang Guo

机构 * LARK, HKUST(GZ)(香港科技大学(广州)LARK实验室) UCL(伦敦大学学院) Mistral AI Tsinghua University(清华大学) SUTD(新加坡科技设计大学) HKUST(香港科技大学)

AI总结 发现CoT监督微调会系统性降低混合线性注意力模型的长上下文召回能力,提出QK-Restore方法通过恢复微调前的查询-键投影矩阵来修复,无需额外训练。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10935 2026-06-10 cs.LG cs.AI 新提交

CLP: Collocation-Length Prediction for Zero-Loss Adaptive Multi-Token Inference

CLP: 零损失自适应多令牌推理的搭配长度预测

Xuezhen Xie, Zhiqiang Zhou

机构 * Xiamen University(厦门大学) Tsinghua University(清华大学)

AI总结 提出CLP方法,通过轻量级线性层预测可安全接受的额外令牌数,解决多令牌预测中头-主干竞争导致的输出退化问题,在Qwen2.5模型上实现零质量损失的1.14x-1.29x加速。

Comments 13 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10927 2026-06-10 cs.RO 新提交

AllDayNav: Lifelong Navigation via Real-World Reinforcement Learning

AllDayNav: 通过真实世界强化学习实现终身导航

Hang Yin, Yinan Liang, Jiazhao Zhang, Jiahang Liu, Minghan Li, Zhizheng Zhang, He Wang

机构 * Tsinghua University(清华大学) Galbot Robotics Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 提出AllDayNav框架,利用自进化多模态记忆和强化学习隐式编码场景动态,在跨房间、跨回合和跨任务场景中实现接近100%的成功率,超越基于地图、VLM和RL的基线方法。

Comments Project Page: https://bagh2178.github.io/AllDayNav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10899 2026-06-10 cs.RO 新提交

MV-Actor: Aligning Multi-View Semantics and Spatial Awareness for Bimanual Manipulation

MV-Actor:对齐多视角语义与空间感知以实现双臂操作

Yinchen Tian, Huan Li, Muyao Peng, Xi Wang, Yan Wang, You Yang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院) AIR Wuxi Innovation Center, Tsinghua University(清华大学智能产业研究院无锡创新中心)

AI总结 提出MV-Actor框架,通过多视角语义交互和语义-空间令牌交互统一语义与空间表示,并利用引导度量深度修复模块处理深度噪声,在PerAct2基准上达到87.8%平均成功率。

Comments 14 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10752 2026-06-10 cs.AI 新提交

AutoPDE: Reliable Agentic PDE Solving via Explicitly Represented Solver Strategies

AutoPDE: 通过显式表示的求解器策略实现可靠的智能体PDE求解

Huanshuo Dong, Keyao Zhang, Hong Wang, Zhezheng Hao, Zhiwei Zhuang, Ziyan Liu, Jiacong Wang, Gengyuan Liu, Xin Jin

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) University of the Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学)

AI总结 提出AutoPDE,一种将求解器策略作为显式对象维护的代码智能体,通过PDE分析、数值方法选择和自适应调优三阶段构建策略,在PDE Agent Bench上达到54.5%的通过率,比最强基线提升14.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10742 2026-06-10 cs.CR cs.LG 新提交

MemVenom: Triggered Poisoning of Multimodal Memories in Web Agents

MemVenom:网络代理中多模态记忆的触发式投毒

Yv Zhang, Hao Sun, Hao Fang, Kuofeng Gao, Fan Mo, Bin Chen, Shu-Tao Xia, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Tianjin University(天津大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生学院,清华大学) Huawei Technologies Ltd.(华为技术有限公司)

AI总结 提出MemVenom框架,针对网络代理的外部记忆系统,通过触发条件检索和攻击诱导,实现黑盒多模态记忆投毒,达到高成功率且不影响良性性能。

Comments Preprint. 27 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10677 2026-06-10 cs.AI cs.CL 新提交

Infini Memory: Maintainable Topic Documents for Long-Term LLM Agent Memory

Infini Memory:用于长期LLM智能体记忆的可维护主题文档

Suozhao Ji, Baodong Wu, Zehao Wang, Lei Xia, Qingping Li, Ruisong Wang, Wenbo Ding, Zhenhua Zhu, Boxun Li, Guohao Dai, Yu Wang

机构 * Infinigence AI(InfiniGen AI) Tsinghua University(清华大学) Shanghai Jiaotong University(上海交通大学)

AI总结 提出Infini Memory架构,将智能体记忆组织为主题文档,通过缓冲合并和迭代检索实现可维护的长期记忆,在MemoryAgentBench上达到64.7%的总体得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10656 2026-06-10 cs.CV 新提交

Envision4D: Envisioning Visual Futures via Feed-forward 4D Gaussian Splatting for Autonomous Driving

Envision4D: 通过前馈4D高斯泼溅展望自动驾驶的视觉未来

Qi Song, Yifei He, Chi Zhang, Zheng Fu, Xuhe Zhao, Mengmeng Yang, Kun Jiang, Rui Huang, Diange Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出Envision4D,一种全自监督前馈框架,通过未来姿态预测、层内时间注意力和条件运动提升,实现无位姿的未来外推,在自动驾驶动态场景预测中达到最先进性能。

Comments Project Page: https://maggiesong7.github.io/research/Envision4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10591 2026-06-10 cs.SD 新提交

ContextCodec: Content-Focused Context Guidance for Ultra-Low Bitrate Speech Coding

ContextCodec: 面向内容的超低比特率语音编码上下文引导

Chengbin Liang, Wenqi Guo, Hao Cao, Zhijin Qin

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 提出ContextCodec,通过双分支编码器解耦声学细节与内容上下文,利用CLIP对比损失对齐上下文特征与音素索引,在500 bps下实现质量与可懂度的良好平衡。

Comments Accepted at Interspeech 2026. 6 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10581 2026-06-10 cs.CL cs.SD eess.AS 新提交

ParaBridge: Bridging Paralinguistic Perception and Dialogue Behavior in Speech Language Models

ParaBridge: 弥合语音语言模型中的副语言感知与对话行为

Yuxiang Wang, Qinke Ni, Shengbo Cai, Wan Lin, Liqiang Zhang, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tencent Hunyuan(腾讯混元) Shenzhen Loop Area Institute(深圳河套学院) Amphion Technology Co., Ltd.(Amphion科技有限公司) Tsinghua University(清华大学)

AI总结 提出ParaBridge,一种在线自我蒸馏方法,将推理阶段的副语言指令支架转化为稳定的模型行为,无需人工标注或外部奖励,显著提升语音语言模型对副语言线索的响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10493 2026-06-10 cs.DC cs.AI cs.LG cs.NE 新提交

Achieving Cloud-Grade SLOs for Local Mixture-of-Experts Inference through CPU-GPU Hybrid Design

实现本地混合专家模型推理的云级SLO:CPU-GPU混合设计

Wenxin Wang, Yule Hou, Yu Ji, Peng Qu, Youhui Zhang

机构 * Tsinghua University(清华大学) Xingyun Integrated Circuits Co., Ltd.(星云集成电路有限公司) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

AI总结 针对本地MoE推理在低并发下仍无法达到云级服务质量的问题,提出CPU-GPU混合系统,通过流加载预填充、分布式SLP、节点内预填充-解码分离、AVX-512优化FP8 GEMV内核和细粒度CPU并行,在消费级硬件上实现云级SLO。

Comments Accepted to the 20th USENIX Symposium on Operating Systems Design and Implementation (OSDI '26). The official version will appear in the OSDI '26 proceedings published by USENIX

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10488 2026-06-10 cs.CV 新提交

5% > 100%: Flatness Preference is All You Need for Multimodal Parameter-Efficient Fine-Tuning

5% > 100%: 平坦性偏好是您进行多模态参数高效微调所需的一切

Yifan Zhu, Can Lin, Hangjie Yuan, Zixiang Zhao, Pengfei Zhang, Tao Feng, Zhonghong Ou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院) Anhui University of Science and Technology(安徽理工大学) Tsinghua University(清华大学) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

AI总结 揭示参数高效微调方法中普遍存在的平坦性偏好,即少量尖锐维度主导泛化,并提出FlatPO方法优化这些维度以提升泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10479 2026-06-10 cs.AI 新提交

ComBench: A Benchmark for Rigorous Proof Reasoning and Constructive Realization in Olympiad-Level Combinatorics

ComBench: 奥林匹克级组合数学中严格证明推理与构造实现的基准测试

Shunkai Zhang, Haoran Zhang, Yun Luo, Qianjia Cheng, Haodi Lei, Yizhuo Li, Runzhe Zhan, Zhilin Wang, Bangjie Xu, Yucheng Su, Xinmiao Han, Xiaoye Qu, Dongrui Liu, Zhouchen Lin, Yu Qiao, Ning Ding, Yafu Li, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出ComBench基准,包含100道奥林匹克级组合问题,分分析和构造两类,通过评分与验证评估大模型推理能力,发现最强模型准确率仅65.4%,且证明推理与构造实现能力存在差异。

Comments 39 pages, 6 figures, 26 tables. Project page: https://simplified-reasoning.github.io/ComBench/docs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10371 2026-06-10 cs.RO cs.AI 新提交

Test-time Adversarial Takeover: A Real-time Hijacking Interface against Robotic Diffusion Policies

测试时对抗接管:针对机器人扩散策略的实时劫持接口

Zi Yin, Peilin Chai, Siyuan Huang, Zhanhao Hu

机构 * Tsinghua University(清华大学) Independent Researcher(独立研究员) Johns Hopkins University(约翰霍普金斯大学) UC Berkeley(加州大学伯克利分校)

AI总结 提出测试时对抗接管(TAKO)方法,通过可微扩散推理学习可重复使用的通用补丁,在测试时切换补丁以劫持机器人策略,实现远程操控,在多种任务和模型上达到100%接管成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10366 2026-06-10 cs.RO cs.AI 新提交

A Practical Recipe Towards Improving Sim-and-Real Correlation for VLA Evaluation

提升VLA评估中仿真与真实相关性的实用指南

Shuo Wang, Hanyuan Xu, Yingdong Hu, Fanqi Lin, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院)

AI总结 本文系统研究仿真与真实环境在VLA策略评估中的相关性,提出统一框架来测量和提升仿真作为真实评估代理的有效性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10363 2026-06-10 cs.RO 新提交

HiMem-WAM: Hierarchical Memory-Gated World Action Models for Robotic Manipulation

HiMem-WAM: 用于机器人操作的分层记忆门控世界动作模型

Xiaoquan Sun, Ruijian Zhang, Chen Cao, Yihan Sun, Jiahui Chen, Zetian Xu, Bo Chen, Haijier Chen, Zhen Yang, Jiarun Zhu, Yijun Hong, JingZhe Xu, Jingrui Pang, Mingqi Yuan, Jiayu Chen

机构 * The University of Hong Kong(香港大学) INFIFORCE Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Southern University of Science and Technology(南方科技大学)

AI总结 提出分层记忆门控世界动作模型HiMem-WAM,通过分层潜在动作框架和边界触发记忆更新,提升长时域机器人操作的任务相关记忆与泛化鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10340 2026-06-10 cs.RO 新提交

OMG: Omni-Modal Motion Generation for Generalist Humanoid Control

OMG: 面向通用人形机器人的全模态运动生成

Siqiao Huang, Kun-Ying Lee, Dongming Qiao, Guanqi He, Zhenyu Wang, Yitang Li, Shaoting Zhu, Hang Zhao

机构 * Tsinghua University(清华大学)

AI总结 提出OMG框架,通过精心策划的数据流程和扩散模型,实现基于语言、音频和参考动作的全模态全身控制,展示了最先进的性能和可扩展性。

Comments Project Page: https://tsinghua-mars-lab.github.io/OMG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10338 2026-06-10 cs.CL cs.AI 新提交

Routing-Aware Expert Calibration for Machine Unlearning in Mixture-of-Experts Language Models

路由感知的专家校准用于混合专家语言模型中的机器遗忘

Jingyi Xie, Yijun Lin, Yinjiang Xiong, Zhikun Zhang, Sai Li

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Lightstandard

AI总结 针对MoE模型中遗忘数据与保留数据路由不匹配导致遗忘关键专家正则化不足的问题,提出TRACE方法,通过离线激活统计检测遗忘关键专家并重新加权保留损失以校准保留侧激活频率,实验表明在WMDP和MUSE-BOOKS上遗忘-效用权衡提升9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10112 2026-06-10 cs.GT cs.AI cs.LG econ.TH 新提交

Duality for Optimal Multi-Item, Multi-Bidder Auction Design: Revenue Certificates through Deep Learning

最优多物品多竞拍者拍卖设计的对偶性:通过深度学习的收入证书

Yanchen Jiang, David C. Parkes, Tonghan Wang

机构 * Harvard University(哈佛大学) College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 提出首个直接处理多物品多竞拍者拍卖对偶问题的计算框架,通过神经网络参数化拉格朗日乘子并引入提升技术,生成可证明的收入上界,为连续类型提供近最优性证书。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10092 2026-06-10 cs.LG econ.GN q-fin.EC 新提交

Decision-Making under Combinatorial Risk

组合风险下的决策

Yifan Hong, Hongmiao Fan, Chen Wang

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系)

AI总结 通过投资分配任务研究组合风险下的决策,发现参与者主要依据投资后成功概率等特征而非精确评估完整分布,并利用符号回归发现简洁描述模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08982 2026-06-10 cs.AI 版本更新

Baichuan-M4: A Clinical-Grade Medical Agent System for Continuous Care

Baichuan-M4:面向持续照护的临床级医疗智能体系统

Aiyuan Yang, Canbin Piao, Chengfeng Dou, Da Pan, Dian Wang, Fan Yang, Fei Deng, Fei Li, Guangwei Ai, Hui Liu, Hongda Zhang, Jinyang Tai, Kai Lu, Lijun Liu, Linwei Chen, Linyu Li, Meiqing Guo, Peidong Guo, Qiang Ju, Rihui Xin, Shuai Wang, XinKai Ma, Xudong Chen, Yichuan Mo, Yijie Zhou, Leyi Pan, Yihe Luo, Zian Wang

机构 * Baichuan AI(百川智能) THUBPM Group, Tsinghua University(清华大学THUBPM课题组)

AI总结 提出Baichuan-M4临床级医疗大模型,通过统一运行时、持续照护强化学习框架和临床工具层三大支柱构建智能体系统,在多项医疗评估中取得领先结果,幻觉率降至3.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06234 2026-06-10 cs.RO cs.HC 版本更新

RobotEQ: Transitioning from Passive Intelligence to Active Intelligence in Embodied AI

RobotEQ:从被动智能到主动智能的具身AI过渡

Kuofei Fang, Xinyi Che, Haomin Ouyang, Shufan Zhang, Xuehao Wang, Qi Liu, Liyi Liu, Chenqi Zhang, Wenxi Cai, Wenyu Dai, Jinyang Wu, Fan Zhang, Haoyu Chen, Bin He, Zheng Lian

机构 * State Key Laboratory of Autonomous Intelligent Unmanned Systems, Tongji University(自主智能无人系统国家重点实验室,同济大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) CMVS, University of Oulu(奥卢大学CMVS)

AI总结 提出RobotEQ基准,评估模型在具身场景中理解并遵守社会规范的能力,实验表明现有模型在主动智能上仍有不足,利用RAG技术可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20048 2026-06-10 cs.CL cs.CY 版本更新

Culturally uneven urban perception in large language models

大型语言模型通过文化不平等的基线感知城市

Rong Zhao, Wanqi Liu, Zhizhou Sha, Nanxi Su, Yecheng Zhang, Ying Long

机构 * Centre for Advanced Spatial Analysis (CASA), UCL, London, UK(高级空间分析中心(CASA),伦敦大学学院,英国) School of Architecture, Tsinghua University, Beijing, China(清华大学建筑学院,北京,中国) Department of Computer Science, UT Austin, Austin, TX, USA(得克萨斯大学奥斯汀分校计算机科学系,奥斯汀,德克萨斯,美国)

AI总结 本研究通过全球平衡的街景样本测试前沿LLM的城市感知,发现中性提示实际上偏向欧美文化,且文化提示能改变情感评价但无法恢复人类语义多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05791 2026-06-10 cs.RO 版本更新

Scalable and General Whole-Body Control for Cross-Humanoid Locomotion

可扩展且通用的全身控制:跨人形机器人运动

Yufei Xue, YunFeng Lin, Wentao Dong, Yang Tang, Jingbo Wang, Jiangmiao Pang, Ming Zhou, Minghuan Liu, Weinan Zhang

机构 * Tsinghua University(清华大学)

AI总结 提出XHugWBC框架,通过形态随机化、语义对齐观测动作空间和有效策略架构,实现单次训练后跨多种人形机器人的零样本泛化控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17196 2026-06-10 cs.LG cs.AI

BudgetThinker: Empowering Budget-aware LLM Reasoning with Control Tokens

BudgetThinker: 通过控制令牌赋能预算感知的LLM推理

Hao Wen, Xinrui Wu, Yi Sun, Feifei Zhang, Liye Chen, Jie Wang, Yunxin Liu, Yunhao Liu, Ya-Qin Zhang, Yuanchun Li

机构 * Institute for AI Industry Research (AIR) Tsinghua University(人工智能产业研究院(AIR)清华大学) Global Innovation Exchange & Department of Automation Tsinghua University(全球创新交流中心及自动化系 清华大学)

AI总结 BudgetThinker通过在推理过程中插入控制令牌,使LLM能够精确控制推理过程长度,采用两阶段训练流程提升模型在不同预算下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏