You Only Index Once: Cross-Layer Sparse Attention with Shared Routing
仅索引一次:具有共享路由的跨层稀疏注意力
机构 * Microsoft Research(微软研究院) ; Tsinghua University(清华大学)
AI总结 提出跨层稀疏注意力(CLSA),通过共享KV缓存和路由索引,在保持token稀疏注意力精度的同时减少路由开销,显著提升长上下文LLM的解码效率。
高校专区
仅索引一次:具有共享路由的跨层稀疏注意力
机构 * Microsoft Research(微软研究院) ; Tsinghua University(清华大学)
AI总结 提出跨层稀疏注意力(CLSA),通过共享KV缓存和路由索引,在保持token稀疏注意力精度的同时减少路由开销,显著提升长上下文LLM的解码效率。
确保多任务外骨骼控制中的交互安全性:一种仿真训练的可变阻抗框架
机构 * Tsinghua University(清华大学)
AI总结 提出一种基于仿真训练的可变阻抗控制框架,通过Lyapunov稳定性理论约束刚度变化,实现多任务外骨骼的安全交互控制并降低代谢成本。
RhymeFlow: 基于异步去噪流调度的无训练加速视频生成
机构 * Tsinghua University(清华大学) ; GigaAI
AI总结 针对DiT视频生成模型推理慢的问题,提出无训练框架RhymeFlow,通过识别关键帧并仅对其密集去噪,非关键帧逐步跳过步骤,同时引入潜在轨迹投影模块保持时序一致性,实现加速并提升质量。
Comments Project Page: https://simon-dcs.github.io/Website-of-RhymeFlow/, Code: https://github.com/Simon-Dcs/RhymeFlow
三轴加速度计的姿态辅助线性校准
机构 * Tsinghua University(清华大学)
AI总结 提出一种利用姿态信息的三轴加速度计线性校准方法(ALAC),通过构建组合误差矩阵实现线性最小二乘估计,仅需五个任意方向测量即可完成校准,并在静态和准静态实验中验证了其精度和鲁棒性。
MPCoT: 奖励引导的多路径潜在推理用于测试时可扩展的视觉-语言-动作
机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) ; Department of Computer Science, Tsinghua University(清华大学计算机系)
AI总结 提出MPCoT框架,通过奖励引导的多路径潜在推理,在保持零推理令牌和原始动作接口的同时,提升长时域和高不确定性控制任务中的VLA策略性能。
Comments 14 pages, 5 figures, submitted to CoRL
WorldFly: 基于世界模型的视觉-语言-动作模型用于无人机导航
机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; BNRist, Tsinghua University(清华大学北京研究院)
AI总结 提出WorldFly框架,通过双分支耦合流匹配机制联合生成未来视频预测和导航动作,解决城市峡谷中严重遮挡和视角剧变下的无人机导航问题。
超越相似性:面向个人AI代理的可信记忆搜索
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 针对个人AI代理中基于语义相似性的记忆检索存在的信任漏洞,提出轻量级记忆插件MemGate,通过查询条件神经门控实现可信记忆搜索。
迈向生物医学研究的世界模型
机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China(网络与交换技术国家重点实验室,北京邮电大学,北京,中国) ; Department of Engineering Science, University of Oxford, Oxford, United Kingdom(英国牛津大学工程科学系,牛津,英国) ; Institute of Medical Artificial Intelligence, South China Hospital, Medical School, Shenzhen University, Shenzhen, Guangdong, China(医学人工智能研究所,南方医院,医学学院,深圳大学,深圳,广东,中国) ; Zhongguancun Academy & Zhongguancun Institute of Artificial Intelligence, Beijing, China(中关村学院及中关村人工智能研究院,北京,中国) ; Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University, 100084, Beijing, China(北京信息科学与技术国家研究中心(BNRist),清华大学,100084,北京,中国) ; Department of Chemical and Nano Engineering, University of California, San Diego, La Jolla, CA, USA(美国加州大学圣地亚哥分校化学与纳米工程系,La Jolla,CA,美国) ; Nanyang Technological University, Singapore(新加坡南洋理工大学) ; Monash Biomedicine Discovery Institute and Department of Biochemistry and Molecular Biology, Monash University, Melbourne, Victoria, Australia(莫纳什大学生物医学发现研究所和生物化学与分子生物学系,墨尔本,维多利亚,澳大利亚) ; David R. Cheriton School of Computer Science, University of Waterloo, Waterloo, Ontario, Canada(加拿大滑铁卢大学戴维·R·切里顿计算机科学学校,滑铁卢,安大略,加拿大) ; Department of ICT and Center for AI Research, University of Agder (UiA), Jon Lilletuns vei 9, Grimstad, Norway(挪威阿格德大学(UiA)信息与通信技术系及人工智能研究中心,Jon Lilletuns vei 9,Grimstad,挪威) ; Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国)
AI总结 提出生物医学世界模型作为AI驱动发现的新范式,通过学习分子、细胞、组织和临床状态的潜在表征及干预条件动态,实现未来轨迹模拟,并探讨其在虚拟细胞、类器官、虚拟患者和手术模拟等应用中的潜力。
MemoryCard: 面向长视频问答的主题感知多模态线索压缩
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Digital China Group(数字中国集团)
AI总结 提出MemoryCard框架,通过将长视频分割为主题事件单元并生成事件级摘要和代表性视觉时刻,以记忆卡形式增强VLMs的长视频问答能力,在相同视觉令牌预算下准确率提升高达21.8%。
Comments 21 pages, 8 figures
从风险分类到行动方案修复:一种基于护栏反馈驱动的LLM代理框架
机构 * The University of Melbourne(墨尔本大学) ; Tsinghua University(清华大学)
AI总结 提出TRIAD框架,通过护栏生成的言语反馈引导代理在规划步骤中保持良性目标,实现安全与效用的最佳平衡。
Comments 32 pages
VTI-CoT: 用于视频推理的视觉-文本交织思维链
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Hong Kong(香港大学) ; Beijing Shanwei Zhixing Technology Co., Ltd.(北京尚维智行科技有限公司) ; Tsinghua University(清华大学) ; Beihang University(北航)
AI总结 提出VTI-CoT框架,通过视觉-文本交织的思维链结合OCR压缩技术,提升视频推理准确性和训练效率。
Comments 25 pages, 7 figures
在突然完全旋翼故障下保持完整六自由度驱动:使用双轴倾斜六旋翼的被动容错飞行控制
机构 * Tsinghua University(清华大学)
AI总结 本文针对双轴倾斜过驱动六旋翼在突发完全旋翼故障下,提出两种无需故障检测的被动容错控制方案,实现完整六自由度轨迹跟踪,并通过仿真和实验验证其鲁棒性。
StableRCA:鲁棒的图无关机制级根因分析
机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系) ; Bosch Center for Artificial Intelligence(博世人工智能中心) ; Computer Science Department, TU Darmstadt(图尔恩大学计算机科学系)
AI总结 提出StableRCA框架,通过估计局部马尔可夫边界并检测条件分布偏移,避免全局图发现,实现鲁棒的机制级根因分析。
自承诺延迟:一种用于提示隐式劫持的无奖励探针
机构 * Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
AI总结 提出自承诺延迟指标,通过测量推理上下文对模型自身最终答案的承诺时机,无需奖励信号即可检测提示隐式劫持,在GSM8K数据集上达到AUROC 0.878-0.926。
KV-Control: 用于轨迹控制文本到运动的参数高效K/V注入
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
AI总结 提出KV-Control,一种紧凑的注意力侧控制接口,通过部分标记化运动基元和轨迹编码器注入键/值记忆,实现精确的轨迹控制而不覆盖预训练的文本条件运动先验。
FlowPRO:通过近端偏好优化对流匹配VLA进行无奖励强化微调
机构 * Tencent Robotics X(腾讯机器人X实验室) ; Futian Laboratory(福田实验室) ; Tsinghua University(清华大学)
AI总结 提出FlowPRO框架,通过近端偏好优化(RPRO)和干预-回滚数据收集方法,实现无奖励的离线强化微调,在四类长时程双臂任务中取得最高成功率。
DiffSlack: 通过可学习松弛变量在非线性不等式约束下学习
机构 * State Key Laboratory of Tribology in Advanced Equipment, Tsinghua University(先进设备摩擦学国家重点实验室,清华大学) ; Beijing Key Laboratory of Transformative High-end Manufacturing Equipment and Technology, Department of Mechanical Engineering, Tsinghua University(transformative高端制造设备与技术北京市重点实验室,机械工程系,清华大学) ; Automotive Electronics Business Unit, Hirain Inc.(Hirain公司汽车电子事业部)
AI总结 提出DiffSlack,一种可微投影层,通过可学习松弛变量将非线性不等式约束转化为等式,结合阻尼高斯-牛顿投影实现端到端约束满足,在车辆路径规划中取得更高成功率和几何约束满足度。
状态承诺学习:训练语言模型区分计算与记忆
机构 * Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学)
AI总结 提出状态承诺学习目标及反事实擦除强化学习(CERL)方法,通过训练模型区分应保留的持久状态与可丢弃的临时计算,减少推理对隐藏思维的依赖,在数学、长链逻辑、科学问答和多轮工具使用任务中保持准确率的同时降低依赖。
Comments 17 pages
用于复杂驾驶场景中鲁棒交通标志识别的分层解耦混合专家模型
机构 * School of Automotive and Traffic Engineering, Liaoning University of Technology(辽宁科技学院汽车与交通工程学院) ; State Key Laboratory of Intelligent Green Vehicles and Mobility, School of Vehicle and Mobility, Tsinghua University(智能绿色车辆与移动State Key Laboratory,清华大学车辆与移动学院)
AI总结 提出分层解耦异构混合专家框架CBDES MoE TSR,通过图像级动态路由机制选择最优专家模型,在复合交通标志数据集上mAP50-95达76.8%,比基线提升2.3%且计算开销降低39.4%。
Comments 9 figures, 3 tables
超越模仿:基于强化学习的仿真-现实协同训练用于VLA模型
机构 * Tsinghua University(清华大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Zhongguancun Academy(中关村学院)
AI总结 本文提出基于强化学习的仿真-现实协同训练框架,通过结合仿真交互与真实世界数据,提升VLA模型的现实应用能力和泛化能力。
EgoHumanoid: 通过无机器人眼示范解锁真实场景中的移动- manipulation
机构 * University of California, Berkeley(加州大学伯克利分校) ; Tsinghua University(清华大学)
AI总结 本文提出EgoHumanoid框架,通过结合大量眼示范数据和少量机器人数据共同训练视觉-语言-动作策略,使机器人能够执行多样化的现实环境中的移动- manipulation任务,实验表明无机器人数据显著提升了性能,尤其在未见过的环境中表现更优。
Comments Project page: https://opendrivelab.com/EgoHumanoid
扩散语言模型的综述
机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(维拉实验室,穆罕默德·本·扎耶德人工智能大学) ; Department of Automation, Tsinghua University(清华大学自动化系)
AI总结 本文综述了扩散语言模型的发展现状,探讨了其与自回归模型和掩码语言模型的关系,分析了预训练策略、后训练方法以及推理优化技术,并讨论了多模态扩展、应用场景、局限性及未来研究方向。
在安全对齐的连续视觉指令微调中实现和谐参数适应
机构 * Hefei University of Technology(合肥工业大学) ; Tsinghua University(清华大学) ; University of Amsterdam(阿姆斯特丹大学)
AI总结 本文研究了在安全对齐的连续视觉指令微调中如何平衡安全性和任务性能,提出了一种名为和谐参数适应(HPA)的后训练框架,通过参数分区、平衡选择和正交调整来缓解遗忘问题。
重新思考分布偏移:针对表格数据的经验分析与建模
机构 * Department of Industrial Engineering and Operations Research(工业工程与运筹学系) ; Department of Computer Science and Technology(计算机科学与技术系) ; Decision, Risk, and Operations Division(决策、风险与运营部) ; Columbia University(哥伦比亚大学) ; Tsinghua University(清华大学)
AI总结 本文通过经验分析和建模,重新审视分布偏移问题,发现Y|X偏移在表格数据中最为常见,与机器学习文献中对X(协变量)偏移的重视形成鲜明对比,并指出鲁棒算法的性能并不优于普通方法。
Comments Forthcoming at Management Science. Conference version appeared in NeurIPS 2023, previously titled "On the Need for a Language Describing Distribution Shifts: Illustrations on Tabular Datasets"
多样性是否是可扩展机器人操作的全部需求?
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文研究了数据多样性在机器人学习中的作用,发现任务多样性比单任务演示量更重要,多身体预训练数据在跨身体转移中可选,专家多样性可能对策略学习产生干扰,提出分布去偏方法提升性能。
Comments Code is available at https://github.com/OpenDriveLab/AgiBot-World