Co-Fusion4D: Spatio-temporal Collaborative Fusion for Robust 3D Object Detection
Co-Fusion4D:面向鲁棒3D目标检测的时空协同融合
机构 * Tsinghua University(清华大学)
AI总结 提出Co-Fusion4D框架,通过当前帧主导-历史帧互补机制和双注意力融合模块,解决BEV检测器中跨帧时空不一致问题,在nuScenes上达到74.9% mAP和75.6% NDS。
高校专区
Co-Fusion4D:面向鲁棒3D目标检测的时空协同融合
机构 * Tsinghua University(清华大学)
AI总结 提出Co-Fusion4D框架,通过当前帧主导-历史帧互补机制和双注意力融合模块,解决BEV检测器中跨帧时空不一致问题,在nuScenes上达到74.9% mAP和75.6% NDS。
Causal Forcing++:用于实时交互式视频生成的可扩展少步自回归扩散蒸馏
机构 * Tsinghua University(清华大学) ; ShengShu(盛数) ; Renmin University of China(中国人民大学)
AI总结 提出Causal Forcing++框架,通过因果一致性蒸馏(causal CD)实现帧级1-2步自回归扩散蒸馏,在降低延迟和训练成本的同时提升视频生成质量。
打破双重瓶颈:将统一多模态模型演化为自适应交错视觉推理器
机构 * Tsinghua University(清华大学)
AI总结 针对统一多模态模型在理解与生成之间的鸿沟导致的注意力纠缠和视觉细化瓶颈,提出一种自适应切换生成策略的框架,通过分层数据流水线和两阶段训练(SFT+RL)提升X2I任务性能。
Comments Accepted by ICML 2026
Render-of-Thought: 将文本思维链渲染为图像以进行视觉潜在推理
机构 * Tencent BAC(腾讯BAC) ; Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) ; School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; School of Mathematics and Statistics, University of Glasgow(格拉斯哥大学数学与统计学学院)
AI总结 提出Render-of-Thought框架,通过将思维链的文本步骤渲染为图像,利用视觉语言模型的视觉编码器进行语义对齐,实现3-4倍令牌压缩和推理加速,同时保持竞争性能。
Comments Accepted by ACL 2026 Main Conference
Safe-FedLLM:深入探究联邦大语言模型的安全性
机构 * Hainan University(海南大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出Safe-FedLLM,一种基于探针的防御框架,通过三级防御(步骤级、客户端级和阴影级)利用轻量级分类器区分恶意与良性LoRA更新,以增强联邦大语言模型对恶意客户端的鲁棒性。
进退维谷:大型语言模型中伦理推理与安全对齐之间的张力
机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist,清华大学) ; IDG/McGovern Institute for Brain Research, Tsinghua University(IDG/麦克戈文脑科学研究院,清华大学) ; Chinese Institute for Brain Research (CIBR)(中国脑科学研究院(CIBR)) ; Shanghai Jiao Tong University(上海交通大学) ; ByteDance(字节跳动)
AI总结 本文提出TRIAL多轮红队方法,通过将有害请求嵌入伦理框架来利用模型伦理推理能力,并引入ERR防御框架(分层有害门控LoRA架构)以区分工具性回应与解释性回应,实现鲁棒防御。
AffordGen: 通过可供性对应生成多样化演示以实现通用物体操作
机构 * Shanghai Qi Zhi Institute(上海启智研究院) ; Tsinghua University(清华大学) ; Fudan University(复旦大学) ; UC Berkeley(伯克利大学)
AI总结 提出AffordGen框架,利用3D生成模型和视觉基础模型在大规模3D网格上的语义对应生成多样化操作轨迹,训练鲁棒的闭环视觉运动策略,实现零样本泛化到未见物体。
参数化社会身份注入与多样化在舆论模拟中的应用
机构 * DCST, Tsinghua University(清华大学信息科技系) ; Quancheng Laboratory(泉城实验室) ; Tsinghua University(清华大学) ; Shandong China(山东中国)
AI总结 针对大语言模型在舆论模拟中社会多样性不足的问题,提出参数化社会身份注入(PSII)框架,通过向中间隐藏状态注入显式参数化的人口属性与价值取向表示,显著提升分布保真度与多样性。
Comments Accepted to KDD 2026 Research Track. Project page: https://github.com/halsayxi/PSII
AgentProcessBench:诊断工具使用代理的步骤级过程质量
机构 * Renmin University of China(中国人民大学) ; Beijing Jiaotong University(北京交通大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
AI总结 提出AgentProcessBench基准,通过三元标注方案和错误传播规则评估工具增强轨迹中的步骤级有效性,揭示当前模型在区分中立与错误动作方面的挑战,并证明过程信号对结果监督的补充价值。
SmartThinker: 渐进式思维链长度校准以实现高效的大语言模型推理
机构 * Tsinghua University(清华大学)
AI总结 针对大型推理模型输出冗余问题,提出基于GRPO的渐进式CoT长度校准方法SmartThinker,通过动态估计最优长度和调节长度奖励系数,在压缩响应长度同时提升准确率。
Comments Accepted by ICML 2026, 18 pages, 13 figures
从陌生到熟悉:通过梯度偏差检测大型语言模型中的预训练数据
机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京未来区块链与隐私计算先进创新中心,北京航空航天大学) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
AI总结 提出GDS方法,通过分析目标样本的梯度偏差分数(包括更新幅度、位置和神经元激活集中度)来区分预训练成员与非成员数据,实现高效且跨数据集迁移的预训练数据检测。
Comments 17 pages, 8 figures
Code2Math:你的代码智能体能否通过探索有效演化数学问题?
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; Nanjing Tech University(南京工业大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Michigan(密歇根大学) ; Independent Researcher(独立研究者)
AI总结 本文提出一个多智能体框架,利用代码智能体通过探索将现有数学问题自主演化为更复杂、更困难的变体,并验证其可解性和难度提升。
Comments 38 pages
REAL: 通过推理枢轴对齐解决知识密集型视觉问答中的知识冲突
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
AI总结 提出REAL框架,通过推理枢轴对齐和引导解码,解决知识密集型视觉问答中因开放域检索引起的知识冲突问题。
Comments Accepted by ICML 2026
超越模型库检索:编织知识以掌握细粒度神经网络设计
机构 * National University of Singapore(新加坡国立大学) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出M-DESIGN框架,通过构建编辑效应证据图并采用自适应检索与预测任务规划器,在严格预算下高效发现近最优细粒度架构修改路径,在33个案例中26个达到搜索空间最佳性能。
Comments Accepted at ICML 2026. Title changed from "Beyond Model Base Selection: Weaving Knowledge to Master Fine-grained Neural Network Design" to "Beyond Model Base Retrieval: Weaving Knowledge to Master Fine-grained Neural Network Design"
ChatUMM: 面向对话式交错生成的鲁棒上下文追踪
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan Project lead(腾讯文心一言项目负责人)
AI总结 提出ChatUMM,一种通过交错多轮训练策略和系统化对话数据合成流水线实现鲁棒上下文追踪的对话式统一多模态模型,在视觉理解和指令引导编辑基准上达到开源模型最优性能。
Comments ChatUMM Project
Fast-SAM3D: 更快地将图像中的任何物体三维化
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
AI总结 提出Fast-SAM3D,一种无需训练的三维重建加速框架,通过多级异构性感知机制(模态感知步骤缓存、联合时空令牌雕刻、频谱感知令牌聚合)实现高达2.67倍端到端加速且保真度损失极小。
Comments Accepted by ICML 2026
从人类偏好中学习查询特定评分标准用于DeepResearch报告生成
机构 * Tencent(腾讯) ; Fudan University(复旦大学) ; Tsinghua University(清华大学)
AI总结 提出一种通过强化学习训练查询特定评分标准生成器的流水线,以解决DeepResearch长报告生成中缺乏可验证奖励信号的问题,并在人类偏好测试和下游任务中取得显著性能提升。
MulFeRL:在多轮循环中利用语言反馈增强强化学习
机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,北京,中国) ; Quancheng Laboratory(千晨实验室)
AI总结 针对强化学习中标量奖励稀疏且缺乏信息的问题,提出MulFeRL框架,通过多轮语言反馈引导失败样本的再生、进度信用分配和结构化反馈注入,提升模型推理性能。
APB-V: 通过序列并行感知的近似注意力加速长视频理解
机构 * NLP Group, DCST, IAI, BNRIST, Tsinghua University, Beijing, China(清华大学北京校区自然语言处理组、国防科技大学、人工智能研究院、北京理工大学、清华大学) ; Department of CS&T, Central South University, Changsha, China(中南大学计算机与技术系,长沙,中国) ; BUPT, Beijing, China(北京邮电大学,北京,中国) ; Pattern Recognition Center, WeChat AI, Tencent Inc.(腾讯公司微信人工智能研究院)
AI总结 提出APB-V,一种序列并行框架,通过分布式近似注意力在多GPU上加速长视频推理,显著提升速度且不损失性能。
Comments ACL 2026 main
寻找关键:通过演化索引锚定上下文知识进行迭代检索
机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) ; Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系) ; Beijing National Research Center for Information Science and Technology, China(北京信息科学与技术国家研究中心) ; School of Computer Science, Beijing University of Posts and Telecommunications, China(北京邮电大学计算机学院)
AI总结 提出KAIR框架,通过迭代检索中动态更新的知识索引锚定关键证据,引导大语言模型在多跳问答中有效推理并缓解噪声干扰。
VLM4VLA:重新审视视觉-语言-动作模型中的视觉-语言模型
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) ; Qwen Team, Alibaba Inc.(阿里巴巴公司Qwen团队)
AI总结 本文通过VLM4VLA最小适配管道,系统研究视觉-语言模型(VLM)的选择和能力如何影响下游视觉-语言-动作(VLA)策略性能,发现VLM通用能力无法预测下游任务表现,且视觉模块是性能瓶颈。
两个数据集优于一个:冷冻电镜三维重建的双矩方法
机构 * Department of Mathematics and Oden Institute, University of Texas at Austin(德克萨斯大学奥斯汀分校数学系与奥登研究所) ; Yau Mathematical Sciences Center, Tsinghua University(清华大学姚贝泰数学科学中心) ; Program in Applied and Computational Mathematics and Department of Mathematics, Princeton University(普林斯顿大学应用与计算数学项目及数学系) ; Program in Applied and Computational Mathematics, Princeton University(普林斯顿大学应用与计算数学项目)
AI总结 提出双矩方法(MoDM),利用均匀和非均匀两种取向分布下的二阶矩数据唯一确定分子结构,并开发基于凸松弛的算法实现高精度重建。
停止徘徊,找到关键:LLMs 辨别关键状态以实现高效多智能体探索
机构 * Department of Automation, Tsinghua University, Beijing 100084, China(清华大学自动化系) ; College of Electrical Engineering, Zhejiang University, Hangzhou 310027, China(浙江大学电气工程学院) ; National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University, Xi’an 710049, China(西安交通大学人机混合增强智能国家级重点实验室)
AI总结 提出 LEMAE 方法,利用大语言模型辨别关键状态并设计子空间内在奖励和关键状态记忆树,引导多智能体高效探索,在 SMAC 和 MPE 基准上显著超越现有方法,实现 10 倍加速。
Journal ref SCIENCE CHINA Information Sciences 2026