BAMI: Training-Free Bias Mitigation in GUI Grounding
BAMI:无需训练的GUI定位偏差缓解
机构 * Tsinghua University, China(清华大学,中国) ; Lenovo Research, China(联想研究院,中国)
AI总结 本文提出BAMI方法,通过粗到细聚焦和候选选择缓解GUI定位中的精度偏差和歧义偏差,提升模型在无训练设置下的准确性。
Comments Accepted by CVPR 2026
高校专区
BAMI:无需训练的GUI定位偏差缓解
机构 * Tsinghua University, China(清华大学,中国) ; Lenovo Research, China(联想研究院,中国)
AI总结 本文提出BAMI方法,通过粗到细聚焦和候选选择缓解GUI定位中的精度偏差和歧义偏差,提升模型在无训练设置下的准确性。
Comments Accepted by CVPR 2026
Relit-LiVE: 通过联合学习环境视频实现视频照明
机构 * Nanjing University(南京大学) ; Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Huazhong University of Science and Technology(华中科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 Relit-LiVE通过引入原始参考图像和环境视频预测方法,实现了无需相机姿态先验知识的物理一致视频照明,提升了真实场景下的照明效果和时间稳定性。
Comments Accepted at SIGGRAPH 2026. Project site: https://github.com/zhuxing0/Relit-LiVE
代理AI是基础模型在分布外泛化中的缺失范式
机构 * Tsinghua University(清华大学)
AI总结 本文提出代理系统是解决基础模型分布外泛化问题的必要范式,通过四个步骤论证代理系统在结构上超越了传统模型中心范式,提出了参数覆盖上限的理论,并反驳了七项反论点。
Comments 13 pages, 2 figures
OA-WAM:面向鲁棒机器人操作的对象可寻址世界动作模型
机构 * Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学)
AI总结 OA-WAM通过分解帧为N+1槽状态,结合文本、图像和动作历史,提升机器人操作的鲁棒性,其可寻址对象状态在场景扰动下表现更优。
SparseForge:通过Hessian引导的软掩码退火实现高效的半结构化LLM稀疏化
机构 * Tsinghua University(清华大学)
AI总结 SparseForge通过优化稀疏掩码而非扩大重训练token数量,实现高效的半结构化LLM稀疏化,提升稀疏恢复效率,实验显示其在准确率与效率的权衡上优于现有方法。
教授思考模型进行工具推理:一种完整的全管道配方用于工具集成推理
机构 * Zhejiang University(浙江大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Peking University(北京大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出一种全管道配方,通过注入自然工具使用行为提升强思考模型的工具集成推理能力,同时保持文本推理能力,展示在Qwen3模型上取得最佳性能。
感知、路由与调制:时间序列预测中的动态模式再校准
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tsinghua University(清华大学) ; Squirrel Ai Learning
AI总结 本文提出动态模式再校准(DPR),通过轻量级'感知-路由-调制'流程,实现时间序列预测中动态模式的自适应调整,提升模型对局部动态变化的响应能力。
Comments 22 pages, 6 figures. Preprint
CKT-WAM: 在世界动作模型之间高效传递上下文知识
机构 * Tsinghua University(清华大学) ; LivsynRobotics ; Shanghai AI Laboratory(上海人工智能实验室)
AI总结 CKT-WAM通过文本嵌入空间中的紧凑上下文传递教师WAM知识,提升零样本泛化能力,在LIBERO-Plus上达到86.1%的成功率,且在现实任务中表现出色。
重新审视不确定性:关于部分相关视频检索的证据学习
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) ; Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学,深圳,中国) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)
AI总结 本文提出Holmes框架,通过多粒度跨模态证据聚合量化和建模不确定性,解决视频检索中因查询简短与视频内容丰富带来的语义模糊问题。
Comments Accepted by ICML 2026. 16 pages, 6 figures, 3 tables
TheraAgent:自我改进的治疗剂用于精准且全面的治疗计划
机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) ; Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) ; School of Computing, National University of Singapore, Singapore(计算学院,新加坡国立大学,新加坡)
AI总结 TheraAgent通过迭代生成-判断-改进流程提升治疗计划的精准度和完整性,实验显示其在HealthBench上表现优异,专家评估中胜率高达86%。
Comments Accepted to ACL 2026
从视频先验构建统一的4D世界动作模型
机构 * Tsinghua University(清华大学) ; Xiaomi Robotics(小米机器人) ; Peking University(北京大学) ; CASIA
AI总结 本文提出X-WAM,统一了实时机器人动作执行与高保真的4D世界合成,在单一框架中解决传统统一世界模型仅建模2D像素空间且无法平衡动作效率与世界建模质量的问题。
Comments Project website: https://sharinka0715.github.io/X-WAM/
使重建FID成为扩散生成FID的预测指标
机构 * Tsinghua University(清华大学) ; University of Cambridge(剑桥大学) ; Peking University(北京大学) ; Kuaishou Technology(快手科技)
AI总结 本文提出插值FID(iFID),通过在潜在空间中检索最近邻并插值其潜在表示,解码后计算与原数据集的FID,从而与生成FID强相关。
去中心化注意力失败于中心化信号:重新思考用于医疗时间序列的Transformer
机构 * Department of Biomedical Engineering, PolyU(PolyU 生物医学工程系) ; School of Nursing, PolyU(PolyU 护理学院) ; Yau Mathematical Sciences Center, Tsinghua University(清华大学尤太数学科学中心)
AI总结 本文提出CoTAR模块,通过集中化MLP替代去中心化注意力,以更好地捕捉医疗时间序列数据中的中心化依赖关系,提升模型效果与效率。
Comments Accepted by ICLR 2026 (Oral). arXiv admin note: text overlap with arXiv:2405.19363 by other authors
SuperWing:一个综合的跨音速机翼数据集用于数据驱动的空气动力学设计
机构 * School of Aerospace Engineering, Tsinghua University, Beijing, China(清华大学北京航空航天工程学院) ; School of Computation, Information and Technology, Technical University of Munich, Germany(慕尼黑技术大学计算、信息与技术学院)
AI总结 SuperWing数据集通过4239种参数化机翼几何和28856个RANS解,为数据驱动的空气动力学设计提供广泛的数据支持,展示了其在预测表面流动和零样本泛化方面的有效性。
AsyncVLA: 视觉-语言-动作模型中的异步流匹配
机构 * Tsinghua University(清华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; Lumos Robotics(Lumos机器人)
AI总结 本文提出AsyncVLA,一种引入异步流匹配的视觉-语言-动作模型框架,通过非均匀时间调度和自修正机制提升长周期任务的稳定性与效率。
生成AI遇见6G与未来:扩散模型在语义通信中的应用
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Jiao Tong University(上海交通大学) ; East China Normal University(华东师范大学) ; Tsinghua University(清华大学) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文探讨生成AI与6G通信的结合,介绍扩散模型在语义通信中的应用,分析其在可控生成、高效推理和跨域适应中的核心方法及贡献。
Comments Accepted by IEEE COMST, GitHub repository: https://github.com/qin-jingyun/Awesome-DiffComm, project page: https://qin-jingyun.github.io/Awesome-DiffComm
NOWS: 用于加速迭代求解器的神经算子预热
机构 * Leibniz University Hannover(莱布尼茨汉诺威大学) ; Institute of Photonics(光子研究所) ; Department of Mathematics and Physics(数学与物理系) ; Tsinghua University(清华大学) ; Institute of Structural Mechanics(结构力学研究所) ; Bauhaus-Universität Weimar(魏玛建筑学院)
AI总结 NOWS结合神经算子的快速推理与传统求解器的严谨性,通过生成高质量初始猜测加速迭代求解,显著降低计算时间并保持稳定性。
神经算子是否遗忘几何?深度算子学习中的遗忘假设
机构 * Qiuzhen College, Tsinghua University, Beijing, China(清华大学北京校区Quizhen学院) ; Yau Mathematical Sciences Center, Tsinghua University, Beijing, China(清华大学Yau数学科学中心)
AI总结 本文研究了神经算子在不规则几何上性能下降的原因,提出几何遗忘假设,并引入轻量级几何记忆注入机制以缓解遗忘问题,揭示几何保留是结构需求而非设计选择。
HCInfer:通过误差补偿实现资源受限设备的高效推理系统
机构 * Tsinghua University(清华大学) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 本文提出HCInfer系统,通过将残差补偿任务卸载到CPU,利用GPU执行压缩主干网络,并引入异步补偿管道和敏感性感知的动态秩分配,以提高精度恢复和吞吐量。
LeakDojo:解码RAG系统的泄漏威胁
机构 * Tsinghua University, China(清华大学, 中国) ; Ant International, China(蚂蚁集团, 中国) ; Nanyang Technological University, Singapore(南洋理工大学, 新加坡)
AI总结 LeakDojo通过可控评估揭示RAG系统泄漏风险,发现查询生成和对抗指令独立影响泄漏,且指令能力越强泄漏风险越高,RAG可信度提升可能增加泄漏风险。
Comments Findings of ACL 2026
通过理解监督引导统一多模态模型的视觉生成
机构 * Tsinghua University(清华大学) ; Kolors Team, Kuaishou Technology(快手技术团队)
AI总结 本文提出UNO框架,通过将理解作为监督信号引导生成,提升多模态模型在图像生成与编辑中的性能。
HyperLens: 通过细粒度置信轨迹量化大语言模型中的认知努力
机构 * IIIS, Tsinghua University(清华大学信息学院) ; Shanghai Qi Zhi Institute(上海启智研究院)
AI总结 HyperLens通过分析大语言模型推理过程中的置信轨迹,量化认知努力,揭示复杂任务对更高认知努力的需求,并诊断监督微调对领域任务性能的影响。
Comments 33 pages
EgoEMG:一个用于手姿态估计的多模态自体视角数据集,包含双侧EMG和视觉信息
机构 * Department of Automation, Tsinghua University(清华大学自动化系)
AI总结 EgoEMG数据集融合双侧EMG和视觉信息,用于手姿态估计,包含16通道EMG、IMU、RGB视频和RGB-D视频,涵盖41名参与者60种手势,提供EMG-to-pose、vision-to-pose和融合任务的基准测试。
Comments 34 pages, 13 figures, 15 tables. Submitted to NeurIPS 2026
推理时预算控制用于大语言模型搜索代理
机构 * City University of Hong Kong(香港城市大学) ; Tsinghua University(清华大学) ; Alibaba Ant Group(阿里巴巴集团)
AI总结 本文研究了多跳问答中推理时双预算控制问题,通过两阶段控制策略,在搜索阶段根据任务级信息价值评分选择检索、分解或回答承诺,在最终阶段根据证据选择性修正答案,实验表明该方法在多个基准上取得积极收益。
对现实软件开发中主动编码助手的实证研究
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; Fitten Tech Co., Ltd.(Fitten科技有限公司)
AI总结 本文通过大规模实证研究,分析了模拟与现实数据在主动意图预测中的差异,提出ProCodeBench基准,并指出模拟数据无法替代真实数据。
为野外面部外观捕捉学习一种愉悦先验
机构 * School of Software(软件学院) ; BNRist, Tsinghua University(清华大学计算机系) ; ShanghaiTech University(上海科技大学) ; Deemos Technology Co., Ltd.(德莫斯科技有限公司)
AI总结 本文提出通过训练强大愉悦网络作为先验来约束优化,结合异构数据源实现高质量反射率估计,同时开源模型和数据集推动高精度面部捕捉研究。
Comments ACM Transactions on Graphics (Proc. of SIGGRAPH), 2026. Code: https://github.com/yxuhan/OpenDelight Project Page: https://yxuhan.github.io/OpenDelight/index.html
DexSim2Real: 基于基础模型的仿真到现实迁移用于通用的灵巧操作
机构 * Tsinghua University(清华大学) ; Alibaba Group(阿里巴巴集团) ; Bengbu University(Bengbu大学) ; UCSI University(UCSI大学)
AI总结 本文提出DexSim2Real框架,结合基础模型引导的域随机化、触觉视觉交叉注意力策略和渐进技能课程,提升灵巧操作的仿真到现实迁移性能,实验表明其在现实世界中的成功率达到78.2%。
Comments 13 pages, 2 figures, 5 tables
MesonGS++: 3D高斯散射的后训练压缩与超参数搜索
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; The Hong Kong University of Science and Technology(香港科技大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; The Chinese University of Hong Kong(香港中文大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Shenzhen Technology University(深圳技术大学) ; Xiamen University(厦门大学) ; Simon Fraser University(西蒙弗雷泽大学) ; Jiangxing Intelligence Inc.(江兴智能有限公司)
AI总结 MesonGS++提出了一种基于超参数搜索的3D高斯散射后训练压缩方法,通过联合重要性剪枝、八叉树几何编码等技术,实现34倍压缩并保持渲染质量,优于现有方法并精准满足目标存储预算。
面向HOI的自适应网络用于弱监督动作分割
机构 * Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; Beijing Jiaotong University(北京交通大学)
AI总结 本文提出AdaAct网络,通过利用视频级的时空局部人-物交互作为先验知识,动态适应HOI序列以区分模糊动作,实验验证了方法的有效性。
Comments Accepted to IJCAI 2023
MACE-Dance: 基于动作-外观级联专家的音乐驱动舞蹈视频生成
机构 * Renmin University of China(中国人民大学) ; AMAP, Alibaba Group(阿里集团AMAP) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学)
AI总结 本文提出MACE-Dance框架,结合级联混合专家模型,实现音乐驱动的高质量舞蹈视频生成,通过动作和外观专家分别生成3D动作和视频,提升视觉一致性和动作真实感。
Comments Accepted by SIGGRAPH 2026