FlowCodec: One-Step Flow Prior for Generative Image Compression
FlowCodec: 用于生成式图像压缩的一步流先验
机构 * Tsinghua University(清华大学)
AI总结 提出FlowCodec框架,将预训练的大规模文本到图像先验嵌入超低比特率编解码器,通过解耦的潜在压缩和单步潜在传输实现高质量压缩,无需额外条件信号或辅助网络。
高校专区
FlowCodec: 用于生成式图像压缩的一步流先验
机构 * Tsinghua University(清华大学)
AI总结 提出FlowCodec框架,将预训练的大规模文本到图像先验嵌入超低比特率编解码器,通过解耦的潜在压缩和单步潜在传输实现高质量压缩,无需额外条件信号或辅助网络。
DiT-Reward:文本到图像奖励建模的生成式表示
机构 * JD Explore Academy, JD.com(京东探索研究院,京东) ; Tsinghua University(清华大学) ; Beijing Institute of Technology(北京理工大学) ; Peking University(北京大学)
AI总结 提出DiT-Reward,利用预训练文本到图像扩散Transformer的生成表示进行奖励预测,在多个偏好基准上超越HPSv3,并实现1.65倍推理加速。
dVLA-RL:基于去噪轨迹的强化学习用于离散扩散视觉-语言-动作模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Baidu AI Cloud D-Robotics Shanghai AI Laboratory(百度AI云D-机器人上海人工智能实验室)
AI总结 提出dVLA-RL方法,将离散扩散VLA模型的强化学习目标从边缘动作概率转移到采样生成路径的联合概率,通过将去噪过程建模为马尔可夫决策过程,实现变步长调度,在LIBERO上达到99.7%成功率,在RoboTwin 2.0上相比SFT提升30.6%。
VeriEvol:通过可验证的进化指令扩展多模态数学推理
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan(腾讯混元)
AI总结 提出VeriEvol框架,通过类型感知进化模块生成更难的问题,并利用HTV-Agent验证器确保答案可靠性,从而在强化学习中扩展多模态数学推理数据,提升模型性能。
AOHP:一个用于个性化、高效和安全交互的开源操作系统级Agent框架
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; The University of Hong Kong(香港大学)
AI总结 提出AOHP,一个基于AOSP的操作系统级Agent框架,通过将Agent视为一等OS参与者,实现个性化服务组合、高效Agent接口和安全信息流,在任务完成率、令牌成本和策略合规性上优于现有系统。
Comments 17 pages, 3 figures
TSD:一种受物理启发的轨迹显著性检测器用于高效模仿学习
机构 * Department of Automation, Tsinghua University(清华大学自动化系)
AI总结 提出一种无需训练、即插即用的轨迹显著性检测器TSD,通过空间熵和向心加速度两个物理指标识别关键轨迹,实现数据集压缩和扩展,平均减少25%数据量仍保持或提升性能。
抽象表征几何支持大型语言模型中的推理
机构 * College of Future Information Technology, Fudan University(复旦大学未来信息科技学院) ; Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学)
AI总结 本研究通过文本版情境反转学习范式,比较人类与LLM的行为和表征,发现LLM内部状态在推理时形成类似海马体的抽象几何结构,且该结构分层组织,高层次表征与推理相关。
弥合差距:基于四元数表示学习的异质属性图聚类
机构 * School of Computer Science and Technology, Guangdong University of Technology(广东工业大学计算机科学与技术学院) ; Tsinghua University(清华大学) ; BH-Energy Technology Co., Ltd.(BH-Energy科技有限公司) ; Shenzhen MSU-BIT University(深圳北理莫斯科大学)
AI总结 提出AGREE框架,通过多级对齐和基于相似度的图构建统一处理数值和类别属性,利用四元数图卷积缓解过度主导和过度平滑问题,实现无需预定义聚类数的端到端聚类。
Comments Accepted by IEEE Transactions on Emerging Topics in Computational Intelligence. Author-accepted manuscript
Journal ref IEEE Transactions on Emerging Topics in Computational Intelligence, 2026
相同问题,不同历史:语言、国家认同与大型语言模型中的归因
机构 * Tsinghua University(清华大学) ; Federal University of Rio de Janeiro(里约热内卢联邦大学)
AI总结 研究大型语言模型在21项有争议的发明/发现中,查询语言如何系统性地影响不同国家主张者的出现频率,揭示语言作为激活不同国家历史版本的开关,产生系统性不同的国家记忆。
Comments 27 pages (main text and Supplementary Information combined), 5 figures, 9 tables
Poisson2Gaussian:噪声高斯化以增强图像去噪
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; Department of Automation, Tsinghua University(清华大学自动化系) ; School of Electronic and Information Engineering, Beihang University(北京航空航天大学电子信息工程学院)
AI总结 提出Poisson2Gaussian (P2G)方法,通过概率密度匹配将复杂真实噪声转化为i.i.d.高斯噪声,并设计无偏去噪框架,无需干净数据或噪声参数,显著提升去噪性能。
PIVOTSBench:评估多模态大语言模型中的细粒度人际关系推理
机构 * Sun Yat-sen University(中山大学) ; University of Michigan(密歇根大学) ; Tsinghua University(清华大学)
AI总结 提出PIVOTS基准,基于Social-IQ 2.0和YouTube数据,评估多模态大语言模型在心理学研究基础上预测双向人际关系维度的能力,并包含辅助任务分析关键视觉线索。
自进化LLM智能体系统中的安全性:威胁、放大与案例研究
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; Tsinghua University(清华大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; Nanyang Technological University(南洋理工大学) ; Fudan University(复旦大学)
AI总结 本文系统分析自进化LLM智能体系统的安全威胁,提出模块-生命周期攻击面矩阵,揭示17个关键威胁和7种跨模块放大效应,并通过案例证明进化设计激活3.5倍攻击面且静态防御失效。
注意力谱正则化:无回放的连续多模态大语言模型
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Sun Yat-sen University(中山大学) ; Nanyang Technological University(南洋理工大学) ; Renmin University of China(中国人民大学) ; Tsinghua University(清华大学)
AI总结 提出注意力谱正则化(ASR),一种无回放的连续学习框架,通过存储技能级交叉注意力原型分布并施加谱正则化约束,有效缓解多模态大语言模型在连续微调中的灾难性遗忘。
ScalingAttention: 发现视频扩散变换器的内在稀疏注意力拓扑
机构 * KlingAI Research(KlingAI研究院) ; Beijing Institute of Technology(北京理工大学) ; NVIDIA(英伟达) ; Tsinghua University(清华大学)
AI总结 提出ScalingAttention框架,通过权重编码的稀疏拓扑(WEST)和保真度感知灵敏度调优(FAST)实现训练无关的注意力稀疏化,在Wan2.1上获得最高1.90倍加速并保持高质量。
Comments 18 pages, 9 figures
基于公式驱动的在线策略蒸馏综述与研究议程
机构 * Tsinghua University(清华大学)
AI总结 本文提出一种公式驱动的分类法,将在线策略蒸馏(OPD)视为反馈到更新的问题,区分直接分布损失和策略梯度式对数比更新,并揭示状态兼容性、支持构建、时间信用、词汇路由等关键因素。
READ:超越所见——基于强化学习的准确连贯音频描述生成
机构 * City University of Hong Kong(香港城市大学) ; Baidu Inc(百度公司) ; Tsinghua University(清华大学)
AI总结 提出首个基于强化学习的音频描述生成框架READ,通过序列级优化和连贯性奖励,显著提升生成准确性与连贯性。
MacAgentBench: 在真实macOS桌面上基准测试AI代理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Xi’an Jiaotong University(西安交通大学) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学) ; East China Normal University(华东师范大学) ; Tsinghua University(清华大学)
AI总结 提出MacAgentBench,包含676个跨25个应用的任务,采用规则评估和细粒度多检查点评分,实验表明最佳配置(OpenClaw上的Claude Opus 4.6)达到73.7% Pass@1,优势主要来自技能库而非框架设计。
人类与AI协作进行肺结节分割
机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院) ; PET/CT Center, The First Affiliated Hospital of Guangzhou Medical University(广州医科大学第一附属医院PET/CT中心) ; Department of Thoracic Surgery and Oncology, The First Affiliated Hospital of Guangzhou Medical University(广州医科大学第一附属医院胸外科与肿瘤科) ; Department of Mathematical Science, Tsinghua University(清华大学数学科学系) ; Yau Mathematical Sciences Center, Tsinghua University(清华大学尤金数学科学中心) ; China State Key Laboratory of Respiratory Disease & National Clinical Research Centre for Respiratory Disease, Guangzhou, China(中国呼吸疾病国家重点实验室及呼吸疾病临床研究中心,广州,中国) ; School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) ; National Center for Respiratory Medicine, National Clinical Research Center for Respiratory Disease, Guangzhou Institute of Respiratory Health, The First Affiliated Hospital of Guangzhou Medical University(呼吸医学国家中心、呼吸疾病临床研究中心、广州呼吸健康研究院、广州医科大学第一附属医院)
AI总结 提出Hi-Seg框架,基于SAM通过人类迭代优化提示实现肺结节分割,在12中心1179例CT上平均Dice达85%,优于多种深度学习模型,并降低标注时间。
金点狙击手:VLM中的自引导视觉推理用于细粒度动作理解
机构 * Beijing National Research Center for Information Science and Technology (BNRist), Department of Automation, Tsinghua University(清华大学自动化系北京信息科学与技术国家研究中心) ; State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院通用人工智能国家重点实验室)
AI总结 提出金点狙击手框架,通过金点提取器、选择性苏格拉底提问器和语义蕴含评估器三个模块,增强轻量级VLM的细粒度人类动作理解能力,在CAP基准上达到接近GPT-4o的性能且事实准确性更优。
稀疏性-存储-精度权衡在简约激活字典学习中的研究
机构 * Tsinghua University, Institute of Data and Information(清华大学数据与信息研究院) ; Shenzhen Key Laboratory of Ubiquitous Data Enabling(深圳泛在数据赋能重点实验室)
AI总结 本文提出简约激活字典学习(PADL)的结构化生成模型解释,推导出稀疏性、存储成本与重建精度之间的权衡关系,并开发出无需手动调参的高效算法,在视觉基准上取得更优性能。
OpenHLM:全身人形机器人移动操作的经验配方
机构 * Tsinghua University(清华大学) ; Shanghai Qi Zhi Institute(上海期智研究院) ; Spirit AI
AI总结 提出OpenHLM,通过全身遥操作、VLA模型设计和异构协同训练三阶段实验,构建直接映射语言和像素到人形机器人全部自由度的原生视觉-语言-动作模型,在长时域任务中优于现有基线。
ACEsplat: 仅通过RGB和姿态加速的3D高斯场景回归
机构 * Peking University(北京大学) ; University of Georgia(佐治亚大学) ; ByteDance(字节跳动) ; Tsinghua University(清华大学) ; Chongqing Vocational Institute of Engineering(重庆工程职业技术学院) ; Infinity Robotics
AI总结 提出ACEsplat框架,通过自监督场景坐标回归和轻量级高斯初始化,仅用RGB图像和相机姿态实现快速3D高斯场景重建,无需外部几何先验。
更深并非总是更好:通过置信层解码缓解对齐税
机构 * Qwen Team, Alibaba Inc.(阿里巴巴集团 Qwen 团队) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学)
AI总结 提出Confident Decoding,一种无需训练的解码策略,通过熵引导的保守反向搜索动态选择最可靠的近最终层,以缓解对齐微调导致的最终层扰动,提升推理性能。
AgentCAT:通过多智能体大语言模型模拟计算机自适应测试
机构 * Institute for Clarity in Documentation(文档清晰度研究所) ; Inria Paris-Rocquencourt(法国国家信息与自动化研究所巴黎-罗康库尔中心) ; Rajiv Gandhi University(拉吉夫·甘地大学) ; Tsinghua University(清华大学) ; Palmer Research Laboratories(帕默研究实验室) ; State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, Institute of Physical Science and Information Technology, Anhui University(光电信息获取与防护技术国家重点实验室,物理科学与信息技术学院,安徽大学) ; School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) ; School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) ; School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) ; State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China, the Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(认知智能国家重点实验室,中国科学技术大学,人工智能研究院,合肥综合性国家科学中心)
AI总结 提出基于大语言模型的多智能体仿真系统AgentCAT,通过考生、选题和监督三个模块模拟动态测试过程,实现能力估计与选题策略的平衡,在真实数据集上验证了有效性。
UnityShots: 基于记忆的多镜头音视频生成与边界感知门控
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; Kling Team, Kuaishou Technology(Kling团队,快手科技) ; Tsinghua University(清华大学) ; Sun Yat-sen University(中山大学)
AI总结 提出UnityShots,一种基于记忆的多镜头音视频生成系统,通过固定大小的长期和短期记忆槽及边界条件门控实现跨镜头连贯性,在多种条件模式下超越开源基线。
CulMind:中国文化遗产中的多模态理解与推理基准
机构 * University of International Relations(国际关系学院) ; Kedge Business School(凯致商学院) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Capital Normal University(首都师范大学)
AI总结 针对现有基准忽视推理过程的问题,提出CulMind和CulMind-R基准,涵盖50个任务和24个推理子任务,并设计ReaScore指标评估推理质量,揭示答案与推理之间的差距。
平衡GRPO自回归文本到图像后训练中的性能与多样性
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
AI总结 针对自回归文本到图像生成中人类偏好对齐问题,提出统一f-散度框架,理论分析不同散度对策略优化的影响,实验证明JS散度在性能与多样性间取得最佳平衡。
通过观测-动作规范化实现姿态无关的机器人功能性抓取
机构 * Tsinghua University(清华大学) ; Amazon(亚马逊) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出AnyMug框架,通过观测-动作规范化将深度观测和末端执行器动作转换到物体中心坐标系,训练单一闭环策略实现零样本迁移的功能性抓取,在模拟和真实机器人上均取得高成功率。
通过价值拼接的自适应地平线离线策略学习
机构 * The University of Hong Kong(香港大学) ; Tsinghua University(清华大学)
AI总结 提出VAST方法,通过递归、自适应地平线价值组合替代固定地平线备份,利用未来状态和地平线长度条件辅助价值函数与拼接策略,实现离线策略优化,在长时域任务中优于固定步长和生成价值基线。
面向组合泛化的因子感知混合专家与预训练编码器
机构 * Tsinghua University(清华大学) ; SunRisingAI Ltd.(日升AI有限公司) ; EFORT Intelligent Robot Co., Ltd.(埃夫特智能机器人有限公司)
AI总结 提出FAME框架,结合因子感知混合专家与预训练编码器,通过三阶段训练实现视觉机器人操作在多变环境中的组合泛化,在Meta-World和真实任务中分别提升34%和35%。
Comments 8 pages, 9 figures, accepted by the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)