Shao: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation
Shao:将声学令牌语言模型扩展至高保真音乐生成
机构 * Central Conservatory of Music(中央音乐学院) ; Tsinghua University(清华大学)
AI总结 该研究提出单一声学令牌层级内渐进建模音乐结构与保真度的框架,通过双阶段生成与混合注意力训练,无需异构空间即可实现高质量音乐生成。
高校专区
Shao:将声学令牌语言模型扩展至高保真音乐生成
机构 * Central Conservatory of Music(中央音乐学院) ; Tsinghua University(清华大学)
AI总结 该研究提出单一声学令牌层级内渐进建模音乐结构与保真度的框架,通过双阶段生成与混合注意力训练,无需异构空间即可实现高质量音乐生成。
WeaveBench: 面向混合接口的长期、真实世界计算机使用代理基准
机构 * Zhejiang University(浙江大学) ; Microsoft Research Asia(微软亚洲研究院) ; Tsinghua University(清华大学)
AI总结 提出WeaveBench基准,包含114个跨8个真实工作领域的长期混合接口任务,要求代理结合GUI和CLI/代码操作,最佳PassRate仅41.2%,揭示现有评估的不足。
表示强制:无瓶颈统一多模态模型
机构 * University of Hong Kong(香港大学) ; ByteDance Seed(字节跳动种子) ; The Chinese University of Hong Kong(香港中文大学) ; Nanjing University(南京大学) ; Tsinghua University(清华大学)
AI总结 提出表示强制(RF)技术,通过让解码器自回归预测视觉表示作为中间令牌,再在相同骨干网络中引导像素扩散,从而消除统一多模态模型对预训练VAE的依赖,实现无瓶颈的端到端模型。
Comments Project page: https://yuqingwang1029.github.io/RepresentationForcing
检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头
机构 * HKUST(香港科技大学) ; University of Edinburgh(爱丁堡大学) ; CUHK(香港中文大学) ; NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) ; Tsinghua University(清华大学)
AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。
Comments Work in Progress
无需标注的深度学习用于胎儿生殖层-脑室出血的检测和分割
机构 * Department of Radiology, West China Second University Hospital, Sichuan University(四川大学华西第二医院放射科) ; School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University(清华大学医学院生物医学工程系) ; Department of Radiology, Sichuan Provincial Woman’s and Children’s Hospital, The Affiliated Women’s and Children’s Hospital of Chengdu Medical College(四川省妇幼保健院放射科,成都医学院附属妇幼医院) ; Chengdu Women’s and Children’s Central Hospital, School of Medicine, University of Electronic Science and Technology of China(成都妇女儿童中央医院,电子科技大学医学院) ; Department of Radiology, The Third Affiliated Hospital of Zhengzhou University(郑州大学第三附属医院放射科) ; Qujing Maternal and Child Health Hospital, Qujing, China(曲靖 maternal and child health hospital, Qujing, China)
AI总结 本文提出一种无需标注数据的深度学习框架,用于自动检测和分割胎儿生殖层-脑室出血,通过伪图像合成和医学先验知识训练,提升了诊断和分割的准确性。
MLS-Bench:对构建更好AI的AI系统的全面且严格评估
机构 * UC Berkeley(伯克利大学) ; Princeton University(普林斯顿大学) ; Tsinghua University(清华大学) ; University of Washington(华盛顿大学) ; Purdue University(Purdue 大学) ; Harvard University(哈佛大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Shanghai Jiao Tong University(上海交通大学) ; UC San Diego(圣地亚哥大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出MLS-Bench基准,包含12个领域140个任务,评估AI系统能否发明通用且可扩展的机器学习方法,发现当前智能体在方法发明上仍远逊于人类,瓶颈在于科学洞察而非单纯搜索或计算。
$M^2$-VLA:通过层混合与元技能提升视觉语言模型的通用操控能力
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai, China(智能机器人与先进制造学院,复旦大学,上海,中国) ; Synapath
AI总结 本文提出$M^2$-VLA,通过层混合和元技能模块提升视觉语言模型在机器人操控中的泛化能力,实验验证了其在模拟和现实环境中的有效性。
面向流式目标说话人提取的分块交织拼接自回归语言模型
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; The Chinese University of Hong Kong(香港中文大学) ; SenseTime Research(商汤科技研究院)
AI总结 本文提出一种分块交织拼接方法,用于提升流式目标说话人提取的效率与稳定性,实验表明其在低延迟下保持高性能且优于离线基线。
动态生成视频中3D空间几何一致性的测量
机构 * Tongji University(同济大学) ; Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出SGC指标,用于评估动态生成视频中的3D空间几何一致性,通过分析多个相机姿态的分歧度来量化几何不一致问题,实验证实其能有效识别现有方法遗漏的关键故障。
Comments Accepted at ECCV 2026. Code is available at https://github.com/tj12323/SGC
MIND-V:基于强化学习物理对齐的长期机器人操作分层世界模型
机构 * Tsinghua University(清华大学) ; X Square Robot(X Square机器人) ; Sun Yat-sen University(中山大学) ; HKUST(香港科技大学)
AI总结 提出MIND-V分层世界模型,通过语义推理、行为语义桥接和运动视频生成,结合强化学习物理对齐,实现长期机器人操作视频的物理合理合成。
AULLM++:用于微表情动作单元检测的结构化令牌条件大语言模型
机构 * Great Bay University(广东东莞大学) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 针对微表情动作单元检测,以往方法有局限。本文提出AULLM++框架,利用大语言模型,将视觉特征注入文本提示,分证据构建、结构建模和基于推理预测三阶段,融合多粒度证据等,提升性能与泛化能力。
Hyper-KGGen:一种用于高质量知识超图生成的技能驱动知识提取器
机构 * Xi’an Jiaotong University(西安交通大学) ; State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) ; Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) ; Tsinghua University(清华大学) ; Shanghai University(上海大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
AI总结 针对高质量知识超图构建难题,提出Hyper-KGGen框架,用粗到细机制分解文档,含自适应技能获取模块,经反馈回路提炼领域专长,还给出标注基准,实验验证其性能优于基线。
TaoSR-AGRL:用于电子商务搜索相关性的自适应引导强化学习框架
机构 * Tsinghua University(清华大学) ; Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) ; Fudan University(复旦大学)
AI总结 电商搜索中查询-产品相关性预测很关键,现有方法有局限。提出TaoSR-AGRL框架,通过规则感知奖励塑造和自适应引导重放两大创新,提升模型推理能力,在实验中表现优于基线,已成功部署。
Comments Accepted to The Web Conference (WWW) 2026, Industry Track, Oral
Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), 2026, pp. 7955-7966
迈向高效智能体:记忆、工具学习与规划
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiaotong University(上海交通大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) ; Hong Kong Polytechnic University(香港理工大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学)
AI总结 研究将大语言模型扩展到智能体系统中的效率问题,从记忆、工具学习和规划三个核心组件考虑成本,回顾多种方法并详细讨论,以两种方式刻画效率,还探讨关键挑战与未来方向。
Comments 63 pages, 244 references
PuzzleMoE:通过稀疏专家合并和位打包推理对大型专家混合模型进行高效压缩
机构 * Tsinghua University(清华大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 研究针对专家混合模型内存开销大难题,提出PuzzleMoE方法。通过识别权重冗余与专业化进行稀疏专家合并,用双掩码捕获参数,引入位打包编码避免存储开销,实现高效推理,大幅压缩模型且保持精度。
TrendFact:自动事实核查中热点感知的基准
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; National University of Defense Technology(国防科学技术大学) ; Northeastern University(东北大学) ; East China Normal University(华东师范大学) ; Beihang University(北京航空航天大学) ; Tsinghua University(清华大学)
AI总结 研究自动事实核查范式在资源受限环境下面临风险不对称挑战,引入TrendFact基准及评估热点感知能力的指标,提出FactISR框架提升热点感知能力和计算效率。
Re:Form——利用大语言模型中的强化学习减少可扩展形式化软件验证中的人工标注:关于Dafny的初步研究
机构 * Shanghai AI Lab(上海人工智能实验室) ; University of Alberta(阿尔伯塔大学) ; Tsinghua University(清华大学) ; Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) ; Hong Kong University of Science and Technology(香港科技大学) ; Nanyang Technological University(南洋理工大学) ; University of Manchester(曼彻斯特大学) ; Peking University(北京大学)
AI总结 研究利用形式语言Dafny减少人工标注,核心方法是引入自动可扩展数据处理流程及结合形式语言验证器反馈的强化学习设计,主要贡献是提升模型在DafnyComp基准测试表现。
Comments Published in Transactions on Machine Learning Research (TMLR), 05/2026. Reviewed on OpenReview: https://openreview.net/forum?id=cAQmIS4GOe
OctoPipe:通过共同优化分区、放置和调度减少异构模型的流水线气泡
机构 * FDU & Shanghai AI Laboratory(复旦大学及上海人工智能实验室) ; HKUST(香港科技大学) ; Unaffiliated(无隶属机构) ; Tsinghua University(清华大学) ; CUHK & SenseTime Research(香港大学及SenseTime研究院)
AI总结 研究针对模型架构异构性加剧流水线气泡降低训练效率的问题,提出OctoPipe系统,通过构建模拟器、开发调谐器、实现执行器共同优化分区、放置和调度,提升了吞吐量。
Comments 14 pages, 12 Figures; Accepted by SC'26;
CoDoL:用于分布外泛化的条件域提示学习
机构 * East China Normal University(东华师范大学) ; Xidian University(西安电子科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; The University of Oxford(牛津大学) ; Tsinghua University(清华大学)
AI总结 针对基于提示的CLIP方法存在的文本描述不准确、视觉语言嵌入对齐有限问题,提出CoDoL方法,利用域信息形成提示,还提出DMN生成输入条件令牌,实验验证其在分布外泛化的有效性。
Comments Accepted to TMLR 2026
图酉消息传递
机构 * Department of Electrical Engineering, Tsinghua University(清华大学电子工程系) ; Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) ; State Key laboratory of Space Network and Communications(空间网络与通信国家重点实验室)
AI总结 针对图神经网络中不稳定问题,提出图酉消息传递框架,通过在变换图上用酉传播算子避免指数衰减,结合图变换和酉投影程序,经理论分析表明其能保持深度稳定,实验取得较好性能。
Comments TMLR