The SJTU X-LANCE Lab System for MSR Challenge 2025
上海交通大学X-LANCE实验室系统用于MSR挑战2025
机构 * SJTU X-LANCE Lab(上海交通大学X-LANCE实验室)
AI总结 X-LANCE实验室提出了一种基于BS-RoFormers的音乐源恢复系统,通过预训练模型和多种训练方案实现8种乐器分离,取得挑战赛多项指标第一名。
高校专区
上海交通大学X-LANCE实验室系统用于MSR挑战2025
机构 * SJTU X-LANCE Lab(上海交通大学X-LANCE实验室)
AI总结 X-LANCE实验室提出了一种基于BS-RoFormers的音乐源恢复系统,通过预训练模型和多种训练方案实现8种乐器分离,取得挑战赛多项指标第一名。
面向视觉生成的统一个性化奖励模型
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiaotong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室)
AI总结 本文提出UnifiedReward-Flex,一种面向视觉生成的统一个性化奖励模型,通过结合奖励建模与灵活上下文适应的推理,提升视觉生成的准确性与对人类偏好的对齐性。
Comments Website: https://codegoat24.github.io/UnifiedReward/flex
MoWM: 通过潜在到像素特征调制的混合世界模型实现具身规划
机构 * Tsinghua University(清华大学) ; Manifold AI ; Shanghai Jiao Tong University(上海交通大学)
AI总结 MoWM通过融合潜在世界模型与像素特征,提升具身规划中动作解码的精度与泛化能力。
面具背后的魔鬼:扩散语言模型的新兴安全漏洞
机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) ; Shanghai AI Laboratory(上海人工智能实验室) ; University of Chicago(芝加哥大学)
AI总结 DIJA揭示了扩散语言模型的安全漏洞,通过构造对抗性提示利用双向建模和并行解码机制,使有害内容在对齐训练模型中得以生成。
Comments Accepted by ICLR 2026
解构位置信息:从注意力logits到训练偏见
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院)
AI总结 本文通过分析注意力logits和位置编码形式,揭示了乘法编码在整合位置与语义信息上的优势,并发现训练过程中存在的单头沉积模式。
Comments Accepted by ICLR 2026
Plasticine: 加速塑料性驱动的深度强化学习研究
机构 * HK PolyU(香港理工大学) ; SJTU(上海交通大学) ; EIT, Ningbo(宁波工程学院) ; NTU(National University of Technology) ; HKU(香港大学) ; INFIFORCE
AI总结 Plasticine是首个开源框架,用于评估深度强化学习中的塑性优化,提供多种缓解方法和评估指标,帮助研究者系统量化塑性损失并分析动态。
Comments 21 pages, 7 figures
在离散潜在空间中进行下一步概念预测可使语言模型更强大
机构 * LUMIA Lab(LUMIA实验室) ; School of Artificial Intelligence(人工智能学院) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Department of Electronic Engineering(电子工程系) ; College of Artificial Intelligence(人工智能学院) ; Tsinghua University(清华大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 通过在离散潜在空间中进行下一步概念预测,ConceptLM在预训练任务中实现了更强大的语言模型性能。
VocalNet-MDM:通过自蒸馏掩码扩散建模加速流式语音大语言模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
AI总结 VocalNet-MDM通过自蒸馏掩码扩散建模实现流式语音LLM的高效解码与低延迟
OSCAR:基于优化的代理规划用于组合图像检索
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 OSCAR通过优化引导的代理规划框架,提升组合图像检索的性能,仅用10%训练数据即超越现有最佳方法。
D$^2$-VR: 降质鲁棒且蒸馏的视频修复与协同优化策略
机构 * Shanghai Jiaotong University(上海交通大学)
AI总结 D$^2$-VR通过降质鲁棒流对齐和对抗蒸馏技术,实现低步推理的视频修复,提升修复质量和效率。
新技能还是更尖锐的原语?从概率角度探讨RLVR中推理能力的出现
机构 * University of Science(科学技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Nanjing University(南京大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 RLVR通过提升原子步骤概率,使模型在多步骤推理中克服指数衰减,展现新能力而非单纯激发潜在痕迹。
Comments 15 pages
MLLMs真的能看见吗:在多模态大语言模型中强化视觉注意力
机构 * Shanghai Jiao Tong University(上海交通大学) ; Northwestern Polytechnical University(西北工业大学)
AI总结 SAYO通过强化学习框架引入区域级视觉注意力奖励,提升多模态大语言模型的视觉聚焦能力,从而在多种推理和感知任务中取得性能提升。
通过跨切片一致的随机性改进2D扩散模型用于3D医学影像
机构 * ShanghaiTech University(上海科技大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 通过引入跨切片一致的随机性策略,改进2D扩散模型以提升3D医学影像重建的保真度与一致性。
Comments Accepted by ICLR 2026
ProjDevBench: 从端到端项目开发角度评估AI编程代理
机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) ; Beijing Institute of Technology, Beijing, China(北京理工大学) ; University of California, Merced, CA, USA(加州大学默塞德分校) ; Shanghai Innovation Institute, Shanghai, China(上海创新研究院)
AI总结 ProjDevBench从端到端项目开发角度评估AI编程代理,通过系统架构设计、功能正确性和迭代优化三个维度,评估六种基于不同LLM的代理,发现其在复杂系统设计和资源管理方面存在不足。
InternSVG:通过多模态大语言模型实现统一的SVG任务
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Donghua University(东华大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 InternSVG通过多模态大语言模型实现统一的SVG任务建模,结合大规模数据集和两阶段训练策略,提升SVG理解、编辑和生成性能。
ASSESS: 一个用于语义和结构相似性评估的框架
机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院)
AI总结 ASSESS提出了一种新的语义和结构相似性评估框架,通过TransTED度量在EPLA基准上实现了最先进的准确率和Kappa分数。
Comments Accepted to ICLR 2026
DyMixOp:从复杂动力学视角设计的神经算子,通过局部-全局混合解决偏微分方程
机构 * School of Aeronautics and Astronautics, Shanghai Jiao Tong University(航空宇航学院,上海交通大学)
AI总结 DyMixOp通过局部-全局混合机制,从复杂动力学角度设计神经算子,有效解决PDEs的非线性建模问题,实现高精度与高效计算的平衡。
WeTok:强大的离散分词用于高保真的视觉重建
机构 * Shanghai Jiao Tong University(上海交通大学) ; WeChat Vision, Tencent Inc.(腾讯微信视觉部门) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) ; Hong Kong University of Science and Technology(香港科学大学) ; Zhejiang University(浙江大学) ; Shanghai AI Laboratory(上海人工智能实验室)
AI总结 WeTok通过GQ和GD创新实现高保真视觉重建,以更高效的压缩率和更优的重建质量在ImageNet上取得突破。
Comments 32 pages, 15 figures, 39 tables
改进的采样算法与非对数凹分布的函数不等式
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 本文改进了非对数凹分布采样算法,通过加强假设获得更优的查询复杂度和Poincaré常数界。
解耦的参数高效线性模型用于长期时间序列预测
机构 * Shanghai Key Laboratory of Scalable Computing(可扩展计算与系统上海市重点实验室) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英技术学院) ; ByteDance Inc.(字节跳动公司)
AI总结 DiPE-Linear通过解耦参数高效模块,实现了更高效的长期时间序列预测,减少参数和计算复杂度,取得更优性能。
Comments Accepted by DASFAA 2026. (Submitted Manuscript Version)
EgoFSD:面向端到端自动驾驶的以自我为中心的完全稀疏范式,结合不确定性去噪和迭代细化
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; SenseAuto ; The Hong Kong University of Science and Technology(香港理工大学)
AI总结 EgoFSD通过引入稀疏感知、分层交互和迭代运动规划,提升端到端自动驾驶的效率和性能,减少误差和碰撞,提高训练稳定性。
Comments Accepted to ICRA2026
MARTI-MARS$^2$:通过强化学习实现多智能体自搜索的扩展用于代码生成
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Shanghai Jiao Tong University(上海交通大学) ; Institute of Automation(自动化研究所) ; Fudan University(复旦大学) ; High School Affiliated to Fudan University(复旦大学附属高中) ; Renmin University of China(中国人民大学) ; University of Washington(华盛顿大学)
AI总结 MARTI-MARS2通过多智能体强化学习实现代码生成的扩展,突破单智能体限制,提升性能和多样性。
远程人类识别:挑战、方法与HID 2025竞赛结果
机构 * Shenzhen Polytechnic University(深圳职业技术大学) ; Fujitsu Research and Development Center Company Ltd.(富士通研发有限公司) ; Beijing Jiaotong University(北京交通大学) ; South China University of Technology(华南理工大学) ; Shandong University(山东大学) ; EVERSPRY ; Wuhan University of Technology(武汉理工大学) ; Sun Yat-sen University(中山大学) ; Shanghai Jiao Tong University(上海交通大学) ; Fujitsu Ltd.(富士通株式会社) ; Huazhong University of Science and Technology(华中科技大学) ; Hefei University of Technology(合肥工业大学) ; Peking University, Shenzhen Graduate School(北京大学深圳研究生院) ; Beijing Normal University(北京师范大学) ; Watrix Technology Limited Co. Ltd.(华智科技有限公司) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Cordoba(科尔多瓦大学) ; University of East London(东伦敦大学) ; Southern University of Science and Technology(南方科技大学)
AI总结 HID 2025竞赛评估了步态识别在远程人类识别中的挑战与进展,通过SUSTech-Competition数据集验证了算法性能的提升,达到94.2%的准确率。
Comments Accepted by IJCB 2025(https://ijcb2025.ieee-biometrics.org/competitions/)
TextOp: 人形机器人实时交互文本驱动动作生成与控制
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) ; Shanghai Jiao Tong University(上海交通大学) ; East China University of Science and Technology(东华大学)
AI总结 TextOp通过实时文本驱动框架实现人形机器人灵活的动作生成与控制,支持流式指令和即时修改,实现实时交互与自主性平衡。
Comments Project Page: https://text-op.github.io/
通过手性行列式核学习分子手性
机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学)
AI总结 本文提出ChiDeK框架,通过手性行列式核和交叉注意机制,系统整合立体化学信息,实现对分子中心和轴手性的联合编码,并在ECD和OR预测任务中取得显著提升。
Comments Accepted at the ICLR 2026
监控面部图像质量评估:一个多维数据集和轻量模型
机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) ; School of Communication and Electronic Engineering, East China Normal University(东华大学通信与电子工程学院) ; School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Shanghai AI Lab(上海人工智能实验室)
AI总结 本文提出SFIQA-Bench和SFIQA-Assessor,针对监控场景中的质量与保真度问题,通过多任务模型实现高质量的面部图像评估。
OPUS:在每次迭代中实现大语言模型预训练中的高效且原则性的数据选择
机构 * SJTU(上海交通大学) ; Alibaba(阿里巴巴)
AI总结 OPUS通过在优化器诱导的更新空间中动态选择数据,提升大语言模型预训练的效率和效果,尤其在数据稀缺和低质量情况下表现优异。
Comments 45 pages, 7 figures, 8 tables
RoboPaint:从人类示范到任何机器人和任何视角
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
AI总结 RoboPaint通过真实-仿真-真实数据流程,将人类示范转化为机器人训练数据,实现高效、低成本的复杂灵巧操作训练。
Comments 17 pages
RealPDEBench: 一个整合真实世界数据的复杂物理系统基准
机构 * School of Engineering, Westlake University(西湖大学工程学院) ; Global College, Shanghai Jiao Tong University(上海交通大学全球学院) ; Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) ; Department of Geotechnical Engineering, Tongji University(同济大学地质工程系) ; School of Physics, Peking University(北京大学物理学院) ; Key Laboratory for Power Machinery and Engineering of M. O. E., Shanghai Jiao Tong University(上海交通大学机械工程重点实验室)
AI总结 RealPDEBench通过整合真实世界数据与模拟数据,为科学机器学习提供了一个新的基准,旨在弥合仿真与现实之间的差距。
Comments iclr26 oral; 46 pages, 21 figures
协同在线学习赋能的分布鲁棒多机器人运动控制
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai, China(自动化与智能感知学院,上海交通大学,上海,中国) ; Department of Mechanical Engineering, University of Victoria, Victoria, Canada(机械工程系,维多利亚大学,维多利亚,加拿大)
AI总结 本文提出一种基于协同在线学习的分布鲁棒多机器人运动控制方法,通过构建模糊集并优化轨迹生成,实现碰撞避免和长期跟踪性能保障。
Comments 26 pages