Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy
Harmony: 通过跨任务协同实现音频和视频生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent Hunyuan Project(腾讯文心项目)
AI总结 Harmony通过跨任务协同机制和同步增强CFG,实现高效音频视频同步生成。
高校专区
Harmony: 通过跨任务协同实现音频和视频生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent Hunyuan Project(腾讯文心项目)
AI总结 Harmony通过跨任务协同机制和同步增强CFG,实现高效音频视频同步生成。
STAR-Bench:探测深度时空推理作为音频4D智能
机构 * Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Innovation Institute(上海创新研究院) ; Beihang University(北京航空航天大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 STAR-Bench通过测试音频4D智能,揭示了模型在细粒度感知和推理上的不足,为未来模型发展提供方向。
Comments Homepage: https://internlm.github.io/StarBench/
空间并行全光神经网络
机构 * School of Physics and Astronomy(物理与天文学院) ; Shanghai Jiao Tong University(上海交通大学) ; School of Electronic Engineering(电子工程学院) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Beijing Institute of Space Mechanics and Electricity(北京空间机械与电子研究所) ; China Academy of Space Technology(中国空间技术研究院) ; School of Physics(物理学院) ; Chengdu University of Technology(成都理工大学)
AI总结 本文提出了一种空间并行全光神经网络架构,通过并行处理提升计算精度与鲁棒性,为光学神经计算提供新的解决方案。
Comments 13 pages, 4 figures
SARD: 通过区域约束扩散与判别掩码引导进行的分段感知异常合成
机构 * Global Institute of Future Technology(未来技术全球研究所) ; Shanghai Jiao Tong University(上海交通大学) ; Department of Intelligent Manufacturing(智能制造系) ; Contemporary Amperex Technology Co.,Ltd(当代电子技术有限公司)
AI总结 SARD通过区域约束扩散与判别掩码引导方法,提升工业异常检测系统的鲁棒性,实现更精确的像素级异常合成。
Comments Accepted by The 2025 International Conference on Machine Intelligence and Nature-InspireD Computing (MIND)
Kalib: 通过参考点跟踪实现易于的机眼标定
机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(电子信息与电气工程学院,上海交通大学) ; Meta Robotics Institute, Shanghai Jiao Tong University(元机器人研究所,上海交通大学) ; Qing Yuan Research Institute(青元研究院) ; MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能联合重点实验室,人工智能学院,上海交通大学)
AI总结 Kalib通过利用视觉基础模型的通用性,提出了一种无需复杂设置的机眼标定方法,实现了高精度与低手动工作量的平衡。
Comments The code, data, and supplementary materials are available at https://sites.google.com/view/hand-eye-kalib
PURE 编码器:残差熵的渐进展开用于语音编码器学习
机构 * CMU(卡内基梅隆大学) ; SJTU(上海交通大学)
AI总结 PURE编码器通过预训练语音增强模型指导多阶段量化,提升低比特率语音编码的训练稳定性与重建质量,尤其在嘈杂环境下表现优异。
Comments Accepted by ASRU2025
几何约束代理用于空间推理
机构 * School of Software, Beihang University(北京航空航天大学软件学院) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; ZIP Lab, Zhejiang University(浙江大学ZIP实验室)
AI总结 Geometrically-Constrained Agent 通过引入正式任务约束,解决视觉语言模型在空间推理中的语义到几何差距问题,实现更稳健的推理路径。
Comments 27 pages, 13 figures
IMTalker: 基于隐式运动传输的高效音频驱动说话人脸生成
机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室)
AI总结 IMTalker通过隐式运动传输实现高效音频驱动说话人脸生成,提升运动准确性与身份保持性,达到最先进的生成质量与效率。
Comments 11 pages, 5 figures
G$^2$VLM:基于几何的视觉语言模型,实现统一的3D重建与空间推理
机构 * Shanghai AI Lab(上海人工智能实验室) ; UCLA(加州大学洛杉矶分校) ; SJTU(上海交通大学) ; FDU(福建师范大学) ; ZJU(浙江大学) ; USTC(中国科学技术大学) ; HKU(香港大学) ; CUHK(香港中文大学)
AI总结 G$^2$VLM通过统一3D重建与空间推理,提升视觉语言模型在空间智能任务中的性能。
Comments code are released at https://github.com/InternRobotics/G2VLM
一步扩散变换器用于可控的现实世界图像超分辨率
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xiaohongshu Inc(小红书公司)
AI总结 ODTSR通过噪声混合视觉流和保真度感知对抗训练,实现一步扩散变换器在现实世界图像超分辨率中的保真度与可控性平衡。
WritingBench: 一个全面的生成写作评估基准
机构 * Alibaba Group(阿里巴巴集团) ; Renmin University of China(中国人民大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 WritingBench是一个用于评估生成写作能力的综合基准,通过查询依赖框架和微调批评模型,提升多领域写作任务的评估效能。
通过大规模多模态数据集增强描述性图像质量评估
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) ; Sofia University(索菲亚大学) ; University of Macau(澳门大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shenzhen University of Advanced Technology(深圳先进技术大学)
AI总结 本研究提出DepictQA-Wild模型,通过构建大规模多模态数据集提升图像质量评估的准确性和实用性。
Comments Accepted by TIP
AutoHall: 自动化生成大语言模型的事实性幻觉数据集
机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学) ; Shanghai Key Laboratory of Trusted Data Circulation and Governance in Web3(上海可信数据流通与治理Web3重点实验室) ; School of Media & Communication, Shanghai Jiao Tong University(媒体与传播学院,上海交通大学)
AI总结 AutoHall通过自动化生成模型特定的幻觉数据集,提升大语言模型的事实性内容检测能力。
Comments Accepted by IEEE Transactions on Audio, Speech, and Language Processing (TASLP)
VacuumVLA: 通过统一的吸力和抓取工具提升VLA能力以实现复杂机器人操作
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; DiDi Global(滴滴出行)
AI总结 VacuumVLA通过整合吸力与抓取功能的末端执行器,提升VLA在复杂机器人操作中的能力,实现更多任务的可行性。
Comments 8 pages
通过边界框思考:通过强化微调提升空间时间视频定位
机构 * ByteDance Intelligent Creation(字节跳动智能创作) ; Tsinghua University(清华大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Shanghai Jiao Tong University(上海交通大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
AI总结 STVG-o1通过强化微调提升空间时间视频定位性能,实现无需架构修改的先进结果。
手术视频分析中Segment Anything模型的系统评估与指南
机构 * Global College(全球学院) ; Shanghai Jiao Tong University(上海交通大学) ; Department of Automation(自动化系) ; National University of Singapore(新加坡国立大学) ; Department of Computer Science and Engineering(计算机科学与工程系)
AI总结 本文评估了SAM2模型在手术视频分割中的零样本能力,揭示其在结构化场景中的表现与动态手术条件下的局限性,为手术数据科学提供未来研究方向。
通过评估LLM作为裁判来评估LLM对齐
机构 * Yale University(耶鲁大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出AlignEval基准,通过评估LLM作为裁判的能力来衡量其对齐人类偏好的效果,结果优于现有自动评估基准。
Comments NeurIPS 2025 Camera Ready
Flash-DMD: 向高保真少步图像生成迈进:高效蒸馏与联合强化学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent(腾讯) ; Huazhong University of Science and Technology(华中科技大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 Flash-DMD通过高效蒸馏和联合强化学习实现快速收敛,提升少步图像生成的保真度和稳定性。
通过基于猜测的算法-系统联合设计降低LLM搜索代理的延迟
机构 * Tsinghua University(清华大学) ; Infinigence ; Lenovo(联想) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 SPAgent通过基于猜测的算法-系统联合设计框架,减少LLM搜索代理的延迟,实现端到端加速并保持高准确性。
DLADiff: 一种双层防御框架,用于对抗扩散模型的微调和零样本定制
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shandong University(山东大学) ; Hefei University of Technology(合肥工业大学) ; East China Normal University(华东师范大学)
AI总结 DLADiff提出一种双层防御框架,通过双代理模型和交替动态微调有效防御扩散模型的微调和零样本生成攻击。
Spatial-SSRL: 通过自监督强化学习增强空间理解
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 Spatial-SSRL通过自监督强化学习提升大视觉-语言模型的空间理解能力,无需人工标注,在多个基准测试中取得显著准确率提升。
Comments preprint
EHR-R1: 一种增强推理能力的基础语言模型用于电子健康记录分析
机构 * Shanghai Jiao Tong University(上海交通大学) ; Intelligence Healthcare Department, AntGroup(智能医疗部,蚂蚁集团) ; Intelligence Computing and Sensing Laboratory, Peking University(智能计算与感知实验室,北京大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学)
AI总结 EHR-R1是一种针对电子健康记录分析设计的增强推理能力的基础语言模型,通过大规模推理数据集和多阶段训练方法提升了EHR分析的准确性和鲁棒性。
STAlloc:通过时空规划提升大规模模型训练的内存效率
机构 * Tsinghua University(清华大学) ; Infinigence AI ; Shanghai Jiao Tong University(上海交通大学)
AI总结 STAlloc通过结合离线规划与在线分配,有效减少大规模模型训练中的内存碎片化,提升训练效率和吞吐量。
TK-Mamba:将KAN与Mamba结合用于文本驱动的3D医学图像分割
机构 * Zhejiang University(浙江大学) ; Research Center, National Certification Technology (Hangzhou) Co., Ltd(国家认证技术(杭州)有限公司研究部) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; East China Normal University(华东师范大学)
AI总结 TK-Mamba通过融合KAN与Mamba,提出文本驱动的3D医学图像分割方法,实现高效准确的多器官和肿瘤分割。
注意力跨度混合:通过异质滑动窗口长度优化LLM推理效率
机构 * Tsinghua University(清华大学) ; Infinigence-AI ; Stanford University(斯坦福大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 MoA通过异质滑动窗口长度优化LLM推理效率,提升上下文长度和检索准确率,减少内存消耗并提高吞吐量。
Comments Published at CoLM'25
Life-IQA: 通过GCN增强的层交互和MoE基于的特征解耦提升盲图像质量评估
机构 * College of Integrated Circuits, Shanghai Jiao Tong University(集成电路学院,上海交通大学) ; College of Integrated Circuits, Beijing University of Chemical Technology(集成电路学院,北京化工大学) ; ICCI and the Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(ICCI和图像通信与信息处理研究所,上海交通大学)
AI总结 Life-IQA通过GCN增强的层交互和MoE基于的特征解耦提升盲图像质量评估的准确性和效率。
基于单目鱼眼摄像头的端到端自动驾驶跟车系统
机构 * department of Automation, Shanghai Jiao Tong University(自动化系,上海交通大学) ; Key Laboratory of System Control and Information Processing, Ministry of Education(系统控制与信息处理重点实验室,教育部) ; Global Institute of Future Technology, Shanghai Jiao Tong University(未来技术全球研究院,上海交通大学)
AI总结 本文提出一种基于单目鱼眼摄像头的端到端自动驾驶跟车系统,通过语义掩码和动态采样机制提升驾驶性能,实现低成本的车辆编队应用。
VideoCompressa: 通过联合时间压缩和空间重建实现数据高效的视频理解
机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) ; KTH(瑞典皇家理工学院) ; Shanghai AI Laboratory(上海人工智能实验室) ; HKUST(香港科技大学)
AI总结 VideoCompressa通过联合时间压缩和空间重建,实现视频数据高效合成,显著提升数据效率和模型性能。
Comments 15 pages, 6 tables, 8 figures
OmniDocLayout: 通过粗到细的LLM学习实现多样化的文档布局生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Sun Yat-sen University(中山大学)
AI总结 OmniDocLayout通过粗到细的LLM学习方法,生成多样化文档布局,解决现有布局生成中多样性和复杂性不足的问题。
Comments TL;DR: With the proposed OmniDocLayout-1M dataset and the LLM-based coarse-to-fine learning strategy, we enable diverse and complex document layout generation that achieves both strong condition consistency and adherence to fundamental aesthetic principles
学习原始具身世界模型:迈向可扩展的机器人学习
机构 * Shanghai AI Lab(上海人工智能实验室) ; Fudan(复旦大学) ; SJTU(上海交通大学) ; NJUST(南京理工大学) ; THU(清华大学) ; Harvard(哈佛大学) ; ZJU(浙江大学) ; NJU(南京大学) ; USTC(中国科学技术大学) ; Tongji(同济大学) ; HKUST (GZ)(香港科技大学(广州))
AI总结 提出原始具身世界模型(PEWM)以解决具身数据稀疏和高维问题,通过短视界视频生成实现细粒度对齐、降低学习复杂度并提高数据效率。