arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3178
2601.15589 2026-01-23 cs.LG

Deep Learning for Perishable Inventory Systems with Human Knowledge

带有人类知识的易腐库存系统的深度学习

Xuan Liao, Zhenkang Peng, Ying Rong

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出了一种基于深度学习的易腐库存管理方法,结合人类知识提升学习效率,通过结构引导策略和提升技术改进订单决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15296 2026-01-23 cs.CL cs.AI

Entropy-Tree: Tree-Based Decoding with Entropy-Guided Exploration

熵树:基于熵引导的树状解码

Longxuan Wei, Yubo Zhang, Zijiao Zhang, Zhihu Wang, Shiwan Zhao, Tianyu Huang, Huiting Zhao, Chenfei Liu, Shenao Zhang, Junchi Yan

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Huawei Technologies Ltd.(华为技术有限公司) Nankai University(南开大学) Nanyang Technological University(南洋理工大学)

AI总结 熵树通过利用熵信号指导分支决策,提升解码效率和不确定性估计的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12787 2026-01-23 cs.CV

Rasterizing Wireless Radiance Field via Deformable 2D Gaussian Splatting

通过可变形2D高斯散射法实现无线辐射场的栅格化

Mufan Liu, Cixiao Zhang, Qi Yang, Yujie Cao, Yiling Xu, Yin Xu, Shu Sun, Mingzeng Dai, Yunfeng Guan

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(信息科学与电子工程学院,上海交通大学) University of Missouri-Kansas City(密苏里大学-凯斯城分校) Lenovo Group, Lenovo Research(联想集团,联想研究院)

AI总结 SwiftWRF通过可变形2D高斯散射法高效重建无线辐射场,实现高速光谱合成与高精度信号预测

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18763 2026-01-23 cs.LG

GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning

GenPO:生成扩散模型与在线策略强化学习相结合

Shutong Ding, Ke Hu, Shan Zhong, Haoyang Luo, Weinan Zhang, Jingya Wang, Jun Wang, Ye Shi

机构 * ShanghaiTech University(上海科技大学) University of Electronic Science and Technology of China(电子科技大学) Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) MoE Key Laboratory of Intelligent Perception and Human Machine Collaboration(智能感知与人机协同联合实验室)

AI总结 GenPO通过生成扩散模型与在线强化学习结合,解决了扩散策略在计算状态-动作对数似然中的挑战,实现了高效的可逆动作映射和熵正则化,提升了机器人任务的训练效果。

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10739 2026-01-23 cs.CV cs.AI

Efficient Multimodal Large Language Models: A Survey

高效多模态大语言模型:综述

Yizhang Jin, Jian Li, Yexin Liu, Tianjun Gu, Kai Wu, Zhengkai Jiang, Muyang He, Bo Zhao, Xin Tan, Zhenye Gan, Yabiao Wang, Chengjie Wang, Lizhuang Ma

机构 * Youtu Lab, Tencent(腾讯优图实验室) SJTU(上海交通大学) BAAI(北京人工智能研究院) ECNU(华东师范大学)

AI总结 本文综述了高效多模态大语言模型的发展现状,探讨了其高效结构、策略及应用,并展望了未来研究方向。

Comments Accepted by Visual Intelligence

Journal ref Visual Intelligence, Volume 3, article number 27, (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16362 2026-01-23 math.OC cs.LG

A Unified Analysis on the Subgradient Upper Bounds for the Subgradient Methods Minimizing Composite Nonconvex, Nonsmooth and Non-Lipschitz Functions

对子梯度上界统一分析:用于最小化复合非凸、非光滑和非利普斯芝函数的子梯度方法

Daoli Zhu, Lei Zhao, Shuzhong Zhang

机构 * Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Institute of Translational Medicine and National Center for Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院和转化医学中心) Department of Industrial and Systems Engineering, University of Minnesota(明尼苏达大学工业与系统工程系)

AI总结 本文提出了一种统一分析方法,用于研究子梯度方法在最小化复合非凸、非光滑和非利普斯芝函数时的子梯度上界问题,并扩展到随机近端子梯度算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15267 2026-01-22 cs.CY cs.AI cs.CL

Evaluation of Large Language Models in Legal Applications: Challenges, Methods, and Future Directions

评估大型语言模型在法律应用中的表现:挑战、方法与未来方向

Yiran Hu, Huanghai Liu, Chong Wang, Kunran Li, Tien-Hsuan Wu, Haitao Li, Xinran Xu, Siqing Huo, Weihang Su, Ning Zheng, Siyuan Zheng, Qingyao Ai, Yun Liu, Renjun Bian, Yiqun Liu, Charles L. A. Clarke, Weixing Shen, Ben Kao

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Waterloo(多伦多大学) Shanghai Jiaotong University(上海交通大学) Peking University(北京大学)

AI总结 本文探讨了大型语言模型在法律应用中的评估挑战与方法,分析了现有评估框架的局限性,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15164 2026-01-22 cs.RO cs.AI

V-CAGE: Context-Aware Generation and Verification for Scalable Long-Horizon Embodied Tasks

V-CAGE:面向可扩展长时间跨度具身任务的上下文感知生成与验证

Yaru Liu, Ao-bo Wang, Nanyang Ye

机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, England.(计算机科学与技术系,剑桥大学,剑桥,英格兰) Shanghai Jiao Tong University, Shanghai, China(上海交通大学,上海,中国) Wuhan University, Wuhan, Hubei, China(武汉大学,武汉,湖北,中国)

AI总结 V-CAGE通过上下文感知生成与验证框架,提升大规模具身任务数据集的物理和语义保真度,提高下游策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14667 2026-01-22 cs.MA cs.AI

INFA-Guard: Mitigating Malicious Propagation via Infection-Aware Safeguarding in LLM-Based Multi-Agent Systems

INFA-Guard: 通过感染感知防护减轻恶意传播在基于大语言模型的多智能体系统中的影响

Yijin Zhou, Xiaoya Lu, Dongrui Liu, Junchi Yan, Jing Shao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

AI总结 INFA-Guard通过感染感知防护机制有效减轻基于大语言模型的多智能体系统中的恶意传播问题,显著降低攻击成功率并保持拓扑完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14286 2026-01-22 cs.ET cs.LG

GNN-based Path-aware multi-view Circuit Learning for Technology Mapping

基于GNN的路径感知多视图电路学习用于技术映射

Wentao Jiang, Jingxin Wang, Zhang Hu, Zhengyuan Shi, Chengyu Ma, Qiang Xu, Weikang Qian, Zhufei Chu

机构 * Faculty of Electrical Engineering and Computer Science, NingBo University(电子工程与计算机科学学院,宁波大学) University of Michigan-Shanghai Jiao Tong University Joint Institute, Shanghai Jiao Tong University(密歇根大学-上海交通大学联合研究所,上海交通大学) Department of Computer Science and Engineering, The Chinese University of Hong Kong(中国香港中文大学计算机科学与工程系)

AI总结 GPA通过融合多视图电路结构学习,提升技术映射中延迟预测的准确性,实现更高效的映射决策。

Comments 7pages, 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13664 2026-01-22 cs.CV

VIAFormer: Voxel-Image Alignment Transformer for High-Fidelity Voxel Refinement

VIAFormer:用于高保真体素细化的体素-图像对齐变换器

Tiancheng Fang, Bowen Pan, Lingxi Chen, Jiangjing Lyu, Chengfei Lyu, Chaoyue Niu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

AI总结 VIAFormer通过体素-图像对齐变换器实现高保真体素细化,结合图像索引、校正流目标和混合流变换器,提升多视角条件下体素修复的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05665 2026-01-22 cs.CL cs.CV

Interleaved Latent Visual Reasoning with Selective Perceptual Modeling

交错的潜在视觉推理与选择性感知建模

Shuai Dong, Siyuan Wang, Xingyu Liu, Chenglin Li, Haowen Hou, Zhongyu Wei

机构 * China University of Geosciences, Wuhan(中国地质大学(武汉)) Shanghai Innovation Institute(上海创新研究院) University of Southern California(南加州大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 ILVR通过交错潜在视觉表示与文本生成,实现动态状态演变与精确感知建模的统一,提升多模态推理性能。

Comments 18 pages, 11 figures. Code available at https://github.com/XD111ds/ILVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20310 2026-01-22 cs.AI cs.MA

Manalyzer: End-to-end Automated Meta-analysis with Multi-agent System

Manalyzer: 基于多智能体系统的端到端自动化元分析

Wanghan Xu, Wenlong Zhang, Fenghua Ling, Ben Fei, Yusong Hu, Runmin Ma, Bo Zhang, Fangxuan Ren, Jintai Lin, Wanli Ouyang, Lei Bai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Nankai University(南开大学) Peking University(北京大学)

AI总结 Manalyzer通过多智能体系统实现端到端自动化元分析,有效缓解了传统方法中的幻觉问题,并在多模态数据处理中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13951 2026-01-21 cs.CV

VTONGuard: Automatic Detection and Authentication of AI-Generated Virtual Try-On Content

VTONGuard: 自动检测和认证AI生成的虚拟试衣内容

Shengyi Wu, Yan Hong, Shengyao Chen, Zheng Wang, Xianbing Sun, Jiahui Zhan, Jun Lan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

AI总结 VTONGuard通过大规模基准数据集和多任务框架提升AI生成虚拟试衣内容的检测能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13919 2026-01-21 cs.CL cs.CV

HyperWalker: Dynamic Hypergraph-Based Deep Diagnosis for Multi-Hop Clinical Modeling across EHR and X-Ray in Medical VLMs

HyperWalker: 基于动态超图的多跳临床建模深度诊断方法,跨EHR和X光在医学视觉语言模型中

Yuezhe Yang, Hao Wang, Yige Peng, Jinman Kim, Lei Bi

机构 * Institute of Translational Medicine, Shanghai Jiao Tong University(翻译医学研究院,上海交通大学) School of Computer Science, University of Sydney(计算机科学学院,悉尼大学)

AI总结 HyperWalker通过动态超图和测试时训练,实现跨EHR和X光的多跳临床建模深度诊断,提升医疗视觉语言模型的诊断性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13918 2026-01-21 cs.CL

AgentEHR: Advancing Autonomous Clinical Decision-Making via Retrospective Summarization

AgentEHR: 通过回顾性总结推进自主临床决策制定

Yusheng Liao, Chuan Xuan, Yutong Cai, Lina Yang, Zhe Chen, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 AgentEHR通过RetroSum框架提升自主临床决策制定,减少交互错误并提升性能

Comments 37 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13886 2026-01-21 cs.CV

Revisiting Multi-Task Visual Representation Learning

重新审视多任务视觉表示学习

Shangzhe Di, Zhonghua Zhai, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI) ByteDance Seed(字节跳动种子)

AI总结 MTV框架通过多任务学习结合视觉-语言对比、自监督和密集空间目标,提升空间推理能力的同时保持全局语义理解。

Comments Code: https://github.com/Becomebright/MTV

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13614 2026-01-21 cs.CL cs.AI cs.LG

CauScientist: Teaching LLMs to Respect Data for Causal Discovery

CauScientist: 教授大语言模型尊重数据进行因果发现

Bo Peng, Sirui Chen, Lei Xu, Chaochao Lu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Tongji University(同济大学) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院)

AI总结 CauScientist通过结合大语言模型与概率统计,提升因果发现的准确性与可靠性,实现显著的F1分数提升和召回率提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13556 2026-01-21 cs.RO

LogicEnvGen: Task-Logic Driven Generation of Diverse Simulated Environments for Embodied AI

LogicEnvGen: 基于任务逻辑的多样化模拟环境生成用于具身AI

Jianan Wang, Siyang Zhang, Bin Li, Juan Chen, Jingtao Qi, Zhuo Zhang, Chen Qian

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室) School of Artifical Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 LogicEnvGen通过任务逻辑驱动生成多样化模拟环境,提升智能体在不同环境中的适应性和鲁棒性评估性能。

Comments 19 pages, 15 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13539 2026-01-21 cs.SD

LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech

LongSpeech: 一种可扩展的基准,用于长语音的转录、翻译和理解

Fei Yang, Xuanfan Ni, Renyi Yang, Jiahui Geng, Qing Li, Chenyang Lyu, Yichao Du, Longyue Wang, Weihua Luo, Kaifu Zhang

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商务) Shanghai Jiao Tong University(上海交通大学) Delft University of Technology(代尔夫特理工大学) Linköping University(林肯大学) University of Groningen(格罗宁根大学)

AI总结 LongSpeech是一个大规模可扩展的语音基准,旨在评估和推动语音模型在长音频转录、翻译和理解上的能力,揭示了现有模型在多任务和高阶推理上的不足。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13531 2026-01-21 eess.AS cs.SD

ICASSP 2026 URGENT Speech Enhancement Challenge

ICASSP 2026 URGENT语音增强挑战

Chenda Li, Wei Wang, Marvin Sach, Wangyou Zhang, Kohei Saijo, Samuele Cornell, Yihui Fu, Zhaoheng Ni, Tim Fingscheidt, Shinji Watanabe, Yanmin Qian

机构 * Shanghai Jiao Tong University(上海交通大学) Technische Universität Braunschweig(Braunschweig技术大学) Waseda University(早稻田大学) Carnegie Mellon University(卡内基梅隆大学) Meta

AI总结 ICASSP 2026 URGENT挑战通过两个赛道推动通用语音增强系统的发展,吸引80多支队伍参与,展示对鲁棒语音增强技术的广泛兴趣。

Comments The overview paper of the ICASSP 2026 URGENT Speech Enhancement Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13948 2026-01-21 cs.CV

Light4GS: Lightweight Compact 4D Gaussian Splatting Generation via Context Model

Light4GS: 通过上下文模型实现轻量级紧凑的4D高斯点云生成

Mufan Liu, Qi Yang, He Huang, Wenjie Huang, Zhenlong Yuan, Zhu Li, Yiling Xu

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(信息科学与电子工程学院,上海交通大学) School of Science and Engineering, University of Missouri–Kansas City(科学与工程学院,密苏里大学-堪萨斯城分校) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 Light4GS通过显著性剪枝和深度上下文模型实现轻量级4D高斯点云生成,提升压缩效率和渲染速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13207 2026-01-21 cs.CV

GTPred: Benchmarking MLLMs for Interpretable Geo-localization and Time-of-capture Prediction

GTPred:评估多模态大语言模型在可解释地理定位和拍摄时间预测中的基准测试

Jinnao Li, Zijian Chen, Tingzhu Chen, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究院) School of Humanities, Shanghai Jiao Tong University(上海交通大学人文学院) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 GTPred是一个新的地理-时间预测基准测试,通过评估多模态大语言模型在可解释地理定位和拍摄时间预测中的表现,揭示了当前模型在世界知识和时空推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12988 2026-01-21 cs.LG

PaperGuide: Making Small Language-Model Paper-Reading Agents More Efficient

PaperGuide: 使小型语言模型论文阅读代理更加高效

Zijian Wang, Tiancheng Huang, Hanqi Li, Da Ma, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, MoE Key Lab of Artificial Intelligence, SJTU AI Institute, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室、计算机科学学院、人工智能关键实验室、SJTU人工智能研究所、上海交通大学、上海,中国) Suzhou Laboratory, Suzhou, China(苏州实验室、苏州,中国)

AI总结 PaperCompass通过分离高层规划与细粒度执行,提升小型语言模型在论文阅读任务中的效率,实现高效且可靠的训练过程。

Comments 35 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12808 2026-01-21 cs.IT cs.CV cs.LG math.IT

Joint Source-Channel-Generation Coding: From Distortion-oriented Reconstruction to Semantic-consistent Generation

联合源-信道-生成编码:从以失真为导向的重建到语义一致的生成

Tong Wu, Zhiyong Chen, Guo Lu, Li Song, Feng Yang, Meixia Tao, Wenjun Zhang

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University, Shanghai, China(合作中位网创新中心,上海交通大学,上海,中国)

AI总结 本文提出JSCGC,通过概率生成替代确定性重建,提升图像传输的感知质量和语义保真度,优于传统JSCC方法。

Comments submitted to IEEE ISIT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12762 2026-01-21 cs.SE cs.AI

Teaching LLMs to Learn Tool Trialing and Execution through Environment Interaction

通过环境交互教授LLMs学习工具尝试与执行

Xingjie Gao, Pengcheng Huang, Zhenghao Liu, Yukun Yan, Shuo Wang, Zulong Chen, Chen Qian, Ge Yu, Yu Gu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Alibaba Group(阿里巴巴集团) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 ToolMaster通过环境交互主动学习工具使用,提升LLMs在新工具上的泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12701 2026-01-21 cs.RO cs.CG

RPT*: Global Planning with Probabilistic Terminals for Target Search in Complex Environments

RPT*: 带概率终端的全局规划用于复杂环境中的目标搜索

Yunpeng Lyu, Chao Cao, Ji Zhang, Howie Choset, Zhongqiang Ren

机构 * Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 RPT*通过动态规划和新启发式方法解决复杂环境中的目标搜索问题,实现最优路径规划与高效探索的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12428 2026-01-21 cs.RO cs.CV

ReWorld: Multi-Dimensional Reward Modeling for Embodied World Models

ReWorld:面向具身世界模型的多维奖励建模

Baorui Peng, Wenyao Zhang, Liang Xu, Zekun Qi, Jiazhao Zhang, Hongsi Liu, Wenjun Zeng, Xin Jin

机构 * Eastern Institute of Technology(东部技术研究所) Georgia Institute of Technology(佐治亚理工学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

AI总结 ReWorld通过多维奖励建模提升具身世界模型的物理真实性和任务完成能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10369 2026-01-21 cs.CV

Fine-Grained Human Pose Editing Assessment via Layer-Selective MLLMs

通过层选择性MLLMs实现细粒度人体姿态编辑评估

Ningyu Sun, Zhaolin Cai, Zitong Xu, Peihang Chen, Huiyu Duan, Yichao Yan, Xiongkuo Min, Xiaokang Yang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

AI总结 本文提出HPE-Bench基准和基于层选择性MLLMs的统一框架,用于细粒度评估人体姿态编辑的真实性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20339 2026-01-21 cs.SD

MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model

MMEDIT: 一种基于音频语言模型的多类型音频编辑统一框架

Ye Tao, Wen Wu, Chao Zhang, Mengyue Wu, Shuai Wang, Xuenan Xu

机构 * MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(人工智能莫埃实验室、X-LANCE实验室、上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学)

AI总结 MMEdit提出一种基于音频语言模型的统一框架,通过扩展任务定义和设计数据合成管道,实现多类型音频编辑的高精度与高保真度。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏