arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-05-21 至 2026-05-21 共收录 17
2605.21177 2026-05-21 cs.LG cs.CL

ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning

ChunkFT: 用于内存高效全微调的分块优化

Yongkang Liu, Zijing Wang, Mengjie Zhao, Ercong Nie, Mingyang Wang, Qian Li, Feiliang Ren, Shi Feng, Daling Wang, Hinrich Schütze

机构 * Northeastern University, China(中国东北大学) Shanghai Jiao Tong University, China(上海交通大学) CIS, LMU Munich, Germany(慕尼黑大学CIS实验室) MCML, Germany(德国MCML实验室) Shandong University, China(山东大学)

AI总结 本文提出ChunkFT框架,通过动态激活的工作集重新定义全参数微调,实现了无需修改网络架构即可对任意子张量进行梯度计算,理论分析和实验表明其在内存使用、运行时间和优化质量上均有效,且在下游任务中表现优于现有内存高效基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21160 2026-05-21 cs.LG

Learning First Integrals via Backward-Generated Data and Guided Reinforcement Learning

通过反向生成数据和引导强化学习学习第一积分

Jingfeng Zhong, Zhengxiang Liu, Zhijie Wang, Shuai Li

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出FISolver,一种基于LLM的求解器,通过反向生成数据和引导强化学习方法,解决第一积分发现中的数据稀缺问题,并在挑战性基准上显著优于其他方法。

Comments 17 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21042 2026-05-21 cs.CV

Dynamic Video Generation: Shaping Video Generation Across Time and Space

动态视频生成:跨时间和空间的视频生成塑造

Shikang Zheng, Jingkai Huang, Jiacheng Liu, Guantao Chen, Lixuan, Yuqi Lin, Peiliang Cai, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Tsinghua University(清华大学)

AI总结 本文提出DVG框架,通过在时间和空间上联合分配计算,自动选择内容感知的加速策略,实现近无损加速,展示了在视频生成中的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20929 2026-05-21 cs.RO

STEAM: A Training-Free Congestion-Aware Enhancement Framework for Decentralized Multi-Agent Path Finding

STEAM: 一种无需训练的拥堵感知增强框架用于去中心化多智能体路径寻找

Mingyang Feng, Mengnuo Zhang, Shaoyuan Li, Xiang Yin

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学)

AI总结 本文提出STEAM框架,一种无需训练的去中心化多智能体路径寻找(MAPF)学习方法,在离散环境中通过注入轻量级拥堵感知指导来提升性能,通过空间避让、时间修正和密度修正等方法提高成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20922 2026-05-21 cs.LG cs.AI cs.CV

Winfree Oscillatory Neural Network

Winfree振荡神经网络

Jiawen Dai, Yue Song

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Qi Zhi Institute(上海启智研究院) College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 本文提出了一种基于广义Winfree动力学的振荡神经网络WONN,通过结构化的振荡交互在流形$(S^1)^d$上进化表示,结合基于相位的归纳偏置与灵活的层次交互机制,实现了在图像识别和复杂推理任务上的竞争力和参数效率。

Comments Project page: https://jiawen-dai.github.io/WONN_Project_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20827 2026-05-21 cs.CV

HyDAR-Pano3D: A Hybrid Disentangled Anatomical Recovery Framework for Panoramic-to-3D Reconstruction

HyDAR-Pano3D: 一种用于全景到3D重建的混合解耦解剖恢复框架

Yaoyao Yue, Jérôme Schmid, Xiaoshuang Li, Eduardo Delamare, Jinman Kim

机构 * School of Computer Science, the University of Sydney(悉尼大学计算机科学学院) Geneva School of Health Sciences, HES-SO University of Applied Sciences and Arts Western Switzerland(日内瓦健康科学学院,HES-SO应用科学和艺术西瑞士大学) Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Sydney Dental School, Faculty of Medicine and Health, The University of Sydney(悉尼牙科学院,医学与健康学院,悉尼大学)

AI总结 本文提出HyDAR-Pano3D框架,通过解耦解剖恢复问题来解决全景影像到CBCT重建中的模糊问题,实验表明其在PSNR、SSIM和Dice评分上均优于基线方法,能够有效恢复临床相关的解剖结构。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20742 2026-05-21 cs.AI

VBFDD-Agent for Electric Vehicle Battery Fault Detection and Diagnosis: Descriptive Text Modeling of Battery Digital Signals

VBFDD-Agent 用于电动汽车电池故障检测与诊断:电池数字信号的描述性文本建模

Joey Chan, Zhen Chen, Ershun Pan

机构 * Department of Industrial Engineering and Management, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(工业工程与管理系,机械工程学院,上海交通大学,上海200240,中国)

AI总结 本研究提出了一种基于描述性文本建模的电池信号报告方法,用于解决开放源代码电池故障报告数据集稀缺和缺乏统一维护知识表示的问题,通过构建语言语料库来改进电池健康诊断和维护,提出了VBFDD-Agent,整合了描述性电池状态文本、历史案例检索、本地维护手册和大语言模型推理,生成结构化的诊断结果和维护建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20641 2026-05-21 cs.CR cs.AI cs.LG

Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs

可信的权重,危险的优化?针对大语言模型的优化触发后门攻击

Yifei Wang, Tianlin Li, Xiaohan Zhang, Yida Yang, Xiaoyu Zhang, Li Pan

机构 * Shanghai Jiao Tong University(上海交通大学) Beihang University(北京航空航天大学) Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出了一种利用编译优化过程植入隐蔽后门的攻击方法,通过两种互补策略在无需修改编译器或硬件的情况下,实现对大语言模型的后门攻击,并展示了其在多个开源大语言模型上的高成功率。

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20563 2026-05-21 cs.MA cs.AI cs.CL cs.LG cs.SE

Multi-agent Collaboration with State Management

具有状态管理的多智能体协作

Mengyang Liu, Taozhi Chen, Zhenhua Xu, Xue Jiang, Yihong Dong

机构 * Shanghai Jiaotong University(上海交通大学) Cortices AI Emory University(埃默里大学) Peking University(北京大学)

AI总结 本文提出STORM,一种面向多智能体协作的状态管理方法,通过在共享工作区中调解智能体的交互,确保每个智能体在一致的代码库视图上操作,并在写入时检测和解决冲突。STORM在多个LLM上优于基于git-worktree的多智能体基线,且在成本效率上具有竞争力,表明显式状态管理比工作区隔离更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15157 2026-05-21 cs.RO cs.LG

Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention

手在环中:通过无缝手臂干预改进VLA策略以实现灵巧操作

Zhuohang Li, Liqun Huang, Wei Xu, Zhengming Zhu, Nie Lin, Xiao Ma, Xinjun Sheng, Ruoshi Wen

机构 * State Key Laboratory of Mechanical System and Vibration, School of Mechanical Engineering, Shanghai Jiao Tong University(机械系统与振动国家重点实验室,机械工程学院,上海交通大学) Shanghai Key Laboratory of Intelligent Robotics, Meta Robotics Institute, Shanghai Jiao Tong University, Shanghai 200240, China(智能机器人上海市重点实验室,元机器人研究院,上海交通大学,上海200240,中国) The University of Tokyo(东京大学)

AI总结 本文提出Hand-in-the-Loop方法,通过无缝整合人类干预与自主策略执行,减少手部操作中的突兀变化,提升双臂灵巧操作的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12960 2026-05-21 cs.CL

DiM\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging

DiM\textsuperscript{3}: 通过方向和幅度感知融合连接多语言和多模态模型

Zijing Wang, Mingyang Wang, Ercong Nie, Yongkang Liu, Shi Feng, Mengjie Zhao, Daling Wang, Xiaocui Yang, Hinrich Schütze

机构 * Northeastern University, China(东北大学,中国) CIS, LMU Munich, Germany(慕尼黑莱布尼茨大学计算机学院,德国) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心(MCML),德国) Shanghai Jiao Tong University, China(上海交通大学,中国)

AI总结 本研究提出DiM3方法,通过在共享语言模型骨干中融合残差更新,实现多语言和多模态能力的无缝整合,从而提升多语言性能并保持多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08155 2026-05-21 cs.LG

C$^2$FG: Control Classifier-Free Guidance via Score Discrepancy Analysis

C$^2$FG: 通过分数差异分析实现控制分类器无关引导

Jiayang Gao, Tianyi Zheng, Jiayang Zou, Fengxiang Yang, Shice Liu, Luyao Fan, Zheyu Zhang, Hao Zhang, Jinwei Chen, Peng-Tao Jiang, Bo Li, Jia Wang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo BlueImage Lab(vivo 蓝影实验室) vivo Mobile Communication Co., Ltd.(vivo 通信有限公司)

AI总结 本文提出C$^2$FG,一种基于分数差异分析的控制分类器无关引导方法,通过严格理论分析建立了条件分布与无条件分布在不同时间步的分数差异上界,从而为时间依赖引导提供了理论基础,并通过实验验证了其在多种生成任务中的有效性。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06007 2026-05-21 cs.CL cs.AI cs.MA

MASFactory: A Graph-centric Framework for Orchestrating LLM-Based Multi-Agent Systems with Vibe Graphing

MASFactory: 一种基于图的框架,用于通过Vibe图谱编排基于大语言模型的多智能体系统

Yang Liu, Jinxuan Cai, Yishen Li, Qi Meng, Zedi Liu, Xin Li, Chen Qian, Chuan Shi, Cheng Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出MASFactory,一种基于图的框架,用于通过Vibe图谱编排基于大语言模型的多智能体系统,解决了现有框架在实现复杂图工作流时需要大量手动工作、重用性差和难以整合异构外部上下文源的问题。

Comments Accepted to the ACL 2026 Demo Track. Camera-ready version. 10 pages, 6 figures. Code and documentation are available at: https://github.com/BUPT-GAMMA/MASFactory

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18532 2026-05-21 cs.CV cs.AI cs.RO

VLANeXt: Recipes for Building Strong VLA Models

VLANeXt: 构建强大VLA模型的配方

Xiao-Ming Wu, Bin Fan, Kang Liao, Jian-Jian Jiang, Runze Yang, Yihang Luo, Zhonghua Wu, Wei-Shi Zheng, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文通过统一框架和评估设置重新审视VLA设计空间,系统分析了基础组件、感知要素和动作建模视角,总结出12项关键发现,提出了一种简单有效的VLA模型VLANeXt,并在LIBERO和LIBERO-plus基准测试中超越了现有方法,同时提供了易于使用的代码库。

Comments Accepted in ICML 2026, Project Page: https://dravenalg.github.io/VLANeXt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01273 2026-05-21 cs.CV

Q-DiT4SR: Exploration of Detail-Preserving Diffusion Transformer Quantization for Real-World Image Super-Resolution

Q-DiT4SR: 探索细节保留的扩散变换器量化以实现实景图像超分辨率

Xun Zhang, Kaicheng Yang, Hongliang Lu, Haotong Qin, Yong Guo, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为)

AI总结 本文提出Q-DiT4SR,一种专门针对基于扩散变换器的实现实景图像超分辨率的后训练量化框架,通过引入层次化SVD和变异性感知时空混合精度方法,在保持细节的同时实现高效的模型压缩和加速。

Comments Accepted to ICML 2026. Our code and models will be available at https://github.com/xunzhang1128/Q-DiT4SR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26627 2026-05-21 cs.AI cs.LG cs.RO

TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance

TimeRewarder: 通过帧间时间距离从被动视频中学习密集奖励

Yuyang Liu, Chuan Wen, Yihang Hu, Dinesh Jayaraman, Yang Gao

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海启智研究院) Shanghai Jiao Tong University(上海交通大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出TimeRewarder方法,通过帧间时间距离从被动视频中学习密集奖励,以提升强化学习在稀疏奖励任务中的性能,实验表明其在多个任务中显著提高了成功率和样本效率。

Comments ICML 2026 spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20199 2026-05-21 cs.CL cs.AI

FlowLM: Few-Step Language Modeling via Diffusion-to-Flow Adaptation

FlowLM: 通过扩散到流的适应实现少步语言建模

Runzhe Zhang, Letian Chen, Wenpeng Zhang, Zhouhan Lin, Peilin Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

AI总结 本文提出FlowLM,一种通过高效微调从预训练的扩散语言模型转换而来的流匹配语言模型,通过将扩散模型的弯曲采样轨迹重新对齐为直线流,实现了高质量的少步生成,其质量可与甚至超越2000步扩散采样。此外,作者提出了一种更有效的流匹配训练目标:预测干净数据以持续引导采样过程向真实数据分布靠近。

Comments 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏