arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3167
2604.10542 2026-04-14 cs.SD cs.AI

VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories

VidAudio-Bench:跨四个音频类别的V2A和VT2A生成基准测试

Qian Zhang, Yuqin Cao, Yixuan Gao, Xiongkuo Min

机构 * Shanghai Jiaotong University(上海交通大学)

AI总结 本文提出VidAudio-Bench,通过四个音频类别评估V2A和VT2A生成,包含1634个视频文本对和11种先进模型,引入13种参考自由指标,揭示当前模型在语音和歌唱生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10517 2026-04-14 cs.AI

From Perception to Planning: Evolving Ego-Centric Task-Oriented Spatiotemporal Reasoning via Curriculum Learning

从感知到规划:通过课程学习进化自主任务导向的空间时间推理

Xiaoda Yang, Yuxiang Liu, Shenzhou Gao, Can Wang, Jingyang Xue, Lixin Yang, Yao Mu, Tao Jin, Shuicheng Yan, Zhimeng Zhang, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Qingdao University(青岛大学) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出EgoTSR框架,通过课程学习提升任务导向的空间时间推理能力,解决静态感知和动态环境中的时空幻觉问题,实验显示其在长周期推理任务中准确率达92.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10506 2026-04-14 cs.AI

A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning

一种用于对抗具身推理中时空幻觉的渐进训练策略

Xiaoda Yang, Shuai Yang, Can Wang, Jingyang Xue, Menglan Tang, Checheng Yu, Xunzhe Zhou, Sashuai Zhou, Tao Jin, Lixin Yang, Xiangyu Yue, Zhou Zhao

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学) Qingdao University(青岛大学) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) University of YYY(YYY大学) Institute of WWW(WWW研究所)

AI总结 本文提出一种渐进训练框架,通过构建CoT数据集和弱标签数据提升视觉语言模型的时空推理能力,有效缩小了正反向性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10480 2026-04-14 cs.AI

Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs

追溯根源:一种多智能体框架,用于揭示训练后LLM的数据血缘

Yu Li, Xiaoran Shang, Qizhi Pei, Yun Zhu, Xin Gao, Honglin Lin, Zhanping Zhong, Zhuoshi Pan, Zheng Liu, Xiaoyang Wang, Conghui He, Dahua Lin, Feng Zhao, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出多智能体框架,用于揭示训练后LLM的数据血缘,识别数据集演化图谱中的结构模式与系统问题,构建血缘感知的多样化数据集。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08963 2026-04-14 cs.MA cs.AI

Aligned Agents, Biased Swarm: Measuring Bias Amplification in Multi-Agent Systems

对齐的智能体,偏见的蜂群:测量多智能体系统中的偏见放大

Keyu Li, Jin Gao, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 研究通过实验分析多智能体系统拓扑结构和反馈循环对偏见的影响,发现结构复杂性并不保证伦理鲁棒性,指出系统复杂性可能加剧偏见。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10128 2026-04-14 cs.CV

HG-Lane: High-Fidelity Generation of Lane Scenes under Adverse Weather and Lighting Conditions without Re-annotation

HG-Lane:在恶劣天气和光照条件下无需重新标注的高保真车道场景生成

Daichao Zhao, Qiupu Chen, Feng He, Xin Ning, Qiankun Li

机构 * Shanghai Jiao Tong University(上海交通大学) School of Artificial Intelligence, Henan University(河南大学人工智能学院) University of Science and Technology of China(中国科学技术大学) AnnLab, Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所 AnnLab) Nanyang Technological University(南洋理工大学)

AI总结 本文提出HG-Lane框架,通过构建包含30000张图像的基准数据集,提升恶劣天气下车道检测性能,实验显示基于CLRNet的mF1得分提升20.87%。

Comments Accepted by CVPR 2026 (HighLight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21484 2026-04-14 cs.CV

Unified Unsupervised and Sparsely-Supervised 3D Object Detection by Semantic Pseudo-Labeling and Prototype Learning

通过语义伪标签和原型学习实现统一的无监督和稀疏监督3D目标检测

Yushen He, Lei Zhao, Weidong Chen

机构 * Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医疗机器人研究院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(系统控制与信息处理教育部重点实验室)

AI总结 本文提出SPL框架,通过语义伪标签和原型学习统一无监督和稀疏监督3D目标检测,生成高质量伪标签并稳定特征学习,实验表明在KITTI和nuScenes数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02311 2026-04-14 cs.CV cs.LG

Inferring Dynamic Physical Properties from Video Foundation Models

从视频基础模型推断动态物理性质

Guanqi Zhan, Xianzheng Ma, Weidi Xie, Andrew Zisserman

机构 * VGG, University of Oxford(牛津大学VGG实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文研究通过视频预测动态物理性质,提出新数据集和三种推断方法,展示视频基础模型与多模态大语言模型的性能对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17784 2026-04-14 cs.LG cs.AI cs.CL

Proximal Supervised Fine-Tuning

近端监督微调

Wenhong Zhu, Ruobing Xie, Rui Wang, Xingwu Sun, Di Wang, Pengfei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Large Language Model Department, Tencent(腾讯大语言模型部) University of Macau(澳门大学)

AI总结 本文提出近端监督微调(PSFT),通过引入信任区域方法约束策略漂移,提升模型在新领域中的泛化能力,实验显示其在跨领域泛化和长期稳定性方面优于传统监督微调。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16796 2026-04-14 cs.CV

RealSR-R1: Reinforcement Learning for Real-World Image Super-Resolution with Vision-Language Chain-of-Thought

RealSR-R1: 用强化学习解决真实世界图像超分辨率问题

Junbo Qiao, Miaomiao Cai, Wei Li, Xudong Huang, Jie Hu, Xinghao Chen, Shaohui Lin, Hongkai Xiong

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学)

AI总结 本文提出RealSR-R1,通过视觉-语言链式推理框架和Group Relative Policy Optimization方法,提升真实世界图像超分辨率的生成质量与内容理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09484 2026-04-14 cs.LG

An overview of condensation phenomenon in deep learning

深度学习中冷凝现象综述

Zhi-Qin John Xu, Yaoyu Zhang, Zhangchen Zhou

机构 * School of Mathematical Sciences, Institute of Natural Sciences, MOE-LSC, Shanghai Jiao Tong University(上海交通大学数学科学学院、自然科学研究院、教育部科学与工程计算重点实验室) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 本文综述了神经网络非线性训练中观察到的冷凝现象,探讨了冷凝过程的机制及其对网络泛化能力和transformer语言模型推理能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15803 2026-04-14 cs.LG cs.AI

WebLLM: A High-Performance In-Browser LLM Inference Engine

WebLLM:一种高性能的浏览器内LLM推理引擎

Charlie F. Ruan, Yucheng Qin, Akaash R. Parthasarathy, Xun Zhou, Ruihang Lai, Hongyi Jin, Yixin Dong, Bohan Hou, Meng-Shiun Yu, Yiyan Zhai, Sudeep Agarwal, Hangrui Cao, Siyuan Feng, Tianqi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) NVIDIA(英伟达)

AI总结 WebLLM通过JavaScript框架在浏览器内实现高性能LLM推理,利用WebGPU和WebAssembly结合MLC-LLM和Apache TVM优化,实现80%的本地性能,推动隐私保护的本地化LLM应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07469 2026-04-14 stat.ML cs.LG

Score-matching-based Structure Learning for Temporal Data on Networks

基于分数匹配的网络上时序数据结构学习

Hao Chen, Kai Yi

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) University of Cambridge(剑桥大学)

AI总结 本文提出PICK算法,通过改进父节点查找子程序提升分数匹配在处理独立同分布及时序网络数据时的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17163 2026-04-14 cs.CV

OSDFace: One-Step Diffusion Model for Face Restoration

OSDFace:面向面部修复的一步扩散模型

Jingkai Wang, Jue Gong, Lin Zhang, Zheng Chen, Xing Liu, Hong Gu, Yutong Liu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

AI总结 OSDFace提出一种一步扩散模型,通过视觉嵌入器和面部身份损失提升面部修复的视觉质量和身份一致性。

Comments Accepted to CVPR 2025. The code and model will be available at https://github.com/jkwang28/OSDFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12067 2026-04-14 cs.LG cs.AI cs.CL cs.CV

MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets

MM-LIMA:多模态数据集对齐中的‘少即是多’

Lai Wei, Xiaozhe Li, Zihao Jiang, Weiran Huang, Lichao Sun

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Shanghai Innovation Institute(上海创新研究院) Lehigh University(里海大学) Tongji University(同济大学)

AI总结 本文提出MM-LIMA,仅用200个示例(约6%的指令数据)训练,通过数据选择器过滤低质量数据,使模型在多项评估中超越MiniGPT-4,证明高质量少量指令数据的有效性。

Comments Published at Artificial Intelligence for Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10182 2026-04-14 cs.AI

Credit-Budgeted ICPC-Style Coding: When Agents Must Pay for Every Decision

基于信用的ICPC风格编码:当代理必须为每个决定付费

Lingfeng Zhou, Junhao Shi, Jin Gao, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出USACOArena,通过引入严格的信用经济机制,使代理在决策时考虑成本,解决资源受限下的高效编码问题。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10164 2026-04-14 cs.AI

Inductive Reasoning for Temporal Knowledge Graphs with Emerging Entities

基于新兴实体的时序知识图谱归纳推理

Ze Zhao, Yuhui He, Lyuwen Wu, Gu Tang, Bin Lu, Xiaoying Gan, Luoyi Fu, Xinbing Wang, Chenghu Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) IGSNRR, Chinese Academy of Sciences(中国科学院地理科学与资源研究所)

AI总结 本文提出TransFIR框架,通过利用语义相似实体的历史交互序列,为新兴实体提供归纳推理支持,实验显示在多个数据集上平均提升MRR 28.6%。

Comments 24 pages, accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10032 2026-04-14 cs.LG cs.AI

Closed-Form Concept Erasure via Double Projections

通过双重投影实现闭式概念擦除

Chi Zhang, Jingpu Cheng, Zhixian Wang, Ping Liu

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) University of Nevada, Reno(内华达大学里诺分校)

AI总结 本文提出一种无需训练的线性变换框架,通过两次闭式步骤实现安全高效的概念擦除,实验显示其性能优于现有方法并能更忠实保留非目标概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09676 2026-04-14 cs.LG cs.AI

A Comparative Theoretical Analysis of Entropy Control Methods in Reinforcement Learning

强化学习中熵控制方法的比较理论分析

Ming Lei, Christophe Baehr

机构 * Shanghai Jiao Tong University(上海交通大学) Météo France/CNRS, Université de Toulouse, CNRM UMR 3589(法国气象局/法国国家科学研究中心,图卢兹大学,国家气象研究中心 UMR 3589)

AI总结 本文比较了传统熵正则化与基于协方差的熵控制方法,揭示了熵变化由log-probabilities与logit更新的协方差决定,传统方法引入持续偏差导致次优策略,而基于协方差方法通过稀疏正则化实现无偏性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09587 2026-04-14 cs.AI cs.LG cs.SE

MobiFlow: Real-World Mobile Agent Benchmarking through Trajectory Fusion

MobiFlow: 通过轨迹融合实现真实世界移动代理基准测试

Yunfei Feng, Xi Zhao, Cheng Zhang, Dahu Feng, Daolin Cheng, Jianqi Yu, Yubin Xia, Erhu Feng

机构 * Institute of Parallel and Distributed Systems (IPADS), Shanghai Jiao Tong University(上海交通大学并行与分布式系统研究所(IPADS)) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) National Innovation Institute of High-end Smart Appliances(国家高端智能家电创新研究院)

AI总结 MobiFlow通过轨迹融合算法构建任务,覆盖20个常用第三方应用,提供240种真实任务,提升模型在真实负载下的评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09574 2026-04-14 cs.AI cs.LG

Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization

屏幕上的图灵测试:移动GUI代理人化的一个基准

Jiachen Zhu, Lingyu Yang, Rong Shan, Congmin Zheng, Zeyu Zheng, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出屏幕上的图灵测试基准,通过建模检测器与代理的MinMax优化问题,评估代理在人类中心生态系统中的生存能力,并提出人化基准和检测指标,展示代理在不牺牲性能的前提下实现高模仿性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03088 2026-04-14 cs.SE cs.LG

SkVM: Revisiting Language VM for Skills across Heterogenous LLMs and Harnesses

SkVM:重新审视跨异构LLM的技能语言虚拟机

Le Chen, Erhu Feng, Yubin Xia, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SkVM,通过将技能视为代码并利用LLM作为异构处理器,解决技能在不同平台间执行不一致的问题,提升技能可移植性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15593 2026-04-14 cs.CL cs.AI cs.LG

Parallelism and Generation Order in Masked Diffusion Language Models: Limits Today, Potential Tomorrow

掩码扩散语言模型中的并行性与生成顺序:今日的限制,明日的潜力

Yangyang Zhong, Yanmei Gu, Zhengqing Zang, Xiaomeng Li, Yuqi Ding, Xibei Jia, Yuting Shen, Zhenzhong Lan, Liwang Zhu, Weiping Liu, Junlin Zhou, Haisheng Liu, Zhong Xin Yu, Pengxin Luo, Donglian Qi, Yunfeng Yan, Junbo Zhao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) University of Chinese Academy of Social Sciences(中国社会科学院大学) Westlake University(西湖大学)

AI总结 研究评估了八种主流MDLM在58个基准上的表现,发现其并行性和生成顺序受任务领域和正确性影响显著,且在需要逆向信息的任务中表现更优,提出生成后编辑范式以提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03641 2026-04-14 cs.CL

Agent-Dice: Disentangling Knowledge Updates via Geometric Consensus for Agent Continual Learning

Agent-Dice: 通过几何共识解耦知识更新以实现智能体持续学习

Zheng Wu, Xingyu Lou, Xinbei Ma, Yansi Li, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) OPPO Research Institute(OPPO研究院)

AI总结 本文提出Agent-Dice框架,通过几何共识过滤和曲率重要性加权解耦知识更新,解决智能体持续学习中的稳定性与可塑性矛盾,实验表明其在GUI智能体和工具使用领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06376 2026-04-14 cs.LG cs.AI cs.AR

The Phantom of PCIe: Constraining Generative Artificial Intelligences for Practical Peripherals Trace Synthesizing

PCIe的幽灵:约束生成人工智能以实现实用外设追踪合成

Zhibai Huang, Chen Chen, James Yen, Yihan Shen, Yongchen Xie, Zhixiang Wei, Kailiang Xu, Yun Wang, Fangxin Liu, Tao Song, Mingyuan Xia, Zhengwei Qi

机构 * Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) UltraRISC

AI总结 本文提出Phantom框架,通过结合生成模型与后处理过滤器,解决生成AI在合成TLP序列时的幻觉问题,提升外设追踪合成的准确性与实用性。

Comments Accepted by DAC'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10181 2026-04-13 cs.RO cs.AI cs.CV

Dejavu: Towards Experience Feedback Learning for Embodied Intelligence

Dejavu:迈向具身智能的经验反馈学习

Shaokai Wu, Yanbiao Ji, Qiuchang Li, Zhiyi Zhang, Qichen He, Wenyuan Xie, Guodong Zhang, Bayram Bayramli, Yue Ding, Hongtao Lu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

AI总结 本文提出Dejavu框架,通过经验反馈网络增强冻结的视觉-语言-动作策略,提升具身智能任务的适应性、鲁棒性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09240 2026-04-13 cs.LG

DiffHLS: Differential Learning for High-Level Synthesis QoR Prediction with GNNs and LLM Code Embeddings

DiffHLS: 基于GNN和LLM代码嵌入的高阶综合QoR预测差分学习

Zedong Peng, Zeju Li, Qiang Xu, Jieru Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 DiffHLS通过GNN和LLM代码嵌入预测高阶综合QoR,利用核基线与pragma插入设计变体的差分学习,降低合成成本,实验显示在PolyBench上优于GNN基线,且在ForgeHLS数据集上验证了可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09201 2026-04-13 cs.CV

CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation

CT-1:视觉-语言-相机模型将空间推理知识转移到相机可控的视频生成

Haoyu Zhao, Zihao Zhang, Jiaxi Gu, Haoran Chen, Qingping Zheng, Pin Tang, Yeyin Jin, Yuang Zhang, Junqi Cheng, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯) Xiamen University(厦门大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出CT-1模型,通过准确估计相机轨迹将空间推理知识转移到视频生成中,利用小波正则化损失和视频扩散模型提升相机控制精度,实验显示其生成的视频质量高且控制准确率提升25.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09059 2026-04-13 cs.CV cs.AI

Learning Vision-Language-Action World Models for Autonomous Driving

学习视觉-语言-动作世界模型以实现自动驾驶

Guoqing Wang, Pin Tang, Xiangxuan Ren, Guodongfang Zhao, Bailan Feng, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) Central Research Institute, Huawei(华为中央研究院)

AI总结 本文提出VLA-World模型,通过结合预测想象与反思推理提升自动驾驶的前瞻性。该模型利用生成的轨迹引导图像生成,并通过反思优化轨迹预测,实验表明其在规划和未来场景生成任务中优于现有方法。

Comments Accepted by CVPR2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09051 2026-04-13 cs.CV cs.RO

Fine-Grained Action Segmentation for Renorrhaphy in Robot-Assisted Partial Nephrectomy

机器人辅助部分肾切除术中缝合术的细粒度动作分割

Jiaheng Dai, Huanrong Liu, Tailai Zhou, Tongyu Jia, Qin Liu, Yutong Ban, Zeju Li, Yu Gao, Xin Ma, Qingbiao Li

机构 * Fudan University(复旦大学) University of Macau(澳门大学) The Chinese PLA General Hospital(中国人民解放军总医院) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文针对机器人辅助部分肾切除术中缝合术的细粒度动作分割问题,提出SIA-RAPN基准测试,采用I3D特征构建四种时间模型,评估平衡准确率、编辑得分和分段F1等指标,结果显示DiffAct在多个指标上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏