arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-05-12 至 2026-05-12 共收录 50
2602.21581 2026-05-12 cs.CV

MultiAnimate: Pose-Guided Image Animation Made Extensible

MultiAnimate:基于姿态的图像动画使其可扩展

Yingcheng Hu, Haowen Gong, Chuanguang Yang, Zhulin An, Yongjun Xu, Songhua Liu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出一种可扩展的多人物图像动画框架,通过引入标识符分配器和标识符适配器,解决多人物场景中的身份混淆和不合理的遮挡问题,实现高质量多人物动画生成。

Comments CVPR2026 Accepted. Project page at https://hyc001.github.io/MultiAnimate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21587 2026-05-12 physics.optics cond-mat.dis-nn cs.LG math-ph math.MP physics.app-ph

Incorporating rank-free coupling and external field via an incoherent modulated spatial photonic Ising machine

引入无等级耦合和外部场的非相干调制空间光子Ising机器

Ze Zheng, Yuegang Li, Hang Xu, Jingzheng Huang, Tailong Xiao, Guihua Zeng

机构 * State Key Laboratory of Photonics and Communications(光子与通信国家重点实验室) Institute for Quantum Sensing and Information Processing(量子传感与信息处理研究所) Shanghai Jiao Tong University(上海交通大学) Hefei National Laboratory(合肥国家实验室) Shanghai Research Center for Quantum Sciences(上海量子科学研究中心)

AI总结 该研究提出一种无需等级的光子Ising机器,通过Hadamard积编码任意Ising哈密顿量,实现高精度、高旋量的Ising模型模拟,并在Mobius ladder图上解决Max-Cut问题,展示了光子Ising机器的可扩展性。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12878 2026-05-12 cs.CV cs.RO

Uni-Hand: Universal Hand Motion Forecasting in Egocentric Views

Uni-Hand:面向亲身体验视角的通用手部运动预测

Junyi Ma, Wentao Bao, Jingyi Xu, Guanzhong Sun, Yu Zheng, Erhang Zhang, Xieyuanli Chen, Hesheng Wang

机构 * IRMV Lab, Shanghai Jiao Tong University(上海交通大学IMV实验室) Meta Reality Labs(Meta现实实验室) Department of Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子工程系) China University of Mining and Technology(中国矿业大学) College of Intelligence Science and Technology, National University of Defense Technology(国防科技大学智能科学与技术学院)

AI总结 本文提出Uni-Hand框架,通过多模态输入、多维多目标预测和多任务赋能,实现手部在2D和3D空间的精准预测,并引入目标指标预测手腕和指尖关节点,同时预测手-物体交互状态,提升下游任务性能。

Comments Accepted by T-PAMI 2026. Code and data: https://github.com/IRMVLab/UniHand

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25646 2026-05-12 cs.LG cs.NA math.NA

Deep set based operator learning with uncertainty quantification

基于不确定性的深度集运算学习

Lei Ma, Ling Guo, Hao Wu, Tao Zhou

机构 * Department of Mathematics, Shanghai Normal University(上海师范大学数学系) School of Mathematical Sciences, Institute of Natural Sciences(自然科学院数学系) MOE-LSC, Shanghai Jiao Tong University(教育部重点实验室,上海交通大学) Institute of Computational Mathematics(计算数学研究所) Scientific/Engineering Computing, AMSS, Chinese Academy of Sciences(科学与工程计算,中国科学院数学研究所)

AI总结 本文提出UQ-SONet框架,通过集变换器和变分自编码器实现稀疏传感器下的运算学习,并利用ELBO最小化进行不确定性估计,验证了在确定性和随机性PDE中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09132 2026-05-12 cs.CV

KEPIL: Knowledge-Enhanced Prompt-Image Learning for Prompt-Robust Disease Detection

KEPIL: 基于知识增强的提示-图像学习用于提示鲁棒疾病检测

Haozhe Luo, Shelley Zixin Shu, Ziyu Zhou, Robert Berke, Mauricio Reyes

机构 * University of Bern(伯尔尼大学) Shanghai Jiao Tong University(上海交通大学) Department of Radiation Oncology, Inselspital, Bern University Hospital and University of Bern(放射肿瘤科、Inselspital伯尔尼大学医院及伯尔尼大学)

AI总结 KEPIL通过整合 curated 医学知识,提升零样本推理性能,采用动态提示增强、语义感知对比损失和实体中心报告标准化方法,在多个基准测试中实现 state-of-the-art 成绩,提升 AUC 6.37% 在 CheXpert 上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08862 2026-05-12 cs.LG cs.AI

BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning

BubbleSpec: 将长尾气泡转化为投机性回滚草稿以同步强化学习

Yuhang Xu, Kaibin Tian, Yang Tian, Zhice Yang, Yifeng Yu, Yan Li, Shengzhong Liu, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出BubbleSpec框架,通过利用更快rank的空闲时间预生成回滚结果,提升同步强化学习的效率,减少50%的解码步骤并提高1.8倍的回滚吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08813 2026-05-12 cs.LG

AgentSlimming: Towards Efficient and Cost-Aware Multi-Agent Systems

AgentSlimming: 向高效且成本敏感的多智能体系统迈进

Yulang Chen, Haoxuan Peng, Jinyan Liu, Zichen Wen, Dongrui Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) The University of Sydney(悉尼大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出AgentSlimming框架,通过重要性评分和基线锚定规则压缩多智能体工作流,降低token成本达78.9%且性能损失小,实现成本与质量的帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08778 2026-05-12 cs.AI cs.LG cs.MA

Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

并非所有转折都重要:多轮 jailbreak 的信用分配

Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Xingcheng Xu, Dongrui Liu, Xia Hu, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出 TRACE 框架,通过区分多轮 jailbreak 中不同回合的贡献,提升攻击效果和防御安全。

Comments 41 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08713 2026-05-12 cs.RO cs.AI

REAP: Reinforcement-Learning End-to-End Autonomous Parking with Gaussian Splatting Simulator for Real2Sim2Real Transfer

REAP:基于高斯点扩散模拟器的端到端自主泊车强化学习

Changze Li, Zhe Chen, Shaoyu Chen, Lisen Mu, Yijian Li, Yuelong Yu, Qian Zhang, Qing Su, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Horizon Robotics Technology Research and Development Co., Ltd.(地平线机器人技术研究与开发有限公司)

AI总结 本文提出REAP方法,通过高斯点扩散模拟器实现Real2Sim2Real迁移,利用SAC算法提升训练效率,结合行为克隆和软预测碰撞惩罚机制,解决极端场景下的泊车问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08712 2026-05-12 cs.CV

From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation

从运动学至路由视觉控制:用于动作条件化外科视频生成

Bohan Li, Shuojue Yang, Baorui Peng, Xianda Guo, Erli Zhang, Youqi Tao, Junfeng Duan, Daguang Xu, Qi Dou, Xin Jin, Wenjun Zeng, Hao Zhao, Yueming Jin

机构 * SJTU(上海交通大学) NUS(国立新加坡大学) THU(清华大学) EIT(欧洲研究所) WHU(武汉大学) Harvard(哈佛大学) NVIDIA(NVIDIA公司) CUHK(香港大学)

AI总结 本文提出一种运动学至视觉提升范式,通过五种图像对齐的控制模态生成动作条件化外科视频,采用分层路由框架提升控制精度与效率,构建新基准并验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08709 2026-05-12 cs.CV

UniShield: Unified Face Attack Detection via KG-Informed Multimodal Reasoning

UniShield:基于知识图谱的多模态推理统一面部攻击检测

Hongrui Li, Yichen Shi, Hongyang Wang, Yuhao Gao, Hui Ma, Jun Feng, Zitong Yu

机构 * Shijiazhuang Tiedao University(石家庄铁道大学) Shanghai Jiao Tong University(上海交通大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Great Bay University(大贝大学)

AI总结 UniShield通过构建面部攻击知识图谱,结合图谱一致推理优化,提升面部攻击检测的准确性和推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05611 2026-05-12 cs.SD cs.AI eess.AS

X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning

X-Voice:通过零样本跨语言语音克隆让每个人都能说30种语言

Rixi Xu, Qingyu Liu, Haitao Li, Yushen Chen, Zhikang Niu, Yunting Yang, Jian Zhao, Ke Li, Berrak Sisman, Qinyuan Cheng, Xipeng Qiu, Kai Yu, Xie Chen

机构 * MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(摩埃人工智能重点实验室、X-LANCE实验室、上海交通大学) Shanghai Innovation Institute(上海创新研究院) Center for Language and Speech Processing, Johns Hopkins University(语言与语音处理中心、约翰霍普金斯大学) Geely(吉利) Dataocean AI(数据海洋人工智能) Zhejiang University(浙江大学) Fudan University(复旦大学)

AI总结 X-Voice通过双阶段训练和多语言语音合成架构,实现零样本跨语言语音克隆,优于现有多语言系统并在性能上接近大规模模型。

Comments 16 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12592 2026-05-12 cs.CV

ELoG-GS: Dual-Branch Gaussian Splatting with Luminance-Guided Enhancement for Extreme Low-light 3D Reconstruction

ELoG-GS:双分支高斯点云生成与亮度引导增强用于极端低光3D重建

Yuhao Liu, Dingju Wang, Ziyang Zheng

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出ELoG-GS方法,结合学习点云初始化和亮度引导色彩增强,提升极端低光环境下3D重建的几何一致性和真实感。实验表明其在NTIRE 2026挑战赛中优于基线方法,达到更高的PSNR和SSIM。

Comments Our method achieved a ranking of 9 out of 148 participants in Track 1 of the NTIRE 3DRR Challenge, as reported on the official competition website: https://www.codabench.org/competitions/13854/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16231 2026-05-12 math.OC cs.RO cs.SY eess.SY

Featurized Occupation Measures for Structured Global Search in Numerical Optimal Control

特征化占用测度用于数值最优控制中的结构化全局搜索

Qi Wei, Jianfeng Tao, Haoyang Tan, Hongyu Nie

机构 * School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院)

AI总结 本文提出特征化占用测度(FOM),通过有限维的对偶界面连接数值最优控制求解器与显式HJB子解,通过证书引导原问题搜索并收紧证书,分离原问题表达性与对偶精度,减少维度灾难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13224 2026-05-12 cs.CV cs.AI

Visual-ERM: Reward Modeling for Visual Equivalence

视觉-ERM:用于视觉等价性的奖励建模

Ziyu Liu, Shengyuan Ding, Xinyu Fang, Xuanlang Dai, Penghui Yang, Jianze Liang, Jiaqi Wang, Kai Chen, Dahua Lin, Yuhang Zang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) CUHK(香港中文大学)

AI总结 本文提出视觉-ERM模型,通过细粒度的视觉反馈提升视觉到代码任务的奖励学习效果,实验显示其在图表到代码、表格和SVG解析任务中均取得显著提升。

Comments Project: https://github.com/InternLM/Visual-ERM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22088 2026-05-12 cs.RO

Force Policy: Learning Hybrid Force-Position Control Policy under Interaction Frame for Contact-Rich Manipulation

力政策:在交互框架下学习混合力-位置控制策略以进行密集接触 manipulation

Hongjie Fang, Shirun Tang, Mingyu Mei, Haoxiang Qin, Zihao He, Jingjing Chen, Ying Feng, Chenxi Wang, Wanxi Liu, Zaixing He, Cewu Lu, Shiquan Wang

机构 * Noematrix Flexiv Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出力政策,通过视觉和力反馈实现全局-局部控制,提升接触稳定性和执行质量,适用于复杂接触任务。

Comments accepted by RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21619 2026-05-12 cs.LG cs.AI cs.CL

On the Overscaling Curse of Parallel Thinking: System Efficacy Contradicts Sample Efficiency

关于并行思维的过度扩展诅咒:系统效能与样本效率的矛盾

Yiming Wang, Zhuosheng Zhang, Rui Wang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 本文研究并行思维中系统效能与样本效率的矛盾,提出Latent Budget Predictor提升预算利用率,并引入Pre-decoding Budget Adaptation改进解码效率。

Comments 44 pages, 66 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14045 2026-05-12 cs.CR cs.AI cs.CL

Auditing Data Membership in Reinforcement Learning With Verifiable Rewards

在强化学习中使用可验证奖励进行数据成员审计

Yule Liu, Heyi Zhang, Jinyi Zheng, Zhen Sun, Zifan Peng, Jiaheng Wei, Tianshuo Cong, Yilong Yang, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Xidian University(西安电子科技大学) Wuhan University(武汉大学)

AI总结 本文提出DIBA框架,通过比较微调模型与预RLVR检查点,检测强化学习中数据暴露问题,提升审计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04233 2026-05-12 cs.LG cs.AI

PAINET: A Principled Efficient Transformer for 3D Dynamics Modeling

PAINET:一种基于原理的高效变压器用于3D动态建模

Kai Yang, Yuqi Huang, Junheng Tao, Wanyu Wang, Qitian Wu

机构 * Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University(上海交通大学巴黎精英理工学院) Department of Physics, Harvard University(哈佛大学物理系) Harvard-MIT Center for Ultracold Atoms(哈佛-麻省理工冷原子中心) Eric and Wendy Schmidt Center, Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所埃里克和wendy Schmidt中心)

AI总结 本文提出PAINET,一种基于SE(3)等价性的变压器,用于学习多体系统的所有对相互作用,通过物理启发的注意力网络和并行解码器,在多个真实世界基准上实现了3D动态预测的误差降低。

Comments 24 pages, published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08283 2026-05-12 cs.LG cs.AI cs.CL

HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control

HTPO: 通过分层令牌级目标控制实现探索-利用平衡的策略优化

Xincheng Yao, Ruoqi Li, Cheng Chen, Daoxin Zhang, Yi Wu, Yao Hu, Chongyang Zhang

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Xiaohongshu Inc.(小红书公司) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院)

AI总结 本文提出HTPO算法,通过分层划分响应令牌为功能组,设计专用优化目标以平衡探索与利用,实验验证其在推理基准上的优越性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏