arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-05-13 至 2026-05-13 共收录 17
2605.12496 2026-05-13 cs.CV

CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives

CausalCine:多镜头视频叙事的实时自回归生成

Yihao Meng, Zichen Liu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Yue Yu, Hanlin Wang, Haobo Li, Jiapeng Zhu, Yanhong Zeng, Xing Zhu, Yujun Shen, Qifeng Chen, Huamin Qu

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) SJTU(上海交通大学)

AI总结 CausalCine通过自回归框架实现多镜头视频生成,通过动态提示和记忆路由保持跨镜头连贯性,优于现有自回归模型,实现实时交互生成。

Comments Project page: https://yihao-meng.github.io/CausalCine/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12357 2026-05-13 cs.AI

$δ$-mem: Efficient Online Memory for Large Language Models

$δ$-mem: 高效的大型语言模型在线内存

Jingdi Lei, Di Zhang, Junxian Li, Weida Wang, Kaixuan Fan, Xiang Liu, Qihan Liu, Xiaoteng Ma, Baian Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Mind Lab Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出$δ$-mem机制,通过紧凑的在线状态与注意力计算直接耦合,提升模型在长文本任务中的表现,无需全微调或替换backbone。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12245 2026-05-13 cs.LG

SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization

SOAR:在NVFP4量化中的尺度优化以实现准确重建

Chengzhu Bao, Xianglong Yan, Zhiteng Li, Guangshuo Qin, Guanghua Yu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文心)

AI总结 本文提出SOAR框架,通过闭式联合尺度优化和解耦尺度搜索提升NVFP4量化精度,实验证明其在相同内存占用下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12240 2026-05-13 cs.AI

No Action Without a NOD: A Heterogeneous Multi-Agent Architecture for Reliable Service Agents

没有NOD就没有行动:一种异质多智能体架构用于可靠的服务代理

Zixu Yang, Hang Zheng, Nan Jiang, Zhiyang Tang, Situo Zhang, Xiaobao Wu, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室,计算机科学学院,上海交通大学,上海,中国) Shanghai Innovation Institution, Shanghai, China(上海创新机构,上海,中国) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室,苏州,中国)

AI总结 本文提出NOD架构,通过外部化全局状态和选择性外部监督,提升服务代理在长周期任务中的可靠性,实验表明其在任务成功率和关键动作精度上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12198 2026-05-13 cs.CV

Enhancing Domain Generalization in 3D Human Pose Estimation through Controllable Generative Augmentation

通过可控生成增强在3D人体姿态估计中的领域泛化

Xinhao Hu, Yiyi Zhang, Liqing Zhang, Jianfu Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 本文提出可控人体姿态生成框架,通过系统变化姿态、背景和摄像机视角合成多样化视频数据,增强训练集多样性,提升模型泛化能力,验证了在处理领域差异方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12162 2026-05-13 cs.RO

X-Imitator: Spatial-Aware Imitation Learning via Bidirectional Action-Pose Interaction

X-Imitator:通过双向动作-姿态交互实现空间感知的模仿学习

Kai Xiong, Hongjie Fang, Lixin Yang, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出X-Imitator框架,通过双向动作-姿态交互解决机器人操作中空间感知与动作生成的耦合问题,实验表明其在24个模拟和3个现实任务中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12001 2026-05-13 cs.IT cs.AI math.IT

CR^2: Cost-Aware Risk-Controlled Routing for Wireless Device-Edge LLM Inference

CR²:面向无线设备-边缘LLM推断的成本感知风险控制路由

Nan Xue, Shengkang Chen, Zhiyong Chen, Jiangchao Yao, Yaping Sun, Zixia Hu, Meixia Tao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(合作中位网创新中心,上海交通大学) Department of Broadband Communication, Pengcheng Laboratory(宽带通信部,鹏城实验室) Future Network of Intelligent Institute (FNii), the Chinese University of Hong Kong (Shenzhen)(智能网络研究所(FNii),香港中文大学(深圳)) Meta

AI总结 本文提出CR²框架,通过分离轻量级设备模型与边缘模型的决策机制,优化无线边缘环境下的推断效率与成本,提升部署准确性与能耗平衡。

Comments submitted to IEEE Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18152 2026-05-13 cs.CV cs.AI

UnfoldLDM: Degradation-Aware Unfolding with Iterative Latent Diffusion Priors for Blind Image Restoration

UnfoldLDM: 基于迭代潜在扩散先验的退化感知展开网络用于盲图像恢复

Chunming He, Rihan Zhang, Zheng Chen, Bowen Yang, Chengyu Fang, Yunlong Lin, Yulun Zhang, Fengyang Xiao, Sina Farsiu

机构 * Duke University(杜克大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Tsinghua University(清华大学) Xiamen University(厦门大学)

AI总结 本文提出UnfoldLDM,结合深度展开网络与潜在扩散模型,解决盲图像恢复中的退化依赖和过平滑偏差问题,通过多粒度退化感知模块和退化抗性LDM提取先验,提升恢复质量与视觉效果。

Comments 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11756 2026-05-13 cs.CV cs.AI

Focusable Monocular Depth Estimation

可聚焦的单目深度估计

Yuxin Du, Tao Lin, Zile Zhong, Runting Li, Xiyao Chen, Jiting Liu, Chenglin Liu, Ying-Cong Chen, Yuqian Fu, Bo Zhao

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

AI总结 本文提出FDE,一种区域感知的单目深度估计方法,通过FocusDepth框架和MSSA模块,提升目标区域的深度精度和全局几何一致性,基于FDE-Bench验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11716 2026-05-13 cs.AI

SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models

SafeSteer: 多模态大语言模型中的解码级防御机制

Xinyi Zeng, Xue Yang, Jingyuan Zhang, Huanqian Yan, Xiang Chen, Kaiwen Wei, Hankun Kang, Yu Tian

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技) School of Computer Science and Technology, Beihang University(北航计算机科学与技术学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Chongqing University(重庆大学) Wuhan University(武汉大学)

AI总结 本文提出SafeSteer,通过解码阶段的轻量探针和模态语义对齐向量,提升多模态大语言模型的安全性,实验表明其能提升33.40%的安全性而不需微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11591 2026-05-13 cs.CV

Logit-Attention Divergence: Mitigating Position Bias in Multi-Image Retrieval via Attention-Guided Calibration

Logit-Attention Divergence:通过注意力引导的校准缓解多图像检索中的位置偏差

Mingtao Xian, Yifeng Yang, Qinying Gu, Xinbing Wang, Nanyang Ye

机构 * Zhiyuan College, Shanghai Jiao Tong University, Shanghai, China(上海交通大学紫阳学院) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

AI总结 本文提出一种无需训练的注意力引导去偏框架,通过利用内在注意力信号在推理时进行实例级校正,显著提升排列不变性并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11577 2026-05-13 cs.CL

BitLM: Unlocking Multi-Token Language Generation with Bitwise Continuous Diffusion

BitLM:通过位连续扩散解锁多令牌语言生成

Shaobin Zhuang, Yuang Ai, Jiaming Han, Xiaohui Li, Huaibo Huang, Xiangyu Yue, Xuefeng Hu, Kun Xu, Yali Wang, Hao Chen

机构 * Shanghai Jiao Tong University(上海交通大学) MMLab, The Chinese University of Hong Kong(中大香港机器学习实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) SIAT, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 BitLM通过位连续扩散模型实现多令牌并行生成,结合因果注意力与联合词决策,提升预训练效率和推理速度,证明单令牌生成并非必要。

Comments 12 pages, 4figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11550 2026-05-13 cs.CV

The DAWN of World-Action Interactive Models

世界-动作交互模型的黎明

Hongbo Lu, Liang Yao, Chenghao He, Haoyu Wang, Xiang Gu, Xianfei Li, Wenlong Liao, Tao He, Pai Peng

机构 * COWARobot Co. Ltd(COWARobot有限公司) Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学)

AI总结 本文提出WAIMs,通过DAWN模型在语义潜在空间中实现世界预测与动作生成的交互,提升自动驾驶中的规划性能与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11541 2026-05-13 cs.CV

GeoR-Bench: Evaluating Geoscience Visual Reasoning

GeoR-Bench:评估地质学视觉推理

Yushuo Zheng, Zicheng Zhang, Huiyu Duan, Chunyi Li, Zijian Chen, Ziheng Jia, Yue Shi, Ke Gu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Technology(北京理工大学)

AI总结 GeoR-Bench通过推理引导的视觉编辑任务评估地质学视觉推理,包含440个样本涵盖6类地质学领域和24种任务类型,揭示地质学推理仍是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11491 2026-05-13 cs.LG cs.AI

Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization

理解与防止RLVR中的熵崩溃:基于策略熵流的在线优化

Huimin Xu, Shuai Zhao, Xiaobao Wu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity(文大学)

AI总结 本文提出OPEFO方法,通过平衡熵动态缓解RLVR中的熵崩溃问题,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10980 2026-05-13 cs.LG cs.AI

LEAP: Unlocking dLLM Parallelism via Lookahead Early-Convergence Token Detection

LEAP: 通过前瞻性早期收敛令牌检测解锁dLLM并行性

Haohui Zhang, Zhiye Wang, Xiaoying Gan, Xinbing Wang, Bo Jiang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 LEAP通过前瞻性早期收敛令牌检测方法,有效降低dLLM解码延迟和步骤,减少约30%的去噪步骤,提升并行解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09003 2026-05-13 cs.CV

FlashClear: Ultra-Fast Image Content Removal via Efficient Step Distillation and Feature Caching

FlashClear: 通过高效的步骤蒸馏和特征缓存实现超快图像内容移除

Yixin Tang, Jiawei Guo, Junxian Li, Zhiteng Li, Jixin Zhao, Bingya Zhang, Chenbo Wang, Yulun Zhang, Shangchen Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Honor Device Co., Ltd(荣耀设备有限公司)

AI总结 本文提出FlashClear,通过区域感知对抗蒸馏和前景优先的注意力与缓存策略,实现高效内容移除,实验表明其在保持性能的同时显著提升速度,达到8.26倍和122倍的加速。

Comments Code: https://github.com/GuoCalix/FlashClear

详情

展开后加载摘要…

URL PDF HTML 收藏