arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-05-19 至 2026-05-19 共收录 54
2605.18733 2026-05-19 cs.CV

Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory

通过无训练的身份感知记忆推进叙事长视频生成

Jinzhuo Liu, Jiangning Zhang, Wencan Jiang, Yabiao Wang, Dingkang Liang, Zhucun Xue, Ran Yi, Yong Liu

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯云智实验室) Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出了一种无训练的身份感知记忆框架IAMFlow,通过显式建模和跟踪持久实体身份,实现一致的生成,同时引入NarraStream-Bench基准测试,在叙事流视频生成中取得最佳性能。

Comments Project page: https://eddie0521.github.io/projects/iamflow/ Code: https://github.com/Eddie0521/IAMFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18722 2026-05-19 cs.RO

Dexora: Open-source VLA for High-DoF Bimanual Dexterity

Dexora: 开源的高自由度双臂灵巧性VLA系统

Zongzheng Zhang, Jingrui Pang, Zhuo Yang, Kun Li, Minwen Liao, Saining Zhang, Guoxuan Chi, Jinbang Guo, Huan-ang Gao, Modi Shi, Dongyun Ge, Yao Mu, Jiayuan Gu, Rui Chen, Hao Dong, Huazhe Xu, Li Yi, Yixin Zhu, Hang Zhao, Pengwei Wang, Shanghang Zhang, Guocai Yao, Jianyu Chen, Hongyang Li, Hao Zhao

机构 * Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) ShanghaiTech University(上海科技大学) Peking University(北京大学)

AI总结 本文提出Dexora,首个开源的VLA系统,旨在双臂双手高自由度操作,通过混合遥控管道分离粗臂运动和精细手指运动,结合物理平台和数字孪生,构建大规模训练数据集,并提出数据质量感知训练方法,实验证明其在基础和灵巧任务上的优越性能。

Comments Accpeted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18693 2026-05-19 cs.AI

SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents

SkillGenBench: 评估LLM代理技能生成流水线的基准测试

Yifan Zhou, Zhentao Zhang, Ziming Cheng, Shuo Zhang, Qizhen Lan, Zhangquan Chen, Zhi Yang, QianyuXu, Ronghao Chen, Huacan Wang, Sen Hu

机构 * SJTU(上海交通大学) XJTU(西安交通大学) NUS(新加坡国立大学) QuantaAlpha(量子Alpha) THU(清华大学) SUFE(上海财经大学) NTU(国立.ntu) PKU(北京大学) UCAS(中国科学技术大学)

AI总结 本文提出SkillGenBench,一个用于评估LLM代理技能生成流水线的基准测试,通过统一可控的协议评估技能生成过程,涵盖任务条件生成和任务无关生成两种模式,以及基于仓库和文档的两种程序来源,揭示技能生成在不同数据源中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18599 2026-05-19 cs.CV

Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling

通过语义-空间解耦解决前馈新视角合成变换器中的表示歧义

Yihang Wu, Yihang Sun, Shaofeng Zhang, Zuxuan Wu, Junchi Yan, Xiaosong Jia, Yu-gang Jiang

机构 * Institute of Trustworthy Embodied Artificial Intelligence (TEAI)(可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Sch. of Artificial Intelligence & Sch. of Computer Science, Shanghai Jiao Tong University(上海交通大学人工智能学院与计算机科学学院) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出通过语义-空间解耦解决前馈新视角合成变换器中的表示歧义问题,通过分离语义和空间令牌,保持两者的显式表示并利用共享注意力路由保持跨分支交互,同时引入可选分类监督和双向调制以提高交互效果,从而在解码器-only和编码器-解码器前馈NVS模型中实现一致的改进。

Comments 24 pages, 11 figures, 4 tables. Project page: https://hangzay.github.io/ssd_lvsm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18346 2026-05-19 cs.CV cs.AI

Focused Forcing: Content-Aware Per-Frame KV Selection for Efficient Autoregressive Video Diffusion

聚焦强制:面向内容的每帧KV选择用于高效的自回归视频扩散

Peiliang Cai, Evelyn Zhang, Jiacheng Liu, Hao Lin, Ruiqi Zhang, Weile Mo, Yue Ma, Shikang Zheng, Jiehang Huang, Dongrui Liu, Linfeng Zhang

机构 * SJTU(上海交通大学) SDU(山东大学) HUST(华中科技大学) UTokyo(东京大学) HKUST(香港科技大学) SCUT(上海大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出了一种无需训练的KV选择方法,通过结合注意力分数和历史帧的多样性分数,保留最相关和有区别的历史帧,从而在不牺牲质量的情况下提高自回归视频扩散的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18165 2026-05-19 cs.LG

Elastic-dLLM: Position Preserving Context Compression and Augmentation of Diffusion LLMs

Elastic-dLLM: Diffusion LLMs的弹性上下文压缩与增强

Junyi Wu, Tianchen Zhao, Shaoqiu Zhang, Linfeng Zhang, Guohao Dai, Yu Wang

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Infinigence AI

AI总结 本文针对扩散大语言模型中上下文压缩和增强问题,提出了一种位置保持的上下文压缩和终端感知增强方法,以提高解码效率并实现长上下文扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10503 2026-05-19 cs.AI

SLASH the Sink: Sharpening Structural Attention Inside LLMs

SLASH the Sink: 在大语言模型中 sharpening 结构性注意力

Yiming Liu, Bin Lu, Xinbing Wang, Chenghu Zhou, Meng Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Geographical Science and Natural Resources Research(地理科学与自然资源研究所) Chinese Academy of Sciences(中国科学院)

AI总结 本文研究了大语言模型内部机制,发现其能自发重构图拓扑,但受注意力sink影响导致结构理解被削弱。提出SLASH方法,通过插件式注意力重分布增强内部结构理解,实验表明在纯图任务和分子预测中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18652 2026-05-19 cs.CR cs.AI

From Craft to Kernel: A Governance-First Execution Architecture and Semantic ISA for Agentic Computers

从手工到内核:一种以治理为导向的执行架构和语义ISA用于代理计算机

Xiangyu Wen, Yuang Zhao, Xiaoyu Xu, Lingjun Chen, Changran Xu, Shu Chi, Jianrong Ding, Zeju Li, Haomin Li, Li Jiang, Fangxin Liu, Qiang Xu

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出了一种以治理为导向的执行架构和语义指令集架构(ISA),旨在解决代理计算机中AI从脆弱原型到生产系统的过渡问题,通过引入概率处理单元和确定性神经符号内核,提升系统的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22244 2026-05-19 cs.CV

FlashEdit: Decoupling Speed, Structure, and Semantics for Precise Image Editing

FlashEdit: 解耦速度、结构和语义以实现精确图像编辑

Junyi Wu, Zhiteng Li, Haotong Qin, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出FlashEdit,一种高效的局部图像编辑框架,通过解耦速度、结构和语义来实现精确编辑,实验表明其在保真度和效率之间取得了良好的平衡。

Comments Our code will be made publicly available at https://github.com/JunyiWuCode/FlashEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06038 2026-05-19 cs.CV cs.AI

Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models

Fourier Compressor: 频域视觉令牌压缩用于视觉-语言模型

Huanyu Wang, Jushi Kai, Haoli Bai, Lu Hou, Bo Jiang, Ziwei He, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Noah’s Ark Lab(诺亚实验室) Huawei Technologies Ltd.(华为技术有限公司) School of Computer Science(计算机科学学院)

AI总结 本文提出了一种基于频域的视觉令牌压缩策略,通过傅里叶变换减少计算开销并提升效率,同时保持语义准确性,实验表明其在图像和视频任务中均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16278 2026-05-19 cs.CV cs.AI cs.RO

DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving

DriveMoE:面向端到端自动驾驶的视觉-语言-动作混合专家模型

Zhenjie Yang, Yilin Chai, Xiaosong Jia, Qifeng Li, Yuqian Shao, Xuekai Zhu, Haisheng Su, Junchi Yan

机构 * Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学计算机科学学院与人工智能学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) AnyScale AI Project(AnyScale AI项目)

AI总结 本文提出DriveMoE,一种基于混合专家架构的端到端自动驾驶框架,通过场景专用的视觉混合专家和技能专用的动作混合专家,实现了对复杂驾驶场景的有效处理,展示了在自动驾驶任务中结合视觉和动作混合专家的有效性。

Comments Accepted by CVPR 2026, Project Page: https://thinklab-sjtu.github.io/DriveMoE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20969 2026-05-19 cs.DC cs.LG

TeleRAG: Efficient Retrieval-Augmented Generation Inference with Lookahead Retrieval

TeleRAG: 通过前瞻性检索实现高效的检索增强生成推理

Chien-Yu Lin, Keisuke Kamahori, Yiyu Liu, Xiaoxiang Shi, Madhav Kashyap, Yile Gu, Rulin Shao, Zihao Ye, Kan Zhu, Rohan Kadekodi, Stephanie Wang, Arvind Krishnamurthy, Luis Ceze, Baris Kasikci

机构 * Paul G. Allen School of Computer Science and Engineering, University of Washington, Seattle, WA, USA(华盛顿大学保罗·G·艾伦计算机科学与工程学院,西雅图,华盛顿州,美国) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University, Cambridge, MA, USA(哈佛大学约翰·A·保罗森工程与应用科学学院,剑桥,马萨诸塞州,美国) Shanghai Jiao Tong University, Shanghai, China(上海交通大学,上海,中国)

AI总结 本文提出TeleRAG,一种通过前瞻性检索机制减少延迟并提高吞吐量的高效检索增强生成推理系统,该系统在有限的GPU内存下实现了更高的性能和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18115 2026-05-19 cs.CV

WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens

WinTok: 一种通过分解视觉理解和生成来实现双赢的混合分词器

Yiwei Guo, Shaobin Zhuang, Zhipeng Huang, Canmiao Fu, Chen Li, Jing Lyu, Yali Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) WeChat Vision, Tencent Inc.(腾讯微信视觉部) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出WinTok,一种通过分解视觉理解和生成任务来实现双赢的混合分词器,通过引入可迁移的语义分词来减少跨任务干扰,从而在多个基准测试中提升了重建、理解和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18059 2026-05-19 cs.RO

Bench2Drive-Robust: Benchmarking Closed-Loop Autonomous Driving under Deployment Perturbations

Bench2Drive-Robust: 在部署扰动下闭环自动驾驶的基准测试

Zhiyuan Zhang, Zhenghao Jin, Yanlun Peng, Xianda Guo, Haoran Liu, Shaofeng Zhang, Xingjun Ma, Zuxuan Wu, Junchi Yan, Xiaosong Jia, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI (TEAI)(可信具身人工智能研究院) Great Wall Motor(长城汽车) Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学计算机学院及人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出Bench2Drive-Robust,首个针对闭环端到端自动驾驶在现实部署扰动下的设备中心鲁棒性基准测试,评估了三种主要来源的部署相关扰动对自动驾驶系统的影响,揭示了传统图像级腐蚀评估未能完全捕捉的鲁棒性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18055 2026-05-19 cs.LG cs.AI

FLAG: Foundation model representation with Latent diffusion Alignment via Graph for spatial gene expression prediction

FLAG: 通过图结构的潜在扩散对齐实现基础模型表示以空间基因表达预测

Qi Si, Penglei Wang, Yushuai Wu, Yifeng Jiao, Xuyang Liu, Xin Guo, Yuan Qi, Yuan Cheng

机构 * Shanghai Academy of Artificial Intelligence for Science, Shanghai, China.(上海人工智能科学研究院) School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China.(上海交通大学生物医学工程学院) Incubation Institute, Fudan University, Shanghai, China.(复旦大学孵化院)

AI总结 本文提出FLAG框架,通过图结构的潜在扩散对齐方法,解决空间基因表达预测中的基因协调和空间分布关系问题,并引入基因维度诅咒的概念,通过空间图编码器和基因基础模型对齐来提升模型的结构一致性与基因间保真度。

Comments 9 pages for main text, 3 pages for references, 19 pages for appendix. accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17976 2026-05-19 cs.AI math.OC

Unleashing LLMs in Bayesian Optimization: Preference-Guided Framework for Scientific Discovery

释放大语言模型于贝叶斯优化:用于科学发现的偏好引导框架

Xinzhe Yuan, Zhuo Chen, Jianshu Zhang, Huan Xiong, Nanyang Ye, Yuqiang Li, Qinying Gu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出了一种基于大语言模型的贝叶斯优化框架LGBO,通过在优化循环中持续整合大语言模型的语义推理,提高了科学发现中的优化效率和收敛速度。

Comments Published as a conference paper at ICLR 2026. 10 pages main paper, 21 pages appendix, 26 figures

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17969 2026-05-19 cs.CV

Generation Navigator: A State-Aware Agentic Framework for Image Generation

生成导航器:一种基于状态的图像生成代理框架

Jinming Liu, Ruoyu Feng, Yuqi Wang, Wenjun Zeng, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究所) Independent(独立)

AI总结 本文提出了一种基于状态的图像生成代理框架Generation Navigator,通过将图像生成问题重新表述为状态条件下的动作生成问题,解决了传统方法中在强化学习训练中因信用分配问题导致的不足,通过PRE-GRPO算法提升了生成质量与推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17967 2026-05-19 cs.AI

Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective

弥合对SFT在LLM中效果的矛盾观点:一种交互视角

Junpeng Zhang, Lei Cheng, Guoxi Zhang, Hua Cai, Qing Xu, Quanshi Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute for General Artificial Intelligence(北京一般人工智能研究院) UniDT

AI总结 本文从交互视角探讨了SFT在LLM中的效果不一致问题,发现SFT主要去除噪声交互但难以获得可靠新交互,且去噪阶段短暂,继续微调易引入过拟合交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17912 2026-05-19 cs.RO cs.CV

WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform

WorldArena 2.0: 扩展模态、功能和平台的具身世界模型基准测试

Yu Shang, Yinzhou Tang, Yiding Ma, Zhuohang Li, Lei Jin, Weikang Su, Xin Jin, Zhaolu Wang, Ziyou Wang, Xin Zhang, Haisheng Su, Weizhen He, Wei Wu, Haoyi Duan, Gordon Wetzstein, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Chen Gao, Yong Li

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Stanford University(斯坦福大学) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学) Chinese Academy of Sciences(中国科学院) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出WorldArena 2.0,扩展了具身世界模型的评估,涵盖模态、功能和平台三个维度,提供全面的测试平台以评估具身世界模型的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17888 2026-05-19 physics.flu-dyn cs.LG

Long-horizon prediction of three-dimensional wall-bounded turbulence with CTA-Swin-UNet and resolvent analysis

利用CTA-Swin-UNet和分辨率分析进行三维壁湍流长周期预测

Bo Chen, Yitong Fan, Jie Yao, Weipeng Li

机构 * School of Aeronautics and Astronautics, Shanghai Jiao Tong University, Shanghai 200240, China(航空航天学院,上海交通大学,上海200240,中国) School of Interdisciplinary Science, Beijing Institute of Technology, Beijing 100081, China(交叉科学学院,北京理工大学,北京100081,中国)

AI总结 本文提出了一种混合机器学习框架,通过CTA-Swin-UNet和多时间尺度融合校正策略,有效预测壁平行平面的湍流场,并通过分辨率基谱线性随机估计重构三维流场,展示了该框架在长周期自回归预测中的有效性与计算效率。

Comments 40 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17742 2026-05-19 cs.CV cs.HC

UST-Hand: An Uncertainty-aware Spatiotemporal Point Cloud Interaction Network for 3D Self-supervised Hand Pose Estimation

UST-Hand: 一种面向3D自监督手姿态估计的不确定性感知时空点云交互网络

Tianhao Han, Haoyang Zhang, Liang Xie, Haochen Chang, Kun Gao, Yuan Cheng, Pengfei Ren, Erwei Yin

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Beijing University of Posts and Telecommunications(北京邮电大学) Sun Yat-sen University(中山大学) Peking University(北京大学) Defense Innovation Institute, Academy of Military Sciences(国防科技创新院,军事科学学院) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心)

AI总结 本文提出UST-Hand,一种通过估计手姿态不确定性分布并构建概率点云特征空间的自监督学习框架,以更稳定地建模复杂的时空关系,从而在三个具有挑战性的数据集上实现了最先进的性能,比现有自监督方法在均位点误差(MPVPE)上高出37.8%。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17718 2026-05-19 stat.ML cs.LG

How does feature learning reshape the function space?

特征学习如何重塑函数空间?

João Lobo, Bruno Loureiro, Long Tran-Than, Fanghui Liu

机构 * Department of Computer Science, University of Warwick, United Kingdom(沃里克大学计算机科学系,英国) Departement d’Informatique, École Normale Supérieure, PSL & CNRS(巴黎高等师范学院信息系,PSL与CNRS) School of Mathematical Sciences, Institute of Natural Sciences and MOE-LSC, Shanghai Jiao Tong University, China(上海交通大学数学科学学院,中国) Department of Computer Science, and Centre for Discrete Mathematics and its Applications (DIMAP), University of Warwick, United Kingdom(沃里克大学计算机科学系,以及离散数学及其应用中心(DIMAP),英国)

AI总结 本文研究了特征学习如何通过梯度下降训练改变两层神经网络的函数空间,揭示了特征学习在参数空间或输入空间中的分布变换作用,以及其对函数空间谱结构的影响。

Comments 59 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17566 2026-05-19 cs.CV

Rethinking Point Clouds as Sequences: A Causal Next-Token Predictive Learning Framework

重新思考点云作为序列:一种因果性下一标记预测学习框架

Yumeng Yao, Jingzhi Dong, Haowen Gu, Tao Chen, Zonghan Wu, Xiaoshui Huang, Yazhou Yao

机构 * Nanjing University of Science and Technology(南京理工大学) Shanghai Jiao Tong University(上海交通大学) Hangzhou City University(杭州城市学院) East China Normal University(华东师范大学)

AI总结 本文提出PointNTP,将点云预训练重新定义为全因果、无解码器的潜在下一标记预测问题,通过局部补丁分割和结构化3D标记序列生成,实现对点云结构依赖的直接建模,无需重建解码器或显式几何恢复,实验表明其在多个下游任务中表现优异。

Comments 10 pages, 2 figures. Code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17488 2026-05-19 cs.CV cs.MM cs.SD

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

Omni-Customizer: 用于联合音频-视频生成的端到端多模态定制

Yuheng Chen, Qingdong He, Teng Hu, Yuji Wang, Yabiao Wang, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 本文提出Omni-Customizer,一种端到端多模态定制框架,旨在实现精确的多模态身份信息绑定和无缝融合,通过引入Omni-Context Fusion模块和Masked TTS Cross-Attention机制,提升多模态定制生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17478 2026-05-19 cs.CV

Mamba-VGGT: Persistent Long-Sequence Video Geometry Grounded Transformer via External Sliding Window Mamba Memory

Mamba-VGGT: 通过外部滑动窗口Mamba内存实现持久长序列视频几何 grounded 变换器

Tianchen Deng, Zhenxiang Xiong, Nailin Wang, Fangjinhua Wang, Jiuming Liu, Jianfei Yang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zurich(苏黎世联邦理工学院) Cambridge University(剑桥大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Mamba-VGGT框架,通过引入滑动窗口Mamba内存模块,解决传统VGGT在长序列视频中几何遗忘和累积漂移问题,提升3D场景重建的精度与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20155 2026-05-19 cs.CV

GSCompleter: A Distillation-Free Plugin for Metric-Aware 3D Gaussian Splatting Completion in Seconds

GSCompleter: 一种无需蒸馏的插件,用于在几秒钟内进行基于度量的3D高斯溅射完成

Ao Gao, Jingyu Gong, Xin Tan, Zhizhong Zhang, Lizhuang Ma, Yuan Xie

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai Innovation Institute(上海创新研究院) Chongqing Key Laboratory of Precision Optics, Chongqing Institute of East China Normal University(重庆精密光学重点实验室,东华大学重庆研究院) Shanghai Key Laboratory of Computer Software Evaluating and Testing(上海计算机软件评测测试重点实验室) Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

AI总结 本文提出了一种无需蒸馏的GSCompleter插件,通过稳定的'生成-注册'流程实现基于度量的3D高斯溅射完成,提高了完成质量和效率,并在三个基准上取得了新的最先进的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15762 2026-05-19 cs.LG

Zero-Shot Scalable Resilience in UAV Swarms: A Decentralized Imitation Learning Framework with Physics-Informed Graph Interactions

无人机群中的零样本可扩展韧性:一种带有物理信息图交互的去中心化模仿学习框架

Huan Lin, Lianghui Ding

机构 * Institute of Image Communication and Network Engineering, School of Integrated Circuits, Shanghai Jiao Tong University(图像通信与网络工程研究所,集成电路学院,上海交通大学)

AI总结 本文提出了一种去中心化模仿学习框架,通过物理信息图神经网络编码局部交互,实现无人机群在大规模故障和碎片化拓扑下的鲁棒恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18158 2026-05-19 cs.CV eess.IV

Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion

语义解耦与组合用于具有高效LLM推理和生成扩散的通用图像编码

Jinming Liu, Yuntao Wei, Junyan Lin, Shengyang Zhao, Heming Sun, Zhibo Chen, Wenjun Zeng, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Ningbo Institute of Digital Twin(宁波数字孪生研究院) Eastern Institute of Technology(东部技术研究院) University of Science and Technology of China(中国科学技术大学) Yokohama National University(Yokohama国立大学)

AI总结 本文提出UniCodec,一种基于语义解耦和组合生成的通用图像编码框架,通过高效LLM推理和生成扩散模型实现人类和机器需求的统一压缩,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19189 2026-05-19 cs.LG

DyDiff: Long-Horizon Rollout via Dynamics Diffusion for Offline Reinforcement Learning

DyDiff: 通过动力学扩散实现离线强化学习中的长周期 rollout

Hanye Zhao, Xiaoshen Han, Zhengbang Zhu, Minghuan Liu, Yong Yu, De-Chuan Zhan, Weinan Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学计算机科学学院) Department of Computer Science, Nanjing University, Nanjing 210093, China(南京大学计算机科学系)

AI总结 本文提出DyDiff,一种通过动力学扩散模型实现离线强化学习中长周期轨迹生成的方法,通过迭代注入学习策略信息,解决行为策略与学习策略不一致的问题,提升长周期rollout的准确性。

Comments 18 pages, 10 figures, 9 tables. The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-52028-5}

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17368 2026-05-19 cs.CV

RadGenome-Anatomy: A Large-Scale Anatomy-Labeled Chest Radiograph Dataset via Physically Grounded Volumetric Projection

RadGenome-Anatomy: 通过物理基础的体积分量生成大规模解剖标注胸部X光图像数据集

Shuchang Ye, Mingyuan Meng, Hao Wang, Usman Naseem, Jinman Kim

机构 * The University of Sydney(悉尼大学) Zhongguancun Academy(中关村学院) Shanghai Jiao Tong University(上海交通大学) Macquarie University(麦考瑞大学)

AI总结 本文提出RadGenome-Anatomy数据集,通过物理基础的体积分量生成技术,生成包含超过1000万段分割掩码的大型解剖标注胸部X光图像数据集,用于改进医学图像分割和诊断任务。

详情

展开后加载摘要…

URL PDF HTML 收藏