arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-05-15 至 2026-05-15 共收录 21
2605.15182 2026-05-15 cs.CV

Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video

Warp-as-History:从单个训练视频生成可泛化的相机控制视频

Yifan Wang, Tong He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出Warp-as-History方法,通过将相机诱导的变形转化为相机变形的伪历史,实现无需训练的零样本相机轨迹生成,提升视频生成的相机顺应性和视觉质量。

Comments Project page: https://yyfz.github.io/warp-as-history/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15081 2026-05-15 cs.CL cs.AI

ML-Embed: Inclusive and Efficient Embeddings for a Multilingual World

ML-Embed:面向多语言世界的包容性与高效嵌入

Ziyin Zhang, Zihan Liao, Hang Yu, Peng Di, Rui Wang

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院)

AI总结 本文提出ML-Embed,通过3D-ML框架解决高质文本嵌入的计算、语言覆盖和透明性问题,构建了从140M到8B参数的多语言模型,实现了在9个MTEB基准上的新纪录,尤其在低资源语言表现突出。

Comments Accepted by ICML 2026. The data has been released earlier in the preprint arXiv:2603.19223

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14950 2026-05-15 cs.CV cs.RO

Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model

Evo-Depth:一种轻量化的深度增强视觉-语言-动作模型

Tao Lin, Yuxin Du, Jiting Liu, Nuobei Zhu, Yunhe Li, Yuqian Fu, Yinxinyu Chen, Hongyi Cai, Zewei Ye, Bing Cheng, Kai Ye, Yiran Mao, Yilei Zhong, MingKang Dong, Junchi Yan, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 大学科学与技术大学) Nanyang Technological University(南洋理工大学) SJTU-Quic Robot Joint Lab(上海交通大学-Quick 机器人联合实验室)

AI总结 本文提出Evo-Depth模型,通过轻量隐式深度编码模块和空间增强模块提升视觉-语言-动作任务中的空间感知能力,实现高效部署与高精度操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14948 2026-05-15 cs.CV

ACE-LoRA: Adaptive Orthogonal Decoupling for Continual Image Editing

ACE-LoRA:适应性正交解耦用于持续图像编辑

Yuehao Liu, Weijia Zhang, Xuanming Shang, Zhizhou Chen, Yanhao Ge, Shanyan Guan, Chao Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) VIVO

AI总结 ACE-LoRA通过动态正则化框架解决持续图像编辑中的灾难性遗忘问题,采用适应性正交解耦和历史信息压缩策略,提出首个全面的CIE-Bench基准,验证方法在指令忠实度、视觉真实性和抗遗忘性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14938 2026-05-15 cs.LG cs.CV

Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models

Octopus:无历史梯度正交化用于多模态大语言模型中的持续学习

Yuehao Liu, Shanyan Guan, Weijia Zhang, Xuanming Shang, Yanhao Ge, Wei Li, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能大模型关键实验室,人工智能研究院,上海交通大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

AI总结 Octopus提出一种基于无历史梯度正交化的方法,通过两阶段微调策略平衡持续学习中的可塑性与稳定性,实验表明其在UCIT数据集上性能优于现有最佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14874 2026-05-15 cs.CV

LPH-VTON: Resolving the Structure-Texture Dilemma of Virtual Try-On via Latent Process Handover

LPH-VTON:通过潜在过程交接解决虚拟试衣的结构-纹理困境

Yixin Liu, Baihong Qian, Jinglin Jiang, Jeffery Wu, Yan Chen, Wei Wang, Yida Wang, Lanqing Yang, Guangtao Xue

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出LPH-VTON框架,通过单个连续去噪过程解决虚拟试衣中结构与纹理的平衡问题,实现高质量的视觉真实性和精确的结构对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14857 2026-05-15 cs.AI cs.IR

A Deterministic Agentic Workflow for HS Tariff Classification: Multi-Dimensional Rule Reasoning with Interpretable Decisions

一种确定性代理工作流用于HS税则分类:多维规则推理与可解释决策

Yu Zhang, Dongjiang Zhuang, Qu Zhou, Zheng Huang, Junhe Wu, Jing Cao, Kai Chen

机构 * School of Information and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, China(信息与电子工程学院,上海交通大学,上海,中国) Nanjing Jiyun Information Technology Co., Ltd., Nanjing, China(南京吉云信息技术有限公司,南京,中国) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(计算机科学学院,上海交通大学,上海,中国)

AI总结 本文提出确定性代理工作流,通过多维规则推理实现HS税则分类,通过结构化输出和引用注释提升可解释性,实验显示在六位和四位税则层面均取得较高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14801 2026-05-15 cs.RO

Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN

探索VLM-LLM导航中的瓶颈:3D场景理解能力如何影响零样本VLN

Ziyi Xia, Chaoran Xiong, Litao Wei, Xinhao Hu, Ling Pei

机构 * Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(上海导航与基于位置的服务关键实验室,上海交通大学)

AI总结 本文研究了零样本视觉-语言导航中3D场景理解能力对性能的影响,提出了统计成功率上限,揭示了感知饱和现象,建议转向导航相关的核心词汇和准确的边界框比例。

Comments Accepted by ICRA Workshop MM-Spatial AI, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14497 2026-05-15 cs.LG cs.AI

ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization

ROAD: 通过双层优化实现的自适应数据混合用于离线到在线强化学习

Letian Yang, Xu Liu, Yiqiang Lu, Jian Liu, Weiqiang Wang, Shuai Li

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

AI总结 本文提出ROAD框架,通过双层优化解决离线数据与在线策略间分布偏移问题,提升稳定性和性能。

Comments 20 pages, 9 figures, 7 tables. Accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14449 2026-05-15 cs.LG cs.AI cs.CL

When Answers Stray from Questions: Hallucination Detection via Question-Answer Orthogonal Decomposition

当答案偏离问题:通过问题-答案正交分解进行幻觉检测

Siyang Yao, Erhu Feng, Yubin Xia

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出QAOD框架,通过正交分解回答表示以抑制领域变化,结合双策略实现领域内检测与跨领域泛化,提升检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14391 2026-05-15 cs.CV

Dual-Latent Collaborative Decoding for Fidelity-Perception Balanced Image Compression

双潜变量协作解码用于保真度-感知平衡的图像压缩

Qi Mao, Zijian Wang, Zhengxue Cheng, Lingyu Zhu, Siwei Ma

机构 * School of Information and Communication Engineering and the State Key Laboratory of Media Convergence and Communication, Communication University of China(信息与通信工程学院和媒体融合与通信国家重点实验室,中国通信大学) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(信息科学与电子工程学院,上海交通大学) Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学) State Key Laboratory of Multimedia information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学)

AI总结 本文提出MoDE框架,通过双潜变量协作解码平衡保真度与感知质量,实验表明在宽比特率范围内优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14366 2026-05-15 cs.CL cs.LG

Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax

基于语义奖励的强化学习实现低资源语言扩展而不产生对齐税

Zeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang

机构 * Minzu University of China(中国民族大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) University of Macau(澳门大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hainan International College, Minzu University of China(中国民族大学海南国际学院)

AI总结 本文提出基于语义空间对齐的GRPO方法,通过嵌入层语义奖励优化,减少对预训练知识的破坏性干扰,提升低资源语言扩展效果。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11775 2026-05-15 cs.LG cs.CL

Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control

强化微调中的熵极性:方向、不对称性与控制

Jiazheng Zhang, Ziche Fu, Junrui Shen, Yunbin Zhao, Yunke Zhang, Zhiheng Xi, Long Ma, Chenxin An, Zhihao Zhang, Shichun Liu, Dingwei Zhu, Shihan Dou, Shaofan Liu, Han Li, Wiggin Zhou, Aiden Adams, Tao Gui, Fei Huang, Qi Zhang, Xuanjing Huang

机构 * Fudan NLP Group(复旦大学自然语言处理组) Honor Device Co Ltd(荣誉设备有限公司) University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文心)

AI总结 本文提出熵极性理论框架,揭示熵变化的token级机制,开发PAPO算法通过优势重加权实现熵控制,实验显示其在数学推理和代理基准中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11410 2026-05-15 cs.AI

What Do EEG Foundation Models Capture from Human Brain Signals?

EEG基础模型从人类大脑信号中捕捉了什么?

Ling Tang, Qian Chen, Jilin Mei, Houshi Xu, Quanshi Zhang, Jing Shao, Na Zou, Xia Hu, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Tongji University(同济大学) University of Houston(休斯顿大学)

AI总结 研究探讨EEG基础模型如何从原始信号中学习,并通过实验验证其表示与特征工程基线的对齐情况,揭示了模型学习、使用及解释性方面的关键发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08374 2026-05-15 cs.AI

MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs

MemQ:将Q学习整合到基于溯源DAG的自进化记忆代理中

Junwei Liao, Haoting Shi, Ruiwen Zhou, Jiaqian Wang, Shengtao Zhang, Wei Zhang, Ying Wen, Zhiyu Li, Feiyu Xiong, Bo Tang, Weinan Zhang, Muning Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学) Xidian University(西安电子科技大学) University of Science and Technology of China(中国科学技术大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

AI总结 MemQ通过在溯源DAG中传播信用权重,改进记忆Q值的评估,提升多步任务的泛化能力,尤其在产生深层相关溯源链的任务中表现突出。

Comments 22 pages, 11 figures (containing 43 individual image panels total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06132 2026-05-15 cs.CL

MemReranker: Reasoning-Aware Reranking for Agent Memory Retrieval

MemReranker:面向智能体记忆检索的推理增强重排序

Chunyu Li, Mengyuan Zhang, Jingyi Kang, Ding Chen, Jiajun Shen, Bo Tang, Xuanhe Zhou, Feiyu Xiong, Zhiyu Li

机构 * China Telecom Research Institute(中国电信研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 MemReranker通过多阶段LLM知识蒸馏构建,解决记忆检索中语义相关但缺乏关键信息的问题,提升重排序模型的推理能力与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07441 2026-05-15 cs.LG cs.AI

Proximal Action Replacement for Behavior Cloning Actor-Critic in Offline Reinforcement Learning

近端动作替换用于离线强化学习中的行为克隆Actor-Critic

Jinzong Dong, Wei Huang, Jianshu Zhang, Zhuo Chen, Xinzhe Yuan, Qinying Gu, Zhaohui Jiang, Nanyang Ye

机构 * School of Automation, Central South University(中南大学自动化学院) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出近端动作替换方法,解决离线强化学习中行为克隆导致的性能瓶颈问题,通过替换亚优动作提升Actor-Critic算法性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19924 2026-05-15 cs.CL cs.AI cs.LG

OPT-Engine: Benchmarking the Limits of LLMs in Optimization Modeling via Complexity Scaling

OPT-Engine:通过复杂度扩展评估大语言模型在优化建模中的极限

Yitian Chen, Cheng Cheng, Yinan Sun, Zi Ling, Dongdong Ge

机构 * Shanghai University of Finance and Economics(上海财经大学) Booth School of Business, University of Chicago(芝加哥大学商学院) Antai School of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院)

AI总结 本文通过OPT-ENGINE框架评估大语言模型在优化建模中的能力与扩展性,发现纯文本推理在任务复杂度增加时存在鲁棒性差距,外部工具无法满足全局优化约束,指出约束自动建模是当前SOTA范式的瓶颈。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20206 2026-05-15 cs.CV

RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling

RAPO++: 通过数据对齐和测试时缩放实现文本到视频生成的跨阶段提示优化

Bingjie Gao, Qianli Ma, Xiaoxue Wu, Shuai Yang, Guanzhou Lan, Haonan Zhao, Jiaxuan Chen, Qingyang Liu, Yu Qiao, Xinyuan Chen, Yaohui Wang, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 RAPO++通过数据对齐和测试时缩放,结合训练数据对齐、测试时迭代缩放和大语言模型微调,提升文本到视频生成效果,无需修改生成基础模型。

Comments arXiv admin note: text overlap with arXiv:2504.11739

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14232 2026-05-15 cs.CV

GenExam: A Multidisciplinary Text-to-Image Exam

GenExam:多学科文本到图像考试

Zhaokai Wang, Penghao Yin, Xiangyu Zhao, Changyao Tian, Yu Qiao, Wenhai Wang, Jifeng Dai, Gen Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 GenExam是首个多学科文本到图像考试基准,包含10个学科1000个样本,通过四级分类评估模型的综合能力,揭示开源模型与闭源模型间的显著差距。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14045 2026-05-15 cs.CV

PVRF: All-in-one Adverse Weather Removal via Prior-modulated and Velocity-constrained Rectified Flow

PVRF:通过先验调节和速度约束的修正流实现一体化的恶劣天气去除

Wei Dong, Han Zhou, Terry Ji, Guanhua Zhao, Shahab Asoodeh, Yulun Zhang, Guangtao Zhai, Jun Chen, Xiaohong Liu

机构 * McMaster University(麦斯特大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出PVRF框架,结合零样本软天气感知与速度约束修正流细化,提升恶劣天气去除的保真度和感知质量,具有良好的跨数据集泛化能力。

Comments 10 pages, 9 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏