arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3178
2508.06908 2025-11-25 cs.CV cs.AI

Find Them All: Unveiling MLLMs for Versatile Person Re-identification

找到它们全部:揭示MLLMs用于多功能人物重识别

Jinhao Li, Zijian Chen, Lirong Deng, Guangtao Zhai, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究所) Macao Polytechnic University(澳门 polytechnic 大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出VP-ReID基准,利用MLLMs提升人物重识别的多功能性和有效性,同时揭示其在处理某些模态时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00350 2025-11-25 cs.LG cs.CV

BOOD: Boundary-based Out-Of-Distribution Data Generation

基于边界的Out-Of-Distribution数据生成

Qilin Liao, Shuo Yang, Bo Zhao, Ping Luo, Hengshuang Zhao

机构 * The University of Hong Kong, Hong Kong, China(香港大学) School of AI, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Department of Computer Science, Harbin Institute of Technology (Shenzhen), Shenzhen, China(哈尔滨工业大学(深圳)计算机科学系)

AI总结 BOOD通过在潜在空间中识别决策边界并生成高质量OOD特征,提升OOD检测性能,实验显示在CIFAR-100数据集上显著优于现有方法。

Comments 14 pages, 8 figures, To be published in the Proceedings of the International Conference on Machine Learning (ICML) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00416 2025-11-25 cs.RO cs.CV

Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding

Evo-0:具有隐式空间理解的视觉-语言-动作模型

Tao Lin, Gen Li, Yilei Zhong, Yanwen Zou, Yuxin Du, Jiting Liu, Encheng Gu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) University of Cambridge(剑桥大学)

AI总结 Evo-0通过隐式整合3D几何特征,提升视觉-语言-动作模型在现实世界中的空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13837 2025-11-25 cs.AI cs.CL cs.CV

Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

强化学习真的能激励大语言模型在基础模型之外提升推理能力吗?

Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao, Zhaokai Wang, Yang Yue, Shiji Song, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学 LeapLab) Shanghai Jiao Tong University(上海交通大学)

AI总结 本研究发现RLVR方法未有效激发LLMs的新型推理能力,而蒸馏方法能更有效地扩展模型推理能力。

Comments 31 pages, 27 figures

Journal ref NeurIPS 2025 Oral; ICML 2025 AI4MATH workshop best paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18378 2025-11-25 cs.CV

Synthetic Curriculum Reinforces Compositional Text-to-Image Generation

合成课程强化组合文本到图像生成

Shijian Wang, Runhao Fu, Siyi Zhao, Qingqin Zhan, Xingjian Wang, Jiarui Jin, Yuan Lu, Hanqian Wu, Cunjian Chen

机构 * Southeast University(东南大学) Xiaohongshu Inc.(小红书公司) Monash University(墨尔本大学) Shanghai Jiao Tong University(上海交通大学) Anhui University(安徽大学)

AI总结 CompGen通过课程强化学习框架提升文本到图像生成的组合能力,采用场景图和自适应采样算法优化模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18352 2025-11-25 cs.CV

MagicWand: A Universal Agent for Generation and Evaluation Aligned with User Preference

MagicWand: 一个通用代理用于生成与评估,与用户偏好对齐

Zitong Xu, Dake Shen, Yaosong Du, Kexiang Hao, Jinghan Huang, Xiande Huang

机构 * Shanghai Jiao Tong University(上海交通大学) De Artificial Intelligence Lab(德人工智能实验室) The Chinese University of Hong Kong, Shenzhen China(香港中文大学(深圳))

AI总结 MagicWand通过结合用户偏好数据集和先进生成模型,实现高质量内容生成与偏好对齐评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18104 2025-11-25 cs.CV

Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning

通过统一多模态伪造学习巩固扩散生成视频检测

Xiaohong Liu, Xiufeng Song, Huayu Zheng, Lei Bai, Xiaoming Liu, Guangtao Zhai

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

AI总结 本文提出MM-Det++算法,通过统一多模态学习检测扩散生成视频,结合时空分支和多模态分支,提升视频伪造检测的准确性和泛化能力。

Comments Code and dataset are available at https://github.com/SparkleXFantasy/MM-Det-Plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17962 2025-11-25 cs.CV cs.AI

VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment

VITAL:面向视觉质量评估的LMMs视觉编码器预训练

Ziheng Jia, Linhan Cao, Jinliang Han, Zicheng Zhang, Jiaying Qian, Jiarui Wang, Zijian Chen, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 VITAL提出了一种以视觉编码器为中心的生成预训练流程,通过构建大规模训练数据集和多任务训练流程,提升了视觉质量评估LMMs的通用性和可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17930 2025-11-25 cs.CV

UniRSCD: A Unified Novel Architectural Paradigm for Remote Sensing Change Detection

UniRSCD:一种用于遥感变化检测的统一新型架构范式

Yuan Qu, Zhipeng Zhang, Chaojun Xu, Qiao Wan, Mengying Xie, Yuzeng Chen, Zhenqi Liu, Yanfei Zhong

机构 * College of Artificial Intelligence, Southwest University(西南大学人工智能学院) School of Artificial Intelligence, Shanghai Jiaotong University(上海交通大学人工智能学院) LIESMARS, Wuhan University(武汉大学LIESMARS) CS, Chongqing University(重庆大学计算机学院) School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院)

AI总结 UniRSCD提出了一种统一的遥感变化检测架构,通过统一编码器和解码器解决多任务变化检测中的信息损失问题,并在多个数据集上实现了优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17898 2025-11-25 cs.RO

L1 Sample Flow for Efficient Visuomotor Learning

L1样本流用于高效视觉-运动学习

Weixi Song, Zhetao Chen, Tao Xu, Xianchao Zeng, Xinyu Zhou, Lixin Yang, Donglin Wang, Cewu Lu, Yong-Lu Li

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 L1流通过结合去噪模型的多模分布捕捉能力与L1回归的高效性,实现高效的视觉-运动学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17647 2025-11-25 cs.LG cs.AI

MamTiff-CAD: Multi-Scale Latent Diffusion with Mamba+ for Complex Parametric Sequence

MamTiff-CAD: 多尺度潜在扩散与Mamba+用于复杂参数序列

Liyuan Deng, Yunpeng Bai, Yongkang Dai, Xiaoshui Huang, Hongping Gan, Dongshuo Huang, Hao jiacheng, Yilei Shi

机构 * Northwestern Polytechnical University(西北工业大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Nanchang University(南昌大学)

AI总结 MamTiff-CAD通过结合Mamba+和Transformer的多尺度潜在扩散模型,有效生成复杂CAD参数序列,实现长序列生成任务的高性能表现。

Comments ICCV 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01982 2025-11-25 cs.LG cs.CV

Fine-Grained GRPO for Precise Preference Alignment in Flow Models

细粒度GRPO用于流模型中的精确偏好对齐

Yujie Zhou, Pengyang Ling, Jiazi Bu, Yibin Wang, Yuhang Zang, Jiaqi Wang, Li Niu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出细粒度GRPO框架,通过细粒度评估和多粒度整合模块提升流模型中偏好对齐的精度与鲁棒性。

Comments Project Page: https://bujiazi.github.io/g2rpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11977 2025-11-25 cs.IR cs.AI

TBGRecall: A Generative Retrieval Model for E-commerce Recommendation Scenarios

TBGRecall:一种用于电商推荐场景的生成检索模型

Zida Liang, Changfa Wu, Dunxian Huang, Weiqiang Sun, Ziyang Wang, Yuliang Yan, Jian Wu, Yuning Jiang, Bo Zheng, Ke Chen, Silu Zhou, Yu Zhang

机构 * Shanghai Jiaotong University(上海交通大学) Alibaba Inc.(阿里巴巴公司)

AI总结 TBGRecall通过整合下一会话预测,提升电商推荐系统的生成检索能力,有效解决传统模型在多会话生成中的局限性。

Comments Both authors contributed equally to this research. Work done during internship at Alibaba. Corresponding author: Dunxian Huang (dunxian.hdx@alibaba-inc.com). Affiliations: (1) Shanghai Jiaotong University, Shanghai, China; (2) Alibaba Inc

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19536 2025-11-25 cs.CV cs.AI cs.CL

FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models

FlowCut: 通过信息流重新思考冗余性以提高视觉-语言模型的效率

Jintao Tong, Wenwei Jin, Pengda Qin, Anqi Li, Yixiong Zou, Yuhong Li, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Xiaohongshu Inc.(小红书公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 FlowCut通过信息流视角改进视觉-语言模型的冗余识别,实现更高效的剪枝效果。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01215 2025-11-25 cs.CL cs.AI cs.PL cs.SE

From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging

从代码到正确性:通过分层调试关闭代码生成的最后一公里

Yuling Shi, Songsong Wang, Chengcheng Wan, Min Wang, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Davis(加州大学戴维斯分校) East China Normal University(华东师范大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出MGDebugger,一种分层调试器,通过多粒度分析提升代码生成的准确性与修复效率。

Comments Accepted to ICSE 2026. Code and data available at https://github.com/YerbaPage/MGDebugger

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17225 2025-11-24 cs.RO cs.AI cs.CV

TP-MDDN: Task-Preferenced Multi-Demand-Driven Navigation with Autonomous Decision-Making

TP-MDDN:任务优先的多需求驱动导航与自主决策

Shanshan Li, Da Huang, Yu He, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institution(上海创新机构)

AI总结 TP-MDDN通过引入任务优先的多需求驱动导航与自主决策系统,提升复杂任务下的导航性能与环境理解能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17135 2025-11-24 cs.CV

A Multi-Stage Optimization Framework for Deploying Learned Image Compression on FPGAs

一种用于在FPGA上部署学习图像压缩的多阶段优化框架

Jiaxun Fang, Li Chen

机构 * Shanghai Jiao Tong University, China(上海交通大学)

AI总结 本文提出了一种多阶段优化框架,通过动态范围感知量化和硬件感知优化,有效降低了FPGA上学习图像压缩的计算复杂度和BD-rate开销,提升了模型效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17106 2025-11-24 cs.CV

ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better

ChainV: 原子视觉提示使多模态推理更短更优

Yuan Zhang, Ming Lu, Junwen Pan, Tao Huang, Kuan Cheng, Qi She, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ByteDance Inc.(字节跳动公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 ChainV通过动态整合视觉提示,提升多模态推理的效率和准确性,尤其在数学密集型基准测试中表现突出。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18883 2025-11-24 cs.CV

Universal Video Temporal Grounding with Generative Multi-modal Large Language Models

通用视频时间定位与生成多模态大语言模型

Zeqian Li, Shangzhe Di, Zhonghua Zhai, Weilin Huang, Yanfeng Wang, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI实验室) ByteDance Seed(字节跳动种子)

AI总结 本文提出UniTime模型,利用生成多模态大语言模型实现通用视频时间定位,有效处理多类型视频并提升VideoQA任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08708 2025-11-24 cs.RO cs.AI cs.CV

PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly

PhyBlock:通过3D积木组装实现物理理解和规划的渐进性基准

Liang Ma, Jiajun Wen, Min Lin, Rongtao Xu, Xiwen Liang, Bingqian Lin, Jun Ma, Yongxin Wang, Ziming Wei, Haokun Lin, Mingfei Han, Meng Cao, Bokui Chen, Ivan Laptev, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Shenzhen Campus of Sun Yat-sen University(孙中山大学深圳校区) Spatialtemporal AI(时空人工智能) Shanghai Jiao Tong University(上海交通大学)

AI总结 PhyBlock通过3D积木组装任务评估VLMs在物理理解和规划能力,揭示其在复杂任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00820 2025-11-24 cs.CV

QuantFace: Efficient Quantization for Face Restoration

QuantFace: 面部修复的高效量化方法

Jiatong Li, Libo Zhu, Haotong Qin, Jingkai Wang, Linghe Kong, Guihai Chen, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zürich(苏黎世联邦理工学院)

AI总结 QuantFace通过低比特量化和自适应策略提升面部修复效率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06677 2025-11-24 cs.CV cs.MM

REArtGS: Reconstructing and Generating Articulated Objects via 3D Gaussian Splatting with Geometric and Motion Constraints

REArtGS: 通过3D高斯散点与几何和运动约束进行姿态物体的重建与生成

Di Wu, Liu Liu, Zhou Linli, Anran Huang, Liangtu Song, Qiaojun Yu, Qi Wu, Cewu Lu

机构 * Hefei Institutes of Physical Science Chinese Academy of Sciences(合肥物理研究所中国科学院) University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学) Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

AI总结 REArtGS通过引入几何和运动约束的3D高斯散点方法,实现姿态物体的高保真表面重建与生成。

Comments 11pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00929 2025-11-24 cs.CV

Colo-ReID: Discriminative Representation Embedding with Meta-learning for Colonoscopic Polyp Re-Identification

Colo-ReID: 基于元学习的鉴别性表示嵌入用于结肠镜息肉重识别

Suncheng Xiang, Chengfeng Zhou, Zhengjie Zhang, Shilun Cai, Dahong Qian

机构 * School of Biomedical Engineering, Shanghai Jiao Tong University(生物医学工程学院,上海交通大学) Endoscopy Center, Zhongshan Hospital of Fudan University(复旦大学中山医院内窥镜中心)

AI总结 Colo-ReID通过元学习策略提升结肠镜息肉重识别性能,有效解决领域差距和自差异性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16546 2025-11-21 cs.CV

Progressive Supernet Training for Efficient Visual Autoregressive Modeling

渐进式超网络训练用于高效的视觉自回归建模

Xiaoyue Chen, Yuling Shi, Kaiyuan Li, Huandong Wang, Yong Li, Xiaodong Gu, Xinlei Chen, Mingbao Lin

机构 * Tsinghua University, China(清华大学) Shanghai Jiao Tong University, China(上海交通大学) Rakuten, Singapore(Rakuten)

AI总结 VARiant通过渐进式超网络训练实现高效视觉自回归建模,减少内存消耗并提升部署灵活性。

Comments Submitted to CVPR 2025. 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16378 2025-11-21 cs.CV

CAMS: Towards Compositional Zero-Shot Learning via Gated Cross-Attention and Multi-Space Disentanglement

CAMS:通过门控交叉注意力和多空间解耦实现组合零样本学习

Pan Yang, Cheng Deng, Jing Yang, Han Zhao, Yun Liu, Yuling Chen, Xiaoli Ruan, Yanping Chen

机构 * The State Key Laboratory of Public Big Data(公共大数据国家重点实验室) Shanghai Jiao Tong University(上海交通大学) Nankai University(南开大学)

AI总结 CAMS通过门控交叉注意力和多空间解耦技术,提升组合零样本学习在封闭和开放世界中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17534 2025-11-21 cs.CV cs.CL cs.MM

Co-Reinforcement Learning for Unified Multimodal Understanding and Generation

协同强化学习用于统一多模态理解和生成

Jingjing Jiang, Chongjie Si, Jun Luo, Hanwang Zhang, Chao Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出CoRL框架,通过协同强化学习提升多模态大语言模型在生成与理解任务上的性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07979 2025-11-21 cs.AI

Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models

对多步骤法律推理进行基准测试并分析思维链效应在大型语言模型中的表现

Wenhan Yu, Xinbo Lin, Lanxin Ni, Jinhua Cheng, Lei Sha

机构 * School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) KoGuan School of Law, Shanghai Jiao Tong University, Shanghai, China(上海交通大学KoGuan法学院) School of Criminal Law, China University of Political Science and Law, Beijing, China(中国政法大学刑事法律学院)

AI总结 本文提出MSLR数据集,用于评估大型语言模型在多步骤法律推理中的表现,并通过实验展示自主生成的思维链提示提升了推理质量。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23584 2025-11-21 cs.CV

VividFace: High-Quality and Efficient One-Step Diffusion For Video Face Enhancement

VividFace: 高质量和高效的一步扩散用于视频面部增强

Shulian Zhang, Yong Guo, Long Peng, Ziyang Wang, Ye Chen, Wenbo Li, Xiao Zhang, Yulun Zhang, Jian Chen

机构 * South China University of Technology(华南理工大学) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University of Science and Technology(南京理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 VividFace通过单步扩散框架和联合训练策略,高效提升视频面部增强的高质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13161 2025-11-21 cs.CV

Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning

通过结构化多视频协作推理增强视频大语言模型

Zhihao He, Tianyao He, Yun Xu, Tieyuan Chen, Huabin Liu, Chaofan Gan, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

AI总结 本文提出一种多视频协作框架,通过结构化视频表示和图融合模块提升视频大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12851 2025-11-21 cs.CL

ACEBench: Who Wins the Match Point in Tool Usage?

ACEBench: 工具使用场景中谁胜出?

Chen Chen, Xinlong Hao, Weiwen Liu, Xu Huang, Xingshan Zeng, Shuai Yu, Dexun Li, Shuai Wang, Weinan Gan, Yuefeng Huang, Wulong Liu, Xinzhi Wang, Defu Lian, Baoqun Yin, Yasheng Wang, Wu Liu

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 ACEBench是一个用于评估大型语言模型工具使用能力的综合基准测试,通过三种类型的数据评估场景,深入分析LLMs在不同情境下的工具使用表现。

详情

展开后加载摘要…

URL PDF HTML 收藏