arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3167
2603.27813 2026-03-31 cs.CV

MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences

MuSEAgent:一种具有状态化经验的多模态推理代理

Shijian Wang, Jiarui Jin, Runhao Fu, Zexuan Yan, Xingjian Wang, Mengkang Hu, Eric Wang, Xiaoxi Li, Kangning Zhang, Li Yao, Wenxiang Jiao, Xuelian Cheng, Yuan Lu, Zongyuan Ge

机构 * Southeast University(东南大学) Monash University(莫纳什大学) Xiaohongshu Inc.(小红书) Shanghai Jiao Tong University(上海交通大学) University of Hong Kong(香港大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学)

AI总结 MuSEAgent通过引入状态化经验学习范式,提升多模态推理代理的决策能力,其通过 hindsight reasoning 抽象交互数据为原子决策经验,并在推理时进行质量过滤的经验检索,实验表明其在细粒度视觉感知和复杂多模态推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27781 2026-03-31 cs.CV

GS3LAM: Gaussian Semantic Splatting SLAM

GS3LAM: 基于高斯语义散射的SLAM

Linfei Li, Lin Zhang, Zhong Wang, Ying Shen

机构 * School of Software Engineering, Tongji University(同济大学软件工程学院) Department of Automation, Shanghai Jiaotong University(上海交通大学自动化系)

AI总结 GS3LAM通过多模态数据融合实现实时一致的语义密集地图,采用语义高斯场和多模态误差约束联合优化,引入深度自适应尺度正则化和随机采样关键帧映射策略,提升跟踪鲁棒性和渲染质量。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24037 2026-03-31 cs.CV

A$^3$: Towards Advertising Aesthetic Assessment

A$^3$:迈向广告审美评估

Kaiyuan Ji, Yixuan Gao, Lu Sun, Yushuo Zheng, Zijian Chen, Jianbo Zhang, Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) School of Information and Electronic Engineering, East China Normal University(华东师范大学信息与电子工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

AI总结 本文提出A$^3$框架,通过理论驱动的A$^3$-Law、大规模标注数据集A$^3$-Dataset、多模态大语言模型A$^3$-Align及基准A$^3$-Bench,解决广告审美评估中主观性、缺乏标准等问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05551 2026-03-31 cs.CV

FastVMT: Eliminating Redundancy in Video Motion Transfer

FastVMT:消除视频运动迁移中的冗余

Yue Ma, Zhikai Wang, Tianhao Ren, Mingzhe Zheng, Hongyu Liu, Jiayi Guo, Kunyu Feng, Yuxuan Xue, Zixiang Zhao, Konrad Schindler, Qifeng Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) HKUST(香港科技大学) THU(清华大学) Meta ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出FastVMT,通过消除DiT架构中的运动和梯度冗余,实现视频运动迁移的加速,提升生成视频的效率而不影响视觉质量和时间一致性。

Comments Accepted by ICLR2026, Project page: fastvmt.gitHub.io, Code: https://github.com/mayuelala/FastVMT

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14959 2026-03-31 cs.CV

Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers

迈向视频帧插值的整体建模:具有自回归扩散变换器的局部扩散强制

Xinyu Peng, Han Li, Yuyang Huang, Ziyang Zheng, Yaoming Wang, Xin Chen, Wenrui Dai, Chenglin Li, Junni Zou, Hongkai Xiong

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

AI总结 本文提出LDF-VFI方法,通过自回归扩散变换器建模整个视频序列,结合跳连采样策略和稀疏注意力机制,提升视频帧插值的时序一致性和重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21643 2026-03-31 cs.CV

Omni-Weather: A Unified Multimodal Model for Weather Radar Understanding and Generation

Omni-Weather: 一种统一的多模态模型用于天气雷达理解和生成

Zhiwang Zhou, Yuandong Pu, Xuming He, Yidi Liu, Yixin Chen, Junchao Gong, Xiang Zhuang, Wanghan Xu, Qinglong Cao, Shixiang Tang, Yihao Liu, Wenlong Zhang, Lei Bai

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) UCLA(加州大学洛杉矶分校)

AI总结 Omni-Weather通过统一架构整合天气生成与理解,采用共享自注意力机制和因果推理数据集提升生成质量与可解释性,实验显示其在天气生成和理解上达到最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16727 2026-03-31 cs.CV cs.HC

OMG-Bench: A New Challenging Benchmark for Skeleton-based Online Micro Hand Gesture Recognition

OMG-Bench:一种新的挑战性基准,用于基于骨架的在线微手部手势识别

Haochen Chang, Pengfei Ren, Buyuan Zhang, Da Li, Tianhao Han, Haoyang Zhang, Liang Xie, Hongbo Chen, Erwei Yin

机构 * School of Systems Science and Engineering, Sun Yat-sen University(中山大学系统科学与工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Nankai University(南开大学) Defense Innovation Institute, Academy of Military Sciences(军事科学院国防创新研究院) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心)

AI总结 本文提出OMG-Bench,首个大规模公开基准,用于基于骨架的在线微手势识别,包含40个细粒度手势类别,提出HMATr框架提升识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01342 2026-03-31 cs.CV

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

InternVideo-Next:无需视频-文本监督的通用视频基础模型

Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shenzhen Institutes of Advanced Technology, China(中国科学院深圳先进技术研究院) Nanjing University(南京大学)

AI总结 本文提出InternVideo-Next,通过解耦传统编码器-解码器设计为Encoder-Predictor-Decoder框架,解决像素重建与语义冲突问题,构建语义一致且细节保留的潜在空间,提升视频基础模型的通用性。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22264 2026-03-31 cs.CV

DriveVGGT: Calibration-Constrained Visual Geometry Transformers for Multi-Camera Autonomous Driving

DriveVGGT: 用于多摄像头自动驾驶的校准约束视觉几何变换

Xiaosong Jia, Yanhao Liu, Yu Hong, Renqiu Xia, Junqi You, Bin Sun, Zhihui Hao, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究所) Li Auto Inc.(理想汽车)

AI总结 DriveVGGT通过引入时间视频注意模块、多摄像头一致性注意模块和分解的解码过程,整合稀疏空间重叠、校准几何约束和刚性外参恒定等先验知识,提升自动驾驶场景下的重建效率和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10102 2026-03-31 cs.LG

PANTHER: Generative Pretraining Beyond Language for Sequential User Behavior Modeling

PANTHER:超越语言的生成预训练用于序列用户行为建模

Guilin Li, Yun Zhang, Xiuyuan Chen, Chengqi Li, Bo Wang, Linghe Kong, Wenjia Wang, Weiran Huang, Matthias Hwai Yong Tan

机构 * Shanghai Jiao Tong University(上海交通大学) WeChat Pay, Tencent(微信支付,腾讯) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 PANTHER通过生成预训练方法,结合生成与判别模型,实现用户行为序列的高效建模,提升交易预测和欺诈检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08553 2026-03-31 cs.CV cs.AI cs.RO

Dream to Recall: Imagination-Guided Experience Retrieval for Memory-Persistent Vision-and-Language Navigation

梦想回溯:基于想象的体验检索用于记忆持久的视觉与语言导航

Yunzhe Xu, Yiyuan Pan, Zhe Liu

机构 * National Key Laboratory of Human Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(西安交通大学人机混合增强智能全国重点实验室) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

AI总结 本文提出Memoir,通过想象引导的检索机制提升记忆持久的视觉与语言导航性能,通过混合视角记忆和经验增强导航模型,在多个基准测试中实现了显著提升。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16952 2026-03-31 cs.CL cs.AI

AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation

AirQA:一个用于人工智能研究的综合性问答数据集,具有实例级评估

Tiancheng Huang, Ruisheng Cao, Yuxin Zhang, Zhangyi Kang, Zijian Wang, Chenrun Wang, Yijie Luo, Hang Zheng, Lirong Qian, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) Shanghai Innovation Institution(上海创新研究院) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Suzhou Laboratory(苏州实验室)

AI总结 本文提出AirQA数据集,包含13956篇AI论文和1246个问题,支持多任务、多模态和实例级评估,并提出ExTrActor框架提升小模型多轮工具使用能力。

Comments 29 page, 6 figures, 17 tables, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05207 2026-03-31 cs.CV

Follow-Your-Motion: Video Motion Transfer via Efficient Spatial-Temporal Decoupled Finetuning

跟随你的动作:通过高效的时空解耦微调实现视频动作迁移

Yue Ma, Yulong Liu, Qiyuan Zhu, Ayden Yang, Kunyu Feng, Xinhua Zhang, Zexuan Yan, Zhifeng Li, Sirui Han, Chenyang Qi, Qifeng Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Tsinghua University(清华大学) XIntelligence Technology Co., Limited(星云科技股份有限公司) SJTU(上海交通大学)

AI总结 本文提出Follow-Your-Motion框架,通过高效的时空解耦微调方法,解决视频扩散变换器在动作迁移中的不一致性和效率问题,并引入MotionBench基准进行验证。

Comments Accepted by ICLR 2026, project page: https://follow-your-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27666 2026-03-31 cs.CV

Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers

门控条件注入无需多模态注意:迈向可控的线性注意变换器

Yuhe Liu, Zhenxiong Tan, Yujia Hu, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出基于线性注意架构的可控扩散模型,解决现有方法在多类型条件输入灵活性和收敛速度上的不足,通过统一门控条件模块实现高效可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27650 2026-03-31 cs.CV

V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models

V-CAST:面向高效视频大语言模型的曲率感知时空剪枝

Xinying Lin, Xuyang Liu, Yiyu Wang, Teng Ma, Wenqi Ren

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shenzhen Loop Area Institute(深圳河套学院) Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室)

AI总结 本文提出V-CAST,一种无需训练的视频长上下文推理剪枝策略,通过曲率引导的时空分配模块和双锚点空间选择机制,提升视频大语言模型的效率与性能。

Comments Code: \url{https://github.com/xinyouu/V-CAST}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27460 2026-03-31 cs.CV cs.AI

Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development

Project Imaging-X:1000多个开放访问医学影像数据集的调查

Zhongying Deng, Cheng Tang, Ziyan Huang, Jiashi Lin, Ying Chen, Junzhi Ning, Chenglong Ma, Jiyao Liu, Wei Li, Yinghao Zhu, Shujian Gao, Yanyan Huang, Sibo Ju, Yanzhou Su, Pengcheng Chen, Wenhao Tang, Tianbin Li, Haoyu Wang, Yuanfeng Ji, Hui Sun, Shaobo Min, Liang Peng, Feilong Tang, Haochen Xue, Rulin Zhou, Chaoyang Zhang, Wenjie Li, Shaohao Rui, Weijie Ma, Xingyue Zhao, Yibin Wang, Kun Yuan, Zhaohui Lu, Shujun Wang, Jinjie Wei, Lihao Liu, Dingkang Yang, Lin Wang, Yulong Li, Haolin Yang, Yiqing Shen, Lequan Yu, Xiaowei Hu, Yun Gu, Yicheng Wu, Benyou Wang, Minghui Zhang, Angelica I. Aviles-Rivero, Qi Gao, Hongming Shan, Xiaoyu Ren, Fang Yan, Hongyu Zhou, Haodong Duan, Maosong Cao, Shanshan Wang, Bin Fu, Xiaomeng Li, Zhi Hou, Chunfeng Song, Lei Bai, Yuan Cheng, Yuandong Pu, Xiang Li, Wenhai Wang, Hao Chen, Jiaxin Zhuang, Songyang Zhang, Huiguang He, Mengzhang Li, Bohan Zhuang, Zhian Bai, Rongshan Yu, Liansheng Wang, Yukun Zhou, Xiaosong Wang, Xin Guo, Guanbin Li, Xiangru Lin, Dakai Jin, Mianxin Liu, Wenlong Zhang, Qi Qin, Conghui He, Yuqiang Li, Ye Luo, Nanqing Dong, Jie Xu, Wenqi Shao, Bo Zhang, Qiujuan Yan, Yihao Liu, Jun Ma, Zhi Lu, Yuewen Cao, Zongwei Zhou, Jianming Liang, Shixiang Tang, Qi Duan, Dongzhan Zhou, Chen Jiang, Yuyin Zhou, Yanwu Xu, Jiancheng Yang, Shaoting Zhang, Xiaohong Liu, Siqi Luo, Yi Xin, Chaoyu Liu, Haochen Wen, Xin Chen, Alejandro Lozano, Min Woo Sun, Yuhui Zhang, Yue Yao, Xiaoxiao Sun, Serena Yeung-Levy, Xia Li, Jing Ke, Chunhui Zhang, Zongyuan Ge, Ming Hu, Jin Ye, Zhifeng Li, Yirong Chen, Yu Qiao, Junjun He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Institute of Optics and Fine Mechanics(上海光学精密机械研究所) Fudan University(复旦大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Fuzhou University(福州大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Incept Labs Monash University(莫纳什大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Alibaba DAMO Academy(阿里巴巴达摩院) The Hong Kong Polytechnic University(香港理工大学) South China University of Technology(华南理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与产业研究院) Shanghai Academy of Artificial Intelligence for Science(上海科学智能研究院) Nankai University(南开大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) School of Informatics, Xiamen University(厦门大学信息学院) University College London(伦敦大学学院) Sun Yat-sen University(中山大学) Alibaba Group, DAMO Academy, New York, NY, USA(阿里巴巴集团达摩院(纽约)) Tongji University(同济大学) University of Toronto(多伦多大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Johns Hopkins University(约翰霍普金斯大学) Arizona State University(亚利桑那州立大学) Academy for Clinical Innovation and Translation of Shanghai(上海临床创新转化研究院) University of California, Santa Cruz(加州大学圣克鲁兹分校) ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(阿尔托大学) Shandong University(山东大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文调查了1000多个开放访问医学影像数据集,揭示了其规模小、任务碎片化和分布不均的问题,并提出元数据驱动融合方法和交互发现门户,为医学影像数据集的整合和基础模型发展提供路线图。

Comments 157 pages, 19 figures, 26 tables. Project repo: \url{https://github.com/uni-medical/Project-Imaging-X}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27375 2026-03-31 cs.CV

Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models

弥合可验证奖励下的视觉表征与强化学习在大视觉-语言模型中的应用

Yuhang Han, Yuyang Wu, Zhengbo Jiao, Yiyu Wang, Xuyang Liu, Shaobo Wang, Hanlin Xu, Xuming Hu, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) Huawei(华为) HKUST (GZ)(香港科技大学(广州))

AI总结 本文提出KAWHI机制,通过整合结构化视觉信息提升大视觉-语言模型的多模态推理性能,改进现有统一奖励优化方法。

Comments Homepage: \url{https://kawhiiiileo.github.io/KAWHI_PAGE/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27303 2026-03-31 cs.AI cs.CL q-bio.QM

Self-evolving AI agents for protein discovery and directed evolution

具有自我进化的AI代理用于蛋白质发现和定向进化

Yang Tan, Lingrong Zhang, Mingchen Li, Yuanxi Yu, Bozitao Zhong, Bingxin Zhou, Nanqing Dong, Liang Hong

机构 * Shanghai Innovation Institute(上海创新研究院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Zhangjiang Institute for Advanced Study, Shanghai Jiao Tong University(上海交通大学张江高等研究院)

AI总结 本文提出VenusFactory2框架,通过自我进化的多代理基础设施实现动态工作流合成,解决蛋白质发现中的手动信息协调问题,并在基准测试中超越现有代理。

Comments 100 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27181 2026-03-31 cs.RO cs.AI

An End-to-end Flight Control Network for High-speed UAV Obstacle Avoidance based on Event-Depth Fusion

面向高速无人机障碍避让的端到端飞行控制系统:基于事件深度融合

Dikai Shang, Jingyue Zhao, Shi Xu, Nanyang Ye, Lei Wang

机构 * Shanghai jiaotong University(上海交通大学) Defense Innovation Institute, AMS(军事科学院国防科技创新研究院)

AI总结 本文提出端到端飞行控制网络,通过双向交叉注意力模块融合深度图像和事件数据,利用模仿学习训练,结合球面主搜索算法设计高效专家规划器,在高速环境下实现更可靠的障碍避让。

Comments 7 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27164 2026-03-31 cs.AI cs.CL

daVinci-LLM:Towards the Science of Pretraining

daVinci-LLM:迈向预训练的科学

Yiwei Qin, Yixiu Liu, Tiantian Mi, Muhang Xie, Zhen Huang, Weiye Si, Pengrui Lu, Siyuan Feng, Xia Wu, Liming Liu, Ye Luo, Jinlong Hou, Qipeng Guo, Yu Qiao, Pengfei Liu

机构 * SII SJTU(上海交通大学) GAIR

AI总结 本文提出daVinci-LLM,通过结合工业级资源与科研自由,探索预训练的科学方法。采用开放范式,通过数据达尔文主义框架和两阶段适应课程,训练3B参数模型,验证处理深度对能力的影响及不同领域饱和动态的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14498 2026-03-31 cs.RO cs.CV

R3DP: Real-Time 3D-Aware Policy for Embodied Manipulation

R3DP:实时3D感知策略用于具身操作

Yuhao Zhang, Wanxi Dong, Yue Shi, Yi Liang, Jingnan Gao, Qiaochu Yang, Yaxing Lyu, Zhixuan Liang, Yibin Liu, Congsheng Xu, Xianda Guo, Wei Sui, Yaohui Jin, Xiaokang Yang, Yanyan Xu, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) D-Robotics(地平线机器人) Southern University of Science and Technology(南方科技大学) Xspark AI(星火科技) The University of Hong Kong(香港大学) Wuhan University(武汉大学) Xiamen University Malaysia(厦门大学马来西亚分校) Northeastern University(东北大学)

AI总结 R3DP通过异步快慢协作模块整合大尺度3D先验知识,提升实时操作性能,实验显示在成功率和推理时间上均优于现有方法。

Comments Project Page: https://dazazh.github.io/r3dp-project-page/ Github Repo: https://github.com/dazazh/R3DP

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08602 2026-03-31 cs.RO

Mimic Intent, Not Just Trajectories

模仿意图,而非仅仅轨迹

Renming Huang, Chendong Zeng, Wenjing Tang, Jintian Cai, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出MINT方法,通过多尺度频域标记解耦行为意图与执行细节,提升模仿学习的适应性和迁移能力,实验显示其在任务基准和真实机器人上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03596 2026-03-31 cs.CV

Adaptive Attention Distillation for Robust Few-Shot Segmentation under Environmental Perturbations

适应性注意力蒸馏用于环境扰动下的鲁棒少样本分割

Qianyu Guo, Jingrong Wu, Jieji Ren, Weifeng Ge, Wenqiang Zhang

机构 * Shanghai Institute of Virology, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院上海市病毒研究所) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械与动力工程学院) Shanghai Key Lab of Intelligent Information Processing, School of Computer Science, Fudan University(复旦大学计算机科学技术学院上海市智能信息处理重点实验室) Engineering Research Center of AI & Robotics, Ministry of Education, Academy for Engineering & Technology, Fudan University(复旦大学工程与应用技术研究院教育部人工智能与机器人工程研究中心)

AI总结 本文提出适应性注意力蒸馏方法,通过对比和蒸馏已知与未知图像间的共享语义,提升模型在复杂环境下的鲁棒性,实验显示在多个数据集上mIoU提升3.3%-8.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10465 2026-03-31 cs.CL cs.AI

Beyond Elicitation: Provision-based Prompt Optimization for Knowledge-Intensive Tasks

超越启发:基于供应的提示优化用于知识密集型任务

Yunzhe Xu, Zhuosheng Zhang, Zhe Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室)

AI总结 本文提出KPPO框架,通过系统整合知识而非潜在启发来优化提示,解决知识密集型任务中静态知识容量的局限,提升性能并降低token消耗。

Comments Accepted by IEEE Transactions on Audio, Speech and Language Processing (TASLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14015 2026-03-31 cs.CV

Prompting Depth Anything for 4K Resolution Accurate Metric Depth Estimation

通过提示深度任何事实现4K分辨率的准确度量深度估计

Haotong Lin, Sida Peng, Jingxiao Chen, Songyou Peng, Jiaming Sun, Minghuan Liu, Hujun Bao, Jiashi Feng, Xiaowei Zhou, Bingyi Kang

机构 * Zhejiang University(浙江大学) ByteDance Seed(字节跳动Seed) Shanghai Jiao Tong University(上海交通大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出Prompt Depth Anything,利用低成本LiDAR作为提示,通过多尺度融合设计实现4K分辨率的度量深度估计,并在ARKitScenes和ScanNet++数据集上取得新突破。

Comments CVPR 2025; Project page: https://PromptDA.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26745 2026-03-31 cs.CV

Motion Semantics Guided Normalizing Flow for Privacy-Preserving Video Anomaly Detection

基于运动语义的归一化流用于隐私保护视频异常检测

Yang Liu, Boan Chen, Yuanyuan Meng, Jing Liu, Zhengliang Guo, Wei Zhou, Peng Sun, Hong Chen

机构 * Tongji Univ.(同济大学) SJTU(上海交通大学) Shanghai Creative Studies Institute(上海创意研究院) UBC(不列颠哥伦比亚大学) Fudan Univ.(复旦大学) Cardiff Univ.(卡迪夫大学) DKU(杜克昆山大学)

AI总结 本文提出MSG-Flow方法,通过分解骨架基视频异常检测任务,利用向量量化变分自编码器、自回归Transformer和条件归一化流,提升多层级运动语义建模能力,实现88.1%和75.8%的AUC性能。

Comments Accepted to IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26192 2026-03-30 cs.CV

HAD: Heterogeneity-Aware Distillation for Lifelong Heterogeneous Learning

HAD:面向终身异质学习的异质性感知知识蒸馏

Xuerui Zhang, Xuehao Wang, Zhan Zhuang, Linglan Zhao, Ziyue Li, Xinmin Zhang, Zhihuan Song, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) Zhejiang University(浙江大学) Technical University of Munich(慕尼黑工业大学) City University of Hong Kong(香港城市大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出HAD方法,用于解决终身异质学习中异质知识保留问题,通过两种互补损失函数提升预测分布平衡性和信息边缘像素学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26164 2026-03-30 cs.LG cs.CL

DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models

DataFlex: 一种统一的以数据为中心的大型语言模型动态训练框架

Hao Liang, Zhengyang Zhao, Meiyi Qiang, Mingrui Chen, Lu Ma, Rongyi Yu, Hengyi Feng, Shixuan Sun, Zimo Meng, Xiaochen Ma, Xuanlin Yang, Qifeng Cai, Ruichuan An, Bohan Zeng, Zhen Hao Wong, Chengyu Shen, Runming He, Zhaoyang Han, Yaowei Zheng, Fangcheng Fu, Conghui He, Bin Cui, Zhiyu Li, Weinan E, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) OriginHub Technology LLaMA-Factory Team(LLaMA-Factory团队) Zhongguancun Academy(中关村学院) OpenDataLab, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室OpenDataLab) Shanghai Jiao Tong University(上海交通大学)

AI总结 DataFlex 提供了一种统一的以数据为中心的动态训练框架,支持样本选择、领域混合调整和样本再加权,提升了大型语言模型的训练效率和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25377 2026-03-30 cs.SD

Joint Learning Global-Local Speaker Classification to Enhance End-to-End Speaker Diarization and Recognition

联合学习全局-局部说话人分类以增强端到端说话人辨识与识别

Yuhang Dai, Haopeng Lin, Jiale Qian, Ruiqi Yan, Hao Meng, Hanke Xie, Hanlin Wen, Shunshun Yin, Ming Tao, Xie Chen, Lei Xie, Xinsheng Wang

机构 * Soul AI Lab, China(中国Soul AI实验室) X-LANCE Lab, Shanghai Jiao Tong University, China(中国上海交通大学X-LANCE实验室)

AI总结 本文提出GLSC-SDR方法,通过联合训练说话人分类与辨识识别,提升细粒度说话人区分能力,实验表明其在多个数据集上表现优异,无需依赖大规模真实对话数据。

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11647 2026-03-30 cs.CV

IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment

IVEBench:现代指令引导视频编辑评估基准套件

Yinan Chen, Jiangning Zhang, Teng Hu, Yuxiang Zeng, Zhucun Xue, Qingdong He, Chengjie Wang, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学) University of Auckland(奥克兰大学) National University of Singapore(新加坡国立大学)

AI总结 IVEBench通过引入多样化的视频数据库和多维评估协议,解决现有视频编辑基准在评估指令引导视频编辑方面的不足,提供全面的人类对齐评估结果。

Comments Accepted by ICLR 2026. Equal contributions from first two authors. Project page: https://ryanchenyn.github.io/projects/IVEBench Code: https://github.com/RyanChenYN/IVEBench Dataset: https://huggingface.co/datasets/Coraxor/IVEBench

详情

展开后加载摘要…

URL PDF HTML 收藏