arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3172
2603.03739 2026-03-05 cs.CV cs.AI

PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation

PROSPECT:通过语义-空间融合和潜在预测表示实现统一的流式视觉-语言导航

Zehua Fan, Wenqi Lyu, Wenxuan Song, Linge Zhao, Yifei Yang, Xi Wang, Junjie He, Lida Huang, Haiyan Liu, Bingchuan Sun, Guangjun Bao, Xuanyao Mao, Liang Xu, Yan Wang, Feng Gao

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Jiaotong University(北京交通大学) AIR Wuxi Innovation Center, Tsinghua University(清华大学无锡创新中心) Lenovo(联想集团)

AI总结 PROSPECT通过语义-空间融合和潜在预测表示,实现统一的流式视觉-语言导航,提升环境动态和空间结构的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03677 2026-03-05 cs.CL cs.AI

MIND: Unified Inquiry and Diagnosis RL with Criteria Grounded Clinical Supports for Psychiatric Consultation

MIND: 一种基于临床标准的统一探究与诊断强化学习框架用于精神病咨询

Guoyi Li, Shihao Xu, Jiatong Ma, Yunyun Han, Jianhua Chen, Yafeng Deng

机构 * EverMind AI Inc.(EverMind AI公司) EverMind AI Inc., Tianqiao and Chrissy Chen Institute(EverMind AI公司、田桥与克里斯西·陈研究所) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心、上海交通大学医学院)

AI总结 MIND通过基于临床标准的推理框架提升精神病咨询的诊断准确性和互动质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24065 2026-03-05 cs.CV

EvalMVX: A Unified Benchmarking for Neural 3D Reconstruction under Diverse Multiview Setups

EvalMVX: 一种用于神经3D重建的统一基准测试,适用于多样化的多视角设置

Zaiyan Yang, Jieji Ren, Xiangyi Wang, zonglin li, Xu Cao, Heng Guo, Zhanyu Ma, Boxin Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院) Xiong’an Aerospace Information Research Institute(雄安航空航天信息研究所) State Key Laboratory of Multimedia Information Processing, School of Computer Science Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)

AI总结 EvalMVX是一个包含25个物体的真实世界数据集,用于评估神经3D重建方法在不同多视角设置下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18707 2026-03-05 cs.RO

CLASH: Collision Learning via Augmented Sim-to-real Hybridization to Bridge the Reality Gap

CLASH:通过增强的仿真到现实混合化进行碰撞学习以弥合现实差距

Haotian He, Ning Guo, Siqi Shi, Qipeng Liu, Wenzhao Lian

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Mathematical Sciences, Beijing Normal University(北京师范大学数学科学学院)

AI总结 CLASH通过增强的仿真到现实混合化方法,有效提升碰撞预测精度并减少仿真计算时间,增强机器人策略在现实中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22235 2026-03-05 cs.AI

Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation

通过执行反馈强化学习训练高阶调度器以实现长周期GUI自动化

Zehao Deng, Tianjie Ju, Zheng Wu, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 本文提出CES多代理框架,通过训练高阶调度器解决GUI代理在长周期任务中的责任耦合和状态管理问题,提升任务规划与执行效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19524 2026-03-05 cs.CV cs.MA

VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning

VideoChat-M1: 通过多智能体强化学习实现视频理解的协作策略规划

Boyu Chen, Zikang Wang, Zhengrong Yue, Kainan Yan, Chenyun Yu, Yi Huang, Zijun Liu, Yafei Wen, Xiaoxin Chen, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition(深圳计算机视觉与模式识别重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) VIVO AI Lab(VIVO人工智能实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen Campus of Sun Yat-sen University(孙逸仙大学深圳校区) Shanghai Jiao Tong University(上海交通大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系,人工智能研究院)

AI总结 VideoChat-M1通过多智能体强化学习实现视频理解的协作策略规划,显著提升复杂视频任务的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05091 2026-03-05 cs.CV

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

事实性至关重要:当图像生成与编辑遇见结构化视觉

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Beihang University(北京航空航天大学) Krea AI(Krea人工智能) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Hugging Face National University of Singapore(新加坡国立大学) ByteDance(字节跳动) The University of Hong Kong(香港大学)

AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。

Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02071 2026-03-05 cs.RO

A Geometric Method for Base Parameter Analysis in Robot Inertia Identification Based on Projective Geometric Algebra

基于投影几何代数的机器人惯性参数分析几何方法

Guangzhen Sun, Ye Ding, Xiangyang Zhu

机构 * The State Key Laboratory of Mechanical System and Vibration, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(机械系统与振动国家重点实验室,机械工程学院,上海交通大学,上海200240,中国)

AI总结 本文提出了一种基于投影几何代数的几何方法,用于高效准确地识别机器人系统的基体惯性参数。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02751 2026-03-05 cs.CV

Partial Weakly-Supervised Oriented Object Detection

部分弱监督定向物体检测

Mingxin Liu, Peiyuan Zhang, Yuan Liu, Wei Zhang, Yue Zhou, Ning Liao, Ziyang Gong, Junwei Luo, Zhirui Wang, Yi Yu, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) East China Normal University(华东师范大学) Aerospace Information Research Institute(航天信息研究所) Southeast University(东南大学)

AI总结 本文提出PWOOD框架,通过部分弱标注高效利用未标注数据,提升定向物体检测性能,降低标注成本。

Comments 10 pages, 5 figures, 4 tables, source code: https://github.com/VisionXLab/PWOOD

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10118 2026-03-05 cs.CV cs.CL

Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering

为何1+1<1在视觉令牌修剪中:通过多目标平衡覆盖超越简单整合

Yangfu Li, Hongjian Zhan, Tianyi Chen, Qi Liu, Yue Lu

机构 * East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学) Chongqing Institute of East China Normal University(华东师范大学重庆研究院) Shanghai University of Engineering Science(上海工程技术大学)

AI总结 MoB通过多目标平衡覆盖方法,解决视觉令牌修剪中提示对齐与视觉保留的权衡问题,实现高效且高性能的修剪效果。

Comments 31 pages,9 figures,conference

Journal ref Advances in Neural Information Processing Systems 39 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09879 2026-03-05 cs.CV

TextMaster: A Unified Framework for Realistic Text Editing via Glyph-Style Dual-Control

TextMaster: 一种通过字形-风格双控实现真实文本编辑的统一框架

Zhenyu Yan, Jian Wang, Aoqiang Wang, Yuhan Li, Wenxiang Shang, Ran Lin

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Shanghai Jiao Tong University(上海交通大学)

AI总结 TextMaster通过字形-风格双控机制,实现了高精度、可控的文本编辑,适用于多种场景和图像区域,提升了文本布局的准确性和风格的可控性。

Comments Accepted to ICCV 2025

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 16112-16121

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03241 2026-03-04 cs.CV cs.AI

UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?

UniG2U-Bench: 统一模型是否能提升多模态理解?

Zimo Wen, Boxiu Li, Wanbo Zhang, Junxiang Lei, Xiaoyu Chen, Yijia Fan, Qi Zhang, Yujiang Wang, Lili Qiu, Bo Li, Ziwei Liu, Caihua Shan, Yifan Yang, Yifei Shen

机构 * Microsoft Research Asia(微软亚洲研究院) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) University of Oxford(牛津大学)

AI总结 UniG2U-Bench通过系统评估生成到理解的任务,揭示统一模型在多模态理解中的局限性和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03198 2026-03-04 cs.RO cs.CL cs.CV

ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments

ACE-Brain-0:空间智能作为通用具身化体系的共享框架

Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen Luo, Haolan Kang, Shuang Luo, Yue Zhou, Yong Luo, Li Shen, Xiaosong Jia, Yao Mu, Xue Yang, Chunxiao Liu, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of Science(科学技术大学) Fudan University(复旦大学) Xiamen University(厦门大学) East China Normal University(华东师范大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学)

AI总结 ACE-Brain-0 通过空间智能作为共享框架,统一了自动驾驶、机器人和 UAVs 的具身化任务,采用 SSR 范式和 GRPO 方法实现跨领域泛化和领域精通的平衡。

Comments Code: https://github.com/ACE-BRAIN-Team/ACE-Brain-0 Hugging Face: https://huggingface.co/ACE-Brain/ACE-Brain-0-8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03112 2026-03-04 cs.LG cs.AI nlin.CD

From Complex Dynamics to DynFormer: Rethinking Transformers for PDEs

从复杂动力学走向 DynFormer:重新思考用于偏微分方程的 Transformer

Pengyu Lai, Yixiao Chen, Dewu Yang, Rui Wang, Feng Wang, Hui Xu

机构 * School of Aeronautics and Astronautics, Shanghai Jiao Tong University(航空宇航学院,上海交通大学)

AI总结 DynFormer 通过引入谱嵌入和局部-全局混合模块,重新设计 Transformer 架构以高效处理 PDEs 的多尺度特性,实现高精度与低内存消耗的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08646 2026-03-04 cs.LG cs.AI cs.CL stat.ML

Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy

通过推理时间激活能量缓解对齐大语言模型中的过度拒绝

Eric Hanchen Jiang, Weixuan Ou, Run Liu, Shengyuan Pang, Guancheng Wan, Ranjie Duan, Wei Dong, Kai-Wei Chang, XiaoFeng Wang, Ying Nian Wu, Xinfeng Li

机构 * UCLA(加州大学洛杉矶分校) Alibaba Cloud Computing(阿里云计算) SJTU(上海交通大学) Alibaba Group(阿里巴巴集团) NTU(国立科技大学)

AI总结 通过能量景观引导框架,提升大语言模型的安全性并减少虚假拒绝,实验显示在ORB-H基准上合规性显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04949 2026-03-04 cs.IR cs.AI

Leverage Knowledge Graph and Large Language Model for Law Article Recommendation: A Case Study of Chinese Criminal Law

利用知识图谱和大语言模型进行法律文书推荐:中国刑法案例研究

Yongming Chen, Miner Chen, Ye Zhu, Juan Pei, Siyu Chen, Yu Zhou, Yi Wang, Yifan Zhou, Hao Li, Songan Zhang

机构 * Global Institute of Future Technology, Shanghai Jiao Tong University(未来技术全球研究院,上海交通大学) Donghua University(东华大学)

AI总结 本文提出结合知识图谱和大语言模型的法律文书推荐方法,通过构建案例增强的知识图谱和闭环框架,提升了推荐准确性,优于现有基线方法。

Comments Paper has been accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02576 2026-03-04 cs.LG

Wasserstein Proximal Policy Gradient

基于Wasserstein几何的近端策略梯度方法

Zhaoyu Zhu, Shuhan Zhang, Rui Gao, Shuang Li

机构 * Zhiyuan College, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学紫阳学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen, Guangdong, China(香港中文大学(深圳)数据科学学院) McCombs School of Business, The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校麦克拉姆商学院)

AI总结 WPPG通过Wasserstein几何视角提出一种无需计算策略对数密度或梯度的策略梯度方法,实现连续动作空间下的高效强化学习

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02547 2026-03-04 cs.CL cs.AI cs.LG

CoDAR: Continuous Diffusion Language Models are More Powerful Than You Think

CoDAR:连续扩散语言模型比你想象的更强大

Junzhe Shen, Jieru Zhao, Ziwei He, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) School of Computer Science(计算机科学学院) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 CoDAR通过改进的连续扩散模型和上下文自回归解码器,在生成质量上超越了潜在扩散,并与强离散DLMs相竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02236 2026-03-04 cs.LG cs.AI

CUDABench: Benchmarking LLMs for Text-to-CUDA Generation

CUDABench: 评估用于文本到CUDA生成的LLM

Jiace Zhu, Wentao Chen, Qi Fan, Zhixing Ren, Junying Wu, Xing Zhe Chai, Chotiwit Rungrueangwutthinon, Yehan Ma, An Zou

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 CUDABench是一个评估LLM文本到CUDA生成能力的基准测试,通过编译正确性、功能一致性和性能指标评估LLM在生成GPU程序中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00624 2026-03-04 cs.LG cs.AI cs.CV

IDER: IDempotent Experience Replay for Reliable Continual Learning

IDER:惰性经验重放用于可靠的持续学习

Zhanwang Liu, Yuting Li, Haoyuan Gao, Yexin Li, Linghe Kong, Lichao Sun, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) Lehigh University(莱斯大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) MIFA Lab(MIFA实验室)

AI总结 IDER通过惰性性质提出新的经验重放方法,提升持续学习的可靠性与准确性,减少遗忘问题。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03215 2026-03-04 cs.CL cs.LG

Cache-to-Cache: Direct Semantic Communication Between Large Language Models

缓存到缓存:大型语言模型之间的直接语义通信

Tianyu Fu, Zihan Min, Hanling Zhang, Jichao Yan, Guohao Dai, Wanli Ouyang, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence AI The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) SLAI Shanghai AI Laboratory(上海人工智能实验室)

AI总结 缓存到缓存通过直接语义通信提升大型语言模型的性能和效率,实现比文本通信更高的准确率和更低的延迟。

Comments Published in ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13909 2026-03-04 cs.AI cs.CL cs.LG

Efficient Agent Training for Computer Use

高效计算机使用代理的训练

Yanheng He, Jiahe Jin, Pengfei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) SII GAIR

AI总结 本文提出PC Agent-E,通过结合人类标注数据与Claude 3.7 Sonnet生成的数据,实现了计算机使用代理的高效训练,取得显著性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00061 2026-03-04 math.OC cs.LG

A Global Optimization Algorithm for K-Center Clustering of One Billion Samples

针对十亿样本的K中心聚类的全局优化算法

Jiayang Ren, Ningning You, Kaixun Hua, Chaojie Ji, Yankai Cao

机构 * Department of Chemical and Biological Engineering, University of British Columbia(英国不列颠哥伦比亚大学化学与生物工程系) Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学Antai经济管理学院) Department of Mathematics, University of British Columbia(英国不列颠哥伦比亚大学数学系)

AI总结 本文提出一种针对十亿样本K中心聚类问题的全局优化算法,通过缩减空间分支限界和并行化技术,实现高效求解并提升全局最优解的精度。

Comments 34 pages, 6 figures, and 5 tables. This paper is accepted by Managment Science. The final published version of this article is available at: https://pubsonline.informs.org/doi/10.1287/mnsc.2023.00218

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02130 2026-03-03 cs.CV

Stereo-Inertial Poser: Towards Metric-Accurate Shape-Aware Motion Capture Using Sparse IMUs and a Single Stereo Camera

立体视觉惯性定位器:利用稀疏IMUs和单个立体摄像头实现精确的形状感知运动捕捉

Tutian Tang, Xingyu Ji, Yutong Li, MingHao Liu, Wenqiang Xu, Cewu Lu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meta Robotics Institute, SJTU(SJTU机器人研究院) Shanghai Innovation Institute(上海创新研究院)

AI总结 立体视觉惯性定位器利用单个立体摄像头和六个IMUs,通过校准基线几何解决深度模糊问题,实现精确且形状感知的3D人体运动捕捉。

Comments The code, data, and supplementary materials are available at \url{https://sites.google.com/view/stereo-inertial-poser}. Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02079 2026-03-03 cs.CV

MMNavAgent: Multi-Magnification WSI Navigation Agent for Clinically Consistent Whole-Slide Analysis

MMNavAgent: 多倍率WSI导航代理用于临床一致的全滑片分析

Zhengyang Xu, Han Li, Jingsong Liu, Linrui Xie, Xun Ma, Xin You, Shihui Zu, Ayako Ito, Xinyu Hao, Hongming Xu, Shaohua Kevin Zhou, Nassir Navab, Peter J. Schüffler

机构 * Institute of Pathology, Technical University of Munich, Germany(慕尼黑技术大学病理研究所) Munich Data Science Institute (MDSI), Munich, Germany(慕尼黑数据科学研究所) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心) Computer Aided Medical Procedures (CAMP), TU Munich, Munich, Germany(计算机辅助医疗程序(CAMP),慕尼黑技术大学) Dalian University of Technology(大连理工大学) Cancer Hospital of Dalian University of Technology, Shenyang(大连理工大学肿瘤医院) Department of Human Pathology, Juntendo University Graduate School of Medicine(立命大学医学研究生院人类病理部门) University of Science and Technology of China(中国科学技术大学) Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所) Northwest University of China(中国西北大学)

AI总结 MMNavAgent通过多倍率交互建模和自适应倍率选择,提升全滑片图像诊断性能,实验显示AUC和BACC均有所提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01913 2026-03-03 cs.CV

Zero-shot Low-Field MRI Enhancement via Diffusion-Based Adaptive Contrast Transport

零场MRI增强通过扩散基于自适应对比传输

Muyu Liu, Chenhe Du, Xuanyu Tian, Qing Wu, Xiao Wang, Haonan Zhang, Hongjiang Wei, Yuyao Zhang

机构 * School of Information Science and Technology, ShanghaiTech University, Shanghai, China(信息科学与技术学院,上海科技大学) School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China(生物医学工程学院,上海交通大学)

AI总结 本文提出DACT框架,通过扩散模型和自适应对比传输技术,在无配对监督的情况下实现低场MRI到高场MRI的高质量图像重建,提升组织对比和结构细节。

Comments 11 pages, 4 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01890 2026-03-03 cs.CV

Resolving Blind Inverse Problems under Dynamic Range Compression via Structured Forward Operator Modeling

通过结构化前向算子建模解决动态范围压缩下的盲逆问题

Muyu Liu, Xuanyu Tian, Chenhe Du, Qing Wu, Hongjiang Wei, Yuyao Zhang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出CaMB-Diff,通过结构化前向算子建模解决动态范围压缩下的盲逆问题,提升信号保真度和物理一致性。

Comments 16 pages, 10 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23697 2026-03-03 cs.CV

Towards Source-Aware Object Swapping with Initial Noise Perturbation

面向源感知的对象交换的初始噪声扰动

Jiahui Zhan, Xianbing Sun, Xiangnan Zhu, Yikun Ji, Ruitong Liu, Liqing Zhang, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 SourceSwap通过初始噪声扰动实现自监督对象交换,无需额外数据即可实现高质量跨对象对齐和零样本推理。

Comments This paper is accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01813 2026-03-03 cs.RO

SSMG-Nav: Enhancing Lifelong Object Navigation with Semantic Skeleton Memory Graph

SSMG-Nav: 通过语义骨架记忆图增强终身物体导航

Haochen Niu, Lantao Zhang, Xingwu Ji, Rendong Ying, Peilin Liu, Fei Wen

机构 * Brain-Inspired Application Technology Center (BATC), Shanghai Jiao Tong University(脑启发应用技术中心(BATC),上海交通大学)

AI总结 SSMG-Nav通过语义骨架记忆图提升终身物体导航,整合多模态信息与持久记忆,优化路径效率与任务成功率。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01698 2026-03-03 cs.CV cs.AI

Towards Principled Dataset Distillation: A Spectral Distribution Perspective

迈向原则化的数据集蒸馏:从谱分布视角

Ruixi Wu, Shaobo Wang, Jiahuan Chen, Zhiyuan Liu, Yicun Yang, Zhaorun Chen, Zekai Li, Kaixin Li, Xinming Wang, Hongzhu Yi, Kai Wang, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) UChicago(芝加哥大学) NUS(新加坡国立大学) CASIA(中国科学院自动化研究所) UCAS(中国科学院自动化研究所)

AI总结 本文提出CSDM方法,通过谱分布匹配解决长尾数据集中的分布对齐问题,实现性能提升并增强稳定性。

Comments 30 pages, 5 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏