arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3172
2603.17693 2026-03-19 cs.CV

Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos

通过合成视频学习可迁移的时间原语以实现视频推理

Songtao Jiang, Sibo Song, Chenyi Zhou, Yuan Wang, Ruizhe Chen, Tongkun Guan, Ruilin Luo, Yan Zhang, Zhihang Tang, Yuchong Sun, Hang Zhang, Zhibo Yang, Shuai Bai, Junyang Lin, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 本文提出SynRL框架,通过合成视频训练模型的时间原语,提升视频推理能力,在15个基准测试中取得显著成效,合成数据在复杂场景中表现优于真实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24910 2026-03-19 cs.CV

Learning Goal-Oriented Vision-and-Language Navigation with Self-Improving Demonstrations at Scale

基于大规模自改进演示的目标导向视觉-语言导航学习

Songze Li, Zun Wang, Gengze Zhou, Jialu Li, Xiangyu Zeng, Ziyang Gong, Limin Wang, Yu Qiao, Qi Wu, Mohit Bansal, Yi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Fudan University(复旦大学) The University of Adelaide(阿德莱德大学) Nanjing University(南京大学) Shanghai Jiaotong University(上海交通大学)

AI总结 本文提出SID方法,通过自改进演示提升导航能力,实现高效探索和泛化,显著提升导航性能,达到新状态的SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17541 2026-03-19 cs.CV

Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models

时间收益,空间代价:重新审视多模态大语言模型中的视频微调

Linghao Zhang, Jungang Li, Yonghua Hei, Sicheng Tao, Song Dai, Yibo Yan, Zihao Dongfang, Weiting Liu, Chenxi Qin, Hanqian Li, Xin Zou, Jiahao Zhang, Shuhang Xun, Haiyun Jiang, Xuming Hu

机构 * SJTU(上海交通大学) HKUST(GZ)(香港科技大学(珠海)) HKUST(香港科技大学) CityU(城市大学) FDU(复旦大学) HIT(哈尔滨工业大学) TJU(天津大学)

AI总结 本文研究了视频微调对多模态大语言模型视觉能力的影响,发现视频性能提升的同时,静态图像表现可能受限,提出混合帧策略以缓解空间与时间理解的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17408 2026-03-19 cs.CV cs.AI

Joint Degradation-Aware Arbitrary-Scale Super-Resolution for Variable-Rate Extreme Image Compression

联合退化感知任意尺度超分辨率用于可变速率极值图像压缩

Xinning Chai, Zhengxue Cheng, Xin Li, Rong Xie, Li Song

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Department of Electronic Engineer and Information Science, University of Science and Technology of China(中国科学技术大学电子工程与信息科学系) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能教育部重点实验室)

AI总结 本文提出ASSR-EIC框架,利用任意尺度超分辨率支持可变速率极值图像压缩,通过联合退化感知解码器实现率自适应重建,提升低比特率下的图像恢复质量。

Comments Accepted by IEEE Transactions on BroadCasting

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17382 2026-03-19 cs.CV

VisionNVS: Self-Supervised Inpainting for Novel View Synthesis under the Virtual-Shift Paradigm

VisionNVS: 一种基于虚拟位移范式的自监督补全方法用于新型视角合成

Hongbo Lu, Liang Yao, Chenghao He, Fan Liu, Wenlong Liao, Tao He, Pai Peng

机构 * Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学) COWARobot Co. Ltd.(COWARobot有限公司)

AI总结 本文提出VisionNVS,通过引入虚拟位移策略,将视角合成问题转化为自监督补全任务,利用单目深度代理模拟遮挡模式,提升自动驾驶中新型视角合成的几何精度和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17160 2026-03-19 stat.ML cs.LG math.ST stat.TH

Self-Regularized Learning Methods

自调节学习方法

Max Schölpple, Liu Fanghui, Ingo Steinwart

机构 * Institute for Stochastics(随机学研究所) Applications, University of Stuttgart(应用,斯图加特大学) School of Mathematical Sciences(数学科学学院) Institute of Natural Sciences(自然科学研究所) MOE-LSC, Shanghai Jiao Tong University(教育部-上海交通大学联合实验室)

AI总结 本文提出基于自调节概念的通用学习算法分析框架,通过隐式复杂度控制实现无需显式正则化。该框架涵盖经典正则化经验风险最小化和梯度下降,提供统计分析并讨论数据依赖超参数选择问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17052 2026-03-19 cs.LG cs.AI

Early Quantization Shrinks Codebook: A Simple Fix for Diversity-Preserving Tokenization

早量化缩小代码表:一种维持多样性token化问题的简单修复

Wenhao Zhao, Qiran Zou, Rushi Shah, Yudi Wu, Zhouhan Lin, Dianbo Liu

机构 * National University of Singapore(国立新加坡大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文研究了向量量化中的坍塌问题,发现随机初始化和编码器容量限制导致token和嵌入坍塌,并提出缓解方案,是首次系统探讨该问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16301 2026-03-19 cs.RO

OGScene3D: Incremental Open-Vocabulary 3D Gaussian Scene Graph Mapping for Scene Understanding

OGScene3D: 增量式开放词汇3D高斯场景图映射用于场景理解

Siting Zhu, Ziyun Lu, Guangming Wang, Chenguang Huang, Yongbo Chen, I-Ming Chen, Wolfram Burgard, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学) University of Technology Nuremberg(纽伦堡技术大学) Nanyang Technological University(南洋理工大学) Department of Automation, Key Laboratory of System Control and Information Processing of Ministry of Education, State Key Laboratory of Avionics Integration and Aviation System-of-Systems Synthesis, Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(自动化系,教育部系统控制与信息处理重点实验室,航空系统集成与航空系统-of-系统综合国家重点实验室,上海导航与定位基于服务重点实验室,上海交通大学)

AI总结 OGScene3D通过增量式3D高斯场景图映射,实现开放词汇场景理解,结合高斯表示与层次优化策略,提升语义一致性与长期优化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23562 2026-03-19 cs.LG cs.AI cs.CL

VL-RouterBench: A Benchmark for Vision-Language Model Routing

VL-RouterBench:一种用于视觉-语言模型路由的基准测试

Zhehao Huang, Baijiong Lin, Jingyuan Zhang, Jingying Wang, Yuhang Liu, Ning Lu, Tao Li, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(1 图像处理与模式识别研究所,上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(2 香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(3 香港科学与技术大学)

AI总结 本文提出VL-RouterBench,用于系统评估视觉-语言模型路由系统的能力,通过构建质量与成本矩阵,评估10种路由方法并发现显著的路由改进空间,揭示了路由架构改进的潜力。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02341 2026-03-19 cs.CV

TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction

TALO:推动3D视觉基础模型向全球一致的在线重建迈进

Fengyi Zhang, Tianjun Zhang, Kasra Khosoussi, Zheng Zhang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出基于薄板样条的高自由度长期对齐框架,通过全局传播控制点纠正空间变化不一致,并采用点无关子图注册设计提升鲁棒性,实验表明其在多数据集和相机配置下均能获得更一致的几何和更低的轨迹误差。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13615 2026-03-19 cs.AI cs.CL cs.HC

See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles

看见、思考、行动:通过识别切换器教多模态代理有效交互GUI

Zongru Wu, Rui Mao, Zhiyuan Tian, Pengzhou Cheng, Tianjie Ju, Zheng Wu, Lingzhong Dong, Haiyue Sheng, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 本文提出State-aware Reasoning方法,通过识别当前切换状态和指令目标状态,提升多模态代理在GUI切换指令执行的准确性,实验显示准确率提升超30%。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05591 2026-03-19 cs.AI

MLlm-DR: Towards Explainable Depression Recognition with MultiModal Large Language Models

MLlm-DR: 向多模态大语言模型的可解释性抑郁识别迈进

Wei Zhang, Juan Chen, En Zhu, Wenhong Cheng, YunPeng Li, Yanbo J. Wang

机构 * National University of Defense Technology(国防科技大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院) Nanjing Industria Tenebris Information Technology Co., Ltd.(南京Industria Tenebris信息技术有限公司) National University of Uzbekistan named after Mirzo Ulugbek(乌兹别克斯坦Mirzo Ulugbek命名的国立大学)

AI总结 本文提出MLlm-DR模型,通过多模态大语言模型实现可解释的抑郁识别,结合小型LLM和轻量级查询模块,提升诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12346 2026-03-19 cs.CV cs.AI

Efficient Diffusion as Low Light Enhancer

高效扩散作为低光照增强器

Guanzhou Lan, Qianli Ma, Yuqi Yang, Zhigang Wang, Dong Wang, Xuelong Li, Bin Zhao

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) TeleAI

AI总结 本文提出ReDDiT框架,通过线性外推错误分数函数和迁移高斯流到反射感知残差空间,提升低光照图像增强效率,仅用2步即可达到SOTA效果。

Comments CVPR 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16866 2026-03-18 cs.RO cs.AI cs.GR cs.LG cs.SE

ManiTwin: Scaling Data-Generation-Ready Digital Object Dataset to 100K

ManiTwin:将数据生成-ready的数字对象数据集扩展到10万

Kaixuan Wang, Tianxing Chen, Jiawei Liu, Honghao Su, Shaolong Zhu, Minxuan Wang, Zixuan Li, Yue Chen, Huan-ang Gao, Yusen Qin, Jiawei Wang, Qixuan Zhang, Lan Xu, Jingyi Yu, Yao Mu, Ping Luo

机构 * The University of Hong Kong(香港大学) Xspark AI Deemos Tech Shanghai Jiao Tong University(上海交通大学) ShanghaiTech University(上海交通大学) University of California, San Diego(加州大学圣地亚哥分校) D-Robotics Peking University(北京大学) Tsinghua University(清华大学) Shenzhen University(深圳大学)

AI总结 本文提出ManiTwin,一种高效生成数据生成-ready数字对象双胞胎的自动化流程,构建了包含10万高质量标注3D资产的ManiTwin-100K数据集,为大规模仿真数据合成和策略学习提供基础。

Comments Website: https://manitwin.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16844 2026-03-18 cs.CV

M^3: Dense Matching Meets Multi-View Foundation Models for Monocular Gaussian Splatting SLAM

M^3:密集匹配与多视角基础模型结合的单目高斯点云SLAM

Kerui Ren, Guanghao Li, Changjian Jiang, Yingxiang Xu, Tao Lu, Linning Xu, Junting Dong, Jiangmiao Pang, Mulin Yu, Bo Dai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 本文提出M^3,结合多视角基础模型与单目高斯点云SLAM,通过引入匹配头提升密集对应关系,增强跟踪稳定性,在多种基准上取得优异的位姿估计和场景重建性能。

Comments Project page: https://city-super.github.io/M3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16822 2026-03-18 cs.AI

Surg$Σ$: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence

Surg$Σ$: 一种大规模多模态数据和基础模型的光谱,用于外科智能

Zhitao Zeng, Mengya Xu, Jian Jiang, Pengfei Guo, Yunqiu Xu, Zhu Zhuo, Chang Han Low, Yufan He, Dong Yang, Chenxi Lin, Yiming Gu, Jiaxin Guo, Yutong Ban, Daguang Xu, Qi Dou, Yueming Jin

机构 * NUS(新加坡国立大学) CUHK(香港中文大学) SJTU(上海交通大学) NVIDIA(英伟达)

AI总结 本文提出Surg$Σ$,通过大规模多模态数据和基础模型提升外科智能,解决现有框架任务特定、泛化能力差的问题,展示统一语义设计和结构化推理标注的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16679 2026-03-18 cs.CV

HMAR: Hierarchical Modality-Aware Expert and Dynamic Routing Medical Image Retrieval Architecture

HMAR:分层模态感知专家与动态路由医学图像检索架构

Aojie Yuan

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出HMAR框架,通过双专家机制和两阶段对比学习实现细粒度医学图像检索,提升检索精度与效率。

Comments 8 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16435 2026-03-18 cs.CL

VQKV: High-Fidelity and High-Ratio Cache Compression via Vector-Quantization

VQKV:通过向量量化实现高保真和高比的缓存压缩

Yixuan Wang, Qingyu Shi, Jiayu Zhou, Dianbo Liu, Ziwei He, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Cambridge(剑桥大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出VQKV方法,利用向量量化实现高压缩比和高重建保真度的KV缓存压缩,实现在有限资源环境下提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16429 2026-03-18 astro-ph.IM cs.AI cs.CV

LenghuSky-8: An 8-Year All-Sky Cloud Dataset with Star-Aware Masks and Alt-Az Calibration for Segmentation and Nowcasting

LenghuSky-8: 一个8年全天云数据集,配备星 aware 掩码和 altitude-azimuth 校准,用于分割和现在预测

Yicheng Rui, Xiao-Wei Duan, Licai Deng, Fan Yang, Zhengming Dang, Zhengjun Du, Junhao Peng, Wenhao Chu, Umut Mahmut, Kexin Li, Yiyun Wu, Fabo Feng

机构 * State Key Laboratory of Dark Matter Physics, Tsung-Dao Lee Institute & School of Physics and Astronomy, Shanghai Jiao Tong University(暗物质物理国家重点实验室、李政道研究所及物理天文学院、上海交通大学) National Astronomical Observatories, Chinese Academy of Sciences(中国科学院国家天文台) School of Computer Technology and Application, Qinghai University(青海大学计算机技术与应用学院)

AI总结 本文提出LenghuSky-8数据集,包含8年全天影像,提供星 aware 掩码和Alt-Az校准,用于云分割和现在预测,通过线性探针训练获得高分割精度,并引入短周期现在预测基准测试。

Comments CVPR Findings accepted. 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16393 2026-03-18 math.NA cs.AI cs.NA

Robust Physics-Guided Diffusion for Full-Waveform Inversion

鲁棒的物理引导扩散用于全波形反演

Jishen Peng, Enze Jiang, Zheng Ma, Xiongbin Yan

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University, Shanghai, China(上海交通大学数学科学学院) Institute of Natural Sciences, MOE-LSC, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自然科学院) Qing Yuan Research Institute, Shanghai Jiao Tong University, Shanghai, China(上海交通大学清元研究院) CMA-Shanghai, Shanghai Jiao Tong University, Shanghai, China(上海交通大学上海计算机应用研究所) School of Mathematics and Statistics, Lanzhou University, Lanzhou, China(兰州大学数学与统计学院)

AI总结 本文提出一种鲁棒的物理引导扩散框架,结合生成先验与通过波动方程模拟计算的似然引导,通过波动场增强和观测依赖归一化提升抗幅度不平衡和时间/相位偏移能力,实验表明在同等计算预算下优于确定性优化基线和标准扩散后验采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16280 2026-03-18 cs.SD eess.AS

CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS

CAST-TTS: 一种用于语音合成中统一音色控制的跨注意力框架

Zihao Zheng, Wen Wu, Chao Zhang, Mengyue Wu, Xuenan Xu

机构 * Shanghai AI Lab(上海人工智能实验室) MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(人工智能大规模并行计算关键实验室,X-LANCE实验室,上海交通大学)

AI总结 本文提出CAST-TTS框架,通过统一语音和文本提示的音色控制,采用多阶段训练策略和单个跨注意力机制实现高效合成,实验表明其性能接近专用单输入模型。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16277 2026-03-18 cs.LG physics.flu-dyn

Physics-integrated neural differentiable modeling for immersed boundary systems

融合物理的神经可微建模用于浸没边界系统

Chenglin Li, Hang Xu, Jianting Chen, Yanfei Zhang

机构 * State Key Lab of Ocean Engineering, School of Ocean and Civil Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(海洋工程国家重点实验室,海洋与civil工程学院,上海交通大学,上海200240,中国) State Key Laboratory of Maritime Technology and Safety, Shanghai Ship and Shipping Research Institute Co., Ltd, Shanghai 200135, China(海洋技术与安全国家重点实验室,上海船舶研究所有限公司,上海200135,中国)

AI总结 本文提出融合物理的神经可微框架,用于长时间预测浸没边界流动,通过结构整合物理原理和改进的PDE中间速度模块,提高计算效率和稳定性,实现快速推理。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16189 2026-03-18 cs.CV

Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning

通过多任务多奖励强化学习实现SVG-LLMs的可靠推理

Haomin Wang, Qi Wei, Qianli Ma, Shengyuan Ding, Jinhui Yin, Kai Chen, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Nanjing University(南京大学)

AI总结 本文提出CTRL-S框架,通过多任务多奖励优化提升SVG生成的结构连贯性和视觉保真度,实验表明其在任务成功率和SVG代码质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16099 2026-03-18 cs.CV

OneWorld: Taming Scene Generation with 3D Unified Representation Autoencoder

OneWorld: 通过3D统一表示自编码器驯服场景生成

Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Tongliang Liu, Mingming Gong, Jiawang Bian

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽亚德人工智能大学) AISphere Shanghai Jiao Tong University(上海交通大学) University of Melbourne(墨尔本大学) Nanyang Technological University(南洋理工大学)

AI总结 OneWorld通过3D统一表示自编码器直接在3D空间中进行扩散,解决跨视角一致性和几何一致性问题,实验表明其生成的3D场景质量优于现有2D方法。

Comments Code: https://github.com/SensenGao/OneWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16086 2026-03-18 cs.RO cs.AI cs.CV cs.SD

Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation

迈向视觉-声音-语言-动作范式:用于以声音为中心的操作的HEAR框架

Chang Nie, Tianchen Deng, Guangming Wang, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University and Shanghai Key Laboratory of Navigation and Location Based Services(自动化与智能感知学院,上海交通大学,导航与基于位置的服务重点实验室) Department of Engineering, Cambridge University(工程系,剑桥大学)

AI总结 本文提出HEAR框架,通过整合声音、视觉、语言和本体感知,解决实时声音中心操作中的关键声音遗漏问题,强调因果持续性和显式时间学习的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15987 2026-03-18 cs.LG

Determinism in the Undetermined: Deterministic Output in Charge-Conserving Continuous-Time Neuromorphic Systems with Temporal Stochasticity

确定性在不确定之中:具有时间随机性的电荷守恒连续时间神经形态系统中的确定性输出

Jing Yan, Kang You, Zhezhi He, Yaoyu Zhang

机构 * School of Mathematical Sciences, Institute of Natural Sciences(数学科学学院,自然科学院) MOE-LSC, Shanghai Jiao Tong University, Shanghai, China(教育部-上海交通大学联合实验室,上海交通大学,上海,中国) School of Electronic Information(电子信息学院) Electrical Engineering, Shanghai Jiao Tong University, Shanghai, China(电气工程,上海交通大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

AI总结 本文提出了一种连续时间框架,通过结合电荷守恒定律与最小神经元约束,实现异步神经形态系统中确定性输出,解决了时间随机性带来的挑战,并建立了电荷守恒SNN与量化人工神经网络的精确对应关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15011 2026-03-18 cs.CV

Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing

分子标识视觉提示与可验证强化学习用于化学反应图解析

Jiahe Song, Chuang Wang, Yinfan Wang, Hao Zheng, Rui Nie, Bowen Jiang, Xingjian Wei, Junyuan Gao, Yubin Wang, Bin Wang, Lijun Wu, Jiang Wu, Qian Yu, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) Peking University(北京大学) South China Normal University(华南师范大学)

AI总结 本文提出IdtVP和Re3-DAPO方法,通过视觉提示和强化学习提升化学反应图解析的准确性和泛化能力,同时发布ScannedRxn基准数据集以评估模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19117 2026-03-18 cs.CV physics.optics

3M-TI: High-Quality Mobile Thermal Imaging via Calibration-free Multi-Camera Cross-Modal Diffusion

3M-TI: 通过无校准多相机跨模态扩散实现高质量移动热成像

Minchong Chen, Xiaoyun Yuan, Junzhe Wan, Jianing Zhang, Jun Zhang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能联合实验室,人工智能研究院,上海交通大学) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 本文提出3M-TI,一种无需校准的多相机跨模态扩散框架,通过跨模态自注意力模块提升热成像的分辨率和细节,验证其在实际应用中的优越性能。

Comments Accepted by CVPR 2026, Code: https://github.com/work-submit/3MTI, Project page: https://lab.xiaoyunyuan.net/index.html?project=3m-ti

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02192 2026-03-18 cs.CV

Content-Aware Mamba for Learned Image Compression

内容感知Mamba用于学习图像压缩

Yunuo Chen, Zezheng Lyu, Bing He, Hongwei Hu, Qi Wang, Yuan Tian, Li Song, Wenjun Zhang, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Massachusetts Institute of Technology(麻省理工学院) Alibaba Group(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出Content-Aware Mamba,通过动态适应图像内容的处理策略,提升学习图像压缩中全局冗余消除效率,实现优于现有方法的率失真性能。

Comments ICLR2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14837 2026-03-18 cs.CV cs.AI

Improved Iterative Refinement for Chart-to-Code Generation via Structured Instruction

改进的图表到代码生成的迭代细化方法:基于结构化指令

Chengzhi Xu, Yuyang Wang, Lai Wei, Lichao Sun, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) Lehigh University(莱特大学) MIFA Lab(MIFA实验室)

AI总结 本文提出基于结构化指令的ChartIR方法,通过区分视觉理解和代码翻译任务,提升图表到代码生成的性能,实验显示在Qwen2-VL和GPT-4o上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏