arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

共收录 1936
2604.00599 2026-04-02 cs.LG

Predicting Dynamics of Ultra-Large Complex Systems by Inferring Governing Equations

通过推断 governing 方程来预测超大规模复杂系统的动态

Qi Shao, Duxin Chen, Jiawen Chen, Yujie Zeng, Athen Ma, Wenwu Yu, Vito Latora, Wei Lin

机构 * Southeast University(东南大学) Queen Mary University of London(伦敦玛丽女王大学) Università di Catania and INFN(卡塔尼亚大学及国家核物理研究所) Complexity Science Hub Vienna(维也纳复杂性科学中心) Fudan University(复旦大学)

AI总结 本文提出 SIGN 框架,通过数据推断大规模网络系统 governing 方程,实现高效且可靠的长时预测,适用于复杂系统研究。

Comments 15 pages, 5 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09697 2026-04-02 cs.LG cs.AI cs.CL

Mousse: Rectifying the Geometry of Muon with Curvature-Aware Preconditioning

Mousse:通过曲率感知预条件化校正μon的几何

Yechen Zhang, Shuhao Xing, Junhao Huang, Kai Lv, Yunhua Zhou, Xipeng Qiu, Qipeng Guo, Kai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

AI总结 本文提出Mousse优化器,通过曲率感知预条件化改进谱方法的结构稳定性,实验证明其在大规模语言模型训练中显著提升效率。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19225 2026-04-02 eess.IV cs.CV

Unified Medical Image Tokenizer for Autoregressive Synthesis and Understanding

统一的医学图像标记器用于自回归合成与理解

Chenglong Ma, Yuanfeng Ji, Jin Ye, Zilong Li, Chenhui Wang, Junzhi Ning, Wei Li, Lihao Liu, Qiushan Guo, Tianbin Li, Junjun He, Hongming Shan

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Stanford University(斯坦福大学) Shanghai AI Laboratory(上海人工智能实验室) ByteDance Seed(字节跳动Seed)

AI总结 本文提出MedITok,通过两阶段训练框架统一医学图像标记器,利用大规模未配对图像提升重建精度,并结合图像-文本对注入细粒度语义,实现自回归建模在诊断和生成任务中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29732 2026-04-01 cs.CV

Compressive sensing inspired self-supervised single-pixel imaging

受压缩感知启发的自监督单像素成像

Jijun Lu, Yifan Chen, Libang Chen, Yiqiang Zhou, Ye Zheng, Mingliang Chen, Zhe Sun, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(中国电信人工智能研究院(TeleAI)) School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai, China(上海交通大学集成电路学院) College of Future Information Technology, Fudan University, Shanghai, China(复旦大学未来信息科技学院) Aerospace Laser Technology and System Department, Shanghai Institute of Optics and Fine Mechanics, Chinese Academy of Sciences, Shanghai, China(中国科学院上海光学精密机械研究所航天激光技术与系统部) Fujian Ocean Innovation Center, Xiamen, China(福建海洋创新中心(厦门))

AI总结 本文提出SISTA-Net,通过融合局部和全局特征建模,提升单像素成像的鲁棒性和抗干扰能力,在多个仿真场景中实现2.6dB的PSNR提升,远场水下测试平均PSNR提高3.4dB。

Comments 10 pages, 9 figures, 2 algorithms, 2 tables, journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29697 2026-04-01 cs.CV

FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing

FED-Bench:一种跨粒度的面部表情编辑评估基准

Fengjian Xue, Xuecheng Wu, Heli Sun, Yunyun Shi, Shi Chen, Liangyu Fu, Jinheng Xie, Dingkang Yang, Hao Wang, Junxiao Xue, Liang He

机构 * Xi’an Jiaotong University(西安交通大学) Northwestern Polytechnical University(西北工业大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Zhejiang Lab(之江实验室)

AI总结 本文提出FED-Bench,通过构建747个三元组基准,引入FED-Score评估协议,评估面部表情编辑的对齐、保真度和相对表达增益,揭示当前方法在高保真与准确表达操控间的困境,并提供20k+真实世界面部训练集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29634 2026-04-01 cs.CV cs.AI

MacTok: Robust Continuous Tokenization for Image Generation

MacTok: 图像生成中的鲁棒连续分词

Hengyu Zeng, Xin Gao, Guanghao Li, Yuxiang Yan, Jiaoyang Ruan, Junpeng Ma, Haoyu Albert Wang, Jian Pu

机构 * Fudan University(复旦大学)

AI总结 MacTok通过引入图像掩码和表征对齐,防止后验崩溃,实现高效且高保真的连续分词,仅需64或128个token,在ImageNet上取得优异成绩。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19114 2026-04-01 cs.CV

CreatiDesign: A Unified Multi-Conditional Diffusion Transformer for Creative Graphic Design

CreatiDesign: 一种统一的多条件扩散变换器用于创意图形设计

Hui Zhang, Dexiang Hong, Maoke Yang, Yutao Cheng, Zhao Zhang, Weidong Chen, Jie Shao, Xinglong Wu, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) Bytedance Intelligent Creation(字节跳动智能创作) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)

AI总结 本文提出CreatiDesign,一种统一的多条件扩散变换器,解决多条件控制问题,通过多模态注意力掩码机制和自动化数据集构建,提升图形设计生成的准确性和和谐度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29494 2026-04-01 cs.CV

VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference

VecAttention: 向量级稀疏注意力用于加速长上下文推理

Anmin Liu, Ruixuan Yang, Huiqiang Jiang, Bin Lin, Minmin Sun, Yong Li, Chen Zhang, Tao Xie

机构 * SCS, Peking University(北京大学计算机科学技术学院) Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学)) Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出VecAttention,一种向量级稀疏注意力框架,通过动态选择信息向量提升视频模型的精度与效率,实测在视频理解和生成任务中比全注意力快2.65倍,比现有稀疏注意力方法快1.83倍且精度相当。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29176 2026-04-01 q-bio.NC cs.AI cs.CE cs.CV

Predicting Neuromodulation Outcome for Parkinson's Disease with Generative Virtual Brain Model

利用生成虚拟脑模型预测帕金森病的神经调制疗效

Siyuan Du, Siyi Li, Shuwei Bai, Ang Li, Haolin Li, Mingqing Xiao, Yang Pan, Dongsheng Li, Weidi Xie, Yanfeng Wang, Ya Zhang, Chencheng Zhang, Jiangchao Yao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Microsoft Research Asia(微软亚洲研究院) Zhongnan Hospital of Wuhan University(武汉大学中南医院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Artificial Intelligence for Medicine, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院人工智能医学研究所) Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学协同媒体创新中心)

AI总结 本文提出一种基于生成虚拟脑模型的预训练-微调框架,通过静息态fMRI预测帕金森病患者接受颞叶干扰和深部脑刺激的疗效,利用生成模型提高个体化虚拟脑的准确性,并通过反事实估计预测临床反应,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24176 2026-04-01 eess.IV cs.CV q-bio.NC

Modeling Spatiotemporal Neural Frames for High Resolution Brain Dynamic

时空神经帧建模用于高分辨率脑动态研究

Wanying Qu, Jianxiong Gao, Wei Wang, Yanwei Fu

机构 * Fudan University(复旦大学) Southern University of Science and Technology(南方科技大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出一种基于EEG条件的框架,用于高保真重建动态fMRI,通过引入空域中间帧重建解决采样不规则问题,提升时空连续性与应用性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01228 2026-04-01 cs.CV

Towards Policy-Adaptive Image Guardrail: Benchmark and Method

面向政策适应的图像防护:基准与方法

Caiyong Piao, Zhiyuan Yan, Haoming Xu, Yunzhen Zhao, Kaiqing Lin, Feiyang Xu, Shuigeng Zhou

机构 * Fudan University(复旦大学) Tencent(腾讯) Peking University(北京大学)

AI总结 本文提出SafeGuard-VL方法,通过强化学习与可验证奖励提升图像防护的政策适应能力,并通过SafeEditBench基准测试验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06874 2026-04-01 cs.CV

MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation

MVGGT:多模态视觉几何 grounded 变换器用于多视角3D指称表达分割

Changli Wu, Haodong Wang, Jiayi Ji, Yutian Yao, Chunsai Du, Jihua Kang, Yanwei Fu, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ByteDance(字节跳动) Tianjin University of Science and Technology(天津科技大学)

AI总结 本文提出MVGGT,一种高效的端到端框架,通过双分支设计将语言信息整合到稀疏视角的几何推理中,解决稀疏视角下的优化障碍,建立首个强基线,实现高精度和快速推理。

Comments Accepted to CVPR 2026; Project Website: https://mvggt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16635 2026-04-01 cs.MA cs.AI cs.CL cs.HC cs.IR

MA-SAPO: Multi-Agent Reasoning for Score-Aware Prompt Optimization

MA-SAPO:多智能体推理用于评分感知提示优化

Wonduk Seo, Juhyeon Lee, Junseo Koh, Wonseok Choi, Hyunjin An, Jian Park, Seunghyun lee, Haihua Chen, Yi Bu

机构 * Enhans Peking University(北京大学) Fudan University(复旦大学) University of North Texas(北德克萨斯大学)

AI总结 本文提出MA-SAPO框架,通过多智能体推理将评估结果与针对性改进联系起来,提升提示优化的可解释性和可控性,实验表明其在多个评估指标上优于现有方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11018 2026-03-31 cs.CV

Unleashing the Potential of Mamba: Boosting a LiDAR 3D Sparse Detector by Using Cross-Model Knowledge Distillation

释放Mamba的潜力:通过跨模型知识蒸馏提升LiDAR 3D稀疏检测器

Rui Yu, Runkai Zhao, Jiagen Li, Qingsong Zhao, HuaiCheng Yan, Meng Wang

机构 * East China University of Science and Technology(华东理工大学) University of Sydney(悉尼大学) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学技术学院)

AI总结 本文提出FASD框架,通过跨模型知识蒸馏将Transformer的全局上下文理解能力转移到Mamba模型,提升检测精度与效率,实现在Waymo和nuScenes数据集上的性能提升和资源消耗降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28569 2026-03-31 cs.LG cs.AI cs.IR cs.PF

CirrusBench: Evaluating LLM-based Agents Beyond Correctness in Real-World Cloud Service Environments

CirrusBench:在真实云服务环境中评估基于LLM的代理超越正确性的能力

Yi Yu, Guangquan Hu, Chenghuang Shen, Xingyan Liu, Jing Gu, Hangyi Sun, Junzhuo Ma, Weiting Liu, Jianfeng Liu, Mingyue Pu, Yu Wang, Zhengdong Xiao, Rui Xie, Longjiu Luo, Qianrong Wang, Gurong Cui, Honglin Qiao, Wenlian Lu

机构 * School of Mathematics and Sciences, Fudan University(复旦大学数学科学学院) Shanghai Center for Mathematical Sciences, Fudan University(复旦大学上海数学中心) Alibaba Group(阿里巴巴集团) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院) Center for Applied Mathematics & Shanghai Key Laboratory of Contemporary Applied Mathematics, Fudan University(复旦大学应用数学中心暨上海市现代应用数学重点实验室)

AI总结 本文提出CirrusBench框架,基于真实云服务工单数据评估LLM代理的鲁棒性和解决效率,引入客户导向指标量化服务质量,揭示现有模型在复杂多轮任务中的不足。

Comments Submitted for SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28135 2026-03-31 cs.AI

CoT2-Meta: Budgeted Metacognitive Control for Test-Time Reasoning

CoT2-Meta:预算化的元认知控制用于测试时推理

Siyuan Ma, Bo Gao, Zikai Xiao, Hailong Wang, Xinlei Yu, Rui Qian, Jiayu Qian, Luqi Gong, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Sun Yat-Sen University(中山大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Zhejiang Lab(之江实验室)

AI总结 CoT2-Meta通过元认知控制优化测试时推理,提升多个基准测试的性能,包括MATH、GSM8K等,相比基线方法有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14790 2026-03-31 cs.CV

Mind-of-Director: Multi-modal Agent-Driven Film Previsualization via Collaborative Decision-Making

导演之思:通过协作决策的多模态代理驱动电影预可视化

Shufeng Nan, Mengtian Li, Sixiao Zheng, Yuwei Lu, Han Zhang, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai University(上海大学)

AI总结 Mind-of-Director通过协作决策过程生成高质量的电影预可视化序列,结合多个专业代理在游戏引擎中协作生成预可视化内容,提升自动化原型制作和人机协同电影制作的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13742 2026-03-31 cs.LG stat.ML

Few Batches or Little Memory, But Not Both: Simultaneous Space and Adaptivity Constraints in Stochastic Bandits

少批次或少内存,但并非两者:随机老虎机中的同时空间和适应性约束

Ruiyuan Huang, Zicheng Lyu, Xiaoyi Zhu, Zengfeng Huang

机构 * School of Data Science, Fudan University(复旦大学大数据学院) Shanghai Innovation Institute(上海创新研究院)

AI总结 研究随机老虎机在空间和适应性同时约束下的性能,证明在同时约束下,近最优 regret 需要 Ω(K/W) 批次,提出一个在任意内存预算下达到近最优 regret 的算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19582 2026-03-31 cs.CV

ScenePilot-4K: A Large-Scale First-Person Dataset and Benchmark for Vision-Language Models in Autonomous Driving

ScenePilot-4K:一个大规模第一视角数据集和基准,用于自动驾驶中视觉-语言模型的安全感知学习与评估

Yujin Wang, Yutong Zheng, Wenxian Fan, Tianyi Wang, Hongqing Chu, Li Zhang, Bingzhao Gao, Daxin Tian, Jianqiang Wang, Hong Chen

机构 * Tongji University(同济大学) UT Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

AI总结 本文提出ScenePilot-4K数据集,包含3847小时视频和27.7亿帧图像,用于评估视觉-语言模型在自动驾驶中的场景理解、空间感知、运动规划和语义对齐能力,揭示模型在几何感知和规划推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18857 2026-03-31 stat.ML cs.LG

Statistical Inference for Explainable Boosting Machines

可解释提升机的统计推断

Haimo Fang, Kevin Tan, Jonathan Pipping-Gamon, Giles Hooker

机构 * School of Economics, Fudan University(复旦大学经济学院) Department of Statistics and Data Science, The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院统计与数据科学系)

AI总结 本文提出利用梯度提升的统计推断方法,通过移动平均替代树的求和(Boulevard正则化),使提升过程收敛于特征核岭回归,实现渐近正态预测并达到最小最大最优MSE,同时构建预测区间和置信区间,提升EBM的可解释性。

Comments Accepted to AISTATS 2026 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14959 2026-03-31 cs.CV

Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers

迈向视频帧插值的整体建模:具有自回归扩散变换器的局部扩散强制

Xinyu Peng, Han Li, Yuyang Huang, Ziyang Zheng, Yaoming Wang, Xin Chen, Wenrui Dai, Chenglin Li, Junni Zou, Hongkai Xiong

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

AI总结 本文提出LDF-VFI方法,通过自回归扩散变换器建模整个视频序列,结合跳连采样策略和稀疏注意力机制,提升视频帧插值的时序一致性和重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05138 2026-03-31 cs.CV

VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control

VerseCrafter:基于4D几何控制的动态真实视频世界模型

Sixiao Zheng, Minghao Yin, Wenbo Hu, Xiaoyu Li, Ying Shan, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) HKU(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

AI总结 本文提出VerseCrafter,通过4D几何控制生成动态真实视频,相比传统方法更精确控制相机和多物体运动。

Comments Project Page: https://sixiaozheng.github.io/VerseCrafter_page/, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22264 2026-03-31 cs.CV

DriveVGGT: Calibration-Constrained Visual Geometry Transformers for Multi-Camera Autonomous Driving

DriveVGGT: 用于多摄像头自动驾驶的校准约束视觉几何变换

Xiaosong Jia, Yanhao Liu, Yu Hong, Renqiu Xia, Junqi You, Bin Sun, Zhihui Hao, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究所) Li Auto Inc.(理想汽车)

AI总结 DriveVGGT通过引入时间视频注意模块、多摄像头一致性注意模块和分解的解码过程,整合稀疏空间重叠、校准几何约束和刚性外参恒定等先验知识,提升自动驾驶场景下的重建效率和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23392 2026-03-31 cs.AI cs.CL

Your Models Have Thought Enough: Training Large Reasoning Models to Stop Overthinking

您的模型已经思考足够了:训练大型推理模型以停止过度思考

Jinyi Han, Ying Huang, Ying Liao, Zishang Jiang, Xikun Lu, Haiquan Zhao, Xinyi Wang, Guanghao Zhou, Sihang Jiang, Jiaqing Liang, Weikang Zhou, Zeye Sun, Fei Yu, Yanghua Xiao

机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海智能教育研究院) School of Data Science, Fudan University(复旦大学数据科学学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Antgroup(蚂蚁集团)

AI总结 本文提出JET方法,通过训练模型主动终止不必要的推理步骤,提升推理效率而不牺牲准确性,在奥lympiad基准测试中实现4.6%的准确率提升和46.3%的输出长度减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27460 2026-03-31 cs.CV cs.AI

Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development

Project Imaging-X:1000多个开放访问医学影像数据集的调查

Zhongying Deng, Cheng Tang, Ziyan Huang, Jiashi Lin, Ying Chen, Junzhi Ning, Chenglong Ma, Jiyao Liu, Wei Li, Yinghao Zhu, Shujian Gao, Yanyan Huang, Sibo Ju, Yanzhou Su, Pengcheng Chen, Wenhao Tang, Tianbin Li, Haoyu Wang, Yuanfeng Ji, Hui Sun, Shaobo Min, Liang Peng, Feilong Tang, Haochen Xue, Rulin Zhou, Chaoyang Zhang, Wenjie Li, Shaohao Rui, Weijie Ma, Xingyue Zhao, Yibin Wang, Kun Yuan, Zhaohui Lu, Shujun Wang, Jinjie Wei, Lihao Liu, Dingkang Yang, Lin Wang, Yulong Li, Haolin Yang, Yiqing Shen, Lequan Yu, Xiaowei Hu, Yun Gu, Yicheng Wu, Benyou Wang, Minghui Zhang, Angelica I. Aviles-Rivero, Qi Gao, Hongming Shan, Xiaoyu Ren, Fang Yan, Hongyu Zhou, Haodong Duan, Maosong Cao, Shanshan Wang, Bin Fu, Xiaomeng Li, Zhi Hou, Chunfeng Song, Lei Bai, Yuan Cheng, Yuandong Pu, Xiang Li, Wenhai Wang, Hao Chen, Jiaxin Zhuang, Songyang Zhang, Huiguang He, Mengzhang Li, Bohan Zhuang, Zhian Bai, Rongshan Yu, Liansheng Wang, Yukun Zhou, Xiaosong Wang, Xin Guo, Guanbin Li, Xiangru Lin, Dakai Jin, Mianxin Liu, Wenlong Zhang, Qi Qin, Conghui He, Yuqiang Li, Ye Luo, Nanqing Dong, Jie Xu, Wenqi Shao, Bo Zhang, Qiujuan Yan, Yihao Liu, Jun Ma, Zhi Lu, Yuewen Cao, Zongwei Zhou, Jianming Liang, Shixiang Tang, Qi Duan, Dongzhan Zhou, Chen Jiang, Yuyin Zhou, Yanwu Xu, Jiancheng Yang, Shaoting Zhang, Xiaohong Liu, Siqi Luo, Yi Xin, Chaoyu Liu, Haochen Wen, Xin Chen, Alejandro Lozano, Min Woo Sun, Yuhui Zhang, Yue Yao, Xiaoxiao Sun, Serena Yeung-Levy, Xia Li, Jing Ke, Chunhui Zhang, Zongyuan Ge, Ming Hu, Jin Ye, Zhifeng Li, Yirong Chen, Yu Qiao, Junjun He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Institute of Optics and Fine Mechanics(上海光学精密机械研究所) Fudan University(复旦大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Fuzhou University(福州大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Incept Labs Monash University(莫纳什大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Alibaba DAMO Academy(阿里巴巴达摩院) The Hong Kong Polytechnic University(香港理工大学) South China University of Technology(华南理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与产业研究院) Shanghai Academy of Artificial Intelligence for Science(上海科学智能研究院) Nankai University(南开大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) School of Informatics, Xiamen University(厦门大学信息学院) University College London(伦敦大学学院) Sun Yat-sen University(中山大学) Alibaba Group, DAMO Academy, New York, NY, USA(阿里巴巴集团达摩院(纽约)) Tongji University(同济大学) University of Toronto(多伦多大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Johns Hopkins University(约翰霍普金斯大学) Arizona State University(亚利桑那州立大学) Academy for Clinical Innovation and Translation of Shanghai(上海临床创新转化研究院) University of California, Santa Cruz(加州大学圣克鲁兹分校) ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(阿尔托大学) Shandong University(山东大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文调查了1000多个开放访问医学影像数据集,揭示了其规模小、任务碎片化和分布不均的问题,并提出元数据驱动融合方法和交互发现门户,为医学影像数据集的整合和基础模型发展提供路线图。

Comments 157 pages, 19 figures, 26 tables. Project repo: \url{https://github.com/uni-medical/Project-Imaging-X}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27287 2026-03-31 cs.RO cs.CV

Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving

Uni-World VLA:自主驾驶中的交织世界建模与规划

Qiqi Liu, Huan Xu, Jingyu Li, Bin Sun, Zhihui Hao, Dangen She, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Li Auto Inc.(理想汽车) University of Surrey(萨里大学)

AI总结 本文提出Uni-World VLA模型,通过交织未来帧预测与轨迹规划提升自主驾驶决策能力,结合单目深度信息增强场景预测。

Comments 22 pages, 8 figures. Submitted to ECCV 2026. Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22054 2026-03-31 cs.CV

FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generation

FontCrafter: 基于元素驱动的高保真艺术字体创作与视觉上下文生成

Wuyang Luo, Chengkai Tan, Chang Ge, Binye Hong, Su Yang, Yongjiu Ma

机构 * Dalian University of Technology(大连理工大学) Shanghai Key Laboratory of Intelligent Information Processing, Fudan University(复旦大学上海市智能信息处理重点实验室)

AI总结 本文提出FontCrafter框架,通过元素驱动方法生成艺术字体,结合上下文生成策略和轻量级CMA模块,实现高保真纹理与结构重建及灵活风格控制。

Comments To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03596 2026-03-31 cs.CV

Adaptive Attention Distillation for Robust Few-Shot Segmentation under Environmental Perturbations

适应性注意力蒸馏用于环境扰动下的鲁棒少样本分割

Qianyu Guo, Jingrong Wu, Jieji Ren, Weifeng Ge, Wenqiang Zhang

机构 * Shanghai Institute of Virology, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院上海市病毒研究所) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械与动力工程学院) Shanghai Key Lab of Intelligent Information Processing, School of Computer Science, Fudan University(复旦大学计算机科学技术学院上海市智能信息处理重点实验室) Engineering Research Center of AI & Robotics, Ministry of Education, Academy for Engineering & Technology, Fudan University(复旦大学工程与应用技术研究院教育部人工智能与机器人工程研究中心)

AI总结 本文提出适应性注意力蒸馏方法,通过对比和蒸馏已知与未知图像间的共享语义,提升模型在复杂环境下的鲁棒性,实验显示在多个数据集上mIoU提升3.3%-8.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13773 2026-03-31 cs.LG cs.AI

PENGUIN: Enhancing Transformer with Periodic-Nested Group Attention for Long-term Time Series Forecasting

PENGUIN:通过周期-嵌套组注意力增强Transformer以进行长期时间序列预测

Tian Sun, Yuqi Chen, Weiwei Sun

机构 * School of Computer Science, Fudan University(复旦大学计算机科学技术学院) Shanghai Key Laboratory of Data Science, Fudan University(复旦大学上海市数据科学重点实验室) Xiaohongshu Inc.(小红书公司)

AI总结 本文提出PENGUIN,一种周期-嵌套组注意力机制,用于提升Transformer在长期时间序列预测中的性能,通过捕捉周期结构和处理多重周期性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26837 2026-03-31 cs.RO cs.AI cs.CV

SpatialAnt: Autonomous Zero-Shot Robot Navigation via Active Scene Reconstruction and Visual Anticipation

SpatialAnt:通过主动场景重建与视觉预判实现自主零样本机器人导航

Jiwen Zhang, Xiangyu Shi, Siyuan Wang, Zerui Li, Zhongyu Wei, Qi Wu

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) Adelaide University(阿德莱德大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 SpatialAnt通过主动场景重建和视觉预判机制,解决零样本机器人导航中自建场景的不完整和噪声问题,提升导航性能。

Comments 10 pages, 4 figures, 5 tables. Homepage: https://imnearth.github.io/Spatial-X/

详情

展开后加载摘要…

URL PDF HTML 收藏