arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

共收录 1936
2505.03802 2026-01-06 cs.LG cs.AI

Balancing Fidelity and Plasticity: Aligning Mixed-Precision Fine-Tuning with Linguistic Hierarchies

在保真度与可塑性之间寻求平衡:将混合精度微调与语言层次结构对齐

Changhai Zhou, Shiyang Zhang, Yuhua Zhou, Qian Qiao, Jun Gao, Shichao Weng, Weizhong Zhang, Cheng Jin

机构 * Fudan University(复旦大学) Yale University(耶鲁大学) Zhejiang University(浙江大学)

AI总结 QR-Adaptor通过联合优化量化位宽和LoRA秩,解决混合精度微调中保真度与可塑性的平衡问题,实现内存与性能的高效资源分配。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01094 2026-01-06 cs.HC cs.AI cs.IR

SoulSeek: Exploring the Use of Social Cues in LLM-based Information Seeking

SoulSeek:探索在基于大语言模型的信息检索中利用社会线索的使用

Yubo Shu, Peng Zhang, Meng Wu, Yan Chen, Haoxuan Zhou, Guanming Liu, Yu Zhang, Liuxin Zhang, Qianying Wang, Tun Lu, Ning Gu

机构 * Fudan University(复旦大学)

AI总结 SoulSeek通过整合社会线索到基于大语言模型的信息检索中,提升用户感知和反思性信息行为,揭示当前LLM搜索的局限性,并提出设计改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05818 2026-01-06 cs.CV

LRANet++: Low-Rank Approximation Network for Accurate and Efficient Text Spotting

LRANet++:用于准确高效文本定位的低秩近似网络

Yuchen Su, Zhineng Chen, Yongkun Du, Zuxuan Wu, Hongtao Xie, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Institute of Trustworthy Embodied AI, College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学可信具身人工智能研究院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

AI总结 LRANet++通过低秩近似和三重分配方案,实现高效准确的任意形状文本定位。

Comments Accepted by IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25270 2026-01-06 cs.LG cs.AI cs.CV

InfMasking: Unleashing Synergistic Information by Contrastive Multimodal Interactions

InfMasking:通过对比多模态交互释放协同信息

Liangjian Wen, Qun Dai, Jianzhuang Liu, Jiangtao Zheng, Yong Dai, Dongkai Wang, Zhao Kang, Jun Wang, Zenglin Xu, Jiang Duan

机构 * School of Computing and Artificial Intelligence(计算与人工智能学院) Engineering Research Center of Intelligent Finance Ministry of Education(教育部长智能金融工程研究中心) Shenzhen Institutes of Advanced Technology Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Electronic Science and Technology of China(电子科技大学) Shanghai Academy of AI for Science(上海人工智能科学研究院) Artificial Intelligence Innovation and Incubation Institute Fudan University(复旦大学人工智能创新与孵化院) Artificial Intelligence and Digital Finance Key Laboratory of Sichuan Province(四川省人工智能与数字金融重点实验室)

AI总结 InfMasking通过无限遮蔽策略增强多模态协同信息提取,实现多模态表示学习中的协同信息优化与性能提升。

Comments Conference on Neural Information Processing Systems (NeurIPS) 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13201 2026-01-06 cs.CR cs.LG cs.MA

CEE: An Inference-Time Jailbreak Defense for Embodied Intelligence via Subspace Concept Rotation

CEE: 通过子空间概念旋转实现体智能中的推断时间劫持防御

Jirui Yang, Zheyu Lin, Zhihui Lu, Yinggui Wang, Lei Wang, Tao Wei, Qiang Duan, Xin Du, Shuhan Yang

机构 * Fudan University(复旦大学) Dalian University of Technology(大连理工大学) Ant Group(蚂蚁集团) Pennsylvania State University(宾夕法尼亚州立大学) Zhejiang University(浙江大学)

AI总结 CEE通过动态构建子空间并应用SLERP旋转,实现体智能系统中高效的推断时间劫持防御,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09082 2026-01-06 cs.CL cs.AI

CoSER: A Comprehensive Literary Dataset and Framework for Training and Evaluating LLM Role-Playing and Persona Simulation

CoSER:一个综合的文学数据集和框架,用于训练和评估LLM角色扮演和人设模拟

Xintao Wang, Heng Wang, Yifei Zhang, Xinfeng Yuan, Rui Xu, Jen-tse Huang, Siyu Yuan, Haoran Guo, Jiangjie Chen, Shuchang Zhou, Wei Wang, Yanghua Xiao

机构 * Fudan University(复旦大学) StepFun Johns Hopkins University(约翰霍普金斯大学)

AI总结 CoSER通过高质量文学数据集和开放模型,训练和评估LLM角色扮演能力,其70B模型在多个基准测试中超越GPT-4o。

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20144 2026-01-05 cs.CL

Multi-hop Reasoning via Early Knowledge Alignment

通过早期知识对齐实现多跳推理

Yuxin Wang, Shicheng Fang, Bo Wang, Qi Luo, Xuanjing Huang, Yining Zheng, Xipeng Qiu

机构 * Computer Science, Fudan University(复旦大学计算机科学系) Institute of Modern Languages and Linguistics, Fudan University(复旦大学现代语言与语言学研究所) Shanghai SII(上海SII)

AI总结 EKA通过早期知识对齐提升多跳推理效率,增强检索精度和系统性能。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17608 2026-01-05 cs.CV

Test-time generative augmentation for medical image segmentation

测试时生成增强用于医学图像分割

Xiao Ma, Yuhui Tao, Zetian Zhang, Yuhan Zhang, Xi Wang, Sheng Zhang, Zexuan Ji, Yizhe Zhang, Qiang Chen, Guang Yang

机构 * organization= School of Computer Science Engineering, Nanjing University of Science organization= Bioengineering Department Imperial-X, Imperial College London , city= London , postcode= W12 7SL , country= UK organization= Digital Medical Research Center, School of Basic Medical Sciences, Fudan University , city= Shanghai , country= China organization= Shanghai Key Laboratory of MICCAI , city= Shanghai , country= China organization= School of Biomedical Engineering, Shenzhen University , city= Shenzhen , country= China organization= Department of Computer Science Engineering, The Hong Kong University of Science Engineering, The Chinese University of Hong Kong , city= Hong Kong , country= China Lung Institute, Imperial College London , city= London , postcode= SW7 2AZ , country= UK organization= Cardiovascular Research Centre, Royal Brompton Hospital , city= London , postcode= SW3 6NP , country= UK organization= School of Biomedical Engineering \& Imaging Sciences, King's College London , city= London , postcode= WC2R 2LS , country= UK

AI总结 本研究提出TTGA方法,通过生成模型在测试时增强医学图像分割,提升分割精度并提供像素级误差估计。

Comments Accepted for publication in Medical Image Analysis (MedIA). Finalized version. Vol. 109, March 2026

Journal ref Medical Image Analysis, Vol. 109, 103902, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24638 2026-01-01 cs.RO

Resolving State Ambiguity in Robot Manipulation via Adaptive Working Memory Recoding

通过自适应工作记忆重编码解决机器人操作中的状态歧义

Qingda Hu, Ziheng Qiu, Zijun Xu, Kaizhao Zhang, Xizhou Bu, Zuolei Sun, Bo Zhang, Jieru Zhao, Zhongxue Gan, Wenchao Ding

机构 * Fudan Academy for Engineering and Technology, Fudan University(复旦大学工程与技术学院) Westwell(韦斯尔实验室) Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系)

AI总结 PAM通过自适应工作记忆重编码解决机器人操作中的状态歧义问题,支持300帧历史窗口并保持高推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24278 2026-01-01 cs.CV cs.AI

One-shot synthesis of rare gastrointestinal lesions improves diagnostic accuracy and clinical training

一次性合成罕见胃肠道病变提高诊断准确性和临床培训

Jia Yu, Yan Zhu, Peiyao Fu, Tianyi Chen, Zhihua Wang, Fei Wu, Quanlin Li, Pinghong Zhou, Shuo Wang, Xian Yang

机构 * Zhejiang University(浙江大学) Shanghai Institute for Advanced Study of Zhejiang University(浙江大学上海研究院) Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学部数字医学研究中心) Shanghai Collaborative Innovation Center of Endoscopy(上海内镜协同创新中心) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学曼彻斯特商学院) Data Science Institute, Imperial College London(伦敦帝国理工学院数据科学学院)

AI总结 EndoRare通过一次性合成罕见胃肠道病变,提升诊断准确性和临床培训效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24119 2026-01-01 cs.CV

GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation

GeoBench: 通过分层评估重新思考多模态几何问题解决

Yuan Feng, Yue Yang, Xiaohan He, Jiatong Zhao, Jianlong Chen, Zijun Chen, Daocheng Fu, Qi Liu, Renqiu Xia, Bo Zhang, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 GeoBench通过分层评估框架,系统评估几何问题解决能力,揭示任务复杂度对性能的影响及子目标分解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24023 2026-01-01 cs.CV cs.AI

RSAgent: Learning to Reason and Act for Text-Guided Segmentation via Multi-Turn Tool Invocations

RSAgent: 通过多轮工具调用学习推理与行动进行文本引导的分割

Xingqi He, Yujie Zhang, Shuyong Gao, Wenjie Li, Lingyi Hong, Mingxi Chen, Kaixun Jiang, Jiyuan Fu, Wenqiang Zhang

机构 * Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(上海智能信息处理关键实验室,计算机科学与人工智能学院,复旦大学) Artificial Intelligence, Fudan University(人工智能,复旦大学)

AI总结 RSAgent通过多轮工具调用实现文本引导分割的推理与行动,采用两阶段框架提升分割性能,达到领域内和领域外基准的最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25138 2026-01-01 cs.RO

Learning Spatial-Aware Manipulation Ordering

学习空间感知的操作顺序

Yuxiang Yan, Zhiyuan Zhou, Xin Gao, Guanghao Li, Shenglin Li, Jiaqi Chen, Qunyan Pu, Jian Pu

机构 * Fudan University(复旦大学) Shanghai YinCheng Intelligent CO., LTD(上海英成智能有限公司) Stanford University(斯坦福大学)

AI总结 OrderMind通过空间感知学习在杂乱环境中实现高效鲁棒操作的统一框架。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23105 2026-01-01 cs.CV

Towards Comprehensive Interactive Change Understanding in Remote Sensing: A Large-scale Dataset and Dual-granularity Enhanced VLM

迈向遥感中全面交互变化理解:一个大规模数据集和双粒度增强VLM

Junxiao Xue, Quan Deng, Xuecheng Wu, Kelu Yao, Xinyi Yin, Fei Yu, Wei Zhou, Yanfei Zhong, Yang Liu, Dingkang Yang

机构 * Research Center for Space Computing System, Zhejiang Lab(浙江省实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学网络科学与工程学院) Liaoning University of Technology(辽宁科技学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University(武汉测绘遥感与信息工程国家重点实验室(LIESMARS)) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

AI总结 本文提出ChangeIMTI数据集和ChangeVG模型,通过双粒度增强方法提升遥感图像变化理解的准确性和交互性。

Comments Junxiao Xue, Quan Deng, and Xuecheng Wu deserve equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23545 2025-12-30 cs.CV cs.AI

PathFound: An Agentic Multimodal Model Activating Evidence-seeking Pathological Diagnosis

PathFound: 一种促进证据寻求病理诊断的代理多模态模型

Shengyi Hua, Jianfeng Wu, Tianle Shen, Kangzhe Hu, Zhongzhen Huang, Shujuan Ni, Zhihong Zhang, Yuan Li, Zhe Wang, Xiaofan Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学庆元研究院) Shanghai Innovation Institute(上海创新研究院) Department of Pathology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学学院病理科) Intelligent Pathology Institute, Division of Life Sciences and Medicine(生命科学与医学学院智能病理研究所) Department of Pathology, Fudan University Shanghai Cancer Center(复旦大学上海癌症中心病理科) Department of Oncology, Shanghai Medical College, Fudan University(复旦大学上海医学院肿瘤科) Institute of Pathology, Fudan University(复旦大学病理研究所) Department of Pathology, The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院病理科)

AI总结 PathFound是一种通过主动信息获取和诊断完善来提升病理诊断准确性的代理多模态模型,其在多种临床场景中表现出卓越的诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23343 2025-12-30 cs.CL cs.AI cs.CV

AI Meets Brain: Memory Systems from Cognitive Neuroscience to Autonomous Agents

AI 与大脑:从认知神经科学到自主代理的记忆系统

Jiafeng Liang, Hao Li, Chang Li, Jiaqi Zhou, Shixin Jiang, Zekun Wang, Changkai Ji, Zhihao Zhu, Runxuan Liu, Tao Ren, Jinlan Fu, See-Kiong Ng, Xia Liang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 本文从认知神经科学到自主代理,系统综合了记忆的跨学科知识,探讨了记忆的定义、功能、分类、存储机制及安全问题,并展望了多模态记忆系统和技能获取的未来研究方向。

Comments 57 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23333 2025-12-30 cs.CV

CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation

CME-CAD:异构协作多专家强化学习用于CAD代码生成

Ke Niu, Haiyang Yu, Zhuofan Chen, Zhengtao Yao, Weitao Jia, Xiaodong Ge, Jingqun Tang, Benlei Cui, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学) ByteDance Inc(字节跳动公司)

AI总结 CME-CAD通过异构协作多专家强化学习方法,提升CAD代码生成的精度和可编辑性,提出两阶段训练流程并构建开源基准CADExpert。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23244 2025-12-30 cs.CV cs.AI

ViLaCD-R1: A Vision-Language Framework for Semantic Change Detection in Remote Sensing

ViLaCD-R1: 一种用于遥感语义变化检测的视觉-语言框架

Xingwei Ma, Shiyang Feng, Bo Zhang, Bin Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 ViLaCD-R1通过多图像推理器和掩码引导解码器,提升遥感变化检测的语义识别与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17703 2025-12-30 cond-mat.str-el cond-mat.mtrl-sci cs.LG physics.comp-ph

Revisiting the Broken Symmetry Phase of Solid Hydrogen: A Neural Network Variational Monte Carlo Study

重新审视固态氢的破缺对称相:一种神经网络变分蒙特卡洛研究

Shengdu Chai, Chen Lin, Xinyang Dong, Yuqiang Li, Wanli Ouyang, Lei Wang, X. C. Xie

机构 * Interdisciplinary Center for Theoretical Physics(理论物理交叉中心) Information Sciences (ICTPIS), Fudan University(信息科学(ICTPIS),复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Engineering, University of Oxford(工程系,牛津大学) Beijing National Laboratory for Condensed Matter Physics(北京凝聚态物理实验室) Institute of Physics, Chinese Academy of Sciences(物理研究所,中国科学院) Department of Information Engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学) International Center for Quantum Materials, School of Physics, Peking University(国际量子材料中心,物理系,北京大学) Hefei National Laboratory(合肥国家实验室)

AI总结 本文通过神经网络变分蒙特卡洛方法研究固态氢的破缺对称相,发现其基态结构候选者Cmcm空间群对称性,并验证其稳定性及与实验数据的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20666 2025-12-30 cs.LG cs.AI

Continuous-Time Attention: PDE-Guided Mechanisms for Long-Sequence Transformers

连续时间注意力:用于长序列Transformer的PDE引导机制

Yukun Zhang, Xueqing Zhou

机构 * The Chinese University Of Hongkong(香港中文大学) Fudan University(复旦大学)

AI总结 本文提出连续时间注意力机制,通过引入偏微分方程提升长序列Transformer对长距离依赖性和梯度流动的处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14404 2025-12-30 cs.CV

ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations

ViC-Bench: 用自由式中间状态表示法对多模态大语言模型的视觉交错链式思维能力进行基准测试

Xuecheng Wu, Jiaxing Liu, Danlei Huang, Yifan Wang, Yunyun Shi, Kedi Chen, Junxiao Xue, Yang Liu, Chunlin Chen, Hairong Dong, Dingkang Yang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Meituan Inc.(美团公司) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Robotics and Automation, Nanjing University(南京大学机器人与自动化学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

AI总结 ViC-Bench 通过自由式中间状态表示法,系统评估多模态大语言模型的视觉交错链式思维能力,涵盖四个任务并提出新评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17951 2025-12-30 cs.CV cs.AI

Robust Polyp Detection and Diagnosis through Compositional Prompt-Guided Diffusion Models

通过组成提示引导的扩散模型实现鲁棒的息肉检测与诊断

Jia Yu, Yan Zhu, Peiyao Fu, Tianyi Chen, Junbo Huang, Quanlin Li, Pinghong Zhou, Zhihua Wang, Fei Wu, Shuo Wang, Xian Yang

机构 * Zhejiang University(浙江大学) Shanghai Institute for Advanced Study of Zhejiang University(浙江大学上海高等研究院) Endoscopy Center, Zhongshan Hospital, Fudan University(复旦大学中山医院内窥镜中心) Shanghai Collaborative Innovation Center of Endoscopy(上海内窥镜协同创新中心) Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医疗研究中心) Shanghai Key Laboratory of MICCAI(上海MICCAI重点实验室) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟商学院) Data Science Institute, Imperial College London(伦敦帝国学院数据科学研究所)

AI总结 本文提出PSDM模型,通过整合多种临床注释生成合成图像,提升息肉检测、分类和分割的鲁棒性和泛化能力。

Journal ref IEEE Trans. Med. Imaging, vol. 44, no. 12, pp. 5245-5257, Dec. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19466 2025-12-30 cs.CV cs.LG

ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection

ForgerySleuth: 赋能多模态大语言模型进行图像篡改检测

Zhihao Sun, Haoran Jiang, Haoran Chen, Yixin Cao, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

AI总结 ForgerySleuth通过多模态大语言模型进行图像篡改检测,利用线索融合和数据集构建提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12004 2025-12-30 eess.IV cs.LG eess.SP

NLCG-Net: A Model-Based Zero-Shot Learning Framework for Undersampled Quantitative MRI Reconstruction

NLCG-Net:一种用于欠采样定量磁共振成像重建的基于模型的零样本学习框架

Xinrui Jiang, Yohan Jun, Jaejin Cho, Mengze Gao, Xingwang Yong, Berkin Bilgic

机构 * Fudan University(复旦大学) Harvard Medical School(哈佛医学院) Massachusetts General Hospital(麻省总医院) Stanford University(斯坦福大学) Zhejiang University(浙江大学)

AI总结 NLCG-Net通过结合U-Net正则化器和单指数信号建模,实现了基于模型的零样本学习,用于高加速因子下的T2/T1定量磁共振成像重建。

Comments 5 pages, 5 figures, accepted by International Society for Magnetic Resonance in Medicine 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07328 2025-12-30 cs.CV

Enhance Multi-Scale Spatial-Temporal Coherence for Configurable Video Anomaly Detection

增强可配置视频异常检测的多尺度空间-时间一致性

Kai Cheng, Xinzhe Li, Lijuan Che

机构 * Fudan University(复旦大学) East China University of Science and Technology(东华大学) School of Artificial Intelligence in Traditional Chinese Medicine(中医人工智能学院) Shanghai University of Traditional Chinese Medicine(上海中医药大学)

AI总结 本研究提出一种可配置的视频异常检测方法,通过多尺度空间-时间一致性模块提升检测准确性和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22096 2025-12-29 cs.CV

Yume-1.5: A Text-Controlled Interactive World Generation Model

Yume-1.5:一种文本控制的交互式世界生成模型

Xiaofeng Mao, Zhen Li, Chuanhao Li, Xiaojie Xu, Kaining Ying, Tong He, Jiangmiao Pang, Yu Qiao, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 Yume-1.5通过文本控制和高效框架生成交互式连续世界,解决实时性能与文本控制能力的瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06270 2025-12-29 stat.ML cs.LG

Contextual Strongly Convex Simulation Optimization: Optimize then Predict with Inexact Solutions

上下文强凸模拟优化:在不精确解中优化然后预测

Nifei Lin, Heng Luo, L. Jeff Hong

机构 * School of Management, Fudan University, Shanghai 200433, China(复旦大学管理学院) School of Data Science, Fudan University, Shanghai 200433, China(复旦大学数据科学学院) Department of Industrial and Systems Engineering, University of Minnesota, Minneapolis, MN 55455, USA(明尼苏达大学工业与系统工程系)

AI总结 本文提出一种"优化然后预测"方法,通过分析模拟优化算法的不精确性对最优性差距的影响,建立了收敛速率理论并验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00846 2025-12-29 cs.CV cs.AI

OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks

OmniBrainBench: 一种全面的多模态基准,用于跨多阶段临床任务的脑影像分析

Zhihao Peng, Cheng Wang, Shengyuan Liu, Zhiying Liang, Zanting Ye, Minjie Ju, PeterYM Woo, Yixuan Yuan

机构 * Chinese University of Hong Kong(香港中文大学) Sun Yat-sen Memorial Hospital, Sun Yat-sen University(中山大学孙逸仙纪念医院) Southern Medical University(南方医科大学) Zhongshan Hospital, Fudan University(复旦大学中山医院) Department of Neurosurgery, Prince of Wales Hospital(威尔士王室医院神经外科部)

AI总结 OmniBrainBench是一个全面的多模态基准,用于评估脑影像分析中MLLMs的多模态理解能力,揭示了其在复杂临床任务中的挑战和与医生的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13626 2025-12-29 cs.RO cs.CL cs.CV

LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models

LIBERO-Plus:视觉-语言-动作模型的深入鲁棒性分析

Senyu Fei, Siyin Wang, Junhao Shi, Zihao Dai, Jikun Cai, Pengfang Qian, Li Ji, Xinzhe He, Shiduo Zhang, Zhaoye Fei, Jinlan Fu, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

AI总结 LIBERO-Plus研究了视觉-语言-动作模型在七个维度上的鲁棒性,发现模型对摄像机视角和机器人初始状态等扰动极度敏感,但对语言指令变化不敏感,挑战了高基准分数代表真正能力的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21641 2025-12-29 cs.CV cs.AI

TrackTeller: Temporal Multimodal 3D Grounding for Behavior-Dependent Object References

TrackTeller: 基于时间的多模态3D定位用于行为依赖的对象引用

Jiahong Yu, Ziqi Wang, Hailiang Zhao, Wei Zhai, Xueqiang Yan, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Huawei Technologies Ltd.(华为技术有限公司)

AI总结 TrackTeller通过融合LiDAR图像、语言条件解码和时间推理,提升动态3D场景中基于语言的物体定位与跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏