arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2925
2603.27527 2026-03-31 cs.LG

Visualization of Machine Learning Models through Their Spatial and Temporal Listeners

通过空间和时间监听器可视化机器学习模型

Siyu Wu, Lei Shi, Lei Xia, Cenyang Wu, Zipeng Liu, Yingchaojie Feng, Liang Zhou, Wei Chen

机构 * School of Computer Science & Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Institute of Medical Technology, Peking University Health Science Center and National Institute of Health Data Science, Peking University(北京大学医学部医学技术研究院与北京大学健康数据科学国家研究所) School of Software, Beihang University(北京航空航天大学软件学院) National University of Singapore(新加坡国立大学) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 本文提出一种以模型为中心的两阶段框架,通过抽象监听器捕捉模型的空间和时间行为,并将其连接到经典信息可视化流程,分析显示可视化模型结果、定量/名义数据类型和统计图表是主要关注点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27460 2026-03-31 cs.CV cs.AI

Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development

Project Imaging-X:1000多个开放访问医学影像数据集的调查

Zhongying Deng, Cheng Tang, Ziyan Huang, Jiashi Lin, Ying Chen, Junzhi Ning, Chenglong Ma, Jiyao Liu, Wei Li, Yinghao Zhu, Shujian Gao, Yanyan Huang, Sibo Ju, Yanzhou Su, Pengcheng Chen, Wenhao Tang, Tianbin Li, Haoyu Wang, Yuanfeng Ji, Hui Sun, Shaobo Min, Liang Peng, Feilong Tang, Haochen Xue, Rulin Zhou, Chaoyang Zhang, Wenjie Li, Shaohao Rui, Weijie Ma, Xingyue Zhao, Yibin Wang, Kun Yuan, Zhaohui Lu, Shujun Wang, Jinjie Wei, Lihao Liu, Dingkang Yang, Lin Wang, Yulong Li, Haolin Yang, Yiqing Shen, Lequan Yu, Xiaowei Hu, Yun Gu, Yicheng Wu, Benyou Wang, Minghui Zhang, Angelica I. Aviles-Rivero, Qi Gao, Hongming Shan, Xiaoyu Ren, Fang Yan, Hongyu Zhou, Haodong Duan, Maosong Cao, Shanshan Wang, Bin Fu, Xiaomeng Li, Zhi Hou, Chunfeng Song, Lei Bai, Yuan Cheng, Yuandong Pu, Xiang Li, Wenhai Wang, Hao Chen, Jiaxin Zhuang, Songyang Zhang, Huiguang He, Mengzhang Li, Bohan Zhuang, Zhian Bai, Rongshan Yu, Liansheng Wang, Yukun Zhou, Xiaosong Wang, Xin Guo, Guanbin Li, Xiangru Lin, Dakai Jin, Mianxin Liu, Wenlong Zhang, Qi Qin, Conghui He, Yuqiang Li, Ye Luo, Nanqing Dong, Jie Xu, Wenqi Shao, Bo Zhang, Qiujuan Yan, Yihao Liu, Jun Ma, Zhi Lu, Yuewen Cao, Zongwei Zhou, Jianming Liang, Shixiang Tang, Qi Duan, Dongzhan Zhou, Chen Jiang, Yuyin Zhou, Yanwu Xu, Jiancheng Yang, Shaoting Zhang, Xiaohong Liu, Siqi Luo, Yi Xin, Chaoyu Liu, Haochen Wen, Xin Chen, Alejandro Lozano, Min Woo Sun, Yuhui Zhang, Yue Yao, Xiaoxiao Sun, Serena Yeung-Levy, Xia Li, Jing Ke, Chunhui Zhang, Zongyuan Ge, Ming Hu, Jin Ye, Zhifeng Li, Yirong Chen, Yu Qiao, Junjun He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Institute of Optics and Fine Mechanics(上海光学精密机械研究所) Fudan University(复旦大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Fuzhou University(福州大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Incept Labs Monash University(莫纳什大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Alibaba DAMO Academy(阿里巴巴达摩院) The Hong Kong Polytechnic University(香港理工大学) South China University of Technology(华南理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与产业研究院) Shanghai Academy of Artificial Intelligence for Science(上海科学智能研究院) Nankai University(南开大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) School of Informatics, Xiamen University(厦门大学信息学院) University College London(伦敦大学学院) Sun Yat-sen University(中山大学) Alibaba Group, DAMO Academy, New York, NY, USA(阿里巴巴集团达摩院(纽约)) Tongji University(同济大学) University of Toronto(多伦多大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Johns Hopkins University(约翰霍普金斯大学) Arizona State University(亚利桑那州立大学) Academy for Clinical Innovation and Translation of Shanghai(上海临床创新转化研究院) University of California, Santa Cruz(加州大学圣克鲁兹分校) ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(阿尔托大学) Shandong University(山东大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文调查了1000多个开放访问医学影像数据集,揭示了其规模小、任务碎片化和分布不均的问题,并提出元数据驱动融合方法和交互发现门户,为医学影像数据集的整合和基础模型发展提供路线图。

Comments 157 pages, 19 figures, 26 tables. Project repo: \url{https://github.com/uni-medical/Project-Imaging-X}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27301 2026-03-31 cs.CV

Dual-Path Learning based on Frequency Structural Decoupling and Regional-Aware Fusion for Low-Light Image Super-Resolution

基于频率结构解耦和区域感知融合的双路径学习用于低光照图像超分辨率

Ji-Xuan He, Jia-Cheng Zhao, Feng-Qi Cui, Jinyang Huang, Yang Liu, Sirui Zhao, Meng Li, Zhi Liu

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) The University of Electro-Communications(电气通信大学)

AI总结 本文提出DTP框架,通过频率感知解耦和区域感知融合提升低光照图像超分辨率,改进PSNR、SSIM和LPIPS指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18845 2026-03-31 cs.CV

Echoes of ownership: Adversarial-guided dual injection for copyright protection in MLLMs

所有权的回声:对抗引导的双注入用于MLLMs中的版权保护

Chengwei Xia, Fan Ma, Ruijie Quan, Yunqiu Xu, Kun Zhan, Yi Yang

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出一种生成版权触发器的框架,通过双注入方法在MLLMs中嵌入可验证的版权信息,以在微调衍生模型中触发专属文本响应,同时在非衍生模型中保持无活性。

Comments Accepted to CVPR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22674 2026-03-31 cs.CV

VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration

VisionTrim: 一种用于无训练多模态大语言模型加速的统一视觉标记压缩方法

Hanxun Yu, Wentong Li, Xuan Qu, Song Wang, Junbo Chen, Jianke Zhu

机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) NUAA(南京航空航天大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出VisionTrim,通过整合DVTS和TGVC模块,有效减少视觉标记,提升多模态大语言模型在高分辨率和视频场景中的计算效率。

Comments ICLR2026, Code Link: https://github.com/hanxunyu/VisionTrim

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14015 2026-03-31 cs.CV

Prompting Depth Anything for 4K Resolution Accurate Metric Depth Estimation

通过提示深度任何事实现4K分辨率的准确度量深度估计

Haotong Lin, Sida Peng, Jingxiao Chen, Songyou Peng, Jiaming Sun, Minghuan Liu, Hujun Bao, Jiashi Feng, Xiaowei Zhou, Bingyi Kang

机构 * Zhejiang University(浙江大学) ByteDance Seed(字节跳动Seed) Shanghai Jiao Tong University(上海交通大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出Prompt Depth Anything,利用低成本LiDAR作为提示,通过多尺度融合设计实现4K分辨率的度量深度估计,并在ARKitScenes和ScanNet++数据集上取得新突破。

Comments CVPR 2025; Project page: https://PromptDA.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26841 2026-03-31 cs.LG cs.AI

FatigueFormer: Static-Temporal Feature Fusion for Robust sEMG-Based Muscle Fatigue Recognition

FatigueFormer: 静态-时间特征融合用于鲁棒的sEMG基肌肉疲劳识别

Tong Zhang, Hong Guo, Shuangzhou Yan, Dongkai Weng, Jian Wang, Hongxin Zhang

机构 * Zhejiang University(浙江大学)

AI总结 FatigueFormer通过结合显著性引导的特征分离与深度时间建模,实现从sEMG信号中学习可解释且通用的肌肉疲劳动态,提升低和高MVC条件下的性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26800 2026-03-31 cs.LG cs.AI physics.flu-dyn

DSO: Dual-Scale Neural Operators for Stable Long-term Fluid Dynamics Forecasting

DSO:双尺度神经算子用于稳定长期流体动力学预测

Huanshuo Dong, Hao Wu, Hong Wang, Qin-Yi Zhang, Zhezheng Hao

机构 * Institute for Clarity in Documentation(文档清晰度研究所) Inria Paris-Rocquencourt(法国国家信息与自动化研究所巴黎-罗康库尔) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhejiang University(浙江大学)

AI总结 本文提出DSO双尺度神经算子,通过分离局部细节和全局趋势处理,提升长期流体预测的稳定性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26795 2026-03-31 eess.AS cs.AI cs.SD

HASS: Hierarchical Simulation of Logopenic Aphasic Speech for Scalable PPA Detection

HASS:面向可扩展PPA检测的层次化日语口语模拟

Harrison Li, Kevin Wang, Cheol Jun Cho, Jiachen Lian, Rabab Rangwala, Chenxu Guo, Emma Yang, Lynn Kurteff, Zoe Ezzes, Willa Keegan-Rodewald, Jet Vonk, Siddarth Ramkrishnan, Giada Antonicelli, Zachary Miller, Marilu Gorno Tempini, Gopala Anumanchipalli

机构 * UC Berkeley(加州大学伯克利分校) UCSF(加州大学旧金山分校) Zhejiang University(浙江大学) Columbia University(哥伦比亚大学) Basque Center on Cognition, Brain and Language(巴斯克认知、大脑与语言中心)

AI总结 本文提出HASS框架,通过系统模拟lvPPA的语义、语音和时间缺陷,提升PPA检测模型的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26586 2026-03-30 cs.CV

MA-Bench: Towards Fine-grained Micro-Action Understanding

MA-Bench:迈向细粒度微动作理解

Kun Li, Jihao Gu, Fei Wang, Zhiliang Wu, Hehe Fan, Dan Guo

机构 * CVLab, College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息技术学院CVLab) University College London(伦敦大学学院) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 本文提出MA-Bench基准,包含1000个视频和三级评估架构,系统评估微动作识别与解释,通过23个MLLM的实验发现微动作细粒度理解存在挑战,并构建MA-Bench-Train训练集提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26328 2026-03-30 cs.CV

Verify Claimed Text-to-Image Models via Boundary-Aware Prompt Optimization

通过边界感知提示优化验证声称的文本到图像模型

Zidong Zhao, Yihao Huang, Qing Guo, Tianlin Li, Anran Li, Kailong Wang, Jin Song Dong, Geguang Pu

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Nankai University(南开大学) Beihang University(北京航空航天大学) University of Science and Technology of China(中国科学技术大学) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出边界感知提示优化方法,通过识别模型特定的边界相邻提示来验证文本到图像模型的真实性,实验显示其验证准确率优越。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26192 2026-03-30 cs.CV

HAD: Heterogeneity-Aware Distillation for Lifelong Heterogeneous Learning

HAD:面向终身异质学习的异质性感知知识蒸馏

Xuerui Zhang, Xuehao Wang, Zhan Zhuang, Linglan Zhao, Ziyue Li, Xinmin Zhang, Zhihuan Song, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) Zhejiang University(浙江大学) Technical University of Munich(慕尼黑工业大学) City University of Hong Kong(香港城市大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出HAD方法,用于解决终身异质学习中异质知识保留问题,通过两种互补损失函数提升预测分布平衡性和信息边缘像素学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20778 2026-03-30 cs.CV

PiLoT: Neural Pixel-to-3D Registration for UAV-based Ego and Target Geo-localization

PiLoT:基于无人机的自主与目标地理定位的神经像素到3D注册

Xiaoya Cheng, Long Wang, Yan Liu, Xinyi Liu, Hanlin Tan, Yu Liu, Maojun Zhang, Shen Yan

机构 * National University of Defense Technology(国防科技大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Hangzhou Dianzi University(杭州电子科技大学)

AI总结 PiLoT提出一个统一框架,通过直接将实时视频流与地理参考3D地图进行注册,解决无人机自主与目标定位问题,采用双线程引擎、大规模合成数据集和联合神经引导随机梯度优化器,实现高精度实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09435 2026-03-30 cs.CV

UniPart: Part-Level 3D Generation with Unified 3D Geom-Seg Latents

UniPart: 部级3D生成与统一3D几何-分割潜在表示

Xufan He, Yushuang Wu, Xiaoyang Guo, Chongjie Ye, Jiaqing Zhou, Tianlei Hu, Xiaoguang Han, Dong Du

机构 * Nanjing University of Science and Technology(南京理工大学) ByteDance Games(字节跳动游戏) Zhejiang University(浙江大学) FNii-Shenzhen(深圳福田国家创新研究院) SSE, CUHKSZ(香港中文大学(深圳)理工学院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来智能网络重点实验室)

AI总结 本文提出UniPart,一种基于统一3D几何-分割潜在表示的两阶段扩散框架,实现图像引导的部级3D生成,提升分割可控性和几何质量。

Comments Project page: https://xfanhe.github.io/projects/unipart/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11647 2026-03-30 cs.CV

IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment

IVEBench:现代指令引导视频编辑评估基准套件

Yinan Chen, Jiangning Zhang, Teng Hu, Yuxiang Zeng, Zhucun Xue, Qingdong He, Chengjie Wang, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学) University of Auckland(奥克兰大学) National University of Singapore(新加坡国立大学)

AI总结 IVEBench通过引入多样化的视频数据库和多维评估协议,解决现有视频编辑基准在评估指令引导视频编辑方面的不足,提供全面的人类对齐评估结果。

Comments Accepted by ICLR 2026. Equal contributions from first two authors. Project page: https://ryanchenyn.github.io/projects/IVEBench Code: https://github.com/RyanChenYN/IVEBench Dataset: https://huggingface.co/datasets/Coraxor/IVEBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00181 2026-03-30 cs.CV cs.AI

Uncovering What, Why and How: A Comprehensive Benchmark for Causation Understanding of Video Anomaly

揭示是什么、为什么和如何:面向视频异常因果理解的全面基准

Hang Du, Sicheng Zhang, Binzhu Xie, Guoshun Nan, Jiayang Zhang, Junrui Xu, Hangyu Liu, Sicong Leng, Jiangming Liu, Hehe Fan, Dajiu Huang, Jing Feng, Linli Chen, Can Zhang, Xuhuan Li, Hao Zhang, Jianhang Chen, Qimei Cui, Xiaofeng Tao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Queen Mary University of London(伦敦玛丽女王大学) Nanyang Technological University(南洋理工大学) Yunnan University(云南大学) Zhejiang University(浙江大学) China Telecom Co., Ltd. Sichuan Branch(中国电信股份有限公司四川分公司)

AI总结 本文提出CUVA基准,通过三种人类标注解决视频异常的'what'、'why'和'how'问题,并引入MMEval评估指标和基于提示的方法,验证其在异常因果理解中的有效性。

Comments Accepted in CVPR2024, Codebase: https://github.com/fesvhtr/CUVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25767 2026-03-30 cs.SD cs.AI eess.AS

Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods

解锁强监督:面向通用音频预训练方法的数据导向研究

Xuanru Zhou, Yiwen Shao, Wei-Cheng Tseng, Dong Yu

机构 * Zhejiang University(浙江大学) Tencent AI Lab(腾讯AI实验室) UT-Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出通过高质量数据构建强监督框架,对比不同预训练目标,发现数据质量和覆盖范围是性能关键因素,目标选择决定下游任务专精。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25494 2026-03-27 cs.CV

AdaSFormer: Adaptive Serialized Transformers for Monocular Semantic Scene Completion from Indoor Environments

AdaSFormer:适应性串行变压器用于从室内环境单目语义场景补全

Xuzhi Wang, Xinran Wu, Song Wang, Lingdong Kong, Ziping Zhao

机构 * Tianjin Normal University(天津师范大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出AdaSFormer,一种专为室内单目语义场景补全设计的串行变压器框架,通过自适应串行变压器、中心相对位置编码和卷积调制层归一化等设计,实现更高效的语义场景补全。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25463 2026-03-27 cs.CV

CIAR: Interval-based Collaborative Decoding for Image Generation Acceleration

基于区间的方法:用于图像生成加速的协作解码

Keming Ye, Zhou Zhao, Fan Wu, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出CIAR框架,通过设备端自验证处理图像生成中的大词汇量和空间冗余问题,采用连续概率区间加速处理并保持图像质量,实验显示在速度和云请求减少方面优于现有方法。

Comments 23 pages, 10 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25382 2026-03-27 cs.RO

IntentReact: Guiding Reactive Object-Centric Navigation via Topological Intent

IntentReact: 通过拓扑意图引导以对象为中心的反应式导航

Yanmei Jiao, Anpeng Lu, Wenhan Hu, Rong Xiong, Yue Wang, Huajin Tang, Wen-an Zhang

机构 * School of Information Science and Engineering, Hangzhou Normal University(杭州师范大学信息科学与工程学院) State Key Laboratory of Industrial Control and Technology, Zhejiang University(浙江大学工业控制技术国家重点实验室) Neuromorphic Computing and Robotic Cognition Lab, Zhejiang University(浙江大学神经形态计算与机器人认知实验室) Department of Automation, Zhejiang University of Technology(浙江工业大学自动化系)

AI总结 本文提出IntentReact框架,通过将全局拓扑指导编码为方向信号来引导机器人以对象为中心的反应式导航,提升导航精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25322 2026-03-27 cs.MA cs.AI

AD-CARE: A Guideline-grounded, Modality-agnostic LLM Agent for Real-world Alzheimer's Disease Diagnosis with Multi-cohort Assessment, Fairness Analysis, and Reader Study

AD-CARE:一种基于指南、模态无关的LLM代理,用于多队列评估、公平性分析和读者研究的阿尔茨海默病诊断

Wenlong Hou, Sheng Bi, Guangqian Yang, Lihao Liu, Ye Du, Hanxiao Xue, Juncheng Wang, Yuxiang Feng, Yue Xun, Nanxi Yu, Ning Mao, Mo Yang, Yi Wah Eva Cheung, Ling Long, Kay Chen Tan, Lequan Yu, Xiaomeng Ma, Shaozhen Yan, Shujun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院) Amazon(亚马逊) Zhejiang University(浙江大学) Sany AI(三一人工智能) Yantai Yuhuangding Hospital, Qingdao University(青岛大学烟台毓璜顶医院) The University of Hong Kong(香港大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院)

AI总结 AD-CARE通过整合临床指南和多模态数据,实现了多队列中84.9%的诊断准确率,显著提升诊断效率和公平性,适用于阿尔茨海默病的临床决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25243 2026-03-27 cs.AR cs.AI

FluxEDA: A Unified Execution Infrastructure for Stateful Agentic EDA

FluxEDA: 一种用于状态性代理EDA的统一执行基础设施

Zhengrui Chen, Zixuan Song, Yu Li, Qi Sun, Cheng Zhuo

机构 * Zhejiang University(浙江大学)

AI总结 本文提出FluxEDA,一种统一的状态性代理EDA基础设施,通过结构化请求响应和持久后端实例支持工具状态保留,实现异构EDA工具的多步分析与优化。

Comments qisunchn@zju.edu.cn, czhuo@zju.edu.cn

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09929 2026-03-27 cs.CV cs.AI

Monocular Normal Estimation via Shading Sequence Estimation

单目法线估计 via 阴影序列估计

Zongrui Li, Xinhua Ma, Minghui Hu, Yunqing Zhao, Yingchen Yu, Qian Zheng, Chang Liu, Xudong Jiang, Song Bai

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ByteDance(字节跳动) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) The State Key Lab of Brain-Machine Intelligence, Zhejiang University(浙江大学脑机智能全国重点实验室) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics, Shanghai University of Finance and Economics(上海财经大学计算与经济学交叉学科教育部重点实验室)

AI总结 本文提出通过阴影序列估计改进单目法线估计,通过生成阴影序列并求解普通最小二乘问题生成法线图,在合成数据集MultiShade上训练以增强鲁棒性,实验显示在真实数据集上达到最先进的性能。

Comments ICLR 2026 (Oral), Project page: https://xinhua694.github.io/RoSE.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12200 2026-03-27 cs.CV

CompBench: Benchmarking Complex Instruction-guided Image Editing

CompBench:复杂指令引导图像编辑的基准测试

Bohan Jia, Wenxuan Huang, Yuntian Tang, Junbo Qiao, Jincheng Liao, Shaosheng Cao, Fei Zhao, Zhaopeng Feng, Zhouhong Gu, Zhenfei Yin, Lei Bai, Wanli Ouyang, Lin Chen, Fei Zhao, Yao Hu, Zihan Wang, Yuan Xie, Shaohui Lin

机构 * East China Normal University(华东师范大学) Xiaohongshu Inc.(小红书) KLATASDS, MOE, China(中国教育部统计与数据科学重点实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Fudan University(复旦大学) University of Oxford(牛津大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

AI总结 CompBench旨在解决现有图像编辑基准测试对任务复杂度简化的问题,通过引入复杂指令引导的图像编辑基准,评估模型在精细操控能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.09843 2026-03-27 cs.CV

CODER: Coupled Diversity-Sensitive Momentum Contrastive Learning for Image-Text Retrieval

CODER: 耦合多样性敏感动量对比学习用于图像-文本检索

Haoran Wang, Dongliang He, Wenhao Wu, Boyang Xia, Min Yang, Fu Li, Yunlong Yu, Zhong Ji, Errui Ding, Jingdong Wang

机构 * Department of Computer Vision Technology (VIS), Baidu Inc., Beijing, China(百度公司计算机视觉技术部(VIS),北京,中国) Key Lab of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, Beijing, China(中国科学院智能信息处理重点实验室,中国科学院计算技术研究所,北京,中国) College of Information Science & Electronic Engineering, Zhejiang University, Hangzhou, China(浙江大学信息与电子工程学院,杭州,中国) School of Electrical & Information Engineering, Tianjin University, Tianjin, China(天津大学电气与信息工程学院,天津,中国) The University of Sydney, Sydney, Australia(悉尼大学,悉尼,澳大利亚)

AI总结 本文提出CODER,通过耦合多样性敏感动量对比学习提升跨模态表示,引入动态字典扩大图像-文本对规模,结合常识知识图谱生成概念级描述,实验表明在MSCOCO和Flickr30K上优于现有方法。

Comments Accepted by ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25072 2026-03-27 cs.CV

GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding

GIFT:全局不可替代性帧目标用于高效视频理解

Junpeng Ma, Sashuai Zhou, Guanghao Li, Xin Gao, Yue Cao, Hengyu Zeng, Yuxiang Yan, Zhibin Wang, Jun Song, Bo Zheng, Shanghang Zhang, Jian Pu

机构 * Institute of Science and Technology for Brain-inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Zhejiang University(浙江大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

AI总结 GIFT通过评估帧的内在不可替代性选择关键帧,解决视频理解中处理密集帧的高计算成本问题,提升视频分析效率。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25025 2026-03-27 cs.AI

System-Anchored Knee Estimation for Low-Cost Context Window Selection in PDE Forecasting

基于系统锚点的低成本上下文窗口选择方法用于PDE预测

Wenshuo Wang, Fan Zhang

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院) State Key Laboratory of Ocean Sensing & Ocean College, Zhejiang University(浙江大学海洋学院海洋传感国家重点实验室) Kavli Institute for Astrophysics and Space Research, Massachusetts Institute of Technology(麻省理工学院卡弗里天体物理与空间研究所)

AI总结 本文提出SAKE方法,通过系统锚点识别和膝点感知选择,实现低成本上下文窗口选择,提升PDE预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24947 2026-03-27 cs.AI econ.GN q-fin.EC

Shopping with a Platform AI Assistant: Who Adopts, When in the Journey, and What For

通过平台AI助手购物:谁采用、何时在旅程中、为何采用

Se Yan, Han Zhong, Zemin, Zhong, Wenyu Zhou

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院) International Business School, Zhejiang University(浙江大学国际联合商学院)

AI总结 本文研究消费者在电子商务中采用平台嵌入式购物AI的行为特征,发现AI助手在探索性产品发现中起补充作用,而非替代传统搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24578 2026-03-26 cs.CV eess.IV

Vision-Language Models vs Human: Perceptual Image Quality Assessment

视觉-语言模型与人类:感知图像质量评估

Imran Mehmood, Imad Ali Shah, Ming Ronnier Luo, Brian Deegan

机构 * School of Engineering, University of Galway(Galway大学工程学院) State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(浙江大学极端光信息获取国家重点实验室)

AI总结 本文研究视觉语言模型是否能近似人类对图像质量的感知判断,通过对比心理物理数据,发现模型在颜色丰富度上表现优异,但在对比度上表现较差,且模型一致性与人类对齐性存在矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20732 2026-03-26 cs.LG cs.CV

Continual GUI Agents

连续GUI代理

Ziwei Liu, Borui Kang, Hangjie Yuan, Zixiang Zhao, Wei Li, Yifan Zhu, Tao Feng

机构 * Department of Computer Science and Technology, Tsinghua University, China(计算机科学与技术系,清华大学,中国) College of Computer Science, Zhejiang University, China(浙江大学计算机科学学院,中国) College of Computer Science, Beijing University of Posts and Telecommunications, China(北京邮电大学计算机科学学院,中国)

AI总结 本文提出连续GUI代理任务,通过引入GUI-Anchoring in Flux框架,解决GUI分布变化时持续学习稳定性问题,实验显示其优于现有方法。

Comments Code is available at: https://github.com/xavierliu34/GUI-AiF

详情

展开后加载摘要…

URL PDF HTML 收藏