arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-03-17 至 2026-03-17 共收录 8
2603.15539 2026-03-17 cs.LG

Vib2ECG: A Paired Chest-Lead SCG-ECG Dataset and Benchmark for ECG Reconstruction

Vib2ECG:一种配对的胸导体SCG-ECG数据集和用于ECG重建的基准

Guorui Lu, Xiaohui Cai, Todor Stefanov, Qinyu Chen

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University(莱顿先进计算机科学研究所(LIACS)、莱顿大学) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

AI总结 本文提出Vib2ECG数据集,用于从低成本振动信号重建ECG,展示了轻量U-Net在多导联ECG重建中的可行性,并分析了模型生成虚假ECG波形的问题。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15302 2026-03-17 cs.CV

Generative Video Compression with One-Dimensional Latent Representation

基于一维潜在表示的生成视频压缩

Zihan Zheng, Zhaoyang Jia, Naifu Xue, Jiahao Li, Bin Li, Zongyu Guo, Xiaoyi Zhang, Zhenghao Chen, Houqiang Li, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Communication University of China(通信大学) Microsoft Research Asia(微软亚洲研究院) University of Newcastle(新castle大学)

AI总结 本文提出GVC1D方法,通过一维潜在表示替代二维网格,减少空间和时间冗余,实现更高效的视频压缩。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15020 2026-03-17 cs.CV cs.CL

MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal

MER-Bench:多模态表情包再解释的综合基准

Yiqi Nie, Fei Wang, Junjie Chen, Kun Li, Yudi Cai, Dan Guo, Chenglong Li, Meng Wang

机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息学院) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院)

AI总结 本文提出MER-Bench,一个用于多模态表情包再解释的综合基准,通过多模态大语言模型评估结构保持、语义一致性和情感转换,揭示现有系统在约束满足上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14976 2026-03-17 cs.MM cs.CV

Anchoring Emotions in Text: Robust Multimodal Fusion for Mimicry Intensity Estimation

在文本中锚定情绪:用于模仿强度估计的鲁棒多模态融合

Lingsi Zhu, Yuefeng Zou, Yunxiang Zhang, Naixiang Zheng, Guoyuan Wang, Jun Yu, Jiaen Liang, Wei Huang, Shengping Liu, Ximin Zheng

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co., Ltd.(Unisound人工智能科技有限公司) Pingan Technology Co., Ltd.(平安科技有限公司)

AI总结 本文提出TAEMI框架,通过文本锚定机制融合多模态数据,提升在噪声和缺失数据下的情绪模仿强度估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14917 2026-03-17 eess.AS cs.AI cs.LG eess.SP

Spectrogram features for audio and speech analysis

基于频谱图的音频和语音分析特征

Ian McLoughlin, Lam Pham, Yan Song, Xiaoxiao Miao, Huy Phan, Pengfei Cai, Qing Gu, Jiang Nan, Haoyu Song, Donny Soh

机构 * Singapore Institute of Technology(新加坡理工学院) Austrian Institute of Technology(奥地利理工学院) The University of Science and Technology of China(中国科学技术大学) Meta Inc., Reality Labs(Meta公司,现实实验室)

AI总结 本文探讨频谱图在音频和语音分析中的应用,回顾其在不同任务中与后端分类器架构的匹配性,总结其在深度学习中的优势与挑战。

Comments 30 pages

Journal ref Analysis. Appl. Sci. 2026, 16, 572

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13361 2026-03-17 cs.CV cs.AI stat.ML

BrainCast: A Spatio-Temporal Forecasting Model for Whole-Brain fMRI Time Series Prediction

BrainCast:一种用于全脑fMRI时间序列预测的时空预测模型

Yunlong Gao, Jinbo Yang, Li Xiao, Haiye Huo, Yang Ji, Hao Wang, Aiying Zhang, Yu-Ping Wang

机构 * Institute of Advanced Technology, University of Science and Technology of China(科学技术大学先进技术研究院) MoE Key Laboratory of Brain-Inspired Intelligence Perception and Cognition, University of Science and Technology of China(科学技术大学脑启发智能感知与认知教育部重点实验室) School of Mathematics and Computer Sciences, Nanchang University(南昌大学数学与计算机科学学院) School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院) Department of Biomedical Engineering, Tulane University(路易斯安那大学医学工程系)

AI总结 本文提出BrainCast模型,通过联合建模感兴趣区域内的时序动态和跨区域的空间交互,提升全脑fMRI时间序列预测性能,从而提升下游认知能力预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13349 2026-03-17 cs.CV cs.AI

MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval

MURE:基于视觉-语言模型的多分辨率编码框架用于视觉文档检索

Fengbin Zhu, Zijing Cai, Yuzhe Wang, Pengyang Shao, Wenjie Wang, Fuli Feng, Richang Hong, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) University of Science and Technology of China, China(中国科学技术大学) Hefei University of Technology, China(合肥工业大学)

AI总结 本文提出MURE框架,通过多分辨率采样编码、跨粒度特征融合和语义感知聚类机制,提升视觉文档检索效率与效果,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01050 2026-03-17 cs.CV cs.AI cs.GR

EgoGrasp: World-Space Hand-Object Interaction Estimation from Egocentric Videos

EgoGrasp:从第一人称视频中估计世界空间手-物体交互

Hongming Fu, Wenjia Wang, Xiaozhen Qiao, Rolandos Alexandros Potamias, Taku Komura, Shuo Yang, Zheng Liu, Bo Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 EgoGrasp提出了一种从动态第一人称视频中重建世界空间手-物体交互的方法,支持开放词汇物体,通过多阶段框架实现鲁棒的3D重建与姿态估计。

详情

展开后加载摘要…

URL PDF HTML 收藏