arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1186
2512.16538 2025-12-19 cs.CR cs.LG

A Systematic Study of Code Obfuscation Against LLM-based Vulnerability Detection

对抗基于大语言模型的漏洞检测的代码混淆系统研究

Xiao Li, Yue Li, Hao Wu, Yue Zhang, Yechao Zhang, Fengyuan Xu, Sheng Zhong

机构 * National Key Lab for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Shandong University(山东大学) Nanyang Technological University(南洋理工大学)

AI总结 本文系统研究了对抗基于大语言模型的漏洞检测的代码混淆技术,评估了不同混淆方法对LLM检测性能的影响,并提出了未来改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10918 2025-12-19 cs.RO

Unleashing Humanoid Reaching Potential via Real-world-Ready Skill Space

通过现实-ready技能空间释放人形机器人的抓取潜力

Zhikai Zhang, Chao Chen, Han Xue, Jilong Wang, Sikai Liang, Yun Liu, Zongzhang Zhang, He Wang, Li Yi

机构 * IIIS, Tsinghua University(清华大学人工智能研究院) Peking University(北京大学) Galbot Shanghai AI Laboratory(上海人工智能实验室) Shanghai Qi Zhi Institute(上海智院) Nanjing University(南京大学) Tongji University(同济大学)

AI总结 本研究提出R2S2方法,通过现实-ready技能空间提升人形机器人在现实环境中的抓取能力,实现高效且鲁棒的仿真到现实转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09676 2025-12-19 cs.CV

SpatialVID: A Large-Scale Video Dataset with Spatial Annotations

SpatialVID: 一个具有空间标注的大规模视频数据集

Jiahao Wang, Yufeng Yuan, Rujie Zheng, Youtian Lin, Jian Gao, Lin-Zhuo Chen, Yajie Bao, Yi Zhang, Chang Zeng, Yanxi Zhou, Xiao-Xiao Long, Hao Zhu, Zhaoxiang Zhang, Xun Cao, Yao Yao

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 SpatialVID是一个包含大规模真实视频和密集3D注释的数据集,旨在提升视频和3D视觉研究中的模型泛化能力与性能。

Comments Project page: https://nju-3dv.github.io/projects/SpatialVID/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09560 2025-12-19 eess.IV cs.CV

StructDiff: Structure-aware Diffusion Model for 3D Fine-grained Medical Image Synthesis

StructDiff: 一种结构感知的扩散模型用于3D细粒度医学图像合成

Jiahao Xia, Yutao Hu, Yaolei Qi, Zhenliang Li, Wenqi Shao, Junjun He, Ying Fu, Longjiang Zhang, Guanyu Yang

机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及跨学科应用关键实验室(东南大学),中华人民共和国教育部,中国) Jiangsu Province Joint International Research Laboratory of Medical Information Processing, Southeast University, Nanjing, China(江苏省医疗信息处理联合国际研究实验室(东南大学),南京市,中国) Univ Rennes, CHU Rennes, Inserm, LTSI– UMR 1099, F-35000 Rennes, France(里昂大学,里昂大学医院,Inserm,LTSI– UMR 1099,法国里昂,法国) Shanghai AI Laboratory(上海人工智能实验室) School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(计算机科学与技术学院,北京理工大学,北京,中国) Department of Radiology, Jinling Hospital, Affiliated Hospital of Medical School, Nanjing University, Nanjing, China(放射科,南京大学附属医院,南京大学,南京,中国)

AI总结 StructDiff通过结构感知扩散模型解决3D医学图像细粒度生成中的拓扑一致性和细节还原问题,提升下游分割性能。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14700 2025-12-19 cs.CV

Sparse-Tuning: Adapting Vision Transformers with Efficient Fine-tuning and Inference

稀疏微调:通过高效微调和推理适应视觉变换器

Ting Liu, Xuyang Liu, Liangtao Shi, Zunnan Xu, Yue Hu, Siteng Huang, Yi Xin, Bineng Zhong, Donglin Wang

机构 * College of Systems Engineering and State Key Laboratory of Digital Intelligent Modeling and Simulation, National University of Defense Technology(系统工程学院和数字智能建模与仿真国家重点实验室,国防科技大学) College of Electronics and Information Engineering, Sichuan University(电子信息工程学院,四川大学) Key Laboratory of Knowledge Engineering with Big Data, Hefei University of Technology(大数据知识工程重点实验室,合肥工业大学) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学) School of Engineering, Westlake University(工程学院,西湖大学) Tsinghua University(清华大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Key Laboratory of Education Blockchain and Intelligent Technology, Ministry of Education, Guangxi Normal University(教育区块链与智能技术重点实验室,教育部,广西师范大学)

AI总结 稀疏微调通过结合标记稀疏化和密集适配器技术,在保持性能的同时显著提升计算和内存效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15524 2025-12-18 cs.CV

DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion Representations

DeX-Portrait: 通过显式和潜在运动表示实现解耦且表达性的肖像动画

Yuxiang Shi, Zhe Li, Yanwen Wang, Hao Zhu, Xun Cao, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究所) Nanjing University(南京大学)

AI总结 DeX-Portrait通过显式和潜在运动表示生成解耦且表达性的肖像动画,提升动画质量和可控性。

Comments Projectpage: https://syx132.github.io/DeX-Portrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15335 2025-12-18 cs.LG cs.CR

Bits for Privacy: Evaluating Post-Training Quantization via Membership Inference

比特与隐私:通过成员推断评估训练后量化

Chenxiang Zhang, Tongxi Qu, Zhong Li, Tian Zhang, Jun Pang, Sjouke Mauw

机构 * Department of Computer Science University of Luxembourg(计算机科学系卢森堡大学) Department of Computer Science Nanjing University(计算机科学系南京大学)

AI总结 研究通过成员推断攻击评估训练后量化在隐私和效用之间的平衡,发现低精度量化可显著降低隐私泄露风险,但会牺牲模型效用。

Comments accepted at TrustCom 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14750 2025-12-18 q-bio.QM cs.AI

Multiscale Cross-Modal Mapping of Molecular, Pathologic, and Radiologic Phenotypes in Lipid-Deficient Clear Cell Renal CellCarcinoma

多尺度跨模态映射分子、病理和放射表型在脂质缺乏型清细胞癌肾癌中的应用

Ying Cui, Dongzhe Zheng, Ke Yu, Xiyin Zheng, Xiaorui Wang, Xinxiang Li, Yan Gu, Lin Fu, Xinyi Chen, Wenjie Mei, Xin-Gui Peng

机构 * Nurturing Center of Jiangsu Province for State Laboratory of AI Imaging & Interventional Radiology, Department of Radiology, Zhongda Hospital, School of Medicine, Southeast University(江苏省人工智能影像与介入放射学 state laboratory 育成中心,放射科,中大医院,东南大学) Department of Mechanical and Aerospace Engineering, Princeton University(机械与航空航天工程系,普林斯顿大学) School of Automation, Southeast University(自动化学院,东南大学) Department of Biomedical Engineering, Columbia University(生物医学工程系,哥伦比亚大学) Automation and Electrical Engineering College, Lanzhou University of Technology(自动化与电气工程学院,兰州理工大学) The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学附属第一医院,生命科学与医学学院,中国科学技术大学) Lianyungang First People’s Hospital(连云港第一人民医院) School of Robotics and Automation, Suzhou Campus, Nanjing University(机器人与自动化学院,南京大学苏智校区)

AI总结 本研究提出多尺度跨模态框架,用于术前识别脂质缺乏型清细胞肾癌的分子、病理和放射表型,实现非侵入性分子表型分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14542 2025-12-17 cs.CV

HiFi-Portrait: Zero-shot Identity-preserved Portrait Generation with High-fidelity Multi-face Fusion

HiFi-Portrait: 零样本身份保留肖像生成的高保真多脸融合

Yifang Xu, Benxiang Zhai, Yunzhuo Sun, Ming Li, Yang Li, Sidan Du

机构 * Nanjing University(南京大学) Dalian University of Technology(大连理工大学) Nanjing University of Information Science and Technology(南京信息科技大学)

AI总结 HiFi-Portrait通过高保真多脸融合技术实现零样本身份保留肖像生成,提升了面部相似性和可控性,同时兼容SDXL工作。

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02483 2025-12-17 cs.CV cs.GR

OLATverse: A Large-scale Real-world Object Dataset with Precise Lighting Control

OLATverse:一个具有精确光照控制的大规模真实世界物体数据集

Xilong Zhou, Jianchun Chen, Pramod Rao, Timo Teufel, Linjie Lyu, Tigran Minasian, Oleksandr Sotnychenko, Xiao-Xiao Long, Marc Habermann, Christian Theobalt

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Nanjing University(南京大学)

AI总结 OLATverse通过大规模真实物体和精确光照控制,为反向渲染和法线估计提供首个全面的现实世界基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14040 2025-12-17 cs.CV cs.LG

ChartAgent: A Chart Understanding Framework with Tool Integrated Reasoning

ChartAgent: 一种集成工具推理的图表理解框架

Boran Wang, Xinming Wang, Yi Chen, Xiang Li, Jian Xu, Jing Yuan, Chenglin Liu

机构 * College of Artificial Intelligence, Nankai University(人工智能学院,南开大学) University of Chinese Academy of Sciences(中国科学院大学) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institution of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室(MAIS),自动化研究所,中国科学院) Zhongguancun Academy(中关村学院) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

AI总结 ChartAgent通过集成工具推理框架提升图表理解的鲁棒性与可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07584 2025-12-17 cs.LG

MIRA: Medical Time Series Foundation Model for Real-World Health Data

MIRA:面向真实世界健康数据的医学时间序列基础模型

Hao Li, Bowen Deng, Chang Xu, Zhiyuan Feng, Viktor Schlegel, Yu-Hao Huang, Yizheng Sun, Jingyuan Sun, Kailai Yang, Yiyao Yu, Jiang Bian

机构 * Microsoft Research(微软研究院) University of Manchester(曼彻斯特大学) Peking University(北京大学) Tsinghua University(清华大学) Nanjing University(南京大学) Imperial Global Singapore, Imperial College London(帝国理工学院伦敦分校)

AI总结 MIRA是一种专为医学时间序列预测设计的基础模型,通过连续时间旋转位置编码、频率特定混合专家层和连续动态外推块,实现对不规则时间间隔、异质采样率和缺失值的高效处理,提升医疗时间序列数据的预测精度和跨机构迁移能力。

Comments NeurIPS 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08648 2025-12-16 cs.CV

Repulsor: Accelerating Generative Modeling with a Contrastive Memory Bank

Repulsor:利用对比记忆库加速生成建模

Shaofeng Zhang, Xuanqi Chen, Ning Liao, Haoxiang Zhao, Xiaoxing Wang, Haoru Tan, Sitong Wu, Xiaosong Jia, Qi Fan, Junchi Yan

机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(人工智能与数据科学学院,中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) HKU(香港大学) CUHK(香港大学) Fudan University(复旦大学) Nanjing University(南京大学)

AI总结 Repulsor通过对比记忆库机制,无需外部编码器,实现高效的生成建模,显著提升收敛速度和生成质量。

Comments 19 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05503 2025-12-16 cs.AR cs.LG

iEEG Seizure Detection with a Sparse Hyperdimensional Computing Accelerator

通过稀疏超维度计算加速器实现iEEG癫痫检测

Stef Cuyckens, Ryan Antonio, Chao Fang, Marian Verhelst

机构 * KU Leuven, Belgium(卢森堡大学) Nanjing University, China(南京大学)

AI总结 本文提出稀疏超维度计算加速器,通过压缩内存和简化空间捆绑,提升iEEG癫痫检测的能耗和面积效率,实现更小的植入设备和更长的电池寿命。

Comments To appear at the 20th International Conference on PhD Research in Microelectronics and Electronics (PRIME 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12793 2025-12-16 cs.CV

ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution

ViCO: 一种面向语义感知动态高分辨率的训练策略

Long Cui, Weiyun Wang, Jie Shao, Zichen Wen, Gen Luo, Linfeng Zhang, Yanting Zhang, Yu Qiao, Wenhai Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Nanjing University(南京大学) Donghua University(东华大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 ViCO通过动态调整视觉标记数量以适应图像语义复杂度,有效降低推理成本的同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22404 2025-12-16 cs.AR cs.RO

Efficient Precision-Scalable Hardware for Microscaling (MX) Processing in Robotics Learning

高效精度可扩展硬件用于机器人学习中的微缩处理(MX)

Stef Cuyckens, Xiaoling Yi, Nitish Satya Murthy, Chao Fang, Marian Verhelst

机构 * KU Leuven, Belgium(卢森堡大学) Nanjing University, China(南京大学)

AI总结 本文提出了一种高效精度可扩展硬件,支持微缩处理,通过子字并行和统一整数浮点处理,提升机器人边缘持续学习的能效和吞吐量。

Comments To appear in 2025 IEEE/ACM International Symposium on Low Power Electronics and Design (ISLPED 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12196 2025-12-16 cs.MM cs.CV cs.SD eess.AS

AutoMV: An Automatic Multi-Agent System for Music Video Generation

AutoMV: 一种自动多智能体系统用于音乐视频生成

Xiaoxuan Tang, Xinping Lei, Chaoran Zhu, Shiyun Chen, Ruibin Yuan, Yizhi Li, Changjae Oh, Ge Zhang, Wenhao Huang, Emmanouil Benetos, Yang Liu, Jiaheng Liu, Yinghao Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学) Queen Mary University of London(伦敦大学女王学院) Hong Kong University of Science and Technology(香港科技大学) University of Manchester(曼彻斯特大学)

AI总结 AutoMV通过多智能体协作生成完整音乐视频,优于现有方法并接近专业水准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19766 2025-12-12 cs.RO

SEA: Semantic Map Prediction for Active Exploration of Uncertain Areas

基于语义地图预测的主动探索不确定区域方法

Hongyu Ding, Xinyue Liang, Yudong Fang, You Wu, Jieqi Shi, Jing Huo, Wenbin Li, Jing Wu, Yu-Kun Lai, Yang Gao

机构 * School of Computer Science, Nanjing University(南京大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Cardiff University(卡地夫大学)

AI总结 本文提出SEA方法,通过语义地图预测和强化学习策略,实现高效主动探索不确定区域。

Comments Project page: https://robo-lavira.github.io/sea-active-exp

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09920 2025-12-11 cs.RO cs.AI cs.CV

LISN: Language-Instructed Social Navigation with VLM-based Controller Modulating

LISN: 基于VLM控制器的指令引导社交导航

Junting Chen, Yunchuan Li, Panfeng Jiang, Jiacheng Du, Zixuan Chen, Chenrui Tie, Jiajun Deng, Lin Shao

机构 * RoboScience Co.(RoboScience公司) ShanghaiTech University(上海科技大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

AI总结 LISN通过VLM控制器实现指令引导的社交导航,提出首个标准化基准并提升动态避障能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08188 2025-12-10 cs.RO cs.AI cs.CV

Embodied Tree of Thoughts: Deliberate Manipulation Planning with Embodied World Model

具身思维树:基于具身世界模型的 deliberative 操控规划

Wenjiang Xu, Cindy Wang, Rui Fang, Mingkang Zhang, Lusong Li, Jing Xu, Jiayuan Gu, Zecui Zeng, Rui Chen

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tsinghua University(清华大学) JD Explore Academy(京东探索学院) ShanghaiTech University(上海科技大学) Nanjing University(南京大学)

AI总结 EToT通过基于物理的交互数字双胞胎实现具身世界模型,结合先验分支和反思分支机制,提升机器人操控规划的物理一致性和鲁棒性。

Comments Website at https://embodied-tree-of-thoughts.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07007 2025-12-10 cs.CV

MELLM: A Flow-Guided Large Language Model for Micro-Expression Understanding

MELLM:一种面向微表情理解的流引导大型语言模型

Sirui Zhao, Zhengye Zhang, Shifeng Liu, Xinglong Mao, Shukang Yin, Chaoyou Fu, Tong Xu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Nanjing University(南京大学)

AI总结 MELLM通过结合光学流敏感性与LLM推理能力,首次实现对微表情的全面理解,显著提升微表情识别的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02242 2025-12-10 cs.CV cs.LG

Parameter-Efficient Fine-Tuning for Pre-Trained Vision Models: A Survey and Benchmark

预训练视觉模型的参数高效微调:调查与基准

Yi Xin, Jianjiang Yang, Siqi Luo, Yuntao Du, Qi Qin, Kangrui Cen, Yangfan He, Zhiwei Zhang, Bin Fu, Xiaokang Yang, Guangtao Zhai, Ming-Hsuan Yang, Xiaohong Liu

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of Bristol(布里斯托大学) Shandong University(山东大学) University of Sydney(悉尼大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) The Pennsylvania State University(宾夕法尼亚州立大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of California at Merced(加州大学默塞德分校)

AI总结 本文调查了预训练视觉模型参数高效微调的最新进展,提出了V-PEFT Bench基准,并探讨了未来研究方向。

Comments Submitted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07175 2025-12-09 cs.LG

SPACE: Noise Contrastive Estimation Stabilizes Self-Play Fine-Tuning for Large Language Models

SPACE:噪声对比估计稳定了大语言模型的自我对战微调

Yibo Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) Alibaba International Digital Commerce(阿里巴巴国际数字商业) Pazhou Laboratory (Huangpu)(琶洲实验室(黄埔))

AI总结 SPACE通过噪声对比估计稳定大语言模型的自我对战微调,提升下游任务性能

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13157 2025-12-09 cs.AR cs.AI cs.CV eess.IV

Image2Net: Datasets, Benchmark and Hybrid Framework to Convert Analog Circuit Diagrams into Netlists

Image2Net: 用于将模拟电路图转换为网表的数据集、基准和混合框架

Haohang Xu, Chengjie Liu, Qihang Wang, Wenhao Huang, Yongjian Xu, Weiyu Chen, Anlan Peng, Zhijun Li, Bo Li, Lei Qi, Jun Yang, Yuan Du, Li Du

机构 * School of Electronic Science and Engineering, Nanjing University, Nanjing, China(南京大学电子科学与工程学院) School of Integrated Circuit, South East University, Nanjing, China(东南大学集成电路学院) National Center of Technology Innovation for EDA, Nanjing, China(EDA技术创新国家中心)

AI总结 Image2Net通过混合框架和新数据集,有效将模拟电路图转换为网表,提升LLM在模拟IC设计中的应用效果。

Comments 10 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06272 2025-12-09 cs.CL cs.CE

Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models

黄金触点:一种全面的双语基准,用于评估金融大语言模型

Xiaojun Wu, Junxi Liu, Huanyi Su, Zhouchi Lin, Yiyan Qi, Chengjin Xu, Jiajun Su, Jiajie Zhong, Fuwei Wang, Saizhuo Wang, Fengrui Hua, Jia Li, Jian Guo

机构 * IDEA Research(IDEA研究机构) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) South China Normal University(华南师范大学) DataArcTech Ltd.(DataArcTech有限公司)

AI总结 本研究提出Golden Touchstone双语基准,用于全面评估金融大语言模型的性能,通过对比分析揭示模型在处理复杂金融信息时的优势与局限。

Comments Published in Findings of EMNLP 2025

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 22544-22560, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01341 2025-12-09 cs.CV

Enhancing Test Time Adaptation with Few-shot Guidance

通过少样本指导增强测试时间适应

Siqi Luo, Yi Xin, Yuntao Du, Tao Tan, Guangtao Zhai, Xiaohong Liu

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Software & Joint SDU-NTU Centre for Artificial Intelligence Research, Shandong University(软件学院及SDU-NTU联合人工智能研究中心,山东大学) Macao Polytechnic University(澳门理工学院)

AI总结 本文提出少样本测试时间适应(FS-TTA)方法,通过结合少量样本支持集和原型记忆库指导,提升模型在跨领域场景下的适应性能和可靠性。

Comments Submitted to TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06674 2025-12-09 cs.CV

RunawayEvil: Jailbreaking the Image-to-Video Generative Models

RunawayEvil: 对图像到视频生成模型的劫持

Songping Wang, Rufan Qian, Yueming Lyu, Qinglong Liu, Linzhuang Zou, Jie Qin, Songhua Liu, Caifeng Shan

机构 * PRLab, Nanjing University(南京大学PRLab) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

AI总结 RunawayEvil是一种针对图像到视频生成模型的多模态劫持框架,通过自我进化机制实现动态攻击策略,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06533 2025-12-09 cs.LG cs.AI

Beyond Token-level Supervision: Unlocking the Potential of Decoding-based Regression via Reinforcement Learning

超越标记级监督:通过强化学习解锁解码回归的潜力

Ming Chen, Sheng Tang, Rong-Xi Tan, Ziniu Li, Jiacheng Chen, Ke Xue, Chao Qian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学)

AI总结 本文提出通过强化学习提升基于解码的回归性能,引入序列级信号以提高预测精度和采样效率,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20058 2025-12-08 cs.CV

M3DHMR: Monocular 3D Hand Mesh Recovery

M3DHMR:单目3D手网格恢复

Yihong Lin, Xianjia Wu, Xilai Wang, Jianqiao Hu, Songju Lei, Xiandong Li, Wenxiong Kang

机构 * South China University of Technology(华南理工大学) Huawei Cloud(华为云) Nanjing University(南京大学)

AI总结 M3DHMR通过动态螺旋卷积和感兴趣区域层,实现单目3D手网格的高效恢复,优于现有实时方法。

Comments 9 pages, 5 figures

Journal ref IEEE International Joint Conference on Biometrics (IJCB 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01826 2025-12-08 cs.CV

GLDiTalker: Speech-Driven 3D Facial Animation with Graph Latent Diffusion Transformer

GLDiTalker: 基于图潜在扩散变换器的语音驱动3D面部动画

Yihong Lin, Zhaoxin Fan, Xianjia Wu, Lingyu Xiong, Liang Peng, Xiandong Li, Wenxiong Kang, Songju Lei, Huang Xu

机构 * South China University of Technology(南方科技大学) Beihang University(北航) Huawei Cloud(华为云) Nanjing University(南京大学)

AI总结 GLDiTalker通过图潜在扩散变换器解决语音驱动3D面部动画中的模态不一致问题,提升唇形同步精度和运动多样性。

Comments 9 pages, 5 figures

Journal ref the 34th International Joint Conference on Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏