arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1182
2503.15986 2026-01-12 cs.NE cs.CV

SpiLiFormer: Enhancing Spiking Transformers with Lateral Inhibition

SpiLiFormer:通过横向抑制增强脉冲变换器

Zeqi Zheng, Yanchen Huang, Yingchao Yu, Zizheng Zhu, Junfeng Tang, Zhaofei Yu, Yaochu Jin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) Donghua University(东华大学) University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学)

AI总结 SpiLiFormer通过引入横向抑制机制,提升脉冲变换器对相关上下文的注意力,从而在多个数据集上取得更优性能。

Comments Accepted by ICCV 2025. The first two authors contributed equally

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 24539-24548

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17722 2026-01-09 cs.CV cs.AI

MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues

MT-Video-Bench: 一个多轮对话中评估多模态大语言模型的综合视频理解基准

Yaning Pan, Qianqian Xie, Guohui Zhang, Zekun Wang, Yongqian Wen, Yuanxing Zhang, Haoxuan Hu, Zhiyu Pan, Yibing Huang, Zhidong Gan, Yonghong Lin, An Ping, Shihao Li, Yanghai Wang, Tianhao Peng, Jiaheng Liu

机构 * Fudan University(复旦大学) NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技)

AI总结 MT-Video-Bench通过评估多轮对话中多模态大语言模型的6项核心能力,揭示其在处理多轮视频对话任务中的性能差异和局限性。

Comments Project Website: https://github.com/NJU-LINK/MT-Video-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04463 2026-01-09 cs.CL cs.AI

Beyond Static Summarization: Proactive Memory Extraction for LLM Agents

超越静态摘要:为LLM代理的主动记忆提取

Chengyuan Yang, Zequn Sun, Wei Wei, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) National Institute of Healthcare Data Science, Nanjing University, China(健康数据科学国家研究院,南京大学)

AI总结 本文提出ProMem,一种主动记忆提取方法,通过递归反馈机制提升LLM代理的记忆完整性和问答准确性,实现高质量与低成本的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12730 2026-01-09 cs.CL

NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents

NL2Repo-Bench: 向编码代理的长周期仓库生成评估迈进

Jingzhe Ding, Shengda Long, Changxin Pu, Huan Zhou, Hongwan Gao, Xiang Gao, Chao He, Yue Hou, Fei Hu, Zhaojian Li, Weiran Shi, Zaiyuan Wang, Daoguang Zan, Chenchen Zhang, Xiaoxu Zhang, Qizhi Chen, Xianfu Cheng, Bo Deng, Qingshui Gu, Kai Hua, Juntao Lin, Pai Liu, Mingchen Li, Xuanguang Pan, Zifan Peng, Yujia Qin, Yong Shan, Zhewen Tan, Weihao Xie, Zihan Wang, Yishuo Yuan, Jiayu Zhang, Enduo Zhao, Yunfei Zhao, He Zhu, Liya Zhu, Chenyang Zou, Ming Ding, Jianpeng Jiao, Jiaheng Liu, Minghao Liu, Qian Liu, Chongyang Tao, Jian Yang, Tong Yang, Zhaoxiang Zhang, Xinjie Chen, Wenhao Huang, Ge Zhang

机构 * Nanjing University(南京大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

AI总结 NL2Repo-Bench通过评估编码代理在长周期内生成仓库的能力,揭示了自主软件开发中的核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03955 2026-01-08 cs.CV

ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation

ResTok: 在1D视觉分词器中学习层次化残差以实现自回归图像生成

Xu Zhang, Cheng Da, Huan Yang, Kun Gai, Ming Lu, Zhan Ma

机构 * Vision Lab, Nanjing University(南京大学视觉实验室) Kolors Team, Kuaishou Technology(快手技术Kolors团队)

AI总结 ResTok通过引入层次化残差机制提升自回归图像生成效果,实现更高效的潜在分布建模与生成过程。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24867 2026-01-07 cs.CL cs.AI

Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements

Encyclo-K:通过动态组成的知识陈述评估LLM

Yiming Liang, Yizhi Li, Yantao Du, Ge Zhang, Jiayi Zhou, Yuchen Wu, Yinzhu Piao, Denghui Cao, Tong Sun, Ziniu Li, Li Du, Bo Lei, Jiaheng Liu, Chenghua Lin, Zhaoxiang Zhang, Wenhao Huang, Jiajun Zhang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) The University of Manchester(曼彻斯特大学)

AI总结 Encyclo-K通过动态组合知识陈述,提出了一种评估LLM全面理解能力的基准测试框架,有效解决了现有基准测试的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01141 2026-01-06 eess.IV cs.CV

YODA: Yet Another One-step Diffusion-based Video Compressor

YODA: 另一种一步扩散视频压缩器

Xingchen Li, Junzhe Zhang, Junqi Shi, Ming Lu, Zhan Ma

机构 * School of Electronic Science and Engineering, Nanjing University(电子科学与工程学院,南京大学)

AI总结 YODA通过嵌入时间参考的多尺度特征,结合线性扩散变换器,实现了更高效的视频压缩,其在多个感知指标上均优于现有方法。

Comments Code will be available at https://github.com/NJUVISION/YODA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07252 2026-01-06 cs.CV eess.IV eess.SP

Semantic Communications with Computer Vision Sensing for Edge Video Transmission

面向边缘视频传输的语义通信与计算机视觉传感

Yubo Peng, Luping Xiang, Kun Yang, Kezhi Wang, Merouane Debbah

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Intelligent Software and Engineering, Nanjing University (Suzhou Campus)(智能软件与工程学院,南京大学(苏州校区)) Department of Computer Science, Brunel University London(计算机科学系,布伦尔大学伦敦分校)

AI总结 本文提出了一种面向边缘视频传输的语义通信与计算机视觉传感框架,通过自适应压缩比模型和智能传感方案提升传输效率,同时保持关键语义信息的完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12692 2026-01-06 cs.CL

FormulaReasoning: A Dataset for Formula-Based Numerical Reasoning

FormulaReasoning:一个用于基于公式的数值推理的数据集

Xiao Li, Bolin Zhu, Kaiwen Shi, Sichen Liu, Yin Zhu, Yiwei Liu, Gong Cheng

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室)

AI总结 FormulaReasoning数据集通过引入基于物理原理的数值推理任务,提供细粒度注释和扩展版本,评估多种推理框架,揭示公式推理中的关键挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24165 2026-01-01 cs.CV

DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models

DiffThinker: 向基于扩散模型的生成多模态推理迈进

Zefeng He, Xiaoye Qu, Yafu Li, Tong Zhu, Siyuan Huang, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 DiffThinker通过基于扩散模型的生成方法,在多模态推理任务中实现了更高效的视觉推理和更精确的空间处理,显著优于现有模型。

Comments Project page: https://diffthinker-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24022 2026-01-01 cs.CV cs.AI

FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing

FUSE-RSVLM:用于遥感的特征融合视觉-语言模型

Yunkai Dang, Donghao Wang, Jiacheng Yang, Yifan Jiang, Meiyi Zhu, Yuekun Yang, Cong Wang, Qi Fan, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence Science and Technology, Nanjing University(人工智能科学与技术学院,南京大学)

AI总结 FUSE-RSVLM通过多特征融合技术提升遥感图像的视觉-语言处理能力,有效解决细粒度特征提取和视觉遗忘问题,在遥感分类、图像描述和VQA任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21414 2026-01-01 cs.CV

Adapting In-Domain Few-Shot Segmentation to New Domains without Source Domain Retraining

在新领域中无需源领域再训练即可适应领域内少样本分割

Qi Fan, Kaiqi Liu, Nian Liu, Hisham Cholakkal, Rao Muhammad Anwer, Wenbin Li, Yang Gao

机构 * Nanjing University(南京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出ISA方法,通过在推理过程中学习领域特征,适应已训练的FSS模型结构,无需源领域再训练,提升跨领域少样本分割性能。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15272 2026-01-01 cs.CL cs.AI cs.CV

OmniBench: Towards The Future of Universal Omni-Language Models

OmniBench: 向通用多语言模型的未来迈进

Yizhi Li, Yinghao Ma, Ge Zhang, Ruibin Yuan, Kang Zhu, Hangyu Guo, Yiming Liang, Jiaheng Liu, Zekun Wang, Jian Yang, Siwei Wu, Xingwei Qu, Jinjie Shi, Xinyue Zhang, Zhenzhu Yang, Yidan Wen, Yanghai Wang, Shihao Li, Zhaoxiang Zhang, Zachary Liu, Emmanouil Benetos, Wenhao Huang, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Queen Mary University of London(伦敦大学玛丽女王学院) Hongkong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Dartmouth College(达特茅斯学院)

AI总结 OmniBench提出了一种评估通用多语言模型三模态处理能力的基准,揭示了现有模型在多模态推理中的不足,并提出OmniInstruct数据集以改进训练方法。

Comments Accepted by The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03146 2025-12-30 cs.CL

MME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacity

MME-CC:认知能力多模态评估基准

Kaiyuan Zhang, Chenghao Yang, Zhoufutu Wen, Sihang Yuan, Qiuyue Wang, Chaoyi Huang, Guosheng Zhu, He Wang, Huawenyu Lu, Jianing Wen, Jianpeng Jiao, Lishu Luo, Longxiang Liu, Sijin Wu, Xiaolei Zhu, Xuanliang Zhang, Yu Liu, Ge Zhang, Yi Lin, Guang Shi, Chaoyou Fu, Wenhao Huang

机构 * Nanjing University(南京大学)

AI总结 MME-CC提出一个以视觉为基础的多模态评估基准,系统评估大语言模型在空间、几何和知识推理中的认知能力,揭示封闭源模型在总体表现上的优势及空间几何推理的薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14404 2025-12-30 cs.CV

ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations

ViC-Bench: 用自由式中间状态表示法对多模态大语言模型的视觉交错链式思维能力进行基准测试

Xuecheng Wu, Jiaxing Liu, Danlei Huang, Yifan Wang, Yunyun Shi, Kedi Chen, Junxiao Xue, Yang Liu, Chunlin Chen, Hairong Dong, Dingkang Yang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Meituan Inc.(美团公司) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Robotics and Automation, Nanjing University(南京大学机器人与自动化学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

AI总结 ViC-Bench 通过自由式中间状态表示法,系统评估多模态大语言模型的视觉交错链式思维能力,涵盖四个任务并提出新评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22605 2025-12-30 cs.AI cs.CV

Learning Multi-Modal Mobility Dynamics for Generalized Next Location Recommendation

学习多模态移动动态以实现通用的下一站推荐

Junshu Dai, Yu Wang, Tongya Zheng, Wei Ji, Qinghong Guo, Ji Cao, Jie Song, Canghong Jin, Mingli Song

机构 * Zhejiang University(浙江大学) Hangzhou City University(杭州市大学) Nanjing University(南京大学)

AI总结 本文提出多模态移动(M^3ob)方法,通过构建统一时空关系图和门控机制,提升位置推荐任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02005 2025-12-30 cs.CV

Learning Visual Affordance from Audio

从音频学习视觉可及性

Lidong Lu, Guo Chen, Zhu Wei, Yicheng Liu, Tong Lu

机构 * Nanjing University(南京大学) China Mobile Communications Company Limited Research Institute(中国移动通信有限公司研究院)

AI总结 AVAGFormer通过融合音频和视觉信号,实现了从音频学习视觉可及性的任务,提升了交互区域的识别性能。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22029 2025-12-29 cs.LG cs.AI

LibContinual: A Comprehensive Library towards Realistic Continual Learning

LibContinual:面向真实连续学习的综合性库

Wenbin Li, Shangge Liu, Borui Kang, Yiyang Chen, KaXuan Lew, Yang Chen, Yinghuan Shi, Lei Wang, Yang Gao, Jiebo Luo

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Computing and Information Technology, University of Wollongong, Australia(沃林戈大学计算与信息科技学院) Department of Computer Science, University of Rochester, USA(罗切斯特大学计算机科学系)

AI总结 LibContinual提出一个综合性库,旨在解决持续学习中的现实约束问题,通过统一框架和严格评估揭示方法的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21675 2025-12-29 cs.CV

UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture

UniPercept:迈向跨美学、质量、结构和纹理的统一感知级图像理解

Shuo Cao, Jiayang Li, Xiaohui Li, Yuandong Pu, Kaiwen Zhu, Yuanting Gao, Siqi Luo, Yi Xin, Qi Qin, Yu Zhou, Xiangyu Chen, Wenlong Zhang, Bin Fu, Yu Qiao, Yihao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学) Sun Yat-sen University(中山大学) Tele-AI Website(Tele-AI网站)

AI总结 UniPercept通过领域自适应预训练和任务对齐强化学习,实现跨美学、质量、结构和纹理的统一感知级图像理解,优于现有多模态大语言模型。

Comments 27 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21302 2025-12-25 cs.CV

AndroidLens: Long-latency Evaluation with Nested Sub-targets for Android GUI Agents

AndroidLens: 长延迟评估与嵌套子目标用于Android GUI代理

Yue Cao, Yingyao Wang, Pi Bu, Jingxuan Xing, Wei Jiang, Zekun Zhu, Junpeng Ma, Sashuai Zhou, Tong Lu, Jun Song, Yu Cheng, Yuning Jiang, Bo Zheng

机构 * Nanjing University(南京大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) Zhejiang University(浙江大学)

AI总结 AndroidLens通过引入571个长延迟任务和嵌套子目标,评估Android GUI代理的性能,揭示了现实环境中任务完成的挑战。

Comments 23 pages, 13 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20135 2025-12-25 cs.AI

MolAct: An Agentic RL Framework for Molecular Editing and Property Optimization

MolAct:一种用于分子编辑和性质优化的代理强化学习框架

Zhuo Yang, Yeyun Chen, Jiaqing Xie, Ben Gao, Shuaike Shen, Wanhao Liu, Liujia Yang, Beilun Wang, Tianfan Fu, Yuqiang Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xidian University(西安电子科技大学) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Nanjing University(南京大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 MolAct框架通过代理强化学习方法,实现了分子编辑和性质优化的多步骤、工具增强过程,提升了分子设计的可靠性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19320 2025-12-23 cs.LG cs.AI cs.CL cs.CV

MAGIC: Achieving Superior Model Merging via Magnitude Calibration

MAGIC: 通过幅度校准实现卓越的模型合并

Yayuan Li, Jian Zhang, Jintao Guo, Zihan Cheng, Lei Qi, Yinghuan Shi, Yang Gao

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) National Institute of Healthcare Data Science(医疗数据科学国家研究院) Nanjing University(南京大学) Shanghai Jiao Tong University Medical School Affiliated Ruijin Hospital(上海交通大学附属瑞金医院医学院) School of Computer Science and Engineering(计算机科学与工程学院) Key Lab of Computer Network and Information Integration(计算机网络与信息集成重点实验室) Southeast University(东南大学)

AI总结 MAGIC通过校正特征和权重空间的幅度,提升模型合并性能,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14501 2025-12-23 cs.CV

Advances in Feed-Forward 3D Reconstruction and View Synthesis: A Survey

反向馈送3D重建与视角合成的进展:综述

Jiahui Zhang, Yuelei Li, Anpei Chen, Muyu Xu, Kunhao Liu, Jianyuan Wang, Xiao-Xiao Long, Hanxue Liang, Zexiang Xu, Hao Su, Christian Theobalt, Christian Rupprecht, Andrea Vedaldi, Kaichen Zhou, Hanspeter Pfister, Paul Pu Liang, Shijian Lu, Fangneng Zhan

机构 * NTU(国立台湾大学) Caltech(加州理工学院) Westlake University(西湖大学) UCSD(加州大学圣地亚哥分校) University of Oxford(牛津大学) Nanjing University(南京大学) HKU(香港大学) University of Cambridge(剑桥大学) Hillbot MPI for Informatics(信息研究所) Harvard University(哈佛大学) MIT(麻省理工学院)

AI总结 本文综述了反向馈送方法在3D重建与视角合成中的进展,涵盖多种表示架构及应用,探讨了关键任务和未来研究方向。

Comments A project page associated with this survey is available at https://fnzhan.com/projects/Feed-Forward-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17319 2025-12-22 cs.CV cs.AI cs.MM

A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs

超高分辨率遥感多模态大语言模型基准

Yunkai Dang, Meiyi Zhu, Donghao Wang, Yizhuo Zhang, Jiacheng Yang, Qi Fan, Yuekun Yang, Wenbin Li, Feng Miao, Yang Gao

机构 * School of Artificial Intelligence Science and Technology, Nanjing University(人工智能科学与技术学院,南京大学) School of Physics, Nanjing University(物理学院,南京大学)

AI总结 本文提出RSHR-Bench,一个超高分辨率遥感多模态大语言模型基准,通过高分辨率图像和多样化任务评估视觉理解与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16491 2025-12-22 cs.AI

Best Practices For Empirical Meta-Algorithmic Research: Guidelines from the COSEAL Research Network

元算法研究的最佳实践:来自COSEAL研究网络的指南

Theresa Eimer, Lennart Schäpermeier, André Biedenkapp, Alexander Tornede, Lars Kotthoff, Pieter Leyman, Matthias Feurer, Katharina Eggensperger, Kaitlin Maile, Tanja Tornede, Anna Kozak, Ke Xue, Marcel Wever, Mitra Baratchi, Damir Pulatov, Heike Trautmann, Haniye Kashgarani, Marius Lindauer

机构 * Leibniz University Hannover(莱比锡大学汉诺威分校) L3S Research Center(L3S研究中心) University of Münster(穆尔斯特大学) University Freiburg(弗赖堡大学) University of St. Andrews(圣安德鲁斯大学) Ghent University(根特大学) TU Dortmund University(多特蒙德技术大学) Lamarr Institute for Machine Learning and Artificial Intelligence(Lamarr机器学习与人工智能研究所) Google(谷歌) Warsaw University of Technology(华沙技术大学) Nanjing University(南京大学) Leiden University(莱顿大学) University of North Carolina Wilmington(北卡罗来纳大学 Wilmington分校) Paderborn University(帕德博恩大学) Purdue University(普渡大学)

AI总结 本文提出元算法研究的最佳实践指南,涵盖实验设计、执行及结果分析,旨在提升研究的可扩展性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16538 2025-12-19 cs.CR cs.LG

A Systematic Study of Code Obfuscation Against LLM-based Vulnerability Detection

对抗基于大语言模型的漏洞检测的代码混淆系统研究

Xiao Li, Yue Li, Hao Wu, Yue Zhang, Yechao Zhang, Fengyuan Xu, Sheng Zhong

机构 * National Key Lab for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Shandong University(山东大学) Nanyang Technological University(南洋理工大学)

AI总结 本文系统研究了对抗基于大语言模型的漏洞检测的代码混淆技术,评估了不同混淆方法对LLM检测性能的影响,并提出了未来改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10918 2025-12-19 cs.RO

Unleashing Humanoid Reaching Potential via Real-world-Ready Skill Space

通过现实-ready技能空间释放人形机器人的抓取潜力

Zhikai Zhang, Chao Chen, Han Xue, Jilong Wang, Sikai Liang, Yun Liu, Zongzhang Zhang, He Wang, Li Yi

机构 * IIIS, Tsinghua University(清华大学人工智能研究院) Peking University(北京大学) Galbot Shanghai AI Laboratory(上海人工智能实验室) Shanghai Qi Zhi Institute(上海智院) Nanjing University(南京大学) Tongji University(同济大学)

AI总结 本研究提出R2S2方法,通过现实-ready技能空间提升人形机器人在现实环境中的抓取能力,实现高效且鲁棒的仿真到现实转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09676 2025-12-19 cs.CV

SpatialVID: A Large-Scale Video Dataset with Spatial Annotations

SpatialVID: 一个具有空间标注的大规模视频数据集

Jiahao Wang, Yufeng Yuan, Rujie Zheng, Youtian Lin, Jian Gao, Lin-Zhuo Chen, Yajie Bao, Yi Zhang, Chang Zeng, Yanxi Zhou, Xiao-Xiao Long, Hao Zhu, Zhaoxiang Zhang, Xun Cao, Yao Yao

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 SpatialVID是一个包含大规模真实视频和密集3D注释的数据集,旨在提升视频和3D视觉研究中的模型泛化能力与性能。

Comments Project page: https://nju-3dv.github.io/projects/SpatialVID/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09560 2025-12-19 eess.IV cs.CV

StructDiff: Structure-aware Diffusion Model for 3D Fine-grained Medical Image Synthesis

StructDiff: 一种结构感知的扩散模型用于3D细粒度医学图像合成

Jiahao Xia, Yutao Hu, Yaolei Qi, Zhenliang Li, Wenqi Shao, Junjun He, Ying Fu, Longjiang Zhang, Guanyu Yang

机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及跨学科应用关键实验室(东南大学),中华人民共和国教育部,中国) Jiangsu Province Joint International Research Laboratory of Medical Information Processing, Southeast University, Nanjing, China(江苏省医疗信息处理联合国际研究实验室(东南大学),南京市,中国) Univ Rennes, CHU Rennes, Inserm, LTSI– UMR 1099, F-35000 Rennes, France(里昂大学,里昂大学医院,Inserm,LTSI– UMR 1099,法国里昂,法国) Shanghai AI Laboratory(上海人工智能实验室) School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(计算机科学与技术学院,北京理工大学,北京,中国) Department of Radiology, Jinling Hospital, Affiliated Hospital of Medical School, Nanjing University, Nanjing, China(放射科,南京大学附属医院,南京大学,南京,中国)

AI总结 StructDiff通过结构感知扩散模型解决3D医学图像细粒度生成中的拓扑一致性和细节还原问题,提升下游分割性能。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14700 2025-12-19 cs.CV

Sparse-Tuning: Adapting Vision Transformers with Efficient Fine-tuning and Inference

稀疏微调:通过高效微调和推理适应视觉变换器

Ting Liu, Xuyang Liu, Liangtao Shi, Zunnan Xu, Yue Hu, Siteng Huang, Yi Xin, Bineng Zhong, Donglin Wang

机构 * College of Systems Engineering and State Key Laboratory of Digital Intelligent Modeling and Simulation, National University of Defense Technology(系统工程学院和数字智能建模与仿真国家重点实验室,国防科技大学) College of Electronics and Information Engineering, Sichuan University(电子信息工程学院,四川大学) Key Laboratory of Knowledge Engineering with Big Data, Hefei University of Technology(大数据知识工程重点实验室,合肥工业大学) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学) School of Engineering, Westlake University(工程学院,西湖大学) Tsinghua University(清华大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Key Laboratory of Education Blockchain and Intelligent Technology, Ministry of Education, Guangxi Normal University(教育区块链与智能技术重点实验室,教育部,广西师范大学)

AI总结 稀疏微调通过结合标记稀疏化和密集适配器技术,在保持性能的同时显著提升计算和内存效率。

详情

展开后加载摘要…

URL PDF HTML 收藏