arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1177
2605.01356 2026-05-05 cs.LG cs.AI

Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data

基于模型的主动成本生成:用于在有限违规数据下学习安全策略

Ruiqi Xue, Lei Yuan, Kainuo Cheng, Jing-Wen Yang, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Polixir Technologies Nanjing, China(南京Polixir科技有限公司) Tencent Game AI Center Shenzhen, China(腾讯深圳游戏AI中心)

AI总结 本文提出PROCO框架,利用大语言模型整合自然语言知识,通过构建保守成本函数和模型基于的模拟,减少约束违规并提升安全性,适用于离线数据中极少或无违规样本的高风险场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01330 2026-05-05 cs.CV

Colinearity Decay: Training Quantization-Friendly ViTs with Outlier Decay

共线性衰减:通过异常衰减训练量化友好的视觉Transformer

Jin Tong, Guang Liang, Peilin Sun, Jianxin Wu

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Zhongguancun Academy, Beijing(中关村学院)

AI总结 本文提出Colinearity-Decay方法,通过结构正则化控制Transformer块内的矩阵对对齐,减少极端激活,提升低比特部署精度,同时保持全精度性能。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01293 2026-05-05 cs.AI

Lifting Traces to Logic: Programmatic Skill Induction with Neuro-Symbolic Learning for Long-Horizon Agentic Tasks

将轨迹提升到逻辑:基于神经符号学习的程序化技能诱导用于长视界代理任务

Jie-Jing Shao, Haiyan Yin, Yueming Lyu, Xingrui Yu, Lan-Zhe Guo, Ivor Tsang, James Kwok, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学) Centre for Frontier AI Research(前沿人工智能研究中心) Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,新加坡科技研究局) Department of Computer Science and Engineering, Hong Kong University of Science and Technology, China(香港科学与技术大学计算机科学与工程系)

AI总结 本文提出NSI框架,通过将交互轨迹提升为模块化逻辑 grounded 程序,使代理能从少量示例中归纳技能并适应新目标,优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01255 2026-05-05 cs.LG

Activation Compression in LLMs: Theoretical Analysis and Efficient Algorithm

LLMs中的激活压缩:理论分析与高效算法

Wen-Da Wei, Han-Bin Fang, Yang-Di Liu, Jiang-Xin Shi, James Kwok, Yu-Feng Li

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Hong Kong University of Science and Technology(香港科学大学)

AI总结 本文提出一种激活-梯度联合压缩方法,通过低秩因子压缩线性层梯度,无需额外计算,提升LLM训练效率与压缩性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00658 2026-05-04 cs.CV

UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

UniVidX:一种基于扩散先验的统一多模态框架,用于 versatile 视频生成

Houyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu, Shaocong Xu, Weiqing Xiao, Yuwei Guo, Chongjie Ye, Lvmin Zhang, Hao Zhao, Anyi Rao

机构 * Beihang University(北京航空航天大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

AI总结 UniVidX 提出一种统一多模态框架,通过扩散先验实现 versatile 视频生成,采用随机条件掩码、解耦门控LoRA和跨模态自注意力等设计,提升多模态一致性与生成性能。

Comments Project page: https://houyuanchen111.github.io/UniVidX.github.io/ Accepted to ACM Transactions on Graphics (Proceedings of SIGGRAPH 2026)

Journal ref ACM Trans. Graph. 45, 4, Article 51 (July 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00513 2026-05-04 cs.CL cs.LG

ControBench: An Interaction-Aware Benchmark for Controversial Discourse Analysis on Social Networks

ControBench:一种考虑交互的争议性 discourse 分析社交网络基准

Ta Thanh Thuy, Jiaqi Zhu, Xuan Liu, Lin Shang, Reihaneh Rabbany, Guillaume Rabusseau, Lihui Chen, Zheng Yilun, Sitao Luan

机构 * Nanyang Technological University(南洋理工大学) NVIDIA(NVIDIA公司) Nanjing University(南京大学) Mila - Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) University of Montreal(蒙特利尔大学)

AI总结 ControBench结合异质社交交互图与丰富文本语义,通过Reddit讨论数据构建,用于研究争议性 discourse 分析中的政治极化、虚假信息和内容审核问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00510 2026-05-04 cs.LG cs.CV physics.comp-ph

Scale-Aware Adversarial Analysis: A Diagnostic for Generative AI in Multiscale Complex Systems

基于尺度的对抗分析:生成AI在多尺度复杂系统中的诊断

Mengke Zhao, Guang-Xing Li, Duo Xu, Keping Qiu

机构 * School of Astronomy and Space Science, Nanjing University(南京大学天文与空间科学学院) South-Western Institute for Astronomy Research, Yunnan University(云南西南天文研究所) Key Laboratory of Modern Astronomy and Astrophysics (Nanjing University), Ministry of Education(南京大学现代天文与天体物理重点实验室) Canadian Institute for Theoretical Astrophysics, University of Toronto(多伦多大学加拿大理论天体物理研究所)

AI总结 本文提出基于约束扩散分解的诊断框架,用于评估生成AI在多尺度复杂系统中的性能,揭示模型在物理约束下的稳定性与连续性问题。

Comments submitted, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00498 2026-05-04 cs.CV

GOR-IS: 3D Gaussian Object Removal in the Intrinsic Space

GOR-IS: 在内在空间中进行3D高斯物体移除

Yonghao Zhao, Yupeng Gao, Jian Yang, Jin Xie, Beibei Wang

机构 * Nankai University(南开大学) Nanjing University(南京大学)

AI总结 本文提出GOR-IS框架,通过分解场景为内在组件并建模光传输,实现物理一致且视觉连贯的3D物体移除,实验表明其在感知相似度和PSNR上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22285 2026-05-04 cs.CV

VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding

VideoDetective:通过外在查询和内在相关性进行长视频理解的线索搜索

Ruoliu Yang, Chu Wu, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出VideoDetective框架,通过结合查询与片段的相关性及片段间亲和力,有效定位长视频问答中的关键片段,提升多模态大语言模型在长视频理解中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27958 2026-05-01 cs.CV

TripVVT: A Large-Scale Triplet Dataset and a Coarse-Mask Baseline for In-the-Wild Video Virtual Try-On

TripVVT:一个大规模三元组数据集和一个粗略遮罩基线用于真实场景视频虚拟试穿

Dingbao Shao, Song Wu, Shenyi Wang, Ye Wang, Ziheng Tang, Fei Liu, Jiang Lin, Xinyu Chen, Qian Wang, Ying Tai, Jian Yang, Zili Yi

机构 * Nanjing University, China(南京大学) JIUTIAN Research, CMCC, China(JIUTIAN研究院,CMCC,中国) Jilin University, China(吉林大学) ByteDance Inc., China(字节跳动公司)

AI总结 本文提出TripVVT-10K数据集和TripVVT框架,通过改进的遮罩先验提升视频虚拟试穿的鲁棒性和质量,同时建立评估基准以验证其在复杂场景中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27464 2026-05-01 cs.CR cs.AI

Security Attack and Defense Strategies for Autonomous Agent Frameworks: A Layered Review with OpenClaw as a Case Study

自主代理框架的安全攻击与防御策略:以OpenClaw为案例的分层综述

Luyao Xu, Xiang Chen

机构 * School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学) State Key Lab. for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

AI总结 本文通过分层分析探讨自主代理框架的安全风险与防御策略,以OpenClaw为案例,揭示威胁跨层传播的可能性及未来研究方向。

Comments 14 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27426 2026-05-01 cs.CR cs.AI

Secret Stealing Attacks on Local LLM Fine-Tuning through Supply-Chain Model Code Backdoors

通过供应链模型代码后门进行本地LLM微调中的秘密窃取攻击

Zi Li, Tian Zhou, Wenze Li, Jingyu Hua, Yunlong Mao, Sheng Zhong

机构 * Nanjing University(南京大学)

AI总结 研究揭示本地微调数据中敏感信息泄露风险,提出通过供应链代码后门实现主动执行劫持,引入确定性全链记忆机制,实现高精度秘密窃取,实验表明方法在不干扰主要任务的前提下达到98%以上的ASR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27383 2026-05-01 eess.IV cs.CV

A Real-time Scale-robust Network for Glottis Segmentation in Nasal Transnasal Intubation

一种实时尺度鲁棒网络用于鼻内气管插管中的声带分割

Yang Zhou, Chaoyong Zhang, Ruoyi Hao, Huilin Pan, Yang Zhang, Hongliang Ren

机构 * School of Mechanical Engineering, Hubei University of Technology(湖北工业大学机械工程学院) National Key Laboratory for Novel Software Technology, Department of Computer Science and Technology, Nanjing University(南京大学新型软件技术国家重点实验室,计算机科学与技术系) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系) Shun Hing Institute of Advanced Engineering, The Chinese University of Hong Kong(香港中文大学顺安先进工程研究院)

AI总结 本文提出了一种轻量级多感受野特征提取模块,用于提高鼻内气管插管中声带分割的鲁棒性和精度,实验表明其在三个数据集上表现优异,达到92.9%的mDice分数。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27296 2026-05-01 cs.SE cs.CL

To Diff or Not to Diff? Structure-Aware and Adaptive Output Formats for Efficient LLM-based Code Editing

要进行差异生成还是不进行差异生成?面向高效LLM代码编辑的结构感知和自适应输出格式

Wei Cheng, Yongchang Cao, Chen Shen, Binhua Li, Jue Chen, Yongbin Li, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) Tongyi Lab, Alibaba Group, China(通义实验室,阿里巴巴集团,中国)

AI总结 本文提出BlockDiff和FuncDiff两种结构感知差异格式及AdaEdit策略,通过减少生成复杂度提升长代码编辑效率,准确度与全代码生成相当,降低30%以上延迟和成本。

Comments Accepted in the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22201 2026-05-01 cs.RO

Make Tracking Easy: Neural Motion Retargeting for Humanoid Whole-body Control

让跟踪变得容易:用于双足机器人全身控制的神经运动重定向

Qingrui Zhao, Kaiyue Yang, Xiyu Wang, Shiqi Zhao, Yi Lu, Xinfang Zhang, Qiu Shen, Xiao-Xiao Long, Xun Cao

机构 * Nanjing University(南京大学) Huawei Technologies(华为技术)

AI总结 本文提出NMR框架,通过学习数据分布而非优化最优解,解决传统重定向方法的非凸性问题,提升双足机器人在复杂环境中的运动能力。

Comments Report, 12 pages, 5 figures, 4 tables, webpage: https://nju3dv-humanoidgroup.github.io/nmr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13682 2026-04-30 cs.AI cs.CL

ChinaTravel: An Open-Ended Travel Planning Benchmark with Compositional Constraint Validation for Language Agents

ChinaTravel: 一个带有组合约束验证的开放旅行规划基准,用于语言代理

Jie-Jing Shao, Bo-Wen Zhang, Xiao-Wen Yang, Baizhi Chen, Si-Yu Han, Jinghao Pang, Wen-Da Wei, Guohao Cai, Zhenhua Dong, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University, China(南京大学智能科学与技术学院) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) Noah’s Ark Lab, Huawei, China(华为诺亚实验室)

AI总结 ChinaTravel通过开放数据集和组合通用领域语言,提升语言代理在复杂真实场景中的约束满足能力,实现37%的约束满足率,比纯神经模型提升10倍。

Comments ICLR 2026. Webpage: https://www.lamda.nju.edu.cn/shaojj/chinatravel

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09925 2026-04-30 cs.CV

FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding

FLARE:完全整合视觉-语言表示以实现深度跨模态理解

Zheng Liu, Mengjie Liu, Jingzhou Chen, Jingwei Xu, Bin Cui, Conghui He, Wentao Zhang

机构 * Peking University Shanghai AI Laboratory(北京大学上海人工智能实验室) Nanjing University(南京大学) Peking University(北京大学) Shanghai AI Laboratory(上海人工智能实验室) Zhongguancun Academy Beijing Key Laboratory of Data Intelligence and Security(中关村北京数据智能与安全重点实验室)

AI总结 FLARE通过全视觉-语言对齐与整合范式实现深度跨模态理解,提出文本引导视觉编码、上下文感知对齐解码、双语义映射损失和文本驱动VQA合成等核心方法,展现优于现有方法的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24575 2026-04-28 cs.CV

Diffusion Model as a Generalist Segmentation Learner

扩散模型作为通用分割学习者

Haoxiao Wang, Antao Xiang, Haiyang Sun, Peilin Sun, Changhao Pan, Yifu Chen, Minjie Hong, Weijie Wang, Shuang Chen, Yue Chen, Zhou Zhao

机构 * Zhejiang University(浙江大学) South China University of Technology(华南理工大学) Nanjing University(南京大学) Peking University(北京大学)

AI总结 本文提出DiGSeg,利用预训练扩散模型实现通用分割框架,通过编码图像和掩码到潜在空间,并结合CLIP对齐的文本路径,实现基于外观和任意文本提示的结构化分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23632 2026-04-28 cs.CV cs.MM cs.SD

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

Hallo-Live: 实时流式联合音频-视频虚拟形象生成与异步双流及以人类为中心的偏好蒸馏

Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Baidu(百度)

AI总结 本文提出Hallo-Live框架,通过异步双流扩散与人类中心偏好蒸馏实现高保真实时音频视频虚拟形象生成,达到高吞吐量与低延迟,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23580 2026-04-28 cs.RO cs.AI

PhysCodeBench: Benchmarking Physics-Aware Symbolic Simulation of 3D Scenes via Self-Corrective Multi-Agent Refinement

PhysCodeBench: 通过自校正多代理细化进行3D场景的物理感知符号模拟基准测试

Tianyidan Xie, Peiyu Wang, Yuyi Qian, Yuxuan Wang, Rui Ma, Ying Tai, Song Wu, Qian Wang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Skywork AI Jilin University(吉林大学) JIUTIAN Research(JIUTIAN研究院) Tianjin University(天津大学)

AI总结 本文提出PhysCodeBench,首个评估物理感知符号模拟的基准,包含700个手动构建的样本,通过自校正多代理框架SMRF实现67.7分的性能,优于现有模型31.4分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23574 2026-04-28 cs.CV

PhysLayer: Language-Guided Layered Animation with Depth-Aware Physics

PhysLayer:基于语言的分层动画与深度感知物理

Tianyidan Xie, Zhentao Huang, Mingjie Wang, Xin Huang, Jun Zhou, Minglun Gong, Zili Yi

机构 * Nanjing University(南京大学) University of Guelph(圭尔夫大学) Zhejiang Sci-Tech University(浙江科技大学) Dalian Maritime University(大连海事大学)

AI总结 PhysLayer通过深度感知物理模拟和语言引导,实现静态图像的分层动画生成,提升了物理真实性和可控性,实验结果显示在多个指标上均有显著提升。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12971 2026-04-28 cs.RO

INHerit-SG: Incremental Hierarchical Semantic Scene Graphs with RAG-Style Retrieval

INHerit-SG:增量式层次语义场景图与RAG风格检索

YukTungSamuel Fang, Zhikang Shi, Jiabin Qiu, Zixuan Chen, Jieqi Shi, Hao Xu, Jing Huo, Yang Gao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Beihang University(北京航空航天大学)

AI总结 本文提出INHerit-SG,通过异步双流架构构建RAG-ready知识库,解决复杂嵌入查询与持续语义图构建问题,实验表明在复杂查询中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11480 2026-04-28 cs.LG cs.AI

LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment

LearnAlign: 用于改进梯度对齐的LLM强化学习数据选择

Shipeng Li, Zhiqin Yang, Shikun Li, Xiaobo Xia, Hengyu Liu, Xinghua Zhang, Gaode Chen, Dong Fang, Ying Tai, Zhe Peng

机构 * Nanjing University(南京大学) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

AI总结 LearnAlign通过改进梯度对齐方法,智能选择训练数据以提升LLM推理能力,减少训练数据需求且性能表现优异。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01700 2026-04-28 cs.LG q-bio.QM

PoseX: AI Defeats Physics Approaches on Protein-Ligand Cross Docking

PoseX:人工智能击败物理方法在蛋白质-配体交叉对接

Yize Jiang, Xinze Li, Yuanyuan Zhang, Jin Han, Youjun Xu, Ayush Pandit, Zaixi Zhang, Mengdi Wang, Mengyang Wang, Minjie Shen, Guang Yang, Yejin Choi, Wu-Jun Li, Tianfan Fu, Fang Wu, Junhong Liu

机构 * Microcyto Purdue University(普渡大学) State Key Laboratory for Novel Software Technology at Nanjing University(南京大学新型软件技术国家重点实验室) Anew Therapeutics Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Peking University(北京大学) Virginia Tech(弗吉尼亚理工大学) Imperial College London(伦敦帝国理工学院)

AI总结 PoseX设计了一个开放源代码的基准测试,评估自我对接和交叉对接,通过23种方法和718/1312个数据集,发现AI方法在对接成功率上优于物理方法,并通过放松方法和结合口袋信息提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11594 2026-04-27 eess.AS cs.SD

HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models

HumDial-EIBench: 一个用于音频语言模型的情感智能基准测试

Shuiyuan Wang, Zhixian Zhao, Hongfei Xue, Chengyou Wang, Shuai Wang, Hui Bu, Xin Xu, Lei Xie

机构 * Nanjing University, China(南京大学,中国) AISHELL, China(AISHELL,中国)

AI总结 本文提出HumDial-EIBench,通过真实人类对话评估音频语言模型的情感智能,采用多选题和对抗性干扰项减少主观评分偏差,发现大多数模型在多轮情感跟踪和隐含因果推理上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06148 2026-04-27 cs.CV

V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models

V-MAGE:一种用于评估多模态大语言模型视觉能力的游戏评估框架

Xiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, Lijuan Wang

机构 * Nanjing University(南京大学) Microsoft Research(微软研究院) Central South University(中南大学) Nanjing University of Science and Technology(南京理工大学)

AI总结 V-MAGE通过游戏化评估框架系统评估多模态大语言模型在动态交互环境中的视觉推理能力,揭示其在复杂场景中的性能局限,为提升模型视觉与推理能力提供改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21575 2026-04-24 cs.CV cs.GR

OmniFit: Multi-modal 3D Body Fitting via Scale-agnostic Dense Landmark Prediction

OmniFit:通过尺度无关密集地标预测实现多模态3D身体拟合

Zeyu Cai, Yuliang Xiu, Renke Wang, Zhijing Shao, Xiaoben Li, Siyuan Yu, Chao Xu, Yang Liu, Baigui Sun, Jian Yang, Zhenyu Zhang

机构 * Nanjing University(南京大学) Westlake University(西湖大学) iROOTECH Nanjing University of Science and Technology(南京理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 OmniFit通过尺度无关的密集地标预测,实现对多模态输入(如完整扫描、部分深度观测和图像)的无缝处理,首次在日常和宽松服装场景中超越多视图优化基线,达到毫米级精度。

Comments Project Page: https://zcai0612.github.io/OmniFit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20847 2026-04-24 cs.IR cs.AI

Revisiting Content-Based Music Recommendation: Efficient Feature Aggregation from Large-Scale Music Models

重新审视基于内容的音乐推荐:从大规模音乐模型中高效地聚合特征

Yizhi Zhou, Jia-Qi Yang, De-Chuan Zhan, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)

AI总结 本文提出TASTE数据集和基准框架,通过整合音频和文本信息提升音乐推荐性能,引入MuQ-token方法优化多层音频特征整合,验证了内容驱动方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19926 2026-04-23 cs.AI

CreativeGame:Toward Mechanic-Aware Creative Game Generation

CreativeGame:迈向机制感知的创意游戏生成

Hongnan Ma, Han Wang, Shenglin Wang, Tieyue Yin, Yiwei Shi, Yucong Huang, Yingtian Zou, Muning Wen, Mengyue Yang

机构 * University of Bristol(布里斯托大学) Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Nanjing University(南京大学) Sreal AI Project(Sreal AI项目)

AI总结 本文提出CreativeGame系统,通过机制感知规划循环和跨版本经验积累,实现迭代式HTML5游戏生成,支持可解释的版本间进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14222 2026-04-23 cs.CR cs.AI

Membership Inference for Contrastive Pre-training Models with Text-only PII Queries

对比预训练模型的成员推断与仅文本隐私信息查询

Ruoxi Cheng, Yizhong Ding, Jian Zhao, Hongyi Zhang, Haoxuan Ma, Tianle Zhang, Yiyan Huang, Xuelong Li

机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) School of Computing and Information Technology, Great Bay University(广东大湾区大学计算机与信息科技学院)

AI总结 本文提出UMID框架,通过仅文本模态推断多模态模型的记忆,有效检测隐私信息泄露,无需生物特征输入,提升隐私审计效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏