ScenDi: 3D-to-2D Scene Diffusion Cascades for Urban Generation
ScenDi: 3D到2D场景扩散级联用于城市生成
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; The University of British Columbia(不列颠哥伦比亚大学)
AI总结 ScenDi通过整合3D和2D扩散模型,解决3D城市生成中外观细节与相机可控性的平衡问题,实现高质量场景生成。
高校专区
ScenDi: 3D到2D场景扩散级联用于城市生成
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; The University of British Columbia(不列颠哥伦比亚大学)
AI总结 ScenDi通过整合3D和2D扩散模型,解决3D城市生成中外观细节与相机可控性的平衡问题,实现高质量场景生成。
HiNS:分层负采样用于更全面的记忆检索嵌入模型
机构 * OPPO ; Zhejiang University(浙江大学)
AI总结 HiNS通过分层负采样方法提升记忆检索嵌入模型的检索保真度和泛化能力,在多个任务中取得显著性能提升。
RECAP: 在基于文本的心理健康咨询中利用大语言模型进行抗阻捕捉
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学)
AI总结 RECAP通过捕捉13种细粒度抗阻行为,提高了基于文本的心理健康咨询中抗阻检测的准确性和解释性,优于现有方法。
Comments 19 pages, 2 figures
受计划引导:通过引导解码增强忠实的自回归文本到音频生成
机构 * The Hong Kong Polytechnic University(香港理工大学) ; IROOTECH TECHNOLOGY(IROOTECH技术公司) ; Wolf 1069 b Lab, Sany Group(三一集团沃尔夫1069实验室) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学)
AI总结 本研究提出Plan-Critic模型,通过引导解码提升自回归文本到音频生成的忠实度,实现CLAP分数提升10分,达到新状态。
Comments Accepted at EACL 2026
合成歌手:深度学习在歌唱语音合成方法中的综述
机构 * Zhejiang University(浙江大学)
AI总结 本文综述了基于深度学习的歌唱语音合成方法,系统分析了其任务分类、架构范式及核心技术,并提供了相关数据集和评估基准。
Comments Accepetd by IJCNLP-AACL 2025(Oral)
DNF:用于大语言模型知识产权保护的双层嵌套指纹
机构 * Zhejiang University(浙江大学) ; Binjiang Institute of Zhejiang University(浙江大学滨江学院) ; Hangzhou Dianzi University(杭州电子科技大学) ; Hefei University of Technology(合肥工业大学)
AI总结 DNF通过结合领域特定风格线索和隐含语义触发器,实现大语言模型的隐蔽知识产权保护。
Comments Accepted by ICASSP2026
交错的潜在视觉推理与选择性感知建模
机构 * China University of Geosciences, Wuhan(中国地质大学(武汉)) ; Shanghai Innovation Institute(上海创新研究院) ; University of Southern California(南加州大学) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 ILVR通过交错潜在视觉表示与文本生成,实现动态状态演变与精确感知建模的统一,提升多模态推理性能。
Comments 18 pages, 11 figures. Code available at https://github.com/XD111ds/ILVR
在行之间阅读:通过零阶梯度估计实现可靠的黑盒LLM指纹识别
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; City University of Hong Kong(香港城市大学)
AI总结 本文提出ZeroPrint方法,通过零阶梯度估计在黑盒环境下实现更可靠的LLM指纹识别,有效提升指纹识别的准确性和鲁棒性。
Comments This paper is accepeted by the ACM Web Conference (WWW) 2026
基于多维偏好混合的列表式直接偏好优化
机构 * University of Alberta(阿尔伯塔大学) ; University of Toronto(多伦多大学) ; Zhejiang University(浙江大学) ; School of Computer Science McGill University(麦吉尔大学计算机学院) ; Alibaba Group (Ant Group)(阿里巴巴集团(蚂蚁集团)) ; Chinese Academy of Sciences(中国科学院)
AI总结 本文提出λ-DPO,通过多维偏好混合和自适应调度器提升模型对多维度偏好权衡的建模能力。
Comments 13 pages, 1 figures, appendix included
ThinkRec: 基于思考的推荐方法
机构 * Zhejiang University(浙江大学) ; Shanghai AI Laboratory(上海人工智能实验室)
AI总结 ThinkRec通过引入思考激活机制和实例级专家融合机制,提升推荐系统的准确性和可解释性。
Comments Published on WWW'26: In Proceedings of the ACM Web Conference 2026
基于遗传算法的阿拉伯拟南芥根皮层细胞核在3D时间延拓显微镜图像中的准确跟踪
机构 * Graduate School of Science and Technology, Nara Institute of Science and Technology(奈良科学技术大学研究生院) ; Bioresource Engineering Laboratory, Ishikawa Prefectural University(石川县立大学生物资源工程实验室) ; Department of Engineering Informatics, Osaka Electro-Communication University(大阪电讯大学工程信息学系) ; Exploratory Research Center on Life and Living Systems, National Institutes of Natural Sciences(国家自然科学研究院生命与生活系统探索研究中心) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
AI总结 本研究提出基于遗传算法的拟南芥根部细胞核跟踪方法,解决密集细胞排列下的准确跟踪问题,首次在根尖领域实现时间延拓显微镜中的细胞跟踪突破。
Journal ref IEEE Transactions on Computational Biology and Bioinformatics, vol. 22, pp. 3260-3272, 2025
Interp3D: 基于对应关系的生成式纹理3D变形
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Nanjing University(南京大学) ; State Key Lab of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) ; Shenzhen Loop Area Institute(深圳河套学院)
AI总结 Interp3D提出一种无需训练的纹理3D变形方法,通过结构化潜在引导和渐进对齐实现几何与纹理一致性,提升3D变形的平滑度和合理性。
Comments 22 pages, 12 figures
细粒度零样本组合图像检索与互补视觉-语义整合
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) ; Zhejiang University(浙江大学)
AI总结 本文提出CVSI方法,通过互补视觉-语义整合提升细粒度零样本组合图像检索性能。
视觉也需要:利用多模态大语言模型进行分布外检测导航
机构 * Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算电力网络与信息安全重点实验室,山东计算机科学中心(国家超算中心济南中心),齐鲁工业大学(山东科学院)) ; Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算电力互联网与服务计算重点实验室,山东省计算机科学基础研究中心) ; University of Electronic Science and Technology of China(电子科技大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; RWTH Aachen University(亚琛工业大学)
AI总结 本文提出MM-OOD方法,利用多模态大语言模型的推理能力,通过多轮对话增强分布外检测,提升近远OOD任务性能。
寻找RELIFF:通过信念工程塑造推理行为而无需推理监督
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Sun Yat-sen University(中山大学) ; Zhejiang University(浙江大学) ; WUST(华中科技大学)
AI总结 本文提出RELIFF,通过信念工程无需推理监督塑造大型推理模型的行为,实验表明其在效率和忠实度任务上表现优异。
Comments Working in progress
FG-OrIU: 通过特征-梯度正交性实现更好的增量遗忘
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
AI总结 FG-OrIU通过特征和梯度正交约束实现深度不可逆的增量遗忘,解决现有方法中残留信息可恢复的问题。
Comments This paper has been accepted by ICCV 2025. code: \url{https://github.com/RAIAN08/FG-OrIU}
通过知识性经验学习对齐代理世界模型
机构 * Zhejiang University(浙江大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。
Comments Ongoing work
ForgetMark: 通过针对性遗忘实现语言模型的隐秘指纹嵌入
机构 * Zhejiang University(浙江大学) ; Zhejiang University of Technology(浙江工业大学)
AI总结 ForgetMark通过针对性遗忘技术,在语言模型中实现隐秘指纹嵌入,提升隐蔽性和鲁棒性,同时保持模型性能。
Comments Accepted by ICASSP2026
Doracamom:多视角4D雷达与摄像头联合3D检测与占用预测用于全方位感知
机构 * School of Automotive Studies, Tongji University(同济大学汽车学院) ; Momoni AI ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) ; Chair of Automotive Engineering, Technische Universität Berlin(柏林技术大学汽车工程学系) ; College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) ; School of Information and Electrical Engineering, Hangzhou City University(杭州城市学院信息与电气工程学院)
AI总结 Doracamom通过融合多视角4D雷达与摄像头,实现3D物体检测与语义占用预测,提升自动驾驶环境感知能力。
Comments Accepted by IEEE TCSVT
深入探索:用于鲁棒视频-文本检索的层次视觉感知
机构 * Zhejiang University(浙江大学)
AI总结 HVP-Net通过提取和细化视觉编码器的多层特征,提升视频-文本检索的鲁棒性,实现新的最佳性能。
以分布为中心的策略优化主导探索-利用权衡
机构 * College of Software, Nankai University(南开大学软件学院) ; Zhongguancun Academy(中关村学院) ; School of Automation , Beijing Institute of Technology(北京理工大学自动化学院) ; College of Computer Science(计算机科学学院) ; Technology, Zhejiang University(浙江大学技术学院)
AI总结 本文提出DCPO,通过分布层面的正则化实现可控探索,改进了探索-利用权衡。
DC-VLAQ:用于鲁棒视觉位置识别的查询残差聚合
机构 * BCCITA Provincial Key Laboratory, Hangzhou Dianzi University, China(杭州电子科技大学省重点实验室) ; TopXGun Robotics, China(TopXGun Robotics) ; ICT State Key Laboratory, Zhejiang University, China(浙江大学信息与电子技术国家重点实验室) ; I3A, University of Zaragoza, Spain(阿拉贡大学I3A)
AI总结 DC-VLAQ通过融合互补视觉基础模型和鲁棒的全局聚合方法,提升了视觉位置识别在大视角变化和领域偏移下的鲁棒性。
Comments 10 pages, 4 figures, 5 tables
简单而有效的选择性填补用于不完整多视图聚类
机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) ; State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)
AI总结 SI$^3$提出了一种轻量级、数据驱动的选择性填补方法,用于不完整多视图聚类,通过预评估信息量实现高效且鲁棒的填补与融合。
Comments Under Review
预设性能的空中机械臂运动跟踪控制
机构 * Westlake Institute for Optoelectronics(西lake光电研究所) ; Department of Artificial Intelligence, Westlake University(人工智能系,西lake大学) ; WINDY Lab(WINDY实验室) ; College of Control Science and Engineering, Zhejiang University(控制科学与工程学院,浙江大学)
AI总结 本文提出了一种预设性能的空中机械臂运动跟踪控制方法,通过结合预设轨迹和二次规划参考分配,确保在指定时间内达到目标位置并满足任务要求。
MoA:异构适配器混合用于大语言模型的参数高效微调
机构 * Zhejiang University(浙江大学)
AI总结 MoA通过异构适配器混合提升大语言模型的参数高效微调性能,采用软和稀疏变体实现细粒度整合与稀疏激活,增强预训练知识向下游任务的转移效果。
退火模拟增强语言模型的理论思维推理
机构 * Department of Psychology and Behavioral Sciences, Zhejiang University(浙江大学心理学与行为科学系) ; Department of Psychology, The University of Hong Kong(香港大学心理学系)
AI总结 通过退火模拟提升自回归语言模型的理论思维推理能力,无需额外训练。
解码器梯度防护:一种可证明且高保真的对抗梯度基于的框外水印移除方法
机构 * Hong Kong JC STEM Lab of Smart City and Department of Computer Science, City University of Hong Kong(香港JC STEM实验室及城市大学计算机科学系) ; Infocomm Technology Cluster, Singapore Institute of Technology(新加坡理工学院信息通信技术集群) ; College of Information Science & Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) ; School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科学与技术大学计算机科学与工程学院) ; Department of Electronic and Electrical Engineering, University College London(伦敦大学学院电子与电气工程系)
AI总结 本文提出了解码器梯度防护(DGSs)方法,通过防止梯度传播来增强对抗框外水印移除的鲁棒性,有效保护模型知识产权。
大语言模型在软件工程中的问题解决进展与前沿:一项全面的调查
机构 * Sun Yat-sen University(中山大学) ; Hangzhou Normal University(杭州师范大学) ; Zhejiang University(浙江大学) ; Huawei Technologies Co, Ltd(华为技术有限公司) ; Chongqing University(重庆大学)
AI总结 本文全面调查了大语言模型在软件工程中问题解决的进展与前沿,分析了数据构建、方法和技术挑战,并提供了开源资源。
Comments 26 pages, 4 figures, 5 tables
大语言模型对顺序敏感性如何?OrderProbe用于确定性结构重建
机构 * Peking University(北京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; City University of Hong Kong(香港城市大学) ; Fudan University(复旦大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) ; Marquette University(马凯特大学) ; Juniata College(朱尼阿特学院)
AI总结 研究通过OrderProbe基准评估大语言模型对输入顺序的敏感性,发现即使在前沿模型上,结构重建仍面临挑战,且语义能力与结构鲁棒性存在脱节。
组合特征增强用于无偏场景图生成
机构 * Zhejiang University(浙江大学) ; The Hong Kong University of Science and Technology(香港理工大学) ; FinVolution
AI总结 本文提出组合特征增强策略,通过增强关系三元组特征多样性,解决SGG中的偏见问题。
Comments ICCV