arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1177
2602.24240 2026-03-02 cs.CV

Joint Geometric and Trajectory Consistency Learning for One-Step Real-World Super-Resolution

联合几何与轨迹一致性学习用于一步现实世界超分辨率

Chengyan Deng, Zhangquan Chen, Li Yu, Kai Zhang, Xue Zhou, Wang Zhang

机构 * University of Electronic Science(电子科学大学) Tsinghua University(清华大学) Nanjing University(南京大学)

AI总结 GTASR通过引入轨迹对齐和双参考结构校正,解决现实世界超分辨率中的几何解耦和一致性漂移问题,实现高效且高质量的一步生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23996 2026-03-02 cs.CV

Accelerating Masked Image Generation by Learning Latent Controlled Dynamics

通过学习潜在控制动力学加速掩码图像生成

Kaiwen Zhu, Quansheng Zeng, Yuandong Pu, Shuo Cao, Xiaohui Li, Yi Xin, Qi Qin, Jiayang Li, Yu Qiao, Jinjin Gu, Yihao Liu

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Nankai University, Tianjin, China(南开大学) University of Science(科学技术大学) Nanjing University, Nanjing, China(南京大学) The University of Sydney, Sydney, Australia(悉尼大学) Peking University, Beijing, China(北京大学)

AI总结 本文提出MIGM-Shortcut模型,通过学习潜在控制动力学加速掩码图像生成,在保持质量的同时实现文本到图像生成的四倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23461 2026-03-02 cs.CV

Investigating Text Insulation and Attention Mechanisms for Complex Visual Text Generation

探究文本绝缘与注意力机制用于复杂视觉文本生成

Ying Tai, Nikai Du, Rui Xie, Zhennan Chen, Qian Wang, Zhengkai Jiang, Kai Zhang, Jian Yang

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Jiutian Research(极天研究) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 TextCrafter通过文本绝缘与注意力机制,提升复杂视觉文本生成性能,引入CVTG-2K基准测试集验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10258 2026-03-02 cs.LG stat.ML

Revisiting Matrix Sketching in Linear Bandits: Achieving Sublinear Regret via Dyadic Block Sketching

重新审视线性老虎机中的矩阵压缩:通过双尺度块压缩实现亚线性遗憾

Dongxie Wen, Hanyan Yin, Xiao Zhang, Peng Zhao, Lijun Zhang, Zhewei Wei

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)

AI总结 本文提出双尺度块压缩方法,通过动态调整压缩大小,在无需先验知识的情况下实现线性老虎机的亚线性遗憾界。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22923 2026-02-27 cs.CV cs.RO

WaterVideoQA: ASV-Centric Perception and Rule-Compliant Reasoning via Multi-Modal Agents

WaterVideoQA: 以ASV为中心的感知与符合规则的推理 via 多模态智能体

Runwei Guan, Shaofeng Liang, Ningwei Ouyang, Weichen Fei, Shanliang Yao, Wei Dai, Chenhao Ge, Penglei Sun, Xiaohui Zhu, Tao Huang, Ryan Wen Liu, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)人工智能研究所) Hubei Key Laboratory of Inland Shipping Technology (Wuhan University of Technology)(湖北内河航运技术重点实验室(武汉理工大学)) School of Navigation, Wuhan University of Technology(武汉理工大学航海学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Information Engineering, Yancheng Institute of Technology(盐城职业技术学院信息工程学院) School of Engineering, Stanford University(斯坦福大学工程学院) Centre for AI and Data Science Innovation and the School of Science and Engineering, James Cook University(詹姆斯库克大学人工智能与数据科学创新中心及科学与工程学院)

AI总结 WaterVideoQA通过多模态智能体系统,实现ASV在复杂水域环境中的感知与规则合规推理,提升自主航行的安全性和精确性。

Comments 11 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22808 2026-02-27 cs.AI

MiroFlow: Towards High-Performance and Robust Open-Source Agent Framework for General Deep Research Tasks

MiroFlow:面向通用深度研究任务的高性能和鲁棒开源代理框架

Shiqian Su, Sen Xing, Xuan Dong, Muyan Zhong, Bin Wang, Xizhou Zhu, Yuntao Chen, Wenhai Wang, Yue Deng, Pengxiang Zhu, Ziyuan Liu, Tiantong Li, Jiaheng Yu, Zhe Chen, Lidong Bing, Jifeng Dai

机构 * Tsinghua University(清华大学) MiroMind AI National University of Singapore(新加坡国立大学) Nanjing University(南京大学)

AI总结 MiroFlow是一种面向通用深度研究任务的高性能开源代理框架,通过灵活的工作流编排和深度推理模式提升性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04228 2026-02-27 cs.CV cs.AI cs.LG cs.MM

LayerT2V: A Unified Multi-Layer Video Generation Framework

LayerT2V: 一个统一的多层视频生成框架

Guangzhao Li, Kangrui Cen, Baixuan Zhao, Yi Xin, Siqi Luo, Guangtao Zhai, Lei Zhang, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 LayerT2V通过统一的多层视频生成框架,实现了多层输出并提升了视频生成的语义一致性和时间一致性。

Comments Project Page is https://layert2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22412 2026-02-27 cs.LG cs.HC cs.IT econ.GN math.IT q-fin.EC

A Learning-Based Hybrid Decision Framework for Matching Systems with User Departure Detection

基于学习的混合决策框架用于具有用户离开检测的匹配系统

Ruiqi Zhou, Donghao Zhu, Houcai Shen

机构 * School of Management and Engineering, Nanjing University, China(管理学院和工程学院,南京大学,中国) The Institute of Statistical Mathematics, Tokyo, Japan(统计数学研究所,东京,日本) The University of Tokyo Market Design Center, Tokyo, Japan(东京大学市场设计中心,东京,日本)

AI总结 本文提出了一种基于学习的混合决策框架,通过动态调整匹配策略,在即时匹配与延迟匹配之间平衡,以提高市场效率并减少拥堵。

Comments Accepted at HCII 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17605 2026-02-27 cs.CV

Distractor-free Generalizable 3D Gaussian Splatting

无干扰的可泛化3D高斯点散布

Yanqi Bao, Jing Liao, Jing Huo, Yang Gao

机构 * Nanjing University(南京大学) City University of Hong Kong(香港城市大学)

AI总结 DGGS通过无干扰的可泛化3D高斯点散布框架,解决跨场景训练中的干扰问题,提升重建能力和掩码预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21887 2026-02-26 cs.CL

ExpLang: Improved Exploration and Exploitation in LLM Reasoning with On-Policy Thinking Language Selection

ExpLang: 通过在线策略思考语言选择改进大语言模型推理中的探索与利用

Changjiang Gao, Zixian Huang, Kaichen Yang, Jiajun Chen, Jixing Li, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Jiangsu, China(新型软件技术国家重点实验室,南京大学,江苏,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Department of Linguistics and Translation, City University of Hong Kong, Hong Kong, China(语言学与翻译系,香港城市大学,香港,中国) School of Mathematical Sciences, Dalian University of Technology, Liaoning, China(数学科学学院,大连理工大学,辽宁,中国)

AI总结 ExpLang通过在线策略思考语言选择改进大语言模型推理中的探索与利用,实现多语言优势提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21849 2026-02-26 cs.CV

Meta-FC: Meta-Learning with Feature Consistency for Robust and Generalizable Watermarking

Meta-FC: 通过特征一致性进行元学习的鲁棒且可泛化的水印技术

Yuheng Li, Weitong Chen, Chengcheng Zhu, Jiale Zhang, Chunpeng Ge, Di Wu, Guodong Long

机构 * Yangzhou University(扬州大学) Nanjing University(南京大学) Shandong University(山东大学) La Trobe University(拉特罗布大学) University of Technology Sydney(悉尼技术大学)

AI总结 Meta-FC通过元学习和特征一致性提升水印技术的鲁棒性和泛化能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07986 2026-02-26 cs.CL cs.CV

VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding

VULCA-Bench:一个多文化视觉-语言基准,用于评估文化理解

Haorui Yu, Diji Yang, Hang He, Fengrui Zhang, Qiufeng Yi

机构 * DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD部门) University of California, Santa Cruz, USA(加州大学圣克ruz分校) Analogy AI East China Normal University, China(华东师范大学) Nanjing University, China(南京大学) Department of Mechanical Engineering, School of Engineering, University of Birmingham(伯明翰大学工程学院机械工程系)

AI总结 VULCA-Bench通过多文化艺术批评基准评估视觉-语言模型在文化理解上的能力,包含7,410对图像-批评对,涵盖八个文化传统,通过五层框架评估文化理解,揭示更高阶推理更具挑战性。

Comments 8 pages, 4 figures, submitted to ACL 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07984 2026-02-26 cs.CL

Cross-Cultural Expert-Level Art Critique Evaluation with Vision-Language Models

跨文化专家级艺术批评评估与视觉-语言模型

Haorui Yu, Xuehang Wen, Fengrui Zhang, Qiufeng Yi

机构 * DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD研究中心,英国) Hebei Academy of Fine Art, China(河北美术院,中国) Computer Science, Nanjing University, China(南京大学计算机科学系,中国) Department of Mechanical Engineering, School of Engineering, University of Birmingham(伯明翰大学工程学院机械工程系)

AI总结 本文提出了一种跨文化评估框架,用于评估视觉-语言模型在艺术批评中的文化理解能力,揭示了自动化指标与专家评分的差异及文化敏感性问题。

Comments 16 pages, 7 figures, submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20566 2026-02-25 cs.RO cs.CV

BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model

BFA++: 多视角视觉语言动作模型的分层最佳特征感知令牌剪枝

Haosheng Li, Weixin Mao, Zihan Lan, Hongwei Xiong, Hongan Wang, Chenyang Si, Ziwei Liu, Xiaoming Deng, Hua Chen

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) LimX Dynamic(LimX动态) Nanjing University(南京大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

AI总结 BFA++通过分层最佳特征感知令牌剪枝提升多视角视觉语言动作模型的效率和成功率

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20494 2026-02-25 cs.AI

KairosVL: Orchestrating Time Series and Semantics for Unified Reasoning

KairosVL:协调时间序列与语义以实现统一推理

Haotian Si, Changhua Pei, Xiao He, Zeyan Li, Zhe Xie, Zexin Wang, Jiyao Hu, Zhaoyang Yu, Tieying Zhang, Dan Pei, Jianhui Li, Gaogang Xie

机构 * Tsinghua University(清华大学) Nanjing University(南京大学)

AI总结 KairosVL通过两轮强化学习框架结合语义推理与时间建模,提升复杂时间序列任务的推理能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09126 2026-02-25 cs.CV

DreamBarbie: Text to Barbie-Style 3D Avatars

DreamBarbie: 通过文本生成Barbie风格的3D人像

Xiaokun Sun, Zhenyu Zhang, Ying Tai, Hao Tang, Zili Yi, Jian Yang

机构 * School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) School of Computer Science, Peking University(计算机科学学院,北京大学)

AI总结 DreamBarbie通过文本生成Barbie风格的3D人像,结合表达性3D表示和专门优化模型,实现高保真度的可动画和模拟人像生成。

Comments Accepted by TVCG 2026; Project page: https://xiaokunsun.github.io/DreamBarbie.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19166 2026-02-24 eess.AS cs.AI cs.SD

CosyAccent: Duration-Controllable Accent Normalization Using Source-Synthesis Training Data

CosyAccent: 基于源合成训练数据的可控声调规范化

Qibing Bai, Shuhao Shi, Shuai Wang, Yukai Ju, Yannan Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) Nanjing University(南京大学) Tencent(腾讯) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 CosyAccent通过源合成训练数据构建方法,实现可控的声调规范化,无需真实L2数据,提升内容保持与自然度。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18874 2026-02-24 cs.CV cs.AI

Structure-Level Disentangled Diffusion for Few-Shot Chinese Font Generation

结构层面解耦的扩散模型用于少样本中文字体生成

Jie Li, Suorong Yang, Jian Zhao, Furao Shen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(人工智能学院) Department of Computer Science and Technology, Nanjing University, China(计算机科学与技术系) School of Electronic Science and Engineering, Nanjing University, China(电子科学与工程学院)

AI总结 SLD-Font通过结构层面解耦和参数高效微调,实现少样本中文字体生成中更高的风格保真度和内容准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18697 2026-02-24 cs.CV

Deep LoRA-Unfolding Networks for Image Restoration

深度 LoRA 展开网络用于图像恢复

Xiangming Wang, Haijin Zeng, Benteng Sun, Jiezhang Cao, Kai Zhang, Qiangqiang Shen, Yongyong Chen

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(计算机科学与技术学院,哈尔滨工业大学(深圳)) Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程院,上海交通大学) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) School of Electronics and Information Engineering, Harbin Institute of Technology (Shenzhen)(电子与信息工程学院,哈尔滨工业大学(深圳))

AI总结 LoRun 通过引入 LoRA 适配器实现高效图像恢复,减少参数冗余并提升去噪性能。

Comments Accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26209 2026-02-24 cs.AI

Diversity-Incentivized Exploration for Versatile Reasoning

多样化激励探索用于多面推理

Zican Hu, Shilin Zhang, Yafu Li, Jianhao Yan, Xuyang Hu, Leyang Cui, Xiaoye Qu, Chunlin Chen, Yu Cheng, Zhi Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Westlake University(西湖大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 DIVER通过引入全局多样性激励,提升大语言模型在多面推理任务中的探索能力和样本效率。

Comments 26 pages, 10 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03870 2026-02-20 cs.CL

Reconstructing KV Caches with Cross-layer Fusion For Enhanced Transformers

通过跨层融合重建KV缓存以增强Transformer

Hongzhan Lin, Zhiqi Bai, Xinmiao Zhang, Sen Yang, Xiang Li, Siran Yang, Yunlong Xu, Jiaheng Liu, Yongchi Zhao, Jiamang Wang, Yuchi Xu, Wenbo Su, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团) GSAI, Renmin University of China(国际人工智能学院,中国人民大学) Nanjing University(南京大学)

AI总结 通过跨层融合重建KV缓存以提升Transformer性能,减少内存占用并提高效率。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22237 2026-02-19 cs.CL cs.AI cs.SE

FeatBench: Towards More Realistic Evaluation of Feature-level Code Generation

FeatBench: 向更真实的特征级代码生成评估迈进

Haorui Chen, Chengze Li, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) University of Electronic Science and Technology of China(电子科技大学) Nanjing University(南京大学)

AI总结 FeatBench提出了一种新的特征级代码生成评估基准,通过真实任务输入和动态数据构建,解决现有基准的局限性,并揭示了代理在实现中的激进行为问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14028 2026-02-17 cs.CL

GRRM: Group Relative Reward Modeling for Machine Translation

GRRM:用于机器翻译的组相对奖励建模

Sen Yang, Shanbo Cheng, Lu Xu, Jianbing Zhang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 本文提出GRRM,通过组相对奖励模型提升机器翻译的排名准确性和推理能力。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12095 2026-02-17 cs.RO

Pack it in: Packing into Partially Filled Containers Through Contact

装满它:通过接触将物品装入部分填充的容器

David Russell, Zisong Xu, Maximo A. Roa, Mehmet Dogar

机构 * School of Computer Science, University of Leeds, UK(利兹大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) German Aerospace Centre (DLR)(德国航空航天中心)

AI总结 本文提出了一种接触感知的装箱方法,通过与已放置物体的互动创造自由空间,以更有效地将新物品放入部分填充的容器中。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14902 2026-02-17 cs.IR cs.CV

U-MARVEL: Unveiling Key Factors for Universal Multimodal Retrieval via Embedding Learning with MLLMs

通过嵌入学习与大语言模型揭示通用多模态检索的关键因素:U-MARVEL

Xiaojie Li, Chu Li, Shi-Zhe Chen, Xi Chen

机构 * Tencent PCG(腾讯PCG) Nanjing University(南京大学) ByteDance(字节跳动)

AI总结 U-MARVEL通过嵌入学习与大语言模型揭示通用多模态检索的关键因素,实现超越现有方法的性能。

Comments Accepted to ICLR 2026

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23522 2026-02-17 cs.CV cs.LG

OmniEarth-Bench: Towards Holistic Evaluation of Earth's Six Spheres and Cross-Spheres Interactions with Multimodal Observational Earth Data

OmniEarth-Bench: 向全面评估地球六大球体及跨球体交互的多模态观测地球数据迈进

Fengxiang Wang, Mingshuo Chen, Xuming He, Yi-Fan Zhang, Yueying Li, Feng Liu, Zijie Guo, Zhenghao Hu, Jiong Wang, Jingyi Xu, Zhangrui Li, Junchao Gong, Di Wang, Fenghua Ling, Ben Fei, Weijia Li, Long Lan, Wenjing Yang

机构 * National University of Defense Technology, China(国防科技大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Beijing University of Posts and Telecommunications, China(北京邮电大学) Zhejiang University, China(浙江大学) Shanghai Jiao Tong University, China(上海交通大学) Fudan University, China(复旦大学) Sun Yat-sen University, China(中山大学) Nanjing University, China(南京大学) University of Science and Technology of China(中国科学技术大学) Wuhan University, China(武汉大学)

AI总结 OmniEarth-Bench是首个全面评估地球六大球体及跨球体交互的多模态基准测试,通过29,855个标准化注释揭示了地球系统认知能力的系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00527 2026-02-17 cs.RO

DeCo: Task Decomposition and Skill Composition for Zero-Shot Generalization in Long-Horizon 3D Manipulation

DeCo:用于长周期3D操作零样本泛化任务分解与技能组合

Zixuan Chen, Junhui Yin, Yangtao Chen, Jing Huo, Pinzhuo Tian, Jieqi Shi, Yiwen Hou, Yinchuan Li, Yang Gao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Huawei Noah’s Ark Lab (AI Lab), China(华为诺亚实验室(AI实验室))

AI总结 DeCo通过任务分解与技能组合提升长周期3D操作任务的零样本泛化能力,显著提高多个模型在新任务上的成功率。

Comments RAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13653 2026-02-17 cs.AI cs.CL cs.CV cs.HC

Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization

通过代理-Q估计和分步策略优化构建自主GUI导航

Yibo Wang, Guangda Huzhang, Yuwei Hu, Yu Xia, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Ovis Team, Alibaba Group(阿里团队,阿里巴巴集团)

AI总结 本文提出基于代理-Q估计和分步策略优化的GUI自主导航框架,通过强化学习提升GUI交互能力,实验证明其在导航和基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09407 2026-02-17 cs.CV

Geometry-to-Image Synthesis-Driven Generative Point Cloud Registration

基于几何到图像合成的生成式点云配准

Haobo Jiang, Jin Xie, Jian Yang, Liang Yu, Jianmin Zheng

机构 * ANGEL CorpLab and College of Computing and Data Science, Nanyang Technological University, Singapore(ANGEL CorpLab和计算与数据科学学院,南洋理工大学,新加坡) Alibaba Cloud, Alibaba Group, China(阿里巴巴云,阿里巴巴集团,中国) PCA Lab, VCIP, College of Computer Science, Nankai University, China(PCA实验室,VCIP,计算机科学学院,南开大学,中国) State Key Laboratory for Novel Software Technology & Schoolof Intelligence Science and Technology, Nanjing University, China(新型软件技术国家重点实验室与智能科学与技术学校,南京大学,中国)

AI总结 本文提出生成式点云配准方法,通过生成跨视角一致的图像对,结合几何与颜色特征融合,提升3D配准性能。

Comments Journal extension of the ICML 2025 paper "Generative Point Cloud Registration". This version adopts a new title, and includes substantial methodological improvements, additional experiments, and extended analysis. Under review at IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11586 2026-02-17 cs.CV

StrandHead: Text to Hair-Disentangled 3D Head Avatars Using Human-Centric Priors

StrandHead: 基于人类中心先验的文本驱动3D头像生成方法

Xiaokun Sun, Zeyu Cai, Ying Tai, Jian Yang, Zhenyu Zhang

机构 * Nanjing University(南京大学)

AI总结 StrandHead通过人类中心先验生成逼真3D头发并实现解耦头像建模,达到文本到发束生成的最新水平。

Comments Accepted by ICCV 2025; Project page: https://xiaokunsun.github.io/StrandHead.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏