arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Nanjing University(南京大学)

2026-04-07 至 2026-04-07 共收录 8
2604.04863 2026-04-07 cs.CV

Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations

超越全局评分:细粒度令牌接地作为检测LVLM幻觉的稳健检测器

Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Yutong Xie, Nguyen Cam-Tu, Minh Khoi Nguyen, Dang Huy Pham Nguyen, Anton van den Hengel, Johan W. Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

机构 * Hanoi University of Science and Technology(河内科技大学) Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Nanjing University(南京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hanoi-Amsterdam High School for the Gifted(河内阿姆斯特丹天才高中)

AI总结 本文提出细粒度令牌接地方法,通过分析模型层间令牌交互,发现幻觉令牌的扩散注意力模式和语义对齐失败特征,实现90%的幻觉检测准确率。

Comments Accepted at CVPR2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04406 2026-04-07 cs.CV

3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image

3D-Fixer:从单张图像生成3D场景的粗到细就地补全

Ze-Xin Yin, Liu Liu, Xinjie Wang, Wei Sui, Zhizhong Su, Jian Yang, Jin Xie

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Horizon Robotics(地平线机器人) D-Robotics

AI总结 本文提出3D-Fixer,通过粗到细的生成方案解决单张图像生成3D场景的布局和3D资产恢复问题,结合双分支条件网络和Occlusion-Robust Feature Alignment策略,提升生成精度和效率,同时引入ARSG-110K数据集提升训练效果。

Comments 17 pages, 10 figures, CVPR 2026, project page: https://zx-yin.github.io/3dfixer

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04401 2026-04-07 cs.RO cs.LG cs.SY eess.SY

ReinVBC: A Model-based Reinforcement Learning Approach to Vehicle Braking Controller

ReinVBC:一种基于模型的强化学习方法用于车辆制动控制器

Haoxin Lin, Junjie Zhou, Daheng Xu, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Polixir Technologies(探境科技)

AI总结 本文提出ReinVBC,利用基于模型的强化学习方法解决车辆制动控制问题,通过工程设计获得可靠的车辆动力学模型和制动策略,实验证明其在实际车辆制动中的有效性及替代传统防抱死刹车系统潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07435 2026-04-07 cs.CV

DreamLifting: A Plug-in Module Lifting MV Diffusion Models for 3D Asset Generation

DreamLifting:一种插件模块用于提升MV扩散模型以生成3D资产

Ze-Xin Yin, Jiaxiong Qiu, Liu Liu, Xinjie Wang, Wei Sui, Zhizhong Su, Jian Yang, Jin Xie

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP实验室PCA Lab) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Horizon Robotics(地平线机器人) D-Robotics

AI总结 本文提出LGAA框架,通过多视角扩散先验统一几何与PBR材质建模,结合模块化设计和改进的VAE实现高效3D资产生成,实验表明其在文本和图像条件下均表现优异。

Comments 16 pages, 9 figures, TVCG 2026, project page: https://zx-yin.github.io/dreamlifting/

Journal ref IEEE Transactions on Visualization and Computer Graphics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12946 2026-04-07 cs.AR cs.AI

Open3DBench: Open-Source Benchmark for 3D-IC Backend Implementation and PPA Evaluation

Open3DBench:开源的3D-IC后端实现与PPA评估基准

Yunqi Shi, Chengrui Gao, Wanqi Ren, Peng Xie, Siyuan Xu, Ke Xue, Mingxuan Yuan, Chao Qian, Zhi-Hua Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 本文提出Open3DBench,基于OpenROAD流程框架,提供3D-IC后端实现与PPA评估的开源基准,展示了改进的面积、线长、时序和功耗性能,强调了PPA驱动方法的重要性。

Comments This version 2.0 is under review of TCAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05773 2026-04-07 cs.CV

Scalable and Generalizable Correspondence Pruning via Geometry-Consistent Pre-training

基于几何一致预训练的可扩展且可泛化的对应关系修剪

Tangfei Liao, Xiaoqin Zhang, Tao Wang, Hao Ye, Min Li, Guobao Xiao, Mang Ye

机构 * Wuhan University(武汉大学) Wenzhou University(温州大学) Nanjing University(南京大学) Xiaomi Corporation, Xiaomi Automobile Co., Ltd.(小米集团,小米汽车有限公司) Tongji University(同济大学)

AI总结 本文提出几何一致预训练方法,通过掩码内点重建任务和双流编码器提升对应关系的鲁棒性和泛化能力,在相机姿态估计、视觉定位和3D配准任务中取得显著性能提升。

Comments Accepted by TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01590 2026-04-07 eess.AS cs.SD

PhiNet: Speaker Verification with Phonetic Interpretability

PhiNet:具有语音可解释性的说话人验证

Yi Ma, Shuai Wang, Tianchi Liu, Haizhou Li

机构 * National University of Singapore(新加坡国立大学) LIGHTSPEED Nanjing University(南京大学) Shenzhen Loop Area Institute(深圳河套学院) Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong(香港中文大学(深圳)深圳市大数据研究院)

AI总结 PhiNet通过利用语音证据提升局部和全局可解释性,为说话人验证提供详细的语音级比较,帮助用户手动检查特征并评估验证结果,同时为开发者提供决策理由,简化错误追踪和超参数选择。

Comments Accepted by IEEE Transactions on Audio, Speech and Language Processing. Codes: https://github.com/mmmmayi/PhiNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22553 2026-04-07 cs.CV

Bringing Your Portrait to 3D Presence

将您的肖像带入3D存在

Jiawei Zhang, Lei Chu, Jiahao Li, Zhenyu Zang, Chong Li, Xiao Li, Xun Cao, Hao Zhu, Yan Lu

机构 * Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出统一框架,从单张肖像重建可动画的3D人体虚拟角色,解决姿态和构图敏感的特征表示、数据有限性和代理网格估计不可靠的问题。

Comments project page: https://zjwfufu.github.io/HuaPi-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏