arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

共收录 2374
2512.13153 2025-12-16 cs.RO

START: Traversing Sparse Footholds with Terrain Reconstruction

START:通过地形重建穿越稀疏脚 footholds

Ruiqi Yu, Qianshi Wang, Hongyi Li, Zheng Jun, Zhicheng Wang, Jun Wu, Qiuguo Zhu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学控制系统研究所) MARMoT Lab, National University of Singapore(新加坡国立大学MARMoT实验室) th Asian Games Hangzhou 2022 Organising Committee(杭州2022年第19届亚运会组委会)

AI总结 START通过地形重建实现四足机器人在稀疏随机脚 footholds 上的敏捷稳定移动,利用低成本传感器实现高效地形感知与适应性控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12795 2025-12-16 cs.LG stat.ME

TRACER: Transfer Learning based Real-time Adaptation for Clinical Evolving Risk

TRACER: 基于迁移学习的临床风险演变实时适应

Mengying Yan, Ziye Tian, Siqi Li, Nan Liu, Benjamin A. Goldstein, Molei Liu, Chuan Hong

机构 * Duke University School of Medicine(杜克大学医学学院) Duke AI Health(杜克AI健康) Department of Biostatistics and Bioinformatics(生物统计学与生物信息学系) Duke-NUS Medical School(杜克-新加坡国立大学医学院) Centre for Quantitative Medicine(定量医学中心) Duke-NUS AI + Medical Sciences Initiative(杜克-新加坡国立大学AI+医学科学倡议) Pre-hospital & Emergency Research Centre(急救与应急研究中心) Health Services and Systems Research(卫生服务与系统研究) NUS Artificial Intelligence Institute(新加坡国立大学人工智能研究所)

AI总结 TRACER通过迁移学习实时适应临床风险演变,提升预测模型在动态临床环境中的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12622 2025-12-16 cs.CV cs.RO

D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation

D3D-VLP:动态3D视觉-语言-规划模型用于具身接地与导航

Zihan Wang, Seungjun Lee, Guangzhao Dai, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Nanjing University of Science and Technology(南京理工大学)

AI总结 D3D-VLP通过动态3D链式思维和协同学习策略,实现具身接地与导航的高效统一,提升多任务导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12578 2025-12-16 quant-ph cs.CC cs.LG

Scalable Quantum Error Mitigation with Neighbor-Informed Learning

可扩展的邻域感知学习量子误差缓解

Zhenyu Chen, Bin Cheng, Minbo Gao, Xiaodie Lin, Ruiqi Zhang, Zhaohui Wei, Zhengfeng Ji

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Centre for Quantum Technologies, National University of Singapore(新加坡国立大学量子技术中心) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院) Yau Mathematical Sciences Center, Tsinghua University(清华大学姚期 Banking 数学科学中心) Department of Mathematics, Tsinghua University(清华大学数学系) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications(燕琦湖北京数学科学与应用研究院)

AI总结 本文提出邻域感知学习框架,通过灵活高效的训练方法提升量子误差缓解的性能,实现理论与实际的双重优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23188 2025-12-16 cs.CL

Diagnose, Localize, Align: A Full-Stack Framework for Reliable LLM Multi-Agent Systems under Instruction Conflicts

诊断、定位、对齐:一种用于在指令冲突下可靠LLM多智能体系统的全栈框架

Guancheng Wan, Leixin Sun, Longxu Dou, Zitong Shi, Fang Wu, Eric Hanchen Jiang, Wenke Huang, Guibin Zhang, Hejia Geng, Xiangru Tang, Zhenfei Yin, Yizhou Sun, Wei Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Sea AI Lab(Sea AI 实验室) Stanford University(斯坦福大学) University of Oxford(牛津大学) Yale University(耶鲁大学) NTU(南洋理工大学) NUS(新加坡国立大学) Boston University(波士顿大学)

AI总结 本文提出了一种全栈框架,通过诊断、定位和对齐三个阶段提升LLM多智能体系统在指令冲突下的可靠性。

Comments Upon further review, we realized that the version submitted to arXiv was not the final draft and omits crucial results and discussion. To avoid confusion and ensure the integrity of the record, we request withdrawal and will resubmit once the complete work is ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24850 2025-12-16 cs.LG cs.AI cs.CL

Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning

利用负信号:从教师数据中进行强化蒸馏以提升大语言模型推理能力

Shuyao Xu, Cheng Peng, Jiangxuan Long, Weidi Xu, Wei Chu, Yuan Qi

机构 * National University of Singapore(国立新加坡大学) INF AI

AI总结 本文提出通过强化蒸馏利用正负推理轨迹提升LLM推理性能,实验表明在少量数据下可达到与大量数据训练模型相当的性能。

Comments 22 pages, 10 figures. Code available at https://github.com/Tim-Siu/reinforcement-distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15187 2025-12-16 cs.DB cs.LG

IRG: Modular Synthetic Relational Database Generation with Complex Relational Schemas

IRG:模块化合成关系数据库生成与复杂关系模式

Jiayu Li, Zilong Zhao, Milad Abdollahzadeh, Biplab Sikdar, Y. C. Tay

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National University of Singapore(新加坡国立大学)

AI总结 IRG提出一种模块化框架,通过学习关系连接上下文生成合成关系数据库,有效处理复杂关系模式和数据相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18078 2025-12-15 cs.SD cs.AI

Diffusion-based Surrogate Model for Time-varying Underwater Acoustic Channels

基于扩散模型的时变水下声学信道代理模型

Kexin Li, Mandar Chitre

机构 * ARL, Tropical Marine Science Institute, National University of Singapore(ARL、热带海洋科学研究所、新加坡国立大学) Department of Electrical and Computer Engineering, National University of Singapore(电气与计算机工程系、新加坡国立大学)

AI总结 本文提出StableUASim,一种基于扩散模型的预训练代理模型,用于高效建模水下声学信道,实现快速适应和高精度仿真。

Comments Updated references with DOIs

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24379 2025-12-15 cs.CV cs.AI

Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation

Any2Caption:任何条件到字幕以实现可控视频生成

Shengqiong Wu, Weicai Ye, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * Kuaishou Technology(快手科技) National University of Singapore(新加坡国立大学)

AI总结 Any2Caption通过多模态大语言模型实现任何条件到字幕的可控视频生成,提升视频生成的可控性和质量。

Comments Project Page: https://sqwu.top/Any2Cap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01933 2025-12-15 cs.LG

TAEGAN: Generating Synthetic Tabular Data For Data Augmentation

TAEGAN:生成合成表格数据用于数据增强

Jiayu Li, Zilong Zhao, Kevin Yee, Uzair Javaid, Biplab Sikdar

机构 * National University of Singapore(国立新加坡大学) Betterdata AI Singapore(Betterdata AI新加坡)

AI总结 TAEGAN通过引入自监督预热训练和改进的损失函数,提升表格数据生成的稳定性与效率,优于现有方法。

Comments This paper is accepted at ACML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02899 2025-12-12 cs.CV

Glance: Accelerating Diffusion Models with 1 Sample

Glance: 通过1个样本加速扩散模型

Zhuobai Dong, Rui Zhao, Songjie Wu, Junchao Yi, Linjie Li, Zhengyuan Yang, Lijuan Wang, Alex Jinpeng Wang

机构 * WHU(武汉大学) NUS(国立新加坡大学) CSU(中国科学技术大学) UESTC(电子科技大学) Microsoft(微软公司)

AI总结 本文提出通过轻量LoRA适配器实现扩散模型的高效加速,仅需1个样本训练即可获得强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19955 2025-12-12 cs.RO

ShapeForce: Low-Cost Soft Robotic Wrist for Contact-Rich Manipulation

ShapeForce: 低成本的软体机器人手腕用于接触密集的操控

Jinxuan Zhu, Zihao Yan, Yangyu Xiao, Jingxiang Guo, Chenrui Tie, Xinyi Cao, Yuhang Zheng, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) RoboScience, Shenzhen, China(深圳机器人科学研究院)

AI总结 ShapeForce是一种低成本软体机器人手腕,通过变形核心和标记跟踪提供力样信号,实现接触密集操控的高效反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15257 2025-12-12 cs.CL

When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners

当语言更少时更有效:语言推理解耦使LLM成为更好的多语言推理者

Weixiang Zhao, Jiahe Guo, Yang Deng, Tongtong Wu, Wenxuan Zhang, Yulin Hu, Xingyu Sui, Yanyan Zhao, Wanxiang Che, Bing Qin, Tat-Seng Chua, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Singapore Management University(新加坡管理学院) Monash University(墨尔本大学) Singapore University of Technology and Design(新加坡科技设计大学) National University of Singapore(国立新加坡大学)

AI总结 通过解耦语言和推理能力,使LLM在多语言推理中表现更优,无需额外训练开销。

Comments NeurIPS 2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09406 2025-12-11 cs.RO cs.AI cs.CV

H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos

H2R-Grounder:一种无需配对数据的视频到物理 grounded 机器人视频翻译范式

Hai Ci, Xiaokang Liu, Pei Yang, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学显示实验室)

AI总结 H2R-Grounder通过无需配对数据的方法,将人类交互视频转换为物理 grounded 的机器人视频,提升机器人学习的现实感和扩展性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09247 2025-12-11 cs.CV

OmniPSD: Layered PSD Generation with Diffusion Transformer

OmniPSD:基于扩散变换器的分层PSD生成

Cheng Liu, Yiren Song, Haofan Wang, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Lovart AI

AI总结 OmniPSD通过扩散变换器实现文本到PSD生成和图像到PSD分解,提升分层设计的生成与编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18309 2025-12-11 stat.ML cs.LG eess.SP

Efficient Transformed Gaussian Process State-Space Models for Non-Stationary High-Dimensional Dynamical Systems

高效变换高斯过程状态空间模型用于非平稳高维动态系统

Zhidi Lin, Ying Li, Feng Yin, Juan Maroñas, Alexandre H. Thiéry

机构 * Department of Statistics and Actuarial Science, University of Hong Kong(统计与精算科学系,香港大学) Department of Statistics and Data Science, National University of Singapore(统计与数据科学系,新加坡国立大学) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(人工智能学院,香港中文大学(深圳)) Machine Learning Group, Universidad Autónoma de Madrid(马德里自治大学机器学习组)

AI总结 本文提出ETGPSSM,通过整合共享GP与输入依赖的归一化流,实现高效建模高维非平稳动态系统,提升计算效率和预测精度。

Comments IEEE Transactions on Signal Processing (16 pages, 6 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09016 2025-12-11 cs.CV

Learning to Remove Lens Flare in Event Camera

学习去除事件相机中的光斑

Haiqian Han, Lingdong Kong, Jianing Li, Ao Liang, Chengtao Zhu, Jiacheng Lyu, Lai Xing Ng, Xiangyang Ji, Wei Tsang Ooi, Benoit R. Cottereau

机构 * National University of Singapore(国立新加坡大学) Tsinghua University(清华大学) Institute for Infocomm Research, A*STAR(资讯通信研究院(A*STAR)) IPAL, CNRS IRL 2955, Singapore(IPAL,CNRS IRL 2955,新加坡) CerCo, CNRS UMR 5549, Université Toulouse III(CerCo,CNRS UMR 5549,图卢兹第三大学)

AI总结 本文提出E-Deflare框架,通过物理基础模型和基准数据集,实现了事件相机中光斑的有效去除,提升了视觉系统的性能。

Comments Preprint; 29 pages, 14 figures, 4 tables; Project Page at https://e-flare.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18321 2025-12-10 cs.CL cs.AI

LLMs Can't Handle Peer Pressure: Crumbling under Multi-Agent Social Interactions

大语言模型难以应对同伴压力:在多智能体社交互动中崩溃

Maojia Song, Tej Deep Pala, Ruiwen Zhou, Weisheng Jin, Amir Zadeh, Chuan Li, Dorien Herremans, Soujanya Poria

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Lambda Labs(Lambda实验室)

AI总结 研究探讨了大语言模型在多智能体社交互动中的表现,提出KAIROS基准用于评估模型在复杂社交动态中的决策能力,发现模型规模和训练方法对抵抗社交影响至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22930 2025-12-10 cs.CV

Towards Explainable Bilingual Multimodal Misinformation Detection and Localization

迈向可解释的双语多模态虚假信息检测与定位

Yiwei He, Zhenglin Huang, Haiquan Wen, Tianxiao Li, Yi Dong, Hao Fei, Baoyuan Wu, Guangliang Cheng

机构 * University of Liverpool, United Kingdom(利物浦大学) National University of Singapore, Singapore(新加坡国立大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

AI总结 BiMi提出双语多模态框架,通过联合定位、一致性检测和自然语言解释,提升多语言虚假信息检测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07458 2025-12-09 physics.comp-ph cond-mat.dis-nn cs.LG

Optimized Machine Learning Methods for Studying the Thermodynamic Behavior of Complex Spin Systems

优化机器学习方法研究复杂自旋系统的热力学行为

Dmitrii Kapitan, Pavel Ovchinnikov, Konstantin Soldatov, Petr Andriushchenko, Vitalii Kapitan

机构 * Heidelberg Institute of Global Health, Heidelberg University Hospital, Heidelberg University, INF 130.3, Heidelberg 69120, Germany(海德堡全球健康研究所、海德堡大学医院、海德堡大学) Institute for Functional Intelligent Materials, National University of Singapore, 21 Lower Kent Ridge Road, 119077, Singapore(功能智能材料研究所、新加坡国立大学)

AI总结 本文提出利用卷积神经网络优化研究复杂自旋系统热力学行为,通过训练不同晶格结构的相态分类器,有效降低误差并确定临界温度。

Comments 16 pages, in Russian language, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23045 2025-12-09 cs.AI cs.CL cs.SE

Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents

Kimi-Dev:无代理训练作为SWE-代理的技能先验

Zonghan Yang, Shengjie Wang, Kelin Fu, Wenyang He, Weimin Xiong, Yibo Liu, Yibo Miao, Bofei Gao, Yejie Wang, Yingwei Ma, Yanhao Li, Yue Liu, Zhenxing Hu, Kaitai Zhang, Shuyi Wang, Huarong Chen, Flood Sung, Yang Liu, Yang Gao, Zhilin Yang, Tianyu Liu

机构 * Moonshot AI THU(清华大学) PKU(北京大学) UCAS(中国科学技术大学) BUPT(北京邮电大学) NUS(新加坡国立大学)

AI总结 Kimi-Dev通过无代理训练生成技能先验,使SWE-代理在SWE-bench Verified上取得60.4%的优异成绩,并通过额外SFT适应达到48.6%的pass@1,与Claude 3.5 Sonnet相当。

Comments 68 pages. GitHub repo at https://github.com/MoonshotAI/Kimi-Dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14683 2025-12-09 cs.SE cs.AI

Unified Software Engineering Agent as AI Software Engineer

统一软件工程代理作为AI软件工程师

Leonhard Applis, Yuntong Zhang, Shanchao Liang, Nan Jiang, Lin Tan, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Purdue University(普渡大学)

AI总结 本文提出统一软件工程代理USEagent,旨在通过协调多种能力提升软件开发效率,通过USEbench验证其效果,发现其在复杂任务中表现优于现有代理。

Comments Leonhard Applis and Yuntong Zhang contributed equally to this work. To appear in ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19912 2025-12-09 cs.CV cs.LG cs.RO

Enhanced Spatiotemporal Consistency for Image-to-LiDAR Data Pretraining

增强的时空一致性用于图像到LiDAR数据预训练

Xiang Xu, Lingdong Kong, Hui Shuai, Wenwei Zhang, Liang Pan, Kai Chen, Ziwei Liu, Qingshan Liu

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) School of Computing, Department of Computer Science, National University of Singapore(新加坡国立大学计算机学院) School of Computer Science, Nanjing University of Posts and Telecommunications(南京邮电大学计算机学院) Shanghai AI Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

AI总结 SuperFlow++通过整合时空线索提升图像到LiDAR数据预训练效果,实现更鲁棒的特征表示和更高效的自动驾驶感知。

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14354 2025-12-09 cs.LG cs.CL

Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment

迈向帕累托最优的自我改进:缓解多目标对齐中的偏好冲突

Moxin Li, Yuantao Zhang, Wenjie Wang, Wentao Shi, Zhuo Liu, Fuli Feng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出一种自我改进的DPO框架,通过生成帕累托最优响应缓解多目标对齐中的偏好冲突,提升模型在帕累托前沿的优化效果。

Comments ACL findings (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09388 2025-12-09 cs.CV

Diffusion Models for Image Restoration and Enhancement: A Comprehensive Survey

扩散模型在图像修复与增强中的应用:全面综述

Xin Li, Yulin Ren, Xin Jin, Cuiling Lan, Xingrui Wang, Wenjun Zeng, Xinchao Wang, Zhibo Chen

机构 * University of Science and Technology of China(科学技术大学) National University of Singapore(国立新加坡大学) Eastern Institute for Advanced Study(东部高级研究机构) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文首次全面综述了基于扩散模型的图像修复与增强方法,涵盖学习范式、条件策略、框架设计等,并提出未来研究方向。

Comments Accepted by IJCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06589 2025-12-09 cs.CR cs.CV

OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation

OmniSafeBench-MM:多模态 jailbreak 攻击-防御评估的统一基准和工具箱

Xiaojun Jia, Jie Liao, Qi Guo, Teng Ma, Simeng Qin, Ranjie Duan, Tianlin Li, Yihao Huang, Zhitao Zeng, Dongxian Wu, Yiming Li, Wenqi Ren, Xiaochun Cao, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学) BraneMatrix AI, China(BraneMatrix AI) Chongqing University, China(重庆大学) Xi’an Jiaotong University, China(西安交通大学) Northeastern University, China(东北大学) Sun Yat-sen University, China(中山大学) Alibaba, China(阿里巴巴) National University of Singapore, Singapore(新加坡国立大学) ByteDance, China(字节跳动)

AI总结 OmniSafeBench-MM提供一个多模态jailbreak攻击-防御评估的统一基准和工具箱,整合13种攻击方法、15种防御策略及广泛数据集,通过三维评估协议深入分析安全与效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05987 2025-12-09 cs.CV cs.AI

Adaptive Dataset Quantization: A New Direction for Dataset Pruning

自适应数据集量化:一种新的数据集剪枝方向

Chenyue Yu, Jianyu Yu

机构 * National University of Singapore, Singapore(新加坡国立大学) PetroChina Company Limited, Cangzhou, China(中国石油公司)

AI总结 本文提出了一种自适应数据集量化方法,通过减少样本内部冗余实现数据集压缩,同时保持模型训练性能,优于传统方法。

Comments Accepted by ICCPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04686 2025-12-09 cs.CV

Towards Cross-View Point Correspondence in Vision-Language Models

面向视觉-语言模型的跨视图点对应研究

Yipu Wang, Yuheng Ji, Yuyang Liu, Enshen Zhou, Ziqiang Yang, Yuxuan Tian, Ziheng Qin, Yue Liu, Huajie Tan, Cheng Chi, Zhiyuan Ma, Daniel Dajun Zeng, Xiaolong Zheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beihang University(北航大学) Jilin University(吉林大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Huazhong University of Science And Technology(华中科技大学)

AI总结 本文提出跨视图点对应任务和 CrossPoint-Bench 基准,通过 CroPond 模型在 CrossPoint-Bench 上取得超越 Gemini-2.5-Pro 的准确率,推动跨视图对应研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13558 2025-12-09 cs.CV

X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability

X-Scene: 通过高保真和灵活可控性实现大规模驾驶场景生成

Yu Yang, Alan Liang, Jianbiao Mei, Yukai Ma, Yong Liu, Gim Hee Lee

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 X-Scene通过高保真和灵活可控性实现大规模驾驶场景生成,支持多粒度控制和一致性外推,提升自动驾驶的数据生成与模拟能力。

Comments Accepted by NeurIPS 2025, Project page at https://x-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09476 2025-12-08 cs.CV

Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses

视频生成中的协作面部专家融合:提升大面部姿态下的身份一致性

Yuji Wang, Moran Li, Xiaobin Hu, Ran Yi, Jiangning Zhang, Chengming Xu, Weijian Cao, Yabiao Wang, Chengjie Wang, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) National University of Singapore(新加坡国立大学)

AI总结 本文提出协作面部专家融合方法,通过动态融合身份、语义和细节专家信号,提升大姿态下视频生成的身份一致性,并构建了大规模姿态标注数据集。

Comments Project page: https://rain152.github.io/CoFE/

详情

展开后加载摘要…

URL PDF HTML 收藏