arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

共收录 2374
2601.11332 2026-01-19 cs.CL

Idea First, Code Later: Disentangling Problem Solving from Code Generation in Evaluating LLMs for Competitive Programming

先有想法,后写代码:在评估LLM用于竞技编程时,将问题解决与代码生成解耦

Sama Hadhoud, Alaa Elsetohy, Frederikus Hudi, Jan Christian Blaise Cruz, Steven Halim, Alham Fikri Aji

机构 * MBZUAI NAIST National University of Singapore(国立新加坡大学)

AI总结 本文提出通过编辑稿而非代码来评估LLM在竞技编程中的问题解决能力,并引入数据集和评估方法,强调区分问题解决与实现的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10532 2026-01-19 cs.CL

PERM: Psychology-grounded Empathetic Reward Modeling for Large Language Models

PERM:基于心理学的共情奖励建模用于大语言模型

Chengbing Wang, Wuqiang Zheng, Yang Zhang, Fengbin Zhu, Junyi Cheng, Yi Xie, Wenjie Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Huawei Technologies(华为技术)

AI总结 PERM通过双向分解和旁观者视角提升大语言模型的共情能力,实验显示其在同理心基准和对话数据集上表现优异,用户偏好率达70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11151 2026-01-19 cs.IR cs.AI

Cross-Modal Attention Network with Dual Graph Learning in Multimodal Recommendation

跨模态注意力网络与双图学习在多模态推荐中的应用

Ji Dai, Quan Fang, Jun Hu, Desheng Cai, Yang Yang, Can Zhao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学) Tianjin University of Technology(天津工业大学) Beihang University(北航) State Key Laboratory of CNS/ATM(国家空管重大科技专项实验室) Aviation Data Communication Corporation(航空数据通信公司)

AI总结 CRANE通过双图学习和递归注意力机制,解决多模态推荐中的浅层融合和不对称特征处理问题,提升推荐性能。

Comments Accepted to ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07351 2026-01-19 cs.CL cs.AI

Beyond Hard Masks: Progressive Token Evolution for Diffusion Language Models

超越硬掩膜:用于扩散语言模型的渐进性令牌演化

Linhao Zhong, Linyu Wu, Bozhen Fang, Tianjian Feng, Chenchen Jing, Wen Wang, Jiaheng Zhang, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Zhejiang University of Technology(浙江工业大学)

AI总结 本文提出EvoToken-DLM,通过演化的软令牌分布替代硬二进制掩码,实现扩散语言模型中可修正的解码,提升模型性能。

Comments Project webpage: https://aim-uofa.github.io/EvoTokenDLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23759 2026-01-19 eess.IV cs.CV

Spatio-Temporal Representation Decoupling and Enhancement for Federated Instrument Segmentation in Surgical Videos

联邦学习中手术视频仪器分割的时空表示解耦与增强

Zheng Fang, Xiaoming Qi, Chun-Mei Feng, Jialun Pei, Weixin Si, Yueming Jin

机构 * Department of Electrical and Computer Engineering, NUS, Singapore(新加坡国立大学电子与计算机工程系) Department of Biomedical Engineering, NUS, Singapore(新加坡国立大学生物医学工程系) Institute of High Performance Computing, A*STAR, Singapore(新加坡A*STAR高性能计算研究所) Department of Computer Science and Engineering, The Chinese University of Hong Kong, HKSAR, China(香港中文大学(深圳)计算机科学与工程系) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(中国科学院深圳先进技术研究所)

AI总结 本文提出FedST方法,通过解耦和增强时空表示,提升联邦学习中手术视频仪器分割的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14161 2026-01-19 cs.CL

MIST: Towards Multi-dimensional Implicit BiaS Evaluation of LLMs for Theory of Mind

MIST:面向大语言模型理论思维的多维隐性偏见评估

Yanlin Li, Hao Liu, Huimin Liu, Kun Wang, Yinwei Wei, Yupeng Hu

机构 * School of Software(软件学院) Shandong University(山东大学) National University of Singapore(新加坡国立大学) School of Psychology(心理学学院) Hainan Normal University(海南师范大学)

AI总结 MIST通过两个间接任务揭示大语言模型在理论思维方面的多维隐性偏见,提升模型对刻板印象的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10365 2026-01-16 cs.RO

FastStair: Learning to Run Up Stairs with Humanoid Robots

FastStair: 人类机器人跑步上楼梯的学习

Yan Liu, Tao Yu, Haolin Song, Hongbo Zhu, Nianzong Hu, Yuzhi Hao, Xiuyong Yao, Xizhe Zang, Hua Chen, Jie Zhao

机构 * School of Mechanics Engineering, Harbin Institute of Technology (HIT), Harbin Heilongjiang 150001, China(哈尔滨工业大学机械工程学院) LimX Dynamics, Shenzhen, China(LimX Dynamics) Zhejiang University-University of Illinois Urbana-Champaign Institute (ZJUI), Haining, China(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所) Department of Electronic Engineering and Information Science (EEIS), University of Science and Technology of China, Hefei 230027, China(中国科学技术大学电子工程与信息科学系) Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学) Department of Mechanical Engineering, National University of Singapore, Singapore 117575(新加坡国立大学机械工程系)

AI总结 FastStair通过结合基于模型的规划器和强化学习,实现仿人机器人快速稳定的楼梯上升,展示了在高速和长楼梯上的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09667 2026-01-16 cs.AI cs.CL

Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning

协同多智能体测试时间强化学习用于推理

Zhiyuan Hu, Yunhai Hu, Juncheng Liu, Shuyue Stella Li, Yucheng Wang, Zhen Xu, See-Kiong Ng, Anh Tuan Luu, Xinxing Xu, Bryan Hooi, Cynthia Breazeal, Hae Won Park

机构 * MIT(麻省理工学院) NUS(新加坡国立大学) NYU(纽约大学) Microsoft(微软) Columbia(哥伦比亚大学) NTU(国立科技大学)

AI总结 MATTRL通过在推理阶段注入结构化文本经验,提升多智能体在医学、数学和教育等领域的推理准确性,比多智能体基线提升3.67%,比单智能体基线提升8.67%。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00451 2026-01-16 cs.CV

Encoder-Only Image Registration

仅编码器图像配准

Xiang Chen, Renjiu Hu, Jinwei Zhang, Yuxi Zhang, Xinyao Yu, Min Liu, Yaonan Wang, Hang Zhang

机构 * School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) Cornell University(康奈尔大学) Department of Electrical and Computer Engineering, Johns Hopkins University(电气与计算机工程系,约翰霍普金斯大学) Department of Electrical and Computer Engineering, National University of Singapore(电气与计算机工程系,国立新加坡大学)

AI总结 EOIR通过仅编码器架构实现图像配准的高精度与高效率平衡,利用卷积网络线性化局部强度和和谐化全局对比度变化,构建拉普拉斯特征金字塔以逐步生成全微分变形。

Comments accepted by IEEE Transactions on Circuits and Systems for Video Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10272 2026-01-16 cs.CL cs.AI cs.LG cs.SD

MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts

MoST:通过模态感知混合专家混合语音和文本

Yuxuan Lou, Kai Yang, Yang You

机构 * School of Computer Science, National University of Singapore(新加坡国立大学计算机科学学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 MoST通过模态感知混合专家架构,实现语音和文本的高效融合,首次公开了基于混合专家的语音-文本大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09717 2026-01-16 cs.CL cs.AI

SALP-CG: Standard-Aligned LLM Pipeline for Classifying and Grading Large Volumes of Online Conversational Health Data

SALP-CG:面向在线医疗对话数据分类与分级的标准对齐大语言模型流水线

Yiwei Yan, Hao Li, Hua He, Gong Kai, Zhengyi Yang, Guanfeng Liu

机构 * School of Computing, Macquarie University, Australia(麦考瑞大学计算机学院) Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) School of Mathematics and Statistics, Shandong University of Technology, China(山东理工大学数学与统计学院) Digital Intelligence Center, Fuzhou University Affiliated Provincial Hospital, China(福州市附属省医院数字智能中心) School of Computer Science and Engineering, UNSW, Australia(新南威尔士大学计算机科学与工程学院)

AI总结 SALP-CG通过统一标准和自动化方法,实现在线医疗对话数据的分类与敏感性分级,提升健康数据治理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16063 2026-01-16 cs.LG cs.NA math.NA physics.flu-dyn

VICON: Vision In-Context Operator Networks for Multi-Physics Fluid Dynamics Prediction

VICON:基于多物理场流体动力学预测的上下文操作网络

Yadi Cao, Yuxuan Liu, Liu Yang, Rose Yu, Hayden Schaeffer, Stanley Osher

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣地亚哥分校) National University of Singapore(新加坡国立大学)

AI总结 VICON通过整合视觉Transformer架构,高效处理2D数据并提升多物理场流体动力学预测的准确性与鲁棒性。

Comments update after TMLR accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09474 2026-01-15 cs.LG math.OC

Terminally constrained flow-based generative models from an optimal control perspective

从最优控制视角出发的终端约束流基生成模型

Weiguo Gao, Ming Li, Qianxiao Li

机构 * School of Mathematical Sciences, Fudan University(复旦大学数学学院) Shanghai Key Laboratory of Contemporary Applied Mathematics(上海当代应用数学重点实验室) Department of Mathematics and Institute for Functional Intelligent Materials(数学系和功能智能材料研究所) National University of Singapore(新加坡国立大学)

AI总结 TOCFlow从最优控制视角提出一种几何感知的采样方法,通过终端共动框架实现二阶曲率效应捕捉,提升约束满足性能。

Comments 59 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04562 2026-01-15 cs.LG

LeMat-GenBench: A Unified Evaluation Framework for Crystal Generative Models

LeMat-GenBench:一种统一的晶体生成模型评估框架

Siddharth Betala, Samuel P. Gleason, Ali Ramlaoui, Andy Xu, Georgia Channing, Daniel Levy, Clémentine Fourrier, Nikita Kazeev, Chaitanya K. Joshi, Sékou-Oumar Kaba, Félix Therrien, Alex Hernandez-Garcia, Rocío Mercado, N. M. Anoop Krishnan, Alexandre Duval

机构 * Harvey Mudd College, USA(哈维·穆德学院,美国) National University of Singapore, Singapore(新加坡国立大学) University of Cambridge, UK(剑桥大学) Chalmers University of Technology, Sweden(瑞典查尔姆斯理工大学) Indian Institute of Technology Delhi, India(印度德里理工学院)

AI总结 LeMat-GenBench通过统一的评估框架和指标,评估晶体生成模型的稳定性与多样性,揭示稳定性与新颖性之间的权衡,为生成模型的发展提供指导。

Comments 46 pages, 17 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09274 2026-01-15 cs.AI

$A^3$-Bench: Benchmarking Memory-Driven Scientific Reasoning via Anchor and Attractor Activation

$A^3$-Bench:通过锚点和吸引子激活进行记忆驱动科学推理的基准测试

Jian Zhang, Yu He, Zhiyuan Wang, Zhangqi Wang, Kai He, Fangzhi Xu, Qika Lin, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学)

AI总结 $A^3$-Bench通过双尺度记忆驱动激活机制,评估科学推理中的记忆利用效果,揭示记忆激活对推理性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09259 2026-01-15 cs.AI

MAXS: Meta-Adaptive Exploration with LLM Agents

MAXS: 基于LLM代理的元适应性探索

Jian Zhang, Zhiyuan Wang, Zhangqi Wang, Yu He, Haoran Luo, li yuan, Lingling Zhang, Rui Mao, Qika Lin, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) South China University of Technology(华南理工大学)

AI总结 MAXS通过元适应性探索框架提升LLM代理在多工具推理中的全局有效性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01852 2026-01-15 eess.AS cs.AI cs.LG

MORE: Multi-Objective Adversarial Attacks on Speech Recognition

MORE: 语音识别中的多目标对抗攻击

Xiaoxue Gao, Zexin Li, Yiming Chen, Nancy F. Chen

机构 * Agency for Science, Technology and Research(科技研究局) University of California, Riverside(加州大学河滨分校) National University of Singapore(新加坡国立大学)

AI总结 MORE通过多目标对抗攻击方法,同时降低语音识别模型的识别准确率和推理效率,有效揭示了ASR模型的脆弱性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06803 2026-01-15 cs.CV

DyDiT++: Diffusion Transformers with Timestep and Spatial Dynamics for Efficient Visual Generation

DyDiT++: 带时间步和空间动态的扩散变换器用于高效的视觉生成

Wangbo Zhao, Yizeng Han, Jiasheng Tang, Kai Wang, Hao Luo, Yibing Song, Gao Huang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) Tsinghua University(清华大学)

AI总结 DyDiT++通过动态调整时间步和空间计算,提升视觉生成效率,减少计算成本并拓展应用范围。

Comments This paper was accepted to the IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) on January 9, 2026. arXiv admin note: substantial text overlap with arXiv:2410.03456

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08623 2026-01-14 cs.CV cs.AI cs.CR cs.LG

SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models

SafeRedir: 基于提示嵌入重定向的图像生成模型鲁棒去学习

Renyang Liu, Kangjie Chen, Han Qiu, Jie Zhang, Kwok-Yan Lam, Tianwei Zhang, See-Kiong Ng

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) CFAR and IHPC, A*STAR(CFAR和IHPC,A*STAR)

AI总结 SafeRedir通过提示嵌入重定向实现图像生成模型的鲁棒去学习,无需修改模型即可有效消除不安全内容并提升对抗性攻击抵抗力。

Comments Code at https://github.com/ryliu68/SafeRedir

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06789 2026-01-14 cs.SE cs.AI

MemGovern: Enhancing Code Agents through Learning from Governed Human Experiences

MemGovern:通过学习受控的人类经验增强代码代理

Qihao Wang, Ziming Cheng, Shuo Zhang, Fan Liu, Rui Xu, Heng Lian, Kunyi Wang, Xiaoming Yu, Jianghao Yin, Sen Hu, Yue Hu, Shaolei Zhang, Yanbing Liu, Ronghao Chen, Huacan Wang

机构 * UCAS(中国科学院大学) NUS(新加坡国立大学) ECNU(华东师范大学) FDU(福建师范大学) XDU(西安电子科技大学) UBC(不列颠哥伦比亚大学) HKUST(GZ)(香港科技大学) PKU(北京大学) RUC(中国人民大学) QuantaAlpha(量子阿尔法)

AI总结 MemGovern通过学习受控的人类经验,提升代码代理的修复效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23301 2026-01-14 cs.CV

MDReID: Modality-Decoupled Learning for Any-to-Any Multi-Modal Object Re-Identification

MDReID: 任意到任意多模态对象重识别的模态解耦学习

Yingying Feng, Jie Li, Jie Hu, Yukang Zhang, Lei Tan, Jiayi Ji

机构 * Northeastern University(东北大学) Xiamen University(厦门大学) National University of Singapore(新加坡国立大学)

AI总结 MDReID通过模态解耦学习和模态感知度量学习,实现了任意到任意多模态对象重识别的鲁棒性和可扩展性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22268 2026-01-14 cs.CV

GSAlign: Geometric and Semantic Alignment Network for Aerial-Ground Person Re-Identification

GSAlign:面向空地行人重识别的几何与语义对齐网络

Qiao Li, Jie Li, Yukang Zhang, Lei Tan, Jing Chen, Jiayi Ji

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部与可信计算重点实验室,教育部,武汉大学计算机科学与工程学院) Xiamen University(厦门大学) National University of Singapore(新加坡国立大学)

AI总结 GSAlign通过几何与语义对齐模块,有效解决空地行人重识别中的视角差异和遮挡问题,提升匹配精度。

Comments Accepted by Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08120 2026-01-14 cs.CV cs.AI cs.LG cs.MM

UniF$^2$ace: A Unified Fine-grained Face Understanding and Generation Model

UniF$^2$ace: 一个统一的细粒度人脸理解和生成模型

Junzhe Li, Sifan Zhou, Liya Guo, Xuerui Qiu, Linrui Xu, Delin Qu, Tingting Long, Chun Fan, Ming Li, Hehe Fan, Jun Liu, Shuicheng Yan

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Central South University(中南大学) Fudan University(复旦大学) Guangming Lab(光明实验室) Zhejiang University(浙江大学) Lancaster University(兰卡斯特大学) National University of Singapore(新加坡国立大学)

AI总结 UniF$^2$ace是一个专门针对细粒度人脸理解和生成的统一多模态模型,通过双离散扩散损失和多级分组专家混合架构,提升高质量面部细节生成和细粒度属性处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07779 2026-01-13 cs.MA cs.AI cs.CL cs.CV cs.HC

OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent

OS-Symphony: 一个用于鲁棒且通用计算机使用代理的综合框架

Bowen Yang, Kaiming Jin, Zhenyu Wu, Zhaoyang Liu, Qiushi Sun, Zehao Li, JingJing Xie, Zhoumianze Liu, Fangzhi Xu, Kanzhi Cheng, Qingyun Li, Yian Wang, Yu Qiao, Zun Wang, Zichen Ding

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) CUHK MMLab(香港中文大学MMLab) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 OS-Symphony通过反思记忆代理和多功能工具代理,提升计算机使用代理在长周期任务和新领域中的鲁棒性和泛化能力。

Comments 31 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07181 2026-01-13 cs.CV

ShowUI-Aloha: Human-Taught GUI Agent

ShowUI-Aloha: 由人类指导的GUI代理

Yichun Zhang, Xiangwu Guo, Yauhong Goh, Jessica Hu, Zhiheng Chen, Xin Wang, Difei Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

AI总结 ShowUI-Aloha通过将无结构的人类屏幕记录转化为结构化任务,提供了一种可扩展的解决方案,用于构建能够从观察人类中有效学习的通用GUI代理。

Comments 13 Pages, 16 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06573 2026-01-13 cs.AI cs.MM

QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models

QMAVIS:利用大多模态模型融合实现长视频音频理解

Zixing Lin, Jiale Wang, Gee Wah Ng, Lee Onn Mak, Chan Zhi Yang Jeriel, Jun Yang Lee, Yaohao Li

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University, Singapore(南洋理工大学)

AI总结 QMAVIS通过融合大型多模态模型、大型语言模型和语音识别模型,实现了长视频音频理解,展示了在VideoMME数据集上38.75%的性能提升,并在其他数据集上表现出竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05394 2026-01-13 cs.CV cs.GR cs.MM eess.IV

Sketch&Patch++: Efficient Structure-Aware 3D Gaussian Representation

Sketch&Patch++: 高效的结构感知3D高斯表示

Yuang Shi, Géraldine Morin, Simone Gasparini, Wei Tsang Ooi

机构 * National University of Singapore(新加坡国立大学) IRIT - Université de Toulouse(图卢兹大学IRIT)

AI总结 Sketch&Patch++提出一种结构感知的3D高斯表示方法,通过分层自适应分类框架实现高效存储和渲染,相比传统方法在PSNR、SSIM和LPIPS上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08362 2026-01-13 quant-ph cs.LG

An Information-Minimal Geometry for Qubit-Efficient Optimization

为量子比特高效优化设计的信息最小几何

Gordon Ma, Dimitris G. Angelakis

机构 * Centre for Quantum Technologies, National University of Singapore(量子技术中心,新加坡国立大学) Institute for Quantum Computing and Quantum Technologies, NCSR Demokritos(量子计算与量子技术研究所,NCSR德莫克里托斯研究中心) School of Electronics and Computer Science, University of Southampton(电子与计算机科学学院,南安普顿大学) AngelQ Quantum Computing, Singapore(新加坡AngelQ量子计算)

AI总结 本文提出了一种信息最小的几何方法,通过构建水平2阶谢尔盖-阿德ams多面体,实现量子比特高效优化的近最优近似比,揭示了配对多面体几何在解决大规模优化问题中的作用。

Comments 39 pages, 9 figures. v2: Revised for clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19142 2026-01-13 cs.CV

CLIP-GS: Unifying Vision-Language Representation with 3D Gaussian Splatting

CLIP-GS: 通过3D高斯点划法统一视觉-语言表示

Siyu Jiao, Haoye Dong, Yuyang Yin, Zequn Jie, Yinlong Qian, Yao Zhao, Humphrey Shi, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) National University of Singapore(新加坡国立大学) Meituan(美团) Georgia Institute of Technology(佐治亚理工学院) Picsart AI Research (PAIR)(Picsart AI研究(PAIR))

AI总结 CLIP-GS通过3D高斯点划法统一视觉-语言表示,利用对比损失和图像投票损失提升多模态检索和分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06834 2026-01-13 cs.CV

Enhancing Low-resolution Image Representation Through Normalizing Flows

通过归一化流增强低分辨率图像表示

Chenglong Bao, Tongyao Pang, Zuowei Shen, Dihan Zheng, Yihang Zou

机构 * Yau Mathematical Sciences Center, Tsinghua University, Beijing, China(清华大学数学科学中心,北京,中国) Beijing Institute of Mathematical Sciences and Applications, Beijing, China(北京数学科学研究院,北京,中国) Department of Mathematics, National University of Singapore, Singapore(新加坡国立大学数学系,新加坡) Department of Pharmaceutical Chemistry, University of California, San Francisco, CA, USA(加州大学旧金山分校药学化学系,美国,加利福尼亚州,旧金山) Yau Mathematical Sciences Center and Department of Mathematical Sciences, Tsinghua University, Beijing, China(清华大学数学科学中心及数学系,北京,中国)

AI总结 本文提出LR2Flow框架,通过整合小波紧框架块与归一化流,提升低分辨率图像表示的重建能力与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏