arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

共收录 2370
2604.04986 2026-04-08 cs.LG

Enhancing sample efficiency in reinforcement-learning-based flow control: replacing the critic with an adaptive reduced-order model

提升基于强化学习的流控制样本效率:用自适应降阶模型替代批评器

Zesheng Yao, Zhen-Hua Wan, Canjun Yang, Qingchao Xia, Mengqi Zhang

机构 * School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系) Department of Modern Mechanics, University of Science and Technology of China(中国科学技术大学近代力学系)

AI总结 本文提出一种基于自适应降阶模型的强化学习框架,通过物理洞察设计降阶模型结构,结合线性动力系统和神经微分方程估计流体非线性,实现更高效的控制器优化。

Comments 43 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04982 2026-04-08 cs.IR cs.AI cs.CL cs.LG

CURE:Circuit-Aware Unlearning for LLM-based Recommendation

CURE:基于电路的LLM推荐系统去学习

Ziheng Chen, Jiali Cheng, Zezhong Fan, Hadi Amiri, Yunzhi Yao, Xiangguo Sun, Yang Zhang

机构 * University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出CURE框架,通过分离模型组件并按功能分类,解决LLM推荐系统去学习中的梯度冲突问题,提升去学习效果和模型稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23448 2026-04-08 cs.SE cs.AI

Code Review Agent Benchmark

代码审查代理基准

Yuntong Zhang, Zhiyuan Pan, Imam Nur Bani Yusuf, Haifeng Ruan, Ridwan Shariffdeen, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 本文提出c-CRAB基准,用于评估代码审查代理的能力,发现现有代理仅能解决40%的任务,揭示了未来研究的潜力及人机协作的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19297 2026-04-08 cs.LG

CLaRE-ty Amid Chaos: Quantifying Representational Entanglement to Predict Ripple Effects in LLM Editing

在混乱中保持清晰:量化表征纠缠以预测LLM编辑中的涟漪效应

Manit Baser, Alperen Yildiz, Dinil Mon Divakaran, Mohan Gurusamy

机构 * National University of Singapore(新加坡国立大学) A*STAR Institute for Infocomm Research (A*STAR I2 R)(新加坡科技研究局资讯通信研究院)

AI总结 本文提出CLaRE技术,通过量化事实间的纠缠关系,识别LLM编辑中的潜在涟漪效应,提升模型编辑的稳定性和效率。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17652 2026-04-08 q-bio.QM cs.CV

TeamPath: Building MultiModal Pathology Experts with Reasoning AI Copilots

TeamPath: 构建多模态病理专家的推理AI助手

Tianyu Liu, Weihao Xuan, Hao Wu, Peter Humphrey, Marcello DiStasio, Mohamed Kahila, Alfonso Garcia Tan, Heli Qi, Rui Yang, Simeng Han, Tinglin Huang, Fang Wu, Chen Liu, Qingyu Chen, Nan Liu, Irene Li, Hua Xu, Hongyu Zhao

机构 * Interdepartmental Program in Computational Biology and Biomedical Informatics, Yale University(耶鲁大学计算生物学与生物医学信息学跨学科项目) Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Broad Institute of MIT and Harvard(博德研究所) Department of Complexity Science and Engineering, The University of Tokyo(东京大学复杂科学与工程系) Center for Advanced Intelligence Project, RIKEN(理化学研究所先进智能项目中心) Department of Pathology, Yale University(耶鲁大学病理学系) Department of Anatomical Pathology, Singapore General Hospital(新加坡中央医院解剖病理学系) Center for Biomedical Data Science, Duke–NUS Medical School, Singapore, Singapore(杜克-新加坡国立大学医学院生物医学数据科学中心) Department of Computer Science, Yale University(耶鲁大学计算机科学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

AI总结 TeamPath通过强化学习和路由增强方案,整合多模态数据提升病理诊断与跨模态生成能力,为临床提供可靠的信息交流系统。

Comments 45 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09691 2026-04-08 cs.CV

PaCo-FR: Patch-Pixel Aligned End-to-End Codebook Learning for Facial Representation Pre-training

PaCo-FR:基于补丁-像素对齐的端到端代码本学习用于面部表示预训练

Yin Xie, Zhichao Chen, Zeyu Xiao, Yongle Zhao, Xiang An, Kaicheng Yang, Zimin Ran, Jia Guo, Ziyong Feng, Jiankang Deng

机构 * GlintLab National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼科技大学) Imperial College London(伦敦帝国理工学院)

AI总结 本文提出PaCo-FR,通过结合掩码图像建模与补丁-像素对齐,解决面部表示预训练中特征捕捉、空间结构和数据利用效率的问题,实现高效且鲁棒的面部分析性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04759 2026-04-07 cs.CR cs.AI cs.CL

Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw

你的代理,他们的资产:OpenClaw的现实世界安全性分析

Zijun Wang, Haoqin Tu, Letian Zhang, Hardy Chen, Juncheng Wu, Xiangyan Liu, Zhenlong Yuan, Tianyu Pang, Michael Qizhe Shieh, Fengze Liu, Zeyu Zheng, Huaxiu Yao, Yuyin Zhou, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) NUS(新加坡国立大学) Tencent(腾讯) ByteDance(字节跳动) UC Berkeley(加州大学伯克利分校) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文首次对OpenClaw进行现实世界安全性评估,引入CIK分类法分析代理的持久状态,发现攻击单个CIK维度可显著提高攻击成功率,强调需系统性保障个人AI代理的安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04562 2026-04-07 cs.DL cs.AI

Paper Espresso: From Paper Overload to Research Insight

Paper Espresso:从论文过载到研究洞察

Mingzhe Du, Luu Anh Tuan, Dong Huang, See-kiong Ng

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 Paper Espresso通过大规模语言模型自动发现、总结和分析arXiv热点论文,揭示AI研究动态,包括强化学习的爆发、非饱和主题涌现及新颖性与社区参与度的正相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04402 2026-04-07 cs.CV

UENR-600K: A Large-Scale Physically Grounded Dataset for Nighttime Video Deraining

UENR-600K:一个大规模的物理基础数据集用于夜间视频去雨

Pei Yang, Hai Ci, Beibei Lin, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab) National University of Singapore(新加坡国立大学)

AI总结 本文提出UENR-600K数据集,通过Unreal Engine模拟真实夜间雨景,解决传统小规模数据无法捕捉物理特性的问题,提升模型在真实夜间雨场景下的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04354 2026-04-07 cs.HC cs.CL cs.CY

Talk2AI: A Longitudinal Dataset of Human--AI Persuasive Conversations

Talk2AI: 人类与AI说服对话的纵向数据集

Alexis Carrillo, Enrique Taietta, Ali Aghazadeh Ardebili, Giuseppe Alessandro Veltri, Massimo Stella

机构 * University of Trento(特伦托大学) National University of Singapore(新加坡国立大学)

AI总结 Talk2AI数据集通过3080次对话研究说服、观点变化和人机交互,包含30800个对话轮次及丰富的上下文数据。

Comments 17 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.13096 2026-04-07 cs.CV

3D Magic Mirror: Clothing Reconstruction from a Single Image via a Causal Perspective

3D魔镜:通过因果视角从单张图像进行衣物重建

Zhedong Zheng, Jiayin Zhu, Wei Ji, Yi Yang, Tat-Seng Chua

机构 * Sea-NExT Joint Lab, National University of Singapore(新加坡国立大学Sea-NExT联合实验室) Zhejiang University(浙江大学)

AI总结 本文提出一种自监督学习方法,通过因果视角从单张图像重建3D非刚性物体,解决3D标注困难、模板限制和内在模糊性问题,实验表明其在时尚数据集上能实现高质量重建。

Comments Update results. Report person re-id performance. Add details in Appendix

Journal ref npj Artif. Intell. 2, 29 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03862 2026-04-07 cs.CR cs.DC cs.LG

SecureAFL: Secure Asynchronous Federated Learning

SecureAFL: 安全的异步联邦学习

Anjun Gao, Feng Wang, Zhenglin Wan, Yueyang Quan, Zhuqing Liu, Minghong Fang

机构 * University of Louisville(路易斯维尔大学) Northeastern University(东北大学) National University of Singapore(新加坡国立大学) University of North Texas(北德克萨斯大学)

AI总结 本文提出SecureAFL框架,通过检测并丢弃异常更新、估计缺失客户端贡献以及采用坐标中位数聚合技术,提升异步联邦学习的安全性与鲁棒性。

Comments To appear in ACM AsiaCCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03693 2026-04-07 cs.CV

ResGuard: Enhancing Robustness Against Known Original Attacks in Deep Watermarking

ResGuard: 提高深度水印在已知原始攻击下的鲁棒性

Hanyi Wang, Han Fang, Yupeng Qiu, Shilin Wang, Ee-Chien Chang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出ResGuard模块,通过增强图像依赖性来提升对已知原始攻击的鲁棒性,使水印提取准确率从59.87%提升至99.81%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03656 2026-04-07 cs.AI

Beyond Retrieval: Modeling Confidence Decay and Deterministic Agentic Platforms in Generative Engine Optimization

超越检索:在生成引擎优化中建模置信度衰减与确定性代理平台

XinYu Zhao, ChengYou Li, XiangBao Meng, Kai Zhang, XiaoDong Liu

机构 * National University of Singapore(新加坡国立大学) Yishu Research(艺树研究) Fukuoka Institute of Technology(福冈工业大学)

AI总结 本文提出通过确定性多代理意图路由替代传统检索增强生成方法,建模置信度衰减并构建代理信任经纪生态系统,实验证明显著降低垂直任务幻觉率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03645 2026-04-07 eess.IV cs.CV

UniSurgSAM: A Unified Promptable Model for Reliable Surgical Video Segmentation

UniSurgSAM: 一种用于可靠外科视频分割的统一提示模型

Haofeng Liu, Ziyue Wang, Alex Y. W. Kong, Guanyi Qin, Yunqiu Xu, Chang Han Low, Mingqi Gao, Lap Yan Lennon Chan, Yueming Jin

机构 * Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) School of Computer Science, The University of Sheffield(谢菲尔德大学计算机科学学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

AI总结 本文提出UniSurgSAM,通过视觉、文本或音频提示实现可靠的外科视频分割,采用解耦两阶段框架解决优化干扰问题,并引入三种关键设计提升可靠性。

Comments Extended version of MICCAI 2025 paper (ReSurgSAM2). 13 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03315 2026-04-07 cs.CV cs.AI

StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics

StoryBlender: 具有时空动态的跨镜头一致且可编辑的3D分镜

Bingliang Li, Zhenhong Sun, Jiaming Bian, Yuehao Wu, Yifu Wang, Hongdong Li, Yatao Bian, Huadong Mo, Daoyi Dong

机构 * Independent Researcher(独立研究员) Australia National University(澳大利亚国立大学) Central South University(中南大学) University of New South Wales(新南威尔士大学) Vertex Lab(Vertex实验室) National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼科技大学)

AI总结 StoryBlender通过三阶段流程实现跨镜头一致性和可编辑性,结合语义空间接地、资产材料化和时空动态,提升3D分镜生成的连续性和编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03242 2026-04-07 cs.LG

DRAFT: Task Decoupled Latent Reasoning for Agent Safety

草稿:任务解耦的潜在推理用于代理安全

Lin Wang, Junfeng Fang, Dan Zhang, Fei Shen, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出DRAFT框架,通过解耦安全判断为提取器和推理器两个阶段,利用潜在空间证据聚合提升代理安全性,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01590 2026-04-07 eess.AS cs.SD

PhiNet: Speaker Verification with Phonetic Interpretability

PhiNet:具有语音可解释性的说话人验证

Yi Ma, Shuai Wang, Tianchi Liu, Haizhou Li

机构 * National University of Singapore(新加坡国立大学) LIGHTSPEED Nanjing University(南京大学) Shenzhen Loop Area Institute(深圳河套学院) Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong(香港中文大学(深圳)深圳市大数据研究院)

AI总结 PhiNet通过利用语音证据提升局部和全局可解释性,为说话人验证提供详细的语音级比较,帮助用户手动检查特征并评估验证结果,同时为开发者提供决策理由,简化错误追踪和超参数选择。

Comments Accepted by IEEE Transactions on Audio, Speech and Language Processing. Codes: https://github.com/mmmmayi/PhiNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03944 2026-04-07 cs.CV

SCP: Spatial Causal Prediction in Video

SCP:视频中的空间因果预测

Yanguang Zhao, Jie Yang, Shengqiong Wu, Shutong Hu, Hongbo Qiu, Yu Wang, Guijia Zhang, Tan Kai Ze, Hao Fei, Chia-Wen Lin, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Shenzhen University(深圳大学) Sichuan University(四川大学) National Tsing Hua University(国立清华大学)

AI总结 本文提出SCP任务,挑战模型超越观察预测空间因果结果,并构建SCP-Bench基准测试,揭示人类与模型性能差距及因果推理局限。

Comments 30 pages, 21 figures, 17 tables, CVPR findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21940 2026-04-07 stat.ML cs.IT cs.LG math.IT math.ST stat.TH

Sequential 1-bit Mean Estimation with Near-Optimal Sample Complexity

序列1位均值估计与近最优样本复杂性

Ivan Lau, Jonathan Scarlett

机构 * National University of Singapore(新加坡国立大学)

AI总结 本文研究了在1位通信约束下的分布式均值估计问题,提出基于随机和序列选择区间查询的均值估计器,证明其在有限均值和方差条件下满足(ε, δ)-PAC要求,并给出样本复杂性界,匹配无量化设置的最小最大下界。

Comments AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05892 2026-04-07 cs.CV cs.AI

Challenges in Deep Learning-Based Small Organ Segmentation: A Benchmarking Perspective for Medical Research with Limited Datasets

深度学习在小器官分割中的挑战:基于有限数据集的医学研究基准视角

Phongsakon Mark Konrad, Andrei-Alexandru Popa, Yaser Sabzehmeidani, Liang Zhong, Madhulika Tripathy, Andrei Constantinescu, Elisa A. Liehn, Serkan Ayvaz

机构 * Centre for Industrial Software, University of Southern Denmark(南丹麦大学工业软件中心) Centre for Industrial Mechanics, University of Southern Denmark(南丹麦大学工业力学中心) Duke-NUS(杜克-新加坡国立大学医学院) National Heart Center Singapore(新加坡国家心脏中心) University of Medicine and Pharmacy Carol Davila Bucharest(布加勒斯特卡罗尔·达维拉医药大学)

AI总结 本文评估了十种深度学习分割模型在有限数据集上的表现,发现经典架构在分布偏移下表现不佳,而基础模型保持稳定,揭示了低数据环境下基准评估的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08547 2026-04-07 cs.AI

Representation learning to advance multi-institutional studies with electronic health record data from US and France

利用表示学习推动多机构研究的电子健康记录数据:来自美国和法国的数据

Doudou Zhou, Han Tong, Linshanshan Wang, Suqi Liu, Xin Xiong, Ziming Gan, Romain Griffier, Boris Hejblum, Yun-Chung Liu, Chuan Hong, Clara-Lea Bonzel, Tianrun Cai, Kevin Pan, Yuk-Lam Ho, Lauren Costa, Vidul A. Panickan, J. Michael Gaziano, Kenneth Mandl, Vianney Jouhet, Rodolphe Thiebaut, Zongqi Xia, Kelly Cho, Katherine Liao, Tianxi Cai

机构 * Department of Statistics and Data Science, National University of Singapore(新加坡国立大学统计与数据科学系) Harvard T.H. Chan School of Public Health(哈佛大学陈曾熙公共卫生学院) Department of Statistics, Columbia University(哥伦比亚大学统计系) Harvard Medical School(哈佛医学院) Department of Statistics, University of Chicago(芝加哥大学统计系) Univ. Bordeaux, INSERM, Bordeaux Population Health Research Center(波尔多大学,法国国家健康与医学研究院,波尔多人口健康研究中心) CHU de Bordeaux, Service d’Information Médicale(波尔多大学医院医学信息部) Inria SISTM Team(法国国家信息与自动化研究所SISTM团队) Duke University(杜克大学) VA Boston Healthcare System(VA波士顿医疗系统) Brigham and Women’s Hospital(布里格姆妇女医院) Brown University(布朗大学) Computational Health Informatics Program, Boston Children’s Hospital(波士顿儿童医院计算健康信息学项目) Department of Neurology, University of Pittsburgh(匹兹堡大学神经病学系)

AI总结 本文提出基于图的框架,通过学习共享语义空间解决多机构电子健康记录数据表示不一致问题,提升跨机构临床模型训练与部署的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02934 2026-04-06 cs.CV

PolyReal: A Benchmark for Real-World Polymer Science Workflows

PolyReal:一个用于现实世界聚合物科学工作流程的基准

Wanhao Liu, Weida Wang, Jiaqing Xie, Suorong Yang, Jue Wang, Benteng Chen, Guangtao Mei, Zonglin Yang, Shufei Zhang, Yuchun Mo, Lang Cheng, Jin Zeng, Houqiang Li, Wanli Ouyang, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Tongji University(同济大学) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 PolyReal是一个新的多模态基准,用于评估大规模语言模型在聚合物实验全流程中的能力,揭示了模型在实践任务上的不足,填补了评估空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02627 2026-04-06 cs.CV cs.AI cs.MM

Smart Transfer: Leveraging Vision Foundation Model for Rapid Building Damage Mapping with Post-Earthquake VHR Imagery

智能迁移:利用视觉基础模型实现地震后高分辨率影像快速建筑损坏映射

Hao Li, Liwei Zou, Wenping Yin, Gulsen Taskin, Naoto Yokoya, Danfeng Hong, Wufan Zhao

机构 * Department of Geography, National University of Singapore(新加坡国立大学地理系) Urban Governance and Design Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)城市治理与设计学域) School of Environment and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与空间信息学院) Disaster Management Institute, Istanbul Technical University(伊斯坦布尔技术大学灾害管理研究所) Department of Complexity Science and Engineering, University of Tokyo(东京大学复杂科学与工程系) School of Automation, Southeast University(东南大学自动化学院)

AI总结 本文提出Smart Transfer框架,利用先进视觉基础模型实现快速建筑损坏映射,通过像素聚类和距离惩罚三元组策略提升跨区域迁移性能,为灾害响应提供可扩展的自动化解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02288 2026-04-03 cs.LG cs.AI

Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing

通过样本路由统一组相对和自蒸馏策略优化

Gengsheng Li, Tianyu Yang, Junfeng Fang, Mingyang Song, Mao Zheng, Haiyun Guo, Dan Zhang, Jinqiao Wang, Tat-Seng Chua

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Tencent(腾讯) Wuhan AI Research(武汉人工智能研究院)

AI总结 本文提出SRPO框架,通过样本路由整合GRPO和SDPO的优势,解决自蒸馏在长期训练中的稳定性问题,实现快速早期改进与长周期稳定性的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01966 2026-04-03 cs.CV cs.AI cs.RO

Ego-Grounding for Personalized Question-Answering in Egocentric Videos

面向第一视角视频的个性化问答中的自我定位

Junbin Xiao, Shenglang Zhang, Pengxiang Zhu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出MyEgo数据集,用于评估多模态大语言模型在需要自我定位的个性化问答中的能力,发现现有模型在自我记忆和推理方面存在显著不足。

Comments To appear at CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01915 2026-04-03 cs.CV

Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts

通过知识引导的空间提示增强医学视觉 grounding

Yifan Gao, Tao Zhou, Yi Zhou, Ke Zou, Yizhe Zhang, Huazhu Fu

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Yong Yoo Lin School of Medicine, National University of Singapore(新加坡国立大学杨潞龄医学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所)

AI总结 本文提出KnowMVG框架,通过知识增强提示和全局局部注意力机制提升医学视觉 grounding的精度,实验显示在四个基准上优于现有方法。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01586 2026-04-03 cs.CV cs.AI

SHOE: Semantic HOI Open-Vocabulary Evaluation Metric

SHOE:语义HOI开放词汇评估度量

Maja Noack, Qinqian Lei, Taipeng Tian, Bihan Dong, Robby T. Tan, Yixin Chen, John Young, Saijun Zhang, Bo Wang

机构 * University of Mississippi(密西西比大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究员) ASUS Intelligent Cloud Services (AICS)(华硕智能云服务(AICS))

AI总结 本文提出SHOE评估框架,通过结合预测与真实HOI标签的语义相似性,改进开放词汇HOI检测的评估方法,实验表明其与人类判断一致率达85.73%。

Comments Accepted to GRAIL-V Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06499 2026-04-03 cs.CV cs.AI

ExGes: Expressive Human Motion Retrieval and Modulation for Audio-Driven Gesture Synthesis

ExGes:基于音频驱动的 gesture 合成中的 expressive 人类运动检索与调节

Xukun Zhou, Fengxin Li, Ming Chen, Yan Zhou, Pengfei Wan, Di Zhang, Yeying Jin, Zhaoxin Fan, Hongyan Liu, Jun He

机构 * Renmin University(中国人民大学) Kuaishou Technology(快手科技) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 本文提出ExGes框架,通过运动库构建、运动检索模块和精度控制模块,提升音频驱动手势合成的表达性和与音频语义的一致性,实验表明其在Fréchet Gesture Distance和运动多样性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01043 2026-04-02 cs.CV

ONE-SHOT: Compositional Human-Environment Video Synthesis via Spatial-Decoupled Motion Injection and Hybrid Context Integration

ONE-SHOT:通过空间解耦的运动注入与混合上下文整合进行组合人类-环境视频合成

Fengyuan Yang, Luying Huang, Jiazhi Guan, Quanwei Yang, Dongwei Pan, Jianglin Fu, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Baidu Inc.(百度公司)

AI总结 本文提出ONE-SHOT框架,通过空间解耦运动注入和混合上下文整合,实现高效的人类-环境视频合成,优于现有方法,具有更好的结构控制和创意多样性。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏