arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

2026-05-11 至 2026-05-11 共收录 15
2605.07930 2026-05-11 cs.LG cs.AI

INO-SGD: Addressing Utility Imbalance under Individualized Differential Privacy

INO-SGD:在个性化差分隐私下解决效用不平衡问题

Xiao Tian, Jue Fan, Rachael Hwee Ling Sim, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局)

AI总结 本文提出INO-SGD算法,通过在每个批次中策略性降低权重,改善所有迭代中更隐私数据的性能,满足个性化差分隐私需求,解决现有方法无法兼顾隐私和效用的不足。

Comments Accepted to the 14th International Conference on Learning Representations (ICLR-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07825 2026-05-11 cs.MM cs.CV

Anisotropic Modality Align

各向异性模态对齐

Xiaomin Yu, Yijiang Li, Yuhui Zhang, Hanzhen Zhao, Yue Yang, Hao Tang, Yue Song, Xiaobin Hu, Chengwei Qin, Shuicheng Yan, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) NUS(国立新加坡大学) UCSD(加州大学圣地亚哥分校) Stanford(斯坦福大学) PKU(北京大学) THU(清华大学)

AI总结 本文研究了多模态模型中模态间转换的可行性,提出各向异性模态对齐方法,通过几何修正框架提升单模态数据的多模态训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07815 2026-05-11 cs.LG cs.CL

OrScale: Orthogonalised Optimization with Layer-Wise Trust-Ratio Scaling

OrScale:基于层间信任比缩放的正交化优化

Yuxuan Lou, Yang You

机构 * National University of Singapore(新加坡国立大学)

AI总结 OrScale通过引入信任比缩放改进Muon算法,通过层间正交化优化提升训练稳定性,实现更高效的收敛与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06571 2026-05-11 cs.CL cs.AI cs.LG

Rep2Text: Decoding Full Text from a Single LLM Token Representation

Rep2Text:从单个LLM标记表示解码完整文本

Haiyan Zhao, Zirui He, Yiming Tang, Fan Yang, Ali Payani, Dianbo Liu, Mengnan Du

机构 * New Jersey Institute of Technology(新泽西理工学院) National University of Singapore(国立新加坡大学) Cisco Research(思科研究) Wake Forest University(威克森林大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究探讨如何从LLM单个最后标记表示恢复原始文本,提出Rep2Text框架,通过可训练适配器将目标模型的最后标记表示映射到解码语言模型的token嵌入空间,实现文本自回归重建,实验显示在16-token序列中约半数token可被恢复且保持语义连贯。

Comments 18 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07456 2026-05-11 cs.LG

Inference-Time Attribute Distribution Alignment for Unconditional Diffusion

推理时属性分布对齐用于无条件扩散

Hao Luan, See-Kiong Ng, Chun Kai Ling

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所)

AI总结 本文提出在推理时对齐属性分布的方法,通过最优控制问题优化扩散过程,实现更灵活的属性分布对齐,无需重新训练模型。

Comments Preprint. 35 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07455 2026-05-11 cs.CV

EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing

EditTransfer++:迈向精确且高效的视觉提示引导图像编辑

Lan Chen, Qi Mao, Yiren Song, Yuchao Gu, Siwei Ma

机构 * School of Information and Communication Engineering and the State Key Laboratory of Media Convergence and Communication, Communication University of China(信息与通信工程学院和媒体融合与通信国家重点实验室,中国传媒大学) ShowLab, National University of Singapore(新加坡国立大学ShowLab)

AI总结 EditTransfer++通过渐进式结构训练和高效条件方案提升视觉提示的准确性与推理效率,结合文本解耦训练和对比细化机制,实现更稳定的图像编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07396 2026-05-11 cs.LG cs.AI

Rubric-based On-policy Distillation

基于评分标准的在线蒸馏

Junfeng Fang, Zhepei Hong, Mao Zheng, Mingyang Song, Gengsheng Li, Houcheng Jiang, Dan Zhang, Haiyun Guo, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Tencent(腾讯)

AI总结 本文提出ROPD框架,利用教师生成的响应而非教师日志进行在线蒸馏,实现更灵活的黑盒兼容方案,实验显示在多数场景下性能优于基于日志的蒸馏方法,样本效率提升达10倍。

Comments Preprint. Code is available at https://github.com/Peregrine123/ROPD_official

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07390 2026-05-11 cs.CV

ST-Gen4D: Embedding 4D Spatiotemporal Cognition into World Model for 4D Generation

ST-Gen4D:将4D时空认知嵌入世界模型以实现4D生成

Haonan Wang, Hanyu Zhou, Tao Gu, Luxin Yan

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

AI总结 本文提出ST-Gen4D框架,通过4D时空认知世界模型实现4D生成,结合时空表示、认知、推理和生成四大设计,提升4D生成的结构合理性和拓扑一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07381 2026-05-11 cs.RO cs.AI

Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation

通过锚点中心适应摆脱机器人操作中的多样性陷阱

Yanzhe Chen, Kevin Yuchen Ma, Qi Lv, Yiqi Lin, Zechen Bai, Chen Gao, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Institude for Information Research, A STAR(A*STAR信息研究所)

AI总结 本文提出锚点中心适应方法,通过稳定策略骨架和选择性扩展覆盖范围,解决多样性陷阱问题,提升任务可靠性和成功率。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07252 2026-05-11 cs.GR cs.CV cs.MM

PersonaGest: Personalized Co-Speech Gesture Generation with Semantic-Guided Hierarchical Motion Representation

PersonaGest: 基于语义引导的层次化运动表示的个性化语音伴随手势生成

Junchuan Zhao, Qifan Liang, Ye Wang

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

AI总结 本文提出PersonaGest框架,通过语义引导的RVQ-VAE和Masked Generative Transformer实现语音伴随手势的高质量生成,提升语义一致性和个性化表现。

Comments 26 pages, 10 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06716 2026-05-11 cs.AI cs.CL

From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms

从存储到经验:LLM代理记忆机制演化的综述

Jinghao Luo, Yuchen Tian, Chuxue Cao, Ziyang Luo, Hongzhan Lin, Kaixin Li, Chuyi Kong, Ruichao Yang, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) South China Normal University(南方中国师范大学) Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) University of Science and Technology Beijing(北京科技大学)

AI总结 本文综述了LLM代理记忆机制的发展,提出三阶段框架,分析长程一致性、动态环境挑战和持续学习目标,探讨前瞻性探索与跨轨迹抽象等前沿机制,为下一代LLM代理设计提供指导。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02881 2026-05-11 cs.RO

MolmoAct2: Action Reasoning Models for Real-world Deployment

MolmoAct2:面向现实部署的动作推理模型

Haoquan Fang, Jiafei Duan, Donovan Clay, Sam Wang, Shuo Liu, Weikai Huang, Xiang Fan, Wei-Chuan Tsai, Shirui Chen, Yi Ru Wang, Shanli Xing, Jaemin Cho, Jae Sung Park, Ainaz Eftekhar, Peter Sushko, Karen Farley, Angad Wadhwa, Cole Harrison, Winson Han, Ying-Chun Lee, Eli VanderBilt, Rose Hendrix, Suveen Ellawela, Lucas Ngoo, Joyce Chai, Zhongzheng Ren, Ali Farhadi, Dieter Fox, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊公司) University of Michigan(密歇根大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出MolmoAct2,一个完全开放的动作推理模型,通过改进架构和引入新数据集,在五个方面提升性能,展示了在多个基准测试中优于现有模型的成果。

Comments 31 pages, project page: https://allenai.org/blog/molmoact2

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19974 2026-05-11 cs.CV

RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection

基于内在反思的生成式空间推理器:RL-RIG

Tianyu Wang, Zhiyuan Ma, Qian Wang, Xinyi Zhang, Xinwei Long, Bowen Zhou

机构 * Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫元学院) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 RL-RIG通过生成-反思-编辑范式,提升图像生成的精细空间关系捕捉能力,采用Scene Graph IoU和VLM评估策略,在空间一致性上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22976 2026-05-11 cs.CV cs.AI

LoopNav: Benchmarking Spatial Consistency in World Models

LoopNav:世界模型中空间一致性评估的基准测试

Kewei Lian, Shaofei Cai, Yitao Liang, Anji Liu

机构 * NUS(国立新加坡大学) Peking Univeristy(北京大学)

AI总结 LoopNav提出一个基于循环导航的基准测试,用于评估世界模型的空间一致性,通过Minecraft开放世界环境收集250小时视频数据,并引入场景图一致性评分以量化空间一致性。

Comments V3: SGCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05085 2026-05-11 cs.CL cs.SD eess.AS

S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models

S2S-Arena:评估语音到语音模型的副语言指令遵循

Feng Jiang, Zhiyu Lin, Yiyang Liu, Liumeng Xue, Fan Bu, Yuhao Du, Xiangying Chen, Benyou Wang, Haizhou Li

机构 * Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanjing University(南京大学) Shenzhen Loop Area Institute(深圳河套学院) CentraleSupélec, Université Paris-Saclay(巴黎萨克雷大学CentraleSupélec分校) National University of Singapore(新加坡国立大学)

AI总结 S2S-Arena通过四级交互协议和双阶段数据构建流程,评估语音模型在语义理解和副语言表达上的能力,揭示了现有系统在复杂副语言需求下的性能差距。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏