arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

2026-06-16 至 2026-06-16 共收录 12
2606.16602 2026-06-16 cs.LG cs.NA math.NA physics.comp-ph 新提交

PhysGuard: Fisher-Guided Gradient Projection for Sim-to-Real Neural PDE Surrogates

PhysGuard: 面向仿真到现实神经PDE代理的Fisher引导梯度投影

Changjian Zhou, Junfeng Fang, Negin Yousefpour, Peng Wu, Bin Yan, Guillermo A Narsilio

机构 * Faculty of Engineering and IT, University of Melbourne(墨尔本大学工程与信息技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Artificial Intelligence Research Institute, IFLYTEK Co., Ltd.(科大讯飞股份有限公司人工智能研究院)

AI总结 针对神经算子模型从仿真到现实迁移时的精度下降问题,提出PhysGuard框架,利用仿真数据的Fisher信息矩阵保护物理关键参数,限制微调更新方向,在严重域偏移下将低频误差降低32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16082 2026-06-16 cs.CV cs.AI 新提交

Tool-IQA: Augmenting Image Quality Assessment with Simple Tools

Tool-IQA: 利用简单工具增强图像质量评估

Guanyi Qin, Junjie Zhang, Chunming He, Yibing Fu, Jie Liang, Tianhe Wu, Lei Zhang

机构 * National University of Singapore(新加坡国立大学) OPPO Research Institute(OPPO研究院) Nanyang Technical University(南洋理工大学) Duke University(杜克大学) City University of Hong Kong(香港城市大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 提出Tool-IQA,通过为视觉语言模型配备放大镜和伽马校正器等简单工具,将被动评分转变为工具增强的工作流程,显著提升图像质量评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15912 2026-06-16 cs.LG cs.AI 新提交

On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents

基于课程回合级指导的在线策略蒸馏用于多轮智能体

Gengsheng Li, Mao Zheng, Mingyang Song, Ruiqi Liu, Tianyu Yang, Jie Sun, Qiyong Zhong, Haiyun Guo, Junfeng Fang, Dan Zhang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Large Language Model Department, Tencent(腾讯大语言模型部) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究院)

AI总结 针对多轮智能体在线策略蒸馏中错误累积导致教师监督失效的问题,提出混合教师和学生生成回合的Guided-OPD算法,通过课程式衰减教师干预概率,在ALFWorld等任务上平均提升21.1%得分和25.5%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15880 2026-06-16 cs.CV cs.AI 新提交

Deep Residual Injection for Full-Spectrum Forensic Signal Perception in Multimodal Large Language Models

深度残差注入:多模态大语言模型的全频谱取证信号感知

Kaiqing Lin, Zhiyuan Yan, Ruoxin Chen, Ke-Yue Zhang, Yue Zhou, Caiyong Piao, Bin Li, Taiping Yao, Bo Wang, Youchang Xiao, Shouhong Ding

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 针对多模态大语言模型在取证中难以同时保留语义知识和捕获低级生成器伪影的问题,提出Deep-VRM方法,通过将伪影特定视觉信号作为残差路径注入中间层,实现全频谱信号感知,达到鲁棒检测性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15846 2026-06-16 cs.RO 新提交

FlashNav: Ultra-Fast Policy Training for Robot Navigation within 20 Seconds

FlashNav:20秒内实现超快速机器人导航策略训练

Shanze Wang, Yiwei Qian, Xinming Zhang, Jun Xue, Siwei Cheng, Xianghui Wang, Qingyuan Hu, Xiaoyu Shen, Wei Zhang

机构 * Eastern Institute of Technology, Ningbo(宁波东方理工大学) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出FlashNav框架,通过GPU加速和MDP对齐实现20秒内训练可部署的导航策略,在TurtleBot2和Unitree Go2上验证成功。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15702 2026-06-16 math.OC cs.LG 新提交

Schattor: Schatten-family methods for deep learning optimization

Schattor:用于深度学习优化的Schatten族方法

Bohao Ma, Junyu Zhang, Chuan He

机构 * School of Data Science, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)数据科学学院) Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Department of Mathematics, Linköping University(利乌波德大学数学系)

AI总结 提出基于Schatten范数的自适应一阶方法族Schattor,统一SGD与Muon,通过矩阵鞅矩界实现无维数平稳性保证,并开发多块扩展以自适应平衡块优化。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15570 2026-06-16 cs.CV 新提交

An Extensive Benchmark for Single-round and Multi-round Instruction-based Image Editing

单轮与多轮指令式图像编辑的广泛基准

Yiwei Ma, Ke Ye, Weihuang Lin, Jiayi Ji, Xiaoshuai Sun, Tat-Seng Chua, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Singapore(新加坡国立大学)

AI总结 提出I2EBench2.0基准,通过16个单轮和7个多轮维度评估指令式图像编辑模型,结合用户研究确保与人类判断一致,并基于八种模型分析提供研究指导。

Comments Accepted by International Journal of Computer Vision (IJCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15550 2026-06-16 cs.RO 新提交

Robots as Tokens: Unified Diffusion Transformer for Coordinated Multi-Robot Trajectory Generation

机器人作为令牌:面向协调多机器人轨迹生成的统一扩散Transformer

Ruofei Bai, Jie Chen, Yuxin Cai, Jun Li, Wei-Yun Yau, Lihua Xie

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research(新加坡科技研究局) National University of Singapore(新加坡国立大学)

AI总结 提出Roken框架,将每个机器人表示为离散令牌,通过扩散Transformer直接生成满足安全和连通性约束的多机器人轨迹,无需迭代后处理。

Comments 23 pages, 13 figures; \textbf{Project page:} \href{https://bairuofei.github.io/roken-project-page/}{\texttt{bairuofei.github.io/roken-project-page}}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15092 2026-06-16 cs.LG 新提交

High-Dimensional Random Projection for Activation Steering in Language Models

高维随机投影用于语言模型中的激活引导

Minh-Hieu Pham, Bach Do, Laziz Abdullaev, Tan Minh Nguyen, Khoat Than

机构 * Hanoi University of Science and Technology(河内科技大学) National University of Singapore(新加坡国立大学)

AI总结 针对现有激活引导方法仅捕捉均值差异的局限,提出无训练的高维随机投影激活引导方法(HiDRA),通过在投影高维空间中进行激活加法,捕获非线性特征子空间中的判别信号,实验证明其优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15044 2026-06-16 cs.CL 新提交

Equity with Efficiency: An Empirical Study of Tokenizers for Multilingual Large Language Models

公平与效率:多语言大语言模型分词器的实证研究

Kieron Seven Jun Wei Lee, Muhammad Reza Qorib, Andrew Ivan Soegeng, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学) Carnegie Mellon University(卡内基梅隆大学) SAP

AI总结 本文系统比较了11种东南亚语言上的公平分词器,发现Parity-aware BPE在效率与公平的权衡中处于帕累托前沿,而Morphology-Driven Byte Encoding在语义推理上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14786 2026-06-16 cs.MM cs.AI cs.CV 新提交

MatchLM2Lite: A Scalable MLLM-to-Lite Framework for Reproduced Content Identification

MatchLM2Lite: 一种可扩展的MLLM-to-Lite框架用于重复内容识别

Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang, Zirui Zhu, Kanchan Sarkar, Kun Xu

机构 * Tiktok(字节跳动) National University of Singapore School of Computing(新加坡国立大学计算机学院)

AI总结 提出MatchLM2Lite框架,通过将多模态大语言模型蒸馏为轻量模型,实现视频、音频和文本联合建模的实时重复内容识别,在降低35倍计算成本的同时保持高准确率,并成功部署于大规模生产环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14783 2026-06-16 cs.CV cs.CR 新提交

The Vision Encoder as a Privacy Boundary: Visual-Token Side Channels in Encoder-Free Vision-Language Models

视觉编码器作为隐私边界:无编码器视觉-语言模型中的视觉令牌侧信道

Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

机构 * School of Engineering, Institute of Science Tokyo(东京科学大学工学院) College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系)

AI总结 研究无编码器视觉-语言模型中视觉令牌侧信道导致的隐私泄露问题,通过解码器攻击从中间视觉令牌恢复图像和文本,发现空间采样保真度是关键因素,并指出KV缓存也存在泄露风险。

详情

展开后加载摘要…

URL PDF HTML 收藏