arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

National University of Singapore(新加坡国立大学)

2026-03-31 至 2026-03-31 共收录 11
2603.28135 2026-03-31 cs.AI

CoT2-Meta: Budgeted Metacognitive Control for Test-Time Reasoning

CoT2-Meta:预算化的元认知控制用于测试时推理

Siyuan Ma, Bo Gao, Zikai Xiao, Hailong Wang, Xinlei Yu, Rui Qian, Jiayu Qian, Luqi Gong, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Sun Yat-Sen University(中山大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Zhejiang Lab(之江实验室)

AI总结 CoT2-Meta通过元认知控制优化测试时推理,提升多个基准测试的性能,包括MATH、GSM8K等,相比基线方法有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27991 2026-03-31 cs.HC cs.AI

ViviDoc: Generating Interactive Documents through Human-Agent Collaboration

ViviDoc:通过人机协作生成交互式文档

Yinghao Tang, Yupeng Xie, Yingchaojie Feng, Tingfeng Lan, Jiale Lao, Yue Cheng, Wei Chen

机构 * National University of Singapore(新加坡国立大学) University of Virginia(弗吉尼亚大学) Cornell University(康奈尔大学)

AI总结 ViviDoc通过多智能体流程和三级人类控制,系统性解决交互式文档生成问题,构建了ViviBench基准并实现高内容丰富度和交互质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16771 2026-03-31 cs.CV cs.LG

AutoRegressive Generation with B-rep Holistic Token Sequence Representation

基于B-表示的自回归生成:整体令牌序列表示

Jiahao Li, Yunpeng Bai, Yongkang Dai, Hao Guo, Hongping Gan, Yilei Shi

机构 * Northwestern Polytechnical University(西北工业大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出BrepARG,首次将B-表示的几何与拓扑转化为整体令牌序列,通过自回归架构实现B-表示生成,实验表明其达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23919 2026-03-31 cs.RO

Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation

Goal-VLA: 图像生成视觉语言模型作为对象中心世界模型,赋能零样本机器人操作

Haonan Chen, Jingxiang Guo, Bangjun Wang, Tianrui Zhang, Xuchuan Huang, Boren Zheng, Yiwen Hou, Chenrui Tie, Jiajun Deng, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) The HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学数据科学研究院) Yuanpei College, Peking University(北京大学元培学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出Goal-VLA框架,利用图像生成视觉语言模型生成目标状态,通过对象状态表示分离高阶与低阶策略,提升机器人操作的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01448 2026-03-31 cs.LG cs.MM

OpenAVS: Training-Free Open-Vocabulary Audio Visual Segmentation with Foundational Models

OpenAVS: 基于基础模型的无训练开放词汇音频视觉分割

Shengkai Chen, Yifang Yin, Jinming Cao, Shili Xiang, Zhenguang Liu, Roger Zimmermann

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 OpenAVS通过文本作为代理,首次实现音频与视觉模态对齐,利用基础模型直接推断掩码,提升开放词汇音频视觉分割的泛化能力。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05675 2026-03-31 cs.AI cs.LG

Synergizing Large Language Models and Task-specific Models for Time Series Anomaly Detection

融合大语言模型与任务特定模型用于时间序列异常检测

Feiyi Chen, Leilei Zhang, Guansong Pang, Roger Zimmermann, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Department of Computer Science and Technology, Singapore Management University(新加坡管理大学计算机科学与技术系) Department of Computer Science and Technology, National University of Singapore(新加坡国立大学计算机科学与技术系)

AI总结 本文提出CoLLaTe框架,通过融合大语言模型与任务特定模型,解决异常检测中的表达域不匹配和预测误差累积问题,提升检测性能。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27666 2026-03-31 cs.CV

Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers

门控条件注入无需多模态注意:迈向可控的线性注意变换器

Yuhe Liu, Zhenxiong Tan, Yujia Hu, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出基于线性注意架构的可控扩散模型,解决现有方法在多类型条件输入灵活性和收敛速度上的不足,通过统一门控条件模块实现高效可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27527 2026-03-31 cs.LG

Visualization of Machine Learning Models through Their Spatial and Temporal Listeners

通过空间和时间监听器可视化机器学习模型

Siyu Wu, Lei Shi, Lei Xia, Cenyang Wu, Zipeng Liu, Yingchaojie Feng, Liang Zhou, Wei Chen

机构 * School of Computer Science & Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Institute of Medical Technology, Peking University Health Science Center and National Institute of Health Data Science, Peking University(北京大学医学部医学技术研究院与北京大学健康数据科学国家研究所) School of Software, Beihang University(北京航空航天大学软件学院) National University of Singapore(新加坡国立大学) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 本文提出一种以模型为中心的两阶段框架,通过抽象监听器捕捉模型的空间和时间行为,并将其连接到经典信息可视化流程,分析显示可视化模型结果、定量/名义数据类型和统计图表是主要关注点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27169 2026-03-31 cs.AI

Aligning LLMs with Graph Neural Solvers for Combinatorial Optimization

对齐大语言模型与图神经求解器以解决组合优化问题

Shaodi Feng, Zhuoyi Lin, Yaoxin Wu, Haiyan Yin, Yan Jin, Senthilnath Jayavelu, Xun Xu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Eindhoven University of Technology(埃因霍温理工大学) Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,新加坡科技研究局) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出AlignOPT方法,通过结合大语言模型与图神经求解器,提升组合优化问题的求解能力,实现语义与结构表示的对齐,实验显示其在多种优化问题中表现优异。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22950 2026-03-31 cs.CV cs.RO

RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video

RobotSeg: 一种用于图像和视频中分割机器人的模型和数据集

Haiyang Mei, Qiming Huang, Hai Ci, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

AI总结 本文提出RobotSeg模型和数据集,解决机器人分割的挑战,通过结构增强的记忆关联器、机器人提示生成器和标签高效训练策略,实现结构感知、自动化的高效分割。

Comments CVPR 2026. Project page: https://github.com/showlab/RobotSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26741 2026-03-31 cs.CV cs.AI cs.RO

Language-Conditioned World Modeling for Visual Navigation

基于语言的视觉导航世界建模

Yifei Dong, Fengyi Wu, Yilong Dai, Lingdong Kong, Guangyu Chen, Xu Zhu, Qiyu Hu, Tianyu Wang, Johnalbert Garnica, Feng Liu, Siyu Huang, Qi Dai, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) Clemson University(克莱姆森大学) Drexel University(德雷塞尔大学) Microsoft Research(微软研究院)

AI总结 本文研究了基于语言的视觉导航问题,提出LCVN数据集并开发了两种模型家族,通过语言 grounding、未来状态预测和动作生成实现统一任务学习。

Comments 19 pages, 6 figures, Code: https://github.com/F1y1113/LCVN

详情

展开后加载摘要…

URL PDF HTML 收藏