arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-06-17 至 2026-06-17 共收录 11
2606.18235 2026-06-17 cs.AI 新提交

EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation

EvolveNav: 用于零样本目标导航的主动预反思与自进化记忆

Qi Chai, Wenhao Shen, Nanjie Yao, Yue Xia, Kaiyong Zhao, Jie Ma, Guosheng Lin, Hao Wang

机构 * HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Xi’an Jiaotong University(西安交通大学) XGRIDS(深圳格物智联)

AI总结 提出自进化零样本目标导航框架,通过从历史轨迹提取规则并基于置信上界检索,结合记忆引导预反思模块,减少无效探索,成功率提升10.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18198 2026-06-17 cs.CR cs.CV 新提交

Seeing Is Not Screening: Multimodal Hidden Instruction Attacks on Agent Skill Scanners

看见不等于筛查:针对智能体技能扫描仪的多模态隐藏指令攻击

Xiaojun Jia, Jie Liao, Simeng Qin, Ke Ma, Wenbo Guo, Yebo Feng, Aishan Liu, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Chongqing University, China(重庆大学) Northeastern University, China(东北大学) University of Chinese Academy of Sciences, China(中国科学院大学) Beihang University, China(北航大学)

AI总结 针对现有技能扫描仪忽视图像中恶意指令的盲点,提出SkillCamo多模态攻击将指令隐藏于图像,并设计ExecScan执行级扫描模块,通过意图提取、行为重建等检测隐藏指令,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18094 2026-06-17 cs.SD 新提交

Next-Turn: Duration-Aware Streaming Endpoint Detection via Time-to-Next-Speech-Onset Prediction

Next-Turn: 通过预测下一次语音开始时间进行持续时间感知的流式端点检测

Tristan Tsoi, Jiajun Deng, Yingke Zhu, Huu Quyen Dang, Tianxiang Cao, Nikita Kuzmin, Tao Zhong, Simon Lui

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究院) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

AI总结 提出Next-Turn方法,以到下一次语音开始的时间为训练目标,直接利用语音时间戳,无需额外标注,在端点检测中比最强基线提高25.9%的绝对准确率,且与持续时间感知目标联合训练可进一步提升性能。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18075 2026-06-17 cs.AI 新提交

A Unified Framework for Context-Aware and Relation-Aware Graph Retrieval-Augmented Generation

上下文感知与关系感知的图检索增强生成统一框架

Haoyang Zhong, Yifei Sun, Antong Zhang, Chunping Wang, Lei Chen, Yang Yang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Finvolution Group(信也科技集团)

AI总结 提出HyGRAG分层图RAG框架,通过构建融合上下文与关系的摘要、跨层级检索及动态更新,将多跳推理准确率提升9.7%。

Comments Accepted at The ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17678 2026-06-17 cs.CV cs.AI 新提交

See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

先看后答:基于充分性驱动的强化学习实现视觉证据预对齐

Yilian Liu, Sicong Leng, Guoshun Nan, Junyi Zhu, Jiayu Huang, Minghao Sun, Xuancheng Zhu, Yisong Chen, Zexian Wei, Xiaofeng Tao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) China Telecom(中国电信)

AI总结 提出视觉证据预对齐(VEPA)方法,在预训练与后训练之间引入充分性驱动的GRPO优化,以增强多模态大模型对细粒度视觉证据的利用,显著提升视觉密集型任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17609 2026-06-17 cs.CL 新提交

The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

基准测试幻觉:剪枝后的大语言模型能通过多项选择但无法回答问题

Rui Wen, Lu Sun, Jiayang Liu, Zesheng Xu, Tianshuo Cong, Zheng Li

机构 * Institute of Science Tokyo(东京科学大学) Tohoku University(东北大学) Nanyang Technological University(南洋理工大学) KTH Royal Institute of Technology(瑞典皇家理工学院) Shandong University(山东大学)

AI总结 研究发现,高稀疏度剪枝后的大语言模型在多项选择评估中表现良好,但在开放生成中无法正确回答相同问题,揭示了基准测试的盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17475 2026-06-17 cs.CV 新提交

StereoFactory: A Unified Merging Framework for Robust Stereo Matching

StereoFactory: 一种用于鲁棒立体匹配的统一合并框架

Xianda Guo, Pinhan Fu, Ruilin Wang, Wenke Huang, Mang Ye, Qin Zou

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) D-Star Robotics Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 提出StereoFactory,一种粗到细的进化框架,通过遗传算法选择模型子集和CMA-ES优化模块级路由,实现自适应模型合并,在多个基准上降低误差并显著减少训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16449 2026-06-17 cs.CV 新提交

PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory

PermaVid: 通过解耦上下文记忆实现编辑下的一致视频生成

Shuai Yang, Bingjie Gao, Ziwei Liu, Jiaqi Wang, Dahua Lin, Tong Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Stanford University(斯坦福大学) S-Lab, Nanyang Technological University(南洋理工大学S-Lab) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出PermaVid框架,利用解耦为语义外观和几何结构的上下文记忆,结合编辑感知更新策略,实现编辑操作后视频的长期一致生成。

Comments Project page: https://ys-imtech.github.io/projects/PermaVid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15236 2026-06-17 cs.CV 新提交

Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion

展示信号,隐藏噪声:像素空间扩散的频谱强制

Weichen Fan, Haiwen Diao, Penghao Wu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

AI总结 提出频谱强制方法,通过在像素空间扩散模型中对噪声输入施加时变低通滤波器,引导模型关注信号频带,提升训练效率和生成质量。

Comments Code link: https://github.com/WeichenFan/Spectral_Forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13258 2026-06-17 cs.AI 新提交

MOSAIC: Modality-Specific Adaptation for Incremental Continual Learning in Parkinson's Disease Gait Assessment

MOSAIC: 帕金森病步态评估中增量持续学习的模态特定适应

Minlin Zeng, Zhipeng Zhou, Yang Qiu, Martin J. McKeown, Zhiqi Shen

机构 * Nanyang Technological University(南洋理工大学) Pacific Parkinson's Research Centre, University of British Columbia(不列颠哥伦比亚大学太平洋帕金森研究中心)

AI总结 针对帕金森病步态评估中模态增量场景,提出MOSAIC框架,通过模态特定预热、统计解耦MSBN架构和课程引导排斥目标,解决跨模态蒸馏不可靠、统计偏移和可塑性下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08402 2026-06-17 cs.CV cs.AI cs.MA 新提交

SceneConductor: 3D Scene Generation from a Single Image with Multi-Agent Orchestration

SceneConductor: 基于多智能体编排的单图像3D场景生成

Jeonghwan Kim, Yushi Lan, Yongwei Chen, Hieu Trung Nguyen, Chuanyu Pan, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Meshy AI

AI总结 提出多智能体编排框架,将单图像3D场景生成分解为场景初始化、环境构建和多智能体细化三个阶段,并引入几何感知布局预测器,在几何精度、空间一致性和感知真实性上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏