Inference-time Alignment via Sparse Junction Steering
推理时对齐 via 稀疏节点引导
机构 * Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学) ; G Labs(0G实验室)
AI总结 通过稀疏节点引导方法,实现更高效的推理过程对齐,减少计算开销并提升生成质量。
Comments 28 pages, 17 figures
高校专区
推理时对齐 via 稀疏节点引导
机构 * Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学) ; G Labs(0G实验室)
AI总结 通过稀疏节点引导方法,实现更高效的推理过程对齐,减少计算开销并提升生成质量。
Comments 28 pages, 17 figures
BARREL:面向事实性和可靠性的边界感知推理
机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话AI小组,清华大学数据科学与技术研究院) ; Centre for Frontier AI Research, Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(前沿人工智能研究中心,高性能计算研究所,新加坡科技研究局) ; The College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
AI总结 BARREL通过促进简洁且边界感知的事实推理,提升了大型推理模型的事实可靠性,实验显示其在可靠性方面有显著提升,同时保持了与传统微调模型相当的准确性。
你确定吗?:一项关于LLM驱动代理系统中人类感知脆弱性的实证研究
机构 * Nanyang Technological University(南洋理工大学) ; KTH(皇家理工学院) ; William & Mary(威廉与玛丽学院)
AI总结 研究通过实证分析揭示人类对LLM驱动代理系统中代理介导欺骗的脆弱性,并提出基于HAT-Lab的防御策略。
VAUQ:面向LVLM自评估的视觉感知不确定性量化
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Nanyang Technological University(南洋理工大学)
AI总结 VAUQ通过引入图像信息分数和核心区域遮蔽策略,实现对LVLM自评估的视觉感知不确定性量化,有效提升模型输出的可靠性。
从感知到行动:一个交互式基准测试用于视觉推理
机构 * Singapore University of Technology(新加坡科技设计大学) ; Singapore Management University (SMU), Singapore(新加坡管理学院) ; Nanyang Technological University (NTU), Singapore(南洋理工大学) ; University of Science(科学大学)
AI总结 CHAIN基准测试通过交互式3D物理驱动环境,评估模型在动态环境中理解、规划和执行基于物理约束的结构化动作序列的能力。
Comments Work in processing. Website: https://social-ai-studio.github.io/CHAIN/
LST-SLAM:一种用于公里级动态环境的立体热SLAM系统
机构 * PEAK-Lab, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)峰值实验室) ; School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)
AI总结 LST-SLAM通过结合自监督学习、立体跟踪和几何优化,实现了在动态大规模环境中高鲁棒性和精度的热SLAM系统。
Comments ICRA 2026
一个非常大的视频推理套件
机构 * University of California, Berkeley(加州大学伯克利分校) ; Nanyang Technological University(南洋理工大学) ; Northeastern University(东北大学) ; University of Tübingen(图宾根大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Michigan(密歇根大学) ; University of Southern California(南加州大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Shanghai Jiao Tong University(上海交通大学) ; East China Normal University(华东师范大学) ; Stanford University(斯坦福大学) ; University of Texas at Austin(得克萨斯大学奥斯汀分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Cornell University(康奈尔大学) ; San Jose State University(圣何塞州立大学) ; University of California, Irvine(加州大学尔湾分校) ; Technical University of Munich(慕尼黑技术大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Imperial College London(伦敦帝国学院) ; University of Wisconsin--Madison(威斯康星大学麦迪逊分校) ; University of Edinburgh(爱丁堡大学) ; Hong Kong University of Science(香港科学大学) ; New York University(纽约大学) ; Auburn University(阿伯丁大学) ; Columbia University(哥伦比亚大学) ; University of Bristol(布里斯托大学) ; University of Waterloo(滑铁卢大学) ; The Chinese University of Hong Kong(香港中文大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Oxford(牛津大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 VBVR数据集和评估框架旨在解决视频推理能力研究中的大规模数据缺乏问题,通过大规模实验观察到对未见任务的泛化能力。
Comments Homepage: https://video-reason.com/
基于LLM辅助推理的上下文感知2D绘图注释到3D CAD特征映射
机构 * Singapore Institute of Manufacturing Technology (SIMTech), A*STAR, Singapore(新加坡制造技术研究所) ; Advanced Remanufacturing and Technology Centre (ARTC), A*STAR, Singapore(先进再制造与技术中心) ; School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院)
AI总结 本文提出一种基于LLM辅助推理的上下文感知框架,实现2D绘图注释到3D CAD特征的映射,提升制造自动化精度和可靠性。
KBVQ-MoE:基于KLT引导SVD与偏置校正向量量化的大语言模型MoE
机构 * Houmo AI ; Nanyang Technological University(南洋理工大学)
AI总结 KBVQ-MoE通过KLT引导SVD和偏置校正输出稳定化,提升MoE大语言模型的极低比特量化精度与部署效率。
Comments Accepted by ICLR 2026
AdapTools: 面向代理LLM的自适应工具间接提示注入攻击
机构 * College of Computing(计算学院) ; Data Science, Nanyang Technological University, Singapore(数据科学,南洋理工大学,新加坡) ; School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)
AI总结 AdapTools通过自适应工具和提示生成,提升间接提示注入攻击成功率2.13倍,同时降低系统效用1.78倍,有效应对现代AI代理的快速演变特性。
Comments 11 pages
ICON:基于推理时校正的代理间接提示注入防御
机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) ; Alibaba(阿里巴巴) ; School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)
AI总结 ICON通过潜在空间轨迹探测和修正器实现对代理间接提示注入攻击的防御,有效提升任务连续性和安全性,同时保持高检测率和任务效用。
Comments 11 pages,
BFA++: 多视角视觉语言动作模型的分层最佳特征感知令牌剪枝
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; LimX Dynamic(LimX动态) ; Nanjing University(南京大学) ; Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学)
AI总结 BFA++通过分层最佳特征感知令牌剪枝提升多视角视觉语言动作模型的效率和成功率
Comments 9 pages, 10 figures
基于反馈的递归量子神经网络通用性
机构 * School of Computer Science University of St. Gallen(圣加尔登大学计算机科学学院) ; Donostia International Physics Center(多尼亚国际物理中心) ; Department of Mathematics, Imperial College(帝国理工学院数学系) ; School of Physical and Mathematical Sciences Nanyang Technological University(南洋理工大学物理与数学科学学院)
AI总结 本文研究了基于反馈的量子递归神经网络的通用性,证明其能高效逼近常规系统,且量子比特数量随精度要求呈对数增长,具备实用性和实验可操作性。
Comments 28 pages, 1 figure. Accepted by ICLR 2026
窥探未知:基于神经不确定性地图的主动视角选择用于3D重建
机构 * Deep NeuroCognition Lab, Nanyang Technological University, Singapore(深神经认知实验室,南洋理工大学,新加坡) ; Fudan University, China(复旦大学,中国)
AI总结 本文提出了一种基于神经不确定性地图的主动视角选择方法,通过轻量级神经网络预测视角不确定性,从而提升3D重建的准确性和效率。
Comments 10 pages, 4 figures in the main text. Published at ICLR 2026
学习分层稀疏变换编码用于3DGS压缩
机构 * McMaster University, Canada(麦斯威尔大学) ; Nanyang Technological University, Singapore(南洋理工大学) ; Southwest Jiaotong University, China(西南交通大学)
AI总结 本文提出了一种学习分层稀疏变换编码方法,通过引入分析-合成变换和联合优化3DGS表示与熵模型,提升3DGS压缩的R-D性能和解码效率。
Comments Our code will be released at \href{https://github.com/hxu160/SHTC_for_3DGS_compression}{here}
HoloLLM:面向语言基础的人感知与推理的多感官基础模型
机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)
AI总结 HoloLLM通过整合LiDAR、红外、毫米波雷达和Wi-Fi等多感官数据,提升语言基础的人感知与推理能力,实验表明其在真实场景中的性能提升达30%。
Comments Camera-ready version. Accepted at NeurIPS 2025
基于优势的时序攻击在强化学习中
机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出基于优势的对抗变压器(AAT),通过多尺度因果自注意力机制和加权优势机制,生成具有更强时间相关性的对抗示例,提升强化学习中的攻击性能。
HD-TTA:基于假设的测试时适应用于更安全的脑肿瘤分割
机构 * Institute for Digital Molecular Analytics and Science(数字分子分析与科学研究所) ; Nanyang Technological University(南洋理工大学) ; School of Electrical and Electronic Engineering(电气与电子工程学院)
AI总结 HD-TTA通过生成竞争性几何假设并采用表示引导的selector,提高脑肿瘤分割的安全性与精度。
Comments 11 pages, 3 figures, 2 tables
基于扩散模型的人体网格恢复中的群体偏好对齐
机构 * Nanyang Technological University(南洋理工大学) ; HKUST(GZ)(香港科技大学(广州)) ; SenseTime Research(商汤科技研究院) ; A*STAR(新加坡科技研究局)
AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。
Comments Accepted to CVPR 2026
JavisDiT++:联合音频视频生成的统一建模与优化
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; University of Toronto(多伦多大学) ; HiThink Research(HiThink研究) ; University of Rochester(罗切斯特大学) ; Nanyang Technological University(南洋理工大学)
AI总结 JavisDiT++通过统一建模与优化方法,在联合音频视频生成任务中实现高质量的同步与语义对齐。
Comments Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page
L3DR:基于3D感知的LiDAR扩散与校正
机构 * Nanyang Technological University(南洋理工大学) ; Zhejiang University of Technology(浙江工业大学) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 L3DR通过3D-aware的LiDAR扩散和校正框架,在3D空间中消除RV伪影并恢复局部几何结构,实现更真实的3D几何生成。
Comments In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
大型语言模型和视觉语言模型是否共享神经元进行推理?证据和跨模态转移的机制
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文研究了大型语言模型和视觉语言模型在推理过程中共享神经元的现象,提出SNRF框架实现低秩融合,提升多模态推理性能。
LinVideo: 一种面向高效视频生成的O(n)注意力后训练框架
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Beihang University(北航) ; Sensetime Research(商汤科技研究院) ; Nanyang Technological University(南洋理工大学)
AI总结 LinVideo提出一种高效的无数据后训练框架,通过选择性迁移将部分自注意力模块替换为线性注意力,从而在保持性能的同时显著提升视频生成效率。
Comments Accepted by CVPR 2026
JavisDiT:具有层次化时空先验同步的联合音频视频扩散变换器
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Rochester(罗切斯特大学) ; Nanyang Technological University(南洋理工大学)
AI总结 JavisDiT通过层次化时空先验同步机制,实现了高质量的音频视频同步生成,解决了现实场景中的同步评估问题。
Comments Accepted by ICLR 2026. Homepage: https://javisverse.github.io/JavisDiT-page/
学习房间中的大象:人类和人工智能中的自监督上下文推理
机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) ; CFAR and I2R, Agency for Science, Technology and Research(CFAR和I2R,科技研究局) ; Boston Children’s Hospital, Harvard Medical School(哈佛医学院儿童医院)
AI总结 本文提出SeCo模型,通过自监督学习实现上下文推理,展示了上下文关联在场景理解中的关键作用。
当世界模型做梦错误:针对世界模型的物理条件对抗攻击
机构 * Nanyang Technological University(南洋理工大学) ; University of Szeged(塞格德大学)
AI总结 本文提出PhysCond-WMA攻击方法,通过扰动物理条件通道诱导世界模型的语义、逻辑或决策层面的扭曲,揭示生成式世界模型的安全性漏洞。
通过预测双模拟度量实现任务感知探索
机构 * Department of Automation, Xiamen University, Xiamen, China(自动化系,厦门大学) ; Department of Computer Science, Beijing Normal-Hong Kong Baptist University, Zhuhai, China(计算机科学系,北京师范大学-香港 Baptist大学) ; School of Artificial Intelligence, Xian Jiaotong University, Xian, China(人工智能学院,西安交通大学) ; College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学)
AI总结 TEB通过预测双模拟度量实现任务感知探索,有效解决稀疏奖励下视觉强化学习中的探索难题。
从像素到词语 -- 向大规模原生视觉-语言原始语义迈进
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; SenseTime Research(商汤科技研究院) ; Xi’an Jiaotong University(西安交通大学)
AI总结 NEO通过原生视觉-语言基础构建,实现了从零开始的视觉感知发展,有效缓解了视觉-语言冲突,推动了大规模原生VLM的发展。
Comments 21 pages, 8 figures, Accepted by ICLR2026
BitHydra: 面向大语言模型的位翻转推理成本攻击
机构 * Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学)
AI总结 BitHydra通过位翻转攻击针对大语言模型的推理成本进行攻击,利用ADMM方法高效实现无限生成。
推进移动GUI代理:一种以验证器驱动的方法用于实际部署
机构 * Nanyang Technological University(南洋理工大学) ; Microsoft Research(微软研究院) ; Tsinghua University(清华大学)
AI总结 V-Droid通过验证器驱动的方法提升移动GUI任务自动化代理的性能与效率
Comments "V-Droid: Advancing Mobile GUI Agent Through Generative Verifiers", got accepted to MobiCom 2026