arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2393
2602.21215 2026-02-26 cs.CL cs.AI

Inference-time Alignment via Sparse Junction Steering

推理时对齐 via 稀疏节点引导

Runyi Hu, Jie Zhang, Shiqian Zhao, Jiale Meng, Jiwei Li, Jason Zeng, Ming Wu, Michael Heinrich, Yonggang Wen, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) G Labs(0G实验室)

AI总结 通过稀疏节点引导方法,实现更高效的推理过程对齐,减少计算开销并提升生成质量。

Comments 28 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13529 2026-02-26 cs.AI cs.CL cs.LG

BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs

BARREL:面向事实性和可靠性的边界感知推理

Junxiao Yang, Jinzhe Tu, Haoran Liu, Xiaoce Wang, Chujie Zheng, Zhexin Zhang, Shiyao Cui, Caishun Chen, Tiantian He, Hongning Wang, Yew-Soon Ong, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话AI小组,清华大学数据科学与技术研究院) Centre for Frontier AI Research, Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(前沿人工智能研究中心,高性能计算研究所,新加坡科技研究局) The College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 BARREL通过促进简洁且边界感知的事实推理,提升了大型推理模型的事实可靠性,实验显示其在可靠性方面有显著提升,同时保持了与传统微调模型相当的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21127 2026-02-25 cs.HC cs.AI cs.CR cs.SI

"Are You Sure?": An Empirical Study of Human Perception Vulnerability in LLM-Driven Agentic Systems

你确定吗?:一项关于LLM驱动代理系统中人类感知脆弱性的实证研究

Xinfeng Li, Shenyu Dai, Kelong Zheng, Yue Xiao, Gelei Deng, Wei Dong, Xiaofeng Wang

机构 * Nanyang Technological University(南洋理工大学) KTH(皇家理工学院) William & Mary(威廉与玛丽学院)

AI总结 研究通过实证分析揭示人类对LLM驱动代理系统中代理介导欺骗的脆弱性,并提出基于HAT-Lab的防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21054 2026-02-25 cs.CV cs.AI cs.CL

VAUQ: Vision-Aware Uncertainty Quantification for LVLM Self-Evaluation

VAUQ:面向LVLM自评估的视觉感知不确定性量化

Seongheon Park, Changdae Oh, Hyeong Kyu Choi, Xuefeng Du, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学)

AI总结 VAUQ通过引入图像信息分数和核心区域遮蔽策略,实现对LVLM自评估的视觉感知不确定性量化,有效提升模型输出的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21015 2026-02-25 cs.CV

From Perception to Action: An Interactive Benchmark for Vision Reasoning

从感知到行动:一个交互式基准测试用于视觉推理

Yuhao Wu, Maojia Song, Yihuai Lan, Lei Wang, Zhiqiang Hu, Yao Xiao, Heng Zhou, Weihua Zheng, Dylan Raharja, Soujanya Poria, Roy Ka-Wei Lee

机构 * Singapore University of Technology(新加坡科技设计大学) Singapore Management University (SMU), Singapore(新加坡管理学院) Nanyang Technological University (NTU), Singapore(南洋理工大学) University of Science(科学大学)

AI总结 CHAIN基准测试通过交互式3D物理驱动环境,评估模型在动态环境中理解、规划和执行基于物理约束的结构化动作序列的能力。

Comments Work in processing. Website: https://social-ai-studio.github.io/CHAIN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20925 2026-02-25 cs.RO cs.CV

LST-SLAM: A Stereo Thermal SLAM System for Kilometer-Scale Dynamic Environments

LST-SLAM:一种用于公里级动态环境的立体热SLAM系统

Zeyu Jiang, Kuan Xu, Changhao Chen

机构 * PEAK-Lab, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)峰值实验室) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)

AI总结 LST-SLAM通过结合自监督学习、立体跟踪和几何优化,实现了在动态大规模环境中高鲁棒性和精度的热SLAM系统。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20159 2026-02-25 cs.CV cs.AI cs.LG cs.MM cs.RO

A Very Big Video Reasoning Suite

一个非常大的视频推理套件

Maijunxian Wang, Ruisi Wang, Juyi Lin, Ran Ji, Thaddäus Wiedemer, Qingying Gao, Dezhi Luo, Yaoyao Qian, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Jiachen Li, Hanwen Xing, Tianqi Zhao, Fengyuan Yu, Weihang Xiao, Yizheng Jiao, Jianheng Hou, Danyang Zhang, Pengcheng Xu, Boyang Zhong, Zehong Zhao, Gaoyun Fang, John Kitaoka, Yile Xu, Hua Xu, Kenton Blacutt, Tin Nguyen, Siyuan Song, Haoran Sun, Shaoyue Wen, Linyang He, Runming Wang, Yanzhi Wang, Mengyue Yang, Ziqiao Ma, Raphaël Millière, Freda Shi, Nuno Vasconcelos, Daniel Khashabi, Alan Yuille, Yilun Du, Ziming Liu, Bo Li, Dahua Lin, Ziwei Liu, Vikash Kumar, Yijiang Li, Lei Yang, Zhongang Cai, Hokin Deng

机构 * University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) University of Tübingen(图宾根大学) Johns Hopkins University(约翰霍普金斯大学) University of Michigan(密歇根大学) University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Stanford University(斯坦福大学) University of Texas at Austin(得克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校) Cornell University(康奈尔大学) San Jose State University(圣何塞州立大学) University of California, Irvine(加州大学尔湾分校) Technical University of Munich(慕尼黑技术大学) University of California, San Diego(加州大学圣地亚哥分校) Imperial College London(伦敦帝国学院) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) University of Edinburgh(爱丁堡大学) Hong Kong University of Science(香港科学大学) New York University(纽约大学) Auburn University(阿伯丁大学) Columbia University(哥伦比亚大学) University of Bristol(布里斯托大学) University of Waterloo(滑铁卢大学) The Chinese University of Hong Kong(香港中文大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 VBVR数据集和评估框架旨在解决视频推理能力研究中的大规模数据缺乏问题,通过大规模实验观察到对未见任务的泛化能力。

Comments Homepage: https://video-reason.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18296 2026-02-25 cs.CE cs.AI

Context-Aware Mapping of 2D Drawing Annotations to 3D CAD Features Using LLM-Assisted Reasoning for Manufacturing Automation

基于LLM辅助推理的上下文感知2D绘图注释到3D CAD特征映射

Muhammad Tayyab Khan, Lequn Chen, Wenhe Feng, Seung Ki Moon

机构 * Singapore Institute of Manufacturing Technology (SIMTech), A*STAR, Singapore(新加坡制造技术研究所) Advanced Remanufacturing and Technology Centre (ARTC), A*STAR, Singapore(先进再制造与技术中心) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院)

AI总结 本文提出一种基于LLM辅助推理的上下文感知框架,实现2D绘图注释到3D CAD特征的映射,提升制造自动化精度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11184 2026-02-25 cs.LG cs.AI

KBVQ-MoE: KLT-guided SVD with Bias-Corrected Vector Quantization for MoE Large Language Models

KBVQ-MoE:基于KLT引导SVD与偏置校正向量量化的大语言模型MoE

Zukang Xu, Zhixiong Zhao, Xing Hu, Zhixuan Chen, Dawei Yang

机构 * Houmo AI Nanyang Technological University(南洋理工大学)

AI总结 KBVQ-MoE通过KLT引导SVD和偏置校正输出稳定化,提升MoE大语言模型的极低比特量化精度与部署效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20720 2026-02-25 cs.CR cs.AI

AdapTools: Adaptive Tool-based Indirect Prompt Injection Attacks on Agentic LLMs

AdapTools: 面向代理LLM的自适应工具间接提示注入攻击

Che Wang, Jiaming Zhang, Ziqi Zhang, Zijie Wang, Yinghui Wang, Jianbo Gao, Tao Wei, Zhong Chen, Wei Yang Bryan Lim

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore(数据科学,南洋理工大学,新加坡) School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)

AI总结 AdapTools通过自适应工具和提示生成,提升间接提示注入攻击成功率2.13倍,同时降低系统效用1.78倍,有效应对现代AI代理的快速演变特性。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20708 2026-02-25 cs.AI cs.CR

ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction

ICON:基于推理时校正的代理间接提示注入防御

Che Wang, Fuyao Zhang, Jiaming Zhang, Ziqi Zhang, Yinghui Wang, Longtao Huang, Jianbo Gao, Zhong Chen, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) Alibaba(阿里巴巴) School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)

AI总结 ICON通过潜在空间轨迹探测和修正器实现对代理间接提示注入攻击的防御,有效提升任务连续性和安全性,同时保持高检测率和任务效用。

Comments 11 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20566 2026-02-25 cs.RO cs.CV

BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model

BFA++: 多视角视觉语言动作模型的分层最佳特征感知令牌剪枝

Haosheng Li, Weixin Mao, Zihan Lan, Hongwei Xiong, Hongan Wang, Chenyang Si, Ziwei Liu, Xiaoming Deng, Hua Chen

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) LimX Dynamic(LimX动态) Nanjing University(南京大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

AI总结 BFA++通过分层最佳特征感知令牌剪枝提升多视角视觉语言动作模型的效率和成功率

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16332 2026-02-25 quant-ph cs.LG

Feedback-driven recurrent quantum neural network universality

基于反馈的递归量子神经网络通用性

Lukas Gonon, Rodrigo Martínez-Peña, Juan-Pablo Ortega

机构 * School of Computer Science University of St. Gallen(圣加尔登大学计算机科学学院) Donostia International Physics Center(多尼亚国际物理中心) Department of Mathematics, Imperial College(帝国理工学院数学系) School of Physical and Mathematical Sciences Nanyang Technological University(南洋理工大学物理与数学科学学院)

AI总结 本文研究了基于反馈的量子递归神经网络的通用性,证明其能高效逼近常规系统,且量子比特数量随精度要求呈对数增长,具备实用性和实验可操作性。

Comments 28 pages, 1 figure. Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14856 2026-02-25 cs.CV cs.AI

Peering into the Unknown: Active View Selection with Neural Uncertainty Maps for 3D Reconstruction

窥探未知:基于神经不确定性地图的主动视角选择用于3D重建

Zhengquan Zhang, Feng Xu, Mengmi Zhang

机构 * Deep NeuroCognition Lab, Nanyang Technological University, Singapore(深神经认知实验室,南洋理工大学,新加坡) Fudan University, China(复旦大学,中国)

AI总结 本文提出了一种基于神经不确定性地图的主动视角选择方法,通过轻量级神经网络预测视角不确定性,从而提升3D重建的准确性和效率。

Comments 10 pages, 4 figures in the main text. Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22908 2026-02-25 cs.CV eess.IV

Learning Hierarchical Sparse Transform Coding for 3DGS Compression

学习分层稀疏变换编码用于3DGS压缩

Hao Xu, Xiaolin Wu, Xi Zhang

机构 * McMaster University, Canada(麦斯威尔大学) Nanyang Technological University, Singapore(南洋理工大学) Southwest Jiaotong University, China(西南交通大学)

AI总结 本文提出了一种学习分层稀疏变换编码方法,通过引入分析-合成变换和联合优化3DGS表示与熵模型,提升3DGS压缩的R-D性能和解码效率。

Comments Our code will be released at \href{https://github.com/hxu160/SHTC_for_3DGS_compression}{here}

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17645 2026-02-25 cs.CV cs.AI cs.CL cs.LG cs.MM

HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning

HoloLLM:面向语言基础的人感知与推理的多感官基础模型

Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

AI总结 HoloLLM通过整合LiDAR、红外、毫米波雷达和Wi-Fi等多感官数据,提升语言基础的人感知与推理能力,实验表明其在真实场景中的性能提升达30%。

Comments Camera-ready version. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19582 2026-02-24 cs.LG

Advantage-based Temporal Attack in Reinforcement Learning

基于优势的时序攻击在强化学习中

Shenghong He

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出基于优势的对抗变压器(AAT),通过多尺度因果自注意力机制和加权优势机制,生成具有更强时间相关性的对抗示例,提升强化学习中的攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19454 2026-02-24 cs.CV

HD-TTA: Hypothesis-Driven Test-Time Adaptation for Safer Brain Tumor Segmentation

HD-TTA:基于假设的测试时适应用于更安全的脑肿瘤分割

Kartik Jhawar, Lipo Wang

机构 * Institute for Digital Molecular Analytics and Science(数字分子分析与科学研究所) Nanyang Technological University(南洋理工大学) School of Electrical and Electronic Engineering(电气与电子工程学院)

AI总结 HD-TTA通过生成竞争性几何假设并采用表示引导的selector,提高脑肿瘤分割的安全性与精度。

Comments 11 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19180 2026-02-24 cs.CV

VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

基于扩散模型的人体网格恢复中的群体偏好对齐

Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) HKUST(GZ)(香港科技大学(广州)) SenseTime Research(商汤科技研究院) A*STAR(新加坡科技研究局)

AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19163 2026-02-24 cs.CV cs.MM cs.SD

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

JavisDiT++:联合音频视频生成的统一建模与优化

Kai Liu, Yanhao Zheng, Kai Wang, Shengqiong Wu, Rongjunchen Zhang, Jiebo Luo, Dimitrios Hatzinakos, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) HiThink Research(HiThink研究) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

AI总结 JavisDiT++通过统一建模与优化方法,在联合音频视频生成任务中实现高质量的同步与语义对齐。

Comments Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19064 2026-02-24 cs.CV

L3DR: 3D-aware LiDAR Diffusion and Rectification

L3DR:基于3D感知的LiDAR扩散与校正

Quan Liu, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 L3DR通过3D-aware的LiDAR扩散和校正框架,在3D空间中消除RV伪影并恢复局部几何结构,实现更真实的3D几何生成。

Comments In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19058 2026-02-24 cs.CL

Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer

大型语言模型和视觉语言模型是否共享神经元进行推理?证据和跨模态转移的机制

Chenhang Cui, An Zhang, Yuxin Chen, Gelei Deng, Jingnan Zheng, Zhenkai Liang, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

AI总结 本文研究了大型语言模型和视觉语言模型在推理过程中共享神经元的现象,提出SNRF框架实现低秩融合,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08318 2026-02-24 cs.CV

LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation

LinVideo: 一种面向高效视频生成的O(n)注意力后训练框架

Yushi Huang, Xingtong Ge, Ruihao Gong, Chengtao Lv, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Sensetime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

AI总结 LinVideo提出一种高效的无数据后训练框架,通过选择性迁移将部分自注意力模块替换为线性注意力,从而在保持性能的同时显著提升视频生成效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23377 2026-02-24 cs.CV cs.AI cs.SD eess.AS

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

JavisDiT:具有层次化时空先验同步的联合音频视频扩散变换器

Kai Liu, Wei Li, Lai Chen, Shengqiong Wu, Yanhao Zheng, Jiayi Ji, Fan Zhou, Jiebo Luo, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

AI总结 JavisDiT通过层次化时空先验同步机制,实现了高质量的音频视频同步生成,解决了现实场景中的同步评估问题。

Comments Accepted by ICLR 2026. Homepage: https://javisverse.github.io/JavisDiT-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12817 2026-02-24 cs.CV cs.AI

Learning to See the Elephant in the Room: Self-Supervised Context Reasoning in Humans and AI

学习房间中的大象:人类和人工智能中的自监督上下文推理

Xiao Liu, Soumick Sarker, Ankur Sikarwar, Bryan Atista Kiely, Gabriel Kreiman, Zenglin Shi, Mengmi Zhang

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) CFAR and I2R, Agency for Science, Technology and Research(CFAR和I2R,科技研究局) Boston Children’s Hospital, Harvard Medical School(哈佛医学院儿童医院)

AI总结 本文提出SeCo模型,通过自监督学习实现上下文推理,展示了上下文关联在场景理解中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18739 2026-02-24 cs.LG

When World Models Dream Wrong: Physical-Conditioned Adversarial Attacks against World Models

当世界模型做梦错误:针对世界模型的物理条件对抗攻击

Zhixiang Guo, Siyuan Liang, Andras Balogh, Noah Lunberry, Rong-Cheng Tu, Mark Jelasity, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) University of Szeged(塞格德大学)

AI总结 本文提出PhysCond-WMA攻击方法,通过扰动物理条件通道诱导世界模型的语义、逻辑或决策层面的扭曲,揭示生成式世界模型的安全性漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18724 2026-02-24 cs.AI

Task-Aware Exploration via a Predictive Bisimulation Metric

通过预测双模拟度量实现任务感知探索

Dayang Liang, Ruihan Liu, Lipeng Wan, Yunlong Liu, Bo An

机构 * Department of Automation, Xiamen University, Xiamen, China(自动化系,厦门大学) Department of Computer Science, Beijing Normal-Hong Kong Baptist University, Zhuhai, China(计算机科学系,北京师范大学-香港 Baptist大学) School of Artificial Intelligence, Xian Jiaotong University, Xian, China(人工智能学院,西安交通大学) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学)

AI总结 TEB通过预测双模拟度量实现任务感知探索,有效解决稀疏奖励下视觉强化学习中的探索难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14979 2026-02-24 cs.CV cs.AI

From Pixels to Words -- Towards Native Vision-Language Primitives at Scale

从像素到词语 -- 向大规模原生视觉-语言原始语义迈进

Haiwen Diao, Mingxuan Li, Silei Wu, Linjun Dai, Xiaohua Wang, Hanming Deng, Lewei Lu, Dahua Lin, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Xi’an Jiaotong University(西安交通大学)

AI总结 NEO通过原生视觉-语言基础构建,实现了从零开始的视觉感知发展,有效缓解了视觉-语言冲突,推动了大规模原生VLM的发展。

Comments 21 pages, 8 figures, Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16670 2026-02-24 cs.CR cs.AI

BitHydra: Towards Bit-flip Inference Cost Attack against Large Language Models

BitHydra: 面向大语言模型的位翻转推理成本攻击

Xiaobei Yan, Yiming Li, Hao Wang, Han Qiu, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

AI总结 BitHydra通过位翻转攻击针对大语言模型的推理成本进行攻击,利用ADMM方法高效实现无限生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15937 2026-02-24 cs.AI

Advancing Mobile GUI Agents: A Verifier-Driven Approach to Practical Deployment

推进移动GUI代理:一种以验证器驱动的方法用于实际部署

Gaole Dai, Shiqi Jiang, Ting Cao, Yuanchun Li, Yuqing Yang, Rui Tan, Mo Li, Lili Qiu

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) Tsinghua University(清华大学)

AI总结 V-Droid通过验证器驱动的方法提升移动GUI任务自动化代理的性能与效率

Comments "V-Droid: Advancing Mobile GUI Agent Through Generative Verifiers", got accepted to MobiCom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏