arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2393
2602.08329 2026-02-10 cs.LG cs.AI cs.IT math.IT

Near-Oracle KV Selection via Pre-hoc Sparsity for Long-Context Inference

通过预处理稀疏性实现近oracle的KV选择用于长上下文推理

Yifei Gao, Lei Wang, Rong-Cheng Tu, Qixin Zhang, Jun Cheng, Dacheng Tao

机构 * University College London(伦敦大学学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences (CAS)(深圳先进技术研究院,中国科学院) Chinese University of Hong Kong(香港中文大学) College of Computing & Data Science, Nanyang Technological University(computing 与数据科学学院,南洋理工大学)

AI总结 PrHS通过预处理稀疏性在长上下文推理中实现近oracle的KV选择,有效降低计算和带宽成本,提升推理效率。

Comments An effective method for accelerating LLM's inference via selective KV processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08214 2026-02-10 cs.AI cs.CR

RECUR: Resource Exhaustion Attack via Recursive-Entropy Guided Counterfactual Utilization and Reflection

RECUR:通过递归熵引导的反事实利用与反射实现资源耗尽攻击

Ziwei Wang, Yuanhe Zhang, Jing Chen, Zhenhong Zhou, Ruichao Liang, Ruiying Du, Ju Jia, Cong Wu, Yang Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学) Southeast University(东南大学) University of Hong Kong(香港大学)

AI总结 本文提出RECUR攻击,通过递归熵引导反事实利用与反射,揭示大型推理模型的资源耗尽风险及安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13261 2026-02-10 cs.CV

Building Egocentric Procedural AI Assistant: Methods, Benchmarks, and Challenges

构建第一人称程序化AI助手:方法、基准和挑战

Junlong Li, Huaiyuan Xu, Sijie Cheng, Kejun Wu, Kim-Hui Yap, Lap-Pui Chau, Yi Wang

机构 * Department of EEE(电子工程系) The Hong Kong Polytechnic University(香港理工大学) RayNeo Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出第一人称程序化AI助手,探讨其核心任务、赋能维度及挑战,通过实验评估现有方法并指明未来研究方向。

Comments Under peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22444 2026-02-10 cs.CV

On Geometry-Enhanced Parameter-Efficient Fine-Tuning for 3D Scene Segmentation

针对3D场景分割的几何增强型参数高效微调

Liyao Tang, Zhe Chen, Dacheng Tao

机构 * The University of Sydney(悉尼大学) La Trobe University(拉特罗布大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出GEM模块,通过整合局部位置编码与轻量级注意力机制,提升3D点云模型的几何感知微调效率和性能。

Comments Neurips 2025; available at https://github.com/LiyaoTang/GEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03803 2026-02-10 cs.CV

EgoLife: Towards Egocentric Life Assistant

EgoLife:迈向以自身为中心的生活助手

Jingkang Yang, Shuai Liu, Hongming Guo, Yuhao Dong, Xiamengwei Zhang, Sicheng Zhang, Pengyun Wang, Zitang Zhou, Binzhu Xie, Ziyue Wang, Bei Ouyang, Zhengyu Lin, Marco Cominelli, Zhongang Cai, Yuanhan Zhang, Peiyuan Zhang, Fangzhou Hong, Joerg Widmer, Francesco Gringoli, Lei Yang, Bo Li, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学新加坡分校) LMMs-Lab(LMMs实验室) IMDEA Networks, Spain(西班牙IMDEA网络) University of Brescia, Italy(意大利布雷西亚大学) Politecnico di Milano, Italy(意大利米兰理工学院)

AI总结 EgoLife旨在通过AI赋能的可穿戴设备开发以自身为中心的生活助手,通过多模态数据集和EgoButler系统提升日常效率与个性化服务。

Comments This version corrects the author affiliation to reflect the accurate institutional information at the time of publication. No technical content of the paper has been changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07891 2026-02-10 cs.CV cs.AI

Scalable Adaptation of 3D Geometric Foundation Models via Weak Supervision from Internet Video

通过互联网视频弱监督实现3D几何基础模型的可扩展适应

Zihui Gao, Ke Liu, Donny Y. Chen, Duochao Shi, Guosheng Lin, Hao Chen, Chunhua Shen

机构 * Zhejiang University, State Key Lab of CAD \& CG Nanyang Technological University Independent Researcher Zhejiang University of Technology

AI总结 SAGE通过互联网视频弱监督实现几何基础模型的可扩展适应,提升零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07689 2026-02-10 cs.CV cs.AI

Process-of-Thought Reasoning for Videos

视频过程推理

Jusheng Zhang, Kaitong Cai, Jian Wang, Yongsen Zheng, Kwok-Yan Lam, Keze Wang

机构 * Sun Yat-sen University, China(中山大学) Nanyang Technological University, Singapore(南洋理工大学) Snap Inc.(Snap公司)

AI总结 视频过程推理框架通过结构化推理步骤提升视频理解的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07679 2026-02-10 cs.LG cs.AI

Spectral Gating Networks

谱门网络

Jusheng Zhang, Yijia Fan, Kaitong Cai, Jing Yang, Yongsen Zheng, Kwok-Yan Lam, Liang Lin, Keze Wang

机构 * Sun Yat-sen University, China(中山大学,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

AI总结 谱门网络通过引入紧凑的频谱路径和可学习门控,提升模型在保持稳定性和可扩展性的同时的准确率与效率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07422 2026-02-10 cs.CR cs.AI cs.CL

Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model

通过在线强化学习与漏洞奖励模型实现安全代码生成

Tianyi Wu, Mingzhe Du, Yue Liu, Chengran Yang, Terry Yue Zhuo, Jiaheng Zhang, See-Kiong Ng

机构 * National University of Singapore(国立新加坡大学) Singapore Management University(新加坡管理学院) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学)

AI总结 SecCoderX通过在线强化学习与漏洞奖励模型提升代码安全性,实现功能与安全性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07388 2026-02-10 cs.RO

Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation

面向长时程机器人操作的多模态动作消歧的轨迹聚焦扩散策略

Yuxuan Hu, Xiangyu Chen, Chuhao Zhou, Yuxi Liu, Gen Li, Jindou Jia, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(MARS实验室,南洋理工大学)

AI总结 TF-DP通过轨迹聚焦解决长时程机器人操作中的多模态动作模糊问题,提升时间一致性和鲁棒性,实验结果优于普通扩散策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03284 2026-02-10 cs.CR cs.CV

Time Is All It Takes: Spike-Retiming Attacks on Event-Driven Spiking Neural Networks

时间就是一切:针对事件驱动脉冲神经网络的脉冲重定时攻击

Yi Yu, Qixin Zhang, Shuhan Ye, Xun Lin, Qianshan Wei, Kun Wang, Wenhan Yang, Dacheng Tao, Xudong Jiang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院生成式人工智能实验室) CUHK(香港中文大学) Southeast University(东南大学) Nanyang Technological University(南洋理工大学) Pengcheng Laboratory(鹏城实验室)

AI总结 本文提出了一种针对事件驱动脉冲神经网络的脉冲重定时攻击,通过重定时脉冲而非改变强度或计数来实现攻击,展示了其在多个基准上的高成功率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03322 2026-02-10 cs.LG cs.AI

HEEGNet: Hyperbolic Embeddings for EEG

HEEGNet:用于EEG的双曲嵌入

Shanglin Li, Shiwen Chu, Okan Koç, Yi Ding, Qibin Zhao, Motoaki Kawanabe, Ziheng Chen

机构 * Advanced Telecommunications Research Institute International(先进电信研究所国际) RIKEN Center for Advanced Intelligence Project(RIKEN高级人工智能项目中心) University of Trento(特伦特大学) Nanyang Technological University(南洋理工大学)

AI总结 HEEGNet通过结合欧几里得和双曲编码器,利用双曲几何提升EEG数据的泛化能力,实现领域不变的嵌入学习。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14313 2026-02-10 cs.LG cs.AI

Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS

你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成

Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

机构 * Rutgers University(新泽西州立大学) Nanyang Technological University(南洋理工大学) University of Connecticut(康涅狄格大学) Fudan University(复旦大学) NVIDIA Research(NVIDIA研究) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出AIRL-S,通过强化学习与搜索技术的统一,利用奖励函数直接学习动态PRM,提升推理链扩展和跨任务泛化能力,实验显示性能提升9%并优于基线PRM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11239 2026-02-10 cs.AI cs.CL

Nondeterministic Polynomial-time Problem Challenge: An Ever-Scaling Reasoning Benchmark for LLMs

非确定多项式时间问题挑战:为大语言模型构建的持续扩展推理基准

Chang Yang, Ruiyu Wang, Junzhe Jiang, Qi Jiang, Qinggang Zhang, Yanchen Deng, Shuxin Li, Shuyue Hu, Bo Li, Florian T. Pokorny, Xiao Huang, Xinrun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) KTH Royal Institute of Technology(皇家理工学院) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Singapore Management University(新加坡管理学院)

AI总结 NPPC是一个持续扩展的推理基准,通过三个模块评估LLMs的推理能力,揭示其性能极限和改进方向。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07095 2026-02-10 cs.CV cs.AI

WorldEdit: Towards Open-World Image Editing with a Knowledge-Informed Benchmark

WorldEdit: 向开放世界图像编辑迈进的基于知识的基准

Wang Lin, Feng Wang, Majun Zhang, Wentao Hu, Tao Jin, Zhou Zhao, Fei Wu, Jingyuan Chen, Alan Yuille, Sucheng Ren

机构 * Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学)

AI总结 WorldEdit通过引入基于知识的基准,提升模型在开放世界图像编辑中对隐式指令的理解和处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07080 2026-02-10 cs.SE cs.AI

CodeCircuit: Toward Inferring LLM-Generated Code Correctness via Attribution Graphs

CodeCircuit: 通过归因图推断LLM生成代码的正确性

Yicheng He, Zheng Zhao, Zhou Kaiyu, Bryan Dai, Jie Fu, Yonghui Yang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Edinburgh(爱丁堡大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) IQuest Research(IQuest研究)

AI总结 CodeCircuit通过归因图分析LLM内部结构,推断生成代码的正确性,验证内部动态信号的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06953 2026-02-09 cs.CL

DAWN: Dependency-Aware Fast Inference for Diffusion LLMs

DAWN: 依赖感知的快速扩散语言模型推理

Lizhuo Luo, Zhuoran Shi, Jiajun Luo, Zhi Wang, Shen Ren, Wenya Wang, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) AUMOVIO-NTU Corporate Lab, Nanyang Technological University(AUMOVIO-NTU企业实验室,南洋理工大学) Southern University of Science(南方科技大学) SIGS, Tsinghua University(系统所,清华大学) AUMOVIO Singapore Pte. Ltd.(AUMOVIO新加坡私人有限公司)

AI总结 DAWN通过依赖感知解码方法提升扩散语言模型推理效率,实现1.80-8.06倍的速度提升同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06875 2026-02-09 cs.SE cs.AI

TraceCoder: A Trace-Driven Multi-Agent Framework for Automated Debugging of LLM-Generated Code

TraceCoder: 一个基于跟踪的多智能体框架,用于自动调试LLM生成的代码

Jiangping Huang, Wenguang Ye, Weisong Sun, Jian Zhang, Mingyue Zhang, Yang Liu

机构 * School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院) Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Southwest University(西南大学)

AI总结 TraceCoder通过多智能体框架和历史教训学习机制,提升LLM生成代码的自动调试效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06621 2026-02-09 stat.ML cs.LG

Infinite-dimensional generative diffusions via Doob's h-transform

通过Doob的h变换构建无限维生成扩散

Thorben Pieper-Sethmacher, Daniel Paulin

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

AI总结 本文通过Doob的h变换在无限维中构建生成扩散模型,通过测度变换推动扩散过程,实现了更灵活的模型构建,并在合成和真实数据上验证了方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06506 2026-02-09 cs.HC cs.CL cs.CY

Designing Computational Tools for Exploring Causal Relationships in Qualitative Data

为探索定性数据中的因果关系设计计算工具

Han Meng, Qiuyuan Lyu, Peinuan Qin, Yitian Yang, Renwen Zhang, Wen-Chieh Lin, Yi-Chieh Lee

机构 * Department of Computer Science, National University of Singapore(国立新加坡大学计算机科学系) Wee Kim Wee School of Communication and Information, Nanyang Technological University(南洋理工大学Wee Kim Wee通讯与信息学院) Dept of Computer Science, National Yang Ming Chiao Tung University(阳明交通大学计算机科学系)

AI总结 本文提出QualCausal系统,通过交互式因果网络构建和多视角可视化,帮助用户探索定性数据中的因果关系,减少分析负担并提供认知支持。

Comments 19 pages, 5 figures, conditionally accepted by CHI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06093 2026-02-09 cs.LG cs.AI

NanoNet: Parameter-Efficient Learning with Label-Scarce Supervision for Lightweight Text Mining Model

NanoNet:基于标签稀缺监督的轻量文本挖掘模型参数高效学习

Qianren Mao, Yashuo Luo, Ziqi Qin, Junnan Liu, Weifeng Jiang, Zhijun Chen, Zhuoran Li, Likang Xiao, Chuou Xu, Qili Zhang, Hanwen Hao, Jingzheng Li, Chunghua Lin, Jianxin Li, Philip S. Yu

机构 * Zhongguancun Laboratory(中关村实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Nanyang Technological University (NTU)(南洋理工大学) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Department of Computer Science, University of Illinois at Chicago(伊利诺伊大学香槟分校计算机科学系)

AI总结 NanoNet通过参数高效学习和知识蒸馏,实现轻量文本挖掘模型在有限监督下的高效训练与推理

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06056 2026-02-09 cs.MM cs.AI cs.CL cs.CV

Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space

分析扩散模型和自回归视觉语言模型在多模态嵌入空间中的表现

Zihang Wang, Siyue Zhang, Yilun Zhao, Jingyi Yang, Tingyu Song, Anh Tuan Luu, Chen Zhao

机构 * Nanyang Technological University(南洋理工大学) Yale University(耶鲁大学) NYU Shanghai(纽约大学上海分校) Alibaba-NTU Singapore Joint Research Institute(阿里-国立新加坡大学联合研究机构) University of the Chinese Academy of Sciences(中国科学院大学) Center for Data Science(数据科学中心) New York University(纽约大学)

AI总结 本文研究了多模态扩散模型在多模态嵌入任务中的表现,发现其在分类、VQA和检索任务中均逊于自回归VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08585 2026-02-09 cs.AI cs.CV

Simulating the Visual World with Artificial Intelligence: A Roadmap

用人工智能模拟视觉世界:一条路线图

Jingtong Yue, Ziqi Huang, Zhaoxi Chen, Xintao Wang, Pengfei Wan, Ziwei Liu

机构 * Robotics Institute Carnegie Mellon University(卡内基梅隆大学机器人研究所) S-Lab Nanyang Technological University(南洋理工大学S实验室) Kling Team Kuaishou Technology(快手科技 Kling 团队)

AI总结 本文提出了一种基于隐式世界模型和视频渲染器的视频基础模型,用于模拟物理动态、智能体交互和任务规划,涵盖四代视频生成技术,应用于机器人、自动驾驶和互动游戏等领域。

Comments Project page: https://world-model-roadmap.github.io/ Github Repo: https://github.com/ziqihuangg/Awesome-From-Video-Generation-to-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06017 2026-02-06 cs.CV

MambaVF: State Space Model for Efficient Video Fusion

MambaVF:用于高效视频融合的状态空间模型

Zixiang Zhao, Yukun Cui, Lilun Deng, Haowen Bai, Haotong Qin, Tao Feng, Konrad Schindler

机构 * Xi'an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

AI总结 MambaVF通过基于状态空间模型的高效框架,实现了无需显式运动估计的视频融合,显著提升效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05605 2026-02-06 cs.LG cs.AI cs.CV

Shiva-DiT: Residual-Based Differentiable Top-$k$ Selection for Efficient Diffusion Transformers

Shiva-DiT:基于残差的可微Top-k选择用于高效扩散变换器

Jiaji Zhang, Hailiang Zhao, Guoxuan Zhu, Ruichao Sun, Jiaju Wu, Xinkui Zhao, Hanlin Tang, Weiyi Lu, Kan Liu, Tao Lan, Lin Qu, Shuiguang Deng

机构 * AIOS, Alibaba Group(阿里云人工智能实验室,阿里巴巴集团) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Nanyang Technological University(南洋理工大学)

AI总结 Shiva-DiT通过基于残差的可微Top-k选择,在保持端到端可学习性的同时,实现了高效扩散变换器的剪枝,提升了计算效率并减少了硬件开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05508 2026-02-06 cs.CV

VGGT-Motion: Motion-Aware Calibration-Free Monocular SLAM for Long-Range Consistency

VGGT-Motion:具有运动感知的校准自由单目SLAM用于长距离一致性

Zhuang Xiong, Chen Zhang, Qingshan Xu, Wenbing Tao

机构 * National Key Laboratory of Science and Technology on Multi-spectral Information Processing(科学与技术多光谱信息处理国家重点实验室) Huazhong University of Science and Technology(华中科技大学) College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

AI总结 VGGT-Motion通过运动感知子地图构造和锚点驱动的直接Sim(3)对齐策略,实现了高效且稳健的校准自由单目SLAM,提升了长距离轨迹的精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13948 2026-02-06 eess.AS cs.AI

Stream-Voice-Anon: Enhancing Utility of Real-Time Speaker Anonymization via Neural Audio Codec and Language Models

Stream-Voice-Anon: 通过神经音频编解码器和语言模型提升实时语音匿名化的效用

Nikita Kuzmin, Songting Liu, Kong Aik Lee, Eng Siong Chng

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Institute for Infocomm Research, A STAR, Singapore(信息通信研究所,新加坡) The Hong Kong Polytechnic University, Hong Kong(香港理工大学,香港)

AI总结 Stream-Voice-Anon通过神经音频编解码器和语言模型提升实时语音匿名化效果,实现更高的可懂度和情绪保留,同时保持低延迟和隐私保护。

Comments Accepted by ICASSP2026. Demo/code: https://paniquex.github.io/Stream-Voice-Anon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08641 2026-02-06 cs.AI q-fin.TR

Resisting Manipulative Bots in Meme Coin Copy Trading: A Multi-Agent Approach with Chain-of-Thought Reasoning

抵制操纵机器人在表情包加密货币复制交易中的应用:一种基于多智能体的链式推理方法

Yichen Luo, Yebo Feng, Jiahua Xu, Yang Liu

机构 * UCL, Centre for Blockchain Technologies(伦敦大学区块链技术中心) The University of Hong Kong, FinTech Academy(香港大学金融科技学院) Nanyang Technological University(南洋理工大学)

AI总结 本文提出一种基于多智能体和链式推理的复制交易系统,以抵御操纵机器人,通过多模态大语言模型提升预测准确度和经济表现,实现加密货币投资的稳健收益。

Journal ref Proceedings of the ACM Web Conference 2026 (WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05218 2026-02-06 cs.CV

Boosting SAM for Cross-Domain Few-Shot Segmentation via Conditional Point Sparsification

通过条件点稀疏化提升SAM用于跨域少样本分割

Jiahao Nie, Yun Xing, Wenbin An, Qingsong Zhao, Jiawei Shao, Yap-Peng Tan, Alex C. Kot, Shijian Lu, Xuelong Li

机构 * Nanyang Technological University(南洋理工大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Xi'an Jiaotong University(西安交通大学) VinUniversity(文大学)

AI总结 本文提出条件点稀疏化方法,通过自适应引导SAM实现跨域少样本分割的更准确结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05215 2026-02-06 cs.CV

E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching

E.M.Ground: 一种具有整体事件感知和匹配的时序地面视频大语言模型

Jiahao Nie, Wenbin An, Gongjie Zhang, Yicheng Xu, Yap-Peng Tan, Alex C. Kot, Shijian Lu

机构 * Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学交叉学科研究生项目) Xi’an Jiaotong University, China(西安交通大学) Alibaba DAMO Academy, Singapore(阿里巴巴达摩院) Institute of Science Tokyo, Japan(东京科学研究院) VinUniversity, Vietnam(文大学) Nanyang Technological University, Singapore(南洋理工大学)

AI总结 E.M.Ground通过引入事件标记、平滑处理和多粒度特征聚合,提升了时序视频地面任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏