arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2380
2410.00296 2026-07-07 cs.LG cs.CR 版本更新

VLMGuard: Bootstrapping Malicious Prompt Detectors from Unlabeled Vision-Language Prompts in the Wild

VLMGuard:从野生未标记视觉语言提示中引导恶意提示检测器

Junlin Fang, Wenyu Chen, Reshmi Ghosh, Robert Sim, Ahmed Salem, Vitor R. Carvalho, Emily Lawton, Sharon Li, Jack W. Stokes, Sean Du

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) School of Physical and Mathematical Sciences(物理与数学科学学院) Microsoft Corp.(微软公司) Department of Computer Sciences(计算机科学系) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 研究针对视觉语言模型易受恶意输入影响的问题,提出VLMGuard框架,利用野生未标记用户提示,通过自动恶意估计分数区分良性和恶意样本,训练二进制提示分类器,无需额外人工标注,效果优于现有方法。

Comments Accepted to Transactions on Machine Learning Research (07/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01299 2026-07-07 cs.CV cs.AI cs.CL cs.LG 版本更新

CausalChaos! Dataset for Comprehensive Causal Action Question Answering Over Longer Causal Chains Grounded in Dynamic Visual Scenes

因果混沌!用于基于动态视觉场景的更长因果链上的综合因果动作问答的数据集

Paritosh Parmar, Eric Peh, Ruirui Chen, Ting En Lam, Yuhan Chen, Elston Tan, Basura Fernando

机构 * Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,科技研究局,新加坡) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Singapore Polytechnic(新加坡理工学院)

AI总结 针对因果视频问答中现有数据集因果推理深度不足的问题,利用卡通特性构建CausalChaos!数据集,含因果链等问题并引入错误答案挖掘,为因果关系建模等发展助力。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02431 2026-07-03 cs.RO cs.AI 新提交

WorldSample: Closed-loop Real-robot RL with World Modelling

WorldSample:基于世界建模的闭环真实机器人强化学习

Yuquan Xue, Le Xu, Zeyi Liu, Zhenyu Wu, Zhengyi Gu, Xinyang Song, Bofang Jia, Ziwei Wang

机构 * PINE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电气与电子工程学院PINE实验室) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) School of Automation, Central South University, Changsha, China(中南大学自动化学院) School of Automation, Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学自动化学院)

AI总结 提出WorldSample框架,通过物理 rollout、世界模型生成与策略改进的闭环,结合策略节奏学习(PPL)调节训练,在接触性精密操作任务中成功率提升28%,训练步数减少59%。

Comments 16 pages, 9 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02020 2026-07-03 cs.AI 新提交

Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails

持续多模态学习中的隐藏遗忘:当准确率幸存但基础失效时

Qianyu Chen, Canran Xiao, Runxuan Tang

机构 * Nanyang Technological University(南洋理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

AI总结 针对持续多模态学习中模型答案准确但证据使用方式改变的问题,提出无重放依赖约束框架RCL,通过冻结旧模型、反事实干预估计证据依赖并联合优化,有效降低隐藏遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02010 2026-07-03 cs.AI 新提交

InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories

InduceKV: 通过诱导KV记忆实现多模态大语言模型的固定足迹持续适应

Qianyu Chen, Ziteng Feng, Canran Xiao, Runxuan Tang

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

AI总结 提出InduceKV方法,通过检索将训练前缀存储为注意力就绪的记忆条目,在固定内存预算下实现多模态大语言模型的持续适应,无需更新骨干模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01940 2026-07-03 cs.LG cs.AI 新提交

Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits

条件共消融:恢复变压器电路中的自修复备份

Zhiren Gong, Zihao Zeng, Chau Yuen, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学跨学科研究生项目) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电气与电子工程学院)

AI总结 提出条件共消融(CoAx)方法,通过测量在移除主要组件后剩余单元消融效应的增长,来发现变压器电路中因自修复而隐藏的备份组件,在GPT-2-small IOI电路上将备份头恢复的ROC-AUC从0.33提升至0.91。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01859 2026-07-03 cs.AI cs.CL 新提交

Safety Targeted Embedding Exploit via Refinement

通过精炼的安全目标嵌入利用

Joshua Adrian Cahyono

机构 * Nanyang Technological University(南洋理工大学)

AI总结 提出STEER方法,通过梯度引导攻击识别并翻译关键词语到低资源语言,抑制大语言模型拒绝行为,在多个模型上实现高达96.7%的攻击成功率,揭示安全机制在多语言输入下的泛化缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01764 2026-07-03 cs.AI 新提交

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

Mastermind: 基于策略学习的仓库级漏洞复现

Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出Mastermind双循环框架,通过策略学习(SFT+GRPO)提升LLM代理在仓库级漏洞复现中的表现,在260个训练任务和200个测试任务上达到84.5%通过率,并成功迁移至不同执行器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01642 2026-07-03 cs.CV 新提交

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling

多分辨率流匹配:通过分阶段采样实现无训练扩散加速

Xingyu Zheng, Xianglong Liu, Yifu Ding, Weilun Feng, Junqing Lin, Jinyang Guo, Haotong Qin

机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Nanyang Technological University(南洋理工大学) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ETH Zürich(苏黎世联邦理工学院)

AI总结 提出MrFlow,一种基于分阶段低到高分辨率管道的无训练多分辨率加速策略,利用低分辨率采样减少计算量,像素空间超分辨率和高频重采样保持质量,实现10倍加速且质量损失小于1%。

Comments The code is available at https://github.com/Xingyu-Zheng/MrFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32028 2026-07-03 cs.RO 新提交

DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation

DVG-WM:解耦视频生成实现高效机器人操作具身世界模型

Ziyu Shan, Zhenyu Wu, Xiaofeng Wang, Zheng Zhu, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学(新加坡)) Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学(中国北京)) GigaAI

AI总结 提出解耦视频生成世界模型(DVG-WM),将世界模型分解为动力学学习和视觉合成,通过流匹配直接映射动力学到视频潜变量,并引入潜变量退化机制再生接触细节,在LIBERO和真实平台实现高达3.97倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13723 2026-07-03 cs.CV cs.AI 新提交

Morphology-Aware Sample Assignment: Overcoming IoU Insensitivity for Surface Defect Detection

形态感知样本分配:克服IoU不敏感性用于表面缺陷检测

Pengfei Liu, Yuhan Guo

机构 * School of Management, Harbin Institute of Technology(管理学院,哈尔滨工业大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

AI总结 针对IoU在缺陷检测中不敏感的问题,提出基于面积、形状和长宽比的形态相似性度量来优化正样本分配,理论分析表明该方法能重塑匹配函数响应分布,在NEUDET和GC10-DET数据集上基于YOLOv9框架取得一致性能提升,且零额外推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01086 2026-07-02 cs.CV cs.AI 新提交

LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models

LongVQUBench:评估视觉语言模型的长期视频质量理解能力

Arpita Nema, Hanwei Zhu, Xi Zhang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学)

AI总结 提出LongVQUBench基准,包含1200+长视频和1500个问题,通过三级评估(局部、跨事件、全局)和针孔失真问答范式,揭示现有LVLMs在长视频质量理解上的局限性。

Comments Accepted at European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00886 2026-07-02 cs.CV 新提交

Beyond Pixel Overlap: A Framework for Decomposing Segmentation Evaluation Metrics

超越像素重叠:分割评估指标分解框架

Youwei Pang, Xiaoqi Zhao

机构 * Nanyang Technological University(南洋理工大学)

AI总结 提出一个五阶段分解框架,将分割评估指标拆解为预测表示、目标提取、目标匹配、分数计算和指标报告,分析现有指标并展示新指标如何解决早期局限,支持任务感知评估协议设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00379 2026-07-02 cs.IR cs.CV 新提交

Attribute-Prompted Kernel Hashing for Unsupervised Data-Efficient Cross-Modal Retrieval

属性提示核哈希用于无监督数据高效跨模态检索

Runhao Li, Xiaoxu Ma, Zhenyu Weng, Yue Zhang, Guibo Luo, Huiping Zhuang, Zhiping Lin, Yap-Peng Tan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) VinUniversity

AI总结 提出属性提示核哈希(APKH),利用视觉-语言基础模型的广义属性先验,通过上下文优化属性核映射和核平滑对比对齐,在数据受限场景下实现从可见到不可见类别的跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00369 2026-07-02 cs.CV 新提交

SFDATrack: Generalized Source-Free Domain Adaptive Tracking Under Adverse Weather Conditions

SFDATrack: 恶劣天气条件下的广义无源域自适应跟踪

Siyuan Yao, Ziqi Wang, Ruiqi Yu, Junqi Huang, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

AI总结 提出SFDATrack,一种仅利用目标域恶劣天气样本的无源域自适应跟踪器,通过双交互Mamba骨干和超球原型投影实现鲁棒状态估计,在多个基准上超越现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00362 2026-07-02 cs.CR cs.AI cs.LG 新提交

SoK: Attack and Defense Landscape of Mobile On-device AI Systems

SoK: 移动端设备上AI系统的攻击与防御全景

Yujin Huang, Xin Zheng, Xingliang Yuan, Kwok-Yan Lam

机构 * The University of Melbourne(墨尔本大学) RMIT University(皇家墨尔本理工大学) Nanyang Technological University(南洋理工大学)

AI总结 本文首次系统化梳理移动端设备上AI系统的安全知识,涵盖安全支柱、攻击与防御全景,并指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00060 2026-07-02 cs.CV 新提交

Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence

协同感知-推理治理:用可验证解剖证据为医学多模态大语言模型提供基础

Rui Hao, Qiankun Li, Junyuan Mao, Linghao Meng, Dirui Xie, Dayu Tan, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Imperial Global Singapore, Imperial College London(帝国理工学院新加坡全球中心) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Anhui University(安徽大学)

AI总结 提出一种无需训练的证据注入框架,通过ROI引导的视觉激活调制和解剖坐标语义标记,协同校准视觉感知与文本推理,动态路由任务特定干预,有效减少医学MLLM的幻觉。

Comments Accepted by MICCAI 2026 (Early Accept, Top 9%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00397 2026-07-02 q-bio.NC cs.AI cs.CL 交叉投稿

NeuroCogMap Reveals Cognitive Organization of Large Language Models

NeuroCogMap揭示大语言模型的认知组织

Zhongxiang Sun, Haolang Lu, Qiang Ma, Qi Li, Qipeng Wang, Liang Pang, Chenyu Liu, Qiankun Li, Hao Sun, Kun Wang, Yi Zeng, Jun Xu, Guoqi Li, Ji-Rong Wen

机构 * The University of Hong Kong(香港大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) IGS, Imperial College London(伦敦帝国理工学院IGS)

AI总结 提出神经认知地图框架,将LLM内部特征组织为功能分区,揭示其与认知能力、行为失败及人类大脑皮层的对应关系。

Comments 79 pages, 6 main figures, 5 extended figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00661 2026-07-02 cs.CL cs.AI 新提交

Faithful by Definition: Emotion Analysis via Natural Semantic Metalanguage Explications

定义上的忠实:通过自然语义元语言解释进行情感分析

Frank Xing, Erik Cambria

机构 * University of Reading(雷丁大学) Nanyang Technological University(南洋理工大学)

AI总结 提出一种基于自然语义元语言解释的情感分析接口,通过解析器将输入文本映射为固定规则的解释,实现因果定义上的忠实性,并在小规模数据集上验证了其可检查的决策基础。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08492 2026-07-02 cs.CV cs.AI 新提交

Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation

眼见为实:基于视觉锚点的提示重写对齐用于文本到图像生成

Xuanyi Liu, Deyi Ji, Junyu Lu, Jing Wang, Lanyun Zhu, Qianxiong Xu, Xuhang Chen, Tianrun Chen, Siwei Ma

机构 * Peking University(北京大学) Tencent(腾讯) Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学) University of Cambridge(剑桥大学) Zhejiang University(浙江大学)

AI总结 提出FaithRewriter框架,利用多模态大模型生成中间视觉线索,结合大语言模型生成视觉锚定的增强提示,再蒸馏至小模型,以缩小用户意图与生成图像之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26270 2026-07-02 cs.CR cs.AI cs.SE 版本更新

Knowdit: Agentic Smart Contract Vulnerability Detection with Auditing Knowledge Summarization

Knowdit: 基于审计知识摘要的智能合约漏洞检测框架

Ziqiao Kong, Wanxu Xia, Chong Wang, Yue Xue, Yi Lu, Pan Li, Shaohua Li, Zong Cao, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) National Superior College for Engineers, Beihang University(北京航空航天大学高等工程学院) Bitslab The Chinese University of Hong Kong(香港中文大学)

AI总结 Knowdit利用审计知识摘要和多智能体框架,通过迭代循环检测智能合约漏洞,有效识别高和中严重性漏洞,优于现有基线方法。

Comments Revised with GPT-5.4

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10540 2026-07-02 cs.LG 版本更新

FusionFactory: Fusing LLM Capabilities with Multi-LLM Log Data

FusionFactory: 融合多LLM日志数据中的大语言模型能力

Tao Feng, Haozhen Zhang, Zijie Lei, Pengrui Han, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学) Meta Monetization AI(Meta 变现人工智能) NVIDIA(英伟达)

AI总结 提出FusionFactory框架,通过查询级、思维级和模型级融合策略,利用多LLM日志数据提升模型性能,在14个基准测试中均优于最佳单模型。

Journal ref TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31982 2026-07-01 cs.CV 新提交

ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs

ERA:基于熵引导的视觉令牌剪枝与修正注意力机制的高效多模态大语言模型

Yuhao Wang, Mu Qiao, Haiwen Diao, Yunzhi Zhuge, Pingping Zhang, Xindong Zhang, Lei Zhang, Huchuan Lu

机构 * School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) S-Lab, Nanyang Technological University(南洋理工大学S-Lab) OPPO Research Institute(OPPO研究院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

AI总结 提出ERA框架,通过熵引导的视觉令牌剪枝和修正注意力机制,解决令牌减少导致的注意力对数坍塌问题,实现高效多模态大语言模型推理加速。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31933 2026-07-01 cs.CV 新提交

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs

无处可藏:基于背景控制对的视频幻觉基准测试

Haojian Huang, Harold Haodong Chen, Meng Luo, Junjia Du, Shanqing Xu, Ziheng Chen, Yanxiang Huang, Yinchuan Li, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Knowin AI(考恩人工智能) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出VidPair-Halluc基准,通过背景相似但前景语义不同的视频对,精确评估大型视频模型中的视频幻觉,包含1K对抗视频对和11K时空问答对。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31517 2026-07-01 cs.IR cs.CV 新提交

Unsupervised Data-Efficient Cross-Modal Retrieval with Global-Neighborhood Alignment Hashing

基于全局邻域对齐哈希的无监督数据高效跨模态检索

Runhao Li, Xiaoxu Ma, Zhenyu Weng, Yue Zhang, Guibo Luo, Huiping Zhuang, Zhiping Lin, Yap-Peng Tan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) College of Computer and Information Engineering, Henan Normal University(河南师范大学计算机与信息工程学院) VinUniversity(Vin大学)

AI总结 提出全局邻域对齐哈希(GNAH),通过原型锚定全局对齐和对比随机邻域对齐,在少量图像-文本对下学习紧凑二进制码,实现数据高效的无监督跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31388 2026-07-01 cs.CV 新提交

One Video, One World: Turning Monocular Video into Physical 4D Scenes

一视频一世界:将单目视频转化为物理4D场景

Junhao Chen, Boran Zhang, Mingjin Chen, Henghaofan Zhang, Saining Zhang, Congcong Zhu, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) SparcAI Inc(SparcAI公司) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。

Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31099 2026-07-01 cs.CV cs.AI 新提交

Seeing Through Multiple Views: Parameter-Efficient Fine-Tuning via Selective Neurons for Consistent Radiology Report Generation

透视多视图:通过选择性神经元进行参数高效微调以实现一致的放射学报告生成

Yucheng Chen, Jinjing Zhu, Yang Yu, Yufei Shi, Hane Naghshbandi, Jinhua Liu, Angela S. Koh, Fang Fen, Kian Eng Ong, Si Yong Yeo

机构 * MedVisAI Lab(MedVisAI实验室) Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(新加坡南洋理工大学李光前医学院) Centre of AI in Medicine, Singapore(新加坡人工智能医学中心) The Chinese University of Hong Kong, Sha Tin, New Territories, Hong Kong(香港中文大学) National Heart Centre Singapore (NHCS), Singapore(新加坡国家心脏中心)

AI总结 提出View-PNDF框架,通过检测和微调视图特定神经元,从神经元层面实现多视图X光报告的一致性生成,仅更新少量参数即可提升视图特定报告质量并保持通用性能。

Comments Accepted by MICCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27922 2026-07-01 cs.CV cs.AI 新提交

Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding

Reflect-R1:长视频理解中基于证据驱动的自纠正反思

Shuimu Chen, Yuteng Chen, Yuanshen Guan, Zebang Cheng, Zeyu Zhang, Shengqian Qin, Bin Xia, Jiaran Li, Wenming Yang, Fei Ma

机构 * Tsinghua University(清华大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) University of California(加利福尼亚大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出Reflect-R1框架,通过直觉、验证、仲裁三阶段管道动态检索客观视觉证据,并设计阶段解耦强化学习算法SD-GRPO解决策略耦合,在长视频理解基准上达到最优性能。

Comments 2026 ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27313 2026-07-01 cs.CV 新提交

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

ViQ: 任意分辨率下的文本对齐视觉量化表示

Xumin Yu, Zuyan Liu, Zhenyu Yang, Yuhao Dong, Shengsheng Qian, Jiwen Lu, Han Hu, Yongming Rao

机构 * Tencent HY Vision Team(腾讯HY视觉团队) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Chinese Academy of Sciences(中国科学院)

AI总结 提出ViQ框架,通过文本对齐预训练和特征离散化两阶段量化学习,平衡离散表示中的语义与细节,支持原生分辨率输入,在多模态任务中取得与连续高维特征编码器相当的性能,并实现20%-70%的训练加速。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10652 2026-07-01 cs.CV cs.AI 版本更新

Are Video Reasoning Models Ready to Go Outside?

视频推理模型是否已准备好走向户外?

Yangfan He, Changgyu Boo, Jaehong Yoon

机构 * NTU Singapore(新加坡国立大学) Korea University(韩国大学)

AI总结 本文提出ROVA框架,通过时空腐蚀建模提升模型鲁棒性,并引入PVRBench基准测试真实环境扰动下的性能,验证了ROVA在准确性和推理质量上的显著提升。

Comments Project Page: https://robust-video-reason.github.io/, accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏