arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 340 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 340 篇

2607.04872 2026-08-12 cs.CV cs.AI 版本更新 62%

EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization

EventCoT:用于推理时间定位的以事件为中心的视频思维链

Youngkil Song, Yoonjae Baek, Dongwon Kim, Inho Kim, Dongkeun Kim, Suha Kwak

机构 * Pohang University of Science and Technology(浦项科技大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) Handong Global University(韩东国际大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出EventCoT框架解决推理时间定位难题,先对视频进行以事件为中心的分词,再在识别出的事件内推理生成答案,通过嵌入匹配确定时间间隔,在相关任务中取得好结果。

Comments 27 pages, 11 figures, 19 tables. Co-corresponding authors: Dongkeun Kim and Suha Kwak

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05280 2026-08-12 cs.IT cs.AI cs.LG math.IT 版本更新 62%

On Solomonoff Induction in Large Language Models and the Limits of Self-Improving: The Singularity Is Not Near Without Symbolic Model Synthesis

在大型语言模型中自我改进的极限:没有符号模型合成,奇点并不临近

Hector Zenil

机构 * Algorithmic Dynamics Lab(算法动力实验室) Department of Biomedical Computing(生物医学计算系) School of Biomedical Engineering and Imaging Sciences(生物医学工程与成像科学学院) King’s Institute for AI(国王人工智能研究所) King’s College London(伦敦国王学院) Oxford Immune Algorithmics(牛津免疫算法公司) Oxford University Innovation(牛津大学创新中心) London Institute for Healthcare Engineering(伦敦医疗工程研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究指出大型语言模型在缺乏外部信号时自我改进会退化,提出神经符号整合方法以突破这一限制。

Comments 31 pages. Update: DPI and Levin's non-growth is not violated explanation when it comes to finite learners

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01548 2026-08-11 cs.AI cs.LG 版本更新 62%

Emergence Invariance: From Symbolized Thought to Structural Control

涌现不变性:从符号化思维到结构控制

Yi Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。

Comments 51 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22665 2026-08-11 cs.CV cs.AI 版本更新 62%

SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery

SARVLM:一种用于SAR图像语义理解的视觉语言基础模型

Qiwei Ma, Xukun Lu, Wang Liu, Puhong Duan, Xudong Kang, Shutao Li

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Yuelushan Center for Industrial Innovation(岳麓山创新中心) School of Medical Information Engineering, Jining Medical University(济南医学院医学信息工程学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SARVLM,一种专为SAR图像设计的视觉语言基础模型,通过多阶段领域迁移策略和集成策略提升跨场景泛化能力,在多个基准测试中表现优异。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14750 2026-08-07 eess.AS cs.AI cs.CV cs.SD 版本更新 62%

Pixel-TTS: Image based Text Rendering for Robust Text-to-Speech

Pixel-TTS: 基于图像的文字渲染实现鲁棒文本转语音

Adarsh Arigala, Arjun Gangwar, S Umesh, Yova Kementchedjhieva

机构 * SPRING Lab, Indian Institute of Technology, Madras, India(SPRING实验室,印度理工学院,马德拉斯,印度) MBZUAI, UAE(MBZUAI,阿联酋)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出Pixel-TTS框架,将文本渲染为图像并通过2D卷积生成嵌入,消除嵌入矩阵扩展,提升对未见字符和拼写变体的鲁棒性,实现零样本泛化。

Comments 11 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14299 2026-08-07 cs.CV cs.LG 版本更新 62%

What Drives Test-Time Adaptation for CLIP? A Controlled Empirical Study from an Update Perspective

什么驱动了CLIP的测试时适应?从更新视角进行的受控实证研究

Jiazhen Huang, Xiao Chen, Zhiming Liu, Yaru Sun, Jingyan Jiang, Zhi Wang

机构 * Tsinghua University(清华大学) Shenzhen Technology University(深圳技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文通过受控实证研究,从更新视角分析了CLIP测试时适应方法的驱动因素,揭示了适应增益主要来自测试时证据和可靠代理,而非繁重优化,并指出无单一范式普遍最优。

Comments Benchmark and codes are available at https://github.com/walawalagoose/TTABC

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01407 2026-08-06 cs.CV cs.AI 版本更新 62%

ZoomV: Temporal Zoom-in for Efficient Long Video Understanding

TimeSearch: 基于聚光灯和反射的层次视频搜索用于类人长视频理解

Yuan Zhang, Junwen Pan, Rui Zhang, Xin Wan, Qizhe Zhang, Ming Lu, Qi She, Shanghang Zhang

机构 * ByteDance(字节跳动) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 TimeSearch通过Spotlight和Reflection机制,提升长视频理解的准确性和效率

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15622 2026-08-04 cs.CV cs.LG 版本更新 62%

AdaDINO: Context-Adaptive DINO-Distilled Vision Foundation Models for Efficient Open-Vocabulary Edge Inference

AdaVFM:通过LLM引导执行实现边缘智能的自适应视觉基础模型

Yiwei Zhao, Yi Zheng, Huapeng Su, Jieyu Lin, Stefano Ambrogio, Cijo Jose, Michael Ramamonjisoa, Patrick Labatut, Barbara De Salvo, Chiao Liu, Phillip B. Gibbons, Ziyun Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出AdaVFM,一种通过LLM引导执行实现边缘设备上语言对齐视觉基础模型高效推理的自适应框架,通过动态调整计算实现性能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21799 2026-08-03 cs.LG cs.AI 版本更新 62%

Towards White-Box Deep Wireless Sensing

迈向白盒深度无线感知

Xie Zhang, Yina Wang, Chenshu Wu

机构 * The University of Hong Kong(香港大学) MIT(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对现有深度无线感知模型为黑盒的问题,提出基于复稀疏率降维原理的全复值Transformer模型RF-CRATE,引入子空间正则化解决数据稀缺问题,在五项数据集的多类任务中验证其性能优于黑盒模型且具备可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06254 2026-07-30 cs.CV cs.AI 版本更新 62%

VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection

VendorBench-100:用于深度伪造图像检测的统一跨范式基准测试

Sharayu N. Deshmukh, Md Rashidunnabi, Nelton Tiago Gemo, Kurundkar G. D., Mahamune M. R., Nilesh K. Deshmukh

机构 * Universidade da Beira Interior(贝拉内斯大学) Shri Guru Buddhi Swami College(什里·古鲁·布迪·斯瓦米学院) Swami Ramanand Tirtha Marathwada University(斯瓦米拉曼南德·蒂尔塔马哈拉施特拉大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对深度伪造图像检测的三种范式缺乏通用评估的问题,提出VendorBench-100基准测试,用统一框架评估36个模型,强调现实场景,通过MCC排名,发现ROC-AUC与MCC有差异,还发布评估框架和结果助力后续研究。

Comments Fixed scoring-normalization error in Neural Defend/TruthScan results, revising the central finding: MCC and ROC-AUC are strongly correlated (r ~ 0.86) overall, with only a specific subset showing one-directional threshold miscalibration. Abstract, tables, Discussion, Conclusion updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16035 2026-07-30 cs.LG cs.AI 版本更新 62%

Equivariant Eikonal Neural Networks: Grid-Free, Scalable Travel-Time Prediction on Homogeneous Spaces

等变 eikonal 神经网络:齐性空间上无网格、可扩展的走时预测

Alejandro García-Castellanos, David R. Wessels, Nicky J. van den Berg, Remco Duits, Daniël M. Pelt, Erik J. Bekkers

机构 * Amsterdam Machine Learning Lab (AMLab), University of Amsterdam(阿姆斯特丹机器学习实验室(AMLab),阿姆斯特丹大学) New Theory(新理论) Department of Mathematics and Computer Science, Eindhoven University of Technology(数学与计算机科学系,埃因霍温理工大学) Leiden Institute of Advanced Computer Science, Universiteit Leiden(莱顿高级计算机科学研究所,莱顿大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将等变神经场与神经 eikonal 求解器结合的新型框架,用于齐性空间等任意黎曼流形的走时预测,经地震走时建模验证,性能优于现有基于神经算子的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08543 2026-07-30 cs.CV cs.AI cs.CL cs.CY 版本更新 62%

VideoNorms: Benchmarking Cultural Awareness of Video Language Models

VideoNorms:视频语言模型文化意识基准测试

Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究推出VideoNorms数据集评估VideoLLMs的文化规范意识,发现模型中文表现逊于英文、提供非语言证据更困难,视频模态必要且规模扩大无分类分数提升,成果助力文化导向的视频模型训练与评估。

Comments 29 pages, 6 figures, 19 tables. IC2S2 2026, C3NLP@ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04364 2026-07-29 cs.CV cs.LG 版本更新 62%

Spatially Grounded Concept Bottleneck Models via Part-Factorized Attention

通过部分分解注意力的空间基础概念瓶颈模型

Dhanesh Ramachandram

机构 * Vector Institute(向量研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 提出一种部分分解的概念瓶颈模型,通过空间先验约束注意力,在细粒度识别中实现可解释性并提升定位精度。

Comments Updated references, abstract and rewrite to remove terse language

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10643 2026-07-29 stat.ML cs.AI cs.LG 版本更新 62%

TaylorPODA: A Taylor Expansion-Based Method to Improve Post-Hoc Attributions for Opaque Models

TaylorPODA:一种基于泰勒展开的方法,用于改进不透明模型的事后归因

Yuchi Tang, Iñaki Esnaola, George Panoutsos

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究针对不透明模型事后归因方法缺乏普遍标准的问题,提出基于泰勒展开框架的TaylorPODA方法,通过引入假设、分析矛盾、设计可控分配机制等,使其既满足假设又适应下游目标,提升了归因与用户定义效用的对齐及解释的可交流性。

Comments 21 pages, 4 figures. Submitted to TMLR. Re-upload with amended manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15553 2026-07-28 cs.CV cs.LG 版本更新 62%

Self-Distillation of Hidden Layers for Self-Supervised Representation Learning

隐藏层自蒸馏用于自监督表示学习

Scott C. Lowe, Anthony Fuller, Sageev Oore, Evan Shelhamer, Graham W. Taylor

机构 * Vector Institute(向量研究所) Carleton University(卡尔顿大学) Dalhousie University(达尔豪斯大学) University of British Columbia(不列颠哥伦比亚大学) University of Guelph(圭尔夫大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Bootleg方法,通过预测教师网络多层隐藏层的潜在表示,提升自监督学习中高层概念特征的学习能力,在ImageNet-1K等数据集上表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13302 2026-07-21 cs.AI cs.LG 版本更新 62%

Physics-Guided Spatiotemporal Learning for Coastal Wave Peak Period Estimation from Video

物理引导的时空学习用于从视频估计海岸波浪峰值周期

Abubakar Hamisu Kamagata, Dharm Singh Jat, Attlee Munyaradzi Gamundani, Abhishek Srivastava, Paramasivam Saravanakumar

机构 * Namibia University of Science and Technology(纳米比亚科技大学) Indian Institute of Technology Indore(印度理工学院印多尔分校) Namdeb Diamond Corporation(纳米比亚钻石公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出物理引导的深度时空学习框架,结合自动区域检测、模拟到真实迁移学习和物理信息正则化,从海岸视频直接估计近岸波浪峰值周期,验证了基于Transformer和轻量级循环卷积架构的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20681 2026-07-14 cs.CL cs.AI cs.LG 版本更新 62%

Disentangling Feature Structure: A Mathematically Provable Two-Stage Training Dynamics in Transformers

解开特征结构:Transformer中数学上可证明的两阶段训练动态

Zixuan Gong, Shijia Li, Yong Liu, Jiaye Teng

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) School of Mechanical-Electronic and Vehicle Engineering, Beijing University of Civil Engineering and Architecture(北京建筑大学机械电子与车辆工程学院) School of Statistics and Management, Shanghai University of Finance and Economics(上海财经大学统计与管理学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究Transformer中特征级两阶段训练动态,通过分析解缠结的两类特征结构引发的学习动态,基于简化设置进行研究,得到该理论框架内首个严格结果,且两阶段过程与注意力权重谱特性相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03631 2026-07-13 cs.LG cs.AI 版本更新 62%

AnchorMoE: Interpretable Time Series Classification via Anchor-Routed MoE

AnchorMoE: 基于锚点路由的混合专家模型实现可解释时间序列分类

Tao Xie, Zexi Tan, Haoyi Xiao, Mengke Li, Yiqun Zhang, Yang Lu, Cuie Yang, Yiu-ming Cheung

机构 * School of Automation, Guangdong University of Technology(广东工业大学自动化学院) School of Computer Science and Technology, Guangdong University of Technology(广东工业大学计算机科学与技术学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Informatics, Xiamen University(厦门大学信息学院) State Key Laboratory of Synthetical Automation for Process Industries, Northeastern University(东北大学过程工业综合自动化国家重点实验室) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出AnchorMoE框架,利用混合专家架构对局部补丁进行多视角表示并路由至专门专家,通过加性分解实现前向可解释性,并引入几何正交约束和不确定性感知门控机制提升稀疏信号下的分解可靠性与噪声抑制。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24264 2026-07-07 cs.CV cs.LG 版本更新 62%

Compositional Generalization Requires Linear, Orthogonal Representations in Vision Embedding Models

组合泛化要求视觉嵌入模型具有线性、正交表示

Arnas Uselis, Andrea Dittadi, Seong Joon Oh

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) Technical University of Munich(慕尼黑技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 研究组合泛化中表示结构需满足的条件,通过形式化三个需求得出其几何约束,为线性表示假设提供理论基础,还推导维度界限并通过实验验证,揭示模型表示结构与组合泛化的关联。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07267 2026-07-03 cs.AI cs.CL cs.LG 版本更新 62%

BRIDGE: Predicting Human Task Completion Time From Model Performance

BRIDGE: 从模型性能预测人类任务完成时间

Fengyuan Liu, Jay Gala, Nilaksh, Dzmitry Bahdanau, Siva Reddy, Hugo Larochelle

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Polytechnique Montréal(蒙特利尔理工学院) Periodic Labs(Periodic实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ServiceNow Research(ServiceNow研究)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出BRIDGE框架,利用项目反应理论从模型性能中学习潜在任务难度,并将其与人类任务完成时间对齐,从而仅凭模型性能预测新基准上的人类任务完成时间。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26874 2026-07-01 cs.DB cs.AI cs.LG 版本更新 62%

Knowledge Graphs as the Missing Data Layer for LLM-Based Industrial Asset Operations

知识图谱:基于LLM的工业资产运营中缺失的数据层

Madhulatha Mandarapu, Sandeep Kunkunuru

机构 * VaidhyaMegha Private Limited, India(印度VaidhyaMegha私人有限公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究通过类型化知识图谱作为数据层,将GPT-4在工业维护场景中的准确率从65%提升至99%,并引入生成增强知识(GAK)处理缺失数据,实现81.8%的场景可回答性。

Comments v4: Accepted at Agents+Graph (AG2026) @ VLDB 2026. Corrects claims to reproduced ground truth: base graph 9 labels/5 edge types/12,647 nodes (extended schema 14/21); GAK materializes 106 failure-mode nodes; FailureSensorIQ noted as a separate IBM benchmark; 467 FMSR overlap with GAK disclosed. 20 pages, 4 figures. Code: github.com/samyama-ai/assetops-kg

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13402 2026-07-01 cs.CV cs.LG 版本更新 62%

Event-Driven Video Generation

事件驱动视频生成

Chika Maduabuchi, Jindong Wang

机构 * William & Mary(威廉与玛丽学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 提出事件驱动视频生成(EVD),通过轻量级头部预测令牌级事件活动,并利用事件门控采样在交互区域集中更新,以修正对象交互错误,提升状态持久性、空间准确性和接触稳定性。

Comments Accepted to ECCV 2026. Project webpage: https://evd-project-website.pages.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24198 2026-06-23 cs.CL cs.AI cs.CE cs.LG cs.MA 版本更新 62%

Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis

奖励科学过程:面向代理数据分析的过程级奖励建模

Zhisong Qiu, Shuofei Qiao, Kewei Xu, Yuqi Zhu, Lun Du, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DataPRM,一种环境感知的生成过程奖励模型,通过主动验证和反思意识的三元奖励策略,提升动态数据分析任务中代理的性能,实验表明其在多个基准测试中表现优异。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26113 2026-06-23 cs.CV cs.AI 版本更新 62%

EgoExo-Con: Exploring View-Invariant Video Temporal Understanding

EgoExo-Con: 探索视角不变视频时间理解

Minjoon Jung, Junbin Xiao, Junghyun Kim, Byoung-Tak Zhang, Angela Yao

机构 * Seoul National University(首尔国立大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出EgoExo-Con基准测试,评估视频大模型在不同视角下的时间理解一致性,并设计View-GRPO强化学习框架提升跨视角一致性。

Comments Accepted to ECCV 2026; project page at https://minjoong507.github.io/projects/EgoExo-Con/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16592 2026-06-16 cs.RO cs.AI cs.CV cs.ET 版本更新 62%

Human Cognition in Machines: A Unified Perspective of World Models

机器中的人类认知:世界模型的统一视角

Timothy Rupprecht, Pu Zhao, Amir Taherin, Arash Akbari, Arman Akbari, Yumei He, Tooba Imtiaz, Sean Duffy, Juyi Lin, Yixiao Chen, Rahul Chowdhury, Enfu Nan, Yixin Shen, Yifan Cao, Haochen Zeng, Weiwei Chen, Geng Yuan, Jennifer Dy, Sarah Ostadabbas, Xuan Zhang, David Kaeli, Edmund Yeh, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc.(EmbodyX公司) Tulane University(路易斯安那州立大学) Cornell University(康奈尔大学) University of Georgia(佐治亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出统一框架整合记忆、感知等认知功能,指出动机和元认知研究不足,并引入认知世界模型新类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17531 2026-06-16 cs.CV cs.AI cs.CR 版本更新 62%

Rel-Zero: Harnessing Patch-Pair Invariance for Robust Zero-Watermarking Against AI Editing

Rel-Zero:利用补丁对不变性实现鲁棒的零水印以抵御AI编辑

Pengzhen Chen, Yanwei Liu, Xiaoyan Gu, Xiaojun Chen, Wu Liu, Weiping Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对AI编辑对图像真实性的威胁,提出Rel-Zero零水印框架,利用编辑中补丁对关系距离的不变性,无需修改原图即可生成鲁棒水印,实验证明其优于现有方法。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09831 2026-06-16 cs.AI cs.LG cs.MA cs.SI 版本更新 62%

Interpretation as Linear Transformation: A Cognitive-Geometric Model of Concepts and Meaning

解释作为线性变换:概念与意义的认知几何模型

Chainarong Amornbunchornvej

机构 * National Electronics and Computer Technology Center(国家电子与计算机技术中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出一个几何框架,通过线性映射和向量空间建模异构智能体间的概念传递、动机与影响,揭示误解与概念消亡的结构条件,并给出领导力的可达性解释。

Comments The revised draft w.r.t. reviewer comments. The code is at https://github.com/DarkEyes/Cognitive-Geometry

Journal ref Minds and Machines, Volume 36, Issue 3, Article number 36, (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18493 2026-06-09 eess.IV cs.AI cs.CV 版本更新 62%

SAGE: Shape-Adapting Gated Experts for Adaptive Histopathology Image Segmentation

SAGE:适应性组织病理图像分割的形状自适应门控专家

Gia Huy Thai, Hoang-Nguyen Vu, Anh-Minh Phan, Quang-Thinh Ly, Thi-Ngoc-Truc Nguyen, Nhat Ho

机构 * University of Science, VNU-HCM(越南国家大学科学学院) Trivita AI University of Technology, VNU-HCM(越南国家大学技术学院) Michigan State University, USA(美国密歇根州立大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 SAGE通过动态专家路由框架提升异构视觉网络中细胞形态变化的适应性,实现高精度分割与稳健泛化。

Comments Accepted to CVPR 2026 (Findings Track). Project Page: https://oxyzgiahuy.github.io/sage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14147 2026-06-09 cs.AI cs.LG 版本更新 62%

An Alternative Trajectory for Generative AI

生成AI的另一种轨迹

Margarita Belova, Yuval Kansal, Yihao Liang, Jiaxin Xiao, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过构建领域特定超智能(DSS)来改进生成AI,利用符号抽象提升领域推理能力,避免LLM合成数据的模型崩溃问题,实现可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25194 2026-08-17 cs.LG 版本更新 57%

Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack

先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击

Dongpeng Zhang, Ke Ma, Yangbangyan Jiang, Gaozheng Pei, Longtao Huang, Qianqian Xu, Qingming Huang

机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) Alibaba Group(阿里巴巴集团) School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.LG

AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏