arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 582 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 582 篇

2607.26913 2026-07-30 cs.CV 新提交 50%

Prior Directions: Why GUI Grounding Gets Locked in the Past

先验方向:为什么GUI grounding会被锁定在过去

Weile Gong, Zijian Lu, Mingcai Chen, Yiping Zuo, Xin He, Weibei Fan

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 该研究探究视觉-语言模型的GUI grounding锁定问题,提出先验方向概念,发现其是锁定的关键,移除该方向分量可恢复视觉grounding。

Comments 13 pages, 8 figures. Code: https://github.com/phare111/prior-directions

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24872 2026-07-29 cs.IT cs.SY eess.SY math.IT 新提交 50%

Beam-Response Contrastive Learning for Transmitter-Side MIMO CSI Representation

用于发射机端MIMO CSI表示的波束响应对比学习

Sehyun Ryu, Yumin Kim, Minjae Lee, Hyun Jong Yang, John M. Cioffi

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 研究无标签信道状态信息的自监督表示学习,提出波束响应对比学习框架BRCL,基于发射端Gram矩阵,结合重建学习实现样本级CSI恢复和波束响应级一致性,实验表明其提高标签效率且性能优于其他预训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14521 2026-07-17 cs.CV 新提交 50%

Uni-AdaVD: Universal Concept Erasure for Visual Generation via Orthogonal Value Decomposition

Uni-AdaVD:通过正交值分解实现视觉生成的通用概念擦除

Qifan Zhou, Yuan Wang, Yanbin Hao, Xiang Wang, Kuien Liu, Richang Hong, Meng Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 针对视觉生成模型吸收不良概念问题,提出Uni-AdaVD框架,将多模态注意力值空间作为干预空间,结合正交值分解与自适应擦除移位抑制目标语义方向,实验证明其在单多概念擦除且保留非目标先验方面性能强大,为视觉生成模型提供安全机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14442 2026-07-17 cs.CR 新提交 50%

Disclosure Divergence: Measuring Privacy Policy and Data Safety Misalignment at Scale

披露差异:大规模衡量隐私政策与数据安全的不一致性

Mst Eshita Khatun, Lamine Noureddine, Sideeq Bello, Aisha Ali-Gombe

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 针对移动应用隐私政策与数据安全标签表述不一致问题,通过对6051款安卓应用大规模实证研究,利用基于大语言模型的框架和统一模式,测量一致性并引入风险评分,发现敏感类别受影响大,凸显披露机制差距,强调加强验证与提高透明度。

Journal ref Proceedings on Privacy Enhancing Technologies (PoPETs) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13192 2026-07-16 cs.CV 新提交 50%

Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?

自监督视觉表征学习:预训练-微调还是联合训练?

Nusrat Munia, Tyler Ward, Nishat Nayla, Matthew A. Massey, Abdullah-Al-Zubaer Imran

机构 * University of Kentucky(肯塔基大学) Kentucky Geological Survey(肯塔基地质调查局)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 研究自监督视觉表征学习中预训练-微调与联合训练两种范式,通过在多种任务及不同标记数据比例下评估性能,发现JT在低标记时提高效率且稳健,PFT在专业领域更可靠,为混合自监督半监督学习提供基准和指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12098 2026-07-15 cs.IR 新提交 50%

Explaining When PRF Fails: Participatory Auditing for Selective Query Expansion

解释伪相关反馈何时失败:用于选择性查询扩展的参与式审计

Zeyan Liang, Graham McDonald, Iadh Ounis

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 研究PRF失败问题,提出两阶段审计然后自动化框架,第一阶段通过对用户审计揭示PRF利弊,第二阶段利用基于语言模型的重排器作预测器,解释PRF危害及决策过程,使检索组件可审计且以用户为基础。

Comments Accepted at WExIR @ SIGIR 2026, the 2nd Workshop on Explainability in Information Retrieval, Melbourne (Naarm), Australia, 24 July 2026. 3 pages, 1 figure. Extended abstract building on the SIGIR 2026 short paper "Auditing Query Drift: Do Users Actually Benefit from Pseudo-Relevance Feedback?" (doi:10.1145/3805712.3809916)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12050 2026-07-15 cs.RO 新提交 50%

EFLUX: Elastic Multi-Robot Formation Navigation and Adaptation with Agentic LLMs

EFLUX:基于智能语言模型的弹性多机器人编队导航与自适应

Jinyuan Zhang, Yuwei Wu, Guangyao Shi, Jonathan Diller, Gaurav S. Sukhatme, Vijay Kumar

机构 * GRASP Lab, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) Department of Computer Science, University of Southern California(南加州大学计算机科学系)

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 针对多机器人在受限环境中编队导航问题,提出EFLUX框架,基于几何和大语言模型,对变形与重新配置动作联合推理,经闭环管道转化为航点,实验证明其能实现安全弹性导航,减少死锁与导航失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11281 2026-07-14 cs.CV 新提交 50%

The Devil Is in the Leakage: A Disentangled Dual-Purification Framework for High-Fidelity Hairstyle Transfer

问题出在泄漏中:用于高保真发型转移的解缠双净化框架

Jijie Li, Jiankuo Zhao, Xiangyu Zhu, Zhen Lei

机构 * SAI, UCAS(中国科学院大学 模式识别国家重点实验室) MAIS, CASIA(中国科学院自动化所 模式识别国家重点实验室) CAIR, HKSIS, CAS(中国科学院香港创新研究院 计算机与信息工程实验室) SCSE, FIE, M.U.S.T(澳门科技大学 资讯科技学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 研究发型转移中参考发型与源身份纠缠及现有方法泄漏问题,提出双净化框架,含对抗发型净化和对比几何净化两个正则化器,实现高保真、身份保留的发型转移并达领先性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11196 2026-07-14 cs.CV 新提交 50%

Slot-RAE: Streamlining Object-Centric Learning via Direct Representation Auto-Encoders

Slot-RAE:通过直接表示自动编码器简化以对象为中心的学习

Alexandre Chapin, Emmanuel Dellandrea, Liming Chen

机构 * LIRIS(里昂图像与信息系统实验室) Ecole Centrale de Lyon(里昂中央理工学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 研究针对以对象为中心的模型部署问题,提出Slot-RAE框架,直接在视觉基础模型特征空间运行,采用特征空间扩散过程及独特训练方式,在COCO数据集实验中取得领先成果,实现高效无监督对象发现等,速度和计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11118 2026-07-14 cs.CV 新提交 50%

GHOST: Geometry-Guided Hallucination of Opaque Surface Textures

GHOST:不透明表面纹理的几何引导幻觉

Langxu Zhao, Zuan Gu, Tianhan Gao

机构 * School of Software, Northeastern University, Shenyang, China(软件学院,东北大学,沈阳,中国)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 针对透明物体给深度估计和3D重建带来的挑战,提出几何引导预处理框架GHOST,利用视觉基础模型,经多步骤处理分离属性、恢复法线先验并整合多模态线索,合成不透明RGB图像,显著提升相关模型对透明物体的处理精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10003 2026-07-14 cs.SD 新提交 50%

ARIMA: Reconstruction-Grounded Predictive Representation Learning for Symbolic Music

ARIMA:用于符号音乐的基于重构的预测表示学习

Mingyang Yao, Zhaoxiang Feng

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本文提出ARIMA框架,用于符号音乐的基于重构的预测表示学习。它直接从数据学习紧凑窗口表示,编码窗口为潜在表示,训练因果预测器并通过结构化重构确定编码器基础,在多下游任务表现良好,证明相关方法的有效性和重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09583 2026-07-13 cs.CV 新提交 50%

Promptable Concept Segmentation from Above: Evaluating SAM 3's Zero-Shot and One-Shot Capabilities in Remote Sensing

从上方进行可提示的概念分割:评估SAM 3在遥感中的零样本和单样本能力

Mohammad Dabaja, Turgay Celik

机构 * University of Agder(阿格德大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 研究在严格零样本和单样本约束下,对SAM 3在遥感场景分类等任务中的能力进行评估。核心方法是对SAM 3结构调整并隔离提示模态来诊断对齐机制,还制定代理评估协议。主要贡献是揭示跨模态干扰,表明SAM 3避免过拟合但受分辨率等限制,指明微调方向。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09143 2026-07-13 cs.CV 新提交 50%

Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing

编织光与时间:用于密集RGB-事件解析的统一谐波-几何表示学习

Chenxu Peng, Chongtian zhou, Dicheng Liu, Bo-Wen Yin, Yimian Dai, Xialei Liu, Ming-Ming Cheng, Xiang Li

机构 * NKIARI(鹏城实验室) VCIP, CS, Nankai University(南开大学视觉计算与图像处理研究室) AAIS, Nankai University(南开大学人工智能学院)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 研究针对RGB-事件解析中统一主干应用的挑战,提出Evita统一主干,嵌入几何视差校正等协同学习模块,构建N-ImageNetV2及预训练协议,经多基准评估,其实现新指标,在实时多模态上精度-延迟权衡表现卓越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06424 2026-07-08 cs.CV 新提交 50%

XRFormer: Multiscale Tokenization for XRF Representation Learning

XRFormer:用于X射线荧光光谱表示学习的多尺度令牌化

Sofiane Daimellah, Sylvie Le Hégarat-Mascle, Clotilde Boust

机构 * Centre de Recherche et de Restauration des Musées de France(法国国家博物馆研究与修复中心)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 研究针对X射线荧光光谱自动学习难的问题,提出XRFormer架构,通过多尺度卷积令牌器定制,结合自监督预训练方法,在颜料识别和分解任务中表现出色,凸显多尺度令牌化在数据有限时对基于变压器的XRF建模的有效性和高效性。

Comments International Conference on Pattern Recognition, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06356 2026-07-08 eess.IV cs.CV 新提交 50%

TMF-RSE: Tri-Modal Fusion with Regional Semantics and Evidential Uncertainty for Lung Severity Scoring

TMF-RSE:用于肺部严重程度评分的具有区域语义和证据不确定性的三模态融合

Fadi Abdeladhim Zidi, Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Gaby Maroun, Fadi Dornaika, Cosimo Distante

机构 * Institute of Applied Sciences and Intelligent Systems (ISASI), CNR(应用科学与智能系统研究所(ISASI),CNR) Department of Computer Science and Artificial Intelligence, University of the Basque Country (UPV/EHU)(巴斯克国家大学计算机科学与人工智能系) University of Salento(萨莱nton大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 针对从胸部影像量化肺部疾病严重程度的问题,提出TMF-RSE框架,结合多模态特征,采用互补融合机制和证据回归,在相关数据集实验中性能优于基于Transformer的基线。

Comments 6 pages, 2 figures, 5 tables. IEEE conference format (IEEEtran). Submitted to AVSS 2026. Tri-modal fusion for lung severity scoring using appearance, segmentation, and VLM semantics with evidential uncertainty

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05373 2026-07-07 cs.CV 新提交 50%

PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space

PixWorld:在像素空间中统一3D场景生成与重建

Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Jia-Wang Bian

机构 * Nanyang Technological University(南洋理工大学) AISphere(人工智能领域)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 针对3D场景生成与重建原有范式存在信息损失等缺陷,提出像素空间统一扩散框架PixWorld,引入几何感知损失,无需预训练自编码器,性能优于现有方法。

Comments Project page: https://sensengao.github.io/PixWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04812 2026-07-07 cs.CV 新提交 50%

TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving

TGRIP:一种用于自动驾驶中车辆实例预测的文本引导方法

Miguel Antunes-García, Santiago Montiel-Marín, Fabio Sánchez-García, Rodrigo Gutiérrez-Moreno, Rafael Barea, Luis M. Bergasa

机构 * Electronics Department, University of Alcalá (UAH)(阿尔卡拉大学(UAH)电子系)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 研究自动驾驶中鸟瞰图实例预测问题,提出TGRIP框架,利用视觉语言基础模型生成语义增强地图作辅助监督,使网络学习时空表征,提升预测能力。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04696 2026-07-07 cs.CV 新提交 50%

Probe-EM: Targeted Neuron Tracing via Training-Free Semantic Verification

Probe-EM:通过无训练语义验证进行靶向神经元追踪

Liuyun Jiang, Yanchao Zhang, Jinyue Guo, Chuanyue Chen, Haiyang Yan, Ye Yuan, Jing Liu, Hua Han

机构 * State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化所脑认知与脑机智能技术重点实验室) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学高等研究院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 为解决自动重建算法过分割瓶颈及传统追踪方法问题,提出无训练靶向神经元追踪框架,利用几何先验和新策略迭代重建神经元形态,集成到平台减少人工校对时间。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03511 2026-07-07 cond-mat.mes-hall 新提交 50%

Robustness of quantized Hall resistivity under cavity coupling at zero temperature

零温下腔耦合时量子化霍尔电阻率的鲁棒性

Juan Román-Roche, Jie Wang, Michael Ruggenthaler, Angel Rubio, Vasil Rokaj

专题命中 知识编辑与模型理解 :prompting(abstract)

AI总结 研究电磁腔强光-物质耦合对量子霍尔系统输运性质的影响,通过现象学模型揭示强光-物质相互作用下量子霍尔系统电导率和电阻率的不对称性及零温时霍尔电阻率的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01630 2026-07-03 cs.CV 新提交 50%

DRDN: Decoupled Representation Dynamic Network for From-Scratch ViT Class-Incremental Learning

DRDN: 用于从头训练ViT类增量学习的解耦表示动态网络

Bingchen Huang, Yifu Chen, Zhiling Wang, Yuanchao Du

机构 * Meituan Vision AI Department(美团视觉AI部门)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 针对类增量学习中共享表示退化与任务间干扰问题,提出解耦表示动态网络(DRDN),通过掩码图像建模保持骨干网络通用视觉结构,并采用层次化任务令牌扩展减少跨任务干扰,在从头训练的ViT上取得显著提升。

Comments 10 pages, IEEEtran journal format. Preprint submitted to IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00978 2026-07-02 cs.CV cs.RO 新提交 50%

Privacy-Preserving Depth-Only Open-Vocabulary 3D Semantic Segmentation Via Uncertainty-Guided Test-Time Optimization

隐私保护下基于深度图的开放词汇3D语义分割:不确定性引导的测试时优化

Xuying Huang, Sicong Pan, Maren Bennewitz

机构 * Humanoid Robots Lab, University of Bonn(波恩大学仿人机器人实验室) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所) Center for Robotics, Bonn, Germany(波恩机器人中心)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 针对隐私保护需求,提出不确定性引导的测试时优化框架UTTO,利用深度图几何信息与基础模型语义先验,实现无需RGB图像的开放词汇3D语义分割,在多个数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00638 2026-07-02 cs.CV 新提交 50%

Uncertainty-aware tree height change regression

不确定性感知的树高变化回归

Max Gaber, Dimitri Gominski, Jaime C. Revenga, Stefan Oehmcke, Rasmus Fensholt, Martin Brandt

机构 * Department of Geosciences and Natural Resource Management, University of Copenhagen(哥本哈根大学地球科学与自然资源管理系) Department of Mathematical Sciences, University of Copenhagen(哥本哈根大学数学科学系) Department of Computer Science and Electrical Engineering, University of Rostock(罗斯托克大学计算机科学与电气工程系) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 针对现有方法忽略连续变化和标签不确定性的问题,提出CHC数据集(含3米分辨率树高变化及不确定性)和不确定性感知变化回归任务,评估了地理空间基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31811 2026-07-01 cs.CV 新提交 50%

MuSViT: A Foundation Vision Model for Sheet Music Representation

MuSViT: 一种用于乐谱表示的基础视觉模型

Carlos Penarrubia, Antonio Rios-Vila, Eliseo Fuentes-Martinez, Juan C. Martinez-Sevilla, Francisco J. Castellanos, María Alfaro-Contreras, Jorge Calvo-Zaragoza

机构 * Pattern Recognition and Artificial Intelligence Group, University of Alicante, Spain(西班牙阿利坎特大学模式识别与人工智能组)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出MuSViT,首个基于ViT的乐谱基础视觉模型,通过掩码自编码器预训练于970万页IMSLP数据,采用两阶段课程学习,在下游任务中优于通用视觉编码器,并直接编码符号音乐结构。

Comments Accepted at European Conference on Computer Vision (ECCV'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26711 2026-07-01 cs.CV 新提交 50%

Mask to Concept: Auto-Promptable SAM3 via Efficient Test-Time Concept Embedding Search for Few-Shot Annotation

掩码到概念:通过高效测试时概念嵌入搜索实现自动可提示的SAM3用于少样本标注

Quan Zhou, Shaoqing Zhai, Qiang Hu, Jia Chen, Qiang Li, Zhiwei Wang

机构 * Wuhan University of Technology(武汉理工大学) Huazhong University of Science and Technology(华中科技大学) Changzhou United lmaging Healthcare Surgical Technology Co. Ltd.(常州联影医疗手术技术有限公司)

专题命中 知识编辑与模型理解 :prompting(abstract)

AI总结 提出Mask to Concept (M2C)框架,无需外部模块或重训练,仅用少量标注图像,通过可学习概念嵌入搜索和混合不确定性估计,实现SAM3在医学图像中的自动少样本标注,达到SOTA性能。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21252 2026-07-01 cs.CV 新提交 50%

A Neurosymbolic Framework for Interpretable Skeleton-Based Seizure Detection via Concept-Driven Logical Reasoning

一种基于概念驱动逻辑推理的可解释骨架癫痫检测的神经符号框架

Talha Ilyas, Deval Mehta, Zongyuan Ge

机构 * Monash University(莫纳什大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出首个神经符号框架用于视频癫痫检测,通过概念驱动逻辑推理实现可解释性,在SAHZU和IEEE基准上分别达到89.78%和85.27%的灵敏度,误检率低至0.06和0.09次/小时。

Comments Accepted to MICCAI 2026 (Early Accept: top 9%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07100 2026-07-01 cs.CV cs.RO 新提交 50%

LARA: Latent Action Representation Alignment for Vision-Language-Action Models

LARA: 视觉-语言-动作模型的潜在动作表示对齐

Mengya Liu, Baoxiong Jia, Jiangyong Huang, Jingze Zhang, Siyuan Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :post-training(abstract)

AI总结 提出LARA框架,通过表示对齐联合优化潜在动作模型和视觉-语言-动作模型,利用人类视频数据提升机器人操作性能,在模拟和真实基准上平均提升约10%、5%和15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25713 2026-06-25 cs.SD 新提交 50%

Frequency-Aware Self-Supervised Music Representation Learning

频率感知的自监督音乐表示学习

Yicheng Gu, Junan Zhang, Jerry Li, Zhizheng Wu, Lauri Juvela

机构 * Spellbrush Acoustic Lab, Department of Information and Communications Engineering (DICE), Aalto University(阿尔托大学信息与通信工程系声学实验室) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出PupuJEPA,一种直接在2D频谱图上训练的视觉联合嵌入预测架构,通过预测掩码补丁的潜在嵌入学习鲁棒表示,在MARBLE基准上线性探测优于1D序列SSL模型。

Comments Submitted to TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24767 2026-06-24 cs.CV cs.RO 新提交 50%

Compact Object-Level Representations with Open-Vocabulary Understanding for Indoor Visual Relocalization

具有开放词汇理解的紧凑对象级表示用于室内视觉重定位

Zhaopeng Cui, Jiarui Hu, Jingbo Liu, Boming Zhao, Xiyue Guo, Boyin Feng, Haocheng Peng, Yujun Shen, Hujun Bao, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Ant Group(蚂蚁集团)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出OpenReLoc系统,利用基础模型实现多模态开放词汇语义匹配、基于DIOU的参考帧选择和双路径2D ICP损失,仅用对象单元实现室内视觉重定位,提升可解释性和准确性。

Comments Accepted by RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22749 2026-06-23 cs.CV 新提交 50%

RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation

RaysUp: 基于几何感知射线表示的超轻量通用特征上采样

Yuchuan Ding, Linfei Li, Lin Zhang, Ying Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出RaysUp,一种超轻量、任务无关且VFM无关的特征上采样框架,通过几何感知射线域重建高分辨率特征图,在多种密集预测任务上以16%参数和7倍加速实现最先进性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20419 2026-06-19 cs.CV 新提交 50%

Spectral Query-Key Product Weight Steering for Training-Free VLM Hallucination Mitigation

谱查询-键乘积权重引导用于免训练VLM幻觉缓解

Karn Tiwari, Varnith Chordia, Prathosh A P

机构 * Indian Institute of Science, Bengaluru(印度科学理工学院,班加罗尔) Snap Research(Snap 研究院)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出QK乘积引导,一种无数据、免训练、零推理成本的权重编辑方法,通过抑制中间层主导奇异模式减少对象幻觉,在三个GQA基VLM上平均降低CHAIR$_s$ 4.0%。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏