arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 266 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 266 篇

2602.01359 2026-07-02 cs.LG cs.AI 版本更新 62%

PaAno: Patch-Based Representation Learning for Time-Series Anomaly Detection

PaAno:基于片段的时序异常检测表示学习

Jinju Park, Seokho Kang

机构 * Department of Industrial Engineering, Sungkyunkwan University(成均馆大学工业工程系)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 PaAno提出一种轻量高效的时序异常检测方法,通过提取短时片段并使用1D卷积神经网络进行嵌入,结合三元组损失和预设任务损失提升表示学习效果,实验证明在多种评估指标上优于现有方法。

Comments Accepted by the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14814 2026-06-26 cs.LG cs.CL 版本更新 62%

Learning State-Tracking from Code Using Linear RNNs

利用线性RNN从代码中学习状态追踪

Julien Siems, Riccardo Grazzi, Korbinian Pöppel, Kirill Kalinin, Hitesh Ballani, Babak Rahmani

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 通过将置换组合任务转换为带状态揭示的代码,研究线性RNN在状态追踪中的表现,发现其优于Transformer,但在部分可观测状态下不如非线性RNN。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18324 2026-06-16 cs.CV cs.AI cs.GR cs.LG stat.ML 版本更新 62%

Improved Baselines with Representation Autoencoders

改进的基于表示自动编码器的基线

Jaskirat Singh, Boyang Zheng, Zongze Wu, Richard Zhang, Eli Shechtman, Saining Xie

机构 * Adobe Research(Adobe研究院) ANU(澳大利亚国立大学) New York University(纽约大学)

专题命中 知识编辑与模型理解 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了基于表示自动编码器(RAE)的设计选择,发现三个见解,简化并改进了RAE。首先,研究了一种通用公式,将表示定义为最后k个编码器层的总和,而不是仅最终层。其次,研究了RAE与表示对齐(REPA)的假设,发现两者具有互补的工作机制。最后,改进了RAE在无分类器指导(CFG)中的表现,通过重新参数化DiT模型输出,实现了无需训练第二个模型的指导效果。RAEv2在ImageNet-256上达到了1.06的gFID,且训练效率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12760 2026-06-09 cs.LG cs.CL 版本更新 62%

Similarity-Distance-Magnitude Activations

相似度-距离-幅度激活函数

Allen Schmaltz

机构 * Reexpress AI

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SDM激活函数,通过引入相似度和距离意识提升softmax的鲁棒性和可解释性,并通过密集匹配实现基于实例的可解释性。SDM估计器通过数据驱动的CDF分区控制分类准确性,优于现有校准方法。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. 21 pages, 8 tables, 1 algorithm. arXiv admin note: substantial text overlap with arXiv:2502.20167

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05154 2026-08-14 cs.CL cs.CV 版本更新 57%

RIG-RoPE: Relation-Stratified Multimodal Attention with Instance-Local Rotary Geometry and Representation-Aware Traversal Coordinates

RIG-RoPE:具有时长感知时间坐标的关系与实例门控旋转位置编码

Donggen Li

机构 * Sichuan University(四川大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 本研究针对多模态场景中静态多维位置分配的局限,提出RIG-RoPE机制,通过关系与实例门控及时长感知时间坐标优化位置编码,未增加可学习参数,确立了相关公式与验证路径。

Comments 24 pages, 2 figures. Major theoretical revision: reformulated cross-instance geometry, null-relation analysis, relation-stratified normalization, and representation-aware traversal coordinates; expanded related work and implementation details. Preliminary technical report; empirical validation is left to future work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07303 2026-08-13 cs.LG 版本更新 57%

Bootstrap Theory of Representational Emergence: Explanatory Insufficiency as a Driver of Representation Learning and World Models

表征涌现的自举理论:解释不充分性作为表征学习与世界模型的驱动力

Jacques Raynal, Pierre Slangen, Elsa Raynal, Jacques Margerit

机构 * Laboratory of Bioengineering and Nanosciences (LBN), University of Montpellier(生物工程与纳米科学实验室(LBN),蒙彼利埃大学) EuroMov Digital Health in Motion, University of Montpellier, IMT Mines Alès(EuroMov数字健康运动,蒙彼利埃大学,IMT矿山阿尔勒) Certified Sophrologist, Sensorimotor Practice, Montpellier, France(认证Sophrologist,运动觉实践,蒙彼利埃,法国) Emeritus Professor, University of Montpellier(荣誉教授,蒙彼利埃大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 提出表征涌现自举理论(TBER),将解释不充分性视为新表征涌现的积极信号,通过五阶段递归过程驱动表征创新,应用于表征学习、世界模型和科学发现。

Comments 27 pages, 25 references, no figures or tables. Conceptual framework on representational emergence and explanatory insufficiency, with implications for representation learning, world models, autonomous AI, and scientific discovery

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29055 2026-08-13 cs.AI cs.MA 版本更新 57%

Hallucination Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

基于智能体AI、嵌套学习与语义缓存的幻觉缓解与AI可持续性

Diego Gosmar, Deborah A. Dahl

机构 * Head of AI, Tesisquare Member, Open Voice Interoperability Initiative Linux Foundation AI & Data(AI负责人,Tesisquare成员,开放语音互操作性倡议Linux基金会AI与数据) Principal, Conversational Technologies Member, Open Voice Interoperability Initiative Linux Foundation AI & Data(首席科学家,对话技术成员,开放语音互操作性倡议Linux基金会AI与数据)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);分类 cs.AI

AI总结 提出一种HOPE启发的嵌套学习架构,结合连续记忆系统和语义缓存,通过三阶段智能体管道在混合基准上实现幻觉缓解,同时降低能耗并提高可观测性。

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00421 2026-08-11 cs.AI 版本更新 57%

Self-Routing: Parameter-Free Expert Routing from Hidden States

自路由:从隐藏状态中无参数的专家路由

Jama Hussein Mohamud, Drew Wagner, Mirco Ravanelli

机构 * Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所) Universite de Montreal(蒙特利尔大学) Concordia University(康考迪亚大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文提出自路由机制,通过直接利用隐藏状态子空间作为专家logits,无需额外路由参数,实现更平衡的专家利用。在GPT-2语言模型和ImageNet-1K分类任务中,自路由在性能上与传统路由方法相当,且提升专家利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10168 2026-08-11 cs.CV cs.AI cs.RO 版本更新 57%

RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation

RAG-3DSG: 通过重拍引导的检索增强生成增强3D场景图

Yue Chang, Rufeng Chen, Zhaofan Zhang, Yi Chen, Yifan Tian, Sihong Xie

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 RAG-3DSG通过重拍引导的不确定性估计缓解3D场景图中的语义不一致问题,利用对象级检索增强生成方法提升机器人任务中的场景表示可靠性。

Comments Accepted by ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21607 2026-08-10 cs.AI 版本更新 57%

INTRYGUE: Induction-Aware Entropy Gating for Reliable RAG Uncertainty Estimation

INTRYGUE:面向可靠RAG不确定性估计的诱导感知熵门控

Alexandra Bazarova, Andrei Volodichev, Daria Kotova, Alexey Zaytsev

机构 * Applied AI Institute(应用人工智能研究所)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出INTRYGUE方法,通过诱导头激活模式门控预测熵,解决RAG中熵基不确定性估计的机械悖论问题,提升hallucination检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03855 2026-08-07 cs.LG 版本更新 57%

Bi-semantic Chemical Embedder for Joint Representation Learning of SMILES and Natural Language

用于SMILES与自然语言联合表示学习的双语义化学嵌入器

David Ming Segura, Jeremy Goumaz, Joshua W. Sin, Bojana Ranković, Philippe Schwaller

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 该研究提出双语义化学嵌入模型CheMatE,通过两阶段训练将SMILES与自然语言联合表示,在分子性质预测等下游任务上表现具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27237 2026-08-07 cs.CL 版本更新 57%

LMs as Task-Specific Knowledge Bases: An Interpretability Analysis

语言模型作为任务特定知识库:一种可解释性分析

Amit Elhelo, Amir Globerson, Mor Geva

机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(特拉维夫大学布拉瓦特尼克计算机科学与人工智能学院) Google Research(谷歌研究院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 通过行为和机制分析,发现语言模型以任务特定方式编码知识,不同任务对同一事实的查询结果不一致,且参数定位实验揭示了不同任务涉及不同参数子集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09764 2026-08-06 cs.LG 版本更新 57%

Prototype-based Self-Supervised Multimodal Learning for PPG and Accelerometry Signals

基于原型的PPG与加速度计信号自监督多模态学习

Wanting Mao, Maxwell A Xu, Harish Haresamudram, Mithun Saha, Santosh Kumar, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Memphis(密苏里大学孟菲斯分校)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 针对PPG与加速度计等生物信号的多模态学习局限,提出基于原型的SSL框架ProtoMM,开发Pulse-Motion基础模型,性能优于现有对比式及多模态SSL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17447 2026-08-05 stat.ME cs.CL math.ST stat.ML stat.TH 版本更新 57%

Calibrating Semantic Uncertainty from Observable Language-Model Probabilities

从可观察的语言模型概率校准语义不确定性

Matthew F. Dixon

机构 * Artificial Intelligence Finance Institute (AIFI)(人工智能金融研究所) Quiota LLC(Quiota公司)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 研究如何从语言模型概率校准语义不确定性,引入语义映射方法,经测试该方法在处理专业市场文本和模拟时,语言衍生概率表现良好,能恢复后验且稳定,语义映射将问题转化为可测试统计问题并产生可审计后验估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13352 2026-08-04 cs.LG 版本更新 57%

GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding

GeoFlowVLM: 基于几何的联合不确定性用于冻结视觉-语言嵌入

Mayank Nautiyal, Li Ju, Andreas Hellander, Ekta Vats, Prashant Singh

机构 * Department of Information Technology, Uppsala University(乌普萨拉大学信息科技系) SciLifeLab, Uppsala University(乌普萨拉大学SciLifeLab)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 GeoFlowVLM通过流匹配学习双编码VLM嵌入的联合分布,解决视觉-语言模型中缺乏联合不确定性的问题,提出条件检索熵和边际典型性得分以量化不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05131 2026-08-03 cs.CV cs.AI cs.RO 版本更新 57%

AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance

AREA3D: 带有统一前馈3D感知和视觉-语言引导的主动重建代理

Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister

机构 * Southern University of Science and Technology(南方科技大学) Harvard University(哈佛大学) California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 AREA3D通过统一前馈3D感知与视觉-语言引导,实现高效主动3D重建,尤其在稀疏视角下提升重建精度。

Journal ref Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister. The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06128 2026-07-28 cs.CL 版本更新 57%

Parallel Tokenizers: Rethinking Encoder Models' Vocabulary Design in Cross-Lingual Transfer of Low-Resource Languages

并行分词器:重新思考低资源语言跨语言转移中编码器模型的词汇设计

Muhammad Dehan Al Kautsar, Fajri Koto

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 针对低资源语言跨语言转移中因词汇映射问题限制表示学习的情况,提出并行分词器框架,先单语训练再对齐词汇表,实验表明该方法训练的模型在多任务中优于传统基线,对推进多语言表示学习意义重大。

Comments 17 pages, 25 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01145 2026-07-24 cs.LG eess.SP 版本更新 57%

Hierarchical Self-Supervised Representation Learning Framework for Multivariate Time Series Grounded in ECG Analysis

一种用于多变量时间序列的轻量级自监督学习框架:基于层次JEPA的心电图数据方法

Siwon Kim

机构 * Research Institute of Basic Sciences, Seoul National University(首尔大学基础科学研究院)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 提出ER-JEPA,一种轻量级自监督学习框架,通过层次化联合嵌入预测架构对多变量时间序列进行表征学习,在心电图数据上实现高效预训练和下游任务最优性能。

Comments 29 pages, 8 figures. Further clarified, added the new downstream task in the abstract and intro since last update.<< Polished text, improved formatting, fixed speed benchmark result, and added new downstream task. Code will be made publicly available soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13597 2026-07-21 cs.RO cs.AI cs.CV 版本更新 57%

Semantic Anchoring for Robotic Action Representations

用于机器人动作表示的语义锚定

Yuan Xu, Youheng Shi, Chengyang Li, Wentao Zhu, Yizhou Wang

机构 * Peking University(北京大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究VLA模型微调后动作表示结构受损问题,受镜像神经元理论启发,通过系统探测证实结构变化与任务表现相关。提出即插即用方法,将动作表示锚定到语义流形并分解通道,经多基准测试验证,有效提升了模型在真实世界任务中的表现。

Comments Project Page: https://xy02-05.github.io/SemanticMN

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04419 2026-07-20 cs.AI 版本更新 57%

Agent Step Value: Auditing Evaluator-Channel Reversals in Black-Box Agent Traces

智能体步骤值:使用基于状态的语言模型评估器进行状态转换测量

Andrew Zhang, Chengzhan Li

机构 * KTH Royal Institute of Technology(皇家理工学院) University of Electronic Science and Technology of China(电子科技大学)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI

AI总结 研究提出智能体步骤值(ASV)框架,通过状态转换测量评估智能体动作,能定位最终答案分数等遗漏的关键信息,还介绍了具体方法及工具,并用实验验证其有效性。

Comments adds source-contract intervention and two-wave retry study; re-acquires cube and extends bridge cohort to n=98 to 100

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12752 2026-07-16 cs.CV cs.AI 版本更新 57%

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

Hallo4D:用于一致时空生成的多模态幻觉缓解

Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He

机构 * Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Shanghaitech University(上海科技大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究针对3D和4D内容生成中的时空幻觉问题,提出Hallo4D框架,利用多模态语言模型,通过生成-检测-校正范式及多种技术提升一致性,实验证明其在多样生成设置下优于基线,提供了可扩展通用的一致性感知内容生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12474 2026-07-16 cs.AI 版本更新 57%

From Observation to Insight: Mechanistic World Models and the Quest for Autonomous Discovery

从观察到洞察:机制世界模型与自主发现探索

Ingmar Posner, Anson Lei, Bernhard Schölkopf

机构 * MPI for Intelligent Systems & ELLIS Institute(马克斯·普朗克智能系统研究所及埃利斯研究所)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 本文探讨科学发现问题,提出机制世界模型这一新设计范式,将可重复使用机制置于核心,推导其计算能力、设计原则等,指出虽有不同研究方向捕捉该范式要素但缺统一框架,为推动AI走向自主科学发现提供基础和蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05686 2026-07-15 cs.AI 版本更新 57%

Attractor Geometry of Transformer Memory: From Conflict Arbitration to Confident Hallucination

Transformer记忆的吸引子几何:从冲突仲裁到自信 hallucination

Qiyao Liang, Risto Miikkulainen, Ila Fiete

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Texas Austin(德克萨斯大学奥斯汀分校) Cognizant(Cognizant公司)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究Transformer记忆中冲突与hallucination的几何机制,揭示吸引子基底在隐藏状态空间中的作用,通过合成任务验证几何边界在区分正确回忆与hallucination中的有效性。

Comments Inadvertent premature posting before full approval of all listed co-authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18419 2026-07-08 cs.CV cs.AI 版本更新 57%

Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology

面向几何的不确定性聚类用于病理学中鲁棒的视觉上下文学习

Franciskus Xaverius Erick, Johanna Paula Müller, Bernhard Kainz

机构 * FAU Erlangen-Nürnberg, Erlangen, DE(埃尔兰根-纽伦堡大学) Department of Computing, Imperial College London, London, UK(伦敦帝国理工学院计算机系)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文提出GAUC,一种无需训练的聚类选择方法,直接在预训练的多模态嵌入空间中操作,通过优化三个目标提升视觉上下文学习的鲁棒性、准确性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03750 2026-07-07 cs.LG cs.CE cs.CV eess.IV 版本更新 57%

GlaBoost: A Multimodal Structured Framework for Glaucoma Risk Stratification

GlaBoost:用于青光眼风险分层的多模态结构化框架

Cheng Huang, Zeyu Han, Weizheng Xie, Karanjit Kooner, Tsengdar Lee, Jui-Kai Wang, Jia Zhang

机构 * Department of Computer Science, Southern Methodist University(计算机科学系,南方 Methodist 大学) Department of Ophthalmology, UT Southwestern Medical Center(眼科学系,UT 南方医学中心) High Performance Computing Program, National Aeronautics and Space Administration(高性能计算计划,国家航空航天局)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 研究针对青光眼检测,提出多模态梯度提升框架GlaBoost,统一眼底图像嵌入、文本评估及生物标志物三信号预测风险,融合后用增强XGBoost分类,性能超基线且可解释。

Comments Accepted by IEEE 48th EMBC (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23164 2026-07-02 cs.LG 版本更新 57%

MetaOthello: A Controlled Study of Multiple World Models in Transformers

MetaOthello: Transformer中多个世界模型的控制研究

Aviral Chawla, Galen Hall, Juniper Lovato

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 通过引入共享语法但规则或分词不同的Othello变体套件,训练小型GPT处理混合数据,发现Transformer不划分容量为孤立子模型,而是收敛于跨变体因果转移的共享棋盘状态表示。

Comments Camera-ready version. Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18714 2026-06-26 cs.CV cs.AI 版本更新 57%

Semantic Generative Tuning for Unified Multimodal Models

语义生成微调用于统一多模态模型

Songsong Yu, Yuxin Chen, Ying Shan, Yanwei Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent ARCLab(腾讯ARCLab)

专题命中 知识编辑与模型理解 :post-training(abstract);分类 cs.AI

AI总结 本文提出语义生成微调(SGT)方法,通过将高阶语义任务作为生成代理,统一多模态模型的感知与生成能力,提升多模态理解和生成质量。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21911 2026-06-23 cs.CV cs.LG eess.IV 版本更新 57%

A Latent Representation Learning Framework for Hyperspectral Image Emulation in Remote Sensing

遥感高光谱图像模拟的潜在表示学习框架

Chedly Ben Azizi, Claire Guilloteau, Gilles Roussel, Matthieu Puigt

机构 * univ-littoral(里弗拉尔大学)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 提出基于潜在表示的高光谱模拟框架,支持光谱级和空间-光谱级模拟,通过变分自编码器与参数映射两步策略,在PROSAIL模拟数据和Sentinel-3 OLCI图像上优于传统回归方法,并保持下游参数反演性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03531 2026-06-23 cs.LG cs.CV 版本更新 57%

Robust Representation Learning in Masked Autoencoders

掩码自编码器中的鲁棒表示学习

Anika Shrivastava, Renu Rameshan, Samar Agnihotri

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 本文通过分析掩码自编码器(MAE)的表示学习机制,发现其预训练和微调后的表示对模糊、遮挡等退化具有鲁棒性,并通过层间分析和敏感性指标揭示了其类感知子空间和全局注意力机制。

Comments To appear in ICPR 2026. 10 pages, 5 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03448 2026-06-23 cs.CV cs.AI 版本更新 57%

Hierarchical Concept-to-Appearance Guidance for Multi-Subject Image Generation

多主体图像生成的层次化概念到外观引导

Yijia Xu, Zihao Wang, Haokun Gui, Jinshi Cui

机构 * Peking University(北京大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 提出层次化概念到外观引导框架(CAG),通过VAE dropout训练和对应感知掩码注意力模块,实现多主体图像生成中身份一致性和精确组合控制。

详情

展开后加载摘要…

URL PDF HTML 收藏