arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-03 至 2026-04-03 共收录 227 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 23 篇

2601.02031 2026-04-03 cs.LG cs.AI cs.CL 90%

Output Embedding Centering for Stable LLM Pretraining

输出嵌入中心化用于稳定大语言模型预训练

Felix Stollenwerk, Anna Lokrantz, Niclas Hertzberg

机构 * AI Sweden

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出输出嵌入中心化(OEC)方法,通过分析输出嵌入几何特性,解决预训练中的输出logit发散问题,提升训练稳定性。

Comments Additional experiments using logit soft-capping & weight tying

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29966 2026-04-03 cs.CV 89%

Scaling Video Pretraining for Surgical Foundation Models

为手术基础模型扩展视频预训练

Sicheng Lu, Zikai Xiao, Jianhui Wei, Danyu Sun, Qi Lu, Keli Hu, Yang Feng, Jian Wu, Zongxin Yang, Zuozhu Liu

机构 * The Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟分校联合学院) Zhejiang Lab(之江实验室) Shaoxing University(绍兴大学) Angelalign(时代天使) Harvard Medical School(哈佛医学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);language model(abstract)

AI总结 本文提出SurgRec,通过大规模数据和统一预训练流程提升手术视频理解能力,对比SSL基线和视觉语言模型,展示SurgRec在多个下游任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00911 2026-04-03 cs.SE 85%

Foundation Models for Autonomous Driving System: An Initial Roadmap

自动驾驶系统中的基础模型:初步路线图

Xiongfei Wu, Mingfei Cheng, Xiaoning Ren, Qiang Hu, Jianlang Chen, Yuheng Huang, Maxime Cordy, Yao Zhang, Xiaofei Xie, Lei Ma, Yves Le Traon

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了基础模型在自动驾驶系统中的应用,分析了在基础设施、车载集成和实际部署三个维度中的现状、挑战和研究方向,旨在为构建安全可靠的自动驾驶系统提供指导。

Comments To appear in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01247 2026-04-03 cs.SD eess.AS 82%

Combining Masked Language Modeling and Cross-Modal Contrastive Learning for Prosody-Aware TTS

结合掩码语言建模与跨模态对比学习的语调感知语音合成

Kirill Borodin, Vasiliy Kudryavtsev, Maxim Maslov, Nikita Vasiliev, Mikhail Gorodnichev, Grach Mkrtchian

机构 * MTUCI(莫斯科电信与信息技术大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)

AI总结 本文研究了基于扩散模型的语音合成中多阶段预训练对语调建模的影响,通过掩码语言建模与混合音素对比学习相结合,提升了生成质量与感知指标。

Comments This paper has been submitted to Interspeech 2026 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10611 2026-04-03 cs.CV cs.AI 79%

Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding

Molmo2:具有视频理解和 grounding 的开放权重和数据的视觉语言模型

Christopher Clark, Jieyu Zhang, Zixian Ma, Jae Sung Park, Mohammadreza Salehi, Rohun Tripathi, Sangho Lee, Zhongzheng Ren, Chris Dongjoo Kim, Yinuo Yang, Vincent Shao, Yue Yang, Weikai Huang, Ziqi Gao, Taira Anderson, Jianrui Zhang, Jitesh Jain, George Stoica, Winson Han, Ali Farhadi, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 Molmo2 是一种开放源代码的视频语言模型,通过7个新视频数据集和2个多图像数据集,实现了单图像、多图像和视频任务中的点驱动 grounding 能力,其8B模型在短视频计数和描述任务中表现优异,在视频 grounding 任务中超越了现有开源和专有模型。

Comments Updated first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03485 2026-04-03 cs.LG q-bio.QM 79%

TEDDY: A Family Of Foundation Models For Understanding Single Cell Biology

TEDDY:单细胞生物学理解的模型家族

Alexis Chevalier, Soumya Ghosh, Urvi Awasthi, James Watkins, Julia Bieniewska, Nichita Mitrea, Olga Kotova, Kirill Shkura, Andrew Noble, Michael Steinbaugh, Vijay Sadashivaiah, George Dasoulas, Julien Delile, Christoph Meier, Leonid Zhukov, Iya Khalil, Srayanta Mukherjee, Judith Mueller

机构 * BCG AI Science Institute, Boston, USA(BCG人工智能科学研究所,波士顿,美国) MSD (UK) Limited, London, UK(默沙东(英国)有限公司,伦敦,英国)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出TEDDY模型家族,通过扩大预训练数据和利用大规模生物注释提升单细胞基础模型性能,验证了模型在疾病状态识别和生物学探索中的有效性。

Comments ICML 2025 Generative AI and Biology (GenBio) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15828 2026-04-03 cs.CL cs.SD eess.AS 79%

J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling

J-CHAT:用于 spoken dialogue 语言建模的日本大规模口语对话语料库

Wataru Nakata, Kentaro Seki, Hitomi Yanaka, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari

机构 * The University of Tokyo(东京大学) Keio University(庆应义塾大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文提出 J-CHAT,一个76000小时的日本口语对话语料库,用于改进 spoken dialogue 语言模型,通过自动化方法确保高质量和自然性,推动人机对话研究。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01472 2026-04-03 math.OC cs.AI cs.LG 79%

The Newton-Muon Optimizer

牛顿-穆恩优化器

Zhehang Du, Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出牛顿-穆恩优化器,通过引入替代模型揭示穆恩设计原理并提出新优化方法,通过矩阵-梯度正交化实现闭式更新规则,实验证明其在训练GPT-2时效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02045 2026-04-03 cs.CL cs.AI 73%

BidirLM: From Text to Omnimodal Bidirectional Encoders by Adapting and Composing Causal LLMs

BidirLM:通过适应和组合因果语言模型实现从文本到多模态双向编码

Nicolas Boizard, Théo Deschamps-Berger, Hippolyte Gisserot-Boukhlef, Céline Hudelot, Pierre Colombo

机构 * Diabolocom Artefact Research Center(Artefact 研究中心) MICS, CentraleSupélec, Université Paris-Saclay(MICS,中央理工-高等电力学院,巴黎-萨克雷大学) Cohere

专题命中 预训练与数据 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过系统消融实验发现,通过引入先验掩码阶段和双策略可提升因果语言模型的双向编码性能,最终提出BidirLM家族五种编码器,在文本、视觉和音频表示基准上优于现有方法。

Comments 30 pages, 16 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01411 2026-04-03 cs.LG cs.CL stat.ML 73%

Test-Time Scaling Makes Overtraining Compute-Optimal

测试时扩展使过训练计算最优

Nicholas Roberts, Sungjun Cho, Zhiqi Gao, Tzu-Heng Huang, Albert Wu, Gabriel Orlanski, Avi Trost, Kelly Buchanan, Aws Albarghouthi, Frederic Sala

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Train-to-Test(T²)扩展定律,通过联合优化模型大小、训练token和推理样本数,在固定端到端预算下提升性能,发现考虑推理成本时最优预训练决策进入过训练区域,验证了其在现代部署中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03140 2026-04-03 cs.LG cs.CL 73%

In-context Learning in Presence of Spurious Correlations

在存在虚假相关性时的上下文学习

Hrayr Harutyunyan, Rafayel Darbinyan, Samvel Karapetyan, Hrant Khachatrian

机构 * Google DeepMind(谷歌DeepMind) ServiceTitan YerevaNN Yerevan State University(埃里温国立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了在存在虚假特征时训练上下文学习器的可行性,提出了一种新方法,该方法在分类任务中表现优异,但泛化能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02156 2026-04-03 cs.CL astro-ph.IM cs.IR cs.LG 62%

AstroConcepts: A Large-Scale Multi-Label Classification Corpus for Astrophysics

AstroConcepts: 一个大规模多标签分类语料库用于天文学

Atilla Kaan Alkan, Felix Grezes, Sergi Blanco-Cuaresma, Jennifer Lynn Bartlett, Daniel Chivvis, Anna Kelbert, Kelly Lockhart, Alberto Accomazzi

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AstroConcepts语料库,包含21702篇天文学论文摘要,标注2367个概念,用于研究极端类别不平衡问题,揭示了词汇受限LLM、领域适应和频率分层评估等关键发现。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01195 2026-04-03 cs.CL cs.AI cs.IR 62%

ORBIT: Scalable and Verifiable Data Generation for Search Agents on a Tight Budget

ORBIT:在有限预算下为搜索代理可扩展且可验证的数据生成

Nandan Thakur, Zijian Chen, Xueguang Ma, Jimmy Lin

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ORBIT数据集,通过低成本框架生成20000个需多步推理的查询,用于训练搜索代理,实验表明其在维基百科问答中表现优异。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01936 2026-04-03 cs.CL cs.AI 62%

Reliable News or Propagandist News? A Neurosymbolic Model Using Genre, Topic, and Persuasion Techniques to Improve Robustness in Classification

可靠新闻还是宣传新闻?一种结合体裁、主题和说服技巧的神经符号模型以提升分类鲁棒性

Géraud Faye, Benjamin Icard, Morgane Casanova, Guillaume Gadek, Guillaume Gravier, Wassila Ouerdane, Céline Hudelot, Sylvain Gatepaille, Paul Égré

机构 * Airbus Defence and Space, France(空中客车防务与航天公司,法国) Université Paris-Saclay, CentraleSupélec, MICS, France(巴黎-萨克雷大学,中央理工-高等电力学院,MICS,法国) LIP6, Sorbonne Université, CNRS, France(LIP6,索邦大学,法国国家科学研究中心,法国) Université de Rennes, CNRS, Inria, IRISA, France(雷恩大学,法国国家科学研究中心,法国国家信息与自动化研究所,IRISA,法国) IRL Crossing, CNRS, Australia(IRL Crossing,法国国家科学研究中心,澳大利亚)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合非上下文文本嵌入与符号概念特征的神经符号模型,以提高分类鲁棒性,通过实验验证其在识别宣传新闻方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01683 2026-04-03 cs.LG cs.CL 62%

Coupled Query-Key Dynamics for Attention

注意力的耦合查询-键动态

Barak Gahtan, Alex M. Bronstein

机构 * Technion – Israel Institute of Technology(以色列理工学院) ISTA – Institute of Science and Technology Austria(奥地利科学技术研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出耦合QK动态机制,通过共享学习动态改进语言模型 perplexity 和训练稳定性,在WikiText-103上取得显著提升,且在不同数据集上表现出差异性效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02209 2026-04-03 cs.CL 57%

CV-18 NER: Augmented Common Voice for Named Entity Recognition from Arabic Speech

CV-18 NER:增强的常见语音用于阿拉伯语语音的命名实体识别

Youssef Saidi, Haroun Elleuch, Fethi Bougares

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 本文提出CV-18 NER数据集,通过增强阿拉伯语Common Voice 18语料库并添加细粒度Wojood标注,评估了端到端模型和流水线系统在阿拉伯语语音命名实体识别中的性能。

Comments Accepted at OSACT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30031 2026-04-03 cs.AI 57%

Cognitive Friction: A Decision-Theoretic Framework for Bounded Deliberation in Tool-Using Agents

认知摩擦:一种决策理论框架,用于工具使用智能体的有限推理

Davide Di Gioia

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI

AI总结 本文提出Triadic Cognitive Architecture框架,通过认知摩擦建模决策过程,提升资源利用效率和行动速度,实验显示在EMDG和NSTG环境中优于贪心基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01961 2026-04-03 cs.LG 57%

Generalization Bounds and Statistical Guarantees for Multi-Task and Multiple Operator Learning with MNO Networks

多任务和多重操作学习的泛化界限与统计保证:MNO网络

Adrien Weihs, Hayden Schaeffer

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 本文研究了MNO网络在多任务和多重操作学习中的泛化界限,通过覆盖数分析得出了可分离模型的显式度量-熵界,并结合MNO的近似保证,获得了新三元组上的测试误差的显式近似-估计权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11147 2026-04-03 cs.MM cs.CV cs.LG 57%

Catalogue Grounded Multimodal Attribution for Museum Video under Resource and Regulatory Constraints

博物馆视频下的资源与监管约束下的目录引导多模态归因

Minsak Nanang, Adrian Hilton, Armin Mustafa

机构 * University of Surrey(萨里大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本文提出一种目录引导的多模态归因方法,用于博物馆视频内容的自动化元数据生成,以提高档案馆发现性并满足资源和监管要求。

Comments Demo video url: https://jn00767.pages.surrey.ac.uk/catalogue-grounded-multimodal-attribution-for-museum-video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17641 2026-04-03 cs.LG eess.SP 57%

RPNT: Robust Pre-trained Neural Transformer -- A Pathway for Generalized Motor Decoding

RPNT:鲁棒预训练神经变换器——通用运动解码的路径

Hao Fang, Ryan A. Canfield, Tomohiro Ouchi, Beatrice Macagno, Eli Shlizerman, Amy L. Orsborn

机构 * University of Washington(华盛顿大学) Washington National Primate Research Center(华盛顿国家灵长类研究中心)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出RPNT模型,通过预训练实现鲁棒泛化,提升多任务、多主体和多会话的运动解码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02278 2026-04-03 cs.SE 50%

LLMs as Idiomatic Decompilers: Recovering High-Level Code from x86-64 Assembly for Dart

LLMs作为idiomatic反编译器:从x86-64汇编语言恢复Dart的高级代码

Raafat Abualazm, Ayman Abo Elhassan

专题命中 预训练与数据 :LLM(abstract)

AI总结 本文研究了小型专用LLM作为idiomatic反编译器在Dart等现代语言中的应用,通过合成同语言示例和相关语言示例的对比,展示了专用模型在生成可读且符合 idiomatic 的Dart代码方面的有效性。

Comments 5 pages, 1 figure, 3 tables. Accepted at SANER 2026 ERA Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01821 2026-04-03 cs.CY 50%

Training-Free Private Synthesis with Validation: A New Frontier for Practical Educational Data Sharing

无需训练的隐私合成与验证:面向实际教育数据共享的新前沿

Hibiki Ito, Chia-Yu Hsu, Hiroaki Ogata

专题命中 预训练与数据 :LLM(abstract)

AI总结 本文提出一种无需训练的LLM基于差分隐私合成数据生成方法,并引入按需真实数据验证,以解决教育领域数据共享中的隐私和实用性问题。

Comments 14 page, 8 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01498 2026-04-03 cs.MM 50%

Semantic Compensation via Adversarial Removal for Robust Zero-Shot ECG Diagnosis

通过对抗性移除实现语义补偿的鲁棒零样本ECG诊断

Hongjun Liu, Rujun Han, Leyu Zhou, Chao Yao

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出SCAR框架,通过对抗性移除提升ECG与语言预训练的鲁棒性,解决部分缺失情况下语义对齐问题,并引入CMRS评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 18 篇

2604.01762 2026-04-03 cs.LG cs.AI cs.CL cs.DC 90%

FourierMoE: Fourier Mixture-of-Experts Adaptation of Large Language Models

FourierMoE:大型语言模型的傅里叶混合专家适应

Juyong Jiang, Fan Wang, Hong Qi, Sunghun Kim, Jing Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出傅里叶MoE,通过频域分析提升大语言模型在多任务适应中的性能,采用频域适应方法减少参数开销,实验证明其在单任务和多任务场景中均优于基线方法。

Comments The first two authors contributed equally to this work; listing order is random

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02194 2026-04-03 cs.CL cs.AI 90%

Neuro-RIT: Neuron-Guided Instruction Tuning for Robust Retrieval-Augmented Language Model

Neuro-RIT: 用于鲁棒检索增强语言模型的神经引导指令微调

Jaemin Kim, Jae O Lee, Sumyeong Ahn, Seo Yeon Park

机构 * Hanyang University(汉阳大学)

专题命中 指令微调 :language model(title,abstract);instruction tuning(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 Neuro-RIT通过神经层面的对齐提升检索增强语言模型的鲁棒性,通过神经属性挖掘分离相关与无关上下文的神经元,并采用两阶段指令微调策略增强噪声鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14285 2026-04-03 cs.LG cs.AI stat.ML 88%

Meta-Learning at Scale for Large Language Models via Low-Rank Amortized Bayesian Meta-Learning

通过低秩放大贝叶斯元学习实现大规模语言模型的规模化元学习

Liyi Zhang, Jake Snell, Thomas L. Griffiths

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ABMLL方法,通过低秩放大贝叶斯元学习实现大规模语言模型对多分布的适应,提升跨数据集泛化能力,并在CrossFit和Unified-QA数据集上优于现有方法。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01379 2026-04-03 cs.SI cs.AI 85%

Can LLMs Predict Academic Collaboration? Topology Heuristics vs. LLM-Based Link Prediction on Real Co-authorship Networks

大语言模型能预测学术合作吗?拓扑启发式方法与基于LLM的链接预测在真实合著网络中的比较

Fan Huang, Munjung Kim

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了大语言模型能否通过作者资料预测未来学术合作,发现LLM与拓扑启发式方法捕捉不同信号,在互补场景中表现最佳,且在不平衡数据中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13651 2026-04-03 cs.CL cs.AI cs.IR 85%

Benchmarking Large Language Models on Reference Extraction and Parsing in the Social Sciences and Humanities

在社会科学和人文领域上对大型语言模型进行参考提取与解析的基准测试

Yurui Zhu, Giovanni Colavizza, Matteo Romanello

机构 * Odoma LLC

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出一个统一基准,针对社会科学和人文领域的真实条件,评估参考提取、参考解析和端到端文档解析任务,发现解析和端到端解析是主要瓶颈,LoRA微调和分段管道能提升鲁棒性。

Comments 12 pages, 2 figures. Accepted at the SCOLIA 2026 Workshop (Second Workshop on Scholarly Information Access), co-located with ECIR 2026. Workshop date: April 2, 2026

Journal ref Proceedings of the Second International Workshop on Scholarly Information Access (SCOLIA 2026), co-located with ECIR 2026, Delft, The Netherlands, April 2, 2026. CEUR Workshop Proceedings, Vol. 4187, pp. 16-30

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01787 2026-04-03 cs.CL 81%

DEFT: Distribution-guided Efficient Fine-Tuning for Human Alignment

DEFT:基于分布的高效微调以实现人类对齐

Liang Zhu, Feiteng Fang, Yuelin Bai, Longze Chen, Zhexiang Zhang, Minghuan Tan, Min Yang

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Science and Technology of China(中国科学技术大学) University of Copenhagen(哥本哈根大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

AI总结 本文提出DEFT框架,通过数据过滤和分布引导提升模型对齐效率与泛化能力,减少训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02009 2026-04-03 cs.CV 78%

Test-Time Adaptation for Height Completion via Self-Supervised ViT Features and Monocular Foundation Models

通过自监督ViT特征和单目基础模型实现高度补全的测试时适应

Osher Rafaeli, Tal Svoray, Ariel Nahlieli

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出Prior2DSM方法,利用自监督ViT特征和单目深度基础模型,在测试时完成高度补全,通过语义特征空间对应传播度量信息,提升重建精度并减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏