arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-12 至 2026-08-12 共收录 203 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 20 篇

2608.10715 2026-08-12 cs.CL cs.AI cs.CY cs.DL cs.SI 新提交 90%

Most biomedical publications show signs of LLM-assisted writing

大多数生物医学出版物显示出大语言模型(LLM)辅助写作的迹象

Lena Holzwarth, Rita González-Márquez, Dmitry Kobak

机构 * Hertie Institute for AI in Brain Health, University of Tübingen(蒂宾根大学赫蒂脑健康人工智能研究所) Ghent University(根特大学) VIB(弗拉芒生物技术研究院)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究提出基于词频变化的无偏方法估计文本语料库中LLM使用情况,发现到2025年底89%的生物医学论文存在LLM相关词汇过量,讨论部分LLM使用率是方法部分的两倍,相关估计对制定指南政策至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11044 2026-08-12 cs.CL 新提交 90%

TEAMMix: Taxonomy Enrichment Augmentation and Minority-augmented Mixing Strategy for LLM-enhanced Weak-Supervised Hierarchical Text Classification

TEAMMix:用于大语言模型增强弱监督分层文本分类的类别体系丰富增强与少数类增强混合策略

Jian Zhang, Zhuohao Yang, Songlin Lei, Bangli Liu, Ziwei Wang, Xufeng Weng, Gehan Amaratunga, Yu Lin, Hongwei Wang

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC研究院) Shaoxing K3i Technology Co. Ltd(绍兴K3i科技有限公司) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM应用于分层文本分类的局限,本文提出TEAMMix框架,通过丰富标签层次、生成伪样本并优化其质量,提升了细粒度及不平衡数据集上的分类性能。

Comments Accepted by IEEE CSCWD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10690 2026-08-12 cs.CL 新提交 89%

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

已发布的大语言模型词汇表能否支持隐藏语料库的词元级估计?

Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

专题命中 预训练与数据 :LLM(title,summary_cn);pretraining(abstract);分类 cs.CL

AI总结 该研究针对隐藏语料库的词元级估计问题,提出分位数引导密度估计(QGDE)方法,利用已发布的LLM分词器词汇表实现了低误差的细粒度语料估计,为相关任务提供了新的有效信号来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10214 2026-08-12 cs.AI 新提交 88%

Decodable But Not Detachable: Training Data Granularity Determines Parametric Modularity in Large Language Models

可解码但不可分离:训练数据粒度决定大语言模型的参数模块化

Marcus Armstrong, Navid Ayoobi, Arjun Mukherjee

机构 * University of Houston(休斯顿大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究探讨大语言模型是否存在特定领域参数壳,通过多模型、多领域实验发现训练数据的标记级模块化是参数壳形成的关键,为大语言模型的参数模块化研究提供了核心结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10239 2026-08-12 cs.AI 新提交 86%

Beyond Detection: Evaluating Defensive LLMs Against AI-Generated Social Engineering in Live Turn-by-Turn Interaction

超越检测:评估防御型大语言模型(LLM)在实时逐轮交互中对抗AI生成社会工程攻击的能力

Yuqiao Xu, Osama Zafar, Alexander Nemecek, Erman Ayday

专题命中 预训练与数据 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本研究构建含300例的在线住房语料库,评估5种防御型LLM在实时逐轮与静态设置下对抗AI社会工程攻击的能力,发现防御效果差异大,需单独测量干预等指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11167 2026-08-12 cs.CV cs.CL cs.LG 新提交 85%

MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

多模态代码切换:将视觉对象交织入语言以实现显式对象级对齐

Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu Dai

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 针对现有多模态大语言模型的图像级对齐存在指称歧义的问题,提出多模态代码切换(MMCS)范式,构建含77.3万样本的数据集,仅用5万样本即可匹配或超越60万图像-文本对训练的模型,提升了视觉基础与感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10595 2026-08-12 q-bio.BM cs.AI 新提交 83%

DegradeQuery: Counterfactual Tuple Pretraining for Context-Aware PROTAC Degradation Prediction

DegradeQuery:面向上下文感知PROTAC降解预测的反事实元组预训练

Dong Xu, Zhangfan Yang, Jiantao Wu, Zexuan Zhu, Jianqiang Li, Junkai Ji

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 DegradeQuery是一种上下文感知PROTAC降解预测框架,通过反事实元组预训练利用标签缺失的PROTAC记录,在PROTAC-8K基准上AUC达0.9065、准确率0.8500,性能优于对比方法。

Comments 19 pages, 2 figures, with supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10154 2026-08-12 cs.CL cs.AI 新提交 82%

Multimodal Item Parameter Estimation using Simulated Response Probabilitie

基于模拟响应概率的多模态题目参数估计

Christopher Ormerod, YoungKoung Kim

机构 * College Board(大学理事会)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究基于Qwen3.5微调多模态大语言模型,利用含图像与文本的多项选择题训练语料,通过学习学生能力相关的选择概率,实现了题目参数的准确估计。

Comments Submitted and Accepted for AIME-Con 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10109 2026-08-12 cs.CL 新提交 81%

PERCEPT: A Corpus for POS Tagging and Analysis of Persian-English Code-Mixing

PERCEPT:用于波斯语-英语代码混合的词性标注与分析语料库

Ghazal Kalhor, Zahra Jafari, Amirarsalan Shahbazi, Behnam Bahrak

机构 * School of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰大学工程学院电气与计算机工程学院) School of Engineering Science, College of Engineering, University of Tehran(德黑兰大学工程学院工程科学学院) Tehran Institute for Advanced Studies, Khatam University(哈塔米大学德黑兰高级研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文推出首个含通用依存关系词性标注的公开波斯语-英语代码混合语料库PERCEPT,结合LLM辅助标注框架完成6800条社交媒体帖子标注,通过分析揭示代码混合词的词性、位置分布规律,为相关NLP研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10046 2026-08-12 cs.LG cs.CY 新提交 81%

Detecting Soft Skills in ML Engineering Roles CVs

检测机器学习工程岗位简历中的软技能

Aidin Azamnouri, Nouran Ayad, Justus Bogner, Stefan Wagner

机构 * Technical University of Munich(慕尼黑工业大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本研究构建含300份简历的平衡语料库,用LLM流水线提取软技能并检验13项假设,发现候选人多以叙事披露软技能,资历影响领导力表述率,关键词筛选会遗漏软技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09936 2026-08-12 cs.CL 新提交 81%

Conflict or Strategy? Asymmetric Role Framing of La France insoumise and Rassemblement National in French News Headlines, 2022-2025

冲突还是策略?2022-2025年法国新闻头条中对不屈法国(La France insoumise,LFI)和国民联盟(Rassemblement National,RN)的不对称角色框架

Amr Sobhy

机构 * Le French News Lab(法国新闻实验室)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究分析2022-2025年法国25家媒体28592条头条,发现新闻对LFI和RN的角色框架不对称,建立分层可靠性框架校准LLM政治文本标注流水线。

Comments 19 pages, 3 figures, includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10295 2026-08-12 cs.CV cs.AI 新提交 79%

Frozen Brain-MRI Foundation Models Are Site Fingerprints

冻结的脑MRI基础模型是站点指纹

Saman Rahbar

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.AI

AI总结 该研究发现冻结脑MRI基础模型的嵌入包含采集站点的指纹,该指纹可线性解码且与预训练无关,可通过特定方法移除,同时指出其对共享嵌入的影响及密集分割的代价,并发布了审计工具包。

Comments 15 pages, 5 figures, 7 tables. Code: https://github.com/saman-rahbar/scanner-fingerprints

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10327 2026-08-12 cs.AI 新提交 77%

Toward a Theory of Value in AI Alignment

迈向AI对齐中的价值理论

Andrew Smart, Shazeda Ahmed, Jackie Kay, Jimmy Tobin, Kris Shrishak, Abeba Birhane

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本研究通过标注94篇AI价值对齐论文,发现多数未明确定义人类价值,转而依赖偏好,且采用合成数据等自动方法可能关闭价值践行路径,旨在明确该领域哲学承诺以丰富相关辩论。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10605 2026-08-12 cs.LG cs.AI 新提交 73%

Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts

计算最优并非集群最优:面向稀疏混合专家模型的系统感知缩放

Soumajyoti Sarkar, Yuxin Tang, Sheng Zha

机构 * Amazon AGI Foundations(亚马逊AGI基础研究部门)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发MOSAIC框架,将稀疏MoE模型的架构与系统协同设计建模为优化问题,发现计算最优与集群最优稀疏性存在差异,主张统一架构与系统协同设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11142 2026-08-12 cs.CV 新提交 67%

SAR2Agri: Learning SAR Intensity Representations for Agricultural Monitoring

SAR2Agri:学习SAR强度表征用于农业监测

Moti Rattan Gupta, Anupam Sobti

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本研究提出首个仅用SAR强度影像的自监督学习流水线,通过改进时间预文本任务提升物候特征捕捉能力,在SICKLE基准上的作物类型制图任务中,其IoU较光学基线和现有SAR基线均有显著提升,验证了SAR强度编码器预训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10484 2026-08-12 cs.RO cs.AI cs.CL 新提交 62%

Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models

在重建中迷失:将视觉-语言-动作模型中的动作表示与语言对齐

Li Wenjie, Yash Jangir, Ignacy Stepka, Yash Agarwal, Marion Kipsang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对视觉-语言-动作模型中动作表示与语言脱节的问题,提出SALT语义对齐动作标记器,在SimplerEnv中使策略平均成功率达71.9%,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11025 2026-08-12 cs.CL 新提交 57%

Data Attribution of Emergent Misalignment with Persona Features

基于角色特征的涌现失配数据归因

Clemens Vetter, David Kaczér, Lucie Flek, Florian Mai

机构 * Bonn-Aachen International Center for Information Technology, University of Bonn(波恩-亚琛信息技术中心,波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 本研究基于SAE分析揭示EM源于角色特征,操控特征可双向控制EM,发现人类文本无法可靠诱导EM而合成指令响应对可以,明确响应结构或模型措辞的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10359 2026-08-12 cs.SD cs.CL 新提交 57%

VoxSumm: A Multilingual Corpus of Long-Form Spoken News for Joint Summarization and Translation

VoxSumm:用于联合摘要与翻译的多语言长篇口语新闻语料库

Yejin Jeon, Marie Maltais, Virginia Ceccatelli, Min Ma, David Ifeoluwa Adelani

机构 * Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) Google DeepMind(谷歌DeepMind) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席项目)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 本研究针对长文档摘要与多语言语音翻译的研究缺口,提出联合语音摘要与翻译任务,构建首个多语言跨语言基准VoxSumm,并评估相关模型表现,为多语言语音处理系统提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09995 2026-08-12 eess.IV cs.CV 新提交 50%

Structural Guidance for Unified Joint Demosaicing and Denoising

用于统一联合去马赛克与去噪的结构引导

Qixin Zheng, Ping Chen, Qiangqiang Shen, Haijin Zeng

专题命中 预训练与数据 :pretraining(abstract)

AI总结 该研究提出含SwinIR恢复分支、结构推理分支与轻量适配器的结构引导统一恢复框架,在多CFA模式和噪声水平实验中较现有方法实现一致性能提升,增强了相机图像恢复的鲁棒性。

Comments 19 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10769 2026-08-12 math.DG math.OC 新提交 50%

A Framework for Joint Affine and Diffeomorphic Image Registration

联合仿射与微分同胚图像配准的框架

Anton François, Rayane Mouhli, Thomas Pierron

专题命中 预训练与数据 :foundation model(abstract)

AI总结 该研究提出联合仿射-微分同胚图像配准框架,含FA和DA模型,优化策略结合渐进仿射丰富与变分加权,在Dice重叠度上优于CARL等基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 17 篇

2608.10187 2026-08-12 cs.IR cs.SI 新提交 93%

ConnectionMind: Leveraging Social Networks and Large Language Models for Personalized Recommendation at Meta

ConnectionMind:利用社交网络与大语言模型实现 Meta 平台的个性化推荐

Haoyu Han, Yuming Liu, Lei Huang, Lizhu Zhang, Jiliang Tang, Xiangjun Fan

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn)

AI总结 该研究提出 ConnectionMind 框架,结合社交网络与 LLM,经两阶段学习训练后,在 Meta 部署并通过 A/B 测试实现视频观看时长 0.43% 的提升,解决传统推荐模型的多关系上下文整合不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10273 2026-08-12 cs.CL cs.AI 新提交 92%

Locally Deployable Small Language Models for Emergency Department Decision Support: A Systematic Benchmark of Fine-Tuning Strategies

可本地部署的小型语言模型用于急诊科决策支持:微调策略的系统基准测试

Qingfeng Zhang, Yuanxiong Guo, Yanmin Gong

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract_cn);large language model(abstract)

AI总结 该研究针对急诊科决策支持的隐私风险,通过基准测试发现经LoRA微调的开源小型语言模型在分诊和转诊任务上优于商业模型,可本地部署且具备临床竞争力。

Comments Accepted to AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10276 2026-08-12 cs.HC cs.CY 新提交 91%

Fine-Tuning Large Language Models for Codebook-Guided Coding of Students' Mathematics Metaphor Responses

针对学生数学隐喻回答的密码本引导编码任务微调大型语言模型

Liang Zhang, Stephen Hwang, Yue Ma, Jinfa Cai

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本研究通过LoRA微调开放权重LLM,使其在学生数学隐喻的密码本引导编码任务中性能提升,表现媲美甚至超越仅提示的专有模型,可用于数学教育的规模化AI辅助测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10090 2026-08-12 cs.AI cs.LG 新提交 90%

CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation

CHORUS:用于高覆盖率测试平台激励生成的互补专家

Hejia Zhang, Sheng Lu, Zhongming Yu, Chia-Tung Ho, Brucek Khailany, Jishen Zhao

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对芯片设计中高覆盖率测试平台激励生成任务,提出CHORUS后训练框架,整合分阶段SFT与密集奖励RL得到的互补专家,构建4B模型,在CVDP-ECov上的Pass@1指标优于671B参数的DeepSeek-R1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11030 2026-08-12 cs.IR cs.CL 新提交 88%

Self-Knowledge Retrieval Augmented Generation Framework for Patent Matching

用于专利匹配的自知识检索增强生成框架

Jian Zhang, Songlin Lei, Zhuohao Yang, Bangli Liu, Ziwei Wang, Xufeng Weng, Gehan Amaratunga, Yu Lin, Hongwei Wang

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 针对专利匹配的LLM方法存在成本高、易遗忘等问题,本文提出自知识RAG框架,结合FAISS检索与生成式匹配机制,在真实专利数据集上提升了检索匹配准确率。

Comments Accepted by IEEE CSCWD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10513 2026-08-12 cs.CV cs.AI 新提交 88%

SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning

SafeCap:通过图像字幕强化学习提升大型视觉语言模型(LVLM)的安全性

Caoyuan Ma, Wenpu Liu, Weichu Xie, Tian Gu, Shilei Zhao, Lingxi Min, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng Chang, Taiqiang Wu, Yongfu Zhu, Wenqi Shao, Yinqiang Zheng

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 SafeCap是一种通过图像字幕强化学习提升LVLM安全性的框架,在多模态安全基准上安全得分提升3.7-19.0个百分点,且视觉效用相当或更优,性能优于安全SFT等方法。

Comments 16pages, 4 figures. Preprint. Project page: https://safe-vlm.github.io/SafeCap/ ; code: https://github.com/Safe-VLM/SafeCap

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10414 2026-08-12 cs.CL cs.LG 新提交 87%

How Robust Are LLMs to Vietnamese Dialects?

大型语言模型对越南方言的鲁棒性如何?

Minh Tran, Trinh Chau, Thanh-Nhan Le, Nam Tran, Luan Thanh Nguyen, Cuong Dang, Duc Hoang

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过构建VialectBench基准,评估指令微调LLM对越南方言的鲁棒性,发现方言输入会导致模型性能下降,且不同方言组的影响存在显著差异,标准越南语上的性能不代表方言场景下的可靠性。

Comments 8 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10657 2026-08-12 eess.IV cs.CV cs.LG 新提交 83%

Retrieval-Augmented Vision Foundation Models for Robust Leukemia Cell Classification across Multiple Microscopy Datasets

用于跨多个显微镜数据集实现稳健白血病细胞分类的检索增强视觉基础模型

Carlos Zamora, Hiram Zuniga, Ulises Orozco-Rosas, Kenia Picos

专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究提出基于预训练视觉基础模型的两阶段检索增强框架,经多数据集测试,可实现跨异构数据集的稳健白血病细胞分类,为解决领域偏移问题提供低成本替代方案。

Comments Accepted at SPIE Optics + Photonics 2026 for oral presentation. 23 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10628 2026-08-12 cs.CV cs.CL cs.LG 新提交 82%

InSight-doc: Agentic Visual Perception for Long-Document Understanding

InSight-doc:面向长文档理解的智能体视觉感知框架

Kaican Li, Weiyan Xie, Lewei Yao, Jiannan Wu, Lanqing Hong, Yongxiang Huang, Nevin L. Zhang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出智能体视觉感知框架InSight-doc,通过自适应选择放大高分辨率区域处理长文档,经SFT+RL训练后在文档VQA任务中显著提升准确率、降低幻觉与推理延迟,相关资源已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10708 2026-08-12 cs.CV 新提交 82%

Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models

自几何:面向几何一致的3D视觉基础模型的无GT、即插即用测试时自适应方法

Seokhyun Youn, Dahyeon Kye, Sung-Ho Bae, Jihyong Oh

机构 * Chung-Ang University(中央大学) Kyung Hee University(庆熙大学)

专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文针对3D视觉基础模型测试时几何一致性不足的问题,提出即插即用的Self-Geometry自适应流水线,结合多视图与对极一致性损失等,在6种模型和4个基准上实现位姿与几何估计的一致提升。

Comments Project page: https://cmlab-korea.github.io/Self-Geometry/

详情

展开后加载摘要…

URL PDF HTML 收藏