arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 874 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 874 篇

2606.14072 2026-06-15 cs.CV cs.CL 新提交 57%

Diffusion-Refined Segmentation and Vision-Language Interpretation for Pediatric Brain Tumor MRI

扩散细化分割与视觉-语言解释用于儿童脑肿瘤MRI

Wentao Ke, Jianche Liu

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) School of Medicine, Stanford University(斯坦福大学医学院)

专题命中 领域大模型 :language model(abstract);分类 cs.CL

AI总结 提出两阶段框架,先用Swin-UNETR粗分割,再用条件扩散模型细化边界,最后结合多模态语言模型生成结构化报告,提升儿童脑肿瘤分割精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09724 2026-06-09 cs.AI 新提交 57%

Beyond Probabilistic Similarity: Structural, Temporal, and Causal Limitations of Retrieval-Augmented Generation in the Legal Domain

超越概率相似性:检索增强生成在法律领域的结构性、时间性和因果性局限

Hudson de Martim

机构 * Federal Senate of Brazil(巴西联邦参议院)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 本文指出法律AI中RAG的失败源于概率检索与法律知识层次、时间及制度结构的架构不匹配,提出三种病理(部分盲、历时盲、因果不透明)并推导出确定性设计的四项架构承诺。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09590 2026-06-09 cs.CL cs.CR 新提交 57%

Clinically Grounded Privacy Evaluation of Medical LMs

临床导向的医学语言模型隐私评估

Sasha Ronaghi, Sana Tonekaboni, Lena Stempfle, Vivian Utti, Jordan Li Cahoon, Nathaniel Hendrix, Ayin Vala, Marzyeh Ghassemi, Emily Alsentzer

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) American Board of Family Medicine(家庭医学认证委员会)

专题命中 领域大模型 :language model(abstract);分类 cs.CL

AI总结 提出临床导向框架,按对抗访问等级评估医学语言模型隐私泄露,发现常规元数据可导致高比率逐字记忆和敏感诊断恢复,但部分记忆源于模板化文档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07965 2026-06-09 cs.AI 新提交 57%

Zero-Shot Learning in Industrial Scenarios: New Large-Scale Benchmark, Challenges and Baseline

工业场景中的零样本学习:新的大规模基准、挑战与基线

Zekai Zhang, Qinghui Chen, Maomao Xiong, Shijiao Ding, Zhanzhi Su, Xinjie Yao, Yiming Sun, Cong Bai, Jinglin Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Huawei Technologies(华为技术有限公司) Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 针对工业场景中视觉语言模型应用难、数据稀缺的问题,提出大规模多模态工业开放数据集MMIO和精炼文本-视觉提示RTVP,实现零样本工业缺陷检测,在MMIO上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07953 2026-06-09 cs.AI 新提交 57%

Unification of Closed-Open Industrial Detection Scenarios: New Large-Scale Benchmarks,Challenges and Baselines

闭集与开集工业检测场景的统一:新的大规模基准、挑战与基线

Zekai Zhang, Jinglin Zhang, Qinghui Chen, Gang Li, Da Chen, Shuainan Jing, He Wang, Dagang Li, Cong Liu, Cong Bai, Shengyong Chen

机构 * Shandong University(山东大学) University Paris Dauphine, PSL Research University, CNRS, UMR 7534(巴黎多芬纳大学,PSL研究大学,法国国家科学研究中心,UMR 7534) Qilu University of Technology(齐鲁工业大学) Zhejiang University of Technology(浙江工业大学) Nova University of Lisbon(里斯本新大学) Macau University of Science and Technology(澳门科技大学) Tianjin University of Technology(天津理工大学)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 针对工业缺陷检测中数据集稀缺和人工提示依赖问题,提出含百万样本的MMIOC-1M基准和RTVPNet网络,通过专家辅助域投影、能量稀疏采样和双向文本-视觉交互实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07646 2026-06-09 cs.CV cs.AI 新提交 57%

DOME: Learning Transferable Domain Variables from Sparse Supervision for Test-Time Adaptation

DOME:从稀疏监督中学习可迁移域变量用于测试时自适应

Xiaoran Xu, Yifan Xu, Yupeng Wu, Xiaoshan Yang, Changsheng Xu

机构 * MAIS, IACAS(中国科学院自动化研究所多模态人工智能系统实验室)

专题命中 领域大模型 :pretraining(abstract);分类 cs.AI

AI总结 提出DOME域编码器,通过视觉-语言预训练提取密集连续表示,参数化域为分布变量并引入动量更新的稀疏域库,实现零样本显式域建模,在多个基准上超越复杂TTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15252 2026-08-18 cs.HC 新提交 50%

MDwAIstScheduler: Bringing On-Device Voice Documentation into Clinical Practice

MDwAIstScheduler:将设备端语音记录引入临床实践

Diego Mardian, Frank Liu

专题命中 领域大模型 :language model(abstract)

AI总结 该研究提出设备端临床语音记录工具MDwAIstScheduler,通过设备端运行转录和意图提取,将诊疗语音转化为EHR可审核草稿,减轻医生记录负担并提升诊疗专注度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14226 2026-08-17 cs.CV 新提交 50%

RankT2I: A Submodular Framework for Discovering Interpretable and Diverse Semantics in Text-to-Image Models

RankT2I:一种用于发现文本到图像模型中可解释且多样化语义的子模框架

Ritika Allada, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 领域大模型 :language model(abstract)

AI总结 本文提出无训练、模型无关的RankT2I框架,通过子模方法自动发现T2I模型的可编辑语义,性能优于现有方法,可高效获取多领域文本到图像编辑所需的多样化语义。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09917 2026-08-11 cs.SI cs.HC 新提交 50%

WhichTok? Comparing Three TikTok Data Acquisition Tools

WhichTok?对比三种TikTok数据采集工具

Gayoung Jeon, Cameron Moy, Silvia Teliz, Cristina Monzer, Nicolette Alayon, Deen Freelon

专题命中 领域大模型 :prompting(abstract)

AI总结 本研究系统对比TikTok Research API、Pyktok和Apify三种数据采集工具,发现它们在话题标签等端点存在显著差异,仅用户端点结果一致,据此提出提升TikTok研究质量的相关建议。

Comments This paper has been accepted for the upcoming 21st International AAAI Conference on Web and Social Media (ICWSM'27)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08805 2026-08-11 cs.CV 新提交 50%

LASA: Language-and-Source-Anchored Alignment for Domain Generalized Semantic Segmentation

LASA:面向域泛化语义分割的语言与源锚定对齐

Jinhong Zhu, Weiqi Yan, Shengchuan Zhang, Liujuan Cao

机构 * Xiamen University(厦门大学)

专题命中 领域大模型 :language model(abstract)

AI总结 针对域泛化语义分割中传统方法损害特征完整性的问题,提出LASA框架,含三个协同组件,实验显示其性能优于现有最优方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08402 2026-08-11 cs.CV 新提交 50%

Agentic AI-powered flexible fiber-bundle endoscopy for high-resolution NIR-II fluorescence imaging in vivo

智能体驱动的柔性光纤束内窥镜用于体内高分辨率近红外二区(NIR-II)荧光成像

Yanzhao Shi, Yuanhua Liu, Sixin Xu, Wayne Jason Li, Yuyuan Chen, Danyang Xu, Zhisheng Wu, Hanze Yu, Ian Yu-Hong Wong, Simon Ying-Kit Law, Hongjie Dai, Liangqiong Qu, Feifei Wang

专题命中 领域大模型 :language model(abstract)

AI总结 该研究开发了AI驱动的柔性光纤束内窥镜平台,通过光学-计算协同设计及GAME流水线提升NIR-II成像分辨率,实现体内生物样本高分辨率成像,为临床转化奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06673 2026-08-10 cs.CV 新提交 50%

When Semantics Saturate or Emerge: Adaptation-Conditional Semantic Utility in Source-Free Cross-Domain Few-Shot Learning

当语义饱和或涌现时:无源跨域小样本学习中的适配条件语义效用

Wei Liu, Xing Deng, Haijian Shao

机构 * College of Computer Science, Jiangsu University of Science and Technology(江苏科技大学计算机学院)

专题命中 领域大模型 :language model(abstract)

AI总结 该研究针对无源跨域小样本学习,发现零样本提示质量无法完全代表适配锚点质量,揭示了语义饱和与涌现两种模式,为评估语言提供了新方向。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05074 2026-08-06 cs.CV 新提交 50%

Bag-of-Visual-Words for Spatial Mapping of Lung Adenocarcinoma Growth Patterns

用于肺腺癌生长模式空间映射的视觉词袋模型

Darya Ardan, Valentin Oreiller, Henning Müller

机构 * University of Geneva(日内瓦大学) University of Applied Sciences Western Switzerland (HES-SO Valais)(瑞士西部应用科学大学(HES-SO Valais))

专题命中 领域大模型 :foundation model(abstract)

AI总结 该研究提出弱监督BoVW流程,从ROI学习视觉词汇并生成LUAD空间模式图,在肿瘤/健康和组织学分级分类任务中表现优于或接近现有方法,可保留与分级相关的异质性。

Comments 10 pages, 2 figures. Accepted at the 7th International Conference on Medical Imaging and Computer-Aided Diagnosis (MICAD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04604 2026-08-06 cs.CV 新提交 50%

COSMO: Consensus-Driven Shift Modulation for Source-Free Domain Adaptation

COSMO:面向无源域自适应的共识驱动偏移调制

Bo Li, Junjie Peng, Xiaohua Xie, Jianhuang Lai

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 领域大模型 :language model(abstract)

AI总结 针对无源域自适应的源衍生证据遗忘问题,提出COSMO方法,通过锚定共享共识的协同适配实现样本级可靠性分配,在四个基准上达到最优性能,平衡了源证据保留与VLM互补证据吸收。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01407 2026-08-04 cs.CV 新提交 50%

Training-Free Out-of-Distribution Detection for Pathology Whole-Slide Images

面向病理全切片图像的无分布外检测训练方法

Sabri Mustafa Kahya, Richard R. Chen, Muhammet Sami Yavuz, Jerry Jierui Lou, Akanimoh Adeleye, Haci Ali Kahya, Jana Lipkova

专题命中 领域大模型 :foundation model(abstract)

AI总结 本文提出基于视觉-语言病理基础模型的无训练多模态OOD检测器ZIO,在14700余张病理WSI上优于40种现有OOD方法,为临床AI安全部署提供支撑。

Comments Under review. The code is available in https://github.com/muskahya/ZIO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00282 2026-08-04 cs.CR cs.CY 新提交 50%

Reflection, Education, Consistency: Towards Best Ethics Practices At Security And Privacy Conferences

反思、教育、一致性:迈向安全与隐私会议的最佳伦理实践

Florian Hantke, Rafael Mrowczynski, Til Dralle, Ben Stock

专题命中 领域大模型 :LLM(abstract_cn)

AI总结 该研究针对安全与隐私会议的伦理问题,通过分析四大顶级会议伦理政策及20名社区成员访谈,指出伦理教育不足、政策不一致等问题,提出开展全社区协调伦理工作并建立开放伦理维基。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27779 2026-07-31 cs.CV 新提交 50%

CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography

CXR-Retrieve:胸部X线摄影中的组合式文本到图像检索

Tomer Erez, Moshe Kimhi, Chaim Baskin, Ehud Rivlin

机构 * Technion – Israel Institute of Technology(以色列理工学院) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 领域大模型 :language model(abstract)

AI总结 针对胸部X线检索的目标不匹配问题,提出CXR-Retrieve基准与标签感知对比微调方法,在双病理组合和否定查询的Precision@5上较CXR-CLIP分别提升8.5和22.0个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27122 2026-07-30 cs.CV 新提交 50%

Towards Grounded GI Endoscopy VQA via Multi-Task Learning on Small VLMs

基于小型视觉语言模型多任务学习的 grounded 胃肠道内窥镜视觉问答研究

Itbaan Safwan, Ramail Khan, Muhammad Annas Shaikh, Muhammad Atif Tahir

机构 * Institute of Business and Administration(商业管理学院)

专题命中 领域大模型 :language model(abstract)

AI总结 该研究针对胃肠道内窥镜视觉问答任务,提出多任务微调方案,利用现有数据集构建辅助任务,微调小型视觉语言模型,实现了准确率提升与答案-图像区域对齐优化。

Comments Accepted at EMA4MICCAI 2026 (Workshop on Efficient Medical AI, MICCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25823 2026-07-29 cs.IR 新提交 50%

Hypothesis-Driven Shelf Generation for Personalised Recommendation

用于个性化推荐的假设驱动型货架生成

Aleksandr V. Petrov, Tarun Chillara, Matthew D. Moellman, Lucas de Haas, Yabai Song, Alina Susoykina, Melissa Crawford, Gabriel Negash, Erik Franco, Tasnim Rahman, Binal Jhaveri, Shubham Bansal, Hugues Bouchard, Roberto Mirizzi, Mounia Lalmas, Aloïs Gruson

专题命中 领域大模型 :LLM(abstract)

AI总结 研究针对个性化推荐中货架生成问题,提出内容假设驱动型系统,含假设生成等四个阶段,解耦货架规划与目录填充,支持独立优化,经生产管道结合多种操作,通过离线和在线评估,该系统能扩展个性化推荐供应,效果有竞争力。

Comments Accepted at ACM RecSys '26 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24255 2026-07-28 cs.IR 新提交 50%

OxygenREC-v2: Internalizing Discrimination into Generative Recommendation

OxygenREC-v2:将歧视内化到生成式推荐中

Guo Tang, Hanye Wu, Changjiang Han, Qingyang Li, Ming Zhang, Xiangyu Qian, Yanchen Qiao, Huanjie Wang, Zhi Ma, Zhen Li, Yaqiang Zang, Pinghua Gong

专题命中 领域大模型 :post-training(abstract)

AI总结 研究针对生成式推荐中纳入行为信号的挑战,提出OxygenREC-v2,通过用记录行为条件生成及监督训练,在预训练和训练后分别采用不同方式,保持统一主干,部署在电商平台,相比OxygenREC-v1提升了用户点击率转化率和商品交易总额。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23993 2026-07-28 cs.CY cs.HC 新提交 50%

On Capturing the Narrative: Social Media Manipulation Wargaming for Cyberliteracy

关于捕捉叙事:用于网络素养的社交媒体操纵模拟演练

Alexandra Vassar, Rahat Masood, Hammond Pearce

专题命中 领域大模型 :LLM(abstract)

AI总结 该研究针对网络错误信息及数字素养教育问题,通过举办“捕捉叙事”多校竞赛,让学生团队构建大语言模型驱动的机器人影响模拟选举,分析竞赛情况及学生反馈,为教育工作者提供建议并提出改进方向。

Comments 7 pages, 1 figure. Paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22607 2026-07-28 cs.CY 新提交 50%

The Clinical Trial Pipeline Reveals the Next Wave of Artificial Intelligence in Healthcare: A Multidimensional Analysis of 8,532 Registered Studies

临床试验管道揭示医疗保健领域人工智能的下一波浪潮:对8532项注册研究的多维分析

Lior Rokach

专题命中 领域大模型 :LLM(abstract)

AI总结 该研究通过对8532项注册研究多维分析,揭示医学人工智能临床试验格局。用关键词搜索和分类器识别试验,从多维度分类,发现虽从回顾转向前瞻,但在规模、专业覆盖等方面有差距,未来进展取决于弥合这些差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20836 2026-07-24 astro-ph.IM physics.soc-ph 新提交 50%

How to Craft the Right Language AI Policy For Your Research Group (Some Assembly Required)

如何为你的研究团队制定合适的语言人工智能政策(需一些组装工作)

Michelle Ntampaka, S. Burke-Spolaor, Ioana Ciucă, Ana Maria Delgado, Kartheik G. Iyer, Kelly Lockhart, Adele Plunkett, Mercedes López-Morales, Ashish A. Mahabal, Susan E. Mullally, Rohit Raj, Jan Rerink, Jeffrey Smith, Joshua S. Speagle, John Soltis, John F. Wu, Mikaeel Yunus

专题命中 领域大模型 :prompting(abstract)

AI总结 探讨为何不存在适用于天文学研究团队的单一正确人工智能政策,引入四种研究实验室原型,基于团队优先级探讨其对人工智能相关决策的影响,提供使政策与团队科学价值观和使命一致的框架,助研究领导者决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19988 2026-07-23 cs.CY 新提交 50%

What Does the Credential Still Certify? Cognitive Stewardship for AI-Mediated Education

证书仍然证明什么?人工智能介导教育的认知管理

Kai Yao

专题命中 领域大模型 :LLM(abstract)

AI总结 研究探讨生成式AI对教育评估前提的改变,开发认知管理框架,审核30所大学的AI评估指南,发现公共政策分类AI使用较好但解释证书有效性不足,强调大学需制定使认证逻辑可见的政策。

Comments Accepted at the Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026), Malmö, Sweden, October 12--14, 2026. 13 pages, 3 figures; supplementary material is available as an ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17323 2026-07-21 cs.RO cs.CV cs.HC cs.SY eess.SY 新提交 50%

From Perception to Assistance: Open-Vocabulary Shared Autonomy for Robotic Manipulation

从感知到协助:用于机器人操作的开放词汇共享自主性

Murilo Vinicius da Silva, Ricardo V. Godoy, Juliano Negri, Gustavo J. G. Lahr, Ranulfo Bezerra, Marcelo Becker

机构 * University of São Paulo(圣保罗大学) Instituto Israelita de Ensino e Pesquisa Albert Einstein(以色列爱因斯坦教育与研究机构) Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)

专题命中 领域大模型 :language model(abstract)

AI总结 研究针对工业环境中机器人操作难题,提出共享自主性框架,利用RGB-D摄像头、视觉语言模型等,经GPU加速控制器等实现操作,在四足移动操纵器上验证,在多项任务中表现良好,展示了该框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16726 2026-07-21 cs.CV 新提交 50%

Can Experts Adapt Without Training? On Test-Time Modality Generalization in MVLMs

专家能否在无训练情况下适应?关于多模态视觉语言模型的测试时模态泛化

Raza Imam, Darakshan Rashid, Yutong Xie, Dwarikanath Mahapatra, Brejesh Lall, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Khalifa University(哈里发大学) Indian Institute of Technology Delhi(印度理工学院德里分校)

专题命中 领域大模型 :language model(abstract)

AI总结 研究医学视觉语言模型测试时模态泛化问题,提出MoBE框架,通过熵引导动态路由与专家级贝叶斯适应相结合,无需参数更新,在多基准测试中比现有方法平均准确率有显著提升,实现无训练专家适应以增强模态泛化。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15730 2026-07-20 cs.IR 新提交 50%

RECAP: Feedback-Driven Streaming Semantic User Profiles for Short-Video Recommendation

RECAP:用于短视频推荐的反馈驱动流语义用户画像

Ziyi Zhao, Xiaoyou Zhou, Xiao Lv, Yangyang Li, Chubo He, Zhao Liu, Jiayao Shen, Yuqi Liu, He Li, Chengyi Zhang, Jian Liang, Ming Li, Chongming Gao, Fuli Feng, Ruiming Tang, Han Li

专题命中 领域大模型 :LLM(abstract)

AI总结 研究短视频推荐中用户画像生成问题,提出RECAP离线闭环框架,结合大语言模型语义更新、生命周期及容量控制维护画像,通过大语言模型判断和双塔评估器构建反馈,实验证明其提升推荐指标,在线测试显示提高用户应用使用时间。

Comments 9 pages, 5 figures, 2 tables. Accepted at RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15661 2026-07-20 cs.CV 新提交 50%

Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All Approach

用于医学视觉语言模型的模型合并:一个基准和一种赢家通吃的方法

Lichao Mou, Shilan Zhang, Chunlei Li, Bingcong Yan, Jingliang Hu, Yilei Shi, Shengwu Xiong, Xiao Xiang Zhu, Lei Li, Yaxiong Chen

机构 * Wuhan University of Technology(武汉理工大学) Technical University of Munich(慕尼黑工业大学) National University of Singapore(新加坡国立大学)

专题命中 领域大模型 :language model(abstract)

AI总结 研究医学LVLMs的模型合并,提出涵盖多种成像模态和临床任务类型的MergeMedBench基准,评估现有合并方法,提出赢家通吃方法,该方法简单且无超参数,优于现有方法,为LoRA合并提供新视角和实用基线。

Comments Project Page: https://github.com/MedAI-T/MergeMedBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15397 2026-07-20 cs.CY 新提交 50%

Clinical Audit Logs as Multi-Axial Traces of Care Delivery

临床审计日志作为护理交付的多轴轨迹

Braden Eberhard, Nate Apathy, Kevin Johnson

专题命中 领域大模型 :pretraining(abstract)

AI总结 研究以电子健康记录审计日志为对象,将其视为多轴事件流,通过基础模型预训练学习可重复使用的表示,阐述了审计日志在表示学习、评估和治理方面的作用及相关规定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13983 2026-07-16 cs.CV 新提交 50%

Screening Is Effective for Visual Recognition

筛选对视觉识别有效

Shunya Shimomura, Kazuhiro Hotta

机构 * Meijo University(名城大学)

专题命中 领域大模型 :language model(abstract)

AI总结 研究针对视觉Transformer难以独立评估图像块相关性的问题,提出VisionScreen模型,将筛选机制扩展到视觉识别,通过二维空间域绝对相关性估计,让块选择性聚合相关块,实验证明该方法优于传统ViT,为视觉识别提供新方案。

Comments Exploratory research

详情

展开后加载摘要…

URL PDF HTML 收藏