arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-02 至 2026-06-02 共收录 201 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 51 篇

2606.01101 2026-06-02 cs.LG cs.AI 62%

Soft-NBCE: Entropy-Weighted Chunk Fusion for Long-Context

Soft-NBCE: 基于熵加权分块融合的长上下文处理

Shihao Ji, Mingyu Li, Zihui Song

机构 * Beijing Normal University(北京师范大学) Chunjiang Intelligence(春江智能)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对长上下文推理中硬选择策略导致语义碎片化的问题,提出Soft-NBCE,通过熵加权软融合和一致性蒸馏,在保持检索精度的同时提升多跳推理性能。

Comments 7 pages, 3 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00232 2026-06-02 cs.AI cs.LG 62%

TIGER: Traceable Inference with Graph-Based Evidence Routing for Mitigating Hallucinations in Multimodal Generation

TIGER: 基于图证据路由的可追踪推理用于减轻多模态生成中的幻觉

Kaixiang Zhao, Tianrun Yu, Shawn Huang, Porter Jenkins, Yushun Dong, Amanda Hughes

机构 * Brigham Young University Florida State University

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出TIGER框架,通过从输入和输出中独立提取观测图与声明图,并基于图条件风险评分修复高风险声明,以减轻多模态生成中的事实级幻觉。

Comments 25 pages, 7 figures, 16 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29539 2026-06-02 cs.CV cs.AI 62%

GiPL: Generative augmented iterative Pseudo-Labeling for Cross-Domain Few-Shot Object Detection

GiPL: 用于跨域小样本目标检测的生成增强迭代伪标签方法

Jiacong Liu, Shu Luo, Yikai Qin, Yaze Zhao, Yongwei Jiang, Yixiong Zou

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出GiPL双分支训练框架,通过迭代伪标签自训练和生成数据增强,解决跨域小样本目标检测中支持集利用不足和过拟合问题。

Comments CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23500 2026-06-02 cs.CV cs.LG 62%

B-GRTO: Bootstrapped Group Relative Tool Optimization for Referring Segmentation

B-GRTO: 引导式分组相对工具优化用于指代分割

Mario Markov, Stefan Maria Ailuro, Mohammad Mahdi, Luc Van Gool, Danda Pani Paudel

机构 * INSAIT Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱门特·欧赫里迪斯基")

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出B-GRTO框架,通过引导式预训练和分组相对工具优化,联合优化策略与可微分割解码器,显著提升复杂指代分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24324 2026-06-02 cs.LG cs.AI cs.SY eess.SY 62%

Large Language Model Guided Incentive Aware Reward Design for Cooperative Multi-Agent Reinforcement Learning

大语言模型引导的激励感知奖励设计用于合作多智能体强化学习

Dogan Urgun, Gokhan Gungor

机构 * Department of Electrical and Electronics Engineering(电气与电子工程系) Karabuk University(卡拉博克大学) Department of Mechatronics Engineering(机械工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出利用大语言模型自动生成可执行奖励程序,结合多智能体近端策略优化训练,在Overcooked-AI环境中显著提升合作任务回报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02886 2026-06-02 cs.LG cs.AI 62%

Mixture of Concept Bottleneck Experts

概念瓶颈专家混合模型

Francesco De Santis, Gabriele Ciravegna, Giovanni De Felice, Arianna Casanova, Francesco Giannini, Michelangelo Diligenti, Johannes Schneider, Danilo Giordano, Mateo Espinosa Zarlenga, Pietro Barbiero

机构 * University of Padua(帕多瓦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出概念瓶颈专家混合模型(M-CBE),通过引入多个专家表达式和灵活的函数形式,在保持可解释性的同时提升预测精度和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20638 2026-06-02 cs.CL cs.AI cs.LG 62%

Uncovering Competency Gaps in Large Language Models and Their Benchmarks

揭示大型语言模型及其基准测试中的能力差距

Maty Bohacek, Nino Scherrer, Nicholas Dufour, Thomas Leung, Christoph Bregler, Stephanie C. Y. Chan

机构 * University of Zurich(苏黎世大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于稀疏自编码器概念激活的新方法,自动发现模型在细粒度概念上的弱点(模型差距)和基准测试覆盖不平衡(基准差距),并通过内部表示评估和跨基准比较进行验证。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01753 2026-06-02 cs.CV 57%

Quality-Guided Semi-Supervised Learning for Medical Image Segmentation

质量引导的半监督学习用于医学图像分割

Kumar Abhishek, Ghassan Hamarneh

机构 * School of Computing Science, Simon Fraser University, Canada(Simon Fraser大学计算机科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出一种质量引导的半监督学习框架,通过专用网络估计分割质量,并利用质量感知正则化和伪标签重加权提升医学图像分割性能。

Comments Early Accept at MICCAI 2026, 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01461 2026-06-02 cs.LG cs.MA 57%

Genotype-Conditioned Molecular Generation via Evidence-Grounded Multi-Objective Latent Perturbation in Diffusion Models

基于证据的多目标潜在扰动在扩散模型中的基因型条件分子生成

Brenda Nogueira, Gisela A. Gonzalez-Montiel, Nitesh V. Chawla, Nuno Moniz

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of Notre Dame(诺克斯大学) Department of Chemistry and Biochemistry(化学与生物化学系) Lucy Family Institute for Data & Society(数据与社会学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出一种在预训练的基因型到药物扩散模型的潜在空间中,通过梯度上升优化可学习扰动以最大化药物敏感性、类药性和合成可及性的复合奖励,并利用实验数据和LLM管道确保生物合理性和机制一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01322 2026-06-02 cs.CL cs.AI 57%

TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages

TukaBench: 一个基于文化的非洲语言越狱基准

Victor Akinode, Senyu Li, Wassim Hamidouche, Waqas Zamir, Inbal Becker-Reshef, David Ifeoluwa Adelani

机构 * Mila - Quebec AI Institute(魁北克人工智能研究院) McGill University(麦吉尔大学) Microsoft AI for Good Research Lab(微软人工智能造福人类研究实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对大型语言模型在非洲低资源语言上的安全评估缺失,提出TUKABENCH基准,通过四种设置(直接翻译、文化适应翻译、人工策划提示、代码切换提示)评估语言、文化背景和提示规避性对模型安全的影响,发现非洲语言提示降低拒绝率,并引入Deflection指标和人工验证以解决模型理解失败和评判可靠性问题。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01223 2026-06-02 cs.CL cs.AI 57%

Connecting the Dots: Benchmarking Reflective Memory in Long-Horizon Dialogue

连接点:长时对话中的反思性记忆基准测试

Jingjie Lin, Bingbing Wang, Zihan Wang, Zhengda Jin, Weiming Qiao, Jing Li, Ruifeng Xu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong Polytechnic University(香港理工大学) Fudan University(复旦大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对现有基准无法衡量从碎片化多模态线索合成高层解释的反思性记忆问题,提出RefMem-Bench基准和REMIND层次框架,通过渐进式证据感知、定位和抽象提升模型反思性记忆能力。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01199 2026-06-02 cs.AI 57%

Can LLM Agents Sustain Long-Horizon Organizational Dynamics?

LLM智能体能否维持长期组织动态?

Xuancheng Zhu, Yang Yue, Shuaibing Wan, Zihan Dou, Xiaohan Zhang, Yongrui Liu, Guoshun Nan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出TaskWeave分层智能体框架,通过记忆中心的协调机制(规划-分解-诊断-对齐循环和依赖感知追踪记忆)实现长期组织模拟,实验表明该框架能维持连贯的组织动态并产生可靠的人工制品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01149 2026-06-02 cs.CV 57%

CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection

CoSTL:面向时刻检索与高亮检测的综合时空表征学习

Xin Dong, Wenjia Geng, Wenfeng Deng, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出综合时空表征学习框架CoSTL,通过文本驱动的渐进细粒度图像编码器和多尺度时间感知模块,联合学习空间细节与时间动态,在时刻检索和高亮检测任务上达到最优性能。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00826 2026-06-02 cs.LG 57%

Partial Fairness Awareness: Belief-Guided Strategic Mechanism for Strategic Agents

部分公平意识:面向策略代理的信念引导策略机制

Xinpeng Lv, Chunyuan Zheng, Yunxin Mao, Renzhe Xu, Hao Zou, Shanzhi Gu, Liyang Xu, Huan Chen, Yuanlong Chen, Wenjing Yang, Haotian Wang

机构 * National University of Defense Technology, Changsha, China(国防科技大学) Peking University, Beijing, China(北京大学) Shanghai University of Finance and Economics, Shanghai, China(上海财经大学) ZGC Laboratory, Beijing, China(ZGC实验室) Faculty of Computing, Harbin Institute of Technology, Harbin, China(哈尔滨工业大学计算机学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 针对策略分类中的公平暴露困境,提出部分公平意识(PFA)问题,通过发布公平约束候选集并隐藏真实约束,结合信念引导机制实现代理与系统公平约束的对齐,实验表明PFA在降低群体公平差距、提高合格个体接受率和结果稳定性方面优于完全公开或私有的公平机制。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00756 2026-06-02 cs.AI 57%

CoMIC: Collaborative Memory and Insights Circulation for Long-Horizon LLM Agents in Cloud-Edge Systems

CoMIC:云边系统中长周期LLM代理的协作记忆与洞察循环

Yannan Wang, Longli Yang, Zhen Liu, Abhishek Kumar, Carsten Maple

机构 * Beijing Jiaotong University(北京交通大学) The Alan Turing Institute(艾伦·图灵研究所) University of Warwick(沃里克大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出无需参数更新的云边框架CoMIC,通过集中式反思与分布式执行设计,利用语义子目标标识实现跨代理经验聚合,提升弱边缘代理在长周期任务中的进展率和动作基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00518 2026-06-02 cs.AI 57%

Acting with AI: An Interaction-Based Framework for Agentic Tort Liability

与AI行动:基于交互的代理侵权责任框架

Yiheng Yao

机构 * Yiheng Yao(姚艺恒)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文基于Bratman规划理论和普通法人类协同行动原则,提出一种交互分类框架(自主漂移、纯工具使用、协作规划)来分配AI代理系统的侵权责任,并引入“合理代理”标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00432 2026-06-02 cs.LG 57%

Grounded Decoding: Retrieval-Anchored Probability Fusion for Faithful RAG

Grounded Decoding: 面向忠实RAG的检索锚定概率融合

Ibne Farabi Shihab, Fariya Afrin, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(爱荷华州立大学计算机科学系) Department of Computer Science, Kalinga Institute of Industrial Technology(卡林加工业技术学院计算机科学系) Department of Civil, Construction & Environmental Engineering, Iowa State University(爱荷华州立大学土木、建设与环境工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出Grounded Decoding,一种无需训练的推理时解码框架,通过KL-重心目标融合全RAG分布和仅检索分布,并引入冲突感知自适应加权,以提升RAG的事实一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00104 2026-06-02 cs.RO cs.AI 57%

PEACE: A Planner-Executor Agent with Constraint Enforcement for UAVs

PEACE: 一种用于无人机的带约束执行的规划-执行智能体

Erdem Uysal, Timo Kehrer, Sebastiano Panichella

机构 * Institute of Computer Science, University of Bern(伯尔尼大学计算机科学研究所) AI4I - The Italian Institute of Artificial Intelligence(意大利人工智能研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 提出一种基于大语言模型的规划-执行智能体架构,通过解耦高层任务规划与低层控制,并引入约束执行层和有限重规划,实现无人机可解释、可约束的自主飞行。

Comments Accepted to ICRA 2026 Workshop on Semantics for Reliable Robot Autonomy: From Environment Understanding and Reasoning to Safe Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13937 2026-06-02 cs.LG cs.SE 57%

iML: Executable, Problem-Grounded, and Broadly Exploratory Code-Driven AutoML

iML: 可执行、问题驱动且广泛探索的代码驱动自动机器学习

Dat Le, Duc-Cuong Le, Anh-Son Nguyen, Tuan-Dung Bui, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息科技学院,越南工程与技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出iML多智能体框架,通过任务分析、数据剖析、结构化蓝图生成和模块化代码合成,实现可执行、问题驱动且广泛探索的代码驱动AutoML,在MLE-BENCH和iML-BENCH上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08038 2026-06-02 cs.CL cs.AI 57%

AblationBench: Evaluating Automated Planning of Ablations in Empirical AI Research

AblationBench:评估实证AI研究中消融实验的自动规划

Talor Abramovich, Gal Chechik

机构 * Google Research(谷歌研究)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出AblationBench基准套件,包含作者消融和审稿人消融两个任务,用于评估语言模型在AI研究中规划消融实验的能力,实验表明当前最佳模型仅能识别45%的原始消融,低于人类水平。

Comments AI4Science Workshop, ICML 2026; Project page: https://ablation-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02556 2026-06-02 cs.CL 50%

HERO'S JOURNEY: Testing Complex Rule Induction with Text Games

英雄之旅:用文本游戏测试复杂规则归纳

Anshun Asher Zheng, Kanishka Misra, David I. Beaver, Junyi Jessy Li

机构 * Department of Linguistics(语言学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出HERO'S JOURNEY基准,通过目标导向的文本游戏评估大型语言模型在属性与程序归纳任务中的规则推理能力,发现模型虽能进行规则归纳但能力有限且不均衡,程序执行成为瓶颈,而表面语义影响较小。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02334 2026-06-02 cs.DB 50%

Less Is More? When Dataset Context Hurts LLM-Generated Dataset Descriptions

少即是多?当数据集上下文损害LLM生成的数据集描述时

Lisa-Yao Gan, Arunav Das, Johanna Walker, Klaus Diepold, Elena Simperl

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过大规模消融实验,研究不同数据集上下文(标题、模式、代表性数据)对LLM生成数据集描述质量的影响,发现模式单独使用会降低叙事质量,而代表性数据部分改善但未提升整体面向人类的质量。

Comments Accepted to ICDE26 KDExLLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02001 2026-06-02 cs.CL 50%

Scaling Agentic Capabilities via Grounded Interaction Synthesis

通过基于交互合成扩展智能体能力

Wenhang Shi, Jinhao Dong, Yiren Chen, Zhe Zhao, Shuqing Bian, Wei Lu, Xiaoyong Du

机构 * Renmin University of China(中国人民大学) Peking University(北京大学) Tencent(腾讯)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出GAIS框架,通过两阶段接地机制(协议锚定环境和结构引导规划)自动生成多样化的环境和复杂任务,显著提升智能体在BFCL、τ²-Bench和ACEBench上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01801 2026-06-02 cs.MA 50%

MetaForge: A Self-Evolving Multimodal Agent that Retrieves, Adapts, and Forges Tools On Demand

MetaForge:一种自我进化的多模态智能体,可按需检索、适应和锻造工具

Shouang Wei, Houcheng Min, Xinpeng Dong, Xin Lin, Sen Cui, Bo Jiang, Zhongxiang Dai, Kun Kuang, Guandong Xu, Fei Wu, Min Zhang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出MetaForge框架,通过决策-检索-适应-锻造-回收的闭环机制,使多模态智能体能够按需自我进化工具集,在12个基准测试中超越16个基线方法,提升了准确性、效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01305 2026-06-02 cond-mat.mtrl-sci 50%

How Can Machine Learning Accelerate CALPHAD Free Energy Modeling?

机器学习如何加速CALPHAD自由能建模?

Chen Shen, Muhammad Waqas Qureshi, Mark Asta, Izabela Szlufarska, Dane Morgan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种混合策略,通过将机器学习(ML)与Redlich-Kister(RK)框架结合,利用物理信息描述符学习相互作用系数,从而在数据有限的情况下扩展CALPHAD模型对新化学体系的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00576 2026-06-02 cs.RO 50%

Dynamic Resilient Spatio-Semantic Memory with Hybrid Localization for Mobile Manipulation

面向移动操作的动态弹性时空语义记忆与混合定位

Zhijie Yan, Shufei Li, Ze Zhang, Xin Liu, Yuhang Zheng, Zuoxu Wang

机构 * School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程及自动化学院) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 提出DREAM框架,通过在线构建时空语义体素记忆、冗余感知记忆剪枝和混合定位,实现无预建地图的动态室内移动操作,将长时任务成功率提升至55%-70%。

Comments Code, CAD model, and real-robot demonstrations are available at https://bjhyzj.github.io/dream-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00062 2026-06-02 cs.CL 50%

Graph-Augmented Retrieval for Cross-Entity Financial Sentiment Analysis: A Comparative Study

跨实体金融情感分析的图增强检索:一项比较研究

Rajan Bastakoti, Sagar Bhetwal, Nirajan Acharya, Gaurav Kumar Gupta

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种两跳图增强检索架构(Graph-RAG),通过构建情感加权知识图谱并融合密度检索与图遍历,相比标准向量检索在跨实体金融情感分析中显著提升实体召回率和复杂查询答案相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00043 2026-06-02 cs.CY cs.MA 50%

Fake Plastic Voters: When Political Parties Can Use AI-Simulated Focus Groups

虚假塑料选民:当政党可以使用AI模拟焦点小组时

Claudio Novelli, Javier Argota Sanchez-Vaquerizo, Jennifer Cyr, Giuliano Formisano, Simon McDougall, Giulia Sandri, Luciano Floridi

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文开发了一个决策矩阵,帮助政党策略师根据研究目的、部署风险和模拟工具的经验基础,判断何时使用AI增强模拟技术(AEST)进行焦点小组研究,并指出在模式1(观察政治意义和身份通过互动产生)中AEST无法替代人类互动,在模式2(测试和完善竞选信息)中需谨慎使用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 8 篇

2605.31401 2026-06-02 cs.CL 89%

"Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models

Înţelegi Româneşte?'' 罗马尼亚语视觉语言模型的构建配方

Mihai Masala, Marius Leordeanu, Mihai Dascalu, Traian Rebedea

机构 * National University of Science and Technology POLITEHNICA Bucharest(波兰技术大学布加勒斯特国家大学)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract)

AI总结 本文系统研究了构建罗马尼亚语视觉语言模型(VLM)的完整流程,通过翻译英文语料、消融实验分析视觉骨干、语言骨干和OCR数据的影响,并构建文化本地化评估集HoraVQA,证明罗马尼亚语适配模型在性能上超越同尺寸甚至更大尺寸的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00112 2026-06-02 cs.NE cs.CV 89%

Evolving to the Aesthetics of a Vision-Language Model

进化到视觉语言模型的美学

Stephen James Krol, Jon McCormack

机构 * SensiLab, Monash University Melbourne, Australia(传感实验室,墨尔本莫纳什大学,澳大利亚)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本研究探索使用视觉语言模型(VLM)通过CLIP-IQA评分或成对比较结合Glicko评级系统来评估进化设计的美学,并与艺术家排名对比分析两种方法的优劣。

Comments Paper presented at ICCC26, June 29 - July 3, 2026, Coimbra, Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏